중국 최첨단 모델 경쟁이 조 단위 파라미터 시대에 접어들고 있다. 알리바바의 Qwen3.8-Max는 이미 2.4조 파라미터에 도달했으며, 문라이트 AI의 Kimi K3는 더 높은 수준으로

중국 프런티어 모델 경쟁이 조 단위 파라미터 시대에 접어들고 있다.
알리바바의 Qwen3.8-Max는 이미 2.4조 개의 파라미터를 달성했으며, 문라이트 AI(Moonshot AI)의 Kimi K3는 공개된 규모를 2.8조 개의 파라미터까지 끌어올렸다.
바이트댄스가 다음 도약을 준비하고 있을지 모른다.
AIBase는 완뎬(晚点) LatePost의 보도를 인용해, 바이트댄스가 2026년 8월 7일 5조 개 이상의 파라미터를 가진 기반 모델 훈련을 논의 중이라고 전했다. 해당 보도에 따르면, 이 프로젝트는 아직 초기 단계에 있으며 최종 모델이 공개될지는 보장할 수 없다.

단순히 규모만 놓고 보면, 이 프로젝트는 중국에서 공개적으로 보도된 AI 모델 프로젝트 중 가장 큰 규모 중 하나가 될 것이다.
하지만 그날 중요한 업데이트가 하나 더 있었다.
8월 7일 늦은 시간, 로이터는 영국 파이낸셜 타임스(FT) 및 내부 소식통을 인용해 바이트댄스가 최대 10조 개의 파라미터를 가진 모델을 훈련 중이며, 해당 모델이 이미 사전학습 단계에 진입했다고 보도했다. 바이트댄스는 당시 이 보도에 대해 공개적인 답변을 하지 않았다.
이 두 보도가 반드시 모순되는 것은 아니다. 처음에 "5조 개 초과"로 논의된 프로젝트가 궁극적으로 더 큰 구성을 목표로 할 수도 있다. 그러나 바이트댄스가 아직 모델 아키텍처나 파라미터 수를 공식적으로 공개하지 않았기 때문에, 본 문서의 모든 수치는 확정된 모델 사양이 아닌 보도된 계획으로 간주해야 한다.
완뎬 LatePost의 원래 보도에 따르면, 바이트댄스는 5조 개를 초과하는 파라미터를 가진 모델을 논의 중이다.
이는 현재 여러 중국 프런티어 모델이 공개한 규모를 훨씬 뛰어넘는 수치다.
| 모델 | 공개 보도된 총 파라미터 수 | 상태 |
|---|---|---|
| Qwen3.8-Max | 2.4조 개 | 알리바바, 출시 완료 |
| Kimi K3 | 2.8조 개 | 문라이트 AI, 출시 완료 |
| 보도된 바이트댄스 모델 | 5조 개 초과 | 보도된 계획 |
| 후속 FT/로이터 수치 | 최대 10조 개 | 보도에 따르면, 공식 확인 없음 |
문라이트 AI는 공식적으로 Kimi K3를 2.8조 개 파라미터의 혼합 전문가(MoE) 모델로 설명하며, 각 토큰당 1,040억 개의 파라미터가 활성화된다고 밝혔다.
로이터는 8월 3일 보도에서 알리바바의 Qwen3.8-Max가 2.4조 개의 총 파라미터를 포함한다고 전했다.
바이트댄스가 궁극적으로 5조 개에서 10조 개 사이의 파라미터를 가진 모델을 훈련하고 배포한다면, 이는 모델 총 규모의 획기적인 증가를 의미한다.
하지만 이것이 자동으로 모델의 성능이 2~3배 향상된다는 뜻은 아니다.
AIBase의 소식통은 5조 개 파라미터 모델을 미국의 선도적인 프런티어 시스템(예: GPT-5.6 또는 Anthropic의 최신 고급 모델)과 동일한 규모 범주에 속한다고 설명했다.
이 비교에는 중요한 전제 조건이 필요하다.
OpenAI와 Anthropic은 GPT-5.6, Claude Fable 5, Claude Mythos 5의 정확한 파라미터 수를 공개적으로 밝히지 않았다.
로이터도 8월 7일 보도에서 같은 관점을 제시했다: 미국 선도 시스템과의 직접적인 규모 비교는 어렵다. 이러한 연구소들은 자사 모델의 파라미터 수를 공개하지 않기 때문이다.
파라미터 수는 모델 성능을 측정하는 하나의 차원일 뿐이다.
성능은 다음 요소에 따라 달라진다:
이 점은 혼합 전문가(MoE) 모델에서 특히 중요하다.
희소 MoE 모델은 수조 개의 총 파라미터를 포함할 수 있지만, 각 토큰에서는 그중 극히 일부 하위 집합만 활성화된다.
Kimi K3가 좋은 예시다.
공식 사양은 다음과 같이 명시한다:
따라서 가중치의 총 개수와 매 추론 단계에서 사용되는 계산량은 별개의 문제다.
바이트댄스는 보도된 모델이 유사한 희소 아키텍처를 사용하는지, 토큰당 몇 개의 파라미터가 활성화될지 아직 공개적으로 밝히지 않았다.
원래 보도는 NVIDIA H100 GPU를 예로 들어 그 규모를 설명했다.
추정에 따르면, 5조 개 파라미터 모델을 훈련하는 데 약:
두 시나리오 모두 총 가속기 시간은 대략 동일한 규모다:
| 시나리오 | GPU 수 | 기간 | 대략적인 GPU 일수 |
|---|---|---|---|
| 장기 클러스터 | 100,000 | 347일 | 3,470만 |
| 대규모 단기 클러스터 | 1,000,000 | 35일 | 3,500만 |
이 수치는 정보 제공원의 대략적인 시나리오 추정치로 이해해야 하며, 보편적인 엔지니어링 공식이 아니다.
실제 훈련 요구 사항은 다음에 크게 의존한다:
NVIDIA 공식 H100 사양에 따르면, SXM 버전의 TDP는 최대 700W이며, Hopper의 Transformer Engine과 NVLink 인프라를 통해 대규모 트랜스포머 훈련을 지원한다.
수십만 개의 가속기 규모에서 GPU 클러스터만으로도 전력, 네트워크, 냉각, 데이터 센터 용량이 최우선 제약 조건이 되는 수준에 도달한다.
AIBase의 소식통은 100만 개의 H100급 가속기를 동시에 운영하는 것이 극단적인 인프라 구성이라고 정확히 지적했다.
더 현실적인 프로젝트는 훈련을 더 작지만 여전히 엄청난 클러스터에 분산시킬 가능성이 높다.
소식통이 제안한 더 현실적인 접근 방식은:
이 역시 역대 최대 규모의 훈련 클러스터 중 하나가 될 것이다.
인류 역사상 가장 야심 찬 모델 훈련 엔지니어링 중 하나다.
그리고 사전학습은 단지 하나의 단계에 불과하다.
프런티어 모델은 다음 단계를 완료하기 위해 시간과 연산력도 필요로 한다:
따라서 AIBase의 원래 기사는 전체 프로세스가 최소 6개월이 걸릴 것으로 추정했으며, 완성된 모델이 나오기 전까지는 총 기간이 1년에 가까울 수 있다고 밝혔다.
이후 영국 파이낸셜 타임스의 보도(로이터 요약)는 해당 모델이 사전학습 단계에 진입했다고 전하면서, 이 단계가 일반적으로 약 3~6개월이 걸린 후 미세 조정 및 출시 단계로 넘어간다고 지적했다.
두 설명 모두 동일한 실질적인 결론을 가리킨다: 이 규모의 프로젝트는 장기적인 인프라 엔지니어링 작업이지, 첫 번째 훈련 클러스터가 가동된 직후 곧바로 등장하는 모델이 아니다.
이러한 규모의 훈련은 단순한 연구 문제가 아니다.
인프라와 자본 문제이기도 하다.
바이트댄스는 재정적 여력, 소비자 유통 채널, 클라우드 인프라, 데이터 센터 용량, 그리고 AI 엔지니어링 팀을 모두 갖춘 몇 안 되는 중국 기술 기업 중 하나로, 이 규모의 프로젝트를 진지하게 시도할 수 있는 위치에 있다.
해당 회사의 공식 Seed 조직은 다음 영역을 포괄하고 있습니다:
바이트댄스의 인프라스트럭처 팀은 자신들의 업무를 분산 학습, 강화 학습 시스템, 고성능 추론, 기초 모델을 위한 컴파일러 기술을 포괄하는 것으로 명확히 설명하고 있습니다.
채용 자료에도 다음 업무 내용이 명시적으로 언급되어 있습니다:
이것들은 바로 수조 개의 파라미터 규모로 모델을 학습할 때 결정적으로 중요한 시스템 엔지니어링 문제입니다.
AIBase는 또한 여러 최첨단 연구소에서 사용 가능한 AI 컴퓨팅 규모에 대한 제3자 추정치를 인용했습니다.
기사에서 언급된 대략적인 수치는 다음과 같습니다:
이 수치들은 검증된 재고 데이터로 간주해서는 안 됩니다.
OpenAI와 Anthropic은 자체 시설, 클라우드 파트너, 예약 용량에 있는 모든 가속기의 실시간 수량을 공개적으로 유지하지 않습니다.
아이디어를 한 문장으로 입력하면 We0 AI가 쇼케이스 사이트, 페이지, CMS를 생성하고 출시 후 고객과 트래픽 확보를 돕습니다.
무료 등록을 위한 하나의 완전한 프로젝트 생성
하나의 완전한 생성 흐름을 시도하고 첫 번째 프로젝트 초안을 빠르게 보는 데 가장 적합합니다.
DeepSeek의 약 6만 개 가속기 수치는 원래 SemiAnalysis의 추정에서 비롯되었으며, 이후 다양한 보도에서 광범위하게 인용되었습니다. 이러한 추정치에는 A100, H100, H800, H20 등 여러 가속기의 혼합 구성이 포함되어 있으며, 단일 유형의 함대가 아닙니다.
특정 재고 수치보다 더 신뢰할 수 있는 것은 더 거시적인 핵심 포인트입니다:
최첨단 모델 개발은 점점 더 초대규모 가속기 컴퓨팅에 대한 접근에 의존하게 되며, 모델 규모가 계속 커질 때 초대규모 인프라를 보유한 회사와 소규모 연구소 간의 격차는 매우 커질 수 있습니다.
수조 개의 파라미터로 급증합니다.
H100 등가 컴퓨팅을 사용하면 계산 논의를 더 이해하기 쉽게 만들 수 있지만, 바이트댄스가 반드시 단일 유형의 가속기에 의존할 필요는 없습니다.
대형 AI 기업은 다음을 조합하여 사용할 수 있습니다:
최신 가속기는 동일한 학습 계산량을 완료하는 데 필요한 물리적 GPU 수를 변경할 수 있습니다.
소프트웨어도 마찬가지로 중요합니다.
다음 분야의 개선:
모델 총 규모와 학습 비용 간의 관계를 크게 바꿀 수 있습니다.
따라서 "X 모델에는 정확히 Y개의 GPU가 필요하다"는 항상 시나리오 가정으로 간주해야 하며, 고정 법칙으로 보아서는 안 됩니다.
정보 출처는 주로 이 계획을 두바오의 지능 수준을 글로벌 최전선으로 끌어올리려는 시도로 규정하고 있습니다.
이것은 아마도 동기의 일부일 뿐입니다.
더 큰 기초 모델은 바이트댄스 AI 생태계의 여러 부분을 뒷받침할 수 있습니다.
두바오는 바이트댄스의 중국 시장 주요 소비자용 AI 제품 중 하나입니다.
더 강력한 기반 모델은 다음을 향상시킬 수 있습니다:
초대규모 모델은 또한 Seed 팀에게 새로운 연구 플랫폼을 제공하여 다음을 탐구할 수 있게 합니다:
바이트댄스는 또한 기업 서비스와 클라우드 서비스를 통해 모델 역량을 상업화할 수 있습니다.
따라서 최첨단 모델은 소비자용 챗봇 이외에도 잠재적 가치가 있습니다.
AIBase 기사의 마지막 질문이 가장 중요합니다.
학습 비용이 극도로 높은 모델이 그에 상응하는 수익을 창출할 수 있을까요?
최첨단 연구소는 최종 학습 실행 비용만 지불하는 것이 아닙니다.
총 지출에는 다음이 포함될 수 있습니다:
그런 다음 모델은 다음 조합을 통해 가치를 창출해야 합니다:
파라미터 규모는 허용 가능한 추론 비용으로 유용한 역량으로 전환될 때만 경제적 의미가 있습니다.
이것이 현재 세대의 최첨단 모델이 총 파라미터 수뿐만 아니라 확장 효율성을 점점 더 강조하는 이유입니다.
예를 들어, Kimi K3는 총 파라미터 수가 2.8조 개이지만 토큰당 활성화되는 파라미터는 1040억 개에 불과합니다. 월스앤라이트(Moonshot AI)는 이전 세대와 비교하여 아키텍처의 확장 효율성이 향상되었다고 밝혔습니다.
따라서 진정한 경쟁은:
누가 가장 많은 파라미터를 보유했는가?
가 아니라 오히려:
누가 가장 적은 자원으로 가장 강력한 역량을 전환할 수 있는가?
지속 가능한 학습 및 추론 비용으로 가장 유용한 지능으로 전환할 수 있는가?
AIBase는 <晚点 LatePost>를 인용하여 바이트댄스가 5조 개 이상의 파라미터 모델을 논의 중이라고 보도했습니다. 같은 날 늦게 로이터 통신은 <파이낸셜 타임스>를 인용하여 바이트댄스가 이미 최대 10조 개 파라미터에 달할 수 있는 모델을 사전 학습하고 있다고 보도했습니다. 바이트댄스는 아직 정확한 수치를 공개적으로 확인하지 않았습니다.
정보 출처는 이 모델이 바이트댄스의 두바오 생태계를 강화할 것으로 예상하지만, 바이트댄스는 아직 보도된 모델이 어떻게 배포될지 공식적으로 발표하지 않았습니다. 최첨단 모델은 기업 API, 에이전트, 연구 및 바이트댄스의 다른 제품도 지원할 수 있습니다.
반드시 그렇지는 않습니다. 총 파라미터 수가 모델 품질을 직접 결정하지 않습니다. 아키텍처, 활성화 파라미터, 학습 데이터, 후속 학습, 강화 학습, 추론 시 사고 및 도구 사용이 모두 동일하게 중요할 수 있습니다.
월스앤라이트(Moonshot AI)는 공식적으로 Kimi K3의 총 파라미터 수가 2.8조 개, 활성화 파라미터가 1040억 개라고 발표했습니다. 희소 혼합 전문가(MoE) 아키텍처를 사용합니다.
알리바바와 로이터 통신의 보도에 따르면, 알리바바의 Qwen3.8-Max는 총 파라미터 수가 2.4조 개입니다. 이 역시 모든 토큰에 대해 전체 파라미터를 활성화하는 대신 희소 모델 설계를 기반으로 합니다.
정보 출처는 약 3500만 H100 GPU·일에 해당하는 대략적인 시나리오를 제시했습니다. 예를 들어 10만 개 H100으로 347일, 또는 100만 개 H100으로 약 35일입니다. 실제 필요량은 아키텍처, 정밀도, 활용률, 토큰 수, 하드웨어 및 학습 효율성에 따라 크게 달라질 수 있습니다.
OpenAI는 GPT-5.6의 파라미터 수를 공개적으로 공개하지 않았습니다. GPT-5.6의 파라미터 수에 대한 어떠한 주장도 추정치입니다.
특정 모델과의 직접적인 수치 비교는 모두
보도에 따르면, 바이트댄스의 한 모델은 현재까지 추측에 불과하다.
현재까지 공식 출시일은 발표되지 않았다. 로이터는 영국 파이낸셜타임스의 보도를 인용해 해당 모델이 사전학습 단계에 있으며, 이 단계는 수개월이 소요될 수 있고 이후에야 미세조정, 평가, 배포가 가능하다고 밝혔다.
보도에 따르면, 바이트댄스는 현재 공개적으로 알려진 중국 모델을 초과하는 초대규모 기초모델을 준비하고 있다. AIBase와 晚点 LatePost는 처음에 이 프로젝트를 5조 파라미터 이상으로 설명했으며, 당일 늦은 로이터/파이낸셜타임스의 보도에 따르면 해당 모델은 10조 파라미터에 달할 수 있고 이미 사전학습 단계에 진입했다.
이러한 규모의 프로젝트는 막대한 컴퓨팅 자원을 필요로 한다. 소식통이 예로 든 H100 컴퓨팅량은 약 3,500만 GPU일(day)에 해당하지만, 실제 학습 요구량은 아키텍처, 활성 파라미터, 하드웨어 세대, 활용률 및 학습 효율성에 따라 달라진다.
더 큰 문제는 바이트댄스가 가장 큰 모델을 구축할 수 있는지 여부가 아니다. 총 파라미터 수는 지능을 측정하는 불완전한 지표이며, 특히 희소 혼합 전문가 시스템의 경우 더욱 그렇다.
진정한 시험대는
바이트댄스가 수조 규모의 컴퓨팅량을 성능이 현저히 우수하고, 서비스를 지원할 수 있을 만큼 효율적이며, 그 배후의 인프라를 정당화할 만큼 가치 있는 모델로 전환할 수 있는지에 달려 있다.
한 문장에서 시작해 몇 분 안에 완전한 웹사이트를 받아보세요.