서론
중국 프런티어 모델 경쟁이 조 단위 파라미터 시대에 접어들고 있다.
알리바바의 Qwen3.8-Max는 이미 2.4조 개의 파라미터를 달성했으며, 문라이트 AI(Moonshot AI)의 Kimi K3는 공개된 규모를 2.8조 개의 파라미터까지 끌어올렸다.
바이트댄스가 다음 도약을 준비하고 있을지 모른다.
AIBase는 완뎬(晚点) LatePost의 보도를 인용해, 바이트댄스가 2026년 8월 7일 5조 개 이상의 파라미터를 가진 기반 모델 훈련을 논의 중이라고 전했다. 해당 보도에 따르면, 이 프로젝트는 아직 초기 단계에 있으며 최종 모델이 공개될지는 보장할 수 없다.

단순히 규모만 놓고 보면, 이 프로젝트는 중국에서 공개적으로 보도된 AI 모델 프로젝트 중 가장 큰 규모 중 하나가 될 것이다.
하지만 그날 중요한 업데이트가 하나 더 있었다.
8월 7일 늦은 시간, 로이터는 영국 파이낸셜 타임스(FT) 및 내부 소식통을 인용해 바이트댄스가 최대 10조 개의 파라미터를 가진 모델을 훈련 중이며, 해당 모델이 이미 사전학습 단계에 진입했다고 보도했다. 바이트댄스는 당시 이 보도에 대해 공개적인 답변을 하지 않았다.
이 두 보도가 반드시 모순되는 것은 아니다. 처음에 "5조 개 초과"로 논의된 프로젝트가 궁극적으로 더 큰 구성을 목표로 할 수도 있다. 그러나 바이트댄스가 아직 모델 아키텍처나 파라미터 수를 공식적으로 공개하지 않았기 때문에, 본 문서의 모든 수치는 확정된 모델 사양이 아닌 보도된 계획으로 간주해야 한다.
보도에 따르면, 바이트댄스가 5조 개 파라미터 대기업에 도전
완뎬 LatePost의 원래 보도에 따르면, 바이트댄스는 5조 개를 초과하는 파라미터를 가진 모델을 논의 중이다.
이는 현재 여러 중국 프런티어 모델이 공개한 규모를 훨씬 뛰어넘는 수치다.
| 모델 | 공개 보도된 총 파라미터 수 | 상태 |
|---|---|---|
| Qwen3.8-Max | 2.4조 개 | 알리바바, 출시 완료 |
| Kimi K3 | 2.8조 개 | 문라이트 AI, 출시 완료 |
| 보도된 바이트댄스 모델 | 5조 개 초과 | 보도된 계획 |
| 후속 FT/로이터 수치 | 최대 10조 개 | 보도에 따르면, 공식 확인 없음 |
문라이트 AI는 공식적으로 Kimi K3를 2.8조 개 파라미터의 혼합 전문가(MoE) 모델로 설명하며, 각 토큰당 1,040억 개의 파라미터가 활성화된다고 밝혔다.
로이터는 8월 3일 보도에서 알리바바의 Qwen3.8-Max가 2.4조 개의 총 파라미터를 포함한다고 전했다.
바이트댄스가 궁극적으로 5조 개에서 10조 개 사이의 파라미터를 가진 모델을 훈련하고 배포한다면, 이는 모델 총 규모의 획기적인 증가를 의미한다.
하지만 이것이 자동으로 모델의 성능이 2~3배 향상된다는 뜻은 아니다.
파라미터 수는 지능 수준과 같지 않다
AIBase의 소식통은 5조 개 파라미터 모델을 미국의 선도적인 프런티어 시스템(예: GPT-5.6 또는 Anthropic의 최신 고급 모델)과 동일한 규모 범주에 속한다고 설명했다.
이 비교에는 중요한 전제 조건이 필요하다.
OpenAI와 Anthropic은 GPT-5.6, Claude Fable 5, Claude Mythos 5의 정확한 파라미터 수를 공개적으로 밝히지 않았다.
로이터도 8월 7일 보도에서 같은 관점을 제시했다: 미국 선도 시스템과의 직접적인 규모 비교는 어렵다. 이러한 연구소들은 자사 모델의 파라미터 수를 공개하지 않기 때문이다.
파라미터 수는 모델 성능을 측정하는 하나의 차원일 뿐이다.
성능은 다음 요소에 따라 달라진다:
- 모델 아키텍처
- 토큰당 활성화 파라미터 수
- 훈련 데이터 품질
- 훈련 토큰 수
- 데이터 필터링
- 옵티마이저 설계
- 강화 학습
- 후속 훈련
- 도구 사용
- 테스트 시 계산
- 긴 컨텍스트 아키텍처
- 추론 효율성
이 점은 혼합 전문가(MoE) 모델에서 특히 중요하다.
희소 MoE 모델은 수조 개의 총 파라미터를 포함할 수 있지만, 각 토큰에서는 그중 극히 일부 하위 집합만 활성화된다.
Kimi K3가 좋은 예시다.
공식 사양은 다음과 같이 명시한다:
- 2.8조 개 총 파라미터
- 1,040억 개 활성화 파라미터
- 896개의 라우팅 전문가
- 각 토큰에서 16개 전문가 선택
따라서 가중치의 총 개수와 매 추론 단계에서 사용되는 계산량은 별개의 문제다.
바이트댄스는 보도된 모델이 유사한 희소 아키텍처를 사용하는지, 토큰당 몇 개의 파라미터가 활성화될지 아직 공개적으로 밝히지 않았다.
5조 개 파라미터 모델은 엄청난 훈련 연산력을 필요로 할 것
원래 보도는 NVIDIA H100 GPU를 예로 들어 그 규모를 설명했다.
추정에 따르면, 5조 개 파라미터 모델을 훈련하는 데 약:
- H100급 GPU 100,000개를 347일 동안 운영, 또는
- GPU 1,000,000개를 약 35일 동안 운영
두 시나리오 모두 총 가속기 시간은 대략 동일한 규모다:
| 시나리오 | GPU 수 | 기간 | 대략적인 GPU 일수 |
|---|---|---|---|
| 장기 클러스터 | 100,000 | 347일 | 3,470만 |
| 대규모 단기 클러스터 | 1,000,000 | 35일 | 3,500만 |
이 수치는 정보 제공원의 대략적인 시나리오 추정치로 이해해야 하며, 보편적인 엔지니어링 공식이 아니다.
실제 훈련 요구 사항은 다음에 크게 의존한다:
- 아키텍처
- 희소 vs. 밀집 활성화
- 토큰 수
- 정밀도
- 모델 FLOPs 활용률
- 체크포인트 저장
- 네트워크 효율성
- 하드웨어 세대
- 훈련 안정성
- 데이터 파이프라인 성능
- 실패한 실행 및 재시작
NVIDIA 공식 H100 사양에 따르면, SXM 버전의 TDP는 최대 700W이며, Hopper의 Transformer Engine과 NVLink 인프라를 통해 대규모 트랜스포머 훈련을 지원한다.
수십만 개의 가속기 규모에서 GPU 클러스터만으로도 전력, 네트워크, 냉각, 데이터 센터 용량이 최우선 제약 조건이 되는 수준에 도달한다.
"GPU 100만 개"가 바이트댄스가 그렇게 훈련한다는 의미는 아닌 이유
AIBase의 소식통은 100만 개의 H100급 가속기를 동시에 운영하는 것이 극단적인 인프라 구성이라고 정확히 지적했다.
더 현실적인 프로젝트는 훈련을 더 작지만 여전히 엄청난 클러스터에 분산시킬 가능성이 높다.
소식통이 제안한 더 현실적인 접근 방식은:
- 200,000~300,000개의 가속기
- 약 3~4개월 동안 운영
이 역시 역대 최대 규모의 훈련 클러스터 중 하나가 될 것이다.
인류 역사상 가장 야심 찬 모델 훈련 엔지니어링 중 하나다.
그리고 사전학습은 단지 하나의 단계에 불과하다.
프런티어 모델은 다음 단계를 완료하기 위해 시간과 연산력도 필요로 한다:
- 데이터 준비
- 아키텍처 실험
- 규모 확장 연구
- 사전학습
- 체크포인트 평가
- 지도형 후속 훈련
- 강화 학습
- 안전 테스트
- 도구 및 에이전트 훈련
- 서비스 최적화
따라서 AIBase의 원래 기사는 전체 프로세스가 최소 6개월이 걸릴 것으로 추정했으며, 완성된 모델이 나오기 전까지는 총 기간이 1년에 가까울 수 있다고 밝혔다.
이후 영국 파이낸셜 타임스의 보도(로이터 요약)는 해당 모델이 사전학습 단계에 진입했다고 전하면서, 이 단계가 일반적으로 약 3~6개월이 걸린 후 미세 조정 및 출시 단계로 넘어간다고 지적했다.
두 설명 모두 동일한 실질적인 결론을 가리킨다: 이 규모의 프로젝트는 장기적인 인프라 엔지니어링 작업이지, 첫 번째 훈련 클러스터가 가동된 직후 곧바로 등장하는 모델이 아니다.
바이트댄스는 시도할 역량을 갖추고 있다
이러한 규모의 훈련은 단순한 연구 문제가 아니다.
인프라와 자본 문제이기도 하다.
바이트댄스는 재정적 여력, 소비자 유통 채널, 클라우드 인프라, 데이터 센터 용량, 그리고 AI 엔지니어링 팀을 모두 갖춘 몇 안 되는 중국 기술 기업 중 하나로, 이 규모의 프로젝트를 진지하게 시도할 수 있는 위치에 있다.
해당 회사의 공식 Seed 조직은 다음 영역을 포괄하고 있습니다:
- 기초 모델 사전 학습
- 후속 학습
- 강화 학습
- 고성능 추론
- 분산 학습
- 이기종 하드웨어 컴파일
- 멀티모달 모델
- 에이전트 시스템
바이트댄스의 인프라스트럭처 팀은 자신들의 업무를 분산 학습, 강화 학습 시스템, 고성능 추론, 기초 모델을 위한 컴파일러 기술을 포괄하는 것으로 명확히 설명하고 있습니다.
채용 자료에도 다음 업무 내용이 명시적으로 언급되어 있습니다:
- 초대규모 학습
- 학습 안정성
- 모델 FLOPs 활용률
- 소프트웨어-하드웨어 공동 설계
- 다중 노드 추론
- 병렬화
- 스케줄링 최적화
이것들은 바로 수조 개의 파라미터 규모로 모델을 학습할 때 결정적으로 중요한 시스템 엔지니어링 문제입니다.
정보 출처의 GPU 수량은 추정치일 뿐, 공개된 데이터가 아님
AIBase는 또한 여러 최첨단 연구소에서 사용 가능한 AI 컴퓨팅 규모에 대한 제3자 추정치를 인용했습니다.
기사에서 언급된 대략적인 수치는 다음과 같습니다:
- OpenAI 약 200만 개 GPU
- Anthropic 약 62만 개
- DeepSeek 약 6만 개
이 수치들은 검증된 재고 데이터로 간주해서는 안 됩니다.
OpenAI와 Anthropic은 자체 시설, 클라우드 파트너, 예약 용량에 있는 모든 가속기의 실시간 수량을 공개적으로 유지하지 않습니다.
DeepSeek의 약 6만 개 가속기 수치는 원래 SemiAnalysis의 추정에서 비롯되었으며, 이후 다양한 보도에서 광범위하게 인용되었습니다. 이러한 추정치에는 A100, H100, H800, H20 등 여러 가속기의 혼합 구성이 포함되어 있으며, 단일 유형의 함대가 아닙니다.
특정 재고 수치보다 더 신뢰할 수 있는 것은 더 거시적인 핵심 포인트입니다:
최첨단 모델 개발은 점점 더 초대규모 가속기 컴퓨팅에 대한 접근에 의존하게 되며, 모델 규모가 계속 커질 때 초대규모 인프라를 보유한 회사와 소규모 연구소 간의 격차는 매우 커질 수 있습니다.
몇 분 만에 쇼케이스 사이트를 만들고 리드를 늘리세요
아이디어를 한 문장으로 입력하면 We0 AI가 쇼케이스 사이트, 페이지, CMS를 생성하고 출시 후 고객과 트래픽 확보를 돕습니다.
무료 등록을 위한 하나의 완전한 프로젝트 생성
하나의 완전한 생성 흐름을 시도하고 첫 번째 프로젝트 초안을 빠르게 보는 데 가장 적합합니다.
수조 개의 파라미터로 급증합니다.
H100 비교는 단지 기준점일 뿐
H100 등가 컴퓨팅을 사용하면 계산 논의를 더 이해하기 쉽게 만들 수 있지만, 바이트댄스가 반드시 단일 유형의 가속기에 의존할 필요는 없습니다.
대형 AI 기업은 다음을 조합하여 사용할 수 있습니다:
- H100
- H200
- Blackwell 세대 엔비디아 시스템
- 중국 전용 엔비디아 칩
- 국산 AI 가속기
- 맞춤형 하드웨어
- 여러 클라우드 및 데이터센터 리전
최신 가속기는 동일한 학습 계산량을 완료하는 데 필요한 물리적 GPU 수를 변경할 수 있습니다.
소프트웨어도 마찬가지로 중요합니다.
다음 분야의 개선:
- 커널 효율성
- 병렬도
- 전문가 라우팅
- 메모리 관리
- 통신
- 체크포인트 저장
- 양자화
- 데이터 로딩
모델 총 규모와 학습 비용 간의 관계를 크게 바꿀 수 있습니다.
따라서 "X 모델에는 정확히 Y개의 GPU가 필요하다"는 항상 시나리오 가정으로 간주해야 하며, 고정 법칙으로 보아서는 안 됩니다.
바이트댄스가 이렇게 큰 모델을 필요로 할 수 있는 이유
정보 출처는 주로 이 계획을 두바오의 지능 수준을 글로벌 최전선으로 끌어올리려는 시도로 규정하고 있습니다.
이것은 아마도 동기의 일부일 뿐입니다.
더 큰 기초 모델은 바이트댄스 AI 생태계의 여러 부분을 뒷받침할 수 있습니다.
두바오
두바오는 바이트댄스의 중국 시장 주요 소비자용 AI 제품 중 하나입니다.
더 강력한 기반 모델은 다음을 향상시킬 수 있습니다:
- 일반 추론
- 지식 작업
- 프로그래밍
- 검색
- 긴 컨텍스트 작업
- 에이전트 행동
- 멀티모달 상호작용
Seed 연구
초대규모 모델은 또한 Seed 팀에게 새로운 연구 플랫폼을 제공하여 다음을 탐구할 수 있게 합니다:
- 스케일링 법칙
- 희소 아키텍처
- 강화 학습
- 에이전트 학습
- 모델 효율성
- 메모리
- 장기간 추론
볼켄진
바이트댄스는 또한 기업 서비스와 클라우드 서비스를 통해 모델 역량을 상업화할 수 있습니다.
따라서 최첨단 모델은 소비자용 챗봇 이외에도 잠재적 가치가 있습니다.
더 큰 모델은 여전히 경제적 수익을 창출해야 함
AIBase 기사의 마지막 질문이 가장 중요합니다.
학습 비용이 극도로 높은 모델이 그에 상응하는 수익을 창출할 수 있을까요?
최첨단 연구소는 최종 학습 실행 비용만 지불하는 것이 아닙니다.
총 지출에는 다음이 포함될 수 있습니다:
- GPU
- 데이터센터
- 전력
- 네트워크
- 스토리지
- 연구원 급여
- 데이터 준비
- 실패한 실험
- 후속 학습
- 추론
- 안전 관련 작업
- 제품 통합
그런 다음 모델은 다음 조합을 통해 가치를 창출해야 합니다:
- 소비자 구독
- 광고
- 전자상거래
- 기업 API
- 클라우드 서비스
- 효율성 도구 제품
- 프로그래밍 도구
- 에이전트
- 내부 효율성 향상
파라미터 규모는 허용 가능한 추론 비용으로 유용한 역량으로 전환될 때만 경제적 의미가 있습니다.
이것이 현재 세대의 최첨단 모델이 총 파라미터 수뿐만 아니라 확장 효율성을 점점 더 강조하는 이유입니다.
예를 들어, Kimi K3는 총 파라미터 수가 2.8조 개이지만 토큰당 활성화되는 파라미터는 1040억 개에 불과합니다. 월스앤라이트(Moonshot AI)는 이전 세대와 비교하여 아키텍처의 확장 효율성이 향상되었다고 밝혔습니다.
따라서 진정한 경쟁은:
누가 가장 많은 파라미터를 보유했는가?
가 아니라 오히려:
누가 가장 적은 자원으로 가장 강력한 역량을 전환할 수 있는가?
지속 가능한 학습 및 추론 비용으로 가장 유용한 지능으로 전환할 수 있는가?
확정된 사항과 단순 보도에 불과한 사항
확정됨
- 월스앤라이트(Moonshot AI) 정보에 따르면, Kimi K3의 총 파라미터 수는 2.8조 개입니다.
- 알리바바와 로이터 통신의 보도에 따르면, Qwen3.8-Max의 총 파라미터 수는 2.4조 개입니다.
- 바이트댄스 Seed 팀은 대규모 사전 학습, 후속 학습, 추론 및 모델 인프라 관련 작업을 수행합니다.
- 두바오(Doubao)는 바이트댄스의 소비자용 AI 제품입니다.
- NVIDIA H100은 대규모 Transformer 학습과 수조 개 파라미터 규모의 AI 워크로드를 위해 설계되었습니다.
보도되었으나 바이트댄스 공식 확인은 없음
- 바이트댄스가 5조 개 이상의 파라미터를 가진 모델을 구축 중입니다.
- 최종 목표는 최대 10조 개 파라미터에 달할 수 있습니다.
- 정확한 학습 클러스터 규모.
- 필요한 H100 등가 컴퓨팅의 총량.
- 최종 출시일.
- 해당 모델이最终 공개적으로 출시될지 여부.
- 모델 아키텍처 및 활성화 파라미터 수.
공개 모델 사양으로 검증 불가
- 5조 개 파라미터 모델이 자동으로 "GPT-5.6급"에 해당합니다.
- 파라미터 수만으로 모델의 지능 수준을 예측할 수 있습니다.
- GPT-5.6 또는 Anthropic의 Fable/Mythos급 모델의 정확한 파라미터 수.
- OpenAI 또는 Anthropic의 현재 정확한 GPU 재고.
자주 묻는 질문
바이트댄스가 실제로 5조 개 파라미터 모델을 학습하고 있나요?
AIBase는 <晚点 LatePost>를 인용하여 바이트댄스가 5조 개 이상의 파라미터 모델을 논의 중이라고 보도했습니다. 같은 날 늦게 로이터 통신은 <파이낸셜 타임스>를 인용하여 바이트댄스가 이미 최대 10조 개 파라미터에 달할 수 있는 모델을 사전 학습하고 있다고 보도했습니다. 바이트댄스는 아직 정확한 수치를 공개적으로 확인하지 않았습니다.
해당 모델이 두바오를 지원하게 될까요?
정보 출처는 이 모델이 바이트댄스의 두바오 생태계를 강화할 것으로 예상하지만, 바이트댄스는 아직 보도된 모델이 어떻게 배포될지 공식적으로 발표하지 않았습니다. 최첨단 모델은 기업 API, 에이전트, 연구 및 바이트댄스의 다른 제품도 지원할 수 있습니다.
5조 개 파라미터 모델이 반드시 Kimi K3나 Qwen3.8-Max보다 나은가요?
반드시 그렇지는 않습니다. 총 파라미터 수가 모델 품질을 직접 결정하지 않습니다. 아키텍처, 활성화 파라미터, 학습 데이터, 후속 학습, 강화 학습, 추론 시 사고 및 도구 사용이 모두 동일하게 중요할 수 있습니다.
Kimi K3의 파라미터 수는 얼마인가요?
월스앤라이트(Moonshot AI)는 공식적으로 Kimi K3의 총 파라미터 수가 2.8조 개, 활성화 파라미터가 1040억 개라고 발표했습니다. 희소 혼합 전문가(MoE) 아키텍처를 사용합니다.
Qwen3.8-Max의 파라미터 수는 얼마인가요?
알리바바와 로이터 통신의 보도에 따르면, 알리바바의 Qwen3.8-Max는 총 파라미터 수가 2.4조 개입니다. 이 역시 모든 토큰에 대해 전체 파라미터를 활성화하는 대신 희소 모델 설계를 기반으로 합니다.
5조 개 파라미터 모델을 학습하려면 H100 GPU가 몇 개 필요한가요?
정보 출처는 약 3500만 H100 GPU·일에 해당하는 대략적인 시나리오를 제시했습니다. 예를 들어 10만 개 H100으로 347일, 또는 100만 개 H100으로 약 35일입니다. 실제 필요량은 아키텍처, 정밀도, 활용률, 토큰 수, 하드웨어 및 학습 효율성에 따라 크게 달라질 수 있습니다.
GPT-5.6의 파라미터 수가 5조 개인가요?
OpenAI는 GPT-5.6의 파라미터 수를 공개적으로 공개하지 않았습니다. GPT-5.6의 파라미터 수에 대한 어떠한 주장도 추정치입니다.
특정 모델과의 직접적인 수치 비교는 모두
보도에 따르면, 바이트댄스의 한 모델은 현재까지 추측에 불과하다.
바이트댄스가 해당 모델을 언제 출시할 가능성이 있는가?
현재까지 공식 출시일은 발표되지 않았다. 로이터는 영국 파이낸셜타임스의 보도를 인용해 해당 모델이 사전학습 단계에 있으며, 이 단계는 수개월이 소요될 수 있고 이후에야 미세조정, 평가, 배포가 가능하다고 밝혔다.
관련 도구
- ByteDance Seed: 바이트댄스 공식 연구 기관 및 기초모델, 멀티모달 시스템, AI 연구를 위한 모델 허브.
- ByteDance Seed LLM: 바이트댄스의 사전학습, 후학습, 추론, 메모리, 학습 및 기초모델 연구에 관한 공식 개요.
- 豆包: 바이트댄스의 소비자용 AI 어시스턴트로, 더 강력한 기초모델의 혜택을 받을 수 있는 주요 제품 진입점 중 하나.
- Kimi: Moonshot AI의 공식 제품 플랫폼이자 Kimi 모델 시리즈 접근 경로.
- 通义千问: 알리바바의 공식 Qwen 모델 및 제품 포털.
- NVIDIA H100: NVIDIA가 공식 제공하는 H100 가속기 사양 및 학습 성능 정보.
관련 링크
- 로이터: 바이트댄스, 거대 AI 모델을 겨냥하다: 당일 늦은 보도에 따르면 해당 모델의 규모는 최대 10조 파라미터에 달할 수 있다.
- ByteDance Seed Models: ByteDance Seed 팀의 공식 모델 카탈로그 및 연구 방향.
- ByteDance Seed Infrastructure: 바이트댄스의 분산 학습, 추론 및 AI 시스템 인프라 작업에 관한 공식 개요.
- Kimi K3 기술 블로그: Moonshot AI의 Kimi K3 2.8T 아키텍처 및 104B 활성 파라미터에 대한 공식 설명.
- Kimi K3 GitHub 저장소: Kimi K3 공식 모델 저장소 및 기술 사양.
- 通义千问 공식 웹사이트: 알리바바의 공식 모델 포털 및 API 진입점.
- NVIDIA H100 GPU: 공식 H100 사양 및 대규모 모델 학습 정보.
요약
보도에 따르면, 바이트댄스는 현재 공개적으로 알려진 중국 모델을 초과하는 초대규모 기초모델을 준비하고 있다. AIBase와 晚点 LatePost는 처음에 이 프로젝트를 5조 파라미터 이상으로 설명했으며, 당일 늦은 로이터/파이낸셜타임스의 보도에 따르면 해당 모델은 10조 파라미터에 달할 수 있고 이미 사전학습 단계에 진입했다.
이러한 규모의 프로젝트는 막대한 컴퓨팅 자원을 필요로 한다. 소식통이 예로 든 H100 컴퓨팅량은 약 3,500만 GPU일(day)에 해당하지만, 실제 학습 요구량은 아키텍처, 활성 파라미터, 하드웨어 세대, 활용률 및 학습 효율성에 따라 달라진다.
더 큰 문제는 바이트댄스가 가장 큰 모델을 구축할 수 있는지 여부가 아니다. 총 파라미터 수는 지능을 측정하는 불완전한 지표이며, 특히 희소 혼합 전문가 시스템의 경우 더욱 그렇다.
진정한 시험대는
바이트댄스가 수조 규모의 컴퓨팅량을 성능이 현저히 우수하고, 서비스를 지원할 수 있을 만큼 효율적이며, 그 배후의 인프라를 정당화할 만큼 가치 있는 모델로 전환할 수 있는지에 달려 있다.



