서론
DeepSeek V4 Flash 0731이 공개 베타 버전으로 출시되면서 익숙한 약속을 내걸었다: 매우 낮은 API 가격으로 더 강력한 코딩 및 에이전트 역량을 제공하겠다는 것이다.
개발자들은 이 주장을 곧바로 실제 실험으로 옮겼다.
가장 널리 퍼진 사례 중 하나는 Hermes Agent 실행에서 나왔다. DeepSeek V4 Flash가 단 하나의 초기 프롬프트만으로 플레이 가능한 1인칭 3D 슈팅 게임을 생성한 것이다. 이 프로젝트는 32분이 소요되었으며, 모델 사용 비용은 0.07달러에 불과했다고 알려졌다.
최종 산출물에는 다음이 포함되었다:
- 1인칭 이동.
- 점프.
- 사격.
- 환경과의 물리적 충돌.
- 엄폐물 및 타겟.
- 인터페이스 내 탄약 카운터.

CSA와 HCA가 긴 컨텍스트 비용을 낮춤
DeepSeek V4는 100만 토큰의 컨텍스트 창을 지원합니다.
전통적인 어텐션 시스템은 이러한 규모에서 매우 비싸질 수 있습니다. 각 새 토큰이 많은 이전 컨텍스트를 검사하고 큰 KV 캐시를 유지해야 하기 때문입니다.
DeepSeek의 기술 보고서는 다음을 결합한 하이브리드 어텐션 설계를 설명합니다:
- 압축 희소 어텐션(CSA)
- 고압축 어텐션(HCA)
전반적인 전략은 매 단계마다 전체 기록에 대해 완전하고 비용이 많이 드는 어텐션 계산을 수행하는 것을 피하는 것입니다.
시스템은 컨텍스트를 압축하고 필터링하여 모델이 가장 유용한 정보에 계산을 집중할 수 있게 합니다.
DeepSeek는 100만 토큰 컨텍스트 환경에서 V4 Pro가 다음을 필요로 한다고 보고합니다:
DeepSeek V3.2 단일 토큰 추론 FLOPs의 27%.
- KV 캐시 용량의 10%.
이러한 정확한 비율은 V4 Pro에 대해 기술 논문에서 보고된 수치이며, Flash에 대한 별도 감사 데이터는 아닙니다.
V4 Flash는 동일한 아키텍처 계열을 사용하므로 동일한 장문맥 설계 원칙의 이점을 공유합니다.
실제 효과로는 다음 항목이 감소합니다:
- KV 캐시 메모리.
- GPU 메모리 압력.
- 데이터 이동량.
- 토큰당 계산량.
- 장문맥 서비스 비용.
FP4 및 FP8 저장 공간 절감
및 메모리 트래픽 절감
출시된 V4 Flash 모델은 혼합 저정밀 가중치를 사용합니다.
DeepSeek는 다음을 명시합니다:
FP4 + FP8 혼합 정밀도
낮은 정밀도는 추론 중에 저장, 메모리에서 로드, 장치 간 전송, 처리해야 하는 데이터 양을 줄입니다.
현대 언어 모델 추론은 단순 산술 연산 능력보다 메모리 대역폭에 의해 제한되는 경우가 많기 때문에 이는 중요합니다.
하드웨어와 커널이 이러한 형식을 효율적으로 실행하도록 설계된 경우, 더 작은 데이터 표현은 처리량을 향상시킬 수 있습니다.
저정밀도가 무조건 공짜인 것은 아닙니다.
잘못된 양자화는 모델 품질을 저하시킵니다.
DeepSeek의 출시는 사후 커뮤니티 양자화에 의존하는 대신 선택된 정밀도 체계를 중심으로 설계되고 훈련된 것입니다.
프리뷰 버전과 0731 간 아키텍처 변경 없음
DeepSeek는 공식 0731 버전이 V4 Flash 프리뷰와 동일한 모델 아키텍처와 규모를 유지한다고 밝혔습니다.
이번 업데이트를 위해 전체 사전 훈련을 다시 수행하지 않았습니다.
대신 후훈련 프로세스를 재작업했습니다.
원본 기사는 변경 사항을 다음과 같이 요약합니다:
- 새로운 지도 미세 조정.
- 새로운 GRPO 강화 학습.
- DSpark 투기적 디코딩.
- 더 나은 에이전트 동작.
- 더 높은 서비스 처리량.
DeepSeek의 기술 보고서는 더 광범위한 V4 후훈련 프로세스를 다음과 같이 설명합니다:
- 도메인 전문가 모듈을 독립적으로 개발.
- GRPO를 사용한 지도 미세 조정 및 강화 학습.
- 온라인 정책 증류.
- 전문가 역량을 단일 모델로 통합.
0731 업데이트는 실제 에이전트 워크플로에서 이러한 역량의 성능을 개선하는 데 중점을 둡니다.
DSpark가 토큰 생성을 가속화
DeepSeek-V4-Flash-0731에는 DSpark 투기적 디코딩 모듈이 포함되어 있습니다.
투기적 디코딩은 더 작거나 저렴한 드래프트 경로를 사용하여 여러 미래 토큰을 제안합니다.
메인 모델은 이러한 제안을 일괄 검증합니다.
단순화된 프로세스는 다음과 같습니다:
드래프트 모듈이 토큰 제안
→ 메인 모델이 동시에 검증
→ 수락된 토큰 출력
→ 거부된 경로는 수정됨
드래프트 예측이 정확할 때, 시스템은 더 적은 메인 모델의 비용이 많이 드는 순차적 추론으로 여러 수락된 토큰을 생성할 수 있습니다.
DeepSeek는 vLLM과 SGLang 모두에 DSpark 지원을 제공합니다.
vLLM의 경우 공식 모델 카드에서 다음을 사용합니다:
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
SGLang의 경우 해당 옵션은 다음과 같습니다:
--speculative-algorithm DSPARK
DeepSeek는 대상 모델과 드래프트 모델의 가중치가 동일한 체크포인트에 저장되므로 SGLang에는 별도의 드래프트 모델 경로가 필요하지 않다고 밝혔습니다.
투기적 디코딩은 주로 서비스 속도와 처리량을 향상시킵니다.
그 자체로 모델의 추론 능력 향상을 설명하지는 않습니다.
이러한 향상은 업데이트된 후훈련 프로세스에서 비롯됩니다.
공식 출시가 에이전트 벤치마크 점수 향상
DeepSeek는 V4 Flash 프리뷰 대비 여러 에이전트 중심 테스트에서 큰 향상을 보고했습니다.
| 벤치마크 | V4 Flash 0731 | V4 Flash 프리뷰 | V4 Pro 프리뷰 |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 |
| NL2Repo | 54.2 | 39.4 | 38.5 |
| CyberGym | 76.7 | 38.7 | 52.7 |
| DeepSWE | 54.4 | 7.3 | 12.8 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 |
| Agents' Last Exam | 25.2 | 15.8 | 16.5 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 |
| DSBench-FullStack | 68.7 | 37.0 | 41.8 |
| DSBench-Hard | 59.6 | 25.8 | 31.1 |

DeepSeek는 공개 코드 에이전트 벤치마크가 다음 구성으로 실행되었다고 밝혔습니다:
DeepSeek Harness 최소 모드
reasoning_effort = max
top_p = 0.95
temperature = 1.0
공식 업데이트 시점에 이 테스트 프레임워크는 아직 공개되지 않았습니다.
DSBench-FullStack과 DSBench-Hard는 DeepSeek의 내부 벤치마크입니다.
즉, 이 점수는 회사가 보고한 참고 증거로 사용될 수 있지만 완전히 공개된 벤치마크 스위트처럼 독립적으로 검증할 수는 없습니다.
Terminal Bench와 Toolathlon이 측정하는 것
Terminal Bench 2.1
Terminal Bench는 터미널 환경에서 에이전트가 작업을 완료하는 능력을 평가합니다.
모델은 파일을 검사하고, 명령을 실행하고, 종속성을 설치하고, 오류를 디버깅하고, 코드를 수정하고, 완료를 검증해야 할 수 있습니다.
높은 점수는 모델, 에이전트 프레임워크, 도구 전략, 추론 예산 및 런타임 환경의 종합적인 성능을 반영합니다.
Toolathlon-Verified
Toolathlon은 여러 소프트웨어 애플리케이션과 도구에 걸친 장기 작업을 평가합니다.
이 벤치마크에는 캘린더, 파일 시스템, Notion, WooCommerce, Kubernetes 및 BigQuery와 관련된 시나리오가 포함됩니다.
작업은 여러 도구 상호 작용이 필요하며 실행 기반 평가기를 통해 검증됩니다.
DeepSeek가 보고한 70.3점은 프리뷰 모델 대비 큰 향상입니다.
그러나 이것이 모든 실제 비즈니스 자동화에 대해 70.3%의 성공을 보장하는 것으로 해석되어서는 안 됩니다.
벤치마크 향상이 모든 게임에서 원샷 프롬프트 성공을 보장하지는 않음
소스의 게임 예시는 벤치마크 성능과 창의적 코딩 사이의 중요한 차이를 보여줍니다.
V4 Flash는 공식 에이전트 평가에서 강력한 성능을 보였지만, 한 게임 비교는 여전히 세 번의 반복이 필요했습니다.
벤치마크는 명확하게 정의된 작업 세트와 알려진 평가 규칙 하에서의 성공률을 측정할 수 있습니다.
반면 창의적 프로젝트는 모호한 시각적 요구 사항, 브라우저 호환성 문제, 물리 엔진 오류, 리소스 누락, 주관적인 품질 평가를 포함할 수 있으며 성공을 정의하는 단일 테스트 스위트가 없습니다.
이러한 시나리오에서 저비용 모델은 워크플로가 여러 번의 반복을 견딜 수 있기 때문에 특히 유용합니다.
그 가치는 반드시 첫 생성이 완벽하다는 데 있는 것이 아닙니다.
그것은 다음과 같을 수 있습니다:
허용 가능한 품질
×
대량의 저렴한 시도 횟수
몇 분 만에 쇼케이스 사이트를 만들고 리드를 늘리세요
아이디어를 한 문장으로 입력하면 We0 AI가 쇼케이스 사이트, 페이지, CMS를 생성하고 출시 후 고객과 트래픽 확보를 돕습니다.
무료 등록을 위한 하나의 완전한 프로젝트 생성
하나의 완전한 생성 흐름을 시도하고 첫 번째 프로젝트 초안을 빠르게 보는 데 가장 적합합니다.
V4 Flash는 다양한 API 형식을 지원합니다
DeepSeek는 다음 방식으로 모델을 공개합니다:
- OpenAI의 Chat Completions 인터페이스와 호환.
- OpenAI의 Responses API와 호환.
- Anthropic의 API와 호환.
- JSON 출력.
- 도구 호출.
- 채팅 접두사 완성.
- 비사고 모드에서의 중간 채움 완성.
OpenAI 호환 Base URL은 다음과 같습니다:
https://api.deepseek.com
Anthropic 호환 Base URL은 다음과 같습니다:
https://api.deepseek.com/anthropic
DeepSeek는 V4 Flash가 현재 Responses API를 지원하는 유일한 V4 API 모델이라고 밝혔습니다.
V4 Pro의 지원은 별도로 계획될 예정입니다.
Responses API 호환성을 통해 이 모델은 DeepSeek의 문서화된 구성을 사용하여 Codex에서도 사용할 수 있습니다.
사고 모드 기본 활성화
DeepSeek V4 Flash는 사고 모드와 비사고 모드를 지원합니다.
사고 모드가 기본 모드입니다.
로컬 추론의 경우, 공식 모델 카드는 세 가지 추론 노력 수준을 지원합니다:
low
high
max
DeepSeek는 다음을 권장합니다:
temperature = 1.0
top_p = 0.95
에이전트 시나리오에 사용할 때.
high 및 max 추론 노력 수준의 경우, 최대 출력 길이를 384K 토큰까지 허용할 것을 권장합니다.
더 높은 추론 설정은 어려운 작업의 성능을 개선할 수 있지만, 지연 시간, 출력량, API 비용 및 에이전트 루프 소요 시간을 증가시킬 수 있습니다.
프로덕션 시스템은 작업 요구 사항을 안정적으로 충족할 수 있는 가장 낮은 노력 수준을 평가해야 합니다.
가중치는 MIT 라이선스로 공개
DeepSeek는 Hugging Face에서 V4 Flash 0731 가중치를 MIT 라이선스로 공개했습니다.
이는 많은 대규모 상업용 릴리스와 비교해 이례적으로 관대한 라이선스입니다.
개발자는 공식 모델 저장소를 지원되는 엔진과 함께 사용할 수 있습니다:
- vLLM.
- SGLang.
- Transformers.
- Docker Model Runner.
- llama.cpp와 호환되는 양자화 버전.
- LM Studio와 호환되는 커뮤니티 빌드 버전.
이 모델은 규모가 큽니다.
핵심 모델은 284B 파라미터를 보유하며, 0731 체크포인트에는 별도의 DSpark 구성 요소가 포함되어 있습니다.
사용 가능한 속도로 실행하려면 상당한 메모리와 하드웨어 리소스가 필요합니다.
가중치를 다운로드할 수 있다고 해서 전체 모델이 일반적인 소비자용 노트북에서 원활하게 실행된다는 의미는 아닙니다.
커뮤니티 양자화 버전은 메모리 요구 사항을 줄일 수 있지만, 정확성, 처리량, 컨텍스트 용량, DSpark 동작 및 도구 호출 신뢰성을 변경할 수 있습니다.
V4 Flash가 항상 가장 비용 효율적인 선택인가요?
소식통은 V4 Flash가 모든 비교에서 최상의 결과를 내는 것은 아니지만, 가격 대비 성능 면에서 경쟁하기 어렵다고 요약했습니다.
이는 예시에 대한 합리적인 요약이지만, 한 가지 중요한 전제가 있습니다:
비용 효율성은 전체 워크플로우에 달려 있습니다.
V4 Flash는 다음 상황에서 특히 매력적입니다:
- 요청량이 많은 경우.
- 오류를 쉽게 감지할 수 있는 경우.
- 작업을 자동으로 재시도할 수 있는 경우.
- 컨텍스트 캐싱 효과가 좋은 경우.
- 인적 검토 비용이 낮은 경우.
- 간결한 코드가 허용되는 경우.
- 애플리케이션이 개방형 가중치 모델을 사용할 수 있는 경우.
반면, 더 비싼 프론티어 모델이 전반적으로 여전히 더 경제적일 수 있는 경우:
- 실패한 결과 하나가 큰 손실을 초래하는 경우.
- 첫 시도 신뢰성이 중요한 경우.
- 작업이 더 깊은 지식을 요구하는 경우.
- 에이전트가 안전하게 재시도할 수 없는 경우.
- 인적 검토 비용이 높은 경우.
- 더 작은 모델이 유지 관리하기 어려운 출력을 생성하는 경우.
올바른 비교는 다음과 같지 않습니다:
토큰당 가격
다음과 같습니다:
검증된 성공 작업당 비용
실제 프로젝트를 위한 V4 Flash 평가 방법
1단계: 대표적인 작업 선택
완성된 데모만 테스트하지 마십시오.
프로덕션 워크로드와 일치하는 작업을 사용하십시오. 어렵고 복잡한 시나리오를 포함하십시오.
2단계: 에이전트 환경 고정
다양한 모델 간에 프롬프트, 도구, 시간 제한, 재시도 전략, 프레임워크, 샌드박스, 테스트 스위트 및 추론 설정을 일관되게 유지하십시오.
3단계: 전체 비용 기록
캐시 미스 입력, 캐시 히트 입력, 출력 토큰, 도구 호출, 재시도 횟수, 실행 시간, 인적 검토 및 실패한 시도를 추적하십시오.
4단계: 시각적 유사성만이 아닌 허용 가능성 측정
코드의 경우 테스트를 실행하고 유지 관리 가능성을 확인하십시오.
게임의 경우 컨트롤, 충돌, 성능 및 브라우저 호환성을 확인하십시오.
5단계: 캐시 동작 테스트
안정적인 컨텍스트가 여러 에이전트 단계에서 반복적으로 재사용될 때, 캐시 히트 가격이 매우 낮은 모델은 더 가치가 높아집니다.
6단계: 첫 시도 성공과 최종 성공 비교
저렴한 시도 세 번으로 성공하는 모델은 높은 가격에 한 번 성공하는 모델보다 비용 효율적일 수 있습니다.
재시도가 느리거나 위험한 경우에는 그 반대일 수도 있습니다.
자주 묻는 질문
DeepSeek V4 Flash 0731이란 무엇인가요?
DeepSeek V4 Flash 0731은 DeepSeek의 소규모 V4 혼합 전문가 모델의 공식 사후 학습 버전입니다. 미리보기 버전을 대체하며, DSpark 투기적 디코딩 모듈이 추가되었고 코딩 및 도구 사용형 에이전트 작업에 중점을 둡니다.
DeepSeek V4 Flash API 비용은 얼마인가요?
DeepSeek가 현재 공개한 일반 가격은 다음과 같습니다: 캐시 히트 입력 토큰 100만 개당 0.0028달러, 캐시 미스 입력 토큰 100만 개당 0.14달러, 출력 토큰 100만 개당 0.28달러. 회사는 향후 정책에서 지정된 피크 시간대에 가격을 두 배로 인상할 것이라고 발표했습니다.
DeepSeek V4 Flash가 정말 0.07달러로 3D 게임을 만들었나요?
한 개발자가 Hermes Agent의 단일 실행이 32분 만에 0.07달러의 비용으로 플레이 가능한 1인칭 슈팅 게임을 생성했다고 보고했습니다. 이는 소셜 미디어 사례 연구이지 표준화된 벤치마크가 아니므로, 다른 작업의 비용은 더 높거나 낮을 수 있습니다.
DeepSeek V4 Flash의 파라미터 수는 얼마인가요?
V4 기술 보고서에 따르면 핵심 Flash 모델의 총 파라미터는 2840억 개이며, 토큰당 130억 개의 파라미터가 활성화됩니다. 전체 0731 버전 저장소에는 포함된 DSpark 투기적 디코딩 구성 요소 때문에 약 3040억 개의 파라미터로 표시될 수 있습니다.
왜 DeepSeek V4 Flash가 이렇게 저렴한가요?
저비용의 원인은 희소 혼합 전문가 활성화, 압축된 장문 컨텍스트 주의, FP4/FP8 혼합 정밀도, 프롬프트 캐싱, 투기적 디코딩 및 높은 동시성 서비스에 있습니다. 토큰당 전체 전문가 중 극히 일부만 활성화됩니다.
DeepSeek V4 Flash가 Claude Opus 5나 GPT-5.6보다 우수한가요?
현재 API 가격 기준으로 훨씬 저렴하며 여러 커뮤니티 데모에서 경쟁력 있는 성능을 보여주었습니다. Opus 5와 GPT-5.6은 특정 작업에서 여전히 더 강력한 첫 시도 신뢰성이나 품질을 제공할 수 있으며, 바이럴 비교는 통제된 벤치마크가 아닙니다.
DeepSeek V4 Flash를 로컬에서 실행할 수 있나요?
가능합니다. DeepSeek는 MIT 라이선스로 가중치를 공개했으며 vLLM 및 SGLang 사용 지침을 제공합니다. 전체 모델은 매우 크므로 실제 로컬 배포에는 상당한 가속기 메모리 또는 공격적인 커뮤니티 양자화 방식이 필요합니다.
V4 Flash가 Codex와 Responses API를 지원하나요?
지원합니다. DeepSeek는 공식 Flash 버전이 Responses API를 기본 지원하며 Codex에 맞게 조정되었다고 밝혔습니다. 현재 V4 Pro API는 Responses API를 지원하지 않습니다.
관련 도구
- DeepSeek API: DeepSeek V4 Flash 및 기타 지원 모델을 위한 공식 호스팅 엔드포인트.
- [DeepSeek V4 Flash
0731](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731): 공식 모델 저장소로, 가중치, 벤치마크, 라이선스 및 배포 가이드를 포함합니다.
- vLLM: V4 Flash 및 DSpark용 공식 레시피를 제공하는 고처리량 추론 엔진입니다.
- SGLang: V4 Flash 및 DSpark에 대한 문서화된 지원이 내장된 LLM 서비스 프레임워크입니다.
- DeepSpec: DeepSeek의 추측 디코딩 연구 및 DSpark 방법 저장소입니다.
- Codex: DeepSeek의 Responses API 호환 인터페이스를 통해 V4 Flash에 연결할 수 있는 지능형 코딩 환경입니다.
관련 링크
- DeepSeek V4 Flash 공식 업데이트: 7월 31일 업데이트 로그로, 공식 출시 상태, 벤치마크 및 API 범위를 포함합니다.
- DeepSeek API 모델 및 가격: 현재 토큰 가격, 컨텍스트 길이, 출력 제한, 동시성 및 향후 피크 가격 공지 사항입니다.
- DeepSeek V4 기술 보고서: MoE 아키텍처, CSA/HCA 어텐션, 정밀도, 훈련 및 백만 토큰 컨텍스트를 설명하는 주요 논문입니다.
- DeepSeek V4 Flash 모델 카드: 공식 0731 벤치마크 표, 채팅 코딩, DSpark 구성 및 MIT 라이선스가 포함되어 있습니다.
- DeepSeek Codex 통합: Codex 및 Responses API를 통해 V4 Flash를 사용하는 공식 가이드입니다.
- Toolathlon 논문: 공식 평가에 사용된 장기 다중 도구 벤치마크를 설명하는 연구 논문입니다.
- V4 Flash vLLM 레시피: V4 Flash 배포에 적합한 하드웨어 및 서비스 가이드입니다.
요약
DeepSeek V4 Flash 0731은 개발자들이 단 몇 센트만으로 완전한 인터랙티브 데모를 구축할 수 있다고 보고하면서 큰 주목을 받았습니다. 1인칭 슈팅 게임은 단 0.07달러에 제작되었으며, 다른 소셜 미디어 비교에서는 작업 비용이 Claude Opus 5나 GPT-5.6보다 수십 배 낮은 것으로 나타났습니다.
이러한 사례는 통제된 벤치마크 테스트는 아니지만, 공식 API 가격 정책은 그 핵심 주장을 뒷받침합니다. V4 Flash는 캐시되지 않은 입력 토큰 100만 개당 0.14달러, 출력 토큰 100만 개당 0.28달러를 청구하며, 캐시 적중률은 놀랍게도 낮은 0.0028달러에 불과합니다.
이러한 경제성은 전체 시스템에서 비롯됩니다: 토큰당 13B 파라미터가 활성화되는 284B MoE 코어, 압축된 장기 컨텍스트 어텐션, FP4/FP8 가중치, 백만 토큰 컨텍스트 창, 효율적인 서빙 역량, 그리고 DSpark 추측 디코딩입니다. 0731 업데이트는 미리보기 아키텍처를 유지하면서 새로운 사후 훈련을 통해 에이전트 동작을 개선했습니다.
가장 강력한 공식 증거는 벤치마크 향상입니다. Terminal Bench 2.1은 61.8에서 82.7로, Toolathlon-Verified는 49.7에서 70.3으로 상승했으며, 모델은 Flash 가격 등급을 유지했습니다.
V4 Flash의 강점은 모든 비교에서 이기는 것이 아니라, 매우 낮은 한계 비용 덕분에
많은 프런티어 가격 모델이 감당하기 어려운 규모로 에이전트 실험을 반복적으로 수행하는 것이 실질적으로 가능하다는 점입니다.



