서론
DeepSeek V4 Flash 0731은 이례적인 다양한 반응을 불러일으켰습니다.
개발자들은 코딩 에이전트 점수에 깊은 인상을 받았습니다.
인프라 팀은 100만 토큰 컨텍스트와 낮은 활성 파라미터 수에 주목하고 있습니다.
AI 플랫폼들은 무료 사용과 공격적인 할인을 제공하고 있습니다.
그리고 소셜 미디어는 추론 비용이 달러가 아닌 센트 단위로 보고된 프로토타입 스크린샷으로 가득 차 있습니다.
원문 기사에서 가장 널리 공유된 사례는 다음과 같습니다:
- 소형 3D 우주 슈터 프로토타입이 약 0.07위안으로 생성된 것으로 보고됨.
- 카운터스트라이크 스타일 프로토타입이 약 0.50위안으로 제작된 것으로 보고됨.
- 8,700만 토큰을 31.57위안에 사용한 개인 사용 대시보드.
- OpenCode가 8월 1일에 8조 개의 DeepSeek Flash 토큰을 처리했다고 보고.
- Cline이 모델 보조 비용이 예상보다 저렴하다는 것을 확인한 후 무료 할당량을 확대.
- Nous Portal이 V4 Flash 0731을 일시적으로 90% 할인.
이러한 사례들은 흥분을 불러일으키지만, 서로 다른 여러 가지를 혼동할 수도 있습니다:
- DeepSeek의 공식 API 가격.
- 캐시 적중 및 캐시 미스 가격.
- 무료 또는 보조금이 지급된 타사 접근.
- 에이전트가 수행하는 도구 호출 수.
- 생성된 출력 및 숨은 추론의 양.
- 모델 자체의 비용 대비 완전한 제품의 비용.
이 모델은 확실히 저렴합니다.
그렇다고 모든 애플리케이션이 7센트의 비용이 든다는 의미는 아닙니다.
유용한 질문은 하나의 바이럴 데모가 정확히 재현 가능한지 여부가 아닙니다. 핵심은 DeepSeek가 기본 아키텍처를 변경하지 않고 어떻게 이렇게 큰 성능 도약을 이루었는지, 그리고 새로운 경제성이 개발자에게 어떤 의미를 갖는지입니다.
글로벌 할인 사이클
공식 API 가격은 타사 프로모션이 적용되기 전에도 이미 낮았습니다.
DeepSeek는 현재 백만 토큰당 다음 가격을 제시하고 있습니다:
| 사용 유형 | DeepSeek V4 Flash 가격 |
|---|---|
| 입력, 캐시 적중 | $0.0028 |
| 입력, 캐시 미스 | $0.14 |
| 출력 | $0.28 |
API는 다음을 지원합니다:
- 100만 토큰 컨텍스트 창.
- 최대 384K 출력 토큰.
- 사고 및 비사고 모드.
- 0731 모델 카드의 세 가지 추론 노력 수준:
low,high,max. - 도구 호출.
- JSON 출력.
- 베타 버전의 채팅 접두사 완성.
- 비사고 모드의 FIM 완성.
- OpenAI 호환 채팅 완성.
- Responses API.
- Anthropic 호환 인터페이스.
- V4 Flash에 대해 계정당 2,500의 공개 동시성 제한.
이러한 공식 가격이 기준선입니다.
플랫폼은 다음 중에서 선택할 수 있습니다:
- 가격을 그대로 전가.
- 마크업 추가.
- 사용 보조금 지급.
- 제한된 무료 모델 제공.
- 모델을 구독에 번들로 포함.
- 프로모션 크레딧 적용.
- 트래픽을 다른 추론 제공업체로 라우팅.
이것이 한 개발자는 DeepSeek의 정가를 지불하고 다른 개발자는 제한된 기간 동안 아무 것도 지불하지 않는 이유입니다.
OpenCode, 하루 8조 토큰 보고
OpenCode는 8월 1일에 DeepSeek Flash가 자사 플랫폼을 통해 8조 개의 토큰을 처리했다고 공개적으로 밝혔습니다.
게시물은 수치를 다음과 같이 분류합니다:
5조 토큰 무료 사용
+
3조 토큰 OpenCode Go를 통해

OpenCode의 현재 Zen 문서에는 제한된 기간 동안 이용 가능한 DeepSeek V4 Flash Free 옵션이 나열되어 있습니다.
이것은 중요한 차이점입니다.
8조 토큰이라는 수치는 DeepSeek가 모든 플랫폼에서 보고한 직접 사용량이 아니라 OpenCode를 통한 트래픽을 설명합니다.
그럼에도 이는 저비용 모델이 인기 있는 코딩 에이전트 워크플로우에 배치될 때 엄청난 수요를 창출할 수 있다는 강력한 신호입니다.
Nous Portal, 가격 90% 일시 인하
Nous Research는 Novita Labs와 협력하여 Nous Portal을 통해 DeepSeek V4 Flash 0731을 90% 할인된 가격으로 제공하는 7일 프로모션을 발표했습니다.

프로모션 게시물은 할인된 비용을 Claude Fable 5와 비교하여 비교 가능한 작업에서 1,000배 이상의 가격 차이가 있다고 주장했습니다.
이 비교는 여러 선택에 따라 달라집니다:
- 어떤 공급업체 가격을 사용하는지.
- 입력 또는 출력 중 어떤 것이 우세한지.
- 캐싱을 사용할 수 있는지.
- 어떤 추론 설정을 선택하는지.
- 각 모델이 작업을 완료하는 데 필요한 토큰 수.
- 어떤 벤치마크 또는 워크플로우가 "비교 가능"을 정의하는지.
토큰당 가격 비교는 유용하지만, 더 의미 있는 지표는 다음과 같습니다:
승인된 작업당 총 비용
더 적은 고가 토큰을 사용하는 모델은 반복적으로 재시도하는 저가 모델보다 더 저렴할 수 있습니다.
반대로, 저가 모델이 작업을 빠르게 완료할 수 있을 만큼 충분한 성능을 갖추면 비용 이점이 엄청나게 커질 수 있습니다.
Cline, 무료 할당량 3배 확대
Cline은 처음에 코딩 에이전트를 통한 무료 V4 Flash 0731 사용을 발표했습니다.
이후 공개 게시물에서 경제성이 지속 가능해 보인다며 무료 할당량을 3배로 늘렸다고 밝혔습니다.

Cline의 현재 모델 카탈로그와 ClinePass 자료에는 DeepSeek V4 Flash가 집중 코딩 작업을 위한 빠르고 가성비 높은 옵션으로 포함되어 있습니다.
무료 할당량과 모델 제공 여부는 변경될 수 있으므로, 사용자는 오래된 스크린샷에 의존하기보다 실시간 제공업체 페이지를 확인해야 합니다.
더 넓은 교훈은 더 오래 지속됩니다.
추론 비용이 충분히 저렴해지면 에이전트 플랫폼은 무료 액세스를 고객 유치 수단으로 사용할 수 있으며, 부담을 떠안지 않고도 가능합니다.
프리미엄 프론티어 모델을 사용할 때와 동일한 비용이 발생합니다.
커뮤니티 비용 스크린샷에는 맥락이 필요합니다
출처 기사에는 다음을 보여주는 대시보드가 포함되어 있습니다:
- RMB 31.57 지출
- API 요청 2,282건
- 토큰 87,027,995개

이 스크린샷은 유리한 사용 패턴에서 개발자가 볼 수 있는 규모를 보여주기 때문에 유용합니다.
청구서를 정확히 재구성할 만큼 충분한 정보를 제공하지는 않습니다.
누락된 변수는 다음과 같습니다:
- 입력 대 출력 토큰 비율
- 캐시 적중률
- 각 날짜에 사용된 모델 버전
- 추론 노력
- 도구 호출 횟수
- 실패한 요청
- 프로모션 크레딧
- 공급업체 할인
- 모든 토큰이 동일한 요율로 청구되었는지 여부
길고 반복되는 시스템 프롬프트는 캐시에 적중하면 매우 저렴할 수 있습니다.
한 번 전송되는 길고 고유한 프롬프트는 캐시 미스 입력 가격으로 청구됩니다.
출력은 또한 캐시된 입력보다 훨씬 비쌉니다.
에이전트 시스템의 경우 이러한 차이가 최종 청구서를 좌우합니다.
플래시 블리츠: 7월 31일 변경 사항
DeepSeek V4 Preview는 2026년 4월 24일에 출시되었습니다.
해당 제품군에는 다음이 포함되었습니다:
- DeepSeek V4 Pro
- DeepSeek V4 Flash
Preview 릴리스는 주요 아키텍처를 구축했습니다:
- 희소 혼합 전문가(MoE)
- 100만 토큰 컨텍스트
- 효율적인 장문 컨텍스트 어텐션
- 전체 용량 대비 낮은 활성 파라미터 수
- 사고 및 비사고 모드
- MIT 라이선스 하의 오픈 가중치
V4 Flash Preview는 V4 Pro보다 더 작고 빠르고 저렴한 대안으로 포지셔닝되었습니다.
7월 31일 업데이트로 경쟁적 위치가 변경되었습니다.
DeepSeek는 V4 Flash 0731이 V4 Flash Preview와 동일한 모델 아키텍처와 크기를 사용한다고 밝혔습니다.
업데이트는 새로운 사후 학습 프로세스를 실행하여 생성되었습니다.
간단히 표현하면:
동일한 사전 학습된 기본 아키텍처
+
새로운 사후 학습 및 에이전트 최적화
=
훨씬 강력한 코딩 에이전트 동작
이것이 중요한 이유는 사전 학습된 모델에 얼마나 많은 능력이 잠재되어 있을 수 있는지 보여주기 때문입니다.
아키텍처와 파라미터 수가 제품의 전부는 아닙니다.
사후 학습은 모델이 다음을 얼마나 효과적으로 수행하는지를 결정합니다:
- 도구 사용
- 다단계 작업 계획
- 터미널 피드백 처리
- 오류 복구
- 파일 작성 및 편집
- 에이전트 프로토콜 준수
- 추론 노력 배분
- 하네스 내에서 작업
기본 아키텍처 및 체크포인트 세부 정보
원본 V4 Flash 모델 카드는 기본 모델을 다음과 같이 설명합니다:
| 사양 | DeepSeek V4 Flash |
|---|---|
| 총 기본 MoE 파라미터 | 284B |
| 활성화된 파라미터 | 13B |
| 컨텍스트 길이 | 1M |
| 라이선스 | MIT |
| 주요 모달리티 | 텍스트 |
| 기본 정밀도 | FP8 / 체크포인트에 따른 혼합 저정밀도 |
0731 모델 카드는 새 릴리스가 DSpark 변형과 동일한 구조를 가지며 추측 디코딩 모듈이 포함되어 있다고 말합니다.
이것은 일부 모델 파일 메타데이터가 표시될 수 있는 이유를 설명합니다
총 체크포인트 수가 284B 기본 MoE 수치보다 더 큽니다.
가장 명확한 설명은 다음과 같습니다:
V4 Flash의 기본 MoE 모델은 총 약 284B 파라미터에 활성 파라미터 13B를 유지하며, 0731 릴리스에는 게시된 체크포인트에 추가 DSpark 추측 디코딩 구성 요소가 포함됩니다.
DSpark 추측 디코딩
추측 디코딩은 빠른 드래프트 프로세스를 사용하여 여러 미래 토큰을 제안합니다.
그런 다음 기본 모델이 해당 제안을 검증합니다.
예측이 수용되면 시스템은 더 적은 순차 작업으로 여러 토큰을 생성할 수 있습니다.
DeepSeek의 0731 모델 카드는 vLLM 및 SGLang에 대한 명시적 DSpark 지원을 제공합니다.
vLLM의 경우 관련 구성은 다음과 같습니다:
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
SGLang의 경우 모델 카드는 다음을 사용합니다:
--speculative-algorithm DSPARK
DSpark는 그 자체로 모델의 추론 능력을 향상시키지 않습니다.
이는 지원되는 구성에서 대상 모델의 출력 분포를 유지하면서 디코딩 지연 시간을 줄이거나 처리량을 높이기 위한 추론 최적화입니다.
벤치마크 점프
DeepSeek는 V4 Flash 0731에 대해 다음 비교를 게시합니다:
| 벤치마크 | V4 Flash 0731 | V4 Flash Preview | V4 Pro Preview |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 |
| NL2Repo | 54.2 | 39.4 | 38.5 |
| CyberGym | 76.7 | 38.7 | 52.7 |
| DeepSWE | 54.4 | 7.3 | 12.8 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 |
| Agents’ Last Exam | 25.2 | 15.8 | 16.5 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 |
| DSBench-FullStack | 68.7 | 37.0 | 41.8 |
| DSBench-Hard | 59.6 | 25.8 | 31.1 |
가장 극적인 증가는 DeepSWE입니다:
7.3 → 54.4
CyberGym은 거의 두 배가 됩니다:
38.7 → 76.7
Terminal Bench 2.1은 20포인트 이상 상승합니다:
61.8 → 82.7
새로운 Flash 모델은 또한 DeepSeek가 게시한 표의 모든 벤치마크에서 V4 Pro Preview를 초과합니다.
이는 원래 주로 더 저렴하고 빠른 옵션으로 포지셔닝된 모델에게는 큰 변화입니다.
벤치마크 방법론이 중요합니다
이 표는 순수한 원시 체크포인트 비교로 읽어서는 안 됩니다.
DeepSeek의 모델 카드에는 몇 가지 중요한 메모가 포함되어 있습니다.
공개 코드 에이전트 작업의 경우 회사는 다음을 사용했습니다:
DeepSeek Harness 최소 모드
추론 노력: 최대
온도: 1.0
Top-p: 0.95
DeepSeek Harness는 검증 시점에 공개적으로 릴리스되지 않았습니다.
이는 외부 연구자들이 게시된 코드 에이전트 결과에 사용된 정확한 소프트웨어 환경을 아직 재현하지 못할 수 있음을 의미합니다.
두 가지 테스트도 내부 테스트입니다:
- DSBench-FullStack.
- DSBench-Hard.
내부 벤치마크는 제품 개발에 유용할 수 있지만, 독립 팀은 숨겨진 작업이나 오염 통제를 검사할 수 없습니다.
올바른 해석은 다음과 같습니다:
DeepSeek는 자체 선택한 에이전트 스택 및 평가 설정에서 큰 개선을 보고합니다. 공개 재현성은 하네스, 프롬프트, 로그 및 전체 평가 구성이 제공될 때 개선될 것입니다.
하네스 품질이 점수를 바꿀 수 있습니다
코딩 벤치마크는 종종 전체 시스템을 측정합니다:
모델
+
시스템 프롬프트
+
리포지토리 도구
+
터미널
실행
+
컨텍스트 관리
+
재시도 정책
+
테스트 피드백
+
패치 제출 로직
하나의 구성 요소가 바뀌면 동일한 모델도 다른 점수를 받을 수 있습니다.
더 나은 하네스는 다음과 같은 일을 할 수 있습니다:
- 더 관련성 높은 파일을 선택합니다.
- 유용한 터미널 출력을 보존합니다.
- 컨텍스트 오버플로를 방지합니다.
- 실패한 명령을 지능적으로 재시도합니다.
- 비생산적인 루프를 중단합니다.
- 패치를 더 안정적으로 적용합니다.
- 모델에게 더 명확한 테스트 결과를 제공합니다.
이것이 모델의 관련성을 무의미하게 만들지는 않습니다.
벤치마크 결과는 모델과 하네스의 조합에 귀속된다는 뜻입니다.
강력한 0731 수치는 DeepSeek가 모델의 에이전트 동작과 주변 평가 프로세스를 모두 개선했음을 시사합니다.
## Artificial Analysis는 이를 50점으로 평가
Artificial Analysis는 DeepSeek V4 Flash 0731에 대해 약 **50**의 Intelligence Index 점수를 보고하며, 이는 이전 Flash 버전보다 약 10포인트 높은 수치입니다.
독립 모델 분석 업체는 또한 V4 Flash가 다른 유명 프론티어 시스템들에 비해 매우 저렴하다고 설명합니다.
Reuters는 자체 방법론에서 평균 벤치마크 테스트 비용이 약 3센트라고 보도하며 Artificial Analysis의 분석 결과를 요약했습니다.
이 비교는 가치 논거를 뒷받침합니다.
모든 프로덕션 작업이 3센트라는 뜻은 아닙니다.
Artificial Analysis는 일부 지식 신뢰성 지표에서 더 약한 결과도 보고합니다.
V4 Flash 0731 기사에서 다음과 같이 언급합니다:
- 전지적 정확도는 약 37%를 유지했습니다.
- 환각 비율은 감소했지만 해당 평가에서 약 84%로 여전히 높았습니다.
이 수치들은 유용한 상기 역할을 합니다.
모델은 다음과 같을 수 있습니다:
- 코딩 에이전트에서 매우 강력함.
- 매우 저렴함.
- 복합 지수에서 경쟁력 있음.
- 그럼에도 일부 개방형 사실 질문에서는 여전히 신뢰할 수 없음.
"최고의 가치"는 "모든 작업에 최고"와 같지 않습니다.
## 공식 API 가격
직접 DeepSeek API 가격은 다음과 같습니다:
| 결제 구분 | 100만 토큰당 가격 |
|-|-|
| 캐시 적중 입력 | \$0.0028 |
| 캐시 미스 입력 | \$0.14 |
| 출력 | \$0.28 |
캐시 적중과 캐시 미스 사이의 가격 격차는 엄청납니다:
```Plaintext
$0.14 ÷ $0.0028 = 50
캐시된 입력은 캐시되지 않은 입력보다 50배 저렴합니다.
장기 실행 에이전트의 경우 프롬프트 구조가 비용 구조가 됩니다.
비용 계산 예시
한 요청이 다음을 사용한다고 가정합니다:
캐시되지 않은 입력 토큰 100,000개
출력 토큰 20,000개
직접 모델 비용은 다음과 같습니다:
입력:
100,000 / 1,000,000 × $0.14
= $0.014
출력:
20,000 / 1,000,000 × $0.28
= $0.0056
총계:
$0.0196
이는 2센트 미만입니다.
이제 동일한 100,000토큰 프리픽스가 캐시되었다고 가정합니다:
캐시된 입력:
100,000 / 1,000,000 × $0.0028
= $0.00028
출력:
20,000 / 1,000,000 × $0.28
= $0.0056
총계:
$0.00588
이제 출력이 비용의 대부분을 차지합니다.
이 예시들은 저비용 코딩 프로토타입이 현실적 이유를 설명합니다.
여기에는 다음이 포함되지 않습니다:
- 제공업체 마크업.
- 도구 API 요금.
- 브라우저 또는 검색 비용.
- 샌드박스 컴퓨트.
- 스토리지.
- 반복된 실패 시도.
- 인간 개발 시간.
에이전트 비용이 여전히 커질 수 있는 이유
에이전틱 코딩은 단일 요청인 경우가 드뭅니다.
일반적인 워크플로는 다음을 포함할 수 있습니다:
- 저장소를 읽습니다.
- 관련 코드를 검색합니다.
- 변경을 계획합니다.
- 여러 파일을 편집합니다.
- 테스트를 실행합니다.
- 결과를 검사합니다.
failure.
7. 다시 편집합니다.
8. 테스트를 다시 실행합니다.
9. 변경 사항(diff)을 검토합니다.
10. 최종 답변을 작성합니다.
각 단계는 또 다른 모델 호출을 생성할 수 있습니다.
겉보기에 작은 작업도 다음과 같은 경우 비용이 많이 들 수 있습니다:
- 저장소 컨텍스트가 반복적으로 캐시되지 않는 경우.
- 모델이 긴 추론 과정을 생성하는 경우.
- 테스트가 여러 번 실패하는 경우.
- 에이전트가 불필요하게 큰 파일을 읽는 경우.
- 여러 병렬 에이전트가 작업을 중복 수행하는 경우.
- 컨텍스트 압축으로 인해 중요한 정보가 다시 전송되는 경우.
- 모델이 좋은 해결책에 도달한 후에도 멈추지 않는 경우.
V4 Flash는 이러한 실수의 비용을 줄입니다.
하지만 완전히 제거하지는 않습니다.
컨텍스트 캐싱이 주요 비용 요소입니다
DeepSeek는 디스크 기반 컨텍스트 캐싱을 사용합니다.
동일한 접두사가 재사용되면 일치하는 입력 토큰은 더 낮은 캐시 적중 가격을 받을 수 있습니다.
안정적인 접두사에 적합한 항목은 다음과 같습니다:
- 시스템 지침.
- 저장소 정책.
- 도구 정의.
- 긴 참조 문서.
- 변경되지 않은 프로젝트 스냅샷.
- 반복되는 기업 컨텍스트.
간소화된 프롬프트 설계는 다음과 같습니다:
안정적인 재사용 가능한 접두사
+
새로운 사용자 요청
+
최신 도구 결과
캐시 친화적이지 않은 설계는 다음과 같습니다:
순서가 변경된 지침
+
다시 작성된 저장소 요약
+
변경되는 타임스탬프
+
임의의 요청 메타데이터
+
새로운 사용자 요청
작은 접두사 변경만으로도 캐시 재사용이 줄어들 수 있습니다.
개발자는 긴 프롬프트가 캐시되었다고 가정하지 말고 토큰 사용량 필드를 확인해야 합니다.
DeepSeek는 또한 개인정보 보호와 스케줄링을 위해 user_id 격리를 제공합니다. 캐시 재사용과 사용자 격리는 한 고객의 컨텍스트가 다른 고객의 컨텍스트와 실수로 혼합되지 않도록 함께 설계되어야 합니다.
API 빠른 시작
공식 기본 URL은 다음과 같습니다:
https://api.deepseek.com
모델 ID는 다음과 같습니다:
deepseek-v4-flash
DeepSeek는 안정적인 API ID가 최신 공식 Flash 버전을 자동으로 제공한다고 밝혔습니다.
편리한 점이지만, 안정적인 ID 뒤의 동작이 업그레이드될 수 있으므로 프로덕션 팀은 반환된 모델 지문을 기록하고 변경 사항을 테스트해야 합니다.
Python 예시
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{
"role": "user",
"content": "Review this function and propose a safe refactor.",
}
],
)
print(response.choices[0].message.content)
cURL 예시
몇 분 만에 쇼케이스 사이트를 만들고 리드를 늘리세요
아이디어를 한 문장으로 입력하면 We0 AI가 쇼케이스 사이트, 페이지, CMS를 생성하고 출시 후 고객과 트래픽 확보를 돕습니다.
무료 등록을 위한 하나의 완전한 프로젝트 생성
하나의 완전한 생성 흐름을 시도하고 첫 번째 프로젝트 초안을 빠르게 보는 데 가장 적합합니다.
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{
"role": "user",
"content": "Write a small Python CLI that validates JSON files."
}
]
}'
개발자는 엔드포인트와 SDK 버전에서 지원하는 정확한 reasoning-effort 및 thinking-mode 필드를 확인하기 위해 실시간 API 참조 문서를 확인해야 합니다.
사고 기록(Thinking History)은 보존되어야 합니다
DeepSeek의 thinking-mode 문서에 따르면 턴에 도구 호출이 포함된 경우, 어시스턴트 메시지의 reasoning_content는 후속 요청에 다시 전달되어야 합니다.
다중 턴 에이전트는 다음을 보존해야 합니다:
content
reasoning_content
tool_calls
추론 상태를 삭제하면 연속성이 저하되거나 요청 검증 문제가 발생할 수 있습니다.
이는 특히 공급업체 고유의 추론 필드를 일반적으로 무시하는 OpenAI 호환 클라이언트를 통해 통합할 때 중요합니다.
OpenAI, Anthropic 및 Responses 호환성
DeepSeek는 둘 이상의 인터페이스를 제공합니다.
OpenAI Chat Completions
표준 DeepSeek 기본 URL과 모델 ID를 사용하세요:
deepseek-v4-flash
Anthropic 호환 API
DeepSeek는 또한 Anthropic 형식의 인터페이스를 문서화합니다.
이는 Claude 스타일 메시지를 중심으로 구축된 소프트웨어가 애플리케이션 변경을 줄이면서 DeepSeek에 연결하는 데 도움이 될 수 있습니다.
호환성이 동일한 동작을 보장하지는 않습니다.
공급업체 고유 필드, 추론 기록, 도구 스키마, 안전 동작 및 오류 처리는 여전히 테스트가 필요합니다.
Responses API
DeepSeek는 0731 릴리스가 Responses API 형식을 기본적으로 지원하며 Codex 스타일 사용에 맞게 조정되었다고 밝혔습니다.
이는 상태 저장 응답 객체, 도구 호출 및 구조화된 에이전트 루프에 점점 더 의존하는 코딩 에이전트 제품에 중요합니다.
MIT 라이선스의 오픈 가중치
DeepSeek는 V4 Flash 0731 가중치를 Hugging Face에 MIT 라이선스로 공개했습니다.
이를 통해 개발자는 라이선스 조건에 따라 모델을 검사, 수정, 배포 및 재배포할 수 있습니다.
오픈 가중치 릴리스는 API 전용 모델보다 더 많은 제어를 제공합니다.
팀은 다음을 수행할 수 있습니다:
- 프라이빗 인프라에서 모델 실행
- 아키텍처 연구
- 양자화 변형 구축
- 추론 커널 적용
- 미세 조정 또는 전문화
- 내부 시스템에 통합
- 민감한 코드를 제3자 API로 보내지 않기
실질적인 장벽은 하드웨어입니다.
"오픈 가중치"가 "일반 노트북에서 실행된다"는 의미는 아닙니다.
vLLM 배포
공식 0731 모델 카드는 단일 4×GB300 노드에 대한 vLLM 예제를 제공합니다:
vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \
--trust-remote-code \
--kv-cache-dtype fp8 \
--block-size 256 \
--data-parallel-size 4 \
--enable-expert-parallel \
--moe-backend deep_gemm_mega_moe \
--attention-config '{"use_fp4_indexer_cache": true}' \
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
이 예제는 전체 품질 서빙에 기대되는 인프라 수준을 보여줍니다.
이는 지원되는 유일한 구성으로 해석되어서는 안 됩니다.
vLLM 레시피는 시간이 지남에 따라 다른 GPU 토폴로지에 대한 지원을 추가할 수 있습니다.
SGLang 배포
공식 SGLang 예제는 다음과 같습니다:
sglang serve \
--trust-remote-code \
--model-path deepseek-ai/DeepSeek-V4-Flash-0731 \
--tp 4 \
--moe-runner-backend flashinfer_mxfp4 \
--speculative-algorithm DSPARK \
--mem-fraction-static 0.90 \
--chunked-prefill-size 4096 \
--swa-full-tokens-ratio 0.1
대상 및 초안 가중치는 동일한 체크포인트에서 제공되므로 문서에서는 별도의 스펙큘레이티브 초안 모델 경로를 설정하지 말라고 안내합니다.
추론 엔진은 빠르게 발전합니다.
Preview 릴리스의 이전 실행 명령을 복사하는 대신 현재 모델 카드와 서빙 엔진 레시피를 사용하세요.
로컬 배포는 여전히 인프라 프로젝트입니다
비록 약
13B 파라미터가 토큰에 활성화되면 전체 모델 가중치가 서빙 시스템 전반에 걸쳐 유지되어야 합니다.
배포 계획 시 다음 사항을 고려해야 합니다:
- 전체 모델 저장 공간.
- GPU 메모리.
- 전문가 병렬 처리.
- 인터커넥트 대역폭.
- 긴 컨텍스트 KV 캐시.
- 양자화 지원.
- DSpark 커널.
- 배치 크기.
- 동시성.
- 프리필 지연 시간.
- 디코드 처리량.
더 작은 양자화는 다양한 하드웨어에서 실험을 가능하게 할 수 있지만, 품질, 속도 또는 지원되는 컨텍스트 길이가 변경될 수 있습니다.
대부분의 개인 개발자에게는 직접 API 또는 호스팅 제공업체가 자체 호스팅보다 더 쉽고 저렴합니다.
공식 API 대 타사 제공업체
V4 Flash를 사용하는 방법에는 세 가지 일반적인 방식이 있습니다.
| 경로 | 주요 장점 | 주요 단점 |
|---|---|---|
| DeepSeek API | 공식 가격 및 최신 공식 모델 | 데이터가 환경 외부로 전송됨, 안정적인 ID가 업데이트될 수 있음 |
| 타사 플랫폼 | 무료 할당량, 통합 에이전트, 간편한 결제 | 프로모션 및 라우팅이 변경될 수 있음 |
| 자체 호스팅 가중치 | 최대한의 통제권과 프라이버시 | 상당한 하드웨어 및 엔지니어링 요구 사항 |
가장 저렴한 경로는 작업 부하에 따라 달라집니다.
무료 Cline 또는 OpenCode 할당량은 실험에 가장 적합할 수 있습니다.
직접 API는 예측 가능한 소규모 사용에 가장 적합할 수 있습니다.
자체 호스팅은 충분히 높고 지속적인 볼륨이 있거나 프라이버시 요구 사항이 우선일 때만 매력적일 수 있습니다.
프로토타이핑의 최적기
원문 기사는 저렴한 AI를 자동차의 대량 생산과 비교합니다.
이 비유는 완벽하지 않지만 유용합니다.
기술이 획기적으로 저렴해지면 시장은 단순히 같은 양을 더 적은 비용으로 구매하지 않습니다.
새로운 용도가 가능해집니다.
저비용 에이전트 모델은 이전에는 테스트 전에 거부되었을 실험을 지원할 수 있습니다.
예를 들면:
- 첫 소프트웨어 프로토타입을 만드는 학생.
- 여러 랜딩 페이지 아이디어를 생성하고 테스트하는 개인 창업가.
- 모든 풀 리퀘스트에 코드 리뷰를 실행하는 소규모 팀.
- 무료 이슈 트리아지를 제공하는 오픈소스 프로젝트.
- 대규모 코드 또는 문서 컬렉션을 처리하는 연구자.
- 반복 작업을 위한 내부 에이전트를 만드는 회사.
- 생성된 메커니즘과 레벨을 테스트하는 게임 개발자.
가치의 핵심은 모델이 모든 소프트웨어 엔지니어링을 대체한다는 것이 아닙니다.
다음 질문의 비용을 낮춥니다:
이 아이디어를 더 발전시킬 가치가 있는가?
프로토타입은 제품이 아님
저렴한 생성은 설득력 있는 첫 데모를 만들 수 있습니다.
프로덕션 제품에는 여전히 다음이 필요합니다:
- 제품 디자인.
- 보안.
- 테스트.
- 접근성.
- 성능.
- 모니터링.
- 배포.
- 데이터 보호.
- 법무 검토.
- 유지보수.
- 고객 지원.
7센트 모델 비용이 7센트 사업을 의미하지는 않습니다.
이는 첫 컴퓨팅 실험이 시도할 만큼 저렴해질 수 있음을 의미합니다.
그것은 참여할 수 있는 사람과 테스트할 수 있는 아이디어의 수를 바꿉니다.
커뮤니티 구축 작업공간의 예
원문 기사에는 저렴한 코딩 에이전트로 개발자들이 구축하고 있던 예로 가벼운 문서 작업공간이 포함되어 있습니다.

스크린샷만으로는 애플리케이션 중 얼마나 많은 부분이 모델에 의해 생성되었는지, 얼마나 많은 인간의 편집이 필요했는지, 또는 제품이 안전하고 유지보수가 가능한지 확인할 수 없습니다.
다만 저비용 코딩 모델이 프로토타입 제작을 더 쉽게 만드는 프로젝트의 유형을 보여줍니다.
V4 Flash가 가장 적합한 위치
V4 Flash 0731은 다음과 같은 경우에 특히 매력적입니다:
- 작업이 코드 또는 도구 중심인 경우
- 비용이 중요한 요소인 경우
- 대규모 컨텍스트가 유용한 경우
- 높은 요청 볼륨이 예상되는 경우
- 워크플로우가 출력을 검증할 수 있는 경우
- 가끔 재시도가 허용되는 경우
- 어려운 경우에 사용할 더 큰 폴백 모델이 있는 경우
다음과 같은 경우에는 적합하지 않을 수 있습니다:
- 개방형 세계의 사실 정확성이 중요한 경우
- 비용보다 완성도 높은 첫 답변이 더 중요한 경우
- 이미지 이해가 필요한 작업인 경우
- 조직이 생성된 코드를 검증할 수 없는 경우
- 관리형 규정 준수 보장이 필요한 경우
- 워크플로우가 안정적인 버전 고정 API 동작에 의존하는 경우
모델 라우터는 Flash를 더 강력하거나 더 전문화된 시스템과 결합할 수 있습니다.
예를 들어:
일상적인 저장소 편집
→ V4 Flash
고위험 아키텍처 또는 보안 결정
→ 더 강력한 모델 + 인간 검토
저비용 모델이 에이전트 아키텍처를 바꾼다
모델 호출 비용이 비쌀 때 개발자는 모든 요청을 최소화하려고 합니다.
호출 비용이 저렴해지면 에이전트는 다음을 수행할 수 있습니다:
- 다른 모델에게 패치를 검토하도록 요청
- 별도의 테스트 분석 패스를 실행
- 여러 후보 솔루션 생성
- 대체 구현 방식 비교
- 계획에는 한 모델, 실행에는 다른 모델 사용
- 제출 전에 작업을 재확인
이를 통해 신뢰성이 향상될 수 있습니다.
토큰을 낭비할 수도 있습니다.
올바른 목표는 최소 토큰 사용이 아닙니다.
목표는 다음과 같습니다:
요구 품질에 도달하는 최저 총비용
가격 이야기 뒤에 숨은 주요 위험
- 공개 베타는 변경될 수 있음
DeepSeek는 공식 Flash API를 공개 베타로 설명합니다.
가격, 동작, 제한 및 모델 버전이 변경될 수 있습니다.
프로덕션 팀은 회귀 테스트를 유지해야 합니다.
- 벤치마크 점수는 DeepSeek 하니스에 의존함
가장 강력한 코드 에이전트 결과는 미공개 하니스 구성을 사용합니다.
정확한 독립적 재현은 아직 간단하지 않습니다.
- 저렴한 입력이 저렴한 에이전트를 보장하지 않음
출력, 재시도, 도구 및 캐시되지 않은 컨텍스트가 최종 비용을 좌우할 수 있습니다.
- 긴 컨텍스트는 무료가 아님
100만 토큰 창은 용량 제한이지, 모든 요청에 100만 토큰을 보내라는 권장사항이 아닙니다.
대규모 프리필 워크로드는 지연 시간과 비용을 증가시킵니다.
- 개방형 세계 신뢰성은 여전히 개선 필요
독립 평가에 따르면 가치와 코딩 강점이 사실 테스트에서 높은 환각률과 공존할 수 있습니다.
중요한 사실은 출처와 대조하여 확인해야 합니다.
- 생성된 코드는 검토가 필요함
저비용 모델은 팀이 안전하게 검사할 수 있는 것보다 더 많은 코드를 생성할 수 있습니다.
자동화된 테스트, 정적 분석, 의존성 스캔 및 인간 검토는 여전히 필요합니다.
- 프로모션 액세스는 일시적임
서드파티 무료 모델과 할인은 사라질 수 있습니다.
7일 또는 기간 한정 보조금을 중심으로 영구적인 비즈니스 모델을 구축하지 마십시오.
- 안정적인 API ID가 업그레이드를 숨길 수 있음
deepseek-v4-flash 모델 ID는 현재 버전을 가리킵니다.
해당 ID 뒤의 업그레이드는 애플리케이션의 코드 변경 없이 출력을 바꿀 수 있습니다.
실용적인 비용 관리 체크리스트
- 재사용 가능한 접두사 안정화
시스템 지침과 도구 정의를 일관되게 유지하여 캐시 재사용을 개선하십시오.
- 캐시 적중 토큰을 별도로 추적
총 입력 토큰에만 의존하지 마십시오.
- 불필요한 출력 제한
작업에 현실적인 출력 예산을 설정하십시오.
- 일상적인 작업에는 낮은 추론 수준 사용
더 긴 숙고가 필요한 작업에 max를 아껴 쓰십시오.
- 에이전트 단계 수 제한
진전이 없는 루프를 중단하십시오.
- 다른 모델 호출 전에 저비용 검증 실행
린터, 테스트, 스키마 검증기 및 결정적 검사를 사용하십시오.
- 어려운 사례는 라우팅
테스트에 실패하거나 위험 임계값을 초과할 때만 에스컬레이션하십시오.
- 승인된 결과당 비용 측정
실패한 시도와 인간 검토를 포함하십시오.
한 가지 더: DeepSeek Harness
원문은 DeepSeek 개발자 생태계의 가능한 다음 단계로 끝납니다.
소스에서 DeepSeek Harness를 담당하는 사람으로 식별된 Tianyi Cui는 오픈소스 에이전트 하네스 프로젝트 개발자 모집 메시지를 게시했습니다.
해당 메시지는 관심 있는 개발자에게 GitHub 계정과 대표 오픈소스 작업을 공유하여 내부 테스트에 참여하도록 초대했습니다.

DeepSeek의 7월 31일 변경 로그에도 벤치마크 평가에 사용되는 DeepSeek Harness의 최소 모드가 "곧 공개 예정"이라고 명시되어 있습니다.
확인 시점 기준으로 다음 항목을 찾을 수 없었습니다:
- 공식 공개 DeepSeek Harness 저장소
- "DeepSeek Code"의 안정적인 제품 페이지
- 공개 설치 지침
- 가격 정책
- 출시일
- 완전한 기능 사양
증거는 다음의 좁은 결론을 지지합니다:
DeepSeek는 에이전트 하네스를 테스트 중이며 프레임워크의 최소 일부를 공개할 의도가 있지만, 최종 제품명, 공개 범위, 출시 시점은 여전히 확인되지 않았습니다.
모델, API, 공개 가중치는 현재 사용 가능합니다.
하네스는 여전히 미래의 생태계 구성 요소입니다.
DeepSeek Harness가 중요한 이유
퍼스트파티 하네스는 DeepSeek가 전체 코딩 에이전트 스택을 제어하는 데 도움이 될 수 있습니다.
다음을 제공할 수 있습니다:
- 네이티브 추론 이력 처리
- 모델별 프롬프트 형식
- 도구 호출 파싱
- 컨텍스트 관리
- 저장소 검색
- 터미널 실행
- 벤치마크 재현성
- Responses API 통합
- Codex 호환 워크플로우
- 비용 관리
- Flash와 Pro 간 자동 라우팅
DeepSeek는 이미 외부 하네스 및 코딩 에이전트와의 통합을 문서화하고 있습니다.
자사 도구는 벤치마크 특화 최적화를 일반 개발자도 사용할 수 있는 제품으로 전환할 수 있다.
또한 V4 Flash 0731의 벤치마크 상승분 중 얼마나 많은 부분이 체크포인트에서 비롯되었고, 얼마나 많은 부분이 에이전트 런타임에서 비롯되었는지도 밝혀낼 수 있다.
다음 주목 포인트
V4 Flash의 모멘텀이 지속적인 생태계 변화로 이어질지 여부는 여러 개발 사항에 달려 있다.
공식 V4 Pro 출시
DeepSeek는 공식 V4 Pro 출시가 Flash 업데이트 이후에 이어질 것이라고 밝혔다.
Pro와 Flash 간의 성능 및 가격 격차는 라우팅 결정에 영향을 미칠 것이다.
DeepSeek Harness 공개
공개 배포는 벤치마크 재현성을 개선하고 개발자에게 모델 네이티브 에이전트 프레임워크를 제공할 것이다.
가격 안정성
직접 가격은 이미 낮지만, 서드파티 프로모션은 지속되지 않을 수 있다.
공급업체 용량
저렴한 추론은 매우 높은 트래픽을 유인한다.
지연 시간, 요청 속도 제한, 안정성은 사용량이 확장됨에 따라 중요해질 것이다.
오픈소스 추론 지원
vLLM, SGLang, 하드웨어 공급업체, 양자화 프로젝트가 자체 호스팅의 접근성을 결정할 것이다.
독립적 평가
더 많은 공개 평가가 다음을 테스트해야 한다:
- 코딩.
- 보안.
- 사실적 신뢰성.
- 긴 컨텍스트.
- 도구 사용.
- 성공적 작업당 비용.
- 다양한 하네스에서의 성능.
자주 묻는 질문
DeepSeek V4 Flash 0731이란 무엇인가?
DeepSeek V4 Flash 0731은 V4 Flash의 공식 7월 31일 출시 버전으로, 현재 공개 베타에서 deepseek-v4-flash API를 통해 제공된다. DeepSeek는 Preview 모델의 기본 아키텍처와 크기를 유지하면서 새로운 사후 학습을 통해 에이전트 성능을 대폭 개선했다고 밝혔다.
DeepSeek V4 Flash 비용은 얼마인가?
DeepSeek 공식 API는 캐시 미스 입력 토큰 100만 개당 0.14달러, 캐시 히트 입력 토큰 100만 개당 0.0028달러, 출력 토큰 100만 개당 0.28달러를 책정하고 있다. 서드파티 플랫폼은 다른 가격, 무료 할당량, 또는 한시적 할인을 제공할 수 있다.
3D 게임 생성 비용이 정말 0.07위안뿐인가?
출처 기사는 해당 모델 비용이 보고된 커뮤니티 사례를 인용한다. 해당 사례에는 완전한 프롬프트, 토큰 로그, 캐시 데이터, 재시도, 도구 비용, 또는 인적 작업 기록이 포함되어 있지 않으므로 보장된 예산이 아닌 일화로 취급해야 한다.
주요 V4 Flash 0731 벤치마크 점수는 무엇인가?
DeepSeek는 Terminal Bench 2.1에서 82.7, CyberGym에서 76.7, DeepSWE에서 54.4, Toolathlon-Verified에서 70.3, NL2Repo에서 54.2를 보고한다. 공개 코드 에이전트 평가는 최대 추론 노력으로 미공개 최소 모드의 DeepSeek Harness를 사용했다.
DeepSeek V4 Flash 0731은 오픈소스인가?
모델 가중치와 저장소는 MIT 라이선스로 배포되므로 "오픈 가중치" 및 광범위한 허용적 사용은 정확한 설명이다. 완전한 체크포인트를 실행하려면 여전히 상당한 멀티 GPU 인프라가 필요하다.
DeepSeek V4 Flash를 로컬에서 실행할 수 있나?
예, DeepSeek는 vLLM 및 SGLang에 대한 가중치와 서빙 지침을 게시한다. 공식 풀스케일 예시는 고급 멀티 GPU 하드웨어를 사용하므로 일반 노트북은 완전한 모델의 대상 환경이 아니다.
컨텍스트 창은 무엇인가?
공식 API와 모델 카드는 100만 토큰 컨텍스트 창을 명시한다. API는 또한 다음을 나열한다.
최대 출력 길이는 384K 토큰이지만, 최대 컨텍스트 또는 출력을 사용하면 지연 시간과 리소스 사용량이 크게 증가할 수 있습니다.
DeepSeek Code 또는 DeepSeek Harness가 공개되었나요?
DeepSeek는 Harness 최소 모드를 공개적으로 언급했으며 내부 테스트를 위해 오픈소스 하네스 개발자를 모집했습니다. 검증 과정에서 완전한 공개 저장소, 최종 제품 사양, 확정된 출시 날짜는 확인되지 않았습니다.
관련 도구
- DeepSeek API: API 키, 결제, DeepSeek 모델 직접 액세스를 위한 공식 플랫폼입니다.
- Hugging Face의 DeepSeek V4 Flash 0731: 공식 오픈 가중치 체크포인트, 모델 카드, 벤치마크 표, 라이선스, 배포 지침을 제공합니다.
- vLLM: DeepSeek V4 및 DSpark를 지원하는 오픈소스 고처리량 서빙 엔진입니다.
- SGLang: V4 Flash 0731 배포 경로가 공개된 오픈소스 서빙 프레임워크입니다.
- OpenCode: Zen 서비스에서 현재 기간 한정 무료 V4 Flash 옵션을 제공하는 오픈소스 코딩 에이전트입니다.
- Cline: 제공업체 생태계를 통해 DeepSeek V4 Flash를 제공하는 오픈소스 코딩 에이전트이자 모델 플랫폼입니다.
- Nous Portal: 제한된 DeepSeek V4 Flash 프로모션을 진행한 멀티모델 추론 플랫폼입니다.
- Artificial Analysis: 지능, 속도, 가격, 벤치마크 비용을 다루는 독립적인 모델 분석 플랫폼입니다.
관련 링크
- DeepSeek 7월 31일 변경 로그: 공식 출시 상태, 벤치마크 결과, 방법론 메모, API 범위, 사후 학습 성명을 제공합니다.
- DeepSeek 모델 및 가격: 현재 공식 가격, 컨텍스트 길이, 출력 제한, 기능, 동시성을 제공합니다.
- DeepSeek V4 Flash 0731 모델 카드: 아키텍처 노트, 벤치마크 비교, 추론 노력 수준, DSpark 구성, MIT 라이선스를 제공합니다.
- DeepSeek V4 기술 모델 카드: 원래 V4 아키텍처, 파라미터 수, 기술 보고서, 모델 계열 평가를 제공합니다.
- DeepSeek 사고 모드 가이드: 추론 출력 및 도구 호출 간
reasoning_content유지에 대한 공식 지침입니다. - DeepSeek 에이전트 통합: V4 Flash를 터미널 코딩 하네스에 연결하는 공식 예시입니다.
- OpenCode Zen 모델: 현재 모델 카탈로그 및 기간 한정 무료 모델 정보를 제공합니다.
- Artificial Analysis V4 Flash 0731 평가: 독립적인 종합 점수, 가격, 에이전트 평가, 신뢰성 관찰 결과를 제공합니다.
요약
DeepSeek V4 Flash 0731은 Preview 모델의 기본
아키텍처와 크기는 동일하지만 새로운 포스트 트레이닝을 통해 코딩 에이전트 성능에서 큰 도약을 만들어냈다. DeepSeek는 Terminal Bench 2.1에서 82.7, CyberGym에서 76.7, DeepSWE에서 54.4를 기록했지만, 가장 강력한 공개 코드 에이전트 결과는 공개되지 않은 DeepSeek Harness 구성에 의존한다.
공식 API 가격은 unusually 낮다: 캐시되지 않은 입력 토큰 100만 개당 $0.14, 캐시된 입력 토큰 100만 개당 $0.0028, 출력 토큰 100만 개당 $0.28이다. 타사 무료 할당량과 할인 혜택으로 접근 비용을 더 낮출 수 있지만, 이러한 프로모션은 일시적이며 영구적인 정가와 혼동해서는 안 된다.
오픈 가중치 MIT 라이선스, 100만 토큰 컨텍스트, Responses 및 Anthropic 호환 API, vLLM과 SGLang 지원 덕분에 이 모델은 호스팅 및 자체 관리 경로 모두에서 접근할 수 있다. 완전한 로컬 배포는 여전히 상당한 멀티 GPU 인프라 프로젝트다.
화제가 된 7센트 및 50센트 프로토타입은 한계 모델 비용이 얼마나 낮아질 수 있는지 보여주는 그럴듯한 예시이지만, 완전한 제품 비용 연구는 아니다. 에이전트 루프, 출력 길이, 캐시 미스, 도구, 테스트, 인간의 작업은 여전히 중요하다.
DeepSeek V4 Flash 0731이 중요한 이유는 모든 애플리케이션의 비용이 이제 몇 센트에 불과하기 때문이 아니라, 유능한 에이전트 코딩이 충분히 저렴해져 훨씬 더 많은 개발자가 의미 있는 규모로 실험할 수 있게 되었기 때문이다.



