はじめに
DeepSeek V4 Flash 0731は、異例の複合的な反応を生み出している。
開発者たちはそのコーディングエージェントスコアに感銘を受けている。
インフラチームは100万トークンのコンテキストと低いアクティブパラメータ数に注目している。
AIプラットフォームは無料利用や積極的な割引を提供している。
そしてソーシャルメディアは、推論費用がドルではなくセント単位で報告されているプロトタイプのスクリーンショットで溢れている。
元記事で最も広く共有された事例は以下の通り:
- 約0.07人民元で生成されたと報告される小型3Dスペースシューティングプロトタイプ。
- 約0.50人民元で制作されたと報告されるカウンターストライク風プロトタイプ。
- 8700万トークンで31.57人民元を示す個人利用ダッシュボード。
- 8月1日にOpenCodeが8兆DeepSeek Flashトークンを報告。
- Clineがモデルの補助コストが予想より安いと判明し、無料枠を増加。
- Nous PortalがV4 Flash 0731を一時的に90%割引。
これらの事例は興奮を捉えているが、いくつかの異なる事柄を混同させる可能性もある:
- DeepSeekの公式API価格。
- キャッシュヒットおよびキャッシュミス時の価格。
- 無料または補助付きのサードパーティアクセス。
- エージェントが行うツール呼び出しの回数。
- 生成される出力と隠れた推論の量。
- モデル単体のコストと完全な製品のコスト。
このモデルは確かに安価である。
しかし、すべてのアプリケーションが7セントで済むという意味ではない。
重要な問いは、あるバイラルデモが正確に再現可能かどうかではない。DeepSeekがベースアーキテクチャを変更せずに、どうやってこれほど大きな能力の飛躍を達成したのか——そして、新しい経済性が開発者にとって何を意味するのか、である。
世界的な割引サイクル
公式API価格は、サードパーティのプロモーションが適用される前からすでに低かった。
DeepSeekは現在、100万トークンあたり以下の価格を掲載している:
| 利用タイプ | DeepSeek V4 Flash価格 |
|---|---|
| 入力、キャッシュヒット | $0.0028 |
| 入力、キャッシュミス | $0.14 |
| 出力 | $0.28 |
APIは以下をサポートしている:
- 100万トークンのコンテキストウィンドウ。
- 最大384K出力トークン。
- 思考モードと非思考モード。
- 0731モデルカードにおける3段階の推論努力レベル:
low、high、max。 - ツール呼び出し。
- JSON出力。
- ベータ版のチャットプレフィックス補完。
- 非思考モードでのFIM補完。
- OpenAI互換のチャット完了。
- Responses API。
- Anthropic互換インターフェース。
- V4 Flashのアカウントあたり公開同時実行制限2,500。
これらの公式価格が基準となる。
その後、プラットフォームは以下を選択できる:
- 価格をそのまま転嫁する。
- マークアップを追加する。
- 利用を補助する。
- 限定無料モデルを提供する。
- モデルをサブスクリプションにバンドルする。
- プロモーションクレジットを適用する。
- トラフィックを別の推論プロバイダーにルーティングする。
これが、ある開発者がDeepSeekの定価を支払い、別の開発者が期間限定で無料で利用できる理由である。
OpenCode、1日で8兆トークンを報告
OpenCodeは、DeepSeek Flashが8月1日に自社プラットフォームを通じて8兆トークンを処理したと公表した。
この投稿は数値を以下のように内訳している:
5兆トークンの無料利用
+
3兆トークン(OpenCode Go経由)

OpenCodeの現在のZenドキュメントには、DeepSeek V4 Flash Freeオプションが期間限定で記載されています。
これは重要な違いです。
8兆トークンという数字は、DeepSeekが全プラットフォームで報告した直接的な利用量ではなく、OpenCodeを通じたトラフィックを指しています。
それでも、低コストのモデルが人気のコーディングエージェントワークフローに組み込まれると、大きな需要を生み出せることを示す強いシグナルです。
Nous Portalが一時的に価格を90%引き下げ
Nous Researchは、Novita Labsと提携し、Nous Portalを通じてDeepSeek V4 Flash 0731を90%割引で提供する7日間のプロモーションを発表しました。

プロモーション投稿では、割引後のコストをClaude Fable 5と比較し、同等のタスクで1000倍以上の価格差があると主張しました。
この比較はいくつかの選択に依存しています:
- どのプロバイダーの価格を使用するか。
- 入力と出力のどちらが支配的か。
- キャッシングが利用可能かどうか。
- どの推論設定が選択されるか。
- 各モデルがタスク完了に必要なトークン数。
- 「同等」を定義するベンチマークまたはワークフロー。
トークンあたりの価格比較は有用ですが、より意味のある指標は次のとおりです:
受理されたタスクあたりの総コスト
高価なトークンを少なく使用するモデルは、繰り返し試行する低価格モデルよりも安価になる可能性があります。
逆に、低価格モデルがタスクを迅速に完了できるほど有能な場合、コスト優位性は非常に大きくなる可能性があります。
Clineが無料枠を3倍に拡大
Clineは当初、コーディングエージェントを通じてDeepSeek V4 Flash 0731の無料利用を発表しました。
その後の公開投稿では、経済的な持続可能性が見込めるため、無料枠が3倍に拡大されたと述べられています。

Clineの現在のモデルカタログとClinePass資料には、DeepSeek V4 Flashが集中コーディングタスク向けの高速でコストパフォーマンスに優れたオプションとして含まれています。
無料枠とモデルの可用性は変更される可能性があるため、ユーザーは古いスクリーンショットに頼るのではなく、ライブのプロバイダーページを確認する必要があります。
より広い教訓はより永続的です。
推論が十分に安価になると、エージェントプラットフォームは無料アクセスを顧客獲得手段として利用でき、コストを吸収することなく実現できます。
プレミアムフロンティアモデルを利用する場合と同じコストが発生します。
コミュニティコストのスクリーンショットには文脈が必要
元の記事には、以下のダッシュボードが含まれています:
- 支出額 31.57元。
- APIリクエスト数 2,282回。
- トークン数 87,027,995。

このスクリーンショットは、有利な使用パターンで開発者が目にする可能性のある規模を示しているため有用です。
ただし、請求額を正確に再構築するのに十分な情報は含まれていません。
欠落している変数には以下が含まれます:
- 入力対出力のトークン比率。
- キャッシュヒット率。
- 各日付で使用されたモデルバージョン。
- 推論努力(Reasoning effort)。
- ツール呼び出し回数。
- 失敗したリクエスト。
- プロモーションクレジット。
- プロバイダー割引。
- すべてのトークンが同じレートで課金されたかどうか。
長い繰り返しのシステムプロンプトは、キャッシュにヒットすると非常に低コストになります。
一度だけ送信される長い固有のプロンプトは、キャッシュミス入力価格で課金されます。
出力もキャッシュされた入力よりもはるかに高価です。
エージェントシステムの場合、これらの違いが最終的な請求額を左右します。
フラッシュブリッツ:7月31日に変わったこと
DeepSeek V4 Previewは2026年4月24日にリリースされました。
ファミリーには以下が含まれていました:
- DeepSeek V4 Pro。
- DeepSeek V4 Flash。
Previewリリースで主要なアーキテクチャが確立されました:
- スパース混合エキスパート(MoE)。
- 100万トークンのコンテキスト。
- 効率的な長文コンテキストアテンション。
- 総容量に対するアクティブパラメータ数の少なさ。
- 思考モードと非思考モード。
- MITライセンスによるオープンウェイト。
V4 Flash Previewは、V4 Proよりも小型で高速、低コストな代替として位置づけられていました。
7月31日のアップデートで、その競争上の位置づけが変わりました。
DeepSeekは、V4 Flash 0731はV4 Flash Previewと同じモデルアーキテクチャとサイズを使用していると述べています。
このアップデートは、新しいポストトレーニングプロセスを実行して生成されました。
簡略化すると:
同じ事前学習済みベースアーキテクチャ
+
新しいポストトレーニングとエージェント最適化
=
はるかに強力なコーディングエージェントの動作
これは、事前学習済みモデルにどれだけの能力が潜在的に残されているかを示すため重要です。
アーキテクチャとパラメータ数が製品のすべてではありません。
ポストトレーニングが、モデルが以下のことをどれだけ効果的に行えるかを決定します:
- ツールの使用。
- マルチステップ作業の計画。
- ターミナルフィードバックの処理。
- エラーからの回復。
- ファイルの書き込みと編集。
- エージェントプロトコルの遵守。
- 推論努力の配分。
- ハーネス内での動作。
ベースアーキテクチャとチェックポイントの詳細
元のV4 Flashモデルカードでは、ベースモデルは次のように説明されています:
| 仕様 | DeepSeek V4 Flash |
|---|---|
| ベースMoE総パラメータ | 284B |
| アクティブパラメータ | 13B |
| コンテキスト長 | 1M |
| ライセンス | MIT |
| 主なモダリティ | テキスト |
| ベース精度 | FP8 / チェックポイントに応じた混合低精度 |
0731モデルカードでは、新リリースがDSparkバリアントと同じ構造を持ち、投機的デコードモジュールが付属していると記載されています。
これが、一部のモデルファイルメタデータに表示される可能性がある理由を説明しています。
284BベースのMoEモデルよりも多い総チェックポイント数です。
最も明確な説明は次のとおりです:
V4 Flashの基盤となるMoEモデルは、総パラメータ数約284B、アクティブパラメータ数13Bのままですが、0731リリースには公開チェックポイントにDSpark投機的デコーディングコンポーネントが追加で含まれています。
DSpark投機的デコーディング
投機的デコーディングは、高速なドラフトプロセスを使用していくつかの将来のトークンを提案します。
その後、メインモデルがそれらの提案を検証します。
予測が受け入れられると、システムはより少ない逐次処理で複数のトークンを生成できます。
DeepSeekの0731モデルカードは、vLLMとSGLang向けの明示的なDSparkサポートを提供しています。
vLLMの場合、関連する設定は次のとおりです:
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
SGLangの場合、モデルカードでは次を使用します:
--speculative-algorithm DSPARK
DSparkは、それ自体でモデルの推論能力を向上させるものではありません。
これは、サポートされている構成下でターゲットモデルの出力分布を維持しながら、デコーディングのレイテンシを削減またはスループットを向上させることを目的とした推論最適化です。
ベンチマークの飛躍
DeepSeekはV4 Flash 0731について次の比較を公開しています:
| ベンチマーク | V4 Flash 0731 | V4 Flash Preview | V4 Pro Preview |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 |
| NL2Repo | 54.2 | 39.4 | 38.5 |
| CyberGym | 76.7 | 38.7 | 52.7 |
| DeepSWE | 54.4 | 7.3 | 12.8 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 |
| Agents' Last Exam | 25.2 | 15.8 | 16.5 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 |
| DSBench-FullStack | 68.7 | 37.0 | 41.8 |
| DSBench-Hard | 59.6 | 25.8 | 31.1 |
最も劇的な増加はDeepSWEです:
7.3 → 54.4
CyberGymはほぼ2倍に:
38.7 → 76.7
Terminal Bench 2.1は20ポイント以上上昇:
61.8 → 82.7
新しいFlashモデルは、DeepSeekが公開した表のすべてのベンチマークでV4 Pro Previewを上回っています。
これは、元々主に低コストで高速なオプションとして位置づけられていたモデルにとって大きな変化です。
ベンチマークの方法論が重要
この表は、単純なチェックポイントの純粋な比較として読むべきではありません。
DeepSeekのモデルカードには、いくつかの重要な注記が含まれています。
公開コードエージェントタスクでは、同社は以下を使用しました:
DeepSeek Harness最小モード
推論努力:最大
温度:1.0
Top-p:0.95
DeepSeek Harnessは、検証時点では公開リリースされていませんでした。
つまり、外部の研究者は、公開されたコードエージェント結果に使用された正確なソフトウェア環境をまだ再現できない可能性があります。
また、2つのテストは内部専用です:
- DSBench-FullStack。
- DSBench-Hard。
内部ベンチマークは製品開発に役立つ可能性がありますが、独立したチームは非表示のタスクや汚染管理を検査できません。
正しい解釈は次のとおりです:
DeepSeekは、選択したエージェントスタックと評価設定の下で大きな改善を報告しています。ハーネス、ログ、完全な評価設定が利用可能になれば、公開での再現性は向上します。
ハーネスの品質がスコアを変える
コーディングベンチマークは、多くの場合、完全なシステムを測定します:
モデル
+
システムプロンプト
+
リポジトリツール
+
ターミナル
execution
+
context management
+
retry policy
+
test feedback
+
patch submission logic
同じモデルでも、ある構成要素が変わるとスコアが変わることがあります。
より優れたハーネス(テスト実行環境)は、以下のことを実現できるかもしれません:
- より関連性の高いファイルを選択する。
- 有用なターミナル出力を保持する。
- コンテキストのオーバーフローを防ぐ。
- 失敗したコマンドをインテリジェントに再試行する。
- 非生産的なループを停止する。
- パッチをより確実に適用する。
- モデルに、より明確なテスト結果を提供する。
これは、モデルが無関係になるという意味ではありません。
ベンチマーク結果は、モデルとハーネスの組み合わせに帰属することを意味します。
強い0731の数値は、DeepSeekがモデルのエージェント動作と、それを取り巻く評価プロセスの両方を改善したことを示唆しています。
Artificial Analysis は50点と評価
Artificial Analysisは、DeepSeek V4 Flash 0731に対し、インテリジェンス・インデックスで約50点というスコアを報告しています。これは、以前のFlashバージョンより約10ポイント高い数値です。
独立系モデル分析会社はまた、V4 Flashが他のよく知られたフロンティアシステムと比較して、例外的に低コストであると述べています。
Reutersは、Artificial Analysisの調査結果を要約し、その方法論による平均ベンチマークテストコストが約3米セントであると報じました。
この比較は、バリュー(費用対効果)の議論を支持するものです。
これは、すべての本番タスクが3セントで済むという意味ではありません。
Artificial Analysisはまた、いくつかの知識信頼性指標において、低い結果も報告しています。
V4 Flash 0731に関する記事では、次のように記されています:
- 全知性(オムニサイエンス)の精度は約37%に留まった。
- 幻覚率は低下したものの、その評価では約84%と依然として高かった。
これらの数字は、有用な注意喚起です。
モデルは、以下のようであり得ます:
- コーディングエージェントとして非常に強力である。
- 極めて安価である。
- 複合インデックスで競争力がある。
- それでも、いくつかのオープンワールドの事実に関する質問には信頼性が低い。
「最高の価値」は、「すべてのタスクに最適」という意味と同じではありません。
公式API価格
DeepSeekの直接API価格は以下の通りです:
| 請求カテゴリ | 100万トークンあたりの価格 |
|---|---|
| キャッシュヒット入力 | $0.0028 |
| キャッシュミス入力 | $0.14 |
| 出力 | $0.28 |
キャッシュヒットとキャッシュミスの価格差は非常に大きいです:
$0.14 ÷ $0.0028 = 50
キャッシュされた入力は、キャッシュされていない入力より50倍安価です。
長時間実行されるエージェントにとって、プロンプト構造はコスト構造そのものになります。
コスト計算の例
1回のリクエストで以下を使用すると仮定します:
キャッシュされていない入力トークン 100,000
出力トークン 20,000
直接モデルコストは:
入力:
100,000 / 1,000,000 × $0.14
= $0.014
出力:
20,000 / 1,000,000 × $0.28
= $0.0056
合計:
$0.0196
これは2米セント未満です。
次に、同じ100,000トークンのプレフィックスがキャッシュされていると仮定します:
キャッシュされた入力:
100,000 / 1,000,000 × $0.0028
= $0.00028
出力:
20,000 / 1,000,000 × $0.28
= $0.0056
合計:
$0.00588
これで、出力が請求額の大部分を占めるようになります。
これらの例は、低コストのコーディングプロトタイプが実現可能である理由を説明しています。
これらには以下は含まれていません:
- プロバイダーのマークアップ。
- ツールAPIの使用料。
- ブラウザまたは検索コスト。
- サンドボックス化されたコンピューティング。
- ストレージ。
- 繰り返される失敗した試行。
- 人間の開発時間。
エージェントの請求額が依然として膨らみ得る理由
エージェント型コーディングは、めったに1回のリクエストでは済みません。
典型的なワークフローには、以下が含まれる場合があります:
- リポジトリを読む。
- 関連コードを検索する。
- 変更を計画する。
- 複数のファイルを編集する。
- テストを実行する。
- 結果を検査する。
失敗。
7. 再度編集する。
8. 再度テストを実行する。
9. 差分を確認する。
10. 最終回答を生成する。
各ステップで別のモデル呼び出しが発生する可能性があります。
一見小さなタスクでも、以下の場合にコストが高くなる可能性があります:
- リポジトリコンテキストが繰り返しキャッシュされない場合。
- モデルが長い推論トレースを生成する場合。
- テストが何度も失敗する場合。
- エージェントが不要に大きなファイルを読み取る場合。
- 複数の並行エージェントが作業を重複させる場合。
- コンテキスト圧縮により重要な情報が再送信される場合。
- モデルが良好な解決策に到達した後も停止しない場合。
V4 Flashはこれらのミスのコストを削減します。
ただし、完全に排除するわけではありません。
コンテキストキャッシングが主なコスト要因
DeepSeekはディスクベースのコンテキストキャッシングを使用しています。
同じプレフィックスが再利用されると、一致する入力トークンは低いキャッシュヒット価格を受け取ることができます。
安定したプレフィックスの良い候補は次のとおりです:
- システム指示。
- リポジトリポリシー。
- ツール定義。
- 長い参照ドキュメント。
- 変更されていないプロジェクトスナップショット。
- 繰り返し使用されるエンタープライズコンテキスト。
簡素化されたプロンプト設計は次のとおりです:
安定した再利用可能なプレフィックス
+
新しいユーザーリクエスト
+
最新のツール結果
キャッシュにあまり適さない設計は次のとおりです:
並べ替えられた指示
+
書き直されたリポジトリ概要
+
変化するタイムスタンプ
+
ランダムなリクエストメタデータ
+
新しいユーザーリクエスト
小さなプレフィックスの変更でもキャッシュ再利用が減少する可能性があります。
開発者は、長いプロンプトがキャッシュされたと想定するのではなく、トークン使用量フィールドを確認する必要があります。
DeepSeekはまた、プライバシーとスケジューリングのためにuser_id分離を提供しています。キャッシュ再利用とユーザー分離は、ある顧客のコンテキストが別の顧客と誤って混ざらないように、一緒に設計する必要があります。
APIクイックスタート
公式のベースURLは引き続き次のとおりです:
https://api.deepseek.com
モデルIDは次のとおりです:
deepseek-v4-flash
DeepSeekによると、安定したAPI IDは自動的に最新の公式Flashバージョンを提供します。
これは便利ですが、本番チームは返されたモデルフィンガープリントを記録し、変更をテストする必要があります。安定したIDの背後にある動作はアップグレードされる可能性があるためです。
Pythonの例
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{
"role": "user",
"content": "この関数をレビューし、安全なリファクタリングを提案してください。",
}
],
)
print(response.choices[0].message.content)
cURLの例
数分で紹介サイトを作り、リード獲得を伸ばす
アイデアを一文で入力するだけで、We0 AI が紹介サイト、ページ、CMS を生成し、公開後の顧客獲得と流入拡大を支援します。
無料登録で完全なプロジェクトを 1 つ生成
1 つの完全な生成フローを試し、最初のプロジェクトのドラフトをすぐに確認するのに最適です。
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{
"role": "user",
"content": "JSONファイルを検証する小さなPython CLIを作成してください。"
}
]
}'
開発者は、エンドポイントとSDKバージョンでサポートされている正確な推論努力フィールドと思考モードフィールドについて、最新のAPIリファレンスを確認する必要があります。
思考履歴は保持する必要があります
DeepSeekの思考モードのドキュメントによると、ターンにツール呼び出しが含まれる場合、アシスタントメッセージのreasoning_contentは後続のリクエストで渡し戻す必要があります。
マルチターンエージェントは以下を保持する必要があります:
content
reasoning_content
tool_calls
推論状態を落とすと、連続性が低下したり、リクエスト検証の問題が発生したりする可能性があります。
これは、プロバイダー固有の推論フィールドを通常無視するOpenAI互換クライアントを介して統合する場合に特に重要です。
OpenAI、Anthropic、およびResponses互換性
DeepSeekは複数のインターフェースを提供しています。
OpenAI Chat Completions
標準のDeepSeekベースURLとモデルIDを使用します。
deepseek-v4-flash
Anthropic互換API
DeepSeekはAnthropic形式のインターフェースも文書化しています。
これにより、Claudeスタイルのメッセージを中心に構築されたソフトウェアが、アプリケーションの変更を減らしてDeepSeekに接続できるようになります。
互換性があっても、動作が同一であることは保証されません。
プロバイダー固有のフィールド、推論履歴、ツールスキーマ、安全性の動作、エラーハンドリングは依然としてテストが必要です。
Responses API
DeepSeekによると、0731リリースはResponses API形式をネイティブにサポートし、Codexスタイルの使用に適応されています。
これは、ステートフルなレスポンスオブジェクト、ツール呼び出し、構造化されたエージェントループにますます依存するコーディングエージェント製品にとって重要です。
MITライセンスに基づくオープンウェイト
DeepSeekは、V4 Flash 0731のウェイトをHugging Face上でMITライセンスに基づき公開しています。
これにより、開発者はライセンス条件に従ってモデルを検査、変更、デプロイ、再配布できます。
オープンウェイトのリリースは、API限定モデルよりも多くの制御を提供します。
チームは以下が可能です:
- プライベートインフラストラクチャでモデルを実行する。
- そのアーキテクチャを研究する。
- 量子化バリアントを構築する。
- 推論カーネルを適応させる。
- ファインチューニングまたは特化させる。
- 内部システムに統合する。
- 機密コードをサードパーティAPIに送信しないようにする。
実際の障壁はハードウェアです。
「オープンウェイト」は「通常のラップトップで動作する」という意味ではありません。
vLLMデプロイメント
公式の0731モデルカードは、単一の4×GB300ノード向けのvLLMの例を提供しています。
vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \
--trust-remote-code \
--kv-cache-dtype fp8 \
--block-size 256 \
--data-parallel-size 4 \
--enable-expert-parallel \
--moe-backend deep_gemm_mega_moe \
--attention-config '{"use_fp4_indexer_cache": true}' \
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
この例は、完全な品質でのサービス提供に期待されるインフラストラクチャクラスを示しています。
これは、サポートされている唯一の構成として解釈されるべきではありません。
vLLMレシピは、時間の経過とともに他のGPUトポロジのサポートを追加する可能性があります。
SGLangデプロイメント
公式のSGLangの例は次のとおりです。
sglang serve \
--trust-remote-code \
--model-path deepseek-ai/DeepSeek-V4-Flash-0731 \
--tp 4 \
--moe-runner-backend flashinfer_mxfp4 \
--speculative-algorithm DSPARK \
--mem-fraction-static 0.90 \
--chunked-prefill-size 4096 \
--swa-full-tokens-ratio 0.1
ターゲットとドラフトのウェイトは同じチェックポイントから取得されるため、ドキュメントには個別の推測ドラフトモデルパスを設定しないように記載されています。
推論エンジンは急速に進化します。
Previewリリースからの古い起動コマンドをコピーするのではなく、現在のモデルカードとサービングエンジンのレシピを使用してください。
ローカルデプロイメントは依然としてインフラストラクチャプロジェクトです
約
13Bパラメータが1トークンに対してアクティブな場合、モデル全体の重みはサービングシステム全体で利用可能な状態を維持する必要があります。
導入計画では、以下を考慮する必要があります:
- モデル全体のストレージ。
- GPUメモリ。
- エキスパート並列処理。
- インターコネクト帯域幅。
- 長文コンテキストのKVキャッシュ。
- 量子化サポート。
- DSparkカーネル。
- バッチサイズ。
- 並行性。
- プリフィル遅延。
- デコードスループット。
より小さな量子化により、異なるハードウェアでの実験が可能になる場合がありますが、品質、速度、またはサポートされるコンテキスト長が変わる可能性があります。
ほとんどの個人開発者にとっては、直接APIまたはホスティングプロバイダーを利用する方が、セルフホスティングよりも簡単で安価です。
公式APIとサードパーティプロバイダー
V4 Flashを利用する一般的な方法は3つあります。
| ルート | 主な利点 | 主なトレードオフ |
|---|---|---|
| DeepSeek API | 公式価格と最新の公式モデル | データが環境外に送信される。安定IDが更新される可能性がある |
| サードパーティプラットフォーム | 無料枠、統合エージェント、簡単な請求 | プロモーションやルーティングが変更される可能性がある |
| セルフホスト重み | 最大の制御とプライバシー | 相当なハードウェアとエンジニアリング要件が必要 |
最も安価なルートはワークロードによって異なります。
無料のClineまたはOpenCode枠は実験に最適かもしれません。
直接APIは予測可能な小規模利用に最適かもしれません。
セルフホスティングは、十分に高く持続的なボリュームがある場合、またはプライバシー要件が優先される場合にのみ魅力的になる可能性があります。
プロトタイピングに最適な時代
元の記事では、安価なAIを自動車の大量生産と比較しています。
この類推は完璧ではありませんが有用です。
テクノロジーが劇的に安価になると、市場は単に同じ量をより少ない費用で購入するわけではありません。
新しい用途が可能になります。
低コストのエージェントモデルは、以前であればテスト前に却下されていたであろう実験をサポートできます。
例としては、以下が挙げられます:
- 初めてのソフトウェアプロトタイプを構築する学生。
- 複数のランディングページのアイデアを生成してテストするソロファウンダー。
- すべてのプルリクエストでコードレビューを実行する小規模チーム。
- 無料の課題トリアージを提供するオープンソースプロジェクト。
- 大規模なコードまたはドキュメントコレクションを処理する研究者。
- 反復作業用の社内エージェントを作成する企業。
- 生成されたメカニクスとレベルをテストするゲーム開発者。
価値は、モデルがすべてのソフトウェアエンジニアリングを置き換えることではありません。
それは、次の質問をするコストを下げるのです:
このアイデアはさらに構築する価値があるか?
プロトタイプは製品ではない
安価な生成は説得力のある最初のデモを生み出すことができます。
本番製品には依然として以下が必要です:
- 製品設計。
- セキュリティ。
- テスト。
- アクセシビリティ。
- パフォーマンス。
- モニタリング。
- デプロイメント。
- データ保護。
- 法務レビュー。
- メンテナンス。
- カスタマーサポート。
7セントのモデル請求額は7セントのビジネスを意味するわけではありません。
それは最初の計算実験が試行するのに十分安価である可能性があることを意味します。
それは参加できる人々とテストできるアイデアの数を変えます。
コミュニティ構築ワークスペースの例
元の記事には、開発者が安価なコーディングエージェントで構築していたものの一例として、軽量なドキュメントワークスペースが含まれています。

スクリーンショットだけでは、アプリケーションのどの程度がモデルによって生成されたのか、どの程度の人間による編集が必要だったのか、製品が安全で保守可能かどうかを判断することはできません。
しかし、低コストのコーディングモデルによってプロトタイプ作成が容易になるプロジェクトの種類を示しています。
V4 Flashが最適な用途
V4 Flash 0731は、以下の場合に特に魅力的です:
- タスクがコード中心またはツール中心である場合
- コストが重視される場合
- 大規模なコンテキストが有用な場合
- 大量のリクエストが予想される場合
- ワークフローが出力を検証できる場合
- たまに再試行が許容される場合
- 困難なケースに対応する、より高性能なフォールバックモデルが利用可能な場合
以下の場合はあまり適さない可能性があります:
- オープンワールドの事実の正確性が重要である場合
- コストよりも洗練された最初の回答が重視される場合
- タスクに画像理解が必要な場合
- 組織が生成されたコードを検証できない場合
- 管理されたコンプライアンス保証が必要な場合
- ワークフローが安定したバージョン固定のAPI動作に依存している場合
モデルルーターを使用すると、Flashをより強力なモデルや専門化されたシステムと組み合わせることができます。
例えば:
日常的なリポジトリ編集
→ V4 Flash
高リスクのアーキテクチャまたはセキュリティ判断
→ より強力なモデル + 人間によるレビュー
低コストモデルがエージェントアーキテクチャを変える
モデル呼び出しが高価な場合、開発者はすべてのリクエストを最小限に抑えようとします。
呼び出しが安価になると、エージェントは以下を行う余裕が生まれます:
- 別のモデルにパッチをレビューしてもらう
- 別途テスト分析パスを実行する
- 複数の候補ソリューションを生成する
- 代替実装を比較する
- プランニングに1つのモデル、実行に別のモデルを使用する
- 送信前に作業を再確認する
これにより信頼性が向上する可能性があります。
また、トークンを無駄にする可能性もあります。
正しい目標はトークン使用量の最小化ではありません。
正しい目標は次のとおりです:
必要な品質に到達するための総コスト最小化
価格の裏にある主なリスク
- パブリックベータは変更される可能性がある
DeepSeekは公式Flash APIをパブリックベータと位置付けています。
価格、動作、制限、モデルバージョンは変更される可能性があります。
本番チームはリグレッションテストを維持すべきです。
- ベンチマークスコアはDeepSeekハーネスに依存する
最も強力なコードエージェントの結果は、未公開のハーネス構成を使用しています。
正確な独立した再現はまだ容易ではありません。
- 安価な入力は安価なエージェントを保証しない
出力、再試行、ツール、キャッシュされていないコンテキストが最終コストを支配する可能性があります。
- 長いコンテキストは無料ではない
100万トークンのウィンドウは容量の限界であり、すべてのリクエストで100万トークンを送信することを推奨するものではありません。
大規模なプリフィルワークロードはレイテンシとコストを増加させます。
- オープンワールドの信頼性はまだ改善が必要
独立した評価では、価値とコーディングの強みが、事実に関するテストでの高い幻覚率と共存できることが示されています。
重要な事実は情報源と照合すべきです。
- 生成されたコードにはレビューが必要
低コストモデルは、チームが安全に検査できる以上のコードを生成する可能性があります。
自動テスト、静的解析、依存関係スキャン、人間によるレビューが引き続き必要です。
- プロモーションアクセスは一時的です
サードパーティの無料モデルや割引は、突然消えることがあります。
期間限定の補助金や7日間のキャンペーンを前提に、恒久的なビジネスモデルを構築しないでください。
- 安定したAPI IDの裏に隠されたアップグレード
deepseek-v4-flash というモデルIDは、現在のバージョンを指しています。
このIDの背後でアップグレードが行われると、アプリケーション側のコードを変更しなくても、出力内容が変わる可能性があります。
実践的なコスト管理チェックリスト
- 再利用可能なプレフィックスを安定させる
システム指示とツール定義を一貫させ、キャッシュの再利用効率を高めます。
- キャッシュヒットトークンを別途追跡する
総入力トークン数だけに依存しないでください。
- 不要な出力を制限する
タスクに対して現実的な出力予算を設定します。
- 定型業務には低い推論努力レベルを使用する
max は、より長い熟考が有益なタスクのために取っておきます。
- エージェントのステップ数を制限する
進捗のないループを停止します。
- 次のモデル呼び出しの前に、低コストの検証を実行する
リンター、テスト、スキーマバリデーター、決定的チェックを活用します。
- 困難なケースをルーティングする
タスクがテストに失敗した場合や、リスクしきい値を超えた場合にのみ、上位モデルにエスカレーションします。
- 受け入れられた結果あたりのコストを測定する
失敗した試行と人間によるレビューも含めます。
もう一つ: DeepSeek Harnessについて
元の記事は、DeepSeekの開発者エコシステムにおける次のステップの可能性について述べて締めくくられています。
ソースでDeepSeek Harnessの責任者として特定されているTianyi Cui氏は、オープンソースのエージェントハーネスプロジェクトの開発者を募集するメッセージを投稿しました。
そのメッセージでは、関心のある開発者に対し、GitHubアカウントと代表的なオープンソース作品を共有して内部テストに参加するよう呼びかけていました。

DeepSeek自身の7月31日の変更ログにも、ベンチマーク評価に使用されるDeepSeek Harnessの最小モードは「まもなくリリース予定」と記載されています。
検証時点では、以下を見つけることができませんでした:
- DeepSeek Harnessの公開公式リポジトリ。
- 「DeepSeek Code」の安定した製品ページ。
- 公開されたインストール手順。
- 料金体系。
- リリース日。
- 完全な機能仕様。
エビデンスは、このより限定的な結論を支持しています:
DeepSeekはエージェントハーネスをテストしており、フレームワークの少なくとも一部をリリースする意向があるが、最終的な製品名、公開範囲、および発売時期は未確定のままである。
モデル、API、オープンウェイトは現在利用可能です。
ハーネスはまだ将来のエコシステムコンポーネントです。
DeepSeek Harnessが重要になる理由
ファーストパーティ製のハーネスがあれば、DeepSeekはコーディングエージェントスタック全体を制御できる可能性があります。
提供される可能性があるもの:
- ネイティブな推論履歴の処理。
- モデル固有のプロンプト形式。
- ツール呼び出しの解析。
- コンテキスト管理。
- リポジトリ検索。
- ターミナル実行。
- ベンチマークの再現性。
- Responses APIとの統合。
- Codex互換のワークフロー。
- コスト管理。
- FlashとPro間の自動ルーティング。
DeepSeekはすでに、外部ハーネスやコーディングエージェントとの統合をドキュメント化しています。
ファーストパーティ製ツールがあれば、ベンチマーク特化の最適化を、一般の開発者が使える製品に変えられる可能性がある。
また、V4 Flash 0731のベンチマーク向上のうち、どれだけがチェックポイントによるもので、どれだけがエージェントランタイムによるものかを明らかにすることもできる。
次の注目ポイント
以下のいくつかの動向によって、V4 Flashのこの瞬間が、持続的なエコシステムの変革となるかどうかが決まるだろう。
公式V4 Proリリース
DeepSeekは、V4 Proの正式リリースはFlashアップデートに続いて行われると述べている。
ProとFlashの性能差と価格差は、ルーティングの判断に影響を与えるだろう。
DeepSeek Harnessの公開
一般公開されれば、ベンチマークの再現性が向上し、開発者にモデルネイティブなエージェントフレームワークが提供されることになる。
価格の安定性
直接価格はすでに低いが、サードパーティのプロモーションが継続するとは限らない。
プロバイダーの処理能力
安価な推論は非常に多くのトラフィックを引き寄せる。
利用が拡大するにつれ、レイテンシ、レート制限、信頼性が重要になる。
オープンソースの推論サポート
vLLM、SGLang、ハードウェアベンダー、量子化プロジェクトによって、セルフホスティングの導入しやすさが決まるだろう。
独立した評価
より多くの公開評価で、以下をテストすべきだ:
- コーディング。
- セキュリティ。
- 事実の信頼性。
- 長いコンテキスト。
- ツール使用。
- タスク成功あたりのコスト。
- 異なるハーネスでのパフォーマンス。
よくある質問
DeepSeek V4 Flash 0731とは何か?
DeepSeek V4 Flash 0731は、V4 Flashの7月31日付公式リリースであり、現在はパブリックベータ版としてdeepseek-v4-flash APIを通じて提供されている。DeepSeekによると、Previewモデルの基本アーキテクチャとサイズを維持しつつ、新しいポストトレーニングによってエージェント機能を大幅に向上させている。
DeepSeek V4 Flashの価格は?
DeepSeekの公式APIでは、キャッシュミス入力トークン100万件あたり0.14ドル、キャッシュヒット入力トークン100万件あたり0.0028ドル、出力トークン100万件あたり0.28ドルと記載されている。サードパーティのプラットフォームでは、異なる価格、無料枠、期間限定割引が提供される場合がある。
3Dゲームの生成が本当にわずか0.07人民元で済むのか?
元の記事では、報告されたモデルコストでのコミュニティの例を引用している。この例には、完全なプロンプト、トークンログ、キャッシュデータ、リトライ、ツールコスト、人的作業の記録が付随していないため、保証された予算ではなく、逸話として扱うべきである。
V4 Flash 0731の主なベンチマークスコアは?
DeepSeekは、Terminal Bench 2.1で82.7、CyberGymで76.7、DeepSWEで54.4、Toolathlon-Verifiedで70.3、NL2Repoで54.2を報告している。公開されたコードエージェント評価では、未リリースのDeepSeek Harnessのミニマルモードを最大推論努力で使用した。
DeepSeek V4 Flash 0731はオープンソースか?
モデルの重みとリポジトリはMITライセンスの下でリリースされているため、「オープンウェイト」であり、広く寛容な使用が可能であるという表現は正確である。完全なチェックポイントを実行するには、依然として相当なマルチGPUインフラストラクチャが必要である。
DeepSeek V4 Flashはローカルで実行できるか?
はい、DeepSeekはvLLMとSGLang用の重みとサーブ手順を公開している。公式のフルスケールの例では高度なマルチGPUハードウェアを使用しているため、通常のノートパソコンは完全なモデルの対象環境ではない。
コンテキストウィンドウは?
公式APIとモデルカードでは、100万トークンのコンテキストウィンドウが指定されている。APIには、
最大出力長は384Kトークンですが、最大コンテキストまたは出力を使用すると、レイテンシとリソース使用量が大幅に増加する可能性があります。
DeepSeek CodeまたはDeepSeek Harnessはリリースされていますか?
DeepSeekは公開の場でHarness最小モードに言及し、内部テスト用にオープンソースのハーネス開発者を募集しています。検証中に、完全な公開リポジトリ、最終製品仕様書、確定したリリース日は確認できませんでした。
関連ツール
- DeepSeek API:APIキー、課金、DeepSeekモデルへの直接アクセスのための公式プラットフォーム。
- Hugging FaceのDeepSeek V4 Flash 0731:公式のオープンウェイトチェックポイント、モデルカード、ベンチマーク表、ライセンス、デプロイ手順。
- vLLM:DeepSeek V4およびDSparkをサポートするオープンソースの高スループット推論エンジン。
- SGLang:公開されたV4 Flash 0731デプロイパスを持つオープンソースの推論フレームワーク。
- OpenCode:Zenサービスが現在期間限定で無料のV4 Flashオプションを提供しているオープンソースのコーディングエージェント。
- Cline:プロバイダーエコシステムを通じてDeepSeek V4 Flashを提供するオープンソースのコーディングエージェント兼モデルプラットフォーム。
- Nous Portal:限定のDeepSeek V4 Flashプロモーションを実施したマルチモデル推論プラットフォーム。
- Artificial Analysis:インテリジェンス、速度、価格、ベンチマークコストをカバーする独立したモデル分析プラットフォーム。
関連リンク
- DeepSeek 7月31日変更ログ:公式リリース状況、ベンチマーク結果、方法論ノート、API範囲、ポストトレーニングに関する声明。
- DeepSeekモデルと価格:現在の公式価格、コンテキスト長、出力制限、機能、同時実行数。
- DeepSeek V4 Flash 0731モデルカード:アーキテクチャノート、ベンチマーク比較、推論努力レベル、DSpark設定、MITライセンス。
- DeepSeek V4テクニカルモデルカード:元のV4アーキテクチャ、パラメータ数、テクニカルレポート、モデルファミリー評価。
- DeepSeek思考モードガイド:推論出力およびツール呼び出し全体での
reasoning_content保持に関する公式ガイダンス。 - DeepSeekエージェント統合:V4 Flashをターミナルコーディングハーネスに接続するための公式例。
- OpenCode Zenモデル:現在のモデルカタログと期間限定無料モデル情報。
- Artificial Analysis V4 Flash 0731評価:独立した複合スコア、価格、エージェント評価、信頼性に関する観察結果。
まとめ
DeepSeek V4 Flash 0731は、Previewモデルのベースを維持しています。
アーキテクチャとサイズは踏襲しつつ、新しいポストトレーニングを採用することで、コーディングエージェントの性能を大幅に引き上げた。DeepSeekはTerminal Bench 2.1で82.7、CyberGymで76.7、DeepSWEで54.4を報告しているが、最も強力な公開コードエージェントの成果は未公開のDeepSeek Harness設定に依存している。
公式API価格は異例なほど低い。非キャッシュ入力トークン100万件あたり0.14ドル、キャッシュ入力トークン100万件あたり0.0028ドル、出力トークン100万件あたり0.28ドルである。第三者による無料枠や割引でさらに安価に利用できる場合もあるが、それらのプロモーションは一時的なものであり、恒久的な定価と混同すべきではない。
オープンウェイトのMITライセンスでの公開、100万トークンのコンテキスト、ResponsesおよびAnthropic互換API、さらにvLLMとSGLangでのサポートにより、ホスティング型・自家運用型のいずれの経路でもモデルを利用できる。完全なローカル展開は依然として本格的なマルチGPUインフラプロジェクトである。
話題となった7セントや50セントのプロトタイプは、限界モデル費用がどこまで下がり得るかを示す説得力のある例だが、完全な製品コスト分析ではない。エージェントのループ、出力長、キャッシュミス、ツール、テスト、人的作業は依然として重要である。
DeepSeek V4 Flash 0731が重要なのは、あらゆるアプリケーションの費用が数セントになったからではなく、高性能なエージェント型コーディングが十分に低コスト化され、より多くの開発者が有意義な規模で実験できるようになったからである。



