For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/ja/articles/claude-haiku-5-vs-gpt-6-luna-benchmarks-p-ec36c306.md.
Anthropicは**Claude Haiku 5.5**をリリースしました。これは通常の小型モデル刷新ではありません。

AnthropicはClaude Haiku 5.5をリリースしました。これは通常の小型モデル刷新ではありません。
新しいHaikuは、コンピューター操作、コーディング、専門業務、ツールを多用するエージェントタスクにおいてHaiku 4.5を大きく上回る一方、APIの表示価格を大幅に引き下げています。
Anthropic自身による公開時の比較では、Haiku 5.5はGDPval-AA v2.1、OSWorld 2.1、Terminal-Bench 4.0、FrontierCode 1.1、Chartographyなど、複数のベンチマーク項目でGPT-6 Lunaも上回っています。
そのため、Haiku 5.5は次のような高ボリュームのワークロードにおける有力な新しい選択肢です。
ただし、今回のリリースには重要な注意点もあります。
料金は10万トークンのプロンプト境界で変わり、同じテキストに対してより多くのトークンを使用する新しいトークナイザーが採用されています。また、既存のHaiku 4.5統合をアップグレードするには、複数のAPI変更が必要です。

AnthropicはHaiku 5.5を、これまでで最も安価、高速、かつ高性能な小型モデルと位置付けています。
公式ベンチマーク表には、想定される競合モデルが明確に示されています。GPT-6 LunaがHaiku 5.5の隣に直接掲載されています。

公開された結果は次のとおりです。
| ベンチマーク | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1、オフラインサブセット | 72.4% | 15.7% | 48.9% | 83.9% |
| Humanity’s Last Exam、ツールなし | 45.9% | 10.2% | — | 56.9% |
| Humanity’s Last Exam、ツールあり | 57.4% | 18.7% | — | 64.5% |
| Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1(Main) | 46.4% | — | 42.4% | 52.1% |
| Chartography、ツールなし | 46.4% | 6.4% | 29.1% | 61.6% |
重要なのは、Haiku 5.5が突然すべての大型モデルを置き換えたということではありません。
小型モデルにすぎないと考えられていたClaudeの最小モデル層が、以前ならより大きなモデルを必要とした種類のタスクで、はるかに高い能力を持つようになったということです。
10万トークン以下のプロンプトに対して、Anthropicは次の料金を設定しています。
Haiku 5.5 入力: $0.10 / 100万トークン
Haiku 5.5 出力: $0.50 / 100万トークン
キャッシュ読み取り: $0.01 / 100万トークン
キャッシュ書き込み: $0.125 / 100万トークン
OpenAIのGPT-6 Luna標準料金は現在、次のとおりです。
GPT-6 Luna 入力: $0.10 / 100万トークン
GPT-6 Luna キャッシュ入力: $0.01 / 100万トークン
GPT-6 Luna キャッシュ書き込み: $0.125 / 100万トークン
GPT-6 Luna 出力: $0.50 / 100万トークン
したがって、短いコンテキストを使う標準的なAPI処理では、両モデルの表示トークン料金はほぼ完全に一致します。

Haiku 5.5には2つの料金階層があります。
| トークン種別 | プロンプト≤10万 | プロンプト>10万 |
|---|---|---|
| キャッシュ読み取り | $0.01/M | $0.05/M |
| キャッシュ書き込み | $0.125/M | $0.625/M |
| 入力 | $0.10/M | $0.50/M |
| 出力 | $0.50/M | $2.50/M |
Anthropicによると、10万トークン以下のプロンプトはHaiku 4.5のリクエストの約90%を占めていました。そのため、低い料金階層で想定トラフィックの大半をカバーできます。
10万トークンを超えるプロンプトの場合でも、Haiku 5.5はHaiku 4.5より安価です。ただし、値下げ幅は小さくなります。
元記事では、Haiku 5.5をDeepSeek-V4.1-Flashと比較しています。
DeepSeekの公式料金は現在、ピーク時とオフピーク時で異なります。
キャッシュミス時の入力および出力料金は次のとおりです。
| モデル | 入力 / 100万 | 出力 / 100万 |
|---|---|---|
| Haiku 5.5、10万以下のプロンプト | $0.10 | $0.50 |
| DeepSeek-V4.1-Flash、オフピーク | $0.15 | $0.60 |
| DeepSeek-V4.1-Flash、ピーク | $0.30 | $1.20 |
キャッシュヒット時の入力では、特にオフピーク時にDeepSeekのほうが安価です。そのため、総コストは依然としてワークロードの構造に左右されます。

以前のHaiku世代は、負荷の高いコンピューター操作タスクでは競争力がありませんでした。
Haiku 5.5はこの状況を大きく変えます。
AnthropicのOSWorld 2.1オフラインサブセットでは、Haiku 4.5の**15.7%から、最大努力設定のHaiku 5.5では72.4%**へ上昇しています。
元記事では実践的なテストも行いました。Haiku 5.5に対し、Haikuのローンチページにある表へGPT-6とDeepSeekの料金データを追加するよう依頼したのです。
モデルはUI上で個々のHTML要素を手作業で編集する代わりに、ブラウザのコンソールを開き、スクリプトで変更を注入しました。

この動作が有用なのは、コンピューター操作エージェントが必ずしも人間のマウス操作を文字どおり模倣する必要がないためです。
ブラウザ環境がより直接的な実行経路を提供しているなら、すべてのセルをクリックするよりも、スクリプトを使うほうが速く、信頼性も高い場合があります。
Haiku 5.5は、調整可能な努力レベル制御を備えた最初のHaikuクラスモデルです。
このモデルは、低コストで高速な動作から、より高コストで慎重な推論まで、幅広い設定に対応します。
Anthropicのローンチチャートは、OSWorldにおける精度とコストの明確な関係を示しています。

元記事では、この曲線から次の2点を取り上げています。
実際の本番タスクの正確なコストは、プロンプトの長さ、出力の長さ、キャッシュ、ツール使用によって異なります。しかし、全体的な傾向は重要です。
「小型モデル」を1つの固定された能力レベルとして扱うのではなく、業務に応じてHaikuを調整できるようになりました。
GDPval-AA v2.1は、44の職種にわたる現実世界の専門業務を測定します。

Anthropicによると、最大努力レベルでのHaiku 5.5のEloは1620で、Haiku 4.5の735と比較して大幅に高くなっています。
ここでもSonnet 5.5のほうが高性能ですが、「小型」と「専門業務で役立つ」の距離は大きく縮まりました。
Haiku 5.5では、より新しいClaude世代と共有される新しいトークナイザーが導入されています。
これは、同じテキストでもHaiku 4.5で使用した場合と同じトークン数になるとは限らないことを意味します。
Anthropicの移行ガイドによると、正確な増加幅はコンテンツによって異なるものの、同じ入力テキストはHaiku 4.5よりもHaiku 5.5でおよそ30%多くのトークンを生成します。
ワークロードによって影響は大きくも小さくもなります。特にコード、表、英語以外のテキストについては、あらためて測定する価値があります。
つまり、次の比較は単純すぎます。
旧入力料金:$1.00
新入力料金:$0.10
したがって、すべてのタスクが正確に90%安くなる
より適切な計算は次のとおりです。
実際のタスクコスト
= 新しいトークン数
× 新しいトークン単価
+ キャッシュコスト
+ 出力コスト
+ ツールコスト
Anthropic自身も、トークナイザーの変更を考慮すると、Haiku 5.5はHaiku 4.5より平均で約75%安いと説明しています。すべてのタスクが一律90%安くなるわけではありません。
Artificial Analysisは、低価格モデルを比較する際にトークン効率が重要である理由も示しています。

モデルのトークン単価が低くても、タスクを完了するためにより多くの出力トークンを使用する場合があります。
本番システムでは、100万トークンあたりの料金だけでなく、タスク完了あたりのコストのほうが有用です。
元記事はこの点を明確にしています。「小さなカップ」は依然として小さなカップです。
Haiku 5.5はHaiku 4.5より大幅に強力になりましたが、複雑な自律型コーディングは依然として大型モデル向けの仕事です。
Terminal-Bench 4.0はその差を示しています。
Haiku 5.5: 39.2%
Sonnet 5.5:70.6%
Anthropicは、複雑なエージェント型コーディングにはSonnet 5.5またはOpus 5.5を明確に推奨しています。
Haiku 5.5は、すでに範囲が明確に定められた次のようなタスクに適しています。
CognitionはすでにDevin Fusionでこの構成を使用しています。
ローンチページによると、Opus 5.5がリードとして動作し、Haiku 5.5がサイドキックとして働きます。
Cognitionが報告した構成では、この組み合わせによりFrontierCodeスコア66.2を達成しながら、コストとレイテンシーを削減しました。

パターンは単純です。
Opus / Sonnet
→ 計画、分解、難しい判断
Haiku 5.5
→ 限定的なサブタスク、並列実行、簡単な検索、要約
これは、Haiku 5.5をあらゆる場所で大型モデルの代わりに使おうとするよりも、現実的な活用方法でしょう。
すでにHaiku 4.5を使用しているアプリケーションについて、Anthropicは複数の変更によって既存のリクエストが壊れる可能性があると警告しています。
公式のモデルIDは次のとおりです。
claude-haiku-5-5
ただし、移行にはいくつかの追加要件があります。
Haiku 4.5で次のようにリクエストしていた場合、これは無効になりました。
アイデアを一文で入力するだけで、We0 AI が紹介サイト、ページ、CMS を生成し、公開後の顧客獲得と流入拡大を支援します。
無料登録で完全なプロジェクトを 1 つ生成
1 つの完全な生成フローを試し、最初のプロジェクトのドラフトをすぐに確認するのに最適です。
{
"thinking": {
"type": "enabled",
"budget_tokens": 8000
}
}
Haiku 5.5では、代わりに適応型思考と努力レベル制御を使用します。
{
"thinking": {
"type": "adaptive"
},
"output_config": {
"effort": "medium"
}
}
古いbudget_tokens形式でリクエストを送信すると、400エラーが返されます。
適応型思考はデフォルトでも有効になっているため、アプリケーションは最初のレスポンスコンテンツブロックが常に通常の回答テキストだと想定してはいけません。
ブロックはtypeによって解析してください。
max_tokensを見直す新しいトークナイザーでは同じテキストがより多くのトークンとしてカウントされるため、従来のmax_tokens値では同等の出力に十分な余地が残らない可能性があります。
思考トークンも出力予算に含まれます。
Haiku 4.5のトークン推定値を再利用せず、claude-haiku-5-5を使ってプロンプトを再カウントしてください。
Haiku 5.5では、Haiku 4.5のような任意のサンプリング設定をサポートしなくなりました。
Anthropicは次の項目を省略するよう推奨しています。
temperature
top_p
top_k
デフォルト以外の値を指定すると400エラーが発生する可能性があり、top_kは受け付けられません。
創造性の変化にサンプリングパラメーターを使用していたアプリケーションは、その制御をプロンプトまたは別のアプリケーションレベルの戦略へ移行する必要があります。
Haiku 4.5では、構成によっては最終アシスタントメッセージから続行できました。
Haiku 5.5はアシスタント・プレフィルを拒否します。
次のようなプレフィックスを使用してJSON出力を強制していた場合は、構造化出力またはツールスキーマへ移行してください。
{"result":
Claude APIおよびGoogle Cloud統合では、古いコンピューター操作宣言を次のように変更する必要があります。
computer_20250124
変更後は次のとおりです。
computer_toolset_20260801
新しいツールセットではイベント構造が異なるため、エージェントループは返されたツール使用ブロックを正しくディスパッチし、結果にtoolset_nameを保持する必要があります。
Haiku 5.5は、対応プラットフォーム上のウェブページタスク向けに、Anthropicのブラウザ使用ツールセットもサポートしています。
Haiku 5.5をデプロイする前に、少なくとも次の項目を確認してください。
claude-haiku-5-5に変更する。budget_tokens思考設定を、適応型思考と努力レベルに置き換える。typeでコンテンツブロックを解析する。computer_toolset_20260801へ更新する。refusal停止理由を処理する。Anthropicは、Claude Code向けの自動移行コマンドも提供しています。
/claude-api migrate this project to claude-haiku-5-5
このツールはモデルIDの変更を適用し、互換性のない複数のリクエストパターンを検出できます。ただし、手動での検証も推奨されます。
Haiku 5.5だけがAnthropicの発表した料金変更ではありません。
Sonnet 5.5のキャッシュ読み取り料金は、次のように引き下げられました。
$0.20 / 100万トークン
から、次の料金になりました。
$0.10 / 100万トークン
Anthropicによると、多くのエージェントワークフローではキャッシュ読み取りがトークン消費の大きな割合を占めています。そのため、この変更により、Sonnet 5.5を使うエージェントタスクの多くでコストが約**20%**削減されます。

これにより、混合モデルアーキテクチャがさらに魅力的になります。
Sonnet 5.5
→ 計画とより難しい実行
Haiku 5.5
→ 大量のサブタスクを低コストで処理
Anthropicは、対象となるMaxおよびTeam契約者向けに、月次のClaude Platformクレジットも導入しました。
現在の公式クレジット額は次のとおりです。
| プラン | 月次APIクレジット |
|---|---|
| Max 5x | $100 |
| Max 20x | $200 |
| Team Standardシート | シートあたり$20 |
| Team Premiumシート | シートあたり$100 |
| Teamの共有上限 | $500 |

クレジットは、次のようなClaude Platformワークロードに使用できます。
これらのクレジットによって、ユーザーのClaudeまたはClaude Codeのサブスクリプション利用上限が増えるわけではありません。また、サブスクリプションプランを通じて請求される通常のインタラクティブなClaude Codeセッションも対象外です。
クレジットは1つのClaude Console組織に紐付けられ、無期限に繰り越されるわけではありません。
元記事は、最後に少し軽い比較を行っています。
Anthropicがより安価なモデル、より安価なSonnetのキャッシュ読み取り、月次APIクレジットを発表する一方、OpenAIのCodexおよびChatGPT Workの責任者であるThibault Sottiauxは、CodexとChatGPT Work全体で4,000万人のアクティブユーザーを祝うとともに、有料アカウント向けに別の保存可能なリセットを発表しました。

保存可能なリセットは、恒久的な値下げとは異なります。
これは、モデルの継続的なトークン料金を変更するものではなく、対象ユーザーが保存して後で利用できる追加の使用量リセットです。
したがって、この比較は技術的というより、表現上の比較です。
Anthropicの発表:
新しい小型モデル + キャッシュ料金の引き下げ + 月次APIクレジット
OpenAIの更新:
有料のCodex / Workアカウント向けに追加の保存可能な利用量リセット
どちらもヘビーユーザーにより多くの実験余地を提供する取り組みですが、仕組みは異なります。
今回のリリースによりHaikuははるかに有用になりましたが、理想的な役割は比較的明確です。
Haiku 5.5は次の用途に使用できます。
次の用途では、より大型のClaudeモデルを優先してください。
最も安価なモデルが、必ずしもタスクを完了するための最も安価な方法とは限りません。
本番システムでは、次の指標を測定してください。
成功したタスクあたりのコスト
=
入力 + キャッシュ + 出力 + ツール使用 + 再試行 + 失敗
この指標は、モデルの表示入力料金だけを見るよりも多くの情報を与えてくれます。
Claude Haiku 5.5はAnthropicの最新の小型Claudeモデルです。大量処理、コスト重視、レイテンシー重視のワークロード向けにリリースされています。また、調整可能な努力レベルを備えた最初のHaikuモデルであり、コーディング、コンピューター操作、専門業務の評価においてHaiku 4.5を大きく上回ります。
10万トークン以下のプロンプトでは、入力100万トークンあたり$0.10、出力100万トークンあたり$0.50です。10万トークンを超えるプロンプトでは、入力が$0.50、出力が100万トークンあたり$2.50に上がり、キャッシュ読み取りとキャッシュ書き込みには別の料金が設定されます。
標準的な短いコンテキストのトークン料金では、表示上の入力、キャッシュ入力、キャッシュ書き込み、出力料金は実質的に一致しています。Haiku 5.5は10万トークンのプロンプト境界を超えると料金が上がるため、長いコンテキストのワークロードは別途比較する必要があります。
いいえ。Anthropic自身のTerminal-Bench 4.0の結果では、Sonnet 5.5が70.6%、Haiku 5.5が39.2%です。Haikuは範囲が限定された反復可能な大量処理タスクやサブエージェント作業に適しており、複雑な自律型コーディングではSonnetとOpusのほうが適しています。
Haiku 5.5では新しいトークナイザーが使用されています。Anthropicの移行ガイドによると、正確な増加幅はコンテンツによって異なりますが、同じテキストは平均してHaiku 4.5より約30%多くのトークンになります。
はい。主な変更には、手動のbudget_tokensから適応型思考への変更、サンプリングパラメーターの動作変更、アシスタント・プレフィルの削除、新しいコンピューター操作ツールセット、typeによるレスポンスブロックの解析が含まれます。Anthropicは公式移行ガイドとClaude Code移行コマンドを提供しています。
Claude APIでのモデルIDはclaude-haiku-5-5です。Anthropicは、Amazon Bedrock、Google Cloud、Microsoft Foundry、AWS上のClaude Platformに対応するIDも文書化しています。
対象となるMaxおよびTeam契約者は、月次のClaude Platformクレジットを利用できます。Max 5xには$100、Max 20xには$200が付与され、Teamのクレジットはシートの種類に応じて計算され、月額最大$500まで共有されます。
Claude Haiku 5.5は、Anthropicの小型モデル層における大幅なアップグレードです。コンピューター操作、専門業務、コーディング、推論においてHaiku 4.5を大きく上回り、短いコンテキストでのAPI表示料金ではGPT-6 Lunaと同水準でありながら、Anthropicが公開した複数のベンチマーク比較ではLunaを上回っています。
値下げは実際に行われていますが、本番チームは新しいトークナイザーと10万トークンのプロンプト料金境界を無視すべきではありません。同じテキストでもHaiku 4.5より約30%多くのトークンを消費する可能性があり、長いプロンプトには高い料金階層が適用されます。
移行には、適応型思考による手動思考予算の置き換え、カスタムサンプリング制御の制限、アシスタント・プレフィルの削除、新しいツールセットへのコンピューター操作統合の更新など、実際の破壊的変更も含まれます。既存のHaiku 4.5アプリケーションは、モデル名だけを変更するのではなく、移行ガイドに従う必要があります。
Haiku 5.5は、複雑で長期的な作業においてSonnetやOpusを全面的に置き換えるモデルではなく、大規模処理やサブエージェント向けの高速で低コストな実行モデルとして理解するのが最適です。
ひとことから始めて、数分で完全なサイトを手に入れましょう。