Anthropicによる最近の説明可能性研究は、研究者にクロードの内部活動を観察する新たな方法を提供した。ヤコビアンレンズ(またはJレンズ)と呼ばれる手法を通じて、研究チームはJスペースと名付けられた、小規模で言語化可能な内部表現のセットを特定した。

Anthropicによる最近の説明可能性研究は、研究者にクロードの内部活動を観察する新たな方法を提供した。ヤコビアンレンズ(またはJレンズ)と呼ばれる手法を通じて、研究チームはJスペースと名付けられた、小規模で言語化可能な内部表現のセットを特定した。
この発見は重要である。言語モデル内部の特定の概念が、報告、推論、行動制御にグローバルに使用できることを示しているからだ。研究者はこれらの表現を観察し、制御実験で介入を行い、モデルの出力に因果的影響を与えるかどうかをテストできる。
しかし、内部表現を観察できたからといって、それが完全に説明できたことにはならない。
読み取り可能な活性化状態は、モデルがカウンティング、欺瞞、フランス、完了といった特定の概念を追跡していることを教えてくれるかもしれない。しかし、それだけでは次のような問いに自動的には答えられない。なぜその概念が関連するのか? 根拠となる情報は信頼できるのか? 結論を支える外部事実は何か? 最終的な判断は合理的か?
この違いは、より広範な説明可能なAIアプローチを示唆している。モデルの内部状態だけを説明すべき対象と見なすのではなく、モデルが処理する情報そのものを同時に検討すればよい。その情報がどこから来たのか、どのように構成されているのか、どのような概念や関係が使われているのか、証拠がシステム内をどのように流れるのか、そして最終的な出力が外部の知識体系とどのようにつながっているのかを。
ここでオントロジーエンジニアリングが重要な役割を果たす。

Anthropicの論文『言語モデルにおける言語化可能な表現が構成するグローバルワークスペース』は、認知科学におけるグローバルワークスペース理論を借用してJスペースの概念を導入した。
神経科学や認知科学において、グローバルワークスペースは、容量に制限のある舞台として記述されることが多く、選ばれた情報が複数の認知プロセスに広くアクセス可能となる。Anthropicは、クロードの内部表現の中でも小さくスパースなサブセットが、機能的に類似した役割を果たしていることを発見した。
研究者は語彙項目に関連付けられたJレンズベクトルを使用して、モデルの内部状態を検査した。実験により、Jスペースで表現される情報は以下のことができることが示された:
これらの結果は、説明可能性を単純な出力行動の観察から一歩進める。内部表現の機能をテストする方法を提供しているのだ。
Anthropicはこれに対して慎重な姿勢をとっている。
クロードが人間の脳の完全な認知アーキテクチャを再現しているとか、主観的な意識を持っているとは主張できない。Jスペースは数学的システムにおける機能的な構造であり、人間に似た内面的活動の証拠ではない。
この慎重さは極めて重要である。なぜなら、機能的な類似性は心理的な同等性と混同されやすいからだ。
モデルは共有された内部ワークスペースを持ちうるが、人間の意味での感覚、体験、意図、自覚を持っているわけではない。「恐怖」という単語に対応する活性化パターンはそれ自体が恐怖ではなく、行動を生成する計算状態の一部である。
Jスペースは、次の問いを出発点とする広範な説明可能性の伝統に属する。
モデル内部で何が起きているのか?
この内在主義的アプローチは、活性化パターン、回路、特徴、注意パターン、表現、因果経路を調査し、ニューラルネットワークの隠されたメカニズムをより観察可能でテスト可能にすることを目指す。
この作業には明確な価値があり、研究者は以下のことが可能になる:
その限界は、内部説明可能性が役に立たないということではなく、内部の可視性が説明の一つの層しかカバーしていないということにある。
神経パターンは何らかの答えと関連付けられても、その答えの意味や根拠を解決することはできない。
モデルが「パリはフランスの首都です」と言ったとする。内部探索ではパリ、フランス、地理、首都に関する表現が特定されるかもしれないが、いくつかの外部の問いは未解決のまま残る:
これらの問いは完全に活性化パターンの内部にあるわけではなく、モデルの表現と外部の事実、言語、人間の概念、理由の基準との関係に関わる。
工学的な説明可能性は、研究者がシステムの内部メカニズムを観察し介入できる場合、そのシステムは説明可能であるとみなすことが多い。
この定義は有用ではあるが、狭すぎる。
科学哲学や認識論において、説明はさらに以下を提供する必要があるかもしれない:
Jスペースは、あるタスクでどの情報が活性化されたかを明らかにするかもしれないが、それ自体ではその情報が真実か、関連性があるか、倫理的か、あるいは出力結果を正当化するのに十分かどうかを判断できない。
したがって、より深い問題は次の点にある——
ニューラルネットワーク自体が不透明であるだけでなく、これらのシステムを取り巻く情報がしばしば構造化されておらず、トレースが困難であることにある。
大規模言語モデルは情報処理システムである。テキスト、画像、ファイル、ツールの応答、データベース結果、その他のシグナルを受け取り、それに対する応答として情報を生成する。
これらの入力と出力の意味は、モデル外部の関連関係に依存する。
医学用語は臨床的概念を指し、企業の識別子は法的実体に対応し、政策ルールは特定の管轄区域や有効期間に属し、財務数値は出所、単位、日付、会計定義を含み、科学的な主張は証拠、方法、仮定に依存する。
これらの関連関係が明示的に提示されなければ、モデルは言語と文脈を通じて推論しなければならない。これがうまく機能することもあれば、曖昧さ、矛盾、幻覚、あるいはもっともらしいが監査不可能な答えを生み出すこともある。
情報中心の説明可能性アプローチは、したがって以下の問いを提起する:
これにより、説明可能性の対象がニューラルネットワークから、モデルが動作する情報環境全体へと拡大される。
この環境には以下が含まれる:
モデルは内部的に説明可能であっても、定義が曖昧だったり信頼性の低い情報に基づいて動作することがある。逆に、モデルのメカニズムは不透明でも、その主張のすべてが構造化された証拠と明確なルールに関連付けられているために高度にトレース可能であることもある。
最も強力なシステムは、これら二つの透明性の形態を組み合わせるだろう。
オントロジーという語には、二つの関連する意味がある。
哲学において、オントロジーは存在の問題と事物の分類方法を探求する。コンピュータサイエンスにおいて、オントロジーはある領域における実体、カテゴリ、属性、関係、制約の形式的な表現である。
元の記事は、AIの説明可能性をイマヌエル・カントの範疇理論と結びつけている。
カントは、人間の理解は単に生の感覚データを受け取るのではなく、概念の形式を通じて経験を組織化すると考えた。彼は十二の範疇を次のようにまとめた:
記事はこの枠組みを用いて、より大きな見解を提示する。情報は、概念構造に組み込まれて初めて理解可能になる、と。
この画像は文脈と密接に関連している。
文脈ではカントの十二のカテゴリーが言及されている。この図はそれら四つのカテゴリーを直感的な形で示しており、記事内でのカント理論の紹介と呼応している。人工知能システムにとって、言語モデルが実際にカントの十二のカテゴリーを備えていなければならないわけではない。より有用な考え方は、説明可能性には、モデルが議論している対象の種類と、それが主張する関係の種類を特定するための共有フレームワークが必要だということである。
例えば、次の文を考えてみよう。
システムは申請を却下した。なぜなら申請者が収入要件を満たしていなかったからである。
有益な説明は活性化図だけに依存すべきではない。以下のものを特定する必要があるかもしれない。
オントロジーはこれらの要素と関係を形式的に定義できる。
これにより、モデルの出力を解釈、検証、疑問視することを可能にする意味構造が提供される。
適切に設計されたドメインオントロジーは以下を指定できる。
この構造は安定した意味座標系を生成する。
評価者は、モデルが「因果関係を理解しているように見える」と言う代わりに、出力が明確に定義された因果関係を含んでいるか、関係するエンティティが正しく識別されているか、引用された証拠がその関係を支持しているかを問うことができる。
これにより、すべてのモデル決定が自動的に正しくなるわけではないが、決定に使用された情報の検証が容易になる。
哲学オントロジーは概念を提供する。オントロジー工学はこれらの概念をソフトウェアで利用可能なシステムに変換する。
実際には、オントロジー工学には、ドメインの定義、要件の収集、概念の特定、関係のモデリング、制約の形式化、一貫性のテスト、出典の記録、そしてドメインの変化に応じたオントロジーの維持が含まれる。
従来のオントロジー開発は、ドメイン専門家とナレッジエンジニアに大きく依存するため、コストが高く、進行が遅いことが多い。
大規模言語モデルはプロセスの複数の段階を加速できる。
それらは以下のことに役立つ。
これは双方向の関係を形成する。
言語モデルはオントロジー構築を加速でき、オントロジーは言語モデルシステムをより構造化され、検証可能で、トレーサブルなものにする。

ドメイン専門家は、数十の報告書、ポリシー、マニュアル、データベーススキーマ、語彙集を提供するかもしれない。LLMはこれらの資料をスキャンし、概念と関係の初版リストを生成できる。
例えば、以下のことを特定する可能性がある。
これにより、人手による発見作業を削減できる。
しかし、出力結果は依然としてドメイン専門家によるレビューが必要である。言語モデルは関係を捏造したり、独立しているべき概念を統合したり、ソース文書から不整合を再現したりする可能性がある。
したがって、LLM支援によるオントロジー工学は、自動的な真実抽出ではなく、人間の監督下での知識モデリングと見なされるべきである。
オントロジーは様々な方法で言語モデルアプリケーションを支援できる。
オントロジーはモデルに制御された語彙と明示的な関係を提供する。これにより、検索と生成プロセスにおける曖昧さが軽減される。
システムはユーザーの言語を標準エンティティに接続し、同義語を特定し、表面的な語彙ではなく意味に基づいて情報を検索できる。
出力結果はオントロジーの制約に対してチェックできる。例えば、医療投与量には単位が必要、取引には口座が含まれなければならない、ポリシー決定は有効なルールを引用しなければならない、など。
推論エンジンと検証システムは、構造化データ内の非互換な分類、欠落属性、矛盾を検出できる。
アイデアを一文で入力するだけで、We0 AI が紹介サイト、ページ、CMS を生成し、公開後の顧客獲得と流入拡大を支援します。
無料登録で完全なプロジェクトを 1 つ生成
1 つの完全な生成フローを試し、最初のプロジェクトのドラフトをすぐに確認するのに最適です。
生成された主張は、ソース文書、オントロジー概念、ルール、バージョンにリンクできる。これにより、事後的に生成された不透明な説明をユーザーに信じさせるよりも、現実的なレビューが可能になる。
オントロジーは、LLM、データベース、ツール、ビジネスアプリケーション、人間のチーム間の意味的な契約として機能できる。
モデルは言語的に柔軟であり続ける一方で、周囲のシステムは主要な概念の制御された表現を保持する。
モデル説明がトレーサビリティチェーンの形で提示されると、その価値は大幅に向上する。
これは、モデルに「なぜ」答えを出したかを説明する流暢な段落を生成させる方法とは根本的に異なる。
生成された説明自体にバイアスがかかる可能性がある。しかし、構造化知識に固定されたトレーサビリティチェーンは、独立して審査されることができる。
従来のオントロジーは、多くの場合、決定論的記号推論をサポートするために構築された複雑な公理を大量に含む、形式化された推論エンジン向けに設計されてきた。
大規模言語モデル向けのオントロジーには、異なるバランスが求められるかもしれない。
オントロジーは依然として正確である必要があるが、モデルが検索、引用、適用しやすいものであるべきである。
ソース資料は、AIフレンドリーなオントロジーは、考えられるすべての推論ステップをエンコードしようとするのではなく、明確な意味的骨格を提供することに焦点を当てるべきだと提案している。
この役割分担は非常に価値がある。
このアプローチは二つの極端を回避する。
一つ目の極端は、重要な概念をプロンプトと文書だけで定義する、完全に非構造化された言語モデルワークフローである。二つ目の極端は、あらゆる細部を形式化しようとして維持が困難になる、過度にエンジニアリングされた記号システムである。
AIフレンドリーなオントロジーは以下を目指すべきである。
すべての重要なクラスと関係は、簡潔で曖昧さのない記述を持つべきである。
重要なエンティティと概念には、名前だけでなく正規の識別子を使用すべきである。
定義、事実、ルールには、そのソース、所有者、バージョン、有効期限を記録すべきである。
概念には、人間が読み取り可能なラベル、説明、同義語、使用例を含めるべきである。
オントロジーは管理可能なモジュールに分割され、モデルが関連部分のみを検索できるようにすべきである。
価値の高いデータと出力は、明示的な制約(SHACLシェイプやアプリケーション層バリデーターなど)を通じて検証されるべきである。
オントロジーの変更はモデルの動作に影響を与える可能性があるため、更新はレビュー、バージョン管理、テストを経るべきである。
アプリケーションは、モデルに提供された概念と事実の記録を保持すべきである。
オントロジーは、ルールが不完全、概念が曖昧、または人間の承認が必要なシナリオを識別すべきである。
不可欠である。
意味レイヤーは、維持されて初めて価値を持つ。
時代遅れのオントロジー(存在論)は、システムにあたかも高度に組織化された方法で誤りを犯し続けさせる可能性がある。
J-Spaceをめぐる議論は、二つの異なる目標を浮き彫りにしている。
第一は、モデルそのものの説明である。内部表現、回路、計算、行動メカニズムなどだ。
第二は、モデルの影響の説明である。どの情報が出力を形成し、どのルールが行動を許可し、どの証拠が結果を裏付け、誰がそれを精査、あるいは疑問視できるのか。
これらの目標は重なる部分もあるが、完全に同一ではない。
メカニズムの説明可能性(メカニスティック解釈可能性)は、モデルが誤解を招く出力を生成する前に、内部で欺瞞を表現していることを明らかにするかもしれない。オントロジーに基づく遡及可能性は、どの主張が虚偽で、どの情報源がそれを反駁し、どの下流プロセスが影響を受けたかを明らかにするかもしれない。
第一の目標は、研究者が内部動作を理解するのに役立つ。第二の目標は、組織が現実世界での結果を管理するのに役立つ。

したがって、完全な説明可能性の枠組みには、複数の層が含まれる可能性がある。
オントロジーエンジニアリングは、主に情報層とシステム層を強化する。概念、ルール、情報源を明確にすることで、影響分析とガバナンスを支援することもできる。
しかし、神経科学的な説明可能性(ニューラル解釈可能性)に取って代わるものではない。
構造化されたナレッジグラフ(知識グラフ)は、モデルの重みに埋め込まれた隠れた目標を明らかにすることはできない。J-Spaceは、ソース文書が権威があることや、ビジネスルールが公平であることを証明できない。
これら二つのアプローチは、問題の異なる部分を解決する。
AIのブラックボックスを開くという比喩は、非現実的な目標を設定する可能性がある。すなわち、内部のすべての重みと計算に至るまでの完全な透明性だ。
最先端のモデルにとって、これは人々が想像するほど現実的ではないかもしれない。
より達成可能な目標は、システムの運用を、その使用状況において十分に理解可能、追跡可能、テスト可能、そして管理可能にすることだ。
これは、システムを設計する際に以下を必要とすることを意味する。
技術的に可能な範囲で、監視手段を使用する。

中心的な転換点は、説明可能性を単一の可視化の問題として捉えるのではなく、エンジニアリングとガバナンスの問題として扱うことにある。
すべてのニューラルネットワーク計算を、人間が理解できる物語に完全に翻訳できる日は決して来ないかもしれない。しかし、影響の大きい出力を理解し、疑問視しやすくする情報アーキテクチャを構築することは依然として可能だ。
オントロジーエンジニアリングは、この目標を具体的な作業に変換する。
これは「モデルの思考を読む」ほど注目を集めるものではないが、実際のプロダクションではより有用かもしれない。
元の中国語の記事は、LegionSpace(同富盾関連製品)へのプロモーション的な言及で締めくくられている。情報源はこれを、オントロジーエンジニアリングとトレーサブル推論を中心に構築されたエンタープライズ向けAIインフラストラクチャとして説明している。
本改作では、これらの製品の主張を独自に評価しておらず、したがってそれらをより広範な議論の証拠として使用していない。
関連する教訓は普遍的なものである。オントロジーベースの説明可能性を謳うプラットフォームは、具体的な質問によって評価されるべきである。
ナレッジグラフを使用している、あるいは推論図を表示しているという理由だけで、製品が説明可能であると見なされるべきではない。
J-Spaceは、Anthropicがヤコビアンレンズ(Jacobi lens)を通じて特定した、内部表現の小さなサブセットに付けた名前です。研究によると、これらの表現には、報告、推論、因果介入に使用可能な言語化可能な概念が含まれている可能性があります。
いいえ。Anthropicは、自社のモデルが人間の意識や主観的体験を再現できるとは主張していません。J-Spaceは、大域的ワークスペース理論(Global Workspace Theory)と部分的な機能の類似性を示していますが、機能的な類推は人間のような思考の証拠にはなりません。
内部ツールは、どの表現やメカニズムが動作に影響を与えたかを示すことはできますが、モデルの情報が真実か、情報源が信頼できるか、関連性があるか、または妥当かを自動的に判断することはできません。説明可能性には、証拠、意味定義、情報源、ルール、現実世界への影響の説明も必要です。
オントロジー
オントロジーエンジニアリングとは、ある領域におけるエンティティ、クラス、プロパティ、関係、制約を形式的に定義する実践です。ソフトウェアシステムでは、オントロジーは通常、RDFやOWLなどの標準で表現され、SHACLによって検証可能です。
オントロジーは、規範的な概念と明確な関係を提供し、検索、生成、検証のプロセスを固定します。これらは、主張を定義された概念、それを裏付ける証拠、形式化されたルール、記録されたバージョンと結びつけるのに役立ちます。
LLMは、概念抽出、関係発見、マッピング、文書作成を加速できますが、その提案には専門家によるレビューが必要です。完全に自動化されたオントロジー生成は、ソースデータのエラーを再現したり、異なる概念を統合したり、根拠のない関係を作成したりする可能性があります。
いいえ。オントロジーは重要な出力を制約し、トレーサビリティを向上させることができますが、すべてのモデルエラーを排除することはできません。信頼性の高いシステムには、検索品質管理、検証、テスト、権限管理、監視、および人間によるレビューも必要です。
これらは説明可能性の異なる側面を解決するものであり、補完的な手段として用いるのが最善です。メカニスティック解釈可能性はモデルの内部動作を研究する一方、オントロジーエンジニアリングは外部情報、ルール、意思決定経路を精査しやすくします。
Eclipse RDF4J:RDFデータの作成、保存、検索、推論、検証を行うためのモジュラー型Javaフレームワーク。
AnthropicのJ-Space研究は、機械的解釈可能性の分野における重要な進展です。研究者に対し、Claude内の少数の言語化可能な内部表現を観察し、因果的に検証する新たな手法を提供しています。
この研究は、より広範な説明可能性の問題を解決するものではありません。AIシステムを理解するには、その利用する情報、概念の意味、主張の背後にある証拠、行動が従うルール、出力結果がもたらす影響を明らかにする必要があります。
オントロジーエンジニアリングは、こうした外部構造を形式化するための実現可能な経路を提供します。特に人手によるレビューや内部解釈可能性研究と組み合わせることで、セマンティック検索、検証、トレーサビリティ、追跡、説明責任を支援します。
説明可能なAIの真の鍵は、おそらく「モデルを開く」か「外部世界の枠組みを構築する」かの選択ではなく、両方を兼ね備えることにあるのです。