Anthropic最近的可解释性研究为研究人员提供了一种观察克劳德内部活动的新方法。通过一种名为雅可比透镜(或J-lens)的方法,研究团队识别出了一组小规模、可语言化的内部表征,称为J-Space。

Anthropic最近的可解释性研究为研究人员提供了一种观察克劳德内部活动的新方法。通过一种名为雅可比透镜(或J-lens)的方法,研究团队识别出了一组小规模、可语言化的内部表征,称为J-Space。
这一发现意义重大。它表明语言模型内部的某些概念可以全局性地用于报告、推理和行为控制。研究人员可以观察这些表征,并在受控实验中对其进行干预,测试它们是否对模型输出产生因果影响。
但观察到内部表征并不等于完全解释了它。
一个可读的激活状态或许能告诉我们模型正在追踪某个概念,比如计数、欺骗、法国或完成。但这并不能自动告诉我们:为什么该概念是相关的?所依据的信息是否可靠?哪些外部事实支撑了结论?或者最终做出的决策是否合理?
这一区别指向了一种更广泛的可解释AI方法。我们不必将模型的内部状态视为唯一需要被解释的对象,而是可以同时审视模型所处理的信息:这些信息来自何处、如何构成、使用了哪些概念和关系、证据如何在系统中流动,以及最终输出如何与外部知识体系相连接。
这正是本体工程发挥作用的地方。

Anthropic的论文《语言模型中可语言化表征构成全局工作空间》通过借鉴认知科学中的全局工作空间理论引入了J-Space概念。
在神经科学和认知科学中,全局工作空间通常被描述为一个容量有限的舞台,选定的信息在此能被多种认知过程广泛获取。Anthropic发现,克劳德内部表征中一个小型、稀疏的子集似乎发挥着功能上类似的作用。
研究人员使用与词汇项关联的J-lens向量来检查模型内部状态。他们的实验表明,J-Space中表征的信息可以:
这些结果将可解释性从简单的输出行为观察推进了一步。它们提供了一种测试某些内部表征功能的方法。
Anthropic对此持谨慎态度。
不能声称Claude复制了人脑完整的认知架构或拥有主观意识。J-Space是数学系统中的功能性结构,并非类人内心活动的证据。
这种谨慎至关重要,因为功能相似性很容易被误认为心理等同性。
模型可能包含共享的内部工作空间,却不具备人类意义上的感受、体验、意图或觉知。与"恐惧"一词对应的激活模式本身并非恐惧,而是参与生成行为的计算状态。
J-Space属于一个广泛的可解释性传统,其起点是一个问题:
模型内部正在发生什么?
这种内在主义方法考察激活模式、电路、特征、注意力模式、表征和因果路径,目标在于使神经网络隐藏的机制更可观察、可测试。
这项工作具有明确价值,可帮助研究者:
其局限不在于内部可解释性毫无用处,而在于内部可见性仅覆盖解释的一个层面。
神经模式可能与某个答案相关联,却无法解决该答案的意义与依据问题。
假设模型说"巴黎是法国的首都"。内部探测可能识别出与巴黎、法国、地理和首都相关的表征,但仍有几个外部问题悬而未决:
这些问题并不完全存在于激活模式内部,而是关乎模型表征与外部事实、语言、人类概念及理由标准之间的关系。
面向工程的可解释性通常认为,当研究者能够观察并干预系统内部机制时,该系统就是可解释的。
这一定义虽有用,却过于狭隘。
在科学哲学和认识论中,解释可能还需要提供:
J-Space或许能揭示某项任务中哪些信息被激活,但它本身无法确定这些信息是否真实、相关、合乎伦理,或足以证明输出结果的合理性。
因此,更深层的问题在于——
不仅在于神经网络本身不透明,更在于围绕这些系统的信息往往结构混乱、难以追溯。
大语言模型是信息处理系统。它们接收文本、图像、文件、工具响应、数据库结果及其他信号,随后生成信息作为回应。
这些输入和输出的意义取决于模型外部的关联关系。
一个医学术语指向临床概念,企业标识对应法律实体,政策规则属于特定管辖区域和有效期,财务数字包含来源、单位、日期和会计定义,科学主张则依赖证据、方法和假设。
如果这些关联关系未被明确呈现,模型就必须通过语言和上下文进行推断。这有时奏效,有时却会产生歧义、矛盾、幻觉,或看似合理却无法审计的答案。
以信息为中心的可解释性方法因此提出以下问题:
这便将可解释性的对象从神经网络扩展至模型运行的整个信息环境。
该环境包括:
一个模型可能在内部具备可解释性,但仍会基于定义模糊或不可靠的信息运行。反之,模型机制可能不透明,却因其每个主张都与结构化证据和明确规则关联而高度可追溯。
最强大的系统将可能结合这两种透明度形式。
本体论一词具有两层相关含义。
在哲学中,本体论探讨存在问题及事物分类方式。在计算机科学中,本体论是对某一领域内实体、类别、属性、关系和约束的形式化表达。
源文章将人工智能可解释性与伊曼努尔·康德的范畴理论联系起来。
康德认为,人类的理解并非简单接收原始感官数据,而是通过概念形式组织经验。他将十二个范畴归纳为:
文章运用这一框架阐述了更宏观的观点:信息只有在被纳入概念结构组织后,才能成为可理解之物。
该图片与上下文紧密相关。上下文提及康德的十二范畴,此图以直观形式呈现了这四个范畴,与文章中对康德理论的介绍相呼应。对于人工智能系统而言,实际意义并不在于语言模型必须真正具备康德的十二范畴。更有用的理念是:可解释性需要一个共享框架,用以识别模型正在讨论的事物类型及其断言的关系类型。
例如,考虑以下句子:
系统拒绝了申请,因为申请人未满足收入要求。
有用的解释不能仅依赖激活图。它可能需要识别:
本体可以正式定义这些元素和关系。
它提供了一种语义结构,使模型的输出能够被解读、核查和质疑。
设计良好的领域本体可以指定:
这种结构创建了一个稳定的语义坐标系。
评估者无需说模型“似乎理解因果关系”,而是可以询问输出是否包含定义明确的因果关系,所涉及的实体是否被正确识别,以及引用的证据是否支持该关系。
这并不会使每个模型决策自动正确,但会使决策中所使用的信息更易于核查。
哲学本体提供概念。本体工程将这些概念转化为软件可用的系统。
在实践中,本体工程涉及定义领域、收集需求、识别概念、建模关系、形式化约束、测试一致性、记录来源,并在领域变化时维护本体。
传统的本体开发往往成本高昂且进展缓慢,因为它高度依赖领域专家和知识工程师。
大语言模型可以加速流程的多个阶段。
它们能够帮助:
关系
这形成了一种双向关系。
语言模型可以加快本体构建速度,而本体则能使语言模型系统更加结构化、可验证和可追溯。

领域专家可能会提供数十份报告、政策、手册、数据库模式和词汇表。LLM可以扫描这些材料,生成概念和关系的初版清单。
例如,它可能识别出:
这可以减少人工发现的工作量。
然而,输出结果仍需由领域专家审查。语言模型可能会编造关系、合并本应保持独立的概念,或从源文档中复现不一致之处。
因此,LLM辅助的本体工程应被视为人类监督下的知识建模,而非自动的真实性提取。
本体可以通过多种方式支持语言模型应用。
本体为模型提供受控词汇和明确关系。这可以在检索和生成过程中减少歧义。
系统可以将用户语言连接到标准实体,识别同义词,并基于含义而非表面词汇进行信息检索。
输出结果可以对照本体约束进行检查。例如,医疗剂量可能需要单位,交易必须包含账户,或政策决策必须引用有效规则。
推理器和验证系统可以检测结构化数据中的不兼容分类、缺失属性或矛盾。
输入一句想法,We0 AI 即可生成展示站、页面与 CMS。发布上线后并帮你获取客户和流量。
用户注册赠送一次完整项目生成
适合先体验一次完整生成流程,快速看到项目初稿。
生成的声明可以链接到源文档、本体概念、规则和版本。这使得审查比要求用户相信事后生成的、不透明的解释更加实用。
本体可以作为LLM、数据库、工具、业务应用和人类团队之间的语义契约。
模型在语言上保持灵活,而周围系统则保留对以下内容的受控表示:
关键概念。
当模型解释能够以追溯链的形式呈现时,其价值会显著提升:
这与要求模型生成流畅段落来描述"为何"给出答案的方式截然不同。
生成的解释本身可能存在偏差。而锚定于结构化知识的追溯链则可独立接受审查。
传统本体往往针对形式化推理引擎设计,包含大量为支持确定性符号推理而构建的复杂公理。
用于大语言模型的本体可能需要不同的平衡点。
本体仍需保持精确性,但更应便于模型检索、引用和应用。
源文提出:AI友好型本体应聚焦于提供清晰的语义骨架,而非试图编码所有可能的推理步骤。
这种分工模式颇具价值:
这种方法规避了两个极端。
第一个极端是完全非结构化的语言模型工作流,仅通过提示词和文档定义重要概念。第二个极端是过度工程的符号系统,试图形式化每个细节而导致难以维护。
AI友好型本体应追求以下目标:
每个重要类别和关系都应具备简洁无歧义的描述。
关键实体和概念应使用规范标识符,而非仅依赖名称。
定义、事实和规则应记录其来源、所有者、版本及有效期。
概念需包含人类可读的标签、描述、同义词及使用范例。
本体应划分为可管理的模块,便于模型仅检索相关部分。
高价值数据与输出需通过显式约束(如SHACL形状或应用层验证器)进行校验。
因本体变更可能影响模型行为,更新需经审核、版本管理和测试。
应用应保留向模型提供的概念和事实记录。
本体应标识规则不完整、概念模糊或需人工审批的场景。
必要的。
语义层只有在得到维护时才有价值。过时的本体论可能使系统以看似高度组织化的方式持续犯错。
关于J-Space的争论凸显了两个不同目标。
第一个是解释模型本身:其内部表征、回路、计算和行为机制。
第二个是解释模型的影响:哪些信息塑造了输出,哪些规则授权了行动,哪些证据支持了结果,以及谁可以审查或质疑它。
这些目标有所重叠,但并不完全相同。
机制可解释性可能揭示模型在产生误导性输出之前已在内部表征了欺骗。基于本体论的追溯性可能揭示哪个声明是虚假的,哪个来源反驳了它,以及哪个下游流程受到了影响。
第一个帮助研究人员理解内部行为。第二个帮助组织治理现实世界的后果。

因此,一个完整的可解释性方案可能包含多个层面:
本体论工程主要强化信息层和系统层。它也可以通过明确概念、规则和来源来支持影响分析和治理。
它并不能取代神经可解释性。
结构化的知识图谱无法揭示嵌入在模型权重中的隐藏目标。J-Space无法证明源文档是权威的,或业务规则是公平的。
这两种方法解决了问题的不同部分。
打开AI黑箱的比喻可能设定了一个不切实际的目标:完全透明,直至每一个内部权重和计算。
对于前沿模型而言,这可能永远无法像人们想象的那样实际可行。
一个更可实现的目标是让系统的操作在其使用场景中足够可理解、可追溯、可测试和可治理。
这意味着设计系统时需要:
在技术可行的前提下,我们会使用监控手段。

核心转变在于:不再将可解释性视为单一的可视化问题,而是将其作为工程与治理问题来对待。
我们或许永远无法将每一次神经网络计算都完整地翻译成人类可理解的故事。但我们仍然可以构建一个信息架构,使那些影响重大的输出更容易被理解和质疑。
本体工程将这一目标转化为具体工作:
这不如“读懂模型的思想”那样引人注目,但在实际生产中可能更有用。
原始中文文章以对LegionSpace(同富盾相关产品)的推广性提及作为结尾。来源将其描述为围绕本体工程和可追溯推理构建的企业级AI基础设施。
本次改编并未独立评估这些产品宣称,因此不将其用作更广泛论证的证据。
相关的教训具有普遍性:任何声称提供基于本体的可解释性的平台,都应通过具体问题来评估。
一个产品不应仅仅因为使用了知识图谱或展示了推理图,就被认为是可解释的。
J-Space是Anthropic为其通过雅可比透镜识别出的一小部分内部表征所起的名称。研究表明,这些表征可以包含那些可用于报告、推理和因果干预的、可语言化的概念。
不能。Anthropic并未声称其模型能再现人类意识或主观体验。J-Space显示出与全局工作空间理论部分功能上的相似性,但功能上的类比并非拥有类人思维的证据。
内部工具可以显示哪些表征或机制影响了行为,但它们无法自动确定模型的信息是否真实、来源可靠、相关或合理。可解释性还需要证据、语义定义、来源、规则以及对现实世界影响的说明。
本体
本体工程是指在一个领域中,对实体、类别、属性、关系和约束进行形式化定义的实践。在软件系统中,本体通常以RDF和OWL等标准表示,并可通过SHACL进行验证。
本体提供规范的概念和明确的关系,能锚定检索、生成和验证过程。它们有助于将主张与定义好的概念、支撑证据、形式化规则以及记录版本联系起来。
大语言模型可以加速概念提取、关系发现、映射和文档编写,但其建议需要专家审核。全自动的本体生成可能重现源数据错误、合并不同概念或创建无依据的关系。
不能。本体可以约束重要输出并提升可追溯性,但无法消除所有模型错误。可靠的系统还需要检索质量控制、验证、测试、权限管理、监控和人工审核。
它们解决的是可解释性的不同层面,最好作为互补手段。机械可解释性研究模型内部行为,而本体工程则让外部信息、规则和决策路径更易于审查。
《与LLM共同开发工程》](https://arxiv.org/abs/2411.09601):一篇研究论文,概述了利用大语言模型辅助知识图谱与本体开发的机会。
Anthropic的J-Space研究是机械可解释性领域的重要进展。它为研究者提供了一种新方法,用以观察并因果检验Claude中少量可具象化的内部表征。
这项研究并未解决更广泛的解释性问题。理解AI系统还需要阐明其使用的信息、概念的含义、主张背后的证据、行为遵循的规则以及输出结果带来的影响。
本体工程为形式化这些外部结构提供了可行路径。它能支持语义检索、验证、溯源、追踪和问责,尤其在结合人工审查与内部可解释性研究时效果更佳。
可解释AI的真正关键或许不在于选择"打开模型"或"构建外部世界框架",而在于学会两者兼顾。