在 2026 年世界人工智能大会上,模型公司用参数数量填满展厅,而基础设施提供商则展示越来越大的计算集群。然而,在 Qingcheng.ai 的展台,主要吸引力并非单个模型或服务器,而是一张完整图表,展示了代币如何在 AI Agent 全生命周期中被生产、路由、分发、计量和治理。...

在 WAIC 2026 展会上,模型公司用参数数量填满展厅,基础设施提供商则展示日益庞大的计算集群。然而,青城智能展台的主角并非某个单一模型或服务器。
而是一张完整的示意图,展示了 Token 如何在 AI Agent 的完整生命周期内被生产、路由、分发、计量和治理。
青城智能将这一模型称为 Token“前店后厂”。该框架融合了三个层次:
该公司将其架构描述为人工智能时代的电力系统。算力硬件与推理软件充当发电厂,AI Ping 扮演电网角色,而 Agent 工具则是消耗电力的设备。
青城智能展台展示了完整的 Token 生产、路由与治理工作流程。
根据原始报告,该系统旨在解决三个反复出现的问题:模型 API 不稳定、国产异构加速器利用率低下,以及大规模 Agent 部署中缺乏清晰的 Token 核算。
随着 AI Agent 从演示阶段步入生产环境,一个用户请求可能触发多次模型调用。
一个 Agent 可能需要检索文件、搜索数据库、调用工具、生成代码、评估结果、修订计划,再调用另一个 Agent。用户看到的响应只是最终步骤。在其背后,系统可能跨多个服务消耗大量 Token。
原始文章指出了三大基础设施问题,这些问题随着工作流扩展而愈发严重。
模型 API 容量在需求高峰期可能出现波动。
同一请求可能在某一时刻快速响应,而在另一时刻变得缓慢或不可用。在闲聊场景中,短暂的延迟或许可以接受,但在每一步后续操作都依赖前一步响应的多步骤 Agent 工作流中,这种延迟可能导致流程中断。
因此,企业系统需要的不仅仅是访问一个模型。它们需要可预测的延迟、吞吐量、可靠性和输出质量。
许多机构已采购了混合的国产 GPU、NPU 和智算服务器。硬件可能已就位,但要在其上高效部署大型模型仍然困难重重。
vLLM 等流行的推理框架最初针对 NVIDIA 和 CUDA 生态进行了优化。它们虽能支持越来越多的设备,但要将每一项功能和优化适配到不同的加速器架构,仍需大量工程工作。
青城智能认为,原生推理引擎和具备硬件感知能力的软件栈能够从这些集群中提取更多可用的 Token 输出。
当一家公司运营多个 Agent 时,月度模型账单并不总能显示是哪条工作流产生了成本。
单个 Agent 可能调用多个模型,使用
多个供应商、启动子代理并持续运行数小时。如果没有详细的追踪,组织可能难以回答一些基本问题:
清程极智将其三层体系定位为连接生产、分发、应用和计费的一体化基础设施架构。

展览蓝图描绘了从底层计算到Agent应用的工作流程。
该架构围绕一个简单的工业类比构建。
后厂负责将计算硬件转化为Token。商店聚合和路由Token服务。应用节点分发Agent并控制Token的消耗方式。
清程极智的架构连接了Token生产、服务路由和Agent治理。
这三个层级旨在协同工作,而非作为孤立产品存在。
后厂负责将物理计算资源转化为标准化的模型推理能力。
其主要组成部分包括:
清程极智将此层比喻为发电厂。其目标是在降低部署复杂度的同时,从可用硬件中生成尽可能多、稳定且可用的Token。
赤兔是清程极智开源的高性能推理框架。
官方仓库将其描述为一个面向生产、注重效率、灵活性和可用性的引擎。它支持从CPU及单加速器到大规模集群的部署,并对多个国产硬件平台进行了优化支持。
该项目还支持DeepSeek、Qwen、GLM和Kimi等模型,以及标准的OpenAI兼容HTTP接口。

赤兔用于提升异构计算平台上的大模型推理能力。
清程极智认为,将一个围绕单一硬件生态系统设计的框架进行适配,可能类似于用错工具。该公司的类比是:一个为烤面包设计的烤箱,可以被改造……
蒸包,但专用蒸笼可能更有效地利用现有热量。
这种比较虽然简化了,但背后涉及的工程问题真实存在。加速器架构在内存、通信、算子、数值格式、编译和调度行为等方面存在差异。
Chitu 包含硬件特定的优化和低精度推理支持,包括 FP4 和 FP8 配置。
原始报告指出,采用 FP4 部署的 DeepSeek 模型将所需硬件从四台机器减少到一台。
在这种特定配置下,机器数量从四台减少到一台意味着所需机器数量减少了 75%。该文章将这一减少换算为 75% 的成本节约。
报告将 DeepSeek 从四台机器减少到一台的部署归功于 FP4 优化。
这个结果不应被解读为每个 DeepSeek 部署都能普遍降低 75% 成本的保证。
实际节省取决于以下因素:
开源的 Chitu 仓库也指出,性能结果可能因硬件、软件和测试负载而异。
八卦炉是 Qingcheng.ai 用于模型训练、推理、部署、调度和运维的软件栈。
该公司将其作为将复杂的基础设施工作打包成更易于管理的企业级平台的方式。
八卦炉位于异构硬件之上,提供部署和运维工具。
八卦炉旨在减少以下方面所需的手动工作量:
Qingcheng.ai 还与浪潮信息合作,推出了联合优化的 元脑八卦炉一体机。在一项已公布的 Qwen3-32B 测试中,合作方报告称,经过 Chitu 优化后,总推理吞吐量提升了高达 14.45 倍,经过全栈调优后,端到端性能提升了约 10 倍。
这些数据来自合作公司自身的测试环境,与 WAIC 上描述的 DeepSeek FP4 案例并不等同。
后端工厂层旨在管理多种类型的加速器。
原始报告中提到的一项策略是
是将 预填充 和 解码 工作负载进行分离。
在预填充阶段,系统会处理输入提示并构建模型的内部缓存。在解码阶段,系统则逐步生成输出令牌。这两个阶段在内存、带宽和计算特性上有所不同。
异构集群可以将每个阶段分配给最高效处理该阶段的硬件。这种做法有时被称为"预填充-解码分离"。
其目标并非让所有加速器表现一致,而是让不同硬件处理与其优势最匹配的工作负载部分。
一旦令牌生成完毕,应用程序仍需要一种稳定的方式来获取它们。
中间层是 AI Ping,即清程智韵的模型服务评估与API路由平台。
AI Ping 持续监控模型服务,并在多家服务商之上提供统一接口。

AI Ping 评估模型API并在服务商之间路由请求。
原始报告指出,AI Ping 监控以下内容:
该平台旨在降低开发者创建账户、管理不同API格式以及手动对比各服务商的需求。
用户可优先设定目标,例如:
输入一句想法,We0 AI 即可生成展示站、页面与 CMS。发布上线后并帮你获取客户和流量。
用户注册赠送一次完整项目生成
适合先体验一次完整生成流程,快速看到项目初稿。
若未指定偏好,AI Ping 可利用其路由逻辑选择一个可用服务。
静态集成会将每个请求发送到同一服务商,直到开发者更改配置。
动态路由则不同。如果某家服务商变慢或不可用,路由层可将后续请求定向到当前表现更优的其他服务。
这对智能体工作负载很有帮助,因为一次中断可能导致较长任务的失败。
该平台预期的反馈循环如下:
清程智韵表示,统一API使较小的团队也能访问通常需要内部平台团队才能实现的路由与监控能力。
该公司单独报告了通过AI Ping在成本、吞吐量和延迟方面的平均改进。这些百分比为平台公布的结果,根据所选模型、服务商、流量模式及路由策略的不同,实际效果会有所变化。
最终层关注智能体如何...
其Token的分发方式及使用治理规则。
该系统由两大组件构成:
Agent商店被定位为通用型与行业专用型Agent的分发复用层。
其核心价值在于连接Agent开发者与需要可部署工作流的组织机构,同时使这些Agent能够接入更广泛的Token基础设施。
原始报告将其比作连接共享电网的电器市场。在本文档编制时,关于Agent商店定价策略、审核标准、部署格式及商业条款的公开文档仍十分有限。
ATM全称为Agent Token管理器。
清程科技在2026世界人工智能大会上将其作为面向多Agent系统的本地化Token管理与治理工具推出。
该工具提供以下功能:
原始文献指出,ATM可通过行为钩子、本地文件扫描及隐私网关等机制观察Agent活动。
在实际应用中,ATM类似于AI工作负载的"电表"。其目标是将Token计费与产生该消费的Agent、操作、模型及工具进行关联。
这与云成本管理(FinOps)理念高度相关——即云支出的度量与控制学科。在Agent系统中,挑战更为精细,因为单个业务流程可能包含多层嵌套的模型调用。
有效的Agent成本记录需包含:
清程科技将ATM定位为针对此类新型工作负载的Token导向型FinOps层。
原始文章指出,中立性是清程科技的核心优势之一。
大型云计算与硬件企业天然倾向于优先推广自有平台、合作伙伴或投资项目。因此,运营混合集群的组织更倾向于选择支持多种竞品加速器与服务供应商的独立软件提供商。
清程科技声称其平台不绑定单一芯片供应商。
这一理念体现在赤兔对多种硬件环境的支持能力,以及AI品多供应商路由模型上。
中立性仍需在实践中验证。客户应审视以下要素:
该公司的技术背景构成其另一项定位优势。
清程科技成立于2023年12月,核心团队源自清华大学计算机系高性能计算研究所。
公司表示,该团队曾为超算中心和智算中心开展性能评估与优化工作。
清程AI也将Token服务视为国内算力触达海外用户的一条可行路径。
其逻辑在于:开发者无需知道是哪个加速器生成了响应。开发者购买模型API,就能获得Token。
如果国产硬件能够稳定高效地支撑起具有竞争力的模型,那么其输出便可以通过统一的API进行销售,境外客户无需部署或了解底层的硬件架构。
清程AI将Token服务视为一种在全球范围内分销国内算力的方式。
原始报告指出,海外开发流量高峰期通常位于北京时间晚上10点至次日上午8点。
这就创造了一个潜在的利用率机会。那些在国内非高峰时段闲置的算力,可以用来服务其他时区的用户。
文章中描述的工作流程是:
这并未消除国际服务交付的常规要求。服务提供商仍需处理延迟、合规性、数据治理、模型许可、计费、技术支持以及区域可用性等问题。
在AI展览上,最显眼的产品往往是模型和应用。
基础设施得到的关注较少,因为其大部分工作发生在用户界面之下。它决定了模型能否稳定运行,Agent能否完成任务,以及最终成本是否清晰可理解。
清程AI的“前店后厂”概念串联起三个问题:
“后厂”结合了硬件、Chitu和八卦炉。“前店”使用智评来评估和路由模型服务。应用节点则使用Agent Store和ATM来分发Agent并管理其Token用量。
电网的类比并非技术标准,但它为企业提供了一种理解全栈架构的实用视角。
该架构不将每个模型API、加速器集群和Agent视为孤立的产品,而是将其视为Token供应链中相互连接的组成部分。
这是一个覆盖Token生产、API路由和Agent应用的三层AI基础设施模型。“后厂”使用算力硬件、Chitu和八卦炉;中间层使用智评;应用层则包括Agent Store和ATM。
Chitu是一个开源的、面向生产环境的大模型推理框架。它支持多种国产及国际加速器平台、多种部署规模、低精度推理以及兼容OpenAI的HTTP服务接口。
接口。
并未发布通用的 75% 降本承诺。该数据源于某个特定 FP4 部署场景——该配置下服务器需求从四台降至一台,即机器数量减少 75%。
可以。赤兔官方仓库已提供适配昇腾、海光、MetaX 等多种硬件环境的 Dockerfile,并附有通用安装与部署文档。
AI Ping 用于监控和对比模型 API 服务,并根据成本、速度、可靠性或质量等目标进行请求路由。它在多家服务商之上提供统一 API。
Agent Token Manager(简称 ATM)是清程 AI 为 Agent 系统设计的令牌治理工具,用于追踪使用量、分摊成本、管理凭证、设置限额、隔离工作负载,并在异常消耗时向团队发出告警。
八挂炉是更广义的软件栈,而非仅限推理引擎。它涵盖训练、推理部署、调度、监控、应用交付及集群运维等领域,而赤兔负责核心模型推理层。
该结果由清程 AI 及原始报告提供。独立复现所需的具体部署细节尚未完整公开,建议读者自行在自有模型、硬件及工作负载上测试。
软件栈。
在2026年世界人工智能大会上,清程AI展示了三层Token基础设施,旨在连接模型推理、API路由、智能体分发及成本治理。
后端工厂层采用赤兔与八股炉,优化异构计算硬件上的模型部署。据公司报告,在FP4 DeepSeek配置下,所需机器数量从四台降至一台,实现75%的成本缩减。
AI Ping构成中间路由层,而智能体商店与ATM覆盖智能体分发及Token财务运营。各产品共同致力于使Token供应更稳定、可量化,且不依赖单一硬件或API提供商。
核心理念简洁明了:AI智能体需要的不仅是模型——它们需要一个能够生成、路由、计量并控制所消耗每个Token的基础设施层。
从一句话开始,几分钟内拿到完整网站。