引言
WAIC 2026将上海变成为中国快速扩张的AI计算产业的展示窗口。本届展会汇聚了108款芯片和200余款智能计算产品,涵盖加速器、超级节点、集群系统、软件栈、科学计算平台及行业解决方案。
竞争格局已然改变。
前几年,厂商往往以单卡峰值性能作为宣传重点。而今年,系统架构、大规模协同、互联效率、软件迁移和完整部署能力成为反复出现的关键词。
随着模型规模扩大、智能体系统状态增强、科学智能(AI for Science)工作负载对通用计算和加速计算的双重需求提升,孤立芯片的价值越来越难以与周围系统割裂开来。
在张江的太初元基展台,该公司展示了一款新型异构众核芯片及一套围绕所谓"AI与HPC融合"理念设计的大型超级节点系统。
核心产品包括:
- HCU异构融合计算架构
- 全新 T2 Ultra 处理器
- HyperIntelliX 大规模计算系统
- 升级的开发者社区与迁移工具链
- 自主研发的AI4Science计算平台
- 多边全领域大模型安全体系
该公司的观点直白明了:市场不再仅仅决定国产芯片能否运行模型,而是评估完整平台能否支持多样化工作负载、能否扩展至大规模集群、能否降低迁移成本、能否在生产环境中保持稳定。
架构优先于单卡性能
太初元基CEO杨晋哲将行业现状描述为从单卡竞争转向系统级竞争。
这种转变反映了工作负载本身的变化。
大模型已跨越万亿参数门槛。智能体系统需要更复杂的规划、调度、内存管理和工具协同。科学智能应用则增加了高吞吐量数值计算、长时运行任务及严格的双精度要求。
当周边CPU、内存、通信链路、存储和调度软件无法跟上时,单纯增加加速卡数量可能产生边际效应递减。
相关目标已不再是单纯的最大理论算力,而是降低整个系统中有用计算的实际成本。
其他WAIC参展商也展示了类似的系统级策略,包括华为的Atlas 950 SuperPoD、沐曦的Xijing超级节点系统,以及阿里巴巴的凌骏真武基础设施。
太初元基的解决方案是其HCU架构,即异构融合计算架构的简称。
该架构将通用CPU资源与专用AI计算核心置于同一高速总线上。它支持可配置的M:N比例,使CPU与加速器资源之间的平衡能够随工作负载动态调整。
在提出的分工方案中:
- CPU端负责智能体调度、工作流控制、数据预处理等通用任务。
- XPA计算阵列专注于大模型训练与推理。
- 共享分层内存动态管理冷热数据。
- 系统根据任务需求改变资源平衡,而非依赖固定的CPU与加速器配置。
从实践角度看,该设计将两种计算资源整合于同一架构内,使系统能够更灵活地分配资源。
其潜在优势在于混合工作负载下的更高利用率。系统无需为每个控制密集型任务动用高吞吐AI阵列,也无需在需要大量调度与协调的工作负载中依赖较小规模的主机CPU。
异构众核计算对智能体的意义
传统AI服务器通常采用一颗CPU搭配四到八颗GPU或AI加速卡。
在这种设计中,CPU通常充当主机角色:启动任务、管理数据移动、处理操作系统工作并协调加速器。
当加速器执行绝大部分计算且控制路径相对简单时,这种模式运行良好。
智能体AI打破了这一平衡。
一个高效的智能体可能需要:
- 解读目标
- 拆分为子任务
- 选择工具
- 规划并调整工作流
- 读写外部数据
- 维护长期记忆
- 协调多个模型或子智能体
- 从失败动作中恢复
- 管理权限与审批
- 在长时间会话中持续执行
其中许多操作依赖通用计算而非密集矩阵乘法。
来源文章援引行业预期:历史上CPU与GPU的多对一比例,在未来某些节点可能趋近一对一,而在智能体密集型工作负载中,CPU需求可能进一步上升。
阿里云也曾将智能体描述为有状态调度与无状态执行的结合,这要求更精细的资源控制。
Tecorigin的HCU架构旨在从处理器层面应对这一转变。
通过将CPU资源与AI核心通过同一高速互连结构连接,该公司旨在降低与完全分离的主机-加速器设计相比的数据传输开销。
理论优势能否转化为实际成效,取决于真实应用性能、编译器质量、内存行为、调度策略、能效及系统利用率。
T2 Ultra:单处理器,双工作模式
天钧(Tecorigin)推出的T2 Ultra,是首款基于其全新HCU架构的处理器。
其最显著的特点在于双模设计。
自主计算模式
在自主计算模式下,T2 Ultra可作为完整的计算节点运行,而不仅仅是充当一个附加加速器。
这使得它适用于:
- 边缘部署
- 小型研究系统
- 工作站
- 独立计算节点
- 在需要独立主机架构会增加复杂性的环境中
加速计算模式
在加速模式下,T2 Ultra与主机系统协同工作,在更大的服务器或集群中充当高吞吐量计算引擎。
该模式支持:
- 大模型训练
- 大规模推理
- 多卡服务器
- 超级节点
- 科学计算集群
- 数据中心部署
因此,同系列处理器可在多种基础设施角色中发挥作用。
公布的T2 Ultra规格
天钧及原始报告列出了以下峰值规格:
| 精度或特性 | 公布规格 |
|---|---|
| FP64 HPC算力 | 38 TFLOPS |
| FP16稀疏算力 | 1,200 TFLOPS |
| FP4稀疏算力 | 4,800 TFLOPS |
| 精度覆盖范围 | FP64至FP4 |
| 芯片间互联带宽 | 800 GB/s |
| 工作模式 | 自主计算与加速计算 |
| 单系统最大直连数量 | 高达128卡 |
以上为供应商提供的峰值数据。
FP64性能对于需要双精度计算的科学和工程应用尤为重要。FP16和FP4则面向AI训练与推理,在模型和精度要求允许的情况下,使用低精度格式可提升吞吐量。
稀疏算力数据同样假设工作负载及软件能利用所支持的稀疏化模式。在未确认基准测试方法前,不应将其与密集算力直接比较。
T2 Ultra的实际价值取决于:
- 持续的应用性能
- 内存带宽与容量
- 集群扩展效率
- 低精度下的准确性
- 软件支持
- 可靠性
- 功耗
- 生产供应情况
- 每完成工作负载的成本
双模架构可能为需要多种部署规模的客户减少硬件碎片化问题,但仍需验证目标工作负载的适配性。
HyperIntelliX:融合智能计算与超算
如果说T2 Ultra是计算引擎,那么HyperIntelliX便是基于它构建的大规模平台。
天钧将HyperIntelliX定位为融合以下能力的全国产计算系统:
- 面向模型训练与推理的智能计算
- 面向数值模拟的高性能计算
- AI4Science工作流
- 大规模互联
- 液冷模块化基础设施
- 共享软件与资源管理
![图片展示了Tecorigin T2 Ultra
- HyperIntelliX超智融合平台,强调其面向AI4S的新一代全国产智算+超算融合计算系统,适配万亿参数大模型训推与AI4S科学计算。左侧是平台的外观图,右侧以表格形式呈现其关键参数,包括超节点规模128卡、推理算力614PB、训练算力307PB、HPC算力4.8PB、内存容量18.4TB、内存带宽512TB/s、互联带宽102.4TB/s]
4TB/s、16个计算节点、8个交换节点,运行模式支持自主计算和加速计算两种模式。](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/0cf00195-6d6f-494c-b802-71d1354bd2dd-155674a0-c083-4fa4-92f3-c1640b85e6b8.jpeg)
该公司表示,该系统采用液冷模块化设计,目标PUE低于1.1,并可通过光互连扩展至包含多达10万张卡的集群。
它旨在用一个硬件家族同时运行万亿参数模型工作负载和科学计算应用。
这就是超算与智算融合的核心含义。
传统AI集群通常针对张量运算、模型训练或推理进行优化。传统超级计算机则可能优先考虑FP64、MPI风格的工作负载、大型数值模拟以及持续的并行性能。
AI for Science正越来越多地将两者结合起来。
一个研究工作流可能使用传统模拟生成数据,训练神经替代模型,运行AI辅助预测,再回到数值验证。为每个阶段维护独立的基础设施会造成硬件、软件和运营成本的重复。
HyperIntelliX旨在为这两类应用提供一个统一的底层平台。
称其为业界首个大规模智算与超算融合平台的说法源自该公司和原始报道。分类标准取决于如何定义竞品系统和先前部署,因此不应将其视为独立确立的市场排名。
该平台不仅适用于大模型
太初元碁强调,HyperIntelliX并不局限于通用AI训练和推理。
该公司展示了三个代表性领域的AI for Science项目:
- 全球天气预报可视化
- TecoQSim经典量子模拟器
- 大规模虚拟药物筛选
这些工作负载对典型聊天机器人或检索应用提出了不同需求。
科学计算通常需要:
- 高并发
- 高数据吞吐量
- 长时间运行的任务
- 稳定运行数小时或数天
- 双精度运算
- 大型分布式内存系统
- 专用数值计算库
- 可重复的结果
- 与现有研究代码的集成
太初元碁团队的背景包括参与获得戈登贝尔奖(高性能计算领域最负盛名的奖项之一)的系统和项目。
这些经验支持了该公司进军AI for Science的决策,尽管团队的历史成就并不能独立证明新产品的性能。
生命科学
太初元碁官方AI for Science资料中描述的工作包括:
- 与百度飞桨和神威团队合作,对AlphaFold3进行国产化复现
- 适配与
山东大学对UCSF DOCK 3.7的优化
- 与湖南大学共同开发CrossDNA
这些项目针对蛋白质结构预测、分子对接、虚拟药物筛选及基因组语言建模。
天气与气候
太初(Tecorigin)与百度的科学计算团队合作开发了国内天气系统,可可视化温度、风力、降雨量及台风轨迹。
天气预报需要处理大规模时空数据集,并能将数值模型与机器学习系统相结合。
量子模拟
太初与清华大学团队共同开发了TecoQSim,这是一款面向量子系统的经典模拟器。
该平台利用复杂张量收缩与高性能数值计算,在传统计算硬件上模拟量子行为。
流体力学与材料学
该公司还描述了在计算流体力学、科学多模态模型、材料学、化学及其他结合模拟与人工智能领域的实践。
这些合作展示了该平台的预期应用范围。各项目的性能数据仍取决于其具体配置与评估方法。
生态迁移是国产计算的最大难点
若开发者无法将工作负载迁至新硬件,仅靠强大硬件是不够的。
太初在世博人工智能大会上发布了两款生态产品,旨在降低迁移成本。
首款产品为AI开发者社区2.0。
该公司表示,该平台支持以下主要训练与推理系统:
- Megatron-LM
- DeepSpeed
- PaddlePaddle 与 PaddleHelix
- PyTorch
- vLLM
- SGLang
- Transformers
- LLaMA-Factory
工具链覆盖以下环节:
- 模型分析
- 迁移
- 算子开发
- 编译
- 性能优化
- 精度调试
- 部署
- 运行时管理
幾分鐘搭建展示站並增長獲客
輸入一句想法,We0 AI 即可生成展示站、頁面與 CMS。發佈上線後並幫你獲取客戶和流量。
用戶註冊贈送一次完整項目生成
適合先體驗一次完整生成流程,快速看到專案初稿。
第二款产品是一款全新的国产AI4Science计算平台。
该平台针对科学计算负载特性,集成了:
- 计算资源调度
- 作业管理
- 开发环境
- 科学计算套件
- 太初编程模型
- 通用与领域专用加速库
- 算子生成工具
- 编译器优化
- 性能分析
根据官方产品页面,该平台支持主流及国产CPU,包括龙芯、申威、飞腾、x86及
其他系统。
它还支持包括以下框架:
- PyTorch
- JAX
- PaddlePaddle
- MindSpore
- vLLM
配套的DevKit旨在降低编写和优化算子的成本。
为何迁移需要时间
一个能成功启动的模型,未必能达到生产就绪状态。
迁移可能需要在多个层面开展工作:
- 替换不支持的算子
- 移植自定义内核
- 更新构建系统
- 转换模型格式
- 验证数值精度
- 复现基线结果
- 提升内存效率
- 优化通信机制
- 调整并行策略
- 测试故障恢复
- 更新监控与部署工具
原文引用行业估算,完整适配需三至六个月,其中性能优化约占工作量的60%。
该估算并非普遍适用。使用支持算子的标准模型迁移速度可能更快,而大型定制研究代码则需更长时间。
关键在于,迁移成本衡量的是工程耗时与运营风险,而非仅仅是软件安装。
两大生态战略
原文将国内加速器生态分为两大类。
兼容导向型生态
该路径力图保留熟悉的开发模式,并尽量减少对现有工作负载的改动。
厂商可提供自研编译器、运行时、算子库及迁移工具,同时支持广泛使用的框架与编程模型。
优势在于降低切换摩擦。
风险在于,与成熟且快速演进的生态系统保持完全兼容难度较大。在高级工作负载中可能出现细微的语义或性能差异。
独立型生态
第二条路径构建更独立的软件环境,例如华为昇思(MindSpore)与昇腾(Ascend)技术栈所对应的生态。
这能围绕自身硬件实现更深度的控制与优化。
代价是开发人员可能需要学习新工具,或对工作流程进行更大范围的修改。
中科加禾(Tecorigin)的公开资料显示其更接近兼容导向型路径。其官网描述支持主流模型与框架,并称其软件栈可适配40多个模型系列。
原文估算该路径可覆盖80%至90%的主流场景。这一范围是厂商或行业的大致描述,并非保证每个工作负载都能无改动迁移。
构建AI4Science生态
中科加禾的生态工作包括与高校、研究机构及企业的合作。
原文列出以下案例:
- 与清华大学合作的TecoQSim
- 与本源量子(SpinQ)合作打造的量子-超算-智算平台
- RiverONE适配与龙芯平台验证
- 支持清华大学智能产业研究院(AIR)的AtomWorld基础设施
- 与飞桨(PaddlePaddle)及神威团队复现AlphaFold3
- 与湖南大学合作的CrossDNA
- 与山东大学合作的分子对接优化
- 与百度飞桨合作的AI4Science解决方案
- 国产天气计算平台
与百度科学计算团队合作的应用
- 与东润合作开展能源计算工作
- 适配上海人工智能实验室的Intern-S1科学多模态模型
太初元算官方网站证实了上述多个项目,并描述了超过40种适配模型系列,涵盖语言、多模态、代码及AI4Science应用场景。
该消息源还指出,该公司已与超过100所高校、研究机构和行业合作伙伴展开合作。
合作伙伴数量和适配总量均为公司自行报告的数据。这些数据彰显了生态活跃度,但本身并不能证明每个部署的深度、生产规模或商业成功。
核心战略依然明确:
芯片是进入市场的钥匙,但软件和应用生态决定了平台能否持续发挥价值。
全领域大模型安全系统
本届WAIC还发布了由七家机构共同构建的全领域大模型安全系统:
- 河南空港智算中心
- 瑞莱智慧
- 太初元算
- 安势信息
- 清源智迁
- 点数科技
- 数安信
消息源将该系统描述为一个分层架构。
底层是国产可信计算基础。之上是集成评估与治理平台。上层涵盖:
- 大模型安全评估
- 数据合规
- 数据安全
- 软件供应链安全
- 安全培训与教育
这看似与处理器和集群性能无关,但安全正日益成为基础设施就绪度的关键组成部分。
政府、金融、医疗及其他受监管行业不能仅因模型运行速度快就进行部署。它们需要涵盖数据、权限、软件组件、模型行为、审计和合规等方面的管控。
该联合安全体系的价值将取决于其标准、覆盖范围、测试方法、集成质量以及独立验证。
分层示意图并不等同于可操作的安全保障。
三层基础设施战略
该消息源将太初元算在本届WAIC的展示组合概括为三个相互关联的层面。
底层:硬件与计算系统
- HCU异构融合计算架构
- T2 Ultra处理器
- HyperIntelliX计算系统
- 大规模互联
- 液冷集群基础设施
中间层:开发者与AI4Science平台
- AI开发者社区2.0
- 框架适配
- 算子开发
- 编译器与性能工具
- AI4Science平台
- DevKit与加速库
上层:安全与行业应用
- 全领域大模型安全
- 科研合作
- 气象、量子、生命科学、材料等计算负载
- 企业与公共部门部署
各层级之间相互强化。
没有软件支持的芯片,其应用范围有限。没有可靠硬件支撑的软件,则无法发挥性能。两者若缺乏治理与安全保障,都难以在敏感行业部署。
因此,中科弧光(Tecorigin)的定位并非单一的替代型加速器供应商,而是更广泛的人工智能基础设施栈的构建者。
2026世界人工智能大会(WAIC)是对国产计算成熟度的一次检验
消息源将中科弧光置于一个更大的国产芯片市场中,该市场还包括华为昇腾、寒武纪、沐曦、海光等厂商。
对比中的多项数据——包括生产目标、收入增长、市值以及模型适配数量——具有时效性,均来自公司声明或财务报告。这些数据对于评估中科弧光的架构并非必要,且可能快速变化。
更具持久性的观察是,国产人工智能计算正从政策驱动的采用,转向更强的市场检验。
客户越来越多地追问:
- 硬件能否大规模交付?
- 大型集群能否保持稳定?
- 软件是否支持当前主流模型?
- 迁移需要多长时间?
- 每项工作负载的实际成本是多少?
- 工程师能否诊断问题?
- 模型升级后性能是否依然保持?
- 平台对于受监管数据是否足够安全?
- 供应商能否在系统整个生命周期内提供支持?
中科弧光的差异化之处在于,它试图通过一个统一的架构来支持人工智能与科学计算。
机遇是明确的:AI4Science工作负载既需要高精度数值性能,也需要现代人工智能加速能力。
挑战同样清晰:公司必须证明:
- 可靠的大规模生产
- 稳定的万卡与十万卡部署
- 高利用率
- 强大的软件兼容性
- 可复用的模型适配
- 有竞争力的总拥有成本
- 可持续的技术支持
- 独立的性能验证
从"可用"迈向"易用",是任何替代性计算生态系统都必须迈出的决定性一步。
真正的竞争在于系统完备性
2026年世界人工智能大会表明,依赖单一峰值计算性能的时代正在终结。
现代人工智能基础设施需要协调:
- 通用计算
- 加速计算
- 内存
- 互联
- 存储
- 散热
- 编译器
- 框架
算子库
- 集群调度
- 模型适配
- 科学计算软件
- 安全与治理
T2 Ultra 是天数智芯在芯片层面的最新答案,HyperIntelliX 是其系统级答案,开发者平台与 AI4Science 技术栈构成生态答案。联合安全架构旨在解决敏感环境部署需求。
该产品矩阵雄心勃勃,诸多技术主张仍需经过生产级规模验证。
即便如此,它已展现出正确的竞争单元。
未来国产计算格局的胜负,不取决于哪家公司在展会上展示的理论峰值最高,而取决于哪套系统能稳定运行高价值负载、高效迁移软件生态,并实现部署后的经济可持续性。
常见问题
什么是天数智芯 T2 Ultra?
T2 Ultra 是基于 HCU 架构的新一代异构众核处理器,支持自主模式与加速器模式,覆盖 FP64 至 FP4 精度格式。
什么是 HCU 架构?
HCU 即异构融合计算架构,将 CPU 资源与 AI 计算核心置于共享高速互联网络,可根据不同负载动态调整二者配比。
什么是 HyperIntelliX?
HyperIntelliX 是天数智芯面向 AI 与高性能科学计算推出的融合大规模计算系统,以 T2 Ultra 为核心,融合液冷、大规模互联及共享软件平台。
T2 Ultra 为何支持 FP64?
FP64 对需要高数值精度的科学仿真与工程计算至关重要。该支持使处理器能兼顾 AI4Science 与传统 HPC 应用,而非仅聚焦低精度 AI 推理。
天数智芯硬件能否运行主流 AI 框架?
官方资料显示支持 PyTorch、PaddlePaddle、Megatron-LM、DeepSpeed、vLLM、SGLang、Transformers、JAX、MindSpore 等框架与工具。具体支持深度与迁移工作量因模型和算子而异。
什么是天数智芯 AI4Science 平台?
该平台是融合科研计算平台,整合国产硬件、作业调度、开发环境、编程模型、科学计算库、算子工具及框架支持,覆盖生命科学、气象、量子模拟、流体力学、材料科学等领域。
T2 Ultra 的性能数据是否经过独立验证?
发布材料中的 FP64、FP16、FP4 峰值性能、互联及扩展规格由厂商提供。完整对比需依赖独立应用基准测试与生产部署数据。
什么是全域大模型安全体系?
该体系于 2026 年 WAIC 发布,是融合国产可信计算与模型评估、治理、数据合规、数据安全、软件供应链安全及训练安全的多方安全架构。
相关工具
org/): 一个广泛使用的开源框架,用于模型训练、研究和部署。
- Megatron-LM: 英伟达(NVIDIA)开发的开源框架,用于大规模训练Transformer模型。
- DeepSpeed: 微软(Microsoft)的开源系统,支持分布式模型训练和推理优化。
- vLLM: 一个高吞吐量的开源大语言模型服务引擎。
- JAX: 用于机器学习和科学计算工作负载的数值计算框架。
相关链接
- 天数智芯官网: 公司、产品、解决方案和生态系统信息的官方平台。
- 天数智芯产品与技术概览: 异构架构、硬件系统、软件栈、支持模型及计算管理的官方信息。
- 天数智芯AI4Science平台: 国产AI4Science平台、编程工具、支持框架及研究案例的官方详情。
- 天数智芯文档中心: 天数智芯产品及生态项目的技术文档和案例研究。
- 天数智芯开发者平台: 模型资源与开发者生态系统入口。
- WAIC 2026产品报道: 专门报道T2 Ultra、HyperIntelliX、AI4Science平台及大模型安全系统的文章。
- 国家科技创新中心报告: 政府官方网站对天数智芯在人工智能、气象、生物及智算中心部署情况的概述。
总结
天数智芯在WAIC 2026上发布的产品,将全新的HCU异构架构、T2 Ultra处理器、HyperIntelliX融合计算系统、开发者工具、AI4Science平台以及分层安全体系融为一体。
这项策略回应了AI基础设施领域的现实变革。智能体工作负载对通用协调能力的需求更高,而科学AI则需要高精度数值计算、长周期运行任务及可扩展的并行系统。
虽然该架构及厂商公布的规格令人期待,但其生产可用性、软件成熟度、集群稳定性、应用性能及总运营成本仍有待更广泛的验证。
天数智芯此次发布的意义,并非单一芯片的规格参数,而在于它试图为人工智能、智能体、科学计算、软件迁移及安全部署构建一整套完整的计算基础。



