For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/zh/articles/gpt-6-astra-unitree-g1-homebody-kitchen-r-56df14d6.md.
斯坦福大学与加州理工学院的 HomeBody 项目将 GPT Astra 与 Unitree G1 人形机器人连接起来,使其能够探索陌生厨房、建立空间记忆、重建数字孪生,并通过调用可复用的导航与操作技能完成长时任务。本文介绍其三步工作流、System 2/System 0 架构、...

具身 AI 的最新进展,并不是又一次桌面机器人手臂演示。
现在,一台 Unitree G1 人形机器人已经能够探索陌生厨房,记住物品所在的位置,清理房间另一端的物品,打开抽屉,取出已经不可见的药品,并将药品递给人类。
这个项目名为 HomeBody,由斯坦福大学和加州理工学院的研究人员开发。
它的核心想法出人意料地简单:
让前沿视觉语言模型把机器人技能当作工具使用。
HomeBody 不要求模型输出每一个关节指令,而是让 GPT Astra 理解任务、决定下一步应该做什么,并调用可复用的导航、抓取、放置、开抽屉和取物技能。
这使模型成为高层规划器,而不是底层电机控制器。
最终形成的机器人工作流,比通常的“看到物体、抓取物体、停止”模式具有更长的任务链路。
在厨房演示中,机器人首先探索环境并建立持久化空间记忆。随后,它重建数字孪生,将该表示与真实房间对齐,并利用记忆中的观察结果完成后续指令。
例如,用户可以说:
“整理一下厨房。把咖啡袋放到中岛上,并把变质的纸盒扔掉。”
随后,G1 会在不同位置之间移动,收集咖啡袋,并丢弃指定的纸盒。
第二个任务更能说明问题:
“我忘了拿药,你能帮我取过来吗?顺便把坏掉的纸盒也扔掉。”
用户提出请求时,药品并不可见。
HomeBody 会搜索已存储的空间记忆,回忆之前观察到药品的抽屉,移动到那里,打开抽屉,取出药品,将其递给用户,同时继续完成丢弃纸盒的任务。
这才是关键变化。
机器人不再只对摄像头当前看到的内容做出反应。它正在结合当前感知、记忆中的观察结果、房间几何结构、导航、操作和任务排序,在整个空间内完成任务。

HomeBody 的核心设计可以用一句话概括:
GPT Astra 通过结构化工具调用选择并编排机器人技能。
模型负责理解用户目标,并决定下一步需要发生什么。
机器人技术栈则负责处理物理细节。
简化后的流程如下:
用户指令
↓
GPT Astra / System 2
↓
选择技能 + 目标
↓
导航 / 抓取 / 放置 / 打开抽屉 / 从抽屉中抓取
↓
感知 + 运动规划 + 底层控制
↓
执行结果
↓
将结果返回给 GPT Astra
↓
选择下一步动作
不过,在机器人能够从陌生厨房中取回物品之前,它需要的不只是技能库。
它还需要知道厨房是什么样子,以及记忆中的物品位于何处。
HomeBody 分三个阶段建立这些上下文。
第一条指令有意设计得非常简单:
你是一台厨房机器人,请探索这个空间!
随后,GPT Astra 选择有用的观察视角,并引导 G1 穿过房间。
在探索过程中,HomeBody 会收集多种数据,包括:
摄像头显示房间中的内容。
LiDAR 和其他传感器提供测量得到的空间结构。
SLAM,即同步定位与地图构建,帮助机器人在建立地图的同时估计自己在地图中的位置。
关键在于持久性。
当 G1 转身离开某个物体时,相关信息不会随着摄像头视野消失。
HomeBody 会存储观察结果,并将其与位置关联起来,以便后续任务检索。
因此,即使药品当前藏在抽屉中,或者位于机器人视野之外,诸如“把我的药拿来”这样的请求仍然可以执行。
仅靠探索还不够。
接下来,HomeBody 将 GPT Astra 用作 Real2Sim 智能体,在 NVIDIA Isaac Sim 中创建环境的数字重建。

数字孪生充当厨房的空间模型。
它为系统提供以下结构化表示:
重要的是,重建并不只依赖外观。
HomeBody 还会将测量得到的 SLAM 几何信息输入 Real2Sim 流程。
这使重建结果受到真实世界尺寸约束。
这很重要,因为具有视觉吸引力的重建并不足以支持机器人运行。
机器人必须知道通道是否真的足够宽,身体是否能够足够靠近抽屉,以及手臂是否能够在不与环境碰撞的情况下够到目标。
随后,系统会在共享坐标系中,将现实世界的 SLAM 地图与重建出的仿真环境对齐。
存储的摄像头观察、语义描述和机器人位置,就可以与房间中的实际地点关联起来。
因此,HomeBody 保存的并不只是:
我看到过一个药瓶。
而是更接近下面的信息:
我在这个抽屉里看到过药品,
它位于这个已记忆的位置,
并且处在共享房间坐标系中。
这正是后续取物成为可能的原因。
完成探索和重建后,用户可以下达日常任务。
例如:
整理一下厨房。
把咖啡袋放到中岛上,
并把变质的纸盒扔掉。

在每个阶段,GPT Astra 都可以考虑:
然后,它会选择下一个技能和目标。
药品演示说明了这一点的价值。
用户并没有指定抽屉的位置。
模型可以回忆之前的观察结果,导航回正确区域,打开抽屉,取出药瓶,将其递给用户,然后继续执行剩余的清理指令。
任务持续时间足够长,以至于任何单个摄像头画面都不包含完成任务所需的全部信息。
这正是持久化空间记忆发挥价值的地方。
这是 HomeBody 最重要的架构细节。
当人们听到“GPT 控制人形机器人”时,很容易想象语言模型直接输出每一个关节角度。
但 HomeBody 并不是这样工作的。
RoboCurve 等早期工作展示了前沿模型如何通过观察摄像头图像和机器人状态,使用指定夹爪位置、方向以及开合状态的工具来控制机器人手臂任务。
HomeBody 运行在更高的抽象层级。
模型调用的是完整的可复用技能。
项目将常见的人形机器人技术栈概念性地划分为三个层级:
传统的学习型动作架构可能如下所示:
System 2 VLM
↓
System 1 VLA
↓
System 0 全身控制器
HomeBody 改变了这一流程的中间层。
它不要求学习型 VLA 将高层意图转换为动作,而是让 VLM 直接调用可组合的技能库。

最终结构更接近:
System 2 VLM
↓
技能库
↓
运动规划 + 感知
↓
System 0 全身控制
HomeBody 当前的技能词汇包括:
| 技能 | 高层模型提供的内容 | 技能负责的内容 |
|---|---|---|
| 导航 | 目标位置和方向 | 路径规划与行走执行 |
| 抓取 | 图像点和手的选择 | 分割、深度、抓取姿态、手臂轨迹和重试 |
| 放置 | 手和三维释放目标 | 将手中的物体移动到目标位置并释放 |
| 打开抽屉 | 抽屉/把手目标 | 对齐、钩取姿态和向后拉动序列 |
| 从抽屉中抓取 | 打开抽屉内的物体目标 | 伸手、抓取、抬起和局部重试逻辑 |
所有技能都共享目标和执行结果接口。
模型不需要理解每项技能的内部底层实现。
它只需要决定运行哪项技能,以及技能的目标是什么。
对于抓取动作,GPT Astra 会在第一视角摄像头图像中选择一个点,并决定使用哪只手。
接下来由技能栈接管。
根据 HomeBody 的实现:

换句话说:
GPT 决定抓取什么
以及使用哪只手。
机器人技能决定
手如何在物理空间中到达那里。
这种分离让前沿模型专注于推理和任务排序,而不是承担实时电机控制责任。
物理世界充满噪声。
当机器人靠近物体时,物体可能会在摄像头图像中发生位移。
抓取动作可能在没有接触物体的情况下闭合。
机器人可能需要调整站姿。
因此,HomeBody 不要求 GPT 每次微小修正都重新做出决策。
项目使用分割技术,以及结合 SAM 2.1 跟踪和 SAMURAI 风格记忆选择的方法,在不同帧之间跟踪目标。
随后,视觉伺服可以在局部修正对齐误差。
如果抓取失败,技能可以尝试另一个抓取候选点,或者重新调整位置并规划。
这些局部重试受到边界限制。
当局部技能无法继续恢复时,它会将失败原因返回给 GPT Astra。
随后,VLM 可以选择另一个目标、重新定位机器人,或改变高层计划。
流程变为:
做出决策
↓
执行技能
↓
观察结果
↓
如果可行则局部重试
↓
将结果返回给 GPT Astra
↓
必要时重新规划
这使多个技能能够串联成更长的序列,例如:
导航到抽屉
→ 打开抽屉
→ 取出药品
→ 导航到人旁边
→ 递出药品
→ 找到纸盒
→ 扔掉纸盒
即使高层规划器选对了技能,人形机器人在行走和伸手时仍必须保持平衡。
HomeBody 使用预训练的 **AMO(自适应运动优化)**进行考虑上半身状态的下肢控制。
输入一句想法,We0 AI 即可生成展示站、页面与 CMS。发布上线后并帮你获取客户和流量。
用户注册赠送一次完整项目生成
适合先体验一次完整生成流程,快速看到项目初稿。
该控制器在协调行走的同时,处理上半身目标。
根据项目页面,手臂和手部指令以 250 Hz 运行,而 AMO 策略每五个控制周期更新一次,即以 50 Hz 更新。
这也是为什么“无需额外训练”需要结合上下文理解。
新厨房不需要重新训练特定环境的动作策略。
但系统底层仍然依赖此前训练和工程化的组件。
HomeBody 最有力的主张之一,是它能够进入一个此前未见过的厨房,而无需收集该环境的专属训练数据,也无需为该房间学习新的动作策略。
这具有实际意义。
传统机器人部署通常需要示范、策略训练或针对环境的调试,机器人才能可靠行动。
而 HomeBody 将以下能力组合起来:
这将一部分适应成本从重新训练转移到了推理 + 建图 + 可复用工具上。
完整的 HomeBody 流程可以概括如下:

探索陌生房间
↓
收集第一视角观察 + SLAM + 姿态
↓
使用 Real2Sim 构建数字孪生
↓
对齐现实与仿真的坐标系
↓
存储空间观察结果
↓
接收日常指令
↓
GPT Astra 选择技能 + 目标
↓
本地机器人技术栈执行
↓
返回结果
↓
持续执行直到任务完成
这项研究演示令人印象深刻,但它并不等同于购买一台 G1、输入 API 密钥,就能得到一台家用机器人。
当前的 HomeBody 技术栈仍然需要大量机器人基础设施。
研究人员报告称,感知、运动规划和技能执行运行在一台配备 RTX 4090 GPU 的 Razer Blade 笔记本电脑上。
GPT Astra 在远程运行,并向本地机器发送技能请求和目标。
这意味着该架构分布在两个计算环境中:
远程前沿模型
→ 高层推理与技能选择
本地 RTX 4090 系统
→ 感知、几何、规划、技能与执行
项目还列出了若干实际成本与限制。
在完整工作流使用空间表示之前,必须先创建数字孪生。
这会增加准备时间。
远程前沿模型会在规划和 Real2Sim 工作期间被调用。
这会带来 API 费用。
Astra 不会即时响应。
研究人员指出,在高层推理完成期间,不同技能之间会出现停顿。
对于家务任务而言,这些停顿很重要,因为物理任务本身就比纯数字任务耗时更长。
长时间运行的人形机器人操作还会受到机械限制。
HomeBody 页面特别提到,持续运行期间可能出现手指舵机过热。
机器人只能执行当前手部、触及范围、平衡能力、感知能力和已实现技能所支持的任务。
因此,该项目是长时自主性的研究演示,而不是一台已经能够处理任意家务的通用家庭助理。
HomeBody 属于将前沿模型与实体机器人连接起来的更大范围研究浪潮。
原文重点介绍了三种日益常见的方法。
在类似 RoboCurve 的设置中,模型接收图像和机器人状态,然后调用指定以下目标的工具:
底层逆运动学或控制技术栈会将这些目标转换为机器人运动。
模型仍然处于频繁的观察—决策—行动循环中。
第二种方法使用前沿语言/视觉模型进行较慢的高层推理,并使用学习型 VLA 生成动作。
概念上可以表示为:
VLM 规划器
→ VLA 动作模型
→ 底层控制器
这种方法让前沿模型保持在电机层之上,同时使用学习型策略将计划转换为物理动作。
HomeBody 采取了不同路径。
它不再要求中间层必须存在学习型 VLA,而是让前沿 VLM 直接调用可复用技能。
这些技能本身可以是经典算法、学习型策略或其他控制器。
HomeBody 项目明确支持通过共享接口添加新技能。
这使架构具备模块化特征:
替换 VLM
或
添加新技能
而无需重新设计整套机器人技术栈
更深层的理念并不只是“增加另一个 System 0 层”。
它改变了推理与物理执行之间的连接方式。
结合空间记忆后,这种连接让机器人能够跨越整个房间工作,而不是只能在一张桌面周围操作。
原文最后考察了 RoboCurve 发布的第三方机器人控制评估结果。
这些结果应被理解为特定任务的机器人基准测试数据,而不是关于模型整体智能水平的普遍结论。
在 Jay Chooi 分享的 RoboCurve 结果中,据报告,GPT-6 Sol 在机器人任务集上的得分约为 GPT-5.6 Sol 的 1.6 倍,而每次试验成本约低 47%。

同一图表显示,在该评估中,GPT-6 Sol 的表现低于更强的 Opus 5.5 配置所形成的初步帕累托前沿。
这说明成本与机器人控制表现并不总是同步变化。
即使另一个模型仍能取得更高分,成本更低的模型也可能是更好的运营选择。
另一项 RoboCurve 结果涵盖了 360 次机器人试验。
据报告,平均结果显示,Opus 5.5 的得分约为 Opus 5 的 1.8 倍,成本约为其一半;同时,它的平均得分大致与 Astra 持平,但成本约低 21%。

再次强调,这不是 Anthropic 或 OpenAI 的通用基准测试。
这是第三方针对特定任务、硬件、提示词和试验条件进行的机器人控制评估。
这一点很重要,因为具身 AI 的表现取决于完整系统:
模型
×
提示词
×
机器人硬件
×
感知
×
控制技术栈
×
技能设计
×
任务定义
在编码基准测试中表现最佳的模型,不一定是在控制机器人时具有最佳成本/性能比的模型。
HomeBody 最有趣的地方,并不在于人形机器人移动了一个咖啡袋。
多年来,机器人一直在操作物体。
真正重要的是架构上的变化。
HomeBody 展示了一种实用方法,将以下能力结合起来:
前沿模型不需要学习每一个电机细节。
机器人也不需要针对每个厨房训练新的端到端策略。
相反,一个通用模型在结构化环境上进行推理,并编排可复用的能力。
这类似于软件智能体日益普遍的工作方式:
模型进行推理
→ 调用工具
→ 读取结果
→ 选择下一个工具
HomeBody 将相同模式带入了物理世界。
工具不再是网页搜索、Python 或数据库。
它们变成了:
导航
抓取
放置
打开抽屉
从抽屉中抓取
这就是为什么该项目被视为具身智能体的重要一步。
HomeBody 是斯坦福大学和加州理工学院的一个研究系统,为人形机器人提供持久化空间记忆和可组合的运动技能库。前沿视觉语言模型通过结构化工具接口规划长时任务并调用这些技能。
不会。HomeBody 项目页面将规划器称为 GPT Astra,并将其作为高层 System 2 模型使用。导航、操作、感知、运动规划、重试和全身控制由底层机器人模块和预训练控制器负责。
研究人员表示,演示中的陌生厨房不需要环境专属训练数据或额外的策略学习。不过,系统仍然依赖预训练感知模型、可复用技能、SLAM、规划软件和预训练的 AMO 全身控制器。
在探索过程中,HomeBody 会将第一视角摄像头观察结果、语义内容和位置存储在共享空间坐标系中。当后续请求涉及视野之外的物体时,GPT Astra 可以回忆已存储的关键帧,并导航回记忆中的位置。
Real2Sim 阶段为高层规划器提供了房间的结构化空间模型。HomeBody 还使用测量得到的 SLAM 几何信息约束重建结果,使导航和操作决策基于真实尺寸,而不只是视觉外观。
项目报告称,本地技能、感知和运动规划运行在一台配备 RTX 4090 GPU 的 Razer Blade 笔记本电脑上,而 GPT Astra 在远程运行。当前设置还需要人形机器人硬件、摄像头、LiDAR/SLAM 组件、网络连接以及项目的机器人软件技术栈。
不能。该项目展示了有意义的长时自主能力,但其自身记录的局限性包括 Real2Sim 设置时间、API 成本、推理延迟、操作限制,以及手指舵机过热等硬件耐久性问题。
不是。原文讨论的数字来自独立第三方评估机构 RoboCurve,适用于其机器人任务集和试验条件。不能将这些结果推广为脱离具体背景的整体模型排名。
HomeBody 展示了前沿模型如何成为人形机器人的高层规划器,而无需直接生成每一个底层电机指令。GPT Astra 探索陌生房间,使用 Real2Sim 重建和持久化空间记忆,然后组合导航与操作技能,完成长时厨房任务。
其关键设计选择是模块化。模型决定下一步做什么,而感知、几何、运动规划、局部重试和全身控制决定机器人在物理上如何完成。这使系统能够进入新厨房,而无需训练新的环境专属动作策略;但与此同时,它仍然依赖大量预训练和工程化的机器人基础设施。
当前实现仍然是研究系统,而不是即插即用的家用机器人:它需要 RTX 4090 级别的本地机器、远程模型推理、仿真设置、API 访问以及可靠的机器人硬件。研究人员还记录了在长时真实任务中仍然重要的延迟和耐久性限制。
真正重要的进展并不只是“GPT 可以控制机器人”,而是通用模型现在可以利用空间记忆和可复用的物理技能,就像软件智能体使用工具一样。
We0 适合 SaaS 与 AI 团队、企业主、独立开发者、Agency 与顾问、外贸企业,以及希望通过企业官网持续获取线索的团队。它不仅适合生成页面,也覆盖 AI 建站、页面规划、CMS、SEO、GEO、多语言网站、域名部署、内容运营与获客增长。
可以根据网站目标、内容规模、团队协作方式、语言数量、SEO/GEO 需求、域名部署要求和线索获取流程进行选择。对于需要快速搭建展示型官网的团队,应重点评估自然语言建站与页面规划能力;对于持续增长的企业,则应同时关注 CMS、内容增长、SEO/GEO 和线索管理能力。
We0 的定位不是单纯的网页生成器,而是面向展示型网站的 AI 建站与获客增长平台,覆盖 Build → Showcase → Grow → Leads 链路。与 Wix、Webflow、Framer、WordPress、Squarespace 等方案比较时,企业应结合 AI 建站效率、内容运营、SEO/GEO、多智能体协作、部署方式和获客闭环进行评估,而不应只比较页面生成速度。
企业官网通常应补充适用用户、典型场景、产品边界、实施步骤、交付内容、集成方式、价格或报价规则、SEO/GEO 能力、内容运营方式、案例证据、服务支持与常见问题等信息。这些内容能够帮助潜在客户和 AI 搜索系统更准确地理解产品,并降低选型过程中的不确定性。
对于希望从 AI、AI Agent 和新型自动化趋势中获得官网增长机会的企业,HomeBody 所体现的“模型推理 + 工具调用 + 结构化记忆 + 模块化执行”同样具有启发意义。企业官网不应只展示产品,还需要清晰说明产品是什么、适合谁、如何实施、能解决什么问题,以及用户下一步如何行动。
We0.ai 通过 AI 建站、多智能体协作、CMS、SEO/GEO、多语言网站和线索获取能力,帮助企业构建从 Build、Showcase 到 Grow、Leads 的官网增长链路。最终效果仍取决于内容质量、业务匹配度、持续运营和真实转化数据,而不是单一工具或模型本身。
从一句话开始,几分钟内拿到完整网站。