For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/ru/articles/gpt-6-astra-unitree-g1-homebody-kitchen-r-56df14d6.md.
Проект HomeBody от Stanford и Caltech объединяет GPT Astra с гуманоидом Unitree G1, чтобы исследовать незнакомую кухню, создать пространстве...

Следующий этап развития воплощенного ИИ — это не очередная демонстрация роботизированной руки на столе.
Гуманоид Unitree G1 теперь продемонстрирован за исследованием незнакомой кухни, запоминанием расположения предметов, уборкой объектов в разных частях помещения, открыванием ящиков, поиском лекарства, которого больше не видно, и передачей его человеку.
Проект называется HomeBody. Его разработали исследователи из Stanford University и Caltech.
Его ключевая идея удивительно проста:
Позволить передовой мультимодальной модели воспринимать навыки робота как инструменты.
Вместо того чтобы просить модель выдавать команды для каждого сустава, HomeBody позволяет GPT Astra понять задачу, решить, что должно произойти дальше, и вызвать повторно используемые навыки навигации, захвата, размещения, открывания ящика и извлечения объекта.
Так модель становится планировщиком высокого уровня, а не контроллером двигателей низкого уровня.
В результате робот получает рабочий процесс с более длинным горизонтом планирования, чем стандартная схема «увидеть объект, взять объект, остановиться».
В кухонной демонстрации робот сначала исследует окружающую среду и создает постоянную пространственную память. Затем он реконструирует цифровой двойник, сопоставляет это представление с реальным помещением и использует сохраненные наблюдения для выполнения последующих инструкций.
Например, пользователь может сказать:
«Убери на кухне. Положи пакеты с кофе на остров и выбрось испорченные упаковки».
После этого G1 перемещается между разными участками, собирает пакеты с кофе и выбрасывает указанные упаковки.
Вторая задача еще показательнее:
«Я забыл лекарство, можешь принести его? И заодно выбрось испорченную упаковку».
В момент запроса лекарство не видно.
HomeBody просматривает сохраненную пространственную память, вспоминает ящик, в котором ранее было замечено лекарство, перемещается к нему, открывает ящик, достает лекарство, передает его человеку и при этом продолжает выполнение задачи по утилизации упаковки.
Именно в этом заключается важный сдвиг.
Робот больше не реагирует только на то, что в данный момент находится перед его камерой. Он объединяет текущее восприятие, сохраненные наблюдения, геометрию помещения, навигацию, манипуляции и последовательность действий во всем пространстве.

Основную конструкцию HomeBody можно описать одним предложением:
GPT Astra выбирает и выстраивает последовательность роботизированных навыков с помощью структурированных вызовов инструментов.
Модель отвечает за понимание цели пользователя и принятие решения о следующем действии.
Роботизированный стек обрабатывает физические детали.
Упрощенно это выглядит так:
Инструкция пользователя
↓
GPT Astra / System 2
↓
Выбор навыка + цели
↓
Навигация / Захват / Размещение / Открытие ящика / Захват из ящика
↓
Восприятие + планирование движения + управление низкого уровня
↓
Результат выполнения
↓
Возврат результата GPT Astra
↓
Выбор следующего действия
Однако прежде чем робот сможет забрать что-либо из незнакомой кухни, ему нужно больше, чем библиотека навыков.
Он должен понимать, как выглядит кухня и где находятся запомненные объекты.
HomeBody создает этот контекст в три этапа.
Первая инструкция намеренно проста:
Вы кухонный робот, пожалуйста, исследуйте пространство!
Затем GPT Astra выбирает полезные точки обзора и направляет G1 по помещению.
Во время исследования HomeBody собирает несколько типов данных, включая:
Камера показывает содержимое помещения.
LiDAR и другие датчики предоставляют измеренную пространственную структуру.
SLAM — одновременная локализация и построение карты — помогает роботу создавать карту и одновременно оценивать собственное положение внутри нее.
Ключевое значение имеет сохранение данных.
Когда G1 отворачивается от объекта, информация не исчезает вместе с изображением с камеры.
HomeBody сохраняет наблюдения и связывает их с местоположениями, чтобы позднее можно было использовать их в новых задачах.
Именно поэтому запрос вроде «принеси мне лекарство» может сработать, даже если лекарство сейчас спрятано в ящике или находится за пределами поля зрения робота.
Одного исследования недостаточно.
Затем HomeBody использует GPT Astra как агента Real2Sim, чтобы создать цифровую реконструкцию окружающей среды в NVIDIA Isaac Sim.

Цифровой двойник служит пространственной моделью кухни.
Он предоставляет системе структурированное представление о:
Важно, что реконструкция основана не только на внешнем виде.
HomeBody также передает в процесс Real2Sim измеренную геометрию SLAM.
Это добавляет реконструкции ограничения, соответствующие реальным размерам.
Это важно, потому что привлекательной визуальной реконструкции недостаточно для робототехники.
Робот должен понимать, достаточно ли широк проход для движения, сможет ли корпус подойти к ящику на нужное расстояние и сможет ли рука достичь цели, не столкнувшись с окружающими объектами.
Затем система сопоставляет карту SLAM реального мира с реконструированной симуляцией в общей системе координат.
Сохраненные наблюдения с камер, семантические описания и местоположения робота после этого можно связать с физическими местами в помещении.
Таким образом, вместо простого воспоминания:
Я видел флакон с лекарством.
HomeBody может сохранить информацию, более близкую к следующей:
Я видел лекарство в этом ящике,
в этом запомненном месте,
в общей системе координат помещения.
Именно это делает последующее извлечение возможным.
После исследования и реконструкции пользователь может дать роботу бытовую задачу.
Например:
Убери на кухне.
Положи пакеты с кофе на остров
и выбрось испорченные упаковки.

На каждом этапе GPT Astra может учитывать:
Затем модель выбирает следующий навык и цель.
Демонстрация с лекарством показывает, почему это полезно.
Пользователь не указывает ящик.
Модель может вспомнить предыдущее наблюдение, вернуться в нужную область, открыть ящик, достать флакон, передать его человеку и продолжить выполнение оставшейся инструкции по уборке.
Задача достаточно продолжительна, и ни один отдельный кадр с камеры не содержит всей информации, необходимой для ее завершения.
Именно в таких условиях постоянная пространственная память становится особенно ценной.
Это самая важная архитектурная деталь HomeBody.
Можно услышать фразу «GPT управляет гуманоидным роботом» и представить, что языковая модель напрямую выдает значения для каждого сустава.
Но система работает не так.
Более ранняя работа, например RoboCurve, демонстрировала управление задачами роботизированной руки с помощью передовых моделей: модель наблюдала изображения с камеры и состояние робота, а затем использовала инструменты, задающие положение, ориентацию и состояние открытия или закрытия захвата.
HomeBody работает на более высоком уровне абстракции.
Модель вызывает готовые составные навыки.
Проект описывает распространенный стек управления гуманоидом через три концептуальных уровня:
Обычная архитектура с обученным управлением действиями может выглядеть так:
System 2 VLM
↓
System 1 VLA
↓
System 0 — контроллер всего тела
HomeBody изменяет средний уровень этого конвейера.
Вместо того чтобы требовать от обученной VLA-модели переводить намерение высокого уровня в действия, VLM напрямую вызывает составную библиотеку навыков.

Получившаяся структура ближе к следующей:
System 2 VLM
↓
Библиотека навыков
↓
Планирование движения + восприятие
↓
System 0 — управление всем телом
Текущий набор навыков HomeBody включает:
| Навык | Что предоставляет модель высокого уровня | Что обрабатывает навык |
|---|---|---|
| Навигация | Целевое местоположение и ориентация | Планирование маршрута и выполнение перемещения |
| Захват | Точка на изображении и выбор руки | Сегментация, глубина, поза захвата, траектория руки и повторные попытки |
| Размещение | Рука и трехмерная цель освобождения | Перемещение удерживаемого объекта к цели и отпускание |
| Открытие ящика | Цель — ящик или ручка | Выравнивание, положение для зацепления и последовательность оттягивания назад |
| Захват из ящика | Целевой объект внутри открытого ящика | Достижение, захват, подъем и локальная логика повторной попытки |
Все навыки используют общий интерфейс целей и результатов выполнения.
Модели не нужно понимать внутреннюю реализацию каждого низкоуровневого навыка.
Ей нужно только решить, какой навык запустить и какой должна быть его цель.
Для действия захвата GPT Astra выбирает точку на изображении с эго-камеры и решает, какую руку использовать.
После этого управление переходит к стеку навыка.
Согласно реализации HomeBody:

Иными словами:
GPT решает, что захватить
и какую руку использовать.
Роботизированный навык решает,
как физически доставить руку к цели.
Такое разделение позволяет передовой модели сосредоточиться на рассуждении и последовательности задач, а не отвечает за управление двигателями в реальном времени.
Физический мир нестабилен.
По мере приближения робота объект может смещаться на изображении с камеры.
Захват может закрыться, не соприкоснувшись с объектом.
Роботу может понадобиться изменить положение корпуса.
Поэтому HomeBody не требует нового решения GPT для каждой небольшой коррекции.
Проект использует сегментацию и отслеживание SAM 2.1 с выбором памяти в стиле SAMURAI, чтобы отслеживать цели между кадрами.
Затем визуальное сервоприводное управление может локально исправить выравнивание.
Если захват не удался, навык может попробовать другой кандидат для захвата либо изменить положение робота и выполнить новое планирование.
Количество таких локальных повторных попыток ограничено.
Когда локальный навык больше не может восстановиться после ошибки, он передает GPT Astra причину сбоя.
После этого VLM может выбрать другую цель, изменить положение робота или скорректировать план высокого уровня.
Цикл выглядит так:
Опишите идею одной фразой, и We0 AI создаст сайт-витрину, страницы и CMS, а после запуска поможет привлечь клиентов и трафик.
Одна полная генерация проекта для бесплатной регистрации
Лучше всего попробовать один полный поток генерации и быстро увидеть первый черновик проекта.
Принять решение
↓
Выполнить навык
↓
Наблюдать результат
↓
Локальная повторная попытка, если возможна
↓
Вернуть результат GPT Astra
↓
Перепланировать при необходимости
Так несколько навыков можно объединить в длинную последовательность:
Подойти к ящику
→ Открыть ящик
→ Взять лекарство
→ Подойти к человеку
→ Передать лекарство
→ Найти упаковку
→ Выбросить упаковку
Даже если планировщик высокого уровня выбирает правильный навык, гуманоид все равно должен сохранять равновесие во время ходьбы и вытягивания руки.
HomeBody использует предварительно обученный AMO (Adaptive Motion Optimization) для управления нижней частью тела с учетом движений верхней части.
Контроллер учитывает цели верхней части тела при координации перемещения.
Согласно странице проекта, команды для рук и кистей выполняются с частотой 250 Гц, а политика AMO обновляется на каждом пятом такте управления — с частотой 50 Гц.
Это еще одна причина, по которой фразу «без дополнительного обучения» необходимо воспринимать в контексте.
Для новой кухни не требуется заново обучать зависящую от среды политику действий.
Однако система по-прежнему зависит от ранее обученных и спроектированных компонентов, расположенных ниже уровня VLM.
Одно из наиболее сильных утверждений HomeBody заключается в том, что система может работать в ранее неизвестной кухне без сбора данных для обучения, специфичных для этой среды, и без изучения новой политики действий для данного помещения.
Это существенно.
Традиционное развертывание роботов часто требует демонстраций, обучения политики или настройки под конкретную среду, прежде чем робот сможет действовать надежно.
Вместо этого HomeBody объединяет:
Это переносит часть нагрузки по адаптации с повторного обучения на рассуждение + картографирование + повторно используемые инструменты.
Полный процесс HomeBody можно представить так:

Исследовать незнакомое помещение
↓
Собрать наблюдения эго-камеры + SLAM + положения
↓
Создать цифровой двойник с помощью Real2Sim
↓
Сопоставить реальные и симулированные системы координат
↓
Сохранить пространственные наблюдения
↓
Получить бытовую инструкцию
↓
GPT Astra выбирает навык + цель
↓
Локальный роботизированный стек выполняет действие
↓
Вернуть результат
↓
Продолжать до завершения задачи
Исследовательская демонстрация впечатляет, но она не равнозначна покупке G1, вводу ключа API и получению готового бытового робота.
Для текущего стека HomeBody по-прежнему требуется значительная робототехническая инфраструктура.
Исследователи сообщают, что восприятие, планирование движения и выполнение навыков работают на одном ноутбуке Razer Blade с графическим процессором RTX 4090.
GPT Astra работает удаленно и отправляет запросы навыков и цели на локальную машину.
Это означает, что архитектура разделена между двумя вычислительными средами:
Удаленная передовая модель
→ рассуждение высокого уровня и выбор навыков
Локальная система с RTX 4090
→ восприятие, геометрия, планирование, навыки и выполнение
Проект также перечисляет несколько практических затрат и ограничений.
Цифровой двойник должен быть создан до того, как весь рабочий процесс сможет использовать его пространственное представление.
Это увеличивает время подготовки.
Удаленная передовая модель вызывается во время планирования и работы Real2Sim.
Это добавляет расходы на API.
Astra не отвечает мгновенно.
Исследователи отмечают паузы между навыками, пока завершается рассуждение высокого уровня.
Для бытовых задач эти паузы важны, поскольку физические действия и без того занимают намного больше времени, чем полностью цифровые операции.
Длительные манипуляции гуманоидом также ограничены механикой.
На странице HomeBody отдельно упоминается перегрев сервоприводов пальцев во время продолжительной работы.
Робот может выполнять только те задачи, которые поддерживаются его текущими кистями, досягаемостью, балансом, возможностями восприятия и реализованным набором навыков.
Поэтому проект является исследовательской демонстрацией долгосрочной автономности, а не универсальным бытовым помощником, который уже способен выполнять любые домашние дела.
HomeBody является частью более широкой волны разработок, связывающих передовые модели с физическими роботами.
Исходная статья выделяет три все более распространенных подхода.
В конфигурации в стиле RoboCurve модель получает изображения и состояние робота, а затем вызывает инструменты, задающие такие цели, как:
Более низкоуровневый стек обратной кинематики или управления преобразует эти цели в движения робота.
Модель остается в частом цикле «наблюдение — решение — действие».
Второй подход использует передовую языково-визуальную модель для медленного рассуждения высокого уровня и обученную VLA-модель для генерации действий.
Концептуально:
Планировщик VLM
→ модель действий VLA
→ контроллер низкого уровня
Так передовая модель остается выше моторного уровня, но для преобразования планов в физические действия по-прежнему используется обученная политика.
HomeBody выбирает другой путь.
Проект устраняет необходимость в обученной VLA-модели между уровнями и позволяет передовой VLM напрямую вызывать повторно используемые навыки.
Сами навыки могут быть классическими алгоритмами, обученными политиками или другими контроллерами.
Проект HomeBody явно допускает добавление новых навыков через общий интерфейс.
Это делает архитектуру модульной:
Заменить VLM
или
добавить новый навык
без перепроектирования всего роботизированного стека
Глубинная идея заключается не просто в добавлении еще одного уровня System 0.
Речь идет о другом способе связать рассуждение с физическим выполнением.
В сочетании с пространственной памятью такая связь позволяет роботу работать во всем помещении, а не только возле одной столешницы.
Исходная статья завершается рассмотрением результатов сторонней оценки управления роботами от RoboCurve.
Эти результаты следует воспринимать как измерения робототехнического бенчмарка для конкретных задач, а не как универсальные утверждения об общем интеллекте моделей.
В результатах RoboCurve, опубликованных Jay Chooi, GPT-6 Sol, как сообщается, набрала примерно в 1,6 раза больше баллов, чем GPT-5.6 Sol, на наборе робототехнических задач, при этом стоимость одной попытки была примерно на 47% ниже.

На той же диаграмме GPT-6 Sol находилась ниже предварительной границы Парето, сформированной более сильными конфигурациями Opus 5.5 в рамках этой оценки.
Это полезное свидетельство того, что стоимость и эффективность управления роботом не всегда изменяются синхронно.
Более дешевая модель может быть лучшим операционным выбором, даже если другая модель по-прежнему достигает более высокого результата.
В другом результате RoboCurve рассматривались 360 робототехнических испытаний.
Согласно опубликованному среднему показателю, Opus 5.5 набрала примерно в 1,8 раза больше баллов, чем Opus 5, при примерно вдвое меньшей стоимости, а также примерно сравнялась со средним результатом Astra при стоимости примерно на 21% ниже.

И снова: это не общий бенчмарк Anthropic или OpenAI.
Это сторонняя оценка управления роботами на конкретном наборе задач, оборудовании, с определенными промптами и условиями испытаний.
Это различие важно, поскольку эффективность воплощенного ИИ зависит от всей системы:
Модель
×
Промптинг
×
Оборудование робота
×
Восприятие
×
Стек управления
×
Проектирование навыков
×
Определение задачи
Модель, которая лучше всего показывает себя в бенчмарке программирования, не обязательно имеет лучшее соотношение стоимости и эффективности при управлении роботом.
Самая интересная часть HomeBody заключается не в том, что гуманоид переместил пакет кофе.
Роботы уже много лет манипулируют объектами.
Важен архитектурный сдвиг.
HomeBody показывает практический способ объединить:
Передовой модели не нужно изучать каждую деталь движения.
Роботу не нужна новая сквозная политика, специально обученная для каждой кухни.
Вместо этого универсальная модель рассуждает о структурированной среде и координирует повторно используемые возможности.
Это напоминает принцип работы программных агентов:
Модель рассуждает
→ вызывает инструменты
→ читает результаты
→ выбирает следующий инструмент
HomeBody переносит тот же подход в физический мир.
Инструментами становятся уже не веб-поиск, Python или база данных.
Теперь это:
Навигация
Захват
Размещение
Открытие ящика
Захват из ящика
Именно поэтому проект кажется важным шагом для воплощенных агентов.
HomeBody — исследовательская система Stanford и Caltech, которая дает гуманоидному роботу постоянную пространственную память и библиотеку составных моторных навыков. Передовая vision-language-модель планирует долгосрочные задачи и вызывает эти навыки через структурированные интерфейсы инструментов.
Нет. На странице проекта HomeBody планировщик обозначен как GPT Astra и используется как модель высокого уровня System 2. Навигация, манипуляции, восприятие, планирование движения, повторные попытки и управление всем телом обрабатываются роботизированными модулями более низкого уровня и предварительно обученными контроллерами.
Исследователи утверждают, что продемонстрированная незнакомая кухня не требует данных для обучения, специфичных для среды, или дополнительного обучения политики. При этом система по-прежнему опирается на предварительно обученные модели восприятия, повторно используемые навыки, SLAM, программное обеспечение для планирования и предварительно обученный контроллер всего тела AMO.
Во время исследования HomeBody сохраняет наблюдения с эго-камеры вместе с семантическим содержанием и положениями в общей пространственной системе координат. Когда последующий запрос относится к объекту за пределами поля зрения, GPT Astra может вспомнить сохраненный ключевой кадр и вернуться к запомненному местоположению.
Этап Real2Sim дает планировщику высокого уровня структурированную пространственную модель помещения. HomeBody также привязывает реконструкцию к измеренной геометрии SLAM, чтобы решения о навигации и манипуляциях основывались на реальных размерах, а не только на визуальном внешнем виде.
Проект сообщает, что локальные навыки, восприятие и планирование движения работают на ноутбуке Razer Blade с графическим процессором RTX 4090, тогда как GPT Astra работает удаленно. Текущая конфигурация также требует самого гуманоида, камер, компонентов LiDAR/SLAM, сетевого соединения и роботизированного программного стека проекта.
Нет. Проект демонстрирует значимую долгосрочную автономность, но его собственные ограничения включают время настройки Real2Sim, стоимость API, задержку рассуждений, ограничения манипуляций и проблемы с ресурсом оборудования, например перегрев сервоприводов пальцев.
Нет. Обсуждаемые в исходном материале показатели получены RoboCurve, независимым сторонним оценщиком, и относятся к его наборам робототехнических задач и условиям испытаний. Их не следует распространять на общий рейтинг моделей вне этого контекста.
HomeBody показывает, как передовая модель может стать планировщиком высокого уровня для гуманоида, не генерируя напрямую каждую низкоуровневую моторную команду. GPT Astra исследует незнакомое помещение, использует реконструкцию Real2Sim и постоянную пространственную память, а затем объединяет навыки навигации и манипуляции для выполнения долгосрочных кухонных задач.
Ключевое архитектурное решение — модульность. Модель решает, что должно произойти дальше, а восприятие, геометрия, планирование движения, локальные повторные попытки и управление всем телом определяют, как робот физически это выполнит. Благодаря этому система может работать в новой кухне без обучения новой политики действий, специфичной для среды, хотя и по-прежнему зависит от значительной предварительно обученной и спроектированной робототехнической инфраструктуры.
Текущая реализация остается исследовательской системой, а не бытовым роботом, готовым к работе сразу после подключения: ей требуется локальная машина уровня RTX 4090, удаленный запуск модели, настройка симуляции, доступ к API и надежное роботизированное оборудование. Исследователи также документируют ограничения по задержке и ресурсу оборудования, которые по-прежнему имеют значение при длительных задачах в реальном мире.
Важен не просто тот факт, что «GPT может управлять роботом», а то, что универсальная модель теперь способна использовать пространственную память и повторно используемые физические навыки так же, как программный агент использует инструменты.
Начните с одной фразы и получите полноценный сайт за считанные минуты.