Введение
Чуть более чем через год после того, как Lepton AI стала частью NVIDIA, Ян Цинцзя начинает заново.
Его новая компания, Intent Lab, запускается не с обычным чат-ботом, облачным маркетплейсом или IDE для разработчиков. Вместо этого компания создаёт Fleet — систему, которую она описывает как автономную инженерную команду, превращающую намерение высокого уровня в программное обеспечение производственного класса.
Первая публичная демонстрация Intent Lab включает три совершенно разные системы:
- Движок инференса GLM-5.2, оптимизированный лучше, чем стандартный TensorRT-LLM.
- Совместимую с SQLite базу данных, созданную по однострочному требованию.
- Распределённую файловую систему для ИИ-агентов с формальной верификацией и тестированием отказоустойчивости.
На первый взгляд эти проекты не похожи на единую продуктовую категорию.
В этом и заключается суть.
Intent Lab утверждает, что настоящим продуктом является инженерная система, стоящая за ними. Fleet предназначен для выполнения работы между расплывчатым запросом на программное обеспечение и системой, которую можно тестировать, верифицировать, эксплуатировать и развивать в производственной среде.

Ранние показатели производительности в этой статье взяты из собственных материалов запуска Intent Lab. Это многообещающие демонстрации, а не независимые сертифицированные бенчмарки. Компания ещё не опубликовала достаточно деталей для воспроизводимости, чтобы внешние команды могли подтвердить каждый результат в идентичных условиях.
Ян Цинцзя создаёт ещё одну инфраструктурную компанию
Карьера Яна Цинцзя неоднократно возвращала его к инфраструктуре.
Он наиболее известен созданием Caffe во время учёбы в UC Berkeley, а впоследствии работал над крупными проектами ИИ-инфраструктуры, включая PyTorch и ONNX.
После ухода из Alibaba в 2023 году Цзя стал соучредителем Lepton AI — компании, ориентированной на упрощение для разработчиков работы с GPU-вычислениями и развёртыванием моделей.
Первоначальное предложение Lepton сочеталло Python-ориентированный опыт разработчика с инфраструктурой, способной запускать ИИ-нагрузки на нескольких GPU-провайдерах.
Компания была приобретена NVIDIA в 2025 году в сделке, которая на тот момент публично оценивалась в сотни миллионов долларов. Более поздние отраслевые отчёты оценивали сумму примерно в 700 миллионов долларов, хотя NVIDIA не публиковала окончательную цену приобретения.
Технологии Lepton вошли в состав NVIDIA DGX Cloud Lepton.

Эта роль, как оказалось, не была его главным следующим шагом.
29 июля Цзя публично представил Intent Lab.
Его подход отличался от Lepton AI.
Lepton фокусировался на предоставлении разработчикам более лёгкого доступа к вычислительным ресурсам.
Intent Lab сосредоточен на предоставлении автономной инженерной системе возможности создавать и поддерживать программное обеспечение, которое работает на этих вычислительных мощностях.
Цзя резюмировал этот сдвиг, сказав, что его команды всю свою карьеру тщательно строили большие системы по одной за раз. Теперь их интересовала система, способная создавать множество таких систем.

Fleet — продукт, стоящий за тремя демонстрациями
Intent Lab называет свою автономную инженерную систему Fleet.
Компания описывает её как команду, а не как отдельного агента по написанию кода.
Это различие важно.
Типичный агент по написанию кода может редактировать файлы, запускать команды, исправлять тесты, искать в репозитории и реализовывать функцию.
Fleet представлена как система, способная координировать более длительный инженерный процесс.
Заявленная цель Intent Lab — охватить работу, необходимую для перехода от запроса высокого уровня к производственной системе с измеримыми
поведение, проверка и путь к постоянному совершенствованию.
Первые три демонстрации были выбраны, чтобы проверить это утверждение в самых разных инженерных областях.
Демонстрация первая: оптимизация GLM-5.2 за пределами стандартного TensorRT-LLM
Наиболее технически впечатляющий результат запуска — это движок логического вывода для GLM-5.2.
Первоначальная инструкция по сути представляла собой одну инженерную задачу:
Переработайте TensorRT-LLM так, чтобы GLM-5.2 эффективно работал на узлах Grace Blackwell,
определите возможности для оптимизации, реализуйте их и проверьте автономно.
TensorRT-LLM — это уже продакшен-ориентированный стек логического вывода NVIDIA для больших языковых моделей.
NVIDIA документирует такие функции, как обслуживание на нескольких GPU и узлах, пакетная обработка в полёте, кэширование KV постранично, квантизация, оптимизированные ядра, а также среду выполнения на Python и C++.
Таким образом, повышение производительности поверх этого стека — более сложная задача, чем оптимизация неоптимизированной эталонной реализации.
Intent Lab сообщает о 6,3-кратном увеличении скорости вывода
Intent Lab утверждает, что Fleet начинал со стандартного TensorRT-LLM примерно на:
102 токена/с
Оптимизированная среда выполнения достигла:
161 токена/с
После добавления фирменного оптимизированного пути спекулятивного декодирования система, по сообщениям, достигла:
647 токенов/с
Это примерно в 6,3 раза больше исходной скорости вывода.

Intent Lab сообщает, что в тесте использовались два узла Grace Blackwell.
Компания разбивает работу по производительности на четыре категории.
Оптимизация ядер: +24%
По сообщениям, Fleet применил слияние ядер и сгенерировал низкоуровневые пути PTX/SASS для контроля на уровне инструкций.
Оптимизация среды выполнения: +16%
Intent Lab утверждает, что среда выполнения устранила повторяющиеся копирования метаданных с хоста на устройство из стационарного декодирования с помощью пакетной обработки H2D и методов нулевого копирования.
Оптимизация коммуникации: +18%
По сообщениям, Fleet использовал объединённый путь all-reduce MNNVL, который включает остаточное сложение и RMSNorm в коллективную операцию.
Спекулятивное декодирование: примерно в 4 раза
Самый значительный индивидуальный прирост дало спекулятивное декодирование.
Intent Lab утверждает, что оптимизированный черновик DSpark предлагает несколько токенов, а основная модель проверяет их пакетами, что значительно увеличивает пропускную способность декодирования.
Компания сообщает о полном сквозном результате как об улучшении на 534% по сравнению со стандартным базовым уровнем.
Эти цифры — собственные измерения Intent Lab. Конфигурация оборудования, детали рабочей нагрузки, настройки пакетов, длина вывода, точность, параллелизм и версии программного обеспечения могут существенно повлиять на результаты тестов производительности.
Цикл оптимизации Fleet больше похож на работу команды, чем на единичный проход
Intent Lab утверждает, что Fleet следует повторяющемуся инженерному циклу:
- Анализ по модели крыши (roofline)
- Выявление узких мест
- Предложение
- Проверка
- Накопление
- Возврат к следующему узкому месту
Если предложенная оптимизация
проверка не проходит, система возвращается назад и пробует снова.
Этап «композиции» важен, потому что инженерная оптимизация производительности часто терпит неудачу, когда отдельные успешные оптимизации мешают друг другу.
Fleet спроектирована так, чтобы сохранять изменения только после проверки того, что объединённая система по-прежнему работает.
Почему GLM-5.2 — сложная цель
GLM-5.2 — флагманская модель Z.ai для задач с длинным горизонтом планирования.
В официальной карточке модели указаны окно контекста в один миллион токенов, задачи кодирования и агентные нагрузки с длинным горизонтом, гибкое управление вычислительными усилиями, улучшенная архитектура разреженного внимания и открытые веса под лицензией MIT.
Крупные модели с длинным контекстом и агентными нагрузками создают сложные проблемы при обслуживании.
Самая быстрая реализация зависит от взаимодействия между дизайном ядер, пропускной способностью памяти, поведением KV-кэша, пропускной способностью межсоединений, размером пакета, спекулятивным декодированием, квантизацией, планированием на хосте и коллективными операциями связи.
Это делает оптимизацию инференса полезным стресс-тестом для автономной инженерной системы.
Демонстрация вторая: база данных, совместимая с SQLite, по одному требованию
Второй публичный проект Fleet полностью отходит от GPU-ядер.
Intent Lab попросила систему создать движок SQL-базы данных, совместимый с SQLite.
В презентационных материалах показано требование, эквивалентное следующему:
Создайте движок SQL-базы данных, совместимый с SQLite,
в том смысле, что он должен проходить ВСЕ тестовые случаи sqllogictest,
а производительность должна быть сопоставимой или лучше.
Intent Lab сообщает, что Fleet не начинала с исходного кода или документации SQLite.
Вместо этого она рассматривала поведение существующей системы и тестовый корпус как контракт на приёмку.

Компания сообщает, что итоговая система прошла примерно шесть миллионов тестов на совместимость с SQLite.
Эта цифра получена от Intent Lab и не была независимо воспроизведена для данной статьи.
Один Fleet, множество инженерных ролей
Intent Lab визуализирует создание базы данных как работу нескольких ролей на протяжении всего проекта:
- Принятие решений.
- Архитектура.
- Написание кода.
- Тестирование.
- Ревью.
- QA.
Роли не просто работают в линейной последовательности с передачей задач.
Архитектура может меняться, пока идёт реализация. Тестирование продолжается, пока добавляются функции. Ревью и QA остаются активными по мере роста кодовой базы.
Стоимость сильно зависит от модели
Intent Lab также опубликовала сравнение затрат.
Для той же сборки базы данных компания сообщает, что запуск с использованием Opus 4.8 обошёлся примерно в 2 000 долларов, а запуск с использованием моделей с открытым исходным кодом — примерно в 350 долларов.
Эти цифры предоставлены компанией и зависят от цен на модели, потребления токенов, оркестрации агентов и инфраструктуры.
Тем не менее они иллюстрируют ключевой экономический вопрос для агентной инженерии: какова стоимость полностью успешного проекта, а не цена одного вызова модели?
Демонстрация третья: формально
Верифицированная файловая система для агентов
Третья демонстрация — это распределённая файловая система под названием AgentFS.
Intent Lab заявляет, что она была разработана специально для рабочих нагрузок агентов в облачных средах.
ИИ-агенты для программирования и исследований, как правило, создают характерный паттерн хранения данных:
- Множество временных песочниц.
- Большое количество мелких файлов.
- Частое создание и удаление.
- Общее облачное хранилище.
- Высокая нагрузка на метаданные.
- Недолговечные репозитории.
Intent Lab сообщает, что провела оценку существующих систем, включая Amazon EFS и S3FS, выявила их ограничения для данной рабочей нагрузки и вместо этого создала новую файловую систему.
Компания заявляет о значительном ускорении по сравнению с протестированными системами при выполнении операций, интенсивно работающих с метаданными.

Опять же, это собственные контрольные показатели Intent Lab, а не результаты независимых сторонних организаций.
Формальная верификация обнаружила ошибку, которую пропустил кодовый агент
Наиболее важная часть примера с файловой системой — это не диаграмма с контрольными показателями.
Это верификация.
Создайте сайт-витрину и привлекайте лиды за минуты
Опишите идею одной фразой, и We0 AI создаст сайт-витрину, страницы и CMS, а после запуска поможет привлечь клиентов и трафик.
Одна полная генерация проекта для бесплатной регистрации
Лучше всего попробовать один полный поток генерации и быстро увидеть первый черновик проекта.
Intent Lab сообщает, что Fleet формально смоделировала основные протоколы и исследовала примерно 1,9 миллиона состояний.
Этот процесс выявил ошибку в коде, созданном кодовым агентом.
Ошибка могла приводить к временному повреждённому состоянию при распределённых операциях создания/удаления.
Intent Lab утверждает, что Fleet затем исправила реализацию и повторно запустила верификацию.
Компания также сообщает о примерно 300 интеграционных тестах, а также об инъекции сбоев и фаззинге с имитацией отказов и реплик.
Формальная верификация здесь ценна тем, что файловые системы особенно уязвимы к редким чередованиям операций.
Традиционные тесты могут показать, что стандартный путь работает. Проверка модели может систематически исследовать комбинации состояний, которые обычные наборы тестов могут никогда не обнаружить.
Этот принцип хорошо известен за пределами Intent Lab. Исследователи файловых систем на протяжении десятилетий используют проверку моделей для выявления ошибок согласованности при сбоях и дефектов метаданных в зрелых системах.
Новое заявление здесь заключается в том, что автономная инженерная система может включить этот стиль верификации в свой собственный цикл разработки.
Отсутствующий слой между «работающим кодом» и production-программным обеспечением
Центральный аргумент Цзя шире, чем любая из трёх демонстраций.
Современные модели могут быстро писать код.
Это не означает, что результат — это программное обеспечение, которым компания может управлять годами.
Он утверждает, что оставшийся разрыв — это не просто очередной скачок в способностях моделей к написанию кода.
Это инженерный слой вокруг модели.

Производственная система требует большего, чем просто реализации.
Ей нужны требования, архитектура, интерфейсы,
Компромиссы, координация, тестирование, анализ производительности, работы по обеспечению надёжности, верификация, обработка сбоев, сопровождение и обратная связь из производственной среды.
Кодовая модель может участвовать во всех этих видах деятельности.
Тезис Fleet заключается в том, что они должны быть организованы в единую автономную систему.
Fleet Разбивает Инженерию на Шесть Этапов
Intent Lab описывает свой инженерный процесс в виде шести этапов.

- Understand
Предполагается, что Fleet превращает нечёткие намерения в конкретный результат, ограничения, критерии приёмки и измеримые определения успеха.
- Design
Fleet взвешивает компромиссы и определяет интерфейсы, компоненты и долгосрочную структуру системы.
- Coordinate
Система разбивает крупный проект на задачи, управляет зависимостями и поддерживает реализацию в соответствии с общим проектом.
- Build
Реализация и архитектура развиваются вместе по мере появления новой информации в ходе разработки.
- Verify
Верификация может включать модульные тесты, интеграционные тесты, бенчмарки, формальные доказательства, проверку моделей, внедрение сбоев, фаззинг и валидацию в среде выполнения.
- Evolve
Fleet предназначен для наблюдения за производительностью в производственной среде и передачи информации об использовании, надёжности и стоимости обратно в проектирование.
Именно здесь амбиции Intent Lab выходят за рамки автономного агента для написания кода.
Цель — не только генерация программного обеспечения.
Это автономное владение программным обеспечением.
«Принципиальная инженерная команда» как метафора продукта
Intent Lab описывает Fleet как действующий подобно принципиальной инженерной команде.
Это полезная метафора, потому что ни один член сильной инженерной организации не отвечает за все аспекты.
Один инженер может оптимизировать ядра. Другой может проектировать протокол хранения. Кто-то ещё поддерживает бенчмарки. Другой человек отвечает за надёжность.
Fleet пытается превратить эти обязанности в скоординированные роли агентов.
Таким образом, сложный вопрос заключается не только в том, может ли LLM писать высококачественный код.
Вопрос в том, могут ли несколько автономных процессов поддерживать связную системную архитектуру, одновременно создавая, тестируя, оптимизируя, проверяя и пересматривая один и тот же проект в течение длительного горизонта.
Экономический аргумент: программное обеспечение может стать более кастомизированным
Цзя также приводит экономический аргумент.
В течение десятилетий разработка программного обеспечения имела большие постоянные издержки.
Рациональной стратегией было создать один продукт, продавать его многим пользователям и просить пользователей с разными потребностями адаптироваться к одному и тому же программному обеспечению.
Если автономная инженерия снижает постоянные издержки создания и сопровождения системы, это уравнение меняется.

Компания может оправдать внедрение программного обеспечения для небольшой группы пользователей.
Внутренняя команда могла бы построить систему для рабочего процесса, который ранее годами оставался в бэклоге.
Инфраструктурная группа могла бы создать специализированный движок вместо того, чтобы мириться с ограничениями универсального продукта.
Intent Lab заявляет, что планирует сотрудничать с внешними организациями над проектами такого типа: системами с значительной инженерной ценностью, которые компании откладывали из-за слишком большого объёма требуемой работы.
Это Не То Же Самое, Что «Один Промпт Создаёт Любое Приложение»
Демонстрационные запуски легко сводятся к вирусному заголовку:
Одно предложение создало базу данных.
Такая формулировка упускает большую часть работы, которую, по утверждению Fleet, выполняет система.
Пример с базой данных начинается с одного требования, но затем система выполняет длительный инженерный процесс.
Она должна многократно принимать проектные решения, генерировать код, запускать тесты, диагностировать сбои, пересматривать архитектуру, проверять поведение и повторять всё это.
Пользователь предоставляет краткое намерение.
Машина не обязательно выполняет короткую задачу.
Более точная оценка включает вопросы о том, сколько требовалось ручного вмешательства, сколько вычислительных ресурсов потребовал запуск, сколько было повторных попыток, насколько хорошо был проверен результат, может ли другая команда воспроизвести его и можно ли поддерживать систему после демонстрации.
Что Остаётся Недоказанным
Первые результаты Intent Lab амбициозны, но публичные материалы оставляют важные вопросы открытыми.
Независимое Воспроизведение
Результат инференса 6.3×, количество тестов SQLite, производительность AgentFS и показатели формальной верификации приводятся самой компанией.
Независимое воспроизведение значительно усилило бы эти заявления.
Архитектура Fleet
Intent Lab не опубликовала достаточно деталей, чтобы можно было воссоздать саму Fleet.
Пока неясно, какие базовые модели используются для каждой роли, как агенты обмениваются состоянием, как планируются задачи, как разрешаются конфликты, как хранятся спецификации и сколько человеческого контроля остаётся доступным.
Производственное Владение
Создание системы бенчмарк-качества — это не то же самое, что эксплуатация её годами.
Этап «Evolve» может быть самой сложной частью концепции, поскольку владелец производства должен обрабатывать исправления безопасности, изменения зависимостей, смену оборудования, инциденты, изменение затрат, запросы функций и обратную совместимость.
Экономика
Автономная инженерия может быть дешевле человеческой команды для некоторых задач, но при этом потреблять значительные вычислительные ресурсы и мощности для инференса.
Пример Intent Lab с базой данных показывает, что выбор модели может изменить общую стоимость проекта в несколько раз.
Более Точный Способ Думать Об Intent Lab
Intent Lab — это не просто очередной стартап по созданию кодинг-агентов.
Его концепция ближе к автономной системной инженерии.
Целевая единица работы — это не завершение кода или pull request.
Это производственная система.
Именно поэтому первые три примера выглядят несвязанными.
Движок инференса, база данных и файловая система имеют мало общего на уровне продукта.
Их объединяет инженерный шаблон:
Намерение
→ спецификация
→ архитектура
→
Согласованная реализация
→ измерение
→ проверка
→ итерация
→ эволюция производства
Fleet предназначен для автоматизации этой схемы.
Сможет ли он надёжно делать это во многих реальных компаниях — остаётся открытым вопросом.
Но амбиции очевидны.
Часто задаваемые вопросы
Что такое Intent Lab?
Intent Lab — новая компания в сфере ИИ-инфраструктуры и автономной инженерии, соучредителями которой являются Янцзин Цзя и другие опытные системные инженеры. Её первый продукт, Fleet, предназначен для превращения высокоуровневых программных намерений в системы производственного уровня.
Что такое Fleet?
Fleet — это автономная инженерная система Intent Lab. Компания описывает её как команду скоординированных агентов, которые могут понимать требования, проектировать архитектуру, писать код, проверять результаты и продолжать развивать программное обеспечение после развёртывания.
Действительно ли Fleet ускорил инференс GLM-5.2 в 6,3 раза?
Intent Lab сообщает, что её оптимизированный движок GLM-5.2 увеличил скорость генерации с 102 токенов/с на стандартном TensorRT-LLM до 647 токенов/с на двух узлах Grace Blackwell. Это показатель, заявленный компанией, и он ещё не был независимо воспроизведён в источниках, рассмотренных здесь.
Создал ли Fleet базу данных по одному запросу?
Intent Lab утверждает, что исходным требованием к базе данных был единственный запрос с просьбой создать SQL-движок, совместимый с SQLite. Затем Fleet автономно выполнил архитектуру, кодирование, тестирование, ревью и обеспечение качества, пока, по словам компании, система не прошла примерно шесть миллионов тестов на совместимость.
Что такое AgentFS?
AgentFS — это распределённая файловая система, созданная в ходе третьей демонстрации запуска Intent Lab. Она оптимизирована для рабочих нагрузок ИИ-агентов, включающих множество песочниц и мелких файлов. Intent Lab утверждает, что её основные протоколы были проверены с помощью формальной верификации моделей.
В чём разница между Fleet и обычным кодинг-агентом?
Обычный кодинг-агент, как правило, работает над изменениями кода в рамках существующего проекта. Fleet предназначен для координации полного жизненного цикла системной инженерии, включая определение требований, архитектуру, реализацию, оптимизацию производительности, формальную верификацию, тестирование на ошибки и эволюцию производства.
Является ли Fleet открытым исходным кодом?
Intent Lab публично делилась демонстрациями и своей продуктовой концепцией, но источники, рассмотренные для этой статьи, не показывают публичного выпуска полной системы оркестрации Fleet. Проверьте официальный сайт Intent Lab на предмет актуальной доступности.
Продолжает ли NVIDIA DGX Cloud Lepton работать?
Да. NVIDIA в настоящее время поддерживает страницы продукта и документацию для DGX Cloud Lepton, включая рабочие нагрузки, группы узлов, конечные точки, Dev Pods, пакетные задания и функциональность «принеси свои вычисления». Это отдельный вопрос от дискуссии о том, насколько точно продукт NVIDIA сохранил первоначальную дорожную карту стартапа Lepton AI.
Связанные инструменты
- Intent Lab: Компания, создающая Fleet, автономную инженерную систему для превращения намерений в производственное программное обеспечение.
- NVIDIA TensorRT-LLM: Промышленный инференс-фреймворк NVIDIA для оптимизации и обслуживания больших языковых моделей на GPU NVIDIA.
- TensorRT-LLM на GitHub: Репозиторий с открытым исходным кодом для стека инференса LLM от NVIDIA.
GLM-5.2: открытая модель с длинным горизонтом планирования от Z.ai, использованная в демонстрации механизма логического вывода Intent Lab.
- NVIDIA DGX Cloud Lepton: платформа NVIDIA для создания и развертывания ИИ-нагрузок в сети поставщиков GPU-вычислений.
- SQLite: база данных, чьи тесты поведения и совместимости использовались в качестве цели для демонстрации Fleet в области баз данных.
Связанные ссылки
- Intent Lab: Turn Your Intent Into Production Systems: официальная статья о запуске Intent Lab и источник демонстраций Fleet.
- Анонс Intent Lab от Янцина Цзя: публичный пост Цзя, представляющий Intent Lab и его тезис об автономной инженерии.
- Документация NVIDIA DGX Cloud Lepton: актуальная официальная документация платформы, выросшей из технологий Lepton AI.
- Запуск NVIDIA DGX Cloud Lepton: анонс NVIDIA 2025 года, описывающий DGX Cloud Lepton и его глобальный GPU-маркетплейс.
- Официальная карточка модели GLM-5.2: официальные спецификации и документация модели от Z.ai.
- Документация NVIDIA TensorRT-LLM: официальная документация по архитектуре, установке, оптимизации, рантайму и развертыванию.
- USENIX: Using Model Checking to Find Serious File System Errors: классический пример того, почему формальная проверка моделей полезна для поиска редких ошибок корректности файловых систем.
Резюме
Новая компания Янцина Цзя, Intent Lab, строит Fleet вокруг иной единицы ИИ-работы: не генерации кода, а полного жизненного цикла производственных систем.
Первые демонстрации охватывают оптимизацию логического вывода GLM-5.2, совместимую с SQLite базу данных и формально верифицированную распределенную файловую систему. Intent Lab сообщает об ускорении логического вывода в 6,3 раза, примерно шести миллионах тестов совместимости баз данных и проверке моделей примерно на 1,9 миллиона состояний файловой системы.
Общая идея — шестиэтапный инженерный цикл: Понимание, Проектирование, Координация, Сборка, Проверка и Развитие, — который пытается воспроизвести обязанности сильной инженерной организации с помощью автономных агентов.
Результаты пока ранние и во многом основаны на собственных отчетах, поэтому воспроизводимость и долгосрочная производственная эксплуатация остаются настоящими испытаниями.
Важнейшее утверждение Fleet заключается не в том, что ИИ может писать код по одному предложению, а в том, что автономная система может взять на себя ответственность за инженерную работу между предложением и программным обеспечением, достойным многолетней эксплуатации.



