서론
Lepton AI가 NVIDIA의 일부가 된 지 1년여 만에, Yangqing Jia가 다시 시작합니다.
그의 새로운 회사인 Intent Lab은 기존의 챗봇, 클라우드 마켓플레이스, 또는 개발자 IDE로 출발하지 않습니다. 대신, 이 회사는 Fleet을 구축하고 있습니다. Fleet은 높은 수준의 의도를 프로덕션급 소프트웨어로 전환하는 자율 엔지니어링 팀으로 설명됩니다.
Intent Lab의 첫 공개 데모에는 서로 매우 다른 세 가지 시스템이 포함됩니다:
- 기본 TensorRT-LLM 이상으로 최적화된 GLM-5.2 추론 엔진.
- 한 줄의 요구사항으로 구축된 SQLite 호환 데이터베이스.
- 공식 검증 및 장애 테스트를 갖춘 AI 에이전트용 분산 파일 시스템.
언뜻 보기에 이 프로젝트들은 하나의 제품 카테고리로 보이지 않습니다.
바로 그것이 핵심입니다.
Intent Lab은 실제 제품이 그 뒤에 있는 엔지니어링 시스템이라고 말합니다. Fleet은 막연한 소프트웨어 요청과 벤치마킹, 검증, 운영, 그리고 프로덕션에서의 진화가 가능한 시스템 사이의 작업을 수행하도록 설계되었습니다.

이 글의 초기 성능 수치는 Intent Lab의 자체 출시 자료에서 가져온 것입니다. 이는 유망한 데모일 뿐, 독립적인 벤치마크 인증이 아닙니다. 이 회사는 아직 외부 팀이 동일한 조건에서 모든 결과를 확인할 수 있을 만큼 충분한 재현 가능성 세부 정보를 공개하지 않았습니다.
Yangqing Jia, 또 다른 인프라 회사를 시작하다
Yangqing Jia의 경력은 반복적으로 인프라로 돌아왔습니다.
그는 UC 버클리에서 Caffe를 만든 것으로 가장 잘 알려져 있으며, 이후 PyTorch 및 ONNX를 포함한 주요 AI 인프라 프로젝트에 참여했습니다.
2023년 알리바바를 떠난 후, Jia는 Lepton AI를 공동 창업했습니다. 이 회사는 개발자들이 GPU 컴퓨팅과 모델 배포를 더 쉽게 사용할 수 있도록 하는 데 초점을 맞췄습니다.
Lepton의 초기 제안은 Python 네이티브 개발자 경험과 여러 GPU 제공업체에서 AI 워크로드를 실행할 수 있는 인프라를 결합한 것이었습니다.
이 회사는 2025년 NVIDIA에 인수되었으며, 당시 공개적으로 수억 달러 규모의 거래로 설명되었습니다. 이후 업계 보고서에 따르면 그 금액은 약 7억 달러로 추정되지만, NVIDIA는 최종 인수 가격을 공개하지 않았습니다.
Lepton의 기술은 NVIDIA DGX Cloud Lepton의 일부가 되었습니다.

그 역할은 실제로 그의 다음 주요 행보가 아니었습니다.
7월 29일, Jia는 Intent Lab을 공개적으로 소개했습니다.
그의 프레임은 Lepton AI와 달랐습니다.
Lepton은 개발자에게 컴퓨팅 접근성을 높이는 데 중점을 두었습니다.
Intent Lab은 해당 컴퓨팅에서 실행되는 소프트웨어를 생성하고 유지 관리할 수 있는 자율 엔지니어링 시스템을 구축하는 데 중점을 둡니다.
Jia는 자신의 팀이 경력 내내 대규모 시스템을 하나씩 신중하게 구축하는 데 시간을 보냈다고 말하며 이러한 전환을 요약했습니다. 이제 그들이 관심을 갖는 것은 그러한 시스템을 많이 만들어낼 수 있는 시스템이었습니다.

Fleet: 세 가지 데모 뒤에 있는 제품
Intent Lab은 자율 엔지니어링 시스템을 Fleet이라고 부릅니다.
회사는 이를 단일 코딩 에이전트가 아닌 팀으로 설명합니다.
이 구분은 중요합니다.
일반적인 코딩 에이전트는 파일 편집, 명령 실행, 테스트 수정, 리포지토리 검색, 기능 구현을 할 수 있습니다.
Fleet은 더 긴 엔지니어링 프로세스를 조정할 수 있는 시스템으로 제시됩니다.
Intent Lab의 목표는 높은 수준의 요청에서 측정 가능한 프로덕션 시스템으로 이동하는 데 필요한 작업을 포괄하는 것입니다.
행동, 검증, 그리고 지속적 개선을 위한 경로.
첫 번째 세 가지 데모는 매우 다른 엔지니어링 영역에서 그 주장을 시험하기 위해 선택되었습니다.
데모 1: 기본 TensorRT-LLM을 넘어선 GLM-5.2 최적화
기술적으로 가장 주목할 만한 출시 성과는 GLM-5.2 추론 엔진입니다.
초기 지시는 본질적으로 하나의 엔지니어링 목표였습니다:
TensorRT-LLM을 재설계하여 GLM-5.2가 Grace Blackwell 노드에서 효율적으로 실행되도록 하고,
최적화 기회를 식별하고, 구현하고, 자율적으로 검증하십시오.
TensorRT-LLM은 이미 NVIDIA의 대규모 언어 모델을 위한 프로덕션 중심 추론 스택입니다.
NVIDIA는 멀티 GPU 및 멀티 노드 서빙, 인플라이트 배칭, 페이징된 KV 캐싱, 양자화, 최적화된 커널, Python 및 C++ 런타임과 같은 기능을 문서화합니다.
따라서 해당 스택 위에서 성능을 개선하는 것은 최적화되지 않은 참조 구현을 최적화하는 것보다 더 까다로운 목표입니다.
Intent Lab, 6.3배 출력 속도 향상 보고
Intent Lab에 따르면 Fleet은 기본 TensorRT-LLM에서 약 다음과 같은 성능으로 시작했습니다:
102 tokens/s
최적화된 런타임은 다음에 도달했습니다:
161 tokens/s
회사의 최적화된 추측 디코딩 경로를 추가한 후, 시스템은 다음에 도달했다고 보고되었습니다:
647 tokens/s
이는 원래 출력 속도의 약 6.3배입니다.

Intent Lab은 벤치마크가 두 개의 Grace Blackwell 노드를 사용했다고 밝혔습니다.
회사는 성능 작업을 네 가지 범주로 구분합니다.
커널 최적화: +24%
Fleet은 커널 융합을 적용하고 명령어 수준 제어를 위한 저수준 PTX/SASS 경로를 생성했다고 보고되었습니다.
런타임 최적화: +16%
Intent Lab에 따르면 런타임은 H2D 배칭과 제로 카피 기술을 통해 안정 상태 디코딩에서 반복적인 호스트-대-디바이스 메타데이터 복사를 제거했습니다.
통신 최적화: +18%
Fleet은 집합 연산에 잔여 덧셈과 RMSNorm을 통합한 융합 MNNVL 올리듀스 경로를 사용했다고 보고되었습니다.
추측 디코딩: 약 4배
가장 큰 개별 이득은 추측 디코딩에서 나왔습니다.
Intent Lab에 따르면 최적화된 DSpark 드래프터가 여러 토큰을 제안하고 메인 모델이 이를 배치로 검증하여 디코딩 처리량을 크게 향상시킵니다.
회사는 완전한 엔드투엔드 결과를 기본 베이스라인 대비 534% 개선으로 보고합니다.
이 수치는 Intent Lab 자체 측정 결과입니다. 하드웨어 구성, 워크로드 세부 사항, 배치 설정, 출력 길이, 정밀도, 동시성 및 소프트웨어 버전은 추론 벤치마크에 실질적인 영향을 미칠 수 있습니다.
Fleet의 최적화 루프는 단일 패스보다 팀처럼 작동합니다
Intent Lab에 따르면 Fleet은 반복적인 엔지니어링 루프를 따릅니다:
- 루프라인 분석
- 병목 현상 식별
- 제안
- 검증
- 복합화
- 다음 병목 현상으로 복귀
제안된 최적화가
검증에 실패하면 시스템이 돌아가서 다시 시도합니다.
"복합" 단계가 중요한 이유는 개별적으로 성공한 최적화들이 서로 간섭할 때 성능 엔지니어링이 실패하는 경우가 많기 때문입니다.
Fleet은 결합된 시스템이 여전히 작동하는지 확인한 후에만 변경 사항을 유지하도록 설계되었습니다.
GLM-5.2가 까다로운 목표인 이유
GLM-5.2는 Z.ai의 장기 작업(long-horizon)용 플래그십 모델입니다.
공식 모델 카드에는 100만 토큰 컨텍스트 창, 장기 코딩 및 에이전트 워크로드, 유연한 추론 노력, 개선된 희소 어텐션 아키텍처, MIT 라이선스 하의 오픈 가중치가 강조되어 있습니다.
긴 컨텍스트와 에이전트 워크로드를 가진 대형 모델은 까다로운 서빙 문제를 만듭니다.
가장 빠른 구현은 커널 설계, 메모리 대역폭, KV-캐시 동작, 인터커넥트 대역폭, 배치 크기, 추측 디코딩, 양자화, 호스트 스케줄링, 통신 집합(collectives) 간의 상호작용에 달려 있습니다.
이는 추론 최적화를 자율 엔지니어링 시스템에게 유용한 스트레스 테스트로 만듭니다.
데모 2: 단일 요구사항에서 탄생한 SQLite 호환 데이터베이스
Fleet의 두 번째 공개 프로젝트는 GPU 커널에서 완전히 벗어납니다.
Intent Lab은 시스템에게 SQLite와 호환되는 SQL 데이터베이스 엔진을 구축하도록 요청했습니다.
공개 자료에는 다음과 같은 요구사항이 제시되어 있습니다:
SQLite와 호환되는 SQL 데이터베이스 엔진을 구축하되,
모든 sqllogictest 테스트 케이스를 통과할 수 있다는 의미에서 호환되어야 하며,
성능은 동등하거나 더 빨라야 합니다.
Intent Lab에 따르면 Fleet은 SQLite의 소스 코드나 문서에서 시작하지 않았다고 합니다.
대신 기존 시스템의 동작과 테스트 코퍼스를 승인 계약(acceptance contract)으로 취급했습니다.

회사는 최종 시스템이 약 600만 개의 SQLite 호환성 테스트를 통과했다고 보고합니다.
이 수치는 Intent Lab에서 나온 것이며, 이 기사에서 독립적으로 재현되지는 않았습니다.
하나의 Fleet, 여러 엔지니어링 역할
Intent Lab은 데이터베이스 구축을 프로젝트 전반에 걸쳐 작업하는 여러 역할로 시각화합니다:
- 의사 결정
- 아키텍처
- 코딩
- 테스팅
- 리뷰
- QA
역할들은 단순히 선형적으로 인계되는 방식으로 작동하지 않습니다.
구현이 진행되는 동안 아키텍처가 변경될 수 있습니다. 기능이 추가되는 동안 테스팅이 계속됩니다. 코드베이스가 성장하는 동안 리뷰와 QA가 활성 상태로 유지됩니다.
비용은 모델에 크게 의존합니다
Intent Lab은 또한 비용 비교를 공개했습니다.
동일한 데이터베이스 구축에 대해, 회사는 Opus 4.8을 사용한 실행은 약 $2,000가 들었고, 오픈소스 모델을 사용한 실행은 약 $350가 들었다고 밝혔습니다.
이 수치는 회사가 보고한 것이며, 모델 가격, 토큰 소비, 에이전트 오케스트레이션, 인프라에 따라 달라집니다.
그럼에도 이는 에이전트 엔지니어링의 주요 경제적 질문을 보여줍니다: 단일 모델 호출의 가격이 아니라, 완전한 성공적인 프로젝트의 비용은 얼마인가?
데모 3: 정형
에이전트를 위한 검증된 파일 시스템
세 번째 데모는 AgentFS라는 분산 파일 시스템입니다.
Intent Lab은 클라우드 환경의 에이전트 워크로드를 위해 특별히 설계되었다고 밝혔습니다.
AI 코딩 및 연구 에이전트는 독특한 저장 패턴을 만드는 경향이 있습니다:
- 많은 임시 샌드박스
- 대량의 작은 파일
- 잦은 생성 및 삭제
- 공유 클라우드 스토리지
- 높은 메타데이터 변동
- 수명이 짧은 저장소
Intent Lab은 Amazon EFS와 S3FS를 포함한 기존 시스템을 평가했지만 이러한 워크로드에 한계가 있음을 발견하고, 대신 새로운 파일 시스템을 구축했다고 밝혔습니다.
회사는 메타데이터 중심 작업 전반에 걸쳐 비교 대상 시스템보다 상당한 속도 향상을 달성했다고 주장합니다.

다시 말하지만, 이는 Intent Lab의 출시 벤치마크이지 독립적인 제3자 결과가 아닙니다.
형식 검증이 코딩 에이전트가 놓친 버그를 발견
몇 분 만에 쇼케이스 사이트를 만들고 리드를 늘리세요
아이디어를 한 문장으로 입력하면 We0 AI가 쇼케이스 사이트, 페이지, CMS를 생성하고 출시 후 고객과 트래픽 확보를 돕습니다.
무료 등록을 위한 하나의 완전한 프로젝트 생성
하나의 완전한 생성 흐름을 시도하고 첫 번째 프로젝트 초안을 빠르게 보는 데 가장 적합합니다.
파일 시스템 예시에서 가장 중요한 부분은 벤치마크 차트가 아닙니다.
바로 검증입니다.
Intent Lab은 Fleet이 핵심 프로토콜을 공식적으로 모델링하고 약 190만 개의 상태를 탐색했다고 밝혔습니다.
이 과정에서 코딩 에이전트가 생성한 코드에서 버그가 발견되었습니다.
이 버그는 분산 생성/삭제 동작 중 일시적인 손상 상태를 초래할 수 있었습니다.
Intent Lab은 Fleet이 구현을 수정하고 검증을 다시 실행했다고 밝혔습니다.
또한 회사는 약 300개의 통합 테스트와 장애 주입, 크래시 및 복제본을 주입한 퍼징 테스트를 수행했다고 보고했습니다.
파일 시스템은 드문 인터리빙(교차 실행)에 특히 취약하기 때문에 형식 검증이 여기서 중요한 가치를 갖습니다.
전통적인 테스트는 일반적인 경로가 작동한다는 것을 보여줄 수 있습니다. 모델 체커는 일반적인 테스트 스위트가 결코 만나지 못할 상태 조합을 체계적으로 탐색할 수 있습니다.
이 원리는 Intent Lab 외부에서도 잘 정립되어 있습니다. 파일 시스템 연구자들은 수십 년간 모델 체킹을 사용하여 성숙한 시스템에서 크래시 일관성 및 메타데이터 버그를 노출시켜 왔습니다.
여기서 새로운 주장은 자율 엔지니어링 시스템이 이러한 스타일의 검증을 자체 빌드 루프에 통합할 수 있다는 것입니다.
"실행되는 코드"와 프로덕션 소프트웨어 사이의 누락된 계층
Jia의 핵심 주장은 세 가지 데모보다 더 광범위합니다.
최신 모델은 코드를 빠르게 작성할 수 있습니다.
그렇다고 그 결과물이 기업이 수년간 운영해야 하는 소프트웨어라는 의미는 아닙니다.
그는 남은 격차가 단순히 모델 코딩 능력의 또 다른 도약이 아니라고 주장합니다.
그것은 모델 주변의 엔지니어링 계층입니다.

프로덕션 시스템은 구현 이상의 것이 필요합니다.
요구사항, 아키텍처, 인터페이스가 필요합니다.
trade-offs, coordination, testing, performance analysis, reliability work, verification, fault handling, maintenance, and feedback from production.
A coding model may participate in all of those activities.
Fleet의 핵심 주장은 이러한 활동들이 하나의 자율 시스템으로 조직되어야 한다는 것입니다.
Fleet는 엔지니어링을 6단계로 구분한다
Intent Lab은 엔지니어링 프로세스를 6단계로 설명합니다.

- 이해(Understand)
Fleet는 모호한 의도를 구체적인 결과물, 제약 조건, 승인 기준, 측정 가능한 성공 정의로 전환하도록 설계되었습니다.
- 설계(Design)
Fleet는 트레이드오프를 검토하고 인터페이스, 구성 요소, 장기 시스템 구조를 정의합니다.
- 조정(Coordinate)
시스템은 대규모 프로젝트를 작업으로 분할하고 의존성을 관리하며 구현이 전체 설계와 일관성을 유지하도록 합니다.
- 구축(Build)
개발 중 새로운 정보가 나타남에 따라 구현과 아키텍처가 함께 진화합니다.
- 검증(Verify)
검증에는 단위 테스트, 통합 테스트, 벤치마크, 형식 증명, 모델 체킹, 장애 주입, 퍼징, 런타임 검증이 포함될 수 있습니다.
- 진화(Evolve)
Fleet는 프로덕션 성능을 관찰하고 사용, 신뢰성, 비용에 대한 정보를 설계에 피드백하도록 설계되었습니다.
이 지점에서 Intent Lab의 야망은 자율 코딩 에이전트를 넘어섭니다.
목표는 단순한 소프트웨어 생성이 아닙니다.
목표는 자율적인 소프트웨어 소유권입니다.
"원칙 있는 엔지니어링 팀"이 제품의 은유이다
Intent Lab은 Fleet가 원칙 있는 엔지니어링 팀처럼 작동한다고 설명합니다.
이는 유용한 은유입니다. 강력한 엔지니어링 조직의 어떤 구성원도 모든 문제를 담당하지 않기 때문입니다.
한 엔지니어는 커널을 최적화할 수 있습니다. 다른 엔지니어는 스토리지 프로토콜을 설계할 수 있습니다. 또 다른 사람은 벤치마크를 유지 관리합니다. 다른 사람은 신뢰성을 검토합니다.
Fleet는 이러한 책임을 조정된 에이전트 역할로 전환하려고 시도합니다.
따라서 핵심 질문은 LLM이 고품질 코드를 작성할 수 있는지 여부만이 아닙니다.
핵심 질문은 여러 자율 프로세스가 동일한 프로젝트를 장기간에 걸쳐 구축, 테스트, 최적화, 검증, 수정하면서 일관된 시스템 아키텍처를 유지할 수 있는지 여부입니다.
경제적 논거: 소프트웨어가 더 맞춤화될 수 있다
Jia는 또한 경제적 논거를 제시합니다.
수십 년 동안 소프트웨어 개발에는 고정 비용이 크게 들었습니다.
합리적인 전략은 하나의 제품을 만들어 많은 사용자에게 판매하고, 서로 다른 요구를 가진 사용자들이 동일한 소프트웨어에 적응하도록 하는 것이었습니다.
자율 엔지니어링이 시스템 구축 및 유지 관리의 고정 비용을 줄인다면, 이 공식은 변화합니다.
를 유지 관리하고 있습니다. 이는 NVIDIA 제품이 Lepton AI의 원래 스타트업 로드맵을 얼마나 밀접하게 보존했는지에 대한 논쟁과는 별개의 문제입니다.
관련 도구
- Intent Lab: 의도를 프로덕션 소프트웨어로 전환하는 자율 엔지니어링 시스템인 Fleet을 구축하는 회사.
- NVIDIA TensorRT-LLM: NVIDIA GPU에서 대규모 언어 모델을 최적화하고 서빙하기 위한 NVIDIA의 프로덕션 추론 프레임워크.
- TensorRT-LLM on GitHub: NVIDIA LLM 추론 스택의 오픈소스 저장소.
GLM-5.2: Intent Lab의 추론 엔진 데모에 사용된 Z.ai의 오픈 가중치 장기 지평(long-horizon) 모델.
- NVIDIA DGX Cloud Lepton: GPU 컴퓨팅 제공업체 네트워크 전반에서 AI 워크로드를 구축하고 배포하기 위한 NVIDIA의 플랫폼.
- SQLite: Fleet의 데이터베이스 데모에서 동작 및 호환성 테스트의 대상으로 사용된 데이터베이스.
관련 링크
- Intent Lab: 의도를 프로덕션 시스템으로 전환하기: Intent Lab의 공식 출시 기사이자 Fleet 데모의 출처.
- Yangqing Jia의 Intent Lab 발표: Intent Lab과 자율 엔지니어링 테제를 소개한 Jia의 공개 게시물.
- NVIDIA DGX Cloud Lepton 문서: Lepton AI의 기술에서 성장한 플랫폼에 대한 현재 공식 문서.
- NVIDIA DGX Cloud Lepton 출시: DGX Cloud Lepton과 글로벌 GPU 마켓플레이스를 설명하는 NVIDIA의 2025년 발표.
- GLM-5.2 공식 모델 카드: Z.ai의 공식 사양 및 모델 문서.
- NVIDIA TensorRT-LLM 문서: 공식 아키텍처, 설치, 최적화, 런타임 및 배포 문서.
- USENIX: 모델 체킹을 사용한 심각한 파일 시스템 오류 탐지: 드문 파일 시스템 정확성 실패를 찾는 데 형식 모델 체킹이 왜 유용한지 보여주는 고전적인 사례.
요약
Yangqing Jia의 새 회사 Intent Lab은 AI 작업의 다른 단위, 즉 코드 생성이 아닌 완전한 프로덕션 시스템 수명주기를 중심으로 Fleet을 구축하고 있다.
첫 번째 데모는 GLM-5.2 추론 최적화, SQLite 호환 데이터베이스, 그리고 형식 검증된 분산 파일 시스템에 걸쳐 있다. Intent Lab은 6.3배의 추론 속도 향상, 약 600만 건의 데이터베이스 호환성 테스트, 약 190만 개의 파일 시스템 상태에 대한 모델 체킹을 보고한다.
공통된 아이디어는 이해(Understand), 설계(Design), 조정(Coordinate), 구축(Build), 검증(Verify), 진화(Evolve)의 6단계 엔지니어링 루프로, 자율 에이전트를 통해 강력한 엔지니어링 조직의 책임을 재현하려는 것이다.
결과는 아직 초기 단계이며 대부분 자체 보고에 의존하므로, 재현성과 장기적인 프로덕션 운영이 진정한 시험대가 될 것이다.
Fleet의 가장 중요한 주장은 AI가 한 문장에서 코드를 작성할 수 있다는 것이 아니라, 자율 시스템이 한 문장과 수년간 운영할 가치가 있는 소프트웨어 사이의 엔지니어링 작업에 대한 책임을 질 수 있다는 것이다.



