서론
NVIDIA의 CUDA 해자가 종말을 맞았다는 선언은 거의 업계의 의식(儀式)이 되었다.
새로운 가속기가 등장한다. 컴파일러가 공개 베타에 들어간다. 한 클라우드 서비스 제공업체가 자체 AI 칩을 홍보한다. 어떤 프로그래밍 추상화가 이식 가능한 커널을 약속한다. 누군가 개발자들이 더 이상 CUDA를 직접 작성할 필요가 없다고 선언한다.
그러나 CUDA는 여전히 차세대 AI 인프라의 핵심 위치를 차지하고 있다.
가장 최근의 도전이 더 흥미로운 이유는 그것이 AI 자체에서 비롯되었기 때문이다.
전 Google Brain 연구원 Jeremy Nixon이 설립한 AI 인프라 스타트업 Infinity는 자사의 Ignition 에이전트가 추론 소프트웨어 스택의 중요한 구성 요소를 전통적인 엔지니어링 프로세스보다 훨씬 빠른 속도로 낯선 d-Matrix Corsair 가속기로 이전했다고 주장한다.
가장 주목할 만한 결과는 약 10시간 만에 Ignition이 전체 32개 컴퓨팅 유닛에서 텐서 병렬 행렬 곱셈을 구현했고, 해당 칩의 실측 컴퓨팅 상한의 92%에 도달했다는 것이다.
이는 의미 있는 결과다. 그러나 이것이 10시간 만에 CUDA를 재건했다는 뜻은 아니다.
Infinity의 자체 사례 연구에 따르면 완전한 엔드투엔드 Qwen3 추론 경로는 약 10일이 걸렸으며, 필요한 모든 작업이 새 하드웨어에 맞춰 다시 작성되었다. CUDA는 행렬 곱셈 구현이나 모델 런타임이 아니다. 그것은 컴파일러, 런타임, 라이브러리, 성능 분석 및 디버깅 도구, 통신 시스템, 프레임워크 통합, 문서화, 그리고 거의 20년에 달하는 프로덕션 경험을 포함하는 성숙한 플랫폼이다.
더 나은 질문은 AI가 하룻밤 사이에 CUDA를 복제했는지가 아니다.
코딩 에이전트가 새 AI 칩을 유용하게 만드는 데 걸리는 시간을 획기적으로 단축할 수 있는지 여부다.
그 답은 점점 "그렇다"로 기울고 있다.

CUDA의 해자는 결코 GPU만의 것이 아니었다
NVIDIA는 하드웨어로 가장 잘 알려져 있다: H100, Blackwell, Rubin, 그리고 이를 중심으로 구축된 대규모 시스템.
그러나 가장 지속적인 강점은 하드웨어를 둘러싼 소프트웨어다.
CUDA의 약자는 계산 통합 디바이스 아키텍처다. NVIDIA는 이를 단순한 프로그래밍 언어가 아닌 가속 컴퓨팅 플랫폼으로 설명한다.
CUDA 플랫폼에는 다음이 포함된다:
- GPU 프로그래밍 모델.
- 컴파일러 툴체인.
- 런타임 라이브러리.
- 드라이버 인터페이스.
- 고도로 최적화된 수학 및 AI 라이브러리.
- 디버깅 및 성능 분석 도구.
- 다중 GPU 통신 소프트웨어.
- 프레임워크 통합.
- 문서, 교육 및 코드 예제.
- 방대한 개발자 및 파트너 생태계.
기반 계층에서 CUDA는 엔지니어가 NVIDIA GPU에서 직접 실행되는 커널을 작성할 수 있게 해준다.
그 위에는 cuBLAS, cuDNN, cuFFT, NCCL, TensorRT, TensorRT-LLM과 같은 라이브러리가 있다. 라이브러리 위에는 PyTorch, TensorFlow, JAX, 추론 서버, 연구 코드 및 기업 내부 시스템이 있다.
단순화된 관점은 다음과 같다:
애플리케이션 및 AI 프레임워크
↓
최적화 라이브러리 및 분산 시스템
↓
컴파일러, 런타임, 프로파일러, 디버거 및 커널
↓
NVIDIA GPU 및 상호 연결 기술
기업이 NVIDIA 생태계에 머무는 이유는 CUDA 문법에 익숙하기 때문만이 아니라 모델, 테스트, 배포 시스템, 성능 기대치, 디버깅 프로세스, 프로덕션 팀 모두가 전체 기술 스택에 의존하고 있기 때문이다.
하드웨어를 교체한다는 것은 단순히 소스 코드를 번역하는 것 이상일 수 있으며, 신뢰를 재구축하는 것을 의미할 수도 있다.
Infinity가 10시간 동안 실제로 한 일
Infinity의 공식 사례 연구는 널리 퍼진 제목보다 훨씬 엄격하다.
이 회사는 생성형 AI 추론 하드웨어에 특화된 스타트업인 d-Matrix와 협력했다. Corsair 가속기는 NVIDIA GPU와 다른 아키텍처와 명령어 세트를 사용한다. Infinity는 이 칩이 공개된 소프트웨어 역사가 거의 없어 범용 프로그래밍 모델이 학습 데이터에서 직접 재현하기 어렵다고 밝혔다.
Ignition은 하드웨어 정보를 확보하고 AI 워크로드를 실행하는 데 필요한 저수준 소프트웨어를 생성하기 시작했다.
Infinity에 따르면 약 10시간 만에 시스템은 다음을 달성했다:
- 텐서 병렬 행렬 곱셈.
- 전체 32개 Corsair 컴퓨팅 유닛에서 실행.
- 최대 92%의 "광속(光速)" 성능 달성.
Infinity는 "광속"을 생성된 커널이 달성한 칩 도달 가능 컴퓨팅 피크 대비 비율로 정의한다. 게시된 사례 연구에서 실측 상한 자체는 이론 피크의 약 90%였다.
이는 훌륭한 커널 신속 시작 결과이지만 CUDA와 동등한 완전한 플랫폼은 아니다.
10시간: 고성능 행렬 곱셈
행렬 곱셈은 Transformer 추론의 핵심이지만 단지 한 가지 연산 범주에 불과하다.
전체 모델에는 어텐션 메커니즘, 정규화, 활성화 함수, 라우팅, 양자화, KV 캐시 관리, 샘플링, 텐서 이동, 상태 처리 및 모델 서빙과 같은 추가 작업이 필요하다.
10일: 엔드투엔드 모델 추론
Infinity에 따르면 약 10일 만에 Qwen3가 Corsair에서 엔드투엔드로 실행되었다. 이후 자금 조달 발표에서는 해당 기간 동안 세 개의 프론티어 모델이 커널을 처음부터 작성하여 엔드투엔드로 실행되었다고 밝혔다.
이 더 긴 타임라인 역시 인상적이다.
낯선 가속기를 기본 작동에서 실행 가능한 모델 런타임으로 끌어올리는 기간을 수개월에서 수일로 단축하는 것은 새 하드웨어 출시의 경제성을 근본적으로 바꿀 수 있다.
| 주장 | 더 정확한 해석 |
|---|---|
| "AI가 10시간 만에 CUDA를 재창조했다" | 과장 |
| 행렬 곱셈이 10시간 만에 실행됨 | Infinity 보고 |
| 실측 상한의 92% 성능 달성 | Infinity 보고 |
| Qwen3가 약 10일 만에 엔드투엔드 실행 | Infinity 보고 |
| Infinity가 범용 추론 라이브러리를 구축 중 | Infinity 확인 |
| 완전한 CUDA 생태계가 복제됨 | 아님 |
Ignition은 자동화된 커널 및 추론 엔지니어링 에이전트
Infinity는 Ignition을 AI 연구 에이전트라고 부른다.
그 목적은 모델 연산을 특정 칩에서 효율적인 작업으로 변환하는 저수준 소프트웨어를 생성하고 개선하는 것이다.
이 순환 과정은 자동화된 성능 엔지니어링 프로세스와 유사하다:
코드 생성
→ 컴파일
→ 하드웨어에서 실행
→ 정확성 테스트
→ 성능 측정
→ 병목 현상 진단
→ 구현 수정
→ 반복

Infinity는 하드웨어 공급업체와 추론 서비스 제공업체를 위해 모델 인지 추론 소프트웨어 계층을 구축하고 있습니다. 공개된 작업 흐름은 실제로 다음과 같습니다:
하드웨어 사양
→ 생성된 프로덕션급 추론 소프트웨어
Infinity는 또한 NVIDIA 추론 엔진을 처음부터 구축하여 Qwen3-8B에서 구성이 일치하는 vLLM 구현보다 최대 34.3% 더 높은 성능을 냈다고 보고했습니다.
이 결과는 회사가 자체적으로 보고한 것이며, 하드웨어, 배치 설정, 모델 구성 및 측정 방법에 의존합니다. 그럼에도 불구하고 이는 Infinity의 야망이 기본 칩 시작을 훨씬 넘어선다는 것을 시사합니다.
DeepSeek TileKernels도 동일한 정밀도를 요구함
원문은 DeepSeek의 TileKernels 저장소도 언급했습니다.
TileKernels는 TileLang으로 작성된 최적화된 GPU 커널 라이브러리로, TileLang은 고성능 커널 개발을 위한 Python 기반 도메인 특화 언어입니다.
이 저장소에는 다음 작업이 포함되어 있습니다:
- Mixture of Experts(MoE) 게이팅.
- MoE 라우팅.
- FP8 및 FP4 양자화.
- 전치(Transpose).
- Engram 게이팅.
- Manifold HyperConnection.
- PyTorch 자동 미분 래퍼.
DeepSeek는 많은 커널이 계산 강도 또는 메모리 대역폭 측면에서 이미 하드웨어 한계에 근접했으며, 일부 커널은 내부적으로 사용 중이라고 밝혔습니다.
TileLang은 엔지니어가 수동으로 작성해야 하는 저수준 CUDA C++ 코드의 양을 줄여줍니다.
현재 형태로는 DeepSeek가 NVIDIA 기술 스택에 대한 의존성을 제거했다는 것을 나타내지 않습니다.
공식 TileKernels의 현재 요구 사항은 다음과 같습니다:
NVIDIA SM90 또는 SM100 GPU
CUDA Toolkit 13.1 이상
PyTorch 2.10 이상
TileLang 0.1.9 이상
현재 라이브러리는 최신 NVIDIA 아키텍처를 위해 설계되었습니다. 수동으로 작성된 CUDA 소스 코드에 대한 의존성은 줄였지만, NVIDIA 하드웨어나 CUDA 툴킷에 대한 의존성은 줄이지 못했습니다.
TileLang의 범위는 현재 DeepSeek 라이브러리보다 더 넓음
TileLang 자체는 더 광범위한 야망을 가지고 있습니다.
이 프로젝트는 TVM 컴파일러 인프라를 기반으로 하여 Python 스타일 구문을 사용해 GPU, CPU 및 가속기 커널을 위한 타일링된 프로그래밍 모델을 설명합니다.
그 목표는 엔지니어가 원하는 데이터 흐름과 효율적인 실행에 필요한 저수준 스케줄링을 분리하는 것입니다.
TileLang은 CUDA, ROCm 및 Metal을 포함한 다중 백엔드 언어 지원과 하드웨어 경로를 지속적으로 추가하고 있습니다.
이러한 이식성은 공급업체 간 전환 비용을 낮출 수 있지만, 생성된 결과가 정확하고, 안정적이며, 디버깅 가능하고, 공급업체 라이브러리와 비교해 경쟁력이 있어야 합니다.
어디서나 실행되지만 성능이 낮은 커널은 프로덕션 환경에서 CUDA 경로를 대체할 수 없습니다.
올바른 코드도 수백 배 느릴 수 있음
2026년 7월의 한 연구 논문은 Triton과 TileLang에서 커널 정확성과 대체 품질 간의 격차를 조사했습니다.
저자들은 커널이 수치 정확성 테스트를 통과할 수 있지만 최적화된 기준선보다 성능이 크게 낮을 수 있음을 발견했습니다. 보도에 따르면 TileLang LayerNorm 구현은 정확성 검사를 통과했음에도 불구하고 PyTorch 기준선보다 300배 이상 느리게 실행되었습니다.
이 논문은 TileLang에 반대하는 것이 아니라 생성된 커널을 두 가지 차원에서 평가할 것을 주장합니다:
정확성
+
하드웨어 효율성
코드 생성은 점점 빨라지고 있습니다. 그러나 생성된 코드가 성숙한 프로덕션 소프트웨어를 대체하기에 충분하다는 것을 입증하는 것은 여전히 어렵습니다.
추론이 최우선 주요 전장
CUDA에 대한 도전은 프론티어 모델 훈련보다 추론 분야에서 더 신뢰도를 얻고 있습니다.
훈련은 최대 규모와 안정성을 우선시함
대규모 훈련 실행은 수천 또는 수만 개의 가속기가 수주 또는 수개월 동안 협력하여 작동해야 할 수 있습니다.
훈련 플랫폼은 대규모 장치 전반의 분산 통신, 체크포인트, 장애 복구, 메모리 관리, 병렬성, 재현성 및 디버깅을 처리해야 합니다.
한 번의 하드웨어 또는 소프트웨어 오류로 막대한 컴퓨팅 자원이 낭비될 수 있습니다. 따라서 기관들은 중요한 훈련 부하를 검증된 시스템에서 전환할 때 매우 신중한 태도를 보입니다.
CUDA, CUDA-X 라이브러리, NCCL, PyTorch 지원 및 NVIDIA의 통합 네트워킹 역량은 이 회사가 이 분야에서 강력한 위치를 차지하게 합니다.
추론은 유용한 답변 하나당 비용을 우선시함
추론은 모델 훈련이 완료된 후 서비스를 제공하는 단계입니다.
관련 비즈니스 지표는 일반적으로 다음과 같은 형태에 더 가깝습니다:
허용 가능한 출력 품질
÷
총 서비스 비용
추론은 단일 가속기, 소규모 클러스터, 대규모 컴퓨팅 팜 및 전용 하드웨어에 분산될 수 있습니다.
새로운 칩이 모든 시나리오에서 NVIDIA를 대체할 필요는 없습니다. 특정 모델 또는 부하가 더 낮은 비용, 더 빠른 속도, 더 낮은 전력 소비, 더 높은 처리량 또는 더 예측 가능한 지연 시간에서 이점이 있음을 입증하기만 하면 됩니다.
이러한 더 좁은 목표는 전용 하드웨어에 현실적인 진입점을 제공합니다.
d-Matrix는 생성형 AI 추론을 중심으로 구축됨
d-Matrix는 2019년에 설립되었으며 추론 가속화에 특화되어 있습니다. Corsair 플랫폼은 대량의 온칩 SRAM을 활용하여 생성 모델 실행의 비용과 에너지 소비를 줄이는 것을 목표로 합니다.

Infinity의 작업은 새로운 가속기가 직면하는 전형적인 문제 중 하나를 해결했다.
칩 하나가 유망한 하드웨어를 갖추고 있더라도, 커널, 모델 실행, 메모리 처리, 양자화, 서비스 로직 및 통합 솔루션이 준비되기 전까지는 고객이 효율적으로 사용할 수 없다.
에이전트가 이 부팅 과정을 수개월에서 수일로 단축할 수 있다면, 하드웨어 스타트업은 모델 출시 시점에 맞춰 지원을 제공하고 하드웨어 성능을 더 일찍 시연할 수 있다.
이는 NVIDIA 소프트웨어 우위의 일부를 약화시키지만, 전체 우위를 제거하지는 않는다.
다른 업체들도 같은 돌파구를 노리고 있다
추론 시장에는 여러 도전자가 존재한다:
몇 분 만에 쇼케이스 사이트를 만들고 리드를 늘리세요
아이디어를 한 문장으로 입력하면 We0 AI가 쇼케이스 사이트, 페이지, CMS를 생성하고 출시 후 고객과 트래픽 확보를 돕습니다.
무료 등록을 위한 하나의 완전한 프로젝트 생성
하나의 완전한 생성 흐름을 시도하고 첫 번째 프로젝트 초안을 빠르게 보는 데 가장 적합합니다.
| 업체 또는 플랫폼 | 전반적 포지셔닝 |
|---|---|
| Rebellions | 전용 AI 추론 가속기 및 시스템 |
| Cerebras | 학습 및 추론용 웨이퍼 스케일 시스템 |
| AWS Inferentia | Neuron SDK를 사용하는 Amazon 설계 추론 칩 |
| Google TPU | XLA 및 주요 프레임워크를 통해 지원되는 Google 가속기 |
| AMD Instinct | ROCm 플랫폼을 사용하는 데이터센터 GPU |
| d-Matrix | SRAM 중심의 생성형 AI 추론 가속 |
| NVIDIA | GPU 및 CUDA 가속 컴퓨팅 스택 |
압박은 사용자가 모든 연산을 수동으로 다시 작성하지 않고도 모델을 배포할 수 있게 해주는 소프트웨어 계층에서 발생하며, 여기에는 AWS Neuron, Google XLA, AMD ROCm, Modular MAX 및 Mojo, TileLang, Triton, AI 생성 커널 시스템이 포함된다.
이러한 소프트웨어 계층이 자동화하는 내용이 많을수록 애플리케이션 개발자가 수동으로 개입해야 하는 횟수는 줄어든다.
CUDA에 관한 직접적인 내용이다.
크로스 칩 소프트웨어는 잠금 효과를 낮출 수 있다
애플리케이션과 최적화 커널이 NVIDIA 하드웨어에 긴밀하게 결합되어 있을 때 CUDA의 잠금 효과가 가장 강하게 나타난다.
이식 가능한 추론 계층은 다음 워크플로우를 목표로 한다:
모델
→ 이식 가능한 실행 계층
→ 하드웨어 커널 생성 또는 선택
→ 대상 가속기
현실 세계는 더 복잡하다. 칩마다 메모리 계층 구조, 수치 형식, 상호 연결 방식, 스케줄링 동작, 지원 연산이 다르기 때문이다.
고성능을 위해서는 여전히 특정 하드웨어에 맞춘 작업이 필요한 경우가 많다.
Infinity의 핵심 주장은 에이전트가 이러한 전문화 작업을 자동으로 생성할 수 있다는 것이다.
CUDA의 해자는 단순히 기존 코드만이 아니다
10시간의 결과로는 CUDA를 대체하기 어렵게 만드는 자산을 복제할 수 없다.
이러한 자산에는 다음이 포함된다:
성숙한 라이브러리
많은 조직이 커널을 직접 작성하는 대신 벤더 라이브러리를 사용한다. cuBLAS, cuDNN, TensorRT, NCCL 등의 라이브러리에는 수년간의 최적화 경험이 축적되어 있다.
디버깅 및 분석 도구
NVIDIA Nsight 및 관련 도구는 엔지니어가 정확성, 메모리 동작, 타임라인, 통신 및 성능을 이해하는 데 도움을 준다.
프레임워크 지원
새로운 모델 기능은 일반적으로 NVIDIA 하드웨어에 대해 조기에 통합되고 최적화된다.
배포 지식
프로덕션 팀은 NVIDIA 시스템이 부하 상태에서 어떻게 동작하는지 이해하고 있다.
문서 및 교육
이 생태계에는 예제, 강좌, 컨퍼런스 발표, 커뮤니티 답변, 전문가 리소스가 포함되어 있다.
기존 투자
기업은 수백만 줄의 코드, 테스트, 조달 프로세스, 직원 역량이 이 플랫폼에 묶여 있다.
AI는 전환 비용을 낮출 수 있지만, 조직 차원의 전환 비용을 자동으로 제거하지는 않는다.
검증이 차세대 CUDA 해자가 될 수 있다
INT21 창립자이자 NVIDIA에 인수된 HippoML의 창립자였던 Bing Xu는 검증이 주요 병목이라고 주장한다.

에이전트는 코드를 빠르게 생성할 수 있다. 그러나 프로덕션 팀은 다음을 증명하는 증거가 여전히 필요하다:
- 올바른 수치 출력을 생성한다.
- 다양한 형태와 데이터 유형에 적용된다.
- 엣지 케이스를 처리한다.
- 메모리를 손상시키지 않는다.
- 동시성 하에서 안정적으로 동작한다.
- 다양한 워크로드에서 좋은 성능을 보인다.
- 드라이버 및 하드웨어 변경에 대응할 수 있다.
- 소프트웨어 스택의 다른 부분과 올바르게 상호작용한다.
NVIDIA는 이미 방대한 규정 준수 테스트, 성능 테스트, 참조 구현, 시뮬레이터, 성능 분석기, 컴파일러 진단, 프로덕션 워크로드 및 과거 오류 데이터를 보유하고 있다.
이러한 자산은 에이전트를 더 유용하게 만든다.
따라서 AI는 해자를 코드 생성에서 검증 환경의 품질로 전환할 수 있다.
NVIDIA는 자체 CUDA 에이전트를 구축 중이다
CUDA에 도전하는 기술은 NVIDIA에도 동일하게 적용된다.
Business Insider는 NVIDIA 개발자 생태계 부사장 Ankit Patel의 말을 인용하여, 이 회사가 AI 코딩 에이전트를 사용하여 CUDA 개발을 더 빠르게 진행하고 더 큰 규모로 검증하고 있다고 보도했다.
NVIDIA는 이미
또한 CUDA 인텔리전스 전략을 제시하며 기존 CUDA 지식, 최적화 전문성, 클라우드 성능 프로파일링, Nsight 도구, 벤치마크 및 MCP 기반 서비스를 결합하고 있다.
NVIDIA는 AI 생성 CUDA 및 CUDA 코어 컴퓨팅 라이브러리 코드를 위한 오픈 벤치마크인 ComputeEval을 유지 관리한다.
이 벤치마크는 텐서 코어, 공유 메모리, 워프 레벨 프리미티브, CUDA 그래프, 스트림 및 이벤트와 관련된 작업을 다룬다.
따라서 이 경쟁은 상대적이다:
도전자 소프트웨어가 따라잡는 속도
대
NVIDIA 소프트웨어 개선 속도
Chris Lattner: 과대광고는 실재하지만 과장되었다
Modular 공동 창립자이자 CEO인 Chris Lattner는 더 신중한 견해를 제시했다.

그는 코딩 에이전트가 CUDA 우위의 즉각적인 파괴가 아닌 점진적 개선을 제공한다고 본다.
원문 기사는 세 가지 이유를 요약했다.
코드 작성은 엔지니어링의 일부일 뿐이다
프로덕션 환경의 최적화가 칩의 경제적 실용성을 결정한다. 성능의 마지막 몇 퍼센트 포인트는 상당한 전문가 작업이 필요할 수 있다.
GPU 소프트웨어의 공개 학습 데이터는 적다
애플리케이션 코드는 온라인에 풍부하다.
고급 커널 및 컴파일러 엔지니어링은 비교적 좁은 분야이며, 가장 뛰어난 작업 중 상당수는 여전히 비공개로 유지되고 있다.
기존 시스템은 여전히 마이그레이션이 필요하다
기술적 실현 가능성이 인증 비용, 운영 리스크, 직원 재교육, 계약, 신뢰성 요구사항 또는 기회 비용을 제거하지는 않는다.
이러한 관점이 에이전트 기반 커널 엔지니어링이 중요하지 않다는 뜻은 아니다. 이는 강력한 데모가 즉각적인 시장 대체로 이어지지 않는 이유를 설명할 뿐이다.
해자는 사라지는 것이 아니라 이동하고 있다
가장 강력한 해석은 "CUDA가 죽었다"가 아니다.
오히려 CUDA의 역사적 강점 중 특정 계층이 더 쉽게 복제될 수 있게 되고 있다는 것이다.
에이전트, DSL, 자동화 컴파일러는 새로운 칩을 위한 커널, 런타임, 모델 지원을 구축하는 데 필요한 시간을 단축할 수 있다.
가장 노출된 계층은 초기 추론의 빠른 적응이다.
가장 보호된 계층은 여전히 대규모 학습, 성숙한 생성 라이브러리, 검증, 디버깅, 클러스터 오케스트레이션, 프레임워크 통합, 기존 고객 워크플로우, 지속적 최적화이다.
전략적 질문은 다음과 같이 바뀔 수 있다:
누가 가장 많은 양의 수작업 커널 코드를 보유하고 있는가?
에서 다음과 같이:
누가 자동화된 생성, 측정,
검증, 최적화의 최상의 폐루프를 보유하고 있는가?
NVIDIA는 이미 하드웨어, 도구, 라이브러리, 워크로드, 피드백 데이터를 보유하고 있어 유리한 위치에 있다. 도전자들은 에이전트가 진입 장벽을 낮추면서 혜택을 받는다.
이 두 가지는 동시에 성립할 수 있다.
10시간 결과가 실제로 바꾼 것
Infinity의 결과는 하드웨어 스타트업의 기대치를 바꾸었다.
새로운 가속기는 더 이상 모든 유용한 커널이 소수의 전문가 팀에 의해 수동으로 작성될 것이라고 가정할 필요가 없다.
에이전트는 다음과 같은 작업을 수행할 수 있다:
- 아키텍처 설명을 읽는다.
- 초기 커널을 생성한다.
- 컴파일하고 실행한다.
- 출력을 참조 결과와 비교한다.
- 하드웨어 활용도를 측정한다.
- 대체 스케줄링 방안을 탐색한다.
- 최상의 구현을 유지한다.
- 연산자에서 전체 모델로 확장한다.
이를 통해 칩 첫 테이프아웃부터 사용 가능한 모델 추론까지의 시간을 단축할 수 있다.
이러한 단축은 칩 공급업체가 하드웨어를 더 일찍 시연하고, 새 모델을 더 빠르게 지원하며, 소프트웨어 인력 부담을 줄이고, 더 많은 아이디어를 테스트하며, 더 세분화된 추론 시장에서 경쟁할 수 있게 한다.
이 결과는 CUDA를 지우지 않지만, CUDA와 경쟁하는 첫 걸음이 더 이상 그렇게 위협적으로 느껴지지 않게 만든다.
다음으로 주목할 것
독립적 재현
Infinity가 발표한 결과는 회사와 하드웨어 파트너로부터 나온 것이다. 외부 벤치마크가 더 강력한 증거를 제공할 것이다.
모델 적용 범위
범용 추론 계층은 다양한 아키텍처, 모달리티, 양자화 형식, 서비스 패턴을 지원해야 한다.
프로덕션 신뢰성
엔드투엔드로 실행되는 데모와 실제 고객 트래픽 하에서 수개월간 지속 운영되는 소프트웨어는 다른 문제다.
검증 규모
핵심 질문은 지능형 에이전트 시스템이 방대한 테스트 공간에서 정확성과 성능을 어떻게 입증할 것인가이다.
이식성
하나의 구현이 NVIDIA, AMD, Apple 및 기타 가속기에서 모두 뛰어난 결과를 낸다면 TileLang 및 기타 도메인 특화 언어는 더욱 전략적 중요성을 갖게 된다.
NVIDIA의 대응
NVIDIA는 에이전트, 벤치마크, 컴파일러 지능, 새로운 CUDA 추상화를 적극적으로 구축하고 있다. 기존 거대 기업도 정체되어 있지 않다.
자주 묻는 질문
AI 에이전트가 정말 10시간 만에 CUDA를 재구현했나?
아니다. Infinity는 Ignition이 10시간 만에 d-Matrix Corsair를 위한 텐서 병렬 행렬 곱셈 소프트웨어를 생성했고, 해당 칩의 경험적 계산 상한의 92%에 도달했다고 밝혔다. 엔드투엔드 Qwen3 추론에는 약 10일이 걸렸으며, 이 프로젝트는 CUDA의 전체 생태계를 재현한 것이 아니다.
Infinity Ignition이란 무엇인가?
Ignition은 Infinity의 AI 연구 및 엔지니어링 에이전트로, 저수준 추론 소프트웨어를 생성, 테스트, 디버깅, 최적화한다. 실제 하드웨어의 피드백을 활용하여 커널과 모델 런타임을 반복적으로 개선한다.
d-Matrix Corsair란 무엇인가?
Corsair는 d-Matrix가 출시한 생성형 AI 추론 플랫폼이다. Infinity는 이를 자동 생성된 텐서 병렬 연산 및 전체 모델 추론 스택의 대상 플랫폼으로 사용한다.
DeepSeek TileKernels가 CUDA를 대체할 것인가?
아니다. TileKernels는 TileLang을 사용하여 수작업 저수준 CUDA 커널의 필요성을 줄이지만, 현재 요구사항에는 NVIDIA SM90 또는 SM100 하드웨어와 CUDA Toolkit 13.1 이상이 포함된다.
왜 추론이 학습보다 CUDA 대안을 더 쉽게 수용하는가?
추론은 더 작은 시스템에서 실행될 수 있으며, 일반적으로 단일 모델의 비용, 전력 소비, 처리량 또는 지연 시간으로 평가된다. 최첨단 학습은 더 큰 클러스터, 성숙한 통신 시스템, 장애 복구 능력, 검증된 안정성을 필요로 한다.
CUDA의 가장 큰 해자는 무엇인가?
CUDA의 해자는 성숙한 라이브러리, 프레임워크 통합, 디버깅 및 프로파일링 도구, 분산 시스템, 문서, 프로덕션 이력, 기존 고객 코드를 포함한다. 검증과 지속적 최적화는 코드 생성 비용이 점점 낮아짐에 따라 더욱 중요해질 것이다.
AI 생성 커널이 올바르면서도 너무 느릴 수 있는가?
그렇다. 연구에 따르면 커널이 수치 정확성 테스트를 통과하더라도 성능은 최적화된 라이브러리 구현보다 훨씬 낮을 수 있다. 프로덕션 수준 평가에는 정확성 검사와 하드웨어 효율성 검사가 모두 필요하다.
NVIDIA도 AI 코딩 에이전트를 사용하고 있는가?
그렇다. NVIDIA는 에이전트를 사용하여 CUDA 개발 및 검증을 가속화하고 있다고 밝혔으며, CUDA를 위한 에이전트 워크플로우, 성능 분석 통합, ComputeEval 벤치마크를 공개적으로 시연했다.
관련 도구
- NVIDIA CUDA: NVIDIA의 가속 컴퓨팅 플랫폼으로 컴파일러, 런타임, 라이브러리 및 개발자 도구를 포함한다.
- Infinity: 새로운 AI 가속기를 위한 Ignition 및 모델 인지 추론 소프트웨어를 구축하는 회사.
- DeepSeek TileKernels: DeepSeek가 TileLang으로 작성한 MIT 라이선스의 최적화된 LLM 커널 모음.
- TileLang: 여러 백엔드에서 고성능 커널을 생성하기 위한 Python 스타일 도메인 특화 언어 및 컴파일러 스택.
- INT21 PTX Kernel Factory: 저수준 NVIDIA GPU 커널을 생성하고 개선하기 위한 에이전트 기반 시스템.
- AMD ROCm: GPU 컴퓨팅, AI 및 HPC를 위한 AMD의 소프트웨어 플랫폼.
- AWS Neuron: AWS Trainium 및 Inferentia 칩에서 모델을 배포하고 최적화하기 위한 SDK.
- Modular MAX: 이식 가능한 고성능 AI 실행을 위한 하드웨어 최적화 모델링 및 서비스 프레임워크.
관련 링크
- Business Insider: AI가 NVIDIA의 소프트웨어 해자를 다시 쓰고 있다: Infinity, NVIDIA, INT21, Modular 및 Rebellions 인터뷰를 포함한 주요 보도.
- Infinity d-Matrix Corsair 사례 연구: 10시간 행렬 곱셈 결과 및 10일 엔드투엔드 모델 출시에 대한 Infinity의 공식 설명.
- [Infinity 연구](https://infinity.
inc/research): d-Matrix, 생성형 추론 소프트웨어, 그리고 회사의 OMEGA 연구 시스템에 대한 공식 사례 연구를 포함합니다.
- NVIDIA CUDA 플랫폼: CUDA 컴파일러, 런타임, 라이브러리, 도구 및 생태계에 대한 공식 개요입니다.
- DeepSeek TileKernels 저장소: 공식 소스 코드, 종속성 요구 사항, 테스트 명령, 기능 특성 및 MIT 라이선스를 포함합니다.
- TileLang 논문: TileLang 타일링 프로그래밍 모델과 컴파일러 접근 방식을 설명하는 연구 논문입니다.
- NVIDIA ComputeEval: 최신 CUDA 프로그래밍 작업을 평가하기 위한 NVIDIA의 벤치마크입니다.
요약
Infinity의 Ignition 에이전트는 10시간 만에 NVIDIA CUDA를 재창조하지 않았습니다. 익숙하지 않은 아키텍처를 위해 고성능 텐서 병렬 행렬 곱셈을 생성했습니다.
당시 d-Matrix 가속기는 칩의 실증적 컴퓨팅 상한선의 92%에 도달한 것으로 알려졌습니다. 약 10일 후, 완전한 Qwen3 추론 경로가 구현되었습니다.
이 성과는 오늘날에도 여전히 의미가 있습니다. 에이전트가 새로운 AI 칩의 초기 소프트웨어 부팅을 가속화할 수 있음을 보여줍니다. 특히 추론 영역에서 그렇습니다. 고객은 답변당 비용을 중요하게 여기며, 좁은 워크로드를 위해 전용 하드웨어를 채택할 수 있습니다.
DeepSeek의 TileKernels와 TileLang도 같은 방향을 가리킵니다. 더 많은 커널 작업이 더 높은 수준의 시스템을 통해 표현되고 자동으로 최적화될 수 있습니다. 현재 TileKernels 버전은 여전히 최신 NVIDIA GPU와 CUDA에 의존하므로, 수작업 CUDA 작업을 줄일 뿐 해당 플랫폼을 제거하지는 않습니다.
CUDA의 해자는 여전히 깊습니다. 소스 코드 이상의 것을 포함하기 때문입니다. 라이브러리, 검증, 성능 분석, 프레임워크 지원, 분산 학습, 프로덕션 이력 및 기존 조직 투자는 복제하기 어렵습니다.
AI는 10시간 만에 CUDA의 전체 해자를 넘지 못했습니다. 그러나 첫 번째 장벽에 도달하는 비용을 낮추었고, 장기적인 경쟁을 코드 소유권에서 자동화된 생성, 검증 및 최적화로 전환했을 수 있습니다.



