서론
AI 에이전트는 일반 소프트웨어에서는 거의 발생하지 않는 방식으로 실패할 수 있다. 바로 끊임없는 재시도다.
장애가 발생한 프로세스를 만난 인간 직원은 결국 지치고, 도움을 요청하고, 퇴근하거나, 다음 날 아침까지 기다릴 것이다.
반면 자율 에이전트는 모델을 지속적으로 호출하고, 자신의 출력을 읽고, 도구를 재시도하고, 계획을 다시 작성하고, 또 다른 루프를 시작할 수 있다. 몇 시간, 심지어 며칠 동안 말이다.
작업이 어려울 때 이러한 지속성은 유용하다.
작업 자체에 문제가 있을 때 이러한 지속성은 비용이 된다.
2026년 7월 《파이낸셜 타임스》가 아마존 직원 및 내부 프로젝트에 정통한 인사들을 인용해 보도한 바에 따르면, 아마존에서 Claude Sonnet을 사용한 한 프로젝트가 아마존 웹사이트의 작가 정보를 보강하는 과정에서 누적 약 180만 달러의 AI 비용을 발생시켰다.
보고된 청구 금액은 대략 다음과 같다:
프로젝트 예산 대비 860% 초과
이 초과 지출은 다음 기간 동안 감지되지 않은 것으로 알려졌다:
5개월
그리고 막대한 비용에도 불구하고 이 프로젝트는 성공적으로 배포되지 못한 것으로 알려졌다.
이러한 조합은 이 사건을 단순히 비정상적으로 거대한 청구서 이상의 의미를 갖게 만든다.
이는 새로운 엔터프라이즈 소프트웨어 문제를 드러낸다:
작은 로직 오류
×
자율 재시도
×
사용량 기반 과금
×
취약한 관측성
=
막대한 재정적 손실
이 문제는 클로드, 아마존 또는 어떤 단일 AI 제공업체에만 국한된 것이 아니다.
에이전트 시스템은 컴퓨팅 자원을 변동성 있는 운영 비용으로 전환한다. 에이전트가 독립적으로 실행될 수 있게 되면 비용은 단순한 소프트웨어 구독이 아닌 애플리케이션 동작의 일부가 된다.
결함은 더 이상 단순히 잘못된 결과를 생성하지 않는다.
비용이 계속 발생하면서도 수백만 번의 잘못된 결과를 생성할 수 있다.
180만 달러 아마존 클로드 사건의 전말
《파이낸셜 타임스》 보도에서 설명된 작업은 평범하게 들린다.
아마존은 웹사이트의 작가 정보를 개선하고자 했다.
보도에 따르면, Claude Sonnet 기반 워크플로우가 필요한 작가 정보를 매칭하거나 생성하는 데 사용되었다.
이후 이 프로젝트는 예상을 훨씬 뛰어넘는 AI 리소스를 소비했다.
아마존 직원들은 최종 비용을 대략 다음과 같이 설명한 것으로 알려졌다:
180만 달러
이는 추정치로 환산하면:
860% 예산 초과
가장 주목할 만한 세부 사항은 아마도 탐지 지연일 것이다.
비용 문제는 약 5개월 동안 활성 상태이거나 감지되지 않은 채로 있었다고 알려졌다.
이는 실패가 단지 AI 모델의 문제만이 아님을 시사한다.
모니터링과 거버넌스의 문제이기도 하다.
기업 워크로드가 명확한 알림 없이 일곱 자릿수 금액을 지출할 수 있다면, 해당 시스템에는 다른 청구 인프라에 일반적으로 갖춰진 하나 이상의 통제 장치가 부재한 것이다.
이러한 통제 장치에는 다음이 포함될 수 있다:
- 프로젝트 수준 예산
- 하드 지출 상한선
- 일일 이상 알림
- 에이전트별 할당량
- 최대 재시도 횟수
- 최대 작업 시간
- 사용자별 귀속
- 성공당 비용 대시보드
- 자동 종료 규칙
《파이낸셜 타임스》는 아마존이 AI 비용이 비정상적으로 높은 다른 사례들도 발견했으며, 엔지니어들이 자동화된 안전장치를 개발 중이라고 보도했다.
아마존은 해당 매체에 이러한 사례는 광범위한 AI 노력을 대표하는 것이 아니라 고립된 교훈이라고 밝혔다.
이 구분은 유지할 가치가 있다.
이번 180만 달러 사건은 내부 프로젝트 실패로 알려졌다.
이는 아마존의 전체 AI 프로그램이 재정적으로 실패했음을 증명하지는 않는다.
'6000억 토큰' 추정치의 출처는 맥락과 함께 해석되어야 한다
원문 중국어 기사는 과장된 계산을 했다.
기사는 입력 토큰 100만 개당 3달러의 가격으로 계산했을 때 180만 달러로 최대 다음을 구매할 수 있다고 밝혔다:
6000억 개의 입력 토큰
이 산술은 간단하다:
180만 달러
÷
토큰 100만 개당 3달러
=
600,000백만 토큰
=
6000억 개의 토큰
하지만 이는 아마존 프로젝트의 실제 토큰 소비량에 대한 측정값이 아니다.
단지 몇 가지 비현실적인 가정 하에서 도출된 설명적 상한 계산일 뿐이다:
- 모든 달러가 입력 토큰에 사용되었다.
- 해당 프로젝트에서 사용된 Claude Sonnet 버전의 가격이 정확히 입력 토큰 100만 개당 3달러였다.
- 출력 토큰 비용이 없었다.
- 캐시 쓰기 또는 캐시 읽기 비용이 없었다.
- AWS 플랫폼 특유의 가격 차이가 존재하지 않았다.
- 기타 추론 또는 인프라 비용이 없었다.
Anthropic의 현재 가격은 또한 Sonnet 세대에 따라 다르다.
2026년 8월 기준, Anthropic의 가격표는 다음과 같다:
| 모델 | 표준 입력 | 표준 출력 |
|---|---|---|
| Claude Sonnet 5 | 2달러/100만 토큰 | 10달러/100만 토큰 |
| Claude Sonnet 4.6 | 3달러/100만 토큰 | 15달러/100만 토큰 |
| Claude Sonnet 4.5 | 3달러/100만 토큰 | 15달러/100만 토큰 |
《파이낸셜 타임스》 보도는 Claude Sonnet을 확인했지만, 공개된 보도만으로는 정확한 모델 버전, 입력/출력 비율, 캐시 동작 또는 실제 토큰 수를 재구성하기에 충분한 청구 세부 정보를 제공하지 않는다.
따라서 타당한 결론은 다음과 같다:
보도에 따르면 이 프로젝트는 약 180만 달러를 지출했다. 정확한 토큰 소비량은 대중에게 알려지지 않았다.
이것이 중요한 이유는 달러 금액이 단일 고정 가격으로 자동으로 토큰 수로 환산될 때 기업 AI 비용 분석이 오해를 불러일으킬 수 있기 때문이다.
에이전트 비용이 기존 소프트웨어 비용보다 예측하기 어려운 이유
기존 소프트웨어는 일반적으로 상대적으로 예측 가능한 비용 요인을 가진다.
팀은 다음을 추정할 수 있다:
- 서버 수
- 데이터베이스 크기
- 대역폭
- 저장 공간
- 사용자 라이선스
- 초당 요청 수
대규모 언어 모델 에이전트는 또 다른 복잡성을 추가한다.
한 명의 사용자 요청이 다음을 촉발할 수 있다:
모델 호출 1회
또는 다음을 촉발할 수 있다:
모델 호출 200회
+ 도구 호출
+ 재시도
+ 컨텍스트 재생
+ 웹 검색
+ 코드 실행
사용자는 최종 답변 하나만 볼 수 있다.
비용 측정기는 전체 프로세스 궤적을 본다.
컨텍스트가 반복적으로 전송된다
에이전트는 각 추론 단계에서 작업 컨텍스트의 대부분을 다시 전송하는 경향이 있다.
따라서 매우 긴 코드베이스, 대용량 문서, 도구 기록 또는 대화가 반복적으로 청구될 수 있다.
출력이 새로운 입력이 된다
에이전트가 이전에 생성한 텍스트는 일반적으로 다음 모델 호출의 컨텍스트가 된다.
시스템은 사실상 먼저 비용을 지불하고 정보를 생성한 다음, 다시 비용을 지불하고 그 정보를 읽는 셈이다.
재시도가 비용을 배가시킨다
실패한 도구 호출 한 번이 다음을 촉발할 수 있다:
- 오류 해석
- 새로운 추론
- 수정된 호출
- 또 다른 결과
- 또 한 번의 모델 턴
코드 수준에서 무해해 보이는 재시도 루프가 엄청난 토큰 소비를 생성할 수 있다.
비용은 무작위적이다
에이전트 코딩에 관한 연구에 따르면 동일한 작업이라도 실행마다 토큰 사용량이 크게 다를 수 있다.
2026년 SWE-bench Verified에서 여러 최첨단 모델을 대상으로 한 연구는 동일한 작업에서 실행 간 최대 약 30배의 차이를 보고했다.
더 많은 토큰이 항상 더 나은 결과를 보장하지도 않는다.
이는 '작업 난이도에 따른 비용 추정'을 신뢰할 수 없는 예산 책정 방법으로 만든다.
아마존의 자동화 비전은 실패한 단일 프로젝트에 그치지 않는다
원문 기사는 이후 이 180만 달러 사건에서 더 거시적인 관점으로 전환했다.
아마존은 AI에서 후퇴하지 않았다.
오히려 투자를 확대하고 있다.
CEO 앤디 재시는 생성형 AI와 에이전트가 고객 제품과 아마존의 내부 업무를 재편할 것이라고 반복해서 밝혀왔다.
2025년 6월, 재시는 직원들에게 아마존이 이미 다음을 보유하고 있다고 말했다:
1,000개 이상의 생성형 AI 서비스 및 애플리케이션
구축되었거나 진행 중인 것 모두 포함해서다.
그는 또한 다음과 같이 예측했다:
수십억 개의 AI 에이전트가
다양한 기업과 분야에 걸쳐 나타날 것이다.
재시는 에이전트가 다음 작업을 수행할 수 있다고 말했다:
- 웹 리서치
- 딥 리서치
- 코딩
- 이상 탐지
- 번역
- 데이터 분석
- 워크플로우 자동화
그는 또한 더 광범위한 AI 적용이 아마존의 직원 구조를 변화시킬 것이며, 효율성 향상에 따라 장기적으로 회사 전체의 기업 직원 수를 줄일 수 있다고 말했다.
따라서 이 180만 달러 규모의 Claude 사건은 더 적은 자동화가 아닌 더 많은 자동화를 의도적으로 추진하는 기업 내부에서 발생했습니다.
아마존 2026년 자본지출 약 2,200억 달러
아마존의 인프라 투자 규모는 엄청납니다.
2026년 2분기 실적 발표 주기에서, 재시(Jassy)는 아마존의 2026년 예상 자본지출을 약 다음과 같이 상향 조정했습니다:
2,200억 달러
이는 기존 약 2,000억 달러 계획보다 높은 수치입니다.
지출의 대부분은 다음 분야와 관련됩니다:
- AWS 데이터센터 용량.
- AI 인프라.
- 맞춤형 칩.
- 서버.
- 네트워크.
- 전력.
- 로봇공학 및 기타 장기 인프라.
아마존의 2025년 주주 서한은 이미 회사가 기존 2,000억 달러 추산을 "직관적으로" 한 것이 아니라고 밝혔습니다.
재시는 AWS가 대규모 고객 약정을 보유하고 있어 대부분의 인프라 구축의 타당성을 뒷받침한다고 말했습니다.
이로 인해 뚜렷한 대비가 형성됩니다:
아마존은 수천억 달러를 투자해
AI 용량을 확장하고 있습니다
동시에 배우고 있습니다
단일 AI 워크로드가 수백만 달러를 낭비하는 것을
어떻게 막을지
이 두 문제는 모순되지 않습니다.
인프라 용량과 워크로드 효율성은 별개의 문제입니다.
AWS는 AI 열풍에서 실질적인 수익을 거두고 있습니다
출처 기사는 아마존의 AI 및 클라우드 지출이 단순히 비용만 발생시키는 것이 아니라고 정확히 지적합니다.
아마존 공식 2026년 2분기 실적은 AWS의 강력한 성장을 보여줍니다.

2026년 6월 30일로 종료된 분기 기준:
| 지표 | 2026년 2분기 |
|---|---|
| 아마존 총 순매출 | 2,006억 달러 |
AWS 순매출 | 422억 달러 |
| AWS 전년 대비 매출 성장률 | 37% |
| 아마존 총 영업이익 | 275억 달러 |
| AWS 영업이익 | 166억 달러 |
따라서 AWS는 대략 다음을 기여했습니다:
아마존 영업이익의 60%
그리고 약 다음을 차지합니다:
총 순매출의 21%
해당 분기에.
아마존은 또한 AI 사업과 칩 사업의 연환산 매출 러닝레이트가 각각 250억 달러를 초과했다고 밝혔습니다.
따라서 이 회사는 AI 도입을 계속 추진하면서 비용 규율을 개선해야 할 강력한 경제적 이유가 있습니다.
아마존의 노동력도 동시에 변화하고 있습니다
AI 지출은 아마존 자동화 계획의 한 측면일 뿐입니다.
이 회사는 또한 기업 직원을 줄이고 있습니다.
2025년 10월, 로이터 통신은 아마존이 최대 3만 개의 기업 일자리를 줄일 계획이라고 보도했습니다.
재시는 또한 직원들에게 생성형 AI의 광범위한 도입이 특정 범주의 일자리 감소를 의미할 수 있고 다른 범주의 일자리 증가를 의미할 수 있다고 말했습니다.
아마존의 모든 감원을 "AI가 직원을 대체했다"로 단순화할 수 없다는 점을 유의해야 합니다.
대기업의 노동력 축소는 다음을 포함할 수 있습니다:
- 구조조정.
- 팬데믹 시기의 과잉 채용.
- 비용 압박.
- 관리 계층 축소.
- 사업 종료.
- 자동화.
- AI 기반 효율성 개선.
분명한 것은 아마존 자체가 AI가 미래 직원 수요를 변화시킬 것으로 예상한다는 것입니다.
창고 자동화가 동일한 논리를 물리적 세계로 가져옵니다
출처는 이후 사무실 자동화에서 창고 및 물류로 전환합니다.
아마존 내부 문서에 기반한 보도는 야심찬 로봇 전략을 설명합니다.
보도에 따르면, 그 목표는 향후 몇 년 내에 창고 운영의 상당 부분을 자동화하는 것이며, 이로 인해 아마존은 화물량이 증가할 때 수십만 명의 추가 고용을 피할 수 있을 것으로 예상됩니다.
널리 보도된 추정치에 따르면, 자동화로 인해 아마존은 다음을 피할 수 있습니다:
2027년까지 미국 직원 약 16만 명 추가 고용 방지
그리고 다음 이상:
2033년경까지 약 60만 명의 직원 추가 고용 방지
자동화 수준이 낮은 성장 경로에 비해.
이 수치들은 보도된 내부 예측에 기반한 것이지, 아마존이 기존 직원 60만 명을 해고하겠다는 공개 약속이 아닙니다.
이 구분은 중요합니다.
"미래 채용 회피"와 "기존 일자리 제거"는 경제적으로 관련이 있지만 동일하지 않습니다.

아마존은 로봇공학이 다음 분야에서 다양한 역할을 창출할 수 있다고 공개적으로 강조합니다:
- 유지보수.
- 신뢰성.
- 로봇 엔지니어링.
- 프로세스 감독.
- 기술 운영.
장기적인 노동력 영향은 여전히 논쟁 중입니다.
경제학자 다론 아제모을루(Daron Acemoglu)는 가장 대표적인 비판자 중 한 명으로, 대형 고용주의 공격적인 자동화가 기업을 대규모 일자리 창출자에서 대량 일자리 제거 또는 회피 주체로 전환시킬 수 있다고 경고합니다.
"더 많은 토큰 = 더 많은 AI" 시대가 끝나고 있습니다
출처의 두 번째 주요
장은 아마존에서 실리콘밸리의 더 광범위한 행동, 즉 토큰맥싱(tokenmaxxing)(토큰 소비 극대화)으로 전환합니다.
한동안 기업들은 AI 사용을 너무 과도하게 장려하여 사용량 자체가 하나의 지위 상징이 되었습니다.
관리자들은 직원들이 다음을 하기를 원했습니다:
- AI를 더 많이 사용.
- 더 많은 에이전트 실행.
- 더 많은 업무 자동화.
- 과감한 실험.
- AI 중심의 소규모 팀 구성.
일부 조직에서는 이러한 장려가 리더보드로 발전했습니다.
그리고 지표가 가시화되면 직원들은 그 지표를 최적화하는 방법을 배웠습니다.
이는 **굿하트의 법칙(Goodhart's Law)**의 전형적인 사례입니다:
지표가 목표가 되면 더 이상 좋은 지표가 아닙니다.
회사가 원하는 것은 생산적인 AI 사용입니다.
회사는 토큰 사용량을 측정하는데, 토큰 사용량은 집계하기 쉽기 때문입니다.
직원들은 토큰 사용량을 늘렸습니다.
수치는 올라갔습니다.
하지만 효과적인 산출물은 반드시 증가하지 않았습니다.
아마존, KiroRank 폐쇄
아마존에는 KiroRank라는 비공식 내부 리더보드가 있었습니다.
이는 직원들이 Kiro(아마존의 AI 개발 도구)와 관련된 활동을 추적하거나 순위를 매겼습니다.
Business Insider와 파이낸셜 타임즈에 따르면, 일부 직원들은 자신의 점수를 올리기 위해 불필요한 AI 작업을 수행하기 시작했습니다.
아마존은 결국 해당 리더보드를 폐쇄했습니다.
데이브 트레드웰(Dave Treadwell) 수석 부사장은 직원들에게 AI를 쓰기 위해 AI를 쓰지 말라고 말했습니다.
아마존은 **정규화된 배포(normalized deployments)**라는 지표를 포함하여 실제 산출물에 더 중점을 둔 측정 기준으로 전환했습니다.
교훈은 간단합니다:
토큰 소비
≠
생산성
1억 개의 토큰을 사용했지만 아무것도 전달하지 못한 개발자가 500만 개의 토큰으로 문제를 해결한 개발자보다 자동으로 더 생산적이지는 않습니다.
Meta의 Claudeonomics 리더보드가 동일한 인센티브를 만들었습니다
보도에 따르면, Meta도 유사한 실험을 진행했습니다.
직원들이 구축한 내부 리더보드인 Claudeonomics는 85,000명 이상의 직원들의 AI 사용량을 집계하고 상위 250명의 사용자를 표시했습니다.
보도에는 다음과 같은 칭호가 등장했습니다:
- 토큰 레전드(Token Legend).
- 캐시 위저드(Cache Wizard).
세션 이모탈(Session Immortal).
The Information의 보도에 따르면, Meta 직원들은 30일 순환 주기 동안 수십조 개의 토큰을 소비했다.
이후 보도에서는 30일 총량을 대략 다음과 같이 확정했다:
몇 분 만에 쇼케이스 사이트를 만들고 리드를 늘리세요
아이디어를 한 문장으로 입력하면 We0 AI가 쇼케이스 사이트, 페이지, CMS를 생성하고 출시 후 고객과 트래픽 확보를 돕습니다.
무료 등록을 위한 하나의 완전한 프로젝트 생성
하나의 완전한 생성 흐름을 시도하고 첫 번째 프로젝트 초안을 빠르게 보는 데 가장 적합합니다.
73.7조 개의 토큰
Meta는 이후 더 엄격한 사용 통제로 전환했고, 비용 가시성과 예산 관리를 위한 중앙 집중식 AI 게이트웨이(AI Gateway)를 구축했다.
이러한 수치는 내부 보도의 적용 범위에 기반한 것이지, Meta의 공개 재무제표가 아니다.
출처 기사는 또한 73.7조 개의 토큰을 가상의 월 2억 2,100만 달러 청구서로 환산했다.
이 숫자는 Meta의 실제 청구 금액으로 간주되어서는 안 된다.
본질적으로 다음과 같다:
73.7조 개의 토큰
×
토큰 100만 개당 3달러
≈
2억 2,100만 달러
이는 모든 토큰이 입력 토큰 하나의 표준 가격으로 청구된다고 가정한 것이다.
실제 사용량은 다양한 모델, 협상된 기업 요금, 입력/출력 조합, 캐싱, 내부 모델 및 플랫폼 계약을 포함할 수 있다.
유용한 사실은 단순화된 청구 환산이 아니라 보도된 토큰 사용 규모다.
우버(Uber), 4개월 만에 연간 AI 코딩 예산 소진
우버도 유사한 예산 문제를 겪었다.
2026년 6월 보도에 따르면, 이 회사는 1분기에 이미 에이전트 코딩 도구의 연간 예산을 소진했다.
1년 중 4개월 만이다.
이후 우버는 기본 상한선을 도입했다:
직원 1인당 1,500달러
매월
코딩 에이전트 도구별
이 상한선은 각각 다음 도구에 적용된다:
- Claude Code.
- Cursor.
직원들은 내부 대시보드를 통해 자신의 사용량을 확인할 수 있으며, 추가 지출에 정당한 사유가 있는 경우 예외를 승인할 수 있다.
이러한 접근 방식은 전통적인 클라우드 FinOps에 더 가깝다.
문제가 다음과 같이 바뀌었다:
직원들이 AI를 얼마나 사용했는가?
에서 다음과 같이:
이 워크플로우의 비용은 얼마이며,
결과가 그만한 가치가 있는가?
우버 경영진은 AI가 상당한 효율성 향상을 가져올 수 있다고 일관되게 생각해 왔다.
전환은 'AI 사용'에서 'AI 미사용'으로의 변화가 아니다.
무제한 소비에서 관리되는 소비로의 변화다.
OpenAI조차 비용이 '거대한 문제'가 되었다고 인정
모델 제공업체 내부에서도 동일한 경제적 문제에 직면해 있다.
2026년 6월 기업 행사에서 Sam Altman은 OpenAI 내부에서 가장 많은 토큰을 사용하는 직원이 매월 약:
1,000억 개의 토큰
을 소비한다고 밝혔다.
그는 약 6년 반 전과 비교했을 때, 당시에는 월 10만 개의 토큰이 비정상적으로 많았다고 언급했다.
Business Insider는 또한 뉴욕타임스의 보도를 인용하여 OpenAI 직원 한 명이 일주일 동안 약:
2,100억 개의 토큰
을 사용했다고 전했다.
Altman은 비용이 2026년 초 고객들이 거의 언급하지 않던 문제에서, 그 해에는:
'거대한 문제'
가 되었다고 말했다.
그 아이러니는 명백하다.
AI 연구소는 모델을 더 저렴하게 만들어 고객들이 더 많은 AI를 사용할 수 있기를 원한다.
모델이 더 저렴해지고 에이전트가 더 자율적으로 변함에 따라, 총 사용량의 증가가 단가 하락 속도를 초과할 수 있다.
이는 제본스 효과(Jevons Paradox)의 한 형태다:
더 낮은 단위 비용
→ 더 많은 사용량
→ 총 지출은 더 높아질 수 있음
대부분의 기업은 여전히 자사의 AI 청구서를 완전히 파악하지 못함
비용 거버넌스가 어려운 이유는 AI 사용이 여러 곳에 분산되어 있기 때문이다.
기업은 다음과 같은 경로로 AI 비용을 지불할 수 있다:
- 직접 API.
- AWS Bedrock.
- Azure.
- Google Cloud.
- SaaS 구독.
- 코딩 에이전트.
- 임베디드 Copilot.
- 부서 비용 계정.
- 내부 추론.
- 서드파티 워크플로우 도구.
월스트리트저널의 CFO 보고서는 다음과 같은 사실을 발견한 설문조사를 인용했다:
기업의 26%
만이 자사의 AI 비용을 완전히 파악할 수 있다.
이는 많은 기업이 AI 비용을 안정적으로 귀속시킬 수 있기 전에 AI 지출 최적화를 시도하고 있음을 의미한다.
재무팀은 총 공급업체 청구서는 알 수 있지만, 다음 사항은 알 수 없다:
- 어떤 팀이 발생시켰는지.
- 어떤 애플리케이션이 발생시켰는지.
- 어떤 고객 워크플로우가 발생시켰는지.
- 어떤 에이전트 루프가 급증을 초래했는지.
- 얼마나 많은 비용이 성공적인 결과를 산출했는지.
- 얼마나 많은 비용이 재시도 낭비인지.
AI 비용 거버넌스는 월간 청구서 이상을 요구한다
유용한 기업 AI 비용 시스템은 여러 수준의 질문에 답해야 한다.
레벨 1: 누가 지출했는가?
다음 기준으로 추적:
- 직원.
- 팀.
- 제품.
- 코드 저장소.
- 에이전트.
- 환경.
레벨 2: 무엇이 비용을 소비했는가?
다음을 구분:
- 입력 토큰.
- 출력 토큰.
- 캐시 쓰기.
- 캐시 읽기.
- 도구 호출.
- 검색.
- 코드 실행.
- 재시도.
레벨 3: 지출이 무엇을 산출했는가?
비용을 다음에 연결:
- 배포.
- 해결된 티켓.
- 병합된 풀 리퀘스트.
- 보고서.
- 완료된 고객 요청.
- 수익 이벤트.
- 절약된 시간.
레벨 4: 에이전트 행동이 정상인가?
다음을 모니터링:
- 동일한 호출의 반복.
- 재시도 루프.
- 갑작스러운 컨텍스트 증가.
- 토큰 급증.
- 장시간 유휴 세션.
- 도구 오류.
- 진전이 없는 작업.
목표는 단순히 토큰을 줄이는 것이 아니다.
저가치 토큰을 감지하는 것이다.
더 나은 에이전트 예산은 다중 안전장치를 갖춘다
월간 달러 상한선은 유용하지만 불완전하다.
프로덕션 등급 에이전트는 일반적으로 여러 제한을 동시에 설정해야 한다.
예시:
작업별:
최대 실행 시간: 30분
최대 모델 호출 횟수: 80
도구별 최대 재시도 횟수: 3
최대 비용: $5
사용자별:
일일 예산: $50
팀별:
월간 예산: $25,000
전역:
시간당 지출 +100% 시 이상 알림
비상 중단 스위치
구체적인 수치는 사용 사례에 따라 다르다.
핵심은 아키텍처다.
통제 불능 상태의 시스템은 7자리 수의 예상치 못한 비용이 발생하기 전에 여러 개의 독립적인 장벽에 부딪혀야 한다.
자율 에이전트에게 하드 제한이 중요한 이유
전통적인 소프트웨어는 일반적으로 새 요청이 도착할 때까지 기다렸다가 작업을 계속한다.
에이전트는 스스로 다음 행동을 생성할 수 있다.
이것이 위험 모델을 변화시킨다.
에이전트가 다음과 같은 지시를 받았다고 가정해 보자:
올바른 작성자 레코드를 찾아 데이터베이스를 업데이트하세요.
모호한 매칭이 발견된다.
다시 검색한다.
그런 다음 모델이 후보 결과를 비교하도록 한다.
그런 다음 특정 API를 재시도한다.
그런 다음 새로운 검색 쿼리를 생성한다.
그런 다음 컨텍스트를 확장한다.
그런 다음 반복한다.
성공 기준이 명확하게 정의되지 않으면 시스템은 더 정확해지지 않은 채 오랫동안 '바쁜' 상태를 유지할 수 있다.
에이전트는 다음과 같은 개념이 필요하다:
중지
기술적 이유든 재정적 이유든.
더 높은 자동화가 더 높은 효율성을 의미하지는 않는다
원문은 결론 부분에서 AI 시대 이전의 유명한 자동화 실패 사례인 Knight Capital을 인용한다.
이 비유가 유용한 이유는 Knight의 문제가 LLM과 전혀 관련이 없기 때문이다.
이는 자동화 소프트웨어, 배포 통제 및 손실 제한의 실패였다.
2012년 8월 1일, Knight Capital은 뉴욕증권거래소의 소매 유동성 프로그램을 위해 새로운 거래 소프트웨어를 배포했다.
미국 증권거래위원회(SEC)에 따르면, 배포 오류로 인해 한 서버에서 이전 코드가 여전히 활성화된 상태로 남아 있었다.
새 시스템이 가동되었을 때, 그 휴면 기능은 의도하지 않은 주문을 시장에 보내기 시작했다.
이 시스템은 약:
45분
동안 계속 작동했다.
SEC는 나중에 Knight가 의도하지 않은 수십억 달러 규모의 증권 포트폴리오를 축적했으며, 손실이:
$4.6억
을 초과했다고 밝혔다.
원문의 중국어 기사는 일반적으로 인용되는 $4.4억이라는 숫자를 사용했다. SEC의 이후 집행 자료에서는 $4.6억 이상을 사용하므로, 본 번역은 정확성을 위해 규제 기관의 숫자를 채택한다.
Knight Capital의 교훈은 안전망의 부재
SEC의 비판은 단순히 소프트웨어에 버그가 있었다는 것이 아니다.
소프트웨어에는 항상 버그가 있다.
더 심각한 실패는 다음과 같다:
- 취약한 배포 프로세스.
- 불충분한 테스트.
- 부재한 통제 조치.
- 부실한 모니터링.
- 효과적인 자동 종료 메커니즘의 부재.
Knight의 시스템은 기계 속도로 실행됩니다.
그 속도는
일반적으로는 이점입니다.
장애 중에는 동일한 속도가 피해를 증폭시킵니다.
기본 패턴은 대리인 비용 리스크와 거의 동일합니다:
자동화가 정상 작동
→ 속도가 곧 가치
자동화에 장애 발생
→ 속도가 손실을 증폭
AI 에이전트는 새로운 유형의 손실 함수를 추가합니다
Knight의 시스템은 거래를 통해 직접 돈을 썼습니다.
대부분의 기업용 에이전트는 브로커 접근 권한이 없습니다.
하지만 그들에게는 계량기가 있습니다.
모든 모델 호출은 비용을 발생시킬 수 있습니다.
모든 도구는 하류 영향을 미칠 수 있습니다.
일부 에이전트는 다음 작업을 수행하도록 승인될 수도 있습니다:
- 클라우드 리소스 구매
- 작업 시작
- 이메일 전송
- 코드 수정
- 인프라 배포
- 서비스 조달
- 데이터 마이그레이션
AI 시스템이 더 많은 권한을 얻을수록, 그 실패 모드는 점점 챗봇 오류보다는 자동화 제어 상실에 가까워 보입니다.
이것이 AI 거버넌스가 점점 금융 시스템과 클라우드 인프라에서 익숙한 개념을 차용해야 하는 이유입니다:
- 예산
- 차단기
- 속도 제한
- 승인 임계값
- 감사 로그
- 롤백
- 비상 정지 스위치
자동화는 성공과 실패를 동시에 증폭합니다
원문은 올바른 원칙으로 마무리됩니다.
자동화가 약속하는 것:
- 더 빠른 실행 속도
- 더 낮은 단위 비용
- 반복적인 수작업 오류 감소
- 더 큰 규모
- 24시간 운영
이러한 이점은 실제로 존재합니다.
하지만 시스템은 올바른 행동만 선택적으로 증폭하지 않습니다.
동일하게 증폭되는 것:
- 잘못된 가정
- 끊어진 루프
- 부적절한 권한
- 잘못 구성된 도구
- 좋지 않은 인센티브 구조
- 누락된 제한
가장 위험한 자동화는 반드시 즉시 붕괴하는 시스템이 아닙니다.
빠르고 반복적이며 보이지 않게 실패하면서도 여전히 생산적으로 보이는 시스템입니다.
보도에 따르면, Amazon의 180만 달러 Claude 프로젝트는 에이전트 사용을 중단해야 하는 이유가 아닙니다.
에이전트 소비를 계량되지 않은 실험으로 취급하는 것을 중단해야 하는 이유입니다.
실용적인 AI 에이전트 비용 통제 체크리스트
배포 전
- 비즈니스 성과를 명확히 정의하세요.
- 성공한 작업당 최대 허용 비용을 설정하세요.
- 정상 토큰 및 도구 사용량을 추정하세요.
- 엄격한 작업당 상한을 설정하세요.
- 재시도 한도를 정의하세요.
- 타임아웃을 설정하세요.
- 영향력이 큰 작업에는 인간 승인을 요구하세요.
실행 중
- 지출을 지정된 프로젝트와 담당자에게 귀속시키세요.
- 입력, 출력, 캐시, 도구 비용을 각각 추적하세요.
- 비정상적인 시간당 또는 일일 증가에 대해 경고하세요.
- 반복 호출과 정체 루프를 감지하세요.
- 성공 및 실패 결과를 기록하세요.
- 에이전트 운영자에게 현재 비용을 표시하세요.
실행 후
- 성공 결과당 비용을 계산하세요.
- 비정상적으로 비용이 많이 드는 실행 경로를 검토하세요.
- 모델 계층을 비교하세요.
- 적절한 경우 캐시를 사용하세요.
- 불필요한 컨텍스트를 제거하세요.
- 간단한 작업은 더 경제적인 모델로 라우팅하세요.
- 행동 변화에 따라 제한을 업데이트하세요.
핵심은 어떤 대가를 치르더라도 청구서를 최소화하는 것이 아닙니다.
청구서를 설명 가능하게 만드는 것입니다.
자주 묻는 질문
Amazon은 정말 Claude 프로젝트에 180만 달러를 썼나요?
파이낸셜 타임즈는 Claude Sonnet을 사용한 Amazon 프로젝트가 약 180만 달러의 비용을 누적했으며, 예산을 약 860% 초과했고 문제가 발견되기까지 약 5개월이 걸렸다고 보도했습니다. 해당 수치는 내부 직원 보고서에서 나온 것이며, Amazon의 공식 사고 보고서가 아닙니다.
Amazon 프로젝트는 정말 6,000억 개의 토큰을 사용했나요?
이 수치는 180만 달러를 입력 토큰 100만 개당 3달러로 나눈 대략적인 산술 예시일 뿐입니다. 해당 프로젝트의 실제 토큰 수, 모델 버전, 입력/출력 구성, 캐시 사용량 및 기타 비용은 공개적으로 공개되지 않았습니다.
현재 Claude Sonnet의 가격은 얼마인가요?
Anthropic은 현재 Claude Sonnet 5를 표준 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 10달러로 책정하고 있습니다. Sonnet 4.6과 4.5는 각각 3달러와 15달러로 책정되어 있으며, 이 가격에는 적용 가능한 캐시, 일괄 처리 또는 클라우드 플랫폼 차이가 포함되지 않습니다.
AI 에이전트는 왜 그렇게 비싸질 수 있나요?
에이전트는 단일 사용자 요청에 대해 여러 번의 모델 호출을 시작하고, 대용량 컨텍스트를 재생하고, 도구를 호출하고, 실패한 작업을 자동으로 재시도할 수 있습니다. 워크플로가 루프에 빠지거나 중지 조건이 없으면 작업이 더 이상 유효한 진전을 만들지 못할 때도 지출이 계속 증가할 수 있습니다.
Amazon KiroRank란 무엇인가요?
KiroRank는 직원들의 Amazon Kiro AI 도구 사용과 관련된 비공식적인 내부 순위표로 알려져 있습니다. 직원들이 해당 지표만 최적화하기 시작한 후, Amazon은 이를 중단했으며 리더십도 직원들에게 단순히 사용량을 늘리기 위해 AI를 사용하지 말라고 지시했습니다.
기업은 AI 에이전트 지출을 어떻게 제한해야 하나요?
효과적인 통제 수단으로는 작업당 달러 예산, 모델 호출 횟수 제한, 재시도 상한, 타임아웃 설정, 사용자 및 팀별 할당량, 이상 징후 알림, 사용 귀속, 비상 종료 스위치가 있습니다. 가장 좋은 측정 지표는 일반적으로 원시 토큰 양이 아니라 성공적인 비즈니스 결과당 비용입니다.
Knight Capital과 AI 에이전트는 어떤 관련이 있나요?
Knight Capital은 충분한 안전 장치가 부족한 자동화 거래 배포가 실패한 후 약 45분 만에 4억 6천만 달러 이상의 손실을 입었습니다. 이 사건은 동일한 일반 원칙을 보여줍니다: 자동화는 효과적인 작업의 속도를 높이지만, 실패의 속도와 규모도 높입니다.
토큰 가격 인하가 기업 AI 비용 문제를 해결할 수 있나요?
가격 인하만으로는 충분하지 않습니다. 더 낮은 단가가 더 높은 사용량을 장려할 수 있으며, 특히 에이전트가 자율적으로 실행될 때 더욱 그렇습니다. 기업은 여전히 가시성, 예산, 라우팅, 캐시, 결과 기반 측정이 필요합니다.
관련 도구
- Anthropic Claude 가격: Claude 모델, 프롬프트 캐시, 일괄 처리 및 에이전트 세션의 공식 가격.
- Amazon Bedrock: 기업급 제어 기능을 갖춘 Claude 및 기타 기반 모델을 위한 AWS 관리형 플랫폼.
- AWS Budgets: 지출 또는 사용량이 임계값을 초과할 때 예산을 정의하고 알림을 트리거하는 AWS 도구.
- AWS Cost Explorer: 시간에 따른 AWS 지출을 분석하고 귀속시키는 도구.
- AWS Cost Anomaly Detection: 비정상적인 AWS 지출 패턴을 식별하는 자동 모니터링.
- Kiro: 내부 KiroRank 사용량 순위표 보도에서 언급된 Amazon AI 개발 환경.
관련 링크
- 파이낸셜 타임즈: Amazon, AI 사례로 통제 불능 지출 발견: Amazon의 180만 달러 Claude 프로젝트 및 기타 내부 비용 초과에 대한 주요 보도.
- Amazon 2026년 2분기 실적: AWS 2분기 매출 422억 달러, 영업 이익 166억 달러, Amazon 총 영업 이익 275억 달러의 공식 확인.
- [Andy Jassy가 생성형 AI와 에이전트에 대해 말하다](https://www.aboutamazon.
com/news/company-news/amazon-ceo-andy-jassy-on-generative-ai): 아마존 공식 메모로, 1000개 이상의 생성형 AI 서비스와 저시 CEO의 향후 수십억 개의 에이전트에 대한 전망을 설명합니다.
- Anthropic Claude 가격: 현재 공식 Sonnet 가격 및 토큰 단위 과금에 대한 자세한 정보.
- 미국 증권거래위원회: Knight Capital 거래 장애: 규제 당국이 2012년 자동화 거래 사건과 Knight사의 4억 6천만 달러 이상 손실에 대해 설명한 자료.
- Business Insider: 아마존 KiroRank 종료: 아마존 AI 사용 순위표와 토큰맥싱(tokenmaxxing) 폐기에 관한 보도.
- 월스트리트저널: CFO가 추적하기 어려운 지표 — AI 사용량: 기업 AI 비용 가시성 및 26%의 완전 가시성 비율에 관한 보도.
요약
보도에 따르면, Claude Sonnet을 사용하는 한 아마존 프로젝트가 180만 달러의 청구액을 누적했으며, 예산을 약 860% 초과했고, 5개월이 지나서야 발견되었으며, 최종적으로 배포되지 못했습니다. 이 사건은 강력한 중단 조건 없이 한 에이전트가 종량제 AI 리소스를 반복적으로 소비할 수 있을 때, 평범한 소프트웨어 오류가 비정상적으로 비용이 많이 드는 문제가 될 수 있음을 보여줍니다.
아마존은 AI 분야에서 철수하지 않았습니다. AWS는 빠르게 성장하고 있으며, 회사는 2026년 자본 지출이 약 2,200억 달러에 이를 것으로 예상합니다. 앤디 저시가 묘사한 미래에는 수십억 개의 에이전트가 포함되어 있습니다. 따라서 통제 불능 비용에 대한 대응은 자동화 축소보다는 비용 거버넌스 강화에 가깝습니다.
동일한 변화가 실리콘밸리 전역에서 나타나고 있습니다. 아마존은 KiroRank를 종료했고, 메타는 토큰맥싱에서 예산제로 전환했으며, 우버는 직원별 코딩 도구당 월 1,500달러 상한선을 설정했습니다. 샘 올트먼은 OpenAI 내부에서도 AI 비용이 주요 우려 사항이 되었다고 밝혔습니다.
Knight Capital의 실패는 영원한 교훈을 제공합니다: 자동화는 효율성을 증폭시킬 뿐만 아니라, 통제가 약할 때 동일한 속도로 오류도 증폭시킵니다.
올바른 기업 AI 지표는 "우리가 토큰을 얼마나 사용했는가?"가 아니라 "이 토큰이 어떤 측정 가능한 결과를 만들어냈는가, 그리고 더 이상 가치를 창출하지 않을 때 시스템을 멈추게 하는 것은 무엇인가?"입니다.



