Introducción
Los agentes de IA pueden fallar de maneras que rara vez ocurren con el software convencional: insisten en reintentar.
Un empleado humano que se encuentra con un proceso defectuoso eventualmente se cansa, pide ayuda, se va a casa o lo deja para la mañana siguiente.
Un agente autónomo puede seguir invocando modelos, leyendo sus propias salidas, reintentando herramientas, reescribiendo planes y comenzando otro bucle, durante horas o incluso días.
Cuando la tarea es difícil, esa persistencia es útil.
Cuando la tarea en sí misma falla, esa persistencia es costosa.
Según un informe del Financial Times de julio de 2026 que citaba a empleados de Amazon y a personas familiarizadas con el proyecto interno, un proyecto de Amazon que utilizaba Claude Sonnet acumuló aproximadamente 1,8 millones de dólares en costes de IA al intentar enriquecer la información de los autores en el sitio web de Amazon.
Según los informes, la factura fue aproximadamente:
Un 860% por encima del presupuesto del proyecto
Según los informes, este sobrecoste pasó desapercibido durante:
cinco meses
Y a pesar del gasto considerable, el proyecto supuestamente no se implementó con éxito.
Esta combinación hace que el incidente sea más significativo que una simple factura inusualmente elevada.
Revela un nuevo problema en el software empresarial:
Pequeños errores lógicos
×
Reintentos autónomos
×
Facturación por uso
×
Observabilidad deficiente
=
Pérdidas financieras significativas
Este problema no es exclusivo de Claude, Amazon ni de ningún proveedor de IA en particular.
Los sistemas de agentes convierten la potencia de cómputo en gastos operativos variables. Cuando se les permite operar de forma independiente, el coste se convierte en parte del comportamiento de la aplicación, ya no es una simple suscripción de software.
Un defecto ya no solo produce resultados erróneos.
Puede producir resultados erróneos millones de veces mientras sigue gastando dinero.
La cronología del incidente de Claude en Amazon por 1,8 millones de dólares
La tarea descrita en el informe del Financial Times suena bastante ordinaria.
Amazon quería mejorar la información de los autores en su sitio web.
Según los informes, se utilizó un flujo de trabajo basado en Claude Sonnet para ayudar a relacionar o generar la información de autor deseada.
Posteriormente, el proyecto consumió muchos más recursos de IA de lo esperado.
Los empleados de Amazon describieron el coste final en aproximadamente:
1,8 millones de dólares
Lo que equivale a un estimado de:
860% de sobrecoste presupuestario
El detalle más llamativo podría ser el retraso en la detección.
Según los informes, el problema de costes permaneció activo o sin detectar durante unos cinco meses.
Esto indica que el fallo no fue solo del modelo de IA.
También fue un fallo de monitoreo y gobernanza.
Si una carga de trabajo empresarial puede gastar una cantidad de siete cifras sin alertas claras, entonces ese sistema carece de uno o más de los controles que normalmente rodean a otras infraestructuras de facturación.
Estos controles podrían incluir:
- Presupuestos a nivel de proyecto.
- Límites de gasto estrictos.
- Alertas diarias de anomalías.
- Cuotas por agente.
- Número máximo de reintentos.
- Duración máxima de tareas.
- Atribución por usuario.
- Panel de coste por éxito.
- Reglas de apagado automático.
El Financial Times informó que Amazon también ha encontrado otros casos de costes de IA anormalmente altos, y que los ingenieros están desarrollando protecciones automatizadas.
Amazon declaró al medio que estos casos son lecciones aisladas, no una representación de su trabajo más amplio en IA.
Esa distinción merece ser preservada.
El incidente de 1,8 millones de dólares fue, según los informes, un fallo de un proyecto interno.
No demuestra que todo el programa de IA de Amazon sea un fracaso económico.
La estimación de "600.000 millones de tokens" debe contextualizarse
El artículo original en chino hace un cálculo exagerado.
Afirma que, a un precio de 3 dólares por millón de tokens de entrada, 1,8 millones de dólares podrían comprar como máximo:
600.000 millones de tokens de entrada
La aritmética es simple:
1,8 millones de dólares
÷
3 dólares por millón de tokens
=
600.000 millones de tokens
=
600.000 millones de tokens
Pero esto no es una medición del consumo real de tokens del proyecto de Amazon.
Es solo un cálculo ilustrativo del límite superior basado en varios supuestos poco realistas:
- Cada dólar se gastó en tokens de entrada.
- La versión de Claude Sonnet utilizada por el proyecto tenía exactamente un precio de 3 dólares por millón de tokens de entrada.
- No hubo costes de tokens de salida.
- No hubo costes de escritura o lectura de caché.
- No existen diferencias de precios específicas de la plataforma AWS.
- No hay otros costes de inferencia o infraestructura.
Los precios actuales de Anthropic también varían según la generación de Sonnet.
A agosto de 2026, la lista de precios de Anthropic es la siguiente:
| Modelo | Entrada estándar | Salida estándar |
|---|---|---|
| Claude Sonnet 5 | 2 USD/millón de tokens | 10 USD/millón de tokens |
| Claude Sonnet 4.6 | 3 USD/millón de tokens | 15 USD/millón de tokens |
| Claude Sonnet 4.5 | 3 USD/millón de tokens | 15 USD/millón de tokens |
El informe del Financial Times confirma que se usó Claude Sonnet, pero los informes públicos no proporcionan suficientes detalles de facturación para reconstruir la versión exacta del modelo, la proporción de entrada/salida, el comportamiento de caché o la cantidad real de tokens.
Por lo tanto, la conclusión defendible es:
Según el informe, el proyecto costó aproximadamente 1,8 millones de dólares; su consumo exacto de tokens no es conocido públicamente.
Esto es importante porque cuando un monto en dólares se convierte automáticamente en tokens utilizando un único precio unitario, el análisis de costes de IA empresarial se vuelve engañoso.
Por qué los costes de los agentes son más difíciles de predecir que los del software tradicional
El software tradicional suele tener impulsores de costes relativamente predecibles.
Los equipos pueden estimar:
- Número de servidores.
- Tamaño de las bases de datos.
- Ancho de banda.
- Almacenamiento.
- Licencias de usuario.
- Peticiones por segundo.
Los agentes de modelos de lenguaje a gran escala añaden otra capa de complejidad.
Una solicitud de usuario puede desencadenar:
1 llamada al modelo
O puede desencadenar:
200 llamadas al modelo
+ llamadas a herramientas
+ reintentos
+ reproducción de contexto
+ búsquedas web
+ ejecución de código
El usuario puede ver solo una respuesta final.
El contador de costes ve toda la trayectoria del proceso.
El contexto se reenvía repetidamente
Los agentes tienden a reenviar gran parte de su contexto de trabajo en cada paso de razonamiento.
Por lo tanto, un repositorio de código muy extenso, documentos grandes, historial de herramientas o conversaciones pueden facturarse múltiples veces.
Las salidas se convierten en nuevas entradas
El texto generado previamente por el agente a menudo se convierte en el contexto de la siguiente llamada al modelo.
El sistema primero paga por generar información y luego paga por leerla.
Los reintentos multiplican los costes
Una llamada a herramienta fallida puede desencadenar:
- Interpretación del error.
- Nuevo razonamiento.
- Llamada modificada.
- Otro resultado.
- Otra ronda del modelo.
Un bucle de reintento que parece inofensivo a nivel de código puede generar un consumo masivo de tokens.
El coste es
aleatorio
La investigación sobre codificación con agentes ha descubierto que el uso de tokens para la misma tarea puede variar enormemente entre distintas ejecuciones.
Un estudio de 2026 sobre varios modelos de vanguardia en SWE-bench Verified informó de diferencias de hasta aproximadamente 30 veces entre ejecuciones de la misma tarea.
Más tokens tampoco siempre producen mejores resultados.
Esto convierte "estimar la factura según la dificultad de la tarea" en un método presupuestario poco fiable.
El sueño de automatización de Amazon va mucho más allá de un proyecto fallido
El artículo original pasa del incidente de 1,8 millones de dólares a una visión más amplia.
Amazon no se está retirando del campo de la IA.
Está aumentando sus inversiones.
El CEO Andy Jassy ha afirmado repetidamente que la IA generativa y los agentes remodelarán los productos para clientes y el trabajo interno de Amazon.
En junio de 2025, Jassy dijo a los empleados que Amazon ya tiene más de:
1.000 servicios y aplicaciones de IA generativa
ya sean construidos o en desarrollo.
También predijo:
miles de millones de agentes de IA
en empresas y sectores de todo tipo.
Jassy afirmó que los agentes pueden realizar trabajos como:
- Investigación web.
- Investigación profunda.
- Programación.
- Detección de anomalías.
- Traducción.
- Análisis de datos.
- Automatización de flujos de trabajo.
También dijo que las aplicaciones de IA en general transformarán la plantilla de Amazon, y que a largo plazo, a medida que aumente la eficiencia, podría reducir el número total de empleados corporativos de la empresa.
Por lo tanto, este incidente de Claude por 1,8 millones de dólares ocurrió dentro de una empresa que deliberadamente impulsa más automatización, no menos.
Amazon planea un gasto de capital de aproximadamente 220.000 millones de dólares en 2026
La inversión en infraestructura de Amazon es de una magnitud enorme.
Durante el ciclo de resultados del segundo trimestre de 2026, Jassy elevó el gasto de capital previsto de Amazon para 2026 a aproximadamente:
220.000 millones de dólares
Por encima del plan anterior de unos 200.000 millones de dólares.
La mayor parte de este gasto está relacionada con:
- Capacidad de centros de datos de AWS.
- Infraestructura de IA.
- Chips personalizados.
- Servidores.
- Redes.
- Energía eléctrica.
- Robótica y otra infraestructura a largo plazo.
La carta a los accionistas de Amazon de 2025 ya dejaba claro que la empresa no hizo su estimación anterior de 200.000 millones de dólares "por intuición".
Jassy afirmó que AWS cuenta con suficientes compromisos de clientes para justificar la razonabilidad de la mayor parte de la construcción de infraestructura.
Esto crea un contraste llamativo:
Amazon está invirtiendo cientos de miles de millones de dólares
en expandir su capacidad de IA
al mismo tiempo que aprende
cómo evitar que una sola carga de trabajo de IA
desperdicie millones de dólares.
Estos dos problemas no son contradictorios.
La capacidad de infraestructura y la eficiencia de las cargas de trabajo son dos cosas distintas.
AWS está obteniendo retornos reales del auge de la IA
El artículo original señala correctamente que el gasto en IA y nube de Amazon no solo genera costos.
Los resultados oficiales de Amazon del segundo trimestre de 2026 muestran un fuerte crecimiento de AWS.

Para el trimestre finalizado el 30 de junio de 2026:
| Métrica | Segundo trimestre de 2026 |
|---|---|
| Ventas netas totales de Amazon | 200.600 millones de dólares |
Ventas netas de AWS | 42.200 millones de dólares |
| Crecimiento interanual de ventas de AWS | 37% |
| Beneficio operativo total de Amazon | 27.500 millones de dólares |
| Beneficio operativo de AWS | 16.600 millones de dólares |
Por lo tanto, AWS contribuyó aproximadamente:
El 60% del beneficio operativo de Amazon
Y aproximadamente:
El 21% de las ventas netas totales
En ese trimestre.
Amazon también indicó que sus negocios de IA y de chips ya superan los 25.000 millones de dólares en ingresos anualizados.
Por lo tanto, la empresa tiene sólidas razones económicas para seguir impulsando la adopción de IA mientras mejora la disciplina de costos.
La fuerza laboral de Amazon está cambiando simultáneamente
El gasto en IA es solo un aspecto del plan de automatización de Amazon.
La empresa también está reduciendo puestos corporativos.
En octubre de 2025, un informe de Reuters señaló que Amazon planeaba recortar hasta 30.000 puestos corporativos.
Jassy también dijo a los empleados que la adopción más amplia de IA generativa podría significar menos puestos de trabajo en ciertas categorías y más en otras.
Es importante señalar que no se puede simplificar cada despido de Amazon como "la IA reemplazó a los empleados".
Los recortes de personal en grandes empresas pueden implicar:
- Reestructuraciones.
- Exceso de contratación durante la pandemia.
- Presiones de costos.
- Reducción de niveles gerenciales.
- Cierre de negocios.
- Automatización.
- Mejoras de eficiencia impulsadas por IA.
Lo que está claro es que la propia Amazon espera que la IA transforme sus necesidades futuras de personal.
La automatización de almacenes lleva la misma lógica al mundo físico
La fuente luego pasa de la automatización de oficinas a almacenes y logística.
El informe, basado en documentos internos de Amazon, describe una ambiciosa estrategia de robótica.
Según se informa, su objetivo es automatizar gran parte de las operaciones de almacén en los próximos años, lo que podría permitir a Amazon evitar contratar cientos de miles de empleados adicionales a medida que crece el volumen de carga.
Una estimación ampliamente difundida señala que la automatización podría permitir a Amazon evitar:
Contratar aproximadamente 160.000 empleados adicionales en EE. UU. para 2027
Y más de:
600.000 empleados adicionales para alrededor de 2033
En comparación con una trayectoria de crecimiento menos automatizada.
Estas cifras se basan en proyecciones internas reportadas, no en compromisos públicos de Amazon de despedir a 600.000 empleados existentes.
Esta distinción es importante.
"Evitar contrataciones futuras" y "eliminar puestos existentes" están económicamente relacionados, pero no son lo mismo.

Amazon ha enfatizado públicamente que la robótica también puede crear roles diferentes en áreas como:
- Mantenimiento.
- Fiabilidad.
- Ingeniería robótica.
- Supervisión de procesos.
- Operaciones técnicas.
El impacto laboral a largo plazo sigue siendo controvertido.
El economista Daron Acemoglu es uno de los críticos más destacados, y advierte que la automatización agresiva por parte de grandes empleadores podría transformar a las empresas de creadores masivos de empleo en entidades que eliminan o evitan una gran cantidad de puestos de trabajo.
La era de "más tokens = más IA" está terminando
La segunda sección principal
de la fuente pasa de Amazon a un comportamiento más amplio de Silicon Valley: tokenmaxxing (maximizar el consumo de tokens).
Durante un tiempo, las empresas impulsaron el uso de IA con tanto ahínco que el volumen de uso se convirtió en un símbolo de estatus.
Los gerentes querían que los empleados:
- Usaran más IA.
- Ejecutaran más agentes.
- Automatizaran más trabajo.
- Experimentaran audazmente.
- Formaran equipos más pequeños en torno a la IA.
En algunas organizaciones, este estímulo evolucionó hacia tablas de clasificación.
Y una vez que la métrica se vuelve visible, los empleados aprenden a optimizar esa métrica.
Este es un caso clásico de la ley de Goodhart:
Cuando una métrica se convierte en un objetivo, deja de ser una buena métrica.
La empresa quiere una adopción productiva de la IA.
Mide el uso de tokens porque el uso de tokens es fácil de contabilizar.
Los empleados aumentaron el uso de tokens.
Las cifras subieron.
Pero la producción efectiva no necesariamente aumentó.
Amazon cierra KiroRank
Amazon tenía una tabla de clasificación interna no oficial llamada KiroRank.
Rastreaba o clasificaba la actividad de los empleados relacionada con Kiro, la herramienta de desarrollo de IA de Amazon.
Según informes de Business Insider y el Financial Times, algunos empleados comenzaron a ejecutar tareas de IA innecesarias para mejorar sus puntuaciones.
Amazon finalmente cerró esa tabla de clasificación.
El vicepresidente sénior Dave Treadwell dijo a los empleados que no usaran IA por usar IA.
Amazon pasó a métricas más centradas en la producción real, incluyendo una medida llamada deployments normalizados.
La lección es simple:
Consumo de tokens
≠
Productividad
Un desarrollador que usa 100 millones de tokens sin entregar nada no es automáticamente más productivo que uno que resuelve un problema con 5 millones de tokens.
La tabla de clasificación Claudeonomics de Meta creó los mismos incentivos
Según se informa, Meta también experimentó con algo similar.
Una tabla de clasificación interna construida por empleados llamada Claudeonomics agregaba el uso de IA de más de 85.000 empleados y mostraba a los 250 principales usuarios.
En los informes aparecieron títulos como:
- Leyenda de tokens (Token Legend).
- Mago de caché (Cache Wizard).
Inmortal de Sesión (Session Immortal).
Según The Information, los empleados de Meta consumieron decenas de billones de tokens en un período móvil de 30 días.
Crea un sitio de presentacion y capta leads en minutos
Describe tu idea una vez y We0 AI puede generar un sitio de presentacion, paginas y CMS, y ayudarte a atraer clientes y trafico tras el lanzamiento.
Una generación completa de proyectos para registro gratuito
Lo mejor para probar un flujo de generación completo y ver rápidamente el primer borrador del proyecto.
Informes posteriores situaron el total de 30 días cerca de:
73,7 billones de tokens
Meta luego pasó a controles de uso más estrictos y estableció una puerta de enlace de IA (AI Gateway) centralizada para la visibilidad de costos y la gestión de presupuestos.
Estos datos se basan en la cobertura de informes internos, no en los estados financieros públicos de Meta.
El artículo fuente también convirtió los 73,7 billones de tokens en una factura hipotética mensual de 221 millones de dólares.
Esa cifra no debe considerarse como el monto real de la factura de Meta.
Es esencialmente:
73,7 billones de tokens
×
3 dólares por millón de tokens
≈
221 millones de dólares
Esto supone que cada token se factura al precio de lista de un token de entrada.
El uso real puede implicar diferentes modelos, tarifas empresariales negociadas, combinaciones de entrada/salida, caché, modelos internos y acuerdos de plataforma.
El dato útil es la escala de uso de tokens informada, no la conversión de facturación simplificada.
Uber agotó su presupuesto anual de IA para codificación en cuatro meses
Uber también enfrentó problemas presupuestarios similares.
Informes de junio de 2026 indicaron que la compañía agotó el presupuesto anual de su herramienta de codificación con agentes en el primer trimestre.
Cuatro meses del año.
Posteriormente, Uber introdujo un límite predeterminado:
1.500 dólares por empleado
por mes
por herramienta de codificación con IA
Ese límite se aplica por separado a las siguientes herramientas:
- Claude Code.
- Cursor.
Los empleados pueden consultar su propio uso a través de un panel interno y pueden aprobar excepciones si el gasto adicional está justificado.
Este enfoque se acerca más al FinOps tradicional en la nube.
El problema pasó de:
¿Cuánta IA usaron los empleados?
a:
¿Cuánto cuesta este flujo de trabajo,
y vale la pena el resultado?
Los ejecutivos de Uber han sostenido que la IA puede generar mejoras significativas de eficiencia.
El cambio no es de "usar IA" a "no usar IA".
Es de consumo ilimitado a consumo gestionado.
Incluso OpenAI dice que los costos se convirtieron en un "problema enorme"
Los proveedores de modelos también enfrentan estos problemas económicos internamente.
En un evento empresarial de junio de 2026, Sam Altman dijo que el mayor usuario interno de tokens de OpenAI consume aproximadamente:
100 mil millones de tokens
por mes.
Lo comparó con hace aproximadamente seis años y medio, cuando 100 mil tokens al mes ya parecían inusualmente altos.
Business Insider también citó un informe de The New York Times que indicaba que un empleado de OpenAI utilizó aproximadamente:
210 mil millones de tokens
en una semana.
Altman dijo que los costos pasaron de ser un problema que los clientes casi no mencionaban a principios de 2026, a convertirse en un:
"problema enorme"
ese mismo año.
La ironía es evidente.
Los laboratorios de IA quieren que los modelos sean más baratos para que los clientes puedan usar más IA.
A medida que los modelos se abaratan y los agentes se vuelven más autónomos, el crecimiento del uso total puede superar la caída del precio unitario.
Esto es una manifestación del efecto Jevons:
Menor costo unitario
→ Más uso
→ El gasto total puede ser mayor
La mayoría de las empresas aún no pueden ver completamente sus facturas de IA
La gobernanza de costos es difícil porque el uso de IA está disperso en todas partes.
Las empresas pueden pagar por IA a través de:
- API directa.
- AWS Bedrock.
- Azure.
- Google Cloud.
- Suscripciones SaaS.
- Agentes de codificación.
- Copilots integrados.
- Cuentas de gastos departamentales.
- Inferencia interna.
- Herramientas de flujo de trabajo de terceros.
Un informe de CFO de The Wall Street Journal citó una encuesta que encontró que solo:
el 26% de las empresas
tiene visibilidad completa de sus costos de IA.
Esto significa que muchas empresas intentan optimizar el gasto en IA antes de poder atribuir de manera confiable los costos de IA.
Los equipos financieros pueden conocer la factura total del proveedor, pero no:
- Qué equipo la generó.
- Qué aplicación la generó.
- Qué flujo de trabajo de cliente la generó.
- Qué bucle de agente causó el aumento.
- Cuánto costo produjo resultados exitosos.
- Cuánto fue desperdicio por reintentos.
La gobernanza de costos de IA requiere más que una factura mensual
Un sistema útil de costos de IA empresarial debería responder preguntas en múltiples niveles.
Nivel 1: ¿Quién gastó el dinero?
Rastrear por:
- Empleado.
- Equipo.
- Producto.
- Repositorio de código.
- Agente.
- Entorno.
Nivel 2: ¿Qué consumió el costo?
Distinguir entre:
- Tokens de entrada.
- Tokens de salida.
- Escrituras de caché.
- Lecturas de caché.
- Llamadas a herramientas.
- Búsquedas.
- Ejecución de código.
- Reintentos.
Nivel 3: ¿Qué produjo el gasto?
Vincular costos a:
- Implementaciones.
- Tickets resueltos.
- Pull requests fusionados.
- Informes entregados.
- Solicitudes de clientes completadas.
- Eventos de ingresos.
- Horas ahorradas.
Nivel 4: ¿El comportamiento del agente es normal?
Monitorear:
- Llamadas duplicadas idénticas.
- Bucles de reintento.
- Crecimiento repentino del contexto.
- Picos de tokens.
- Sesiones inactivas prolongadas.
- Fallos de herramientas.
- Tareas sin progreso.
El objetivo no es solo reducir tokens.
Es detectar tokens de bajo valor.
Un mejor presupuesto para agentes tiene múltiples barreras de protección
Un límite mensual en dólares es útil, pero incompleto.
Los agentes de nivel de producción generalmente deberían tener múltiples restricciones simultáneamente.
Ejemplo:
Por tarea:
Tiempo máximo de ejecución: 30 minutos
Máximo de llamadas al modelo: 80
Máximo de reintentos por herramienta: 3
Costo máximo: $5
Por usuario:
Presupuesto diario: $50
Por equipo:
Presupuesto mensual: $25,000
Global:
Alerta de anomalía cuando el gasto por hora supere +100%
Interruptor de emergencia
Los valores específicos dependen del caso de uso.
La arquitectura es la parte clave.
Un sistema descontrolado debería chocar contra múltiples barreras independientes antes de causar un gasto inesperado de siete cifras.
Por qué los límites estrictos son esenciales para los agentes autónomos
El software tradicional generalmente espera una nueva solicitud antes de continuar trabajando.
Un agente puede crear su propia siguiente acción.
Esto cambia el modelo de riesgo.
Supongamos que un agente recibe una instrucción como:
Encuentra el registro de autor correcto y actualiza la base de datos.
Descubre que hay una coincidencia ambigua.
Vuelve a buscar.
Luego hace que el modelo compare los candidatos.
Luego reintenta una API.
Luego genera nuevas consultas de búsqueda.
Luego expande el contexto.
Luego hace un bucle.
Si los criterios de éxito están mal definidos, el sistema puede permanecer "ocupado" durante mucho tiempo sin volverse más correcto.
El agente necesita un concepto de:
detenerse
ya sea por razones técnicas o financieras.
Mayor automatización no significa mayor eficiencia
El artículo original concluye citando un famoso caso de fallo de automatización anterior a la era de la IA: Knight Capital.
La analogía es útil porque el problema de Knight no tenía nada que ver con los LLM.
Fue un fallo en software automatizado, control de implementación y limitación de pérdidas.
El 1 de agosto de 2012, Knight Capital implementó nuevo software de negociación para el programa de liquidez minorista de la Bolsa de Nueva York.
Según la Comisión de Bolsa y Valores de EE. UU. (SEC), un error de implementación dejó código antiguo aún activo en un servidor.
Cuando el nuevo sistema entró en línea, esa función inactiva comenzó a enviar órdenes no intencionadas al mercado.
El sistema funcionó durante aproximadamente:
45 minutos
La SEC declaró más tarde que Knight acumuló una cartera de valores no intencionada de miles de millones de dólares, con pérdidas superiores a:
$460 millones
El artículo original en chino utilizaba la cifra comúnmente citada de $440 millones. Los materiales de cumplimiento posteriores de la SEC utilizan más de $460 millones, por lo que esta traducción adopta la cifra del regulador para garantizar la precisión.
La lección de Knight Capital es la falta de redes de seguridad
La crítica de la SEC no fue simplemente que el software tuviera un error.
El software siempre tiene errores.
Las fallas más graves incluyeron:
- Procesos de implementación deficientes.
- Pruebas insuficientes.
- Controles ausentes.
- Monitoreo inadecuado.
- Falta de un mecanismo efectivo de apagado automático.
El sistema de Knight operaba a velocidad de máquina.
Esa velocidad es
normalmente una ventaja.
Durante una falla, esa misma velocidad amplifica el daño.
El patrón básico es casi idéntico al riesgo de costos de agentes:
Automatización funcionando correctamente
→ La velocidad es valor
Automatización con fallas
→ La velocidad amplifica las pérdidas
Los agentes de IA añaden un nuevo tipo de función de pérdida
El sistema de Knight gastaba dinero directamente mediante operaciones.
La mayoría de los agentes empresariales no tienen acceso a corretaje.
Pero sí tienen un medidor.
Cada invocación de modelo puede generar un costo.
Cada herramienta puede tener un impacto downstream.
Ciertos agentes también pueden estar autorizados para:
- Comprar recursos en la nube.
- Iniciar tareas.
- Enviar correos electrónicos.
- Modificar código.
- Desplegar infraestructura.
- Contratar servicios.
- Migrar datos.
A medida que los sistemas de IA obtienen más permisos, sus modos de falla empiezan a parecerse cada vez menos a errores de chatbot y más a fallas de control de automatización.
Por eso la gobernanza de IA necesita recurrir cada vez más a conceptos familiares de los sistemas financieros y la infraestructura en la nube:
- Presupuestos.
- Disyuntores.
- Límites de velocidad.
- Umbrales de aprobación.
- Registros de auditoría.
- Reversión.
- Interruptor de apagado de emergencia.
La automatización amplifica tanto el éxito como el fracaso
El artículo original cierra con el principio correcto.
La automatización promete:
- Mayor velocidad de ejecución.
- Menor costo unitario.
- Menos errores humanos repetitivos.
- Mayor escala.
- Operación 24/7.
Estas ventajas son reales.
Pero los sistemas no amplifican selectivamente solo el comportamiento correcto.
También amplifican:
- Supuestos incorrectos.
- Bucles rotos.
- Permisos inadecuados.
- Herramientas mal configuradas.
- Incentivos deficientes.
- Límites ausentes.
La automatización más peligrosa no es necesariamente la que colapsa de inmediato.
Es aquella que sigue pareciendo productiva mientras falla de forma rápida, repetitiva e invisible.
El proyecto de Claude de 1.8 millones de dólares de Amazon, según se informó, no es una razón para dejar de usar agentes.
Es una razón para dejar de tratar el consumo de agentes como un experimento sin medir.
Lista práctica de control de costos para agentes de IA
Antes del despliegue
- Definir resultados de negocio claros.
- Establecer el costo máximo aceptable por tarea exitosa.
- Estimar el uso normal de tokens y herramientas.
- Definir límites estrictos por tarea.
- Establecer límites de reintentos.
- Configurar tiempos de espera.
- Exigir aprobación humana para operaciones de alto impacto.
Durante la ejecución
- Atribuir el gasto a proyectos y responsables designados.
- Rastrear por separado entrada, salida, caché y tarifas de herramientas.
- Alertar sobre crecimiento horario o diario anormal.
- Detectar llamadas repetitivas y bucles estancados.
- Registrar resultados exitosos y fallidos.
- Mostrar costos actuales a los operadores de agentes.
Después de la ejecución
- Calcular el costo por resultado exitoso.
- Revisar rutas de ejecución anormalmente costosas.
- Comparar niveles de modelo.
- Usar caché cuando sea apropiado.
- Eliminar contexto innecesario.
- Enrutar tareas simples a modelos más económicos.
- Actualizar límites a medida que cambia el comportamiento.
El objetivo no es minimizar la factura a toda costa.
Es hacer que la factura sea explicable.
Preguntas frecuentes
¿Amazon realmente gastó 1.8 millones de dólares en el proyecto de Claude?
El Financial Times informó que un proyecto de Amazon que usaba Claude Sonnet acumuló aproximadamente 1.8 millones de dólares en costos, superando el presupuesto en alrededor de un 860%, y el problema tardó unos cinco meses en detectarse. La cifra proviene de informes internos de empleados, no de un informe público de incidentes de Amazon.
¿El proyecto de Amazon realmente usó 600 mil millones de tokens?
Esa cifra es solo un ejemplo aritmético aproximado, basado en 1.8 millones de dólares divididos por el precio de 3 dólares por millón de tokens de entrada. La cantidad real de tokens del proyecto, la versión del modelo, la combinación de entrada/salida, el uso de caché y otros costos no se han divulgado públicamente.
¿Cuál es el precio actual de Claude Sonnet?
Anthropic actualmente lista Claude Sonnet 5 a 2 dólares por millón de tokens de entrada estándar y 10 dólares por millón de tokens de salida. Sonnet 4.6 y 4.5 tienen precios de lista de 3 y 15 dólares respectivamente, sin incluir diferencias aplicables de caché, procesamiento por lotes o plataforma en la nube.
¿Por qué los agentes de IA pueden volverse tan costosos?
Los agentes pueden realizar múltiples invocaciones de modelo para una sola solicitud de usuario, reproducir contextos extensos, llamar herramientas y reintentar automáticamente operaciones fallidas. Si el flujo de trabajo entra en un bucle o carece de una condición de detención, el gasto puede seguir aumentando incluso cuando la tarea ya no genera progreso válido.
¿Qué es Amazon KiroRank?
KiroRank es, según se informa, una clasificación interna no oficial relacionada con el uso de la herramienta de IA Kiro de Amazon por parte de los empleados. Según los informes, Amazon lo cerró después de que los empleados comenzaran a optimizar esa métrica exclusivamente, y los líderes dijeron a los empleados que no usaran IA solo para aumentar el uso.
¿Cómo deberían las empresas limitar el gasto de los agentes de IA?
Los controles efectivos incluyen: presupuestos en dólares por tarea, límites en el número de invocaciones de modelo, topes de reintentos, tiempos de espera, cuotas por usuario y por equipo, alertas de anomalías, atribución de uso e interruptor de apagado de emergencia. La mejor métrica suele ser el costo por resultado comercial exitoso, no el volumen bruto de tokens.
¿Qué relación tiene Knight Capital con los agentes de IA?
Knight Capital perdió más de 460 millones de dólares en aproximadamente 45 minutos después de que un despliegue de operaciones automatizadas fallara por falta de salvaguardas adecuadas. El incidente ilustra el mismo principio general: la automatización acelera el trabajo eficaz, pero también acelera la velocidad y la escala del fracaso.
¿Puede la reducción del precio de los tokens resolver los problemas de costos de la IA empresarial?
Bajar los precios por sí solo no es suficiente. Un precio unitario más bajo puede fomentar un mayor uso, especialmente cuando los agentes operan de forma autónoma. Las empresas aún necesitan visibilidad, presupuestos, enrutamiento, caché y medición basada en resultados.
Herramientas relacionadas
- Precios de Anthropic Claude: precios oficiales de modelos Claude, caché de avisos, procesamiento por lotes y sesiones de agentes.
- Amazon Bedrock: plataforma gestionada de AWS para usar Claude y otros modelos fundacionales con controles de nivel empresarial.
- AWS Budgets: herramienta de AWS para definir presupuestos y activar alertas cuando el gasto o el uso superan umbrales.
- AWS Cost Explorer: análisis y atribución del gasto de AWS a lo largo del tiempo.
- AWS Cost Anomaly Detection: monitoreo automático para identificar patrones anómalos de gasto en AWS.
- Kiro: entorno de desarrollo de IA de Amazon mencionado en los informes sobre la clasificación interna de uso de KiroRank.
Enlaces relacionados
que causan gastos descontrolados](https://www.ft.com/content/77baac40-d803-4084-94f3-a133653072cf): informe principal sobre el proyecto de Claude de 1.8 millones de dólares de Amazon y otros sobrecostos internos.
- Resultados del segundo trimestre de 2026 de Amazon: confirmación oficial de ingresos de AWS de 42.2 mil millones de dólares en el segundo trimestre, utilidades operativas de 16.6 mil millones, y utilidades operativas totales de Amazon de 27.5 mil millones.
- [Andy Jassy sobre IA generativa y agentes](https://www.aboutamazon.
com/news/company-news/amazon-ceo-andy-jassy-on-generative-ai): Memorándum oficial de Amazon que describe más de 1000 servicios de IA generativa, así como las expectativas de Jassy sobre miles de millones de agentes en el futuro.
- Precios de Anthropic Claude: Información detallada sobre los precios actuales de Sonnet y la facturación por token.
- Comisión de Bolsa y Valores de EE. UU.: Falla de trading de Knight Capital: Explicación del regulador sobre el incidente de trading automatizado de 2012 y las pérdidas de más de 460 millones de dólares de Knight.
- Business Insider: Amazon cierra KiroRank: Reportaje sobre la tabla de clasificación de uso de IA de Amazon y el abandono del tokenmaxxing.
- The Wall Street Journal: La métrica que a los CFO les cuesta rastrear: el uso de IA: Reportaje sobre la visibilidad de los costos de IA empresarial y la proporción del 26% de visibilidad completa.
Resumen
Según los informes, un proyecto de Amazon que utilizaba Claude Sonnet acumuló una factura de 1,8 millones de dólares, superando el presupuesto en aproximadamente un 860%, tardó cinco meses en descubrirse y finalmente nunca llegó a implementarse. Este incidente demuestra que cuando un agente puede consumir repetidamente recursos de IA de pago por uso sin condiciones de detención sólidas, un error de software común puede volverse extraordinariamente costoso.
Amazon no está abandonando el campo de la IA. AWS está creciendo rápidamente, la compañía prevé un gasto de capital de aproximadamente 220 mil millones de dólares para 2026, y Andy Jassy describe un futuro que incluye miles de millones de agentes. Por lo tanto, la respuesta al descontrol de costos probablemente sea fortalecer la gobernanza de costos, no reducir la automatización.
La misma transformación es visible en todo Silicon Valley. Amazon cerró KiroRank, Meta pasó del tokenmaxxing a un sistema de presupuestos, Uber estableció un límite mensual de 1500 dólares por empleado y por herramienta de codificación, y Sam Altman afirmó que incluso dentro de OpenAI, los costos de IA se han convertido en una preocupación importante.
El fracaso de Knight Capital ofrece una lección atemporal: la automatización no solo amplifica la eficiencia. Cuando los controles son débiles, amplifica los errores a la misma velocidad.
La métrica correcta de IA empresarial no es "¿cuántos tokens usamos?" sino "¿qué resultados medibles producen esos tokens, y qué hace que el sistema se detenga cuando dejan de generar valor?"



