Anthropic afirma que Claude ya lidera el 26 % de su trabajo de investigación y desarrollo de IA, mientras que más del 90 % alcanza el nivel ...

Anthropic ha publicado una de las perspectivas internas más claras hasta la fecha sobre cuánto participa ya la inteligencia artificial en la creación de la próxima generación de inteligencia artificial.
En agosto de 2026, Anthropic afirma que Claude lidera el 26 % del trabajo de investigación y desarrollo de IA de la empresa. A principios de 2026, la misma métrica estaba por debajo del 1 %.
La cifra principal resulta llamativa, pero es fácil interpretarla mal.
Que «Claude lidere el 26 % de la I+D» no significa que Claude gestione de forma independiente una cuarta parte de la empresa sin intervención humana. Anthropic utiliza un marco de automatización de seis niveles, y la cifra del 26 % se refiere específicamente al trabajo clasificado como AL4 — la IA lidera: los humanos proporcionan el objetivo de alto nivel, Claude realiza la mayor parte de la tarea de principio a fin y los humanos siguen siendo responsables de la supervisión y la aprobación.
Anthropic también informa de que más del 90 % de su trabajo de I+D de IA medido ha alcanzado al menos el nivel AL3 — la IA colabora.
Al mismo tiempo, la empresa opera una infraestructura interna de agentes a gran escala. En agosto, alrededor de 30.000 agentes realizaban trabajo de investigación e ingeniería en cualquier momento en la plataforma interna más utilizada de Anthropic, y la empresa analizó más de mil millones de decisiones de agentes de ese mes.
Estas cifras ayudan a explicar por qué el debate sobre la «IA que construye IA» ha pasado de la teoría a algo medible.
También muestran por qué la última salvedad es tan importante:
Anthropic afirma que ninguno de los trabajos medidos ha alcanzado el nivel AL5 de autonomía completa.
La empresa avanza hacia una I+D asistida y liderada por IA, pero no afirma que Claude pueda diseñar, entrenar, evaluar y reemplazarse a sí mismo de forma independiente y sin supervisión humana.
Anthropic creó un Índice de Automatización de I+D experimental para medir cuánto de su investigación y desarrollo de IA realiza Claude.
Primero, la empresa clasifica los tipos de trabajo implicados en la I+D de modelos y después asigna a cada categoría un nivel de automatización. La escala procede del trabajo de Epoch AI y va de AL0 a AL5.
| Nivel | Etiqueta | Significado práctico |
|---|---|---|
| AL0 | No utilizado | La IA no participa de forma relevante en la tarea. |
| AL1 | Marginal | La IA puede ayudar con consultas ocasionales, lluvia de ideas o retoques, pero no cambia la forma en que se realiza el trabajo. |
| AL2 | Asiste | La IA acelera de forma significativa partes de la tarea, mientras los humanos siguen dirigiendo y revisando el trabajo. |
| AL3 | Colabora | La IA gestiona grandes partes del trabajo bajo una dirección humana estrecha; los humanos siguen tomando decisiones clave e integrando el resultado. |
| AL4 | Lidera | La IA completa la mayor parte de la tarea de principio a fin a partir de una solicitud de alto nivel, mientras los humanos supervisan, corrigen el rumbo y aprueban. |
| AL5 | Autónomo | La IA realiza el trabajo de principio a fin con poca o ninguna intervención humana. |
La diferencia entre AL3 y AL4 es especialmente importante.
En AL3, el humano participa estrechamente. Puede proporcionar registros, proponer hipótesis, responder preguntas y decidir qué hacer cuando ocurre algo inesperado.
En AL4, el humano puede delegar un objetivo de alto nivel y dejar que Claude gestione la mayor parte de la ejecución. La persona sigue supervisando la tarea, pero no necesita dirigir continuamente cada paso.
Anthropic informa de tres resultados principales:
| Medición | Resultado comunicado por Anthropic |
|---|---|
| Trabajo de I+D de IA en el que Claude «lidera» en AL4 | 26 % |
| Trabajo de I+D de IA en AL3 «colabora» o superior | Más del 90 % |
| Trabajo de I+D de IA en AL5 «autónomo» | 0 % de los subconjuntos medidos |
Por tanto, la cifra del 26 % se entiende mejor así:
El humano establece el objetivo de alto nivel
↓
Claude gestiona la mayor parte del flujo de trabajo
↓
El humano supervisa y aprueba
No significa:
Claude elige de forma independiente la agenda de investigación,
construye a su sucesor, lo valida y lo implementa
sin intervención humana
Esta distinción es fundamental para la propia definición de Anthropic de la auto-mejora recursiva.
Anthropic no obtuvo la cifra del 26 % simplemente preguntando a sus empleados cuánto utilizan Claude.
Según su metodología publicada, la empresa tomó una muestra de registros de trabajo de los equipos implicados en el ciclo de I+D de modelos y creó, desde abajo hacia arriba, un inventario de aproximadamente 15.000 tareas detalladas a partir de julio de 2026.
Después, Claude ayudó a organizar esas tareas en una jerarquía con:
Para cada categoría, un agente de investigación examinó cómo se realizaba realmente la tarea y qué parte del proceso gestionaba la IA. A continuación, un juez independiente basado en Claude asignó un nivel de automatización.
Anthropic también pidió a los responsables humanos de las áreas de trabajo correspondientes que evaluaran la automatización por separado.
La empresa informa de que el modelo y los humanos otorgaron exactamente la misma clasificación el 59 % de las veces y se situaron dentro de un nivel de automatización el 97 % de las veces.
Se trata de una evidencia útil, pero no de una medición perfecta.
Anthropic señala explícitamente que los casos límite siguen siendo subjetivos y que su modelo juez podría compartir algunos de los mismos errores que los sistemas que está evaluando.
El artículo original también destaca la escala de la infraestructura interna de agentes de Anthropic.
Anthropic afirma que, en agosto de 2026, aproximadamente 30.000 agentes realizaban trabajo de investigación e ingeniería en cualquier momento en su plataforma interna más utilizada.
La formulación es importante: no se trata de 30.000 empleados permanentes similares a humanos ni necesariamente de todos los agentes de IA utilizados en cualquier área de Anthropic.
Es el número de agentes activos simultáneamente en la plataforma interna incluida en la medición.
Estos agentes pueden trabajar de forma semiautónoma durante largos periodos y delegar trabajo entre sí.
Anthropic afirma que su estructura interna proporciona identidades individuales a los agentes y utiliza un sistema abierto de mensajería para que puedan ver las afirmaciones de los demás, enlazar con las pruebas originales y corregir errores en lugar de transmitir información a ciegas por una cadena.
Con decenas de miles de agentes trabajando en paralelo, la supervisión se convierte en un problema de sistemas.
Anthropic afirma que analizó más de mil millones de decisiones tomadas por agentes de investigación e ingeniería en agosto de 2026.
Cada acción de la plataforma interna analizada pasa por un monitor en línea antes de ejecutarse.
El monitor en línea puede:
Anthropic afirma que se bloquearon el 0,002 % de las más de mil millones de decisiones, aproximadamente 1 de cada 47.000.
Ese porcentaje bajo no debe interpretarse automáticamente como «los agentes son seguros el 99,998 % del tiempo». La tasa de bloqueo es solo una medición. Depende de lo que el monitor pueda detectar, de cómo se clasifique el comportamiento y de qué tipos de acciones arriesgadas ocurran en primer lugar.
Anthropic señala lo mismo: a esta escala, es difícil saber si todos los comportamientos importantes son visibles para el sistema de supervisión.
Anthropic describe dos capas de supervisión.
Los monitores en línea inspeccionan las acciones antes de que se ejecuten.
Su función es detener comportamientos que podrían causar daños inmediatos y difíciles de revertir, como que un agente intentara trasladar activos sensibles de un modelo fuera de un sistema autorizado.
Anthropic afirma que el 100 % de las acciones de los agentes en la plataforma analizada pasa por esta capa.
La supervisión fuera de línea examina la actividad de los agentes después de los hechos.
Su objetivo es detectar patrones que puedan desarrollarse lentamente en lugar de causar daños inmediatos.
Anthropic afirma que el sistema fuera de línea marca aproximadamente 100.000 transcripciones por semana para que un clasificador las revise en mayor profundidad.
La mayoría se resuelve automáticamente, pero los casos de mayor prioridad —alrededor de 50 por semana— se escalan a personas.
Por tanto, la arquitectura se parece más a esto:
El agente propone una acción
↓
El monitor en línea comprueba la acción
↓
La acción se ejecuta o se bloquea/redirige
↓
La actividad queda registrada
↓
La supervisión fuera de línea revisa los patrones
↓
Los casos de mayor prioridad llegan a revisores humanos
Esta estructura de supervisión es una de las partes más importantes del anuncio de Anthropic, porque una mayor automatización solo resulta útil si la organización todavía puede comprender e intervenir en lo que hacen los agentes.
El segundo punto principal del artículo de AIBase es la cantidad de código de Anthropic que ahora escribe Claude.
Aquí es necesario indicar la fecha con precisión.
El informe oficial de Anthropic Cuando la IA se construye a sí misma afirma que en mayo de 2026, más del 80 % del código fusionado en la base de código de Anthropic había sido escrito por Claude.
Antes de que Claude Code entrara en fase de investigación preliminar en febrero de 2025, Anthropic afirma que la cifra se encontraba en los primeros dígitos porcentuales.
Se trata de un cambio drástico en poco más de un año.
Estas dos cifras miden cosas diferentes.
Describe tu idea una vez y We0 AI puede generar un sitio de presentacion, paginas y CMS, y ayudarte a atraer clientes y trafico tras el lanzamiento.
Una generación completa de proyectos para registro gratuito
Lo mejor para probar un flujo de generación completo y ver rápidamente el primer borrador del proyecto.
| Métrica | Fecha | Qué mide |
|---|---|---|
| Más del 80 % | Mayo de 2026 | Proporción del código de Anthropic fusionado y escrito por Claude |
| 26 % | Agosto de 2026 | Proporción del trabajo ponderado de I+D de IA clasificado como AL4 «la IA lidera» |
| Más del 90 % | Agosto de 2026 | Proporción del trabajo ponderado de I+D de IA clasificado como AL3 «colabora» o superior |
El código de software es solo una parte de la I+D de modelos.
La investigación de IA también implica:
Por eso Claude puede escribir el 80 % del código mientras solo el 26 % de la I+D de IA se clasifica como liderada por la IA.
Anthropic también informa de que el ingeniero típico fusionaba aproximadamente 8 veces más código al día en el segundo trimestre de 2026 que en 2024.
La empresa añade inmediatamente una salvedad importante: las líneas de código son una medida imperfecta de la productividad.
Más código no significa automáticamente ocho veces más valor.
Un cambio grande puede incluir:
Aun así, Anthropic sostiene que el cambio es suficientemente grande como para mostrar una aceleración real de la capacidad de producción de ingeniería.
El patrón resulta especialmente notable porque la producción se mantuvo relativamente estable entre 2021 y 2024 y comenzó a aumentar después de que Claude empezara a ejecutar código, en lugar de limitarse a sugerir fragmentos para que los humanos los pegaran.
El artículo original agrupa el trabajo de Claude en experimentos de modelos, programación, análisis de datos y verificación de resultados.
Las publicaciones de Anthropic respaldan la imagen más amplia de que Claude participa cada vez más en tareas de todo el ciclo de desarrollo de modelos.
Esto puede incluir actividades como:
Por eso algunas personas describen la tendencia como IA ayudando a construir una IA mejor.
Pero existe una diferencia importante entre participar en el desarrollo de un modelo sucesor y crear ese sucesor de forma totalmente autónoma.
No según la propia definición de Anthropic.
Anthropic describe la auto-mejora recursiva como el punto en el que un modelo puede construir de forma totalmente autónoma a su sucesor.
Los datos de automatización de agosto indican explícitamente que ningún subconjunto medido de la I+D de IA se encuentra en AL5.
Por tanto, la afirmación precisa más sólida en la actualidad es:
Claude está acelerando materialmente el proceso de I+D que produce futuros modelos de Claude, pero Anthropic no afirma que Claude pueda ejecutar todavía de forma autónoma todo el ciclo de desarrollo de un sucesor.
Esta distinción importa porque la expresión «auto-mejora recursiva» suele utilizarse de forma imprecisa.
Hay al menos tres etapas diferentes a las que las personas pueden referirse:
Etapa 1
La IA asiste a los humanos que construyen el siguiente modelo
Etapa 2
La IA lidera grandes partes del flujo de I+D bajo supervisión humana
Etapa 3
La IA diseña, construye, evalúa y mejora de forma autónoma a su sucesor
Los datos publicados por Anthropic respaldan claramente la Etapa 2 en una proporción creciente del trabajo.
No demuestran la Etapa 3.
Anthropic afirma que el objetivo de estas mediciones no es simplemente anunciar mejoras de productividad.
La empresa sostiene que, si los modelos de frontera empiezan a acelerar su propio desarrollo, el público y los gobiernos necesitarán métricas que puedan seguirse a lo largo del tiempo.
Sus mediciones propuestas se centran en tres aspectos:
Anthropic afirma que este tipo de métricas podría verificarse de forma independiente y utilizarse como señal para activar requisitos de seguridad más estrictos.
Por ejemplo, si la proporción de I+D liderada por la IA aumentara considerablemente, podría exigirse a un laboratorio que utilizara periodos de prueba más largos o una evaluación externa más sólida antes de permitir que un nuevo modelo contribuyera a más actividades de I+D.
Este punto queda fuera del breve artículo de AIBase, pero procede de la misma publicación de mediciones de Anthropic y ayuda a explicar el marco más amplio de la empresa.
Para una instantánea de una semana de julio de 2026, Anthropic afirma que:
Anthropic considera que se trata de estimaciones conservadoras y señala que clasificar la investigación de seguridad frente a la investigación de capacidades es intrínsecamente difícil.
Por tanto, las cifras deben tratarse como una instantánea, no como una proporción universal o permanente.
Anthropic es inusualmente explícita sobre las limitaciones de su metodología.
Entre las salvedades importantes se incluyen:
Estas limitaciones no hacen que las cifras carezcan de significado.
Hacen que sean más útiles cuando se interpretan como mediciones de tendencias y no como una prueba absoluta de autonomía.
Significa que el 26 % del trabajo ponderado de I+D de IA de Anthropic está clasificado actualmente como AL4, un nivel en el que Claude puede completar la mayor parte de una tarea de principio a fin a partir de una solicitud de alto nivel. Los humanos siguen supervisando, revisando y aprobando el trabajo, por lo que no se trata de investigación totalmente autónoma.
AL4 significa que la IA lidera la mayor parte de la tarea mientras una persona sigue siendo responsable de la supervisión y la aprobación. AL5 significa que el trabajo se realiza de forma autónoma de principio a fin con poca o ninguna intervención humana; Anthropic afirma que ninguno de sus trabajos de I+D de IA medidos ha alcanzado AL5.
Anthropic informó de que, en mayo de 2026, Claude había escrito más del 80 % del código fusionado en su base de código. Esta métrica se refiere al código fusionado, no al 80 % de toda la investigación, las decisiones de producto o el trabajo de desarrollo de modelos.
Anthropic afirma que aproximadamente 30.000 agentes realizaban trabajo de investigación e ingeniería en cualquier momento en su plataforma interna más utilizada en agosto de 2026. La cifra se aplica a la plataforma interna analizada y no debe interpretarse como un recuento de trabajadores permanentes equivalentes a humanos.
La empresa utiliza supervisión en línea antes de la ejecución y supervisión fuera de línea después de que ocurren las acciones. Anthropic afirma que el 100 % de las acciones de la plataforma analizada pasa por el monitor en línea, mientras que los sistemas fuera de línea marcan transcripciones para una revisión automatizada y humana adicional.
Anthropic afirma que su monitor en línea bloqueó aproximadamente el 0,002 % de más de mil millones de decisiones de agentes en agosto de 2026, es decir, alrededor de 1 de cada 47.000. Se trata de una estadística de supervisión, no de una prueba de que todas las decisiones no bloqueadas fueran seguras o correctas.
No según la propia definición de Anthropic. Anthropic define la forma más sólida de auto-mejora recursiva como la capacidad de un modelo para construir de forma totalmente autónoma a su sucesor, mientras que sus datos actuales indican que ninguna categoría medida de I+D de IA ha alcanzado la autonomía AL5.
Anthropic sostiene que el público, los gobiernos y los evaluadores independientes necesitan visibilidad sobre la rapidez con la que los laboratorios de frontera están automatizando el desarrollo de modelos. La empresa quiere que las métricas de automatización, supervisión de agentes y distribución del cómputo se conviertan en señales rastreables que puedan orientar futuros requisitos de seguridad.
Las últimas mediciones internas de Anthropic muestran un rápido desplazamiento hacia el desarrollo de modelos liderado por la IA. En agosto de 2026, Claude lideraba el 26 % del trabajo ponderado de I+D de IA, más del 90 % alcanzaba la colaboración entre humanos e IA o un nivel superior y alrededor de 30.000 agentes operaban simultáneamente en la plataforma interna de investigación más utilizada de Anthropic.
Por separado, Anthropic afirma que más del 80 % del código fusionado en su base de código había sido escrito por Claude en mayo de 2026. Esta cifra demuestra que la IA ya participa profundamente en la creación de los sistemas que se convertirán en futuros modelos de Claude, pero no debe confundirse con la tasa más amplia de automatización de la I+D.
Lo más importante es que Anthropic sigue informando de cero categorías medidas de I+D de IA en el nivel AL5 de autonomía completa. La empresa avanza claramente hacia un desarrollo de IA impulsado en mayor medida por la propia IA, pero no ha declarado que haya llegado la auto-mejora recursiva totalmente autónoma.
La señal más clara actual no es que «Claude haya reemplazado a los investigadores de Anthropic», sino que el centro de gravedad está pasando de humanos que realizan el trabajo con asistencia de IA a humanos que supervisan flujos de trabajo de I+D cada vez más liderados por la IA.
Empieza con una sola frase y obtén un sitio completo en minutos.