Gemini 4 Pro podría haber aparecido en Arena, pero la historia más importante es la auto-mejora recursiva

Google ha estado inusualmente silencioso sobre la versión Pro de la línea Gemini, mientras sus modelos Flash han seguido avanzando rápidamente.
Gemini 3.6 Flash, 3.7 Flash y 3.8 Flash llegaron en rápida sucesión. Google lanzó oficialmente Gemini 3.8 Flash el 2 de septiembre de 2026, y lo describió como su modelo Flash más capaz para ingeniería de software de larga duración, agentes autónomos y tareas complejas de varios pasos.
Entonces ocurrió algo extraño.
Un modelo con la misma etiqueta gemini-3.8-flash comenzó a aparecer en Arena, pero los desarrolladores que lo probaron afirmaron que su comportamiento parecía notablemente más potente que el del Gemini 3.8 Flash de producción que ya conocían.
El modelo generó SVG más pulidos, interfaces web más completas, escenas 3D más elaboradas y resultados de estilo agente más sólidos de lo que los evaluadores esperaban de la versión pública 3.8 Flash.
Eso activó rápidamente una teoría:
El modelo de Arena podría ser en realidad un punto de control de prueba oculto de Gemini 4 Pro.
Las pruebas son intrigantes, pero siguen siendo circunstanciales. Google no ha anunciado Gemini 4 Pro y, al 20 de septiembre, la documentación pública de modelos Gemini de Google no incluye ningún modelo Gemini 4.
Por eso, la parte más importante de la historia podría estar en otro lugar: el uso cada vez más acelerado de sistemas de IA para evaluar, optimizar y construir la siguiente generación de sistemas de IA.
Ahí es donde entra en escena la auto-mejora recursiva, o RSI por sus siglas en inglés.
El historial de lanzamientos confirmados de Google ofrece un contexto útil.
Gemini 3.8 Flash se lanzó el 2 de septiembre, apenas tres semanas después de Gemini 3.7 Flash. Google lo presentó como su tercer lanzamiento Flash en seis semanas y afirmó que mejoraba la ingeniería de software, las tareas de agentes y el razonamiento complejo de varios pasos, manteniendo la velocidad y el coste propios de la categoría Flash.
Como el Gemini 3.8 Flash real ya está disponible públicamente, los desarrolladores cuentan con un punto de comparación directo.
Por eso, cuando un segundo modelo con el mismo nombre apareció en Arena y parecía considerablemente más potente, la comunidad lo detectó rápidamente.
Una comparación ampliamente compartida pidió a los modelos dibujar un gato doméstico de perfil utilizando SVG.
Los tres resultados mostrados en la fuente estaban etiquetados, de izquierda a derecha, como el supuesto “Gemini 4 Pro”, GPT-6 Astra y el Gemini 3.8 Flash lanzado.
El resultado anónimo de Arena parecía más completo y refinado en sus proporciones que el resultado de producción de Flash.
Eso, por sí solo, no identifica al modelo oculto. Arena se basa en evaluaciones ciegas o parcialmente ciegas, y un modelo anónimo más potente podría ser un nuevo punto de control, un sistema configurado de otra manera u otra variante de Gemini aún no lanzada.
Pero la diferencia era lo bastante grande como para mantener vivo el rumor.
Otros evaluadores llevaron el modelo a tareas de generación más complejas.
Un usuario afirmó que el supuesto modelo pasó aproximadamente ocho minutos produciendo una escena interactiva de una pagoda con estilo voxel.
El mismo evaluador también describió una página detallada de un helicóptero Airbus H145 generada en unos diez minutos y un sitio web monocromático completado en aproximadamente catorce minutos.
Otro miembro de la comunidad utilizó el supuesto modelo para crear un juego y afirmó que la calidad visual y la integridad de la generación del mundo eran sólidas.
El tema común no era la velocidad bruta. El modelo parecía dedicar más tiempo a razonar o generar que un modelo Flash normal.
Ese comportamiento también alimentó la teoría de que la etiqueta de Arena podía estar ocultando un punto de control de clase Pro.
Una afirmación más sensacionalista provino del desarrollador Qwinah, quien aseguró que había realizado un “enrutamiento fantasma” hacia un backend de Gemini 4 Pro.
Publicó una captura de pantalla que parecía mostrar metadatos internos del modelo, con cadenas como G4P-ARGON y VIA_3.8_FLASH.
La captura también afirmaba que el modelo contaba con capacidades como:
Estas afirmaciones no han sido confirmadas por Google, Google DeepMind, Arena ni la documentación oficial de Gemini.
Por tanto, la captura debe tratarse como un artefacto comunitario no verificado y no como una ficha técnica.
Al 20 de septiembre, la documentación publicada de la API de Gemini de Google enumera Gemini 3.8 Flash con un límite de entrada de 1.048.576 tokens y un límite de salida de 65.536 tokens. No existe una página oficial del modelo Gemini 4 Pro ni un identificador de API correspondiente.
También circuló ampliamente otra tabla de benchmarks.
La tabla afirmaba que el supuesto Gemini 4 Pro había obtenido aproximadamente:
| Benchmark | Afirmación viral |
|---|---|
| DeepSWE v1.1 | 88,7 % |
| Terminal-Bench 2.1 | 95,3 % |
| HLE-Verified | 72,1 % |
| OSWorld 2.0 | 86,8 % |
| GDPval-AA v2 | 2064 Elo |
Si fueran reales, esas cifras situarían al modelo por encima de varios sistemas líderes de frontera en tareas de programación, agentes, razonamiento y uso de ordenadores.
Pero la tabla presenta problemas serios.
No incluye una fuente oficial de Google, una validación de Arena, una configuración de evaluación publicada ni una ejecución reproducible del benchmark. Algunos valores comparativos de otros modelos tampoco coinciden con sus resultados oficiales publicados.
Por ejemplo, los materiales oficiales de lanzamiento de GPT-6 Astra de OpenAI sitúan a Astra en 74,1 % en DeepSWE v1.1 y utilizan versiones diferentes de los benchmarks en varias categorías.
Por tanto, la hoja de benchmarks no debe presentarse como un resultado verificado de Gemini 4.
El estado correcto es sencillo:
modelo misterioso de Arena más potente: observado
identidad de Gemini 4 Pro: no confirmada
tabla de benchmarks viral: no verificada
afirmaciones sobre 10 millones de contexto / 256K de salida: no verificadas
La documentación pública de Google ofrece una imagen mucho más conservadora.
Al 20 de septiembre de 2026:
gemini-3.8-flash está disponible de forma general.Eso no demuestra que Gemini 4 no se esté probando internamente.
Los laboratorios de frontera evalúan habitualmente puntos de control no lanzados antes de un lanzamiento formal.
Simplemente significa que las pruebas públicas disponibles todavía no justifican tratar “Gemini 4 Pro” como un producto anunciado.
La segunda sección del artículo original se aleja de la filtración y se centra en una idea más amplia: la auto-mejora recursiva.
RSI describe un proceso en el que los sistemas de IA contribuyen cada vez más a construir, evaluar o mejorar futuros sistemas de IA, creando un ciclo de retroalimentación en el que los modelos mejores ayudan a acelerar la producción de modelos aún mejores.
Una versión sencilla tiene este aspecto:
La IA ayuda a mejorar el desarrollo de la IA
↓
la IA de próxima generación se vuelve más potente
↓
una IA más potente contribuye más a la I+D
↓
el ciclo de desarrollo se acelera
La distinción importante es que los laboratorios de frontera actuales no afirman públicamente haber alcanzado una explosión de inteligencia totalmente autónoma.
Los seres humanos todavía definen los objetivos de investigación, diseñan los sistemas de entrenamiento, asignan la capacidad de cómputo, aprueban los cambios de riesgo y deciden cuándo se implementan los modelos.
Lo que está cambiando es la proporción del ciclo de desarrollo que la IA ya puede realizar.
El anuncio oficial de Gemini 3.8 de Google es una de las pruebas más sólidas de que esta tendencia es real.
La empresa afirma que Gemini 3.8 Flash y 3.8 Flash Cyber se aceleran mediante ciclos agénticos prolongados diseñados para evaluar y perfeccionar recursivamente los modelos subyacentes.
Este lenguaje es importante porque procede directamente de Google, no de la especulación de la comunidad.
No significa que Google haya logrado una RSI completamente autónoma.
Sí significa que los ciclos de evaluación impulsados por IA ya forman parte del proceso de desarrollo de los modelos Gemini de producción.
El investigador de Google DeepMind Shunyu Yao resumió la importancia en una breve publicación pública posterior al lanzamiento de 3.8:
Describe tu idea una vez y We0 AI puede generar un sitio de presentacion, paginas y CMS, y ayudarte a atraer clientes y trafico tras el lanzamiento.
Una generación completa de proyectos para registro gratuito
Lo mejor para probar un flujo de generación completo y ver rápidamente el primer borrador del proyecto.
El mensaje parafraseaba la frase del Apollo 11: un pequeño paso para el modelo, pero un paso mucho mayor para la RSI.
El 14 de septiembre, investigadores de Google, Google DeepMind, la Universidad de Maryland y la Universidad de Virginia publicaron Dream-RSI: Recursive Self-Improvement through Evolving Worlds.
El artículo se centra en un obstáculo específico: cómo puede un agente mejorar la forma en que explora espacios de búsqueda difíciles sin pagar repetidamente por costosas pruebas en línea.
Dream-RSI utiliza un ciclo basado en el historial de exploración anterior:
Los investigadores informan de mejoras en áreas como:
El trabajo es más limitado que la idea popular de una IA que rediseña autónomamente cada parte de sí misma.
Aun así, demuestra un mecanismo recursivo real: el trabajo anterior del sistema se convierte en material de entrenamiento para mejorar la forma en que busca mejoras futuras.
Esa misma semana, Anthropic publicó métricas internas inusualmente detalladas que muestran hasta qué punto la IA ya ha entrado en su propio proceso de investigación.
En agosto de 2026, Anthropic afirma que:
Anthropic define “la IA lidera” como aquellos casos en los que el modelo completa la mayor parte de una tarea de principio a fin a partir de una instrucción de alto nivel, mientras un ser humano supervisa.
La cifra del 26 % resulta especialmente llamativa porque Anthropic afirma que la proporción era inferior al 1 % a comienzos del año.
Anthropic publicó esta métrica en parte porque considera que los observadores externos necesitan una mayor visibilidad sobre la rapidez con la que los laboratorios de frontera están automatizando sus propios procesos de desarrollo de modelos.
Z.ai ha publicado otro ejemplo útil.
La empresa afirma que un Infra Agent impulsado por GLM-5.3 ayudó a construir y optimizar la infraestructura de inferencia que sirve a GLM-5.3-Flash.
Según la información publicada por Z.ai en septiembre:
Z.ai afirma explícitamente que esto no constituye una auto-mejora recursiva completa.
Su descripción es más modesta: ha aparecido un ciclo de escala mínima en el que un modelo ayuda a optimizar el sistema que sirve a otro modelo.
Esa distinción es importante.
Los sistemas actuales todavía requieren objetivos humanos, diseño de la retroalimentación, restricciones de infraestructura y revisión de las modificaciones de alto riesgo.
Pero el ciclo ya no es puramente teórico.
La sección final del artículo original relaciona la RSI con un nuevo debate entre los líderes de la IA de frontera.
El 12 de septiembre, el CEO de Anthropic, Dario Amodei, afirmó públicamente que la industria debería moderar el ritmo de avance de la frontera para dar más tiempo a que el trabajo de seguridad alcance las capacidades de los modelos.
Su propuesta incluía acceso permanente, a nivel de empleado, para evaluadores externos independientes y, con el tiempo, una coordinación más amplia en torno a umbrales de capacidad y medidas de seguridad.
Sam Altman, Elon Musk y Demis Hassabis expresaron distintos grados de apoyo a la idea general de que el desarrollo de frontera podría necesitar salvaguardas más estrictas o un ritmo más lento en determinadas condiciones.
Pero estar de acuerdo en que es necesario actuar con cautela es más fácil que acordar quién debe ralentizarse primero.
Todos los laboratorios de frontera afrontan el mismo problema estratégico.
Si una empresa ralentiza el desarrollo de capacidades mientras sus competidores continúan avanzando, corre el riesgo de perder liderazgo técnico, talento, clientes y cuota de mercado.
La misma lógica opera a escala nacional.
Un país que considere imponer límites estrictos al desarrollo de frontera puede preocuparse de que sus rivales sigan acelerando.
Eso hace que las propuestas de desaceleración coordinada sean estructuralmente difíciles, incluso cuando los principales laboratorios coinciden en que los riesgos son serios.
La tensión es visible en el ciclo actual de modelos.
Google está lanzando modelos Flash rápidamente y podría estar probando puntos de control ocultos más potentes. Anthropic mide públicamente cuánto de su propia I+D realiza Claude, al tiempo que considera futuros lanzamientos de modelos. OpenAI ha seguido lanzando sistemas de frontera mientras amplía las evaluaciones de terceros y los requisitos de seguridad.
El resultado no es una simple contradicción.
Es un problema de coordinación: las mismas organizaciones pueden preocuparse sinceramente por los riesgos de frontera y, al mismo tiempo, enfrentarse a fuertes incentivos para mantenerse en la frontera.
El artículo original también cita informes de la comunidad que sugieren que otros laboratorios podrían estar probando modelos de próxima generación detrás de las superficies de productos existentes.
Una publicación ampliamente compartida afirmaba que algunas solicitudes de Claude Code mostraban un identificador claude-opus-5-2.
Esto no es un anuncio oficial de producto de Anthropic.
Del mismo modo, publicaciones de la comunidad han afirmado haber detectado identificadores de modelos adicionales de OpenAI más allá de la línea anunciada actualmente.
Estos informes deben tratarse igual que la teoría de Gemini 4 Pro: son útiles como indicios de que algo podría estar en fase de prueba, pero no equivalen a un lanzamiento oficial, una especificación o una fecha de lanzamiento.
| Afirmación | Estado al 20 de septiembre de 2026 |
|---|---|
| Google lanzó Gemini 3.8 Flash el 2 de septiembre | Confirmado |
| Gemini 3.8 utiliza ciclos agénticos prolongados para evaluar y perfeccionar recursivamente los modelos subyacentes | Confirmado por Google |
Un modelo más potente etiquetado como gemini-3.8-flash apareció en Arena | Reportado y ampliamente observado |
| El modelo de Arena es Gemini 4 Pro | No confirmado |
| Google ha anunciado oficialmente Gemini 4 Pro | No |
| La documentación pública de modelos de Google enumera actualmente Gemini 4 | No |
G4P-ARGON es un identificador interno real de un modelo de Google | No verificado |
| Gemini 4 Pro tiene más de 10 millones de tokens de contexto y 256K tokens de salida | No verificado |
| Las puntuaciones virales de Gemini 4 en benchmarks son oficiales | No |
| Dream-RSI es un artículo de investigación real de septiembre de 2026 | Confirmado |
| Anthropic afirma que Claude lidera el 26 % del trabajo de I+D en IA medido | Confirmado |
| Anthropic afirma que más del 90 % del trabajo de I+D en IA medido es al menos colaborativo con IA | Confirmado |
| Z.ai afirma que el Infra Agent de GLM-5.3 ayudó a aumentar 3,2 veces el rendimiento del servicio de GLM-5.3-Flash | Confirmado como resultado comunicado por el proveedor |
| Las apariciones comunitarias de Claude Opus 5.2 representan un lanzamiento oficial | No |
No. Google no ha anunciado oficialmente Gemini 4 Pro y la documentación pública actual de la API de Gemini no incluye ningún modelo Gemini 4. La historia actual se basa en un modelo de Arena inusualmente capaz y en la especulación de la comunidad sobre su identidad.
El modelo oculto utilizaba la etiqueta gemini-3.8-flash, pero parecía más potente que el modelo público de producción en pruebas de SVG, web, 3D y estilo agente. Su comportamiento más lento y deliberado también llevó a algunos evaluadores a pensar que parecía más un punto de control de clase Pro que un modelo Flash.
No están verificadas. La tabla viral no cuenta con respaldo oficial de Google ni de Arena, carece de una configuración de evaluación reproducible e incluye valores comparativos que no coinciden plenamente con las publicaciones oficiales de benchmarks de otros proveedores.
La auto-mejora recursiva se refiere a sistemas de IA que ayudan a mejorar el proceso que produce sistemas de IA más potentes, creando un ciclo de retroalimentación. Los laboratorios de frontera actuales no afirman públicamente haber logrado una RSI completamente autónoma, pero la IA ya contribuye a la evaluación, la programación, la optimización de infraestructuras y la I+D de modelos.
Google afirma que Gemini 3.8 se acelera mediante ciclos agénticos prolongados que evalúan y perfeccionan recursivamente los modelos subyacentes. Es un mecanismo real de auto-mejora, aunque mucho más limitado que un sistema completamente autónomo que diseñe a su sucesor sin supervisión humana.
Dream-RSI es un marco de investigación de septiembre de 2026 desarrollado por Google, Google DeepMind y colaboradores académicos. Utiliza historiales de exploración anteriores como simuladores de reproducción para que un agente pueda mejorar de forma económica su política de exploración y después volver a implementarla en el entorno real.
Anthropic afirma que Claude lidera el 26 % de su trabajo de I+D en IA medido y que más del 90 % es, como mínimo, colaborativo con IA. Anthropic también afirma que Claude no es completamente autónomo en ninguna de las partes medidas de ese trabajo.
Una empresa que se ralentiza por sí sola corre el riesgo de quedarse atrás frente a competidores que continúan avanzando. El mismo problema de incentivos existe entre países, por lo que las reglas compartidas de evaluación y los umbrales de capacidad son más fáciles de proponer que de implementar.
Un modelo más potente de lo esperado, etiquetado como gemini-3.8-flash, ha aparecido en Arena, y los evaluadores de la comunidad han producido suficientes resultados inusuales como para hacer plausible la teoría de Gemini 4 Pro. Pero plausible no significa confirmado: Google no ha anunciado Gemini 4 Pro, la captura de pantalla viral del backend no está verificada y la tabla de benchmarks que circula en Internet carece de respaldo oficial.
La historia más duradera es la aceleración del desarrollo de IA asistido por IA. Google afirma abiertamente que Gemini 3.8 utiliza ciclos prolongados para evaluar y perfeccionar recursivamente sus modelos subyacentes. Dream-RSI formaliza un ciclo de exploración de auto-mejora. Anthropic afirma que Claude ya lidera el 26 % del trabajo de I+D en IA medido, mientras que Z.ai afirma que un agente de infraestructura basado en GLM ayudó a triplicar el rendimiento del servicio de GLM-5.3-Flash.
Eso hace que el debate sobre la desaceleración de la industria sea más difícil, no más sencillo. Los laboratorios de frontera pueden coincidir en que son necesarias evaluaciones independientes y salvaguardas más sólidas, al mismo tiempo que afrontan fuertes incentivos para seguir avanzando.
Gemini 4 Pro sigue siendo un rumor; el cambio hacia sistemas de IA que ayudan a construir la siguiente generación de IA ya es real.
Empieza con una sola frase y obtén un sitio completo en minutos.