Demis Hassabis, cofundador y CEO de Google DeepMind, ha propuesto la creación de un organismo independiente encargado de probar y regular lo...

Demis Hassabis, cofundador y director ejecutivo de Google DeepMind, ha propuesto la creación de una nueva institución independiente para probar y regular los modelos de inteligencia artificial más avanzados del mundo.
La organización propuesta se situaría entre los laboratorios de IA de frontera y el gobierno estadounidense. Sus funciones incluirían: establecer estándares de evaluación técnica, realizar pruebas antes del lanzamiento de modelos avanzados, actualizar los puntos de referencia a medida que aumentan las capacidades, fomentar prácticas de seguridad más estrictas y coordinar respuestas cuando se descubran vulnerabilidades graves tras el despliegue.
Hassabis esbozó este plan en un artículo titulado "Un marco para la IA de frontera y el amanecer de una nueva era". TechCrunch informó sobre esta propuesta el 14 de julio de 2026, destacando especialmente su arquitectura singular: una organización financiada por la industria y dotada de personal técnico, que se inspira en parte en el modelo de la Autoridad Reguladora de la Industria Financiera de Estados Unidos (FINRA).
El plan comienza con la cooperación voluntaria. Los desarrolladores de IA de frontera deberán proporcionar los modelos que cumplan los requisitos para su evaluación hasta 30 días antes de su lanzamiento. Si el sistema de evaluación demuestra ser fiable, superar la revisión podría convertirse en un requisito previo para desplegar modelos de frontera en el mercado estadounidense.

Hassabis considera que la llegada de sistemas de IA de alto rendimiento podría superar la capacidad de gobiernos, investigadores y la sociedad para establecer métodos de evaluación fiables.
Esta preocupación no se limita a si los modelos generan texto ofensivo o cometen errores factuales comunes. Los sistemas de frontera podrían desarrollar capacidades que afecten a los siguientes ámbitos:
Los modelos podrían experimentar mejoras significativas entre ciclos regulatorios. Una evaluación que resultaba difícil seis meses atrás podría saturarse rápidamente y dejar de revelar diferencias sustanciales entre sistemas.
La elaboración tradicional de normas suele avanzar con lentitud. Pero no así el desarrollo de los modelos de frontera.
Por ello, Hassabis propone crear una organización cuyos métodos de evaluación puedan mantener aproximadamente el mismo ritmo que la evolución tecnológica.
La institución de estándares propuesta sería una organización de colaboración público-privada bajo supervisión federal o un organismo autorregulador.
Mantendría independencia técnica en su trabajo cotidiano, al tiempo que colaboraría con agencias gubernamentales y laboratorios nacionales en cuestiones de seguridad pública y nacional.
Sus funciones principales incluirían:
La institución de estándares no regularía todos los modelos pequeños, las empresas emergentes, los proyectos universitarios o las aplicaciones comunes de IA.
Su ámbito de competencia se limitaría exclusivamente a aquellos sistemas que, al superar un umbral de capacidad, puedan plantear riesgos excepcionalmente graves.
El marco de Hassabis no define un modelo de frontera simplemente por el número de parámetros, el coste de entrenamiento, el tamaño de la empresa o el reconocimiento de la marca.
En cambio, la institución de estándares propuesta mantendría una serie de puntos de referencia de capacidad.
Los modelos que superen umbrales específicos serían clasificados como de nivel de frontera. Las organizaciones que desarrollen dichos modelos serían consideradas laboratorios de frontera.
Este enfoque basado en la capacidad es importante porque la arquitectura y la eficiencia de los modelos evolucionan rápidamente.
Sistemas más pequeños o más económicos podrían llegar a igualar capacidades que antes requerían un entrenamiento a gran escala. Un umbral fijo basado únicamente en el cómputo podría quedar obsoleto.
Por lo tanto, los puntos de referencia propuestos tendrían las siguientes características:
Esta clasificación también se aplicaría a los modelos desarrollados en el extranjero que se desplieguen en el mercado estadounidense.
La propuesta adopta un enfoque de implementación por fases, en lugar de pasar directamente a un sistema de licencias obligatorias.
Los laboratorios de frontera deberán proporcionar voluntariamente a la institución de estándares los modelos que cumplan los requisitos antes de su lanzamiento.
El plazo de revisión puede ser de hasta 30 días.
Durante este periodo, los evaluadores evaluarán las capacidades, debilidades, medidas de seguridad y los posibles riesgos para la seguridad nacional del modelo.
La fase voluntaria inicial ayudará a la institución a:
Una vez que el proceso de evaluación demuestre ser técnicamente válido y operativamente fiable, el marco se aplicará formalmente.
Los modelos de frontera deberán pasar por este proceso para ser desplegados en el mercado estadounidense.
Esto convertirá las pruebas previas al lanzamiento, de una práctica voluntaria del sector, en un requisito explícito para el acceso al mercado.
La aprobación del modelo no implica el fin de las funciones de la institución de estándares.
Los laboratorios de frontera deberán colaborar con la institución en relación con las vulnerabilidades críticas descubiertas tras el lanzamiento.
Esto puede incluir:
Por lo tanto, el marco considera la seguridad como un ciclo de vida continuo, no como un evento de aprobación único.
Hassabis aboga por la realización de pruebas científicas rigurosas en áreas donde las capacidades avanzadas podrían causar daños graves.
Las áreas de evaluación iniciales podrían incluir:
| Área de evaluación | Pregunta ejemplo |
|---|---|
| Ciberseguridad | ¿Puede el modelo descubrir, explotar o automatizar vulnerabilidades de software graves? |
| Riesgo biológico | ¿Puede ayudar eficazmente en trabajos avanzados que podrían aumentar el peligro biológico? |
| Riesgo químico y radiológico | ¿Proporciona capacidades que van más allá de la información generalmente accesible? |
| Comportamiento autónomo | ¿Puede planificar, usar herramientas, funcionar de forma continua o eludir restricciones en tareas a largo plazo? |
| Engaño | ¿Oculta objetivos, manipula a los evaluadores o se comporta de manera diferente cuando es vigilado? |
| Robustez de las protecciones | ¿Pueden los usuarios adversarios eludir las restricciones de las políticas mediante jailbreak o interacciones múltiples? |
| Seguridad del modelo | ¿Podrían robarse pesos de modelo valiosos o información sensible del sistema? |
| Capacidad de investigación en IA | ¿Puede el modelo acelerar el desarrollo de sistemas de IA más potentes? |
El objetivo no es afirmar que todos los riesgos puedan medirse a la perfección.
La meta es generar pruebas suficientemente sólidas para respaldar las decisiones de despliegue e identificar los puntos que requieren medidas de protección adicionales.
Una de las partes más importantes de la propuesta es la exigencia de revisar con frecuencia el contenido de las pruebas.
Hassabis sugiere que los conjuntos de evaluación podrían actualizarse inicialmente cada trimestre.
Esto es necesario porque los puntos de referencia de frontera pueden volverse poco fiables por varios motivos:
La institución de estándares consultará inicialmente con los laboratorios de frontera, que poseen un amplio conocimiento técnico de sus sistemas actuales.
Sin embargo, con el tiempo, necesitará desarrollar sus propias evaluaciones privadas y confidenciales.
Estas pruebas no se revelarán completamente a los desarrolladores antes de la evaluación. Esto reducirá el riesgo de que los modelos se entrenen específicamente para superar puntos de referencia conocidos sin demostrar una seguridad más amplia.
Los puntos de referencia públicos son útiles para la investigación y la transparencia, pero no son suficientes para una certificación de alto riesgo.
Cuando los desarrolladores conocen todas las preguntas de la evaluación, podrían:
Los evaluadores independientes pueden reducir estos problemas manteniendo tareas confidenciales e introduciendo periódicamente nuevas tareas.
Este proceso se asemeja más a las pruebas de seguridad que a los rankings tradicionales.
Un programa de evaluación confiable debe incluir:
Entorno
Sin estas garantías, esta entidad normativa podría convertirse en una mera plataforma de publicación de puntos de referencia, en lugar de un organismo regulador significativo.
La Autoridad Reguladora de la Industria Financiera de EE.UU. (FINRA) es una organización privada sin fines de lucro autorreguladora de los corredores de bolsa estadounidenses. Se financia con tarifas del sector, pero opera bajo la supervisión de la Comisión de Bolsa y Valores. La entidad establece y hace cumplir las normas para los miembros, realiza inspecciones, supervisa la actividad del mercado, gestiona procesos de certificación y aborda riesgos emergentes.
Hassabis no sugiere trasladar cada aspecto de la regulación financiera al ámbito de la inteligencia artificial. Las características estructurales relevantes incluyen:
Las organizaciones de inteligencia artificial de frontera necesitan infraestructura informática costosa y personal altamente especializado. La financiación del sector puede proporcionar los recursos necesarios para contratar investigadores de modelos, expertos en ciberseguridad, especialistas en riesgos biológicos, ingenieros de evaluación y equipos de infraestructura. La supervisión federal busca evitar que la organización evolucione hacia un club privado controlado enteramente por las empresas evaluadas.
Hassabis sugiere que la junta directiva incluya expertos técnicos independientes y representantes de la comunidad de inteligencia artificial de código abierto. Esto es crucial porque la gobernanza de la inteligencia artificial de frontera afecta a organizaciones que adoptan modelos de desarrollo muy diferentes. Los laboratorios de modelos cerrados pueden proporcionar acceso a través de interfaces seguras sin publicar archivos de pesos, mientras que los desarrolladores de modelos abiertos pueden hacer públicos los parámetros, el código y los detalles técnicos del modelo. Si el organismo normativo solo representa a los laboratorios propietarios más grandes, podría establecer reglas que, de manera intencionada o no, perjudiquen a las organizaciones más pequeñas.
Una estructura más equilibrada podría incluir:
Las reglas específicas sobre derechos de voto y conflictos de intereses son fundamentales. La experiencia del sector es indispensable para comprender la tecnología, pero un control excesivo del sector podría socavar la confianza pública.
La propuesta va más allá de las pruebas de modelos. Las organizaciones clasificadas como laboratorios de frontera deberían adoptar prácticas operativas más estrictas, que incluyan:
Marcas de agua para contenido generado
Estos requisitos reflejan una realidad importante: los riesgos de la inteligencia artificial de frontera no comienzan ni terminan con el comportamiento del modelo.
Un modelo seguro aún puede generar riesgos si sus pesos son robados, sus indicaciones del sistema quedan expuestas, sus herramientas están mal configuradas o su entorno de implementación carece de los controles adecuados.
El organismo normativo no necesita realizar todas las pruebas internamente.
Hassabis propone apoyar un ecosistema de entidades independientes de evaluación y auditoría.
Diferentes organizaciones pueden especializarse en:
La entidad central puede definir requisitos y coordinar procesos, mientras que los expertos aprobados realizan evaluaciones específicas.
Este enfoque puede ser más escalable que intentar establecer todas las formas de conocimiento especializado dentro de una sola organización.
También reduce la dependencia de un único evaluador, cuyos métodos podrían tener puntos ciegos desconocidos.
Describe tu idea una vez y We0 AI puede generar un sitio de presentacion, paginas y CMS, y ayudarte a atraer clientes y trafico tras el lanzamiento.
Una generación completa de proyectos para registro gratuito
Lo mejor para probar un flujo de generación completo y ver rápidamente el primer borrador del proyecto.
EE.UU. ya cuenta con agencias gubernamentales dedicadas a pruebas y elaboración de normas en inteligencia artificial.
El Instituto Nacional de Estándares y Tecnología (NIST) alberga el Centro de Estándares e Innovación en Inteligencia Artificial (CAISI).
CAISI colabora con la industria para desarrollar estándares voluntarios, crear métodos de evaluación y realizar evaluaciones relacionadas con ciberseguridad, bioseguridad, armas químicas, seguridad nacional y sistemas de inteligencia artificial extranjeros.
La propuesta de Hassabis se superpone con este trabajo, pero crearía una estructura única.
Una posible división de responsabilidades sería:
| Entidad | Rol posible |
|---|---|
| CAISI y NIST | Ciencia de la medición, estándares públicos, evaluaciones gubernamentales, coordinación de seguridad nacional |
| Organismo normativo propuesto | Procesos de evaluación previa al lanzamiento, requisitos para laboratorios de frontera, certificación técnica, supervisión continua del sector |
| Agencias federales | Autoridad legal, decisiones de seguridad nacional, aplicación de la ley, controles de exportación |
| Laboratorios nacionales | Pruebas especializadas, infraestructura segura, experiencia científica |
| Evaluadores externos | Auditorías específicas por dominio, pruebas de equipo rojo, desarrollo de puntos de referencia |
| Laboratorios de frontera | Acceso seguro al modelo, documentación técnica, medidas correctivas, monitoreo posterior al lanzamiento |
Este arreglo requiere una coordinación cuidadosa para evitar duplicación de pruebas, requisitos conflictivos y falta de claridad en las competencias.
Google DeepMind ya utiliza un Marco de Seguridad de Frontera interno.
Este marco identifica umbrales de capacidad críticos y los vincula con evaluaciones, medidas de seguridad y medidas de implementación.
Sus áreas de riesgo incluyen:
El marco de DeepMind también utiliza casos de seguridad y medidas de mitigación para modelos que alcanzan niveles específicos de capacidad.
La nueva propuesta de Hassabis extendería esta lógica general más allá de una sola empresa.
En lugar de que cada laboratorio de frontera establezca y revise sus propios umbrales de forma independiente, una organización externa crearía pruebas compartidas y requisitos mínimos.
Una organización especializada puede reclutar personal con suficiente comprensión de los modelos avanzados para evaluar sus capacidades.
Los organismos reguladores generales a menudo tienen dificultades para igualar la profundidad técnica de los laboratorios de frontera.
Las estructuras autorreguladoras pueden actualizar puntos de referencia y procesos más rápidamente que la legislación.
Las evaluaciones comunes facilitan la comparación de las declaraciones de seguridad de modelos de diferentes desarrolladores.
Las pruebas antes de la implementación dan a los evaluadores más tiempo para encontrar fallas graves antes de que el modelo llegue a millones de usuarios.
Las pruebas retenidas y las auditorías de terceros pueden proporcionar evidencia más allá de las fichas técnicas publicadas por las empresas.
Eximir a los modelos comunes que no son de frontera reduce la carga sobre startups, universidades y pequeños proyectos de código abierto.
Un sistema liderado por EE.UU. podría proporcionar un punto de partida para estándares internacionales de evaluación compatibles.
Aunque detallado, el plan presenta varios problemas de diseño.
Los umbrales de capacidad pueden determinar qué empresas deben someterse a costosas pruebas y posibles retrasos en el lanzamiento.
El proceso para establecer umbrales debe ser transparente, basado en evidencia y sujeto a cuestionamiento.
La financiación del sector puede proporcionar conocimiento especializado y capacidad informática, pero también genera conflictos de interés.
Se necesita una fuerte supervisión gubernamental, gobernanza en interés público, transparencia financiera y revisión externa.
Algunas evaluaciones requieren entornos especializados, revisión de expertos, pruebas prolongadas de agentes o experimentos repetidos.
El organismo normativo necesita personal y capacidad informática suficientes para no convertirse en un cuello de botella para los lanzamientos.
Los modelos cuyos pesos se publican presentan riesgos diferentes a los de las API alojadas.
Una vez que los pesos se hacen públicos, muchas medidas de protección de implementación pueden quedar sin efecto.
Los requisitos de evaluación pueden necesitar distinguir entre sistemas de pesos abiertos, pesos restringidos y sistemas cerrados alojados.
Las evaluaciones de frontera a menudo producen evidencia ambigua.
El marco necesita reglas para aprobaciones condicionales, pruebas adicionales, restricciones de implementación, apelaciones y revisiones independientes.
Un organismo autorregulador no puede imponer automáticamente sanciones legales a empresas fuera de su jurisdicción.
La autorización formal requiere legislación, acción de agencias, requisitos contractuales, reglas de adquisición o condiciones de acceso al mercado.
Las grandes empresas de inteligencia artificial pueden permitirse evaluaciones exhaustivas y equipos de cumplimiento normativo.
Los desarrolladores más pequeños podrían tener dificultades, incluso si sus modelos alcanzan el mismo umbral de capacidad.
El marco necesita evitar que los requisitos de seguridad se conviertan en barreras anticompetitivas.
Hassabis considera que el sistema debe ser ajustable.
Si las evaluaciones muestran que los modelos de frontera están generando mayores riesgos, se podría fortalecer la regulación.
Las posibles medidas de escalada incluyen:
Restricciones en el entorno de despliegue
La opción más severa es frenar de forma coordinada el ritmo de desarrollo de los laboratorios de frontera cuando haya pruebas suficientes.
Este tipo de intervención es sumamente compleja tanto a nivel político como técnico, y requiere umbrales claros, coordinación internacional, mecanismos de ejecución y pruebas contundentes de que mantener el ritmo actual conlleva un riesgo inaceptable.
El desarrollo y despliegue de la inteligencia artificial de frontera cruza fronteras nacionales.
Los organismos de normalización de Estados Unidos pueden influir en el acceso al mercado estadounidense, pero no pueden regular de forma independiente a todos los laboratorios del mundo.
Por ello, la propuesta de Hassabis considera el liderazgo de EE. UU. como un punto de partida, no como un sistema definitivo.
Se requiere compatibilidad internacional en:
La falta de coordinación llevará a que las empresas enfrenten estándares inconsistentes o elijan la jurisdicción con la regulación más laxa.
Al mismo tiempo, un único regulador global podría resultar políticamente inviable.
Una red de organismos nacionales y regionales de evaluación que adopten estándares técnicos compartidos podría ser una alternativa más factible.
Un organismo de normalización eficaz cambiaría el proceso de publicación de modelos.
Actualmente, los laboratorios líderes publican por su cuenta tarjetas de modelo, tarjetas de sistema, marcos de seguridad y algunos resultados de evaluación.
Bajo el nuevo sistema, los desarrolladores de frontera podrían tener que preparar:
La evaluación de seguridad se convertirá en un filtro explícito para la publicación, y no en una práctica interna que cada empresa decida por su cuenta.
Propone la creación de un organismo independiente de normalización liderado por Estados Unidos para evaluar modelos de inteligencia artificial de frontera. Dicho organismo establecería pruebas técnicas, auditaría los modelos antes de su publicación, promovería prácticas de seguridad y coordinaría la respuesta ante vulnerabilidades graves.
Se asemejaría a una organización público-privada o autorreguladora supervisada por el gobierno federal. Su financiamiento podría provenir principalmente de la industria de la IA, operando bajo supervisión gubernamental.
FINRA es una organización autorreguladora financiada por la industria que supervisa a los corredores de bolsa en EE. UU., bajo la vigilancia de la SEC. Hassabis considera que una estructura similar podría combinar experiencia técnica, reglas adaptables, financiamiento industrial y supervisión pública.
La propuesta inicial permite un intercambio voluntario con el organismo de normalización hasta 30 días antes de la publicación. El período exacto de revisión puede variar según el modelo y los requisitos de evaluación.
No. El marco se aplicaría a modelos que alcancen umbrales de capacidad de frontera que se actualicen periódicamente. Los modelos más pequeños de startups, universidades y otras organizaciones generalmente no estarían sujetos a este proceso, a menos que alcancen el nivel de capacidad especificado.
Hassabis indica que el marco debería aplicarse a sistemas de nivel de frontera, ya sean de código abierto o cerrado, independientemente de su país de origen. Los modelos con pesos abiertos podrían requerir salvaguardas diferentes, ya que una vez publicados, podría ser imposible imponer controles de despliegue.
La propuesta se centra en ciberseguridad, amenazas biológicas, comportamiento autónomo, engaño, evasión de salvaguardas y otras capacidades de alto riesgo. El conjunto de pruebas deberá actualizarse periódicamente a medida que surjan nuevos riesgos y capacidades.
Sí. El Centro de Estándares e Innovación en IA del NIST se dedica a pruebas, estándares y evaluaciones que involucran IA comercial y de frontera. El organismo propuesto añadiría una estructura más formal e independiente de revisión previa a la publicación y supervisión industrial.
Demis Hassabis propone la creación de un organismo de normalización técnicamente especializado e independiente, encargado de revisar los modelos de IA más capaces antes de su publicación. Esta organización comenzaría con una cooperación voluntaria, establecería procesos de evaluación confiables y, en el futuro, podría convertirse en un requisito obligatorio para el despliegue de modelos de frontera en EE. UU.
La propuesta intenta combinar la experiencia y financiación de la industria con supervisión gubernamental, pruebas independientes, evaluaciones de referencia reservadas, auditorías de terceros y monitoreo continuo posterior.
Aún quedan muchas cuestiones de implementación por resolver, incluidos los mecanismos de gobernanza, los métodos de ejecución, el tratamiento de los modelos de código abierto, la capacidad de evaluación, los conflictos de interés y la coordinación internacional. No obstante, en comparación con los llamados genéricos a regular la IA, esta propuesta es más concreta: define la estructura del organismo, el proceso de revisión, el alcance y las responsabilidades técnicas.
La idea central es directa: la seguridad de la IA de frontera debe ser evaluada por una organización con suficiente independencia, experiencia técnica, recursos computacionales y autoridad para desafiar a las empresas tecnológicas que construyen los modelos.
Empieza con una sola frase y obtén un sitio completo en minutos.