Biblioteca / Análisis · Industria

Le tomaron examen a nueve empresas de IA: la mejor sacó C+

Un panel independiente de siete expertos calificó a las nueve empresas de IA más importantes del mundo en seis dominios de seguridad. Qué mide el informe, qué no mide, y qué hacés vos con esa información.

Por Marina MéndezActualizado · Agosto 2026Lectura · 13 minNivel · Inicial

En julio de 2026 un panel de siete investigadores independientes se sentó a corregir. Los examinados eran las nueve empresas que construyen los modelos de IA más importantes del mundo, entre ellas las que están detrás de ChatGPT, de Claude y de Gemini. La materia era seguridad. La mejor nota de toda la clase fue un C+, y tres empresas reprobaron.

El titular es lindo y por eso circuló mucho, pero el informe dice bastante más que eso, y también dice bastante menos de lo que le atribuyeron algunas coberturas. Acá va qué mide exactamente, quién es cada una de las nueve empresas (porque cinco de ellas probablemente no te suenen de nada), qué encontró el panel, cuáles son los límites reales del ejercicio y qué te sirve a vos de todo esto.

El informeQué es el AI Safety Index

Lo publica el Future of Life Institute, una organización dedicada a estudiar y advertir sobre los riesgos extremos de la tecnología. La edición Verano 2026 salió el 7 de julio de 2026, es la cuarta desde que el índice existe y es también la más grande: arrancó evaluando seis empresas en 2024 y hoy evalúa nueve.

El mecanismo es simple de describir. Un panel independiente de siete investigadores y expertos en gobernanza revisa a cada empresa sobre 37 indicadores agrupados en seis dominios de seguridad y le pone una nota a cada dominio. Las notas usan el sistema de calificación de Estados Unidos, donde A, B, C, D y F equivalen a 4.0, 3.0, 2.0, 1.0 y 0. La evidencia que entró en esta edición se recolectó hasta el 3 de junio de 2026.

El panel lo integran David Krueger (Universidad de Montreal), Sharon Li (Universidad de Wisconsin-Madison), Tegan Maharaj (HEC Montréal), Sneha Revanur (Encode), Stuart Russell (UC Berkeley), Robert Trager (Universidad de Oxford) y Yi Zeng (Universidad Renmin de China). Es un panel académico, con gente de tres continentes, y ninguno de los siete trabaja para las empresas evaluadas.

Lo esencial

Si te llevás solo cuatro cosas de toda esta nota, que sean estas. Primero: ninguna de las nueve empresas llegó a una B, ni siquiera la que lidera el índice. Segundo: en el dominio de seguridad existencial ninguna superó una C-, y la mayoría sacó D o menos. Tercero: cuatro empresas debilitaron sus compromisos de pausar el desarrollo ante capacidades peligrosas, y no son las mismas cuatro que bajaron de nota respecto de la edición anterior. Y cuarto, el más importante de todos: el índice califica a la empresa, no al producto que abrís todos los días.

El aulaQuién es quién entre las nueve

Antes de mirar la tabla conviene saber a quién estamos mirando, porque si no queda una lista de siglas donde reconocés dos nombres y el resto te suena a nada. Van en el orden en que después aparecen en el ranking.

Anthropic (Estados Unidos, San Francisco) se fundó en 2021 con gente que venía de OpenAI y es la empresa que hace Claude. Su diferencial declarado es poner la investigación en seguridad por delante del resto, y en este índice efectivamente lidera cinco de los seis dominios.

OpenAI (Estados Unidos, San Francisco) se fundó en 2015 y hace ChatGPT, el producto que volvió masiva a la IA generativa. En esta edición lidera el dominio de evaluación de riesgos, porque tiene una batería de evaluaciones más amplia que las demás y más apertura al testeo externo.

Google DeepMind (Reino Unido y Estados Unidos) hace Gemini. DeepMind nació en Londres en 2010, Google la compró en 2014 y en 2023 se fusionó con el equipo de Google Brain. Es la única de las nueve que forma parte de una empresa gigante con negocios muy anteriores a la IA, y eso condiciona todo su contexto de decisión.

Meta (Estados Unidos) es la dueña de Instagram, WhatsApp y Facebook. Hace la familia de modelos Llama, que publica con los pesos abiertos, o sea que cualquiera puede descargarlos y correrlos en su propia infraestructura. Es la empresa que más mejoró en esta edición, del sexto al cuarto puesto.

Z.ai (China, Beijing) se llamaba Zhipu AI hasta que cambió su marca internacional en 2025. Nació en 2019 como spin-off comercial de la Universidad de Tsinghua, la institución técnica más prestigiosa de China, fundada por los profesores Tang Jie y Li Juanzi. Hace la familia de modelos GLM y publica buena parte de ellos con pesos abiertos. En enero de 2026 salió a la bolsa de Hong Kong y se convirtió en la primera desarrolladora importante de modelos de lenguaje en cotizar públicamente.

Alibaba Cloud (China, Hangzhou) es la división de computación en la nube del grupo Alibaba, el gigante de comercio electrónico dueño de AliExpress. Hace la familia Qwen, que también publica con pesos abiertos y que se volvió una de las bases más usadas del ecosistema de IA abierta a nivel mundial. Funciona como el brazo de IA de una corporación enorme, con los incentivos comerciales que eso trae, y no como un laboratorio independiente.

xAI (Estados Unidos) la fundó Elon Musk en 2023 y hace Grok, el asistente integrado con la red social X. Es la que más cayó en esta edición, del cuarto al séptimo puesto, y el panel señala que no encontró evidencia de un equipo de seguridad relevante dentro de la empresa.

DeepSeek (China, Hangzhou) la fundó Liang Wenfeng en 2023 con financiamiento de High-Flyer, el fondo de cobertura cuantitativo que él mismo había fundado en 2016. Publica modelos abiertos y saltó a la fama mundial en enero de 2025 con su modelo R1, que alcanzó resultados comparables a los de los modelos de punta con una fracción del costo de entrenamiento. Es un equipo chico comparado con el resto de la lista.

Mistral (Francia, París) la fundaron en abril de 2023 Arthur Mensch, Guillaume Lample y Timothée Lacroix, tres investigadores que venían de Google DeepMind y de Meta. Es la principal apuesta europea a tener un laboratorio de IA propio, su estrategia es publicar modelos con pesos abiertos más eficientes que los de la competencia y su asistente se llama Le Chat. En este índice quedó última de las nueve.

Notá una cosa antes de seguir: cuatro de las nueve (Meta, Z.ai, Alibaba Cloud y DeepSeek) publican modelos con los pesos abiertos, y Mistral hace lo mismo con buena parte de los suyos. Publicar los pesos significa que cualquiera puede descargarse el modelo, modificarlo y correrlo por su cuenta, sin pedirle permiso a nadie. Guardate el dato, porque vuelve a aparecer cuando el informe habla de proteger los mecanismos de seguridad frente al ajuste fino que puede hacer después un tercero.

Las notasLa tabla completa

EmpresaNotaPuntajeRespecto de Invierno 2025
AnthropicC+2.66igual
OpenAIC2.28bajó (venía de C+)
Google DeepMindC2.01igual
MetaD+1.32subió (venía de D)
Z.aiD-0.88bajó (venía de D)
Alibaba CloudD-0.87igual
xAIF0.65bajó (venía de D)
DeepSeekF0.47bajó (venía de D)
MistralF0.33primera vez evaluada

Acá hay una aclaración que la mayoría de las coberturas aplasta y que conviene marcar para no exagerar el dato. En el sistema de notas estadounidense una C es una nota aprobada, no un desastre. Lo que el informe muestra es que ninguna de las nueve llegó a una B y que tres reprobaron directamente, algo bastante distinto de decir que reprobaron todas.

Las tres reprobadas también dicen algo por sí solas: una es estadounidense (xAI), otra es china (DeepSeek) y la tercera es europea (Mistral). El informe usa exactamente ese dato para argumentar que la seguridad insuficiente es un problema global y no un problema de una región en particular.

Y ahí aparece la disonancia europea, que es el detalle más incómodo de la tabla. La Unión Europea lidera el mundo en regulación de seguridad de IA, y sin embargo la principal empresa europea quedó última de las nueve. Tener las mejores reglas del vecindario no garantiza que la empresa de tu vecindario sea la que mejor las encarna.

Los dominiosLas seis materias del examen

El puntaje general sale de promediar seis dominios distintos, y mirarlos por separado es más informativo que mirar la nota final. Esta tabla muestra cuántos indicadores tiene cada dominio y cómo les fue a las tres primeras del ranking.

DominioIndicadoresAnthropicOpenAIGoogle DeepMind
Evaluación de riesgos6C+C+C+
Daños actuales9B-CC
Marcos de seguridad4B-C+C
Seguridad existencial4D+D+D
Gobernanza y rendición de cuentas4BCC-
Compartir información10B+B-B-

El dato más fuerte de todo el informe está en la cuarta fila. En seguridad existencial ninguna de las nueve empresas superó una C-, y la mayoría sacó D o menos. Las tres que lideran el índice general no se salvan tampoco: dos D+ y una D.

El panel reconoce que hay intentos concretos en esa dirección, y los nombra: los clasificadores constitucionales de Anthropic, el pedido de OpenAI de crear instituciones de gobernanza, los compromisos de monitoreo de Google DeepMind y las provisiones de pérdida de control de Meta. Aun así los califica de completamente inadecuados frente al problema que dicen atacar. El cuestionamiento de fondo apunta a que los enfoques hoy dominantes, como la interpretabilidad y el monitoreo de la cadena de razonamiento, sirven para darse cuenta de que algo pasó, y darse cuenta no equivale a impedir que pase.

El hallazgoCorrer el arco

Varias de estas empresas se habían comprometido públicamente a frenar el desarrollo por su cuenta si detectaban que se estaban acercando a líneas rojas de capacidad peligrosa. Ese compromiso era unilateral: lo cumplo yo, sin importar lo que haga el de al lado.

El informe encontró que Anthropic, OpenAI, Google DeepMind y Meta debilitaron o anularon ese compromiso de pausa. Algunas ahora lo condicionan a lo que haga la competencia, que en la práctica lo convierte en un compromiso mucho más blando. Los revisores llaman a esta maniobra "correr el arco" y sostienen que terminó debilitando los marcos de seguridad de toda la industria, no solo los de las cuatro empresas involucradas.

Hay un detalle acá que conviene leer despacio, porque es fácil fusionar dos hallazgos que el informe presenta por separado. Las cuatro empresas que bajaron su nota respecto de la edición anterior son OpenAI, Z.ai, xAI y DeepSeek. Esas cuatro no son las mismas cuatro que debilitaron los compromisos de pausa, y los dos grupos se solapan solamente en OpenAI. Son dos cosas distintas y cualquier resumen que las mezcle te está contando otra historia.

El giroDel "nunca militar" al contrato de defensa

Entre 2024 y 2026 pasó algo que el panel marcó como riesgo emergente dentro del dominio de daños actuales. Empresas que antes prohibían explícitamente las aplicaciones militares de sus modelos, entre ellas Anthropic, OpenAI, Google DeepMind y Meta, revirtieron esa posición y se sumaron a xAI y a Mistral en la búsqueda de acuerdos de defensa. De las nueve empresas evaluadas, seis están hoy en ese terreno.

Vale la pena no dramatizarlo. El propio informe señala que Anthropic mantiene límites sobre vigilancia doméstica y armas autónomas, y aun así recibió críticas del panel por compromisos militares que considera cuestionables. Lo que el panel expresa en estos casos es un señalamiento propio sobre la política de la empresa, y no una determinación de responsabilidad legal de ningún tipo.

La brechaLo que dicen y lo que hacen

Uno de los hallazgos más útiles para el lector común no tiene números pero se entiende enseguida. El panel observó que el discurso público sobre seguridad de los liderazgos de Google DeepMind, OpenAI y xAI diverge de su conducta comercial y de su posición legislativa. Dicho de otro modo: lo que dicen en una entrevista y lo que hacen cuando se discute una ley que los afecta no coinciden. La consecuencia práctica es que las declaraciones públicas funcionan bastante mal como indicador de lo que la empresa hace de verdad puertas adentro.

El informe también anota algo que juega a favor de las empresas. A medida que se acercan las fechas de cumplimiento de la regulación en Estados Unidos y en la Unión Europea, todas publicaron y actualizaron marcos de seguridad más completos que los de ediciones anteriores. El problema es lo que falta adentro de esos marcos: umbrales cuantitativos, auditorías genuinamente independientes y una autoridad de decisión clara sobre quién puede frenar qué cosa y con qué poder real.

Los límitesLa parte honesta

Este informe es serio y está bien hecho, y justamente por eso vale la pena entender qué cosas quedan fuera de su alcance. Son cinco.

1. Califica a la empresa, no al producto que usás. Lo que el panel evalúa son políticas, estructuras de gobernanza, divulgaciones y marcos técnicos publicados. No mide el desempeño del modelo que abrís todos los días ni tu experiencia con él. Un C+ no significa que Claude sea un 66 por ciento seguro para tu trabajo, significa que las políticas y estructuras de la empresa que lo hace fueron calificadas así. Si querés decidir qué herramienta te conviene para una tarea concreta, el criterio pasa por otro lado, y de eso hablo en la nota sobre los modelos de Claude.

2. Las notas las asigna un panel con pesos discrecionales. Los siete revisores califican cada dominio según estándares de desempeño absoluto y con pesos que ellos mismos deciden. Las notas finales son promedios de esas evaluaciones y las calificaciones individuales de cada revisor se mantienen confidenciales. Es un juicio experto informado y transparente en su método, con todo lo que un juicio experto tiene de interpretación.

3. Comparar empresas chinas y occidentales es difícil, y el informe lo admite. En China las regulaciones nacionales tienen fuerza inmediata y los compromisos voluntarios son menos comunes, mientras que en Estados Unidos ocurre lo contrario. La escasez de compromisos voluntarios de las empresas chinas puede reflejar en parte esa diferencia de contexto regulatorio y no únicamente una menor preocupación por la seguridad.

4. La evidencia se cortó el 3 de junio de 2026. Todo lo que haya pasado después de esa fecha, para bien o para mal, no está en estas notas.

5. El Future of Life Institute no es un observador neutro. Es una organización dedicada a advertir sobre los riesgos extremos de la tecnología. Eso no invalida el trabajo, el panel es independiente y académicamente sólido, pero sí explica por qué el dominio de seguridad existencial pesa tanto en el análisis. Un índice armado por otra organización pondría el foco en otro lado, por ejemplo en sesgos, en privacidad o en impacto laboral, y las nueve empresas quedarían ordenadas de otra manera.

El cierreQué hacés vos con esto

Empecemos por lo que este informe no te da. No te dice qué herramienta de IA usar. Si llegaste hasta acá esperando una respuesta a "entonces cuál uso", no está en el índice, y quien te la venda a partir de este informe te está vendiendo algo que el informe no dice en ningún lado.

Lo que sí te da es una forma distinta de leer los anuncios de las empresas de IA, que aparecen todo el tiempo y suelen sonar todos igual de tranquilizadores. Cuando una empresa anuncie su próximo compromiso de seguridad, ya sabés qué tres preguntas hacerle: tiene umbrales medibles, tiene auditoría externa independiente, y existe algún órgano interno con poder para frenar un lanzamiento sin pedirle permiso al liderazgo. Son exactamente las tres cosas que el panel busca para calificar, y son las tres que suelen faltar.

Y queda un dato de fondo que es más valioso que cualquier nota individual: la distancia entre lo que una empresa de IA dice y lo que hace es medible, y hay gente midiéndola dos veces por año, con método público y panel independiente. Eso cambia el terreno. Hace dos años la única fuente sobre la seguridad de estas empresas eran las propias empresas.

Si te interesa seguir el hilo de cómo la regulación empezó a tocar a estas compañías de verdad, está el caso del modelo que un gobierno mandó a apagar en tres días. Y si lo que querés es afinar el criterio con el que usás estas herramientas todos los días, la nota sobre la sicofancia en la IA va justo por ahí. En la biblioteca está el resto.

Noticias todos los domingos sobre los últimos modelos, las nuevas funcionalidades y lo que planean las empresas. 100% gratis.

Llega a tu mail cada semana.

Cero spam. Solo noticIAs.

Marina Méndez

Marina Méndez · AI Specialist & Strategist

Vengo del mundo tech y hace años aplico IA en negocios reales: procesos, clientes y contenido. En @aprendersobreia te ayudo a entender la IA con criterio y a aplicarla para recuperar tiempo en tu trabajo real, sin humo.

Quiero aplicar esto en mi trabajo