Cuando una empresa evalúa proveedores de IA, la conversación de seguridad suele terminar en la misma foto: los dos muestran SOC 2, los dos dicen que no entrenan con tus datos, los dos tienen una página linda de “AI safety”. Con eso no se decide nada. La pregunta útil es otra: ¿qué publica cada proveedor cuando la noticia lo deja mal parado?
En agosto de 2026 esa pregunta tuvo dos respuestas concretas en la misma semana. El 14 de agosto Anthropic publicó su segundo reporte de riesgo, donde se sube a sí misma el nivel de riesgo de desalineamiento, revela que tiene un modelo más capaz que no piensa lanzar y documenta un agujero propio en sus controles que estuvo abierto once meses. En paralelo, el Financial Times reportó que OpenAI había repartido su equipo Preparedness —el que evalúa riesgos catastróficos— entre equipos existentes; OpenAI discute esa lectura. Vamos a los hechos, separando lo verificable de lo que está en disputa.
Anthropic elevó su propia evaluación de riesgo de desalineamiento en contextos críticos de “muy bajo” a “bajo” en su Risk Report de agosto de 2026 (fecha de cobertura: 15 de julio de 2026), y aclaró que sus propios argumentos “probablemente todavía sostienen” la calificación de muy bajo: subió el número para reflejar mayor incertidumbre tras divulgaciones de incidentes en evaluaciones de ciberseguridad. El mismo documento revela un modelo interno sin lanzar, Model 2, algo más capaz que Mythos 5, que no tiene planes de publicar y al que no le corrió toda la batería de evaluaciones previas al despliegue.
Del lado de OpenAI, el hecho no discutido es la reorganización; la palabra “disolvió” sí está en disputa. El Financial Times reportó que a fines de julio de 2026 las responsabilidades del equipo Preparedness se repartieron entre equipos existentes. OpenAI respondió textualmente: “No disolvimos el equipo Preparedness”, y sostiene que hay líderes de investigación en ciberseguridad, riesgo biológico y químico y automejora de la IA reportando a su responsable de seguridad. Para tu due diligence, lo relevante no es quién gana la discusión: es que de un lado hay un documento público con fechas y del otro hay versiones enfrentadas.
Soy consultor de IA certificado por Anthropic, así que corresponde que lo diga de entrada: tengo un sesgo declarado. Por eso este artículo se apoya en documentos que podés abrir vos mismo y marca con claridad qué está confirmado y qué no. Si querés la comparación de producto y precio entre plataformas, esa la escribí aparte en Claude vs ChatGPT para empresas argentinas. Esto es otra cosa: es gobernanza.
| Señal de gobernanza (agosto 2026) | Anthropic | OpenAI |
|---|---|---|
| Documento público de riesgo | Risk Report de agosto de 2026, versión redactada, con fecha de cobertura del 15 de julio de 2026 | Sin reporte equivalente en la misma ventana |
| Movimiento de su propia calificación de riesgo | Subió desalineamiento en contextos críticos de “muy bajo” a “bajo” | No aplica: no publica esa métrica |
| Divulgación de modelos no lanzados | Tres modelos internos sin publicar a la fecha de cobertura, incluido Model 2 | No divulgado en un documento comparable |
| Incidentes propios documentados | Sí, incluido un fallo de clasificadores biológicos de mayo de 2025 a abril de 2026 | Sin publicación equivalente en la ventana analizada |
| Estructura del equipo de riesgo | Reportes de riesgo con proceso de revisión y gobernanza descrito en el documento | Responsabilidades repartidas en equipos existentes a fines de julio de 2026 (FT); la empresa niega que sea una disolución |
¿Qué dice el reporte de riesgo de Anthropic de agosto de 2026?
Dice, en resumen, que el riesgo sigue siendo bajo y que igual lo suben. La tabla resumen del propio documento califica el riesgo general de desalineamiento en contextos críticos como “bajo (un aumento respecto de nuestra evaluación previa de ‘muy bajo’, a la luz del incremento general de incertidumbre en torno a divulgaciones recientes de incidentes relacionados con el comportamiento de los modelos en evaluaciones de ciberseguridad)”.
Y más adelante lo explican sin vueltas: creen que sus argumentos “probablemente todavía sostienen una designación de riesgo ‘muy bajo’ para los modelos cubiertos, pero estamos elevando el riesgo evaluado a ‘bajo’ para reflejar una mayor incertidumbre general”. En otro pasaje lo llaman por su nombre: lo hacen “en aras de la prudencia”.
Para un comité de riesgo esto es información de calidad distinta a un blog post de marketing. Un proveedor que empeora su propia nota sin que nadie lo obligue está mostrando el mecanismo, no el resultado. Y el mecanismo es lo único que podés auditar.
Un proveedor que solo publica buenas noticias no te está dando información: te está dando publicidad. Lo que sirve para decidir es ver qué hace cuando el dato le juega en contra.
¿Qué es Model 2 y por qué importa que exista un modelo que no se lanza?
Model 2 es un modelo interno sin publicar que, según el reporte, es algo más capaz que Claude Mythos 5, el modelo frontera de Anthropic. El documento lo describe como una mejora perceptible para muchas tareas de uso interno, pero aclara que no muestra un salto de capacidad de la magnitud que hubo entre Claude Opus 4.6 y Mythos Preview. Textual: no tienen planes actuales de lanzarlo externamente y no le corrieron toda la batería habitual de evaluaciones previas al despliegue, por lo que tienen menor confianza en sus estimaciones de capacidad.
A la fecha de cobertura había tres modelos internos con capacidades frontera o casi frontera sin publicar: Claude Opus 5 (que desde entonces sí se lanzó), Model 1 y Model 2. Ese nivel de detalle —incluida la existencia de modelos que la competencia jamás mencionaría— es el dato duro del reporte.
Otro detalle que sirve para entender el catálogo comercial: el reporte aclara que Mythos 5 está disponible para ciertos clientes vía Project Glasswing y, con salvaguardas adicionales, para acceso general bajo el nombre Claude Fable 5. Si venís siguiendo la familia de modelos, lo conté en Claude Fable 5 para empresas de LATAM.
El incidente que Anthropic contó sobre sí misma (y que nadie la obligaba a contar)
Es la parte más incómoda del documento y, por eso mismo, la más valiosa. Anthropic reporta que sus clasificadores biológicos no estuvieron corriendo sobre el tráfico de sus proveedores de human feedback durante un período largo. Los números que publica:
- Desde mayo de 2025 hasta abril de 2026, todo el tráfico de sus sistemas de recolección de human feedback corrió sin los clasificadores biológicos de bloqueo.
- Alcanzó a un universo de unas 50.000 personas contratistas, verificadas solo por los proveedores —muchos de los cuales, admite el reporte, no tenían procesos de screening capaces de frenar ni siquiera a actores de amenaza de nivel CB-1—, y a unos 133 millones de intercambios.
- El origen fue un flag pensado solo para uso interno que no solo desactivaba el bloqueo, sino también el registro de las marcas del clasificador: el tráfico que se habría marcado no quedó grabado ni llegó a ningún mecanismo de revisión.
- Remediado por completo, con revisión posterior de los transcripts. No encontraron evidencia de uso indebido preocupante. Pero el propio reporte extrae la conclusión que duele: el hallazgo los lleva a creer que hay mayor probabilidad de que existan otros problemas similares que todavía desconocen.
Esa última frase es la que yo llevaría a una reunión de comité. No porque tranquilice —no tranquiliza—, sino porque es exactamente el tipo de razonamiento que le exigimos a nuestros propios proveedores críticos y que casi nunca recibimos.
¿Qué pasó realmente con el equipo Preparedness de OpenAI?
Acá hay que ser preciso, porque circulan titulares más fuertes que los hechos. Lo reportado y lo respondido:
- Lo que reportó el Financial Times: a fines de julio de 2026 OpenAI desarmó el equipo Preparedness —el grupo encargado de evaluar si sus modelos podían usarse para cosas como desarrollo de armas biológicas o ciberataques a gran escala— y repartió esas responsabilidades entre personal senior de equipos ya existentes.
- Lo que respondió OpenAI, textual: “No disolvimos el equipo Preparedness. Tenemos líderes de investigación sólidos en ciberseguridad, capacidades biológicas y químicas y automejora de la IA, todos reportando a Saachi Jain, nuestra responsable de seguridad”.
- Lo que no está en disputa: que hubo reorganización, que el rol de responsable de preparedness cambió de manos y que las responsabilidades de riesgo biológico y cibernético pasaron a personas dentro de equipos que además lanzan producto. La prensa lo enmarcó como el tercer cambio en estructuras de seguridad de largo plazo en unos dos años, en el camino hacia una salida a bolsa.
Traducido a lenguaje de gobernanza: lo que se discute no es si alguien sigue mirando el riesgo, sino si lo mira un equipo dedicado con un responsable único o personas repartidas en equipos que tienen, además, objetivos de producto. Cualquiera que haya trabajado en compliance sabe que esa diferencia no es semántica: es la diferencia entre una función de control y una tarea más en la lista de alguien.
¿Esto significa que Claude es más seguro que ChatGPT para mi empresa?
No, y sostener eso sería un salto que los documentos no habilitan. Nada de esto habla del riesgo de que tu equipo comercial use un chatbot para redactar una propuesta. Los riesgos que evalúa el reporte de Anthropic son de otra escala —desalineamiento en contextos críticos, uso indebido para armas, automatización de investigación— y no se traducen linealmente a tu operación.
Lo que sí cambia, y es lo que le sirve a tu empresa, es la evidencia disponible para hacer due diligence. Con Anthropic tenés un documento con fecha de cobertura, calificaciones que se mueven, incidentes propios y umbrales de política publicados. Con OpenAI, en esta ventana, tenés una versión periodística y una respuesta corporativa que la contradice. Un comité de riesgo puede trabajar con lo primero. Con lo segundo, solo puede opinar.
Los riesgos que sí te tocan a diario son otros y ya los tratamos acá: qué tiene que decir una política de uso de IA, el shadow AI y, si operás en un sector regulado, la gobernanza de agentes en bancos argentinos.
¿Cómo llevo esto a un framework de gobernanza? Cinco preguntas para el proveedor
Estas son las preguntas que uso cuando una empresa tiene que justificar por escrito la elección de proveedor de IA. Sirven para cualquiera, no solo para los dos de este artículo, y se responden con documentos o no se responden:
- ¿Publica un documento de riesgo con fecha de cobertura? Sin fecha de corte no hay forma de saber a qué se refiere el documento. Anthropic la declara: 15 de julio de 2026.
- ¿Alguna de sus calificaciones empeoró alguna vez? Un tablero donde todo mejora siempre no es un tablero, es una campaña.
- ¿Publica incidentes propios, con alcance y números? No “tuvimos un evento de seguridad”: cuántos usuarios, cuánto tiempo, qué control falló y qué se hizo.
- ¿Quién es el responsable único de la función de riesgo? Con nombre y con reporte jerárquico. Si la función está repartida, que quede claro por escrito quién firma.
- ¿Qué umbrales harían que el proveedor frene un lanzamiento? Y si esos umbrales cambiaron, ¿publicó el antes y el después? Anthropic publicó las dos versiones de sus umbrales de automatización de investigación y de armas biológicas y químicas.
Ninguna de las cinco depende de tener criterio técnico para evaluar un modelo. Todas dependen de que el proveedor haya escrito algo que puedas archivar. Eso es, en la práctica, lo que un auditor te va a pedir.
Conclusión: la transparencia es una función auditable, no un valor declarado
La semana del 14 de agosto de 2026 dejó dos señales que conviene archivar juntas. Una empresa publicó un documento donde se sube el riesgo, admite un agujero de once meses en sus propios controles y revela modelos que no piensa lanzar. La otra quedó en una discusión pública sobre si su equipo de riesgos catastróficos existe o se repartió. Ninguna de las dos cosas te dice qué modelo escribe mejor un correo. Las dos te dicen bastante sobre con quién vas a poder cumplir cuando tu auditor pregunte.
Si tenés que armar o defender el marco de gobernanza de IA de tu empresa —criterios de selección de proveedor, política de uso, controles por área— eso es exactamente lo que trabajo en consultoría de IA y, cuando el sector lo exige, en IA para banca y fintech. Si además querés que el equipo entienda por qué estas decisiones importan, lo bajamos a capacitaciones corporativas con casos reales. Si te suena, hablemos.
Última actualización: 18 de agosto de 2026 · Versión 1.0 · Fuentes: Anthropic — Risk Report: August 2026 (versión redactada, fecha de cobertura 15 de julio de 2026; las citas del reporte son traducción propia del original en inglés) y Engadget sobre el reporte original del Financial Times y la respuesta de OpenAI (agosto de 2026). Análisis y criterio de implementación: Diego Ceredi, consultor de IA certificado por Anthropic.
Preguntas frecuentes
Es el segundo reporte de riesgo de la empresa, publicado el 14 de agosto de 2026 con fecha de cobertura del 15 de julio de 2026. Su cambio principal es que eleva la evaluación de riesgo de desalineamiento en contextos críticos de "muy bajo" a "bajo". El propio documento aclara que sus argumentos probablemente todavía sostienen la designación de "muy bajo", pero que suben la calificación para reflejar mayor incertidumbre tras divulgaciones recientes de incidentes relacionados con el comportamiento de los modelos en evaluaciones de ciberseguridad. También revela modelos internos sin lanzar y documenta incidentes propios de la compañía.
Model 2 es un modelo interno sin publicar que, según el reporte de agosto de 2026, es algo más capaz que Claude Mythos 5. El documento lo describe como una mejora perceptible para muchas tareas de uso interno, aunque sin un salto de capacidad de la magnitud del que hubo entre Claude Opus 4.6 y Mythos Preview. Anthropic afirma que no tiene planes actuales de lanzarlo externamente y que no le corrió toda la batería habitual de evaluaciones previas al despliegue, por lo que tiene menor confianza en sus estimaciones de capacidad. A la fecha de cobertura había tres modelos internos con capacidades frontera o casi frontera sin publicar: Claude Opus 5, Model 1 y Model 2.
Hay dos versiones y conviene no mezclarlas. El Financial Times reportó que a fines de julio de 2026 OpenAI desarmó el equipo Preparedness, encargado de evaluar si sus modelos podían usarse para armas biológicas o ciberataques a gran escala, y repartió esas responsabilidades entre personal senior de equipos existentes. OpenAI lo niega textualmente: "No disolvimos el equipo Preparedness", y sostiene que hay líderes de investigación en ciberseguridad, capacidades biológicas y químicas y automejora de la IA reportando a su responsable de seguridad. Lo que no está en disputa es que hubo reorganización y que el rol de responsable de preparedness cambió de manos.
Anthropic documentó en su reporte que, desde mayo de 2025 hasta abril de 2026, todo el tráfico de sus sistemas de recolección de human feedback corrió sin los clasificadores biológicos de bloqueo. Alcanzó a un universo de unas 50.000 personas contratistas, verificadas solo por los proveedores, y a unos 133 millones de intercambios. El origen fue un flag pensado para uso interno que desactivaba tanto el bloqueo como el registro de las marcas del clasificador. La empresa afirma haberlo remediado por completo y no haber encontrado evidencia de uso indebido preocupante, pero concluye que el hallazgo aumenta la probabilidad de que existan otros problemas similares que todavía desconoce.
Los documentos de agosto de 2026 no habilitan esa conclusión. Los riesgos que evalúa el reporte de Anthropic son de otra escala (desalineamiento en contextos críticos, uso indebido para armas, automatización de investigación) y no se traducen linealmente al riesgo cotidiano de que un equipo comercial redacte una propuesta con un chatbot. Lo que sí cambia es la evidencia disponible para hacer due diligence: de un lado hay un documento público con fecha de cobertura, calificaciones que se mueven e incidentes propios; del otro, en esta ventana, hay una versión periodística y una respuesta corporativa que la contradice.
Cinco, y todas se responden con documentos o no se responden. Primera: ¿publica un documento de riesgo con fecha de cobertura declarada? Segunda: ¿alguna de sus calificaciones empeoró alguna vez, o todo mejora siempre? Tercera: ¿publica incidentes propios con alcance y números concretos, no un genérico "tuvimos un evento de seguridad"? Cuarta: ¿quién es el responsable único de la función de riesgo, con nombre y reporte jerárquico? Quinta: ¿qué umbrales harían que frene un lanzamiento, y publicó el antes y el después si esos umbrales cambiaron? Ninguna requiere criterio técnico para evaluar un modelo: requieren que el proveedor haya escrito algo archivable.
Porque muestra el mecanismo y no solo el resultado. Un tablero donde todas las métricas mejoran siempre no es un tablero de riesgo, es material de marketing. Cuando un proveedor eleva su propia evaluación sin que ningún regulador lo obligue, y además explica que lo hace por prudencia ante mayor incertidumbre, está exponiendo el criterio con el que decide. Ese criterio es lo único que un comité de riesgo externo puede auditar, porque nadie fuera de la empresa puede correr las evaluaciones internas por su cuenta.

Claude ya marca con agua invisible todo el texto que genera: qué implica si le facturás contenido a un cliente de la Unión Europea
9 min de lectura
Compliance API de Claude: auditar sesiones enteras de Cowork y Claude Code
9 min de lectura