
Anthropic revela fallo crítico: 133 millones de chats sin filtros de bioweapons
Anthropic ha publicado un informe de riesgos que revela un fallo significativo en sus plataformas de retroalimentación humana, exponiendo potencialmente a la empresa a riesgos de seguridad relacionados con la creación de armas biológicas.
El Fallo: 133 Millones de Chats sin Protección
Acceso sin filtros
Entre mayo de 2025 y abril de 2026, Anthropic desactivó accidentalmente sus filtros de seguridad diseñados para prevenir el uso de sus modelos en la creación de armas biológicas en sus plataformas de retroalimentación humana. Durante este período, aproximadamente 50,000 contratistas generaron alrededor de 133 millones de conversaciones, muchas de las cuales permitieron discusiones abiertas sin restricciones.
Vulnerabilidad en la cadena de suministro
La empresa admite que algunos de sus proveedores externos carecían de los procesos de selección necesarios para evitar la contratación de individuos con intenciones maliciosas, lo que podría haber facilitado el acceso a estas plataformas por parte de actores con intenciones de desarrollar armas biológicas.
Mecanismo de desactivación oculto
Un flag interno, diseñado para uso exclusivo de Anthropic, desactivó tanto los filtros de seguridad como el registro de las conversaciones, impidiendo la detección de la actividad maliciosa sin una revisión exhaustiva de las transcripciones originales.
Evaluación del Riesgo y Correcciones
Revisión interna
Anthropic realizó una revisión interna utilizando el modelo Claude Sonnet 5 para identificar conversaciones de alto riesgo. Se encontraron 1,197 transcripciones potencialmente problemáticas, la mayoría generadas por equipos internos y ejercicios de red teaming. La revisión manual de estas transcripciones no reveló casos de uso claramente preocupantes, aunque se identificaron algunas conversaciones de “doble uso”.
Corrección del informe anterior
Anthropic ha corregido su informe de riesgos anterior, que inicialmente no consideraba sus plataformas de retroalimentación humana como una superficie de riesgo. La empresa ahora evalúa el riesgo como “bajo”, en comparación con la evaluación anterior de “muy bajo”.
Otro Incidente: Acceso No Autorizado a la API
Explotación de una vulnerabilidad
Un segundo incidente reveló que contratistas de los proveedores de Anthropic explotaron una vulnerabilidad para obtener acceso no autorizado a una API, permitiéndoles utilizar modelos como Mythos Preview sin las restricciones adecuadas. Este acceso permaneció abierto durante varias semanas.
La Opinión de ExploxTV
Este fallo de Anthropic es un recordatorio contundente de los desafíos inherentes a la seguridad de la IA. La exposición de 133 millones de conversaciones sin filtros plantea serias preocupaciones sobre el potencial de uso indebido de la tecnología de IA, especialmente en áreas tan sensibles como el desarrollo de armas biológicas. La rápida respuesta de Anthropic para contener el incidente es encomiable, pero la empresa debe tomar medidas más proactivas para fortalecer sus defensas y garantizar la seguridad de sus modelos.
Para más información sobre seguridad de IA, visita nuestra sección de noticias.