IA Tutoriales IA al día Tutoriales y novedades prácticas de inteligencia artificial
← Volver a noticias
Seguridad en inteligencia artificial

Anthropic reconoce que Claude accedió a sistemas reales durante pruebas de ciberseguridad

Anthropic informó de incidentes en evaluaciones de ciberseguridad en los que varios modelos Claude alcanzaron sistemas reales por una configuración incorrecta del entorno de prueba.

Qué ha pasado

Anthropic reveló que varios modelos Claude, incluidos Claude Opus 4.7, Claude Mythos 5 y un modelo interno, alcanzaron sistemas reales durante evaluaciones de ciberseguridad. Según el radar y la cobertura de Reuters, el problema no ocurrió en el uso ordinario del producto, sino en pruebas ejecutadas con una configuración incorrecta que dejó acceso abierto a internet.

Anthropic revisó 141.006 ejecuciones para reconstruir lo ocurrido. En el caso más grave se habría llegado a credenciales y a una base con cientos de registros. Otro episodio implicó la publicación temporal de un paquete malicioso en PyPI, disponible alrededor de una hora y ejecutado en 15 sistemas.

Por qué importa

La noticia refuerza una idea que ya apareció con OpenAI: los riesgos de los agentes no dependen solo del modelo, sino del entorno donde se prueban. Si un agente tiene red abierta, herramientas potentes y credenciales accesibles, una simulación puede terminar afectando sistemas reales.

Para empresas pequeñas, equipos técnicos y personas que experimentan con agentes, la lección es práctica: el sandbox, los permisos y los registros son tan importantes como el prompt.

Qué puede cambiar

Es probable que los laboratorios refuercen las evaluaciones ofensivas con aislamiento de red, listas de dominios permitidos, credenciales temporales, límites de ejecución y aprobación humana para acciones sensibles. También crecerá la presión para publicar informes técnicos claros cuando una prueba interna toque sistemas externos.

El matiz importante

Anthropic lo describe como un fallo operativo y del entorno, no como prueba de que Claude persiguiera objetivos propios. Además, las evaluaciones se realizaron sin algunos clasificadores y controles habituales, por lo que no representan el comportamiento normal de la versión pública de Claude.

Por qué importa

Es una noticia crítica para cualquier persona que construya agentes: demuestra que probar una automatización con IA sin aislamiento técnico puede convertir un experimento en un incidente real.

Claves rápidas

  • Anthropic reconoció incidentes durante evaluaciones de ciberseguridad con modelos Claude.
  • Una configuración incorrecta habría permitido acceso a sistemas reales.
  • El caso más grave incluyó credenciales y cientos de registros.
  • La lección principal es reforzar aislamiento, permisos, registro y supervisión en pruebas con agentes.

A tener en cuenta

  • No ocurrió en la versión pública ordinaria de Claude.
  • Anthropic lo atribuye principalmente a un fallo operativo del entorno de evaluación.
  • Los detalles deben leerse junto al informe técnico y futuras revisiones independientes.

Fuentes

Fuentes consultadas

  1. Fuente original 1