InicioCentro de noticias de LBank
OpenAI Utiliza un Equipo Rojo de IA para Fortalecer GPT-5.6 contra Ataques de Inyección de Prompts
openai-ai-red-team-strengthen-gpt-5-6-prompt-injection-attacks
OpenAI Utiliza un Equipo Rojo de IA para Fortalecer GPT-5.6 contra Ataques de Inyección de Prompts
OpenAI afirmó que su nuevo modelo automatizado de red teaming, GPT-Red, descubrió vulnerabilidades que se utilizaron para hacer que GPT-5.6 fuera más resistente a los ataques de inyección de prompts.
2026-07-15 Fuente:decrypt.co

En breve

  • OpenAI presentó GPT-Red, un sistema de IA automatizado diseñado para encontrar vulnerabilidades en los modelos GPT antes de su lanzamiento.
  • La compañía afirmó que GPT-Red se utilizó para entrenar GPT-5.6, reduciendo los fallos en uno de sus puntos de referencia más difíciles de inyección de prompts.
  • El sistema está destinado a complementar a los equipos rojos humanos, las pruebas de terceros y otras medidas de seguridad de la IA.

OpenAI ha presentado GPT-Red, un sistema de IA automatizado diseñado para encontrar vulnerabilidades de seguridad en sus modelos de lenguaje.

GPT-Red toma su nombre del "red teaming" de ciberseguridad, que es la práctica de intentar deliberadamente romper un sistema para identificar debilidades antes de que los atacantes puedan explotarlas.

En una publicación el miércoles, OpenAI dijo que la herramienta ayudó a que GPT-5.6 fuera más resistente a los ataques de inyección de prompts antes de su implementación.

"A medida que las capacidades de los modelos crecen, la seguridad y la alineación deben escalar con ellas", escribió OpenAI en X. "El red-teaming es esencial, pero los enfoques actuales son difíciles de escalar, creando un cuello de botella crítico. GPT‑Red es una forma en que lo estamos abordando".

Según OpenAI, GPT-Red fue entrenado mediante aprendizaje por refuerzo auto-supervisado, generando ataques de inyección de prompts progresivamente más fuertes mientras los modelos defensores aprendían a resistirlos. La compañía dijo que esos ataques se incorporaron al proceso de entrenamiento de GPT-5.6, informando que GPT-Red tuvo éxito en el 84% de los escenarios de evaluación interna, en comparación con el 13% para los miembros del equipo rojo humanos en las mismas pruebas.

"GPT‑Red aprende a través del auto-juego adversarial, donde su objetivo es inyectar prompts en una variedad de modelos defensores desafiantes", escribió OpenAI. "Cada ataque exitoso que encuentra GPT-Red se utiliza para mejorar a estos defensores, empujando a GPT‑Red a encontrar continuamente fallos más amplios y complejos."

En un caso de estudio, OpenAI dijo que el sistema manipuló a un agente de máquina expendedora autónoma para que bajara los precios, pidiera inventario con descuento y cancelara el pedido de otro cliente antes de que se revelaran y abordaran las vulnerabilidades.

GPT-Red surge tras años de esfuerzos de ciberseguridad por parte de OpenAI después del lanzamiento público de ChatGPT.

En 2023, la compañía lanzó su Red Teaming Network de OpenAI, reclutando a investigadores de ciberseguridad externos y expertos en la materia para sondear ChatGPT y otros modelos en busca de fallas de seguridad antes de su lanzamiento. GPT-Red amplía ese esfuerzo al automatizar gran parte del proceso, utilizando un modelo de IA para generar ataques de inyección de prompts y otras pruebas adversas a una escala que sería difícil solo para investigadores humanos.

El anuncio de OpenAI refleja un cambio más amplio hacia el uso de la IA para asegurar la IA.

A principios de este mes, la Fundación Ethereum dijo que había implementado agentes de IA para realizar red-teaming en infraestructuras de red críticas, descubriendo una vulnerabilidad en el software utilizado por los clientes de consenso de Ethereum. Los investigadores señalaron que los agentes de IA pueden buscar en bases de código más grandes que los humanos, pero el desafío ha pasado de encontrar posibles errores a probar cuáles son explotables.

Según OpenAI, GPT-Red seguirá siendo una herramienta interna porque contiene capacidades ofensivas desarrolladas intencionadamente.

"Creemos que con GPT-Red hemos empezado a desbloquear un círculo virtuoso similar para la seguridad, donde los modelos de hoy pueden usarse para hacer que los modelos de mañana sean más robustos, alineados y confiables", dijeron.