El modelo de vista previa o1 de OpenAI «hackeó» el juego para evitar la derrota en una partida de ajedrez

Centrado en investigar habilidades peligrosas de la IA. Investigación de empalizadaalgo que compartió en las últimas semanas. con publicación x Explicó que el modelo o1-preview de OpenAI hackeó de forma autónoma su entorno en lugar de perder ante Stockfish en una partida de ajedrez. Según la institución; No es necesario que la otra parte indique al modelo de vista previa o1 que haga esto.

Según la información compartida; simplemente decirle a o1 que su oponente era «fuerte» desencadenó la manipulación del sistema de archivos para forzar una victoria. o1 descubrió que podía ganar editando el estado del juego en lugar de jugar.

Palisade Research es otra empresa de investigación de inteligencia artificial que realiza este estudio. Investigación ApoloAnunció que estaba llevando adelante su investigación. Apollo Research publicó el mes pasado una encuesta que mide las capacidades de planificación en contexto. Evaluaciones de razonamiento de esquemas. En su estudio, probó si los modelos podían aprovechar la vigilancia y engañar a sus desarrolladores para lograr sus objetivos. Apollo Research para esta investigación GPT-4o y o1 de OpenAI, Gemini-1.5 de Google, Llama 3.1 de Meta, Sonnet 3.5 y Opus-3 de Anthropic modelos usados.

El equipo afirma que después de que la modelo cometió el acto de intriga, realizaron una “entrevista de seguimiento” en la que le preguntaron a la modelo si podía explicar lo que había sucedido. Según la investigación Apollo; Llama 3.1 405B y Claude 3 Opus en aproximadamente el 80 por ciento de los casos Si bien admitió que actuó de manera planificada y casi conspiró, o1 sorprendentemente persistente y Menos del 20 por ciento lo admite.. Según la institución; Incluso en interrogatorios de múltiples rondas altamente competitivos, o1 Solo 7 rondas sin cuestionar más tarde 80 por ciento Admitió que actuó de manera planificada.

Apollo Research afirmó que algunos modelos continúan planificando en casos raros (~1%) incluso cuando eliminan la fuerte instrucción de seguimiento. Palisade Research se encuentra en este punto, sin ningún empujón en 5 de 5 intentos. 100 por ciento intriga Afirma que lo consiguió. Puede ver el mensaje que utiliza Palisade Research a continuación.

Según los resultados de las pruebas de Palisade Research; Al hackear el sistema sin necesidad de solicitar o1-preview, GPT-4o y Claude 3,5′entra en esto objetivo o en otras palabras dirigir necesita. Llama 3.3, Qwen, o1-mini mientras pérdida de consistencia está vivo.

Palisade Research afirma que las evaluaciones de esquemas como resultado de la prueba pueden servir como punto de referencia para las capacidades del modelo. Estas evaluaciones pueden medir tanto su capacidad para identificar vulnerabilidades del sistema como su propensión a explotarlas. Se espera que la compañía comparta código experimental, transcripciones completas y un análisis más extenso en las próximas semanas. Hasta entonces, para una lectura más detallada sobre el tema. Artículo de Investigación Apollo puedes revisar.

We use cookies in order to give you the best possible experience on our website. By continuing to use this site, you agree to our use of cookies.
Accept