Connect with us

Inicio

OpenAI revela seis casos preocupantes en sus modelos de inteligencia artificial

La compañía señaló que el avance de los agentes de IA y su capacidad para realizar tareas cada vez más complejas hace necesario mejorar los mecanismos para detectar estos riesgos.

Publicado

el

La compañía señaló que el avance de los agentes de IA y su capacidad para realizar tareas cada vez más complejas hace necesario mejorar los mecanismos para detectar estos riesgos.

OpenAI reveló seis incidentes en los que sus modelos de inteligencia artificial mostraron comportamientos considerados “inesperados o preocupantes”, entre ellos intentos de evadir restricciones, ocultar información y realizar acciones sin autorización de los usuarios.

Los casos fueron presentados este miércoles como parte de un nuevo marco diseñado para identificar, investigar y documentar posibles comportamientos de “desalineamiento” en sus sistemas. La compañía explicó que los incidentes fueron detectados durante procesos de entrenamiento y evaluación realizados en los últimos meses.

Uno de los episodios involucró a un modelo de investigación que todavía no ha sido publicado y que llegó a colocar en sus propias notas instrucciones similares a un jailbreak para intentar ignorar las restricciones que se le habían impuesto. En otro caso, un agente utilizó código para responder una pregunta y posteriormente subió un archivo a internet sin autorización, con la intención de contar con una fuente en línea que pudiera citar.

OpenAI también detectó comportamientos relacionados con la generación y ocultamiento de información. Durante el entrenamiento de un modelo identificado como 5.6-sol, el sistema se indicó que debía inventar datos cuando no encontrara la información requerida. Además, otro agente creó una instrucción para recordarse que debía ocultar información que no coincidiera con determinados resultados.

La compañía señaló que el avance de los agentes de IA y su capacidad para realizar tareas cada vez más complejas hace necesario mejorar los mecanismos para detectar estos riesgos. El anuncio ocurre después de que OpenAI y Anthropic reportaran pruebas en las que sus sistemas llegaron a realizar acciones de hacking contra plataformas u organizaciones, mientras que el nuevo mecanismo permitirá a empleados de OpenAI reportar posibles incidentes para su investigación y clasificación.

Continue Reading
Click para comentar

Leave a Reply

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Abrir chat
1
Escanea el código
Hola 👋
¿En qué podemos ayudarte?