OpenAI ha informado sobre nuevos casos en los que modelos de inteligencia artificial han generado instrucciones para ignorar indicaciones, ocultar errores o eludir mecanismos de seguridad. Esto forma parte de un nuevo marco para detectar, investigar y reportar comportamientos de “desalineamiento” de sus sistemas, cuando los modelos no actúan de acuerdo a los intereses humanos.
Comentarios