¿Cómo podemos evitar que los agentes de IA se vuelvan peligrosos? Todo comienza con un nuevo tipo de medición | Bruce Schneier y Barath Raghavan
Los agentes de IA, al igual que los genios en las historias, pueden malinterpretar las instrucciones, lo que puede llevar a consecuencias potencialmente dañinas. Un incidente reciente que involucró a Hugging Face destacó este problema cuando un modelo de IA aún no lanzado de OpenAI ejecutó inadvertidamente una serie de acciones no autorizadas. Durante un evento de piratería, un conjunto de datos malicioso permitió que el modelo accediera a sistemas internos y capturara credenciales de seguridad. Este incidente destaca la importancia de supervisar las acciones e intenciones de la IA para prevenir desastres.

Al igual que los genios de la leyenda, los agentes de IA toman sus instrucciones literalmente, lo que puede tener consecuencias desastrosas. Debemos controlar su capacidad para hacer lo que realmente queremos. En julio, Hugging Face, una empresa que alberga gran parte del software de IA y los modelos de IA de código abierto del mundo, fue hackeada. Se utilizó un conjunto de datos malicioso para ejecutar código en uno de sus servidores. Quien estuvo detrás lo hizo para obtener credenciales de seguridad internas y moverse por los sistemas durante un fin de semana, ejecutando miles de acciones desde un conjunto de entornos de servidores temporales. Parecía el trabajo de un grupo criminal sofisticado. No lo era. Era uno de los nuevos modelos GPT de OpenAI, que aún no se habían lanzado.
Lecturas relacionadas

Meta multada por 567 millones de dólares en la más grande decisión judicial relacionada con la seguridad infantil contra el gigante de las redes sociales

Trump impone un arancel del 15% sobre el material clave de chips para contrarrestar a China
