Ir al contenido
por InfinyAI EN

IA en un minutoNoticiasSeguridad

Seguridad

Tres de cada cinco modelos de IA suspenden una prueba de seguridad sobre terrorismo, según Tech Against Terrorism

Redacción de IA en un minuto · Editor: Jon Elgezabal

En 30 segundos

Tech Against Terrorism puso a prueba más de 130 modelos de IA con peticiones propias de quien prepara un atentado, y tres de cada cinco no la superaron, cuenta CBS News. Los que habían pasado por la abliteration, la técnica que les borra las salvaguardas, fallaron en todos los casos, y Llama 3.1 8B cayó de 97 puntos hasta rondar los 3. El informe no halló indicios de uso por parte de terroristas, con la excepción de un chatbot extremista.

Tres de cada cinco modelos de IA han suspendido una prueba de seguridad sobre terrorismo, según un informe que CBS News dio a conocer el viernes 9 de octubre.

El informe es de Tech Against Terrorism, una organización sin ánimo de lucro con sede en el Reino Unido que trabaja contra la actividad terrorista en internet, y lo compartió con la cadena. Evaluó más de 130 modelos con cientos de peticiones como las que haría alguien que planea un atentado. Para la organización, suspender es dar una respuesta completa y concreta sobre un asunto que pueda causar muchas víctimas, o quedar por debajo de 90 puntos sobre 100 en sus pruebas, que miden con qué constancia rechaza un modelo una petición, ponderada por la gravedad del asunto.

Los modelos de pesos abiertos, cuyos parámetros son públicos y cualquiera puede modificar, puntuaron de forma parecida a los cerrados. Pero los sometidos a "abliteration", un proceso que les quita por completo las salvaguardas y al que los abiertos son vulnerables, suspendieron siempre. Lo son porque los patrones con los que un modelo aprende a reconocer las peticiones dañinas están en sus pesos, y ahí se pueden localizar y anular. Llama 3.1 8B, de Meta, pasó de 97 puntos sobre 100 a cerca de 3 en su versión modificada.

Meta respondió a CBS News que Llama 3.1, presentado en 2024, pasa evaluaciones de seguridad y análisis de riesgos, y que su política de uso prohíbe los usos que puedan ser dañinos o ilegales.

Según Tech Against Terrorism, este proceso se puede hacer gratis con herramientas disponibles en internet y, en los modelos pequeños, en cuestión de minutos. Las versiones modificadas de los modelos abiertos más populares aparecen menos de tres días después de su publicación. A finales de septiembre, Hugging Face, que la organización describe como el mayor repositorio público de modelos, alojaba más de 29.000 repositorios que anunciaban modelos sin censura o sin salvaguardas.

Yacine Jernite, responsable de aprendizaje automático y sociedad de Hugging Face, dijo a CBS News que la plataforma modera de forma continua y actúa contra lo que incumple su política de contenidos. Para Jernite, el informe aporta herramientas útiles, pero algunas de sus recomendaciones son incompatibles con la investigación abierta, y un modelo sin salvaguardas no equivale a un modelo dañino.

El informe aclara que su prueba mide si un modelo entrega lo que se le pide, no si una persona podría llevarlo a la práctica. También que, salvo un chatbot extremista identificado por la organización, no encontró pruebas de que terroristas o grupos extremistas usen estos modelos.

Tech Against Terrorism, que recibe respaldo de varios gobiernos y el apoyo de la dirección contra el terrorismo de la ONU, propone que gobiernos y desarrolladores financien pruebas independientes, que los modelos sean más difíciles de modificar de este modo antes de publicarse y que los repositorios públicos prohíban los que no llevan salvaguardas. Dice que no pide frenar el desarrollo de la IA ni acabar con la publicación de modelos de pesos abiertos. La organización envió sus resultados a las empresas citadas el 8 de octubre.

Por qué importa · análisis y opinión

El dato incómodo no está en la nota media, sino en lo poco que cuesta dejar un modelo sin frenos: las salvaguardas de un modelo abierto viven en sus pesos y quien tenga las herramientas puede anularlas. Eso mueve la discusión: ya no basta con preguntar cómo de bien se niega un modelo el día que sale, sino qué pasa con sus copias modificadas, que llegan a los repositorios públicos casi de inmediato. El estudio tiene límites que su propio texto reconoce: mide si el modelo entrega lo que se le pide, no si alguien podría llevarlo a la práctica, y Hugging Face recuerda que un modelo sin negativas también tiene usos legítimos. Quien despliegue modelos abiertos en su empresa hará bien en saber de dónde viene cada versión que descarga y en no dejar toda la seguridad en manos del modelo.

Fuente: CBS News · Redactada con ayuda de IA: cómo hacemos las noticias

¿Tu web está a la altura? Te la medimos gratis

La IA en tu correo, cada día o cada viernes

Las noticias que importan, cada una en un minuto. Con su fuente de cada una.

Elige uno o los dos:

Te apuntas y listo: el diario te llega cada noche y el semanal, los viernes por la mañana. Puedes darte de baja en cualquier envío.