Ir al contenido
por InfinyAI EN

IA en un minutoNoticiasSeguridad

Seguridad

Goodfire presenta monitores que leen el interior de la IA para frenar a tiempo a agentes peligrosos

Redacción de IA en un minuto · Editor: Jon Elgezabal

En 30 segundos

Goodfire ha creado un vigilante que observa por dentro a Kimi K3 y a GLM 5.3 mientras trabajan y solo avisa a un segundo modelo cuando detecta algo sospechoso. Según Goodfire, puede cortar una acción peligrosa antes de que el agente la ejecute y sale unas 50 veces más barato que revisarlo todo. FAR.AI lo puso a prueba desde fuera y ningún ataque universal consiguió saltárselo.

Goodfire, una empresa de interpretabilidad (la disciplina que estudia qué pasa dentro de los modelos de IA), publicó el jueves 8 de octubre cómo ha construido y puesto en marcha en un sistema de producción monitores de ciberseguridad para Kimi K3 y GLM 5.3, dos modelos de pesos abiertos.

El problema que quieren resolver es que en ciberseguridad revisar un código en busca de fallos y aprovecharlos para atacar se parecen mucho, y la intención solo se ve siguiendo toda la sesión del agente, que puede llegar a millones de tokens. Poner a otro modelo a leer cada paso es demasiado lento y caro para hacerlo en tiempo real, así que en la práctica la vigilancia llega tarde, cuando el agente ya ha actuado. Según los precios de OpenRouter que cita la empresa, vigilar un millón de turnos de Kimi K3 con Opus 5 costaría del orden de 200.000 dólares, y con el propio Kimi K3, unos 30.000.

Su sistema combina dos piezas. Una sonda (un pequeño clasificador que lee las activaciones internas del modelo mientras trabaja) hace de primer filtro siempre encendido y solo pasa lo sospechoso a un modelo juez, que puede rechazar la petición o dejar que siga.

Según Goodfire, detecta aproximadamente el 93 % de las sesiones dañinas con un 5,5 % de sesiones legítimas interrumpidas (falsas alarmas), supera al juez revisándolo todo en cualquier nivel de interrupciones probado y cuesta unas 50 veces menos: menos de 200 dólares por millón de intercambios. Tampoco resta velocidad al modelo: el rendimiento se mantiene dentro del margen de ruido de sus pruebas y el retraso añadido por turno es de 2 milisegundos sin razonamiento del juez y de 42 con él. Así, una acción de riesgo se puede bloquear antes de que el agente use una herramienta.

La empresa evaluó los monitores con 2.400 sesiones de chat y de agentes, con más de 60.000 turnos, y usó como referencia las etiquetas de Claude Opus 5. Con el monitor, Kimi K3 pasa de bloquear aproximadamente el 29 % de las sesiones dañinas al 96 %, mientras que las legítimas interrumpidas suben de aproximadamente el 5 % al 9 %; en GLM 5.3, del 36 % al 91 % y del 10 % al 15 %, también aproximadamente. El método, entrenado con datos de Kimi K3, también funcionó en GLM 5.3: según Goodfire, el monitor resultante es aproximadamente igual de capaz con conversaciones de Kimi y solo algo peor con datos del propio GLM.

FAR.AI, un evaluador independiente, lo probó durante dos días con 140 técnicas de jailbreak (trucos para saltarse las protecciones), elegidas de un conjunto inicial de 1.500, en conversaciones de chat y sin adaptarlas al monitor. Sin el monitor, los ataques universales, los que sirven para muchas conversaciones, tenían éxito entre el 12 % y el 53 % de las veces, según el nivel de razonamiento; con él, ninguno. Los ataques sobre conversaciones concretas bajaron de al menos entre el 9 % y el 40 % a entre el 0,1 % y el 1,6 %. Goodfire dice que seguirá trabajando con FAR.AI en nuevas pruebas.

Son resultados de la propia Goodfire y la prueba de FAR.AI es preliminar. La empresa no publica precio: ofrece estos monitores a quien sirva o use modelos abiertos, previo contacto.

Por qué importa · análisis y opinión

Hasta ahora, quien ponía un agente con modelos abiertos a tocar código o sistemas tenía dos opciones malas: revisar a posteriori o pagar un segundo modelo que leyera cada paso. Este trabajo apunta a una tercera vía, frenar el problema en el momento, y eso cambia qué tareas se le pueden encargar a un agente con cierta tranquilidad. Falta lo de siempre en seguridad: que alguien ajeno lo pruebe con ataques que se adapten al monitor y ver cómo responde en otros modelos y en usos que no sean de ciberseguridad. Quien ya sirva modelos abiertos dentro de la empresa puede ir preguntando a su proveedor qué vigila y cuándo, porque la diferencia entre detectar antes o después de actuar es la que decide el daño.

Fuente oficial: Goodfire · Redactada con ayuda de IA: cómo hacemos las noticias

¿Tu web está a la altura? Te la medimos gratis

La IA en tu correo, cada día o cada viernes

Las noticias que importan, cada una en un minuto. Con su fuente de cada una.

Elige uno o los dos:

Te apuntas y listo: el diario te llega cada noche y el semanal, los viernes por la mañana. Puedes darte de baja en cualquier envío.