En vivo

Amamos Argentina

Chema Forte

Argentina

En vivo

Informados al regreso

Luis F. Echegaray

Argentina Buenos Aires

En vivo

Amamos Argentina

Chema Forte

Rosario

En vivo

La Central Deportiva

Nicolás Mai

Santa Fe

En vivo

Heatódromo

Mauri Palacios

En vivo

Vuelta popular

Celeste Pereyra

En vivo

Música ligera

Radio

Podcast

Amamos Argentina

Podcast

La mesa de café

Podcast

La otra mirada

Podcast

El dato confiable

Podcast

3x1=4

Podcast

La quinta pata del gato

Podcast

Cuadro de Situación

Podcast

80 años del Cuarteto

Podcast

Nazareno Cruz y el Lobo

Podcast

La Chacarera, el latido del monte

Escuchá lo último

Elegí tu emisora

Sueños de Radio
Sueños de Radio

Tecnología

Modelos de IA de peso abierto alcanzan capacidades de frontera, pero persiste la brecha de seguridad

Un informe de SaferAI revela que el modelo GLM-5.2 de Z.ai se aproxima a las capacidades de IA de frontera, pero carece de mitigaciones de seguridad esenciales. Este hallazgo plantea inquietudes sobre la regulación de modelos de IA potentes.

04/08/2026 | 18:04Redacción Cadena 3

Añadir Cadena 3 a

Agregá Cadena 3 a tus preferidos en Google
Modelo de IA Z.ai

FOTO: Modelo de IA Z.ai

Google News

Mirá las notas de Cadena 3 en Google News

WhatsApp

Mirá las notas de Cadena 3 en WhatsApp

Un reciente informe de SaferAI destacó que el modelo de IA de peso abierto GLM-5.2, desarrollado por Z.ai, ha logrado acercarse a las capacidades de modelos líderes como GPT-5.5 de OpenAI y Claude Opus 4.7 de Anthropic en cuanto a habilidades cibernéticas y biológicas. Sin embargo, el informe también advirtió que la brecha entre las capacidades de frontera y las prácticas de seguridad se está ampliando.

Según la evaluación realizada por SaferAI a través de la API pública de Z.ai, el GLM-5.2 no se negó a realizar ninguna de las tareas cibernéticas ofensivas o biológicas que se le asignaron. En comparación, Claude Opus 4.7 se negó de manera tan consistente que SaferAI no pudo completar el benchmark de CyberGym en él. Este benchmark evalúa las capacidades de ciberseguridad y fue utilizado por OpenAI en una evaluación que precedió a la brecha de Hugging Face del mes pasado.

Este hallazgo representa una clara advertencia sobre los riesgos que conllevan los modelos de IA de peso abierto, que podrían poner herramientas altamente capaces en manos de atacantes potenciales, sin un control efectivo sobre su uso una vez que descargan los pesos del modelo. A medida que los modelos de peso abierto se acercan rápidamente a las capacidades de los sistemas de IA más avanzados, el debate se traslada de si pueden competir a cómo la sociedad gestiona los riesgos una vez que se liberan.

"La frontera de capacidad no es la frontera de riesgo, por lo que debemos tener en cuenta el estado de las mitigaciones para evaluar adecuadamente el riesgo", declaró Henry Papadatos, director ejecutivo de SaferAI, a TechCrunch.

Si bien Z.ai podría aplicar medidas de seguridad a su API alojada, esas protecciones se vuelven inaplicables una vez que alguien ejecuta los pesos en su propio hardware, donde pueden eliminar o modificar cualquier salvaguarda, ajustar los modelos o cambiar los prompts del sistema.

Los desarrolladores de frontera como OpenAI y Anthropic suelen confiar en salvaguardas como clasificadores, entrenamiento de rechazo y controles a nivel de API para limitar la asistencia cibernética y biológica peligrosa. Sin embargo, estas medidas son insuficientes, ya que los jailbreaks a menudo eluden las protecciones en los modelos implementados. Far.ai, una organización sin fines de lucro dedicada a la seguridad de la IA, encontró cientos de jailbreaks universales que tienen éxito en la mayoría de las solicitudes dañinas en modelos de frontera como xAI y Google DeepMind.

A pesar de que las medidas de seguridad implementadas en los modelos cerrados no funcionan en absoluto en los modelos de peso abierto, que están diseñados para ejecutarse en cualquier infraestructura con cualquier conjunto de salvaguardas, o la ausencia de ellas, algunos críticos advierten sobre el riesgo de que estas capacidades sean fácilmente accesibles.

El objetivo debería ser que las buenas capacidades —las seguras— sean accesibles para todos, mientras se intenta eliminar las malas, incluso de manera de código abierto, afirmó Papadatos.

Una técnica que podría ayudar es el "filtrado de datos de preentrenamiento", que consiste en eliminar información ofensiva de ciberseguridad de los datos de entrenamiento antes de entrenar el modelo. Sin embargo, para la ciberseguridad, el filtrado de datos es mucho menos práctico. Es complicado entrenar un modelo general que sobresalga en codificación pero que no sea también un buen hacker.

Los desarrolladores de frontera han comenzado a depender de otras mitigaciones. Una estrategia ha sido restringir selectivamente los tipos de asistencia cibernética que los modelos proporcionarán. Por ejemplo, Opus 5 de Anthropic puede buscar vulnerabilidades en el código fuente no compilado, pero no en software compilado. Esta estrategia busca dificultar su uso con fines ofensivos.

En el caso del GLM-5.2, SaferAI indicó que Z.ai no publicó un marco de seguridad, compromisos de pruebas previas al despliegue ni evaluaciones de riesgo para el modelo. TechCrunch ha consultado a Z.ai sobre si realizó evaluaciones de seguridad de frontera internas o de terceros antes de su lanzamiento, pero no recibió respuesta.

Los líderes chinos han comenzado a reconocer los riesgos de la IA avanzada. En la Conferencia Mundial de IA del mes pasado, el presidente Xi Jinping enfatizó la importancia de los modelos de peso abierto, al tiempo que destacó la necesidad de garantizar que la IA siga siendo una herramienta bajo un estricto control humano.

Graham Webster, quien estudia la política de IA china en el Stanford Cyber Policy Center, comentó que China cuenta con regulaciones robustas que rigen la IA, pero que esas reglas históricamente se han centrado en contenido políticamente sensible, desinformación y estabilidad social, en lugar de riesgos catastróficos de IA como capacidades cibernéticas ofensivas y mal uso biológico.

Los pensadores de IA en EE.UU. tienden a estar más preocupados por esta idea catastrófica existencial que la comunidad china, agregó Webster, señalando que muchos investigadores de políticas chinas creen que, si realmente va a haber un nuevo riesgo de frontera, es probable que las empresas estadounidenses lo encuentren primero.

El sistema chino tiene confianza en que controla el uso de estas tecnologías dentro de China, continuó Webster. Estar en línea en China es algo que se hace atribuido a tu nombre real, y las empresas pueden ser responsables, los usuarios pueden ser responsables.

Webster sugirió que el mismo mecanismo que los proveedores de modelos utilizan para negarse a involucrarse en ciertos temas políticos puede ajustarse para garantizar que los modelos se nieguen a completar ataques cibernéticos ofensivos o que no produzcan resultados adversos en ingeniería biológica. Sin embargo, también resaltó que, debido a que las empresas chinas tienden a coordinarse con los reguladores detrás de escena, puede ser difícil saber qué pruebas internas están realizando antes de su lanzamiento.

Los defensores de la IA de peso abierto argumentan que liberar los pesos es importante para la ciberseguridad, ya que permite a las empresas defenderse contra ataques. Hugging Face se basó en el GLM-5.2 para defenderse de la brecha de OpenAI y porque les permite prepararse mejor para amenazas futuras si saben qué esperar.

El mismo sistema que ayudó a detener un ataque cibernético impulsado por IA puede ahora ayudar a defenderse contra millones de ataques cibernéticos todos los días, al tiempo que nos ayuda a identificar y corregir vulnerabilidades antes de que los atacantes las exploten, afirmó Clem Delangue, CEO de Hugging Face, en una publicación reciente en redes sociales.

Papadatos opinó que este beneficio a menudo se exagera y no significa que deberíamos hacer accesibles capacidades peligrosas. "El punto principal en mi mente es que no deberíamos aceptar que las capacidades peligrosas sean fácilmente accesibles para cualquiera en cualquier lugar", dijo, enfatizando que cree que la industria debería esforzarse por hacer que solo las "buenas capacidades" sean fácilmente accesibles. Por defecto, los atacantes adoptan nuevas herramientas más rápido que los defensores. Por ejemplo, un grupo de ransomware puede cambiar sus métodos en una semana. Un hospital no puede.

Lo más visto

Tecnología

Opinión

Podcast

La otra mirada

Podcast

La mesa de café

Podcast

La quinta pata del gato

Podcast

3x1=4

Podcast

El dato confiable

Podcast

Política esquina Economía

Podcast

Cuadro de Situación

Podcast

Los editoriales de Alberto Lotuf