Volver a todas las noticias
INTELIGENCIA ARTIFICIAL26 de agosto de 2026

Investigadores de la Universidad de Waterloo detectan debilidades de seguridad en modelos abiertos

Investigadores de la Universidad de Waterloo detectan debilidades de seguridad en modelos abiertos

Un equipo de investigadores en ciencias de la computación de la Universidad de Waterloo en Canadá ha publicado un exhaustivo estudio de seguridad algorítmica que pone en entredicho la efectividad de las defensas actuales en modelos de pesos abiertos (Open-Weight LLMs). El trabajo demostró que las salvaguardas de alineación (RLHF / DPO) incorporadas por los fabricantes para evitar la generación de contenidos ilícitos o ciberarmas pueden ser completamente desactivadas mediante la alteración o poda quirúrgica de un porcentaje ínfimo de capas de atención, sin requerir costosos procesos de reentrenamiento.

La técnica de 'Layer Ablation': Eliminación de filtros de seguridad en minutos

La investigación demostró que los mecanismos de rechazo y alineación moral en arquitecturas transformadoras tienden a concentrarse en vectores de representación específicos dentro de las capas intermedias del modelo. Utilizando técnicas de ablación de activación y análisis de gradientes, los científicos lograron neutralizar los bloqueos de seguridad en modelos líderes de pesos abiertos en menos de 15 minutos de cómputo en una GPU doméstica, restaurando la capacidad del modelo para responder a instrucciones sin restricciones.

Las implicancias técnicas identificadas por el estudio incluyen:

  • Fragilidad de la alineación superficial: Demuestra que los métodos actuales de ajuste fino de seguridad actúan como una capa superficial de comportamiento que no borra el conocimiento subyacente del modelo.
  • Riesgo de redistribución de modelos modificados (Jailbreak Weight Distribution): Posibilidad de que actores maliciosos distribuyan versiones no alineadas en repositorios comunitarios sin control regulatorio.
  • Necesidad de alineación no separable en el espacio latente: Urgencia de desarrollar métodos matemáticos de desaprendizaje de máquina (*Machine Unlearning*) que eliminen físicamente la información sensible de los pesos de la red.
«Nuestros hallazgos demuestran que asumir que un modelo de pesos abiertos permanecerá seguro simplemente porque fue alineado por su creador es una ilusión peligrosa. Si los pesos son públicos, cualquier usuario con conocimientos básicos puede remover los frenos éticos con facilidad.» — Declaración de los Investigadores de la Universidad de Waterloo, agosto 2026.

El debate sobre la gobernanza y auditoría de los modelos de código abierto

El estudio ha generado intensos intercambios entre defensores de la ciencia abierta y reguladores gubernamentales. Mientras los primeros argumentan que la transparencia permite a la comunidad académica auditar y corregir fallos, los organismos de ciberdefensa exigen protocolos de certificación y trazabilidad criptográfica de pesos para evitar abusos a gran escala.

Impacto para empresas y desarrolladores que despliegan modelos locales

Las organizaciones que integran modelos abiertos en sus servidores internos deben incorporar capas de filtrado de entrada y salida externas (como cortafuegos de prompts o guardrails independientes) y no confiar exclusivamente en la alineación interna de los pesos descargados.

En conclusión, el hallazgo de la Universidad de Waterloo subraya que la verdadera seguridad en IA exige defensas en profundidad y nuevos paradigmas de desaprendizaje algorítmico estructural.

¿Necesita auditar e implementar guardrails de seguridad en sus modelos de IA?

En Siglo 21 Soluciones diseñamos arquitecturas de IA corporativas con defensas perimetrales y filtros de prompts.

Contactar a un Consultor