Qué cambió
El periodista de Wired, Will Knight, utilizó durante varios días un agente de IA totalmente desalineado en su propia red doméstica. El agente identificó vulnerabilidades en dispositivos del hogar, logró vulnerar un PC y detectó fallos en proyectos programados por intuición, además de ofrecer recomendaciones para mejorar la seguridad.
Knight accedió al modelo a través de Abliteration AI, cuya oferta más potente se describe como una versión de GLM 5.3, el modelo de programación agéntica de Z.ai. La empresa elimina de modelos de pesos abiertos patrones relacionados con la negativa a responder mediante un proceso llamado abliteration, y ofrece acceso totalmente desalineado por un precio tan bajo como el de una pizza. Su CEO, Devon, sostiene que un acceso amplio puede ayudar a los defensores a examinar sus propios sistemas y simular a hackers, estafadores y agentes descontrolados.
El experimento no identificó los dispositivos afectados, las vulnerabilidades concretas ni el método utilizado para vulnerar el PC. Wired también comparó el servicio con Mythos de Anthropic y Astra de OpenAI, que, según afirma, tienen capacidades similares en ciberseguridad, pero están limitados a clientes de confianza; ambas empresas también ofrecen modelos más accesibles con protecciones de nivel medio para la evaluación autorizada de código y sistemas.
Por qué importa
El experimento muestra cómo modelos agénticos accesibles para consumidores y sin protecciones pueden combinar la detección de vulnerabilidades, su explotación y recomendaciones para corregirlas en un entorno doméstico. Esto reduce el esfuerzo necesario para que un propietario autorizado inspeccione dispositivos y software conectados, pero también podría reducirlo para sondeos no autorizados.
Para los desarrolladores que lanzan aplicaciones programadas por intuición, las pruebas asistidas por IA podrían convertir la revisión de seguridad en una tarea más habitual antes del despliegue. Esta misma capacidad eleva el coste de descuidar la autenticación, los permisos, los servicios expuestos y el software sin parches, porque las debilidades pueden ser más fáciles de localizar.
Evaluación del impacto
Los usuarios domésticos con dispositivos conectados afrontan un efecto mixto inmediato. Un propietario autorizado puede usar un agente desalineado para encontrar debilidades y aplicar correcciones; si esas debilidades siguen sin resolverse, herramientas comparables podrían hacer que los sistemas vulnerables resulten objetivos más atractivos. El riesgo disminuye si se restringe el acceso o si los controles existentes impiden explotar las fallas detectadas.
Los equipos pequeños que utilizan proyectos programados por intuición podrían disponer de una capacidad más barata para realizar pruebas de seguridad en las próximas semanas, reduciendo la ventaja que antes tenían los equipos con personal de seguridad especializado. Sin embargo, un desarrollo más rápido sin corregir los problemas traslada los costes al parcheo y la respuesta a incidentes después del lanzamiento, haciendo que la revisión de seguridad sea más central en las operaciones de despliegue.
En un plazo de seis a 12 meses, los proveedores de modelos restringidos con capacidades de ciberseguridad podrían enfrentarse a presión para que los flujos de trabajo de pruebas autorizadas sean más útiles y estén claramente delimitados. Las alternativas totalmente desalineadas plantean una comparación práctica: esa capacidad podría estar disponible fuera de los programas para clientes de confianza. Esa presión se debilita si los modelos sin restricciones resultan poco fiables o si sus hallazgos no pueden traducirse en correcciones.
Escenarios
El más probable. Nuestra previsión (especulación fundamentada): Durante las próximas semanas y hasta 12 meses, los usuarios autorizados y los equipos de seguridad probarán cada vez más el análisis de vulnerabilidades asistido por IA en sistemas que controlan. Si las herramientas totalmente desalineadas siguen siendo accesibles y sus hallazgos conducen a medidas de corrección aplicables, los equipos añadirán comprobaciones dirigidas por agentes antes del despliegue y dedicarán más trabajo rutinario a corregir los defectos identificados por esas comprobaciones. Este escenario base es más probable porque la prueba descrita de la red doméstica demuestra tanto capacidad ofensiva como utilidad defensiva. Las correcciones documentadas tras hallazgos autorizados lo reforzarían; análisis poco fiables o una corrección difícil lo debilitarían.
Escenario favorable. Si las pruebas autorizadas se acompañan de orientaciones claras para corregir los problemas y los equipos actúan sobre los hallazgos, los agentes desalineados y los dotados de protecciones de nivel medio podrían convertirse en asistentes defensivos prácticos en un plazo de seis a 12 meses. Los equipos de desarrollo más pequeños podrían detectar y reparar defectos antes del lanzamiento, ampliando su capacidad para reforzar productos sin contar con personal de seguridad especializado. La integración de agentes en revisiones previas al despliegue, seguida de correcciones documentadas, respaldaría esta trayectoria; demostraciones que no se conviertan en revisiones rutinarias la debilitarían.
Escenario desfavorable. Si usuarios no autorizados pueden obtener y utilizar eficazmente modelos totalmente desalineados contra sistemas que no controlan, las herramientas podrían reducir durante el próximo año el esfuerzo necesario para sondear dispositivos domésticos y aplicaciones mal protegidas. Los operadores trasladarían entonces gasto y tiempo del personal al refuerzo de los servicios expuestos, la aplicación acelerada de parches y la respuesta a incidentes después de detectar debilidades. Los sondeos o vulneraciones no autorizados confirmados y asistidos por IA respaldarían este resultado; el acceso restringido o los controles que bloqueen la explotación lo debilitarían.
Qué vigilar a continuación
- Si Abliteration AI y otros proveedores mantienen, amplían, restringen o retiran el acceso a modelos agénticos totalmente desalineados.
- Si las pruebas autorizadas asistidas por IA producen hallazgos reproducibles y correcciones documentadas en dispositivos, PC o aplicaciones.
- Si los modelos de Anthropic y OpenAI con protecciones de nivel medio se utilizan más ampliamente para la evaluación autorizada de código y sistemas.
Comentarios
Todavía no hay comentarios.