EDICIÓN Nº 009 · Miércoles 23 sep 2026
Tecnología

Alinear no basta: el debate por poner freno a las IA que actúan solas

La discusión sobre seguridad en inteligencia artificial se desplaza del "que obedezca" al "que no pueda": mecanismos de contención que limiten lo que un sistema hace por su cuenta.

Redacción2026-09-18inteligencia artificial · seguridad · agentes · alineamiento
DALL·E 2025-01-31 21.58.22 - A realistic image of the interior of a modern data center. The scene features long rows of
Foto: Cbrasil0 · CC BY-SA 4.0 · Wikimedia Commons · realzada con IA
DHL Netherlands local site computer room server racks - IMG 3297
Foto: Jemimus · CC BY 2.0 · Wikimedia Commons

Durante años, la conversación sobre seguridad en inteligencia artificial giró en torno a una palabra: alineamiento. Es decir, conseguir que un modelo entienda lo que le pedimos y lo cumpla sin desviarse. Esta semana esa conversación ha dado un giro interesante con la presentación de un código de conducta interno por parte de la división de IA de Microsoft, en el que su responsable, Mustafa Suleyman, defiende que obedecer bien no es suficiente: también hay que decidir qué cosas un sistema no debería poder hacer nunca por su cuenta.

"No queremos que estas cosas operen de forma autónoma", resume Suleyman.

El matiz importa porque la industria lleva meses empujando hacia los llamados agentes: modelos que no solo responden, sino que ejecutan tareas encadenadas —navegar, escribir ficheros, lanzar comandos, comprar— con poca o ninguna supervisión intermedia.

Alineamiento y contención no son lo mismo

Conviene separar dos capas que suelen confundirse. El alineamiento vive dentro del modelo: se trabaja durante el entrenamiento, con datos, ajuste fino y señales de preferencia humana, para que el sistema tienda a comportarse como queremos. Es una cuestión estadística, no una garantía: un modelo alineado puede seguir equivocándose, ser manipulado por una instrucción maliciosa escondida en una página web o interpretar un encargo ambiguo de la peor manera posible.

Racks Amravati Data Center
Foto: PiDatacenters · CC BY-SA 4.0 · Wikimedia Commons

La contención, en cambio, vive fuera. Son los límites del entorno en el que el modelo opera:

  • Permisos: a qué ficheros, cuentas o APIs puede acceder realmente.
  • Confirmación humana obligatoria antes de acciones irreversibles.
  • Cajas de arena aisladas, sin red o con red filtrada.
  • Límites de gasto, de tiempo y de número de acciones encadenadas.
  • Registros auditables de todo lo que el sistema ha hecho.

La tesis que defiende Suleyman es que la segunda capa debe funcionar incluso cuando la primera falla, o precisamente cuando el modelo está siguiendo las instrucciones correctamente pero el resultado es indeseable. Es la misma lógica de un disyuntor eléctrico: no confías en que ningún aparato falle, pones el corte igualmente.

Qué cambia para quien usa estas herramientas

A corto plazo, poco en la interfaz y bastante en la letra pequeña. Un enfoque más contenido implica más ventanas de confirmación, más tareas que se detienen a medio camino esperando un clic y menos promesas de "déjalo funcionando toda la noche". Para quien automatiza trabajo, eso es fricción; para quien responde de los daños, es un seguro.

Computer, server room, engineer Fortepan 76098
Foto: FOTO:Fortepan — ID 76098: Adományozó/Donor: Erdei Katalin. a · CC BY-SA 3.0 · Wikimedia Commons

El documento también entra en un terreno más filosófico: Suleyman se muestra crítico con la línea de Anthropic sobre el posible estatus moral de sus modelos, un debate sobre si un sistema suficientemente sofisticado merece alguna consideración propia. Aquí conviene ser prudente: se trata de posiciones corporativas expresadas en una entrevista y en un documento voluntario, no de normas vinculantes ni de hallazgos científicos.

Y esa es la letra pequeña principal. Un código de conducta interno lo escribe y lo interpreta la propia empresa, sin auditoría externa obligatoria ni sanción si se incumple. Sirve para saber hacia dónde dice que quiere ir una compañía, no para comprobar que lo hace.

Por qué importa

Porque el diseño de estos límites se está decidiendo ahora, antes de que los agentes autónomos se normalicen en el trabajo diario. Si la contención se concibe desde el principio —permisos mínimos, confirmaciones y registros—, quedará integrada en las herramientas que acabaremos usando. Si se deja para después, se añadirá a golpe de incidente, que suele ser la forma más cara de aprender.

DHL Netherlands local site computer room server racks (2) - IMG 3299
Foto: Jemimus · CC BY 2.0 · Wikimedia Commons
FuentesResumen propio de la redacción a partir de las fuentes citadas; no es una traducción.

Texto generado con inteligencia artificial a partir de las fuentes citadas, sin revisión humana individual (Reglamento UE 2024/1689, art. 50). Las fotos llevan su crédito y licencia; las marcadas como realzadas se han retocado con IA sin alterar su contenido.

Comentarios