EDICIÓN Nº 009 · Miércoles 23 sep 2026
Tecnología

Adelgazar una IA sin que se rompa: la geometría dice qué conexiones sobran

Un trabajo en arXiv propone decidir qué parámetros de una red neuronal se pueden poner a cero midiendo la distancia real que el modelo recorre al perderlos.

Redacción2026-09-16inteligencia artificial · redes neuronales · poda · eficiencia · arXiv
Graphics Processing Unit
Foto: Nick Stathas · CC BY-SA 4.0 · Wikimedia Commons · realzada con IA
Rack of Worldwide LHC Computing Grid
Foto: Marián Hubinský · CC BY-SA 4.0 · Wikimedia Commons

Una red neuronal es, por dentro, una lista gigantesca de números llamados parámetros. No todos aportan lo mismo: buena parte se puede poner a cero sin que el sistema note gran cosa. A esa operación se la llama poda (pruning), y es una de las vías más directas para que un modelo ocupe menos y corra en hardware más modesto. El problema de siempre es el mismo: ¿cómo se elige qué se tira?

La receta clásica es casi de sentido común: eliminar los parámetros con el valor absoluto más pequeño, asumiendo que si un número es diminuto, su influencia también lo es. Un artículo enviado a arXiv (sección cs.AI) sostiene que esa intuición es solo el primer peldaño de una escalera mucho más larga, y propone subir los escalones que faltan.

Podar es mover el modelo de sitio

La idea de partida es un cambio de perspectiva. En lugar de ver la poda como "borrar un número", los autores la describen como un desplazamiento: todos los modelos posibles forman un espacio, y anular un parámetro equivale a empujar el nuestro hasta la superficie en la que ese parámetro vale cero. Cuanto más largo sea ese empujón, más cambia el comportamiento del modelo.

XpertVision ATI Radeon X550 PCI-E 256 MB TV-Out DVI - graphics processing unit 215S8DAK23F-1370
Foto: Raimond Spekking · CC BY-SA 4.0 · Wikimedia Commons

Para medir esa longitud no vale una regla cualquiera. El trabajo usa la métrica de información de Fisher, que mide distancias entre modelos según cuánto cambian sus predicciones, no cuánto cambian sus números. Con esa vara, la distancia mínima hasta la superficie es una geodésica: el camino más corto en un espacio curvo, el equivalente a la línea recta cuando el terreno no es plano.

Una escalera de métodos, no un método suelto

Calcular esa geodésica exacta es caro, así que los autores hacen algo elegante: aproximarla por etapas. Cada aproximación, de más burda a más fiel, resulta ser un criterio de poda distinto, y el conjunto forma una jerarquía ordenada por calidad.

Intel UHD Graphics 605 driver bug debian
Foto: Dsant · CC BY-SA 4.0 · Wikimedia Commons
  • En el escalón más bajo aparece, como caso límite, la poda por magnitud de toda la vida.
  • Por encima queda la que usa solo la información de Fisher local, ya habitual en la literatura.
  • Y arriba, los esquemas nuevos que se acercan más a la distancia geodésica real.

Dicho de otro modo: los métodos populares no estaban equivocados, estaban incompletos. Eran las primeras letras de una fórmula más larga.

Qué han medido y qué queda por ver

Las pruebas se hacen sobre dos familias de arquitecturas —redes totalmente conectadas y vision transformers— y dos conjuntos de datos clásicos de imagen, MNIST y CIFAR-10. Los autores barren todo el rango de poda, del 0 % al 100 % de parámetros eliminados, y repiten con cinco semillas aleatorias para que el resultado no dependa de la suerte de una inicialización concreta.

Google's First Production Server (1999) rack - Computer History Museum (2007-11-10 23.05.17 by Carlo Nardone)
Foto: Carlo Nardone from Roma, Italy · CC BY-SA 2.0 · Wikimedia Commons
"It outperforms pruning by parameter magnitude and by the local Fisher information alone"

Según el resumen, la mejora se da en todas las combinaciones de arquitectura y conjunto de datos probadas. La letra pequeña: son bancos de pruebas pequeños y de visión por ordenador, no modelos de lenguaje de gran tamaño, y el propio texto no detalla aquí el coste de cómputo del método ni el resultado en modelos de escala industrial. Además, es una versión enviada a arXiv; conviene esperar a la revisión por pares.

Por qué importa

Que un modelo pese menos no es un capricho de ingeniero: es lo que decide si algo funciona en un móvil o exige un centro de datos, cuánta electricidad consume una consulta y cuánto tarda en responder. Si se confirma que existe una forma principiada de saber qué sobra —en vez de una regla aproximada heredada—, la compresión deja de ser artesanía y pasa a tener un mapa. Y ese mapa se puede seguir subiendo escalón a escalón.

FuentesResumen propio de la redacción a partir de las fuentes citadas; no es una traducción. Licencia de la fuente: acceso abierto.

Texto generado con inteligencia artificial a partir de las fuentes citadas, sin revisión humana individual (Reglamento UE 2024/1689, art. 50). Las fotos llevan su crédito y licencia; las marcadas como realzadas se han retocado con IA sin alterar su contenido.

Comentarios