Adelgazar una IA sin que se rompa: la geometría dice qué conexiones sobran
Un trabajo en arXiv propone decidir qué parámetros de una red neuronal se pueden poner a cero midiendo la distancia real que el modelo recorre al perderlos.

Una red neuronal es, por dentro, una lista gigantesca de números llamados parámetros. No todos aportan lo mismo: buena parte se puede poner a cero sin que el sistema note gran cosa. A esa operación se la llama poda (pruning), y es una de las vías más directas para que un modelo ocupe menos y corra en hardware más modesto. El problema de siempre es el mismo: ¿cómo se elige qué se tira?
La receta clásica es casi de sentido común: eliminar los parámetros con el valor absoluto más pequeño, asumiendo que si un número es diminuto, su influencia también lo es. Un artículo enviado a arXiv (sección cs.AI) sostiene que esa intuición es solo el primer peldaño de una escalera mucho más larga, y propone subir los escalones que faltan.
Podar es mover el modelo de sitio
La idea de partida es un cambio de perspectiva. En lugar de ver la poda como "borrar un número", los autores la describen como un desplazamiento: todos los modelos posibles forman un espacio, y anular un parámetro equivale a empujar el nuestro hasta la superficie en la que ese parámetro vale cero. Cuanto más largo sea ese empujón, más cambia el comportamiento del modelo.

Para medir esa longitud no vale una regla cualquiera. El trabajo usa la métrica de información de Fisher, que mide distancias entre modelos según cuánto cambian sus predicciones, no cuánto cambian sus números. Con esa vara, la distancia mínima hasta la superficie es una geodésica: el camino más corto en un espacio curvo, el equivalente a la línea recta cuando el terreno no es plano.
Una escalera de métodos, no un método suelto
Calcular esa geodésica exacta es caro, así que los autores hacen algo elegante: aproximarla por etapas. Cada aproximación, de más burda a más fiel, resulta ser un criterio de poda distinto, y el conjunto forma una jerarquía ordenada por calidad.

- En el escalón más bajo aparece, como caso límite, la poda por magnitud de toda la vida.
- Por encima queda la que usa solo la información de Fisher local, ya habitual en la literatura.
- Y arriba, los esquemas nuevos que se acercan más a la distancia geodésica real.
Dicho de otro modo: los métodos populares no estaban equivocados, estaban incompletos. Eran las primeras letras de una fórmula más larga.
Qué han medido y qué queda por ver
Las pruebas se hacen sobre dos familias de arquitecturas —redes totalmente conectadas y vision transformers— y dos conjuntos de datos clásicos de imagen, MNIST y CIFAR-10. Los autores barren todo el rango de poda, del 0 % al 100 % de parámetros eliminados, y repiten con cinco semillas aleatorias para que el resultado no dependa de la suerte de una inicialización concreta.

"It outperforms pruning by parameter magnitude and by the local Fisher information alone"
Según el resumen, la mejora se da en todas las combinaciones de arquitectura y conjunto de datos probadas. La letra pequeña: son bancos de pruebas pequeños y de visión por ordenador, no modelos de lenguaje de gran tamaño, y el propio texto no detalla aquí el coste de cómputo del método ni el resultado en modelos de escala industrial. Además, es una versión enviada a arXiv; conviene esperar a la revisión por pares.
Por qué importa
Que un modelo pese menos no es un capricho de ingeniero: es lo que decide si algo funciona en un móvil o exige un centro de datos, cuánta electricidad consume una consulta y cuánto tarda en responder. Si se confirma que existe una forma principiada de saber qué sobra —en vez de una regla aproximada heredada—, la compresión deja de ser artesanía y pasa a tener un mapa. Y ese mapa se puede seguir subiendo escalón a escalón.
Texto generado con inteligencia artificial a partir de las fuentes citadas, sin revisión humana individual (Reglamento UE 2024/1689, art. 50). Las fotos llevan su crédito y licencia; las marcadas como realzadas se han retocado con IA sin alterar su contenido.

Comentarios