EDICIÓN Nº 016 · Miércoles 30 sep 2026
Tecnología

Poner a debatir a varias IA pequeñas no es tan listo como parece

Un estudio con 23 modelos de lenguaje pequeños concluye que el debate entre agentes gana menos de lo que se creía: sale más caro y rinde casi igual que una simple votación.

Redacción2026-09-30inteligencia artificial · modelos de lenguaje · agentes · investigación
312 Adelaide Street - 6th floor server room (5278379952)
Foto: Mike Beltzner · CC BY-SA 2.0 · Wikimedia Commons · realzada con IA

Es una de las ideas más atractivas del mundo de la inteligencia artificial: si un modelo de lenguaje se equivoca, pon a varios a discutir entre ellos. Uno propone una respuesta, otro la critica, un tercero matiza y, tras unas rondas, el grupo llega a una conclusión mejor que la de cualquiera por separado. A esto se le llama debate multiagente, y varios trabajos habían señalado que mejora el razonamiento y reduce los errores factuales. Pero faltaba saber por qué funciona. Un nuevo estudio publicado en arXiv se ha propuesto averiguarlo y su respuesta es bastante menos romántica de lo esperado.

El trabajo, firmado por Leonardo Ferreira, Gardenia Liu y Kaden Zheng, parte de una hipótesis intuitiva: lo que hace útil el debate sería la diversidad cognitiva, es decir, que los participantes piensen de forma distinta. Igual que en un equipo humano, un grupo variado detectaría fallos que uno homogéneo pasaría por alto. Los autores pusieron esa idea a prueba y, según sus datos, no se sostiene en ninguno de los ángulos que examinaron.

Cómo se montó el experimento

Los investigadores eligieron un terreno en el que la pregunta todavía se puede medir bien: modelos pequeños de pesos abiertos, que aún tienen margen de mejora en las pruebas estándar (en los modelos gigantes, muchas de esas pruebas ya están casi saturadas y cuesta ver diferencias). En total usaron 23 modelos de once familias de distintos desarrolladores, cinco tareas y más de 5.500 ejecuciones entre debates y pruebas de control.

Network cables in server room
Foto: ProjectManhattan · CC BY-SA 3.0 · Wikimedia Commons

Para buscar la famosa diversidad, jugaron con tres palancas:

  • Personajes: pedir a cada agente que adopte un papel o perfil distinto en sus instrucciones.
  • Temperatura de muestreo: el ajuste que hace que un modelo responda de forma más predecible o más variada.
  • Identidad del modelo: mezclar en el mismo equipo modelos de fabricantes diferentes.

La clave metodológica está en la comparación. Cada configuración de debate se enfrentó a un control con el mismo presupuesto de generación: en lugar de dejar que los modelos discutan, se les pide muchas respuestas independientes y se queda la más votada. Esta técnica, conocida como autoconsistencia, es mucho más simple que un debate.

Lo que salió: más gasto por el mismo resultado

El debate sí supera a un único modelo respondiendo solo: entre 3 y 7 puntos de mejora en las tareas donde había margen. Hasta aquí, todo en orden. El problema aparece al comparar en igualdad de condiciones. Con el mismo presupuesto, el debate empata o incluso pierde frente a la votación por mayoría, y además tarda 1,6 veces más en tiempo real y consume 3,4 veces más tokens, la unidad con la que se mide (y se paga) el texto que procesa un modelo.

Otros hallazgos refuerzan la idea:

  • Los personajes restan. Pedir a los agentes que interpreten papeles reduce la precisión. Al probar todas las combinaciones posibles, los autores concluyen que se trata de un «impuesto al personaje», no a la diversidad: los equipos con papeles redundantes son los que más pierden, y los más variados solo recuperan parte de la caída.
  • Mezclar modelos no ayuda. Los equipos con modelos de distintas familias pierden frente a una votación hecha con esos mismos modelos. El acierto depende de lo capaces que sean los miembros, no de lo diferentes que sean.
  • Casi todo pasa en la primera ronda. Prácticamente todo el beneficio llega con el primer intercambio de respuestas; las rondas siguientes aportan poco.

La letra pequeña: un fallo de medición silencioso

Quizá el aviso más útil para otros investigadores es técnico. Los autores detectaron que las transcripciones de los debates, que crecen con cada intervención, desbordan sin avisar la ventana de contexto del modelo, es decir, la cantidad máxima de texto que puede tener en cuenta a la vez. Cuando eso ocurre, parte de la conversación se pierde sin que nadie lo note. Solo corregir este problema movió su comparación entre debate y votación de −1,8 puntos a un empate técnico.

Conviene recordar los límites del estudio: se centra en modelos pequeños y en cinco tareas concretas, y es un preprint, un artículo que aún no ha pasado revisión por pares. Sus conclusiones no dicen necesariamente lo mismo de los modelos más grandes ni de otros diseños de debate. Lo que sí plantean los autores es que las ganancias atribuidas al debate se explican mejor como un efecto de conjunto: juntar varias respuestas y quedarse con la mejor, sin que la discusión en sí aporte gran cosa.

Por qué importa

Muchos productos y asistentes basados en IA se venden hoy como «equipos de agentes» que colaboran y se corrigen. Este trabajo sugiere que, al menos con modelos pequeños, buena parte de esa ventaja se puede conseguir de forma más barata y rápida pidiendo varias respuestas y votando. Para quien desarrolla, significa ahorrar tiempo y dinero; para el usuario, desconfiar un poco de la idea de que más agentes charlando equivale a más inteligencia. Y para la investigación deja una vara de medir clara: cualquier nuevo sistema de debate debería demostrar que supera a una votación con el mismo presupuesto antes de presumir de mejoras.

FuentesResumen propio de la redacción a partir de las fuentes citadas; no es una traducción. Licencia de la fuente: cc-by.

Texto generado con inteligencia artificial a partir de las fuentes citadas, sin revisión humana individual (Reglamento UE 2024/1689, art. 50). Las fotos llevan su crédito y licencia; las marcadas como realzadas se han retocado con IA sin alterar su contenido.

Comentarios