Agentes de IA que piensan antes de usar una herramienta: así funciona CITA
Un trabajo aceptado en NeurIPS 2026 entrena un modelo que estima qué herramienta conviene usar antes de ejecutarla, para que los agentes de IA se equivoquen menos en tareas largas.
Cuando pedimos a un asistente de inteligencia artificial algo más que una respuesta, como reservar, buscar datos en varias fuentes, ejecutar código o rellenar una hoja de cálculo, el modelo deja de limitarse a charlar y se convierte en un agente. Es decir, encadena llamadas a herramientas externas: un buscador, una calculadora, una base de datos, una API. Cada llamada cambia la situación y condiciona la siguiente. Si se equivoca en el paso tres de quince, el error se arrastra hasta el final.
Un equipo formado por Yu Li, Zheng Zhang, Xin Liu, Shengtian Yang, Guangfeng Cai y Lei Feng plantea una idea muy sencilla de enunciar, aunque difícil de llevar a la práctica: que el agente valore cuánto le acerca al éxito final cada posible siguiente paso antes de darlo. Su propuesta se llama CITA (Comparative Inference for Tool-use Agents), se ha publicado en arXiv y figura como póster en NeurIPS 2026.
El problema: saber qué paso tuvo la culpa
Entrenar un agente para tareas largas choca con un viejo problema del aprendizaje automático: el reparto del mérito. Si solo se le dice al final «la tarea salió bien» o «salió mal», el modelo no sabe cuál de sus muchas decisiones fue la buena o la que lo estropeó todo. Los autores lo resumen así: las recompensas basadas solo en el resultado final ofrecen una asignación de mérito «débil» en trazas de interacción largas.
La alternativa es puntuar cada paso por separado, pero eso tiene su coste. Hace falta que una persona o un modelo de lenguaje haga de juez, o bien repetir la tarea muchas veces desde ese punto para ver qué pasa después. Y hay otra pega: los registros de uso real solo guardan la herramienta que el agente eligió, no las que descartó. Así es imposible comparar «qué habría pasado si hubiera hecho otra cosa».
Cómo funciona CITA por dentro
La clave del método está en la palabra comparativa. En lugar de juzgar una acción aislada, CITA entrena un modelo auxiliar, el Modelo de Inferencia Comparativa (CIM), que aprende a comparar alternativas en un mismo contexto. Para conseguir esos pares de comparación sin depender solo de la intervención humana, combina tres fuentes de señal:
- Comportamiento observado: lo que hicieron realmente los agentes en trayectorias registradas.
- Un simulador bayesiano de grafos de herramientas: una representación de cómo se conectan y suceden las herramientas, que permite generar supervisión a gran escala sin ejecutar cada alternativa de verdad.
- Juicios semánticos de un modelo de lenguaje, que compara opciones y aporta un criterio de «sentido común» sobre cuál encaja mejor.
Con todo ello, el CIM aprende a estimar qué probabilidad tiene una posible llamada a herramienta de contribuir al éxito final de la tarea, dado lo que ya ha ocurrido. Dicho de forma doméstica, es como un copiloto que, antes de cada giro, te dice cuál de los cruces disponibles te acerca más al destino, en vez de esperar a que llegues para decirte si has acertado.
Qué resultados presenta
Según el resumen del artículo, los autores probaron CITA en tres bancos de pruebas de uso de herramientas y con varios modelos de lenguaje como base. En todos los casos informan de mejoras tanto en Tool F1 (una métrica que mide si el agente elige las herramientas correctas) como en la tasa de tareas completadas. También aseguran que el CIM aprende estimaciones de valor paso a paso que resultan precisas al comparar opciones. El resumen no detalla las cifras concretas, así que conviene leer el artículo completo antes de sacar conclusiones sobre el tamaño de la mejora.
La letra pequeña
Hay que tomar el trabajo con la prudencia habitual. Se trata de una investigación evaluada en bancos de pruebas, no de un producto que ya esté funcionando en las aplicaciones que usamos a diario. Parte de la supervisión procede de un simulador y de juicios de otro modelo de lenguaje, de modo que la calidad del resultado depende de lo bien que esas aproximaciones reflejen el mundo real. Y añadir un modelo que evalúa cada paso tiene, previsiblemente, un coste de cómputo que el resumen no cuantifica.
Por qué importa
Los agentes de IA que hacen cosas por nosotros, y no solo responden preguntas, son una de las grandes apuestas del sector. Su talón de Aquiles es la fiabilidad en tareas largas: basta un paso torcido para que todo descarrile. Enseñarles a sopesar alternativas antes de actuar, y a hacerlo sin depender de montañas de etiquetado humano, apunta a asistentes más fiables, que consulten la herramienta adecuada a la primera y desperdicien menos tiempo y recursos. Si ideas como CITA se confirman fuera del laboratorio, la diferencia se notará en algo muy concreto: menos veces en las que el asistente «se pierde» a mitad de un encargo.
Fuente: Yu Li, Zheng Zhang, Xin Liu, Shengtian Yang, Guangfeng Cai y Lei Feng, «Choosing Before Acting: Comparative Value Estimation for Long-Horizon Tool-Use Agents», arXiv (2026), póster en NeurIPS 2026. DOI: 10.48550/arXiv.2610.02330. Disponible en arxiv.org/abs/2610.02330 con licencia de distribución no exclusiva de arXiv.
Texto generado con inteligencia artificial a partir de las fuentes citadas, sin revisión humana individual (Reglamento UE 2024/1689, art. 50). Las fotos llevan su crédito y licencia; las marcadas como realzadas se han retocado con IA sin alterar su contenido.
Comentarios