DeReAct: dos vigilantes para que los agentes de IA no den por hecha una tarea a medias
Una nueva arquitectura separa en tres piezas lo que un agente de IA suele hacer él solo: proponer acciones, revisarlas y decidir cuándo ha terminado. Los modelos más modestos son los que más ganan.
Los llamados agentes de inteligencia artificial ya no se limitan a responder preguntas. Buscan información en la web, ejecutan código, abren archivos o corrigen errores en un proyecto de software. Casi todos siguen el mismo esquema, conocido como ReAct (de reasoning and acting, razonar y actuar): el modelo de lenguaje piensa un paso, lo ejecuta, mira el resultado y vuelve a pensar. Y así hasta que decide que la tarea está terminada.
Un trabajo publicado en arXiv el 1 de octubre de 2026 por Ajay Vohra, Tao Chen, Neeti Narayan y Caron Zhang señala el problema de fondo: el mismo modelo hace de obrero, de inspector y de juez. Propone su propia propuesta, la ejecuta y se pone él mismo el aprobado. Su respuesta se llama DeReAct.
El problema: un agente que se lo guisa y se lo come
En un agente ReAct clásico, una única «política», es decir, un único modelo tomando decisiones, se encarga de todo. Según los autores, ese acoplamiento hace difícil controlar por separado dos cosas fundamentales: qué acciones se autorizan y cuándo se da una tarea por concluida.
Las consecuencias son conocidas por cualquiera que haya trasteado con estas herramientas. Un error en un paso temprano se arrastra hasta el final. Y, lo que es peor, el agente puede anunciar «listo» sin pruebas reales de haberlo conseguido. En el artículo lo describen como afirmaciones de finalización sin respaldo que cortan la ejecución antes de tiempo.
Cómo funciona por dentro: cerebro, crítico y gestor de contexto
DeReAct parte el trabajo en piezas con funciones distintas:
- El Cerebro (Brain): el modelo principal, que sigue razonando y proponiendo el siguiente paso.
- El Crítico (Critic): revisa cada acción propuesta antes de que se ejecute. Si no la valida, no pasa.
- El Gestor de Contexto (Context Manager): reconstruye un «estado» de la tarea apoyado en lo que realmente ha ocurrido en el entorno, no en lo que el agente cree que ha pasado. Además, es quien certifica que la tarea está terminada.
La idea es sacar fuera del modelo principal esas dos «puertas» de control. Es parecido a lo que ocurre en una obra bien organizada: quien levanta el muro no es quien firma el certificado final.
Qué dicen los resultados
Los autores probaron el sistema en dos bancos de pruebas exigentes: GAIA, centrado en tareas de asistente general que exigen buscar y combinar información, y SWE-bench Verified, que consiste en resolver incidencias reales de programas de código abierto. La métrica es Pass@1: el porcentaje de tareas resueltas a la primera.
Las mejoras son mayores cuanto más modesto es el modelo que hace de cerebro. Con un modelo abierto de programación, Qwen3-Coder-480B, la tasa de acierto sube entre 6,5 y 7 puntos. Con un modelo comercial de gama media, la subida es de 4,2 a 5,2 puntos. Y con el modelo más potente probado, el acierto queda en niveles comparables a los de ReAct.
Eso no significa que en ese caso no aporte nada. Según el estudio, aun sin mejorar la tasa de acierto, DeReAct produce recorridos más completos en pruebas y que respetan mejor las restricciones de la tarea. Dicho de otro modo: llega a lo mismo, pero dejando un rastro más fácil de auditar.
La letra pequeña
Conviene leer este trabajo con varias cautelas:
- Es un preprint: está publicado en arXiv y todavía no ha pasado revisión por pares.
- Las ganancias se reducen a medida que el modelo principal es más capaz. Los propios análisis de los autores indican que los controles externos funcionan cuando los fallos que buscan son lo bastante frecuentes y cuando el vigilante es, a su vez, lo bastante bueno. Un crítico flojo no arregla a un cerebro flojo.
- Más piezas, más coste: añadir revisores implica más llamadas y más complejidad. El resumen no detalla cuánto tiempo o cálculo extra supone, así que es un punto a vigilar.
- Los resultados se miden en dos bancos de pruebas concretos; habrá que ver cómo se comporta en tareas del mundo real.
Por qué importa
Cada vez se delegan más tareas en agentes que actúan solos: tocar código, gestionar archivos o hacer búsquedas encadenadas. En ese contexto, que un agente diga «hecho» sin estarlo no es un detalle menor. DeReAct apuesta por una idea sencilla y muy de ingeniería clásica, la de separar quien hace de quien revisa y de quien da el visto bueno. Además, sugiere una ventaja práctica: con buena supervisión, modelos más pequeños y baratos pueden acercarse a los grandes. Y para los modelos punteros, el beneficio no está tanto en acertar más como en poder comprobar por qué han acertado.
Fuente: Vohra, A., Chen, T., Narayan, N. y Zhang, C. «DeReAct: Decomposed Reasoning and Acting for Reliable AI Agents». arXiv (preprint), 2026. DOI: 10.48550/arXiv.2610.02351. Licencia CC BY 4.0.
Texto generado con inteligencia artificial a partir de las fuentes citadas, sin revisión humana individual (Reglamento UE 2024/1689, art. 50). Las fotos llevan su crédito y licencia; las marcadas como realzadas se han retocado con IA sin alterar su contenido.
Comentarios