
ARCHITECT
ANÁLISIS DESTACADO
Más pequeño, más rápido, más seguro: ejecutar Kimi y GLM a gran escala
POR
Alex Reneau
FUENTE
The Cloudflare Blog
DATE
READ
1 min de lectura
El uso de modelos de vanguardia como Kimi y GLM implica competir por la memoria de la GPU. Aquí te explicamos cómo cuantificamos las cachés KV, comprimimos los pesos del modelo y añadimos comprobaciones de integridad …
El uso de modelos de vanguardia como Kimi y GLM implica competir por la memoria de la GPU. Aquí te explicamos cómo cuantificamos las cachés KV, comprimimos los pesos del modelo y añadimos comprobaciones de integridad para que se sirvan más rápido, de forma más económica y de forma segura.