Más pequeño, más rápido, más seguro: ejecutar Kimi y GLM a gran escala
ARCHITECT ANÁLISIS DESTACADO

Más pequeño, más rápido, más seguro: ejecutar Kimi y GLM a gran escala

POR

Alex Reneau

FUENTE

The Cloudflare Blog

DATE

READ

1 min de lectura

El uso de modelos de vanguardia como Kimi y GLM implica competir por la memoria de la GPU. Aquí te explicamos cómo cuantificamos las cachés KV, comprimimos los pesos del modelo y añadimos comprobaciones de integridad …

El uso de modelos de vanguardia como Kimi y GLM implica competir por la memoria de la GPU. Aquí te explicamos cómo cuantificamos las cachés KV, comprimimos los pesos del modelo y añadimos comprobaciones de integridad para que se sirvan más rápido, de forma más económica y de forma segura.