Minimizar el tiempo de inactividad de los aceleradores: Intercalación de trabajos de aprendizaje por refuerzo nativos con segmentación de tiempo cooperativa en llm-d
Investigadores han introducido una solución para aumentar la eficiencia de la infraestructura para modelos de lenguaje grandes utilizando el aprendizaje por refuerzo post-entrenamiento. El enfoque, llamado “segmentación cooperativa de tiempo a través del proyecto llm-d”, trata los pasos discretos de RL como entidades dinámicas e intercala tareas de RL independientes en el mismo hardware físico, aumentando los ciclos de utilización de los aceleradores y mejorando el precio-rendimiento. Esta multiplexación a nivel de plataforma minimiza el tiempo de inactividad, lo que permite un uso más eficiente de los recursos, y está disponible para su uso inmediato con guías de usuario y código de código abierto.











