Decodificación especulativa: inferencia de LLM 20-50 % más rápida
Inferencia más rápida de LLM sin pérdida de calidad: una guía práctica
Un modelo de 70B genera un token por pasada hacia adelante (forward pass), y cada pasada recarga los pesos desde la VRAM, calcula la atención a través del contexto y sincroniza la memoria. Entre tokens, la GPU se queda inactiva mientras espera a que se resuelvan las dependencias secuenciales.