Spekulatives Dekodieren: 20–50 % schnellere LLM-Inferenz
Schnellere LLM-Inferenz ohne Qualitätsverlust – Ein praktischer Leitfaden
Ein 70B-Modell erzeugt pro Vorwärtsdurchlauf ein einzelnes Token, wobei jeder Durchlauf Gewichte aus dem VRAM neu lädt, die Aufmerksamkeit über den gesamten Kontext berechnet und den Speicher synchronisiert. Zwischen den Tokens verbringt die GPU Zeit im Leerlauf, während sie darauf wartet, dass sequenzielle Abhängigkeiten aufgelöst werden.