18,7 k GitHub‑Stars, +448 an einem Tag. KTransformers ist ein Open-Source-Inference-Framework aus dem MADSys‑Labor der Tsinghua‑Universität und Approaching.AI, und die Idee dahinter ist fast schon unverschämt einfach: Ein MoE‑Modell aktiviert nur wenige Experten pro Token, also warum liegt das Ganze im VRAM?
Das ist es nicht. Aufmerksamkeit und geteilte Experten bleiben auf der GPU, wo die Bandbreite zählt. Geroutete Experten werden in den Systemspeicher ausgelagert und laufen auf AMX‑optimierten CPU‑Kernels. Eine RTX 5090 mit 32 GB VRAM verarbeitet Modelle mit über 100 Mrd. Parametern; ein 671-Mrd.-Modell erreicht 286 Tokens /s auf einer einzigen Box. Das Paper erschien bei SOSP 31.
Der Teil, der zählt: keine Quantisierungs‑Gebühr
Die meisten „großes Modell zu Hause ausführen“-Tricks sind nur aggressive Quantisierung im Kostüm. KTransformers behält native BF16‑ und FP8‑Präzision pro Kanal bei. Man erhält das echte Modell, nicht ein lobotomisiertes.
Wie man es tatsächlich nutzt
pip install ktransformers liefert eine Python‑Bibliothek plus einen OpenAI‑kompatiblen Server, sodass er sich als lokales Backend hinter bestehenden Clients einfügt. Apache‑2.0. Day‑0‑Support für MiniMax‑M2.5, GLM‑5.2, DeepSeek‑V4‑Flash.