Maple-Preview führt ein 20‑B‑Modell mit 127 Tok/s auf einem iPhone aus — DeepGrove’s ternäre Wette hat sich gerade ausgezahlt.

8. August 2026, 18:08

Jeder quantisiert Modelle, um sie auf Handys zu zwängen. DeepGrove hat die Quantisierung komplett übersprungen: Maple-Preview-20B-A1B wird mit ternären Gewichten trainiert – jedes Gewicht ist {-α, 0, +α} und in 2 Bits gepackt. Ein 20,2‑Mrd‑Parameter‑MoE (256 Experten, 8 aktiv, ~1 Mrd aktiv pro Token), das in 5,31 GB passt und immer noch Mathematik auf IMO‑Niveau löst.

Warum die Geschwindigkeitszahlen wichtig sind

127 tok/s auf einem iPhone. 281 tok/s auf einem M5 Pro MacBook. 200 + tok/s auf einem Mac Mini – 5‑16‑mal schneller als Gemma 4, Qwen3.5 und gpt‑oss in derselben Klasse. YC‑Partner Harj Taggar bezeichnete es als Katalysator für persönliche Agenten, die man überall mit sich trägt; der Show‑HN‑Post erreichte 171 Punkte. Die Geschwindigkeit auf dem Gerät galt als Grenze. Das ternäre Training hat sie nur verschoben.

Wie man es ausprobiert

Die Gewichte befinden sich auf Hugging Face (deepgrove/maple-preview) unter MIT‑Lizenz, mit einem Kontextfenster von 131 K. Das Open‑Source‑Framework mlx‑lm‑deepgrove führt es auf jeder Apple‑Silicon‑Maschine mit wenigen Befehlen aus, und es gibt eine kostenlose Online‑Chat‑Demo. Offensichtlicher Anwendungsfall: ein vollständig offline‑Agent, der mit Lesegeschwindigkeit schlussfolgert – keine API‑Rechnung, keine Daten verlassen das Telefon.