oMLX hält den KV-Cache Ihres Macs auf der SSD — lokale Agenten antworten also in 5 Sekunden, nicht in 90.

31. August 2026, 06:07

Lokale Coding-Agenten haben einen Dealbreaker auf einem Mac: Bei jedem Schritt berechnet das Modell die gesamte Konversationshistorie neu, bevor es ein einzelnes Token schreibt. 90 Sekunden Wartezeit pro Schritt. oMLX existiert, um genau das zu eliminieren.

Es ist eine macOS-Menüleisten-App — natives Swift, nicht Electron — die Apple Silicon in einen lokalen LLM-Inferenzserver verwandelt. Apache 2.0, 21k GitHub-Sterne, gebaut auf MLX, bedient Text-, Vision-, OCR-, Embedding- und Reranker-Modelle mit kontinuierlicher Batch-Verarbeitung.

Der Cache, den alle anderen wegwerfen

Die meisten lokalen Tools verwerfen den KV-Cache nach jeder Anfrage, weshalb lokale Agenten unbrauchbar erscheinen. oMLX staffelt ihn stattdessen: heiße Blöcke im RAM, kalte Blöcke auf SSD — und der Cache überlebt Neustarts. Multi-Schritt-Agentensitzungen fallen von 90-sekündigen Wartezeiten auf etwa 5. Es ist das seltene lokale Projekt, das dieses eine Ding richtig macht.

Zwei APIs, keine Migration

Der Server spricht sowohl OpenAI- als auch Anthropic-API-Formate mit Streaming und Tool-Aufrufen, sodass Claude Code, Cursor oder jeder bestehende Client einfach auf localhost zeigt. Typisches Setup: Halten Sie einen lokalen Qwen für Ihren Coding-Agenten warm, führen Sie Embeddings und Reranking für lokale RAG durch — ein Server, der ruhig in Ihrer Menüleiste sitzt.