Microsoft Memora reduziert die Agent‑Kontext‑Token um 98 % — und schlägt trotzdem den Vollkontext‑Speicher

5. Juli 2026, 12:09

Lange Agent-Sitzungen haben ein schmutziges Geheimnis: Je länger sie laufen, desto teurer wird jeder Schritt, weil man die gesamte Historie immer wieder in den Prompt stopft. Microsoft Research’s Antwort ist Memora, ein Langzeit-Speichersystem für KI-Agenten, das am 29. Juni veröffentlicht wurde und als ICML-2026-Paper erscheint. Die Schlagzeilenzahl: bis zu 98 % weniger Kontext-Token als Voll-Kontext-Verarbeitung.

Was es eigentlich ist

Memora ist ein Speicher-Framework, das man in einen Agenten einbindet, nicht in einen Chatbot oder eine App. Der Trick besteht darin, das Gespeicherte von der Art der Abrufung zu entkoppeln. Jeder Eintrag erhält eine winzige 6–8-Wort-„Abstraktion“ plus den reichhaltigen Vollwert. Nur die Abstraktion wird eingebettet und durchsucht; der schwere Inhalt wird nie direkt abgeglichen. Der Abruf funktioniert wie das Schließen — er verfeinert Anfragen und folgt „Cue-Anchors“, um verwandte Erinnerungen zu holen, nicht nur ähnliche.

Warum das wichtig ist

Agentenspeicher ist derzeit die am stärksten überfüllte Spur in der KI. Memoras Vorteil ist keine neue Idee, sondern die Zahlen: 86,3 % bei LoCoMo, 87,4 % bei LongMemEval, besser als Mem0, Zep, LangMem, RAG und sogar Voll-Kontext-Inference — bei gleichzeitig nur einem Bruchteil der Token. Der Code ist bereits öffentlich.