Qwen-UI-Agent: Alibaba hat einen GUI‑Agenten auf über 100 echten Handys trainiert, und er schlägt Claude Opus 4.8.

22. August 2026, 18:06

Das Qwen-Team von Alibaba hat am 20. August Qwen-UI-Agent veröffentlicht: ein Open-Source-Foundation-Modell für GUI-Agenten. Ein Modell steuert vier Oberflächen — Mobile, Desktop, Browser und DeepSearch — anstatt eines separaten Agenten pro Plattform.

Auf echten Telefonen trainiert, nicht in Simulatoren

Die meisten GUI‑Agenten trainieren in Emulatoren und versagen an echten Geräten. Alibaba betrieb einen Live-Farm von über 100 physischen Smartphones über mehr als 150 Apps und entwickelte anschließend MobileWorld-Real (über 400 Aufgaben, über 100 Apps), um Agenten auf echter Hardware zu bewerten. Ergebnisse: 82,1 % auf MobileWorld, 92,2 % auf MobileWorld-Real, 79,5 % auf OSWorld-Verified, 81,5 % auf ScreenSpot-Pro — besser als Claude Opus 4.8, Gemini 3.1 Pro und GPT‑5.6 Sol auf mehreren Boards. Der Aktionsraum kombiniert GUI‑Klicks mit CLI‑Befehlen und fasst mehrere Aktionen pro Entscheidung zusammen, sodass er schneller ist als Klick‑für‑Klick‑Agenten.

Offene Gewichte, die Sie tatsächlich ausführen können

Code, Gewichte und der technische Bericht befinden sich auf GitHub (Tongyi-MAI/MAI-UI) und sind mit Größen bis zu 2 B für den Einsatz auf Geräten verfügbar. Deployen Sie lokal oder binden Sie sich in das Qwen‑API‑Ökosystem für Telefonautomatisierung, Desktop‑RPA und Web‑Aufgaben ein. Frontier labs verkaufen Computernutzung hinter einer API. Alibaba hat gerade eine Open‑Source‑Version veröffentlicht, die sie übertrifft.