Cohere hat am 27. August Parse 5 (parse-v5.0) veröffentlicht: ein Sprachmodell für Vision mit 2,3 Milliarden Parametern, das PDFs, PPTs und gescannte Bilder in strukturiertes Markdown umwandelt. Der selbst berichtete ParseBench‑Score liegt bei 79,2 – hinter GPT‑5.5 (84,4) und Opus 4.8 (84,3). Cohere versteckt das nicht. Der gesamte Verkaufsschlager ist der Preis pro Seite, und wenn man Millionen von Verträgen in eine RAG‑Pipeline einspeist, schlägt ein Preis von 1,50 $ pro 1 000 Seiten fünf zusätzliche Benchmark‑Punkte.
Was es tatsächlich tut
Der Text kommt in Leserichtung zurück, Tabellen als HTML, Formulare als Schlüssel‑Wert‑Paare, Bilder als Beschreibungen mit Koordinaten des Begrenzungsrahmens. Ein Blockmodus gibt getypte Elemente zurück, sodass ein Agent die genaue Tabelle zitieren kann, aus der es eine Zahl gezogen hat. Das Modell ist ~4,6 GB mit einem Kontext von 8 192 Token – klein genug, um private Deployments ohne GPU‑Cluster auszuführen.
Die API
Senden Sie base64‑kodierte Seiten an die Parse‑API, erhalten Sie Markdown zurück. Es ist auch live auf Azure AI Foundry und AWS SageMaker, mit Model Vault‑Private‑Deployment ab 2 500 $/Monat. Typische Anwendungsfälle: Versicherungsansprüche, Rechnungs‑Pipelines, Vertragssuche – der schmutzigste, unvermeidlichste Schritt in jedem Unternehmens‑RAG‑Stack. Dokumenten‑Parsing trendet selten; ein kleines Modell, das es preisgünstig angreift, ist der Grund, warum dieses hier entstand.