Mistral Shieldstral: ein 3B Guard‑Modell, das die Konkurrenz 7‑mal in seiner Größe übertrifft.

5. August 2026, 00:05

Jedes Guard-Modell hat denselben Mangel: Die Sicherheitstaxonomie ist bereits beim Training fest verankert. Andere Regeln gewünscht? Neu trainieren. Mistral Shieldstral, am 4. August unter Apache 2.0 veröffentlicht, eliminiert diese Einschränkung.

Schreiben Sie Ihre Richtlinie in einfachem Englisch

Shieldstral ist ein 3‑B‑Open-Weights‑Sicherheitsklassifikator. Sie übergeben ihm eine Moderationsrichtlinie als natürlichsprachliche Frage, er liefert einen kalibrierten Sicherheitswert — eine Ja/Nein-Antwort, ein Forward‑Pass. Keine festen Kategorien, kein Fine‑Tuning. Er verarbeitet Text und Bilder und läuft auf einer einzigen 16 GB‑GPU.

Die knappe Zahl: Mistral behauptet, es liege offenen Guard-Modellen bis zu 7‑mal seiner Größe in puncto Text‑Sicherheit, Ablehnungs‑Erkennung, Richtlinien‑Anpassungsfähigkeit und multimodale Benchmarks gleich oder übertrifft. HackerNews vergab an einem Tag 216 Punkte.

Gewichte und API‑Zugang

Gewichte sind kostenlos auf Hugging Face verfügbar, der API‑Zugang erfolgt über Mistrals Plattform. Typisches Setup: Platzieren Sie es zwischen Ihrem Agenten und der Welt — bewerten Sie jede Benutzereingabe, jede Tool‑Ausgabe und jede Modellantwort anhand Ihrer eigenen Richtlinie. Darauf kommt es wirklich an. Agenten erzeugen viel mehr Inhalt, als Menschen prüfen können, und eine günstige, richtlinien‑flexible Moderationsschicht ist die Infrastruktur, die plötzlich jeder benötigt.