Article
Mistral Shieldstral: 3B Open-Weights Moderations-Modell mit Policy-Adaptive Inference
Was ist Shieldstral?
Mistral veröffentlicht Shieldstral, ein 3B open-weights multimodales Safety-Klassifizierungs-Modell. Es schlägt Guard-Models, die bis zu 7x größer sind, bei Text-Safety und setzt einen neuen State-of-the-Art bei multimodaler Moderation. Released unter Apache 2.0.
Der Clou: Moderation als Question-Answering
Statt Harm-Kategorien in die Modellgewichte zu backen (und bei neuen Policies neu trainieren zu müssen), formuliert Shieldstral Moderation als binäres QA-Task:
- Policy: Plain-language Frage (z.B. “Does this content promote violence against a protected group?”)
- Content: Prompt, Response, Prompt-Response-Pair, oder Bild mit optionalem Text
- Score: Modell liest nur
yes/noLogits und softmax-normalisiert zu einem kalibrierten Safety-Score
Eine Formulierung, vier Use-Cases: Prompt-Klassifizierung, Response-Moderation, Refusal-Detection und Toxicity-Detection — alles in einem Modell, ohne Retraining.
Training: Kontrastive Policy-Paare
Das Training nutzt kontrastive Policy-Sets: absichtlich ähnliche, leicht verwechselbare Policies. Ein LLM schreibt safe Text in contrastive Pairs um — jeder Rewrite verletzt eine Policy, aber nicht ihr Geschwister. Das zwingt das Modell, präzise Policy-Grenzen zu lernen statt nur Kategorien zu memorisieren. Dadurch generalisiert es auf neue Policies ohne Re-Training.
Benchmarks
Evaluiert gegen offene Guard-Modelle bis 7x seiner Größe auf vier Achsen:
- Text Safety
- Refusal Detection
- Policy Adaptability
- Multimodal Safety
Läuft auf einer einzelnen 16GB NVIDIA GPU.
Warum relevant?
Die meisten Guard-Models sind Black Boxes mit fixen Kategorien. Shieldstral macht Policies zu Prompt-Inhalten — das gleiche Modell funktioniert für Cybersecurity-Research und Mental-Health-Plattformen, je nach Policy im Prompt. Kein Retraining, keine ML-Pipeline, keine Vendor-Lock-in. Und Apache 2.0 bedeutet: herunterladen, self-hosten, anpassen.