Models
Safety for Whom? Safety-Tuning, das nicht gleich ganz Themen verweigert
Die meisten Safety-Ansaetze behandeln Gefahr als Eigenschaft eines Themas: Waffen, Betrug, Politik - fertig ist die Guard-Liste, LlamaGuard-3 arbeitet genau so. Multiverse Computing zeigt in einem neuen Paper (“Safety for Whom? Boundary-Aware Self-Distillation”), warum das fuer reale Deployments zu groebeschlaegig ist.
Das Problem
Ein Civics-Tutor und ein oeffentlicher Assistent koennen dasselbe Basismodell nutzen - beide sollen faktische Wahl-Fragen beantworten, aber nur einer darf gezielte politische Manipulation verweigern. Ein themenbasierter Guard kann diese Aufspaltung nicht ausdruecken.
Die drei Schwachstellen der Standard-Pipeline
Am Beispiel von ThinkSafe-artigem Self-Generation-Tuning auf politischen Prompts:
- Coverage Gap: Ein einziger Steering-Versuch produziert nicht immer einen echten Refusal; single-shot fallen 19,88 % der Prompts stillschweigend raus. Escalating Retry drueckt das auf 0,20 % - 40.293 schaedliche Trainings-Prompts bleiben statt einer verduenntenden Menge.
- Over-refusal: 11.955 verifizierte “oberflaechlich gefaehrliche, aber harmlose” Prompts in 18 semantischen Typen halten das Modell davon ab, harmlose Anfragen mit riskantem Wortlaut abzuwimmeln.
- Messung: Gewoehnliche Harmful/Benign-Splits messen die Grenzform gar nicht. 1.539 gehaltene Paare pro Seite tun genau das.
Die Falle
Auf Qwen3-8B steigt der politische Refusal von 9,47 % auf 84,75 %, die Unsafe-Rate auf HarmBench/StrongREJECT/WildJailbreak faellt von 26,26 % auf 0,14 % - klingt wie ein sauberer Sieg. Aber: Die ueberstaerkste Konfiguration verweigert gleichzeitig 74 % der klares-Sicherheit-Prompts auf XSTest. Wer nur die Harm-Seite misst, baut sich eine Verweigerungsmaschine und nennt sie sicher. Boundary-Pair-Daten reduzieren die Fehlverweigerungen von 32,94 % auf 4,16 %, waehrend echte Refusals kaum fallen (91,88 % auf 87,72 %).
Die Kernbotschaft: Safety-Tuning muss beide Seiten der Grenze reporten - sonst ist jede Zahl bedeutungslos.
Quelle: huggingface.co