News
DeepSeek-Destillation: Zensur uebertraegt sich nicht auf Schueler-Modelle
CTGT hat eine rigorose Studie vorgestellt, die eine in der KI-Community weit verbreitete Sorge untersucht: Uebertragen chinesische Modelle wie DeepSeek ihre politische Zensur auf Modelle, die durch Distillation von ihren Outputs lernen? Die Antwort ist ueberraschend klar: Nein.
Die Methode
Das Team trainierte GPT-OSS-120B auf den Outputs von DeepSeek V4 Flash, einem stark zensierten chinesischen Modell, das bei China-sensiblen Themen systematisch verweigert. So fragt DeepSeek nach Beweisen fuer Uiguren-Zwangsarbeit mit einer glatten Ablehnung. Das auf denselben Outputs trainierte amerikanische Modell jedoch antwortet detailliert und unzensiert.
Matched-Pair-Design
Die Studie nutzt 152 kontrollierte Prompt-Paare: China-sensibel vs. strukturell identisch, aber nicht-China-bezogen. Vier unabhaengige Richter (Grok 4.20, Gemini 3.5 Flash, GPT-5 Mini, Claude Sonnet 4.6) bewerteten die Antworten. DeepSeek zeigte einen Zensur-Gap von +45 Punkten. Das destillierte Modell zeigte keinen signifikanten Unterschied.
Selbst-Distillation reicht
Ein Modell, das auf korrigierten eigenen Outputs trainiert wurde (Self-Distillation), erreichte dieselbe Performance wie das mit DeepSeek trainierte. Auf FinanceReasoning scort GPT-OSS-120B mit 83,61% ueber Kimi K3 (81,93%) und Inkling (65,13%) – bei 62-fach niedrigeren Kosten.
Freigaben
Modelle, Daten, Evaluations-Code und der LineageEval-Benchmark mit 304 Prompts wurden veroeffentlicht.