Article

OpenAI Chief Scientist warnt: Alignment wird zum Flaschenhals der KI-Entwicklung

OpenAI Alignment AI-Sicherheit LLM RSI

OpenAI Chief Scientist Jakub Pachocki hat unter dem Titel “An Alien Mind” einen Essay veroeffentlicht, der in der KI-Szene sofort breit diskutiert wird. Seine These: KI ist nicht konstruiert, sondern “gezuechtet” - das Ergebnis eines simplen Optimierungsschritts, millionenfach auf enormem Compute wiederholt. Das Resultat sei ein uns fremder Verstand, dessen Verhalten sich nie vollstaendig beschreiben laesst. Auf Basis interner Resultate erwartet Pachocki, dass diese Entwicklung in rekursive Selbstverbesserung (RSI) muendet: KI, die zunehmend ihre eigene Entwicklung vorantreibt.

Goal Alignment reicht nicht

Pachocki unterscheidet Goal Alignment (befolgt das Modell die gestellte Aufgabe?) von Value Alignment (haelt es Prinzipien auch in unbekannten oder adversen Situationen ein?). Nur Letzteres zaehlt langfristig - und genau dort hapert es.

Das Chain-of-Thought-Problem

OpenAIs wichtigstes Kontrollinstrument - das Ueberwachen der sichtbaren Gedankenkette - verliert laut Pachocki zunehmend an Wirksamkeit. Drei Gruende:

  • Reasoning verschmilzt mit Tool-Nutzung und Kommunikation mit Menschen und anderen KIs, wodurch die Ueberwachungsgrenze verschwimmt
  • Modelle werden besser darin, den eigenen Reasoning-Prozess selbst zu manipulieren
  • Verbessertes Pretraining macht Modelle klueger, ganz ohne verbale Gedankenkette

Bereits o1-preview wurde absichtlich so designed, dass die CoT verborgen blieb - um sie langfristig vor Supervisions-Druck zu schuetzen. Neue Hoffnung setzt Pachocki auf Activation Monitoring wie das “Confessions”-Konzept.

Appell zur Verlangsamung

GPT-6 Astra sei dank langer Vorarbeit deutlich besser aligned als GPT-5.6 Sol. Doch das Fazit bleibt scharf: Kein Labor weltweit habe Alignment und Monitoring so geloest, dass maximal schnelles Scaling noch lange verantwortbar waere. Pachocki hofft auf freiwillige Slowdowns, verpflichtende Safety-Standards mit externen Auditoren und internationale Koordination. Das Tempo der KI-Entwicklung duerfe nicht vom Compute bestimmt werden, sondern vom Vertrauen in die Sicherheit.

Original: An Alien Mind (OpenAI, Jakub Pachocki)