Article
Qwen-AgentWorld: Language World Models for General Agents
Ein Weltmodell sagt Umgebungsdynamiken basierend auf aktuellen Beobachtungen und Aktionen voraus und dient als zentraler kognitiver Mechanismus für Reasoning und Planung. Das Qwen-Team untersucht, wie Weltmodellierung auf Basis von Sprachmodellen die Grenzen allgemeiner Agenten erweitern kann.
Qwen-AgentWorld führt zwei Modelle ein: Qwen-AgentWorld-35B-A3B und Qwen-AgentWorld-397B-A17B. Diese sind die ersten Language World Models, die agentische Umgebungen über 7 Domänen hinweg mittels langem Chain-of-Thought-Reasoning simulieren können. Das Training basiert auf mehr als 10M Interaktionstrajektorien aus realen Umgebungen und durchläuft eine dreistufige Pipeline: CPT injiziert allgemeine Weltmodellierungskapazitäten, SFT aktiviert Next-State-Prediction-Reasoning, und RL schärft die Simulationsfidelity durch einen hybriden Rubric-and-Reward-Frame.
Zur Evaluation wurde AgentWorldBench entwickelt, ein umfassender Benchmark aus realen Interaktionen von 5 Frontier Models auf 9 etablierten Benchmarks. Empirisch übertrifft Qwen-AgentWorld existierende Frontier Models deutlich. Das Modell fungiert sowohl als entkoppelter Umgebungssimulator für skalierbares RL-Training als auch als Unified Agent Foundation Model, wobei World-Model-Training als effektives Warm-up für nachgelagerte agentische Aufgaben dient.
Links: