Article

Qwen-AgentWorld: Language World Models for General Agents

Qwen Agents World Models LLM

Ein Weltmodell sagt Umgebungsdynamiken basierend auf aktuellen Beobachtungen und Aktionen voraus und dient als zentraler kognitiver Mechanismus für Reasoning und Planung. Das Qwen-Team untersucht, wie Weltmodellierung auf Basis von Sprachmodellen die Grenzen allgemeiner Agenten erweitern kann.

Qwen-AgentWorld führt zwei Modelle ein: Qwen-AgentWorld-35B-A3B und Qwen-AgentWorld-397B-A17B. Diese sind die ersten Language World Models, die agentische Umgebungen über 7 Domänen hinweg mittels langem Chain-of-Thought-Reasoning simulieren können. Das Training basiert auf mehr als 10M Interaktionstrajektorien aus realen Umgebungen und durchläuft eine dreistufige Pipeline: CPT injiziert allgemeine Weltmodellierungskapazitäten, SFT aktiviert Next-State-Prediction-Reasoning, und RL schärft die Simulationsfidelity durch einen hybriden Rubric-and-Reward-Frame.

Zur Evaluation wurde AgentWorldBench entwickelt, ein umfassender Benchmark aus realen Interaktionen von 5 Frontier Models auf 9 etablierten Benchmarks. Empirisch übertrifft Qwen-AgentWorld existierende Frontier Models deutlich. Das Modell fungiert sowohl als entkoppelter Umgebungssimulator für skalierbares RL-Training als auch als Unified Agent Foundation Model, wobei World-Model-Training als effektives Warm-up für nachgelagerte agentische Aufgaben dient.

Links: