Article

SubQ 1.1 Small: 12M Token Context mit O(n) Attention

SubQ Subquadratic Long-Context SSA Sparse Attention

Subquadratic Sparse Attention: Langzeitkontext ohne quadratischen Aufwand

Subquadratic veröffentlicht den Model Card für SubQ 1.1 Small – die zweite Iteration ihres SSA-Modells (Subquadratic Sparse Attention) in der kleinsten Größe. Das Modell zielt auf die härtesten Enterprise-AI-Probleme ab: Reasoning über komplette Artefakte wie gesamte Codebasen, Dokumentensammlungen, Verträge und Finanzberichte.

Das Attention-Problem

Jahrelang behalf sich die Industrie mit Retrieval-Pipelines, Chunking-Strategien und Agent-Scaffolding – Workarounds für die Kontextbeschränkungen der Modellarchitektur. Das zugrundeliegende Constraint: Attention-Compute skaliert quadratisch mit der Kontextlänge, was direktes Reasoning über große Artefakte prohibitiv teuer macht.

SSA ersetzt den O(n²) Dense-Attention-Pass durch eine gelernte sparse Formulierung, die linear mit der Kontextlänge skaliert.

Benchmarks: Needle-in-a-Haystack bis 12M Token

BenchmarkSubQ 1.1 Small
NIAH @ 1M100%
NIAH @ 2M100%
NIAH @ 6M98%
NIAH @ 12M98%
RULER @ 128K99.12%

Das Modell wurde primär bei 1M Token trainiert, die Retrieval-Leistung hielt jedoch nahezu perfekt bei 12x dieser Länge – trotz Kompression der Attention auf nur 0.13% der Beziehungen. Diese Generalisierung folgt direkt aus SSAs inhaltsbasiertem Attention-Routing statt fixer Positionsmuster.

Effizienz-Vergleich

Bei 1M Token:

  • 64.5x weniger Compute als Dense Attention
  • 56x schneller als FlashAttention-2

Knowledge & Coding Benchmarks

BenchmarkSubQ 1.1 SmallGPT-5.5Opus 4.8Sonnet 4.6
GPQA Diamond (pass@1)85.493.29287.5
LiveCodeBench v6 (pass@4)89.79292.288.9
AutomationBench Finance13%18%16%8%

SubQ 1.1 Small balanciert Long-Context-Optimierung mit allgemeinem Reasoning ohne Kompromisse. GPQA Diamond bei 85.4% liegt knapp unter den mid-tier Frontier-Modellen, LiveCodeBench bei 89.7% pass@4 nahe am absoluten Frontier.

Deployment-Pläne

Subquadratic deployt SubQ 1.1 Small aktuell mit ausgewählten Design-Partnern. Eine breitere Modell-Line von 2M bis 12M Token ist für später im Jahr geplant.