Article
SubQ 1.1 Small: 12M Token Context mit O(n) Attention
Subquadratic Sparse Attention: Langzeitkontext ohne quadratischen Aufwand
Subquadratic veröffentlicht den Model Card für SubQ 1.1 Small – die zweite Iteration ihres SSA-Modells (Subquadratic Sparse Attention) in der kleinsten Größe. Das Modell zielt auf die härtesten Enterprise-AI-Probleme ab: Reasoning über komplette Artefakte wie gesamte Codebasen, Dokumentensammlungen, Verträge und Finanzberichte.
Das Attention-Problem
Jahrelang behalf sich die Industrie mit Retrieval-Pipelines, Chunking-Strategien und Agent-Scaffolding – Workarounds für die Kontextbeschränkungen der Modellarchitektur. Das zugrundeliegende Constraint: Attention-Compute skaliert quadratisch mit der Kontextlänge, was direktes Reasoning über große Artefakte prohibitiv teuer macht.
SSA ersetzt den O(n²) Dense-Attention-Pass durch eine gelernte sparse Formulierung, die linear mit der Kontextlänge skaliert.
Benchmarks: Needle-in-a-Haystack bis 12M Token
| Benchmark | SubQ 1.1 Small |
|---|---|
| NIAH @ 1M | 100% |
| NIAH @ 2M | 100% |
| NIAH @ 6M | 98% |
| NIAH @ 12M | 98% |
| RULER @ 128K | 99.12% |
Das Modell wurde primär bei 1M Token trainiert, die Retrieval-Leistung hielt jedoch nahezu perfekt bei 12x dieser Länge – trotz Kompression der Attention auf nur 0.13% der Beziehungen. Diese Generalisierung folgt direkt aus SSAs inhaltsbasiertem Attention-Routing statt fixer Positionsmuster.
Effizienz-Vergleich
Bei 1M Token:
- 64.5x weniger Compute als Dense Attention
- 56x schneller als FlashAttention-2
Knowledge & Coding Benchmarks
| Benchmark | SubQ 1.1 Small | GPT-5.5 | Opus 4.8 | Sonnet 4.6 |
|---|---|---|---|---|
| GPQA Diamond (pass@1) | 85.4 | 93.2 | 92 | 87.5 |
| LiveCodeBench v6 (pass@4) | 89.7 | 92 | 92.2 | 88.9 |
| AutomationBench Finance | 13% | 18% | 16% | 8% |
SubQ 1.1 Small balanciert Long-Context-Optimierung mit allgemeinem Reasoning ohne Kompromisse. GPQA Diamond bei 85.4% liegt knapp unter den mid-tier Frontier-Modellen, LiveCodeBench bei 89.7% pass@4 nahe am absoluten Frontier.
Deployment-Pläne
Subquadratic deployt SubQ 1.1 Small aktuell mit ausgewählten Design-Partnern. Eine breitere Modell-Line von 2M bis 12M Token ist für später im Jahr geplant.