Article
Castform + Neon: Open-Source 4B Modell schlägt GPT-5.6 bei Retrieval — 100x günstiger
Kurzfassung
Neon (Lakebase Postgres) und Castform zeigen, dass ein 4B open-weights Modell nach RL-Post-Training GPT-5.6 Sol bei Retrieval-Tasks erreicht — bei 100x niedrigeren Kosten pro Request. Statt teure Frontier-Modelle für Multi-Hop-Search-Loops aufzurufen, post-trainiert man ein kleines Modell auf den eigenen Daten.
Das Problem mit agentic Retrieval
Klassische RAG-Pipelines (Embedding-Search, ein Query, ein Response) sind 2022-Technologie. 2025+ machen Agents Multi-Hop-Search: zerlegen Probleme, suchen mehrfach, planen. Jede Loop-Iteration bedeutet einen API-Call an ein Frontier-Modell. Eine typische Multi-Turn-Search mit GPT-5.6 Sol dauert >10s und kostet ~$0.03 pro Request. Skali nicht.
Castforms Ansatz: RL-Post-Training auf eigenen Daten
Die Idee ist simpel: Die besten Trainingsdaten liegen bereits in Unternehmensdatenbanken — interne Doku, Support-Artikel, Produkt-Records. Castform macht daraus automatisch Trainings-Tasks:
- Dokument aus der eigenen DB → Ground Truth inferiert → Frage synthetisch generiert
- Reward-Function definiert: Retrieval (richtige Quelle?), Citation (richtiger Chunk?), Correctness (richtige Antwort?)
- RL-Loop: Modell versucht die Task, Reward scored den Versuch, Feedback leitet das Training
Die Pipeline läuft gegen Neon Lakebase Search (BM25 + Vector + RRF-Merge). Trainings-Environment und Production-Inference nutzen dieselbe Search-Tool-Call-Schnittstelle.
Warum das wichtig ist
- 4B Modell, nicht 200B: Läuft lokal, günstig, keine API-Abhängigkeit
- 100x Cost-Reduction gegenüber Frontier-Modell-Loops
- Eigene Daten, eigenes Modell: Keine Daten verlassen die Infrastruktur
- Castform als Plattform: RL-Post-Training ohne ML-PhD — “post-training as approachable as prompt engineering”
Fazit
Das ist der Weg. Nicht jedes Retrieval-Problem braucht GPT-5.6. Ein post-trainiertes 4B-Modell auf der eigenen Datenbasis ist billiger, schneller, kontrollierbarer. Castform macht den RL-Part zugänglich, Neon liefert die Search-Infrastruktur. Wer noch Multi-Hop-RAG mit Frontier-APIs betreibt, sollte sich das ansehen.
Quelle: Neon Blog: How Castform + Neon Beats Frontier Models