Article

Castform + Neon: Open-Source 4B Modell schlägt GPT-5.6 bei Retrieval — 100x günstiger

LLM RL Retrieval Open-Source Postgres Neon Fine-Tuning

Kurzfassung

Neon (Lakebase Postgres) und Castform zeigen, dass ein 4B open-weights Modell nach RL-Post-Training GPT-5.6 Sol bei Retrieval-Tasks erreicht — bei 100x niedrigeren Kosten pro Request. Statt teure Frontier-Modelle für Multi-Hop-Search-Loops aufzurufen, post-trainiert man ein kleines Modell auf den eigenen Daten.

Das Problem mit agentic Retrieval

Klassische RAG-Pipelines (Embedding-Search, ein Query, ein Response) sind 2022-Technologie. 2025+ machen Agents Multi-Hop-Search: zerlegen Probleme, suchen mehrfach, planen. Jede Loop-Iteration bedeutet einen API-Call an ein Frontier-Modell. Eine typische Multi-Turn-Search mit GPT-5.6 Sol dauert >10s und kostet ~$0.03 pro Request. Skali nicht.

Castforms Ansatz: RL-Post-Training auf eigenen Daten

Die Idee ist simpel: Die besten Trainingsdaten liegen bereits in Unternehmensdatenbanken — interne Doku, Support-Artikel, Produkt-Records. Castform macht daraus automatisch Trainings-Tasks:

  1. Dokument aus der eigenen DB → Ground Truth inferiert → Frage synthetisch generiert
  2. Reward-Function definiert: Retrieval (richtige Quelle?), Citation (richtiger Chunk?), Correctness (richtige Antwort?)
  3. RL-Loop: Modell versucht die Task, Reward scored den Versuch, Feedback leitet das Training

Die Pipeline läuft gegen Neon Lakebase Search (BM25 + Vector + RRF-Merge). Trainings-Environment und Production-Inference nutzen dieselbe Search-Tool-Call-Schnittstelle.

Warum das wichtig ist

  • 4B Modell, nicht 200B: Läuft lokal, günstig, keine API-Abhängigkeit
  • 100x Cost-Reduction gegenüber Frontier-Modell-Loops
  • Eigene Daten, eigenes Modell: Keine Daten verlassen die Infrastruktur
  • Castform als Plattform: RL-Post-Training ohne ML-PhD — “post-training as approachable as prompt engineering”

Fazit

Das ist der Weg. Nicht jedes Retrieval-Problem braucht GPT-5.6. Ein post-trainiertes 4B-Modell auf der eigenen Datenbasis ist billiger, schneller, kontrollierbarer. Castform macht den RL-Part zugänglich, Neon liefert die Search-Infrastruktur. Wer noch Multi-Hop-RAG mit Frontier-APIs betreibt, sollte sich das ansehen.


Quelle: Neon Blog: How Castform + Neon Beats Frontier Models