Models

Multi-Vector Embeddings: Sentence Transformers v6.0 bringt Late Interaction

embeddings sentence-transformers colbert late-interaction retrieval huggingface

Sentence Transformers v6.0 fuehrt mit MultiVectorEncoder einen vierten Modelltyp neben Dense, Sparse und Reranker ein. Die Blog-Post von Tom Aarsen, Antoine Chaffin und Raphael Sourty erklaert, wie Late-Interaction-Modelle die Retrieval-Qualitaet heben.

Late Interaction vs Dense Embeddings

Dense Embeddings komprimieren einen Text in einen einzigen Vektor - dabei geht Token-Level-Information verloren. Multi-Vector-Modelle (ColBERT-Stil) behalten stattdessen alle Token-Embeddings bei. Ein 9-Token-Dokument wird zu einer 9x128-Matrix, nicht zu einem 1x128-Vektor. Beim Scoring vergleicht jeder Query-Token gegen jeden Dokument-Token (MaxSim-Operator) - ein kontextualisiertes Soft-Alignment, das exakte Matches und semantische Aehnlichkeit gleichzeitig beherrscht.

Benchmarks

Auf NanoBEIR (13 Datensaetze) gewinnt das Multi-Vector-Modell LateOn gegen das vergleichbare DenseOn in 9 von 13 Faellen (0,6868 vs 0,6764 NDCG@10). Der Vorteil wächst mit Dokumentlaenge: Auf MLDR erreicht mLateOn 77,92 vs mDenseOn’s 51,59. Der Preis ist ein ca. 42x groesserer Index, der sich aber mit PLAID-Kompression auf das Niveau von Dense-Modellen druecken laesst.

Praxis

from sentence_transformers import MultiVectorEncoder
model = MultiVectorEncoder("lightonai/LateOn")
query_embs = model.encode_query(queries)
doc_embs = model.encode_document(documents)
scores = model.similarity(query_embs, doc_embs)

Unterstuetzt werden PyLate-Checkpoints, Stanford-NLP ColBERT-Modelle und ColPali fuer visuelles Document Retrieval. Letzteres ist besonders spannend: Text-Queries gegen Seiten-Bilder ohne OCR, inklusive Layout und Tabellen. Dazu kommen Audio- und Video-Retrieval mit demselben Framework.

Index-Strategien

Token-Pooling mit HierarchicalTokenPooling halbiert den Index bei 100,6% Performance. Als Vektordatenbanken funktionieren Qdrant, Weaviate, Vespa, Milvus und LightOns fast-plaid. Fuer grosse Corpora empfiehlt sich Retrieve-and-Rerank: ein schneller Bi-Encoder holt Top-K, der Multi-Vektor-Model reranked.

Original: Multi-Vector Embedding Models - HuggingFace Blog