Zum Inhalt springen
Zurück zum KI-Glossar
Workflows

Reranking

Suchtreffer in einem zweiten Schritt genauer nach Relevanz sortieren, bevor die KI antwortet.

Erklärung

Reranking ist ein zweiter Sortierschritt in der Suche: Aus einer größeren Menge von Treffern wählt ein spezialisiertes Modell die wirklich relevanten aus und bringt sie in die richtige Reihenfolge. In RAG-Systemen verbessert das die Antwortqualität oft deutlich.

So funktioniert's

Zuerst liefert eine schnelle Suche, etwa per Embeddings oder Stichworten, zum Beispiel 50 Kandidaten. Ein Reranker bewertet dann jede Kombination aus Frage und Textabschnitt genauer und vergibt einen Relevanzwert. Nur die besten fünf bis zehn Abschnitte gehen an das Sprachmodell.

Praxisbeispiel

Auf die Frage „Welche Garantie gilt für Ersatzteile nach einer Reparatur?“ findet die Vektorsuche viele Abschnitte über Garantie allgemein. Der Reranker erkennt den einen Absatz, der sich konkret auf reparierte Teile bezieht, und setzt ihn an die erste Stelle.

Warum es wichtig ist

Ein RAG-System kann nur so gut antworten wie die Dokumente, die es findet. Reranking ist oft der Schritt mit dem besten Verhältnis aus Aufwand und Qualitätsgewinn, gerade bei großen, ähnlich formulierten Dokumentbeständen.

Warum braucht RAG einen Reranker?

Die erste Suchstufe in einem RAG-System muss schnell sein und große Bestände durchsuchen. Dafür werden Frage und Dokumente getrennt voneinander in Embeddings umgewandelt, verglichen werden nur die Vektoren. Das ist effizient, aber ungenau: Feine Unterschiede, Verneinungen oder der genaue Bezug einer Aussage gehen verloren. Deshalb landen oft ähnlich klingende, aber unpassende Abschnitte weit oben.

Der Reranker gleicht das aus, indem er nur die kleine Kandidatenmenge genauer prüft. So lässt sich die erste Stufe großzügig einstellen, damit nichts Relevantes fehlt, während der Reranker für Präzision sorgt. Anthropic hat 2024 gezeigt, dass kontextangereicherte Chunks in Kombination mit Reranking die Zahl der Fehltreffer bei der Suche deutlich senken.

Cross-Encoder vs. ColBERT: Welche Reranking-Verfahren gibt es?

Ein Cross-Encoder liest Frage und Textabschnitt gemeinsam und berechnet daraus einen Relevanzwert. Das ist sehr genau, aber rechenintensiv, weil jede Kombination einzeln bewertet wird. Deshalb kommt er nur für wenige Dutzend Kandidaten zum Einsatz. Beispiele sind die Rerank-Modelle von Cohere oder Open-Source-Modelle wie die BGE-Reranker.

ColBERT und verwandte Late-Interaction-Verfahren speichern für jedes Token eines Dokuments einen eigenen Vektor und vergleichen erst bei der Suche Token für Token mit der Frage. Das ist genauer als ein einzelner Vektor pro Abschnitt und schneller als ein Cross-Encoder, braucht aber mehr Speicher. Daneben lassen sich auch LLMs als Reranker einsetzen, was flexibel, aber vergleichsweise teuer und langsam ist.

Häufige Fragen

Was ist Reranking?

Reranking ist das erneute, genauere Sortieren von Suchergebnissen nach Relevanz. In RAG-Systemen sorgt es dafür, dass die wirklich passenden Textabschnitte an das Sprachmodell übergeben werden.

Wie viel Latenz verursacht Reranking?

Bei einigen Dutzend Kandidaten meist nur wenige hundert Millisekunden oder weniger, abhängig von Modell und Hardware. Im Vergleich zur Antwortgenerierung durch das LLM fällt das selten ins Gewicht.

Brauche ich immer einen Reranker?

Nicht immer. Bei kleinen, klar strukturierten Wissensbeständen reicht oft eine gute hybride Suche. Wenn die Antwortqualität leidet, weil falsche Abschnitte gefunden werden, ist Reranking meist eine der ersten Maßnahmen.

Bereit, KI wirklich zum Laufen zu bringen?

Vereinbare dein kostenloses 30-Minuten-Erstgespräch — unverbindlich und vertraulich.

Erstgespräch buchen