Thinking · Jun 2026 · Retrieval

Retrieval ist nicht Suche.

Suche beantwortet die Frage, was ähnlich aussieht. Retrieval muss beantworten, was eine Aufgabe braucht. In der Lücke zwischen diesen beiden Fragen scheitern AI-Systeme.

Suche ist gelöst. Embedding-Modelle finden zuverlässig, was einem Text ähnlich sieht, und zwar schneller und gründlicher, als ein Mensch es je könnte. Nur war Ähnlichkeit nie die Frage. Eine Aufgabe fragt danach, was sie zum richtigen Ergebnis braucht, und das ist ein Urteil und keine Distanz im Vektorraum.

Ähnlich ist nicht wichtig

Wer nach einer Kündigungsfrist fragt, bekommt zehn Absätze, die nach Kündigung klingen, aber nicht zwingend den einen, der für diesen Vertrag gilt. Alle zehn sind ähnlich, einer ist relevant. Ein System, das den Unterschied nicht kennt, füllt das Fenster mit Plausiblem und verdrängt damit das Entscheidende.

Ähnlichkeit ist ein Hinweis, Relevanz ein Urteil.

Was ein Embedding kann und was nicht

Ein Embedding bildet Text auf einen Vektor ab, und die Nähe zweier Vektoren steht für semantische Ähnlichkeit. Das ist eine echte Leistung, aber es ist genau eine Eigenschaft. Ein Embedding weiss nicht, welches von zwei ähnlichen Dokumenten das aktuellere ist, welches für diesen Vertrag gilt, welches von einer zuständigen Stelle stammt und welches ein verworfener Entwurf war. Diese Merkmale stehen nicht im Vektorraum, weil sie nicht im Text stehen. Sie stehen in den Metadaten, im Ablauf und in der Aufgabe.

Der Zuschnitt entscheidet mit

Bevor irgendetwas gefunden wird, muss der Text zerteilt werden. Zerschneidet man zu fein, verliert eine Passage ihren Bezug, und ein Satz wie «Diese Frist gilt nicht für Kaderverträge» steht ohne den Vertrag da, auf den er sich bezieht. Zerschneidet man zu grob, kommt mit jedem Treffer viel Beiwerk mit, das Platz im Fenster kostet. Der Zuschnitt ist damit kein Vorverarbeitungsdetail, sondern eine der wirksamsten Stellschrauben im ganzen System.

Was in der Praxis hilft

Drei Dinge haben sich bei uns bewährt. Erstens die Kombination aus Stichwortsuche und Vektorsuche, weil Zahlen, Aktenzeichen und Eigennamen von einer klassischen Suche zuverlässiger gefunden werden als von einem Embedding. Zweitens ein zweiter Bewertungsschritt, der die Kandidaten aus der ersten Runde noch einmal ordnet, statt sich auf einen einzigen Ähnlichkeitswert zu verlassen. Drittens harte Filter aus Metadaten, also Gültigkeit, Zuständigkeit und Aktualität, bevor überhaupt sortiert wird.

Der Preis gehört in denselben Absatz. Jede zusätzliche Stufe kostet Latenz, und wenn sie ein eigenes Modell aufruft, auch Geld. Sie lohnt sich, wenn sie die Zahl der mitgeschickten Ausschnitte deutlich senkt. Sie lohnt sich nicht, wenn man danach trotzdem alles mitschickt, und genau so wird sie oft eingebaut.

Die falsche Messgrösse

Retrieval-Systeme werden meist an Recall gemessen: Wie viele der passenden Dokumente sind unter den ersten k Treffern? Diese Zahl belohnt Grosszügigkeit, denn wer mehr zurückgibt, findet mehr. Für ein System mit begrenztem Fenster ist sie deshalb irreführend. Die nützlichere Frage lautet, wie viel Richtigkeit pro Token erreicht wird, und sie bestraft jeden Ausschnitt, der nichts beiträgt.

Wer Retrieval als Nebenprodukt seiner Vektordatenbank behandelt, misst deshalb die falsche Grösse und bezahlt die Differenz in jedem einzelnen Lauf.

Widerspruch?

Sag uns, wo wir falschliegen.

Das ist eine Arbeitsnotiz, kein Urteil. Wenn eure Zahlen unseren widersprechen, ist das genau die Mail, die wir wollen.