Thinking · Aug 2026 · Effizienz

Kontext ist ein Budget.

Tokens verhalten sich wie Geld. Wer sie nicht budgetiert, gibt sie aus, ohne es zu merken. Über die Zahl, die in keinem Dashboard steht, und darüber, was sich ändert, sobald man sie hinschreibt.

Jedes AI-System hat ein Kontext-Budget, ob es eines führt oder nicht. Jede Anfrage trägt ein Fenster endlicher Grösse, und alles, was darum konkurriert, gibt vom selben Konto aus: Instruktionen, Dokumente, Verlauf und Tool-Ausgaben. Die meisten Teams sehen dieses Konto nie an. Sie bemerken den Stand erst, wenn er aufgebraucht ist. Dann werden die Antworten vager, die Latenz steigt und die Rechnung kommt.

Die unsichtbare Ausgabe

Unbudgetierter Kontext scheitert leise. Ein Retrieval-Schritt, der vierzig Ausschnitte liefert statt sechs, wirft keinen Fehler. Er begräbt nur die zwei Zeilen, auf die es ankam, unter achtunddreissig, auf die es nicht ankam. Das Modell tut daraufhin, was Modelle mit Überschuss tun: Es mittelt. Die Antwort ist nicht falsch genug, um jemanden zu alarmieren, aber sie ist schlechter, als sie hätte sein müssen, und kostet ein Vielfaches.

Ein längeres Fenster ist nicht gratis

Die Kosten eines langen Prompts stecken nicht nur in der Rechnung. Der Aufmerksamkeitsmechanismus eines Transformers setzt jedes Token zu jedem anderen in Beziehung, der Rechenaufwand wächst also quadratisch mit der Länge der Eingabe. Implementierungen wie FlashAttention senken den Speicherverkehr erheblich, ändern an dieser Grundgrösse aber nichts. Dazu kommt der KV-Cache, in dem die Zwischenzustände der bisherigen Tokens liegen. Er wächst linear mit der Länge und belegt auf dem Server Speicher, der anderen Anfragen fehlt. Ein grosszügig gefülltes Fenster verteuert damit nicht nur die eigene Anfrage, sondern senkt auch, wie viele Anfragen dieselbe Maschine gleichzeitig bedienen kann.

Mehr Kontext macht Antworten nicht automatisch besser

Der verbreitete Reflex lautet: Solange das Fenster reicht, schadet zusätzlicher Kontext nicht. Die Messungen sagen etwas anderes. Die viel zitierte Arbeit «Lost in the Middle» von Liu und Kollegen aus dem Jahr 2023 hat systematisch variiert, an welcher Stelle einer langen Eingabe die benötigte Information steht. Das Ergebnis ist eine U-Kurve: Modelle finden die Information zuverlässig, wenn sie am Anfang oder am Ende steht, und deutlich schlechter, wenn sie in der Mitte liegt. Das galt auch für Modelle, die ausdrücklich für lange Kontexte gebaut wurden.

Daraus folgt eine unbequeme Konsequenz. Wer die entscheidenden zwei Zeilen in achtunddreissig weitere einbettet, senkt die Chance, dass sie überhaupt benutzt werden. Zusätzlicher Kontext ist nicht neutral, er verdünnt das, worauf es ankommt. Position im Prompt ist damit eine Entwurfsentscheidung und keine Nebensache.

Was ein System liest, ist eine Entscheidung. Wer sie nicht trifft, hat trotzdem entschieden.

Was ein Budget verändert

Ein Budget ist keine Obergrenze. Es ist eine Frage vor jeder Ausgabe: Was braucht diese Aufgabe wirklich? Wer sie stellt, wählt bewusster aus, weil jedes Material seine Tokens verdienen muss, und gibt diesem Material eine Form, die dieselbe Bedeutung auf weniger Raum trägt. Die Herkunft fällt dabei gratis an, denn ein System, das entscheidet, was es liest, kann auch sagen, was es gelesen hat.

Warum hier keine Sparquote steht

An dieser Stelle stünde gern eine Zahl, und wir nennen bewusst keine. Frühere Benchmark-Werte zu LeanCTX haben wir zurückgezogen, weil sie unseren eigenen Anforderungen nicht genügten, und sie stehen seither ausdrücklich nicht mehr für Produkttexte zur Verfügung. Ein Gewinn zählt bei uns erst, wenn derselbe Workload eine bekannte Baseline und Behandlung hat, eine erklärte Qualitätsschwelle und eine sichtbare Methodik. Eine Aufgabe, die billiger wird und dabei scheitert, ist kein Gewinn.

Was stattdessen im Werkzeug steckt, ist die Buchhaltung. Jede Einsparung wird pro Lauf protokolliert, in einer hash-verketteten Kette, deren Integrität geprüft werden kann. Die Zahl, die am Ende auf dem Tisch liegt, ist damit eure eigene und nicht unsere. Das ist weniger griffig als eine Prozentangabe auf einer Startseite und deutlich schwerer zu bestreiten.

Der Einwand

Modelle werden billiger und Fenster länger. Warum also eine Ressource budgetieren, deren Preis jedes Quartal fällt? Weil es beim Budget nie hauptsächlich um Geld ging. Ein Fenster ist Aufmerksamkeit, und Aufmerksamkeit skaliert nicht mit ihrem Behälter. Je mehr ein Modell bekommt, desto weniger wiegt die einzelne Zeile, und die U-Kurve verschwindet nicht dadurch, dass das Fenster wächst.

Auf diesem Argument ist LeanCTX gebaut, und an diesem Massstab messen wir unsere eigenen Zahlen.

Widerspruch?

Sag uns, wo wir falschliegen.

Das ist eine Arbeitsnotiz, kein Urteil. Wenn eure Zahlen unseren widersprechen, ist das genau die Mail, die wir wollen.