Geben Sie einem Modell ein hundertseitiges Dokument und fragen Sie nach etwas auf Seite fünfzig, kann es die Antwort verfehlen — nicht weil die Information nicht im Kontext steht, sondern wegen ihrer Position.
TL;DR
- LLMs nutzen Anfang und Ende eines langen Kontexts weit besser als die Mitte.
- Der Effekt ist U-förmig und tritt selbst bei Modellen auf, die ausdrücklich für lange Kontexte gebaut wurden.
- Informationen ins Fenster zu bekommen ist nicht dasselbe, wie dass das Modell sie auch nutzt.
Das Versprechen und der Haken
Größere Kontextfenster verkaufen eine verlockende Idee: einfach alles hineinkopieren und das Modell sortieren lassen. Kein Retrieval, keine Struktur — ein einziger riesiger Prompt. Doch zwischen dem Vorhandensein einer Information im Fenster und ihrer tatsächlichen Nutzung durch das Modell klafft eine Lücke, und diese Lücke wächst mit der Länge.
Was die Forschung zeigt
In Lost in the Middle: How Language Models Use Long Contexts haben Liu und Kollegen gemessen, wie gut Modelle Informationen finden und nutzen, je nachdem, wo diese im Input stehen. Sie bauten zwei bewusst kontrollierte Tests:
- Multi-Dokument-QA. Das Modell erhält eine Frage plus einen Stapel von Dokumenten — 10, 20 oder 30 davon —, von denen genau eines die Antwort enthält. Dieses Golddokument wird an jede Position im Stapel geschoben, und an jeder Stelle wird die Genauigkeit gemessen.
- Key-Value-Retrieval. Ein synthetischer Test, von sprachlichem Ballast befreit: ein langes JSON-Objekt aus Hunderten zufälliger Schlüssel-Wert-Paare, bei dem das Modell den Wert für einen bestimmten Schlüssel zurückgeben muss — das isoliert die reine positionsbasierte Suche vom Verständnis.
Über beide Aufgaben hinweg und über offene wie geschlossene Modelle gleichermaßen (GPT-3.5-Turbo, Claude, MPT-30B-Instruct, LongChat-13B) zeigte sich dieselbe Form: Die Genauigkeit ist am höchsten, wenn das relevante Element nahe am Anfang oder Ende des Kontexts steht, und sinkt, wenn das Modell in die Mitte greifen muss — eine U-förmige Kurve.
Die Leistung ist oft am höchsten, wenn die relevante Information am Anfang oder Ende des Eingabekontexts steht, und verschlechtert sich deutlich, wenn Modelle in der Mitte darauf zugreifen müssen.
Drei Details machen es schlimmer, als es zunächst klingt. Es gilt selbst für Modelle, die für lange Kontexte gebaut wurden — ein größeres Fenster bedeutet nicht, dass das Modell es gleichmäßig liest. Im schlimmsten Fall (der Mitte) kann die Multi-Dokument-Genauigkeit unter die Closed-Book-Baseline fallen — dasselbe Modell, das ganz ohne Dokumente antwortet, allein aus seinen Parametern. Und einem Modell die Variante seiner selbst mit erweitertem Kontext zu geben, brachte keinen Vorteil, wenn der Input bereits ins kleinere Fenster passte: Die zusätzliche Kapazität kaufte nichts.
Eine Gegenmaßnahme bewegte etwas: abfragebewusste Kontextualisierung — die Frage sowohl vor als auch nach den Dokumenten zu wiederholen. Sie behob die synthetische Key-Value-Aufgabe fast vollständig, half aber bei echter Multi-Dokument-QA kaum und ist somit kein allgemeines Heilmittel. Nicht bloß das Vorhandensein, sondern die Position ist es, worauf das Modell empfindlich reagiert.
Was das für Sie bedeutet
Wenn Sie sich darauf verlassen, eine lange Historie, ein großes Dokument oder ein ganzes Projekt in einen Chat zu kopieren, hängt die Antwortqualität des Modells teils vom Glück ab — davon, wo die relevante Passage zufällig landet. Je mehr der Kontext wächst, desto größer wird die zu wenig gelesene „Mitte“. Zwei praktische Konsequenzen:
- Sichtbar machen, nicht vergraben. Das relevante Material sollte das Modell als kurze, gut platzierte Passage erreichen — und nicht mitten in einer Textwand versteckt sein.
- Struktur schlägt Volumen. Die richtigen Teile zu organisieren und abzurufen übertrifft durchweg die Hoffnung, ein größeres Fenster lese sie alle.
Wo FocusLM ins Spiel kommt
Genau deshalb bewahrt FocusLM Ihr Material als strukturiertes Gedächtnis auf statt als wachsendes Chatprotokoll. Anstatt alles in einen einzigen Kontext zu stopfen und zu hoffen, dass die Mitte gelesen wird, legt es ab, was Sie ihm zuführen, und bringt die relevanten, mit Quellen belegten Teile hervor, wenn Sie fragen — sodass die Antwort im richtigen Material verankert ist, ganz gleich, woher es ursprünglich stammt.