Ein Token ist ein Wortstück, in das ein Sprachmodell Text zerlegt, und das Kontextfenster ist die Höchstmenge an Tokens, die es bei einer Anfrage gleichzeitig berücksichtigen kann: Ihre Anweisung, der bisherige Verlauf, mitgegebene Dokumente und die Antwort. Passt etwas nicht mehr hinein oder geht in der Menge unter, wirkt es, als würde die KI vergessen. Abgerechnet wird meist nach Tokens.
Was ist ein Token?
Ein Sprachmodell liest keine Buchstaben und keine ganzen Wörter, sondern Tokens. Häufige Wörter sind oft ein Token, seltene oder lange Wörter werden in mehrere Teile zerlegt. Als Faustregel für Englisch gelten laut OpenAI etwa 100 Tokens für 75 Wörter. Im Deutschen entfallen wegen der langen Zusammensetzungen meist weniger Wörter auf 100 Tokens. Ein Text mit 3.000 englischen Wörtern entspräche nach dieser Regel etwa 4.000 Tokens.
Wie das Zerlegen aussieht, zeigt der Tokenizer von OpenAI. Wie Sprachmodelle insgesamt funktionieren, erklärt Was ist ein LLM?.
Was ist das Kontextfenster, und warum „vergisst“ die KI?
Das Kontextfenster ist die Menge an Text, die das Modell bei einer Antwort gleichzeitig sieht. Dazu zählt alles: Ihre Anweisung, der bisherige Chatverlauf, hochgeladene Dokumente und die Antwort selbst. Das Modell hat keinen dauerhaften Speicher. Bei jeder Nachricht wird der gesamte Verlauf erneut mitgeschickt.
Ist das Fenster voll, müssen ältere Teile gekürzt oder weggelassen werden, und die KI „vergisst“ sie. Aber auch innerhalb des Fensters gilt: Eine Untersuchung zeigt, dass Modelle Informationen am Anfang und Ende langer Texte besser nutzen als solche in der Mitte (Liu et al., „Lost in the Middle“).
Wie entstehen die Kosten?
Anbieter rechnen häufig nach Tokens ab, getrennt nach Eingabe (was das Modell liest) und Ausgabe (was es schreibt). Ausgabe-Tokens sind oft teurer. Es gilt: Je länger der Verlauf und je größer die Dokumente, desto mehr Tokens werden bei jeder Antwort verarbeitet und desto höher die Kosten und die Wartezeit. Konkrete Preise ändern sich häufig; prüfen Sie immer die aktuelle Preisseite Ihres Anbieters.
| Begriff | Bedeutung | Praktische Folge |
|---|---|---|
| Token | Wortstück, Abrechnungseinheit | Lange Texte kosten mehr |
| Kontextfenster | Maximale Tokens pro Anfrage | Alles darüber geht verloren oder wird gekürzt |
| Eingabe | Anweisung, Verlauf, Dokumente | Wächst mit jedem Chatbeitrag |
| Ausgabe | Antwort des Modells | Oft höher bepreist |
| Gedächtnisfunktion | Gespeicherte Hinweise zwischen Chats | Nur aktiv, wenn eingeschaltet, und datenschutzrelevant |
Wie sparen Sie Tokens und vermeiden Gedächtnislücken?
Beginnen Sie für jedes neue Thema einen neuen Chat, statt einen langen Verlauf weiterzuführen. Fassen Sie Zwischenergebnisse zusammen und geben Sie die Zusammenfassung mit. Setzen Sie Wichtiges an den Anfang oder das Ende der Anweisung und wiederholen Sie zentrale Vorgaben.
Geben Sie nur die relevanten Teile eines Dokuments mit, nicht den ganzen Ordner. Bei großen Wissensbeständen lohnt sich ein Verfahren, das passende Stellen gezielt heraussucht, wie es Was ist RAG? beschreibt. Ein größeres Kontextfenster ist nicht automatisch besser: Es kostet mehr, dauert länger und schützt nicht vor Fehlern, wie KI-Halluzinationen zeigt.
- Für neue Themen einen neuen Chat gestartet
- Lange Verläufe in einer Zusammenfassung verdichtet
- Wichtige Vorgaben am Anfang oder Ende der Anweisung platziert
- Nur relevante Dokumentteile mitgegeben
- Tokenverbrauch einer typischen Aufgabe gemessen
- Gedächtnisfunktionen und Datenschutzeinstellungen geprüft
Fazit: Weniger, aber gezielter Kontext
Wer Tokens und Kontextfenster versteht, bekommt bessere Antworten zu niedrigeren Kosten. Geben Sie dem Modell das Nötige mit und halten Sie Verläufe kurz. Wenn Sie KI in Abläufe einbauen möchten, sehen Sie sich unsere KI-Automatisierung an oder schildern Sie uns Ihre Aufgabe.




