Codex Auto-Compact bei GPT-6 Sol: die Defaults im Quellcode und was ihre Erhöhung kostet
Aktualisiert September 27, 2026 · erstveröffentlicht September 27, 2026
Codex komprimiert eine GPT-6-Sol-Sitzung automatisch bei 244.800 Tokens: 90 % des 272.000-Token-Fensters, das es dem Modell zuweist. Wer model_auto_compact_token_limit über diese Zahl anhebt, erreicht nichts, solange er nicht auch model_context_window anhebt. Wird das Fenster über 272K hinaus vergrößert, wird jeder Turn, der die Grenze überschreitet, zu Long-Context-Preisen abgerechnet. Wir haben die Zahlen aus dem Quellcode von Codex 0.157.1 und aus dem Modellkatalog gelesen, den Codex herunterlädt.
Welches Kontextfenster gibt Codex GPT-6 Sol?
272.000 Tokens, obwohl die API bis zu 922.000 akzeptiert. Codex lädt einen Modellkatalog herunter und legt ihn in ~/.codex/models_cache.json im Cache ab. Der Eintrag für gpt-6-sol nennt ein context_window von 272.000 und ein max_context_window von 872.000. Außerdem setzt er effective_context_window_percent auf 95 und lässt auto_compact_token_limit leer. GPT-6 Astra und GPT-6 Luna haben dieselben Werte.
272K ist keine beliebige Zahl. Genau dort beginnt die GPT-6-Preisgestaltung für langen Kontext.
| Wert | Tokens | Woher er stammt |
|---|---|---|
| Kontextfenster | 272.000 | context_window im Modellkatalog |
| Nutzbares Fenster | 258.400 | 95 % des Fensters (effective_context_window_percent) |
| Auto-Compact-Schwelle | 244.800 | 90 % des Fensters, im Code berechnet |
| Größtes erlaubtes Fenster | 872.000 | max_context_window im Modellkatalog |
| API-Eingabelimit | 922.000 | OpenAI-Modellspezifikation (1,05M insgesamt mit Ausgabe) |
Wie entscheidet Codex, wann komprimiert wird?
Es nimmt den kleineren Wert aus Ihrem konfigurierten Limit und 90 % des Kontextfensters. In codex-rs/protocol/src/openai_models.rs berechnet auto_compact_token_limit() den Wert context_window * 9 / 10. Es gibt diesen Wert oder Ihr konfiguriertes Limit zurück, je nachdem, was niedriger ist. Der Katalog liefert für GPT-6 Sol kein Limit, daher ergibt sich standardmäßig 272.000 × 0,9 = 244.800.
Die Einstellung kann die Komprimierung also nur vorziehen. Setzen Sie model_auto_compact_token_limit = 300000 in config.toml bei Standardfenster, und Codex komprimiert trotzdem bei 244.800, ohne jede Warnung. Um später zu komprimieren, müssen Sie auch model_context_window anheben, und das verschiebt auch die Obergrenze: beim Maximum von 872.000 wird die Standardschwelle zu 784.800.
Eine zweite Einstellung, model_auto_compact_token_limit_scope, steht standardmäßig auf total und zählt den gesamten aktiven Kontext. Die Alternative, body_after_prefix, zählt nur das, was die Unterhaltung nach dem zuvor mitgebrachten Kontext hinzufügt.
Was kostet es, das Codex-Fenster über 272K hinaus zu erweitern?
Pro Turn deutlich mehr als die zusätzlichen Tokens. Sobald eine GPT-6-Sol-Anfrage mehr als 272K Eingabe-Tokens hat, wird die gesamte Anfrage zu Long-Context-Preisen abgerechnet. Eingabe und gecachte Eingabe kosten doppelt so viel, die Ausgabe das 1,5-Fache. In einer langen Agent-Sitzung sendet fast jeder Turn die gesamte Historie erneut, daher ist der Großteil dieser Eingabe gecachtes Präfix.
| Kontext pro Turn | Preis gecachte Eingabe | Kosten des gecachten Kontexts pro Turn | Kosten ungecacht pro Turn |
|---|---|---|---|
| 240K (komprimiert beim Default) | $0,20 / 1M | $0,048 | $0,48 |
| 270K | $0,20 / 1M | $0,054 | $0,54 |
| 300K (Fenster erhöht) | $0,40 / 1M | $0,12 | $1,20 |
| 400K (Fenster erhöht) | $0,40 / 1M | $0,16 | $1,60 |
Von 270K auf 300K sind es 11 % mehr Tokens, aber die Kosten jedes Turns steigen auf das 2,2-Fache. Bei einem ChatGPT-Tarif sehen Sie keine Rechnung, doch dieselben Tokens zählen gegen Ihre 5-Stunden- und Wochenlimits von Codex, ein größeres Fenster verbraucht sie also schneller. Der Beitrag context-window-paid-twice erklärt, warum diese wiederholte Abrechnung lange Sitzungen dominiert.
Ist GPT-6 Sol nahe 244K Tokens noch genau?
Das hat bisher niemand gemessen. Der einzige unabhängige Long-Context-Wert für GPT-6 Sol ist Artificial Analysis AA-LCR: 84 %, genauso wie bei GPT-5.6 Sol. Die Dokumente in diesem Test haben im Schnitt etwa 100K Tokens. Die MRCR-Zahlen, die für „Sol“ bei 256K–512K zitiert werden, gehören zu GPT-5.6 Sol. Unsere Übersicht der GPT-6-Sol-Long-Context-Benchmarks listet auf, was Stand 27. September 2026 veröffentlicht ist und was nicht.
Was sollten Sie einstellen?
Für die meisten Teams nichts. Der Default ist bereits die kostensichere Wahl. Komprimieren bei 244.800 hält jede Anfrage unter der 272K-Preisgrenze, mit Platz für die Ausgabe. Drei Situationen verlangen eine Änderung:
- Sie wollen früher komprimieren, etwa weil lange Threads frühere Anweisungen verlieren. Senken Sie
model_auto_compact_token_limit, zum Beispiel auf 200000. Werte unter 244.800 greifen tatsächlich. - Sie wollen die aktuellen Defaults festschreiben, damit ein künftiges Katalog-Update sie nicht still ändern kann. Setzen Sie
model_context_window = 272000und ein Limit bei oder unter 244.800. - Sie brauchen mehr als 258K aktiven Kontext in einer Sitzung. Heben Sie
model_context_windowan und akzeptieren Sie Long-Context-Preise für jeden Turn über 272K. Richten Sie einen Alarm ein, denn nichts in der Codex-Oberfläche weist auf die Preisänderung hin.
# ~/.codex/config.toml
model = "gpt-6-sol"
model_context_window = 272000 # pin the default window, below the 272K price line
model_auto_compact_token_limit = 240000 # anything above 244,800 is ignored at this window
Quellen
- Codex-0.157.1-Quellcode:
auto_compact_token_limit()undusable_context_window() - Codex-0.157.1-Quellcode: auf die Modellinfo angewandte Konfigurations-Overrides
- Codex-0.157.1-Quellcode: Komprimierungsumfang und harte Kontextobergrenze
- OpenAI-API-Preise
- Artificial Analysis: GPT-6 Sol vs GPT-5.6 Sol
Weiterführend
- GPT-6-Sol-Long-Context-Benchmarks: was tatsächlich gemessen wurde
- GPT-6-Preise und der Preissprung bei 272K Long Context
- Sie bezahlen das Kontextfenster zweimal
- Wie viel Codex enthält ChatGPT Pro?
Möchten Sie das auf Ihren Stack anwenden? Bringen Sie Anbieterrechnungen, Gateway-Protokolle und die wichtigsten Workflows mit; wir ordnen Kostentreiber und Einsparpotenziale zu. Kostenlose Prüfung buchen →