Dit artikel beschrijft Issue #37674, waarbij de Native Codex CLI geen gebruik kan maken van expliciete prompt-caching voor het GPT-5.6 Sol model via Amazon Bedrock. Bij agentische codeerworkloads resulteert dit in een groot volume aan cache-schrijftokens, waardoor de kosten aanzienlijk stijgen; in onderzochte gevallen vormden cache-schrijfacties ongeveer 85% van de totale uitgaven.
Technische analyse: Het probleem wordt veroorzaakt door het ontbreken van promptcacheoptions en promptcachebreakpoint in de HTTP- en WebSocket-responses. Omdat de huidige providerconfiguratie geen gestructureerde transformatie van de request-body toestaat, is dit niet aanpasbaar via config.toml.
Gewenste oplossingen:
- Ondersteuning voor het serialiseren van
promptcacheoptions.
- Toevoeging van een getypeerd
promptcachebreakpoint-veld.
- Implementatie van een provider/model capability gate.
- Verbeterde telemetrie om cache-lees- en schrijfacties per beurt zichtbaar te maken.
Native Bedrock Codex GPT-5.6 Sol mist expliciete cache-besturingen, wat leidt tot hoge cache-schrijfuitgaven (Issue #37674)
Samenvatting
Dit probleem is gerelateerd aan issue #35300, maar voegt onafhankelijk bewijs van productiegebruik toe vanuit de native amazon-bedrock provider.
Omgeving
- Codex CLI: 0.147.0
- Provider: native amazon-bedrock
- Endpoint: Bedrock Mantle Responses API, us-east-1
- Model: openai.gpt-5.6-sol
Waargenomen gebruik in productie
Voor de voltooide dagen van 5 augustus 2026 tot en met 8 augustus 2026, leverden de gebruikshoeveelheden uit Cost Explorer en de Bedrock-prijslijst de volgende cache-bewuste schatting op voor Sol:
| Verzoeken | Cache-schrijftokens | Geschatte kosten cache-schrijven | Geschatte totale kosten |
| 3.656 | 171,94M | $1.182,09 | $1.386,46 |
Cache-schrijfacties vormden ongeveer 85% van de geschatte uitgaven van het model.
Een lokale Codex-sessie rapporteerde daarnaast 76 Sol-verzoeken met 6,709M cachewriteinputtokens, nul cachedinput_tokens, en een gemiddelde van ongeveer 88K cache-schrijftokens per verzoek. In de bijbehorende CloudWatch-metrics waren geen clientfouten zichtbaar.
Let op: Dit zijn schattingen op basis van verbruik, geen definitieve AWS-factuurbedragen.
Onderzoek
Codex verzendt al een session-scoped promptcachekey, maar de verzoektypes voor zowel HTTP- als WebSocket-responses bevatten geen van de volgende elementen:
promptcacheoptions
promptcachebreakpoint
De ingebouwde Amazon Bedrock-providerconfiguratie stelt enkel transport- en authenticatie-instellingen beschikbaar, en geen gestructureerde transformatie van het request-body. Hierdoor kan dit niet worden geconfigureerd via config.toml.
AWS documenteert de expliciete cache-modus voor GPT-5.6 op Bedrock specifiek voor agentische workflows waarbij lange, stabiele instructies of tool-definities worden gevolgd door variabele tool- en gebruikersinhoud. Dit komt exact overeen met de bovenstaande workload.
Gewenste functionaliteit
- Voeg ondersteuning toe voor het serialiseren van
promptcacheoptions voor Responses-providers die GPT-5.6 ondersteunen.
- Voeg een getypeerd
promptcachebreakpoint-veld toe aan ondersteunde input-contentblokken.
- Implementeer een provider/model capability gate en een veilige plaatsingsstrategie aan het einde van het gemeten stabiele instructie-/tool-prefix van Codex.
- Maak cache-leesacties en cache-schrijfacties zichtbaar in de per-beurt gebruiks-telemetrie, zodat gebruikers kostbare volledige-prefix-herschrijvingen kunnen diagnosticeren.
Reikwijdte
Dit rapport stelt niet dat elke cache-schrijfactie een defect is. Cold starts, wezenlijk verschillende prompts, forks en compactie kunnen allemaal schrijfacties vereisen. Het probleem is dat native Bedrock Codex momenteel geen manier heeft om het gedocumenteerde expliciete cache-mechanisme te gebruiken voor scenario's met een stabiel prefix.
Native Bedrock Codex GPT-5.6 Sol mist expliciete cache-besturingen, wat leidt tot hoge cache-schrijfuitgaven (Issue #37674)
Samenvatting
Dit probleem is gerelateerd aan issue #35300, maar voegt onafhankelijk bewijs van productiegebruik toe vanuit de native amazon-bedrock provider.
Omgeving
- Codex CLI: 0.147.0
- Provider: native amazon-bedrock
- Endpoint: Bedrock Mantle Responses API, us-east-1
- Model: openai.gpt-5.6-sol
Waargenomen gebruik in productie
Voor de voltooide dagen van 5 augustus 2026 tot en met 8 augustus 2026, leverden de gebruikshoeveelheden uit Cost Explorer en de Bedrock-prijslijst de volgende cache-bewuste schatting op voor Sol:
| Verzoeken | Cache-schrijftokens | Geschatte kosten cache-schrijven | Geschatte totale kosten |
| 3.656 | 171,94M | $1.182,09 | $1.386,46 |
Cache-schrijfacties vormden ongeveer 85% van de geschatte uitgaven van het model.
Een lokale Codex-sessie rapporteerde daarnaast 76 Sol-verzoeken met 6,709M cachewriteinputtokens, nul cachedinput_tokens, en een gemiddelde van ongeveer 88K cache-schrijftokens per verzoek. In de bijbehorende CloudWatch-metrics waren geen clientfouten zichtbaar.
Let op: Dit zijn schattingen op basis van verbruik, geen definitieve AWS-factuurbedragen.
Onderzoek
Codex verzendt al een session-scoped promptcachekey, maar de verzoektypes voor zowel HTTP- als WebSocket-responses bevatten geen van de volgende elementen:
promptcacheoptions
promptcachebreakpoint
De ingebouwde Amazon Bedrock-providerconfiguratie stelt enkel transport- en authenticatie-instellingen beschikbaar, en geen gestructureerde transformatie van het request-body. Hierdoor kan dit niet worden geconfigureerd via config.toml.
AWS documenteert de expliciete cache-modus voor GPT-5.6 op Bedrock specifiek voor agentische workflows waarbij lange, stabiele instructies of tool-definities worden gevolgd door variabele tool- en gebruikersinhoud. Dit komt exact overeen met de bovenstaande workload.
Gewenste functionaliteit
- Voeg ondersteuning toe voor het serialiseren van
promptcacheoptions voor Responses-providers die GPT-5.6 ondersteunen.
- Voeg een getypeerd
promptcachebreakpoint-veld toe aan ondersteunde input-contentblokken.
- Implementeer een provider/model capability gate en een veilige plaatsingsstrategie aan het einde van het gemeten stabiele instructie-/tool-prefix van Codex.
- Maak cache-leesacties en cache-schrijfacties zichtbaar in de per-beurt gebruiks-telemetrie, zodat gebruikers kostbare volledige-prefix-herschrijvingen kunnen diagnosticeren.
Reikwijdte
Dit rapport stelt niet dat elke cache-schrijfactie een defect is. Cold starts, wezenlijk verschillende prompts, forks en compactie kunnen allemaal schrijfacties vereisen. Het probleem is dat native Bedrock Codex momenteel geen manier heeft om het gedocumenteerde expliciete cache-mechanisme te gebruiken voor scenario's met een stabiel prefix.