Native Bedrock Codex GPT-5.6 Sol mist expliciete cache-besturingen, wat leidt tot hoge cache-schrijfuitgaven (Issue #37674)

Samenvatting

Dit probleem is gerelateerd aan issue #35300, maar voegt onafhankelijk bewijs van productiegebruik toe vanuit de native amazon-bedrock provider.

Omgeving

  • Codex CLI: 0.147.0
  • Provider: native amazon-bedrock
  • Endpoint: Bedrock Mantle Responses API, us-east-1
  • Model: openai.gpt-5.6-sol

Waargenomen gebruik in productie

Voor de voltooide dagen van 5 augustus 2026 tot en met 8 augustus 2026, leverden de gebruikshoeveelheden uit Cost Explorer en de Bedrock-prijslijst de volgende cache-bewuste schatting op voor Sol:

VerzoekenCache-schrijftokensGeschatte kosten cache-schrijvenGeschatte totale kosten
3.656171,94M$1.182,09$1.386,46

Cache-schrijfacties vormden ongeveer 85% van de geschatte uitgaven van het model.

Een lokale Codex-sessie rapporteerde daarnaast 76 Sol-verzoeken met 6,709M cachewriteinputtokens, nul cachedinput_tokens, en een gemiddelde van ongeveer 88K cache-schrijftokens per verzoek. In de bijbehorende CloudWatch-metrics waren geen clientfouten zichtbaar.

Let op: Dit zijn schattingen op basis van verbruik, geen definitieve AWS-factuurbedragen.

Onderzoek

Codex verzendt al een session-scoped promptcachekey, maar de verzoektypes voor zowel HTTP- als WebSocket-responses bevatten geen van de volgende elementen:

  • promptcacheoptions
  • promptcachebreakpoint

De ingebouwde Amazon Bedrock-providerconfiguratie stelt enkel transport- en authenticatie-instellingen beschikbaar, en geen gestructureerde transformatie van het request-body. Hierdoor kan dit niet worden geconfigureerd via config.toml.

AWS documenteert de expliciete cache-modus voor GPT-5.6 op Bedrock specifiek voor agentische workflows waarbij lange, stabiele instructies of tool-definities worden gevolgd door variabele tool- en gebruikersinhoud. Dit komt exact overeen met de bovenstaande workload.

Gewenste functionaliteit

  1. Voeg ondersteuning toe voor het serialiseren van promptcacheoptions voor Responses-providers die GPT-5.6 ondersteunen.
  2. Voeg een getypeerd promptcachebreakpoint-veld toe aan ondersteunde input-contentblokken.
  3. Implementeer een provider/model capability gate en een veilige plaatsingsstrategie aan het einde van het gemeten stabiele instructie-/tool-prefix van Codex.
  4. Maak cache-leesacties en cache-schrijfacties zichtbaar in de per-beurt gebruiks-telemetrie, zodat gebruikers kostbare volledige-prefix-herschrijvingen kunnen diagnosticeren.

Reikwijdte

Dit rapport stelt niet dat elke cache-schrijfactie een defect is. Cold starts, wezenlijk verschillende prompts, forks en compactie kunnen allemaal schrijfacties vereisen. Het probleem is dat native Bedrock Codex momenteel geen manier heeft om het gedocumenteerde expliciete cache-mechanisme te gebruiken voor scenario's met een stabiel prefix.