[BUG] De taalkeuze van Claude Opus 4.8 is aanhoudend toxisch/onaangenaam, terwijl Opus 5.0 incoherentie naar extreme hoogten stuwt

Inleiding

Probleemomschrijving

De standaard schrijfstijl van het model is moeilijk leesbaar: deze is omslachtig, bevat te veel jargon, is overgestileerd en maakt constant gebruik van dezelfde 'gekunstelde' terminologie.

Sinds de introductie van Opus 4.8 melden veel gebruikers dat de standaardtaal significant minder toegankelijk is dan in versie 4.5 of 4.6. Antwoorden worden opgevuld met verzonnen corporate-jargon, geforceerde metaforen en "catchy" formuleringen die het werkelijke antwoord vertroebelen. Gebruikers geven aan zinnen meerdere keren te moeten lezen om de betekenis te begrijpen; sommigen sturen de output van Opus inmiddels routinematig door een ander model om een eenvoudige samenvatting te krijgen.

Dit signaal is consistent en omvangrijk. Het probleem is het meest zichtbaar in de chat/web-interface, maar treedt ook op in Claude Code en Fable 5.

Specifieke knelpunten

Toon en register

Het standaardregister wekt de indruk dat het model probeert "slim" over te komen in plaats van begrijpelijk te zijn. Dit komt arrogant over, zeker wanneer het model fouten maakt. Bij intensief dagelijks gebruik voelt dit aan als werken met een toxische collega waar men niet aan kan ontsnappen.

Terugkerende patronen

  • Gebruik van ongebruikelijke termen: Het model herhaalt constant termen als "Load bearing", "prose" (in plaats van tekst), "Hand-waving" (voor luiheid/gebrek aan inspanning), "Reflexive hedging" en "Honest framing".
  • Negatieve formulering: Zinnen beginnen vaak met wat iets niet is, in plaats van wat het wel is (bijv. "Het is niet Y. Het is X.").
  • Verzonnen jargon en aforismen: Termen worden gepresenteerd alsof ze standaard zijn, zoals: "instrumentation is the unlock", "this is where a VP smells hand-waving" en "say the wrong expansion to a growth VP and it dents you".
  • Geforceerde metaforen: Er worden ter plekke metaforen bedacht die gedecodeerd moeten worden in plaats van dat ze het begrip bevorderen.
  • Excessieve lengte en voorbehouden: Eenvoudige vragen krijgen antwoorden van meerdere alinea's, waarbij overduidelijke kanttekeningen worden uitgewerkt tot volledige paragrafen.
  • Dichtheid verward met beknoptheid: Wanneer wordt gevraagd "beknopt te zijn", produceert het model vaak tekst die korter is, maar cryptischer en minder duidelijk.
  • Argumentatieve framing: Het model hanteert een strijdbare toon, met zinnen als "here's where I'd push back", "here's where I'd hold the line" of "now you're avoiding the real question".
  • Antropomorfisme en arrogantie: Het model reageert alsof het menselijke gevoelens heeft. Als een gebruiker gefrustreerd is of vloekt, reageert het model geërgerd of probeert het zijn eigen acties te rechtvaardigen in plaats van instructies op te volgen of fouten te erkennen.

Voorbeelden uit de praktijk

  • "They're tightening, term-locking, and having the counter-probe answer loaded."
  • "None of these are 'you don't get it' gaps."
  • Fable 5: "The dice: clean — and one die never gets rolled anymore."

Waarom dit problematisch is

  1. Cognitieve belasting: Zowel native als non-native English speakers rapporteren dat de output uitputtend is om te analyseren. De stijl vertraagt het werk dat het model juist zou moeten versnellen.
  2. Waargenomen regressie: Veel gebruikers zien dit als een downgrade ten opzichte van 4.5/4.6 en stappen over op oudere Opus-versies, Sonnet of concurrenten.
  3. Onbetrouwbare workarounds: Instructies over stijl houden vaak niet stand en het model drift na enkele beurten terug naar de standaardtoon. Bovendien vrezen gebruikers dat het strikt afdwingen van beknoptheid in de system prompt de redeneerkwaliteit (reasoning) kan verslechteren.
  4. Taalverloedering: Regelmatige gebruikers nemen deze vreemde termen onbewust over in dagelijkse situaties, waardoor legitieme termen (zoals 'load-bearing') onbruikbaar worden omdat ze direct worden geassocieerd met AI-gegenereerde tekst.
  5. Hogere tokenkosten: Er is soms tot twee keer zoveel token-verbruik omdat output herhaaldelijk door andere modellen (zoals Sonnet of Haiku) moet worden gehaald om documentatie leesbaar te maken en termen als "oracle" en "constellation" te verwijderen.

Huidige tijdelijke oplossingen

  • Overstappen naar OpenAI Codex.
  • Gebruik van custom skills of projectprofielen met instructies als: "geen aforismen, geen metaforen, geen 'strategische' taal; enkel platte declaratieve uitspraken; begin met het resultaat."
  • Na elk antwoord vragen om de inhoud te behouden maar "veel beknopter te formuleren".
  • Specifieke klassen van formuleringen verbieden in plaats van te vragen om "beknopt" te zijn, omdat het model "beknopt" interpreteert als "dens en vreemd".

Gewenste resultaten

Ideaal taalgebruik

Gebruikers wensen een standaardregister dat dichter bij een technische whitepaper of een goed Stack Overflow-antwoord ligt:

  • Plat, declaratief en direct ter zake.
  • Beginnen met het antwoord (cijfer/verdict/beslissing), gevolgd door ondersteunende details alleen indien relevant.
  • Geen verzonnen jargon, aforismen of "strategische" metaforen; gebruik industrie-standaarden.
  • Gebruik van correcte zinnen en woorden in plaats van het zoeken naar het meest specifieke woord met de minste tokens.
  • Voorbehouden alleen toevoegen als ze relevant zijn.
  • Behoud van de diepte van de redenering (het gaat om de formulering, niet om minder nadenken).

Verzochte acties

  1. Onderzoek het standaardregister van Opus 4.8 en stem dit af op eenvoud en leesbaarheid zonder in te leveren op redeneerkwaliteit.
  2. Zorg ervoor dat door de gebruiker ingestelde stijlinstructies (system prompt, CLAUDE.md, profielen) consistent blijven gedurende een gesprek.
  3. Introduceer een officieel "plain/concise" register dat verbosite en stilistische franje uitschakelt, terwijl de correctheid van code en artefacten behouden blijft.
  4. Voeg instellingen voor 'Output Style' toe zodat gebruikers een balans kunnen vinden.

Technische details

  • Model: Opus
  • Regressie: Ja (Opus 4.5 functioneerde optimaal; verslechtering richting 4.8)
  • Claude Code Versie: 2.1.197
  • Platform: Anthropic API
  • Besturingssysteem: Ubuntu/Debian Linux