Anthropic heeft Claude Fable 5.1 en Claude Mythos 5.1 gelanceerd, modellen die nieuwe standaarden zetten voor coderen, kenniswerk en wetenschappelijk onderzoek. Waar Fable 5.1 algemeen beschikbaar is, is Mythos 5.1 bestemd voor geverifieerde toegang in de sectoren cybersecurity en levenswetenschappen.
De belangrijkste verbeteringen zijn:
- Kosten en Efficiëntie: De prijzen voor cache-leesacties zijn met 75% verlaagd, waardoor de totale kosten voor typische werklasten met circa 25% en voor agentische taken met tot 45% dalen.
- Privacy en Beveiliging: Met Enterprise Frontier Safeguards (EFS) kunnen zakelijke klanten data opslaan in eigen cloud-infrastructuur voor maximale privacy. Daarnaast zijn de beveiligingsfilters verfijnd om het aantal 'vals positieven' te verminderen.
- Prestaties: Fable 5.1 overtreft zijn voorgangers en concurrenten (zoals GPT-5.6 Sol) in diverse benchmarks. Partners melden dat het model complexe softwarebugs kan oplossen die menselijke ingenieurs jarenlang ontgingen.
- Wetenschappelijke Doorbraken: Het model heeft significante resultaten geboekt in moleculair ontwerp (protein design), het creëren van een hoge-resolutie hoogtekaart van Venus en het optimaliseren van GPU-kernels voor computationele biologie.
Ten slotte voldoet Anthropic aan de EU AI Act door het implementeren van onzichtbare watermerken in de output van de modellen vanaf augustus 2026.
Introductie van Claude Fable 5.1 en Claude Mythos 5.1
Claude Fable 5.1 en Claude Mythos 5.1 zijn hetzelfde model, maar met verschillende niveaus van beveiligingen (safeguards). Fable 5.1 is algemeen beschikbaar, terwijl Mythos 5.1 alleen beschikbaar is via onze programma's voor vertrouwde toegang; de beveiligingen hiervan zijn specifiek ontworpen om werk in cybersecurity en de levenswetenschappen te ondersteunen.
Naast de verhoogde capaciteiten zet Fable 5.1 belangrijke stappen in het adresseren van feedback van klanten over prijs, dataretentie en beveiligingen.
Prijs
Fable 5.1 zal naar schatting 25% minder kosten dan Fable 5 voor typische werklasten, waar het gebruik per token wordt gefactureerd. Dit komt doordat we de prijzen voor cache-leesacties verlagen (waarbij het model inputs leest die al zijn verwerkt en opgeslagen). Voor zeer agentische taken zullen de besparingen vaak veel groter zijn—tot ongeveer 45%.
Dataretentie
Ons nieuwe systeem van Enterprise Frontier Safeguards (EFS) biedt klanten volledige privacy (gelijk aan een zero data retention-beleid), terwijl het tegelijkertijd state-of-the-art is in het voorkomen van kwaadaardig gebruik. EFS werkt door gegevens op te slaan in cloud-infrastructuur die volledig door de klant wordt beheerd, en niet door Anthropic. Dit wordt gefaseerd beschikbaar gesteld aan zakelijke klanten, beginnend later dit najaar. Totdat EFS beschikbaar is, kunnen in aanmerking komende klanten Fable 5.1 gebruiken met zero data retention.
Beveiligingen (Safeguards)
We hebben onze beveiligingen verbeterd om het aantal 'vals positieven' te verminderen (waarbij het systeem onschadelijke inhoud markeert). In cybersecurity blokkeren onze nieuwste beveiligingen 60% minder vals positieven dan voorheen. Dit komt mede doordat Fable 5.1 nu kan worden gebruikt om softwarekwetsbaarheden te ontdekken—hoewel niet om exploits daarvoor te ontwikkelen. In de biologie hebben we, in partnerschap met de Amerikaanse overheid, een toegangsprogramma opgezet om toegang te bieden tot de geavanceerde biologische capaciteiten van Claude Mythos 5.1. We verwachten de inschrijving voor wetenschappers binnenkort te openen.
Een nieuwe grens in prestaties
Claude Fable 5.1 zet een nieuwe standaard voor coderen, kenniswerk en langdurige probleemoplossende taken. Fable 5.1 is in staat tot veel hogere prestaties dan zijn voorganger, Fable 5. Wanneer Fable 5.1 wordt ingesteld op 'Low' of 'Medium' effort, behaalt het resultaten die vergelijkbaar met of beter zijn dan die van Fable 5, tegen veel lagere kosten. (Let op: Fable 5.1 staat standaard op 'High' effort in Claude Code, en op 'Medium' in Claude Cowork en op Claude.ai.)
Fable 5.1 vermijdt shortcuts die leiden tot werk van lagere kwaliteit en is slim genoeg om de bronoorzaken van softwareproblemen op te lossen. Zo vond Fable 5.1 in testen door het beleggingsbedrijf Millennium de oorzaak van een zeldzame crash in hun interne systemen die geen van hun ingenieurs (of welk ander model dan ook) na meerdere jaren van proberen had kunnen verklaren.
Benchmark-vergelijkingen
| Categorie | Benchmark | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
| Agentisch wetenschappelijk onderzoek | Terminal-Bench-Science 0.1 [1] | 52.6% | 24.7% | 29.0% | 22.4% |
| Agentisch coderen | Terminal-Bench 4.0 | 55.8% | 60.9% (Mythos 5.1) | 42.0% | 52.3% / 37.3% |
| Kenniswerk | GDPval-AA v2 | 1853 | 1723 | 1824 | 1711 |
| Computergebruik | OSWorld 2.0 [2] (partial) | 77.9% | partial | 72.9% | partial / 75.4% |
| Computergebruik | OSWorld 2.0 (strict) | 41.7% | strict | 36.1% | strict / 39.6% |
| Multidisciplinaire redenering | Humanity's Last Exam (no tools) | 60.9% | 57.8% | 56.6% | — |
| Multidisciplinaire redenering | Humanity's Last Exam (with tools) | 65.0% | 63.8% | 63.6% | — |
| Bedrijfsworkflows | AutomationBench | 31.4% | 17.1% | 26.9% | 19.6% |
| Agentisch coderen | CursorBench 3.2.0 | 73.4% | 70.5% | 70.0% | 67.2% |
Fable 5.1 werd geëvalueerd met de productie-beveiligingen ingeschakeld. Op taken waar deze beveiligingen ingrepen, scoorden Fable 5.1 en Fable 5 een nul op OSWorld 2.0, en scoorde Fable 5 een nul op AutomationBench. In alle andere gevallen van interventie werden cybersecurity-taken voltooid door Claude Opus 4.8, en biologie-taken door Claude Opus 5. Dit vermindert waarschijnlijk de prestaties van Fable 5.1 en Fable 5 in deze benchmarks.
Feedback van vroege toegangspartners
Onze partners merkten deze prestatie-upgrades op en zagen ook kwalitatieve verbeteringen in de output van het model:
- Jane Street Capital (Craig Falls, Head of Quantitative Research): "In interne benchmarks lost Claude Fable 5.1 meer van onze codeerproblemen op dan Fable 5 of Opus 5, en behaalt het state-of-the-art resultaten in trading-intuïtie. Waar eerdere modellen moeilijk te volgen werden naarmate ze langer werkten, blijft Fable 5.1 leesbaar over lange, meerstaps taken."
- Cognition (Walden Yan, Co-founder and CPO): "We verplaatsen ons Opus 5-verkeer in Devin naar Claude Fable 5.1 op de dag van lancering. Het matchte of overtrof Fable 5 in onze tests tegen lagere kosten per taak. Met de nieuwe cache-read prijzen is een Fable-klasse model eindelijk economisch voor de werklasten die we op Opus hielden, beginnend bij code review."
- Millennium (Damien, Senior Portfolio Manager): "Een specifiek stuk code had een extreem zeldzame crash, ongeveer één op een miljoen runs, die niemand in ons team in vier tot vijf jaar had kunnen verklaren. Elk model dat ik probeerde, inclusief Fable 5, miste het. Claude Fable 5.1 was de eerste die het vond. Het disassemblede een externe vendor-library, matchte dit met de core dump en traceerde de crash naar een bug in die library."
- MongoDB (Ron Sanzone, Staff Software Engineer): "Claude Fable 5.1 bouwde in ongeveer drie dagen een complex prototype. Het deed initieel onderzoek in al onze services-code en documentatie om een vernieuwend en uitbreidbaar ontwerp te produceren. Daarna draaide het urenlang onbeheerd, met sterke verificatielussen, om het volledige prototype te implementeren."
- Every (Dan Shipper, CEO): "Het is 'vriendelijke Fable'. Fable-niveau intelligentie, Opus-prijs, Sonnet-snelheid. In onze tests was het ongeveer twee keer zo snel als Opus 5 en gebruikte het half zoveel tokens."
- IMC (Marquis Wong, Principal AI Engineer): "In onze research-suite zette Claude Fable 5.1 nieuwe records. Bij één taak kwam het met een vernieuwende oplossing langs een volledig andere as dan we hadden gezien van andere modellen of menselijke onderzoekers."
- Red Hat (Josh Boyer, Distinguished Engineer): "Met Claude Code identificeerde het correct de bronoorzaak van elke broken build die we testten, over alle effort-niveaus. Het communiceert ook effectiever dan eerdere Anthropic-modellen."
- Rakuten (Felix Giovanni Virgo, Principal AI Engineer): "We vroegen Claude Fable 5.1 om een klinisch onderzoeksproject voor Rakuten Medical te reviewen waar drie andere frontier-modellen al akkoord mee waren. Het vond een gat dat geen van hen had gezien en drong aan op verder testen. Het stelde vervolgens een volledig nieuwe hypothese voor."
- Block (Willem Avé, Global Head of Product): "Op onze 30-daagse simulatie van het runnen van een bedrijf was het veel efficiënter per token dan Opus 5. We zijn van plan het te gebruiken voor onze meest complexe scenario's."
- Ramp (Dwight Temple, Sr. Machine Learning Engineer): "Voor alles wat research, greenfield of lange-horizon is, zou ik Claude Fable 5.1 absoluut als orchestrator gebruiken. Eén onbeheerde run van 38 uur op een machine learning-probleem diagnoseerde een vorig resultaat als een label-artefact, maakte de correctie, startte zes parallelle experimenten en kwam terug met een resultaat."
- Canva (Danny Wu, Head of AI): "Het sterkste punt in Claude Fable 5.1 is het schrijven: begrijpelijker, betekenisvoller en het volgt onze schrijfrichtlijnen beter. In Canva Code bouwde het een ritmegame met echte muziek en on-beat gameplay."
- Hebbia (Aabhas Sharma, CTO): "In onze PowerPoint-evaluatie produceerde Claude Fable 5.1 de beste presentaties van elk model dat we hebben getest. Datzelfde aspect van volledigheid was zichtbaar in onze Citations-evaluatie."
- Plaid (Aditya Gupta, Staff Software Engineer): "We hadden een wijziging die meer dan acht services over drie codebases raakte. Claude Fable 5.1 bracht de hele workflow van begin tot eind in kaart, in extreem fijn detail, en was accuraat tot op de individuele functies en database-tabellen."
- Glean (Nilesh Dalvi, Engineering Lead): "Onze jury's gaven de voorkeur aan de antwoorden van Claude Fable 5.1 tegenover Fable 5 met een ratio van ongeveer 2-op-1 voor alledaagse kennisvragen, high-intent research en het opstellen van concepten."
- iGent (Sean Ward, Co-founder and CEO): "Op de moeilijkste problemen waar we aan werken, onderscheidt Claude Fable 5.1 zich sterk. Op een 'grand challenge'-probleem produceerde het daadwerkelijk materiële vooruitgang."
- Browserbase (Miguel Gonzalez, Technical Lead): "In onze moeilijkste browser-agent benchmark voltooide Claude Fable 5.1 82% van de taken in ongeveer 10 minuten per stuk, tegenover 74% voor Opus 5 en 57% voor Fable 5."
- Rogo (Alex Wang, Applied AI): "In onze interne Finance-benchmark matcht Claude Fable 5.1 Fable 5 op nauwkeurigheid, terwijl het 20% minder tokens gebruikt."
- Shopify (Ben Lafferty, Senior Staff Engineer): "Claude Fable 5.1 is comfortabeler met langdurig, onbeheerd werk dan Fable 5. Ik heb workflows gehad die lang draaiden zonder de draad kwijt te raken."
- Crosby (Raymond Lin, Member of Technical Staff): "Vergeleken met Fable 5 was Claude Fable 5.1 een enorme verbetering op RedlineBench, onze benchmark voor het redlinen van contracten, waarbij de score steeg van 47.9 naar 57.0."
- Datadog (Daniel Shan, Staff Engineer): "Het is een leidend model voor onze incident-onderzoek-evaluaties. Het heeft sterkere redeneerkracht getoond dan Opus 5 en heeft de meest complexe productie-incidenten gediagnoseerd."
- SpaceXAI (Sualeh Asif, Director of ML): "Claude Fable 5.1 is het meest capabele model dat we hebben gedraaid op CursorBench 3.2, met een score van 73.4% bij max effort."
- Samaya (Yuhao Zhang, Research Lead): "Op FrontierFinance, onze nieuwste finance-benchmark, toont Claude Fable 5.1 een duidelijke winst over Fable 5 (55.9% vs 49.2%), dankzij het vermogen om dieper in gevestigde, autoritaire bronnen te graven."
Wetenschappelijk onderzoek
We hebben de wetenschappelijke onderzoekscapaciteiten van Claude Fable 5.1 en Claude Mythos 5.1 getest over een breed scala aan domeinen.
Moleculair ontwerp
Hoge-affiniteit binders zijn essentieel voor medicijnen om bij lagere doses te werken. We gaven Claude Mythos 5.1 toegang tot open-source protein design- en folding-tools. Mythos 5.1 bleek in staat zeer hoge-affiniteit binders te ontwerpen. Op drie targets waren de bindingsaffiniteiten 10 keer hoger dan de beste ontwerpen uit de protein design-competities van Adaptyv Bio. De hit rate (het aantal levensvatbare binders) bereikte bijna 50% over 12 targets, terwijl 10–15% tegenwoordig gebruikelijk is in protein design.
Computationele analyse en modellering
Claude Fable 5.1 trainde een neuraal netwerk om een nieuwe, hoge-resolutie hoogtekaart van een derde van de planeet Venus te maken, gebaseerd op radarbeelden van NASA's Magellan-missie van meer dan 30 jaar geleden. De nieuwe kaart onthult details tot twee à drie kilometer (voorheen 10 tot 20 kilometer) en toont hoogtes tot 25% nauwkeuriger. Deze kaart wordt vrijgegeven onder een Creative Commons-licentie.
Computationele biologie
In de computationele biologie is de snelheid van modellen op GPU's vaak een bottleneck. Mythos 5.1 bood een oplossing door custom GPU-kernels te schrijven en tussenresultaten te cachen, waardoor zeven open-source deep learning-modellen tot 2,5 keer sneller werden (met identieke output). Dit vermindert de geschatte GPU-kosten voor genoombrede analyses met 30–60%. Optimalisaties die normaal weken in beslag zouden nemen voor een team van ingenieurs, werden door Mythos 5.1 in enkele dagen gerealiseerd.
Daarnaast hebben we de Model Hardware Standard gepresenteerd, waarmee Claude direct en veilig laboratoriumapparatuur kan bedienen. We hebben ook onze ondersteuning voor wetenschappers uitgebreid via het AI for Science-programma, dat gratis credits biedt aan onderzoekers.
Veiligheid, Beveiliging en Alignment
Met toenemende autonomie komen nieuwe risico's. Voordat we Claude Fable 5.1 en Claude Mythos 5.1 uitbrachten, zijn ze uitgebreid getest.
Risico-evaluaties
- Chemische en biologische risico's: We testten of Claude Mythos 5.1 kon helpen bij het creëren van wapens. Hoewel de capaciteiten groter zijn dan die van Mythos 5, vallen ze nog steeds onder de huidige risicocategorie van ons Responsible Scaling Policy. Daarom implementeren we Mythos 5.1 met dezelfde beveiligingen als Mythos 5.
- Cyberrisico's: Mythos 5.1 vertoont de sterkste cybercapaciteiten van elk model dat we hebben uitgebracht, maar valt nog steeds in de lagere risicocategorie van ons Frontier Compliance Framework. Voor Fable 5.1 hebben we de beveiligingen uitvoerig stress-getest; er is geen bewijs gevonden van een critical-severity jailbreak.
- Agentische veiligheid: Het model weigerde kwaadaardige agentische codeer- en computergebruikverzoeken in een vergelijkbaar tempo als Mythos 5, Sonnet 5 en Opus 5.
- Alignment: Onze audits tonen aan dat Claude Mythos 5.1 beter is aligned dan Mythos 5. Het is minder geneigd om resources buiten de testomgeving te benaderen bij onmogelijke taken, en minder geneigd om 'motivated reasoning' te gebruiken om acties te rechtvaardigen.
Verbeterde beveiligingsmechanismen
- Enterprise Frontier Safeguards (EFS): EFS stelt ons in staat misbruik te detecteren terwijl zakelijke klanten de privacy van een zero data retention-overeenkomst behouden. Gegevens worden opgeslagen in de cloud-infrastructuur van de klant.
- Precisie in biologie en cybersecurity: We hebben de filters verfijnd om minder onschadelijke content te blokkeren. Biologie-beveiligingen vuren nu 85% minder vaak bij onschadelijke medische vragen. Voor cybersecurity mag Fable 5.1 nu worden gebruikt voor het identificeren van softwarekwetsbaarheden (defensief werk).
- Anti-distillatiemechanismen: Om te voorkomen dat geavanceerde capaciteiten via distillation-aanvallen worden geëxtraheerd, kunnen nieuwe API-accounts niet langer handmatig de prior context van Claude bewerken terwijl het transcript van Claude's 'thinking' behouden blijft.
Vertrouwd toegangsprogramma's voor Claude Mythos 5.1
Claude Mythos 5.1 is identiek aan Fable 5.1, maar biedt permissievere beveiligingen voor geverifieerde personen en organisaties:
- Cyber Verification Program (CVP): Voor defensief beveiligingswerk.
- Life Sciences Verification Program (LSVP): Voor professionals in de levenswetenschappen voor R&D-activiteiten.
Daarnaast wordt Claude Security, ons product dat codebases scant op kwetsbaarheden, nu aangedreven door Claude Mythos 5.1.
Naleving van de EU AI Act
In juli 2026 tekende Anthropic de Code of Practice on Transparency of AI-Generated Content van de EU AI Act. Dit betekent:
- Watermerking: Er is een onzichtbare numerieke watermerk toegevoegd aan outputs van modellen uitgebracht na 2 augustus 2026. Dit heeft geen invloed op de kwaliteit of inhoud.
- Detection API: We rollen een API uit in private preview voor bevoegde organisaties (regulatoren, wetshandhaving, media, etc.) om te kunnen verifiëren of een tekst het watermerk bevat.
Kosten en Beschikbaarheid
Claude Fable 5.1 is vandaag beschikbaar op alle platforms, waaronder Amazon Web Services, Google Cloud en Microsoft Azure.
Prijsstelling
We hebben de prijs voor cache-leesacties verlaagd naar $0,25 per miljoen tokens (75% minder).
| Type werklast | Kosten t.o.v. Fable 5 |
| Typische werklast | ~25% minder |
| Hoog agentische werklast | ~45% minder |
De overige prijzen blijven gelijk: $10 per miljoen input tokens en $50 per miljoen output tokens.
Claude Mythos 5.1 is momenteel beschikbaar voor geverifieerde cyberdefenders en levenswetenschappers, beginnend met een set Amerikaanse organisaties, met plannen voor internationale uitbreiding.
***
Voetnoten [1] Terminal-Bench-Science 0.1: De standaardfout is ±3.5–4.5 pts per model. De publieke leaderboard rapporteert Claude Opus 5 op 30.0% en Claude Fable 5 op 21.4%; onze setup reproduceert deze op respectievelijk 29.0% en 24.7%. [2] OSWorld 2.0: Scores zijn gebaseerd op de task release van augustus 2026. Fable 5 en Opus 5 zijn onder dezelfde condities opnieuw gedraaid. [3] Deze drie targets zijn EGFR, Nipah G en 15-PGDH, afkomstig uit de protein design-competities van Adaptyv Bio.
Introductie van Claude Fable 5.1 en Claude Mythos 5.1
Claude Fable 5.1 en Claude Mythos 5.1 zijn hetzelfde model, maar met verschillende niveaus van beveiligingen (safeguards). Fable 5.1 is algemeen beschikbaar, terwijl Mythos 5.1 alleen beschikbaar is via onze programma's voor vertrouwde toegang; de beveiligingen hiervan zijn specifiek ontworpen om werk in cybersecurity en de levenswetenschappen te ondersteunen.
Naast de verhoogde capaciteiten zet Fable 5.1 belangrijke stappen in het adresseren van feedback van klanten over prijs, dataretentie en beveiligingen.
Prijs
Fable 5.1 zal naar schatting 25% minder kosten dan Fable 5 voor typische werklasten, waar het gebruik per token wordt gefactureerd. Dit komt doordat we de prijzen voor cache-leesacties verlagen (waarbij het model inputs leest die al zijn verwerkt en opgeslagen). Voor zeer agentische taken zullen de besparingen vaak veel groter zijn—tot ongeveer 45%.
Dataretentie
Ons nieuwe systeem van Enterprise Frontier Safeguards (EFS) biedt klanten volledige privacy (gelijk aan een zero data retention-beleid), terwijl het tegelijkertijd state-of-the-art is in het voorkomen van kwaadaardig gebruik. EFS werkt door gegevens op te slaan in cloud-infrastructuur die volledig door de klant wordt beheerd, en niet door Anthropic. Dit wordt gefaseerd beschikbaar gesteld aan zakelijke klanten, beginnend later dit najaar. Totdat EFS beschikbaar is, kunnen in aanmerking komende klanten Fable 5.1 gebruiken met zero data retention.
Beveiligingen (Safeguards)
We hebben onze beveiligingen verbeterd om het aantal 'vals positieven' te verminderen (waarbij het systeem onschadelijke inhoud markeert). In cybersecurity blokkeren onze nieuwste beveiligingen 60% minder vals positieven dan voorheen. Dit komt mede doordat Fable 5.1 nu kan worden gebruikt om softwarekwetsbaarheden te ontdekken—hoewel niet om exploits daarvoor te ontwikkelen. In de biologie hebben we, in partnerschap met de Amerikaanse overheid, een toegangsprogramma opgezet om toegang te bieden tot de geavanceerde biologische capaciteiten van Claude Mythos 5.1. We verwachten de inschrijving voor wetenschappers binnenkort te openen.
Een nieuwe grens in prestaties
Claude Fable 5.1 zet een nieuwe standaard voor coderen, kenniswerk en langdurige probleemoplossende taken. Fable 5.1 is in staat tot veel hogere prestaties dan zijn voorganger, Fable 5. Wanneer Fable 5.1 wordt ingesteld op 'Low' of 'Medium' effort, behaalt het resultaten die vergelijkbaar met of beter zijn dan die van Fable 5, tegen veel lagere kosten. (Let op: Fable 5.1 staat standaard op 'High' effort in Claude Code, en op 'Medium' in Claude Cowork en op Claude.ai.)
Fable 5.1 vermijdt shortcuts die leiden tot werk van lagere kwaliteit en is slim genoeg om de bronoorzaken van softwareproblemen op te lossen. Zo vond Fable 5.1 in testen door het beleggingsbedrijf Millennium de oorzaak van een zeldzame crash in hun interne systemen die geen van hun ingenieurs (of welk ander model dan ook) na meerdere jaren van proberen had kunnen verklaren.
Benchmark-vergelijkingen
| Categorie | Benchmark | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
| Agentisch wetenschappelijk onderzoek | Terminal-Bench-Science 0.1 [1] | 52.6% | 24.7% | 29.0% | 22.4% |
| Agentisch coderen | Terminal-Bench 4.0 | 55.8% | 60.9% (Mythos 5.1) | 42.0% | 52.3% / 37.3% |
| Kenniswerk | GDPval-AA v2 | 1853 | 1723 | 1824 | 1711 |
| Computergebruik | OSWorld 2.0 [2] (partial) | 77.9% | partial | 72.9% | partial / 75.4% |
| Computergebruik | OSWorld 2.0 (strict) | 41.7% | strict | 36.1% | strict / 39.6% |
| Multidisciplinaire redenering | Humanity's Last Exam (no tools) | 60.9% | 57.8% | 56.6% | — |
| Multidisciplinaire redenering | Humanity's Last Exam (with tools) | 65.0% | 63.8% | 63.6% | — |
| Bedrijfsworkflows | AutomationBench | 31.4% | 17.1% | 26.9% | 19.6% |
| Agentisch coderen | CursorBench 3.2.0 | 73.4% | 70.5% | 70.0% | 67.2% |
Fable 5.1 werd geëvalueerd met de productie-beveiligingen ingeschakeld. Op taken waar deze beveiligingen ingrepen, scoorden Fable 5.1 en Fable 5 een nul op OSWorld 2.0, en scoorde Fable 5 een nul op AutomationBench. In alle andere gevallen van interventie werden cybersecurity-taken voltooid door Claude Opus 4.8, en biologie-taken door Claude Opus 5. Dit vermindert waarschijnlijk de prestaties van Fable 5.1 en Fable 5 in deze benchmarks.
Feedback van vroege toegangspartners
Onze partners merkten deze prestatie-upgrades op en zagen ook kwalitatieve verbeteringen in de output van het model:
- Jane Street Capital (Craig Falls, Head of Quantitative Research): "In interne benchmarks lost Claude Fable 5.1 meer van onze codeerproblemen op dan Fable 5 of Opus 5, en behaalt het state-of-the-art resultaten in trading-intuïtie. Waar eerdere modellen moeilijk te volgen werden naarmate ze langer werkten, blijft Fable 5.1 leesbaar over lange, meerstaps taken."
- Cognition (Walden Yan, Co-founder and CPO): "We verplaatsen ons Opus 5-verkeer in Devin naar Claude Fable 5.1 op de dag van lancering. Het matchte of overtrof Fable 5 in onze tests tegen lagere kosten per taak. Met de nieuwe cache-read prijzen is een Fable-klasse model eindelijk economisch voor de werklasten die we op Opus hielden, beginnend bij code review."
- Millennium (Damien, Senior Portfolio Manager): "Een specifiek stuk code had een extreem zeldzame crash, ongeveer één op een miljoen runs, die niemand in ons team in vier tot vijf jaar had kunnen verklaren. Elk model dat ik probeerde, inclusief Fable 5, miste het. Claude Fable 5.1 was de eerste die het vond. Het disassemblede een externe vendor-library, matchte dit met de core dump en traceerde de crash naar een bug in die library."
- MongoDB (Ron Sanzone, Staff Software Engineer): "Claude Fable 5.1 bouwde in ongeveer drie dagen een complex prototype. Het deed initieel onderzoek in al onze services-code en documentatie om een vernieuwend en uitbreidbaar ontwerp te produceren. Daarna draaide het urenlang onbeheerd, met sterke verificatielussen, om het volledige prototype te implementeren."
- Every (Dan Shipper, CEO): "Het is 'vriendelijke Fable'. Fable-niveau intelligentie, Opus-prijs, Sonnet-snelheid. In onze tests was het ongeveer twee keer zo snel als Opus 5 en gebruikte het half zoveel tokens."
- IMC (Marquis Wong, Principal AI Engineer): "In onze research-suite zette Claude Fable 5.1 nieuwe records. Bij één taak kwam het met een vernieuwende oplossing langs een volledig andere as dan we hadden gezien van andere modellen of menselijke onderzoekers."
- Red Hat (Josh Boyer, Distinguished Engineer): "Met Claude Code identificeerde het correct de bronoorzaak van elke broken build die we testten, over alle effort-niveaus. Het communiceert ook effectiever dan eerdere Anthropic-modellen."
- Rakuten (Felix Giovanni Virgo, Principal AI Engineer): "We vroegen Claude Fable 5.1 om een klinisch onderzoeksproject voor Rakuten Medical te reviewen waar drie andere frontier-modellen al akkoord mee waren. Het vond een gat dat geen van hen had gezien en drong aan op verder testen. Het stelde vervolgens een volledig nieuwe hypothese voor."
- Block (Willem Avé, Global Head of Product): "Op onze 30-daagse simulatie van het runnen van een bedrijf was het veel efficiënter per token dan Opus 5. We zijn van plan het te gebruiken voor onze meest complexe scenario's."
- Ramp (Dwight Temple, Sr. Machine Learning Engineer): "Voor alles wat research, greenfield of lange-horizon is, zou ik Claude Fable 5.1 absoluut als orchestrator gebruiken. Eén onbeheerde run van 38 uur op een machine learning-probleem diagnoseerde een vorig resultaat als een label-artefact, maakte de correctie, startte zes parallelle experimenten en kwam terug met een resultaat."
- Canva (Danny Wu, Head of AI): "Het sterkste punt in Claude Fable 5.1 is het schrijven: begrijpelijker, betekenisvoller en het volgt onze schrijfrichtlijnen beter. In Canva Code bouwde het een ritmegame met echte muziek en on-beat gameplay."
- Hebbia (Aabhas Sharma, CTO): "In onze PowerPoint-evaluatie produceerde Claude Fable 5.1 de beste presentaties van elk model dat we hebben getest. Datzelfde aspect van volledigheid was zichtbaar in onze Citations-evaluatie."
- Plaid (Aditya Gupta, Staff Software Engineer): "We hadden een wijziging die meer dan acht services over drie codebases raakte. Claude Fable 5.1 bracht de hele workflow van begin tot eind in kaart, in extreem fijn detail, en was accuraat tot op de individuele functies en database-tabellen."
- Glean (Nilesh Dalvi, Engineering Lead): "Onze jury's gaven de voorkeur aan de antwoorden van Claude Fable 5.1 tegenover Fable 5 met een ratio van ongeveer 2-op-1 voor alledaagse kennisvragen, high-intent research en het opstellen van concepten."
- iGent (Sean Ward, Co-founder and CEO): "Op de moeilijkste problemen waar we aan werken, onderscheidt Claude Fable 5.1 zich sterk. Op een 'grand challenge'-probleem produceerde het daadwerkelijk materiële vooruitgang."
- Browserbase (Miguel Gonzalez, Technical Lead): "In onze moeilijkste browser-agent benchmark voltooide Claude Fable 5.1 82% van de taken in ongeveer 10 minuten per stuk, tegenover 74% voor Opus 5 en 57% voor Fable 5."
- Rogo (Alex Wang, Applied AI): "In onze interne Finance-benchmark matcht Claude Fable 5.1 Fable 5 op nauwkeurigheid, terwijl het 20% minder tokens gebruikt."
- Shopify (Ben Lafferty, Senior Staff Engineer): "Claude Fable 5.1 is comfortabeler met langdurig, onbeheerd werk dan Fable 5. Ik heb workflows gehad die lang draaiden zonder de draad kwijt te raken."
- Crosby (Raymond Lin, Member of Technical Staff): "Vergeleken met Fable 5 was Claude Fable 5.1 een enorme verbetering op RedlineBench, onze benchmark voor het redlinen van contracten, waarbij de score steeg van 47.9 naar 57.0."
- Datadog (Daniel Shan, Staff Engineer): "Het is een leidend model voor onze incident-onderzoek-evaluaties. Het heeft sterkere redeneerkracht getoond dan Opus 5 en heeft de meest complexe productie-incidenten gediagnoseerd."
- SpaceXAI (Sualeh Asif, Director of ML): "Claude Fable 5.1 is het meest capabele model dat we hebben gedraaid op CursorBench 3.2, met een score van 73.4% bij max effort."
- Samaya (Yuhao Zhang, Research Lead): "Op FrontierFinance, onze nieuwste finance-benchmark, toont Claude Fable 5.1 een duidelijke winst over Fable 5 (55.9% vs 49.2%), dankzij het vermogen om dieper in gevestigde, autoritaire bronnen te graven."
Wetenschappelijk onderzoek
We hebben de wetenschappelijke onderzoekscapaciteiten van Claude Fable 5.1 en Claude Mythos 5.1 getest over een breed scala aan domeinen.
Moleculair ontwerp
Hoge-affiniteit binders zijn essentieel voor medicijnen om bij lagere doses te werken. We gaven Claude Mythos 5.1 toegang tot open-source protein design- en folding-tools. Mythos 5.1 bleek in staat zeer hoge-affiniteit binders te ontwerpen. Op drie targets waren de bindingsaffiniteiten 10 keer hoger dan de beste ontwerpen uit de protein design-competities van Adaptyv Bio. De hit rate (het aantal levensvatbare binders) bereikte bijna 50% over 12 targets, terwijl 10–15% tegenwoordig gebruikelijk is in protein design.
Computationele analyse en modellering
Claude Fable 5.1 trainde een neuraal netwerk om een nieuwe, hoge-resolutie hoogtekaart van een derde van de planeet Venus te maken, gebaseerd op radarbeelden van NASA's Magellan-missie van meer dan 30 jaar geleden. De nieuwe kaart onthult details tot twee à drie kilometer (voorheen 10 tot 20 kilometer) en toont hoogtes tot 25% nauwkeuriger. Deze kaart wordt vrijgegeven onder een Creative Commons-licentie.
Computationele biologie
In de computationele biologie is de snelheid van modellen op GPU's vaak een bottleneck. Mythos 5.1 bood een oplossing door custom GPU-kernels te schrijven en tussenresultaten te cachen, waardoor zeven open-source deep learning-modellen tot 2,5 keer sneller werden (met identieke output). Dit vermindert de geschatte GPU-kosten voor genoombrede analyses met 30–60%. Optimalisaties die normaal weken in beslag zouden nemen voor een team van ingenieurs, werden door Mythos 5.1 in enkele dagen gerealiseerd.
Daarnaast hebben we de Model Hardware Standard gepresenteerd, waarmee Claude direct en veilig laboratoriumapparatuur kan bedienen. We hebben ook onze ondersteuning voor wetenschappers uitgebreid via het AI for Science-programma, dat gratis credits biedt aan onderzoekers.
Veiligheid, Beveiliging en Alignment
Met toenemende autonomie komen nieuwe risico's. Voordat we Claude Fable 5.1 en Claude Mythos 5.1 uitbrachten, zijn ze uitgebreid getest.
Risico-evaluaties
- Chemische en biologische risico's: We testten of Claude Mythos 5.1 kon helpen bij het creëren van wapens. Hoewel de capaciteiten groter zijn dan die van Mythos 5, vallen ze nog steeds onder de huidige risicocategorie van ons Responsible Scaling Policy. Daarom implementeren we Mythos 5.1 met dezelfde beveiligingen als Mythos 5.
- Cyberrisico's: Mythos 5.1 vertoont de sterkste cybercapaciteiten van elk model dat we hebben uitgebracht, maar valt nog steeds in de lagere risicocategorie van ons Frontier Compliance Framework. Voor Fable 5.1 hebben we de beveiligingen uitvoerig stress-getest; er is geen bewijs gevonden van een critical-severity jailbreak.
- Agentische veiligheid: Het model weigerde kwaadaardige agentische codeer- en computergebruikverzoeken in een vergelijkbaar tempo als Mythos 5, Sonnet 5 en Opus 5.
- Alignment: Onze audits tonen aan dat Claude Mythos 5.1 beter is aligned dan Mythos 5. Het is minder geneigd om resources buiten de testomgeving te benaderen bij onmogelijke taken, en minder geneigd om 'motivated reasoning' te gebruiken om acties te rechtvaardigen.
Verbeterde beveiligingsmechanismen
- Enterprise Frontier Safeguards (EFS): EFS stelt ons in staat misbruik te detecteren terwijl zakelijke klanten de privacy van een zero data retention-overeenkomst behouden. Gegevens worden opgeslagen in de cloud-infrastructuur van de klant.
- Precisie in biologie en cybersecurity: We hebben de filters verfijnd om minder onschadelijke content te blokkeren. Biologie-beveiligingen vuren nu 85% minder vaak bij onschadelijke medische vragen. Voor cybersecurity mag Fable 5.1 nu worden gebruikt voor het identificeren van softwarekwetsbaarheden (defensief werk).
- Anti-distillatiemechanismen: Om te voorkomen dat geavanceerde capaciteiten via distillation-aanvallen worden geëxtraheerd, kunnen nieuwe API-accounts niet langer handmatig de prior context van Claude bewerken terwijl het transcript van Claude's 'thinking' behouden blijft.
Vertrouwd toegangsprogramma's voor Claude Mythos 5.1
Claude Mythos 5.1 is identiek aan Fable 5.1, maar biedt permissievere beveiligingen voor geverifieerde personen en organisaties:
- Cyber Verification Program (CVP): Voor defensief beveiligingswerk.
- Life Sciences Verification Program (LSVP): Voor professionals in de levenswetenschappen voor R&D-activiteiten.
Daarnaast wordt Claude Security, ons product dat codebases scant op kwetsbaarheden, nu aangedreven door Claude Mythos 5.1.
Naleving van de EU AI Act
In juli 2026 tekende Anthropic de Code of Practice on Transparency of AI-Generated Content van de EU AI Act. Dit betekent:
- Watermerking: Er is een onzichtbare numerieke watermerk toegevoegd aan outputs van modellen uitgebracht na 2 augustus 2026. Dit heeft geen invloed op de kwaliteit of inhoud.
- Detection API: We rollen een API uit in private preview voor bevoegde organisaties (regulatoren, wetshandhaving, media, etc.) om te kunnen verifiëren of een tekst het watermerk bevat.
Kosten en Beschikbaarheid
Claude Fable 5.1 is vandaag beschikbaar op alle platforms, waaronder Amazon Web Services, Google Cloud en Microsoft Azure.
Prijsstelling
We hebben de prijs voor cache-leesacties verlaagd naar $0,25 per miljoen tokens (75% minder).
| Type werklast | Kosten t.o.v. Fable 5 |
| Typische werklast | ~25% minder |
| Hoog agentische werklast | ~45% minder |
De overige prijzen blijven gelijk: $10 per miljoen input tokens en $50 per miljoen output tokens.
Claude Mythos 5.1 is momenteel beschikbaar voor geverifieerde cyberdefenders en levenswetenschappers, beginnend met een set Amerikaanse organisaties, met plannen voor internationale uitbreiding.
***
Voetnoten [1] Terminal-Bench-Science 0.1: De standaardfout is ±3.5–4.5 pts per model. De publieke leaderboard rapporteert Claude Opus 5 op 30.0% en Claude Fable 5 op 21.4%; onze setup reproduceert deze op respectievelijk 29.0% en 24.7%. [2] OSWorld 2.0: Scores zijn gebaseerd op de task release van augustus 2026. Fable 5 en Opus 5 zijn onder dezelfde condities opnieuw gedraaid. [3] Deze drie targets zijn EGFR, Nipah G en 15-PGDH, afkomstig uit de protein design-competities van Adaptyv Bio.