Versnellen van GPT-5.6 Sol Ultrafast met OpenAI

Vandaag delen Cerebras en OpenAI een eerste blik op Ultrafast Mode, een nieuwe servicelaag die eerst wordt gelanceerd in de OpenAI API en wordt aangedreven door Cerebras. Ultrafast is aanvankelijk beschikbaar voor een selecte groep klanten, waarbij de toegang in de loop van de tijd zal worden uitgebreid. Cerebras drijft GPT-5.6 Sol aan in de Ultrafast-modus, wat resulteert in tot 750 outputtokens per seconde zonder kwaliteitsverlies. Hierdoor kan Sol Ultrafast het meest tijdgevoelige en bedrijfskritische werk versnellen.

Grensoverschrijdende intelligentie met ongekende snelheid

AI-bouwers moesten altijd kiezen tussen snelheid en intelligentie. Naarmate modellen groeien in omvang en intelligentie, nemen de rekenkosten en de kosten voor datatransport toe, wat de responstijden vertraagt. Gebruikers moeten vaak wachten op kwalitatieve resultaten of genoegen nemen met minderwaardige resultaten binnen een korter tijdsbestek.

GPT-5.6 Sol Ultrafast lost dit compromis op door frontier-intelligentie te brengen naar producten en workflows waar elke seconde telt. Vergeleken met de outputsnelheden gerapporteerd door Artificial Analysis, draait GPT-5.6 Sol in de Ultrafast-modus 11x sneller dan Fable 5, en 5x sneller dan Opus 4.8 in de Fast-modus.

Cerebras heeft Ultrafast getest door het direct te vergelijken met populaire modellen op Humanity's Last Exam (HLE). HLE is een uitdagende benchmark die bestaat uit 2.500 vragen die doorgaans alleen beantwoord kunnen worden door mensen met een PhD in vakgebieden zoals chemie, economie en literatuur.

In onze evaluaties beantwoordde GPT-5.6 Sol in de Ultrafast-modus alle 2.500 HLE-vragen in 11 uur en 11 minuten. Claude Fable 5 had 78 uur en 27 minuten nodig — meer dan drie dagen aan continue rekenkracht — om tot dezelfde conclusies te komen. Met andere woorden: Ultrafast werkte in één werkdag door de grenzen van menselijke kennis heen, waarbij een vergelijkbare nauwkeurigheid werd behaald terwijl het bijna 7x sneller was.

Benchmark Humanity's Last Exam
De benchmarking is uitgevoerd door Cerebras met GPT 5.6 Sol Ultrafast met Codex op xhigh reasoning op 10 juli, en Claude Fable 5 met Claude Code op xhigh reasoning van 13 tot 15 juli.

Naarmate de mogelijkheden van modellen verder gelişden, breidt het scala aan toepassingen voor snelle inferentie zich uit. GPT-5.6 Sol is OpenAI's tot nu toe beste model voor juridische stukken, financiële modellen en technische rapporten. Op GDP-Val, een benchmark voor economisch waardevol kenniswerk, leverde Ultrafast een 5,6x versnelling van begin tot eind zonder kwaliteitsverlies. Dit toont aan hoe snellere inferentie economisch waardevol werk kan versnellen.

Opmerking: De benchmarking is uitgevoerd door Cerebras op 31 juli 2026 met GPT 5.6 Sol en GPT 5.6 Sol Ultrafast op medium reasoning binnen Codex.

Hogesnelheidsintelligentie voor kritiek werk

Snellere intelligentie verandert wat mogelijk is voor individuen en organisaties. Met Ultrafast kunt u agents nu inzetten op het kritieke pad van problemen waarbij elke seconde telt.

"Met GPT-5.6 Sol Ultrafast stelt Cerebras AI mogelijk die het tempo bijhoudt van hoe u denkt, codeert en samenwerkt. We zijn benieuwd hoe workflows en applicaties worden getransformeerd door Ultrafast-inferentie."
Rohan Varma, Product at OpenAI

Ultrafast biedt een blijvend voordeel voor organisaties die frontier-AI gebruiken om snel te reageren op binnenkomende informatie. Bedrijven die webdiensten exploiteren, kunnen Ultrafast inzetten om de bronRequest van productieonderbrekingen te achterhalen en aan te pakken, waardoor het klantvertrouwen behouden blijft, omzetverlies wordt voorkomen en downtime-minuten ten opzichte van hun SLA's worden bespaard. En bij vijandige, risicovolle cyberaanvallen is Ultrafast een onschatbaar hulpmiddel voor beveiligingsteams die kwaadwillenden snel moeten detecteren en bestrijden om catastrofale verliezen te beperken.

In bredere zin maakt Ultrafast geheel nieuwe manieren van werken met agents mogelijk; het levert real-time inzichten en updates, zodat u niet hoeft te schakelen tussen meerdere parallelle sessies om het maximale uit uw agents te halen.

"Waar ik voorheen een paar minuten moest wachten tot een taak was voltooid, is deze nu klaar voordat ik überhaupt de kans heb om van context te wisselen. Dat maakt me veel productiever."
Jeffrey Wang, OpenAI Researcher

Met Ultrafast kunnen onderzoekers en ingenieurs hun aandacht richten op het dieper uitzoeken van de problemen die er het meest toe doen, terwijl ze Standard-verwerking blijven gebruiken voor het paralleliseren van routinetaken. Cerebras is enthousiast om de volgende golf van AI-innovatie aan te drijven en het plafond te verhogen van wat individuen en organisaties kunnen bereiken met responsieve AI.

Razendsnelle snelheid mogelijk gemaakt door baanbrekende innovatie

GPT-5.6 Sol in de Ultrafast-modus wordt aangedreven door de revolutionaire Wafer-Scale Engine-architectuur van Cerebras, specifiek gebouwd voor frontier-AI-workloads. Snelle frontier-inferentie is in feite een probleem van datatransport: bij GPU's wordt inferentie op grote modellen beperkt door de geheugenbandbreedte, aangezien modelgewichten herhaaldelijk moeten worden overgedragen tussen het on-chip geheugen en off-chip opslag om opeenvolgende tokens binnen een modelrespons te genereren.

Cerebras hanteert een tegengestelde aanpak om dit inefficiënte datatransport te elimineren: we plaatsen 44 GB SRAM op elke chip ter grootte van een wafer. De gewichten blijven on-chip en tokens stromen ononderbroken door model-lagen die over wafers zijn gepipelined. Deze technische benadering schaalt soepel mee met de modelgrootte, wat de weg vrijmaakt voor een aanhoudend snelheidsvoordeel bij toekomstige frontier-modellen.

Ultrafast: Nu in beperkte preview

GPT-5.6 Sol in de Ultrafast-modus is vandaag beschikbaar in een beperkte preview voor een selecte groep klanten. De toegang zal worden uitgebreid naarmate de capaciteit groeit.