GPT 5.6 Sol is het beste "vision"-model dat OpenAI ooit heeft uitgebracht

Vorige week kondigde OpenAI de GPT-5.6-lijn aan, met de introductie van de modellen Sol, Terra en Luna. Tijdens de release-stream lag de focus van het team sterk op computer use, waarbij modellen werden getoond die in staat zijn om desktopapplicaties te navigeren en te bedienen. OpenAI benadrukte UI-agents en gedetailleerde 3D-visualisaties, maar beide zijn afhankelijk van een sterker visueel begrip.

Om hun visuele capaciteiten te meten, hebben we de modellen door onze aanstaande VLM-benchmark gehaald, die we in de komende weken van plan zijn uit te brengen. De benchmark beslaat veelvoorkomende visuele taken, waaronder detectie, tellen, OCR en data-extractie. In dit artikel kijken we nauwer naar de prestaties van GPT-5.6 op elk van deze punten.

Sol is overduidelijk het beste vision-model dat OpenAI tot nu toe heeft uitgebracht. De sprong is vooral zichtbaar in objectdetectie en tellen, waar GPT-5.5 ver achterbleef bij de sterkste VLMs. Terra en Luna zijn niet zo sterk als Sol, maar laten beiden een betekenisvolle vooruitgang zien ten opzichte van GPT-5.5.

Objectdetectie

Bij detectie is de sprong van GPT-5.6 het duidelijkst. GPT-5.5 scoorde 13,8 mAP@50 in onze benchmark, terwijl Sol 46,2 bereikte. Terra en Luna volgden op de voet met 44,7 en 43,3, waardoor objectdetectie is verschoven van een groot zwak punt naar een praktische functionaliteit.

De detectie van documentlay-outs is een van de duidelijkste sterke punten van GPT-5.6. Sol ging goed om met titels, paragrafen, tabellen, afbeeldingen en handtekeningen. Veel document-workflows beginnen met het lokaliseren van de relevante delen van een pagina voordat OCR of data-extractie begint.

GPT-5.6 presteerde ook goed in complexe scènes. De voorbeelden met pillen en eieren bevatten veel vergelijkbare objecten die dicht op elkaar gepakt zitten, een veelvoorkomende zwakte voor VLM-gebaseerde detectie. In tegenstelling tot traditionele detectoren genereren VLMs elk class-label en elke set coördinaten als tekst. Naarmate het aantal objecten groeit, wordt de respons langer en neemt het risico op gemiste objecten, duplicaten of coördinatiefouten toe. Ondanks dit detecteerde Sol de meeste objecten in beide scènes.

Voor de beste detectieresultaten is het raadzaam om GPT-5.6-modellen aan te sturen om absolute XYXY-coördinaten in image-pixels terug te geven. Dit verschilt van Gemini 3.5 Flash, die het beste presteerde met YXYX-coördinaten genormaliseerd naar een bereik van 0–1000. Het gebruik van het verkeerde coördinatenformaat verminderde de detectieprestaties van GPT-5.6 met ongeveer 15 mAP-punten in onze benchmark.

In enkele gevallen gaf GPT-5.6 Sol boxes terug in schijnbaar willekeurige delen van de afbeelding. Veel hiervan hadden geen of bijna geen overlap met de ground truth. In plaats van de zichtbare objecten te matchen, vormden de boxes vaak onnatuurlijke lay-outs, zoals rechte rijen of gelijkmatig verdeelde groepen.

We hebben deze voorbeelden gedeeld met OpenAI. Hun team bevestigde dat Sol minder stabiel wordt bij afbeeldingen van ongeveer 2.000 bij 2.000 pixels of groter, vooral bij een lagere reasoning effort. Een hogere reasoning effort verbetert de stabiliteit, maar verhoogt ook het tokengebruik, de latentie en de kosten. Het verkleinen of bijsnijden van grote afbeeldingen voordat ze naar de OpenAI API worden gestuurd, is de meest praktische oplossing.

Objecttellen

Het tellen is verbeterd over de gehele GPT-5.6-lijn. Sol scoorde 73,0% in onze benchmark, omhoog vanuit 64,9% voor GPT-5.5, terwijl Terra en Luna 67,6% en 66,2% bereikten. Luna, het goedkoopste model in de lijn, presteerde nog steeds beter dan de vorige OpenAI-baseline.

Als onderdeel van de benchmark hebben we gevallen getest die meer vereisen dan alleen het spotten van objecten en het teruggeven van een totaal. Sol telde sterk overlappende metalen beugels, een moeilijke casus voor zowel traditionele objectdetectoren als VLMs. Sol telde ook kogelgaten die zich uitsluitend in geselecteerde scorezones bevonden, wat getuigt van een begrip van zowel welke objecten geteld moesten worden als waar de regel van toepassing was.

Blisterverpakkingen bleken veel moeilijker. In aparte prompts vroegen we Sol om de lege vakjes en de pillen die nog in de verpakking zaten te tellen. De herhalende lay-out, reflecties en kleine visuele verschillen tussen gevulde en lege vakjes maakten beide taken moeilijk.

Het voorbeeld met de abnormale snoepjes legde een ander type fout bloot. Sol gaf het verkeerde aantal, hoewel het onduidelijk is of het model de snoepjes verkeerd telde of de doelcategorie verkeerd begreep.

OCR en data-extractie

De OCR-prestaties bleven dicht bij die van GPT-5.5. Sol behaalde een gemiddelde similarity-score van 90,7%, slechts 0,5 punten achter GPT-5.5 met 91,2%, terwijl Terra en Luna 88,8% en 88,4% bereikten. Het gat was groter bij tekstextractie, waar Sol 82,5% scoorde vergeleken met 87,6% voor GPT-5.5. Luna en Terra volgden met 81,4% en 79,4%.

Als onderdeel van de benchmark maakten we een onderscheid tussen volledige transcriptie en gerichte extractie. OCR vraagt het model om alle zichtbare tekst te transcriberen, terwijl tekstextractie vraagt om een specifiek stukje informatie. Sol presteerde goed op handgeschreven notities in beide scenario's, waarbij in het ene geval een volledige transcriptie werd gemaakt en in het andere een gevraagde datum werd geëxtraheerd.

Sol presteerde goed op tekst die ingebed was in complexe visuele scènes. Het las een reeks bandenmaten die gedrukt was langs het gebogen oppervlak van een vuile, versleten band. In een ander voorbeeld extraheerde het de live-score van een hockeyscorebord en gaf het antwoord terug in het gevraagde formaat, wat zowel het visuele lezen als het opvolgen van instructies testte.

Sommige simpel ogende extractietaken mislukten nog steeds. Sol kon de vervaldatum niet lezen die op een blisterverpakking was gedrukt. De tekst was klein, verticaal, had een laag contrast en werd beïnvloed door reflecties, wat de fout kan verklaren.

Afwegingen

De winst in visuele prestaties gaat gepaard met een hoger tokengebruik over de hele GPT-5.6-lijn. Het verschil is minder relevant in kleine tests, maar wordt belangrijker op grote schaal, waar het tokenvolume direct de verwerkingskosten verhoogt.

Sol gemiddelde bijna 10 seconden per afbeelding in onze benchmark. Terra bracht dit terug naar ongeveer 6 seconden, terwijl Luna in iets meer dan 5 seconden klaar was. Luna biedt de sterkste balans tussen latentie en kwaliteit in de lijn, met een snelheid die dicht bij Gemini 3.5 Flash ligt, terwijl het GPT-5.5 nog steeds overtreft in detectie en tellen.

In onze benchmark kostte Sol ongeveer 2,5 cent per afbeelding, waarmee het het op één na duurste model is na Claude Fable 5. Terra bracht de gemiddelde kosten terug naar ongeveer 1 cent per afbeelding, terwijl Luna minder dan 0,5 cent kostte.

Met 0,8 cent per afbeelding is Gemini 3.5 Flash veel goedkoper dan Sol, terwijl het in onze benchmarks voor detectie en tellen nog steeds aan kop staat. Dit maakt het een sterke optie voor data-intensieve workloads waar kosten opschalen over grote batches afbeeldingen.

Belangrijkste conclusies

Met GPT-5.6 komt OpenAI veel dichter bij de leidende VLMs dan voorheen. Detectie is verschoven van een zwak punt naar een bruikbare functionaliteit, en het tellen is verbeterd over de hele modelfamilie.

Er zijn nog steeds duidelijke beperkingen. Gemini 3.5 Flash blijft in onze benchmark een betere praktische keuze voor detectie en tellen in hoge volumes, vooral gezien de prijs.

GPT-5.6 laat zien dat OpenAI visuele capaciteiten nu veel serieuzer neemt. Sol heeft nog steeds gebreken, vooral op het gebied van kosten, latentie en sommige onstabiele detectiegevallen, maar de vooruitgang is moeilijk te negeren. Voor agents, schermbegrip, document-workflows en visueel redeneren maakt deze release OpenAI een veel sterkere optie dan voorheen.

***

Citeer dit artikel

Gebruik de volgende vermelding om dit bericht te citeren in je onderzoek: Piotr Skalski. (16 juli 2026). GPT 5.6 Sol is the best "vision" model OpenAI ever released. Roboflow Blog: https://blog.roboflow.com/openai-gpt-5-6/