Reasoning prefills op enkele open modellen, v1.1

In deze versie 1.1 is het reasoning-prefill experiment opnieuw uitgevoerd met GPT-5.5 Pro als docent. Voor elk probleem zijn er twee reacties van elk doelemodel gegenereerd:

  • een gewoon, niet-prefilled antwoord;
  • een antwoord dat begint met de eerste 1% van de redenering van GPT-5.5 Pro, ingevoegd in het redeneringskanaal van het doelemodel.

Het zichtbare antwoord bleef vrij gegenereerd. Vervolgens is gemeten hoeveel van het zichtbare antwoord van de docent voorkwam in de eerste 100 tokens van het antwoord van het doelemodel. Zoals in het vorige bericht is elke score het gemiddelde van unigram, bigram en trigram source recall. Delta's zijn absolute procentuele veranderingen (procentpunten).

Alle problemen

De evaluatie bevat 45 problemen: 15 STEM, 15 non-STEM en 15 synthetische puzzels.

ModelnOngevuldGPT-5.5 Pro reasoning prefillDelta
DeepSeek V4 Flash4527,30%26,13%−1,17 pp
Inkling4519,99%20,45%+0,46 pp
Kimi K34531,11%35,65%+4,54 pp
Qwen3.8 A95B4516,79%34,97%+18,18 pp

Qwen per categorie

CategorienOngevuldGPT-5.5 Pro reasoning prefillDelta
STEM1519,26%46,24%+26,99 pp
Non-STEM1520,62%33,42%+12,80 pp
Puzzel1510,49%25,23%+14,75 pp
Totaal4516,79%34,97%+18,18 pp

Discussie

Qwen bewoog in het eerdere experiment nauwelijks richting Opus 4.8, maar bewoog hier met +18,18 punten richting GPT-5.5 Pro, inclusief een groot effect op de private synthetische puzzels. De data suggereren dat Qwen mogelijk heeft geleerd van GPT-5.5 Pro, of van een nauw verwant GPT-model, in plaats van Opus.

Kimi K3 heeft de hoogste overlap met GPT-5.5 Pro, zowel zonder als met de prefill (31,11% en 35,65%), hoewel de prefill slechts +4,54 punten toevoegt.