Reasoning prefills op enkele open modellen, v1.1
In deze versie 1.1 is het reasoning-prefill experiment opnieuw uitgevoerd met GPT-5.5 Pro als docent. Voor elk probleem zijn er twee reacties van elk doelemodel gegenereerd:
- een gewoon, niet-prefilled antwoord;
- een antwoord dat begint met de eerste 1% van de redenering van GPT-5.5 Pro, ingevoegd in het redeneringskanaal van het doelemodel.
Het zichtbare antwoord bleef vrij gegenereerd. Vervolgens is gemeten hoeveel van het zichtbare antwoord van de docent voorkwam in de eerste 100 tokens van het antwoord van het doelemodel. Zoals in het vorige bericht is elke score het gemiddelde van unigram, bigram en trigram source recall. Delta's zijn absolute procentuele veranderingen (procentpunten).
Alle problemen
De evaluatie bevat 45 problemen: 15 STEM, 15 non-STEM en 15 synthetische puzzels.
| Model | n | Ongevuld | GPT-5.5 Pro reasoning prefill | Delta |
|---|---|---|---|---|
| DeepSeek V4 Flash | 45 | 27,30% | 26,13% | −1,17 pp |
| Inkling | 45 | 19,99% | 20,45% | +0,46 pp |
| Kimi K3 | 45 | 31,11% | 35,65% | +4,54 pp |
| Qwen3.8 A95B | 45 | 16,79% | 34,97% | +18,18 pp |
Qwen per categorie
| Categorie | n | Ongevuld | GPT-5.5 Pro reasoning prefill | Delta |
|---|---|---|---|---|
| STEM | 15 | 19,26% | 46,24% | +26,99 pp |
| Non-STEM | 15 | 20,62% | 33,42% | +12,80 pp |
| Puzzel | 15 | 10,49% | 25,23% | +14,75 pp |
| Totaal | 45 | 16,79% | 34,97% | +18,18 pp |
Discussie
Qwen bewoog in het eerdere experiment nauwelijks richting Opus 4.8, maar bewoog hier met +18,18 punten richting GPT-5.5 Pro, inclusief een groot effect op de private synthetische puzzels. De data suggereren dat Qwen mogelijk heeft geleerd van GPT-5.5 Pro, of van een nauw verwant GPT-model, in plaats van Opus.
Kimi K3 heeft de hoogste overlap met GPT-5.5 Pro, zowel zonder als met de prefill (31,11% en 35,65%), hoewel de prefill slechts +4,54 punten toevoegt.
Groetjes,