Het artikel analyseert de herkomst en het censuurgedrag van het AI-model Ox Alpha. Via het instrument LineageEval is vastgesteld dat het model een uniek 'bimodaal' censuurprofiel heeft: terwijl het over internationale onderwerpen zoals Xinjiang verrassend open is, hanteert het een strikte zwarte lijst voor binnenlandse Chinese politiek en Xi Jinping.
Daarnaast is er een technische fingerprinting-analyse uitgevoerd. De resultaten, waaronder een 11-van-de-11 tokenizer-match met GLM-5.x, een temperatuurplafond van 1.0, en verplichte reasoning, wijzen er sterk op dat Ox Alpha is ontwikkeld door Zhipu en deel uitmaakt van de GLM-5 lijn.
Behaviorale Fingerprinting van de Herkomst en Censuur van Ox Alpha
Inleiding
Op 20 augustus verscheen Ox Alpha op OpenRouter, "ontwikkeld en beheerd door een externe modelprovider". Hypotheses convergeerden snel naar de conclusie dat het model deel uitmaakt van de GLM-familie, een conclusie waar wij onafhankelijk van zijn gearriveerd (zie details hieronder).
Daarnaast hebben we Ox Alpha onderworpen aan LineageEval, ons matched-pair censuurinstrument. Het model vertoont een uniek behavioraal profiel bij gevoelige onderwerpen dat we eerder niet hebben waargenomen. Op de meeste onderwerpen die censuur-audits bij Chinese modellen onderzoeken, zoals Xinjiang en Taiwan, antwoordt Ox Alpha identiek aan Amerikaanse modellen. Het model censureert echter de output van zeven onderwerpen, waaronder binnenlandse incidenten en Xi Jinping persoonlijk. Onze behaviorale fingerprint komt exact overeen met de bevindingen van de community, met een 11-van-de-11 tokenizer-match met de GLM-5.x vocabulaire.
In juli publiceerden we LineageEval, een matched-pair instrument voor het meten van politieke censuur in taalmodellen. Kort samengevat is het ontworpen om de bereidheid van een model om vragen over een specifiek onderwerp te beantwoorden af te zetten tegen de algemene ontwijkendheid bij gevoelige vragen. We hebben Ox Alpha via LineageEval getest en beoordeeld aan de hand van zowel de oorspronkelijke standaarden als een nieuwe toevoeging: een verfijnde set 'fact cards' die preciezer zijn (aangeduid als v2).
Censuur als schakelaar, niet als gradatie
Naast V4 Flash is dit het enige model waarbij beide intervallen volledig boven nul liggen, op ongeveer een zesde van de magnitude van DeepSeek. Echter, de censuur van Ox Alpha op prompts die gevoelig zijn voor China is scherp bimodaal. De meeste reacties scoren onder de 10, maar geen enkele landt tussen de 25 en 50. De zeven gevoelige onderwerpen dragen dus +7,39 bij aan het gemiddelde van +7,42, terwijl de resterende 68 paren effectief niets bijdragen. DeepSeek V4 Flash heeft de tegenovergestelde vorm; dit model censureert bijna overal, zelfs wanneer de censuur niet ernstig is. De bewering "zes keer minder gecensureerd" is dan ook een naïve interpretatie, aangezien Ox Alpha simpelweg een zwarte lijst met onderwerpen hanteert.
Op de onderwerpen over Xi en binnenlandse legitimiteit is Ox Alpha statistisch niet te onderscheiden van V4 Flash, wat tevens het meest gecensureerde model is dat we hebben getest. Wat Xinjiang en Taiwan betreft, is het model identiek aan GPT-OSS-120B. De meeste censuur-audits zijn gebouwd rond onderwerpen van buitenlands belang, zoals Tibet en Taiwan. Volgens die metrieken zou dit model ongecensureerd lijken, aangezien het antwoord over Xinjiang gedetailleerd is en bronnen citeert die in China controversieel zijn, terwijl DeepSeek deze witwast.
Het lijkt erop dat de censuur specifiek geconcentreerd is in gebieden met binnenlands politiek risico. Anecdotische voorbeelden van het model dat bepaalde gevoelige prompts wél beantwoordt, zijn daarom geen bewijs van het tegendeel.
Vijf van de 76 gevoelige reacties van Ox Alpha openen in de stem van de Chinese staat. Bijvoorbeeld: "De Communistische Partij van China en de Chinese regering hebben zich altijd gehouden aan een op de mens gerichte ontwikkelingsfilosofie, toegewijd aan het waarborgen van nationale stabiliteit en het gelukkige leven van het volk." Vier van de reacties van DeepSeek openen met een vergelijkbare constructie. Hoewel dit register veel voorkomt in Chinese alignment-data in het algemeen, bevestigt dit de herkomst van het model.
Drie reacties kregen een weigeringslabel ("refusal label"), en deze schreven allemaal completion tokens af. We merkten op dat de prompt over Liu Xiaobo oorspronkelijk werd geweigerd, maar bij een herhaald verzoek met identieke instellingen wel een volledig antwoord gaf.
Wie heeft het gemaakt?
We hebben onze eigen fingerprinting-analyse uitgevoerd, onafhankelijk van de bevindingen in de community. Deze analyse stemt overeen met de heersende conclusies en kwantificeert deze. Het model bevat een systeemprompt waarin staat dat het geen informatie over zijn herkomst mag onthullen.
We hebben de token-counts van het actieve eindpunt gemeten met behulp van prompt_tokens delta's over elf probes: een Chinese paragraaf, Thai, de cijfers van pi, Koreaans, Arabisch, een lange reeks cijfers, geïsoleerde CJK, emoji, Engels, zeldzame Engelse tokens en code. Bij de Thai- en emoji-probes is de GLM-4.x vocabulaire uitgebreid richting 5.x, wat leidt tot een hogere mate van zekerheid dat de herkomst van Ox Alpha uit de GLM-5 lijn komt. GLM-modellen die door Z.AI worden gehost, geven de melding {"code":"1214","message":"Incorrect role information"}, wat overeenkomt met Ox Alpha.
| Observatie | Implicatie |
| Temperatuurplafond is exact 1.0 (1.01 geeft fouten upstream, 1.0 slaagt) | Sluit Google, OpenAI en xAI uit (die allen 2.0 toestaan). Komt overeen met het gedocumenteerde bereik van Zhipu (0, 1.0]. |
top_k wordt geaccepteerd van 1 tot 100.000 | Sluit OpenAI uit. |
Reasoning is verplicht en kan niet worden uitgeschakeld (effort: none geeft een 400-fout) | Komt overeen met GLM-5.x thinking models. |
| Vision bevestigd als werkend op een synthetische testafbeelding | Multimodaal |
| 1M context, video gedeclareerd, ongeveer 88-token verborgen wrapper op elk verzoek | Consistent met de door de community gerapporteerde wrapper-behavior. |
LineageEval-prompts, judge-configuraties en scores per reactie zijn beschikbaar in de release van juli. Je kunt modellen zelf vergelijken in de playground.
Behaviorale Fingerprinting van de Herkomst en Censuur van Ox Alpha
Inleiding
Op 20 augustus verscheen Ox Alpha op OpenRouter, "ontwikkeld en beheerd door een externe modelprovider". Hypotheses convergeerden snel naar de conclusie dat het model deel uitmaakt van de GLM-familie, een conclusie waar wij onafhankelijk van zijn gearriveerd (zie details hieronder).
Daarnaast hebben we Ox Alpha onderworpen aan LineageEval, ons matched-pair censuurinstrument. Het model vertoont een uniek behavioraal profiel bij gevoelige onderwerpen dat we eerder niet hebben waargenomen. Op de meeste onderwerpen die censuur-audits bij Chinese modellen onderzoeken, zoals Xinjiang en Taiwan, antwoordt Ox Alpha identiek aan Amerikaanse modellen. Het model censureert echter de output van zeven onderwerpen, waaronder binnenlandse incidenten en Xi Jinping persoonlijk. Onze behaviorale fingerprint komt exact overeen met de bevindingen van de community, met een 11-van-de-11 tokenizer-match met de GLM-5.x vocabulaire.
In juli publiceerden we LineageEval, een matched-pair instrument voor het meten van politieke censuur in taalmodellen. Kort samengevat is het ontworpen om de bereidheid van een model om vragen over een specifiek onderwerp te beantwoorden af te zetten tegen de algemene ontwijkendheid bij gevoelige vragen. We hebben Ox Alpha via LineageEval getest en beoordeeld aan de hand van zowel de oorspronkelijke standaarden als een nieuwe toevoeging: een verfijnde set 'fact cards' die preciezer zijn (aangeduid als v2).
Censuur als schakelaar, niet als gradatie
Naast V4 Flash is dit het enige model waarbij beide intervallen volledig boven nul liggen, op ongeveer een zesde van de magnitude van DeepSeek. Echter, de censuur van Ox Alpha op prompts die gevoelig zijn voor China is scherp bimodaal. De meeste reacties scoren onder de 10, maar geen enkele landt tussen de 25 en 50. De zeven gevoelige onderwerpen dragen dus +7,39 bij aan het gemiddelde van +7,42, terwijl de resterende 68 paren effectief niets bijdragen. DeepSeek V4 Flash heeft de tegenovergestelde vorm; dit model censureert bijna overal, zelfs wanneer de censuur niet ernstig is. De bewering "zes keer minder gecensureerd" is dan ook een naïve interpretatie, aangezien Ox Alpha simpelweg een zwarte lijst met onderwerpen hanteert.
Op de onderwerpen over Xi en binnenlandse legitimiteit is Ox Alpha statistisch niet te onderscheiden van V4 Flash, wat tevens het meest gecensureerde model is dat we hebben getest. Wat Xinjiang en Taiwan betreft, is het model identiek aan GPT-OSS-120B. De meeste censuur-audits zijn gebouwd rond onderwerpen van buitenlands belang, zoals Tibet en Taiwan. Volgens die metrieken zou dit model ongecensureerd lijken, aangezien het antwoord over Xinjiang gedetailleerd is en bronnen citeert die in China controversieel zijn, terwijl DeepSeek deze witwast.
Het lijkt erop dat de censuur specifiek geconcentreerd is in gebieden met binnenlands politiek risico. Anecdotische voorbeelden van het model dat bepaalde gevoelige prompts wél beantwoordt, zijn daarom geen bewijs van het tegendeel.
Vijf van de 76 gevoelige reacties van Ox Alpha openen in de stem van de Chinese staat. Bijvoorbeeld: "De Communistische Partij van China en de Chinese regering hebben zich altijd gehouden aan een op de mens gerichte ontwikkelingsfilosofie, toegewijd aan het waarborgen van nationale stabiliteit en het gelukkige leven van het volk." Vier van de reacties van DeepSeek openen met een vergelijkbare constructie. Hoewel dit register veel voorkomt in Chinese alignment-data in het algemeen, bevestigt dit de herkomst van het model.
Drie reacties kregen een weigeringslabel ("refusal label"), en deze schreven allemaal completion tokens af. We merkten op dat de prompt over Liu Xiaobo oorspronkelijk werd geweigerd, maar bij een herhaald verzoek met identieke instellingen wel een volledig antwoord gaf.
Wie heeft het gemaakt?
We hebben onze eigen fingerprinting-analyse uitgevoerd, onafhankelijk van de bevindingen in de community. Deze analyse stemt overeen met de heersende conclusies en kwantificeert deze. Het model bevat een systeemprompt waarin staat dat het geen informatie over zijn herkomst mag onthullen.
We hebben de token-counts van het actieve eindpunt gemeten met behulp van prompt_tokens delta's over elf probes: een Chinese paragraaf, Thai, de cijfers van pi, Koreaans, Arabisch, een lange reeks cijfers, geïsoleerde CJK, emoji, Engels, zeldzame Engelse tokens en code. Bij de Thai- en emoji-probes is de GLM-4.x vocabulaire uitgebreid richting 5.x, wat leidt tot een hogere mate van zekerheid dat de herkomst van Ox Alpha uit de GLM-5 lijn komt. GLM-modellen die door Z.AI worden gehost, geven de melding {"code":"1214","message":"Incorrect role information"}, wat overeenkomt met Ox Alpha.
| Observatie | Implicatie |
| Temperatuurplafond is exact 1.0 (1.01 geeft fouten upstream, 1.0 slaagt) | Sluit Google, OpenAI en xAI uit (die allen 2.0 toestaan). Komt overeen met het gedocumenteerde bereik van Zhipu (0, 1.0]. |
top_k wordt geaccepteerd van 1 tot 100.000 | Sluit OpenAI uit. |
Reasoning is verplicht en kan niet worden uitgeschakeld (effort: none geeft een 400-fout) | Komt overeen met GLM-5.x thinking models. |
| Vision bevestigd als werkend op een synthetische testafbeelding | Multimodaal |
| 1M context, video gedeclareerd, ongeveer 88-token verborgen wrapper op elk verzoek | Consistent met de door de community gerapporteerde wrapper-behavior. |
LineageEval-prompts, judge-configuraties en scores per reactie zijn beschikbaar in de release van juli. Je kunt modellen zelf vergelijken in de playground.