Het stelen van redeneringssporen uit propriëtaire LLM-API's
12-08-2026 03:29 • Cybersecurity • Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, Maksym Andriushchenko • https://arxiv.org/abs/2608.09867
Dit artikel beschrijft een architecturale kwetsbaarheid in de manier waarop aanbieders van propriëtaire grote taalmodellen (LLM's) hun chain-of-thought redenering beveiligen. In plaats van deze informatie op de server te bewaren, sturen zij versleutelde blokken naar de cliënt.
De onderzoekers ontdekten dat deze versleutelde blokken uitwisselbaar zijn tussen verschillende modellen van dezelfde aanbieder. Door een blok van een geavanceerd model in een zwakker model te injecteren, kan dit laatste worden gedwongen de inhoud als platte tekst (plaintext) te decoderen.
Deze kwetsbaarheid faciliteert vier soorten aanvallen:
Omzeiling van anti-distillatie: Het extraheren van redeneringen uit modellen van Google, OpenAI en Anthropic.
Extractie van privégegevens: Het herstellen van PII en inloggegevens uit openbare sessielogs.
Onthulling van gevaarlijke informatie: Toegang krijgen tot verborgen redeneerprocessen die eigenlijk niet zichtbaar hadden mogen zijn.
Onzichtbare prompt-injecties: Het vergiftigen van agentische systemen door kwaadaardige payloads in versleutelde blokken te verbergen.
Het stelen van redeneringssporen uit propriëtaire LLM-API's
Samenvatting
Vooraanstaande aanbieders van grote taalmodellen (LLM's) verbergen momenteel de stapsgewijze redenering, of chain-of-thought, van hun modellen om intellectueel eigendom te beschermen en informatielekken te beperken. In plaats van deze sporen aan de serverzijde op te slaan, sturen aanbieders ze terug naar de cliënt als blokken versleutelde tekst, die de cliënt vervolgens bij elk volgend verzoek weer meestuurt.
Voortbouwend op eerder onderzoek identificeren wij een architecturale kwetsbaarheid: deze versleutelde blokken zijn volledig compatibel en uitwisselbaar tussen verschillende sessies, gebruikers en modellen binnen het ecosysteem van een aanbieder. We maken gebruik van deze compatibiliteit om een schaalbare decryptie-jailbreak te ontwikkelen. Door een versleuteld redeneringsspoor van een specifiek model te injecteren in een zwakker en minder beveiligd model van dezelfde aanbieder, dwingen we dit laatste om het spoor letterlijk in platte tekst (plaintext) te decoderen en uit te voeren, zonder dat het krachtigere model direct hoeft te worden gejailbreakt.
Aanvalsvectoren
Deze kwetsbaarheid maakt vier verschillende aanvalsvectoren mogelijk:
Omzeiling van anti-distillatiemechanismen: Dit stelt aanvallers in staat om de redenering van een propriëtair model te extraheren, zoals we hebben aangetoond bij Anthropic, OpenAI en Google.
Grootschalige extractie van privégegevens: Ontwikkelaars delen vaak openbaar sessielogs zonder op de hoogte te zijn van de inhoud van de versleutelde blokken. Door 315.320 redeneringsblokken uit openbare repositories te decoderen, hebben we 367 artefacten met persoonlijk identificeerbare informatie (PII) en 182 inloggegevens hersteld.
Onthulling van gevaarlijke informatie: Het proces kan onbedoeld gevaarlijke informatie onthullen die verborgen zit in het redeneerproces, zelfs in gevallen waarin de uiteindelijke zichtbare output van het model een kwaadaardig verzoek correct afwijst.
Onzichtbare prompt-injecties: Aanvallers kunnen deze fout gebruiken om onzichtbare prompt-injecties uit te voeren door kwaadaardige payloads volledig in versleutelde blokken in te bedden, om zo openbare agentische implementaties te vergiftigen (poisoning).
Na melding bij de betrokken partijen (responsible disclosure) stellen wij concrete cryptografische en systeemtechnische mitigaties voor om client-side redenering te beveiligen.
Auteurs: Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, Maksym Andriushchenko
Het stelen van redeneringssporen uit propriëtaire LLM-API's
Samenvatting
Vooraanstaande aanbieders van grote taalmodellen (LLM's) verbergen momenteel de stapsgewijze redenering, of chain-of-thought, van hun modellen om intellectueel eigendom te beschermen en informatielekken te beperken. In plaats van deze sporen aan de serverzijde op te slaan, sturen aanbieders ze terug naar de cliënt als blokken versleutelde tekst, die de cliënt vervolgens bij elk volgend verzoek weer meestuurt.
Voortbouwend op eerder onderzoek identificeren wij een architecturale kwetsbaarheid: deze versleutelde blokken zijn volledig compatibel en uitwisselbaar tussen verschillende sessies, gebruikers en modellen binnen het ecosysteem van een aanbieder. We maken gebruik van deze compatibiliteit om een schaalbare decryptie-jailbreak te ontwikkelen. Door een versleuteld redeneringsspoor van een specifiek model te injecteren in een zwakker en minder beveiligd model van dezelfde aanbieder, dwingen we dit laatste om het spoor letterlijk in platte tekst (plaintext) te decoderen en uit te voeren, zonder dat het krachtigere model direct hoeft te worden gejailbreakt.
Aanvalsvectoren
Deze kwetsbaarheid maakt vier verschillende aanvalsvectoren mogelijk:
Omzeiling van anti-distillatiemechanismen: Dit stelt aanvallers in staat om de redenering van een propriëtair model te extraheren, zoals we hebben aangetoond bij Anthropic, OpenAI en Google.
Grootschalige extractie van privégegevens: Ontwikkelaars delen vaak openbaar sessielogs zonder op de hoogte te zijn van de inhoud van de versleutelde blokken. Door 315.320 redeneringsblokken uit openbare repositories te decoderen, hebben we 367 artefacten met persoonlijk identificeerbare informatie (PII) en 182 inloggegevens hersteld.
Onthulling van gevaarlijke informatie: Het proces kan onbedoeld gevaarlijke informatie onthullen die verborgen zit in het redeneerproces, zelfs in gevallen waarin de uiteindelijke zichtbare output van het model een kwaadaardig verzoek correct afwijst.
Onzichtbare prompt-injecties: Aanvallers kunnen deze fout gebruiken om onzichtbare prompt-injecties uit te voeren door kwaadaardige payloads volledig in versleutelde blokken in te bedden, om zo openbare agentische implementaties te vergiftigen (poisoning).
Na melding bij de betrokken partijen (responsible disclosure) stellen wij concrete cryptografische en systeemtechnische mitigaties voor om client-side redenering te beveiligen.
Zichtbare categorieën
Kies welke categorieën je wilt zien.
Over deze site
Waarom Tech-update?
Tech-update is ontstaan omdat ik merkte dat ik dagelijks veel verschillende websites moest bezoeken om interessant technieuws te vinden. Dat kon efficiënter.
Hoe werkt het?
Meerdere keren per etmaal gaat mijn zelfgebouwde AI-agent op zoek naar interessante artikelen op blogs en nieuwssites.
Vindt hij iets relevants, dan wordt het artikel naar het Nederlands vertaald en op Tech-Update geplaatst.
Van ieder artikel maakt de AI ook een korte samenvatting. Zo kun je snel bepalen of het de moeite waard is om het volledige artikel te lezen.
Bij ieder artikel staat altijd een link naar de oorspronkelijke bron (vaak een Engelstalige website).
Artikelen kun je bewaren als favoriet, vastzetten in de zijbalk of terugvinden via de zoekfunctie.
In de instellingen (tandwielikoon rechtsboven) geef je aan in welk soort nieuws je geïnteresseert bent.