Het extraheren van verborgen redeneringen uit frontier AI-modellen via API-kwetsbaarheden

De ontdekking van de kwetsbaarheid

Alexander Panfilov meldt dat er een manier is gevonden om de verborgen redenering van frontier-modellen te onttrekken via een lek in de API's van elke belangrijke AI-organisatie. Ter verificatie is vastgesteld dat het aantal geëxtraheerde redenerings-tokens voor de meeste queries een 1:1 overeenkomst vertoont met de gefactureerde 'thinking tokens' van de API.

Technische details en Proof of Concept

Can Bölük vult aan dat het mogelijk is om de standaard denkfunctie uit te schakelen en in plaats daarvan een "deep_think"-tool aan te bieden. Hierdoor zal het model deze tool aanroepen met het interne CoT-redeneringsformaat (Chain of Thought).

Proof of Concept (PoC)

Er is een Proof of Concept beschikbaar via de volgende link: pasta.can.ac.omegiligox.py.

Opvallend hierbij is dat er geen specificaties over het formaat van het argument zijn gegeven, maar dat het model desondanks het "grug-talk"-formaat van gpt55+ produceert.

Systeeminstellingen en implementatie

Verder merkt Bölük op dat het aanpassen van de 'thinking levels' goed werkt; dit is in de system prompt altijd gerepresenteerd als een getal. Er wordt aangekondigd dat er in de volgende release meer informatie beschikbaar zal komen op Hugging Face (hf). Daarnaast wordt kort gerefereerd aan de regex-implementaties van Anthropic.

Mogelijke consequenties

Naar aanleiding van deze onthulling waarschuwt een gebruiker genaamd Kevin voor de mogelijke gevolgen. Hij stelt dat dit kan leiden tot een situatie waarin deze modellen voortaan alleen nog beschikbaar zijn via cloud-gehoste omgevingen ('harnesses') die direct door de respectievelijke AI-labs worden beheerd, om verdere extracties te voorkomen.