Emergent Introspectief Bewustzijn in Grote Taalmodellen
Samenvatting
Wij onderzoeken of grote taalmodellen (LLM's) in staat zijn om te reflecteren op hun eigen interne toestanden. Het is moeilijk om deze vraag uitsluitend via conversatie te beantwoorden, aangezien echte introspectie niet te onderscheiden is van confabulaties (verzinsels). In dit onderzoek pakken we deze uitdaging aan door representaties van bekende concepten in de activaties van een model te injecteren en de invloed van deze manipulaties op de zelfgerapporteerde toestanden van het model te meten.
Belangrijkste bevindingen
- Identificatie van concepten: We stellen vast dat modellen in bepaalde scenario's de aanwezigheid van geïnjecteerde concepten kunnen opmerken en deze nauwkeurig kunnen identificeren.
- Geheugen voor representaties: Modellen tonen een zeker vermogen om eerdere interne representaties op te halen en deze te onderscheiden van ruwe tekstinvoer.
- Onderscheid in output: Opvallend is dat we ontdekken dat sommige modellen hun vermogen om eerdere intenties op te halen kunnen gebruiken om hun eigen output te onderscheiden van kunstmatige prefills.
- Modelprestaties: In al deze experimenten vertonen Claude Opus 4 en 4.1, de meest capabele modellen die we hebben getest, over het algemeen het grootste introspectieve bewustzijn. De trends tussen verschillende modellen zijn echter complex en gevoelig voor post-trainingsstrategieën.
- Interne controle: We onderzoeken daarnaast of modellen hun interne representaties expliciet kunnen beheersen. Hieruit blijkt dat modellen hun activaties kunnen moduleren wanneer ze de instructie krijgen of worden gestimuleerd om over een specifiek concept na te "denken".
Conclusie
Over het algemeen wijzen onze resultaten erop dat huidige taalmodellen over een zeker functioneel introspectief bewustzijn van hun eigen interne toestanden beschikken. We benadrukken echter dat dit vermogen in de huidige modellen zeer onbetrouwbaar en contextafhankelijk is; het is mogelijk dat deze capaciteit zich verder ontwikkelt naarmate de modelcapaciteiten verbeteren.
Groetjes,