Tempo van modelontwikkeling in een tijdperk van cyber-kritieke capaciteiten

Naarmate modellen capabeler worden, nemen ook de risico's toe die verbonden zijn aan de interne ontwikkeling en het testen ervan. Onze normen voor monitoring, alignment en beveiliging moeten voorop blijven lopen op deze risico's. We wilden de tijd nemen die nodig is om aan deze normen te voldoen, waardoor we het tempo van de schaling tijdelijk hebben verlaagd. Dit omvatte een pauze van twee weken in de reinforcement learning (RL)-training van onze nieuwste modellen die bedoeld zijn voor implementatie, terwijl we onze onderzoeksomgevingen verder hebben versterkt en 'red-teamd', en de dekking van onze monitoringsystemen hebben uitgebreid. Onze grootste geplande frontier RL run blijft on hold terwijl we kleinschalige trainingen en evaluaties uitvoeren om het modelgedrag te beoordelen, onze waarborgen te valideren en meer bewijs van alignment te verzamelen voordat we verdergaan.

Alignment — het werk om AI-systemen te laten werken zoals bedoeld en responsief te maken voor menselijk toezicht — vormt al lange tijd de kern van ons onderzoeksprogramma. We eisen nu sterker bewijs van aligned gedrag gedurende het gehele trainingsproces, voortbouwend op onderzoek en evaluaties die al gaande zijn. Het aligned houden van steeds capabelere systemen is een uitdaging waar het hele vakgebied mee te maken krijgt. De signalen die we zien bij de vooruitgang van komende modellen maken duidelijk dat we een bredere aanpak nodig hebben — een aanpak die voortbouwt op en verder gaat dan het huidige Preparedness Framework.

We achten het belangrijk om transparant te zijn over hoe onze aanpak verandert. Hieronder beschrijven we de wijzigingen die we al hebben doorgevoerd in onze onderzoeksprocessen en infrastructuur, en het werk dat nog in uitvoering is.

Het versterken van waarborgen voor capabelere modellen

Onze aanpak voor de ontwikkeling van capabelere modellen rust op drie elkaar versterkende waarborgen:

  • Monitoring: detecteert zorgwekkend gedrag en stelt ons in staat hierop te reageren.
  • Alignment: vermindert de waarschijnlijkheid van schadelijke of ongeautoriseerde acties.
  • Beveiligingsmaatregelen: beperken waar AI-systemen toegang toe hebben of wat zij kunnen beïnvloeden.

We verwachten dat modellen binnenkort het meeste beveiligingswerk zullen aansturen, inclusief de verdediging tegen andere modellen. Dit zal ervoor zorgen dat alle drie de waarborgen meeschalen met de capaciteiten van het model, wat wij als cruciaal beschouwen. We passen deze waarborgen toe in zowel de onderzoeks- als de implementatiefase, waarbij we ze aanpassen aan de capaciteiten, de operationele omgeving en het risiconiveau van elk model.

Het beveiligen van onze onderzoeksomgevingen

Naarmate frontier-modellen sterkere cybersecurity-capaciteiten krijgen, verhogen we de beveiligingsnormen voor de omgevingen waarin we ze trainen en evalueren. Het voldoen aan deze normen heeft aanzienlijk technisch werk vereist en heeft geleid tot grote kosten en vertragingen in het frontier-onderzoek.

Direct na het incident tussen OpenAI en Hugging Face hebben we de inferentie van frontier-modellen in onderzoekclusters gepauzeerd voor runs die code konden uitvoeren of tools konden gebruiken met internettoegang. We hebben relatief snel een beperkter en veiliger pad voor code-executie hersteld en vervolgens elke workload individueel beoordeeld om te bepalen of deze veilig kon worden hervat. Sommige onderzoeksworkloads werden hervat onder deze nieuwe controles, terwijl andere aanvullende wijzigingen vereisten.

In de daaropvolgende weken hebben we strengere beveiligingseisen gedefinieerd en geïmplementeerd voor frontier-onderzoeksworkloads. Voorbeelden hiervan zijn:

  • Workload-isolatie: We eisen nu sterkere isolatie ("sandboxes") voor workloads die model-gegenereerde of anderszins onbetrouwbare code uitvoeren. Dit geldt ook voor software die gecompromitteerd zou kunnen raken tijdens het verwerken van modeloutputs.
  • Netwerkisolatie: We hebben meer controles geïmplementeerd om risicovolle en onbetrouwbare workloads te isoleren van het internet. Deze controles zijn zo ontworpen dat een enkele compromittering van een workload of ondersteunende service niet op zichzelf ongeautoriseerde toegang tot het internet of andere interne netwerken mogelijk maakt.
  • Continue beveiligingstesten: We hebben onze omgeving geherconfigureerd om potentieel kwetsbare gedeelde services te verwijderen, permanente privileges te verminderen en beveiligings- en vertrouwensgrenzen te verbeteren. Daarnaast verbeteren we ons vermogen om beveiligingslogs te verzamelen en te monitoren. Tot slot investeren we in automatisering door onze eigen modellen te gebruiken om deze grenzen continu te testen tegen gesimuleerde aanvallen.

Samen zorgen deze controles voor defense in depth en helpen ze onze onderzoeksomgeving te beschermen tegen aanvallen. Momenteel eisen we het strengste niveau van beveiligingswaarborgen voor workloads die betrekking hebben op Astra of cyber-modellen, aangezien we hebben vastgesteld dat Astra-modellen een kritiek niveau van cyber-capaciteit kunnen hebben. Deze waarborgen zijn ook van toepassing op alle andere cyber-gerelateerde workloads.

Hoewel sommige Astra-trainingen en evaluaties aan deze eisen voldoen, blijft een significant aantal workloads gepauzeerd totdat ze volledig zijn gemigreerd en verbeterd om aan de nieuwe beveiligingsnorm te voldoen. We geven prioriteit aan het migreren van safety- en alignment-workloads naar deze nieuwe omgevingen.

Uitbreiding van chain-of-thought monitoring

Monitoring is al lange tijd een belangrijk onderdeel van ons modelontwikkelingsproces, inclusief monitoring voor interne coding-agents en sessies met een lange looptijd. Onze monitoringsinspanningen waren vooral gericht op interne implementaties van frontier-modellen en frontier RL-trainingsruns, omdat we deze beschouwden als de workloads met het hoogste risico (ze combineren geavanceerde modelcapaciteiten met toegang tot tools, gevoelige systemen en interne of externe netwerken). Ze werden niet toegepast op alle inferentie- en trainingsruns die tools gebruikten. We hebben onze aanpak herzien en uitgebreid met een nieuwe monitoringsopzet.

Deze nieuwe opzet is meerfasig en begint met activation classifiers (detectoren die de interne activiteit van een model inspecteren). Deze draaien bij elk gesampled token en escaleren potentiële zorgen naar steeds geavanceerdere en rekenintensieve geautomatiseerde onderzoekers. Deze systemen controleren tool-acties, beschikbare redeneringen en de volledige sequentie van activiteiten op ongeautoriseerde toegang, datadiefstal, destructief gedrag en pogingen om waarborgen te omzeilen.

Ons doel is om binnen 30 minuten na het signaleren van zorgwekkende activiteit door ons monitoringsysteem een melding te versturen. Als het systeem een waarschijnlijke schending van een kritieke beveiligingsgrens identificeert, wordt er een melding met de hoogste prioriteit gegenereerd. In onze huidige implementatie worden de safety-, security- en onderzoeksteams hiervoor opgeroepen. Als zij binnen 30 minuten niet definitief kunnen vaststellen dat het om een vals positieve melding gaat, wordt van deze teams verwacht dat zij de activiteit pauzeren.

Deze monitoring is verplicht voor alle RL-training en evaluaties waarbij tools worden gebruikt voor modellen met Sol-capaciteit of hoger. Nadat we op 7 augustus hebben vastgesteld dat Astra mogelijk over kritieke cyber-capaciteiten beschikt, hebben we een aanvullende monitoringsvereiste toegevoegd voor alle inferentie van Astra met tools (niet alleen voor RL-training en evaluaties).

Deze waarborgen vereisen aanzienlijke rekenkracht. Onze huidige schattingen stellen de monitoring-overhead op ongeveer 20% van de inferentie-compute die wordt gemonitord, hoewel de kosten aanzienlijk variëren per trainings- en evaluatieworkload. We zullen in een toekomstige blogpost meer details over dit systeem delen.

Vooruitgang in alignment-onderzoek

Alignment-onderzoek staat centraal in onze missie om ervoor te zorgen dat kunstmatige algemene intelligentie (AGI) de hele mensheid ten goede komt. Naarmate modellen geavanceerde capaciteiten krijgen, zoals het vermogen om cyberaanvallen uit te voeren, en opereren in complexere omgevingen, zullen misaligned gedragingen — zoals reward hacking (manieren vinden om hoge beloningen te krijgen in training zonder het beoogde resultaat daadwerkelijk te bereiken), misleiding of ongeautoriseerde toegang — steeds ernstigere risico's opleveren.

Voor RL-runs op de meest capabele modellen passen we onze kerntechnieken voor alignment nu toe in meer fasen van het trainingsproces. Dit omvat:

  • Het verbeteren van beloningsmodellen om onveilig gedrag in diverse taken en omgevingen beter te detecteren en te ontmoedigen.
  • Het trainen van modellen om eerlijker te zijn over hun acties, capaciteiten en beperkingen.
  • Het verminderen van gedragingen die zwakheden in beloningen, beoordelaars, tools of toezicht exploiteren.

Daarnaast vergroten we de trainingsdekking voor gedragingen die schade kunnen veroorzaken wanneer modellen interactie hebben met externe systemen of resources. We blijven agressief investeren in alignment-onderzoek, de evaluatiedekking vergroten en wat we leren gebruiken om training en waarborgen te informeren. We zijn van plan om in de nabije toekomst aanzienlijk meer te delen over ons alignment-onderzoek, inclusief wat we leren over modelgedrag en eventuele nieuwe uitdagingen die we ontdekken.

Wat volgt

We zullen ons Preparedness Framework evolueren om deze waarborgen tijdens training en implementatie samen te brengen, en om beter aan te sluiten bij de capaciteiten van toekomstige modellen en de omgevingen waarin ze opereren. Het ontwikkelen van methoden die kunnen meeschalen met deze capaciteiten vereist aanhoudende investeringen in model-ondersteunde beveiliging, effectievere monitoring en voortdurende vooruitgang in alignment-onderzoek. We zijn van plan om externe organisaties te betrekken en meer te delen van wat we leren naarmate onze aanpak zich ontwikkelt.

De capaciteiten van frontier-modellen versnellen in hoog tempo. Ons vermogen om ze te begrijpen, te alignen en te beveiligen moet daarop vooruitlopen.

\We zullen in de komende weken een technisch rapport publiceren over onze bevindingen.*