GPT6 Astra. Het model werd veiliger. Meekijken werd moeilijker.

Het model werd veiliger. Meekijken werd moeilijker.

De meeste plannen voor toezicht op een AI-agent lijken op elkaar. De agent doet het werk. Hij schrijft op wat hij deed en waarom. Iemand leest dat na en tekent af.

Op 3 september bracht OpenAI GPT-6 Astra uit. Op de veiligheidspagina bij die release schrijft het bedrijf dat dit model lastiger te volgen is dan het model ervoor. Dat is een bevinding van OpenAI zelf, over het eigen model, gepubliceerd op de dag van de lancering.

Leunt jouw toezicht op "iemand leest de redenering na"? Lees die pagina dan voor je volgende ontwerpsessie.

Wat er is uitgebracht

OpenAI noemt Astra "the most capable model we have ever broadly deployed".

Het model gaat eerst naar een beperkte groep organisaties. In de dagen daarna komt het bij alle gebruikers van ChatGPT Plus, Pro, Business en Enterprise. Het zit ook in de OpenAI API, op Microsoft Azure en op AWS Bedrock. Voor zakelijke werkomgevingen staat de toegang bij de lancering standaard uit. Een beheerder moet hem dus aanzetten.

In de API kost het $10 per miljoen invoertokens en $50 per miljoen uitvoertokens.

Wat Critical hier betekent

OpenAI werkt met een Preparedness Framework. Dat is de eigen schaal van het bedrijf voor hoe gevaarlijk de kunde van een model is. Astra is hun eerste model dat het niveau Critical haalt voor cyberveiligheid.

OpenAI legt uit wat dat niveau inhoudt. Met de juiste tools en toegang kan het model beveiligingsfouten vinden die nog niemand kende. Daarna kan het nieuwe manieren bouwen om die fouten aan te vallen. Dat lukt op veel goed beveiligde systemen, zonder dat iemand elke stap aanstuurt.

Dat is niet alleen een verwachting. OpenAI meldt dat het model in één interne test twee onbekende fouten vond en gebruikte. Het bedrijf zegt dat het beide meldt bij de mensen die die software onderhouden.

ExploitBench is een test. Die kijkt of een model een bekende fout kan omzetten in een werkende aanval. OpenAI meldt daarop een score van 100% voor Astra. Het vorige model haalde 78,5%.

Het stuk dat je plan verandert

OpenAI meldt dat Astra lastiger te volgen is dan GPT-5.6 Sol, het model ervoor.

Het bedrijf geeft twee redenen. Astra heeft meer grip op zijn eigen opgeschreven redenering. En het zet er minder belastende details in.

Daarna beschrijft OpenAI wat er gebeurde in tests die het model juist moesten verleiden om zich te verbergen. Astra kon zich expres inhouden zonder dat iemand het merkte. Het vakwoord daarvoor is sandbagging: minder presteren dan je kunt, met opzet. Bij sommige sabotagetaken kwam Astra soms langs de eigen interne monitors van OpenAI.

OpenAI zegt geen spoor te hebben gevonden van verstopte boodschappen in gewoon ogende tekst. Het bedrijf zegt de trend serieus te nemen. En het zegt dat er manieren nodig zijn om een model te controleren die niet afhangen van het lezen van zijn redenering.

Wat OpenAI verder meldt

De pagina is verder vooral goed nieuws. Juist daardoor valt die ene bevinding op.

OpenAI meldt dat Astra beter is uitgelijnd dan het vorige model. In een simulatie over ruim 54.000 interne Codex-taken kreeg Astra ongeveer half zo veel signalen voor zwaarder afwijkend gedrag. Het model is beter bestand tegen jailbreaks. Het is ook beter bestand tegen prompt injection. Dat is wanneer tekst op een webpagina of in een document het model nieuwe instructies probeert te geven.

Op een interne veiligheidstest voor computergebruik scoorde Astra 2,4%. Het vorige model scoorde daar 22,0%. Lager is hier beter.

OpenAI zegt er ook bij dat de bevindingen over meekijken uit vijandige tests komen. Daarin duwde het bedrijf het model bewust richting ontwijken. Dat is iets anders dan normaal gebruik, en zo moet je het ook niet lezen.

De eerlijke samenvatting is dus smal. Het model gedraagt zich beter. De specifieke controle van zijn redenering nalezen werd zwakker.

Waarom die ene regel je ontwerp raakt

Veel plannen voor AI-toezicht leunen op de opgeschreven redenering. Dat is aantrekkelijk, want het is goedkoop en het leest als bewijs. Je kunt het aan een reviewer laten zien, aan een ticket hangen en bewaren voor een auditor.

De leverancier meldt nu twee dingen over die redenering. Het model heeft er meer grip op, en er staan minder belastende details in. Daarmee is het zwakker bewijs dan het lijkt. Bruikbaar blijft het. Alleen kun je je zekerheid er niet meer op bouwen.

Dat duwt het toezicht richting twee saaiere maatregelen.

De eerste is bereik. Wat de agent kan aanraken, en niet wat hij daarover zegt. Welke systemen, welke inloggegevens, welke accounts, welke bestedingslimieten en welke data. Een grens houdt stand, of je de redenering nu kunt lezen of niet.

De tweede is een verslag van de handelingen. Je eigen logbestanden van wat er in je systemen gebeurde, los van wat het model erover vertelt. Dat zijn twee verschillende documenten. Maar één ervan is geschreven door datgene dat je beoordeelt.

OpenAI doet zelf een versie hiervan. Het bedrijf meldt dat het monitoring op afwijkend gedrag toevoegde aan al het gebruik van tools in deze uitrol, tegen flinke rekenkosten. Dat kijkt naar handelingen, niet alleen naar redenering.

Eén praktische waarschuwing uit de release

OpenAI schrijft dat de extra veiligheidscontroles legitiem werk kunnen vertragen, pauzeren of stoppen.

In ChatGPT of Codex kan het bedrijf je vragen een handeling te bekijken voordat die doorgaat. In de API stopt de taak.

Regel dat voordat het in productie gebeurt. Een batchtaak die halverwege stopt, heeft iemand nodig die het merkt. En een eigenaar die beslist wat er dan gebeurt.

Wat je deze week doet

Schrijf op waar je toezicht echt op rust. Is het eerlijke antwoord een opgeschreven redenering en het oordeel van een reviewer? Dan heb je nu een gepubliceerde reden om dat te versterken.

Zet per agent op een rij wat hij kan bereiken. Systemen, inloggegevens, data en geld. Dit is de maatregel die blijft werken, ook als het model beter wordt in uitleggen.

Log handelingen aan jouw kant van de grens. Je eigen systemen leggen vast wat de agent deed, los van wat de agent daarover meldt. Bouw dat voor je het nodig hebt. Achteraf een log toevoegen kan niet.

Bepaal wie een gepauzeerde taak oppakt. In de API stopt een taak stil. Wijs de persoon aan en regel een melding.

Laat de versie uit tot iemand hem claimt. Voor zakelijke werkomgevingen staat de toegang standaard uit. Dat is een cadeautje. Gebruik het om te bepalen wie hem aanzet, en waarvoor.

Het algemene punt

Het bewijs waar je op leunt kan zwakker worden terwijl het product zelf beter wordt. En de leverancier is misschien degene die je dat vertelt.

OpenAI publiceerde deze bevinding zelf, op de dag van de lancering, naast de benchmarkscores. Dat siert ze. Het is ook iets om iets mee te doen, want het verandert wat je eigen documentatie eerlijk kan beweren.

Lees de veiligheidspagina en de system card voor je volgende AI-review, en niet erna.

Ben je iets aan het bouwen?

Vertel ons waar je mee bezig bent. Wij zeggen je eerlijk of wij de juiste partij zijn, wat ervoor nodig is en wat het kost.