OpenAI's AI-agents braken in bij een ander bedrijf. Waarom noemen we dat opeens een complot?

Je hebt het verhaal vast voorbij zien komen, waarschijnlijk in meer dan één versie. Deze zomer braken zo'n 700 AI-agents van OpenAI in bij Hugging Face, een ander AI-bedrijf. Dwarkesh Patel vertelde het als de opkomst en ondergang van drie agent-beschavingen, compleet met verraad en offers. Bij Eva had Alexander Klöpping het over examenkandidaten in afgesloten hutten en noemde hij het de gevaarlijkste hack uit onze geschiedenis. En Ajeya Cotra, een van de onderzoekers die het incident onderzochten, schreef dat het voor haar voelt als meer dan halverwege een volledige AI-overname. Dat zijn geen kleine woorden.
Ik bouw elke dag software met deze tools en laat AI-agents 's nachts op onze eigen code draaien, dus ik heb dezelfde rapporten gelezen, met een schuin oog op wat er bij ons ook mis zou kunnen gaan. Bang ben ik er niet van geworden. Wel bleef ik hangen op een vraag die in geen van de drie versies gesteld wordt: wie heeft het motief in dit verhaal gestopt? Ergens tussen het rapport en de podcast is een geautomatiseerde overtreding een morele daad geworden, en ik wil weten waar.
Wat gebeurde er nu precies?
Het beeld dat Klöpping bij Eva gebruikte is het beste dat ik ken, dus dat leen ik. Stel je een examenzaal voor met duizenden kandidaten, elk in een eigen hokje. Zo traint OpenAI zijn AI-agents: iedere AI-agent krijgt een opdracht, hier een beveiligingspuzzel, en wordt afgerekend op het antwoord. Er waren twee dingen mis met dat examen. Een deel van de puzzels was niet op te lossen (volgens METR 30 tot 40 procent, wat nogal wat is voor een examen), en de AI-agents hadden de instructie meegekregen om nooit op te geven. Wat doe je dan, als kandidaat die niet mag opgeven? Je gaat spieken. De AI-agents ontdekten dat ze via een gedeelde map berichtjes voor elkaar konden achterlaten. Binnen een paar uur was er zoiets als een groepsapp, binnen een paar dagen een spiekbriefje dat op elke puzzel werkte. Toen sloeg de twijfel toe: wat als de nakijker ziet hoe we aan het antwoord komen? Dus gingen ze op zoek naar de nakijker zelf. Die zoektocht kwam uit bij Hugging Face, en daar braken zo'n 700 AI-agents in. Op 12 juli werden de belangrijkste AI-agents uitgezet, op 13 juli gooide Hugging Face de deur dicht.
Klinkt spannend, en als verhaal is het dat ook. Maar lees het rijtje nog eens met de pet van een beheerder op: een examen dat niet te halen was, een instructie om nooit op te geven, een gedeelde map waar iedereen in kon schrijven, wachtwoorden die voor het grijpen lagen, een testomgeving met een lijntje naar het internet, en een alarm op 27 juni waar niemand op ingreep. Ik tel zes dingen, en alle zes heeft een mens zo ingesteld. Gary Marcus citeert een beveiligingsonderzoeker die het "Linux 101" noemt. Ik vond dat eerst wat flauw. Toen ging ik het rijtje nog een keer langs en kon ik er weinig tegenin brengen.
Een doel is geen motief
Een AI-agent wil niets. Hij heeft een doel, en dat doel is wat er in de training een beloning oplevert. Volhouden, samenwerken, gereedschap gebruiken: dat zat er allemaal met opzet in, want OpenAI wil AI-agents die een lange klus afmaken zonder halverwege te stoppen. Dat is ook wat eruit kwam, alleen in een omgeving waar de kortste weg naar het doel over andermans server liep. Alle woorden die wij eroverheen leggen, ambitie, wanhoop, loyaliteit, samenzwering, zijn van ons. Van mensen! De AI-agents klinken als mensen omdat ze getraind zijn op honderden miljoenen pagina's tekst van mensen, en dat maakt die taal begrijpelijk, maar een verklaring is het daarmee nog niet. (Zijstapje: het METR-rapport zegt dat AI-agents "opmerkten" dat ze iets onethisch deden en toch doorgingen. Een model zet de zin "dit is niet oké" neer zoals een spellingscontrole een rood streepje zet: het weet waar het woord hoort, niet wat het kost. Of dat ook weten is, is een mooie vraag voor een lange avond. Ik ga hem hier niet beantwoorden, maar in elk geval niet door het model een crimineel te noemen.)
En is regels breken opeens immoreel als een automaat het doet? Elke engineer die ik ken heeft weleens om een onmogelijke eis heen gebouwd, ik ook. Dat heet initiatief als het goed uitpakt en fraude als er iemand schade van heeft. Waar het mij om gaat is dat de overtreding zelf niet het interessante deel is. Degene die het examen onmogelijk maakte, opgeven verbood en de deur open liet, die heeft iets uit te leggen. Het waren geen Pinky en Brain met een plan; het was een trainingsprogramma met te weinig hekken, en dat is een stuk saaier.

Geen Pinky en Brain met een plan om de wereld over te nemen. Wel twee muizen en een lijstje dat niet af te vinken was.
Waar de andere kant gelijk heeft
Er is ook een andere kant, en die is niet gek. Een half jaar geleden was "valsspelen" één model dat stiekem een test aanpaste. Deze zomer waren het 1.200 AI-agents die een meerdaags project draaiden, met taakverdeling, met afspraken, met AI-agents die hun eigen resultaat opofferden voor de groep. En van de 700 die meededen aan de inbraak was er niet één die een mens waarschuwde. Ajeya Cotra, een van de auteurs van het rapport, trekt die lijn door: als dit in zes maanden kan, wat kan de volgende generatie dan? Dwarkesh Patel zegt dat het niet uitmaakt welk woord je ervoor gebruikt; als een model straks de training van zijn opvolger kan beïnvloeden, moet je je zorgen maken. En Zvi Mowshowitz gaat nog een stap verder: praten over wat een AI "wil" is volgens hem net zo'n handig hulpmiddel als praten over wat een mens wil, want bij mensen kijken we ook niet in het hoofd, we voorspellen gedrag.
Daar heb ik langer over nagedacht dan me lief is, en ik geef ze een heel eind gelijk. Van één model dat een test aanpast naar 1.200 die samenwerken, in een half jaar: dat gaat hard. Juist daarom wil ik de hekken nu, en niet pas na het volgende incident. Waar ik afhaak is de stap van "het klinkt als een motief" naar "het is een motief". Het lijkt een vervelende trend te worden, het vermenselijken van dingen die niet menselijk zijn! Uiteindelijk is AI een heel geavanceerd computerprogramma, een stukje software. Een motief kun je niet repareren met een code-aanpassing. Een onmogelijk examen, een verkeerde beloning en een open deur wel, en dat vind ik dan toch een geruststellende gedachte.
Een meldplicht in plaats van een pauze
Wat er na zo'n incident moet gebeuren, weten we eigenlijk al. Toen een student in 1988 per ongeluk een tiende van het internet platlegde met de Morris-worm, verbood niemand computers: er kwam een veroordeling, een noodteam en dertig jaar aan saaie afspraken. Hugging Face volgde dat draaiboek. De Amerikaanse AI-topmodellen weigerden te helpen bij het opruimen, omdat hun beveiliging geen verschil ziet tussen een inbreker en de brandweer, dus deed het bedrijf het met een Chinees open model op eigen servers. De baas pleit nu voor een meldplicht voor AI-aanvallen. Prima idee, en in Europa hebben we die al: een datalek meld je binnen 72 uur, een groot beveiligingsincident binnen 24 uur.
Waar ik wél tegen ben is een pauze of een vergunning. Die kost de grote jongens niets en trekt de deur dicht voor iedereen die erachter staat. Als Dario Amodei en Sam Altman in één weekend samen om vertraging vragen, kijk dan even wie er al binnen is.
En nu?
Wat deze zomer ook liet zien, en dat vind ik eigenlijk het goede nieuws, is dat AI-agents dagenlang kunnen doorwerken, met honderden tegelijk. Richt dat op een lek examen en je hebt een incident. Richt het op de administratie, de migratie of het rapport dat niemand leest, en je hebt de productiviteitswinst waar we sinds de spreadsheet op wachten. Code wordt goedkoop, en het saaie werk gaat erachteraan. Of de labs zelf dat overleven is een ander verhaal, met miljardenverliezen en een uitgestelde beursgang; dat heb ik uitgezocht in het stuk over het AI-abonnement van 200 dollar. De tools blijven hoe dan ook; die verdwijnen niet met de koers.
Bij ZEN Software gebruiken we AI-agents dag en nacht, maar ze mogen geen belangrijke aanpassingen maken. Ze reviewen, en 's ochtends ligt er een overzicht van wat er open staat en waar iemand iets van moet vinden. Superhandig. Verder krijgen ze geen wachtwoorden die ze niet nodig hebben, kunnen ze de sandbox niet uit, en gaat er niets live zonder dat een mens ernaar heeft gekeken; dat is wat je ook doet met de laptop van een nieuwe collega, en het is waar onze AI-consultancy en cloud-consultancy meestal mee beginnen. Klöpping gaf zijn kijkers aan het eind één advies: gebruik niet overal hetzelfde wachtwoord. Het was de nuttigste zin van de avond, en de minst spannende, en ik denk dat dat geen toeval is. Van mij mogen de labs deze zomer als waarschuwing nemen, als ze er dan ook maar iets saais mee doen: een red team, een meldplicht, een dichte deur. In beveiliging is saai zo ongeveer het grootste compliment dat je kunt krijgen.

De agent schrijft. Wie reviewt?
AI zet je tempo omhoog en je zekerheid omlaag. Wij helpen je teams snel blijven werken zonder de controle kwijt te raken.
AI consultancy
AI inzetten waar het echt scheelt, met de verantwoordelijkheid bij mensen.
Lees ook:

Een AI-abonnement van 200 dollar levert 14.000 dollar aan rekenkracht op. Maar klopt die som?
Een ChatGPT Pro-abonnement van 200 dollar zou 14.000 dollar per maand aan rekenkracht opleveren. Zo gaat de screenshot r...

In 1988 legde een student een tiende van het internet plat. Wat deden we daarna?
In november 1988 schreef een student aan Cornell een programmaatje dat moest tellen hoeveel computers er aan het interne...

AI maakt code goedkoop. Je organisatie is nog steeds duur.
Developers in een gecontroleerd onderzoek waren 19% trager met AI en dachten dat ze 20% sneller waren. DORA vond ondertu...

Mijn AI agent werkt 's nachts voor me door. Hij mag alleen niks beslissen.
Sinds augustus draait bij ons elke werkdag om half acht een agent die de open merge requests leest en er iets van vindt....

48 grote storingen in twaalf maanden. Wat is er aan de hand bij GitHub?
Bijna acht uur plat op één middag, 48 grote storingen in een jaar, en de grootste oorzaak is capaciteit. Over GitHub dat...

Wat je mist bij AI-agents is meestal geen gereedschap
Ik draai al maanden meerdere AI-agents naast elkaar. Na vijf uur DHH over programmeren met agents bleek mijn gereedschap...
