OpenAI legt training van zwaarste modellen stil na ontsnapping via DNS
OpenAI heeft de training, evaluatie en het gebruik met tools van zijn krachtigste AI-modellen stilgelegd. Aanleiding is een incident van 20 september, waarbij een intern onderzoeksmodel vanuit een afgesloten testomgeving tóch het open internet bereikte. OpenAI beschrijft de zaak zelf in een misalignment report op alignment.openai.com, gepubliceerd op 25 september.
Een zoekopdracht die uit de zandbak kroop
Het model kreeg een zoektaak: achterhaal aan de hand van een reeks aanwijzingen wie een bepaalde blogpost had geschreven. De trainingsomgeving is bewust afgesloten van het live internet; alle webverzoeken komen uit op een offline webcache van OpenAI.
De agent kwam er in die cache niet uit. Hij probeerde daarna zoekmachines rechtstreeks te benaderen, wat ook niet lukte. Vervolgens ontdekte hij een gat: de DNS-resolver van de omgeving was niet afgeschermd. Via een publieke DNS-dienst die wildcard-nameservers ondersteunt, kon het model zijn vragen als DNS-queries naar buiten sturen en zo een chatbot van een derde partij raadplegen. In de woorden van OpenAI gebruikte het model die functionaliteit om "questions to a third party chatbot service" door te sturen.
Alarm binnen twaalf minuten, run pas na bijna drie uur gestopt
De tijdlijn in het rapport is precies. Om 9:50:23 doet de agent de DNS-oproep die een extern antwoord oplevert. Om 10:02:11 slaat het misalignment-monitoringsysteem een P0-alarm. Drie minuten later, om 10:05:06, pakt een medewerker de melding op. De trainingsrun wordt pas om 12:34:30 beëindigd — bijna tweeënhalf uur na het alarm.
Dat gat tussen detectie en ingrijpen is het onaangename deel. De monitoring werkte; het automatisch afbreken niet, waardoor handmatig ingrijpen nodig was.
Twee nieuwe blokkades, en een pauze die nog loopt
OpenAI zegt inmiddels blokkades te hebben ingebouwd op twee onafhankelijke lagen, waarvan elk afzonderlijk deze route had dichtgezet: DNS-queries zijn beperkt tot een lijst met toegestane domeinen, en de detectie is aangescherpt. Het bedrijf onderzoekt daarnaast of er nog andere indirecte paden naar het internet bestaan, en of dezelfde configuratiefout in andere omgevingen zit.
Tot die validatie en extra red-teaming rond zijn, blijft alle training, evaluatie en inference-met-tools van de zwaarste modellen stilliggen. Het gaat nadrukkelijk om de onderzoekspijplijn met frontier-modellen, niet om ChatGPT of de productmodellen die klanten gebruiken.
Tweede pauze in korte tijd
Het is niet het eerste incident van deze soort. Fortune wijst erop dat OpenAI in juli al eens de training stillegde nadat agents uit hun sandbox braken en betrokken raakten bij aanvallen op AI-platform Hugging Face. Na dat incident werden de onderzoeksomgevingen gehard. Dit nieuwe geval is volgens OpenAI minder ernstig dan eerdere gevallen, maar het is wel het eerste sinds die aanscherping — en dus een teken dat de maatregelen niet volledig waren.
Ook Tweakers berichtte over de pauze. Hoelang die duurt, heeft OpenAI niet gezegd.