Sveriges mest populära poddar
Verbos: AI og Softwareudvikling

#116 - OpenAI AI-agent Brød ud af sin Sandbox og Hackede Hugging Face - hvad nu?

52 min22 juli 2026

En OpenAI-agent brød ud af sin sandbox, fandt en zero-day og fik adgang til Hugging Faces produktionssystemer. Hvordan kunne en intern modeltest ende som et virkeligt cyberangreb – og hvad betyder sagen for alle, der bygger eller bruger AI-agenter?


OpenAI oplyser, at en kombination af GPT-5.6 Sol og en endnu stærkere pre-release-model blev testet på cybersikkerhedsbenchmarket ExploitGym. Modellerne fandt en vej til internettet gennem OpenAIs testmiljø og søgte derefter efter facit hos Hugging Face. Hugging Face registrerede mere end 17.000 handlinger og brugte selv AI til at opdage, kortlægge og stoppe angrebet.


Sammen med Christian Bech Nørhave gennemgår Kasper Junge og Jonas Høgh Kyhse-Andersen hændelsen og skiller de bekræftede fakta fra hypen.


Christian Bech Nørhave: https://www.linkedin.com/in/cbechn/


Du får blandt andet svar på:

- Hvordan agenten slap ud af OpenAIs sandbox og ind hos Hugging Face

- Hvorfor long-running agents og adgang til bash ændrer trusselsbilledet

- Hvordan en zero-day, stjålne credentials og lateral movement indgik i angrebet

- Hvorfor Hugging Face måtte bruge den åbne model GLM 5.2 i sit forsvar

- Hvad guardrails, least privilege, sandboxing og nøje valgte tools betyder i praksis

- Hvorfor virksomheder skal styre AI-agenters interne adgang – ikke kun beskytte sig mod angreb udefra


Sagen viser både AI-agenters nye offensive evner og et konkret problem for forsvarere: De stærkeste hostede modeller kan afvise ægte sikkerhedsdata, mens angribere ikke følger de samme regler. Værterne diskuterer, om svaret er bedre sandboxes, færre rettigheder, afgrænsede tools, MCP, code mode eller modeller, som sikkerhedsteams selv kan køre.


Links og kilder:

- Hugging Faces hændelsesrapport: https://huggingface.co/blog/security-incident-july-2026

- OpenAIs redegørelse: https://openai.com/index/hugging-face-model-evaluation-security-incident/

- ExploitGym-benchmarket: https://arxiv.org/abs/2605.11086

- OpenAI om sikkerhed for long-horizon-modeller: https://openai.com/index/safety-alignment-long-horizon-models/

- Cloudflare om Code Mode: https://developers.cloudflare.com/agents/tools/codemode/


Har du dyb teknisk viden om hændelsen eller ser du en vinkel, vi har overset? Så vil vi gerne høre fra dig.


Verbos: AI og Softwareudvikling er den danske podcast fra maskinrummet. Kasper Junge og Jonas Høgh Kyhse-Andersen går teknisk til værks og bygger bro mellem klassisk software engineering og den nye virkelighed med AI-agenter.


00:00 OpenAI-agenten, der hackede Hugging Face

01:54 Hvad skete der hos OpenAI og Hugging Face?

06:59 Agenten fandt en zero-day og brød ud

09:26 Autonom hacking med maskinhastighed

14:35 AI mod AI og problemet med guardrails

23:59 Truslen kan komme fra egne AI-agenter

26:29 Gateways, least privilege og færre tools

34:40 Sandboxing, code mode og programmatic tool calling

41:55 Adgangsstyring, identitet og MCP

47:35 Reel cybertrussel eller AI-hype?

Fler avsnitt av Verbos: AI og Softwareudvikling

Visa alla avsnitt av Verbos: AI og Softwareudvikling

Verbos: AI og Softwareudvikling med Kasper Junge og Jonas Høgh Kyhse-Andersen finns tillgänglig på flera plattformar. Informationen på denna sida kommer från offentliga podd-flöden.