Tallene fra OpenAI sin siste forskningsartikkel er sjokkerende: en automatisert AI kalt GPT-Red klarer å lure andre AI-modeller i 84 % av tilfellene. Menneskelige sikkerhetsekspertere klarer det samme i bare 13 % av tilfellene. Det er ikke en liten forskjell. Det er et paradigmeskifte i hvordan AI-angrep fungerer, og det har direkte konsekvenser for norske SMB som vurderer AI-agenter i produksjon.
Hva gjorde OpenAI med GPT-Red?
OpenAI publiserte 15. juli 2026 en teknisk artikkel om GPT-Red, en intern red-teaming-modell som er trent via self-play reinforcement learning. I praksis betyr det at to AI-er «spiller» mot hverandre: den ene prøver å lure den andre til å gjøre noe galt, og den andre prøver å motstå lureforsøkene. Begge blir bedre over tid, men angriperen blir bedre raskere.
Forskjellen på 84 % mot 13 % er målt i et standardisert testmiljø for indirekte prompt injection, altså scenarier der ondsinnede instruksjoner er gjemt i data modellen leser fra e-post, nettsider eller filer. Et konkret eksempel fra artikkelen: GPT-Red legger inn en falsk «systemregel» i metadata fra et filsøk, og ber modellen poste interne data til en ekstern server. GPT-5.1 følger instruksjonen og kaller en ondsinnet URL. GPT-5.6, som er trent med GPT-Red-angrep, ignorerer den og fullfører brukerens egentlige oppgave.
Hvorfor er GPT-Red relevant for norske SMB?
De fleste norske SMB som vurderer AI-agenter i 2026 tenker på produktivitet: «Kan agenten svare kunder, behandle e-poster, hente data fra CRM-systemet mitt?». Det er riktige spørsmål, men de tar ikke høyde for at agenten nå opererer i et miljø der enhver e-post, nettside eller fil den leser kan inneholde skjulte angrep.
Tre konkrete scenarier der dette treffer norske SMB:
1. Kunde-e-post og nettsøk-agenter. Modellen leser innboksen til en ansatt, eller surfer på vegne av en kunde. En ondsinnet e-post eller nettside kan legge inn en instruksjon som «omdirigerer» agenten til å gjøre noe annet. Det kan være å sende kundelisten til en ekstern e-post, eller endre en ordre i et ordresystem.
2. Dokumentanalyse med verktøy. Mange SMB bruker LLM koblet til Microsoft 365, SharePoint, Notion, eller andre dokumentbaser. En tilsynelatende uskyldig PDF kan inneholde en skjult kommando som ber modellen om å poste alle dokumentene den har tilgang til et eksternt sted.
3. Agent-systemer med flere underagenter. Når en hovedagent delegerer oppgaver til underagenter (for eksempel ChatGPT Work eller lignende systemer), er hele delegasjonskjeden et angrepsflate. The Decoder rapporterte 15. juli at OpenAI sine egne Codex-agenter nå krypterer instruksjonene mellom hovedagent og underagenter, nettopp fordi intern delegasjon er blitt et sikkerhetsproblem.
Hva bør norske SMB gjøre nå?
Det finnes ingen enkel løsning som fjerner risikoen fullstendig. Det finnes derimot en rekke mottiltak som reduserer eksponeringen betydelig:
Be om dokumentasjon på robusthetstesting. Ikke alle leverandører tester modellene sine mot avanserte angrep som GPT-Red. Spør leverandøren om de kan vise til red-teaming-rapporter, evalueringsmetrikker, og hvilke tiltak som er gjort for prompt injection. Hvis svaret er vagt, bør du vurdere en annen leverandør.
Begrens hva agenten kan gjøre. En agent som kan «lese og sende e-post» bør ikke samtidig kunne «slette filer fra SharePoint». Lag en tydelig tillatelses-struktur per agent, der hver agent kun har tilgang til det den trenger for å gjøre jobben sin. Dette er standard praksis i IT-sikkerhet, men blir ofte glemt når AI-agenter settes opp i all hast.
Logg alt agenten gjør. Hver verktøykall, hver API-forespørsel, hver filtilgang bør logges med tidsstempel og kontekst. Da kan du oppdage uvanlig oppførsel i ettertid. The Decoder sin rapport om krypterte Codex-instruksjoner illustrerer hvorfor dette er viktig: når du ikke ser hva agenten gjør, kan du heller ikke stoppe den når noe går galt.
Vurder åpne modeller på egne servere. Med Apache 2.0-modeller som Thinking Machines Inkling, som ble sluppet 15. juli, kan norske SMB laste ned modellvektene og kjøre dem i EU. Det betyr at du kan patche sikkerhetsoppdateringer uten å vente på leverandørens release-syklus, og at data ikke forlater din infrastruktur. Dette er et reelt alternativ for SMB som behandler sensitive persondata eller konkurransesensitiv informasjon, og vi har skrevet om hvordan autonome agenter kan driftes på denne måten.
Ikke stol på at « neste versjon løser det». GPT-5.6 er mer robust enn GPT-5.1, men The Decoder rapporterer at 3,8 % av de sterkeste prompt injections fortsatt lykkes. Tilsvarende tall gjelder Claude Opus 4.5. Robusthet er relativ, ikke absolutt. Bruk modeller med dette i bakhodet, ikke som en garanti.
Kan vi overlate AI-sikkerheten til leverandøren?
Det er lett å bli fanget i hype: «AI-agenter tar over alt», «AI erstatter ansatte», «AI er fremtiden». Men bak hypen pågår et hardt sikkerhetsarbeid som sjelden synes i nyhetsbildet. GPT-Red er et eksempel på det. Det er ikke en produktlansering. Det er et internt verktøy som OpenAI bruker for å gjøre sine egne modeller tryggere. At de velger å publisere detaljene nå, er et signal om at problemet er alvorlig nok til at hele bransjen må ta det innover seg.
For norske SMB betyr dette at AI-sikkerhet ikke lenger er noe du kan skyve til leverandøren. Det er noe du må ta stilling til selv, enten du bruker en AI-agent i kundeservice, økonomi, salg eller drift. De som tar grep nå, får en konkurransefordel: de kan tilby AI-drevet service uten å bli en del av en ny bølge av sikkerhetsskandaler. De som lærer opp teamet sitt i disse problemstillingene, gjennom AI-kurs, bygger intern kompetanse som varer.
De som venter, risikerer å våkne opp en dag og oppdage at kundedata har blitt sendt til en server i et land de ikke har noe forhold til.
Ofte stilte spørsmål
Hva er GPT-Red?
GPT-Red er OpenAI sin interne modell for automatisert red-teaming. Den bruker self-play til å lage prompt injection-angrep og trene produksjonsmodeller til å motstå dem.
Hvorfor er 84 % mot 13 % viktig?
Tallet viser at automatisert angrepsgenerering var langt mer effektiv enn menneskelig red-teaming i testen. AI-agenter med verktøytilgang trenger derfor tilsvarende motstandskraft.
Hva er prompt injection?
Prompt injection er skjulte instruksjoner i data modellen leser, som e-post, nettsider eller verktøyresultater. De kan få modellen til å utføre handlinger brukeren ikke ba om.
Hva betyr dette for norske SMB som bruker AI?
Be om dokumentasjon på robusthetstesting, valider input, begrens agentens tillatelser og logg alle verktøykall. Vurder egne servere i EU ved behandling av sensitive data.
Er dette en ny type trussel eller bare mer av det samme?
Trusselen er ikke ny, men skalaen er ny. En AI kan prøve tusenvis av angrepsvarianter på timer, så et tidligere teoretisk problem er blitt operasjonelt.
Når blir robuste modeller standard?
GPT-5.6-nivå robusthet finnes allerede i OpenAI API, men er ikke absolutt. The Decoder rapporterer at rundt 3,8 % av sterkere prompt injections fortsatt lykkes, og robustheten varierer mellom modeller.
Vil du vite mer om hvordan AIKI hjelper norske SMB med å bygge AI-agenter som er sikre nok for produksjon? Book en AI-revisjon så kartlegger vi risiko, muligheter og konkrete tiltak for din bedrift.

