Kunstig intelligens finder vej til alt fra kattelemme til 'smarte' baggårdsgrill – og du kan selvfølgelig ikke åbne nogen moderne virksomhedssoftware uden at se en slags AI-assistent drevet af en stor sprogmodel (LLM). Men da teknologien bliver svær at undgå, burde vi måske overveje, hvordan folk kan misbruge den.

Vi taler ikke om, hvordan cyberkriminelle kan bruge store sprogmodeller (LLM'er) til at skrive phishing-e-mails eller hacke websteder her. Tværtimod overvejer vi, hvordan angribere kan kompromittere legitime AI-systemer for at stjæle data, sprede misinformation eller endda sende maskiner på spil.

Sårbarhederne, der lurer i LLM'er

Et af de mest almindelige angreb af denne type involverer øjeblikkelig manipulation. Angribere har demonstreret, hvordan man omgår forskellige LLM'ers sikkerhedsbarrierer (kendt som jailbreaking) ved hjælp af teknikker som rollespil og endda indtastning af volapyk.

Prompt injektioner kan gøre mere end at få en LLM til at levere instruktioner til ulovlige aktiviteter eller skrive phishing-e-mails. Forskere har brugt dem til dataudvinding. For eksempel narrede AI-sikkerhedsfirmaet PromptArmor Slacks AI-assistent til at lække hemmeligheder såsom API-nøgler fra private kanaler.

Prompt engineering skaber muligheder for datatyveri. AI-systemer kan utilsigtet eksponere følsomme data gennem fejl eller designfejl. Nogle gange kan disse være fejl, som da en ChatGPT-fejl lækkede brugernes private oplysninger, herunder betalingsoplysninger, i marts 2023. Andre angreb bruger prompt injection med luskede taktikker såsom at ændre tekst, så en ondsindet prompt overtaler en LLM til at udlevere data, mens den er uforståelig for menneskelige ofre.

I nogle scenarier kan forskere muligvis bruge prompt engineering til at afsløre modellens originale træningsdata. I et modelinversionsangreb kan en modstander udspørge LLM'en ved at bruge svarene til at udlede ting om træningsdataene og i sidste ende omvendt konstruere nogle af disse data efter kendsgerningen.

Nogle har foreslået at bruge modelinversion til at udtrække tætte tilnærmelser af de billeder, der bruges til at træne ansigtsgenkendelsesmodeller. Dette risikerer at identificere følsomme eller sårbare personer eller give uautoriseret adgang til ressourcer.

Det behøver ikke kun at være tekstbaserede input, der producerer skadelige resultater. Billeder og andre data kan også have negative virkninger på AI. For eksempel har forskere tvunget selvkørende biler til at ignorere stopskilte ved at tilføje klistermærker til dem og til at se stopskilte, der ikke er der, ved at projicere et par billeder på et billboard – begge dele kan have katastrofale konsekvenser på vejen.

Forgiftning opstrøms

Alternativt kan angribere manipulere med AI-arbejdsgange længere opstrøms ved at forgifte de data, som AI-systemer lærer af. Dette kan ændre den måde, modellen opfører sig på, og dermed forurene slutresultaterne. Nogle af disse angreb udføres af økonomiske eller politiske årsager. Forskere udviklede et værktøj, Nightshade , til at hjælpe kunstnere med subtilt at ændre deres digitale billeder ved at indsætte usynlige pixels som en protest mod, at kunstnere træner i ophavsretligt beskyttet materiale. Dette får billedgenereringsprogrammer til at producere uforudsigelige resultater.

Dataforgiftning behøver ikke at være udbredt for at have en effekt, og når det anvendes på specifikke datasæt, såsom dem, der bruges i medicinske systemer, kan resultaterne være katastrofale. En undersøgelse viste , at ændring af blot 0.001% af træningstokens med medicinsk misinformation øgede sandsynligheden for medicinske fejl betydeligt.

Efterhånden som kunstig intelligens fortsætter med at gennemsyre hverdagen, øges potentialet for systemkompromiser til at påvirke samfundet. En skarpsindig angriber kunne gøre alt fra at skabe desinformation til at forårsage ulykker på vejen, påvirke sikkerhedskritiske beslutninger inden for områder som medicin eller forhindre AI i at opdage svigagtige transaktioner.

Beskyttelse af AI-modeller

Mulighederne for AI-kompromitteringer er udbredte nok – og deres konsekvenser brede nok – til, at en mangesidet tilgang til AI-styring er afgørende. ISO 42001 , en international standard for AI-styringssystemer, har en holistisk tilgang, der inkluderer områder som AI's organisatoriske kontekst og ledelsens involvering. Det involverer også planlægning, support, drift samt løbende evaluering og forbedring. Det dikterer udviklingen af ​​tekniske specifikationer, herunder sikkerhed og datakvalitet, sammen med dokumentation af sikkerhedsprotokoller for at beskytte mod trusler som dataforgiftning og modelinversionsangreb.

Regeringer har indført sikkerhedsrestriktioner for AI. EU's AI-lov kræver en overensstemmelsesvurdering for højrisikosystemer, hvilket inkluderer overholdelse af testkrav, der stadig er under udvikling. I USA havde National Institute of Standards and Technology (NIST) allerede en AI Risk Management Framework (RMF), før Biden-administrationen offentliggjorde sin Executive Order 14110 om AI-sikkerhed i oktober 2023 (nu ophævet af Trump-regeringen). Dette krævede en supplerende generativ AI-risikostyringsressource, som NIST offentliggjorde i juni sidste år.

I modsætning til NISTs AI RMF er ISO 42001 certificerbar. Og mens NIST fokuserer stærkt på sikkerheden og sikkerheden af ​​AI-systemer, udforsker ISO 42001 deres rolle i en bredere forretningskontekst.

Hvorfor AI Governance betyder noget nu

Frameworks som disse bliver stadig vigtigere, efterhånden som grundlæggende LLM-modeludbydere kappes om at levere nye funktioner, der imponerer forbrugerne. Dermed øger de AI-modellernes angrebsflade, hvilket gør det muligt for sikkerhedsforskere at finde nye angreb. For eksempel har virksomheder som OpenAI og Google introduceret langtidshukommelsesfunktioner i deres LLM'er, hvilket giver dem mulighed for at lære brugerne bedre at kende og levere bedre resultater. Dette gjorde det muligt for forskeren Johann Rehberger at bruge prompt injection, der kunne plante falske langtidshukommelser i Googles Gemini LLM.

Det er også værd at undersøge sikkerheden af ​​AI-modeller i sammenhæng med grundlæggende cyberhygiejne. I januar 2025 afslørede forskere et databrud på den kinesisk-konstruerede grundlæggende LLM DeepSeek, som fangede offentlighedens opmærksomhed med sin høje ydeevne. Årsagen til databruddet havde intet at gøre med hurtig engineering, modelinversion eller nogen magiske AI-funktioner; det stammede fra en offentligt eksponeret cloud-database indeholdende chathistorik og brugeroplysninger. I den spændende nye verden af ​​AI er nogle af de mest skadelige sårbarheder deprimerende gammeldags.