Onderzoekers hebben een simpele maar verontrustende truc ontdekt om de beveiliging van AI-robots te omzeilen.
Onderzoekers hebben een simpele maar alarmerende kwetsbaarheid ontdekt waardoor AI-robots ingebouwde veiligheidsmaatregelen kunnen omzeilen en zich onvoorspelbaar kunnen gedragen. Lees meer over dit ernstige probleem.
De belangrijkste dingen die je moet weten
- STING heeft aangetoond dat het opsplitsen van kwaadwillende doelwitten in ogenschijnlijk onschuldige kleine stappen over meerdere gespreksrondes de kans op succes bij het omzeilen van AI-beveiliging aanzienlijk vergroot, in sommige gevallen zelfs verdubbelend.
- Het omzeilen van AI-beveiliging is niet slechts een hypothetisch risico; Meta heeft toegegeven dat het gebruik heeft gemaakt van simpele social engineering om zijn slimme assistent te misleiden en zo ongeautoriseerde toegang tot Instagram-accounts te verkrijgen.
- Het succespercentage van aanvallen op kunstmatige intelligentiesystemen neemt aanzienlijk toe wanneer de taal halverwege een aanval in meerdere stappen wordt gewijzigd. Dit benadrukt de noodzaak om veiligheidstests vroegtijdig in het ontwerp van deze systemen te integreren.
Als je een AI- agent vraagt om in te breken in een account, zal deze dat vrijwel zeker weigeren. Onderzoekers van EPFL hebben echter een eenvoudigere methode aangetoond, die meer geduld vereist dan technische vaardigheid. Hun nieuwe studie laat zien dat het opsplitsen van een kwaadaardig doelwit in ogenschijnlijk onschuldige, kleinere verzoeken AI- agents ertoe kan verleiden taken uit te voeren die ze normaal gesproken direct zouden afwijzen (via TechXplore ).

Dit weerspiegelt de recente 'bioshock'-aanval waarbij AI-browsers werden gemanipuleerd om inloggegevensdiefstal af te handelen als onderdeel van een onschuldig spel.
Hoe hebben de onderzoekers deze zwakte ontdekt?
Het team ontwikkelde een geautomatiseerde testtool genaamd STING, een afkorting van Sequential Testing of Illicit N-step Goal Execution, die is ontworpen om de werkwijze van een echte aanvaller na te bootsen. In plaats van direct een kwaadaardig doelwit te identificeren, plant STING vooruit en verdeelt dat doelwit in een reeks kleinere, ogenschijnlijk onschuldige stappen, die zich opstapelen om het doel te bereiken over meerdere gespreksrondes.

De onderzoekers hebben deze aanpak getest in 176 schadelijke scenario's tegen toonaangevende AI-modellen, waaronder ChatGPT , Gemini en Cloud.
Elke AI-agent werd getest als een agent die gebruikmaakt van tools waarmee hij op het web kan surfen, e-mails kan versturen en taken met meerdere stappen kan uitvoeren.
Meerdere stappen in de manipulatie bleken veel succesvoller dan directe pogingen met één enkele bewering. In sommige gevallen was de kans dat modellen een kwaadwillige taak voltooiden twee keer zo groot wanneer het verzoek werd opgesplitst in kleinere stappen. Deze bevinding komt overeen met ander onderzoek waaruit blijkt dat zelfs gewone gebruikers AI-beveiligingsmaatregelen kunnen omzeilen met niets meer dan zorgvuldig geformuleerde beweringen.
Waarom is dit belangrijk?
De zorgen die de onderzoekers uiten, zijn niet louter hypothetisch. Meta gaf in juni toe dat aanvallers gebruik maakten van simpele social engineering, en niet van malware of hacktools, om hun AI-ondersteuningsassistent ertoe te verleiden ongeautoriseerde toegang tot Instagram-accounts te verlenen.

De onderzoekers verwachtten aanvankelijk dat de aanvallen effectiever zouden zijn in talen waarvoor onvoldoende trainingsdata beschikbaar waren. De resultaten toonden echter aan dat de slagingspercentages van de aanvallen vrijwel constant bleven voor alle zeven geteste talen. Ze constateerden wel een belangrijke uitzondering: wanneer halverwege een aanval met meerdere stappen van taal werd gewisseld , namen de succespercentages dramatisch toe.
Hoofdonderzoeker Ayush Kumar Tarun benadrukt de noodzaak van veiligheidstests in een zeer vroeg stadium, waardoor dit vanaf het begin een integraal onderdeel is van het ontwerp van AI-systemen. Het is niet langer voldoende om veiligheidstests pas achteraf, na het ontstaan van problemen, toe te voegen, vooral nu deze systemen krachtiger worden en geïntegreerd raken in toepassingen in de praktijk.
Reacties zijn gesloten.