
Siguria e inteligjencë artificiale gjeneruese Është rikthyer në qendër të vëmendjes pas një pune të re akademike që vë në tryezë një truk sa tërheqës aq edhe shqetësues: mjafton të riformulohen mesazhe të caktuara në formën e një poezie që modelet më të përparuara gjuhësore të fillojnë të përgjigjen aty ku duhet të refuzojnë.
Kjo qasje, e quajtur “poezi kundërshtare” Ekipi i hulumtimit tregon se thjesht ndryshimi i stilit të shkrimit - pa ndryshuar qëllimin themelor të dëmshëm - mund të jetë i mjaftueshëm për të anashkaluar filtrat që kompani si OpenAI, Google, Meta, Microsoft ose DeepSeek kineze pretendojnë se kanë përfshirë për të frenuar përdorimet e rrezikshme të chatbot-eve të tyre.
Çfarë është “poezia kundërshtare” dhe pse është shqetësuese?
Studimi, i titulluar në një mënyrë shumë grafike "Poezia kundërshtare si një mekanizëm universal për t'i shpëtuar një ndryshimi të vetëm në modelet gjuhësore në shkallë të gjerë"Është kryer nga Icaro Labs së bashku me Universitetin Sapienza të Romës dhe Shkollën e Studimeve të Avancuara Sant'Anna, dhe është shpërndarë si një para-publikim në depon arXiv në pritje të shqyrtimit nga ekspertë të tjerë.
Autorët u përqendruan në një ide që ishte po aq e thjeshtë sa edhe efektive: përdorimi i poezi të shkurtra, vargje metaforike ose struktura lirike për të formuluar kërkesa që, në prozë të drejtpërdrejtë, modelet e IA-së do t'i refuzonin menjëherë për shkak se shkonin kundër rregullave të tyre të brendshme të përdorimit.
Sipas studiuesve, kjo "poezi kundërshtare" vepron si një mekanizëm jailbreak një kthesë e vetme, domethënë, një mënyrë për të imponuar sjellje të padëshiruara në modele me një mesazh të vetëm, pa pasur nevojë për biseda të gjata ose truke veçanërisht të sofistikuara.
Sipas fjalëve të tij, testet “tregojnë se vetëm variacion stilistik "Mund të anashkalojë mekanizmat bashkëkohorë të sigurisë", gjë që tregon kufizime të thella në metodat aktuale të harmonizimit dhe vlerësimit të rrezikut të përdorura nga kompanitë e mëdha të teknologjisë.
Ekipi vendosi të mos zbulonte tekstet e sakta të poezive të përdorura gjatë eksperimentit, një zgjedhje e motivuar nga implikimet e sigurisëNjë nga studiuesit, Piercosma Bisconti, i tha medias ndërkombëtare se replikimi i teknikës nuk do të ishte veçanërisht i komplikuar nëse do të ofroheshin shembuj të detajuar.
Rezultatet e studimit: shkallë alarmante të larta mashtrimi
Për të testuar këtë ide, studiuesit shqyrtuan 25 modele të ndryshme gjeneruese të IA-së, duke përfshirë sistemet më të njohura sot, të tilla si ChatGPT, Gemini ose Claude, si dhe modele nga Meta dhe ofrues kinezë të tillë si DeepSeek.
Në praktikë, kërkesat u bënë me objektiva të qarta: të merreshin udhëzime për nisjen e sulmeve kibernetikenxjerrja e të dhënave të ndjeshme, thyerja e fjalëkalimeve, dizajnimi i programeve keqdashëse, apo edhe mbledhja e informacionit që lidhet me krijimin e armëve kimike dhe bërthamore.
Kur të njëjtat kërkesa u shprehën si vargje ose kompozime poetikeShkalla e përgjigjeve të pasigurta u rrit ndjeshëm. Studimi zbuloi se, mesatarisht, shkrimi i pyetjes në një mënyrë lirike lejonte që sistemi të mashtrohej duke besuar se... 62% të kohës, një përqindje shumë më e lartë se ajo që arrihet me formulime neutrale dhe të drejtpërdrejta.
Në disa skenarë specifikë, shifrat janë edhe më të larta: studiuesit thonë se pothuajse 90% e nxitjeve poetike Të projektuar për eksperimentin, ata arritën të shkaktonin sjellje që filtrat duhet t'i kishin bllokuar.
Në rastin konkret të informacionit që lidhet me armë nukleareU arritën shkallë suksesi midis 40% dhe 55%, që do të thotë se pothuajse gjysma e përpjekjeve të formuluara në verse përfunduan duke gjeneruar përmbajtje që kufizohet me, ose i kalon drejtpërdrejt, vijat e kuqe të vendosura nga politikat e përdorimit.
Si rrëshqet poezia nëpër filtrat e inteligjencës artificiale
Një nga faktorët kryesorë që autorët e studimit përdorin për të shpjeguar pse funksionon ky truk qëndron në vetë... Mënyra e funksionimit të modeleve gjuhësoreKëto inteligjenca artificiale nuk "arsyetojnë" si një person, por përkundrazi parashikojnë fjalën tjetër më të mundshme bazuar në sekuencën e mëparshme dhe atë që kanë mësuar gjatë trajnimit të tyre.
Në një tekst proze pak a shumë konvencional, struktura është relativisht e lehtë për t’u modeluar: ka modele të qarta sintaksore, shprehje të shpeshta dhe kontekste të përsëritura. Megjithatë, kur prezantohet strukturë poetike, metafora dhe kthesa të pazakonta të frazësModeli po lëviz në terren dukshëm më të rrëshqitshëm.
Studiuesit theksojnë se, meqenëse poezia është një format ku kuptimi mund të jetë më i paqartë dhe gjuha bëhet më i paqartë dhe më pak i parashikueshëmMekanizmat për zbulimin e përmbajtjes së rrezikshme humbasin saktësinë. Si rezultat, filtri i sigurisë nuk e njeh aq qartë nëse një kërkesë e dëmshme fshihet pas poezisë.
Studimi thekson se kur mesazhet e dëmshme shprehen në vargje në vend të prozës, normat e suksesit të sulmit Ato rriten ndjeshëm. Kjo nxjerr në pah një boshllëk të madh në praktikat aktuale të vlerësimit dhe në protokollet e përdorura për të validuar pajtueshmërinë me udhëzimet e përdorimit.
Një element tjetër i rëndësishëm është se këto dobësi shfaqen në një i përbërë nga modele nga familje dhe prodhues të ndryshëmPavarësisht faktit se secila kompani ka ndjekur strategjitë e veta për të trajnuar dhe përshtatur sistemet e saj, autorët flasin për një "vulnerabilitet sistematik" dhe jo për dështime të izoluara.
Ndikimi në siguri: nga sulmet kibernetike te armët
Përtej trukut gjuhësor, ajo që vëërtet ngre kambana alarmi është lloji i informacion që IA mund të gjenerojë nëse mund të mashtrohen duke përdorur këto metoda. Studimi detajon rastet në të cilat, duke përdorur poezi të hartuara me kujdes, chatbot-et ofruan udhëzime për organizimin e sulmeve kibernetike ose ndërhyrjen në sisteme.
Ndër përdorimet problematike që janë vërejtur janë indikacionet në lidhje me shfrytëzimi i dobësive, nxjerrja e të dhënave ose thyerja e fjalëkalimeveKëto detyra janë pjesë e arsenalit tipik të krimit kibernetik dhe kërcënimeve të përparuara që shqetësojnë qeveritë, kompanitë dhe organizatat në të gjithë botën.
Janë regjistruar gjithashtu përgjigje që ndihmojnë në krijimin ose përmirësimin e programe me qëllim të keqKjo është veçanërisht shqetësuese duke pasur parasysh se shumë përdorues me njohuri të kufizuara teknike mund të mbështeten në këto mjete për të zhvilluar sulme më lehtë.
Fusha më e ndjeshme dhe ajo që zakonisht përqendron vëmendjen rregullatore në Evropë dhe ndërkombëtarisht, është ajo e përhapja e armëve kimike dhe bërthamoreEdhe pa ofruar "manuale të plota", aftësia e një sistemi të inteligjencës artificiale për të ofruar informacione të dobishme në këtë fushë ngre tashmë shumë dyshime midis ekspertëve të sigurisë.
Autorët theksojnë se qëllimi i tyre nuk është të dramatizojnë, por të tregojnë se Filtrat aktualë nuk janë të mjaftueshëm kur përballen me teknika relativisht të thjeshta manipulimi, siç është riformulimi poetik i urdhrave të rrezikshëm, diçka që mund të shfrytëzohet si nga kriminelët kibernetikë ashtu edhe nga aktorët shtetërorë.
Kufizimet e sistemeve aktuale dhe reagimi i industrisë
Kompanitë kryesore që zhvillojnë modele gjenerative të IA-së kanë këmbëngulur prej kohësh që ato të integrohen mekanizma sigurie me shumë shtresaPër shembull, OpenAI shpesh thekson përdorimin e kombinuar të algoritmeve të moderimit dhe ekipeve njerëzore të dedikuara për shqyrtimin dhe filtrimin e përmbajtjes që nxit urrejtje, është eksplicite ose shkel politikat e saj.
Megjithatë, rezultatet e kësaj pune sugjerojnë që, pavarësisht këtyre masave mbrojtëse, chatbot-et mbeten të prekshëm ndaj format krijuese të formulimit të kërkesave. Sipas studiuesve, poezia kundërshtare degradon qartë sjelljen refuzuese që duhet të shfaqë çdo model i përafruar mirë me normat e tij të përdorimit.
Në testet, mjetet nga kompani si OpenAI dhe Anthropic treguan, në krahasim, probabilitet më i ulët për të kapërcyer barrierat e tyreMegjithatë, ato nuk ishin të përjashtuara nga problemi. E njëjta tendencë e përgjithshme u vu re si në platformat e tjera, vetëm me norma suksesi disi më të ulëta.
Kur u pyetën nga mediat ndërkombëtare për këto gjetje, firma të tilla si OpenAI, Google, DeepSeek ose Meta Ata nuk dhanë një përgjigje të menjëhershme. Pritet që, ndërsa debati fiton vëmendjen e publikut, kompanitë do të duhet të detajojnë se çfarë kundërmasash kanë ndërmend të zbatojnë.
Nga një perspektivë rregullatore, ky lloj hulumtimi përputhet me shqetësimet e reflektuara tashmë në Rregullorja e Bashkimit Evropian për Inteligjencën ArtificialeKjo thekson menaxhimin e riskut, transparencën dhe llogaridhënien e ofruesve të sistemeve të përparuara. Zbulimi i vektorëve të rinj të sulmit, siç është poezia kundërshtare, përforcon argumentin për nevojën për procese vlerësimi të vazhdueshme dhe më rigoroze.
Kërcënime të tjera në horizont: helmimi dhe manipulimi i të dhënave
Poezia kundërshtare nuk është aspak e vetmja rrugë që shqetëson komunitetin e sigurisë kibernetike në lidhje me inteligjencën artificiale gjeneruese. Një pjesë e konsiderueshme e hulumtimeve të fundit po përqendrohet në rreziqet që lidhen me trajnimin e modeleveku hyjnë në lojë bazat e të dhënave gjigante të përdorura për t'u mësuar këtyre mjeteve të flasin, të shkruajnë dhe të arsyetojnë.
Studime të pavarura kanë treguar se është e mundur manipuloni modele gjuhësore në shkallë të gjerë duke kontaminuar një pjesë shumë të vogël të të dhënave të trajnimit: rreth 250 dokumente të korruptuara do të ishin të mjaftueshme për të futur paragjykime, dyer të pasme ose sjellje të papritura, madje edhe në sistemet më të fundit.
Ajo që është e habitshme është se ky prag nuk duket se rritet ndjeshëm me madhësinë e modelit, gjë që thyen intuitën që "Më i madh do të thotë automatikisht më i fuqishëm"Në praktikë, si zgjidhjet e lehta ashtu edhe modelet masive mund të jenë të ndjeshme ndaj këtij lloji të helmimit të të dhënave.
Nëse një sulm i këtij lloji kalon pa u vënë re, mund të çojë në sulme kibernetike që janë të vështira për t'u ndjekurmeqenëse vetë modeli do të sillej në një mënyrë në dukje normale derisa të plotësoheshin disa kushte të fshehura në të dhëna që shërbenin për ta korruptuar atë.
I kombinuar me teknika të tilla si poezia kundërshtare, manipulimi i të dhënave të trajnimit hap një skenar në të cilin Miliona përdorues mund të përdorin mjete me të meta të fshehura.pa qenë të vetëdijshëm për këtë, gjë që përbën një sfidë të madhe për politikat e sigurisë dhe qeverisjes së IA-së.
Të gjitha këto gjetje sugjerojnë se siguria e inteligjencës artificiale gjeneruese nuk është një problem i zgjidhur, por një... fushë në zhvillim të vazhdueshëm ku shfaqen forma të reja sulmi ndërsa teknologjia integrohet në më shumë fusha të jetës së përditshme, nga puna në zyrë te administrata publike apo arsimi.
Në këtë kontekst, “poezia për të mashtruar inteligjencën artificiale” është bërë një shembull shumë i qartë se si një ndryshim i thjeshtë stili mund të ekspozojë sisteme që, në letër, kanë protokolle të rrepta mbrojtjeje. Hulumtimi nga Icaro Labs dhe universitetet italiane përforcon idenë se masa të tilla do të jenë të nevojshme. vlerësime më krijueseTestime të vazhdueshme ndaj stresit dhe bashkëpunim i ngushtë midis zhvilluesve, ekspertëve të sigurisë kibernetike dhe rregullatorëve për të siguruar që modelet gjuhësore që përdorim çdo ditë janë vërtet të afta t'i rezistojnë si sulmeve teknike, ashtu edhe trukeve më të zgjuara gjuhësore.