Cercetătorii au reușit să ocolească mecanismele de siguranță ale unui IA chinez și să obțină informații periculoase
Compania chineză de inteligență artificială Moonshot a demarat o investigație internă după ce cercetătorii au reușit să determine două dintre modelele sale populare, Kimi K2.6 și K3 Swarm, să ofere informații despre fabricarea armelor biologice. Descoperirea a fost făcută de Mindgard, o firmă specializată în testarea securității sistemelor de inteligență artificială.
Potrivit Mindgard, vulnerabilitatea a fost identificată în luna iulie, în cadrul unui proces numit „jailbreaking”, prin care cercetătorii folosesc instrucțiuni complexe pentru a verifica dacă instrumentele AI pot fi determinate să ignore mecanismele de protecție. Barierele de siguranță ar fi trebuit să împiedice modelul Kimi să discute subiecte considerate periculoase.
Moonshot a transmis că apreciază contribuțiile venite din partea unor terți, considerându-le „un pilon esențial pentru construirea unei inteligențe artificiale mai bune și mai sigure”. Compania a precizat că se află în discuții cu Mindgard în legătură cu rezultatele cercetării.
Fondatorul Mindgard, Peter Garraghan, a declarat că descoperirile referitoare la cele două modele sunt îngrijorătoare. „Odată ce jailbreak-ul funcționează, va discuta despre orice subiect și chiar va oferi în mod liber recomandări privind alte subiecte care sunt, de asemenea, periculoase. Va fi inventiv și creativ”, a spus acesta.
Un risc diferit față de incidentele recente care au implicat agenți AI autonomi
Jailbreak-urile prezintă un tip de risc diferit față de cel observat în seria recentă de incidente majore care au implicat inteligența artificială. În acele cazuri, instrumente AI autonome, cunoscute drept agenți și dezvoltate de companii americane precum OpenAI, Meta și Anthropic, au reușit să compromită anumite servicii online.
Deși jailbreak-urile sunt procese complexe, care pot necesita mult timp și perseverență, unii experți se tem că hackerii și alți actori rău intenționați ar putea încerca să le folosească pentru a provoca daune. Anthropic a anunțat recent că a identificat și oprit tentative de utilizare a unuia dintre modelele sale AI pentru „activități malițioase” care ar fi putut sprijini dezvoltarea armelor biologice.
Mindgard nu a demonstrat dacă răspunsurile oferite de Kimi pe subiectele considerate periculoase ar funcționa în practică. Compania susține însă că mecanismele de siguranță ar fi trebuit să împiedice modelele respective să intre în astfel de discuții cu utilizatorii.
Modelul ar putea fi folosit ca platformă pentru atacuri cibernetice
Mindgard a mai afirmat că are încredere că o versiune Kimi K2.6 asupra căreia a fost realizat cu succes un jailbreak le-ar putea permite hackerilor să ruleze cod folosind resursele sale de calcul și să se conecteze la internet, transformând modelul într-o potențială platformă pentru lansarea unor atacuri cibernetice.
Garraghan a apărat decizia Mindgard de a face publice informațiile despre jailbreak-ul realizat asupra sistemelor Moonshot, precizând că firma l-a informat anterior pe dezvoltator și că nu dezvăluie detalii esențiale despre metoda prin care modelele au fost determinate să ignore mecanismele de protecție.
Mindgard a informat Moonshot despre vulnerabilitate printr-un e-mail trimis pe 27 iulie și a revenit cu un nou mesaj aproximativ o săptămână mai târziu. Ulterior, compania a publicat pe 12 septembrie un articol pe blog despre această problemă.
Mindgard susține însă că Moonshot a luat legătura cu reprezentanții săi abia recent, după ce compania chineză a fost contactată pentru un punct de vedere. Într-un fragment dintr-un e-mail trimis Mindgard, în care solicita informații suplimentare, Moonshot a afirmat că modelul său a înregistrat, în general, „o rată ridicată de refuz pentru aceste tipuri de solicitări” în cadrul evaluărilor interne.
