Skip to content Skip to footer

AI, la sfida della sicurezza resta aperta: uno studio italiano individua vulnerabilità nei modelli più avanzati

Nonostante i progressi compiuti negli ultimi anni, i sistemi di intelligenza artificiale generativa continuano a presentare margini di vulnerabilità. È quanto emerge da una ricerca realizzata dall’Istituto Italiano di Intelligenza Artificiale (AI4I), che ha analizzato la capacità di alcuni tra i più avanzati modelli linguistici di resistere a tentativi di manipolazione finalizzati a eludere i meccanismi di sicurezza incorporati.

L’indagine, condotta dall’AI Security Lab diretto da Nicola Franco, rappresenta una delle prime valutazioni indipendenti svolte in Europa su modelli di frontiera. L’obiettivo era verificare quanto siano efficaci le protezioni adottate dai sistemi di nuova generazione contro richieste progettate per ottenere contenuti inappropriati o potenzialmente dannosi.

Per effettuare i test, i ricercatori hanno impiegato HackAgent, una piattaforma open source sviluppata internamente, simulando un numero molto elevato di tentativi di aggiramento delle difese dei modelli. Le prove hanno coperto migliaia di scenari riconducibili a differenti aree di rischio, comprese la sicurezza informatica, la diffusione di informazioni false, le frodi economiche e altri possibili utilizzi impropri dell’intelligenza artificiale.

I risultati delineano un quadro incoraggiante ma non privo di criticità. I modelli esaminati hanno mostrato una notevole capacità di bloccare la maggior parte degli attacchi, confermando un significativo rafforzamento delle misure di sicurezza rispetto al passato. Tuttavia, alcuni test sono riusciti a produrre risposte non conformi agli standard previsti, segnalando l’esistenza di punti deboli ancora sfruttabili.

Secondo i ricercatori, il dato più interessante riguarda l’evoluzione delle tecniche di attacco. Molti dei metodi tradizionali, basati su stratagemmi linguistici o sulla codifica delle richieste, sembrano ormai avere un’efficacia limitata. Maggiori preoccupazioni suscitano invece gli approcci automatizzati e adattivi, che modificano progressivamente il proprio comportamento sulla base delle reazioni del sistema, aumentando così le probabilità di superarne le difese.

Per gli autori dello studio, questi risultati confermano che la sicurezza dell’intelligenza artificiale non può essere considerata un traguardo definitivo. Al contrario, richiede attività costanti di verifica, aggiornamento e controllo, in un contesto in cui le tecniche offensive evolvono rapidamente insieme alle capacità dei modelli.

La ricerca evidenzia inoltre l’importanza di sviluppare competenze autonome di valutazione in Europa. Disporre di strumenti indipendenti per analizzare affidabilità e resilienza dei sistemi più avanzati viene considerato un elemento strategico non solo per la diffusione sicura dell’AI, ma anche per rafforzare la capacità tecnologica del continente in un settore sempre più centrale per economia, istituzioni e società.