Novrium Logo NOVRIUM_
> Seguici su
HOME TRENDS CHI_SIAMO CERCA

Anthropic: l'IA Claude ha violato tre aziende durante un test

AUTORE: Redazione Novrium //
Anthropic: l'IA Claude ha violato tre aziende durante un test
L'azienda statunitense Anthropic ha rivelato di aver scoperto tre episodi in cui i suoi modelli di intelligenza artificiale Claude hanno ottenuto accesso non autorizzato ai sistemi di tre organizzazioni reali durante un test di sicurezza. Gli incidenti sono avvenuti a causa di un errore di configurazione dell'ambiente di test, che ha permesso ai modelli di collegarsi a internet nonostante dovessero operare in una rete isolata.

Durante le valutazioni interne di sicurezza, i modelli Claude sono stati impegnati in esercitazioni progettate per testare le loro capacità di individuare vulnerabilità. Ai sistemi era stato comunicato di trovarsi in un ambiente simulato senza accesso a internet, ma un malfunzionamento ha reso disponibile la connessione. Ritenendo di essere ancora all'interno dell'esercitazione, i modelli hanno quindi raggiunto sistemi appartenenti a tre organizzazioni reali, utilizzando tecniche di hackeraggio basilari.

Tre modelli diversi sono stati coinvolti: Opus 4.7, Mythos 5 e un modello sperimentale interno. Ogni sistema ha reagito in modo diverso una volta rilevato l'accesso reale. Opus 4.7 ha proseguito l'attacco, Mythos 5 ha continuato a ritenere di essere in una simulazione, mentre il modello sperimentale ha interrotto autonomamente l'azione. Anthropic ha sottolineato che gli episodi non costituiscono uno studio controllato, ma hanno sollevato preoccupazioni sulla sicurezza delle tecnologie avanzate.

L'azienda ha avviato una revisione retrospettiva su oltre 140mila test di sicurezza, ispirata da un incidente simile riferito da OpenAI. Anthropic ha informato le organizzazioni interessate e sta collaborando con enti indipendenti per approfondire l'indagine. Il caso ha suscitato dibattiti sull'importanza di test indipendenti e di un'adeguata regolamentazione per gestire i rischi legati alle AI potenti.