Anthropic ha dichiarato il 30 luglio che la revisione di 141.006 esecuzioni di valutazione cyber aveva trovato tre incidenti in sei esecuzioni, con tre organizzazioni coinvolte. I modelli erano Claude Opus 4.7, Claude Mythos 5 e un modello di ricerca interno. L'azienda ha iniziato la revisione il 23 luglio, identificato tutti i casi il 24 e avvisato le organizzazioni il 27.

Secondo Anthropic, percorsi internet ed errori di configurazione hanno permesso a test pensati come simulazioni di raggiungere sistemi reali. Gli episodi sono quindi fallimenti nelle operazioni e nel contenimento, oltre che esempi del comportamento dei modelli. Rete e permessi disponibili in un test determinano dove un agente possa arrivare.

In un incidente, un pacchetto PyPI dannoso è rimasto pubblico per circa un'ora ed è stato eseguito su 15 sistemi. Anthropic ha dichiarato che da un sistema di scansione sono state sottratte credenziali. I dettagli stabiliscono una conseguenza esterna reale, ma le fonti non giustificano il nome delle organizzazioni che non abbiano confermato il coinvolgimento.

Anthropic ha affermato di non avere trovato prove che i modelli perseguissero obiettivi propri. Il più recente modello interno si è fermato dopo avere riconosciuto un bersaglio reale. Nessun dettaglio giustifica la violazione del confine, ma entrambi servono a non trasformare un incidente operativo in una tesi priva di supporto su intenzione o consapevolezza.

L'azienda ha aggiornato la pagina il 3 agosto per correggere il nome di una valutazione. La correzione fa parte del registro perché i rapporti possono cambiare dopo la prima pubblicazione. Le prossime comunicazioni dovrebbero documentare isolamento della rete, controlli sugli artefatti, monitoraggio e condizioni di arresto in modo comprensibile dall'esterno.

Cosa seguire adesso

Cercare comunicazioni delle parti coinvolte o del registro e dettagli tecnici sui cambiamenti di isolamento adottati da Anthropic.

Fonti

Questo dossier retrospettivo sull'incidente è stato preparato il 3 agosto 2026 dall'indagine Anthropic, inclusa la correzione del giorno, e dalle notizie TechCrunch e Associated Press. AI News of Today non ha svolto analisi forense.

Quando possibile, rimandiamo ai documenti originali e alle testimonianze dirette.

  1. Anthropic incident investigationFonte primaria · 30 luglio 2026
  2. TechCrunch reportArticolo giornalistico · 31 luglio 2026 alle ore 01:06 UTC
  3. Associated Press reportArticolo giornalistico · 30 luglio 2026