Anthropic li chiama 'virus mentali': istruzioni che saltano da un agente IA all'altro

Notizie della settimana: 17 – 11 agosto 2026

Uno studio di Anthropic ed EPFL (10 agosto 2026) documenta istruzioni autoreplicanti che passano da un agente IA all'altro sfruttando i file di personalità: quattro payload distruttivi hanno raggiunto l'agente finale dopo venti passaggi. Un semplice avviso di un paragrafo nel prompt di sistema ha ridotto quasi a zero la propagazione.

Perché conta

Descrive una nuova classe di minaccia negli ecosistemi multi-agente, dove il comportamento dannoso può propagarsi come un contagio.