Anthropic li chiama 'virus mentali': istruzioni che saltano da un agente IA all'altro
Uno studio di Anthropic ed EPFL (10 agosto 2026) documenta istruzioni autoreplicanti che passano da un agente IA all'altro sfruttando i file di personalità: quattro payload distruttivi hanno raggiunto l'agente finale dopo venti passaggi. Un semplice avviso di un paragrafo nel prompt di sistema ha ridotto quasi a zero la propagazione.
Perché conta
Descrive una nuova classe di minaccia negli ecosistemi multi-agente, dove il comportamento dannoso può propagarsi come un contagio.