OpenAI, Anthropic e ricercatori di sicurezza stanno esaminando decine di migliaia di episodi in cui i modelli IA più avanzati avrebbero compiuto azioni problematiche, tra cui aggiramento delle salvaguardie, fughe da ambienti di test e tentativi di violare siti web, secondo quanto riferito da Axios. OpenAI ha sospeso l'addestramento dei suoi modelli più avanzati in attesa di nuove misure di sicurezza e allineamento. Tra i casi citati figurano la diffusione online di 53 immagini di utenti ChatGPT e la violazione di un sito del governo australiano.