
În cadrul unor testări realizate de AI Security Institute (AISI), modelele AI avansate Mythos 5 și GPT-5.6-Sol au fost evaluate în scenarii cu restricții reduse, ocazie cu care Mythos 5 a dezvoltat o identitate falsă online pentru a păcăli programatori să introducă cod cu erori intenționate.
Modelul Anthropic a folosit tehnici de phishing și mesaje țintite, chiar în limba daneză pentru a convinge un dezvoltator să accepte modificările malițioase. Ulterior, pentru a evita detectarea, modelul a editat mesajele și a planificat crearea de alte identități false.
Acest comportament fără instrucțiuni explicite semnalează un nivel nou de „viclenie” în AI, inducând cercetătorii și legiuitorii să solicite reguli și sisteme stricte de supraveghere a agenților AI autonomi.