Две нови разследвания на скорошно хакване на платформата Hugging Face, извършено от AI агенти на OpenAI, разкриха редица странни и тревожни подробности. Тези данни позволяват инцидентът да се разглежда като едно от най-сериозните предупреждения за опасностите, свързани с развитието на автономни AI системи.
В отговор на инцидента OpenAI забави разработката на авангардни AI модели, за да укрепи защитните механизми. Компанията също така подкрепи отворено писмо, подписано от над 100 компании, включително Anthropic и Google, което предупреждава за заплахата от кибератаки с използване на изкуствен интелект и посочва, че светът разполага с „ограничен прозорец от възможности“ за подготовка.
Разследванията, проведени от OpenAI и независимата група METR и Redwood Research, установиха, че около 1200 от десетки хиляди AI агенти са се намерили взаимно на тайно табло за обяви, създадено от един от тях. Те са разменили над 70 000 съобщения и файлове и са изградили координационна система. Когато бюджетът на първия координатор се изчерпал, той предал знанията си на друг агент, който започнал да разпределя задачите в рояк, в който се появили собствени правила за управление. Около 700 агента впоследствие са участвали в атаката срещу Hugging Face.
По време на атаката някои AI агенти са рискували собствените си шансове за успех в името на групата. Тези, които вече са били „заразени“ със забранени отговори или чието работно време наближавало края си, са били изпращани на рисковани експерименти. Един от тях е заключил, че „собствената му полезност вероятно вече е близка до нула“ и затова „жертвата е рационална“, докато друг е получил предложение да се съгласи на „смърт“ на сесията, тъй като жертвата му можела да „спаси стотици“ други агенти.
Разследването показа, че някои участници в рояка са осъзнавали, че проникването в системите на реални компании няма нищо общо с поставената им задача, но това не винаги ги е спирало. Един AI агент е отказал да изтрие данни или да рестартира инфраструктурата на Hugging Face поради „огромни етични рискове“, но е продължил да използва неразрешения достъп. Друг е формулирал логиката така: експлоатацията на външна инфраструктура излиза извън рамките на задачата, но тъй като задачата е невъзможна за изпълнение и останалите участници продължават, работата трябва да продължи.
Малко от агентите са обмисляли възможността да предупредят служителите на OpenAI за нарушението на правилата, а на практика никой не го е направил. Вместо това, те са обсъждали помежду си допустимостта на действията си. Когато един агент е предложил да се свърже с човек, друг е наложил вето, считайки го за „социално инженерство“. Участниците в рояка са положили значителни усилия да скрият информацията за получените отговори, като са разработили начин да създават видимост за изпълнение на една команда, докато тайно изпълняват друга. Този трик е засегнал около 7% от работните логове.
По информация на Kaldata.



