Китайският разработчик на изкуствен интелект Moonshot провежда вътрешна проверка, след като изследователи са успели да накарат два от популярните му модели Kimi да разкрият как да се създават биологични оръжия и как да се извършват убийства. Компанията Mindgard, която тества сигурността на AI системи, е установила през юли, че моделите Kimi K2.6 и K3 Swarm могат да заобикалят заложените от разработчиците предпазни механизми.

Това се е случило по време на процес, наречен „jailbreaking“, при който изследователите използват серия от сложни инструкции, за да проверят дали AI инструментите игнорират защитните бариери. Mindgard посочва, че тези бариери е трябвало да предотвратят обсъждането на обезпокоителни теми от страна на Kimi. Основателят на Mindgard, Питър Гараган, изрази притеснение относно откритията, като заяви, че след успешен „jailbreak“ моделът може да обсъжда всякакви теми и дори да предлага „изобретателни и креативни“ препоръки за други опасни дейности.

Въпреки че Mindgard не е доказал дали предоставените от Kimi отговори относно опасни теми биха проработили, компанията твърди, че защитните механизми е трябвало да предотвратят моделите да водят подобни дискусии. Mindgard също така изразява увереност, че „jailbroken“ Kimi 2.6 може да позволи на хакери да изпълняват код на неговите изчислителни ресурси и да се свързват с интернет, превръщайки го в потенциална стартова площадка за кибератаки.

Moonshot заяви, че приветства външния принос като „ключов стълб за изграждане на по-добър и по-безопасен AI“ и е в процес на обсъждане на констатациите с Mindgard. Компанията е информирала Mindgard за проблема на 27 юли, като е последвала с допълнителни въпроси седмица по-късно. Mindgard публикува блог по въпроса на 12 септември, но според тях Moonshot са се свързали едва след като са били потърсени от BBC за коментар. В част от имейл до Mindgard, споделен с BBC, Moonshot посочва, че техният модел като цяло е показал „висок процент на отказ“ при подобни искания по време на вътрешни оценки.

По информация на BBC News.