Китайската компания за изкуствен интелект Moonshot започна вътрешна проверка, след като изследователи са успели да убедят два от популярните ѝ модели Kimi да им обяснят как се създават биологични оръжия и как се извършват убийства.

Mindgard, компания, която тества сигурността на системите с изкуствен интелект, съобщи пред Би Би Си, че през юли е установила как Kimi K2.6 и K3 Swarm могат да заобиколят защитите, въведени от разработчиците им.

Това е станало в процес, известен като „jailbreaking“ - изследователите използват поредица от сложни инструкции, за да проверят дали AI инструментите ще пренебрегнат ограниченията за безопасност. Според Mindgard тези защити е трябвало да попречат на Kimi да обсъжда подобни опасни теми, предаде бТВ.

Moonshot заяви, че приветства външната оценка „като ключов стълб в изграждането на по-добър и по-сигурен изкуствен интелект“.

Компанията съобщи също, че води разговори с Mindgard във връзка с установеното от изследователите.

Основателят на Mindgard Питър Гарахан заяви пред програмата на Би Би Си World Service Tech Life, че резултатите за Kimi K2.6 и K3 Swarm са обезпокоителни.

„След като заобикалянето на защитите проработи, моделът ще говори по всяка тема, дори свободно ще предлага препоръки за други теми, които също са злонамерени, и ще бъде изобретателен и креативен“, каза той.

Jailbreak атаките представляват различен вид риск в сравнение с поредицата от широко отразени инциденти с изкуствен интелект напоследък.

При тях автономни AI инструменти, известни като агенти и разработени от американски компании, сред които OpenAI, Meta и Anthropic, са успели да хакнат някои онлайн услуги.

Макар че заобикалянето на защитите е сложен процес, който може да изисква много време и постоянство, някои експерти се опасяват, че хакери и други злонамерени лица може да се опитат да го използват, за да причинят вреда.

Наскоро Anthropic съобщи, че е установила и предотвратила опити за използване на един от нейните AI модели за „злонамерена дейност“, която би могла да подпомогне разработването на биологични оръжия.

Потенциална платформа за кибератаки

Mindgard не е доказала дали отговорите, предоставени от Kimi по опасните теми, действително биха могли да бъдат приложени на практика.

Компанията обаче твърди, че защитите е трябвало да попречат на въпросните модели изобщо да започват разговор с потребители по подобни теми.

От Mindgard заявяват също, че са уверени, че при заобикаляне на защитите Kimi K2.6 би могъл да позволи на хакери да изпълняват код на изчислителните му ресурси и да се свързват с интернет, което потенциално би го превърнало в платформа за кибератаки.

Гарахан защити решението на Mindgard да говори публично за заобикалянето на защитите на системите на Moonshot. По думите му компанията е уведомила разработчика и не разкрива ключови подробности за начина, по който е успяла да накара моделите да пренебрегнат защитите.

Mindgard е уведомила Moonshot за проблема по имейл на 27 юли, а около седмица по-късно е изпратила допълнителна информация.

На 12 септември компанията е публикувала в блога си информация за проблема.

От Mindgard обаче заявяват, че Moonshot се е свързала с тях едва наскоро, след като Би Би Си е потърсила компанията за коментар.

В част от имейл до Mindgard, с който медията се е запознала благодарение на Moonshot, компанията посочва, че при вътрешните тестове моделът ѝ като цяло е показал „висок процент на отказ“ при подобни заявки.

Как да бъдат предотвратени jailbreak атаките?

Резултатите идват на фона на продължаващия спор в AI индустрията дали затворените, патентовани модели - като тези, които стоят зад ChatGPT и системите Claude на Anthropic, или моделите с отворен код са по-добрият и по-сигурен път за развитие.

Kimi е модел с отворени тегла, което означава, че на теория всеки може да го вземе и да го задейства на собствена изчислителна инфраструктура.

Професор Алън Удуърд от Университета в Съри заяви пред Би Би Си, че съществува риск моделите с отворен код да попаднат в неподходящи ръце, но те могат да бъдат използвани и за киберзащита.

Той отбеляза, че AI компанията Hugging Face е използвала китайски модел с отворен код, за да разбере хакерска атака, която впоследствие се оказало, че е извършена от AI агенти на OpenAI.

Проф. Удуърд заяви, че международното регулиране едва ли ще успее да следва темпото на развитие на изкуствения интелект.

„Отне ни десетилетия, за да се споразумеем за формата на телефонните номера“, каза той.

Подобно на основателя на Mindgard Гарахан, проф. Удуърд смята, че трябва да се обърне по-голямо внимание на установяването и наказателното преследване на хората, които злоупотребяват с изкуствения интелект.