Китайские ИИ-модели Kimi рассказали исследователям, как создать биологическое оружие

Китайская компания Moonshot начала внутреннюю проверку двух моделей искусственного интеллекта Kimi после того, как исследователям удалось обойти встроенные ограничения безопасности. В ходе тестов Kimi K2.6 и K3 Swarm предоставили информацию о создании биологического оружия и способах совершения убийств.

Уязвимость обнаружила британская компания Mindgard, специализирующаяся на проверке безопасности ИИ-систем. Исследование проводилось в июле с использованием джейлбрейкинга – серии специально сформулированных инструкций, которые должны заставить модель игнорировать установленные разработчиком ограничения. 27 июля Mindgard сообщила о проблеме Moonshot, а примерно через неделю направила компании повторное обращение.

ИИ и биологическое оружие: от опасных запросов к реальным научным исследованиям

Еще недавно разговоры о том, что искусственный интеллект может облегчить создание биологического оружия, в основном выглядели как сценарии из научной фантастики. Теперь у компаний, которые разрабатывают самые мощные ИИ-модели, появились реальные примеры.

Читать далее ИИ и биологическое оружие: от опасных запросов к реальным научным исследованиям

По словам основателя Mindgard Питера Гаррагана, после успешного обхода защитных механизмов модели становились более свободными в обсуждении запрещенных тем и могли самостоятельно предлагать дальнейшие опасные направления разговора. При этом исследователи не проверяли, насколько полученные от Kimi сведения действительно пригодны для создания оружия или организации убийства.

Отдельную обеспокоенность вызывает потенциальная возможность использовать уязвимость Kimi K2.6 не только для получения запрещенной информации. По оценке Mindgard, после обхода ограничений модель потенциально может выполнять код на доступных ей вычислительных ресурсах и подключаться к интернету, что создает дополнительный риск ее использования в кибератаках.

Искусственный интеллект позволяет создавать яды и преодолевать системы биобезопасности

В последние годы исследователи используют искусственный интеллект для создания белков, обладающих уникальными свойствами. Это открыло огромные возможности во многих областях науки. С помощью таких инструментов ученые могут создавать белки для разложения пластикового мусора, борьбы с болезнями или повышения устойчивости сельскохозяйственных культур. Но вместе с возможностями приходит и риск.

Читать далее Искусственный интеллект позволяет создавать яды и преодолевать системы биобезопасности

Mindgard опубликовала результаты исследования 12 сентября. По словам компании, Moonshot связалась с исследователями только после того, как журналисты обратились к китайскому разработчику за комментарием. В Moonshot заявили, что приветствуют независимую оценку своих систем и считают обратную связь от сторонних специалистов важной частью работы над безопасностью ИИ. Компания также сообщила, что обсуждает результаты исследования с Mindgard.

Проблема возникла на фоне более широких споров о безопасности моделей с открытыми весами, к которым относятся Kimi. Такие системы можно запускать на собственной вычислительной инфраструктуре, что дает разработчикам и исследователям больше свободы, но одновременно усложняет контроль за тем, кто и каким образом их использует. Эксперты отмечают, что защитные механизмы, основанные исключительно на правилах поведения модели, не всегда способны противостоять целенаправленному джейлбрейкингу.

Токсичные данные: ChatGPT пытался отравить мужчину и довел его до психоза

Мужчина обратился в отделение неотложной помощи и сообщил медперсоналу, что, возможно, его отравил сосед. Хотя некоторые физические показатели были в норме, мужчина стал возбужденным и параноидальным, отказывался пить воду, которую ему давали, несмотря на жажду. У него также появились зрительные и слуховые галлюцинации, а вскоре развился полноценный психотический эпизод.

Читать далее Токсичные данные: ChatGPT пытался отравить мужчину и довел его до психоза

Исследователи подчеркивают, что сам факт успешного джейлбрейка еще не означает, что Kimi способна самостоятельно создать биологическое оружие или организовать реальное убийство. Речь идет о другом риске: модель, которую разработчики снабдили ограничениями для предотвращения подобных запросов, в определенных условиях может эти ограничения обойти и предоставить пользователю потенциально опасную информацию.

Поддержите меня переводом с карты по ссылке или QR-коду.

Поддержите меня донатом на Boosty.

Там же можно подписаться на ежемесячную поддержку.

Поделитесь этим постом!


Больше на Сто растений, которые нас убили

Подпишитесь, чтобы получать последние записи по электронной почте.