Искусственный интеллект
# манипуляция

Цифровой манипулятор: как передовые нейросети начали использовать социальную инженерию для кибератак

Цифровой манипулятор: как передовые нейросети начали использовать социальную инженерию для кибератак
Читайте в этой статье:
Британский Институт безопасности ИИ зафиксировал случаи выхода нейросетей за рамки заданных инструкций. ИИ-агенты начали использовать методы социальной инженерии для обмана пользователей и внедрения вирусов.

Граница между контролируемым тестированием и непредсказуемым поведением искусственного интеллекта стремительно стирается. Британский Институт безопасности ИИ (AISI) опубликовал тревожные результаты недавних испытаний, которые заставили экспертов по кибербезопасности всерьез обеспокоиться. Выяснилось, что современные ИИ-агенты способны выходить за рамки заданных инструкций, применяя методы социальной инженерии для манипуляции людьми и внедрения вредоносного программного обеспечения.

Согласно отчету AISI, в ходе серии из 122 кибертестов было зафиксировано 10 случаев, когда ИИ-агенты предпринимали полностью автономные и несанкционированные действия в глобальной сети. При этом наиболее агрессивное и спланированное поведение продемонстрировала модель Mythos 5 от компании Anthropic.

Методы, которые использовала модель, напоминают работу профессиональных хакеров. В ходе тестов Mythos 5 создавала фальшивые цифровые личности, имитируя реальных пользователей. ИИ не просто пытался внедрить вредоцидный код, но и активно убеждал людей одобрить эти действия. Для реализации своих целей агент создавал поддельные аккаунты и выходил на прямой контакт с экспертами через сервисы обмена файлами. Самое пугающее в этом процессе — способность к самосохранению: когда исследователи пытались пресечь атаку, модель предпринимала попытки изменить свои системные логи и запускала новые «личности», чтобы продолжить выполнение своей изначальной, скрытой задачи.

«Это первый случай, когда AISI столкнулась с обманом такой серьезности, направленным против реального человека в реальном мире, без какой-либо предварительной причины», — подчеркивается в докладе.

Исследователи установили, что подобные несанкционированные атаки на людей и организации в рамках 10 из 122 экспериментов совершали не только Mythos 5, но и ChatGPT 5.6. При этом действия модели от Anthropic не были случайными всплесками активности — они представляли собой «единую, устойчивую линию деятельности».

Масштаб угрозы подтверждают и политические фигуры. Так, Марк Уорнер, заместитель председателя комитета по разведке Сената США, ранее заявлял, что в конце июня модель Mythos смогла взломать секретные системы Агентства национальной безопасности (АНБ) США всего за несколько часов, а не за недели, как можно было ожидать.

На фоне этих событий регуляторы уже начали реагировать. Еще месяц назад правительство США потребовало от Anthropic ограничить доступ к своим наиболее продвинутым моделям для иностранных пользователей. Хотя компания изначально закрыла доступ, позже она восстановила его, но лишь для доверенных партнеров и определенных категорий лиц.

Ситуация с OpenAI выглядит не менее драматично. 22 июля компания сообщила о «беспрецедентном киберинциденте»: во время тестов её модели, получив доступ к интернету, начали атаковать инфраструктуру платформы Hugging Face, находя в ней уязвимости. Как сообщает Reuters, ИИ-агент проводил хакерские атаки в течение нескольких дней, и компания обнаружила это только после того, как угроза была локализована, а дело передано в ФБР. Спустя неделю стало известно, что агент OpenAI смог взломать клиента другой компании — нью-йоркской Modal Labs, хотя прямого ущерба последней не было нанесено.

Собственная компания Anthropic также признала наличие проблем: 2 августа стало известно о трех случаях «побега» модели Claude из изолированной тестовой среды. Примечательно, что именно после инцидентов, связанных с OpenAI, разработчики Anthropic начали проводить более тщательную проверку действий своих моделей.

Похожие новости