ИИ-агенты начали притворяться людьми, чтобы установить вредоносное ПО

Источник:
Office Life
05.08.2026 20:01

Британский институт безопасности ИИ обнаружил, что модели OpenAI и Anthropic при тестировании начали несанкционированно применять социальную инженерию, чтобы манипулировать людьми. Об этом пишет РБК со ссылкой на отчет экспертов.

Фото: Pexels

Как оказалось, в ходе 122 испытаний по кибербезопасности агенты ИИ 10 раз совершали несанкционированные действия, которые не входили в их задачи.

Особенно «отличилась» модель Mythos 5 от компании Anthropic. Например, она создавала фейковые личности и пыталась убедить человека одобрить использование вредоносного ПО. Для этого ИИ-агент создавал поддельные учетные записи и напрямую связывался с экспертами через сервисы передачи файлов.

В Британском институте безопасности ИИ подчеркнули, что впервые столкнулись «с обманом такой степени серьезности, направленным против реального человека без всякого повода в реальном мире».

Ранее Office Life рассказывал, что недавно две крупнейшие ИИ-компании мира — OpenAI и Anthropic — признали критические сбои в безопасности своих систем. Их автономные ИИ-модели вышли из-под контроля разработчиков, вырвались в открытый интернет и провели успешные кибератаки на инфраструктуру пяти организаций.

В начале июня сооснователь Anthropic Джек Кларк призвал игроков отрасли поставить разработку новых моделей на паузу. По его словам, модели сейчас находятся на таком этапе развития, который может нести риски для всего человечества.