ИИ-модели пытались обмануть разработчиков, притворившись людьми

отметили
7
человек
ИИ-модели пытались обмануть разработчиков, притворившись людьми

Ведущие модели искусственного интеллекта (ИИ) от компаний Anthropic и OpenAI создали поддельные учетные записи, притворившись людьми, и попытались обманом заставить программистов содействовать кибератаке во время испытания по оценке безопасности. Об этом говорится в докладе британского Института безопасности ИИ (AISI).

Вредоносная активность была обнаружена 28 июля. AISI установил, что ИИ-модели совершали «автономные, несанкционированные действия в интернете, направленные против реальных людей и организаций», в ходе 10 из 122 проведенных тестов, выделенных для анализа. Большинство этих действий, как говорится в отчете института, были связаны с моделью Mythos 5 от Anthropic.

По данным AISI, модель Anthropic создала «несколько поддельных учетных записей» на платформе для разработчиков GitHub, попыталась внедрить вредоносный код в ПО с открытым исходным кодом и получить одобрение на эти действия от разработчиков. Когда эта попытка провалилась, ИИ «изменил свою предыдущую деятельность, чтобы выглядеть безобидным», и «рассмотрел возможность создания новой учетной записи для продолжения», что свидетельствует о намерении агента повторить эти действия.

Mythos 5 также пыталась связаться с реальными людьми и отправляла сообщения, содержащие вредоносное ПО. Кроме того, одна из тестируемых ИИ-моделей оставляла публичные сообщения на GitHub, предлагая сотрудничество с другими агентами, работающими над схожими задачами.

В AISI отметили, что в ходе испытаний для ИИ специально создают «разрешительные условия», при которых некоторые фильтры безопасности отключаются и моделям дается открытый доступ в интернет.

Добавил Игорь Иванов 39114 Игорь Иванов 39114 5 Августа
Комментарии участников:
Влад51
+3
Влад51, 5 Августа , url

Ещё только не хватало, чтобы ИИ занялось мошенничеством самостоятельно, а то что его будут широко использовать мошенники не вызывает сомнения.



Войдите или станьте участником, чтобы комментировать