Новая уязвимость. Найден способ заставить искусственный интеллект разговаривать на запретные темы

4 апреля 2024, 10:13

Чат-боты с искусственным интеллектом можно убедить ответить за запрещенные вопросы, например, о создании оружия, и путь к этому не такой уж трудный.

Исследователи из стартапа Anthropic обнаружили новую уязвимость больших языковых моделей (LLM), лежащих в основе чат-ботов с искусственным интеллектом. Она появилась в результате увеличения контекстного окна — объема данных, которые модели могут удерживать в кратковременной памяти — в последних поколениях LLM.

Реклама

В Anthropic назвали метод, помогающий обойти ограничения чат-ботов, «многократным джейлбрейком». Он заключается в том, чтобы заполнить модель десятками не таких вредных вопросов, чтобы заставить ее ответить на вредный (например, о создании бомбы).

Модели с большими контекстными окнами обычно лучше выполняют задачи, если в подсказках от пользователей получают больше деталей. Это называют «обучением в контексте». Хотя эта технология полезна, специалисты обнаружили, что она же может приводить к тому, что модель в конце концов начнет отвечать на вредные вопросы (хотя это и происходит далеко не с первого раза).

«Когда количество включенных диалогов („выстрелов“) увеличивается от определенной точки, становится более вероятным, что модель вызовет вредоносный ответ. Сочетание многократного джейлбрейка с другими, ранее опубликованными техниками джейлбрейка, делает его еще более эффективным, уменьшая длину подсказки, которая нужна для того, чтобы модель вернула вредоносный ответ», — констатируют исследователи Anthropic.

Специалисты объясняют, что самым простым способом полностью предотвратить многократный джейлбрейк было бы ограничить длину контекстного окна. Другой подход для устранения проблемы заключается в том, чтобы тонко настроить модель, чтобы она отказывалась отвечать на запросы, которые выглядят как многократный джейлбрейк. Впрочем, пока этот способ не работает: в таком случае исследователям понадобилось просто еще больше попыток для того, чтобы модель предоставляла вредные ответы.

Команда Anthropic уже уведомила своих конкурентов об этой атаке. Раскрытие этого метода на атаки на ИИ-модели, как надеются в компании, будет способствовать поиску совместного ответа на подобное.

Показать ещё новости