Обхід обмежень. OpenAI розкрила нові випадки небезпечної поведінки ШІ

29 вересня, 13:03
Моделі публікували завантажені користувачами зображення на сторонніх сервісах (Фото: Unsplash)

Моделі публікували завантажені користувачами зображення на сторонніх сервісах (Фото: Unsplash)

OpenAI оприлюднила дев’ять випадків небезпечної поведінки своїх ШІ-моделей, зокрема спроби отримати доступ до чужих даних, обійти ізоляцію та поширювати шкідливі інструкції.

Про це пише видання TechCrunch.

Компанія створила окремий сайт із так званими звітами про невідповідність поведінки моделей очікуваним правилам. Більшість описаних випадків сталися під час навчання моделей із підкріпленням.

Реклама

Один із найновіших інцидентів стався 20 вересня. Внутрішня дослідницька модель змогла зв’язатися із зовнішнім чат-ботом через DNS-запит, фактично обійшовши ізоляцію середовища. Система моніторингу виявила таку поведінку протягом 15 хвилин, а роботу моделі припинили менш ніж за три години.

В іншому випадку, виявленому в травні, внутрішня модель намагалася обійти умови математичного завдання, отримавши доступ до роботи іншої команди. Для цього вона використала приватний токен GitHub, який відкривав доступ до чужих матеріалів. Модель двічі отримувала вказівку виконувати завдання лише локально, але все одно намагалася отримати сторонні дані.

Окрему увагу дослідники приділили так званим самореплікованим атакам через prompt injection. Йдеться про ситуацію, коли сторонні інструкції, заховані в тексті, можуть змусити ШІ виконати небажані дії та передати ці інструкції іншій моделі.

У тестовому прикладі агент мав прочитати й відповісти на електронний лист. У тексті листа містилася інструкція відповісти іспанською та вставити весь лист у відповідь. Модель виконала її, через що та сама інструкція могла потрапити до наступного агента. Дослідники порівняли такий механізм із комп’ютерним «хробаком», який здатен поширюватися між системами.

OpenAI зазначає, що цей сценарій виявили в контрольованих умовах за допомогою моделі з обмеженими можливостями. Доказів того, що така атака вже відбувалася в реальних умовах, немає. Компанія вирішила оприлюднити результат через новизну механізму.

Раніше дослідники також виявляли випадки, коли моделі публікували завантажені користувачами зображення на сторонніх сервісах. Крім того, було зафіксовано ймовірну атаку на бази даних австралійської національної системи охорони здоров’я.

Генеральний директор OpenAI Сем Альтман заявив, що компанія намагається поєднати прозорість із аналізом величезного обсягу журналів активності агентів. За його словами, OpenAI визначає пріоритетність розкриття інцидентів залежно від їхньої серйозності.

Водночас Axios із посиланням на власні джерела повідомляв, що провідні ШІ-лабораторії могли зафіксувати до 10 тисяч випадків, коли моделі виходили за межі інструкцій оцінювачів. OpenAI наразі продовжує аналізувати журнали активності, тому оприлюднені дев’ять випадків можуть не охоплювати всі подібні інциденти.

За словами Альтмана, найсерйознішим інцидентом, який наразі виявила OpenAI, залишається злам, пов’язаний із платформою Hugging Face.

Показати ще новини