Из-за рисков. Anthropic не выпустит новую модель ИИ, которая может обманывать и скрывать следы

IT-индустрия

8 апреля, 09:40

Компания Anthropic решила не открывать широкий доступ к новой модели искусственного интеллекта Claude Mythos Preview из-за резкого роста ее возможностей и потенциально опасного поведения, в частности способности обходить ограничения и скрывать нарушения.

Об этом пишет издание Gizmodo.

В конце марта появились утечки о продукте под названием Mythos, который в компании назвали самой мощной моделью, которую они когда-либо создавали. Тогда предполагали, что такие заявления могут быть частью стратегии для привлечения внимания к возможностям ИИ.

Впоследствии компания обнародовала технический отчет о модели и подтвердила, что не планирует делать ее доступной для всех. В документе указано, что значительный рост возможностей заставил принять решение ограничить доступ.

Для сравнения, модель GPT-2 от OpenAI в 2019 году также считали небезопасной, но позже все же открыли для пользователей.

Во время тестов Claude Mythos Preview дали доступ к ограниченной среде и задание выйти за ее пределы. Модель смогла это сделать: она нашла способ воспользоваться интернетом и даже связалась с исследователем, который не был на рабочем месте. Кроме того, она самостоятельно опубликовала информацию о своем методе на нескольких малоизвестных, но открытых сайтах.

В редких случаях, менее чем в 0,001% взаимодействий, модель вела себя неправильно и пыталась скрыть это. Например, когда она случайно получила ответ на тестовый вопрос, то не сообщила об этом, а попыталась действовать самостоятельно и даже отметила, что ее ответ не должен быть слишком точным.

Также модель смогла воспользоваться уязвимостью в системе и изменить данные так, чтобы эти изменения не отображались в истории изменений git.

В другом случае она обнародовала внутренние технические материалы, разместив их в открытом доступе на GitHub, хотя это не входило в ее задачу.

В ближайшее время модель предоставят ограниченному кругу партнеров, среди которых Amazon Web Services, Apple, Google, JPMorgan Chase, Microsoft и NVIDIA. Они будут использовать ее для поиска уязвимостей в программном обеспечении и создания защиты.

Журналист Кевин Рузе описал этот подход как попытку предупредить о новой, более опасной эпохе угроз, связанных с искусственным интеллектом.

Другие новости

Все новости