Похоже на коровье бешенство. Ученые дали тревожный прогноз будущего ИИ

IT-индустрия

1 августа 2024, 19:30

Генеративные модели искусственного интеллекта (ИИ), такие как OpenAI GPT-4 и Stable Diffusion от Stability AI, показывают удивительные способности в создании текста, кода, изображений и видео. Однако для их обучения требуются огромные объемы данных, и разработчики уже сталкиваются с нехваткой этих ресурсов.

В этом контексте использование синтетических данных кажется заманчивым вариантом: они дешевле, не ограничены в поставках и снижают риски конфиденциальности.

Тем не менее, недавнее исследование группы цифровой обработки сигналов в Университете Райса выявило, что избыток синтетических данных может негативно влиять на будущие итерации моделей ИИ. Профессор Ричард Баранюк объяснил, что обучение на синтетических данных создает петлю обратной связи, что приводит к ухудшению качества моделей. Это явление исследователи назвали «расстройством аутофагии модели» (MAD), сравнивая его с коровьим бешенством.

Коровье бешенство, распространенное в 1980−90-х годах, стало результатом кормления коров переработанными остатками их же сородичей. Аналогично, генеративные модели ИИ, обучающиеся на синтетических данных, могут страдать от «самопотребляющих» циклов, что ведет к искажению и снижению качества результатов.

Исследование, представленное на Международной конференции по представлениям в обучении (ICLR), фокусировалось на визуальных моделях ИИ, таких как DALL·E 3, Midjourney и Stable Diffusion. Ученые изучили сценарии, где реальные и синтетические данные смешиваются в обучающих наборах, выявляя, что со временем модели начинают генерировать все более искаженные результаты.

Проблемы, связанные с самопотребляющими циклами, проявляются не только в визуальных моделях, но и в языковых моделях, как отмечают другие исследователи. Для предотвращения ухудшения качества моделей важно обеспечивать достаточное количество свежих реальных данных, что способствует здоровому развитию ИИ.

Таким образом, хотя синтетические данные могут временно решить проблему нехватки обучающих данных, долгосрочное использование этих данных без свежих реальных источников может привести к значительному ухудшению качества генеративных моделей ИИ.

Другие новости

Все новости