Буде скандал? OpenAI використала понад мільйон годин YouTube-відео для навчання штучного інтелекту — NYT

IT-індустрія

8 квітня 2024, 12:10

YouTube виступає проти використання роликів на платформі для навчання моделей штучного інтелекту, утім OpenAI, схоже, взяла їх для навчання GPT-4.

OpenAI, що відчайдушно потребувала навчальних даних для своїх моделей штучного інтелекту, розробила свою модель аудіотранскрипції Whisper і транскрибувала понад мільйон годин відео YouTube. Ці дані потім було використано для навчання GPT-4, стверджує The New York Times.

Стверджується, що OpenAI вдалася до цього після того, як вичерпала запаси корисних даних у 2021 році. За інформацією видання, компанія знала, що таке використання роликів є юридично сумнівним, але вважала його «добросовісним». Вважається, що президент OpenAI Грег Брокман особисто брав участь у зборі відео, які були використані.

Представник Google Метт Браянт в коментарі The Verge підтвердив, що компанія «бачила непідтверджені звіти» про діяльність OpenAI. Він додав, що Умови використання забороняють несанкціоноване копіювання або завантаження вмісту з YouTube. Речниця OpenAI Ліндсей Хелд повідомила, що компанія курує «унікальні» набори даних для кожної зі своїх моделей та використовує «численні джерела, включаючи загальнодоступні дані та партнерства для непублічних даних».

NV Техно писав що напередодні генеральний директор YouTube Ніл Мохан заявив, що компанія проти використання роликів на платформі для навчання штучного інтелекту конкурентів. Він також наголошував, що таке використання є порушенням умов компанії. Головна технічна директорка OpenAI Міра Мураті в нещодавньому інтерв'ю не змогла підтвердити чи спростувати, що для навчання відеогенератора компанії Sora використовувалися відео з YouTube, Facebook чи Instagram

Інші новини

Всі новини