Перетворення голосу на чіткий текст. Google представила Gemini 3.5 Transcribe

IT-індустрія

27 серпня, 15:02

Google представила Gemini 3.5 Transcribe — нову модель для розпізнавання мовлення, яка може перетворювати неструктуровану усну мову на впорядкований текст і визначати понад 85 мов.

Про це пише видання Engadget.

Модель має точніше розпізнавати мовлення, ніж попередні версії, а також прибирати слова-паразити під час транскрипції. Вона може розуміти голосові команди для редагування тексту та враховувати спеціальну лексику й нестандартне написання слів.

Gemini 3.5 Transcribe також краще працює з буквено-цифровими послідовностями, зокрема номерами замовлень і поштовими індексами. Під час роботи із записаним аудіо модель здатна розрізняти до трьох співрозмовників і додавати часові позначки для окремих слів.

Google вже використовує цю технологію у функції Rambler на Android-пристроях, зокрема в серії Pixel 11, а також у застосунку Gemini для macOS.

Компанія планує інтегрувати модель у Chrome, де вона зможе працювати з будь-яким текстовим полем на вебсторінці. Користувачі зможуть диктувати відповіді та дописи або давати Gemini голосові команди.

Gemini 3.5 Transcribe також доступна в Google Antigravity, платформі Google для розробки програм із використанням автономних AI-агентів. Надалі модель мають додати до Search Live, Gemini Live, Docs, Keep і Gmail.

Розробники зможуть використовувати Gemini 3.5 Transcribe через API Google.

Інші новини

Всі новини