Преобразование голоса в четкий текст. Google представила Gemini 3.5 Transcribe

27 августа, 15:02
Компания планирует интегрировать модель в Chrome (Фото: Unsplash)

Компания планирует интегрировать модель в Chrome (Фото: Unsplash)

Google представила Gemini 3.5 Transcribe — новую модель распознавания речи, способную преобразовывать неструктурированную устную речь в упорядоченный текст и распознавать более 85 языков.

Об этом пишет издание Engadget .

Модель должна распознавать речь точнее, чем предыдущие версии, а также удалять слова-паразиты при транскрибировании. Она способна понимать голосовые команды для редактирования текста и учитывать специальную лексику и нестандартное написание слов.

Реклама

Gemini 3.5 Transcribe также лучше справляется с буквенно-цифровыми последовательностями, в частности с номерами заказов и почтовыми индексами. При работе с записанным аудио модель способна различать до трех собеседников и добавлять временные метки для отдельных слов.

Google уже использует эту технологию в функции Rambler на устройствах Android, в частности в серии Pixel 11, а также в приложении Gemini для macOS.

Компания планирует интегрировать модель в Chrome, где она сможет работать с любым текстовым полем на веб-странице. Пользователи смогут диктовать ответы и публикации или отдавать Gemini голосовые команды.

Gemini 3.5 Transcribe также доступна в Google Antigravity — платформе Google для разработки приложений с использованием автономных ИИ-агентов. В дальнейшем модель планируют добавить в Search Live, Gemini Live, Docs, Keep и Gmail.

Разработчики смогут использовать Gemini 3.5 Transcribe через API Google.

Показать ещё новости