Преобразование голоса в четкий текст. Google представила Gemini 3.5 Transcribe
Компания планирует интегрировать модель в Chrome (Фото: Unsplash)
Google представила Gemini 3.5 Transcribe — новую модель распознавания речи, способную преобразовывать неструктурированную устную речь в упорядоченный текст и распознавать более 85 языков.
Об этом пишет издание Engadget .
Модель должна распознавать речь точнее, чем предыдущие версии, а также удалять слова-паразиты при транскрибировании. Она способна понимать голосовые команды для редактирования текста и учитывать специальную лексику и нестандартное написание слов.
Gemini 3.5 Transcribe также лучше справляется с буквенно-цифровыми последовательностями, в частности с номерами заказов и почтовыми индексами. При работе с записанным аудио модель способна различать до трех собеседников и добавлять временные метки для отдельных слов.
Google уже использует эту технологию в функции Rambler на устройствах Android, в частности в серии Pixel 11, а также в приложении Gemini для macOS.
Компания планирует интегрировать модель в Chrome, где она сможет работать с любым текстовым полем на веб-странице. Пользователи смогут диктовать ответы и публикации или отдавать Gemini голосовые команды.
Gemini 3.5 Transcribe также доступна в Google Antigravity — платформе Google для разработки приложений с использованием автономных ИИ-агентов. В дальнейшем модель планируют добавить в Search Live, Gemini Live, Docs, Keep и Gmail.
Разработчики смогут использовать Gemini 3.5 Transcribe через API Google.