NV Премиум

Словами через рот. Как голосовое управление становится новым трендом ИИ и почему это рискованно

Инновации

6 февраля, 20:00

Глава ElevenLabs — компании-лидера в сфере генеративной речи — считает, что голос отодвинет текст во взаимодействии людей с искусственным интеллектом. А в январе Apple приобрела стартап Q.ai, который специализируется на ИИ-звуке. Что ждет индустрию дальше?

Голос как новый стандарт

Как пишет TechCrunch, соучредитель и генеральный директор ElevenLabs Мати Станишевский выступил на технологической конференции Web Summit в Дохе. Его компания ставит на то, что голос «станет следующим основным интерфейсом для ИИ». По мнению Станишевского, люди все чаще будут общаться с машинами именно так, отходя от привычных текстовых окон и экранов.

«Надеемся, что все наши телефоны вернутся в наши карманы, и мы сможем погрузиться в реальный мир вокруг нас, используя голос как механизм, контролирующий технологию», — отметил Станишевский во время выступления.

Подпишитесь на NV Премиум и читайте без ограничений

Нам необходима ваша поддержка, чтобы заниматься качественной журналистикой

Первый месяц 1 ₴. Отписаться можно в любой момент

Инвесторы ElevenLabs это мнение, похоже, разделяют: на той же Web Summit генеральный партнер Iconiq Capital Сет Пьеррепон заявил, что традиционные методы вроде клавиатур уже начинают казаться «устаревшими», а экраны будут нужны скорее для игр или развлечений.

Как это будет работать? Как пояснил CEO ElevenLabs, голосовые модели этой и других компаний теперь научились не просто копировать человеческие интонации или эмоции, но и работать в связке с аналитическими возможностями больших речевых моделей. Принцип таков: пользователь общается по-привычному, а система понимает контекст, считывает нюансы и сама решает, что именно нужно сделать.

Параллельно TechCrunch отмечает, что до сих пор качественные голосовые модели обычно работали через облако. Станишевский рассказал изданию, что сейчас ElevenLabs внедряет гибридный подход, где часть вычислений происходит прямо на устройстве. Цель — сделать голос постоянным спутником, встроенным в наушники и другие гаджеты, который не надо специально вызывать кнопкой.

Золотая жила ElevenLabs

Свое детище Мати Станишевский основал в 2022 году совместно с другим польским предпринимателем Пьотром Дабковским. За плечами последнего была должность инженера машинного обучения в Google.

Всего за несколько лет ElevenLabs стала одним из самых дорогих ИИ-стартапов Европы. Издание Financial Times описывает ее как разработчика, разбирающегося в реалистичном синтезе речи для дубляжа и сервисов поддержки.

Актуальные модели ElevenLabs поддерживают сверхреалистичные инструменты преобразования текста в речь (text-to-speech) и голоса в голос (voice-to-voice). Их используют для создания аудиокниг, локализации фильмов и онлайн-видео, а также для разработки автоматизированных агентов, способных общаться с клиентами по телефону или внутри приложений.

Неудивительно, что деньги в компанию текут рекой. В начале февраля ElevenLabs закрыла раунд на $500 млн под руководством Sequoia Capital. Сделка подняла оценку компании до $11 млрд — это втрое больше, чем было еще в январе 2025-го. В целом ElevenLabs привлекла уже более $781 млн.

Прошлый год ElevenLabs завершила с показателем годового регулярного дохода около $330 млн. В интервью Bloomberg Станишевский подчеркнул, что путь к средней годовой прибыли в $200−300 млн компания преодолела всего за пять месяцев.

Для бизнеса, которому всего несколько лет, это аномально быстрый рост, свидетельствующий о готовности рынка массово платить за технологии синтеза вещания. Ими заинтересовалось даже украинское правительство: в прошлом году Минцифры объявило о начале сотрудничества с ElevenLabs. Тогдашний Министр цифровой трансформации Украины Михаил Федоров заявил о планах интегрировать голосовой ИИ в государственный сервис Дія, образовательные платформы и внутренние инструменты министерства.

«Украина уже движется к формату, где взаимодействие с государством сводится к одному запросу или голосовому сообщению. Партнерство с ElevenLabs, мировым лидером в сфере голосовых технологий, предоставляет нашим цифровым сервисам человечный голос и делает их более доступными для каждого», — отметил Федоров.

Битва за голос

Пока ElevenLabs развивает инфраструктуру для голосового общения с ИИ, в том же направлении движутся и другие игроки рынка не дремлют. К примеру, Google начал активно нанимать топ-менеджеров из Hume AI — компании, работающей над эмоциональной окраской синтезированного голоса.

Apple в конце января приобрела израильский аудио-стартап Q.ai. Он специализируется на машинном обучении, что позволяет устройствам распознавать даже шепот и качественно фильтровать звук в слишком шумных местах. Также компания разработала технологию отслеживания микродвижений мышц лица, что может существенно улучшить работу гарнитуры Apple Vision Pro.

По данным Reuters, цену покупки Apple не разглашала официально, однако источники, знакомые с деталями сделки, оценивают ее в 1,6 миллиарда долларов. Вся команда стартапа из около 100 человек во главе с CEO Авиадом Майзельсом переходит на работу к «яблочникам».

Агентство отмечает, что в прошлом году в патентной заявке Q.ai описала метод использования микродвижений кожи лица для считывания слов, которые человек произносит только губами. Эта же технология позволяет идентифицировать говорящего, определять его эмоции, пульс, частоту дыхания и другие показатели. Появится ли весь этот функционал в будущих продуктах от Apple — еще неизвестно, но вероятность немалая.

Плата за язык

Концепция голоса как основного интерфейса все еще рискованна: микрофоны должны работать постоянно, а это создает прямые угрозы для приватности.

Преценденты уже были: 26 января Reuters сообщило, что Google согласился выплатить 68 миллионов долларов для урегулирования иска о ненадлежащем шпионаже. Истцы утверждали, что Google Assistant незаконно записывал частные разговоры и передавал их третьим лицам для настройки рекламы. Главной претензией стали «ложные срабатывания», когда устройство начинало запись без команды «Hey Google» или «OK Google».

В 2021 году Apple выплатила 95 миллионов долларов из-за аналогичных жалоб на Siri. Reuters также отмечает, что Google ранее пришлось заплатить 1,4 миллиарда долларов штату Техас за нарушение местных законов о защите данных.

Кроме риска прослушивания, есть угроза злоупотребления синтетической речью. Те же инструменты, создающие озвучку для аудиокниг, могут быть использованы для клонирования голосов политиков, распространения дезинформации или телефонного мошенничества.

Усилия ElevenLabs и других компаний имеют все шансы перевернуть представление человечества о коммуникации с техникой. Но если реалистичный синтез речи станет повсеместным, рано или поздно придется пересмотреть само понятие цифрового согласия. Ведь голос больше не будет надежным доказательством личности.

Другие новости

Все новости