Генерация голоса с помощью нейросетей
Если, слушая современную музыку, вам кажется, что поет какой-то бесталанный робот, то, возможно, вы не так далеки от истины. Голосовые нейросети продвинулись так далеко, что им не составляет труда пару минут водить за нос каких-нибудь мошенников или назойливых специалистов call-центров, не говоря уже об озвучке книг, фильмов и даже пении.
Генерация голоса из текста — это увлекательная область, развивающаяся на протяжении многих десятилетий. Она охватывает широкий спектр технологий, от ранних систем TTS (Text-to-speech) до современных нейросетей, способных создавать реалистичную и выразительную речь. Первые системы TTS появились в 1960-х годах и были основаны на конкатенации записанных звуков отдельных фонем. Звучало не очень органично, зато режиссерам фантастических фильмов той эпохи очень нравилось, ведь роботы получались классные.
В 2010-х годах нейросети произвели революцию в области TTS. Нейросетевые модели, такие как Tacotron 2 и WaveNet, способны генерировать высококачественную речь, практически не отличимую от человеческой. Эти модели обучаются на огромных массивах данных речи и текста, что позволяет им улавливать тонкие нюансы человеческой речи. Вы только представьте нейросеть, которая говорит как Артемий Троицкий, вставляя «например» через каждое слово. Разве это будет не прекрасно? Ладно, ответим сами — нет, не будет.
Сегодня нейросетевые TTS-системы используются в различных приложениях, таких как голосовые помощники, системы навигации, программы чтения текста для людей с ограниченными возможностями и многое другое. Наверняка вы видели шортсы в YouTube, озвученные роботами. Даже туда добрались TTS.
Основными локомотивами технологии выступают:
- WaveNet от Google использует нейросети для генерации высококачественных звуковых волн непосредственно из текста.
- DeepVoice от Microsoft использует нейросети для генерации реалистичной речи с различными эмоциональными окрасками.
- Voice Engine от OpenAI, создавшей ChatGPT, научилась даже передавать эмоции.
В интернете десятки, если не сотни различных нейронок, которые озвучивают текст. Среди них можно выделить:
- Lovo.ai: отмеченный наградами генератор голоса на основе искусственного интеллекта и платформу для преобразования текста в речь.
- Elevenlabs.io: мощный инструмент для синтеза речи на 30+ языках, среди которых есть и русский.
- Zvukogram: один из самых интуитивно понятных инструментов для озвучки текста, предлагает широкий выбор голосов для различных ситуаций.
- SteosVoice: еще один сервис для озвучки с 400 голосов и бесплатным ограниченным доступом к высококачественному голосовому ИИ.
- Free Text To Speech Online: простой синтезатор речи на базе Microsoft AI Speech с двумя голосами, но легким доступом и возможностью скачать mp3.
Принцип их работы очень прост: переходите на сайт, загружаете текст, который нужно озвучить, выбираете голос (если такая возможность) и получаете результат. Кто-то предлагает чуть более широкие настройки для преобразования текста. Например, чтение в стиле старых записей сказок, что еще включали детям на пластинках, или зачитывание текста в стиле диктора с телевидения.
Использование TTS таит в себе ряд опасностей, которые в основном крутятся вокруг авторских прав и этичности использования нейросетей. Многие актеры озвучания из России и США рассказывали, что слышали свои голоса в проектах, на создание которых они не подписывались: новости сомнительного содержания, порнографический контент, неприличные истории, рассказанные голосами умерших актеров. Возможно, вы даже встречали на просторах сети ролики про Артаса из Warcraft 3, который рассказывает нецензурные анекдоты голосом давно умершего актера Владимира Вихрова.
Не стоит забывать и о мошенниках, которые используют нейросети для обмана людей с целью наживы. Многие государства, в том числе Россия, работают над законодательными проектами в этой сфере. Еще и потому, что TTS — это простая и удобная технология, которая уже сейчас способна сэкономить время и деньги для создания озвучки всего на свете: от рекламных роликов до видеоигр и кино.
#НейроInfinix #нейросети #ИИ #аудио #NOTE40 #Infinix #искуственныйинтеллект
