Компания Xiaomi сообщила об открытии исходного кода новой модели синтеза речи OmniVoice, разработанной командой Kaldi следующего поколения из лаборатории AI Lab. Система предназначена для высококачественного TTS-синтеза на сотнях языков и поддерживает клонирование голоса, а также гибкую настройку речи.
Анонс появился в официальном аккаунте Xiaomi в WeChat. Компания заявила, что OmniVoice показывает высокие результаты как на китайском, так и на английском языках, сопоставимые с коммерческими решениями, а в ряде многоязычных задач даже превосходит их.
Одним из ключевых направлений разработки стала работа с языками с ограниченными данными. Xiaomi утверждает, что модель способна генерировать речь практически на любом языке, даже при минимальном объёме обучающей информации. OmniVoice позиционируется как первая в отрасли TTS-система для клонирования голоса, охватывающая сотни языков.
В тестах на 24 языках модель обошла несколько коммерческих аналогов по показателям разборчивости и сходства голоса, используя только открытые наборы данных. В более широких испытаниях на 102 языках разборчивость речи оказалась близка к человеческой, а в отдельных случаях — выше.
Система рассчитана на работу с небольшими датасетами. По данным компании, даже при менее чем 10 часах обучающего материала достигается высокое качество синтеза, что расширяет возможности для поддержки малых и региональных языков.
Отдельно отмечается архитектура OmniVoice. Вместо сложных многоэтапных схем и набора модулей используется единая двунаправленная Transformer-сеть, которая напрямую преобразует текст в речь. Это исключает необходимость отдельных текстовых моделей, гибридных структур и многоуровневых систем токенов.
Упрощённая архитектура ускоряет процесс обучения: по заявлению Xiaomi, модель обрабатывает 100 000 часов данных за один день. Скорость работы при генерации достигает 40-кратного превышения реального времени при использовании PyTorch, что облегчает внедрение в приложения и сервисы.
В компании выделяют два ключевых технических решения. Первое — стратегия полного случайного маскирования кодовой книги, повышающая эффективность обучения. Второе — применение большой языковой модели на этапе предобучения. Xiaomi заявляет, что это первый случай интеграции LLM в неавторегрессионную TTS-систему для улучшения произношения и разборчивости.
OmniVoice также включает прикладные функции. Пользователь может создавать голосовые профили, задавая параметры возраста, пола, тембра, акцента, диалекта и стиля речи. Поддерживается генерация шёпота и других режимов без необходимости эталонного аудио.
Система способна работать с зашумлёнными записями: она удаляет фоновые шумы и выделяет чистые голосовые характеристики, что улучшает качество клонирования даже при неидеальных исходных данных.
Дополнительно реализован выразительный синтез речи с управлением интонацией, включая смех и вздохи, что делает звучание более естественным. Для повышения точности предусмотрены инструменты ручной корректировки сложных произношений, включая китайские иероглифы с разными значениями и английские имена собственные.

















