Kokoro TTS или XTTS-v2: что выбрать для русского
Коротко
Если озвучивать надо русский текст, выбора между ними нет: Kokoro-82M русский не поддерживает. В библиотеке девять языковых кодов (американский и британский английский, испанский, французский, хинди, итальянский, японский, бразильский португальский, китайский) и 54 голоса, русского среди них не значится. Скормить кириллицу можно, на выходе получится английская фонетика поверх транслита.
XTTS-v2 русский умеет: он в списке 17 языков, и голос клонируется по шестисекундному сэмплу. Плата за это — размер и лицензия. Весов около 2 ГБ против 312 МБ у Kokoro, а сами веса лежат под Coqui Public Model License: только некоммерческое использование, и купить коммерческую лицензию не у кого — компания Coqui закрылась в январе 2024 года.
Практический вывод: Kokoro берут для английской озвучки на слабом железе, XTTS-v2 — для русского в личных и исследовательских проектах. Для русского в коммерции честнее смотреть на Piper с лицензией MIT.
Чем эти варианты вообще отличаются
Это модели разных классов, и сравнивать их «по качеству звука» бессмысленно, пока не сравнили задачи.
Kokoro-82M — маленькая модель с фиксированным набором голосов. 82 миллиона параметров, один файл kokoro-v1_0.pth на 312,1 МБ (данные HF API на 28 июля 2026 года). Клонирования голоса нет: вы выбираете из готовых пресетов, у каждого языка свой набор. Апач-лицензия, никаких ограничений на коммерцию. Ставится как обычный пакет:
pip install kokoro>=0.9.4
Плюс системный espeak-ng — на нём держится преобразование текста в фонемы через библиотеку misaki. Именно фонемизатор и определяет список языков, а не сама акустическая модель: нет G2P для языка — нет и языка.
XTTS-v2 — тяжёлая многоязычная модель с клонированием. Веса раскладываются на три файла: model.pth 1781,4 МБ, dvae.pth 200,8 МБ, speakers_xtts.pth 7,4 МБ, суммарно чуть меньше 2 ГБ. Плюс PyTorch со всеми CUDA-зависимостями в виртуальном окружении, который на диске займёт больше самой модели. Отвечая на частый вопрос «сколько места»: закладывайте не два гигабайта, а пять-шесть на всё окружение целиком.
Есть ещё разница, о которой в старых статьях не пишут. Оригинальный репозиторий coqui-ai/TTS не поддерживается с закрытия компании. Живой код сейчас — форк idiap/coqui-ai-TTS и пакет coqui-tts в PyPI, лицензия кода MPL-2.0, Python от 3.10 до 3.14, PyTorch 2.2+. Инструкции, где стоит pip install TTS, устарели: на свежем Python они просто не соберутся. Установку с нуля мы разбирали в гайде по локальному синтезу речи на XTTS.
Сравнение по пунктам
| Kokoro-82M | XTTS-v2 | |
|---|---|---|
| Русский язык | нет | да, в списке 17 языков |
| Клонирование голоса | нет, только пресеты | да, сэмпл от 6 секунд |
| Голосов из коробки | 54 на 8 языков | голоса Coqui + любой свой |
| Вес модели | 312,1 МБ | ~2 ГБ (три файла) |
| Параметров | 82 млн | не раскрыто |
| Частота дискретизации | 24 кГц | 24 кГц |
| Лицензия весов | Apache 2.0 | CPML, некоммерческая |
| Лицензия кода | Apache 2.0 | MPL-2.0 (форк idiap) |
| Пакет | kokoro |
coqui-tts |
| Внешние зависимости | espeak-ng, misaki | PyTorch 2.2+, Python 3.10–3.14 |
| Обновление весов на HF | 10 апреля 2025 | 11 декабря 2023 |
| Загрузок за месяц | ~10,4 млн | ~9,3 млн |
| Минимальное железо | нормально живёт на CPU | на CPU медленно, лучше GPU |
Цифры по размерам, лицензиям, датам и загрузкам сняты через API Hugging Face 28 июля 2026 года. Строку про железо я специально оставил качественной: чисел про «столько-то гигабайт VRAM» в официальной документации XTTS нет, а те, что гуляют по сайтам-агрегаторам, друг с другом не сходятся. Проверяется это за десять минут на своей карте, и это единственный способ узнать правду про своё железо.
Когда брать Kokoro
Kokoro — правильный выбор, если русский вам не нужен, а нужны скорость, размер и чистая лицензия.
Типичные сценарии: озвучка англоязычных роликов, голосовой ответ в собственном сервисе, тесты интерфейса, генерация датасета для чего-то ещё. Модель в 312 МБ грузится за секунды, спокойно ходит вместе с приложением в контейнер и не требует видеокарты.
Второй аргумент — Apache 2.0. Это лицензия без звёздочек: можно в продукт, можно в платный сервис, можно раздавать вместе со своим кодом. На фоне лицензионной ситуации у XTTS это ключевое отличие, а не мелочь в подвале README.
Третий — модель живая. Веса обновлялись в апреле 2025 года, вокруг неё выросла экосистема портов на ONNX и мобильные рантаймы. Что она умеет и чего нет, подробнее в карточке Kokoro.
Чего ждать не стоит: интонационной игры и эмоций. Это ровный дикторский голос. Для аудиокниги с персонажами он не подойдёт ни на каком языке.
Когда брать XTTS-v2
XTTS-v2 берут ради двух вещей, которых у Kokoro нет в принципе: русского языка и клонирования голоса по короткому сэмплу.
Шесть секунд чистой записи — и модель говорит вашим голосом на любом из 17 языков, включая перенос голоса между языками. Для личного проекта, исследования или прототипа это до сих пор один из немногих локальных вариантов, который не требует ни подписки, ни отправки голоса на чужой сервер. Отдельно это важно, если вы работаете с голосами других людей: биометрия не покидает вашу машину, а значит вопрос согласия и хранения решается локально, а не в чужой юрисдикции.
Практические детали, которые экономят вечер:
- ставьте
coqui-tts, а не архивныйTTS; - сэмпл для клонирования нужен чистый: без музыки, без эха, моно, ровная громкость. Качество клона определяется этими шестью секундами сильнее, чем любыми параметрами генерации;
- длинный текст режьте на предложения и склеивайте. На длинных кусках авторегрессионная модель начинает уплывать: ускоряется, глотает окончания, иногда повторяет фрагмент;
- ударения в русском модель ставит по своей внутренней логике, и штатной ручки «поставь ударение сюда» у неё нет. С омографами вроде «замок» и «мука» это лечится только переписыванием фразы.
Что ещё умеет модель и как её кормить — в карточке Coqui XTTS.
Что не решает ни один
Коммерческий русский. Это главный разрыв. Kokoro не знает русского, а веса XTTS-v2 лежат под Coqui Public Model License, которая разрешает только некоммерческое использование модели и её аудиовыхода. Код форка под MPL-2.0 и в коммерцию годится, а веса — нет, и это разные лицензии на разные вещи. Купить коммерческую лицензию не у кого: Coqui Inc. закрылась в январе 2024 года. Если озвучка идёт в платный продукт, реальные варианты для русского — голоса Piper под MIT (четыре русских голоса: denis, dmitri, irina, ruslan) или коммерческие российские синтезаторы. У Silero голоса хорошие, но лицензия репозитория нестандартная, GitHub помечает её как NOASSERTION — читайте текст сами до того, как встроите. Обзор остальных вариантов лежит в подборке нейросетей для озвучки текста.
Согласие на клонирование. Ни лицензия, ни модель не спрашивают, чей голос вы загрузили. Голос — биометрический персональный признак, и в российском праве обработка биометрии без письменного согласия человека прямо запрещена. Локальность железа от этого не спасает: 152-ФЗ говорит про обработку, а не про то, где стоит сервер.
Эмоции и режиссура. Обе модели читают ровно. Ни крика, ни шёпота, ни смены темпа по смыслу. Финальную выразительность всё равно делают руками: режут паузы, подтягивают тайминг, местами переозвучивают.
Свежесть. Веса XTTS-v2 не менялись с декабря 2023 года. Модель работает, но развития у неё нет и не будет.
Частые вопросы
Заставить Kokoro говорить по-русски вообще можно?
Штатно — нет. Языковой код r в библиотеке отсутствует, русских голосов в наборе нет, а фонемизатор misaki для русского не собран. Теоретический путь — обучить свой G2P и дообучить модель на русском корпусе, но это полноценный ML-проект на недели, а не настройка. Готовых русских весов Kokoro, которыми стоило бы пользоваться, в открытом доступе на конец июля 2026 года нет.
Сколько места займёт XTTS-v2 на диске?
Сами веса — около 2 ГБ: model.pth 1781 МБ, dvae.pth 201 МБ, speakers_xtts.pth 7,4 МБ. Столько же и больше уйдёт на окружение с PyTorch, поэтому под весь стенд разумно заложить 5–6 ГБ свободного места.
Нужна ли видеокарта?
Kokoro нормально работает на процессоре: 82 миллиона параметров — это мало. XTTS-v2 на CPU запускается, но синтез идёт заметно медленнее реального времени, и для потоковой озвучки это уже неудобно. Точные цифры зависят от вашего железа сильнее, чем от любых советов в интернете, так что мерьте на своём.
XTTS-v2 можно взять в проект, если я не беру за него денег?
Некоммерческие сценарии CPML разрешает: личные эксперименты, учёба, исследования. Границу лицензия проводит по коммерческому характеру использования, а не по вашему обороту, поэтому платное приложение, подписка или демо в составе продаваемого сервиса под неё не попадают. При любых сомнениях читайте текст лицензии, а не пересказы.
Что ставить, если нужен именно русский и именно бесплатно?
Для личных задач — XTTS-v2 через coqui-tts. Для чего угодно с деньгами — Piper: он на порядок легче, работает на CPU, включая Raspberry Pi, и лежит под MIT. Качество у Piper ниже, зато к нему нет вопросов ни по лицензии, ни по железу.