Inflect-Nano: компактная модель TTS для синтеза речи
🛠 Вы когда-нибудь задумывались, насколько малым может быть нейросетевая модель для синтеза речи? Представляем Inflect-Nano — один из самых маленьких TTS-моделей с параметрами всего 4.63M. Несмотря на компактный размер, модель показывает удивительные результаты и может работать даже на самых скромных устройствах. Она поддерживает английский язык, имеет один мужской голос и работает локально с простым PyTorch-скриптом. Для сравнения, Inflect-Nano почти в 17 раз меньше Kokoro и в 1000 раз меньше Fish Audio S2 Pro. Эта модель открывает новые горизонты для локальных голосовых ассистентов и встроенных устройств. Более подробную информацию можно найти на Hugging Face.
Источник:
www.reddit.com