Depository of News

Синтетическая речь разборчивее живой. Или нет? Разбираем Qwen-Audio-3.0-TTS и что происходит в метриках

newsdepo.com · world

Привет, Хабр! Меня зовут Саша, я пишу курс «Аудиоанализ, распознавание и генерация речи» в Яндекс Практикуме, работаю ML-инженером в аудиодомене и вообще послеживаю за индустрией. Пару месяцев назад вышла статья по генерации речи от Alibaba — Qwen-Audio-3.0-TTS. И вот что примечательно: в таблице результатов на SEED-TTS-Eval есть строка Human, и это не какая-то модель-гуманоид, а настоящая живая человеческая речь, прогнанная через тот же бенчмарк, что и все системы в сравнении. Так сказать, контрольная точка отсчёта. Так вот, у человека там ошибка 1,26 , а у модели, про которую эта статья, — 0,84 . На этой строчке я застрял и сел делать разбор, потому что за ней, возможно, стоит проблема поинтереснее самой модели. Вечная проблема метрик. Под катом попробуем разобраться, что у них там происходит. Читать далее

Read full article →