Итак, в этот раз я дописывал voicer, который дропнул на хабр и опенсорс, в итоге перевел полностью с помощью локальных моделей видос, клонируя оригинальный голос, вышло забавно с оригинальным акцентным голосом)
https://www.youtube.com/watch?v=hVoukH-mdgk
Огромная просьба отписаться как вам, так как я хочу сделать автоматический пайплайн публикации переводов и расписать подробный гайд на хабре + выложить код в открытый доступ, важно понять, где я могу еще потюнить алгоритмы) голос – клон оригинального спикера, вариант с акцентом оказался лучше, чем просто сухой голос, как будто смотришь видосы от скаенга