1 min voice data can also be used to train a good TTS model! (few shot voice cloning)
尝试 stream infer (#2469)
* 尝试 stream infer * 在 stream_infer 脚本中绘制生成的音频 * stream_infer 增加导出部分。 * stream_infer: 更方便找规律的图 * stream_infer: 在拼接音频时进行相关性搜索,减少拼接带来基频断裂的情况 * stream_infer: 导出 `find_best_audio_offset_fast` * stream_infer: 优化波形显示,方便对比 * stream_v2pro.py 从命令行读取参数 * stream_v2pro.py 减少用于导出的文本长度 * stream_v2pro: 修复由于 spectrogram_torch 输入是 half 导致 spec 溢出最终没有声音的问题 * stream_v2pro: 新增 --lang 参数提示参考文字的语言类型
Z
zzz committed
6375bbe3163a425bbe363d1b4c3538a6ab6422d1
Parent: e00ca92
Committed by GitHub <noreply@github.com>
on 11/28/2025, 1:36:57 PM