深圳大学研究生,做 声音克隆与 TTS 语音合成大模型。 关心一件事:如何用尽量少的参考音频,合成出音色像、情感对、韵律自然的语音。
我的研究从 零样本音色克隆 起步,逐步走向 情感与韵律可控 的语音生成。写代码守两条线:参考实现以纯 NumPy 为核心,import 时不拉深度学习框架,无 GPU、无网络也能跑通与单测;需要真正训练时,再按需接上可选的 PyTorch 后端。
| 项目 | 方向 | 关键词 |
|---|---|---|
| voxflow | 零样本声音克隆 TTS 工具包 | 说话人编码器 · 扩散 / 流匹配声学模型 · 声码器 · 中英双语 |
| prosodia | 可控语音合成大模型框架 | 情感 / 风格提示 · 韵律控制 · 流式推理 |
- 可复现优先 —— 固定随机种子、离线数据、CI 全绿。
- 离线优先 —— 默认不联网、不下权重也能跑核心逻辑与测试。
- 由小见大 —— 先用纯 NumPy 参考实现把算法讲清楚,再接框架做真实训练。
Shenzhen University · 声音克隆 / TTS · reproducible & offline-first