Fish-Speech 1.5实战教程:用默认参数生成第一段语音的完整步骤
1. 准备工作:访问WebUI界面
首先确保你已经完成了Fish-Speech 1.5的部署。如果你使用的是预装镜像,只需在浏览器地址栏输入:
http://你的服务器IP:7860等待3-8秒页面加载完成后,你会看到一个简洁的中文界面。首次使用时,建议检查右上角是否显示"实时规范化文本同步完成"的绿色对勾标识,这是确保文本处理正常的关键。
2. 界面功能区域简介
Fish-Speech 1.5的WebUI分为三个主要区域:
2.1 文本输入区
位于界面顶部的大文本框,这是你输入想要转换成语音的文字内容的地方。支持中文、英文及混合输入,建议首次尝试时输入50-100字的简短内容。
2.2 音色选择区
中部左侧的下拉菜单和上传按钮,用于选择或定制语音风格。首次使用我们保持默认设置,即使用内置的"zhihuizhe"(智慧者)音色。
2.3 参数控制区
中部右侧的滑块控件,用于调整语音生成的细节参数。本教程将全部使用默认值:
- 温度(Temperature):0.7
- Top-P:0.7
- 重复惩罚(Repetition Penalty):1.2
- 分块长度(Chunk Length):200
3. 生成第一段语音
3.1 输入示例文本
在文本输入框中,输入以下测试内容(或你自己的文字):
欢迎使用Fish-Speech 1.5文本转语音系统。这是一个基于DualAR架构的创新语音合成模型,能够生成自然流畅的语音输出。让我们开始这段奇妙的语音合成之旅吧!3.2 确认文本规范化
输入完成后,观察界面右上角。约1-2秒后会出现绿色对勾图标,表示"实时规范化文本同步完成"。这是重要的一步,确保标点符号和特殊字符被正确解析。
3.3 启动语音生成
点击右下角的蓝色"🎧 生成"按钮。界面会显示进度条,通常在3-6秒内完成(取决于服务器配置)。
4. 播放与保存结果
4.1 播放生成语音
生成完成后,页面会自动出现音频播放器组件。点击播放按钮即可收听你的第一段AI生成语音。注意聆听以下方面:
- 语音流畅度
- 语调自然度
- 停顿合理性
- 发音准确性
4.2 下载音频文件
点击播放器下方的"⬇ 下载"按钮,可以将生成的语音保存为WAV格式文件。建议命名为"first_try.wav"以便后续参考。
5. 常见问题排查
如果首次尝试遇到问题,请检查以下方面:
5.1 页面无法加载
- 确认服务器IP地址正确
- 检查防火墙是否放行7860端口(可运行
ufw allow 7860)
5.2 生成失败或无声音
- 查看浏览器控制台是否有错误(按F12)
- 检查服务器日志:
tail -n 20 /var/log/fish-speech-webui.err.log
5.3 语音质量不佳
- 确保文本规范化已完成(绿色对勾)
- 尝试缩短文本长度(100字以内)
- 重启服务:
supervisorctl restart fish-speech-webui
6. 总结与下一步
恭喜!你已经成功完成了:
- 访问Fish-Speech 1.5的WebUI界面
- 使用默认参数生成第一段语音
- 基本质量评估与问题排查
建议下一步尝试:
- 更换不同内置音色(如"xiaoyu")生成同一段文本,比较差异
- 微调温度参数(0.6-0.8范围),感受语音风格变化
- 输入更长的段落(200-300字),测试模型处理能力
获取更多AI镜像
想探索更多AI镜像和应用场景?访问 CSDN星图镜像广场,提供丰富的预置镜像,覆盖大模型推理、图像生成、视频生成、模型微调等多个领域,支持一键部署。