
✨ TTS,让文字开口说话|Qwen3‑TTS 大众版落地页 🚀
Qwen3‑TTS 将文字瞬间变成自然语音,为您的内容注入生命!感受科技与温度的完美融合。
Qwen3-TTS 适用范围广泛,只需粘贴文字,即可快速生成优质语音:
“告别文字的冰冷,用声音温暖世界。”
我们提供在线 Demo,您可以选择不同的音色和方言,调整语速、音量和音高,即刻体验并下载 MP3/WAV 格式的音频。
您可以自定义语速、音量、音高和比特率,同时系统会尊重标点符号,确保生成自然停顿的语音。
Qwen3-TTS 提供强大且易于集成的 API 接口,助您的应用快速接入语音能力。
https://dashscope.aliyuncs.com/compatible-mode/v1/services/aigc/multimodal-conversation
wss://dashscope-intl.aliyuncs.com/api-ws/v1/realtime?model=qwen3-tts-flash-realtime
format='wav'sample_rate=22050bitrate='128k'presence_penalty=0.6(可用于减少重复性)
import dashscope
dashscope.api_key = 'your_api_key'
response = dashscope.Audio.speech_synthesizer(
model='qwen3-tts-flash-realtime',
text='你好,这是 Qwen3-TTS 测试。',
voice='中文女声',
language='zh'
)
print(response.output_audio)
💡 北京区使用 sk-,国际区使用 sk-intl-。请在 dashscope.aliyuncs.com 选择对应区域生成与重置 Key。
💡 建议使用 WebSocket 并添加重连机制;本地部署可选用 flash-realtime 版本。
💡 长文本请分段(每段小于 500 字符);活用标点符号控制节奏;选择匹配内容语气的音色;可尝试调整 presence_penalty 参数。
💡 官方暂不内置。您可利用开源工具如 So-VITS-SVC / XTTS 训练模型后,路由 Qwen3 输出实现音色克隆。
💡 确保已安装 pip install transformers torch;使用 from transformers import QwenTTSForConditionalGeneration;GPU 需 CUDA 11+;CPU 模式请添加 --device cpu;内存不足可尝试 FP8 量化。
💡 每月约 50 万字符免费额度(约 400 分钟);批量调用可分批进行。亦可选择开源本地部署,实现完全免费。
💡 请明确指定 language 与 dialect 参数;建议先用短句测试。英文与中文无缝切换效果更佳。俄语等语种建议稍慢速。
💡 请正确设置 format、sample_rate 和 bitrate 参数。在保存前检查文本是否有乱码。
💡 更新 dashscope 和 qwen-tts 库。必要时可添加 torch.no_grad() 防止内存泄漏。
💡 尝试刷新页面或使用隐身模式浏览器。必要时可在本地克隆 Hugging Face Space。同时检查设备权限是否允许播放音频。
Transformer + MoE (Mixture of Experts) 架构,构建统一的多模态框架。
分词/编码 → MoE 韵律预测 → VQ-VAE → 梅尔谱图生成 → HiFi-GAN 声码器(输出 22kHz 音频)。
每月约 50 万字符免费额度(约 400 分钟)。提供低成本模型供选择。本地开源版本完全免费。
采用 Apache 2.0 许可证。支持本地运行,有效保护您的数据隐私。请确保用于音色克隆的数据已获得授权。

开源语音 AI 组件,快速搭建语音体验


让配音更具人情味,精准适配32种语言


一站式 AI 音乐创作画布


您专属的AI音效师,打造完美声效


为创作者、品牌和工作室打造的精准语音同步AI配音工具


从对话到成曲、短MV,一键发布


把相机变成你的随身乐器


在浏览器中使用AI学习任何钢琴曲!
