Supertonic 是由 Supertone Inc. 开源的超高速、端侧(On-Device)、多语言文本转语音(TTS)系统
Supertonic 是由 Supertone Inc. 开源的超高速、端侧(On-Device)、多语言文本转语音(TTS)系统。它基于 ONNX Runtime 运行,完全本地推理,无需云端、无需 API 调用,注重隐私与低延迟,模型仅约 99M 参数,却能输出高质量 44.1kHz 音频,并支持 31 种语言。
- 官方仓库:https://github.com/supertone-inc/supertonic
- Hugging Face 模型:https://huggingface.co/Supertone/supertonic-3
- 在线 Demo:https://huggingface.co/spaces/Supertone/supertonic-3
- 音频样例:https://supertonic3.github.io/
- Voice Builder(声音克隆):https://supertonic.supertone.ai/voice-builder
- Python 文档:https://supertone-inc.github.io/supertonic-py/
- 协议:代码 MIT,模型 OpenRAIL-M
重要提示(2026 年 7 月 23 日):官方宣布本仓库将被归档,开源 Supertonic 模型不再有进一步开发或官方支持。现有代码与模型仍可继续使用,商业托管服务请转向 Supertone Play / API。
1. 核心特性
- 极速推理:消费级硬件上可达实时合成的数十倍甚至上百倍(如 M4 Pro 上最高约 167× 实时),整页网页转语音可在 1 秒内完成。
- 31 语言多语种:直接从文本合成,支持 lang=”na” 语言无关处理(无需指定语言)。
- 超轻量模型:约 99M 参数,下载小、启动快、内存占用低,远小于 0.7B–2B 级开源 TTS。
- 真正端侧:桌面、浏览器(WebGPU)、手机、树莓派等均可运行,零网络依赖,无 GPU 要求。
- 高质量音频:直接输出 44.1kHz 16-bit WAV。
- 表达标签:内联标签(如
、 、 等 10 种)增加自然语气。 - 多运行时支持:Python、Node.js、Browser、Java、C++、C#、Go、Swift、iOS、Rust、Flutter 完整示例。
支持语言(31 种): ar, bg, hr, cs, da, nl, en, et, fi, fr, de, el, hi, hu, id, it, ja, ko, lv, lt, pl, pt, ro, ru, sk, sl, es, sv, tr, uk, vi。
2. 快速开始(推荐 Python SDK)
最简单方式,无需手动下载模型:
1 | pip install supertonic |
1 | from supertonic import TTS |
本地 HTTP 服务(兼容 OpenAI 接口,方便对接 Agent / 插件):
1 | pip install 'supertonic[serve]' |
启动后可使用:
- 原生:POST /v1/tts
- OpenAI 兼容:POST /v1/audio/speech
- 文档:http://127.0.0.1:7788/docs
3. 从源码运行多语言示例
1 | git clone https://github.com/supertone-inc/supertonic.git |
Python 示例
1 | cd py |
生成 outputs/output.wav。
其他平台示例
| 平台 | 命令示例 |
|---|---|
| Node.js | cd nodejs && npm install && npm start |
| Browser | cd web && npm install && npm run dev(支持 WebGPU) |
| Java | cd java && mvn clean install && mvn exec:java |
| C++ | cd cpp && mkdir build && cd build && cmake .. && cmake –build . –config Release && ./example_onnx |
| C# | cd csharp && dotnet restore && dotnet run |
| Go | cd go && go mod download && go run example_onnx.go helper.go(macOS 需 brew install onnxruntime) |
| Swift | cd swift && swift build -c release && .build/release/example_onnx |
| Rust | cd rust && cargo build –release && ./target/release/example_onnx |
| iOS | cd ios/ExampleiOSApp && xcodegen generate && open ExampleiOSApp.xcodeproj |
| Flutter | 见 flutter/ 目录 |
4. 音色与声音克隆
- 预设音色:M1–M5(男声)、F1–F5(女声)等,通过 get_voice_style(voice_name=”M1”) 获取。
- 自定义音色:使用官方 Voice Builder,上传短参考音频,生成可部署的 JSON 文件(支持 Supertonic 2 与 3),下载后即可在本地使用。
- 开源仓库本身聚焦固定音色本地推理,不包含官方零样本克隆流水线;托管零样本克隆请使用 Supertone Play / API。
5. 性能与精度亮点
- 模型体积:约 99M 参数,显著小于多数开源大模型 TTS。
- 速度:CPU 即可高效运行,浏览器端也可用 WebGPU 加速。
- 精度:在 Minimax-MLS-test 等基准上,多数语言 WER/CER 与更大型模型(如 VoxCPM2、Qwen3-TTS)处于同一竞争区间,同时保持端侧优势。
- Supertonic 3 改进:语言从 5 种扩展到 31 种,减少重复/跳过错误,提升说话人相似度,并保持与 v2 兼容的公开 ONNX 接口。
6. 使用建议与注意事项
- 首次运行:Python SDK 会自动下载模型,需网络;后续完全离线。
- Git LFS:手动克隆模型时务必安装并初始化 Git LFS。
- 质量与速度权衡:total_steps 越高音质越好但越慢,推荐 8 作为平衡点。
- 语言未知时:使用 lang=”na”。
- 表达力:可在文本中插入
、 、 等标签增加自然感。 - 归档提醒:开源仓库已宣布归档,长期维护请关注官方商业产品或社区 fork。
- 边缘设备:树莓派等低资源设备也可运行,适合离线场景。
7. 相关资源
- 模型下载:https://huggingface.co/Supertone/supertonic-3
- Python 包文档:https://supertone-inc.github.io/supertonic-py/
- Voice Builder:https://supertonic.supertone.ai/voice-builder
- 商业 Play / API:官方网站相关入口
- 旧版 v2 分支:release/supertonic-2
8. 总结与快速上手路径
Supertonic 是目前最轻量、最易部署的高质量开源多语言 TTS 之一,特别适合:
- 需要完全离线 / 隐私保护的应用
- 浏览器端实时朗读
- 移动端与边缘设备
- 多语言内容快速生成
推荐上手步骤:
- pip install supertonic
- 运行上面的 Python 示例生成第一段语音
- 需要服务化时启动 supertonic serve
- 想用自定义声音时去 Voice Builder 生成 JSON
- 需要其他语言/平台时参考仓库对应目录示例
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 极客的赛博空间 | 专注 AI 与技术分享!
评论



