Supertonic 是由 Supertone Inc. 开源的超高速、端侧(On-Device)、多语言文本转语音(TTS)系统。它基于 ONNX Runtime 运行,完全本地推理,无需云端、无需 API 调用,注重隐私与低延迟,模型仅约 99M 参数,却能输出高质量 44.1kHz 音频,并支持 31 种语言

重要提示(2026 年 7 月 23 日):官方宣布本仓库将被归档,开源 Supertonic 模型不再有进一步开发或官方支持。现有代码与模型仍可继续使用,商业托管服务请转向 Supertone Play / API。


1. 核心特性

  • 极速推理:消费级硬件上可达实时合成的数十倍甚至上百倍(如 M4 Pro 上最高约 167× 实时),整页网页转语音可在 1 秒内完成。
  • 31 语言多语种:直接从文本合成,支持 lang=”na” 语言无关处理(无需指定语言)。
  • 超轻量模型:约 99M 参数,下载小、启动快、内存占用低,远小于 0.7B–2B 级开源 TTS。
  • 真正端侧:桌面、浏览器(WebGPU)、手机、树莓派等均可运行,零网络依赖,无 GPU 要求。
  • 高质量音频:直接输出 44.1kHz 16-bit WAV。
  • 表达标签:内联标签(如 等 10 种)增加自然语气。
  • 多运行时支持:Python、Node.js、Browser、Java、C++、C#、Go、Swift、iOS、Rust、Flutter 完整示例。

支持语言(31 种): ar, bg, hr, cs, da, nl, en, et, fi, fr, de, el, hi, hu, id, it, ja, ko, lv, lt, pl, pt, ro, ru, sk, sl, es, sv, tr, uk, vi。


2. 快速开始(推荐 Python SDK)

最简单方式,无需手动下载模型:

1
pip install supertonic
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
from supertonic import TTS

# 首次运行会自动从 Hugging Face 下载模型
tts = TTS(auto_download=True)

style = tts.get_voice_style(voice_name="M1") # 可选 M1–M5, F1–F5 等

text = "Supertonic is a lightning fast, on-device TTS system."

wav, duration = tts.synthesize(
text=text,
lang="en", # 语言代码,或 "na" 自动处理
voice_style=style,
total_steps=8, # 质量:5(低)~12(高),默认 8
speed=1.05, # 语速:0.7(慢)~2.0(快)
)

tts.save_audio(wav, "output.wav")
print(f"Generated {duration[0]:.2f}s of audio")

本地 HTTP 服务(兼容 OpenAI 接口,方便对接 Agent / 插件):

1
2
pip install 'supertonic[serve]'
supertonic serve --host 127.0.0.1 --port 7788

启动后可使用:


3. 从源码运行多语言示例

1
2
3
4
5
6
git clone https://github.com/supertone-inc/supertonic.git
cd supertonic

# 下载模型与音色(需 Git LFS)
git lfs install
git clone https://huggingface.co/Supertone/supertonic-3 assets

Python 示例

1
2
3
cd py
uv sync # 或 pip 安装依赖
uv run example_onnx.py

生成 outputs/output.wav。

其他平台示例

平台 命令示例
Node.js cd nodejs && npm install && npm start
Browser cd web && npm install && npm run dev(支持 WebGPU)
Java cd java && mvn clean install && mvn exec:java
C++ cd cpp && mkdir build && cd build && cmake .. && cmake –build . –config Release && ./example_onnx
C# cd csharp && dotnet restore && dotnet run
Go cd go && go mod download && go run example_onnx.go helper.go(macOS 需 brew install onnxruntime)
Swift cd swift && swift build -c release && .build/release/example_onnx
Rust cd rust && cargo build –release && ./target/release/example_onnx
iOS cd ios/ExampleiOSApp && xcodegen generate && open ExampleiOSApp.xcodeproj
Flutter 见 flutter/ 目录

4. 音色与声音克隆

  • 预设音色:M1–M5(男声)、F1–F5(女声)等,通过 get_voice_style(voice_name=”M1”) 获取。
  • 自定义音色:使用官方 Voice Builder,上传短参考音频,生成可部署的 JSON 文件(支持 Supertonic 2 与 3),下载后即可在本地使用。
  • 开源仓库本身聚焦固定音色本地推理,不包含官方零样本克隆流水线;托管零样本克隆请使用 Supertone Play / API。

5. 性能与精度亮点

  • 模型体积:约 99M 参数,显著小于多数开源大模型 TTS。
  • 速度:CPU 即可高效运行,浏览器端也可用 WebGPU 加速。
  • 精度:在 Minimax-MLS-test 等基准上,多数语言 WER/CER 与更大型模型(如 VoxCPM2、Qwen3-TTS)处于同一竞争区间,同时保持端侧优势。
  • Supertonic 3 改进:语言从 5 种扩展到 31 种,减少重复/跳过错误,提升说话人相似度,并保持与 v2 兼容的公开 ONNX 接口。

6. 使用建议与注意事项

  1. 首次运行:Python SDK 会自动下载模型,需网络;后续完全离线。
  2. Git LFS:手动克隆模型时务必安装并初始化 Git LFS。
  3. 质量与速度权衡:total_steps 越高音质越好但越慢,推荐 8 作为平衡点。
  4. 语言未知时:使用 lang=”na”。
  5. 表达力:可在文本中插入 等标签增加自然感。
  6. 归档提醒:开源仓库已宣布归档,长期维护请关注官方商业产品或社区 fork。
  7. 边缘设备:树莓派等低资源设备也可运行,适合离线场景。

7. 相关资源


8. 总结与快速上手路径

Supertonic 是目前最轻量、最易部署的高质量开源多语言 TTS 之一,特别适合:

  • 需要完全离线 / 隐私保护的应用
  • 浏览器端实时朗读
  • 移动端与边缘设备
  • 多语言内容快速生成

推荐上手步骤

  1. pip install supertonic
  2. 运行上面的 Python 示例生成第一段语音
  3. 需要服务化时启动 supertonic serve
  4. 想用自定义声音时去 Voice Builder 生成 JSON
  5. 需要其他语言/平台时参考仓库对应目录示例