本地推理 · 文本不出设备 · 授权使用

Lovo 语音处理工具包 · 全离线 TTS/ASR

基于 Qwen3-TTS / Qwen3-ASR 与 Rust 打造的一站式语音方案:命令行 / HTTP API / 桌面 UI 三形态任意接入。语音合成、声音克隆、音色设计、语音识别全程本地运行——医疗文档、金融材料、未公开内容,一个字节都不上云。

Lovo 桌面界面 —— 声音角色 / 语音合成 / 语音识别
Lovo · 桌面端:声音角色 / 语音合成 / 语音识别 / 许可证管理,本地推理一键操作。
离线工作

为什么选择离线语音合成

在线 TTS 把文本发到云端才能开口;Lovo 反过来——模型住在你的机器上,随叫随到。

隐私与数据安全

在线 TTS 需要把文本发到云端,医疗、金融、企业内部文档、未公开内容就不太适合上传。离线 TTS 全程本地推理,文本不出设备,更适合敏感场景。

ZERO CLOUD UPLOAD

成本可控

云端 TTS 多按字符、时长或调用次数计费,批量配音、长期高频使用时成本会累积。离线 TTS 模型一次性部署后,后续使用基本没有持续调用费。

ONE-TIME DEPLOY

可集成、可自动化

提供 CLI、HTTP API、桌面 UI,方便接入视频配音、批量生成、工作流自动化。比如批量生成旁白、为 ComfyUI 工作流提供音频输出,或做成内部配音服务。

CLI · API · GUI
在线 TTS 服务Lovo(离线)
数据流向文本上传云端,依赖供应商合规文本与音频全程本地,不出设备
计费方式按字符 / 时长 / 调用次数持续计费一次部署,无限次调用零费用
集成方式网络 SDK,受网络与限流约束CLI / 本地 HTTP API / 桌面 UI,进程内零延迟
断网可用依赖网络连通性完全可用,内网/隔离环境同样部署
Features

主要功能特性

一个工具箱覆盖从"念稿子"到"克隆你的声音"再到"开放成服务"的完整链路。

🎙️

声音克隆

一段参考音频提取声纹,驱动任意新文本;支持 ICL 参考文本与 x-vector 两种模式。

clone --reference
🎭

9 个预设音色

CustomVoice 内置男女声与中英韩日风格:vivian、ryan、serena、sohee……一行参数切换。

--speaker vivian
✨

音色设计

VoiceDesign 模型用一句话文字描述,即生成全新的目标音色,无需任何参考音频;也可用 CLI 的 design 子命令驱动。

design --instruct
🌐

多语言

中文、英文多语言输出,并提供日韩特色说话人(sohee / ono_anna),适配出海内容与多语种旁白需求。

--language
📄

长文本自动分段

超过 max-chars 的文本智能切分逐段合成再拼接,小说级长文、整章旁白直接喂入。

--max-chars 200
⚡

设备自动选择

单一二进制,运行时优先 CUDA、不可用自动回退 CPU,无需区分构建版本。

CUDA → CPU
🔌

OpenAI 兼容 API

POST /v1/audio/speech 请求体与官方一致,现有集成改个 base_url 即可指向本地。

:8000/v1/audio/speech
🎛️

采样与输出可控

贪心 / temperature 采样调节,WAV 输出;API 支持 8–96 kHz 采样率重采样。

--greedy / --temperature
🎧

语音识别 (ASR)

Qwen3-ASR 将音频转写为文本,自动检测语言,也可强制指定语言与自定义最大 token。

asr --audio
🖥️

轻量部署

Rust 单二进制,无需安装 Python 环境;最低 8GB 显存 NVIDIA 显卡(CUDA)即可流畅运行,CPU 模式同样支持。

8GB VRAM · CPU
Product Video

18 秒看懂 Lovo

产品速览:本地推理、声音克隆、音色设计与桌面端一键出声。

时长 18 秒 · 含背景音乐 · 各项能力详见上方版块介绍

AI Integration

给 AI 助手的语音技能包

Lovo-skill 把 voice-cli 封装成技能包:在 Doubao 等 AI 助手的对话里,一句话就能触发语音合成、声音克隆、音色设计与语音识别,文本全程不出设备。

lovo-skill · 能力映射
voice-cli(AI 助手可调用)
  ├─ synth   语音合成   --model-path <TTS> --text ... --speaker vivian
  ├─ clone   声音克隆   --reference ref.wav --text ... [--ref-text ref.txt]
  ├─ design  音色设计   --instruct "年轻女性,甜美温柔" --text ...
  └─ asr     语音识别   --audio input.wav [--language chinese]

全局:--model-path 必填;--max-chars 分段(默认 200)
许可:启动先校验 license.dat,未授权不执行
输出:合成/克隆/设计 WAV(24kHz),识别 TXT

用法示意 —— 对 AI 助手说"用 vivian 的声音朗读这段文案",助手即调用 synth,返回 output.wav。

环境约定 · %LOVO_HOME%
bin/       voice-cli.exe · license.dat
models/    Qwen3-TTS-12Hz-1.7B-{Base,CustomVoice,VoiceDesign}
           Qwen3-ASR-<size>(含 tokenizer.json)
voices/    <voice-name>/voice-ref.wav + voice-ref.txt

9 个预设音色(CustomVoice)—— vivian、ryan、dylan、aiden、serena、eric、uncle_fu、sohee(韩)、ono_anna(日)。

把语音能力装进自己的机器

隐私不出设备,成本一次到位,集成随你所欲。

回到顶部,立即开始 →