优云智算
控制台
立即注册
0.02元/时

voxcpm2.0

VoxCPM2 语音合成服务镜像 基于 VoxCPM2 的实时语音合成(TTS)服务镜像,提供: WebSocket 鉴权接口**(端口 `8765`) WebUI 控制台**(端口 `8080`)

镜像大小
40 GB
当前版本
v1.0
累计部署
0
累计运行
0 h
最近更新
2026-09-16

运行环境

框架版本
-12.8
CUDA版本
12.8
应用
JupyterLab: 8888
自定义开放端口
80808765
支持卡型
3080Ti3090
+3

VoxCPM2 语音合成服务镜像

简介

基于 VoxCPM2 的实时语音合成(TTS)服务镜像,提供:

  • WebSocket 鉴权接口(端口 8765):供业务 / App 调用
  • WebUI 控制台(端口 8080):网页可视化操作与试听

已预装 Python 3.11、CUDA 12.8(cu128)flash-attn 及全部依赖,实例启动后服务自动运行,无需手动执行脚本。

运行环境

项目版本
GPU 驱动 / CUDA12.8
Python3.11
深度学习框架PyTorch(cu128)+ flash-attn
模型VoxCPM2(默认路径 /models/VoxCPM2

使用方式

  1. 用本镜像创建 GPU 实例(建议选择与 12.8 驱动匹配的机型)。
  2. 等待实例启动,服务会自动拉起,无需登录执行命令。
  3. 访问入口(请将 <实例IP> 替换为控制台显示的实例 IP):
    • WebSocket:ws://<实例IP>:8765
    • WebUI:http://<实例IP>:8080

端口

  • 8765:WebSocket 鉴权接口
  • 8080:WebUI 控制台

需在控制台「防火墙 / 自定义端口」中放行 87658080

WebSocket 接口说明

协议概述

  • 连接地址:ws://<实例IP>:8765
  • 帧类型:文本帧(JSON)+ 二进制帧(float32 PCM 音频)
  • 全双工:客户端指令与服务端消息并行,同一连接同时只有一个活跃合成任务(新 synthesize 会自动取消旧的)
  • 音频格式:float32 LE、单声道、采样率 48000 Hz(以 ready / start 返回的 sample_rate 为准);App 端在注入通话前需自行重采样到 16000 Hz

连接与鉴权流程

  1. 连接建立后,服务端先下发 ready(含 auth_requiredauth_enabled)。
  2. auth_required=true,客户端须在 AUTH_TIMEOUT(默认 5 秒)内发送 auth 帧,否则连接被关闭(策略码 1008)。
  3. 校验通过后服务端下发 auth_ok,随后即可发送业务指令。

鉴权帧:

{"op":"auth","token":"<AUTH_TOKEN>"}

客户端 → 服务端指令

op说明关键字段
ping心跳
test_connection连通性测试id(可选)
synthesize文本合成(流式返回音频)text(必填,≤300 字)、voice_id(可选,空=零样本)、id(可选)
add_voice上传音频注册音色voice_id(必填)、modeprompt_textaudio_b64(wav base64,必填)
generate_voice按文字描述生成音色voice_id(必填)、description(必填,≤500 字)、scriptmode
design_voice按描述生成多个候选音色description(必填)、scriptcount(默认 3)、seed
clone_preview创建克隆预览(不正式注册)modeprompt_textaudio_b64(必填)
preview_synthesize用预览音色合成样音preview_id(必填)、text(必填,≤300 字)
register_preview将预览音色正式注册preview_id(必填)、voice_id(必填)
preprocess_audio参考音频降噪/净化audio_b64(必填)、levellight/heavy)、name
list_voices列出已注册音色
cancel取消当前合成id(可选)
  • id 为客户端自定 UUID,服务端在响应中原样带回,用于关联请求与响应。
  • mode 取值:reference(可控克隆,仅参考音频)、prompt(延续式克隆,需 prompt_text 逐字转写)、hifi(极致克隆,参考音频 + 转写,相似度最高)。prompt / hifi 模式必须提供 prompt_text
  • level 取值:light(轻量谱减法)、heavy(DeepFilterNet3 深度降噪)。

服务端 → 客户端消息

op说明关键字段
ready连接建立后首发sample_ratemodelauth_requiredauth_enabled
auth_ok鉴权通过
auth_failed鉴权失败/超时message
connection_oktest_connection 响应idmodelsample_rateauth_enabledauth_required
start流式合成开始idsample_rate
(二进制帧)音频数据float32 LE 单声道 PCM,每个 chunk 一帧
end流式合成结束idsamples(总采样点数)
voice_added音色注册/预览注册成功idvoice_id
voice_listlist_voices 响应idvoices(数组,含 voice_id/mode/prompt_text
voice_candidatesdesign_voice 响应idcandidates(数组,含 candidate_id/wav_b64/duration
clone_previewed预览创建成功idpreview_id
preview_audio预览样音idwav_b64duration
audio_preprocessed降噪处理结果idwav_b64durationnamelevel
cancelled取消确认id
error错误id(可选)、message
pongping 响应

调用示例

文本合成(零样本):

{"op":"synthesize","id":"a1b2c3d4","text":"你好,欢迎使用 VoxCPM2。","voice_id":""}

注册音色(可控克隆):

{"op":"add_voice","id":"e5f6g7h8","voice_id":"my_voice","mode":"reference","audio_b64":"<wav base64>"}

列出音色:

{"op":"list_voices","id":"i9j0k1l2"}

完整合成时序:

client -> synthesize
server -> start
server -> <二进制音频帧> × N
server -> end

鉴权信息(已脱敏)

  • WebUI 默认登录账号:admin,默认密码:123456(建议首次登录后修改)
  • 修改 WebUI 账号/密码(在实例内执行): bash <项目目录>/set_webui_auth.sh <新用户名> <新密码>
  • 鉴权 Token 已固化在镜像中,首次使用请在实例内查看: cat <项目目录>/.voxcpm_token

请勿在公开描述中填写真实 Token 或实例 IP。

开机自启动

  • 自启动脚本:/start.d/voxcpm-server.sh
  • 服务日志:/var/log/voxcpm-server.log
  • 查看日志:tail -f /var/log/voxcpm-server.log

费用提示

  • 平台按秒计费、关机不收费;依赖已固化进镜像,用完关机即可,避免重复安装产生的费用。
  • /models 为独立数据盘 / 公共模型库,新建实例时请挂载同名存储,模型不会丢失。

注意事项

  • 敏感信息(IP、Token、WebUI 密码)请勿写入公开镜像描述或封面截图。
0 个镜像 · 被使用 0
版本日志
v1.0最新
2026-09-15
VoxCPM2 语音合成服务镜像基于 VoxCPM2 的实时语音合成(TTS)服务镜像,提供:WebSocket 鉴权接口**(端口 `8765`)WebUI 控制台**(端口 `8080`)
评分
0.0
暂无评分
我的评分
未评分
voxcpm2.0一键部署 | 优云智算