优云智算
控制台
立即注册
1元/时

VoxCPM2声音克隆

``` VoxCPM2 语音克隆配音服务:部署即用,自动启动 OpenAI 兼容 TTS API(8000 端口),支持音色克隆、极致克隆、风格指令。开箱即用,无需任何配置。 ```

镜像大小
50 GB
当前版本
v1.0
累计部署
0
累计运行
0 h
最近更新
2026-08-21

运行环境

框架版本
PyTorch-2.13.0
CUDA版本
13.2
应用
JupyterLab: 8888
自定义开放端口
88088000
支持卡型
RTX40系48G RTX40系
+2

📌 镜像说明

本镜像内置 VoxCPM2(面壁智能多语言语音合成模型)OpenAI 兼容 TTS 服务,部署完成后自动启动,开箱即用。适用于:

  • 🎬 短视频口播配音(AI 视频创作)
  • 📚 有声书 / 故事配音
  • 🎙️ 音色克隆(上传 5~30 秒参考音频即可克隆)
  • 🌍 多语言 / 方言配音(粤语、河南话等)

⚙️ 预装内容

项目说明
语音模型VoxCPM2(多语言、音色克隆、极致克隆)
API 服务OpenAI 兼容接口 POST /v1/audio/speech,端口 8000
自启动已配置开机自启,部署后无需手动操作
健康检查GET /health
输出格式16-bit PCM WAV(48kHz)

🚀 部署后使用

  1. 实例就绪后(约 1~2 分钟),服务自动运行
  2. 在实例详情页「应用/端口」找到 8000 端口访问地址(格式 https://8000-xxx.pod.compshare.cn
  3. 用任意 OpenAI 兼容客户端调用:
POST {你的地址}/v1/audio/speech
Authorization: Bearer e71d3004b37fe6086ce1fcf921e94cbf95206c67058bd442
Content-Type: application/json

{
  "model": "openbmb/VoxCPM2",
  "input": "大家好,今天给大家讲个故事。",
  "voice": "default",
  "response_format": "wav",
  "reference_audio": "<base64 或 data URI,可选>",
  "instruction": "语速稍快,语气亲切(可选)"
}
  1. 返回 WAV 音频字节,直接保存播放

🎤 音色克隆

  • 可控克隆:上传 5~30 秒清晰参考音频(WAV/MP3),配合风格指令调整语气
  • 极致克隆:附带参考音频文本,最高精度还原音色、节奏、呼吸感
  • 参考音频格式:data URI 或 base64(data:audio/wav;base64,...

💰 计费说明

  • 镜像费:X 元/小时(见页面定价)
  • GPU 租机费:按所选机型计费(RTX 4090 约 2~4 元/小时,建议 16GB 以上显存)
  • 关机/销毁即停止计费

⚠️ 注意事项

  • 实例关机后服务停止,开机后自动恢复(已配置自启动)
  • 单实例 GPU 同一时刻处理一个推理任务,多用户并发建议多开实例
  • 首次请求含模型加载,约 1~2 分钟;后续请求约 5 秒
  • 请勿在镜像内存储个人敏感数据

🆘 支持

  • 部署问题、调用问题请查看镜像评论区留言
  • 详细配置说明见发布者提供的《云端配音部署与使用手册》
0 个镜像 · 被使用 0
版本日志
v1.0最新
08-20
```VoxCPM2 语音克隆配音服务:部署即用,自动启动 OpenAI 兼容 TTS API(8000 端口),支持音色克隆、极致克隆、风格指令。开箱即用,无需任何配置。```
评分
0.0
暂无评分
我的评分
未评分
VoxCPM2声音克隆一键部署 | 优云智算