优云智算
控制台
立即注册
0.1元/时

有声书生成

通过OCR识别文字,然后TTS生成有声书

镜像大小
70 GB
当前版本
v1.0
累计部署
7
累计运行
15 h
最近更新
2026-07-23

运行环境

框架版本
PyTorch-2.10.0
CUDA版本
13.0
应用
JupyterLab: 8888
支持卡型
RTX40系RTX50系

有声书生成

结合OCR与Qwen3-TTS的有声书生成项目

配置方法

  1. 右侧点击“使用该镜像创建实例”——选择40系或50系 bfe7ce3a07ab9eda9e753d3014d546b0.png b9e89c5302ddf44d173e9b300df752fd.png
  2. 进入后台,在workspace目录下,打开终端——输入bash run.sh 0546c6d7f29e9b8ef63d8ed963318806.png fe5276085308d2b8f0ac4d488cf2db4e.png 32aca0025ba226f1fcc20d98fd6e5d26.png
  3. 等待7860端口出现后,实力列表通过“有声书”进入 2d76a003cd1063c1321a5c79eeb21b58.png 02381c3ae77723e518cdcf94ef40748e.png
  4. 上传pdf进行OCR识别【注意最好能够手动切掉页眉页脚】 f390c4365fc77b8ae4dcc902232965c3.png
  5. 编辑文本并选择分段 00731d959312b0e820ca7da87c83b257.png
  6. 使用TTS进行生成 36755a72a5c9733daf9b267ba0565898.png 可选:进行声音设计或者克隆 c630c4c11dd697cd7b1576801d0fe6b0.png
0 个镜像 · 被使用 7
交流与支持
交流群二维码
扫码加入交流群
作者与用户在群内答疑
版本日志
v1.0最新
2026-07-15
评分
0.0
暂无评分
我的评分
未评分
有声书生成一键部署 | 优云智算