优云智算
控制台
立即注册

视频字幕去除器webUI二次修改汉化版

视频字幕去除器webUI二次修改汉化版

镜像大小
50 GB
当前版本
v1.1
累计部署
17 次
累计运行
5 h
最近更新
2026-09-18

运行环境

框架版本
PyTorch-2.8
CUDA版本
12.8
应用
JupyterLab: 8888
支持卡型
3090RTX40系
+10

视频字幕去除器webUI二次修改汉化版

交流加群

bug反馈可以加入科哥专属群交流➕ 广告勿进!

描述图片内容
  • 已经设置开机运行 首次开机 1-2分钟

  • 已经设置开机运行 首次加载大模型时间比较久1-2分钟左右

  • 1、打开 【WebUI】即可进入使用界面;

image.png

image.png

image.png

image.png


【插入一个小广告 给需要做ai视频漫画短剧ai香蕉🍌出图朋友多一个选择】:

  • 在线图片、视频生成网站哈基米AI聚合平台:https://link8.lk888.ai
  • ✅ai大模型:gpt,claude,gemini,deepseek...数百种主流模型
  • ✅最新图片模型:gpt-image2,香蕉2,香蕉pro,即梦,豆包,万相...
  • ✅最新视频模型:sd2,快乐马,grok,veo3,sora2,vidu,可灵...
  • ✅并发高,收费合理(价格优先速度优先)
  • 以上模型均支持API,龙虾CLI接入,web浏览器在线使用!

✅📢【好消息】不要任何电脑配置打开即可使用sora,veo3,grok3出主流ai视频, ✅📢谷歌香蕉🍌2➕pro低至五分钱,500+大模型接口免费体验2次!欢迎免费测试使用! ✅1.api中转站【推荐】,全球最卷,有些比官网便宜90+%: ✅https://ai.kegeai.top/register?aff=78Gs

✅链接: https://pan.baidu.com/s/1CsVlXWRMxgvV2r_G9oXwgg?pwd=8888 提取码: 8888 ✅使用教程帮助主目录: https://g1hzbw0p4dd.feishu.cn/docx/TBeZdghZhoG9yzxju06cTxFBntg?from=from_copylink

✅入交流群加微信(已有三群):312088415

✅工作流也有: https://g1hzbw0p4dd.feishu.cn/docx/LCCTdFzSboC0AGxFHLxccL4Rnlh?from=from_copylink ✅工作流有sora,veo3,grok3等ai视频生成,谷歌香蕉修图,gpt,gemini3,claude,deepseek等等500+模型api

✅增加模型:增加gpt-image2的2k4k高清出图工作流 ✅增加gork的30s延长的工作流(使用task-id二次延长)

✅使用方式1:【本地windows使用Comfyui及插件的快速安装1】 https://b23.tv/JjGWgSY 【本地windows使用Comfyui及插件的快速安装2】 https://b23.tv/MCz0IX9 ✅使用方式2:云端运行地址可无卡模式0.15元一个小时运行即可: https://www.compshare.cn/images/0sm1tb2p1Nnb

✅即梦SD2.0Fast15秒 720P正版不排队可真人使用教程: https://icndm2oxbr60.feishu.cn/docx/Hs3fd8qMgo1pYaxodxYc2en9nYd?from=from_copylink


VSR 用户使用手册

本手册只讲使用,不讲安装搭建。默认你已经能启动本项目。

1. 软件能做什么

VSR 用于去除视频或图片里的硬字幕、文字水印,并生成处理后的新文件。

主要功能:

  • 视频硬字幕去除。
  • 图片文字水印去除。
  • 多个视频/图片批量排队处理。
  • 手动画字幕区域,只处理指定区域。
  • 不画区域时处理全屏文字。
  • 设置 AB 区块,只处理视频指定帧段。
  • 支持多种修复算法:STTN 智能擦除、STTN 字幕检测、LAMA、ProPainter、OpenCV。
  • 支持字幕检测模式:快速(PP-OCRv5 Mobile)、精准(PP-OCRv5 Server)。
  • 处理后保留原视频分辨率,并尝试合并原音频。

2. 启动方式

推荐:WebUI

在项目根目录运行:

python gui.py

启动后浏览器打开:

http://127.0.0.1:7860

控制台显示的是:

http://0.0.0.0:7860

本机访问用 127.0.0.1。局域网其他设备访问,用运行机器的局域网 IP 加 :7860。

Linux/macOS 脚本启动

./start_app.sh

脚本会检查 7860 端口。若端口已被占用,会结束占用进程后再启动 WebUI。

旧 Qt 界面

旧 PySide/Qt 界面仍保留:

python qt_gui.py

新用户优先用 WebUI。旧 Qt 界面主要用于兼容旧操作习惯。

3. WebUI 快速上手

第一步:上传文件

  1. 打开 WebUI。
  2. 在左侧 上传视频/图片 选择一个或多个文件。
  3. 文件会进入 任务队列。
  4. 右侧会显示当前任务预览。

支持常见视频格式:mp4、mov、avi、mkv、flv、webm 等。

支持常见图片格式:jpg、jpeg、png、bmp、webp、tiff 等。

第二步:选择当前任务

任务多时,用 当前任务 下拉框切换要预览和设置的任务。

任务队列列信息:

  • 名称:输入文件名。
  • 进度:处理百分比。
  • 状态:待处理、处理中、已完成、失败、已停止。
  • 输出文件:输出文件名。视频任务完成后,点击这一列可加载处理结果预览。

第三步:选择字幕区域

右侧预览区域默认已有一个底部字幕区域。

操作:

  • 鼠标拖拽:新增字幕区域。
  • 删除最后选区:删除最后一个区域。
  • 清空选区:删除全部区域。
  • 键盘 Delete:删除最后一个区域。
  • 键盘 Esc:清空全部区域。

建议:

  • 只框住字幕或水印所在区域,不要框太大。
  • 字幕位置固定时,手动框选区域,速度和效果通常更好。
  • 字幕位置变化大时,可框大一点,或不框区域让程序全屏检测。

不设置区域时,程序会全屏处理,可能更慢,也更容易误伤画面文字。

第四步:设置 AB 区块

AB 区块用于只处理视频的一段或多段帧。

操作:

  1. 用 预览帧 滑块找到起始帧。
  2. 在 AB 起点帧 输入起始帧号。
  3. 在 AB 终点帧 输入结束帧号。
  4. 点 添加 AB 区块。
  5. 多段处理可重复添加。

删除:

  • 删除序号 输入 AB 表格里的序号。
  • 点 删除 AB 区块。
  • 点 清空 AB 区块 可恢复全视频处理。

未设置 AB 区块时,默认处理全部帧。

第五步:选择算法和检测模式

展开 基础设置。

修复算法

算法适合场景特点
STTN 智能擦除真人视频、字幕区域固定速度快,效果好;WebUI 下需要 CUDA
STTN 字幕检测需要先检测字幕再修复的视频带字幕检测;WebUI 下需要 CUDA
LAMA图片、动画、显存较低环境效果稳,速度中等
ProPainter运动剧烈视频显存占用大,速度慢
OpenCV快速预览、低配置环境速度快,修复效果较弱

推荐:

  • NVIDIA CUDA 用户:优先 STTN 智能擦除。
  • 无 CUDA 用户:优先 LAMA,想快速测试用 OpenCV。
  • 图片任务:优先 LAMA。
  • 运动剧烈视频:尝试 ProPainter。

字幕检测模式

模式特点
快速(PP-OCRv5 Mobile)速度更快,精度略低
精准(PP-OCRv5 Server)默认值,精度更高,速度略慢

硬件加速

开启后会尝试使用 GPU 或 ONNX 后端。

注意:当前 WebUI 的 STTN 智能擦除 和 STTN 字幕检测 会检查 CUDA。没有 CUDA 时请选择 LAMA、OpenCV 或 ProPainter。

第六步:运行任务

  1. 检查任务、字幕区域、AB 区块、算法设置。
  2. 点 运行。
  3. 查看 日志 和任务进度。
  4. 需要中断时点 停止。
  5. 需要重新选择任务时点 清空任务。

处理完成后:

  • 视频输出在 outputs/videos/。
  • 图片输出在 outputs/pictures/。
  • 输出文件名类似 outputs_20260712153045.mp4 或 outputs_20260712153045.png。
  • 视频任务完成后,点击任务队列的 输出文件 可加载结果预览。

4. CLI 用法

CLI 适合批处理、脚本调用、服务器环境。

查看参数:

python ./backend/main.py --help

基本命令:

python ./backend/main.py -i 输入视频.mp4 -o 输出视频.mp4

指定字幕区域:

python ./backend/main.py -i 输入视频.mp4 -o 输出视频.mp4 -c 100 200 300 500

坐标顺序:

ymin ymax xmin xmax

含义:

  • ymin:字幕区域上边界。
  • ymax:字幕区域下边界。
  • xmin:字幕区域左边界。
  • xmax:字幕区域右边界。

指定多个区域:

python ./backend/main.py -i 输入视频.mp4 -o 输出视频.mp4 -c 100 200 300 500 -c 800 950 100 1800

指定算法:

python ./backend/main.py -i 输入视频.mp4 -o 输出视频.mp4 --inpaint-mode opencv

可选算法:

sttn-auto
sttn-det
lama
propainter
opencv

注意:当前 CLI 帮助里说 -o 可选,但实际使用建议始终传 -o,避免输出路径为空导致失败。

5. 参数说明

基础设置

  • 界面语言:切换界面语言。
  • 修复算法:选择字幕/水印去除算法。
  • 字幕检测模式:选择 OCR 检测模型。
  • 硬件加速:启用 GPU 或 ONNX 后端加速。

高级设置

  • 高宽像素差阈值:过滤不像字幕的检测框。字幕通常横向更长。
  • 字幕区域扩展像素:放大 mask 区域,减少文字边缘残留。
  • 同行字幕高度差阈值:判断多个文本框是否属于同一行字幕。
  • Y 轴容忍像素偏差:判断相邻帧字幕框是否相似。
  • X 轴容忍像素偏差:判断相邻帧字幕框是否相似。
  • 字幕时间轴回退帧数:检测到字幕后,向前多处理几帧。
  • 字幕时间轴前进帧数:检测到字幕后,向后多处理几帧。
  • STTN 参考帧步长:STTN 选择参考帧的间隔。
  • STTN 参考帧数量:STTN 使用的参考帧数量。
  • STTN 最大加载帧数:STTN 每批最多处理帧数。越大越吃显存。
  • ProPainter 最大加载帧数:ProPainter 每批最多处理帧数。越大越吃显存。
  • 启动时检查更新:启动时检查新版本。

新用户建议先保持默认值,只改算法和字幕区域。

6. 常见使用场景

去除固定底部字幕

  1. 上传视频。
  2. 用预览框住底部字幕。
  3. CUDA 环境选择 STTN 智能擦除。
  4. 无 CUDA 环境选择 LAMA 或 OpenCV。
  5. 点 运行。

去除多处水印或文字

  1. 上传视频或图片。
  2. 在预览中分别拖拽多个区域。
  3. 检查每个区域是否只覆盖要去除的文字。
  4. 点 运行。

只处理视频中间一段

  1. 上传视频。
  2. 用 预览帧 找到要处理的开始和结束帧。
  3. 添加 AB 区块。
  4. 点 运行。

批量处理图片

  1. 一次上传多张图片。
  2. 对每个任务检查选区。
  3. 算法选择 LAMA。
  4. 点 运行,任务会按队列依次执行。

7. FAQ

Q1:启动后打不开页面?

确认控制台是否显示:

Video Subtitle Remover WebUI: http://0.0.0.0:7860

本机访问:

http://127.0.0.1:7860

若端口被占用,可关闭占用程序,或用 ./start_app.sh 启动。

Q2:提示 STTN 需要 CUDA?

STTN 智能擦除 和 STTN 字幕检测 在当前 WebUI 下需要 CUDA。

解决:

  • 有 NVIDIA CUDA 环境:用支持 CUDA 的 Python 启动。
  • 没有 CUDA:改用 LAMA、OpenCV 或 ProPainter。

Q3:处理很慢?

常见原因:

  • 视频分辨率高、时长长。
  • 使用了 LAMA 或 ProPainter。
  • 没有 GPU 加速。
  • 未框选字幕区域,程序全屏检测。
  • STTN 最大加载帧数 或 ProPainter 最大加载帧数 设置过大。

处理建议:

  • 手动框选字幕区域。
  • 只处理需要的 AB 区块。
  • CUDA 环境优先用 STTN 智能擦除。
  • 低配置环境先用 OpenCV 测试。

Q4:处理后字幕还有残留?

处理建议:

  • 选区稍微放大,覆盖字幕边缘。
  • 增大 字幕区域扩展像素。
  • 字幕检测模式 改为 精准(PP-OCRv5 Server)。
  • 尝试换算法:STTN 智能擦除、LAMA、ProPainter。
  • 渐入渐出字幕可增大 字幕时间轴回退帧数 和 字幕时间轴前进帧数。

Q5:画面被误伤?

常见原因:

  • 选区太大。
  • 未设置选区,使用了全屏处理。
  • 视频中有非字幕文字被检测到。

处理建议:

  • 缩小选区,只覆盖字幕。
  • 用 AB 区块限制处理片段。
  • 换用更合适算法。

Q6:任务显示失败?

查看 日志 最后一段错误。

常见原因:

  • 缺少运行依赖:日志会显示缺少 paddle、torch 或 torchvision。
  • STTN 模式没有 CUDA。
  • 输入文件损坏或格式不兼容。
  • 输出目录无写入权限。
  • 模型文件或 ffmpeg 文件缺失。

Q7:视频处理完成但没有声音?

程序会用 ffmpeg 提取并合并原音频。若日志出现 提取音频失败 或 合并音频失败,输出视频可能无声。

常见原因:

  • 原视频音轨格式异常。
  • ffmpeg 不可用。
  • 原视频本身没有音轨。

Q8:图片结果在哪里?

WebUI 图片输出在:

outputs/pictures/

CLI 图片输出默认由后端逻辑保存到输入文件同目录的 no_sub/ 下。

Q9:视频结果在哪里?

WebUI 视频输出在:

outputs/videos/

CLI 使用你传入的 -o 路径。

Q10:为什么点击输出文件没反应?

只有视频任务完成后,点击任务队列里的 输出文件 才能加载结果预览。

图片任务不支持视频预览。

Q11:如何选择算法?

简单规则:

  • 真人视频、CUDA:STTN 智能擦除。
  • 动画或图片:LAMA。
  • 运动剧烈:ProPainter。
  • 低配置快速试跑:OpenCV。
  • 需要检测字幕出现时间再处理:STTN 字幕检测。

Q12:CLI 坐标怎么取?

坐标来自原视频像素。

格式:

-c ymin ymax xmin xmax

示例:只处理画面底部区域:

python ./backend/main.py -i input.mp4 -o output.mp4 -c 900 1060 100 1800

Q13:能一次处理多个文件吗?

WebUI 可以。上传多个文件后,任务会进入队列,点击 运行 后按顺序处理。

CLI 一次处理一个文件。批量处理需写脚本循环调用。

Q14:设置改错了怎么办?

简单处理:

  • WebUI 里重新选择算法和参数后点 保存设置。
  • 不确定高级参数时,恢复默认思路:只改 修复算法、字幕检测模式、字幕区域,其他保持默认。

8. 推荐默认流程

新用户按这个流程使用:

  1. python gui.py 启动 WebUI。
  2. 打开 http://127.0.0.1:7860。
  3. 上传视频或图片。
  4. 在预览里框选字幕/水印区域。
  5. 有 CUDA 选 STTN 智能擦除,无 CUDA 选 LAMA。
  6. 保持其他参数默认。
  7. 点 运行。
  8. 在 outputs/videos/ 或 outputs/pictures/ 查看结果。
0 个镜像 · 被使用 17 次
交流与支持
交流群二维码
扫码加入交流群
作者与用户在群内答疑
版本日志
v1.1最新
2026-07-12
视频字幕去除器webUI二次修改汉化版
评分
0.0
暂无评分
我的评分
未评分
视频字幕去除器webUI二次修改汉化版一键部署 | 优云智算