Doc的打标器,支持 Qwen3vl及 API 调用
DocCaptioner 是一款基于 NiceGUI 构建的现代化本地图像/视频打标与数据集管理工具。它集成了先进的 Qwen 3-VL (Vision-Language) 视觉大模型,旨在为 AI 训练提供高效、流畅的“工作室级”数据准备工作流。
📸 交互式画廊 (Gallery Studio)
🤖 Qwen 3-VL 自动打标 (Auto Captioning)
📊 系统性能监控 (System Monitor)
📂 数据集管理 (Dataset Manager)
✏️ 批量处理 (Batch Editor)
部署推荐使用 24G 卡,综合性价比高
等待镜像启动后点击 DocCaptioner 即可进入打标器页面
使用内置预设模型 Qwen3-VL-8B 模型进行打标
