LightOnOCR-2高效的1B参数视觉语言模型用于OCR识别pdf转文本jpg转文本图片转文本 二次开发构建by科哥
本镜像基于轻量高效的1B参数视觉语言模型LightOnOCR-2,专注于高精度OCR文字识别。支持PDF、JPG等多种格式的文档与图像快速转换为可编辑文本,适用于文档数字化、资料归档、信息提取与无障碍阅读等场景,提供即开即用、准确高效的文字识别解决方案。





本手册指导用户如何使用 LightOnOCR-2 Web 界面进行 OCR 文本提取。
本地访问: http://localhost:7860
局域网访问: http://[服务器IP]:7860
外网访问: http://[域名或公网IP]:7860
显示项目名称和开发信息:
| 控件 | 功能说明 |
|---|---|
| 模型 | 下拉选择 6 种不同的 OCR 模型 |
| 模型信息 | 显示当前模型的描述和是否支持边界框检测 |
| 上传图片或 PDF | 点击上传或拖拽图片/PDF 文件 |
| 预览 | 显示上传图片的预览效果 |
| PDF:页码 | 选择 PDF 中要提取的页面(仅 PDF 文件) |
| 处理信息 | 显示当前处理状态 |
| 温度 | 控制输出随机性,0.0 = 确定性,数值越高 = 变化越大 |
| 启用流式输出 | 勾选后文本会逐步显示 |
| 最大输出 Token 数 | 设置生成文本的最大长度 |
| 提取文本 | 开始 OCR 文本提取 |
| 清空 | 清空所有输入和输出 |
| 区域 | 功能说明 |
|---|---|
| 提取文本(渲染) | 显示格式化后的提取结果,支持 Markdown 渲染 |
| 原始 Markdown 输出 | 显示原始 Markdown 格式的文本 |
点击任意示例图片可自动加载到输入框,方便快速体验。
LightOnOCR-2 提供以下 6 种模型:
| 模型名称 | 描述 | 边界框检测 | 适用场景 |
|---|---|---|---|
| LightOnOCR-2-1B (Best OCR) | 最佳综合 OCR 性能 | 否 | 通用 OCR 任务,追求最高准确率 |
| LightOnOCR-2-1B-bbox (Best Bbox) | 最佳边界框检测 | 是 | 需要定位文本区域或需要裁剪功能 |
| LightOnOCR-2-1B-base | 基础 OCR 模型 | 否 | 快速 OCR,对准确率要求不高的场景 |
| LightOnOCR-2-1B-bbox-base | 基础边界框模型 | 是 | 快速边界框检测 |
| LightOnOCR-2-1B-ocr-soup | OCR soup 变体 | 否 | 特殊格式文档处理 |
| LightOnOCR-2-1B-bbox-soup | 边界框 soup 变体 | 是 | 复杂版面布局文档处理 |
推荐选择:
| 值 | 效果 | 适用场景 |
|---|---|---|
| 0.0 | 完全确定性,结果稳定 | 表单、票据等结构化文本 |
| 0.2-0.4 | 较少变化,推荐默认值 | 大多数 OCR 场景 |
| 0.5-0.7 | 中等变化 | 手写文本、模糊图片 |
| 0.8-1.0 | 高变化,结果可能不稳定 | 创意性文本处理 |
| 值 | 适用场景 |
|---|---|
| 256 | 短文本、标题提取 |
| 1024 | 单段文本提取 |
| 2048(默认) | 完整文档提取 |
| 4096+ | 超长文档、多页内容 |
| 类型 | 支持格式 |
|---|---|
| 图片 | .png, .jpg, .jpeg |
| 文档 |
推荐格式:
解决方案:
解决方案:
解决方案:
解决方案:
原因:未上传文件就点击了「提取文本」
解决:先上传图片或 PDF 文件
最后更新: 2026-01-24