docs: update model v6 benchmark v5.2
Browse files
README.md
CHANGED
|
@@ -2,6 +2,7 @@
|
|
| 2 |
language:
|
| 3 |
- zh
|
| 4 |
- en
|
|
|
|
| 5 |
base_model: PaddlePaddle/PaddleOCR-VL-1.6
|
| 6 |
pipeline_tag: image-text-to-text
|
| 7 |
tags:
|
|
@@ -12,15 +13,13 @@ tags:
|
|
| 12 |
- developer-tools
|
| 13 |
---
|
| 14 |
|
| 15 |
-
# PaddleOCR-VL 开发场景代码 OCR 微调模型
|
| 16 |
|
| 17 |
-
本模型基于 PaddleOCR-VL-1.6 微调,面向
|
| 18 |
|
| 19 |
-
|
| 20 |
|
| 21 |
-
|
| 22 |
-
|
| 23 |
-
HF Space 使用免费 CPU 硬件,仅作为可访问演示入口;首次加载需拉取模型权重,单图可能需要 1-5 分钟。benchmark 分数和正式复现口径以本地 GPU / OpenAI-compatible 接口结果为准。
|
| 24 |
|
| 25 |
推荐提示词:
|
| 26 |
|
|
@@ -28,16 +27,7 @@ HF Space 使用免费 CPU 硬件,仅作为可访问演示入口;首次加载
|
|
| 28 |
<image>OCR:
|
| 29 |
```
|
| 30 |
|
| 31 |
-
|
| 32 |
-
|
| 33 |
-
- 基础模型:PaddleOCR-VL-1.6
|
| 34 |
-
- 微调方式:LoRA 微调后导出合并模型
|
| 35 |
-
- 任务类型:开发场景代码 OCR / image-to-text
|
| 36 |
-
- 当前版本:v6 提交候选版本
|
| 37 |
-
- 主提示词:`<image>OCR:`
|
| 38 |
-
- 主 benchmark:benchmark v4 固定 100 题,`final_score_v4=61.08`
|
| 39 |
-
|
| 40 |
-
## 推荐推理参数
|
| 41 |
|
| 42 |
```text
|
| 43 |
max_tokens=4096
|
|
@@ -45,44 +35,53 @@ repetition_penalty=1.08
|
|
| 45 |
temperature=0
|
| 46 |
```
|
| 47 |
|
| 48 |
-
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 49 |
|
| 50 |
-
|
| 51 |
|
| 52 |
-
|
| 53 |
|
| 54 |
-
-
|
| 55 |
-
- 终端、Shell、PowerShell 命令和输出
|
| 56 |
-
- Traceback、报错日志和诊断信息
|
| 57 |
-
- YAML / JSON / TOML / INI 配置文件
|
| 58 |
-
- Git diff、patch 和 PR 页面
|
| 59 |
-
- Markdown / 文档代码块
|
| 60 |
-
- API 表格、参数表和字段说明
|
| 61 |
-
- 小字号、压缩、暗色主题、拍屏等困难样本
|
| 62 |
|
| 63 |
-
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 64 |
|
| 65 |
-
|
| 66 |
|
| 67 |
-
|
| 68 |
-
| --- | --- | ---: | ---: | ---: | ---: | ---: | ---: |
|
| 69 |
-
| PaddleOCR-VL-1.6 微调 v6 | `<image>OCR:` | 61.08 | 74.05 | 0.1360 | 47.00% | 96.00% | 79.00% |
|
| 70 |
|
| 71 |
-
|
|
|
|
|
|
|
| 72 |
|
| 73 |
## 局限性
|
| 74 |
|
| 75 |
-
|
|
|
|
|
|
|
|
|
|
| 76 |
|
| 77 |
-
|
| 78 |
-
- 复杂 API 表格
|
| 79 |
-
- 深层嵌套配置文件
|
| 80 |
-
- 长 Traceback 输出
|
| 81 |
-
- 多区域混排截图
|
| 82 |
-
- 罕见符号、代码标点和缩进敏感内容
|
| 83 |
|
| 84 |
-
模型
|
| 85 |
|
| 86 |
## 致谢
|
| 87 |
|
| 88 |
-
|
|
|
|
| 2 |
language:
|
| 3 |
- zh
|
| 4 |
- en
|
| 5 |
+
license: apache-2.0
|
| 6 |
base_model: PaddlePaddle/PaddleOCR-VL-1.6
|
| 7 |
pipeline_tag: image-text-to-text
|
| 8 |
tags:
|
|
|
|
| 13 |
- developer-tools
|
| 14 |
---
|
| 15 |
|
| 16 |
+
# PaddleOCR-VL-1.6 开发场景代码 OCR 微调模型
|
| 17 |
|
| 18 |
+
本模型基于 PaddleOCR-VL-1.6 微调,面向 IDE、终端、Traceback、配置、Git diff、文档代码块、API 表格和多区域开发截图中的结构保真 OCR。当前模型版本为 v6,并作为 PaddleOCR 全球衍生模型挑战赛决赛冻结方案。
|
| 19 |
|
| 20 |
+
在线体验:[PaddleOCR-VL 开发场景代码 OCR Demo](https://huggingface.co/spaces/snnh/paddleocr-vl-code-ocr-demo)。Space 使用 CPU 免费硬件时会降低 token 上限以控制等待时间,正式 Benchmark 以本地 GPU 参数为准。
|
| 21 |
|
| 22 |
+
## 使用方法
|
|
|
|
|
|
|
| 23 |
|
| 24 |
推荐提示词:
|
| 25 |
|
|
|
|
| 27 |
<image>OCR:
|
| 28 |
```
|
| 29 |
|
| 30 |
+
正式推理参数:
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 31 |
|
| 32 |
```text
|
| 33 |
max_tokens=4096
|
|
|
|
| 35 |
temperature=0
|
| 36 |
```
|
| 37 |
|
| 38 |
+
输出只应包含图片中的可见文字,不应解释、总结、补全或修复代码。不同提示词和采样参数可能显著改变输出风格与 Benchmark 结果。
|
| 39 |
+
|
| 40 |
+
## 训练概况
|
| 41 |
+
|
| 42 |
+
- 基础模型:`PaddlePaddle/PaddleOCR-VL-1.6`。
|
| 43 |
+
- 微调方式:LoRA 后导出合并模型。
|
| 44 |
+
- 训练提示词:`<image>OCR:`。
|
| 45 |
+
- 最大序列长度:16384。
|
| 46 |
+
- 训练快照:1102 条开发场景 OCR 样本。
|
| 47 |
+
- 数据范围:IDE、终端、报错日志、配置文件、diff、文档代码块、API 表格及困难画面。
|
| 48 |
|
| 49 |
+
训练数据不随模型或本仓库发布。模型 OCR 只用于预标注草稿,最终文本经过人工筛选或修订。冻结审计中训练集与 304 题测试集图片 SHA-256 重叠为 0。
|
| 50 |
|
| 51 |
+
## Benchmark v5.2
|
| 52 |
|
| 53 |
+
Benchmark v5 内容版本 5.2 共 304 题,覆盖 P01-P09 九类开发场景和 simple、medium、hard 三档难度。模型 v6 按正式参数完成 304/304 推理,并使用 `tencent/hy3:free`、reasoning 关闭的统一六维裁判口径计分。
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 54 |
|
| 55 |
+
| 指标 | 结果 |
|
| 56 |
+
| --- | ---: |
|
| 57 |
+
| `final_score_v5` | **58.4427** |
|
| 58 |
+
| 原始积分 | 60.3374 |
|
| 59 |
+
| 类别加权分 | 72.8633 |
|
| 60 |
+
| 全局样本均值 | 73.3494 |
|
| 61 |
+
| 严格可用率 | 38.1579% |
|
| 62 |
+
| 完成率 | 99.0132% |
|
| 63 |
+
| 安全分 | 90.7895% |
|
| 64 |
+
| 平均 NED | 0.1744 |
|
| 65 |
|
| 66 |
+
LLM 裁判存在约 `±0.5` 的展示误差。v5.2 不应与 v4、其他内容版本或不同提示词组直接混排。完整规则与对照结果见 [GitHub Benchmark v5](https://github.com/snnh/paddleocr-vl-code-ocr/blob/main/docs/ocr_benchmark_v5.md)。
|
| 67 |
|
| 68 |
+
## 适用场景
|
|
|
|
|
|
|
| 69 |
|
| 70 |
+
- 从 IDE、终端和��试工具截图中提取可搜索文本。
|
| 71 |
+
- 转写配置、日志、Traceback、diff 和 API 表格。
|
| 72 |
+
- 为开发文档归档、问题排查或辅助标注提供 OCR 草稿。
|
| 73 |
|
| 74 |
## 局限性
|
| 75 |
|
| 76 |
+
- 复杂 API 表格、长 Traceback、多区域界面和深层嵌套配置仍可能发生阅读顺序或结构错误。
|
| 77 |
+
- 极小字号、模糊拍屏、压缩伪影和罕见符号会降低准确率。
|
| 78 |
+
- 模型可能漏字、误认符号或重复文本;重要输出必须人工复核。
|
| 79 |
+
- 本模型用于转写,不应视为代码生成、代码修复或安全分析工具。
|
| 80 |
|
| 81 |
+
## 许可
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 82 |
|
| 83 |
+
模型权重和仓库代码按 Apache License 2.0 发布。第三方训练素材不随模型重新分发或重新授权,仍受各自许可和使用条款约束。
|
| 84 |
|
| 85 |
## 致谢
|
| 86 |
|
| 87 |
+
感谢 PaddleOCR 与 PaddlePaddle 社区提供基础模型、工具链和赛事平台。
|