snnh commited on
Commit
64ef2dd
·
verified ·
1 Parent(s): 936ff3b

docs: update model v6 benchmark v5.2

Browse files
Files changed (1) hide show
  1. README.md +41 -42
README.md CHANGED
@@ -2,6 +2,7 @@
2
  language:
3
  - zh
4
  - en
 
5
  base_model: PaddlePaddle/PaddleOCR-VL-1.6
6
  pipeline_tag: image-text-to-text
7
  tags:
@@ -12,15 +13,13 @@ tags:
12
  - developer-tools
13
  ---
14
 
15
- # PaddleOCR-VL 开发场景代码 OCR 微调模型
16
 
17
- 本模型基于 PaddleOCR-VL-1.6 微调,面向开发场景 OCR,重点识别 IDE 截图、终端输出、Traceback、配置文件、Git diff、文档代码块、API 表格、小字号暗色主题等开发相关中的可见文字
18
 
19
- ## 在线 Demo
20
 
21
- 🤗 [在线试(HF Space)](https://huggingface.co/spaces/snnh/paddleocr-vl-code-ocr-demo):上传开发场景截图即可在线体验,无需本地部署。
22
-
23
- HF Space 使用免费 CPU 硬件,仅作为可访问演示入口;首次加载需拉取模型权重,单图可能需要 1-5 分钟。benchmark 分数和正式复现口径以本地 GPU / OpenAI-compatible 接口结果为准。
24
 
25
  推荐提示词:
26
 
@@ -28,16 +27,7 @@ HF Space 使用免费 CPU 硬件,仅作为可访问演示入口;首次加载
28
  <image>OCR:
29
  ```
30
 
31
- ## 模型信息
32
-
33
- - 基础模型:PaddleOCR-VL-1.6
34
- - 微调方式:LoRA 微调后导出合并模型
35
- - 任务类型:开发场景代码 OCR / image-to-text
36
- - 当前版本:v6 提交候选版本
37
- - 主提示词:`<image>OCR:`
38
- - 主 benchmark:benchmark v4 固定 100 题,`final_score_v4=61.08`
39
-
40
- ## 推荐推理参数
41
 
42
  ```text
43
  max_tokens=4096
@@ -45,44 +35,53 @@ repetition_penalty=1.08
45
  temperature=0
46
  ```
47
 
48
- 模型目标是只输出图片中可见文字,尽量保留代码符号大小写、缩进、换行、构和阅读顺序。它不是代码修复代码生成模型,应补全图片中不见的内容
 
 
 
 
 
 
 
 
 
49
 
50
- ## 数据与评估
51
 
52
- 当前初赛提交口径下,训练索引 `train.json` 为 2026-06-18 后的快照,共 1102 条样本(941 PNG / 161 JPG),平均目标文本长度 1153.7 字符。该规模只是当前提交快照,不代表最终成品或后续决赛版本;训练数据仍可能继续清洗、补充或回滚。数据主要覆盖:
53
 
54
- - IDE / 编辑器代码截图
55
- - 终端、Shell、PowerShell 命令和输出
56
- - Traceback、报错日志和诊断信息
57
- - YAML / JSON / TOML / INI 配置文件
58
- - Git diff、patch 和 PR 页面
59
- - Markdown / 文档代码块
60
- - API 表格、参数表和字段说明
61
- - 小字号、压缩、暗色主题、拍屏等困难样本
62
 
63
- 当前 benchmark v4 使用 100 题冻测试集,按 8 类开发 OCR 场景加权汇总。测试集不参与训练和训练期调参。
 
 
 
 
 
 
 
 
 
64
 
65
- 阶段性 v4 结果
66
 
67
- | 模型 | 提示词 | final_score_v4 | 平均 LLM | 平均 NED | 严格可率 | 完成率 | 安全分 |
68
- | --- | --- | ---: | ---: | ---: | ---: | ---: | ---: |
69
- | PaddleOCR-VL-1.6 微调 v6 | `<image>OCR:` | 61.08 | 74.05 | 0.1360 | 47.00% | 96.00% | 79.00% |
70
 
71
- 该分数是阶段性回归结果,最比赛评审以官方规则和提交材料为准
 
 
72
 
73
  ## 局限性
74
 
75
- 模型在以下场景仍可能
 
 
 
76
 
77
- - 极小或模糊文本
78
- - 复杂 API 表格
79
- - 深层嵌套配置文件
80
- - 长 Traceback 输出
81
- - 多区域混排截图
82
- - 罕见符号、代码标点和缩进敏感内容
83
 
84
- 模型输出应只作为 OCR 转写结果使用,能视为代码语义理解代码正确性保证
85
 
86
  ## 致谢
87
 
88
- 本模型为 PaddleOCR 全球衍生模型挑战赛构建,基础能力来自 PaddleOCR-VL 系列模型。
 
2
  language:
3
  - zh
4
  - en
5
+ license: apache-2.0
6
  base_model: PaddlePaddle/PaddleOCR-VL-1.6
7
  pipeline_tag: image-text-to-text
8
  tags:
 
13
  - developer-tools
14
  ---
15
 
16
+ # PaddleOCR-VL-1.6 开发场景代码 OCR 微调模型
17
 
18
+ 本模型基于 PaddleOCR-VL-1.6 微调,面向 IDE、终端、Traceback、配置、Git diff、文档代码块、API 表格和多区域开发图中的结构保真 OCR当前模型版本为 v6,并作为 PaddleOCR 全球衍生模型挑战赛决赛冻结方案。
19
 
20
+ 在线体验:[PaddleOCR-VL 开发场景代码 OCR Demo](https://huggingface.co/spaces/snnh/paddleocr-vl-code-ocr-demo)。Space 使用 CPU 免费硬件时会降低 token 上限以控制等待时间,正式 Benchmark 以本地 GPU 参数为准。
21
 
22
+ ## 使方法
 
 
23
 
24
  推荐提示词:
25
 
 
27
  <image>OCR:
28
  ```
29
 
30
+ 正式推理参数:
 
 
 
 
 
 
 
 
 
31
 
32
  ```text
33
  max_tokens=4096
 
35
  temperature=0
36
  ```
37
 
38
+ 输出只应包含图片中可见文字,不应解释、补全或修复代码同提示词和采样参数能显著改变输出风格与 Benchmark 结果
39
+
40
+ ## 训练概况
41
+
42
+ - 基础模型:`PaddlePaddle/PaddleOCR-VL-1.6`。
43
+ - 微调方式:LoRA 后导出合并模型。
44
+ - 训练提示词:`<image>OCR:`。
45
+ - 最大序列长度:16384。
46
+ - 训练快照:1102 条开发场景 OCR 样本。
47
+ - 数据范围:IDE、终端、报错日志、配置文件、diff、文档代码块、API 表格及困难画面。
48
 
49
+ 训练数据不随模型或本仓库发布。模型 OCR 只用于预标注草稿,最终文本经过人工筛选或修订。冻结审计中训练集 304 题测试集图片 SHA-256 重叠为 0。
50
 
51
+ ## Benchmark v5.2
52
 
53
+ Benchmark v5 内容版本 5.2 共 304 题,覆盖 P01-P09 九类开发场景和 simple、medium、hard 三档难度。模型 v6 按正式参数完成 304/304 推理,并使用 `tencent/hy3:free`、reasoning 关闭的统一六维裁判口径计分。
 
 
 
 
 
 
 
54
 
55
+ | 指标 | |
56
+ | --- | ---: |
57
+ | `final_score_v5` | **58.4427** |
58
+ | 原始积分 | 60.3374 |
59
+ | 类别加权分 | 72.8633 |
60
+ | 全局样本均值 | 73.3494 |
61
+ | 严格可用率 | 38.1579% |
62
+ | 完成率 | 99.0132% |
63
+ | 安全分 | 90.7895% |
64
+ | 平均 NED | 0.1744 |
65
 
66
+ LLM 裁判存在约 `±0.5` 的展示误差。v5.2 不应与 v4、其他内容版本或不同提示词组直接混排。完整规则与对照结果见 [GitHub Benchmark v5](https://github.com/snnh/paddleocr-vl-code-ocr/blob/main/docs/ocr_benchmark_v5.md)。
67
 
68
+ ## 场景
 
 
69
 
70
+ - 从 IDE、��试工具截图中取可搜索文本
71
+ - 转写配置、日志、Traceback、diff 和 API 表格。
72
+ - 为开发文档归档、问题排查或辅助标注提供 OCR 草稿。
73
 
74
  ## 局限性
75
 
76
+ - 复杂 API 表格、长 Traceback、多区域界面和深层嵌套配置仍可能发生阅读顺序或结构误。
77
+ - 极小字号、模糊拍屏、压缩伪影和罕见符号会降低准确率。
78
+ - 模型可能漏字、误认符号或重复文本;重要输出必须人工复核。
79
+ - 本模型用于转写,不应视为代码生成、代码修复或安全分析工具。
80
 
81
+ ## 许可
 
 
 
 
 
82
 
83
+ 模型权重和仓库代码按 Apache License 2.0 发布。第三方训练素材随模型重新分发重新授权,仍受各自许可和使用条款约束
84
 
85
  ## 致谢
86
 
87
+ 感谢 PaddleOCR PaddlePaddle 社区提供基础模型、工具链和赛事平台