File size: 4,477 Bytes
f70d12d
fba4561
 
 
64ef2dd
fba4561
 
 
 
 
 
 
 
f70d12d
fba4561
64ef2dd
936ff3b
64ef2dd
936ff3b
64ef2dd
936ff3b
74198e1
 
 
 
 
 
64ef2dd
936ff3b
 
 
 
 
 
 
64ef2dd
936ff3b
 
 
dd949a4
fba4561
 
8d39350
64ef2dd
 
 
 
 
 
 
 
 
 
8d39350
bdf898b
 
 
 
 
 
 
 
 
 
936ff3b
64ef2dd
936ff3b
64ef2dd
936ff3b
64ef2dd
 
 
 
 
 
 
 
 
 
936ff3b
64ef2dd
8d39350
64ef2dd
8d39350
64ef2dd
 
 
5ca6648
936ff3b
 
64ef2dd
 
 
 
936ff3b
64ef2dd
936ff3b
64ef2dd
8d39350
 
 
64ef2dd
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
---
language:
- zh
- en
license: apache-2.0
base_model: PaddlePaddle/PaddleOCR-VL-1.6
pipeline_tag: image-text-to-text
tags:
- paddleocr
- ocr
- vision-language
- code-ocr
- developer-tools
---

# PaddleOCR-VL-1.6 开发场景代码 OCR 微调模型

本模型基于 PaddleOCR-VL-1.6 微调,面向 IDE、终端、Traceback、配置、Git diff、文档代码块、API 表格和多区域开发截图中的结构保真 OCR。当前模型版本为 v6,并作为 PaddleOCR 全球衍生模型挑战赛决赛冻结方案。

在线体验:[PaddleOCR-VL 开发场景代码 OCR Demo](https://huggingface.co/spaces/snnh/paddleocr-vl-code-ocr-demo)。Space 使用 CPU 免费硬件时会降低 token 上限以控制等待时间,正式 Benchmark 以本地 GPU 参数为准。

## Demo 实测

![模型 v6 在 CUDA 环境完成开发场景 OCR](assets/demo_cuda_20s.png)

图中一次 CUDA 推理耗时 20.4 秒,使用 `max_new_tokens=4096``repetition_penalty=1.08``max_time=90s``run_timeout=120s`## 使用方法

推荐提示词:

```text
<image>OCR:
```

正式推理参数:

```text
max_tokens=4096
repetition_penalty=1.08
temperature=0
```

输出只应包含图片中的可见文字,不应解释、总结、补全或修复代码。不同提示词和采样参数可能显著改变输出风格与 Benchmark 结果。

## 训练概况

- 基础模型:`PaddlePaddle/PaddleOCR-VL-1.6`- 微调方式:LoRA 后导出合并模型。
- 训练提示词:`<image>OCR:`- 最大序列长度:16384。
- 训练快照:1102 条开发场景 OCR 样本。
- 数据范围:IDE、终端、报错日志、配置文件、diff、文档代码块、API 表格及困难画面。

| 组成 | 数量 | 来源与处理 |
| --- | ---: | --- |
| 混合截图 | 436 | 联网采集的合规公开开发截图,经二次加工,以及项目作者手动截图 |
| 代码渲染图 | 258 | 代码、配置、命令、日志和文档片段的本地渲染图 |
| 人工筛选批次 | 360 | 388 张候选经模型分类、人工筛选和审计后保留 |
| 人工转写补充 | 48 | 受研究用途许可约束的 IDE 候选经人工转写和筛选 |

新批次采用“项目作者准备—第一模型预标注—第二模型复核—项目作者终审—脚本审计”的流程。模型结果只作为草稿或差异意见,不直接成为最终真值。训练数据不随模型或本仓库发布;公开截图和第三方素材仍受其原始许可约束。冻结审计中训练集与 304 题测试集图片 SHA-256 重叠为 0。

完整来源、人员职责、终审规则和测试集隔离说明见 [决赛最终版训练数据构建报告](https://github.com/snnh/paddleocr-vl-code-ocr/blob/main/docs/%E8%AE%AD%E7%BB%83%E6%95%B0%E6%8D%AE%E6%9E%84%E5%BB%BA%E6%8A%A5%E5%91%8A.md)。

## Benchmark v5.2

Benchmark v5 内容版本 5.2 共 304 题,覆盖 P01-P09 九类开发场景和 simple、medium、hard 三档难度。模型 v6 按正式参数完成 304/304 推理,并使用 `tencent/hy3:free`、reasoning 关闭的统一六维裁判口径计分。

| 指标 | 结果 |
| --- | ---: |
| `final_score_v5` | **58.4427** |
| 原始积分 | 60.3374 |
| 类别加权分 | 72.8633 |
| 全局样本均值 | 73.3494 |
| 严格可用率 | 38.1579% |
| 完成率 | 99.0132% |
| 安全分 | 90.7895% |
| 平均 NED | 0.1744 |

LLM 裁判存在约 `±0.5` 的展示误差。v5.2 不应与 v4、其他内容版本或不同提示词组直接混排。完整规则与对照结果见 [GitHub Benchmark v5](https://github.com/snnh/paddleocr-vl-code-ocr/blob/main/docs/ocr_benchmark_v5.md)。

## 适用场景

- 从 IDE、终端和调试工具截图中提取可搜索文本。
- 转写配置、日志、Traceback、diff 和 API 表格。
- 为开发文档归档、问题排查或辅助标注提供 OCR 草稿。

## 局限性

- 复杂 API 表格、长 Traceback、多区域界面和深层嵌套配置仍可能发生阅读顺序或结构错误。
- 极小字号、模糊拍屏、压缩伪影和罕见符号会降低准确率。
- 模型可能漏字、误认符号或重复文本;重要输出必须人工复核。
- 本模型用于转写,不应视为代码生成、代码修复或安全分析工具。

## 许可

模型权重和仓库代码按 Apache License 2.0 发布。第三方训练素材不随模型重新分发或重新授权,仍受各自许可和使用条款约束。

## 致谢

感谢 PaddleOCR 与 PaddlePaddle 社区提供基础模型、工具链和赛事平台。