--- language: - zh - en license: apache-2.0 base_model: PaddlePaddle/PaddleOCR-VL-1.6 pipeline_tag: image-text-to-text tags: - paddleocr - ocr - vision-language - code-ocr - developer-tools --- # PaddleOCR-VL-1.6 开发场景代码 OCR 微调模型 本模型基于 PaddleOCR-VL-1.6 微调,面向 IDE、终端、Traceback、配置、Git diff、文档代码块、API 表格和多区域开发截图中的结构保真 OCR。当前模型版本为 v6,并作为 PaddleOCR 全球衍生模型挑战赛决赛冻结方案。 在线体验:[PaddleOCR-VL 开发场景代码 OCR Demo](https://huggingface.co/spaces/snnh/paddleocr-vl-code-ocr-demo)。Space 使用 CPU 免费硬件时会降低 token 上限以控制等待时间,正式 Benchmark 以本地 GPU 参数为准。 ## Demo 实测 ![模型 v6 在 CUDA 环境完成开发场景 OCR](assets/demo_cuda_20s.png) 图中一次 CUDA 推理耗时 20.4 秒,使用 `max_new_tokens=4096`、`repetition_penalty=1.08`、`max_time=90s`、`run_timeout=120s`。 ## 使用方法 推荐提示词: ```text OCR: ``` 正式推理参数: ```text max_tokens=4096 repetition_penalty=1.08 temperature=0 ``` 输出只应包含图片中的可见文字,不应解释、总结、补全或修复代码。不同提示词和采样参数可能显著改变输出风格与 Benchmark 结果。 ## 训练概况 - 基础模型:`PaddlePaddle/PaddleOCR-VL-1.6`。 - 微调方式:LoRA 后导出合并模型。 - 训练提示词:`OCR:`。 - 最大序列长度:16384。 - 训练快照:1102 条开发场景 OCR 样本。 - 数据范围:IDE、终端、报错日志、配置文件、diff、文档代码块、API 表格及困难画面。 | 组成 | 数量 | 来源与处理 | | --- | ---: | --- | | 混合截图 | 436 | 联网采集的合规公开开发截图,经二次加工,以及项目作者手动截图 | | 代码渲染图 | 258 | 代码、配置、命令、日志和文档片段的本地渲染图 | | 人工筛选批次 | 360 | 388 张候选经模型分类、人工筛选和审计后保留 | | 人工转写补充 | 48 | 受研究用途许可约束的 IDE 候选经人工转写和筛选 | 新批次采用“项目作者准备—第一模型预标注—第二模型复核—项目作者终审—脚本审计”的流程。模型结果只作为草稿或差异意见,不直接成为最终真值。训练数据不随模型或本仓库发布;公开截图和第三方素材仍受其原始许可约束。冻结审计中训练集与 304 题测试集图片 SHA-256 重叠为 0。 完整来源、人员职责、终审规则和测试集隔离说明见 [决赛最终版训练数据构建报告](https://github.com/snnh/paddleocr-vl-code-ocr/blob/main/docs/%E8%AE%AD%E7%BB%83%E6%95%B0%E6%8D%AE%E6%9E%84%E5%BB%BA%E6%8A%A5%E5%91%8A.md)。 ## Benchmark v5.2 Benchmark v5 内容版本 5.2 共 304 题,覆盖 P01-P09 九类开发场景和 simple、medium、hard 三档难度。模型 v6 按正式参数完成 304/304 推理,并使用 `tencent/hy3:free`、reasoning 关闭的统一六维裁判口径计分。 | 指标 | 结果 | | --- | ---: | | `final_score_v5` | **58.4427** | | 原始积分 | 60.3374 | | 类别加权分 | 72.8633 | | 全局样本均值 | 73.3494 | | 严格可用率 | 38.1579% | | 完成率 | 99.0132% | | 安全分 | 90.7895% | | 平均 NED | 0.1744 | LLM 裁判存在约 `±0.5` 的展示误差。v5.2 不应与 v4、其他内容版本或不同提示词组直接混排。完整规则与对照结果见 [GitHub Benchmark v5](https://github.com/snnh/paddleocr-vl-code-ocr/blob/main/docs/ocr_benchmark_v5.md)。 ## 适用场景 - 从 IDE、终端和调试工具截图中提取可搜索文本。 - 转写配置、日志、Traceback、diff 和 API 表格。 - 为开发文档归档、问题排查或辅助标注提供 OCR 草稿。 ## 局限性 - 复杂 API 表格、长 Traceback、多区域界面和深层嵌套配置仍可能发生阅读顺序或结构错误。 - 极小字号、模糊拍屏、压缩伪影和罕见符号会降低准确率。 - 模型可能漏字、误认符号或重复文本;重要输出必须人工复核。 - 本模型用于转写,不应视为代码生成、代码修复或安全分析工具。 ## 许可 模型权重和仓库代码按 Apache License 2.0 发布。第三方训练素材不随模型重新分发或重新授权,仍受各自许可和使用条款约束。 ## 致谢 感谢 PaddleOCR 与 PaddlePaddle 社区提供基础模型、工具链和赛事平台。