Upload docs/zh/EVALUATION.md with huggingface_hub
Browse files- docs/zh/EVALUATION.md +59 -0
docs/zh/EVALUATION.md
ADDED
|
@@ -0,0 +1,59 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
# 评估方法
|
| 2 |
+
|
| 3 |
+
本文档说明 **87.6% 登录命中率** 是如何测量的,保证结果可复现、可信。
|
| 4 |
+
|
| 5 |
+
## 核心原则
|
| 6 |
+
|
| 7 |
+
南+ 验证码没有公开的 ground truth 数据集,因此使用**真实论坛登录**作为唯一、100% 可靠的判定标准:
|
| 8 |
+
|
| 9 |
+
> **论坛返回"登录成功" = 模型识别正确**
|
| 10 |
+
> **论坛返回"认证码不正确或已过期" = 模型识别错误**
|
| 11 |
+
|
| 12 |
+
每次判定都是干净的二元结果,不依赖任何主观估计。
|
| 13 |
+
|
| 14 |
+
## 测试流程(逐次尝试)
|
| 15 |
+
|
| 16 |
+
1. **抓取登录页** → 解析表单与验证码 URL(带会话 cookie)
|
| 17 |
+
2. **抓取验证码图片**(带时间戳防缓存,150x60 PNG)
|
| 18 |
+
3. **模型推理** → 输出 4 位数字
|
| 19 |
+
4. **提交登录**(带会话 cookie + 表单隐藏字段 + 识别结果)
|
| 20 |
+
5. **读论坛响应** → 成功 / "认证码不正确"
|
| 21 |
+
6. **清空本地会话** → 下一次以全新游客身份开始
|
| 22 |
+
|
| 23 |
+
保证:
|
| 24 |
+
- 每张验证码绑定独立会话,识别与提交严格一一对应,无会话错位
|
| 25 |
+
- 失败响应用 `SP_DEBUG_LOGIN` 落盘逐条核对,确认为真实"认证码不正确",而非网络/风控
|
| 26 |
+
- 网络层干扰不计入统计
|
| 27 |
+
|
| 28 |
+
## 测试环境
|
| 29 |
+
|
| 30 |
+
| 项 | 值 |
|
| 31 |
+
|---|---|
|
| 32 |
+
| 站点 | south-plus.net |
|
| 33 |
+
| 网络 | 家庭 IP + Cloudflare IP 钉定(绕过 DNS 污染) |
|
| 34 |
+
| 请求间隔 | 7 秒(尊重论坛限流) |
|
| 35 |
+
| 账号 | 真实有效账号 |
|
| 36 |
+
| 模型 | captcha_1000_raw.onnx (88.6% val) |
|
| 37 |
+
|
| 38 |
+
## 结果
|
| 39 |
+
|
| 40 |
+
**100 次登录(最终正式测试)**
|
| 41 |
+
|
| 42 |
+
| 结果 | 次数 |
|
| 43 |
+
|---|---|
|
| 44 |
+
| 登录成功 | **85** |
|
| 45 |
+
| 认证码不正确 | 12 |
|
| 46 |
+
| 被论坛风控拦截(不计入) | 3 |
|
| 47 |
+
| 合计有效 | **97** |
|
| 48 |
+
|
| 49 |
+
**单次命中率 = 85/97 = 87.6%**
|
| 50 |
+
|
| 51 |
+
早期小样本:15 次测试 13/15 = 86.7%(供参考)。
|
| 52 |
+
|
| 53 |
+
**重试收益**:`P(6次内至少成功1次) = 1 - (1 - 0.876)^6 ≈ 99.9997%`,即平均 1 万次登录中约 3 次会在 6 次重试内全部失败。
|
| 54 |
+
|
| 55 |
+
## 置信度
|
| 56 |
+
|
| 57 |
+
- 100 次大样本 + 每次二元硬判定 → 统计置信度高
|
| 58 |
+
- 与 15 次小样本(86.7%)高度一致 → 结果稳定
|
| 59 |
+
- 留出验证集(79 张)88.6% 与登录命中 87.6% 接近 → 交叉印证
|