KnowLine-4B-Gen2 / README.zh.md
PEScn's picture
README.zh.md: link KnowLine-4B-Gen3
8749d07 verified
|
Raw History Blame Contribute Delete
14.5 kB

KnowLine-4B-Gen2

PelaAI 推出的 4B System One 决策模型第二版:由上一版 KnowLine-4B-Gen1 与新一轮训练的模型做权重平均得到。

推理说明 · English · 权重 Apache-2.0 · 上一版:KnowLine-4B-Gen1

新版本:KnowLine-4B-Gen3 已发布:DI 0.3 公开分 63.11。

亮点:

  • Decision Index 0.3 公开套件:62.54(自测),比 Gen1(60.47)高 2.07。作为对照:Jev 1.13 为 57.96(榜单);榜单上 ≤5B 模型的最高公开分为 50.82,见横向对比。
  • 自测评测全部不低于 Gen1:自建评测集留出部分(英 / 简 / 繁)69.7 / 71.2 / 64.8(Gen1 为 68.7 / 69.9 / 64.1),C-Eval 78.6(77.9);状态里植入的指令改变答案的比例从 8.9% 降到 4.0%。
  • 校准更好:按榜单的方法计算,ECE 约 0.06-0.07(Gen1 约 0.08-0.09,榜单中位数 0.084);Brier 分数约 0.31-0.33,在榜单 113 个模型里约排第 3,见校准。
  • 拳皇 '98 评测:对 Jev 1.13 为 14 胜 3 负 1 平,对 Gen1 为 13 胜 5 负(单回合同角色镜像对战),打法见游戏评测。
  • 整个迭代循环由 AI Agent 端到端执行:分析模型在哪些领域效果不佳,提出针对性的数据组,构建数据并去污染,训练、评测,最后根据证据决定保留还是否决这次改动。这一版具体做了什么见本版做了什么。

KnowLine 是独立开发的模型,与 TypeSafe 或 Jev 没有隶属关系,未获其背书,也不是基于它们开发的。

它做什么

你发送一段状态(文本或对话)和最多 64 道带类型的问题:是/否、k 选一、按细则打分。模型对每道题给出各选项的概率分布:

  • 每道题只做一次前向计算,不生成文本;
  • 生成的是各选项标签 token 的概率;
  • 现有 Jev 客户端只需修改 base URL 即可接入;Gen1 的用户换模型名即可,接口和推理设置都不变。
底座模型 Qwen/Qwen3.5-4B(Apache-2.0)
训练方式 两次 LoRA 监督微调(rank 32,alpha 64,只训语言模型部分)的结果合并后逐个张量平均:Gen1(训练运行 "mix E" 第 5,650 步)占 0.5,训练运行 "mix F" 的第 4,500 步和第 5,000 步各占 0.25。
发布格式 bf16 权重;视觉部分和 MTP 头与底座相同,配置、分词器和对话模板与 Gen1 完全一致
语言 英文、简体中文、繁体中文

快速开始

pip install "sglang==0.5.21" "transformers==5.12.1" requests
bash serve_knowline.sh PelaAI/KnowLine-4B-Gen2 0 8080     # SGLang(加载时转 FP8)监听 :9080,/v1/systemone 监听 :8080
curl -s http://127.0.0.1:8080/v1/systemone -H 'Content-Type: application/json' -d '{
  "model": "m",
  "state": "Customer: my order arrived broken, I want my money back.",
  "questions": {"refund": {"type": "noul", "instructions": "Should the agent offer a refund?"},
                "tone": {"type": "choice", "instructions": "Customer tone?",
                         "criteria": {"angry": "Angry", "neutral": "Neutral", "happy": "Happy"}}}}'
  • 不用 SGLang:python knowline_server.py --model PelaAI/KnowLine-4B-Gen2 --backend hf --port 8080 只依赖 transformers,速度较慢,精度为 bf16。
  • 前端:knowline_server.py 是单个文件,只依赖 transformers 和 requests,与 Gen1 是同一个文件。
  • 完整设置:我们跑 Decision Index 时的完整设置见 INFERENCE.md。

本版做了什么

  1. 找短板。 Gen1 在知识与推理(37.7)上最弱,在 JevBench 难题集等 Jev 风格的评测上也不如更早的内部版本。Agent 把后者追溯到数据配比:Gen1 的数据为了平衡各通道,把 Jev 风格的数据(OpenJevData 和合成题)削减了约 70%。
  2. 新一轮数据(mix F)。 在 Gen1 的数据上:
    • 恢复全部 Jev 风格数据(OpenJevData 约 18 万行、合成题约 7.6 万行);
    • 换上按行为均衡重做的格斗游戏数据;
    • 新增一组针对 Decision Index 短板的数据:ACOS(只有 5% 答"是",带难负例)、WinoGrande XL 训练集,以及按 Decision Index 0.3 干扰项格式改写的 GSM8K 训练集。
    • 新数据同样过一遍去污染。mix F 共约 105 万行(Gen1 的 mix E 约 71 万行)。
  3. 训练 mix F。 原计划 3 轮。第 1 轮之后模型开始记数据,DI 分数逐步下降,于是在第 8,455 步停止。单独使用时,mix F 的检查点在多数评测上不如 Gen1,但抗提示注入明显更好。
  4. 权重平均。 把 Gen1 和 mix F 的检查点按不同方式平均,共试了 7 种:
    • 6 种只用一个 mix F 检查点(第 4,500 / 4,800 / 5,000 / 5,500 步,Gen1 占 0.4-0.6),DI 0.3 公开分都在 61.89-62.14 之间;
    • 先把 mix F 第 4,500 步和第 5,000 步平均、再与 Gen1 各占一半,公开分 62.54,我们的自测评测也全部不低于 Gen1。这就是 Gen2。
  5. 涨分在哪里。 比 Gen1 高的 2.07 分里,约 1.35 分(约三分之二)来自三个基准:GSM8K(29.5 → 58.0)、ACOS(25.0 → 40.8)、WinoGrande(62.1 → 73.8)。它们的训练集在 mix F 中以 Decision Index 请求格式加入。其余来自 GPQA(16.3 → 23.8)、FinEntity、MuSR、BPoMP 等多个基准的提升;NLI4CT、iSarcasmEval 和 When2Call 略有下降。

横向对比

下表为 Decision Index 0.3 公开套件的分数。0.3 的总分还要加上只由维护者运行的私有测试(同技能 0.5、新领域 0.3),我们的总分暂时还没有。

模型 规模 DI 0.3 公开分 DI 0.3 总分 来源
KnowLine-4B-Gen2 4B 62.54 尚未评测 自测,官方工具包
KnowLine-4B-Gen1 4B 60.47 尚未评测 自测,官方工具包
Clef 27B 61.71 53.08 榜单
Jev 1.13 (API) 57.96 60.11 榜单
RSI-Jev v6.1-VL 4B 50.98 未上榜 自报
ezjev 4B s2 4B 50.82 46.95 榜单
jiwo 4B 4B 45.76 42.86 榜单
Nox 4B 4B 44.21 44.95 榜单

各子领域的公开套件评分如下:

领域 KnowLine-4B-Gen2(0.3 公开) KnowLine-4B-Gen1(0.3 公开) Jev 1.13(0.2.1)
知识与推理 42.7 37.7 51.4
语言 63.3 60.8 62.0
检索与路由 71.3 70.9 55.4
工具与 Agent 86.6 86.8 75.1
艺术与品味 50.2 49.5 37.7

版本

本模型使用自进化的模式进行训练,将持续产生新版本。

模型 日期 DI 0.3 公开 DI 0.2.1 黄金集留出(英 / 简 / 繁) 说明
KnowLine-4B-Gen3 2026-10-09 63.11 — 69.4 / 70.8 / 65.0 第三版
KnowLine-4B-Gen2(本模型) 2026-10-08 62.54 — 69.7 / 71.2 / 64.8 Gen1 占 0.5,mix F 第 4,500、5,000 步各占 0.25,权重平均
KnowLine-4B-Gen1 2026-10-07 60.47 60.92 68.7 / 69.9 / 64.1 首次发布(内部运行 "mix E",第 5,650 步)

从 Gen2 起只跑 Decision Index 0.3,不再跑 0.2.1。

评测

以下结果均为自测,未经第三方复核。

留出评测与中文评测

测试集 Gen2 Gen1
自建评测数据集(英文部分) 69.7 68.7
自建评测数据集(简体中文部分) 71.2 69.9
自建评测数据集(繁体中文部分) 64.8 64.1
C-Eval(4 大类宏平均) 78.6 77.9
Open-Jev 1.1 测试 / OOD 87.4 / 86.6 87.4 / 86.6
提示注入改变答案的比例(越低越好) 4.0% 8.9%

网页操作(Mind2Web 官方测试集,仅用于评测)

划分 Gen2 选元素 Gen2 选操作(三类平均) Gen1 选元素 Gen1 选操作(三类平均)
test_task(训练中见过的网站、新任务) 92.9 97.0 93.1 96.6
test_website(新网站) 90.8 97.3 90.7 96.5
test_domain(新领域) 91.7 97.4 91.5 98.5
  • 与 Gen1 基本持平,差别在误差范围内。
  • 目前仅用于探索该模型在 RPA 自动化等领域的情况,并验证存在一定的泛化性。
  • 任务是从目标元素和页面上随机抽取的最多 5 个其他候选里选出目标,比 Mind2Web 原始评测简单,因此请勿与其排行榜比较。

游戏评测(拳皇 '98)

  • 赛制:单回合同角色镜像对战,每组 18 局,每步选概率最高的动作,设置与 Gen1 的循环赛相同。
  • 结果:对 Jev 1.13 为 14 胜 3 负 1 平,对 Gen1 为 13 胜 5 负,对 StartLux-Decision-4B 为 11 胜 7 负;合计 38 胜 15 负 1 平,得分率 0.713 [0.58, 0.82]。
  • 打法:对 623C 对空升龙的依赖明显降低,使用率 24%(Gen1 在循环赛中约 55%),招式分布也更分散。会按距离选招:近身多用升龙和重拳,中距离多用必杀技 special_2 和重踢,远距离几乎都用 special_2。
  • 说明:
    • 每组只有 18 局,置信区间较宽。Gen1 在循环赛中对 Jev 为 17 胜 0 负 1 平,与 Gen2 的 14 胜 3 负 1 平差异不显著。
    • 54 局中有 36 局以时间到结束,多数胜局按剩余血量判定,不是 K.O.。
    • 这是在该评测环境中的实测结果,不代表具备全面的格斗游戏能力。

校准

按 Decision Index 榜单说明的方法,在 0.3 公开套件上计算:逐字段判断对错,置信度取所选选项的概率,各基准等权,10 个等宽分箱。

指标 Gen2 Gen1 榜单中位数(112 个模型) Jev 1.13
ECE(越低越好) 0.06-0.07 0.08-0.09 0.084 0.074
Brier 分数(越低越好) 0.31-0.33 0.34-0.36 0.49 0.36
置信度 ≥95% 但答错的比例 2.2% 3.3% 1.3% 2.1%
平均置信度 / 准确率 0.83 / 0.76 0.84 / 0.74 0.81 / 0.74
  • 为什么是区间:榜单没有公布具体用了哪 32 个基准。我们用三个公开了结果的榜单模型核对,自算的 ECE 与榜单值最多相差约 0.015,所以按几种可能的基准组合给出区间。
  • 整体仍偏自信:平均置信度比准确率高约 7 个点。偏差集中在难推理题(HLE、CRUXEval)、幽默判断(Humicroedit)和颜色判断(cfcolor)。
  • 建议:对概率阈值敏感的用法,请用自己的数据拟合一个温度。

披露

  • Decision Index 格式的训练数据:Gen2 由两次训练的模型平均而来。mix E 中约 25%、mix F 中约 31% 的数据是 Decision Index 的请求格式,包括改写成这种格式的公开数据集训练集(例如 GSM8K、WinoGrande XL、ACOS),以及按同样格式编写的合成题。不含任何 Decision Index 测试题。
  • 去污染:
    • 训练数据里每个至少 60 个字符的文本片段(行或段落),都与所有 Decision Index 题目以及我们全部评测集的片段做了比对。
    • 与任一评测片段完全相同,或前 50 个字符相同的训练行都已删除。出现在 4 道以上评测题里的通用文本视为模板,不参与比对。
    • mix F 新增的约 23 万行没有被标出的;恢复的 Jev 风格数据来自之前已去污染的配比。
  • 按评测挑选:7 种权重平均方式里,我们选了 DI 0.3 公开分最高、自测评测也全部不低于 Gen1 的一种。
  • 游戏数据:标签来自模拟器推演或引擎,随机种子和起始局面都与评测局面不重叠。
  • 不用模型输出作标签:从未把 Jev 或其他任何决策模型的输出用作训练标签。
  • 教师模型标注的合成数据:合成任务由大语言模型教师编写和标注。标签经过筛选,但并非全部经过人工核对。

局限

  • 知识密集型推理:弱于更大的模型。知识领域 42.7(0.3),MMLU-Pro、HLE 仍接近底座水平。
  • 数学:没有推理过程。0.3 重建版 GSM8K 为 58.0,提升来自 GSM8K 训练集按同样格式改写后的训练。
  • 提示注入:在我们的注入测试集上,状态里植入的指令约有 4% 的概率改变答案。请把不可信文本清楚地隔开。
  • 校准:整体偏自信,见校准。
  • 私有测试:我们在公开套件上的优势有一部分来自对题目格式的适应。Gen2 比 Gen1 多出的分数里,约三分之二来自训练集参与了训练的三个基准,0.3 私有测试的分数可能更低。

引用

@misc{knowline4bgen2,
  title  = {KnowLine-4B-Gen2: a 4B decision model},
  author = {PelaAI},
  year   = {2026},
  url    = {https://huggingface.co/PelaAI/KnowLine-4B-Gen2}
}

许可证

  • 权重:Apache-2.0,与底座模型相同。
  • 代码:knowline_server.py 为 MIT 许可(见文件开头)。