KnowLine-4B-Gen3 / README.zh.md
PEScn's picture
README.zh.md: model card
d0dad89 verified
|
Raw History Blame Contribute Delete
13.7 kB

KnowLine-4B-Gen3

PelaAI 推出的 4B System One 决策模型第三版,在单台一体机上,由 Agent 驱动的数据迭代循环训练出来。

推理说明 · English · 权重 Apache-2.0 · 上一版:KnowLine-4B-Gen2

亮点:

  • Decision Index 0.3 公开套件:63.11(自测),比 Gen2(62.54)高 0.57。作为对照:Perplexity Decider v1.1(27B)为 62.25,Jev 1.13 为 57.96(榜单);榜单上 ≤5B 模型的最高公开分为 50.82,见横向对比。
  • Jev 风格评测和中文评测超过 Gen2:Open-Jev 1.1 测试 / OOD 88.4 / 87.2(Gen2 为 87.4 / 86.6),C-Eval 79.2(78.6);状态里植入的指令改变答案的比例从 4.0% 降到 3.4%。
  • 校准:按榜单的方法计算,Brier 分数约 0.31-0.33,在榜单 114 个模型里约排第 3;ECE 约 0.07-0.08(榜单中位数 0.084),见校准。
  • 拳皇 '98 评测:对 Jev 1.13 为 16 胜 1 负 1 平,对 StartLux-Decision-4B 为 12 胜 4 负 2 平(单回合同角色镜像对战),打法见游戏评测。
  • 整个迭代循环由 AI Agent 端到端执行:分析模型在哪些领域效果不佳,提出针对性的数据组,构建数据并去污染,训练、评测,最后根据证据决定保留还是否决这次改动。这一版具体做了什么见本版做了什么。

KnowLine 是独立开发的模型,与 TypeSafe 或 Jev 没有隶属关系,未获其背书,也不是基于它们开发的。

它做什么

你发送一段状态(文本或对话)和最多 64 道带类型的问题:是/否、k 选一、按细则打分。模型对每道题给出各选项的概率分布:

  • 每道题只做一次前向计算,不生成文本;
  • 生成的是各选项标签 token 的概率;
  • 现有 Jev 客户端只需修改 base URL 即可接入;Gen1、Gen2 的用户换模型名即可,接口和推理设置都不变。
底座模型 Qwen/Qwen3.5-4B(Apache-2.0)
训练方式 LoRA 监督微调(rank 32,alpha 64,只训语言模型部分),合并为 bf16 权重
发布格式 bf16 权重;视觉部分和 MTP 头与底座相同,配置、分词器和对话模板与 Gen1、Gen2 完全一致
语言 英文、简体中文、繁体中文

快速开始

pip install "sglang==0.5.21" "transformers==5.12.1" requests
bash serve_knowline.sh PelaAI/KnowLine-4B-Gen3 0 8080     # SGLang(加载时转 FP8)监听 :9080,/v1/systemone 监听 :8080
curl -s http://127.0.0.1:8080/v1/systemone -H 'Content-Type: application/json' -d '{
  "model": "m",
  "state": "Customer: my order arrived broken, I want my money back.",
  "questions": {"refund": {"type": "noul", "instructions": "Should the agent offer a refund?"},
                "tone": {"type": "choice", "instructions": "Customer tone?",
                         "criteria": {"angry": "Angry", "neutral": "Neutral", "happy": "Happy"}}}}'
  • 不用 SGLang:python knowline_server.py --model PelaAI/KnowLine-4B-Gen3 --backend hf --port 8080 只依赖 transformers,速度较慢,精度为 bf16。
  • 前端:knowline_server.py 是单个文件,只依赖 transformers 和 requests,与 Gen2 是同一个文件。
  • 完整设置:我们跑 Decision Index 时的完整设置见 INFERENCE.md。

本版做了什么

  1. 找短板。 Gen2 仍是知识与推理(42.7)最弱。
  2. 新一轮数据。 在上一轮数据的基础上,新增一组知识回放:来自公开数据集训练集的选择题,覆盖通识、科学、医学、数学应用题和逻辑,中英文都有。这些题都不来自 Decision Index 的基准,新数据同样过一遍去污染。
  3. 训练。 只训 1 轮,学习率一直衰减到底。知识回放让知识与推理略有提升,但艺术领域的 BPoMP 掉了分。
  4. 挑选。 本轮共比较了 13 个候选,DI 0.3 公开分在 62.54-63.25 之间。选中的 Gen3 的 DI 0.3 公开分数为 63.11,与最高分的差距在误差范围内;在 13 个候选里,它的 Jev 风格评测(JevBench 86.6、JevBench 难题集 72.1)和 C-Eval(79.2)最好,泛化(Open-Jev 1.1 OOD 87.2)也在前列。
  5. 涨分在哪里。 比 Gen2 高的分数分散在多个基准上,提升最多的是 NLI4CT(57.6 → 62.3)、CRUXEval(38.8 → 44.0)、WinoGrande(73.8 → 78.8)、RAGTruth(53.3 → 56.8)和 GSM8K(58.0 → 61.5)。WinoGrande 和 GSM8K 的训练集以 Decision Index 请求格式参与了训练。BPoMP(59.4 → 54.5)和 PhishNChips(95.0 → 92.0)有所下降。

横向对比

下表为 Decision Index 0.3 公开套件的分数。0.3 的总分还要加上只由维护者运行的私有测试(同技能 0.5、新领域 0.3),我们的总分暂时还没有。

模型 规模 DI 0.3 公开分 DI 0.3 总分 来源
KnowLine-4B-Gen3 4B 63.11 尚未评测 自测,官方工具包
KnowLine-4B-Gen2 4B 62.54 尚未评测 自测,官方工具包
KnowLine-4B-Gen1 4B 60.47 尚未评测 自测,官方工具包
Perplexity Decider v1.1 27B 62.25 62.75 榜单
Clef 27B 61.71 53.08 榜单
Jev 1.13 (API) 57.96 60.11 榜单
RSI-Jev v6.1-VL 4B 50.98 未上榜 自报
ezjev 4B s2 4B 50.82 46.95 榜单
jiwo 4B 4B 45.76 42.86 榜单
Nox 4B 4B 44.21 44.95 榜单

各子领域的公开套件评分如下(均为 0.3 公开):

领域 KnowLine-4B-Gen3 KnowLine-4B-Gen2 Perplexity Decider v1.1(27B) Jev 1.13
知识与推理 43.9 42.7 52.0 53.9
语言 64.8 63.3 67.5 59.2
检索与路由 70.9 71.3 61.3 55.4
工具与 Agent 86.6 86.6 78.9 75.1
艺术与品味 49.8 50.2 47.0 39.1

版本

本模型使用自进化的模式进行训练,将持续产生新版本。

模型 日期 DI 0.3 公开 DI 0.2.1 黄金集留出(英 / 简 / 繁) 说明
KnowLine-4B-Gen3(本模型) 2026-10-09 63.11 — 69.4 / 70.8 / 65.0 第三版
KnowLine-4B-Gen2 2026-10-08 62.54 — 69.7 / 71.2 / 64.8 第二版
KnowLine-4B-Gen1 2026-10-07 60.47 60.92 68.7 / 69.9 / 64.1 首次发布

从 Gen2 起只跑 Decision Index 0.3,不再跑 0.2.1。

评测

以下结果均为自测,未经第三方复核。

留出评测与中文评测

测试集 Gen3 Gen2
自建评测数据集(英文部分) 69.4 69.7
自建评测数据集(简体中文部分) 70.8 71.2
自建评测数据集(繁体中文部分) 65.0 64.8
C-Eval(4 大类宏平均) 79.2 78.6
Open-Jev 1.1 测试 / OOD 88.4 / 87.2 87.4 / 86.6
提示注入改变答案的比例(越低越好) 3.4% 4.0%

网页操作(Mind2Web 官方测试集,仅用于评测)

划分 Gen3 选元素 Gen3 选操作(三类平均) Gen2 选元素 Gen2 选操作(三类平均)
test_task(训练中见过的网站、新任务) 92.7 97.0 92.9 97.0
test_website(新网站) 91.3 97.3 90.8 97.3
test_domain(新领域) 91.8 97.2 91.7 97.4
  • 与 Gen2 基本持平,差别在误差范围内。
  • 目前仅用于探索该模型在 RPA 自动化等领域的情况,并验证存在一定的泛化性。
  • 任务是从目标元素和页面上随机抽取的最多 5 个其他候选里选出目标,比 Mind2Web 原始评测简单,因此请勿与其排行榜比较。

游戏评测(拳皇 '98)

  • 赛制:单回合同角色镜像对战,每组 18 局,每步选概率最高的动作,设置与 Gen1 的循环赛和 Gen2 的对战相同。
  • 结果:对 Jev 1.13 为 16 胜 1 负 1 平,对 StartLux-Decision-4B 为 12 胜 4 负 2 平,对 Gen2 为 4 胜 14 负;合计 32 胜 19 负 3 平,得分率 0.620 [0.49, 0.74]。
  • 打法:会按距离选招:近身多用 623C 对空升龙(75%),中距离多用必杀技 special_2 和重踢,远距离几乎都用 special_2;整体升龙使用率 23%。
  • 说明:
    • 每组只有 18 局,置信区间较宽。
    • 54 局中有 37 局以时间到结束,多数胜局按剩余血量判定;Gen3 有 8 局是 K.O. 获胜(对 Jev 2 局、对 StartLux 4 局、对 Gen2 2 局)。
    • 这是在该评测环境中的实测结果,不代表具备全面的格斗游戏能力。

校准

按 Decision Index 榜单说明的方法,在 0.3 公开套件上计算:逐字段判断对错,置信度取所选选项的概率,各基准等权,10 个等宽分箱。

指标 Gen3 Gen2 榜单中位数(114 个模型) Jev 1.13
ECE(越低越好) 0.07-0.08 0.06-0.07 0.084 0.074
Brier 分数(越低越好) 0.31-0.33 0.31-0.33 0.49 0.36
置信度 ≥95% 但答错的比例 2.7% 2.2% 1.3% 2.1%
平均置信度 / 准确率 0.84 / 0.76 0.83 / 0.76 0.81 / 0.74
  • 为什么是区间:榜单没有公布具体用了哪 32 个基准。我们用三个公开了结果的榜单模型核对,自算的 ECE 与榜单值最多相差约 0.015,所以按几种可能的基准组合给出区间。
  • 整体仍偏自信:平均置信度比准确率高约 7-8 个点。偏差集中在难推理题(HLE、CRUXEval、MuSR)和幽默判断(Humicroedit、New Yorker 漫画配文)。
  • 建议:对概率阈值敏感的用法,请用自己的数据拟合一个温度。

披露

  • Decision Index 格式的训练数据:Gen3 来自三轮训练,每轮约 25%-31% 的数据是 Decision Index 的请求格式,包括改写成这种格式的公开数据集训练集(例如 GSM8K、WinoGrande XL、ACOS),以及按同样格式编写的合成题。不含任何 Decision Index 测试题。
  • 去污染:
    • 训练数据里每个至少 60 个字符的文本片段(行或段落),都与所有 Decision Index 题目以及我们全部评测集的片段做了比对。
    • 与任一评测片段完全相同,或前 50 个字符相同的训练行都已删除。出现在 4 道以上评测题里的通用文本视为模板,不参与比对。
    • 本轮新增的数据没有被标出的;其余数据在之前几轮已去污染。
  • 按评测挑选:13 种权重平均方式里,我们选了 DI 0.3 公开分与最高分的差距在误差范围内、Jev 风格评测也最好的一种。
  • 游戏数据:标签来自模拟器推演或引擎,随机种子和起始局面都与评测局面不重叠。
  • 不用模型输出作标签:从未把 Jev 或其他任何决策模型的输出用作训练标签。
  • 教师模型标注的合成数据:合成任务由大语言模型教师编写和标注。标签经过筛选,但并非全部经过人工核对。

局限

  • 知识密集型推理:弱于更大的模型。知识领域 43.9(0.3);MMLU-Pro(51.7)变化不大,HLE 仍在随机水平。
  • 数学:没有推理过程。0.3 重建版 GSM8K 为 61.5,提升来自 GSM8K 训练集按同样格式改写后的训练。
  • 提示注入:在我们的注入测试集上,状态里植入的指令约有 3% 的概率改变答案。请把不可信文本清楚地隔开。
  • 校准:整体偏自信,见校准。
  • 私有测试:我们在公开套件上的优势有一部分来自对题目格式的适应。Gen3 比 Gen2 涨得最多的基准里,有的训练集参与了训练,0.3 私有测试的分数可能更低。

引用

@misc{knowline4bgen3,
  title  = {KnowLine-4B-Gen3: a 4B decision model},
  author = {PelaAI},
  year   = {2026},
  url    = {https://huggingface.co/PelaAI/KnowLine-4B-Gen3}
}

许可证

  • 权重:Apache-2.0,与底座模型相同。
  • 代码:knowline_server.py 为 MIT 许可(见文件开头)。