Text Classification
Transformers
Safetensors
English
Chinese
qwen3_5
image-text-to-text
decision-model
system-one
decision-index
lora-merged
model-soup
Instructions to use PelaAI/KnowLine-4B-Gen2 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use PelaAI/KnowLine-4B-Gen2 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-classification", model="PelaAI/KnowLine-4B-Gen2")# pip install -U transformers accelerate # Load model directly from transformers import AutoProcessor, AutoModelForMultimodalLM processor = AutoProcessor.from_pretrained("PelaAI/KnowLine-4B-Gen2") model = AutoModelForMultimodalLM.from_pretrained("PelaAI/KnowLine-4B-Gen2", device_map="auto") - Notebooks
- Google Colab
- Kaggle
|
Download README.zh.md from PelaAI/KnowLine-4B-Gen2: direct link, hf CLI and curl.
- Browser
- Download file 14.5 kB
-
https://huggingface.co/PelaAI/KnowLine-4B-Gen2/resolve/main/README.zh.md
- Command line
-
hf download hf://PelaAI/KnowLine-4B-Gen2/README.zh.md
-
curl -L -o README.zh.md https://huggingface.co/PelaAI/KnowLine-4B-Gen2/resolve/main/README.zh.md
14.5 kB
KnowLine-4B-Gen2
PelaAI 推出的 4B System One 决策模型第二版:由上一版 KnowLine-4B-Gen1 与新一轮训练的模型做权重平均得到。
推理说明 · English · 权重 Apache-2.0 · 上一版:KnowLine-4B-Gen1
新版本:KnowLine-4B-Gen3 已发布:DI 0.3 公开分 63.11。
亮点:
- Decision Index 0.3 公开套件:62.54(自测),比 Gen1(60.47)高 2.07。作为对照:Jev 1.13 为 57.96(榜单);榜单上 ≤5B 模型的最高公开分为 50.82,见横向对比。
- 自测评测全部不低于 Gen1:自建评测集留出部分(英 / 简 / 繁)69.7 / 71.2 / 64.8(Gen1 为 68.7 / 69.9 / 64.1),C-Eval 78.6(77.9);状态里植入的指令改变答案的比例从 8.9% 降到 4.0%。
- 校准更好:按榜单的方法计算,ECE 约 0.06-0.07(Gen1 约 0.08-0.09,榜单中位数 0.084);Brier 分数约 0.31-0.33,在榜单 113 个模型里约排第 3,见校准。
- 拳皇 '98 评测:对 Jev 1.13 为 14 胜 3 负 1 平,对 Gen1 为 13 胜 5 负(单回合同角色镜像对战),打法见游戏评测。
- 整个迭代循环由 AI Agent 端到端执行:分析模型在哪些领域效果不佳,提出针对性的数据组,构建数据并去污染,训练、评测,最后根据证据决定保留还是否决这次改动。这一版具体做了什么见本版做了什么。
KnowLine 是独立开发的模型,与 TypeSafe 或 Jev 没有隶属关系,未获其背书,也不是基于它们开发的。
它做什么
你发送一段状态(文本或对话)和最多 64 道带类型的问题:是/否、k 选一、按细则打分。模型对每道题给出各选项的概率分布:
- 每道题只做一次前向计算,不生成文本;
- 生成的是各选项标签 token 的概率;
- 现有 Jev 客户端只需修改 base URL 即可接入;Gen1 的用户换模型名即可,接口和推理设置都不变。
| 底座模型 | Qwen/Qwen3.5-4B(Apache-2.0) |
| 训练方式 | 两次 LoRA 监督微调(rank 32,alpha 64,只训语言模型部分)的结果合并后逐个张量平均:Gen1(训练运行 "mix E" 第 5,650 步)占 0.5,训练运行 "mix F" 的第 4,500 步和第 5,000 步各占 0.25。 |
| 发布格式 | bf16 权重;视觉部分和 MTP 头与底座相同,配置、分词器和对话模板与 Gen1 完全一致 |
| 语言 | 英文、简体中文、繁体中文 |
快速开始
pip install "sglang==0.5.21" "transformers==5.12.1" requests
bash serve_knowline.sh PelaAI/KnowLine-4B-Gen2 0 8080 # SGLang(加载时转 FP8)监听 :9080,/v1/systemone 监听 :8080
curl -s http://127.0.0.1:8080/v1/systemone -H 'Content-Type: application/json' -d '{
"model": "m",
"state": "Customer: my order arrived broken, I want my money back.",
"questions": {"refund": {"type": "noul", "instructions": "Should the agent offer a refund?"},
"tone": {"type": "choice", "instructions": "Customer tone?",
"criteria": {"angry": "Angry", "neutral": "Neutral", "happy": "Happy"}}}}'
- 不用 SGLang:
python knowline_server.py --model PelaAI/KnowLine-4B-Gen2 --backend hf --port 8080只依赖 transformers,速度较慢,精度为 bf16。 - 前端:
knowline_server.py是单个文件,只依赖 transformers 和 requests,与 Gen1 是同一个文件。 - 完整设置:我们跑 Decision Index 时的完整设置见 INFERENCE.md。
本版做了什么
- 找短板。 Gen1 在知识与推理(37.7)上最弱,在 JevBench 难题集等 Jev 风格的评测上也不如更早的内部版本。Agent 把后者追溯到数据配比:Gen1 的数据为了平衡各通道,把 Jev 风格的数据(OpenJevData 和合成题)削减了约 70%。
- 新一轮数据(mix F)。 在 Gen1 的数据上:
- 恢复全部 Jev 风格数据(OpenJevData 约 18 万行、合成题约 7.6 万行);
- 换上按行为均衡重做的格斗游戏数据;
- 新增一组针对 Decision Index 短板的数据:ACOS(只有 5% 答"是",带难负例)、WinoGrande XL 训练集,以及按 Decision Index 0.3 干扰项格式改写的 GSM8K 训练集。
- 新数据同样过一遍去污染。mix F 共约 105 万行(Gen1 的 mix E 约 71 万行)。
- 训练 mix F。 原计划 3 轮。第 1 轮之后模型开始记数据,DI 分数逐步下降,于是在第 8,455 步停止。单独使用时,mix F 的检查点在多数评测上不如 Gen1,但抗提示注入明显更好。
- 权重平均。 把 Gen1 和 mix F 的检查点按不同方式平均,共试了 7 种:
- 6 种只用一个 mix F 检查点(第 4,500 / 4,800 / 5,000 / 5,500 步,Gen1 占 0.4-0.6),DI 0.3 公开分都在 61.89-62.14 之间;
- 先把 mix F 第 4,500 步和第 5,000 步平均、再与 Gen1 各占一半,公开分 62.54,我们的自测评测也全部不低于 Gen1。这就是 Gen2。
- 涨分在哪里。 比 Gen1 高的 2.07 分里,约 1.35 分(约三分之二)来自三个基准:GSM8K(29.5 → 58.0)、ACOS(25.0 → 40.8)、WinoGrande(62.1 → 73.8)。它们的训练集在 mix F 中以 Decision Index 请求格式加入。其余来自 GPQA(16.3 → 23.8)、FinEntity、MuSR、BPoMP 等多个基准的提升;NLI4CT、iSarcasmEval 和 When2Call 略有下降。
横向对比
下表为 Decision Index 0.3 公开套件的分数。0.3 的总分还要加上只由维护者运行的私有测试(同技能 0.5、新领域 0.3),我们的总分暂时还没有。
| 模型 | 规模 | DI 0.3 公开分 | DI 0.3 总分 | 来源 |
|---|---|---|---|---|
| KnowLine-4B-Gen2 | 4B | 62.54 | 尚未评测 | 自测,官方工具包 |
| KnowLine-4B-Gen1 | 4B | 60.47 | 尚未评测 | 自测,官方工具包 |
| Clef | 27B | 61.71 | 53.08 | 榜单 |
| Jev 1.13 | (API) | 57.96 | 60.11 | 榜单 |
| RSI-Jev v6.1-VL | 4B | 50.98 | 未上榜 | 自报 |
| ezjev 4B s2 | 4B | 50.82 | 46.95 | 榜单 |
| jiwo 4B | 4B | 45.76 | 42.86 | 榜单 |
| Nox 4B | 4B | 44.21 | 44.95 | 榜单 |
各子领域的公开套件评分如下:
| 领域 | KnowLine-4B-Gen2(0.3 公开) | KnowLine-4B-Gen1(0.3 公开) | Jev 1.13(0.2.1) |
|---|---|---|---|
| 知识与推理 | 42.7 | 37.7 | 51.4 |
| 语言 | 63.3 | 60.8 | 62.0 |
| 检索与路由 | 71.3 | 70.9 | 55.4 |
| 工具与 Agent | 86.6 | 86.8 | 75.1 |
| 艺术与品味 | 50.2 | 49.5 | 37.7 |
版本
本模型使用自进化的模式进行训练,将持续产生新版本。
| 模型 | 日期 | DI 0.3 公开 | DI 0.2.1 | 黄金集留出(英 / 简 / 繁) | 说明 |
|---|---|---|---|---|---|
| KnowLine-4B-Gen3 | 2026-10-09 | 63.11 | — | 69.4 / 70.8 / 65.0 | 第三版 |
| KnowLine-4B-Gen2(本模型) | 2026-10-08 | 62.54 | — | 69.7 / 71.2 / 64.8 | Gen1 占 0.5,mix F 第 4,500、5,000 步各占 0.25,权重平均 |
| KnowLine-4B-Gen1 | 2026-10-07 | 60.47 | 60.92 | 68.7 / 69.9 / 64.1 | 首次发布(内部运行 "mix E",第 5,650 步) |
从 Gen2 起只跑 Decision Index 0.3,不再跑 0.2.1。
评测
以下结果均为自测,未经第三方复核。
留出评测与中文评测
| 测试集 | Gen2 | Gen1 |
|---|---|---|
| 自建评测数据集(英文部分) | 69.7 | 68.7 |
| 自建评测数据集(简体中文部分) | 71.2 | 69.9 |
| 自建评测数据集(繁体中文部分) | 64.8 | 64.1 |
| C-Eval(4 大类宏平均) | 78.6 | 77.9 |
| Open-Jev 1.1 测试 / OOD | 87.4 / 86.6 | 87.4 / 86.6 |
| 提示注入改变答案的比例(越低越好) | 4.0% | 8.9% |
网页操作(Mind2Web 官方测试集,仅用于评测)
| 划分 | Gen2 选元素 | Gen2 选操作(三类平均) | Gen1 选元素 | Gen1 选操作(三类平均) |
|---|---|---|---|---|
| test_task(训练中见过的网站、新任务) | 92.9 | 97.0 | 93.1 | 96.6 |
| test_website(新网站) | 90.8 | 97.3 | 90.7 | 96.5 |
| test_domain(新领域) | 91.7 | 97.4 | 91.5 | 98.5 |
- 与 Gen1 基本持平,差别在误差范围内。
- 目前仅用于探索该模型在 RPA 自动化等领域的情况,并验证存在一定的泛化性。
- 任务是从目标元素和页面上随机抽取的最多 5 个其他候选里选出目标,比 Mind2Web 原始评测简单,因此请勿与其排行榜比较。
游戏评测(拳皇 '98)
- 赛制:单回合同角色镜像对战,每组 18 局,每步选概率最高的动作,设置与 Gen1 的循环赛相同。
- 结果:对 Jev 1.13 为 14 胜 3 负 1 平,对 Gen1 为 13 胜 5 负,对 StartLux-Decision-4B 为 11 胜 7 负;合计 38 胜 15 负 1 平,得分率 0.713 [0.58, 0.82]。
- 打法:对 623C 对空升龙的依赖明显降低,使用率 24%(Gen1 在循环赛中约 55%),招式分布也更分散。会按距离选招:近身多用升龙和重拳,中距离多用必杀技 special_2 和重踢,远距离几乎都用 special_2。
- 说明:
- 每组只有 18 局,置信区间较宽。Gen1 在循环赛中对 Jev 为 17 胜 0 负 1 平,与 Gen2 的 14 胜 3 负 1 平差异不显著。
- 54 局中有 36 局以时间到结束,多数胜局按剩余血量判定,不是 K.O.。
- 这是在该评测环境中的实测结果,不代表具备全面的格斗游戏能力。
校准
按 Decision Index 榜单说明的方法,在 0.3 公开套件上计算:逐字段判断对错,置信度取所选选项的概率,各基准等权,10 个等宽分箱。
| 指标 | Gen2 | Gen1 | 榜单中位数(112 个模型) | Jev 1.13 |
|---|---|---|---|---|
| ECE(越低越好) | 0.06-0.07 | 0.08-0.09 | 0.084 | 0.074 |
| Brier 分数(越低越好) | 0.31-0.33 | 0.34-0.36 | 0.49 | 0.36 |
| 置信度 ≥95% 但答错的比例 | 2.2% | 3.3% | 1.3% | 2.1% |
| 平均置信度 / 准确率 | 0.83 / 0.76 | 0.84 / 0.74 | 0.81 / 0.74 |
- 为什么是区间:榜单没有公布具体用了哪 32 个基准。我们用三个公开了结果的榜单模型核对,自算的 ECE 与榜单值最多相差约 0.015,所以按几种可能的基准组合给出区间。
- 整体仍偏自信:平均置信度比准确率高约 7 个点。偏差集中在难推理题(HLE、CRUXEval)、幽默判断(Humicroedit)和颜色判断(cfcolor)。
- 建议:对概率阈值敏感的用法,请用自己的数据拟合一个温度。
披露
- Decision Index 格式的训练数据:Gen2 由两次训练的模型平均而来。mix E 中约 25%、mix F 中约 31% 的数据是 Decision Index 的请求格式,包括改写成这种格式的公开数据集训练集(例如 GSM8K、WinoGrande XL、ACOS),以及按同样格式编写的合成题。不含任何 Decision Index 测试题。
- 去污染:
- 训练数据里每个至少 60 个字符的文本片段(行或段落),都与所有 Decision Index 题目以及我们全部评测集的片段做了比对。
- 与任一评测片段完全相同,或前 50 个字符相同的训练行都已删除。出现在 4 道以上评测题里的通用文本视为模板,不参与比对。
- mix F 新增的约 23 万行没有被标出的;恢复的 Jev 风格数据来自之前已去污染的配比。
- 按评测挑选:7 种权重平均方式里,我们选了 DI 0.3 公开分最高、自测评测也全部不低于 Gen1 的一种。
- 游戏数据:标签来自模拟器推演或引擎,随机种子和起始局面都与评测局面不重叠。
- 不用模型输出作标签:从未把 Jev 或其他任何决策模型的输出用作训练标签。
- 教师模型标注的合成数据:合成任务由大语言模型教师编写和标注。标签经过筛选,但并非全部经过人工核对。
局限
- 知识密集型推理:弱于更大的模型。知识领域 42.7(0.3),MMLU-Pro、HLE 仍接近底座水平。
- 数学:没有推理过程。0.3 重建版 GSM8K 为 58.0,提升来自 GSM8K 训练集按同样格式改写后的训练。
- 提示注入:在我们的注入测试集上,状态里植入的指令约有 4% 的概率改变答案。请把不可信文本清楚地隔开。
- 校准:整体偏自信,见校准。
- 私有测试:我们在公开套件上的优势有一部分来自对题目格式的适应。Gen2 比 Gen1 多出的分数里,约三分之二来自训练集参与了训练的三个基准,0.3 私有测试的分数可能更低。
引用
@misc{knowline4bgen2,
title = {KnowLine-4B-Gen2: a 4B decision model},
author = {PelaAI},
year = {2026},
url = {https://huggingface.co/PelaAI/KnowLine-4B-Gen2}
}
许可证
- 权重:Apache-2.0,与底座模型相同。
- 代码:
knowline_server.py为 MIT 许可(见文件开头)。