Text Classification
Transformers
Safetensors
English
Chinese
qwen3_5
image-text-to-text
decision-model
system-one
decision-index
lora-merged
model-soup
Instructions to use PelaAI/KnowLine-4B-Gen2 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use PelaAI/KnowLine-4B-Gen2 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-classification", model="PelaAI/KnowLine-4B-Gen2")# pip install -U transformers accelerate # Load model directly from transformers import AutoProcessor, AutoModelForMultimodalLM processor = AutoProcessor.from_pretrained("PelaAI/KnowLine-4B-Gen2") model = AutoModelForMultimodalLM.from_pretrained("PelaAI/KnowLine-4B-Gen2", device_map="auto") - Notebooks
- Google Colab
- Kaggle
|
Download README.zh.md from PelaAI/KnowLine-4B-Gen2: direct link, hf CLI and curl.
- Browser
- Download file 14.7 kB
-
https://huggingface.co/PelaAI/KnowLine-4B-Gen2/resolve/main/README.zh.md
- Command line
-
hf download hf://PelaAI/KnowLine-4B-Gen2/README.zh.md
-
curl -L -o README.zh.md https://huggingface.co/PelaAI/KnowLine-4B-Gen2/resolve/main/README.zh.md
14.7 kB
| # KnowLine-4B-Gen2 | |
| **PelaAI 推出的 4B System One 决策模型第二版:由上一版 KnowLine-4B-Gen1 与新一轮训练的模型做权重平均得到。** | |
| [推理说明](INFERENCE.md) · [English](README.md) · 权重 Apache-2.0 · 上一版:[KnowLine-4B-Gen1](https://huggingface.co/PelaAI/KnowLine-4B-Gen1) | |
| > **新版本**:[KnowLine-4B-Gen3](https://huggingface.co/PelaAI/KnowLine-4B-Gen3) 已发布:DI 0.3 公开分 63.11。 | |
| 亮点: | |
| - **Decision Index 0.3 公开套件:62.54**(自测),比 Gen1(60.47)高 2.07。作为对照:Jev 1.13 为 57.96(榜单);榜单上 ≤5B 模型的最高公开分为 50.82,见[横向对比](#横向对比)。 | |
| - **自测评测全部不低于 Gen1**:自建评测集留出部分(英 / 简 / 繁)69.7 / 71.2 / 64.8(Gen1 为 68.7 / 69.9 / 64.1),C-Eval 78.6(77.9);状态里植入的指令改变答案的比例从 8.9% 降到 4.0%。 | |
| - **校准更好**:按榜单的方法计算,ECE 约 0.06-0.07(Gen1 约 0.08-0.09,榜单中位数 0.084);Brier 分数约 0.31-0.33,在榜单 113 个模型里约排第 3,见[校准](#校准)。 | |
| - **拳皇 '98 评测:对 Jev 1.13 为 14 胜 3 负 1 平,对 Gen1 为 13 胜 5 负**(单回合同角色镜像对战),打法见[游戏评测](#游戏评测拳皇-98)。 | |
| - 整个迭代循环由 AI Agent 端到端执行:分析模型在哪些领域效果不佳,提出针对性的数据组,构建数据并去污染,训练、评测,最后根据证据决定保留还是否决这次改动。这一版具体做了什么见[本版做了什么](#本版做了什么)。 | |
| KnowLine 是独立开发的模型,与 TypeSafe 或 Jev 没有隶属关系,未获其背书,也不是基于它们开发的。 | |
| ## 它做什么 | |
| 你发送一段状态(文本或对话)和最多 64 道带类型的问题:是/否、k 选一、按细则打分。模型对每道题给出各选项的概率分布: | |
| - 每道题只做一次前向计算,不生成文本; | |
| - 生成的是各选项标签 token 的概率; | |
| - 现有 Jev 客户端只需修改 base URL 即可接入;Gen1 的用户换模型名即可,接口和推理设置都不变。 | |
| | | | | |
| | ---- | ---- | | |
| | 底座模型 | [Qwen/Qwen3.5-4B](https://huggingface.co/Qwen/Qwen3.5-4B)(Apache-2.0) | | |
| | 训练方式 | 两次 LoRA 监督微调(rank 32,alpha 64,只训语言模型部分)的结果合并后逐个张量平均:Gen1(训练运行 "mix E" 第 5,650 步)占 0.5,训练运行 "mix F" 的第 4,500 步和第 5,000 步各占 0.25。 | | |
| | 发布格式 | bf16 权重;视觉部分和 MTP 头与底座相同,配置、分词器和对话模板与 Gen1 完全一致 | | |
| | 语言 | 英文、简体中文、繁体中文 | | |
| ## 快速开始 | |
| ```bash | |
| pip install "sglang==0.5.21" "transformers==5.12.1" requests | |
| bash serve_knowline.sh PelaAI/KnowLine-4B-Gen2 0 8080 # SGLang(加载时转 FP8)监听 :9080,/v1/systemone 监听 :8080 | |
| curl -s http://127.0.0.1:8080/v1/systemone -H 'Content-Type: application/json' -d '{ | |
| "model": "m", | |
| "state": "Customer: my order arrived broken, I want my money back.", | |
| "questions": {"refund": {"type": "noul", "instructions": "Should the agent offer a refund?"}, | |
| "tone": {"type": "choice", "instructions": "Customer tone?", | |
| "criteria": {"angry": "Angry", "neutral": "Neutral", "happy": "Happy"}}}}' | |
| ``` | |
| - **不用 SGLang**:`python knowline_server.py --model PelaAI/KnowLine-4B-Gen2 --backend hf --port 8080` 只依赖 transformers,速度较慢,精度为 bf16。 | |
| - **前端**:`knowline_server.py` 是单个文件,只依赖 transformers 和 requests,与 Gen1 是同一个文件。 | |
| - **完整设置**:我们跑 Decision Index 时的完整设置见 [INFERENCE.md](INFERENCE.md)。 | |
| ## 本版做了什么 | |
| 1. **找短板。** Gen1 在知识与推理(37.7)上最弱,在 JevBench 难题集等 Jev 风格的评测上也不如更早的内部版本。Agent 把后者追溯到数据配比:Gen1 的数据为了平衡各通道,把 Jev 风格的数据(OpenJevData 和合成题)削减了约 70%。 | |
| 2. **新一轮数据(mix F)。** 在 Gen1 的数据上: | |
| - 恢复全部 Jev 风格数据(OpenJevData 约 18 万行、合成题约 7.6 万行); | |
| - 换上按行为均衡重做的格斗游戏数据; | |
| - 新增一组针对 Decision Index 短板的数据:ACOS(只有 5% 答"是",带难负例)、WinoGrande XL 训练集,以及按 Decision Index 0.3 干扰项格式改写的 GSM8K 训练集。 | |
| - 新数据同样过一遍去污染。mix F 共约 105 万行(Gen1 的 mix E 约 71 万行)。 | |
| 3. **训练 mix F。** 原计划 3 轮。第 1 轮之后模型开始记数据,DI 分数逐步下降,于是在第 8,455 步停止。单独使用时,mix F 的检查点在多数评测上不如 Gen1,但抗提示注入明显更好。 | |
| 4. **权重平均。** 把 Gen1 和 mix F 的检查点按不同方式平均,共试了 7 种: | |
| - 6 种只用一个 mix F 检查点(第 4,500 / 4,800 / 5,000 / 5,500 步,Gen1 占 0.4-0.6),DI 0.3 公开分都在 61.89-62.14 之间; | |
| - 先把 mix F 第 4,500 步和第 5,000 步平均、再与 Gen1 各占一半,公开分 62.54,我们的自测评测也全部不低于 Gen1。这就是 Gen2。 | |
| 5. **涨分在哪里。** 比 Gen1 高的 2.07 分里,约 1.35 分(约三分之二)来自三个基准:GSM8K(29.5 → 58.0)、ACOS(25.0 → 40.8)、WinoGrande(62.1 → 73.8)。它们的训练集在 mix F 中以 Decision Index 请求格式加入。其余来自 GPQA(16.3 → 23.8)、FinEntity、MuSR、BPoMP 等多个基准的提升;NLI4CT、iSarcasmEval 和 When2Call 略有下降。 | |
| ## 横向对比 | |
| 下表为 Decision Index 0.3 公开套件的分数。0.3 的总分还要加上只由维护者运行的私有测试(同技能 0.5、新领域 0.3),我们的总分暂时还没有。 | |
| | 模型 | 规模 | DI 0.3 公开分 | DI 0.3 总分 | 来源 | | |
| | -------------------- | ----- | ---------- | --------- | -------- | | |
| | **KnowLine-4B-Gen2** | 4B | **62.54** | 尚未评测 | 自测,官方工具包 | | |
| | KnowLine-4B-Gen1 | 4B | 60.47 | 尚未评测 | 自测,官方工具包 | | |
| | Clef | 27B | 61.71 | 53.08 | 榜单 | | |
| | Jev 1.13 | (API) | 57.96 | 60.11 | 榜单 | | |
| | RSI-Jev v6.1-VL | 4B | 50.98 | 未上榜 | 自报 | | |
| | ezjev 4B s2 | 4B | 50.82 | 46.95 | 榜单 | | |
| | jiwo 4B | 4B | 45.76 | 42.86 | 榜单 | | |
| | Nox 4B | 4B | 44.21 | 44.95 | 榜单 | | |
| 各子领域的公开套件评分如下: | |
| | 领域 | KnowLine-4B-Gen2(0.3 公开) | KnowLine-4B-Gen1(0.3 公开) | Jev 1.13(0.2.1) | | |
| | --------- | ------------------------ | ------------------------ | --------------- | | |
| | 知识与推理 | 42.7 | 37.7 | 51.4 | | |
| | 语言 | 63.3 | 60.8 | 62.0 | | |
| | 检索与路由 | 71.3 | 70.9 | 55.4 | | |
| | 工具与 Agent | 86.6 | 86.8 | 75.1 | | |
| | 艺术与品味 | 50.2 | 49.5 | 37.7 | | |
| ## 版本 | |
| 本模型使用自进化的模式进行训练,将持续产生新版本。 | |
| | 模型 | 日期 | DI 0.3 公开 | DI 0.2.1 | 黄金集留出(英 / 简 / 繁) | 说明 | | |
| | --------------------- | ---------- | --------- | -------- | ------------------ | ---------------------------- | | |
| | [KnowLine-4B-Gen4](https://huggingface.co/PelaAI/KnowLine-4B-Gen4) | 2026-10-10 | 64.90 | — | 69.7 / 70.1 / 65.1 | 第四版 | | |
| | [KnowLine-4B-Gen3](https://huggingface.co/PelaAI/KnowLine-4B-Gen3) | 2026-10-09 | 63.11 | — | 69.4 / 70.8 / 65.0 | 第三版 | | |
| | KnowLine-4B-Gen2(本模型) | 2026-10-08 | 62.54 | — | 69.7 / 71.2 / 64.8 | Gen1 占 0.5,mix F 第 4,500、5,000 步各占 0.25,权重平均 | | |
| | [KnowLine-4B-Gen1](https://huggingface.co/PelaAI/KnowLine-4B-Gen1) | 2026-10-07 | 60.47 | 60.92 | 68.7 / 69.9 / 64.1 | 首次发布(内部运行 "mix E",第 5,650 步) | | |
| 从 Gen2 起只跑 Decision Index 0.3,不再跑 0.2.1。 | |
| ## 评测 | |
| 以下结果均为自测,未经第三方复核。 | |
| ### 留出评测与中文评测 | |
| | 测试集 | Gen2 | Gen1 | | |
| | --------------------- | ----------- | ----------- | | |
| | 自建评测数据集(英文部分) | 69.7 | 68.7 | | |
| | 自建评测数据集(简体中文部分) | 71.2 | 69.9 | | |
| | 自建评测数据集(繁体中文部分) | 64.8 | 64.1 | | |
| | C-Eval(4 大类宏平均) | 78.6 | 77.9 | | |
| | Open-Jev 1.1 测试 / OOD | 87.4 / 86.6 | 87.4 / 86.6 | | |
| | 提示注入改变答案的比例(越低越好) | 4.0% | 8.9% | | |
| ### 网页操作(Mind2Web 官方测试集,仅用于评测) | |
| | 划分 | Gen2 选元素 | Gen2 选操作(三类平均) | Gen1 选元素 | Gen1 选操作(三类平均) | | |
| | ------------------------ | -------- | ------------- | -------- | ------------- | | |
| | test\_task(训练中见过的网站、新任务) | 92.9 | 97.0 | 93.1 | 96.6 | | |
| | test\_website(新网站) | 90.8 | 97.3 | 90.7 | 96.5 | | |
| | test\_domain(新领域) | 91.7 | 97.4 | 91.5 | 98.5 | | |
| - 与 Gen1 基本持平,差别在误差范围内。 | |
| - 目前仅用于探索该模型在 RPA 自动化等领域的情况,并验证存在一定的泛化性。 | |
| - 任务是从目标元素和页面上随机抽取的最多 5 个其他候选里选出目标,比 Mind2Web 原始评测简单,因此请勿与其排行榜比较。 | |
| ### 游戏评测(拳皇 '98) | |
| - **赛制**:单回合同角色镜像对战,每组 18 局,每步选概率最高的动作,设置与 Gen1 的循环赛相同。 | |
| - **结果**:对 Jev 1.13 为 14 胜 3 负 1 平,对 Gen1 为 13 胜 5 负,对 StartLux-Decision-4B 为 11 胜 7 负;合计 38 胜 15 负 1 平,得分率 0.713 [0.58, 0.82]。 | |
| - **打法**:对 623C 对空升龙的依赖明显降低,使用率 24%(Gen1 在循环赛中约 55%),招式分布也更分散。会按距离选招:近身多用升龙和重拳,中距离多用必杀技 special_2 和重踢,远距离几乎都用 special_2。 | |
| - **说明**: | |
| - 每组只有 18 局,置信区间较宽。Gen1 在循环赛中对 Jev 为 17 胜 0 负 1 平,与 Gen2 的 14 胜 3 负 1 平差异不显著。 | |
| - 54 局中有 36 局以时间到结束,多数胜局按剩余血量判定,不是 K.O.。 | |
| - 这是在该评测环境中的实测结果,不代表具备全面的格斗游戏能力。 | |
| ### 校准 | |
| 按 Decision Index 榜单说明的方法,在 0.3 公开套件上计算:逐字段判断对错,置信度取所选选项的概率,各基准等权,10 个等宽分箱。 | |
| | 指标 | Gen2 | Gen1 | 榜单中位数(112 个模型) | Jev 1.13 | | |
| | --------------- | ----------- | ----------- | -------------- | ----------- | | |
| | ECE(越低越好) | 0.06-0.07 | 0.08-0.09 | 0.084 | 0.074 | | |
| | Brier 分数(越低越好) | 0.31-0.33 | 0.34-0.36 | 0.49 | 0.36 | | |
| | 置信度 ≥95% 但答错的比例 | 2.2% | 3.3% | 1.3% | 2.1% | | |
| | 平均置信度 / 准确率 | 0.83 / 0.76 | 0.84 / 0.74 | | 0.81 / 0.74 | | |
| - **为什么是区间**:榜单没有公布具体用了哪 32 个基准。我们用三个公开了结果的榜单模型核对,自算的 ECE 与榜单值最多相差约 0.015,所以按几种可能的基准组合给出区间。 | |
| - **整体仍偏自信**:平均置信度比准确率高约 7 个点。偏差集中在难推理题(HLE、CRUXEval)、幽默判断(Humicroedit)和颜色判断(cfcolor)。 | |
| - **建议**:对概率阈值敏感的用法,请用自己的数据拟合一个温度。 | |
| ## 披露 | |
| - **Decision Index 格式的训练数据**:Gen2 由两次训练的模型平均而来。mix E 中约 25%、mix F 中约 31% 的数据是 Decision Index 的请求格式,包括改写成这种格式的公开数据集训练集(例如 GSM8K、WinoGrande XL、ACOS),以及按同样格式编写的合成题。不含任何 Decision Index 测试题。 | |
| - **去污染**: | |
| - 训练数据里每个至少 60 个字符的文本片段(行或段落),都与所有 Decision Index 题目以及我们全部评测集的片段做了比对。 | |
| - 与任一评测片段完全相同,或前 50 个字符相同的训练行都已删除。出现在 4 道以上评测题里的通用文本视为模板,不参与比对。 | |
| - mix F 新增的约 23 万行没有被标出的;恢复的 Jev 风格数据来自之前已去污染的配比。 | |
| - **按评测挑选**:7 种权重平均方式里,我们选了 DI 0.3 公开分最高、自测评测也全部不低于 Gen1 的一种。 | |
| - **游戏数据**:标签来自模拟器推演或引擎,随机种子和起始局面都与评测局面不重叠。 | |
| - **不用模型输出作标签**:从未把 Jev 或其他任何决策模型的输出用作训练标签。 | |
| - **教师模型标注的合成数据**:合成任务由大语言模型教师编写和标注。标签经过筛选,但并非全部经过人工核对。 | |
| ## 局限 | |
| - **知识密集型推理**:弱于更大的模型。知识领域 42.7(0.3),MMLU-Pro、HLE 仍接近底座水平。 | |
| - **数学**:没有推理过程。0.3 重建版 GSM8K 为 58.0,提升来自 GSM8K 训练集按同样格式改写后的训练。 | |
| - **提示注入**:在我们的注入测试集上,状态里植入的指令约有 4% 的概率改变答案。请把不可信文本清楚地隔开。 | |
| - **校准**:整体偏自信,见[校准](#校准)。 | |
| - **私有测试**:我们在公开套件上的优势有一部分来自对题目格式的适应。Gen2 比 Gen1 多出的分数里,约三分之二来自训练集参与了训练的三个基准,0.3 私有测试的分数可能更低。 | |
| ## 引用 | |
| ```bibtex | |
| @misc{knowline4bgen2, | |
| title = {KnowLine-4B-Gen2: a 4B decision model}, | |
| author = {PelaAI}, | |
| year = {2026}, | |
| url = {https://huggingface.co/PelaAI/KnowLine-4B-Gen2} | |
| } | |
| ``` | |
| ## 许可证 | |
| - **权重**:Apache-2.0,与底座模型相同。 | |
| - **代码**:`knowline_server.py` 为 MIT 许可(见文件开头)。 | |