# KnowLine-4B-Gen1 **PelaAI 推出的 4B System One 决策模型,在单台一体机上,由 Agent 驱动的数据迭代循环训练出来。** [推理说明](INFERENCE.md) · [English](README.md) · 权重 Apache-2.0 > **新版本**:[KnowLine-4B-Gen3](https://huggingface.co/PelaAI/KnowLine-4B-Gen3)(DI 0.3 公开分 63.11)和 [KnowLine-4B-Gen2](https://huggingface.co/PelaAI/KnowLine-4B-Gen2)(62.54)已发布,自建留出集、C-Eval、Open-Jev 和提示注入评测都不低于本模型。 亮点: - **Decision Index 0.3 公开套件:60.47**(自测)。作为对照:Jev 1.13 为 57.96(榜单);榜单上 ≤5B 模型的最高公开分为 50.82,见[横向对比](#横向对比)。 - 整个迭代循环由 AI Agent 端到端执行,包括分析模型在哪些领域效果不佳、提出针对性的数据组、构建数据并去污染,并针对其进行训练和评测,最终根据证据决定保留还是否决这次改动 - **拳皇 '98 评测:对 Jev 1.13 为 17 胜 0 负 1 平**(单回合同角色镜像循环赛),打法特点见[游戏评测](#游戏评测拳皇-98)。 KnowLine 是独立开发的模型,与 TypeSafe 或 Jev 没有隶属关系,未获其背书,也不是基于它们开发的。 ## 它做什么 你发送一段状态(文本或对话)和最多 64 道带类型的问题:是/否、k 选一、按细则打分。模型对每道题给出各选项的概率分布: - 每道题只做一次前向计算,不生成文本; - 生成的是各选项标签 token 的概率; - 现有 Jev 客户端只需修改 base URL 即可接入。 | | | | ---- | ----------------------------------------------------------------------------------------------- | | 底座模型 | [Qwen/Qwen3.5-4B](https://huggingface.co/Qwen/Qwen3.5-4B)(Apache-2.0) | | 训练方式 | 在语言模型部分做 LoRA 监督微调(rank 32,alpha 64),在约 71.3 万行数据上训练 1 轮。本次发布的是第 5,650 步(共 5,655 步),验证 loss 最低。 | | 发布格式 | LoRA 已合并进底座,bf16 权重;视觉部分和 MTP 头不变 | | 语言 | 英文、简体中文、繁体中文 | ## 快速开始 ```bash pip install "sglang==0.5.21" "transformers==5.12.1" requests bash serve_knowline.sh PelaAI/KnowLine-4B-Gen1 0 8080 # SGLang(加载时转 FP8)监听 :9080,/v1/systemone 监听 :8080 curl -s http://127.0.0.1:8080/v1/systemone -H 'Content-Type: application/json' -d '{ "model": "m", "state": "Customer: my order arrived broken, I want my money back.", "questions": {"refund": {"type": "noul", "instructions": "Should the agent offer a refund?"}, "tone": {"type": "choice", "instructions": "Customer tone?", "criteria": {"angry": "Angry", "neutral": "Neutral", "happy": "Happy"}}}}' ``` - **不用 SGLang**:`python knowline_server.py --model PelaAI/KnowLine-4B-Gen1 --backend hf --port 8080` 只依赖 transformers,速度较慢,精度为 bf16。 - **前端**:`knowline_server.py` 是单个文件,只依赖 transformers 和 requests。 - **完整设置**:我们跑 Decision Index 时的完整设置见 [INFERENCE.md](INFERENCE.md)。 ## 横向对比 下表为 Decision Index 0.3 公开套件的分数。0.3 的总分还要加上只由维护者运行的私有测试(同技能 0.5、新领域 0.3),我们的总分暂时还没有。 | 模型 | 规模 | DI 0.3 公开分 | DI 0.3 总分 | 来源 | | -------------------- | ----- | ---------- | --------- | -------- | | **KnowLine-4B-Gen1** | 4B | **60.47** | 尚未评测 | 自测,官方工具包 | | Clef | 27B | 61.71 | 53.08 | 榜单 | | Jev 1.13 | (API) | 57.96 | 60.11 | 榜单 | | RSI-Jev v6.1-VL | 4B | 50.98 | 未上榜 | 自报 | | ezjev 4B s2 | 4B | 50.82 | 46.95 | 榜单 | | jiwo 4B | 4B | 45.76 | 42.86 | 榜单 | | Nox 4B | 4B | 44.21 | 44.95 | 榜单 | 我们的模型在各子领域的公开套件评分如下: | 领域 | KnowLine-4B-Gen1(0.3 公开) | Jev 1.13(0.2.1) | | --------- | ------------------------ | --------------- | | 知识与推理 | 37.7 | 51.4 | | 语言 | 60.8 | 62.0 | | 检索与路由 | 70.9 | 55.4 | | 工具与 Agent | 86.8 | 75.1 | | 艺术与品味 | 49.5 | 37.7 | ## 版本 本模型使用自进化的模式进行训练,将持续产生新版本 | 模型 | 日期 | DI 0.3 公开 | DI 0.2.1 | 黄金集留出(英 / 简 / 繁) | 说明 | | --------------------- | ---------- | --------- | -------- | ------------------ | ---------------------------- | | [KnowLine-4B-Gen3](https://huggingface.co/PelaAI/KnowLine-4B-Gen3) | 2026-10-09 | 63.11 | — | 69.4 / 70.8 / 65.0 | 第三版 | | [KnowLine-4B-Gen2](https://huggingface.co/PelaAI/KnowLine-4B-Gen2) | 2026-10-08 | 62.54 | — | 69.7 / 71.2 / 64.8 | 本模型占 0.5,mix F 第 4,500、5,000 步各占 0.25,权重平均 | | KnowLine-4B-Gen1(本模型) | 2026-10-07 | 60.47 | 60.92 | 68.7 / 69.9 / 64.1 | 首次发布(内部运行 "mix E",第 5,650 步) | ## 评测 以下结果均为自测,未经第三方复核。 ### 留出评测与中文评测 | 测试集 | 准确率 | | --------------------- | ----------- | | 自建评测数据集(英文部分) | 68.7 | | 自建评测数据集(简体中文部分) | 69.9 | | 自建评测数据集(繁体中文部分) | 64.1 | | C-Eval(4 大类宏平均) | 77.9 | | Open-Jev 1.1 测试 / OOD | 87.4 / 86.6 | ### 网页操作(Mind2Web 官方测试集,仅用于评测) | 划分 | 选元素 | 选操作(三类平均) | | ------------------------ | ---- | --------- | | test\_task(训练中见过的网站、新任务) | 93.1 | 96.6 | | test\_website(新网站) | 90.7 | 96.5 | | test\_domain(新领域) | 91.5 | 98.5 | - 目前仅用于探索该模型在 RPA 自动化等领域的情况,并验证存在一定的泛化性 - 任务是从目标元素和页面上随机抽取的最多 5 个其他候选里选出目标,比 Mind2Web 原始评测简单,因此请勿与其排行榜比较 ### 游戏评测(拳皇 '98) - **赛制**:单回合同角色镜像循环赛,11 方参赛,每组 18 局(共 990 局),每步选概率最高的动作。 - **结果**:胜率 0.883 [0.83, 0.92],Elo 1910,与另一个内部检查点并列第一。 - **对战成绩**:对 Jev 1.13 为 17 胜 0 负 1 平,对 StartLux-Decision-4B 为 15 胜 3 负,对 Clef-Flash 为 18 胜 0 负。 - **说明**:策略高度依赖一招,即 623C 对空升龙,使用率约 55%。这是在该评测环境中的实测结果,不代表具备全面的格斗游戏能力。 ## 披露 - **Decision Index 训练集**:约 25% 的数据是 Decision Index 的格式,即按基准请求格式编写的合成题。不含任何测试题。 - **去污染**: - 每个文本片段(状态、题干、选项文本)都与所有 Decision Index 题目以及我们全部评测集做了比对。 - 完全相同或存在任意连续 50 个字符相同的行都已删除。 - **游戏数据**:标签来自模拟器推演或引擎,随机种子和起始局面都与评测局面不重叠。 - **不用模型输出作标签**:从未把 Jev 或其他任何决策模型的输出用作训练标签。 - **教师模型标注的合成数据**:合成任务由大语言模型教师编写和标注。标签经过筛选,但并非全部经过人工核对。 ## 局限 - **知识密集型推理**:弱于更大的模型。知识领域 37.7(0.3),MMLU-Pro、GPQA、HLE 接近底座水平。 - **数学**:没有推理过程,0.3 重建版 GSM8K 为 29.5。 - **提示注入**:在我们的注入测试集上,状态里植入的指令约有 9% 的概率改变答案。请把不可信文本清楚地隔开。 - **校准**:选择题和是/否题的 ECE 约为 0.05-0.06,打分题约为 0.12。打分题建议用自己的数据拟合温度。 在 Decision Index 0.3 公开套件上按榜单的方法计算,ECE 约 0.08-0.09,置信度 ≥95% 但答错的约占 3.3%(榜单中位数 1.3%),整体偏自信。 - **私有测试**:我们在公开套件上的优势有一部分来自对题目格式的适应,0.3 私有测试的分数可能更低。 ## 引用 ```bibtex @misc{knowline4bgen1, title = {KnowLine-4B-Gen1: a 4B decision model}, author = {PelaAI}, year = {2026}, url = {https://huggingface.co/PelaAI/KnowLine-4B-Gen1} } ``` ## 许可证 - **权重**:Apache-2.0,与底座模型相同。 - **代码**:`knowline_server.py` 为 MIT 许可(见文件开头)。