Text Classification
Transformers
Safetensors
English
Chinese
qwen3_5
image-text-to-text
decision-model
system-one
decision-index
lora-merged
Instructions to use PelaAI/KnowLine-4B-Gen1 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use PelaAI/KnowLine-4B-Gen1 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-classification", model="PelaAI/KnowLine-4B-Gen1")# pip install -U transformers accelerate # Load model directly from transformers import AutoProcessor, AutoModelForMultimodalLM processor = AutoProcessor.from_pretrained("PelaAI/KnowLine-4B-Gen1") model = AutoModelForMultimodalLM.from_pretrained("PelaAI/KnowLine-4B-Gen1", device_map="auto") - Notebooks
- Google Colab
- Kaggle
|
Download README.zh.md from PelaAI/KnowLine-4B-Gen1: direct link, hf CLI and curl.
- Browser
- Download file 9.41 kB
-
https://huggingface.co/PelaAI/KnowLine-4B-Gen1/resolve/main/README.zh.md
- Command line
-
hf download hf://PelaAI/KnowLine-4B-Gen1/README.zh.md
-
curl -L -o README.zh.md https://huggingface.co/PelaAI/KnowLine-4B-Gen1/resolve/main/README.zh.md
9.41 kB
KnowLine-4B-Gen1
PelaAI 推出的 4B System One 决策模型,在单台一体机上,由 Agent 驱动的数据迭代循环训练出来。
推理说明 · English · 权重 Apache-2.0
新版本:KnowLine-4B-Gen3(DI 0.3 公开分 63.11)和 KnowLine-4B-Gen2(62.54)已发布,自建留出集、C-Eval、Open-Jev 和提示注入评测都不低于本模型。
亮点:
- Decision Index 0.3 公开套件:60.47(自测)。作为对照:Jev 1.13 为 57.96(榜单);榜单上 ≤5B 模型的最高公开分为 50.82,见横向对比。
- 整个迭代循环由 AI Agent 端到端执行,包括分析模型在哪些领域效果不佳、提出针对性的数据组、构建数据并去污染,并针对其进行训练和评测,最终根据证据决定保留还是否决这次改动
- 拳皇 '98 评测:对 Jev 1.13 为 17 胜 0 负 1 平(单回合同角色镜像循环赛),打法特点见游戏评测。
KnowLine 是独立开发的模型,与 TypeSafe 或 Jev 没有隶属关系,未获其背书,也不是基于它们开发的。
它做什么
你发送一段状态(文本或对话)和最多 64 道带类型的问题:是/否、k 选一、按细则打分。模型对每道题给出各选项的概率分布:
- 每道题只做一次前向计算,不生成文本;
- 生成的是各选项标签 token 的概率;
- 现有 Jev 客户端只需修改 base URL 即可接入。
| 底座模型 | Qwen/Qwen3.5-4B(Apache-2.0) |
| 训练方式 | 在语言模型部分做 LoRA 监督微调(rank 32,alpha 64),在约 71.3 万行数据上训练 1 轮。本次发布的是第 5,650 步(共 5,655 步),验证 loss 最低。 |
| 发布格式 | LoRA 已合并进底座,bf16 权重;视觉部分和 MTP 头不变 |
| 语言 | 英文、简体中文、繁体中文 |
快速开始
pip install "sglang==0.5.21" "transformers==5.12.1" requests
bash serve_knowline.sh PelaAI/KnowLine-4B-Gen1 0 8080 # SGLang(加载时转 FP8)监听 :9080,/v1/systemone 监听 :8080
curl -s http://127.0.0.1:8080/v1/systemone -H 'Content-Type: application/json' -d '{
"model": "m",
"state": "Customer: my order arrived broken, I want my money back.",
"questions": {"refund": {"type": "noul", "instructions": "Should the agent offer a refund?"},
"tone": {"type": "choice", "instructions": "Customer tone?",
"criteria": {"angry": "Angry", "neutral": "Neutral", "happy": "Happy"}}}}'
- 不用 SGLang:
python knowline_server.py --model PelaAI/KnowLine-4B-Gen1 --backend hf --port 8080只依赖 transformers,速度较慢,精度为 bf16。 - 前端:
knowline_server.py是单个文件,只依赖 transformers 和 requests。 - 完整设置:我们跑 Decision Index 时的完整设置见 INFERENCE.md。
横向对比
下表为 Decision Index 0.3 公开套件的分数。0.3 的总分还要加上只由维护者运行的私有测试(同技能 0.5、新领域 0.3),我们的总分暂时还没有。
| 模型 | 规模 | DI 0.3 公开分 | DI 0.3 总分 | 来源 |
|---|---|---|---|---|
| KnowLine-4B-Gen1 | 4B | 60.47 | 尚未评测 | 自测,官方工具包 |
| Clef | 27B | 61.71 | 53.08 | 榜单 |
| Jev 1.13 | (API) | 57.96 | 60.11 | 榜单 |
| RSI-Jev v6.1-VL | 4B | 50.98 | 未上榜 | 自报 |
| ezjev 4B s2 | 4B | 50.82 | 46.95 | 榜单 |
| jiwo 4B | 4B | 45.76 | 42.86 | 榜单 |
| Nox 4B | 4B | 44.21 | 44.95 | 榜单 |
我们的模型在各子领域的公开套件评分如下:
| 领域 | KnowLine-4B-Gen1(0.3 公开) | Jev 1.13(0.2.1) |
|---|---|---|
| 知识与推理 | 37.7 | 51.4 |
| 语言 | 60.8 | 62.0 |
| 检索与路由 | 70.9 | 55.4 |
| 工具与 Agent | 86.8 | 75.1 |
| 艺术与品味 | 49.5 | 37.7 |
版本
本模型使用自进化的模式进行训练,将持续产生新版本
| 模型 | 日期 | DI 0.3 公开 | DI 0.2.1 | 黄金集留出(英 / 简 / 繁) | 说明 |
|---|---|---|---|---|---|
| KnowLine-4B-Gen3 | 2026-10-09 | 63.11 | — | 69.4 / 70.8 / 65.0 | 第三版 |
| KnowLine-4B-Gen2 | 2026-10-08 | 62.54 | — | 69.7 / 71.2 / 64.8 | 本模型占 0.5,mix F 第 4,500、5,000 步各占 0.25,权重平均 |
| KnowLine-4B-Gen1(本模型) | 2026-10-07 | 60.47 | 60.92 | 68.7 / 69.9 / 64.1 | 首次发布(内部运行 "mix E",第 5,650 步) |
评测
以下结果均为自测,未经第三方复核。
留出评测与中文评测
| 测试集 | 准确率 |
|---|---|
| 自建评测数据集(英文部分) | 68.7 |
| 自建评测数据集(简体中文部分) | 69.9 |
| 自建评测数据集(繁体中文部分) | 64.1 |
| C-Eval(4 大类宏平均) | 77.9 |
| Open-Jev 1.1 测试 / OOD | 87.4 / 86.6 |
网页操作(Mind2Web 官方测试集,仅用于评测)
| 划分 | 选元素 | 选操作(三类平均) |
|---|---|---|
| test_task(训练中见过的网站、新任务) | 93.1 | 96.6 |
| test_website(新网站) | 90.7 | 96.5 |
| test_domain(新领域) | 91.5 | 98.5 |
- 目前仅用于探索该模型在 RPA 自动化等领域的情况,并验证存在一定的泛化性
- 任务是从目标元素和页面上随机抽取的最多 5 个其他候选里选出目标,比 Mind2Web 原始评测简单,因此请勿与其排行榜比较
游戏评测(拳皇 '98)
- 赛制:单回合同角色镜像循环赛,11 方参赛,每组 18 局(共 990 局),每步选概率最高的动作。
- 结果:胜率 0.883 [0.83, 0.92],Elo 1910,与另一个内部检查点并列第一。
- 对战成绩:对 Jev 1.13 为 17 胜 0 负 1 平,对 StartLux-Decision-4B 为 15 胜 3 负,对 Clef-Flash 为 18 胜 0 负。
- 说明:策略高度依赖一招,即 623C 对空升龙,使用率约 55%。这是在该评测环境中的实测结果,不代表具备全面的格斗游戏能力。
披露
- Decision Index 训练集:约 25% 的数据是 Decision Index 的格式,即按基准请求格式编写的合成题。不含任何测试题。
- 去污染:
- 每个文本片段(状态、题干、选项文本)都与所有 Decision Index 题目以及我们全部评测集做了比对。
- 完全相同或存在任意连续 50 个字符相同的行都已删除。
- 游戏数据:标签来自模拟器推演或引擎,随机种子和起始局面都与评测局面不重叠。
- 不用模型输出作标签:从未把 Jev 或其他任何决策模型的输出用作训练标签。
- 教师模型标注的合成数据:合成任务由大语言模型教师编写和标注。标签经过筛选,但并非全部经过人工核对。
局限
- 知识密集型推理:弱于更大的模型。知识领域 37.7(0.3),MMLU-Pro、GPQA、HLE 接近底座水平。
- 数学:没有推理过程,0.3 重建版 GSM8K 为 29.5。
- 提示注入:在我们的注入测试集上,状态里植入的指令约有 9% 的概率改变答案。请把不可信文本清楚地隔开。
- 校准:选择题和是/否题的 ECE 约为 0.05-0.06,打分题约为 0.12。打分题建议用自己的数据拟合温度。 在 Decision Index 0.3 公开套件上按榜单的方法计算,ECE 约 0.08-0.09,置信度 ≥95% 但答错的约占 3.3%(榜单中位数 1.3%),整体偏自信。
- 私有测试:我们在公开套件上的优势有一部分来自对题目格式的适应,0.3 私有测试的分数可能更低。
引用
@misc{knowline4bgen1,
title = {KnowLine-4B-Gen1: a 4B decision model},
author = {PelaAI},
year = {2026},
url = {https://huggingface.co/PelaAI/KnowLine-4B-Gen1}
}
许可证
- 权重:Apache-2.0,与底座模型相同。
- 代码:
knowline_server.py为 MIT 许可(见文件开头)。