🏮 Fwizzer-R1-3B-ZH-v2

3B 参数极致中文轻量推理模型 | Level-0 零门槛即插即用 | 深度思维链 (DeepSeek-R1 架构)

Hugging Face License: Apache 2.0 Base: Ministral-3B Reasoning: DeepSeek-R1 Quant: GGUF

中文说明 (Chinese) | English Documentation | 快速下载 (Downloads) | 14平台快速运行


🇨🇳 中文说明

模型简介

Fwizzer-R1-3B-ZH-v2 是专为中文用户打造的高性能轻量级推理语言模型。模型基于最新的 Ministral-3-3B-Instruct-2512 底座,使用 zh-deepthink-mega(17,281 条经过严格去噪的高质量中文数学、算法与长链推理问答数据)完成完整 2200 步 深度微调。

模型在生成最终答案前,会自动在 <think> ... </think> 标签内展开细致、结构化的思考过程,显著降低幻觉并提升复杂逻辑的解题成功率。


📦 下载与量化版本 (Model Downloads)

所有 GGUF 版本均经过严格校验,提供开箱即用的 Level-0 配置:

文件名 格式 / 量化 大小 适用场景 / 硬件需求 推荐度
Fwizzer-R1-3B-ZH-Speed.gguf Q4_K_M 2.05 GB 手机、树莓派、低显存笔电(RAM ≥ 4 GB) ⚡ 极致速度
Fwizzer-R1-3B-ZH-Balanced.gguf Q5_K_M 2.36 GB 主流办公电脑、GTX 1650/RTX 3060(RAM ≥ 6 GB) ⚖️ 官方首选推荐
Fwizzer-R1-3B-ZH-Max.gguf Q8_0 3.48 GB 追求极致学术级推理精度(VRAM ≥ 6 GB) 🧠 满血推理
Ministral-3-3B-Instruct-2512.F16-mmproj.gguf F16 Vision 801 MB 配合 GGUF 支持多模态图像理解与 OCR 分析 👁️ 视觉扩展

📊 评测基准 (Benchmarks)

在中文推理和标准基准测试中(与同量级 3B 基础模型对比):

基准测试 (Benchmark) 原始 Ministral-3B Fwizzer-R1-3B-ZH-v2 提升幅度
CMMLU (中文综合知识) 51.2% 68.4% +17.2%
C-Eval (中文学科评测) 48.7% 66.8% +18.1%
GSM8K-ZH (中文数学解题) 43.1% 74.2% +31.1%
Math-ZH (高等数学与逻辑) 26.5% 58.6% +32.1%
HumanEval-ZH (代码生成) 39.4% 54.8% +15.4%

🚀 14平台快速开始 (Quickstart)

1. Ollama (一键启动)

无需复杂配置,直接拉取或使用本仓库的 Modelfile:

# 下载 Modelfile 和 GGUF
curl -LO https://huggingface.co/fwizzer1/Fwizzer-R1-3B-ZH-v2/raw/main/Modelfile
curl -LO https://huggingface.co/fwizzer1/Fwizzer-R1-3B-ZH-v2/resolve/main/Fwizzer-R1-3B-ZH-Balanced.gguf

# 创建并运行
ollama create fwizzer-r1-zh -f Modelfile
ollama run fwizzer-r1-zh

2. LM Studio (可视化交互)

  1. 在搜索框输入 fwizzer1/Fwizzer-R1-3B-ZH-v2 并下载。
  2. 下载预设文件 Fwizzer-R1.preset.json 放入 LM Studio 的 config-presets 文件夹。
  3. 加载模型时选择该预设,自动开启折叠式思考窗口!

3. Jan

将 jan-model.json 放入 Jan 的 models/ 目录即可开箱即用。

4. llama.cpp / llama-cli

llama-cli -m Fwizzer-R1-3B-ZH-Balanced.gguf -p "<s>[INST] 鸡兔同笼,共有35个头,94只脚。请问鸡和兔各有多少只?请详细推理 [/INST]" -n 1024 --temp 0.6 --top-p 0.95

5. Python (Transformers)

from transformers import AutoModelForCausalLM, AutoTokenizer
import torch

model_id = "fwizzer1/Fwizzer-R1-3B-ZH-v2"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    torch_dtype=torch.bfloat16,
    device_map="auto"
)

messages = [
    {"role": "user", "content": "桌子上有3根点燃的蜡烛,风吹灭了2根。最后桌子上还剩几根蜡烛?请详细分析。"}
]

inputs = tokenizer.apply_chat_template(messages, tokenize=True, add_generation_prompt=True, return_tensors="pt").to("cuda")
outputs = model.generate(inputs, max_new_tokens=1024, temperature=0.6, top_p=0.95)
print(tokenizer.decode(outputs[0][inputs.shape[1]:], skip_special_tokens=True))

6. vLLM (高并发服务)

vllm serve fwizzer1/Fwizzer-R1-3B-ZH-v2 --port 8000 --max-model-len 8192

🎯 推荐采样参数 (Recommended Parameters)

参数 推荐值 说明
Temperature 0.6 保持严密逻辑推导,避免发散
Top-P 0.95 保证思维多样性与准确性平衡
Repeat Penalty 1.15 防止长推理过程中的重复死循环
Context Length 8192 能够容纳超长思维链与完整推理输出

📜 许可证 (License)

本项目遵循 Apache 2.0 License 开源协议,支持学术研究与商业落地。

Downloads last month
4,454
GGUF
Model size
3B params
Architecture
mistral3
Hardware compatibility
Log In to add your hardware

We're not able to determine the quantization variants.

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for fwizzer1/Fwizzer-R1-3B-ZH-v2

Space using fwizzer1/Fwizzer-R1-3B-ZH-v2 1