Text Classification
Transformers
ONNX
Safetensors
Chinese
bert
chinese
intent-classification
text-embeddings-inference
Instructions to use pawizard/traffic-classify with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use pawizard/traffic-classify with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-classification", model="pawizard/traffic-classify")# Load model directly from transformers import AutoTokenizer, AutoModelForSequenceClassification tokenizer = AutoTokenizer.from_pretrained("pawizard/traffic-classify") model = AutoModelForSequenceClassification.from_pretrained("pawizard/traffic-classify", device_map="auto") - Notebooks
- Google Colab
- Kaggle
数据源说明
本项目当前使用三分类标签:
| label | 含义 |
|---|---|
| 0 | 非研发相关 |
| 1 | 研发相关 |
| 2 | 中性 |
当前推荐数据集
推荐使用精简后的数据集:
- 原始精简 CSV:
data/refined_compact_labeled.csv - 训练集:
data_refined/train.csv - 验证集:
data_refined/val.csv - 测试集:
data_refined/test.csv
当前精简 CSV 的类别分布:
| label | 含义 | 数量 |
|---|---|---|
| 0 | 非研发相关 | 22337 |
| 1 | 研发相关 | 68779 |
| 2 | 中性 | 2312 |
切分比例由 data_prep.py 生成,约为 8:1:1。
数据来源
THUOCL
- 仓库:https://github.com/thunlp/THUOCL
- 用途:提供中文领域词库。
- 中间产物:
data/thuocl_labeled.csv
初始映射中,THUOCL_IT.txt 标为研发相关,其他领域曾用于非研发或中性候选。当前精简数据集中仅保留部分高权重词:
IT:研发相关,全量保留去重后的词条- 其他 THUOCL 领域:非研发相关,每个领域最多保留 300 条
DomainWordsDict
- 仓库:https://github.com/liuhuanyong/DomainWordsDict
- 用途:提供大规模中文领域词库。
- 中间产物:
data/domain_words_labeled.csv
当前精简映射:
计算机业:研发相关,全量保留去重后的词条电子工程:研发相关,全量保留去重后的词条通信工程:研发相关,全量保留去重后的词条- 其他领域:非研发相关,每个领域最多保留 300 条
旧版曾把 网络用语、诗词歌赋、文学名著、汉语言学 标为中性;当前已取消这个策略,这些领域在精简数据集中都按非研发相关处理。
computerese-cross-references
- 仓库:https://github.com/EarsEyesMouth/computerese-cross-references
- 用途:补充计算机专业术语中英文对照。
- 中间产物:
data/computerese_labeled.csv
该仓库主要内容在 README.md 的 Markdown 表格中。当前抽取策略:
- 英文术语全部标为研发相关
- 中文释义只保留明显具有技术语义的短语
- 过滤掉过于泛化的中文词,例如“获取”这类容易导致误判的词
当前精简数据集中,computerese 全量保留去重后的词条,约 1650 条。
stopwords
- 仓库:https://github.com/goto456/stopwords
- 用途:提供中性类样本。
- 使用文件:
baidu_stopwords.txtcn_stopwords.txthit_stopwords.txtscu_stopwords.txt
当前策略:
- 所有去重后的停用词标为
2=中性 - 中性类只来自该停用词仓库
- 例如“继续”会被标为中性
生成策略
精简数据集的目标是避免中性和非研发样本过多,降低类别不均衡和噪声。
当前规则:
| 类别 | 来源 | 保留策略 |
|---|---|---|
| 研发相关 | IT、计算机业、电子工程、通信工程、computerese |
全量保留去重后的词条,并优先于非研发来源 |
| 中性 | stopwords | 全量去重保留 |
| 非研发相关 | 其他领域词库 | 每个领域最多 300 条 |
生成后的 CSV 字段:
| 字段 | 含义 |
|---|---|
text |
训练文本 |
label |
标签 ID |
label_name |
标签名称 |
category |
来源领域或类别 |
df |
原词库权重或词频,部分来源为空 |
source_file |
来源文件 |
注意事项
- 当前数据主要是词库,不是完整用户 query。训练出的模型更偏向领域词识别,后续应补充真实用户话术。
- 中性类目前使用停用词近似表达,如“继续”“好的”“然后”等,适合覆盖短指令和弱语义输入。
- 非研发相关按领域抽样压缩后,与研发相关数量大致均衡,适合先训练一个轻量 baseline。
- 若后续新增真实标注样本,建议优先加入
data/refined_compact_labeled.csv或单独维护一个人工标注 CSV,再合并后重新切分。