traffic-classify / DATA_SOURCES.md
pawizard's picture
Upload traffic classifier with ONNX exports
aa7739c verified
|
Raw
History Blame Contribute Delete
3.96 kB

数据源说明

本项目当前使用三分类标签:

label 含义
0 非研发相关
1 研发相关
2 中性

当前推荐数据集

推荐使用精简后的数据集:

  • 原始精简 CSV:data/refined_compact_labeled.csv
  • 训练集:data_refined/train.csv
  • 验证集:data_refined/val.csv
  • 测试集:data_refined/test.csv

当前精简 CSV 的类别分布:

label 含义 数量
0 非研发相关 22337
1 研发相关 68779
2 中性 2312

切分比例由 data_prep.py 生成,约为 8:1:1

数据来源

THUOCL

初始映射中,THUOCL_IT.txt 标为研发相关,其他领域曾用于非研发或中性候选。当前精简数据集中仅保留部分高权重词:

  • IT:研发相关,全量保留去重后的词条
  • 其他 THUOCL 领域:非研发相关,每个领域最多保留 300 条

DomainWordsDict

当前精简映射:

  • 计算机业:研发相关,全量保留去重后的词条
  • 电子工程:研发相关,全量保留去重后的词条
  • 通信工程:研发相关,全量保留去重后的词条
  • 其他领域:非研发相关,每个领域最多保留 300 条

旧版曾把 网络用语诗词歌赋文学名著汉语言学 标为中性;当前已取消这个策略,这些领域在精简数据集中都按非研发相关处理。

computerese-cross-references

该仓库主要内容在 README.md 的 Markdown 表格中。当前抽取策略:

  • 英文术语全部标为研发相关
  • 中文释义只保留明显具有技术语义的短语
  • 过滤掉过于泛化的中文词,例如“获取”这类容易导致误判的词

当前精简数据集中,computerese 全量保留去重后的词条,约 1650 条。

stopwords

当前策略:

  • 所有去重后的停用词标为 2=中性
  • 中性类只来自该停用词仓库
  • 例如“继续”会被标为中性

生成策略

精简数据集的目标是避免中性和非研发样本过多,降低类别不均衡和噪声。

当前规则:

类别 来源 保留策略
研发相关 IT计算机业电子工程通信工程computerese 全量保留去重后的词条,并优先于非研发来源
中性 stopwords 全量去重保留
非研发相关 其他领域词库 每个领域最多 300 条

生成后的 CSV 字段:

字段 含义
text 训练文本
label 标签 ID
label_name 标签名称
category 来源领域或类别
df 原词库权重或词频,部分来源为空
source_file 来源文件

注意事项

  • 当前数据主要是词库,不是完整用户 query。训练出的模型更偏向领域词识别,后续应补充真实用户话术。
  • 中性类目前使用停用词近似表达,如“继续”“好的”“然后”等,适合覆盖短指令和弱语义输入。
  • 非研发相关按领域抽样压缩后,与研发相关数量大致均衡,适合先训练一个轻量 baseline。
  • 若后续新增真实标注样本,建议优先加入 data/refined_compact_labeled.csv 或单独维护一个人工标注 CSV,再合并后重新切分。