# 数据源说明 本项目当前使用三分类标签: | label | 含义 | | --- | --- | | 0 | 非研发相关 | | 1 | 研发相关 | | 2 | 中性 | ## 当前推荐数据集 推荐使用精简后的数据集: - 原始精简 CSV:`data/refined_compact_labeled.csv` - 训练集:`data_refined/train.csv` - 验证集:`data_refined/val.csv` - 测试集:`data_refined/test.csv` 当前精简 CSV 的类别分布: | label | 含义 | 数量 | | --- | --- | ---: | | 0 | 非研发相关 | 22337 | | 1 | 研发相关 | 68779 | | 2 | 中性 | 2312 | 切分比例由 `data_prep.py` 生成,约为 `8:1:1`。 ## 数据来源 ### THUOCL - 仓库:https://github.com/thunlp/THUOCL - 用途:提供中文领域词库。 - 中间产物:`data/thuocl_labeled.csv` 初始映射中,`THUOCL_IT.txt` 标为研发相关,其他领域曾用于非研发或中性候选。当前精简数据集中仅保留部分高权重词: - `IT`:研发相关,全量保留去重后的词条 - 其他 THUOCL 领域:非研发相关,每个领域最多保留 300 条 ### DomainWordsDict - 仓库:https://github.com/liuhuanyong/DomainWordsDict - 用途:提供大规模中文领域词库。 - 中间产物:`data/domain_words_labeled.csv` 当前精简映射: - `计算机业`:研发相关,全量保留去重后的词条 - `电子工程`:研发相关,全量保留去重后的词条 - `通信工程`:研发相关,全量保留去重后的词条 - 其他领域:非研发相关,每个领域最多保留 300 条 旧版曾把 `网络用语`、`诗词歌赋`、`文学名著`、`汉语言学` 标为中性;当前已取消这个策略,这些领域在精简数据集中都按非研发相关处理。 ### computerese-cross-references - 仓库:https://github.com/EarsEyesMouth/computerese-cross-references - 用途:补充计算机专业术语中英文对照。 - 中间产物:`data/computerese_labeled.csv` 该仓库主要内容在 `README.md` 的 Markdown 表格中。当前抽取策略: - 英文术语全部标为研发相关 - 中文释义只保留明显具有技术语义的短语 - 过滤掉过于泛化的中文词,例如“获取”这类容易导致误判的词 当前精简数据集中,`computerese` 全量保留去重后的词条,约 1650 条。 ### stopwords - 仓库:https://github.com/goto456/stopwords - 用途:提供中性类样本。 - 使用文件: - `baidu_stopwords.txt` - `cn_stopwords.txt` - `hit_stopwords.txt` - `scu_stopwords.txt` 当前策略: - 所有去重后的停用词标为 `2=中性` - 中性类只来自该停用词仓库 - 例如“继续”会被标为中性 ## 生成策略 精简数据集的目标是避免中性和非研发样本过多,降低类别不均衡和噪声。 当前规则: | 类别 | 来源 | 保留策略 | | --- | --- | --- | | 研发相关 | `IT`、`计算机业`、`电子工程`、`通信工程`、`computerese` | 全量保留去重后的词条,并优先于非研发来源 | | 中性 | stopwords | 全量去重保留 | | 非研发相关 | 其他领域词库 | 每个领域最多 300 条 | 生成后的 CSV 字段: | 字段 | 含义 | | --- | --- | | `text` | 训练文本 | | `label` | 标签 ID | | `label_name` | 标签名称 | | `category` | 来源领域或类别 | | `df` | 原词库权重或词频,部分来源为空 | | `source_file` | 来源文件 | ## 注意事项 - 当前数据主要是词库,不是完整用户 query。训练出的模型更偏向领域词识别,后续应补充真实用户话术。 - 中性类目前使用停用词近似表达,如“继续”“好的”“然后”等,适合覆盖短指令和弱语义输入。 - 非研发相关按领域抽样压缩后,与研发相关数量大致均衡,适合先训练一个轻量 baseline。 - 若后续新增真实标注样本,建议优先加入 `data/refined_compact_labeled.csv` 或单独维护一个人工标注 CSV,再合并后重新切分。