Weibo Service Intent MacBERT

这是一个基于 hfl/chinese-macbert-base 微调的二分类模型,用于判断微博正文是否属于以下目标:

  • positive / 1:寻找付费陪玩、代打、有偿服务点单,或微博站内抽奖;
  • negative / 0:服务提供方广告、招聘、引流、故事分享、站外抽奖及其他非目标内容。

配套数据集为 lostsky-service/weibo-service-intent。

固定推理契约

模型不能直接使用 Transformers 默认的最大概率分类结果。推理必须:

  1. 对原始正文应用 remove-first-leading-supertopic-v1,只删除开头第一个完整超话标签;
  2. 使用最大长度 160 并截断;
  3. 对 logits 做 softmax,读取正类列 1;
  4. 正类概率大于等于 0.46 时输出正类。

仓库中的 inference.py 固化了这份契约:

from inference import predict

result = predict("想找一位今晚一起打游戏的付费陪玩")
print(result)

命令行也可以直接运行:

python inference.py "想找一位今晚一起打游戏的付费陪玩"

依赖版本见 requirements.txt。model-release.json 记录了阈值、最大长度、预处理指纹、评估摘要和四个冻结模型资产的 SHA-256。

评估结果

锁定模型在 299 条确定标签的新帖上正确 283 条,综合正确率为 **94.65%**:TP 102、FP 8、FN 8、TN 181; 另有 1 条人工无法确定。若将不确定样本计为错误,结果为 283/300 = 94.33%。

这批测试标签是在模型给出建议后由人工校对,属于模型辅助人工复核,可能存在锚定偏差,并非严格盲标。 该结果不能保证其他时间段、话题、语言或微博分布达到相同准确率。训练集也包含 1,271 条旧 AI 开发标签, 不能将全部训练数据称为人工金标。

使用限制

模型只针对上述业务定义训练,不适合作为通用广告、交易、诈骗或内容安全分类器。概率是分类分数,不应直接解释为真实世界风险概率。 建议在新的时间段和目标人群上重新评估误收与漏收,并保留人工复核路径。

模型代码和权重按 Apache License 2.0 发布,完整文本见 LICENSE。上游来源见 NOTICE。 配套数据集包含第三方公开微博正文;本模型许可证不会为这些正文授予新的许可证,数据权利与限制以数据集卡为准。

Downloads last month
7
Safetensors
Model size
0.1B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for lostsky-service/weibo-service-intent-macbert

Finetuned
(67)
this model

Dataset used to train lostsky-service/weibo-service-intent-macbert