Instructions to use lostsky-service/weibo-service-intent-macbert with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use lostsky-service/weibo-service-intent-macbert with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-classification", model="lostsky-service/weibo-service-intent-macbert")# pip install -U transformers accelerate # Load model directly from transformers import AutoTokenizer, AutoModelForSequenceClassification tokenizer = AutoTokenizer.from_pretrained("lostsky-service/weibo-service-intent-macbert") model = AutoModelForSequenceClassification.from_pretrained("lostsky-service/weibo-service-intent-macbert", device_map="auto") - Notebooks
- Google Colab
- Kaggle
Weibo Service Intent MacBERT
这是一个基于 hfl/chinese-macbert-base 微调的二分类模型,用于判断微博正文是否属于以下目标:
positive/1:寻找付费陪玩、代打、有偿服务点单,或微博站内抽奖;negative/0:服务提供方广告、招聘、引流、故事分享、站外抽奖及其他非目标内容。
配套数据集为 lostsky-service/weibo-service-intent。
固定推理契约
模型不能直接使用 Transformers 默认的最大概率分类结果。推理必须:
- 对原始正文应用
remove-first-leading-supertopic-v1,只删除开头第一个完整超话标签; - 使用最大长度
160并截断; - 对 logits 做 softmax,读取正类列
1; - 正类概率大于等于
0.46时输出正类。
仓库中的 inference.py 固化了这份契约:
from inference import predict
result = predict("想找一位今晚一起打游戏的付费陪玩")
print(result)
命令行也可以直接运行:
python inference.py "想找一位今晚一起打游戏的付费陪玩"
依赖版本见 requirements.txt。model-release.json 记录了阈值、最大长度、预处理指纹、评估摘要和四个冻结模型资产的 SHA-256。
评估结果
锁定模型在 299 条确定标签的新帖上正确 283 条,综合正确率为 **94.65%**:TP 102、FP 8、FN 8、TN 181;
另有 1 条人工无法确定。若将不确定样本计为错误,结果为 283/300 = 94.33%。
这批测试标签是在模型给出建议后由人工校对,属于模型辅助人工复核,可能存在锚定偏差,并非严格盲标。 该结果不能保证其他时间段、话题、语言或微博分布达到相同准确率。训练集也包含 1,271 条旧 AI 开发标签, 不能将全部训练数据称为人工金标。
使用限制
模型只针对上述业务定义训练,不适合作为通用广告、交易、诈骗或内容安全分类器。概率是分类分数,不应直接解释为真实世界风险概率。 建议在新的时间段和目标人群上重新评估误收与漏收,并保留人工复核路径。
模型代码和权重按 Apache License 2.0 发布,完整文本见 LICENSE。上游来源见 NOTICE。
配套数据集包含第三方公开微博正文;本模型许可证不会为这些正文授予新的许可证,数据权利与限制以数据集卡为准。
- Downloads last month
- 7
Model tree for lostsky-service/weibo-service-intent-macbert
Base model
hfl/chinese-macbert-base