NhanSoHocCode/xlmr-ner-4labels-v2 (Phiên bản v2)
Mô hình Named Entity Recognition (NER) phiên bản v2, được tiếp tục huấn luyện bổ sung từ checkpoint NhanSoHocCode/xlmr-ner-4labels trên tập dữ liệu tuyển dụng cập nhật (data-job3).
Điểm cải tiến phiên bản v2:
- Tinh chỉnh trọng số với learning rate
1.5e-05giúp tối ưu biên nhận diện các thực thể kỹ năng và học vấn. - Kết quả F1-Score trên tập Test: 0.9114
4 Nhóm thực thể nhận diện:
HARD_SKILL: Kỹ năng kỹ thuật, công nghệ (Python, Java, Docker, PySpark, SQL,...)SOFT_SKILL: Kỹ năng mềm (giao tiếp, làm việc nhóm, quản lý thời gian, tư duy phản biện,...)EDUCATION: Bằng cấp học vấn (Cử nhân, Thạc sĩ, Kỹ sư, Tiến sĩ,...)MAJOR: Chuyên ngành đào tạo (Khoa học máy tính, Công nghệ thông tin, Hệ thống thông tin,...)
Cách sử dụng nhanh:
from transformers import pipeline
ner = pipeline(
"ner",
model="NhanSoHocCode/xlmr-ner-4labels-v2",
tokenizer="NhanSoHocCode/xlmr-ner-4labels-v2",
aggregation_strategy="simple"
)
text = "Tuyển dụng Data Engineer tốt nghiệp Cử nhân Công nghệ thông tin. Thành thạo Apache Spark, SQL và có kỹ năng làm việc nhóm."
results = ner(text)
for res in results:
print(f"[{res['entity_group']}] {res['word']} (Score: {res['score']:.2%})")
- Downloads last month
- 39