cs_core_news_sm 0.2.1

This folder contains the released Czech spaCy pipeline only. It does not include the training pipeline or training corpora.

Contents

pipeline/                                      # spaCy pipeline directory
cs_core_news_sm-0.2.1-py3-none-any.whl         # prebuilt wheel
build_package.sh                               # rebuilds the wheel from pipeline/
requirements.txt                               # minimal build/load requirements
LICENSE

Install Prebuilt Wheel

python -m pip install cs_core_news_sm-0.2.1-py3-none-any.whl

Load Directly

import spacy

nlp = spacy.load("pipeline")
doc = nlp("Prezident Petr Pavel jednal v Praze.")
print([(ent.text, ent.label_) for ent in doc.ents])

Build Wheel

python -m venv .venv
source .venv/bin/activate
python -m pip install -r requirements.txt
./build_package.sh

The rebuilt wheel will be written to:

packages/cs_core_news_sm-0.2.1/dist/cs_core_news_sm-0.2.1-py3-none-any.whl

Install Rebuilt Wheel

python -m pip install packages/cs_core_news_sm-0.2.1/dist/cs_core_news_sm-0.2.1-py3-none-any.whl

Then load by package name:

import spacy
nlp = spacy.load("cs_core_news_sm")

Pipeline

tok2vec
morphologizer
parser
trainable_lemmatizer
ner

Evaluation

Held-out Czech test corpus:

TOK      99.64
POS      97.33
MORPH    90.79
LEMMA    96.95
UAS      87.49
LAS      82.37
NER F    57.03
SENT F   99.91

License

CC BY-NC-SA 3.0 due to derived Czech Named Entity Corpus 2.0 data.

Downloads last month
10
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Evaluation results

  • NER F1 on Czech Named Entity Corpus 2.0 held-out test split
    self-reported
    57.030
  • POS Accuracy on Czech-PDTC UD held-out test split
    self-reported
    97.330