You need to agree to share your contact information to access this model

This repository is publicly accessible, but you have to accept the conditions to access its files and content.

Log in or Sign Up to review the conditions and access this model content.

Greek fine-tuned model based on multilingual-e5-base

This is a sentence-transformers model finetuned from intfloat/multilingual-e5-base on the generator dataset. It maps sentences & paragraphs to a 768-dimensional dense vector space and can be used for semantic textual similarity, semantic search, paraphrase mining, text classification, clustering, and more.

Model Details

Model Description

  • Model Type: Sentence Transformer
  • Base model: intfloat/multilingual-e5-base
  • Maximum Sequence Length: 512 tokens
  • Output Dimensionality: 768 dimensions
  • Similarity Function: Cosine Similarity
  • Training Dataset:
    • generator
  • Language: gr
  • License: apache-2.0

Model Sources

Full Model Architecture

SentenceTransformer(
  (0): Transformer({'max_seq_length': 512, 'do_lower_case': False, 'architecture': 'XLMRobertaModel'})
  (1): Pooling({'word_embedding_dimension': 768, 'pooling_mode_cls_token': False, 'pooling_mode_mean_tokens': True, 'pooling_mode_max_tokens': False, 'pooling_mode_mean_sqrt_len_tokens': False, 'pooling_mode_weightedmean_tokens': False, 'pooling_mode_lasttoken': False, 'include_prompt': True})
  (2): Normalize()
)

Usage

Direct Usage (Sentence Transformers)

First install the Sentence Transformers library:

pip install -U sentence-transformers

Then you can load this model and run inference.

from sentence_transformers import SentenceTransformer

# Download from the 🤗 Hub
model = SentenceTransformer("sentence_transformers_model_id")
# Run inference
sentences = [
    'Evocati Augusti, Διομητιανός, Κικέρωνας, ρωμαϊκός στρατός',
    'Evocatus\nEvocatus είναι ο λατινικός όρος που αναφέρεται στο στρατιώτη εκείνο του ρωμαϊκού στρατού που ολοκλήρωσε τη θητεία του, έλαβε το απολυτήριό του "(missio)", ωστόσο επέλεξε εθελοντικά να καταταγεί και πάλι, έπειτα από πρόσκληση κάποιου υπάτου ή άλλου διοικητή.\nΑπό ό,τι φαίνεται, πάντα υπήρχε σημαντικός αριθμός από evocati σε κάθε αξιόλογο στρατό, και όταν ο στρατηγός ήταν αγαπητός στους άνδρες του, ο αριθμός βετεράνων που κατατάσσονταν και πάλι στα στρατεύματά του ήταν αυξημένος. Οι evocati απαλλάσσονταν, όπως οι vexillationes, από τις συνηθισμένες στρατιωτικές αγγαρείες, όπως για παράδειγμα την ύψωση οχυρωμάτων για το στρατόπεδο ή την κατασκευή δρόμων Ο βαθμός τους γενικότερα θεωρείτο υψηλότερος από αυτόν των συνηθισμένων λεγεωναρίων. Ορισμένες φορές γίνεται κοινή αναφορά σε αυτούς με τους ιππείς, ενώ άλλες φορές κατατάσσονται με τους εκατοντάρχους. Φαίνεται δε πως συχνά λάμβαναν προαγωγή για το αξίωμα του εκατοντάρχου. Συνεπώς, ο Πομπήιος παρακίνησε πολλούς από τους βετεράνους που υπηρέτησαν υπό τις διαταγές του σε προγενέστερα έτη να ενωθούν μαζί του κατά την περίοδο των εμφυλίων πολέμων, υποσχόμενος ανταμοιβές και τη διοίκηση εκατονταρχιών. Ωστόσο δεν μπορούσαν όλοι οι evocati να γίνουν εκατόνταρχοι, ούτε να αποτελέσουν τμήμα ορισμένων από τις κοόρτεις. Ο ρήτορας Κικέρων κάνει αναφορά σε κάποιον "praefectus evocatorum", έναν αξιωματικό επικεφαλής για τους evocati.\nΜε το όνομα evocati ήταν επίσης γνωστά τα μέλη ενός επίλεκτου σώματος νεαρών ανδρών από την τάξη των ιππέων στους οποίους ανέθεσε ο Αυτοκράτορας Διομητιανός να φυλάσσουν την κρεβατοκάμαρά του. Ορισμένοι συγγραφείς υποστηρίζουν ότι το σώμα αυτό επιβίωσε και κατά την εποχή επόμενων αυτοκρατόρων, με αποτέλεσμα να ταυτίζεται με εκείνους που αργότερα έγιναν γνωστοί ως "Evocati Augusti".',
    "Τίτλος: ΝΟΜΟΣ ΥΠ' ΑΡΙΘΜ. 4174\nΈτος: 2013\nΦορολογικές διαδικασίες και άλλες διατάξεις.\nΆρθρο 24\nΤίτλος άρθρου: Πρόσβαση στα βιβλία και στοιχεία\n1. Η Φορολογική Διοίκηση έχει δικαίωμα να λαμβάνει αντίγραφα των βιβλίων και στοιχείων, καθώς και λοιπών εγγράφων, για τα οποία ο φορολογούμενος δηλώνει ότι αντιπροσωπεύουν ακριβή αντίγραφα. Σε περίπτωση που ο φορολογούμενος αρνείται να προβεί στην ανωτέρω δήλωση, ο οριζόμενος από τη Φορολογική Διοίκηση υπάλληλος προβαίνει σε σχετική επισημείωση επί των εγγράφων. Ο οριζόμενος υπάλληλος δύναται ταυτόχρονα να απαιτεί από το φορολογούμενο ή τον φορολογικό εκπρόσωπό του να παρίσταται στον τόπο όπου διενεργείται ο φορολογικός έλεγχος και να απαντά σε ερωτήματα που του τίθενται, ώστε να διευκολύνεται η διενέργεια του φορολογικού ελέγχου.\n2. Εάν τα βιβλία και στοιχεία τηρούνται σε ηλεκτρονική μορφή, η Φορολογική Διοίκηση έχει δικαίωμα πρόσβασης σε οποιαδήποτε φυλασσόμενα αρχεία, καθώς και στα λογιστικά προγράμματα και τις πληροφορίες που έχουν καταχωριστεί σε αυτά. Η Φορολογική Διοίκηση δικαιούται να λαμβάνει τα ηλεκτρονικά αρχεία σε αναγνώσιμη ηλεκτρονική ή έντυπη μορφή.\n3. Ο υπάλληλος που έχει ορίσει η Φορολογική Διοίκηση δύναται να κατάσχει βιβλία και στοιχεία που τηρούνται ή διαφυλάσσονται σύμφωνα με τη φορολογική νομοθεσία και οποιαδήποτε άλλα ανεπίσημα βιβλία, έγγραφα, αρχεία ή στοιχεία, εφόσον το θεωρήσει αναγκαίο, προκειμένου να διασφαλισθεί η αποδεικτική αξία αυτών.",
]
embeddings = model.encode(sentences)
print(embeddings.shape)
# [3, 768]

# Get the similarity scores for the embeddings
similarities = model.similarity(embeddings, embeddings)
print(similarities)
# tensor([[ 1.0000,  0.7011, -0.0543],
#         [ 0.7011,  1.0000, -0.0311],
#         [-0.0543, -0.0311,  1.0000]])

Evaluation

Metrics

Information Retrieval

Metric Value
cosine_accuracy@3 0.8113
cosine_accuracy@10 0.8851
cosine_precision@3 0.2704
cosine_precision@10 0.0885
cosine_recall@3 0.8113
cosine_recall@10 0.8851
cosine_ndcg@3 0.7622
cosine_ndcg@10 0.7894
cosine_mrr@3 0.7452
cosine_mrr@10 0.7585
cosine_map@100 0.762

Information Retrieval

Metric Value
cosine_accuracy@3 0.7682
cosine_accuracy@10 0.8548
cosine_accuracy@50 0.9314
cosine_precision@10 0.0855
cosine_recall@10 0.8548
cosine_ndcg@3 0.7146
cosine_ndcg@10 0.7462
cosine_ndcg@50 0.7636
cosine_mrr@10 0.7114
cosine_map@100 0.7157

Training Details

Training Dataset

generator

  • Dataset: generator
  • Columns: anchor and positive
  • Loss: MultipleNegativesRankingLoss with these parameters:
    {
        "scale": 20.0,
        "similarity_fct": "cos_sim",
        "gather_across_devices": false
    }
    

Evaluation Dataset

Unnamed Dataset

  • Size: 20,000 evaluation samples
  • Columns: anchor and positive
  • Approximate statistics based on the first 1000 samples:
    anchor positive
    type string string
    details
    • min: 9 tokens
    • mean: 42.63 tokens
    • max: 512 tokens
    • min: 13 tokens
    • mean: 415.22 tokens
    • max: 512 tokens
  • Samples:
    anchor positive
    How many different types of cells have been identified by 2021? Τύπος κυττάρων
    Ο τύπος κυττάρων είναι μια ταξινόμηση που χρησιμοποιείται για τον προσδιορισμό των κυττάρων που έχουν κοινά μορφολογικά ή φαινοτυπικά χαρακτηριστικά Ένας πολυκύτταρος οργανισμός μπορεί να περιέχει έναν αριθμό κυττάρων που διαφέρει ευρέως και εξειδικευμένων τύπων κυττάρων, όπως μυϊκά κύτταρα και κύτταρα δέρματος, που διαφέρουν τόσο στην εμφάνιση όσο και στη λειτουργία, αλλά έχουν ταυτόσημες γονιδιωματικές αλληλουχίες. Τα κύτταρα μπορεί να έχουν τον ίδιο γονότυπο, αλλά να ανήκουν σε διαφορετικούς κυτταρικούς τύπους λόγω της διαφορετικής ρύθμισης των γονιδίων που περιέχουν. Η ταξινόμηση ενός συγκεκριμένου κυτταρικού τύπου γίνεται συχνά με τη χρήση του μικροσκοπίου (όπως αυτά από την οικογένεια σύμπλεγμα διαφοροποίησης (cluster of differentiation) που χρησιμοποιούνται συνήθως για αυτόν τον σκοπό στην ανοσολογία). Οι πρόσφατες εξελίξεις στην αλληλουχία RNA μονοκυττάρου διευκόλυνε την ταξινόμηση των τύπων κυττάρων με βάση κοινά πρότυπα γονιδιακής έκφρασης. Αυτό οδήγησε στην αν...
    Katzedo (Hangsangnam-do) is the second largest island in South Korea. It is one of the many on the south coast of the Korean peninsula, in the province of Gyungsangnam-do, and on it is built most of the city of Katzeh. Katzedo is only 450m away from the adjacent mainland coast, which is connected with two bridges to the town of Tongyan. Moreover, the "State Connection Busan-Kefze", a combination of two bridge and a submarine tunnel, was inaugurated in December 2010 and provides a more direct connection to the big city of Bosuna. Το Κατζεντό είναι νησί του Στενού της Κορέας και έχει έκταση 383,44 τετραγωνικά χιλιόμετρα, που το καθιστά το δεύτερο σε έκταση νησί ολόκληρης της Νότιας Κορέας (το μεγαλύτερο είναι το Τζέτζου). Το τοπίο του Κατζεντό είναι λοφώδες, με αρκετές κορυφές: Το υψηλότερο σημείο του νησιού είναι η κορυφή Γκάρα, με υψόμετρο 580 μέτρα πάνω από την επιφάνεια της θάλασσας, και ακολουθεί η Γκαρόνγκ (554,9 μέτρα). Το νησί είναι γνωστό για τα μεγάλα αποθέματα γρανίτη που διαθέτει. Η νότια ζώνη του, μαζί με ένα μέρος του νησιού Ναμχέ-ντο, συναποτελεί το Εθνικό Θαλάσσιο Πάρκο Χαλυά. Το Κατζεντό έχει αρκετούς φυσικούς λιμένες. Η σημαντικότερη βιομηχανία στο νησί είναι η ναυπηγική. Το δεύτερο και το τρίτο μεγαλύτερο από τα ναυπηγεία της Νότιας Κορέας βρίσκονται αμφότερα στο Κατζεντό: Αυτό της Daewoo (Daewoo Shipbuilding & Marine Engineering, DSME) στο δημοτικό διαμέρισμα Οκπό της Κατζέ και αυτό της Samsung (SHI) στο δημοτικό διαμέρισμα Κοχυάν της Κατζέ. Το κα (거) σημαίνει «μεγάλο», το τζε (제) σημαίνει «...
    Ποιες πληροφορίες πρέπει να γνωστοποιούνται στην Επιτροπή Κεφαλαιαγοράς κατά την απόκτηση ειδικής συμμετοχής; Τίτλος: ΝΟΜΟΣ ΥΠ' ΑΡΙΘΜ. 3606
    Έτος: 2007
    Αγορές χρηματοπιστωτικών μέσων και άλλες διατάξεις.
    Άρθρο 16
    Τίτλος άρθρου: Μέτοχοι ΑΕΠΕΥ με ειδικές συμμετοχές
    1. Η Επιτροπή Κεφαλαιαγοράς χορηγεί άδεια για την παροχή επενδυτικών υπηρεσιών ή την άσκηση επενδυτικών δραστηριοτήτων σε ΑΕΠΕΥ μόνο εφόσον γνωρίζει την ταυτότητα των άμεσων ή έμμεσων μετόχων, φυσικών ή νομικών προσώπων, που κατέχουν ειδικές συμμετοχές, καθώς και το ύψος των εν λόγω ειδικών συμμετοχών. Η Επιτροπή Κεφαλαιαγοράς δεν χορηγεί άδεια λειτουργίας εφόσον, εν όψει της ανάγκης να διασφαλιστεί η ορθή και συνετή διαχείριση της ΑΕΠΕΥ, δεν έχει πεισθεί για την καταλληλότητα των μετόχων που κατέχουν ειδικές συμμετοχές. Εάν υπάρχουν στενοί δεσμοί μεταξύ της ΑΕΠΕΥ και άλλων φυσικών ή νομικών προσώπων, η Επιτροπή Κεφαλαιαγοράς χορηγεί άδεια λειτουργίας μόνο εάν οι δεσμοί αυτοί δεν εμποδίζουν την αποτελεσματική άσκηση των εποπτικών της καθηκόντων.
    2. Η Επιτροπή Κεφαλαιαγοράς δεν χορηγεί άδεια εάν οι νομοθετικές, κανονιστικές ή διοικητικέ...
  • Loss: MultipleNegativesRankingLoss with these parameters:
    {
        "scale": 20.0,
        "similarity_fct": "cos_sim",
        "gather_across_devices": false
    }
    

Training Hyperparameters

Non-Default Hyperparameters

  • eval_strategy: steps
  • per_device_train_batch_size: 16
  • per_device_eval_batch_size: 16
  • gradient_accumulation_steps: 8
  • learning_rate: 5e-06
  • max_steps: 232470
  • lr_scheduler_type: cosine
  • warmup_ratio: 0.1
  • bf16: True
  • tf32: True
  • load_best_model_at_end: True

All Hyperparameters

Click to expand
  • overwrite_output_dir: False
  • do_predict: False
  • eval_strategy: steps
  • prediction_loss_only: True
  • per_device_train_batch_size: 16
  • per_device_eval_batch_size: 16
  • per_gpu_train_batch_size: None
  • per_gpu_eval_batch_size: None
  • gradient_accumulation_steps: 8
  • eval_accumulation_steps: None
  • torch_empty_cache_steps: None
  • learning_rate: 5e-06
  • weight_decay: 0.0
  • adam_beta1: 0.9
  • adam_beta2: 0.999
  • adam_epsilon: 1e-08
  • max_grad_norm: 1.0
  • num_train_epochs: 3.0
  • max_steps: 232470
  • lr_scheduler_type: cosine
  • lr_scheduler_kwargs: {}
  • warmup_ratio: 0.1
  • warmup_steps: 0
  • log_level: passive
  • log_level_replica: warning
  • log_on_each_node: True
  • logging_nan_inf_filter: True
  • save_safetensors: True
  • save_on_each_node: False
  • save_only_model: False
  • restore_callback_states_from_checkpoint: False
  • no_cuda: False
  • use_cpu: False
  • use_mps_device: False
  • seed: 42
  • data_seed: None
  • jit_mode_eval: False
  • bf16: True
  • fp16: False
  • fp16_opt_level: O1
  • half_precision_backend: auto
  • bf16_full_eval: False
  • fp16_full_eval: False
  • tf32: True
  • local_rank: 0
  • ddp_backend: None
  • tpu_num_cores: None
  • tpu_metrics_debug: False
  • debug: []
  • dataloader_drop_last: False
  • dataloader_num_workers: 0
  • dataloader_prefetch_factor: None
  • past_index: -1
  • disable_tqdm: False
  • remove_unused_columns: True
  • label_names: None
  • load_best_model_at_end: True
  • ignore_data_skip: False
  • fsdp: []
  • fsdp_min_num_params: 0
  • fsdp_config: {'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}
  • fsdp_transformer_layer_cls_to_wrap: None
  • accelerator_config: {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}
  • parallelism_config: None
  • deepspeed: None
  • label_smoothing_factor: 0.0
  • optim: adamw_torch_fused
  • optim_args: None
  • adafactor: False
  • group_by_length: False
  • length_column_name: length
  • project: huggingface
  • trackio_space_id: trackio
  • ddp_find_unused_parameters: None
  • ddp_bucket_cap_mb: None
  • ddp_broadcast_buffers: False
  • dataloader_pin_memory: True
  • dataloader_persistent_workers: False
  • skip_memory_metrics: True
  • use_legacy_prediction_loop: False
  • push_to_hub: False
  • resume_from_checkpoint: None
  • hub_model_id: None
  • hub_strategy: every_save
  • hub_private_repo: None
  • hub_always_push: False
  • hub_revision: None
  • gradient_checkpointing: False
  • gradient_checkpointing_kwargs: None
  • include_inputs_for_metrics: False
  • include_for_metrics: []
  • eval_do_concat_batches: True
  • fp16_backend: auto
  • push_to_hub_model_id: None
  • push_to_hub_organization: None
  • mp_parameters:
  • auto_find_batch_size: False
  • full_determinism: False
  • torchdynamo: None
  • ray_scope: last
  • ddp_timeout: 1800
  • torch_compile: False
  • torch_compile_backend: None
  • torch_compile_mode: None
  • include_tokens_per_second: False
  • include_num_input_tokens_seen: no
  • neftune_noise_alpha: None
  • optim_target_modules: None
  • batch_eval_metrics: False
  • eval_on_start: False
  • use_liger_kernel: False
  • liger_kernel_config: None
  • eval_use_gather_object: False
  • average_tokens_across_devices: True
  • prompts: None
  • batch_sampler: batch_sampler
  • multi_dataset_batch_sampler: proportional
  • router_mapping: {}
  • learning_rate_mapping: {}

Training Logs

Epoch Step Training Loss Validation Loss test_cosine_ndcg@10 valid_cosine_ndcg@50
-1 -1 - - 0.6040 -
0.8173 190000 0.6821 0.0549 0.7944 0.7748
1.0159 195000 0.6781 0.0539 0.8008 0.7794
1.0374 200000 0.6758 0.0608 0.7964 0.7736
1.0589 205000 0.6769 0.0652 0.7936 0.7690
1.0804 210000 0.6754 0.0679 0.7922 0.7673
1.1019 215000 0.6747 0.0704 0.7907 0.7652
1.1234 220000 0.6749 0.0715 0.7902 0.7642
1.1449 225000 0.6733 0.0721 0.7897 0.7636
1.1664 230000 0.675 0.0724 0.7894 0.7636
  • The bold row denotes the saved checkpoint.

Framework Versions

  • Python: 3.10.12
  • Sentence Transformers: 5.1.1
  • Transformers: 4.57.1
  • PyTorch: 2.9.0+cu128
  • Accelerate: 1.10.1
  • Datasets: 4.2.0
  • Tokenizers: 0.22.1

Citation

BibTeX

Sentence Transformers

@inproceedings{reimers-2019-sentence-bert,
    title = "Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks",
    author = "Reimers, Nils and Gurevych, Iryna",
    booktitle = "Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing",
    month = "11",
    year = "2019",
    publisher = "Association for Computational Linguistics",
    url = "https://arxiv.org/abs/1908.10084",
}

MultipleNegativesRankingLoss

@misc{henderson2017efficient,
    title={Efficient Natural Language Response Suggestion for Smart Reply},
    author={Matthew Henderson and Rami Al-Rfou and Brian Strope and Yun-hsuan Sung and Laszlo Lukacs and Ruiqi Guo and Sanjiv Kumar and Balint Miklos and Ray Kurzweil},
    year={2017},
    eprint={1705.00652},
    archivePrefix={arXiv},
    primaryClass={cs.CL}
}
Downloads last month
264
Safetensors
Model size
0.3B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for novelcore/Orpheas

Finetuned
(175)
this model

Papers for novelcore/Orpheas

Evaluation results