Instructions to use HuggingFaceTB/cosmo2-tokenizer with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use HuggingFaceTB/cosmo2-tokenizer with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("HuggingFaceTB/cosmo2-tokenizer", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| library_name: transformers | |
| datasets: | |
| - HuggingFaceTB/cosmo2_training_data_subset_1M | |
| # cosmo2-tokenizer | |
| Tokenizer for the training of cosmo2. This tokenizer was trained on 1M samples from: | |
| - FineWeb-Edu 70% | |
| - Cosmopedia v2 15% | |
| - StarCoderData 8% | |
| - OpenWebMath 5% | |
| - StackOverFlow 2% |