dkudos commited on
Commit
5a15826
·
verified ·
1 Parent(s): a7a07a2

Upload folder using huggingface_hub

Browse files
.gitattributes CHANGED
@@ -33,3 +33,5 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ checkpoint-4000-Q8_0.gguf filter=lfs diff=lfs merge=lfs -text
37
+ checkpoint-4000-f16.gguf filter=lfs diff=lfs merge=lfs -text
README.md CHANGED
@@ -1,116 +1,125 @@
1
  ---
2
  language: en
3
  license: apache-2.0
 
4
  tags:
5
- - llm
6
- - devops
7
- - kubernetes
8
- - terraform
9
- - aws
10
- - docker
11
- - infrastructure
12
- - cicd
13
- - linux
14
- - self-trained
15
- library_name: transformers
16
  ---
17
 
18
- # Cinimod DevOps 1.5B
19
 
20
- A 1.5B parameter (781M active) Llama-3 style language model, trained from scratch on DevOps and cloud infrastructure data. Designed for answering technical questions about Kubernetes, Terraform, AWS, Docker, CI/CD, Linux administration, and cloud operations.
21
 
22
  ## Model Details
23
 
24
- | Parameter | Value |
25
- |-----------|-------|
26
- | **Architecture** | LlamaForCausalLM (custom) |
27
- | **Parameters** | ~781M active (1.5B config name) |
28
- | **Hidden Size** | 1536 |
29
- | **Layers** | 24 |
30
- | **Attention Heads** | 24 (Q) / 6 (KV) - GQA |
31
- | **Intermediate Size** | 4096 |
32
- | **Vocab Size** | 65,536 (BPE) |
33
- | **Context Window** | 1,024 tokens (training) |
34
- | **RoPE Theta** | 500,000 |
35
- | **Training Dtype** | FP32 (full precision) |
36
- | **Inference Dtype** | FP16 |
37
- | **Tokenizer** | Custom BPE, 65K vocab |
38
-
39
- ## Training Details
40
-
41
- ### Pretraining
42
- - **Data**: ~50GB curated DevOps corpus (FineWeb-Edu subset, GitHub DevOps repos, cloud provider documentation)
43
- - **Steps**: 60,423
44
- - **Batch Size**: 8 (2 GPUs x 1 per GPU x 4 grad accum)
45
- - **Learning Rate**: Peak 3e-4, cosine decay
46
- - **Optimizer**: DeepSpeed ZeRO-2
47
- - **Sequence Length**: 1,024
48
- - **Hardware**: 2x Tesla V100 16GB
49
- - **Training Time**: ~6 days
50
-
51
- ### Architecture Notes
52
- - **No RoPE scaling** - previous linear scaling (factor=256) broke positional encoding during training, pinning loss at unigram floor
53
- - **Gradient checkpointing** enabled for memory efficiency
54
- - **Tied word embeddings** for parameter savings
55
-
56
- ## Usage
 
 
 
 
 
 
 
 
 
 
 
 
 
57
 
58
  ```python
59
- from transformers import AutoModelForCausalLM, AutoTokenizer
60
-
61
- tokenizer = AutoTokenizer.from_pretrained('dkudos/cinimod-devops')
62
- model = AutoModelForCausalLM.from_pretrained(
63
- 'dkudos/cinimod-devops',
64
- torch_dtype='auto',
65
- device_map='auto',
66
- trust_remote_code=True
67
- )
68
-
69
- prompt = 'How do I set up a Kubernetes Deployment?'
70
- inputs = tokenizer(prompt, return_tensors='pt').to(model.device)
71
- outputs = model.generate(**inputs, max_new_tokens=256, temperature=0.7, top_p=0.9)
72
- print(tokenizer.decode(outputs[0], skip_special_tokens=True))
73
  ```
74
 
75
- ### OpenAI-Compatible Server
 
 
 
 
 
 
 
76
 
77
  ```bash
78
- python scripts/serve_model.py --model_path dkudos/cinimod-devops --tokenizer_path tokenizer --port 8080
79
  ```
80
 
81
- ## Capabilities
82
 
83
- The model was trained on a broad DevOps corpus covering:
84
- - **Kubernetes**: Pods, Deployments, StatefulSets, Services, Ingress, networking, storage, RBAC, Helm, operators, troubleshooting
85
- - **Terraform**: IaC, state management, modules, providers, workspaces, import, best practices
86
- - **AWS**: EC2, S3, VPC, RDS, EKS, Lambda, IAM, CloudWatch, cost optimization
87
- - **Docker**: Images, containers, volumes, networking, Compose, multi-stage builds, Swarm
88
- - **CI/CD**: GitHub Actions, Jenkins, GitLab CI, ArgoCD, deployment strategies, pipelines
89
- - **Linux**: System administration, networking, security, performance monitoring, systemd
90
- - **Monitoring**: Prometheus, Grafana, Alertmanager, Loki, Elasticsearch, distributed tracing
91
- - **Security**: Zero trust, vulnerability scanning, incident response, penetration testing
92
- - **Networking**: DNS, load balancing, CDN, SSL/TLS, troubleshooting
93
 
94
- ## Limitations
95
 
96
- - **Context window**: 1,024 tokens training context (RoPE theta 500K allows extrapolation to ~256K at inference, but quality may degrade)
97
- - **Parameter count**: 781M params - smaller than typical production models; complex reasoning may be limited
98
- - **Training data**: ~50GB - curated but limited compared to frontier models
99
- - **No instruction tuning**: This is the base model. Chat-tuned versions available separately.
100
- - **Hallucination**: May produce incorrect technical details, especially for niche topics or version-specific APIs
101
- - **No code execution**: Cannot run commands or verify solutions - always test in a safe environment
102
 
103
- ## Ethical Considerations
 
 
 
 
104
 
105
- This model is designed as a technical assistant for DevOps professionals. Always verify generated configurations and commands before applying to production systems. Infrastructure changes can have significant consequences if applied without review.
106
 
107
- ## Citation
108
 
109
- ```bibtex
110
- @misc{cinimod-devops-1b5,
111
- title={Cinimod DevOps 1.5B},
112
- author={Dominic Kaiser},
113
- year={2026},
114
- url={https://huggingface.co/dkudos/cinimod-devops}
115
- }
116
- ```
 
1
  ---
2
  language: en
3
  license: apache-2.0
4
+ base_model: dkudos/cinimod-devops
5
  tags:
6
+ - cinimod
7
+ - devops
8
+ - llm
9
+ - causal-lm
10
+ - llama
11
+ - llama.cpp
12
+ pipeline_tag: text-generation
13
+ model-index:
14
+ - name: Cinimod DevOps 300M
15
+ results: []
 
16
  ---
17
 
18
+ # Cinimod DevOps 300M
19
 
20
+ A 287M-parameter decoder-only causal language model (Llama-3 style architecture), trained from scratch on a DevOps/ops SysAdmin domain corpus. Target usage: devops tooling assistance, ops documentation, and small on-box language modeling.
21
 
22
  ## Model Details
23
 
24
+ | Property | Value |
25
+ |---|---|
26
+ | Parameters | 287,310,848 (~287M) |
27
+ | Architecture | Llama-style decoder-only (custom, not stock `transformers` LlamaForCausalLM params) |
28
+ | Hidden size | 1024 |
29
+ | Layers | 20 |
30
+ | Attention heads | 16 |
31
+ | KV heads (GQA) | 4 |
32
+ | Intermediate size | 2730 |
33
+ | Vocab size | 65,536 (BPE) |
34
+ | Position embeddings | RoPE, theta = 500000 |
35
+ | Trained context | 4096 tokens |
36
+ | Max context (served) | up to 256K via linear RoPE scaling |
37
+ | Embeddings | tied (no separate lm_head) |
38
+
39
+ ## Training
40
+
41
+ - **Objective**: from-scratch pretraining on a DevOps/ops corpus.
42
+ - **Compute**: 2x RTX 4090 (24 GB each, bf16), DeepSpeed ZeRO-2, FP32 master weights via bf16 autocast.
43
+ - **Tokens**: one epoch over ~132,068 sequences at seq_len 4096 (~540M tokens).
44
+ - **Steps**: 4000, warmup 40, LR 6e-4 cosine decay (final step LR ~0).
45
+ - **Efficient attention**: `torch.nn.functional.scaled_dot_product_attention` (flash path via flash-attn 2).
46
+ - **Loss trajectory**: train loss 0.43 (step 2000) -> 0.35 (step 4000).
47
+
48
+ ### Evaluation
49
+
50
+ - **Held-out full validation** (17,492 bins / 123,656 sequences @ 4096): mean eval loss ~2.30 (perplexity ~10). Final value in `full_val_eval.log`.
51
+ - Note: the model is trained for exactly one epoch; a small train-eval gap is expected and the held-out score is the honest number.
52
+
53
+ ## Files
54
+
55
+ | File | Description | Size |
56
+ |---|---|---|
57
+ | `model.safetensors` | Full bf16 PyTorch weights (HF format with `config.json`, `tokenizer.json`/`tokenizer_config.json`) | 548 MiB |
58
+ | `checkpoint-4000-f16.gguf` | GGUF F16 (float16) - best quality for llama.cpp | 550 MiB |
59
+ | `checkpoint-4000-Q8_0.gguf` | GGUF Q8_0 8-bit quantized - recommended for most uses (near-lossless, ~2x smaller) | 344 MiB |
60
+ | `config.json` | Model config (transformers) | - |
61
+ | `tokenizer.json` / `tokenizer_config.json` | BPE tokenizer (vocab 65,536) | - |
62
+ | `train_log.log` | Full training log (steps, losses, LR) | - |
63
+ | `full_val_eval.log` | Held-out full validation eval log | - |
64
+
65
+ ## How to run
66
+
67
+ ### HuggingFace transformers (PyTorch)
68
+
69
+ The `model.safetensors` require the Cinimod architecture classes (`cinimod.model.llama.LlamaForCausalLM`) — a custom Llama variant, **not** the stock `transformers.LlamaForCausalLM`. Load from the repo source only:
70
 
71
  ```python
72
+ import sys
73
+ sys.path.insert(0, "/path/to/cinimod-llm/src") # package src/cinimod
74
+ from cinimod.model.llama import LlamaForCausalLM
75
+ from transformers import PreTrainedTokenizerFast
76
+
77
+ model = LlamaForCausalLM.from_pretrained("dkudos/cinimod-devops")
78
+ tok = PreTrainedTokenizerFast.from_pretrained("dkudos/cinimod-devops")
79
+ ids = tok.encode("how do I check nginx status", return_tensors="pt")
80
+ out = model.generate(ids, max_new_tokens=64)
81
+ print(tok.decode(out[0]))
 
 
 
 
82
  ```
83
 
84
+ > If you are not in the Cinimod repo, use the GGUFs instead — they are standalone and need no source code. We publish GGUFs precisely because the HF-PyTorch path depends on the custom architecture classes.
85
+ ```
86
+
87
+ ### llama.cpp (recommended for serving)
88
+
89
+ Both GGUFs load directly in llama.cpp / llama-server with no external deps.
90
+
91
+ Default (train context, 4096):
92
 
93
  ```bash
94
+ llama-server -m dkudos/cinimod-devops/checkpoint-4000-Q8_0.gguf --port 8080
95
  ```
96
 
97
+ 256K context via linear RoPE scaling (trained at 4096):
98
 
99
+ ```bash
100
+ llama-server -m dkudos/cinimod-devops/checkpoint-4000-Q8_0.gguf \
101
+ --ctx-size 262144 --rope-scaling linear --rope-scale 64 --port 8080
102
+ ```
 
 
 
 
 
 
103
 
104
+ Rope scaling is **serve-time only**; this model ships with `rope_scaling: null`. For aggressive 64x scaling, Yarn (`--rope-scaling yarn --rope-scale 64`) often generalizes better than linear if long-range coherence suffers.
105
 
106
+ One-line test:
 
 
 
 
 
107
 
108
+ ```bash
109
+ llama-server -m checkpoint-4000-Q8_0.gguf --ctx-size 262144 --rope-scaling linear --rope-scale 64
110
+ curl http://localhost:8080/v1/chat/completions -H 'Content-Type: application/json' \
111
+ -d '{"messages":[{"role":"user","content":"List 5 common systemd service commands"}],"max_tokens":128}'
112
+ ```
113
 
114
+ ## Notes on the tokenizer
115
 
116
+ Vocabulary is a 65,536-token BPE (custom, `tokenizers` backend). `<pad>`, `<s>`, `</s>`, `<unk>` are at indices 0-3, trained with `pad_token_id=0`. It is a plain causal LM — no chat template is baked in. If GGUF chat-format warnings appear they are just llama.cpp server defaults, not part of the model.
117
 
118
+ ## Limitations
119
+
120
+ - Pretrained from scratch on a single domain (DevOps) for one epoch at small scale (~287M) — expect domain-limited fluency, not general world knowledge.
121
+ - Exact transformers architecture classes are Cinimod-custom; use the GGUFs for maximum portability (no source code needed).
122
+
123
+ ## License
124
+
125
+ Apache 2.0
checkpoint-4000-Q8_0.gguf ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:97226a8f98f42d029a02a76d3c5712f534e92703f7d2252b53b3356c665002da
3
+ size 360204832
checkpoint-4000-f16.gguf ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:691acb9f1efa8db5111afcf0b8bea6258762ee9ca0a4d18283d42db3bda33ae7
3
+ size 577103392
config.json CHANGED
@@ -4,27 +4,24 @@
4
  ],
5
  "attention_bias": false,
6
  "attention_dropout": 0.0,
7
- "bos_token_id": 1,
8
- "dtype": "float16",
9
- "eos_token_id": 2,
10
- "head_dim": 64,
11
  "hidden_act": "silu",
12
- "hidden_size": 1536,
13
  "initializer_range": 0.02,
14
- "intermediate_size": 4096,
15
- "max_position_embeddings": 1024,
16
  "mlp_bias": false,
17
  "model_type": "llama",
18
- "num_attention_heads": 24,
19
- "num_hidden_layers": 24,
20
- "num_key_value_heads": 6,
21
  "pad_token_id": 0,
22
- "pretraining_tp": 1,
23
  "rms_norm_eps": 1e-05,
24
  "rope_parameters": {
25
  "rope_theta": 500000,
26
  "rope_type": "default"
27
  },
 
28
  "tie_word_embeddings": true,
29
  "transformers_version": "5.14.1",
30
  "use_cache": false,
 
4
  ],
5
  "attention_bias": false,
6
  "attention_dropout": 0.0,
7
+ "dtype": "bfloat16",
 
 
 
8
  "hidden_act": "silu",
9
+ "hidden_size": 1024,
10
  "initializer_range": 0.02,
11
+ "intermediate_size": 2730,
12
+ "max_position_embeddings": 4096,
13
  "mlp_bias": false,
14
  "model_type": "llama",
15
+ "num_attention_heads": 16,
16
+ "num_hidden_layers": 20,
17
+ "num_key_value_heads": 4,
18
  "pad_token_id": 0,
 
19
  "rms_norm_eps": 1e-05,
20
  "rope_parameters": {
21
  "rope_theta": 500000,
22
  "rope_type": "default"
23
  },
24
+ "rope_theta": 500000,
25
  "tie_word_embeddings": true,
26
  "transformers_version": "5.14.1",
27
  "use_cache": false,
full_val_eval.log ADDED
@@ -0,0 +1,209 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ [Eval] Loading checkpoint outputs/devops-300m-4096-bf16-vast/checkpoint-4000
2
+ [transformers] LlamaForCausalLM has generative capabilities, as `prepare_inputs_for_generation` is explicitly defined. However, it doesn't directly inherit from `GenerationMixin`. From 👉v4.50👈 onwards, `PreTrainedModel` will NOT inherit from `GenerationMixin`, and this model will lose the ability to call `generate` and other related functions.
3
+ - If you're using `trust_remote_code=True`, you can get rid of this warning by loading the model with an auto class. See https://huggingface.co/docs/transformers/en/model_doc/auto#auto-classes
4
+ - If you are the owner of the model architecture code, please modify your model class such that it inherits from `GenerationMixin` (after `PreTrainedModel`, otherwise you'll get an exception).
5
+ - If you are not the owner of the model architecture class, please contact the model code owner to update it.
6
+ [Eval] 287.3M parameters loaded
7
+ [Dataset] 17492 files, 123,656 non-overlapping samples, seq_len=4096
8
+ [transformers] `use_return_dict` is deprecated! Use `return_dict` instead!
9
+ [Eval] batch 1 | samples 8/123656 | mean_loss 2.4351 | 1s elapsed | 35,948 tok/s
10
+ [Eval] batch 21 | samples 168/123656 | mean_loss 0.5549 | 9s elapsed | 75,776 tok/s
11
+ [Eval] batch 41 | samples 328/123656 | mean_loss 0.4678 | 17s elapsed | 77,938 tok/s
12
+ [Eval] batch 61 | samples 488/123656 | mean_loss 0.4119 | 25s elapsed | 78,609 tok/s
13
+ [Eval] batch 81 | samples 648/123656 | mean_loss 0.3887 | 34s elapsed | 78,920 tok/s
14
+ [Eval] batch 101 | samples 808/123656 | mean_loss 0.3729 | 42s elapsed | 79,039 tok/s
15
+ [Eval] batch 121 | samples 968/123656 | mean_loss 0.3641 | 50s elapsed | 79,081 tok/s
16
+ [Eval] batch 141 | samples 1128/123656 | mean_loss 0.3509 | 58s elapsed | 79,099 tok/s
17
+ [Eval] batch 161 | samples 1288/123656 | mean_loss 0.3459 | 67s elapsed | 79,107 tok/s
18
+ [Eval] batch 181 | samples 1448/123656 | mean_loss 0.3395 | 75s elapsed | 79,110 tok/s
19
+ [Eval] batch 201 | samples 1608/123656 | mean_loss 0.3343 | 83s elapsed | 79,102 tok/s
20
+ [Eval] batch 221 | samples 1768/123656 | mean_loss 0.3313 | 92s elapsed | 79,089 tok/s
21
+ [Eval] batch 241 | samples 1928/123656 | mean_loss 0.3274 | 100s elapsed | 79,048 tok/s
22
+ [Eval] batch 261 | samples 2088/123656 | mean_loss 0.4029 | 108s elapsed | 79,049 tok/s
23
+ [Eval] batch 281 | samples 2248/123656 | mean_loss 0.5424 | 117s elapsed | 79,037 tok/s
24
+ [Eval] batch 301 | samples 2408/123656 | mean_loss 0.6806 | 125s elapsed | 79,016 tok/s
25
+ [Eval] batch 321 | samples 2568/123656 | mean_loss 0.7765 | 133s elapsed | 79,013 tok/s
26
+ [Eval] batch 341 | samples 2728/123656 | mean_loss 0.8807 | 141s elapsed | 78,973 tok/s
27
+ [Eval] batch 361 | samples 2888/123656 | mean_loss 0.9719 | 150s elapsed | 78,961 tok/s
28
+ [Eval] batch 381 | samples 3048/123656 | mean_loss 1.0495 | 158s elapsed | 78,948 tok/s
29
+ [Eval] batch 401 | samples 3208/123656 | mean_loss 1.1496 | 166s elapsed | 78,949 tok/s
30
+ [Eval] batch 421 | samples 3368/123656 | mean_loss 1.2136 | 175s elapsed | 78,921 tok/s
31
+ [Eval] batch 441 | samples 3528/123656 | mean_loss 1.2720 | 183s elapsed | 78,920 tok/s
32
+ [Eval] batch 461 | samples 3688/123656 | mean_loss 1.3302 | 191s elapsed | 78,908 tok/s
33
+ [Eval] batch 481 | samples 3848/123656 | mean_loss 1.3822 | 200s elapsed | 78,904 tok/s
34
+ [Eval] batch 501 | samples 4008/123656 | mean_loss 1.4212 | 208s elapsed | 78,884 tok/s
35
+ [Eval] batch 521 | samples 4168/123656 | mean_loss 1.4664 | 216s elapsed | 78,861 tok/s
36
+ [Eval] batch 541 | samples 4328/123656 | mean_loss 1.5031 | 225s elapsed | 78,864 tok/s
37
+ [Eval] batch 561 | samples 4488/123656 | mean_loss 1.5387 | 233s elapsed | 78,841 tok/s
38
+ [Eval] batch 581 | samples 4648/123656 | mean_loss 1.5600 | 242s elapsed | 78,833 tok/s
39
+ [Eval] batch 601 | samples 4808/123656 | mean_loss 1.5791 | 250s elapsed | 78,831 tok/s
40
+ [Eval] batch 621 | samples 4968/123656 | mean_loss 1.6022 | 258s elapsed | 78,812 tok/s
41
+ [Eval] batch 641 | samples 5128/123656 | mean_loss 1.6348 | 266s elapsed | 78,816 tok/s
42
+ [Eval] batch 661 | samples 5288/123656 | mean_loss 1.6470 | 275s elapsed | 78,803 tok/s
43
+ [Eval] batch 681 | samples 5448/123656 | mean_loss 1.6770 | 283s elapsed | 78,806 tok/s
44
+ [Eval] batch 701 | samples 5608/123656 | mean_loss 1.6898 | 292s elapsed | 78,794 tok/s
45
+ [Eval] batch 721 | samples 5768/123656 | mean_loss 1.7145 | 300s elapsed | 78,776 tok/s
46
+ [Eval] batch 741 | samples 5928/123656 | mean_loss 1.7331 | 308s elapsed | 78,780 tok/s
47
+ [Eval] batch 761 | samples 6088/123656 | mean_loss 1.7482 | 317s elapsed | 78,783 tok/s
48
+ [Eval] batch 781 | samples 6248/123656 | mean_loss 1.7681 | 325s elapsed | 78,782 tok/s
49
+ [Eval] batch 801 | samples 6408/123656 | mean_loss 1.7910 | 333s elapsed | 78,779 tok/s
50
+ [Eval] batch 821 | samples 6568/123656 | mean_loss 1.8134 | 342s elapsed | 78,776 tok/s
51
+ [Eval] batch 841 | samples 6728/123656 | mean_loss 1.8247 | 350s elapsed | 78,767 tok/s
52
+ [Eval] batch 861 | samples 6888/123656 | mean_loss 1.8317 | 358s elapsed | 78,769 tok/s
53
+ [Eval] batch 881 | samples 7048/123656 | mean_loss 1.8502 | 367s elapsed | 78,760 tok/s
54
+ [Eval] batch 901 | samples 7208/123656 | mean_loss 1.8656 | 375s elapsed | 78,748 tok/s
55
+ [Eval] batch 921 | samples 7368/123656 | mean_loss 1.8812 | 383s elapsed | 78,750 tok/s
56
+ [Eval] batch 941 | samples 7528/123656 | mean_loss 1.8935 | 392s elapsed | 78,748 tok/s
57
+ [Eval] batch 961 | samples 7688/123656 | mean_loss 1.9068 | 400s elapsed | 78,751 tok/s
58
+ [Eval] batch 981 | samples 7848/123656 | mean_loss 1.9212 | 408s elapsed | 78,740 tok/s
59
+ [Eval] batch 1001 | samples 8008/123656 | mean_loss 1.9275 | 417s elapsed | 78,735 tok/s
60
+ [Eval] batch 1021 | samples 8168/123656 | mean_loss 1.9460 | 425s elapsed | 78,736 tok/s
61
+ [Eval] batch 1041 | samples 8328/123656 | mean_loss 1.9556 | 433s elapsed | 78,725 tok/s
62
+ [Eval] batch 1061 | samples 8488/123656 | mean_loss 1.9694 | 442s elapsed | 78,727 tok/s
63
+ [Eval] batch 1081 | samples 8648/123656 | mean_loss 1.9707 | 450s elapsed | 78,725 tok/s
64
+ [Eval] batch 1101 | samples 8808/123656 | mean_loss 1.9795 | 458s elapsed | 78,715 tok/s
65
+ [Eval] batch 1121 | samples 8968/123656 | mean_loss 1.9898 | 467s elapsed | 78,716 tok/s
66
+ [Eval] batch 1141 | samples 9128/123656 | mean_loss 1.9981 | 475s elapsed | 78,711 tok/s
67
+ [Eval] batch 1161 | samples 9288/123656 | mean_loss 2.0093 | 483s elapsed | 78,700 tok/s
68
+ [Eval] batch 1181 | samples 9448/123656 | mean_loss 2.0145 | 492s elapsed | 78,701 tok/s
69
+ [Eval] batch 1201 | samples 9608/123656 | mean_loss 2.0230 | 500s elapsed | 78,699 tok/s
70
+ [Eval] batch 1221 | samples 9768/123656 | mean_loss 2.0307 | 508s elapsed | 78,688 tok/s
71
+ [Eval] batch 1241 | samples 9928/123656 | mean_loss 2.0364 | 517s elapsed | 78,683 tok/s
72
+ [Eval] batch 1261 | samples 10088/123656 | mean_loss 2.0445 | 525s elapsed | 78,684 tok/s
73
+ [Eval] batch 1281 | samples 10248/123656 | mean_loss 2.0533 | 533s elapsed | 78,682 tok/s
74
+ [Eval] batch 1301 | samples 10408/123656 | mean_loss 2.0581 | 542s elapsed | 78,684 tok/s
75
+ [Eval] batch 1321 | samples 10568/123656 | mean_loss 2.0644 | 550s elapsed | 78,680 tok/s
76
+ [Eval] batch 1341 | samples 10728/123656 | mean_loss 2.0720 | 558s elapsed | 78,681 tok/s
77
+ [Eval] batch 1361 | samples 10888/123656 | mean_loss 2.0805 | 567s elapsed | 78,680 tok/s
78
+ [Eval] batch 1381 | samples 11048/123656 | mean_loss 2.0827 | 575s elapsed | 78,673 tok/s
79
+ [Eval] batch 1401 | samples 11208/123656 | mean_loss 2.0902 | 583s elapsed | 78,678 tok/s
80
+ [Eval] batch 1421 | samples 11368/123656 | mean_loss 2.0964 | 592s elapsed | 78,671 tok/s
81
+ [Eval] batch 1441 | samples 11528/123656 | mean_loss 2.1036 | 600s elapsed | 78,663 tok/s
82
+ [Eval] batch 1461 | samples 11688/123656 | mean_loss 2.1106 | 609s elapsed | 78,662 tok/s
83
+ [Eval] batch 1481 | samples 11848/123656 | mean_loss 2.1161 | 617s elapsed | 78,663 tok/s
84
+ [Eval] batch 1501 | samples 12008/123656 | mean_loss 2.1225 | 625s elapsed | 78,655 tok/s
85
+ [Eval] batch 1521 | samples 12168/123656 | mean_loss 2.1277 | 634s elapsed | 78,647 tok/s
86
+ [Eval] batch 1541 | samples 12328/123656 | mean_loss 2.1312 | 642s elapsed | 78,647 tok/s
87
+ [Eval] batch 1561 | samples 12488/123656 | mean_loss 2.1368 | 650s elapsed | 78,647 tok/s
88
+ [Eval] batch 1581 | samples 12648/123656 | mean_loss 2.1410 | 659s elapsed | 78,641 tok/s
89
+ [Eval] batch 1601 | samples 12808/123656 | mean_loss 2.1455 | 667s elapsed | 78,643 tok/s
90
+ [Eval] batch 1621 | samples 12968/123656 | mean_loss 2.1506 | 675s elapsed | 78,642 tok/s
91
+ [Eval] batch 1641 | samples 13128/123656 | mean_loss 2.1550 | 684s elapsed | 78,642 tok/s
92
+ [Eval] batch 1661 | samples 13288/123656 | mean_loss 2.1604 | 692s elapsed | 78,642 tok/s
93
+ [Eval] batch 1681 | samples 13448/123656 | mean_loss 2.1658 | 700s elapsed | 78,637 tok/s
94
+ [Eval] batch 1701 | samples 13608/123656 | mean_loss 2.1722 | 709s elapsed | 78,640 tok/s
95
+ [Eval] batch 1721 | samples 13768/123656 | mean_loss 2.1745 | 717s elapsed | 78,638 tok/s
96
+ [Eval] batch 1741 | samples 13928/123656 | mean_loss 2.1791 | 725s elapsed | 78,637 tok/s
97
+ [Eval] batch 1761 | samples 14088/123656 | mean_loss 2.1828 | 734s elapsed | 78,637 tok/s
98
+ [Eval] batch 1781 | samples 14248/123656 | mean_loss 2.1860 | 742s elapsed | 78,635 tok/s
99
+ [Eval] batch 1801 | samples 14408/123656 | mean_loss 2.1904 | 750s elapsed | 78,636 tok/s
100
+ [Eval] batch 1821 | samples 14568/123656 | mean_loss 2.1950 | 759s elapsed | 78,634 tok/s
101
+ [Eval] batch 1841 | samples 14728/123656 | mean_loss 2.1969 | 767s elapsed | 78,628 tok/s
102
+ [Eval] batch 1861 | samples 14888/123656 | mean_loss 2.2013 | 776s elapsed | 78,626 tok/s
103
+ [Eval] batch 1881 | samples 15048/123656 | mean_loss 2.2046 | 784s elapsed | 78,628 tok/s
104
+ [Eval] batch 1901 | samples 15208/123656 | mean_loss 2.2096 | 792s elapsed | 78,623 tok/s
105
+ [Eval] batch 1921 | samples 15368/123656 | mean_loss 2.2126 | 801s elapsed | 78,617 tok/s
106
+ [Eval] batch 1941 | samples 15528/123656 | mean_loss 2.2160 | 809s elapsed | 78,620 tok/s
107
+ [Eval] batch 1961 | samples 15688/123656 | mean_loss 2.2175 | 817s elapsed | 78,618 tok/s
108
+ [Eval] batch 1981 | samples 15848/123656 | mean_loss 2.2175 | 826s elapsed | 78,616 tok/s
109
+ [Eval] batch 2001 | samples 16008/123656 | mean_loss 2.2187 | 834s elapsed | 78,618 tok/s
110
+ [Eval] batch 2021 | samples 16168/123656 | mean_loss 2.2200 | 842s elapsed | 78,614 tok/s
111
+ [Eval] batch 2041 | samples 16328/123656 | mean_loss 2.2234 | 851s elapsed | 78,616 tok/s
112
+ [Eval] batch 2061 | samples 16488/123656 | mean_loss 2.2263 | 859s elapsed | 78,616 tok/s
113
+ [Eval] batch 2081 | samples 16648/123656 | mean_loss 2.2291 | 867s elapsed | 78,617 tok/s
114
+ [Eval] batch 2101 | samples 16808/123656 | mean_loss 2.2318 | 876s elapsed | 78,617 tok/s
115
+ [Eval] batch 2121 | samples 16968/123656 | mean_loss 2.2349 | 884s elapsed | 78,614 tok/s
116
+ [Eval] batch 2141 | samples 17128/123656 | mean_loss 2.2381 | 892s elapsed | 78,615 tok/s
117
+ [Eval] batch 2161 | samples 17288/123656 | mean_loss 2.2403 | 901s elapsed | 78,613 tok/s
118
+ [Eval] batch 2181 | samples 17448/123656 | mean_loss 2.2410 | 909s elapsed | 78,608 tok/s
119
+ [Eval] batch 2201 | samples 17608/123656 | mean_loss 2.2435 | 917s elapsed | 78,607 tok/s
120
+ [Eval] batch 2221 | samples 17768/123656 | mean_loss 2.2463 | 926s elapsed | 78,609 tok/s
121
+ [Eval] batch 2241 | samples 17928/123656 | mean_loss 2.2492 | 934s elapsed | 78,605 tok/s
122
+ [Eval] batch 2261 | samples 18088/123656 | mean_loss 2.2505 | 943s elapsed | 78,601 tok/s
123
+ [Eval] batch 2281 | samples 18248/123656 | mean_loss 2.2533 | 951s elapsed | 78,602 tok/s
124
+ [Eval] batch 2301 | samples 18408/123656 | mean_loss 2.2556 | 959s elapsed | 78,601 tok/s
125
+ [Eval] batch 2321 | samples 18568/123656 | mean_loss 2.2558 | 968s elapsed | 78,598 tok/s
126
+ [Eval] batch 2341 | samples 18728/123656 | mean_loss 2.2585 | 976s elapsed | 78,600 tok/s
127
+ [Eval] batch 2361 | samples 18888/123656 | mean_loss 2.2608 | 984s elapsed | 78,598 tok/s
128
+ [Eval] batch 2381 | samples 19048/123656 | mean_loss 2.2628 | 993s elapsed | 78,594 tok/s
129
+ [Eval] batch 2401 | samples 19208/123656 | mean_loss 2.2647 | 1001s elapsed | 78,594 tok/s
130
+ [Eval] batch 2421 | samples 19368/123656 | mean_loss 2.2670 | 1009s elapsed | 78,595 tok/s
131
+ [Eval] batch 2441 | samples 19528/123656 | mean_loss 2.2687 | 1018s elapsed | 78,591 tok/s
132
+ [Eval] batch 2461 | samples 19688/123656 | mean_loss 2.2713 | 1026s elapsed | 78,589 tok/s
133
+ [Eval] batch 2481 | samples 19848/123656 | mean_loss 2.2732 | 1034s elapsed | 78,591 tok/s
134
+ [Eval] batch 2501 | samples 20008/123656 | mean_loss 2.2744 | 1043s elapsed | 78,588 tok/s
135
+ [Eval] batch 2521 | samples 20168/123656 | mean_loss 2.2756 | 1051s elapsed | 78,587 tok/s
136
+ [Eval] batch 2541 | samples 20328/123656 | mean_loss 2.2810 | 1059s elapsed | 78,589 tok/s
137
+ [Eval] batch 2561 | samples 20488/123656 | mean_loss 2.2824 | 1068s elapsed | 78,585 tok/s
138
+ [Eval] batch 2581 | samples 20648/123656 | mean_loss 2.2848 | 1076s elapsed | 78,583 tok/s
139
+ [Eval] batch 2601 | samples 20808/123656 | mean_loss 2.2865 | 1085s elapsed | 78,586 tok/s
140
+ [Eval] batch 2621 | samples 20968/123656 | mean_loss 2.2866 | 1093s elapsed | 78,583 tok/s
141
+ [Eval] batch 2641 | samples 21128/123656 | mean_loss 2.2882 | 1101s elapsed | 78,581 tok/s
142
+ [Eval] batch 2661 | samples 21288/123656 | mean_loss 2.2896 | 1110s elapsed | 78,583 tok/s
143
+ [Eval] batch 2681 | samples 21448/123656 | mean_loss 2.2907 | 1118s elapsed | 78,581 tok/s
144
+ [Eval] batch 2701 | samples 21608/123656 | mean_loss 2.2958 | 1126s elapsed | 78,577 tok/s
145
+ [Eval] batch 2721 | samples 21768/123656 | mean_loss 2.3010 | 1135s elapsed | 78,578 tok/s
146
+ [Eval] batch 2741 | samples 21928/123656 | mean_loss 2.3032 | 1143s elapsed | 78,579 tok/s
147
+ [Eval] batch 2761 | samples 22088/123656 | mean_loss 2.3048 | 1151s elapsed | 78,577 tok/s
148
+ [Eval] batch 2781 | samples 22248/123656 | mean_loss 2.3010 | 1160s elapsed | 78,579 tok/s
149
+ [Eval] batch 2801 | samples 22408/123656 | mean_loss 2.3022 | 1168s elapsed | 78,577 tok/s
150
+ [Eval] batch 2821 | samples 22568/123656 | mean_loss 2.3038 | 1176s elapsed | 78,579 tok/s
151
+ [Eval] batch 2841 | samples 22728/123656 | mean_loss 2.3055 | 1185s elapsed | 78,578 tok/s
152
+ [Eval] batch 2861 | samples 22888/123656 | mean_loss 2.3052 | 1193s elapsed | 78,577 tok/s
153
+ [Eval] batch 2881 | samples 23048/123656 | mean_loss 2.3059 | 1201s elapsed | 78,579 tok/s
154
+ [Eval] batch 2901 | samples 23208/123656 | mean_loss 2.3081 | 1210s elapsed | 78,577 tok/s
155
+ [Eval] batch 2921 | samples 23368/123656 | mean_loss 2.3068 | 1218s elapsed | 78,578 tok/s
156
+ [Eval] batch 2941 | samples 23528/123656 | mean_loss 2.3083 | 1226s elapsed | 78,578 tok/s
157
+ [Eval] batch 2961 | samples 23688/123656 | mean_loss 2.3084 | 1235s elapsed | 78,574 tok/s
158
+ [Eval] batch 2981 | samples 23848/123656 | mean_loss 2.3096 | 1243s elapsed | 78,571 tok/s
159
+ [Eval] batch 3001 | samples 24008/123656 | mean_loss 2.3104 | 1252s elapsed | 78,572 tok/s
160
+ [Eval] batch 3021 | samples 24168/123656 | mean_loss 2.3127 | 1260s elapsed | 78,572 tok/s
161
+ [Eval] batch 3041 | samples 24328/123656 | mean_loss 2.3135 | 1268s elapsed | 78,569 tok/s
162
+ [Eval] batch 3061 | samples 24488/123656 | mean_loss 2.3155 | 1277s elapsed | 78,569 tok/s
163
+ [Eval] batch 3081 | samples 24648/123656 | mean_loss 2.3198 | 1285s elapsed | 78,570 tok/s
164
+ [Eval] batch 3101 | samples 24808/123656 | mean_loss 2.3205 | 1293s elapsed | 78,567 tok/s
165
+ [Eval] batch 3121 | samples 24968/123656 | mean_loss 2.3220 | 1302s elapsed | 78,568 tok/s
166
+ [Eval] batch 3141 | samples 25128/123656 | mean_loss 2.3240 | 1310s elapsed | 78,569 tok/s
167
+ [Eval] batch 3161 | samples 25288/123656 | mean_loss 2.3255 | 1318s elapsed | 78,565 tok/s
168
+ [Eval] batch 3181 | samples 25448/123656 | mean_loss 2.3270 | 1327s elapsed | 78,567 tok/s
169
+ [Eval] batch 3201 | samples 25608/123656 | mean_loss 2.3288 | 1335s elapsed | 78,567 tok/s
170
+ [Eval] batch 3221 | samples 25768/123656 | mean_loss 2.3291 | 1343s elapsed | 78,564 tok/s
171
+ [Eval] batch 3241 | samples 25928/123656 | mean_loss 2.3291 | 1352s elapsed | 78,561 tok/s
172
+ [Eval] batch 3261 | samples 26088/123656 | mean_loss 2.3304 | 1360s elapsed | 78,561 tok/s
173
+ [Eval] batch 3281 | samples 26248/123656 | mean_loss 2.3331 | 1368s elapsed | 78,562 tok/s
174
+ [Eval] batch 3301 | samples 26408/123656 | mean_loss 2.3337 | 1377s elapsed | 78,562 tok/s
175
+ [Eval] batch 3321 | samples 26568/123656 | mean_loss 2.3359 | 1385s elapsed | 78,563 tok/s
176
+ [Eval] batch 3341 | samples 26728/123656 | mean_loss 2.3376 | 1394s elapsed | 78,561 tok/s
177
+ [Eval] batch 3361 | samples 26888/123656 | mean_loss 2.3394 | 1402s elapsed | 78,560 tok/s
178
+ [Eval] batch 3381 | samples 27048/123656 | mean_loss 2.3391 | 1410s elapsed | 78,562 tok/s
179
+ [Eval] batch 3401 | samples 27208/123656 | mean_loss 2.3408 | 1419s elapsed | 78,561 tok/s
180
+ [Eval] batch 3421 | samples 27368/123656 | mean_loss 2.3410 | 1427s elapsed | 78,562 tok/s
181
+ [Eval] batch 3441 | samples 27528/123656 | mean_loss 2.3415 | 1435s elapsed | 78,561 tok/s
182
+ [Eval] batch 3461 | samples 27688/123656 | mean_loss 2.3423 | 1444s elapsed | 78,560 tok/s
183
+ [Eval] batch 3481 | samples 27848/123656 | mean_loss 2.3426 | 1452s elapsed | 78,561 tok/s
184
+ [Eval] batch 3501 | samples 28008/123656 | mean_loss 2.3422 | 1460s elapsed | 78,559 tok/s
185
+ [Eval] batch 3521 | samples 28168/123656 | mean_loss 2.3433 | 1469s elapsed | 78,558 tok/s
186
+ [Eval] batch 3541 | samples 28328/123656 | mean_loss 2.3442 | 1477s elapsed | 78,559 tok/s
187
+ [Eval] batch 3561 | samples 28488/123656 | mean_loss 2.3459 | 1485s elapsed | 78,558 tok/s
188
+ [Eval] batch 3581 | samples 28648/123656 | mean_loss 2.3466 | 1494s elapsed | 78,556 tok/s
189
+ [Eval] batch 3601 | samples 28808/123656 | mean_loss 2.3481 | 1502s elapsed | 78,558 tok/s
190
+ [Eval] batch 3621 | samples 28968/123656 | mean_loss 2.3526 | 1510s elapsed | 78,557 tok/s
191
+ [Eval] batch 3641 | samples 29128/123656 | mean_loss 2.3542 | 1519s elapsed | 78,557 tok/s
192
+ [Eval] batch 3661 | samples 29288/123656 | mean_loss 2.3552 | 1527s elapsed | 78,558 tok/s
193
+ [Eval] batch 3681 | samples 29448/123656 | mean_loss 2.3555 | 1535s elapsed | 78,558 tok/s
194
+ [Eval] batch 3701 | samples 29608/123656 | mean_loss 2.3547 | 1544s elapsed | 78,559 tok/s
195
+ [Eval] batch 3721 | samples 29768/123656 | mean_loss 2.3553 | 1552s elapsed | 78,557 tok/s
196
+ [Eval] batch 3741 | samples 29928/123656 | mean_loss 2.3558 | 1560s elapsed | 78,557 tok/s
197
+ [Eval] batch 3761 | samples 30088/123656 | mean_loss 2.3569 | 1569s elapsed | 78,558 tok/s
198
+ [Eval] batch 3781 | samples 30248/123656 | mean_loss 2.3569 | 1577s elapsed | 78,556 tok/s
199
+ [Eval] batch 3801 | samples 30408/123656 | mean_loss 2.3573 | 1586s elapsed | 78,554 tok/s
200
+ [Eval] batch 3821 | samples 30568/123656 | mean_loss 2.3593 | 1594s elapsed | 78,555 tok/s
201
+ [Eval] batch 3841 | samples 30728/123656 | mean_loss 2.3595 | 1602s elapsed | 78,555 tok/s
202
+ [Eval] batch 3861 | samples 30888/123656 | mean_loss 2.3600 | 1611s elapsed | 78,555 tok/s
203
+ [Eval] batch 3881 | samples 31048/123656 | mean_loss 2.3609 | 1619s elapsed | 78,556 tok/s
204
+ [Eval] batch 3901 | samples 31208/123656 | mean_loss 2.3601 | 1627s elapsed | 78,556 tok/s
205
+ [Eval] batch 3921 | samples 31368/123656 | mean_loss 2.3601 | 1636s elapsed | 78,557 tok/s
206
+ [Eval] batch 3941 | samples 31528/123656 | mean_loss 2.3587 | 1644s elapsed | 78,557 tok/s
207
+ [Eval] batch 3961 | samples 31688/123656 | mean_loss 2.3588 | 1652s elapsed | 78,558 tok/s
208
+ [Eval] batch 3981 | samples 31848/123656 | mean_loss 2.3601 | 1661s elapsed | 78,557 tok/s
209
+ [Eval] batch 4001 | samples 32008/123656 | mean_loss 2.3606 | 1669s elapsed | 78,554 tok/s
model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:f8cc9320263bc562f9f701ca3d81b22d75f9f5a1a33acf53827c69dae9881939
3
- size 1390587040
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b8a4a820cf7c9c6c4703e6bb57d20c3f8fdca3344668a77e2f5ce173a90e9ea1
3
+ size 574642392
tokenizer.json CHANGED
@@ -47,15 +47,6 @@
47
  "rstrip": false,
48
  "normalized": false,
49
  "special": true
50
- },
51
- {
52
- "id": 65536,
53
- "content": "<|endoftext|>",
54
- "single_word": false,
55
- "lstrip": false,
56
- "rstrip": false,
57
- "normalized": false,
58
- "special": true
59
  }
60
  ],
61
  "normalizer": null,
 
47
  "rstrip": false,
48
  "normalized": false,
49
  "special": true
 
 
 
 
 
 
 
 
 
50
  }
51
  ],
52
  "normalizer": null,
tokenizer_config.json CHANGED
@@ -1,11 +1,5 @@
1
  {
2
  "backend": "tokenizers",
3
- "bos_token": "<|endoftext|>",
4
- "eos_token": "<|endoftext|>",
5
- "is_local": true,
6
- "local_files_only": false,
7
  "model_max_length": 1000000000000000019884624838656,
8
- "pad_token": "<|endoftext|>",
9
- "tokenizer_class": "TokenizersBackend",
10
- "unk_token": "<|endoftext|>"
11
  }
 
1
  {
2
  "backend": "tokenizers",
 
 
 
 
3
  "model_max_length": 1000000000000000019884624838656,
4
+ "tokenizer_class": "TokenizersBackend"
 
 
5
  }
train_log.log ADDED
The diff for this file is too large to render. See raw diff