Codexcoder commited on
Commit
f6fec0c
·
verified ·
1 Parent(s): 6629303

SOVEREIGN — sovereign AI model card (derived from DeepSeek-V4-Flash-0731): specs, config, tokenizer, generation config

Browse files
Files changed (5) hide show
  1. README.md +56 -0
  2. config.json +38 -0
  3. generation_config.json +14 -0
  4. model_specs.json +37 -0
  5. tokenizer_config.json +11 -0
README.md ADDED
@@ -0,0 +1,56 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ # 🌌 deepseek-v4-sovereign — the new sovereign AI model
2
+
3
+ **SOVEREIGN's flagship model.** A sovereign-tuned derivative of
4
+ [`deepseek-ai/DeepSeek-V4-Flash-0731`](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731)
5
+ (304B MoE, MIT license) with an extended reasoning budget, 1M-token context,
6
+ and DSpark speculative decoding — tuned on private, user-owned corpora only.
7
+
8
+ ## Model card
9
+
10
+ | Field | Value |
11
+ |---|---|
12
+ | Base | `deepseek-ai/DeepSeek-V4-Flash-0731` |
13
+ | Architecture | Mixture-of-Experts (MoE) + speculative decoding (DSpark) |
14
+ | Parameters | 304B total, fraction activated per token |
15
+ | Context window | 1,048,576 tokens (1M) |
16
+ | Max output | 384K tokens (high/max reasoning) |
17
+ | Reasoning effort | `low` / `high` / `max` |
18
+ | Precision | BF16 / FP16 / FP32 / FP8 (E4M3, E2M1) / INT8 |
19
+ | Quantizations | 90+ model tree (GGUF/safetensors) |
20
+ | License | MIT (derived) |
21
+ | Paper | arXiv:2606.19348 |
22
+ | Sovereign property | weights + fine-tunes stored locally; zero mandatory telemetry |
23
+
24
+ ## Why "sovereign"
25
+
26
+ - Runs fully locally (vLLM / SGLang / transformers) or via your own VPC.
27
+ - No mandatory external API calls; HF router (`router.huggingface.co/v1`)
28
+ is an *option*, not a dependency.
29
+ - Fine-tuning data, adapters, and inference logs stay under your control.
30
+
31
+ ## Deployment
32
+
33
+ ```bash
34
+ # vLLM (4×GB300 node) — DSpark speculative decoding enabled with one flag
35
+ vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \
36
+ --trust-remote-code --kv-cache-dtype fp8 --block-size 256 \
37
+ --data-parallel-size 4 --enable-expert-parallel \
38
+ --moe-backend deep_gemm_mega_moe \
39
+ --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
40
+
41
+ # SGLang
42
+ sglang serve --trust-remote-code \
43
+ --model-path deepseek-ai/DeepSeek-V4-Flash-0731 \
44
+ --tp 4 --moe-runner-backend flashinfer_mxfp4 \
45
+ --speculative-algorithm DSPARK --chunked-prefill-size 4096
46
+ ```
47
+
48
+ Recommended sampling for agentic scenarios: `temperature=1.0, top_p=0.95`;
49
+ otherwise `top_p=1.0`.
50
+
51
+ ## Chat template
52
+
53
+ No Jinja template ships with this release — encode via the OpenAI-compatible
54
+ contract: `encoding_dsv4.encode_messages(messages, thinking_mode="thinking",
55
+ reasoning_effort="max")` (see `models/deepseek-v4-flash-0731/` docs and
56
+ `api_examples/`).
config.json ADDED
@@ -0,0 +1,38 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": ["DeepseekV4ForCausalLM"],
3
+ "model_type": "deepseek_v4",
4
+ "model_id": "sovereign/deepseek-v4-sovereign",
5
+ "base_model": "deepseek-ai/DeepSeek-V4-Flash-0731",
6
+ "torch_dtype": "bfloat16",
7
+ "vocab_size": 129280,
8
+ "hidden_size": 7168,
9
+ "num_hidden_layers": 61,
10
+ "num_attention_heads": 64,
11
+ "num_key_value_heads": 8,
12
+ "head_dim": 128,
13
+ "num_experts": 256,
14
+ "num_experts_per_tok": 8,
15
+ "intermediate_size": 18432,
16
+ "max_position_embeddings": 1048576,
17
+ "rope_theta": 1000000.0,
18
+ "speculative_decoding": {
19
+ "method": "dspark",
20
+ "num_speculative_tokens": 7,
21
+ "draft_sample_method": "greedy"
22
+ },
23
+ "moe": {
24
+ "backend": "deep_gemm_mega_moe",
25
+ "expert_parallel": true
26
+ },
27
+ "attention": {
28
+ "use_fp4_indexer_cache": true,
29
+ "swa_full_tokens_ratio": 0.1
30
+ },
31
+ "quantization_config": {
32
+ "quant_method": "gptq",
33
+ "bits": 4,
34
+ "group_size": 128,
35
+ "damp_percent": 0.01
36
+ },
37
+ "transformers_version": "4.46.0"
38
+ }
generation_config.json ADDED
@@ -0,0 +1,14 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "temperature": 1.0,
3
+ "top_p": 0.95,
4
+ "top_k": 40,
5
+ "max_new_tokens": 384000,
6
+ "repetition_penalty": 1.0,
7
+ "do_sample": true,
8
+ "reasoning_effort": "max",
9
+ "thinking_mode": "thinking",
10
+ "use_cache": true,
11
+ "pad_token_id": 129277,
12
+ "bos_token_id": 129278,
13
+ "eos_token_id": [129279, 129280]
14
+ }
model_specs.json ADDED
@@ -0,0 +1,37 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "model_id": "sovereign/deepseek-v4-sovereign",
3
+ "display_name": "DeepSeek-V4-Sovereign",
4
+ "base_model": "deepseek-ai/DeepSeek-V4-Flash-0731",
5
+ "license": "MIT",
6
+ "model_size_params": "304B",
7
+ "architecture": "Mixture-of-Experts (MoE) with DSpark speculative decoding",
8
+ "precision_supported": ["BF16", "F16", "F32", "F8", "E4M3", "E2M1", "INT8"],
9
+ "context_window": 1048576,
10
+ "max_output_tokens": 384000,
11
+ "reasoning_effort_levels": ["low", "high", "max"],
12
+ "recommended_sampling": {
13
+ "agentic": {"temperature": 1.0, "top_p": 0.95},
14
+ "default": {"temperature": 1.0, "top_p": 1.0}
15
+ },
16
+ "speculative_decoding": {
17
+ "method": "dspark",
18
+ "num_speculative_tokens": 7,
19
+ "draft_sample_method": "greedy"
20
+ },
21
+ "serving": {
22
+ "vllm": "vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 --trust-remote-code --kv-cache-dtype fp8 --block-size 256 --data-parallel-size 4 --enable-expert-parallel --moe-backend deep_gemm_mega_moe --speculative-config '{\"method\":\"dspark\",\"num_speculative_tokens\":7,\"draft_sample_method\":\"greedy\"}'",
23
+ "sglang": "sglang serve --trust-remote-code --model-path deepseek-ai/DeepSeek-V4-Flash-0731 --tp 4 --moe-runner-backend flashinfer_mxfp4 --speculative-algorithm DSPARK --mem-fraction-static 0.90 --chunked-prefill-size 4096"
24
+ },
25
+ "features": [
26
+ "Text Generation", "Conversational", "Agentic Capabilities",
27
+ "Speculative Decoding", "1M Token Context", "Sovereign (self-hosted)",
28
+ "SafeTensors"
29
+ ],
30
+ "arxiv": "arXiv:2606.19348",
31
+ "sovereign_guarantees": {
32
+ "no_mandatory_telemetry": true,
33
+ "air_gap_capable": true,
34
+ "local_weights": true,
35
+ "private_finetunes": true
36
+ }
37
+ }
tokenizer_config.json ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "tokenizer_class": "LlamaTokenizer",
3
+ "model_max_length": 1048576,
4
+ "padding_side": "right",
5
+ "truncation_side": "right",
6
+ "bos_token": "<|begin▁of▁sentence|>",
7
+ "eos_token": "<|end▁of▁sentence|>",
8
+ "pad_token": "<|end▁of▁sentence|>",
9
+ "unk_token": "<|unk|>",
10
+ "chat_template_note": "Use encoding_dsv4 (see models/deepseek-v4-flash-0731/docs) — no Jinja template ships with this release."
11
+ }