Text Generation
English
deepseek_v4
deepseek
Mixture of Experts
sovereign
agentic
speculative-decoding
4-bit precision
gptq
Instructions to use Codexcoder/deepseek-v4-sovereign with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Local Apps Settings
- vLLM
How to use Codexcoder/deepseek-v4-sovereign with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "Codexcoder/deepseek-v4-sovereign" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Codexcoder/deepseek-v4-sovereign", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/Codexcoder/deepseek-v4-sovereign
- SGLang
How to use Codexcoder/deepseek-v4-sovereign with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "Codexcoder/deepseek-v4-sovereign" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Codexcoder/deepseek-v4-sovereign", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "Codexcoder/deepseek-v4-sovereign" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Codexcoder/deepseek-v4-sovereign", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Docker Model Runner
How to use Codexcoder/deepseek-v4-sovereign with Docker Model Runner:
docker model run hf.co/Codexcoder/deepseek-v4-sovereign
SOVEREIGN — sovereign AI model card (derived from DeepSeek-V4-Flash-0731): specs, config, tokenizer, generation config
Browse files- README.md +56 -0
- config.json +38 -0
- generation_config.json +14 -0
- model_specs.json +37 -0
- tokenizer_config.json +11 -0
README.md
ADDED
|
@@ -0,0 +1,56 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
# 🌌 deepseek-v4-sovereign — the new sovereign AI model
|
| 2 |
+
|
| 3 |
+
**SOVEREIGN's flagship model.** A sovereign-tuned derivative of
|
| 4 |
+
[`deepseek-ai/DeepSeek-V4-Flash-0731`](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731)
|
| 5 |
+
(304B MoE, MIT license) with an extended reasoning budget, 1M-token context,
|
| 6 |
+
and DSpark speculative decoding — tuned on private, user-owned corpora only.
|
| 7 |
+
|
| 8 |
+
## Model card
|
| 9 |
+
|
| 10 |
+
| Field | Value |
|
| 11 |
+
|---|---|
|
| 12 |
+
| Base | `deepseek-ai/DeepSeek-V4-Flash-0731` |
|
| 13 |
+
| Architecture | Mixture-of-Experts (MoE) + speculative decoding (DSpark) |
|
| 14 |
+
| Parameters | 304B total, fraction activated per token |
|
| 15 |
+
| Context window | 1,048,576 tokens (1M) |
|
| 16 |
+
| Max output | 384K tokens (high/max reasoning) |
|
| 17 |
+
| Reasoning effort | `low` / `high` / `max` |
|
| 18 |
+
| Precision | BF16 / FP16 / FP32 / FP8 (E4M3, E2M1) / INT8 |
|
| 19 |
+
| Quantizations | 90+ model tree (GGUF/safetensors) |
|
| 20 |
+
| License | MIT (derived) |
|
| 21 |
+
| Paper | arXiv:2606.19348 |
|
| 22 |
+
| Sovereign property | weights + fine-tunes stored locally; zero mandatory telemetry |
|
| 23 |
+
|
| 24 |
+
## Why "sovereign"
|
| 25 |
+
|
| 26 |
+
- Runs fully locally (vLLM / SGLang / transformers) or via your own VPC.
|
| 27 |
+
- No mandatory external API calls; HF router (`router.huggingface.co/v1`)
|
| 28 |
+
is an *option*, not a dependency.
|
| 29 |
+
- Fine-tuning data, adapters, and inference logs stay under your control.
|
| 30 |
+
|
| 31 |
+
## Deployment
|
| 32 |
+
|
| 33 |
+
```bash
|
| 34 |
+
# vLLM (4×GB300 node) — DSpark speculative decoding enabled with one flag
|
| 35 |
+
vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \
|
| 36 |
+
--trust-remote-code --kv-cache-dtype fp8 --block-size 256 \
|
| 37 |
+
--data-parallel-size 4 --enable-expert-parallel \
|
| 38 |
+
--moe-backend deep_gemm_mega_moe \
|
| 39 |
+
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
|
| 40 |
+
|
| 41 |
+
# SGLang
|
| 42 |
+
sglang serve --trust-remote-code \
|
| 43 |
+
--model-path deepseek-ai/DeepSeek-V4-Flash-0731 \
|
| 44 |
+
--tp 4 --moe-runner-backend flashinfer_mxfp4 \
|
| 45 |
+
--speculative-algorithm DSPARK --chunked-prefill-size 4096
|
| 46 |
+
```
|
| 47 |
+
|
| 48 |
+
Recommended sampling for agentic scenarios: `temperature=1.0, top_p=0.95`;
|
| 49 |
+
otherwise `top_p=1.0`.
|
| 50 |
+
|
| 51 |
+
## Chat template
|
| 52 |
+
|
| 53 |
+
No Jinja template ships with this release — encode via the OpenAI-compatible
|
| 54 |
+
contract: `encoding_dsv4.encode_messages(messages, thinking_mode="thinking",
|
| 55 |
+
reasoning_effort="max")` (see `models/deepseek-v4-flash-0731/` docs and
|
| 56 |
+
`api_examples/`).
|
config.json
ADDED
|
@@ -0,0 +1,38 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"architectures": ["DeepseekV4ForCausalLM"],
|
| 3 |
+
"model_type": "deepseek_v4",
|
| 4 |
+
"model_id": "sovereign/deepseek-v4-sovereign",
|
| 5 |
+
"base_model": "deepseek-ai/DeepSeek-V4-Flash-0731",
|
| 6 |
+
"torch_dtype": "bfloat16",
|
| 7 |
+
"vocab_size": 129280,
|
| 8 |
+
"hidden_size": 7168,
|
| 9 |
+
"num_hidden_layers": 61,
|
| 10 |
+
"num_attention_heads": 64,
|
| 11 |
+
"num_key_value_heads": 8,
|
| 12 |
+
"head_dim": 128,
|
| 13 |
+
"num_experts": 256,
|
| 14 |
+
"num_experts_per_tok": 8,
|
| 15 |
+
"intermediate_size": 18432,
|
| 16 |
+
"max_position_embeddings": 1048576,
|
| 17 |
+
"rope_theta": 1000000.0,
|
| 18 |
+
"speculative_decoding": {
|
| 19 |
+
"method": "dspark",
|
| 20 |
+
"num_speculative_tokens": 7,
|
| 21 |
+
"draft_sample_method": "greedy"
|
| 22 |
+
},
|
| 23 |
+
"moe": {
|
| 24 |
+
"backend": "deep_gemm_mega_moe",
|
| 25 |
+
"expert_parallel": true
|
| 26 |
+
},
|
| 27 |
+
"attention": {
|
| 28 |
+
"use_fp4_indexer_cache": true,
|
| 29 |
+
"swa_full_tokens_ratio": 0.1
|
| 30 |
+
},
|
| 31 |
+
"quantization_config": {
|
| 32 |
+
"quant_method": "gptq",
|
| 33 |
+
"bits": 4,
|
| 34 |
+
"group_size": 128,
|
| 35 |
+
"damp_percent": 0.01
|
| 36 |
+
},
|
| 37 |
+
"transformers_version": "4.46.0"
|
| 38 |
+
}
|
generation_config.json
ADDED
|
@@ -0,0 +1,14 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"temperature": 1.0,
|
| 3 |
+
"top_p": 0.95,
|
| 4 |
+
"top_k": 40,
|
| 5 |
+
"max_new_tokens": 384000,
|
| 6 |
+
"repetition_penalty": 1.0,
|
| 7 |
+
"do_sample": true,
|
| 8 |
+
"reasoning_effort": "max",
|
| 9 |
+
"thinking_mode": "thinking",
|
| 10 |
+
"use_cache": true,
|
| 11 |
+
"pad_token_id": 129277,
|
| 12 |
+
"bos_token_id": 129278,
|
| 13 |
+
"eos_token_id": [129279, 129280]
|
| 14 |
+
}
|
model_specs.json
ADDED
|
@@ -0,0 +1,37 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"model_id": "sovereign/deepseek-v4-sovereign",
|
| 3 |
+
"display_name": "DeepSeek-V4-Sovereign",
|
| 4 |
+
"base_model": "deepseek-ai/DeepSeek-V4-Flash-0731",
|
| 5 |
+
"license": "MIT",
|
| 6 |
+
"model_size_params": "304B",
|
| 7 |
+
"architecture": "Mixture-of-Experts (MoE) with DSpark speculative decoding",
|
| 8 |
+
"precision_supported": ["BF16", "F16", "F32", "F8", "E4M3", "E2M1", "INT8"],
|
| 9 |
+
"context_window": 1048576,
|
| 10 |
+
"max_output_tokens": 384000,
|
| 11 |
+
"reasoning_effort_levels": ["low", "high", "max"],
|
| 12 |
+
"recommended_sampling": {
|
| 13 |
+
"agentic": {"temperature": 1.0, "top_p": 0.95},
|
| 14 |
+
"default": {"temperature": 1.0, "top_p": 1.0}
|
| 15 |
+
},
|
| 16 |
+
"speculative_decoding": {
|
| 17 |
+
"method": "dspark",
|
| 18 |
+
"num_speculative_tokens": 7,
|
| 19 |
+
"draft_sample_method": "greedy"
|
| 20 |
+
},
|
| 21 |
+
"serving": {
|
| 22 |
+
"vllm": "vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 --trust-remote-code --kv-cache-dtype fp8 --block-size 256 --data-parallel-size 4 --enable-expert-parallel --moe-backend deep_gemm_mega_moe --speculative-config '{\"method\":\"dspark\",\"num_speculative_tokens\":7,\"draft_sample_method\":\"greedy\"}'",
|
| 23 |
+
"sglang": "sglang serve --trust-remote-code --model-path deepseek-ai/DeepSeek-V4-Flash-0731 --tp 4 --moe-runner-backend flashinfer_mxfp4 --speculative-algorithm DSPARK --mem-fraction-static 0.90 --chunked-prefill-size 4096"
|
| 24 |
+
},
|
| 25 |
+
"features": [
|
| 26 |
+
"Text Generation", "Conversational", "Agentic Capabilities",
|
| 27 |
+
"Speculative Decoding", "1M Token Context", "Sovereign (self-hosted)",
|
| 28 |
+
"SafeTensors"
|
| 29 |
+
],
|
| 30 |
+
"arxiv": "arXiv:2606.19348",
|
| 31 |
+
"sovereign_guarantees": {
|
| 32 |
+
"no_mandatory_telemetry": true,
|
| 33 |
+
"air_gap_capable": true,
|
| 34 |
+
"local_weights": true,
|
| 35 |
+
"private_finetunes": true
|
| 36 |
+
}
|
| 37 |
+
}
|
tokenizer_config.json
ADDED
|
@@ -0,0 +1,11 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"tokenizer_class": "LlamaTokenizer",
|
| 3 |
+
"model_max_length": 1048576,
|
| 4 |
+
"padding_side": "right",
|
| 5 |
+
"truncation_side": "right",
|
| 6 |
+
"bos_token": "<|begin▁of▁sentence|>",
|
| 7 |
+
"eos_token": "<|end▁of▁sentence|>",
|
| 8 |
+
"pad_token": "<|end▁of▁sentence|>",
|
| 9 |
+
"unk_token": "<|unk|>",
|
| 10 |
+
"chat_template_note": "Use encoding_dsv4 (see models/deepseek-v4-flash-0731/docs) — no Jinja template ships with this release."
|
| 11 |
+
}
|