File size: 1,656 Bytes
f6fec0c
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
{
  "model_id": "sovereign/deepseek-v4-sovereign",
  "display_name": "DeepSeek-V4-Sovereign",
  "base_model": "deepseek-ai/DeepSeek-V4-Flash-0731",
  "license": "MIT",
  "model_size_params": "304B",
  "architecture": "Mixture-of-Experts (MoE) with DSpark speculative decoding",
  "precision_supported": ["BF16", "F16", "F32", "F8", "E4M3", "E2M1", "INT8"],
  "context_window": 1048576,
  "max_output_tokens": 384000,
  "reasoning_effort_levels": ["low", "high", "max"],
  "recommended_sampling": {
    "agentic": {"temperature": 1.0, "top_p": 0.95},
    "default": {"temperature": 1.0, "top_p": 1.0}
  },
  "speculative_decoding": {
    "method": "dspark",
    "num_speculative_tokens": 7,
    "draft_sample_method": "greedy"
  },
  "serving": {
    "vllm": "vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 --trust-remote-code --kv-cache-dtype fp8 --block-size 256 --data-parallel-size 4 --enable-expert-parallel --moe-backend deep_gemm_mega_moe --speculative-config '{\"method\":\"dspark\",\"num_speculative_tokens\":7,\"draft_sample_method\":\"greedy\"}'",
    "sglang": "sglang serve --trust-remote-code --model-path deepseek-ai/DeepSeek-V4-Flash-0731 --tp 4 --moe-runner-backend flashinfer_mxfp4 --speculative-algorithm DSPARK --mem-fraction-static 0.90 --chunked-prefill-size 4096"
  },
  "features": [
    "Text Generation", "Conversational", "Agentic Capabilities",
    "Speculative Decoding", "1M Token Context", "Sovereign (self-hosted)",
    "SafeTensors"
  ],
  "arxiv": "arXiv:2606.19348",
  "sovereign_guarantees": {
    "no_mandatory_telemetry": true,
    "air_gap_capable": true,
    "local_weights": true,
    "private_finetunes": true
  }
}