Text Generation
English
deepseek_v4
deepseek
Mixture of Experts
sovereign
agentic
speculative-decoding
4-bit precision
gptq
Instructions to use Codexcoder/deepseek-v4-sovereign with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Local Apps Settings
- vLLM
How to use Codexcoder/deepseek-v4-sovereign with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "Codexcoder/deepseek-v4-sovereign" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Codexcoder/deepseek-v4-sovereign", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/Codexcoder/deepseek-v4-sovereign
- SGLang
How to use Codexcoder/deepseek-v4-sovereign with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "Codexcoder/deepseek-v4-sovereign" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Codexcoder/deepseek-v4-sovereign", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "Codexcoder/deepseek-v4-sovereign" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Codexcoder/deepseek-v4-sovereign", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Docker Model Runner
How to use Codexcoder/deepseek-v4-sovereign with Docker Model Runner:
docker model run hf.co/Codexcoder/deepseek-v4-sovereign
File size: 1,656 Bytes
f6fec0c | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 | {
"model_id": "sovereign/deepseek-v4-sovereign",
"display_name": "DeepSeek-V4-Sovereign",
"base_model": "deepseek-ai/DeepSeek-V4-Flash-0731",
"license": "MIT",
"model_size_params": "304B",
"architecture": "Mixture-of-Experts (MoE) with DSpark speculative decoding",
"precision_supported": ["BF16", "F16", "F32", "F8", "E4M3", "E2M1", "INT8"],
"context_window": 1048576,
"max_output_tokens": 384000,
"reasoning_effort_levels": ["low", "high", "max"],
"recommended_sampling": {
"agentic": {"temperature": 1.0, "top_p": 0.95},
"default": {"temperature": 1.0, "top_p": 1.0}
},
"speculative_decoding": {
"method": "dspark",
"num_speculative_tokens": 7,
"draft_sample_method": "greedy"
},
"serving": {
"vllm": "vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 --trust-remote-code --kv-cache-dtype fp8 --block-size 256 --data-parallel-size 4 --enable-expert-parallel --moe-backend deep_gemm_mega_moe --speculative-config '{\"method\":\"dspark\",\"num_speculative_tokens\":7,\"draft_sample_method\":\"greedy\"}'",
"sglang": "sglang serve --trust-remote-code --model-path deepseek-ai/DeepSeek-V4-Flash-0731 --tp 4 --moe-runner-backend flashinfer_mxfp4 --speculative-algorithm DSPARK --mem-fraction-static 0.90 --chunked-prefill-size 4096"
},
"features": [
"Text Generation", "Conversational", "Agentic Capabilities",
"Speculative Decoding", "1M Token Context", "Sovereign (self-hosted)",
"SafeTensors"
],
"arxiv": "arXiv:2606.19348",
"sovereign_guarantees": {
"no_mandatory_telemetry": true,
"air_gap_capable": true,
"local_weights": true,
"private_finetunes": true
}
}
|