Instructions to use kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- llama-cpp-python
How to use kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF with llama-cpp-python:
# !pip install llama-cpp-python from llama_cpp import Llama llm = Llama.from_pretrained( repo_id="kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF", filename="Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN.gguf", )
llm.create_chat_completion( messages = "No input example has been defined for this model task." )
- Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- llama.cpp
How to use kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF with llama.cpp:
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh # Start a local OpenAI-compatible server with a web UI: llama serve -hf kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF:Q4_0_ROCMFP # Run inference directly in the terminal: llama cli -hf kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF:Q4_0_ROCMFP
Install from WinGet (Windows)
winget install llama.cpp # Start a local OpenAI-compatible server with a web UI: llama serve -hf kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF:Q4_0_ROCMFP # Run inference directly in the terminal: llama cli -hf kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF:Q4_0_ROCMFP
Use pre-built binary
# Download pre-built binary from: # https://github.com/ggerganov/llama.cpp/releases # Start a local OpenAI-compatible server with a web UI: ./llama-server -hf kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF:Q4_0_ROCMFP # Run inference directly in the terminal: ./llama-cli -hf kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF:Q4_0_ROCMFP
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake --build build -j --target llama-server llama-cli # Start a local OpenAI-compatible server with a web UI: ./build/bin/llama-server -hf kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF:Q4_0_ROCMFP # Run inference directly in the terminal: ./build/bin/llama-cli -hf kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF:Q4_0_ROCMFP
Use Docker
docker model run hf.co/kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF:Q4_0_ROCMFP
- LM Studio
- Jan
- Ollama
How to use kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF with Ollama:
ollama run hf.co/kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF:Q4_0_ROCMFP
- Unsloth Studio
How to use kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF with Unsloth Studio:
Install Unsloth Studio (macOS, Linux, WSL)
curl -fsSL https://unsloth.ai/install.sh | sh # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF to start chatting
Install Unsloth Studio (Windows)
irm https://unsloth.ai/install.ps1 | iex # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF to start chatting
Using HuggingFace Spaces for Unsloth
# No setup required # Open https://huggingface.co/spaces/unsloth/studio in your browser # Search for kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF to start chatting
- Pi
How to use kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF with Pi:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF:Q4_0_ROCMFP
Configure the model in Pi
# Install Pi: npm install -g @mariozechner/pi-coding-agent # Add to ~/.pi/agent/models.json: { "providers": { "llama-cpp": { "baseUrl": "http://localhost:8080/v1", "api": "openai-completions", "apiKey": "none", "models": [ { "id": "kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF:Q4_0_ROCMFP" } ] } } }Run Pi
# Start Pi in your project directory: pi
- Hermes Agent new
How to use kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF with Hermes Agent:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF:Q4_0_ROCMFP
Configure Hermes
# Install Hermes: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup # Point Hermes at the local server: hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF:Q4_0_ROCMFP
Run Hermes
hermes
- Atomic Chat new
- OpenClaw new
How to use kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF with OpenClaw:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF:Q4_0_ROCMFP
Configure OpenClaw
# Install OpenClaw: npm install -g openclaw@latest # Register the local server and set it as the default model: openclaw onboard --non-interactive --mode local \ --auth-choice custom-api-key \ --custom-base-url http://127.0.0.1:8080/v1 \ --custom-model-id "kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF:Q4_0_ROCMFP" \ --custom-provider-id llama-cpp \ --custom-compatibility openai \ --custom-text-input \ --accept-risk \ --skip-health
Run OpenClaw
openclaw agent --local --agent main --message "Hello from Hugging Face"
- Docker Model Runner
How to use kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF with Docker Model Runner:
docker model run hf.co/kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF:Q4_0_ROCMFP
- Lemonade
How to use kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF with Lemonade:
Pull the model
# Download Lemonade from https://lemonade-server.ai/ lemonade pull kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF:Q4_0_ROCMFP
Run and chat with the model
lemonade run user.Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF-Q4_0_ROCMFP
List all available models
lemonade list
Laguna-S-2.1 Q4_0_ROCMFP4_STRIX_LEAN (GGUF)
First public-ready Laguna-S-2.1 ROCmFP4 "Strix Lean" quant for AMD Ryzen AI Max+ 395 (gfx1151 / Radeon 8060S).
β οΈ Not compatible with upstream llama.cpp. Requires the charlie12345/ROCmFPX fork built with HIP + ROCmFP4 kernels.
Files
| File | Size | Notes |
|---|---|---|
Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN.gguf |
~58.34 GiB | 4.26 BPW (quantize report) |
SHA256SUMS |
Base model: poolside/Laguna-S-2.1
F16 source: poolside/Laguna-S-2.1-GGUF laguna-s-2.1-F16.gguf (235202258240 bytes)
Hardware / stack (validated)
- Box: amdaimax2 β Ryzen AI Max+ 395, gfx1151, 128 GB unified
- ROCm 7.2.4 (
/opt/rocm-7.2.4, clang 22) - Fork:
charlie12345/ROCmFPX@3edc3d31ee5ebcea47fd7e0f42c89767bb4245db
Build recipe (HIP-only)
export PATH=/opt/rocm-7.2.4/bin:$PATH
export HIP_PATH=$(hipconfig -R)
export HIPCXX=$(hipconfig -l)/clang
cmake -B build \
-DGGML_HIP=ON -DGPU_TARGETS=gfx1151 \
-DGGML_HIP_ROCWMMA_FATTN=ON -DGGML_HIP_NO_VMM=ON -DGGML_HIP_MMQ_MFMA=ON \
-DCMAKE_BUILD_TYPE=Release -DGGML_VULKAN=OFF -DLLAMA_BUILD_WEBUI=OFF
cmake --build build -j 4 # prefer -j 4..8 on 128GB Strix; avoid -j32
Quantize
build/bin/llama-quantize \
laguna-s-2.1-F16.gguf \
Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN.gguf \
Q4_0_ROCMFP4_STRIX_LEAN 8
# quant size = 59739.82 MiB (4.26 BPW)
Runtime (required)
export LD_LIBRARY_PATH=<build/bin>:/opt/rocm/lib
export HSA_OVERRIDE_GFX_VERSION=11.5.1
export GGML_HIP_ENABLE_UNIFIED_MEMORY=1
llama-server --host 127.0.0.1 --port 8099 \
--n-gpu-layers 999 --flash-attn on -dio --no-warmup --jinja \
--model Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN.gguf \
--ctx-size 65536 --cache-type-k q8_0 --cache-type-v q8_0 --parallel 1 \
--temp 0.2 --top-p 0.95 --top-k 20 --min-p 0.05 --repeat-penalty 1.1 --repeat-last-n 256 \
--chat-template-kwargs '{"enable_thinking":true}' --reasoning-budget 512
-dio is required for reliable cold load of large Laguna GGUFs on this stack (mmap path can hang).
A/B vs Q4_K_M (same binary, same flags, cold load)
| Quant | prompt_n | prompt tok/s | decode tok/s (256-cap gen) | GGUF size |
|---|---|---|---|---|
| Q4_K_M | 8116 (~8K) | 445.6 | 17.36 | 71 GiB |
| ROCmFP4 STRIX_LEAN | 8116 (~8K) | 381.8 | 28.23 | 58.3 GiB |
| Q4_K_M | 32223 (~32K) | 372.4 | 14.15 | 71 GiB |
| ROCmFP4 STRIX_LEAN | 32223 (~32K) | 327.3 | 20.32 | 58.3 GiB |
- Decode speedup: +62.6% @ ~8K, +43.6% @ ~32K
- Size: β18% (58.3 vs 71 GiB)
- Prompt processing slightly slower on ROCmFP4 (β14% / β12%)
Quality / tools / reasoning
Shared prompts (reasoning, code, tool-call plan, short math with thinking):
| Check | Q4_K_M | ROCmFP4 | Verdict |
|---|---|---|---|
| Bat/ball $0.05 | correct | correct | parity |
| is_palindrome plan | coherent thinking | coherent thinking | parity |
| get_weather Paris/Tokyo tool JSON | clean calls | clean calls | parity |
| enable_thinking / reasoning-budget | works | works | parity |
Did we lose anything? No quality regression observed on the four shared prompts. We gain decode speed and lose model file size; prefill is slightly slower.
License
Follow the base model (poolside/Laguna-S-2.1) license terms.
- Downloads last month
- 180
4-bit
Model tree for kingjones777/Laguna-S-2.1-Q4_0_ROCMFP4_STRIX_LEAN-GGUF
Base model
poolside/Laguna-S-2.1