|
Download README.md from mboy2k/llama-cpp-sm75-cuda-binary: direct link, hf CLI and curl.
- Browser
- Download file 951 Bytes
-
https://huggingface.co/mboy2k/llama-cpp-sm75-cuda-binary/resolve/main/README.md
- Command line
-
hf download hf://mboy2k/llama-cpp-sm75-cuda-binary/README.md
-
curl -L -o README.md https://huggingface.co/mboy2k/llama-cpp-sm75-cuda-binary/resolve/main/README.md
951 Bytes
| license: mit | |
| tags: | |
| - llama.cpp | |
| - cuda | |
| - sm75 | |
| - turing | |
| - qwen | |
| # llama.cpp CUDA binary (sm_75 / Tesla T4) | |
| Binary `llama-server` build sẵn cho **NVIDIA Tesla T4 (sm_75, Turing)**, dùng để | |
| cache trong kernel Kaggle — tránh build lại từ source (~25 phút) mỗi lần khởi động. | |
| - Commit llama.cpp: `4e416ee` (2026-09-23) | |
| - Kiến trúc hỗ trợ: `qwen35moe` (Qwen3.8-35B-A3B MoE) | |
| - Build flags: `-DGGML_CUDA=ON -DCMAKE_CUDA_ARCHITECTURES=75` | |
| ## Cách dùng trong kernel Kaggle | |
| ```bash | |
| mkdir -p /kaggle/working/llama-bin && cd /kaggle/working/llama-bin | |
| for f in llama-server libggml-base.so libggml-cpu.so libggml-cuda.so libggml.so \ | |
| libllama-common.so libllama-server-impl.so libllama.so libmtmd.so; do | |
| curl -sL -o "$f" "https://huggingface.co/mboy2k/llama-cpp-sm75-cuda-binary/resolve/main/$f" | |
| done | |
| chmod +x llama-server | |
| ``` | |
| Sau đó chạy `llama-server` với `LD_LIBRARY_PATH` trỏ vào thư mục này. | |