SixpertK1 / examples /api_server.py
SixpertAI's picture
Upload examples/api_server.py with huggingface_hub
82c25a6 verified
Raw
History Blame Contribute Delete
1.83 kB
#!/usr/bin/env python3
"""
Sixpert K1 - OpenAI-Compatible API Server
==========================================
Runs Sixpert K1 as an OpenAI-compatible API server using llama-cpp-python.
Usage:
pip install llama-cpp-python
python api_server.py
Then use with any OpenAI-compatible client:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "sixpert-k1",
"messages": [{"role": "user", "content": "Hello!"}]
}'
"""
import argparse
from llama_cpp.server.app import create_app
from llama_cpp import Llama
def main():
parser = argparse.ArgumentParser(description="Sixpert K1 API Server")
parser.add_argument(
"--model", type=str, default="SixpertK1.gguf", help="Path to GGUF model"
)
parser.add_argument("--host", type=str, default="0.0.0.0", help="Server host")
parser.add_argument("--port", type=int, default=8000, help="Server port")
parser.add_argument("--gpu-layers", type=int, default=-1, help="GPU layers (-1 = all)")
parser.add_argument("--threads", type=int, default=8, help="CPU threads")
args = parser.parse_args()
print("=" * 60)
print(" Sixpert K1 API Server")
print(" Precision Logic Engine - OpenAI Compatible")
print("=" * 60)
llm = Llama(
model_path=args.model,
n_ctx=131072,
n_gpu_layers=args.gpu_layers,
n_threads=args.threads,
verbose=False,
)
app = create_app(llm)
print(f"\n Server running at http://{args.host}:{args.port}")
print(f" Model: sixpert-k1")
print(f" Endpoint: POST /v1/chat/completions")
print(f" Endpoint: POST /v1/completions")
print("=" * 60)
import uvicorn
uvicorn.run(app, host=args.host, port=args.port)
if __name__ == "__main__":
main()