File size: 1,830 Bytes
82c25a6
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
#!/usr/bin/env python3
"""
Sixpert K1 - OpenAI-Compatible API Server
==========================================
Runs Sixpert K1 as an OpenAI-compatible API server using llama-cpp-python.

Usage:
    pip install llama-cpp-python
    python api_server.py

Then use with any OpenAI-compatible client:
    curl http://localhost:8000/v1/chat/completions \
      -H "Content-Type: application/json" \
      -d '{
        "model": "sixpert-k1",
        "messages": [{"role": "user", "content": "Hello!"}]
      }'
"""

import argparse
from llama_cpp.server.app import create_app
from llama_cpp import Llama


def main():
    parser = argparse.ArgumentParser(description="Sixpert K1 API Server")
    parser.add_argument(
        "--model", type=str, default="SixpertK1.gguf", help="Path to GGUF model"
    )
    parser.add_argument("--host", type=str, default="0.0.0.0", help="Server host")
    parser.add_argument("--port", type=int, default=8000, help="Server port")
    parser.add_argument("--gpu-layers", type=int, default=-1, help="GPU layers (-1 = all)")
    parser.add_argument("--threads", type=int, default=8, help="CPU threads")

    args = parser.parse_args()

    print("=" * 60)
    print("  Sixpert K1 API Server")
    print("  Precision Logic Engine - OpenAI Compatible")
    print("=" * 60)

    llm = Llama(
        model_path=args.model,
        n_ctx=131072,
        n_gpu_layers=args.gpu_layers,
        n_threads=args.threads,
        verbose=False,
    )

    app = create_app(llm)

    print(f"\n  Server running at http://{args.host}:{args.port}")
    print(f"  Model: sixpert-k1")
    print(f"  Endpoint: POST /v1/chat/completions")
    print(f"  Endpoint: POST /v1/completions")
    print("=" * 60)

    import uvicorn
    uvicorn.run(app, host=args.host, port=args.port)


if __name__ == "__main__":
    main()