Instructions to use VcherifFIT/stark-mcp-scratch with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use VcherifFIT/stark-mcp-scratch with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="VcherifFIT/stark-mcp-scratch") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# pip install -U transformers accelerate # Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("VcherifFIT/stark-mcp-scratch") model = AutoModelForCausalLM.from_pretrained("VcherifFIT/stark-mcp-scratch", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] inputs = tokenizer.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=256) print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use VcherifFIT/stark-mcp-scratch with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "VcherifFIT/stark-mcp-scratch" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "VcherifFIT/stark-mcp-scratch", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/VcherifFIT/stark-mcp-scratch
- SGLang
How to use VcherifFIT/stark-mcp-scratch with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "VcherifFIT/stark-mcp-scratch" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "VcherifFIT/stark-mcp-scratch", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "VcherifFIT/stark-mcp-scratch" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "VcherifFIT/stark-mcp-scratch", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use VcherifFIT/stark-mcp-scratch with Docker Model Runner:
docker model run hf.co/VcherifFIT/stark-mcp-scratch
Stark v0.2-beta
AVISO: Version BETA. Respecto a v0.1: el tool-calling se reentreno con ejecucion REAL contra servidores MCP reales (filesystem, git, fetch, memory, time, postgres, sqlite) en vez de ejemplos guionados, el dataset es 100% espanol (se elimino contenido en ingles), y el razonamiento (
<think>) pasa por un filtro de fidelidad que descarta cadenas que no conectan con la respuesta final. Sigue en desarrollo activo, no usar en produccion.
Modelo de lenguaje entrenado desde cero (pesos aleatorios) por Victor Cherif. Arquitectura tipo Llama de ~110M de parametros, pensado como asistente en espanol orientado a ciencia, programacion, robotica y fisica, con soporte de tool-calling / MCP entrenado contra servidores MCP reales.
Detalles del modelo
- Parametros: ~110M (embeddings atados)
- Arquitectura: decoder-only tipo Llama, GQA (12 query / 4 KV heads), RoPE (theta=100000), RMSNorm + SwiGLU
- Contexto: 16384 tokens
- Vocabulario: 16000 (tokenizer BPE a nivel de bytes propio)
- Entrenamiento: pre-entrenamiento (~552M tokens, espanol + codigo) + SFT de instrucciones
- Precision: fp16
Uso
from transformers import AutoModelForCausalLM, AutoTokenizer
tok = AutoTokenizer.from_pretrained("VcherifFIT/stark-mcp-scratch")
model = AutoModelForCausalLM.from_pretrained("VcherifFIT/stark-mcp-scratch")
msgs = [{"role": "system", "content": "Eres Stark, un asistente en espanol."},
{"role": "user", "content": "Explica brevemente que es la fotosintesis."}]
inp = tok.apply_chat_template(msgs, add_generation_prompt=True, return_tensors="pt")
out = model.generate(inp, max_new_tokens=200)
print(tok.decode(out[0][inp.shape[1]:], skip_special_tokens=True))
Fallas conocidas (version BETA)
- Al ser un modelo pequeno (~110M), el lenguaje puede ser incoherente en respuestas largas, sobre todo pasados los primeros parrafos (tiende a repetir bloques o rellenar con generalidades).
- La aritmetica mental sigue sin ser confiable: depende de que el modelo dispare la tool
calculateen vez de calcular "de memoria" -- verificado que esto mejoro pero no es perfecto. - El razonamiento (
<think>) mejoro con un filtro de fidelidad en el dataset, pero sigue siendo experimental: no asumas que el<think>siempre refleja como se llego a la respuesta. - Tool-calling entrenado contra 7 servidores MCP reales (filesystem, git, fetch, memory, time, postgres, sqlite) con ejecucion real, pero la cobertura por herramienta es desigual (algunas tienen mas ejemplos que otras) -- puede fallar en herramientas poco representadas.
- No apto para produccion: es una version de pruebas.
Que cambio respecto a v0.1-beta
- Dataset 100% espanol: se eliminaron ~20.000 filas con contenido en ingles y se corrigieron los generadores para que no vuelva a aparecer.
- Tool-calling real: reemplazado el dataset guionado (pocas frases fijas, resultados inventados) por generacion con ejecucion real contra servidores MCP reales via qwen2.5-coder como decisor, mucha mas diversidad de frases por herramienta.
- Reasoning con filtro de fidelidad: se descartan cadenas
<think>que no conectan con la respuesta final (verificadas por un segundo paso con el modelo generador). - Chat template con system prompt por defecto: si no se manda un mensaje de sistema, el template ahora antepone el PERSONA automaticamente (antes, sin system prompt, el modelo colapsaba por completo -- confirmado en pruebas).
- Fix de checkpoint: el mejor checkpoint (menor eval_loss) ahora se respalda en una ruta
estable del Hub que nunca se poda, y se carga explicitamente al publicar (antes, el podado de
checkpoints viejos podia borrar el mejor antes de que
load_best_model_at_endlo necesitara).
- Downloads last month
- 159