patdev commited on
Commit
5fdb82b
·
verified ·
1 Parent(s): 634fcf8

DEPLOY : patch effort natif

Browse files
Files changed (1) hide show
  1. DEPLOY.md +14 -0
DEPLOY.md CHANGED
@@ -380,3 +380,17 @@ warmup (65 s à froid) · 5 s graphes CUDA. v55 (préparée, non publiée) :
380
  `--limit-mm-per-prompt '{"video":0}'` et `HF_HUB_OFFLINE=1` quand le modèle est
381
  en cache → visé ~1 min 45. Le vrai levier reste le nombre de redémarrages : en
382
  natif tout changement de flag/alias en coûte un ; le pont rechargeait en 5 s.
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
380
  `--limit-mm-per-prompt '{"video":0}'` et `HF_HUB_OFFLINE=1` quand le modèle est
381
  en cache → visé ~1 min 45. Le vrai levier reste le nombre de redémarrages : en
382
  natif tout changement de flag/alias en coûte un ; le pont rechargeait en 5 s.
383
+
384
+ ### Niveau de raisonnement en natif : patch vLLM (v55)
385
+
386
+ Constat (sources 0.27.1) : le serveur Anthropic natif ne lit pas `thinking`
387
+ (champ absent de `AnthropicMessagesRequest`, jeté par pydantic) et ne traduit
388
+ `output_config.effort` qu'en `reasoning_effort`, que seul Harmony/GPT-OSS
389
+ honore. Sur Ornith, effort low = max, et `disabled` n'agit pas.
390
+
391
+ `vllm_anthropic_effort_patch.py` (appliqué par le bootstrap avant `vllm serve`,
392
+ idempotent, `VL_EFFORT_PATCH=off` pour le couper) ajoute le champ `thinking` et
393
+ mappe : effort low/medium/high/xhigh/max → `thinking_token_budget`
394
+ 1 024 / 4 096 / 16 384 / 32 768 / illimité ; `thinking.budget_tokens` explicite
395
+ gagne ; `thinking.type=disabled` → `enable_thinking=false`. Même mécanisme que
396
+ le pont (le bloc de raisonnement est fermé au plafond côté échantillonnage).