patdev's picture
denouement : FP8 porte TRT-LLM a 161,8 a 2 sessions
43a2ee3 verified
|
Raw History Blame Contribute Delete
3.32 kB

reports/ — recherches et synthèses (mémoire durable du projet)

Chaque fichier = une recherche sourcée (web, docs, GitHub, HF) ou une synthèse datée. Les mesures elles-mêmes vivent dans RESULTS*.md ; ici, ce qu'on a appris d'ailleurs et ce qu'on en a conclu, pour ne pas le refaire.

Date Fichier Sujet
2026-08-22 2026-08-22-leviers-vllm-long-contexte.md Tous les leviers vLLM pour le décodage concurrent à long contexte sur Ampère (fp8 KV, DCP, cache Mamba, spéculation V1/V2, noyaux MoE, ordonnanceur), avec n° d'issues/PR et « dans 0.27.1 ? »
2026-08-22 2026-08-22-materiel-prix-runpod-hf.md Tableau GPU (prix RunPod/HF, bande passante, FP8, cartes pour 1M) et j/s par $ pour notre régime ; recommandation RTX PRO 6000 Blackwell
2026-08-22 2026-08-22-quants-mtp-piles-alternatives.md La tête MTP d'Ornith n'est PAS quantifiée (config ignore) ; quants HF avec MTP ; brouillons V1/V2 ; SGLang, llama.cpp, LMDeploy, TRT-LLM
2026-08-22 2026-08-22-synthese-regime-multi-agents.md Synthèse : ce qui borne physiquement, ce qui est actionnable, classement, et ce qu'on a fait (v56 → v64)
2026-08-23 2026-08-23-pont-et-integration-claude-code.md Pont sous charge (fuite de connexions), compaction Claude Code ([1m], réponse vide), compteur de jetons en direct, débit solo ressenti
2026-08-23 2026-08-23-l4-graphes-cuda-et-multi-modeles.md L4 : 12,4 → 75,7 tok/s en activant les graphes CUDA (×6) ; rendement par Go/s vs notre TP=2 ; Kimi-K3 / Qwen3.8 déjà servis par le bootstrap ; TRT-LLM impasse confirmée
2026-08-23 2026-08-23-tensorrt-et-onnx-mesures.md TRT-LLM impasse fermée (INT4 et FP8, sur L40S et sur Ada) ; graphe ONNX réparé et fonctionnel (126,9 tok/s L40S) ; baseline L4 corrigée 13→76 ; MTP à 29 % d’acceptation même en FP8
2026-08-23 2026-08-23-mxfp4-deblocage-trtllm-et-familles-moe.md TRT-LLM : le noyau MoE 4 bits est reserve a sm90 — aucun chemin MoE quantifie sur Ada (2 correctifs Python ecrits, valables sur Hopper) ; l'EP TensorRT existe bien dans onnxruntime-gpu 1.29 ; ONNX GenAI 163,2 tok/s sur Ada, devant vLLM ; planchers reels Qwen3.8 (10,79 B) et Kimi K3 (21,29 B) : A4B et A9B impossibles

| 2026-08-23 | 2026-08-23-banc-a12b-multisession.md | Notre Qwen3.8-MoE-A12B en multi-session : x19,2 a 32 sessions ; TurboQuant x3,16 de contexte pour 4 % ; n-gram +183 % (a verifier) ; ONNX et TRT impossibles pour ce modele | | 2026-08-23 | 2026-08-23-banc-quatre-modeles-ada.md | Kimi-Linear-48B bat Ornith sur tous les axes (152 solo, 1 610 a 32) ; le debit suit l'activation ; variantes A4B/A9B/A12B par une ligne de config ; la regle « la speculation ne paie que sur les MoE » demontree FAUSSE (-77 % sur Kimi) | | 2026-08-23 | 2026-08-23-trois-moteurs-sur-ada-bilan.md | Bilan des trois moteurs sur Ada : ONNX 196,0 en solo, vLLM 412,3 a 4 sessions avec 1 M de contexte, TRT-LLM 161,8 a 2 sessions en FP8 (le format decide tout) ; graphes CUDA = +44 % ; l'export ONNX Qwen3.5 est possible, Kimi-Linear non (KDA sans operateur) |

Convention : AAAA-MM-JJ-sujet.md, français, sources en URL, « non trouvé » explicite, et une section finale « ce que nous en avons fait » quand c'est appliqué.