Commit History

cpu-amx README: document the bf16 DiT tier (--dit-precision)
6736003
verified

cortexelus commited on

cpu-amx: add dit_medium_bf16_core.bin (bf16 DiT engine)
0905190
verified

cortexelus commited on

cpu-amx: add dit_medium_bf16_flash.so (bf16 DiT engine)
60952d8
verified

cortexelus commited on

cpu-amx: add dit_medium_bf16_pin_fp32.npz (bf16 DiT engine)
476830e
verified

cortexelus commited on

cpu-amx: add dit_medium_bf16_core_manifest.txt (bf16 DiT engine)
70aafed
verified

cortexelus commited on

cpu-amx: add dit_medium_bf16.so (bf16 DiT engine)
fc19859
verified

cortexelus commited on

Delete old fp16mixed names + retired medium dit_bf16.trt (fp16 rename shipped)
48e34e2
verified

cortexelus commited on

Rename fp16mixed->fp16 DiT/T5Gemma engines+onnx (copies; deletes follow after code merge)
3f29675
verified

cortexelus commited on

Remove redundant w8_bf16 engines (int8 weights fold to bf16 at build → identical size/speed to the bf16 baseline)
63cc70d
verified

cortexelus commited on

Add sm_120 TRT engines (AOT SWA, wide profile) for the quantized tiers
4e8cc21
verified

cortexelus commited on

cpu-amx: add int8 encoders (same_{s,l}_encoder_int8, SmoothQuant+GPTQ) + README row
be8ab06
verified

cortexelus commited on

cpu-amx README: consistent <model>_<precision> filenames
0d42b85
verified

cortexelus commited on

cpu-amx: consistent <model>_<precision> filenames (t5gemma_bf16, dit_medium_int8, same_*_encoder_bf16)
5d1992c
verified

cortexelus commited on

Add sm_90 TRT engines (wide profile) for the quantized tiers
d593f74
verified

cortexelus commited on

Add quantized encoder+decoder tier ONNX (fp8 / w8_bf16, padded encoders)
4168236
verified

cortexelus commited on

Add cpu-amx: torch-free C++/AMX engines (T5Gemma bf16, medium DiT int8, SAME-S/L bf16+int8 decoders, SAME-S/L encoders) + weight blobs + README
dec2054
verified

cortexelus commited on

Add fp8 tier for sm-music / sm-sfx DiTs (clean fp8-linear graft on fp16mixed)
308abaf
verified

cortexelus commited on

Add fp8 tier for sm-music / sm-sfx DiTs (clean fp8-linear graft on fp16mixed)
ac3a57e
verified

cortexelus commited on

Add fp8 tier for sm-music / sm-sfx DiTs (clean fp8-linear graft on fp16mixed)
c3aa6e0
verified

cortexelus commited on

Add fp8 tier for sm-music / sm-sfx DiTs (clean fp8-linear graft on fp16mixed)
5bcf0c7
verified

cortexelus commited on

Add fp8 tier for sm-music / sm-sfx DiTs (clean fp8-linear graft on fp16mixed)
6a96f1b
verified

cortexelus commited on

Add fp8 tier for sm-music / sm-sfx DiTs (clean fp8-linear graft on fp16mixed)
1489a17
verified

cortexelus commited on

sm_120 sa3-m: add the fp8 medium-DiT tier (176 fp8 GEMM + 96 bf16 fused MHA, 1.43-1.95x vs fp16mixed) (#7)
f8e0a0f

cortexelus commited on

sa3-m fp8: calibrated dit_fp8.onnx (real-conditioning activation + per-channel weight scales, @ryanontheinside #47; refs unchanged dit_fp8lin.onnx.data)
8383b7d
verified

cortexelus commited on

sa3-m fp8: ship calibrated-bakedmin engine (176 fp8 GEMM + 96 bf16 fused MHA + baked fp32 RoPE; calibration by @ryanontheinside #47)
4697212
verified

cortexelus commited on

sm_120 SAME-L: AOT (graph-capturable) engines + tensorRT/README.md (#6)
a05f2d4

cortexelus commited on

Upload onnx/sa3-m/dit_fp8lin.onnx.data with huggingface_hub
9efa545
verified

cortexelus commited on

Upload onnx/sa3-m/dit_fp8.onnx with huggingface_hub
21b6506
verified

cortexelus commited on

Upload tensorRT/sm_90/sa3-m/dit_fp8.trt with huggingface_hub
feddb8b
verified

cortexelus commited on

Fix the bf16 medium DiT: bake RoPE's tables into the graph (clipping 3.112% -> 0.014%) (#5)
6152b1d

cortexelus commited on

Rebuild medium DiT fp16-mixed engines (sm_90 + new sm_120): attention now fuses, 4.3x faster (#4)
06debc3

cortexelus commited on

Fix medium DiT FP16-mixed ONNX: bound the RoPE island so attention fuses (4.3x faster, cos 1.0000) (#3)
fb17708

cortexelus commited on

Add bf16 medium DiT TRT engine (sm_90) — FMHA-fused, medium default (#1)
9a38efb

mattricesound cortexelus commited on

tflite: replace naive same-l/enc_w8a8-dyn.tflite with GPTQ (torch-free, real-audio calibrated)
c2949a4
verified

cortexelus commited on

tflite: replace naive same-l/enc_w8a32.tflite with GPTQ (torch-free, real-audio calibrated)
aea1c33
verified

cortexelus commited on

tflite: replace naive same-s/enc_w8a8-dyn.tflite with GPTQ (torch-free, real-audio calibrated)
6401d6c
verified

cortexelus commited on

tflite: replace naive same-s/enc_w8a32.tflite with GPTQ (torch-free, real-audio calibrated)
07885df
verified

cortexelus commited on

tflite: add same-l/enc_w8a8-dyn.tflite (quantized encoder, varlen)
a7970b2
verified

cortexelus commited on

tflite: add same-l/enc_w8a32.tflite (quantized encoder, varlen)
7de7f11
verified

cortexelus commited on

tflite: add same-l/enc_w16a32.tflite (quantized encoder, varlen)
4adfa45
verified

cortexelus commited on

tflite: add same-s/enc_w8a8-dyn.tflite (quantized encoder, varlen)
151e748
verified

cortexelus commited on

tflite: add same-s/enc_w8a32.tflite (quantized encoder, varlen)
2682028
verified

cortexelus commited on

tflite: add same-s/enc_w16a32.tflite (quantized encoder, varlen)
d35a0c9
verified

cortexelus commited on

tflite: add sa3-m/dit_w16a32.tflite (quantized, varlen+varbatch)
4ed3663
verified

cortexelus commited on

tflite: add sa3-m/dit_w8a32.tflite (quantized, varlen+varbatch)
3e6eee6
verified

cortexelus commited on

tflite: add sa3-m/dit_w8a8-dyn.tflite (quantized, varlen+varbatch)
78049a1
verified

cortexelus commited on

tflite: add same-l/dec_w16a32.tflite (quantized, varlen+varbatch)
f4cd71b
verified

cortexelus commited on

tflite: add sa3-sm-sfx/dit_w16a32.tflite (quantized, varlen+varbatch)
860ab42
verified

cortexelus commited on

tflite: add sa3-sm-music/dit_w16a32.tflite (quantized, varlen+varbatch)
e6e2e82
verified

cortexelus commited on