biondizzle
a9d5e09f4c
B1: mixed FP8/BF16 decode FMHA integration
- New: fmha_mixed_fp8_decode.cuh (Blackwell FP8 tensor-core FMHA kernel)
- New: fmha_mixed_fp8_capi.cu (C ABI launcher)
- New: fmha_mixed_fp8_op.py (Python ctypes/nvcc bridge)
- New: fp8_attention_io.cu (Q quantize + mixed KV gather kernels)
- New: fmha_umma_desc.cuh additions (f8f6f4 UMMA + idesc helpers)
- Modified: production.py (dsv4_attention_mixed_fp8_decode API)
- Modified: single_shot_inference.py (B1 gather + FMHA path)
- Modified: __init__.py (export mixed FP8 API)
- New: docs/B1_MIXED_FP8_FMHA.md, FINAL_STRETCH.md
noPE KV stays FP8_E4M3 + per-row scale, RoPE stays BF16.
No global FP8->BF16 KV staging before FMHA.
Decode-only (T==1), specialized HD=512/NOPE=448/ROPE=64.
CUDA compile/runtime validation pending on B200.
2026-06-02 22:53:14 +00:00
..
2026-06-02 19:27:07 +00:00
2026-05-21 21:54:05 +00:00
2026-05-21 21:54:05 +00:00
2026-06-01 20:49:55 +00:00
2026-05-22 00:08:38 +00:00
2026-06-01 05:54:44 +00:00
2026-05-21 17:30:44 +00:00
2026-06-02 09:37:53 +00:00
2026-05-22 00:25:47 +00:00
2026-06-02 22:53:14 +00:00
2026-06-01 21:26:51 +00:00
2026-06-01 21:05:03 +00:00
2026-06-02 16:39:42 +00:00
2026-06-02 16:28:44 +00:00
2026-05-30 21:14:15 +00:00
2026-05-30 21:13:24 +00:00
2026-05-21 21:54:05 +00:00
2026-06-02 18:11:56 +00:00
2026-06-02 10:02:01 +00:00
2026-06-02 21:34:58 +00:00
2026-06-02 10:44:53 +00:00
2026-05-25 16:21:44 +00:00
2026-06-02 09:05:22 +00:00
2026-06-01 22:29:56 +00:00
2026-05-21 17:30:44 +00:00
2026-05-21 21:54:05 +00:00