Skip to content
Open
Show file tree
Hide file tree
Changes from 62 commits
Commits
Show all changes
64 commits
Select commit Hold shift + click to select a range
73a2b96
new Sage-like QKi8-Vf8 fMHA asm
jcaraban May 14, 2026
73bb91f
extend bench_sage.py with aiter_i8fp8
jcaraban May 14, 2026
3233e18
bench_sage.py format
jcaraban May 18, 2026
3cd60c9
bench_sage: support transformer-like input distribution
jcaraban May 18, 2026
329b9ad
bench_sage: rotate qk and clip qk for better i8fp8 quality
jcaraban May 18, 2026
85c835d
bench_sage: relax thresholds for quantized kernels
jcaraban May 18, 2026
95387d2
bench_sage: refactor accuracy metrics report
jcaraban May 18, 2026
25d4f33
bench_sage: prune non-working logic and default to transformer-like i…
jcaraban May 19, 2026
854d2cc
enable fmha i8fp8 for gfx942
jcaraban May 20, 2026
25e68ae
fmha_post_process() bug on mi300 i8fp8 ASM made padded K rows inflate…
jcaraban May 25, 2026
fa82a64
optimize i8fp8.co waves balance for +60T
jcaraban May 31, 2026
8fddda7
bench_sage.py excludes fav3_fp8 from --kernel all
jcaraban May 31, 2026
562581a
Revert accidental gfx942 MI300 fp8.co overwrite
jcaraban Jun 2, 2026
f8b1677
mxfp4 ASM fmha and needed API and bench changes
jcaraban Jun 2, 2026
342400a
mxfp4 ASM 2400T: hoist schrau constants, schrau fission, K-scale read…
jcaraban Jun 10, 2026
ea8757d
bench_sage: add extra distributions and --seed
jcaraban Jun 20, 2026
d3c7d8e
mxfp6 ASM fmha and needed API and bench changes
jcaraban Jun 8, 2026
ef5aa5f
bench_sage: drop duplicated --seed
jcaraban Jun 21, 2026
96b5176
extend mxfp6 packer with coalesced K arrangement
jcaraban Jun 22, 2026
3d73a74
refactor mxfp6 packing & add mxfp4 coalesced load
jcaraban Jun 22, 2026
de8caa5
refresh bf16 / fp8 / i8fp8 / mxfp4 binaries
jcaraban Jun 23, 2026
973e99d
split mxfp6 into f6f8 and f6f6 variants
jcaraban Jun 23, 2026
c5fca8c
mxfp6 K-scale packer: trailing pad byte for op_sel-shift-free kernel
jcaraban Jun 23, 2026
fd4df16
drop f6f6 mha variant, which didn't work out (slower than f6f8)
jcaraban Jun 24, 2026
a21d8ad
optimize fp6 quant/pack to be more inductor friendly
jcaraban Jun 26, 2026
d2ca346
fmha bf16 hd128: deploy woven fold + front-load build (md5 2fb06ab7)
jcaraban Jul 2, 2026
88400df
mxfp6 fmha pack: always pack the E8M0 K-scale in the K-buffer tail
jcaraban Jul 4, 2026
3cc64ac
mxfp6 pack: branchless arithmetic E2M3 encode (2.9x faster fp6 pack)
jcaraban Jul 4, 2026
804be37
mxfp6 pack: tune fp6 pack launch to BLOCK_N=32/num_warps=1 (~17% faster)
jcaraban Jul 4, 2026
98d962a
fmha mxfp6: split f6f4 (fp6-QK / per-channel fp4-V) into its own .co …
Chi-Chu319 Jul 6, 2026
f75c384
Updated packer resolve path for f6f4
Chi-Chu319 Jul 7, 2026
d7d7d68
Keep sparse attention LUT metadata int32
jcaraban Jul 19, 2026
39efdc6
aiter fmha: add aiter_f6f4_pv (MXFP4-PV / fp4-P) kernel + dedicated .…
Chi-Chu319 Jul 21, 2026
a9de39a
aiter fmha aiter_f6f4_pv: deploy kv-aligned fp4-P kernel + per-row co…
Chi-Chu319 Jul 21, 2026
5aeb8fe
Update gfx950 FMHA production binaries
jcaraban Jul 22, 2026
d947efd
aiter: add aiter_f4f4 kernel wiring (WIP fp4-V) + per-row cosine gate
Chi-Chu319 Jul 22, 2026
a0972df
mxfp6 fmha: drop WIP aiter_f8f4 path; add graph-friendly torch fp6 QK…
Chi-Chu319 Jul 23, 2026
4fbf2eb
Merge branch 'mxfp6_fmha_gfx950' of https://github.com/ROCm/aiter int…
Chi-Chu319 Jul 23, 2026
d204714
f4f4 kernel
Chi-Chu319 Jul 23, 2026
040df76
refined f4f4 v packer
Chi-Chu319 Jul 24, 2026
da2f8c3
Refresh gfx950 FMHA production binaries
jcaraban Jul 26, 2026
982d412
mxfp6 fmha: make compact C1 packing the default
jcaraban Aug 1, 2026
cba008a
Regenerate gfx950 Sage FMHA binaries
jcaraban Aug 3, 2026
c9cc1ed
mxfp6 fmha: accelerate QKV preprocessing on gfx950
jcaraban Aug 4, 2026
09eea7f
mxfp4 fmha: add native gfx950 QK quantization
jcaraban Aug 4, 2026
c9d22b6
mxfp6 fmha: pin Triton packer configs
jcaraban Aug 4, 2026
7742a25
bench_sage: use production MXFP preprocessing
jcaraban Aug 4, 2026
bcb733d
bench_sage: add rollback stress distribution
jcaraban Aug 4, 2026
c885826
Merge origin/main into mxfp6_fmha_gfx950
jcaraban Aug 6, 2026
e84f7f0
feat(fmha): add gfx950 f4f4 and f6f4 kernels
jcaraban Aug 6, 2026
8ccca03
fix(fmha): use unique mixed kernel symbols
jcaraban Aug 6, 2026
a601775
feat(mha): add explicit MHA v4 kernel entrypoint
jcaraban Aug 7, 2026
a693d37
[ruff] violations reported by bot
jcaraban Aug 7, 2026
7519a7c
moar [ruff] violations
jcaraban Aug 7, 2026
2f39b8b
refactor(mha): isolate v4 quant preprocessing
jcaraban Aug 7, 2026
195dcff
drop unrelated changes to .gitignore and codegen.py
jcaraban Aug 7, 2026
644da6f
fix(mha): declare v4 output mutation precisely
jcaraban Aug 7, 2026
287e291
perf(mha): fuse MXFP6 key quantization
jcaraban Aug 7, 2026
c69b493
fix(mha): pad unaligned FP4 value inputs
jcaraban Aug 8, 2026
239c439
perf(mha): own coalesced MXFP4 K packing
jcaraban Aug 8, 2026
24a9af0
perf(mha): share coalesced K with F4F4
jcaraban Aug 8, 2026
41c4093
perf(mha): eliminate FP4 V packing copies
jcaraban Aug 8, 2026
b0203c6
docs(mha): record MXFP6 K fusion constraints
jcaraban Aug 9, 2026
50c3dfc
perf(mha): add true MXFP4 value path
jcaraban Aug 9, 2026
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
15 changes: 15 additions & 0 deletions aiter/jit/optCompilerConfig.json
Original file line number Diff line number Diff line change
Expand Up @@ -1306,6 +1306,21 @@
"f'{AITER_META_DIR}/hsa/codegen.py -m fmha_v3_fwd --output_dir {{}}'"
]
},
"module_fmha_v4_fwd": {
"srcs": [
"f'{AITER_CSRC_DIR}/py_itfs_cu/asm_mha_v4_fwd.cu'",
"f'{AITER_CSRC_DIR}/kernels/mha_v4_quant.cu'",
"f'{AITER_CSRC_DIR}/pybind/mha_v4_fwd_pybind.cu'"
],
"flags_extra_cc": [],
"flags_extra_hip": [],
"extra_ldflags": "None",
"extra_include": [],
"verbose": "False",
"blob_gen_cmd": [
"f'{AITER_META_DIR}/hsa/codegen.py -m fmha_v4_fwd --output_dir {{}}'"
]
},
"module_vsa_sparse_attention": {
"srcs": [
"f'{AITER_CSRC_DIR}/py_itfs_ck/vsa_sparse_attention_kernels.cu'",
Expand Down
558 changes: 558 additions & 0 deletions aiter/ops/mha_v4.md

Large diffs are not rendered by default.

Loading
Loading