Logo
Explore Help
Register Sign In
biondizzle/vllm
1
0
Fork 0
You've already forked vllm
Code Issues Pull Requests Actions 2 Packages Projects Releases Wiki Activity
Files
5cc6bddb6ef5e8e5c10de8122a43fd6e8c1e3b4b
vllm/csrc/attention
History
Matthew Bonanni 314fa8abbf [Attention] Tune CUTLASS MLA num_splits (#26846)
Signed-off-by: Matthew Bonanni <mbonanni@redhat.com>
2025-10-16 06:36:09 -07:00
..
mla
[Attention] Tune CUTLASS MLA num_splits (#26846)
2025-10-16 06:36:09 -07:00
attention_dtypes.h
…
attention_generic.cuh
…
attention_kernels.cuh
[Refactor] Refactor FP8 & INT8 Quant Folder inside w8a8 (#25293)
2025-10-08 10:20:48 -04:00
attention_utils.cuh
…
dtype_bfloat16.cuh
…
dtype_float16.cuh
…
dtype_float32.cuh
…
dtype_fp8.cuh
…
merge_attn_states.cu
[BugFix] FA2 MLA Accuracy Issue (#18807)
2025-05-28 08:59:39 +00:00
paged_attention_v1.cu
[Bugfix][ROCm] Fix for warp_size uses on host (#21205)
2025-07-24 00:37:19 -07:00
paged_attention_v2.cu
[Bugfix][ROCm] Fix for warp_size uses on host (#21205)
2025-07-24 00:37:19 -07:00
vertical_slash_index.cu
Implements dual-chunk-flash-attn backend for dual chunk attention with sparse attention support (#11844)
2025-05-12 19:52:47 -07:00
Powered by Gitea Version: 1.25.2 Page: 1998ms Template: 96ms
English
Bahasa Indonesia Deutsch English Español Français Gaeilge Italiano Latviešu Magyar nyelv Nederlands Polski Português de Portugal Português do Brasil Suomi Svenska Türkçe Čeština Ελληνικά Български Русский Українська فارسی മലയാളം 日本語 简体中文 繁體中文(台灣) 繁體中文(香港) 한국어
Licenses API