biondizzle/vllm - vllm - Gitea: Git with a cup of tea

Author	SHA1	Message	Date
Nicolò Lucchesi	e77f162cf5	[Bugfix] Fix `Qwen3ASR` language asr tag in output (#33410 ) Signed-off-by: NickLucche <nlucches@redhat.com>	2026-01-31 05:24:49 +00:00
Patrick von Platen	15e0bb9c42	[Streaming -> Realtime] Rename all voxtral related classes, fn, files (#33415 ) Signed-off-by: Patrick von Platen <patrick.v.platen@gmail.com>	2026-01-31 04:49:00 +00:00
Wentao Ye	010ec0c30e	[Deprecation] Deprecate `seed_everything` and `scatter_mm_placeholders` in v0.15 (#33362 ) Signed-off-by: yewentao256 <zhyanwentao@126.com>	2026-01-31 02:54:16 +00:00
Kyle Sayers	f857a03f6b	[QeRL] Layerwise Reloading (#32133 ) Signed-off-by: Kyle Sayers <kylesayrs@gmail.com>	2026-01-30 08:50:05 -07:00
Julien Denize	8e2ad97ad0	[BUGFIX] Pixtral cannot be loaded with --limit-mm-per-prompt 0 (#33406 ) Signed-off-by: juliendenize <julien.denize@mistral.ai>	2026-01-30 02:52:02 -08:00
Patrick von Platen	10152d2194	[Realtime API] Adds minimal realtime API based on websockets (#33187 ) Signed-off-by: Patrick von Platen <patrick.v.platen@gmail.com> Co-authored-by: Nick Hill <nickhill123@gmail.com>	2026-01-30 18:41:29 +08:00
tianshu-Michael-yu	f45870b53f	fix: allow LFM2 MoE prefix caching (align) (#33376 ) Signed-off-by: Tianshu Yu <tianshuyu.formal@gmail.com>	2026-01-30 08:23:14 +00:00
hujiaxin0	ba45bedfd1	[model] Add support for openPangu7B-VL (#32449 ) Signed-off-by: hujiaxin <524446785@qq.com> Signed-off-by: Emilie1001 <79921183+Emilie1001@users.noreply.github.com> Co-authored-by: Emilie1001 <79921183+Emilie1001@users.noreply.github.com>	2026-01-30 15:54:27 +08:00
Harry Mellor	9432ed8c7e	Explicitly set `return_dict` for `apply_chat_template` (#33372 ) Signed-off-by: Harry Mellor <19981378+hmellor@users.noreply.github.com>	2026-01-30 07:27:04 +00:00
Isotr0py	8bfc8d5600	[Models] Refactor Kimi-K2.5 weight loading (#33346 ) Signed-off-by: Isotr0py <mozf@mail2.sysu.edu.cn>	2026-01-30 05:31:20 +00:00
Wang Haoyu	c46b0cd0af	[Model][Multimodal] Add explicit MusicFlamingo adapter (#32696 ) Signed-off-by: WangHaoyuuu <mailwhaoyu@gmail.com>	2026-01-30 11:01:29 +08:00
Cyrus Leung	831453fcef	[Chore] Move `MediaConnector` to `vllm.multimodal.media` (#33324 ) Signed-off-by: DarkLight1337 <tlleungac@connect.ust.hk>	2026-01-29 16:54:31 +00:00
Isotr0py	5e73e4900c	[Bugfix] Fix broken GLM-OCR initialization (#33350 ) Signed-off-by: Isotr0py <mozf@mail2.sysu.edu.cn>	2026-01-29 07:56:05 -08:00
sthWrong	17b17c0684	[Backport] [Kimi-K2.5] Replace torch.cuda with current_platform for d… (#33320 )	2026-01-29 12:29:17 +00:00
Roger Wang	8b3f0a99dd	[Models] Qwen3-ASR (#33312 ) Signed-off-by: Roger Wang <hey@rogerw.io>	2026-01-29 19:27:15 +08:00
Isotr0py	5400014d55	[Chore] Remove `use_data_parallel` kwargs from ViT implementation (#33310 ) Signed-off-by: Isotr0py <mozf@mail2.sysu.edu.cn>	2026-01-29 10:20:52 +00:00
amirkl94	e01ff5c070	Bugfix: Pass router logits dtype in nemotron shared experts (#32669 ) Signed-off-by: Amir Klein <203507526+amirkl94@users.noreply.github.com>	2026-01-29 09:36:34 +00:00
wang.yuqi	abb34ac43a	[Bugfix] Fix Qwen3-VL-Reranker load. (#33298 ) Signed-off-by: wang.yuqi <yuqi.wang@daocloud.io> Signed-off-by: wang.yuqi <noooop@126.com> Co-authored-by: gemini-code-assist[bot] <176961590+gemini-code-assist[bot]@users.noreply.github.com>	2026-01-29 08:42:53 +00:00
Kiersten Stokes	9e138cb01d	[Misc][Build] Lazy load cv2 in nemotron_parse.py (#33189 ) Signed-off-by: kiersten-stokes <kierstenstokes@gmail.com>	2026-01-29 06:55:50 +00:00
Cyrus Leung	51550179fc	[Refactor] Define MM data parser in processing info instead of processor itself (#33260 ) Signed-off-by: DarkLight1337 <tlleungac@connect.ust.hk>	2026-01-29 13:55:17 +08:00
Rohan Potdar	59bcc5b6f2	Use aiter triton fused_add_rmsnorm_pad for gpt-oss (#30976 ) Signed-off-by: Rohan138 <rohanpotdar138@gmail.com>	2026-01-28 20:47:47 +00:00
ramos	36d450e3b8	Adds FunAudioChat multimodal audio model support (#2 ) (#33058 ) Signed-off-by: ramos <49182011+nemoramo@users.noreply.github.com> Signed-off-by: mayufeng <mayufeng@example.com> Co-authored-by: mayufeng <mayufeng@example.com>	2026-01-28 05:18:09 +00:00
Harry Mellor	35fb0b8613	Don't use `min_pixels`/`max_pixels` from Qwen2VL's processor (#33208 ) Signed-off-by: Harry Mellor <19981378+hmellor@users.noreply.github.com>	2026-01-28 05:02:08 +00:00
Iris	bd92089d33	feature: support eagle3 for HunyuanVL & Hunyuan (#33035 ) Signed-off-by: irisliu10 <601012173@qq.com> Signed-off-by: Iris <38269816+irisliu10@users.noreply.github.com>	2026-01-27 17:55:48 +00:00
danielafrimi	83fb2d09e8	Support heterogeneous NemotronHPuzzle model (#32549 ) Signed-off-by: <dafrimi@nvidia.com> Signed-off-by: Daniel Afrimi <dafrimi@nvidia.com> Signed-off-by: root <dafrimi@nvidia.com>	2026-01-27 10:55:54 -05:00
danisereb	f3a5ee705f	[LoRA][Spec Decode] Support LoRA for Nemotron-H MTP models (#32265 ) Signed-off-by: Daniel Serebrenik <daserebrenik@nvidia.com> Co-authored-by: Jee Jee Li <pandaleefree@gmail.com>	2026-01-27 07:53:26 -08:00
Matthew Bonanni	a608b4c6c2	[5/N][Attention] Finish eliminating `vllm/attention` folder (#32064 ) Signed-off-by: Matthew Bonanni <mbonanni@redhat.com>	2026-01-27 10:02:51 -05:00
Harry Mellor	14385c80fc	Fix weight mapping test for Transfomers v5 (#33162 ) Signed-off-by: Harry Mellor <19981378+hmellor@users.noreply.github.com>	2026-01-27 12:30:14 +00:00
Roger Wang	b539f988e1	[Models] Kimi-K2.5 (#33131 ) Signed-off-by: wanglinian <wanglinian@stu.pku.edu.cn> Signed-off-by: wangln19 <96399074+wangln19@users.noreply.github.com> Signed-off-by: Isotr0py <mozf@mail2.sysu.edu.cn> Signed-off-by: youkaichao <youkaichao@gmail.com> Signed-off-by: Roger Wang <hey@rogerw.io> Co-authored-by: wanglinian <wanglinian@stu.pku.edu.cn> Co-authored-by: wangln19 <96399074+wangln19@users.noreply.github.com> Co-authored-by: Zaida Zhou <58739961+zhouzaida@users.noreply.github.com> Co-authored-by: Isotr0py <mozf@mail2.sysu.edu.cn> Co-authored-by: Nick Hill <nickhill123@gmail.com> Co-authored-by: youkaichao <youkaichao@gmail.com> Co-authored-by: gemini-code-assist[bot] <176961590+gemini-code-assist[bot]@users.noreply.github.com>	2026-01-27 14:50:31 +08:00
Cyrus Leung	c25dbee40d	[Model] Bump transformers version for test registry (#33100 ) Signed-off-by: DarkLight1337 <tlleungac@connect.ust.hk>	2026-01-26 18:53:22 +00:00
Nicolò Lucchesi	19ab0f7ce5	[Bugfix] Fix Voxtral streaming slot_mapping (#33073 ) Signed-off-by: NickLucche <nlucches@redhat.com>	2026-01-26 10:40:40 -08:00
Andy Lo	d56afd45fd	Remove unused logic in `models/mistral.py` (#33095 ) Signed-off-by: Andy Lo <andy@mistral.ai>	2026-01-26 09:01:52 -08:00
Pleaplusone	be6931ee27	[ROCm][Bugfix] Fix ptpc scale load issue for fused shared expert path in deepseek mtp (#33018 ) Signed-off-by: ganyi <ygan@amd.com>	2026-01-26 23:19:04 +08:00
Yuxuan Zhang	bb17e8f11c	[GLM-OCR] GLM-OCR with MTP Support (#33005 ) Signed-off-by: zRzRzRzRzRzRzR <2448370773@qq.com> Signed-off-by: Isotr0py <mozf@mail2.sysu.edu.cn> Co-authored-by: Isotr0py <mozf@mail2.sysu.edu.cn>	2026-01-26 06:24:43 -08:00
Cyrus Leung	dcd80206b7	[Chore] Update type annotation of `input_ids` in model forward (#33063 ) Signed-off-by: DarkLight1337 <tlleungac@connect.ust.hk>	2026-01-26 06:02:10 -08:00
VihaanThat	208c56256f	[Feature] Add LoRA support for Gemma3 vision components (#32764 )	2026-01-26 13:56:40 +00:00
Itay Etelis	6ca2c91b96	[Model] Use mm_position to compute mrope positions for Qwen3-Omni (#33010 ) Signed-off-by: Itay Etelis <itay.etelis@ibm.com> Co-authored-by: Itay Etelis <itay.etelis@ibm.com>	2026-01-26 13:48:07 +00:00
Cyrus Leung	11b556878b	[Refactor] Use data parser for matching data items to multi-modal UUIDs (#32955 ) Signed-off-by: DarkLight1337 <tlleungac@connect.ust.hk>	2026-01-26 15:00:28 +08:00
ltd0924	105d104576	[StepVL] support close img patch (#32923 ) Signed-off-by: luotingdan <luotingdan@stepfun.com> Signed-off-by: ltd0924 <32387785+ltd0924@users.noreply.github.com> Co-authored-by: luotingdan <luotingdan@stepfun.com>	2026-01-25 20:56:39 -08:00
Lucas Wilkinson	566cdb6cfb	[CI] Fix MHA attention test failure (AttributeError when model_config is None in ViT attention backend) (#33033 ) Signed-off-by: Lucas Wilkinson <lwilkins@redhat.com>	2026-01-25 19:49:53 -08:00
Andreas Karatzas	22aeb43007	[Bugfix][VLM] Fix transformers backend embed_multimodal for Qwen2.5-VL profiling (#32969 ) Signed-off-by: Andreas Karatzas <akaratza@amd.com>	2026-01-26 08:34:05 +08:00
Itay Etelis	a698e8e7ad	[Model] Use mm_position to compute mrope positions for Qwen2.5-Omni (#32772 ) Signed-off-by: Itay Etelis <itay.etelis@ibm.com> Co-authored-by: Itay Etelis <itay.etelis@ibm.com>	2026-01-25 20:15:53 +08:00
JJJYmmm	7e67df5570	[Bugfix] fix encoder cache hang in Qwen3VL (#32684 ) Signed-off-by: JJJYmmm <92386084+JJJYmmm@users.noreply.github.com> Signed-off-by: Roger Wang <hey@rogerw.io> Signed-off-by: Isotr0py <mozf@mail2.sysu.edu.cn> Co-authored-by: Roger Wang <hey@rogerw.io> Co-authored-by: Isotr0py <mozf@mail2.sysu.edu.cn>	2026-01-25 05:17:31 +00:00
david guan	bc0d291bfe	feat: Complete LoRA support for MiniMaxM2 Fixes #32736 (#32763 ) Co-authored-by: Claude Sonnet 4.5 <noreply@anthropic.com>	2026-01-24 20:48:46 +08:00
Isotr0py	9ad7f89f55	[Models]: Make Multimodal config implicit in ViT implementation (#31972 ) Signed-off-by: Isotr0py <mozf@mail2.sysu.edu.cn>	2026-01-24 20:34:26 +08:00
Isotr0py	8edaf38570	[Models] Add `SharedFusedMoE` support to Qwen3MoE (#32082 ) Signed-off-by: Isotr0py <mozf@mail2.sysu.edu.cn>	2026-01-23 23:36:31 -08:00
Wentao Ye	37c9859fab	[Refactor] Clean up unused variables & func (#32692 ) Signed-off-by: yewentao256 <zhyanwentao@126.com>	2026-01-23 17:04:25 -05:00
Harry Huang	5206e5e28c	[V1][Hybrid] Mamba Prefix Caching with align mode (#30877 ) Signed-off-by: huanghaoyan.hhy <huanghaoyan.hhy@alibaba-inc.com> Signed-off-by: Chen Zhang <zhangch99@outlook.com> Co-authored-by: Chen Zhang <zhangch99@outlook.com>	2026-01-23 09:56:48 -08:00
Matteo Fari	fec9da0af4	[Model] Enable LoRA support for internvl2 (#32397 ) Signed-off-by: Matteo Fari <matteofari06@gmail.com>	2026-01-24 01:39:01 +08:00
baonudesifeizhai	1fb648bf10	[Bugfix] Fix FP8 MoE EP Weight Loading for ModelOpt Llama4 (#32886 ) Signed-off-by: baonudesifeizhai <baonudesifeizhai@gmail.com>	2026-01-23 10:31:48 -05:00

1 2 3 4 5 ...

2182 Commits