arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-04-28 至 2026-04-28 共收录 3
2604.24715 2026-04-28 cs.CL cs.LG

Long-Context Aware Upcycling: A New Frontier for Hybrid LLM Scaling

长上下文意识的升级:混合大语言模型扩展的新前沿

Parsa Ashrafi Fashi, Utkarsh Saxena, Mehdi Rezagholizadeh, Aref Jafari, Akash Haridas, Mingyu Yang, Vansh Bhatia, Guihong Li, Vikram Appia, Emad Barsoum

机构 * AMD

AI总结 本文提出HyLo方法,通过架构适应与高效Transformer块结合,提升长上下文能力,实现上下文长度扩展32倍,内存消耗降低90%,在混合架构中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24003 2026-04-28 cs.CL cs.LG

Stabilizing Efficient Reasoning with Step-Level Advantage Selection

通过步骤级优势选择稳定高效推理

Han Wang, Xiaodong Yu, Jialian Wu, Jiang Liu, Ximeng Sun, Mohit Bansal, Zicheng Liu

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Advanced Micro Devices, Inc.(先进微器件公司)

AI总结 本文提出SAS方法,在步骤层面选择优势,提升推理稳定性与效率,实验显示在多个基准上准确率提升0.86点,推理长度减少16.3%。

Comments Findings of ACL 2026, Code: https://github.com/HanNight/SAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15050 2026-04-28 cs.CV

DRIFT: Transferring Reasoning Priors for Efficient MLLM Fine-Tuning

DRIFT:用于高效MLLM微调的推理先验转移

Chao Huang, Zeliang Zhang, Jiang Liu, Ximeng Sun, Jialian Wu, Xiaodong Yu, Ze Wang, Chenliang Xu, Emad Barsoum, Zicheng Liu

机构 * University of Rochester(罗切斯特大学) AMD

AI总结 DRIFT通过在梯度空间中转移推理知识,实现高效稳定的多模态推理迁移,优于传统方法并在数据和计算上更高效。

Comments ACL 2026 camera-ready; Project Page: https://wikichao.github.io/DRIFT/

详情

展开后加载摘要…

URL PDF HTML 收藏