arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

共收录 135
2406.08334 2026-04-21 cs.DC cs.AI cs.LG cs.PF

ProTrain: Efficient LLM Training via Memory-Aware Techniques

ProTrain: 通过内存感知技术实现高效的LLM训练

Hanmei Yang, Jin Zhou, Yao Fu, Xiaoqun Wang, Ramine Roane, Hui Guan, Tongping Liu

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Advanced Micro Devices, Inc.(先进微器件公司)

AI总结 本文提出ProTrain系统,通过自动调整内存管理策略提升LLM训练效率,无需人工干预,实验显示训练吞吐量提升1.43至2.71倍。

Comments Accepted to MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17749 2026-04-21 cs.CV

Ego-InBetween: Generating Object State Transitions in Ego-Centric Videos

Ego-InBetween: 生成以自我为中心视频中的物体状态转换

Mengmeng Ge, Takashi Isobe, Xu Jia, Yanan Sun, Zetong Yang, Weinong Wang, Dong Zhou, Dong Li, Huchuan Lu, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(先进微器件公司) Dalian University of Technology(大连理工大学) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Xi’an Jiaotong University(西安交通大学)

AI总结 本文提出EgoIn框架,通过TransitionVLM和Object-aware Auxiliary Supervision生成物体状态转换序列,实现以自我为中心视角下的视觉状态迁移。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17476 2026-04-21 cs.CR cs.AR cs.CV cs.SY eess.SY

Privatar: Scalable Privacy-preserving Multi-user VR via Secure Offloading

Privatar: 通过安全卸载实现可扩展的隐私保护多用户VR

Jianming Tong, Hanshen Xiao, Krishna Kumar Nair, Hao Kang, Ashish Sirasao, Ziqi Zhang, G. Edward Suh, Tushar Krishna

机构 * Georgia Institute of Technology(佐治亚理工学院) Massachusetts Institute of Technology(麻省理工学院) Google(谷歌) Purdue University/NVIDIA(普渡大学/NVIDIA) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) AMD

AI总结 Privatar通过安全卸载实现多用户VR的可扩展隐私保护,利用领域知识在本地设备保留高能量频率组件,减少信息泄露,同时采用分布感知最小扰动技术提升隐私保障与效用。

Comments Proceedings of the 7th Machine Learning and System Conference (MLSys)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16590 2026-04-21 cs.LG cs.AI

Global Attention with Linear Complexity for Exascale Generative Data Assimilation in Earth System Prediction

全球线性复杂度注意力用于地球系统预测的Exascale生成数据同化

Xiao Wang, Zezhong Zhang, Isaac Lyngaas, Hong-Jun Yoon, Jong-Youl Choi, Siming Liang, Janet Wang, Hristo G. Chipilski, Ashwin M. Aji, Feng Bao, Peter Jan van Leeuwen, Dan Lu, Guannan Zhang

机构 * Auburn University(阿伯杜大学) AMD Research(AMD研究) Colorado State University(科罗拉多州立大学) Oak Ridge National Laboratory(橡树岭国家实验室)

AI总结 本文提出一种统一的一阶段生成数据同化框架,通过将同化过程重新表述为贝叶斯后验采样,实现高效率的地球系统状态推断,利用STORM模型实现全球注意力线性复杂度,提升预测精度和极端事件预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16498 2026-04-21 cs.AR cs.AI cs.DC

Forge-UGC: FX optimization and register-graph engine for universal graph compiler

Forge-UGC:面向通用图编译器的FX优化与寄存器图引擎

Satyam Kumar, Saurabh Jha

机构 * Intel(英特尔) Qualcomm(高通) AMD Apple(苹果)

AI总结 Forge-UGC通过四阶段编译器提升Transformer在异构加速器上的部署效率,采用硬件无关设计,优化图捕获、优化、中间表示降低及后端调度,显著降低编译时间和推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01540 2026-04-17 cs.CV cs.AI cs.GR cs.LG

Edge-preserving noise for diffusion models

边缘保留噪声用于扩散模型

Jente Vandersanden, Sascha Holl, Xingchang Huang, Gurprit Singh

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Advanced Micro Devices(先进微器件)

AI总结 本文提出一种边缘保留的扩散过程,通过混合噪声方案在边缘感知调度器中平滑过渡,提升结构细节捕捉能力,同时保持全局性能,并在图像生成和结构引导任务中取得改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21025 2026-04-17 cs.CV

CaptionQA: Is Your Caption as Useful as the Image Itself?

CaptionQA: 你的描述是否和它所代表的图像一样有用?

Shijia Yang, Yunong Liu, Bohan Zhai, Ximeng Sun, Zicheng Liu, Emad Barsoum, Manling Li, Chenfeng Xu

机构 * Advanced Micro Devices, Inc.(先进微器件公司) Stanford University(斯坦福大学) Independent Researcher(独立研究者) Northwestern University(西北大学) UT Austin(德克萨斯大学奥斯汀分校)

AI总结 CaptionQA通过评估生成描述在下游任务中的实用性,揭示了图像与描述之间的效用差距,涵盖四个领域,包含25个顶级和69个子类别,提供33,027个密集标注的多选问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10909 2026-04-17 cs.AR cs.LG cs.NA math.NA

Bit-Accurate Modeling of GPU Matrix Multiply-Accumulate Units: Demystifying Numerical Discrepancy and Accuracy

GPU矩阵乘法-累加单元的位精确建模:解开数值差异和精度的谜团

Peichen Xie, Shuotao Xu, Yang Wang, Fan Yang, Mao Yang

机构 * NVIDIA(英伟达) AMD(超微半导体)

AI总结 本文提出CLFP框架,构建了十种GPU架构的MMA操作位精确算术模型,揭示了四个精度瓶颈和一个数值不对称设计,为未来MMA单元设计提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11659 2026-04-14 cs.CR cs.DC cs.DS cs.LG cs.PF

GPU Acceleration of Sparse Fully Homomorphic Encrypted DNNs

GPU加速稀疏全同态加密DNN

Lara D'Agata, Carlos Agulló-Domingo, Óscar Vera-López, Kaustubh Shivdikar, Ardhi W. B. Yudha, Ferhat Yaman, David Kaeli, José L. Abellán, Ian Colbert, José Cano

机构 * University of Glasgow(格拉斯哥大学) University of Murcia(穆尔西亚大学) Northeastern University(东北大学) AMD(超威半导体公司)

AI总结 本文提出在AMD GPU上加速深度神经网络中矩阵乘法的方法,利用FIDESlib库优化稀疏矩阵运算,提升运行效率并降低时间复杂度。

Comments Accepted to the 6th Workshop on Machine Learning and Systems (EuroMLSys) co-located with EuroSys '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09406 2026-04-13 cs.LG

OASIS: Online Activation Subspace Learning for Memory-Efficient Training

OASIS:面向内存高效训练的在线激活子空间学习

Sakshi Choudhary, Utkarsh Saxena, Kaushik Roy

机构 * Purdue University(普渡大学) Advanced Micro Devices, Inc. (AMD)(超威半导体公司(AMD))

AI总结 OASIS通过在线学习动态激活子空间,减少内存消耗,无需修改前向计算,实现比全微调低2倍的峰值内存使用,同时保持性能并优于现有低秩方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16821 2026-04-13 cs.LG

TopoFlow: Topography-aware Pollutant Flow Learning for High-Resolution Air Quality Prediction

TopoFlow:面向高分辨率空气质量预测的地形感知污染物流动学习

Ammar Kheder, Helmi Toropainen, Wenqing Peng, Samuel Antão, Jia Chen, Michael Boy, Zhi-Song Liu

机构 * Department of Computational Engineering, Lappeenranta–Lahti University of Technology LUT(拉彭兰塔-拉赫蒂理工大学计算工程系) Atmospheric Modelling Centre Lahti, Lahti University Campus(拉赫蒂大学园区大气模拟中心) Institute for Atmospheric and Earth System Research, University of Helsinki(赫尔辛基大学大气与地球系统研究所) Advanced Micro Devices (AMD)(超威半导体公司) Technical University of Munich(慕尼黑工业大学)

AI总结 TopoFlow通过整合地形和风向等物理因素,利用视觉Transformer架构提升空气质量预测精度,实现PM2.5 RMSE降低71-80%。

Comments Accepted in npj Climate and Atmospheric Science

Journal ref npj Climate and Atmospheric Science (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04853 2026-04-13 cs.LG cs.AI cs.IT cs.NA math.IT math.NA

Provable Post-Training Quantization: Theoretical Analysis of OPTQ and Qronos

可证明的训练后量化:OPTQ和Qronos的理论分析

Haoyu Zhang, Shihao Zhang, Ian Colbert, Rayan Saab

机构 * UC San Diego(加州大学圣地亚哥分校) AMD

AI总结 本文首次为OPTQ及Qronos提供了定量误差界,分析了训练后量化的迭代过程对量化误差的影响,并为参数选择和特征排序提供了理论依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08075 2026-04-10 cs.CL

Dual-Pool Token-Budget Routing for Cost-Efficient and Reliable LLM Serving

双池令牌预算路由:用于高效可靠LLM服务的低成本方案

Xunzhuo Liu, Bowei He, Xue Liu, Andy Luo, Haichen Zhang, Huamin Chen

机构 * vLLM Semantic Router Project(vLLM语义路由项目) MBZUAI(穆罕默德·本·扎耶德人工智能大学) McGill University(麦吉尔大学) Mila(米拉研究所) AMD(超威半导体公司)

AI总结 本文提出双池令牌预算路由机制,通过区分短上下文和长上下文请求,提高LLM服务的效率和可靠性,减少GPU小时和预emption率,提升响应速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03674 2026-04-07 cs.CV

DiffSparse: Accelerating Diffusion Transformers with Learned Token Sparsity

DiffSparse: 通过学习的令牌稀疏性加速扩散变换器

Haowei Zhu, Ji Liu, Ziqiong Liu, Dong Li, Junhai Yong, Bin Wang, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(超威半导体公司) Tsinghua University(清华大学) BNRist(北京信息科学与技术国家研究中心)

AI总结 本文提出DiffSparse框架,通过学习令牌稀疏性优化扩散变换器的推理效率,减少计算成本并提升生成质量。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03523 2026-04-07 cs.RO cs.AI cs.CV cs.LG

Optimizing Neurorobot Policy under Limited Demonstration Data through Preference Regret

通过偏好遗憾优化有限示范数据下的神经机器人策略

Viet Dung Nguyen, Yuhang Song, Anh Nguyen, Jamison Heard, Reynold Bailey, Alexander Ororbia

机构 * Rochester Institute of Technology(罗切斯特理工学院) Advanced Micro Devices, Inc.(超威半导体公司) University of Liverpool(利物浦大学)

AI总结 本文提出MYOE框架,通过可查询的偏好混合状态空间模型估计每一步的目标,利用偏好遗憾优化机器人控制策略,实验显示其鲁棒性、适应性和泛化能力优于其他RLfD方法。

Comments 10 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15148 2026-04-07 cs.CV cs.AI

XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models

XModBench:多模态能力与一致性在多语言模型中的基准测试

Xingrui Wang, Jiang Liu, Chao Huang, Xiaodong Yu, Ze Wang, Ximeng Sun, Jialian Wu, Alan Yuille, Emad Barsoum, Zicheng Liu

机构 * Advanced Micro Devices(超威半导体) Johns Hopkins University(约翰霍普金斯大学) University of Rochester(罗彻斯特大学)

AI总结 XModBench通过大规模三模态基准测试,评估多语言模型在跨模态一致性中的能力,揭示模型在不同模态下的推理偏差和不平衡问题。

Journal ref Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18846 2026-03-30 cs.CV cs.AI

DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference

DUET-VLM:双阶段统一高效令牌减少用于VLM训练和推理

Aditya Kumar Singh, Hitesh Kandala, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum

机构 * Advanced Micro Devices, Inc. (AMD)(超威半导体公司(AMD))

AI总结 DUET-VLM通过双阶段令牌压缩框架,在保持语义的同时显著减少视觉令牌数量,实现高效训练和推理。

Comments 15 Pages, 8 figures, 15 tables, CVPR 2026; Code: AGI/DUET-VLM" target="_blank" rel="noopener">https://github.com/AMD-AGI/DUET-VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08985 2026-03-27 cs.CV

Verifier Threshold: An Efficient Test-Time Scaling Approach for Image Generation

验证阈值:一种高效的测试时间扩展方法用于图像生成

Vignesh Sundaresha, Akash Haridas, Vikram Appia, Lav R. Varshney

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) AMD(超威半导体公司) Stony Brook University(石溪大学)

AI总结 本文提出Verifier-Threshold方法,通过自动重新分配测试时间计算,提升图像生成模型的效率,在GenEval基准上实现2-4倍的计算时间减少。

Comments ICLR 2026 ReALM-Gen and DeLTa

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23013 2026-03-25 cs.CL

Knowledge Access Beats Model Size: Memory Augmented Routing for Persistent AI Agents

知识访问胜过模型规模:基于对话记忆的持久AI代理路由

Xunzhuo Liu, Bowei He, Xue Liu, Andy Luo, Haichen Zhang, Huamin Chen

机构 * vLLM Semantic Router Project(vLLM语义路由器项目) MBZUAI McGill University(麦吉尔大学) Mila AMD Red Hat(红帽)

AI总结 本文提出利用对话记忆提升AI代理效率,通过轻量模型结合检索信息,使小模型在用户特定查询中表现优于大模型,证明知识访问比模型规模更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20185 2026-03-23 cs.CV cs.AI cs.CL

VideoSeek: Long-Horizon Video Agent with Tool-Guided Seeking

VideoSeek: 长时程视频代理与工具引导的搜索

Jingyang Lin, Jialian Wu, Jiang Liu, Ximeng Sun, Ze Wang, Xiaodong Yu, Jiebo Luo, Zicheng Liu, Emad Barsoum

机构 * AMD(AMD公司) University of Rochester(罗切斯特大学)

AI总结 VideoSeek通过视频逻辑流程主动寻找关键证据,减少帧数使用,提升视频理解能力,实验显示其在视频理解和推理任务中表现优异。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12823 2026-03-16 cs.CL cs.CV

Adaptive Vision-Language Model Routing for Computer Use Agents

自适应视觉-语言模型路由用于计算机使用代理

Xunzhuo Liu, Bowei He, Xue Liu, Andy Luo, Haichen Zhang, Huamin Chen

机构 * vLLM Semantic Router Project(vLLM语义路由项目) MBZUAI McGill University(麦吉尔大学) AMD Red Hat(红帽公司)

AI总结 本文提出自适应VLM路由框架,通过动态选择模型降低推理成本,同时保持可靠性。在ScreenSpot-Pro数据集和OpenClaw基准测试中,AVR实现了高达78%的推理成本降低,并结合视觉困惑代理机制提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12646 2026-03-16 cs.CL

98$\times$ Faster LLM Routing Without a Dedicated GPU: Flash Attention, Prompt Compression, and Near-Streaming for the vLLM Semantic Router

98倍更快的LLM路由无需专用GPU:Flash注意力、提示压缩与近流式处理用于vLLM语义路由

Xunzhuo Liu, Bowei He, Xue Liu, Andy Luo, Haichen Zhang, Huamin Chen

机构 * vLLM Semantic Router Project(vLLM语义路由器项目) MBZUAI McGill University(麦吉尔大学) AMD Red Hat(红帽公司)

AI总结 本文提出三种优化方法,解决LLM路由的延迟和内存问题,实现98倍速度提升,使路由在共享GPU上成为可能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11725 2026-03-13 cs.CV cs.LG

Cross-Resolution Attention Network for High-Resolution PM2.5 Prediction

跨分辨率注意力网络用于高分辨率PM2.5预测

Ammar Kheder, Helmi Toropainen, Wenqing Peng, Samuel Antão, Zhi-Song Liu, Michael Boy

机构 * Institute for Atmospheric and Earth System Research(大气与地球系统研究所) University of Helsinki(赫尔辛基大学) Department of Computational Engineering(计算工程系) LUT University(卢托纳大学) Atmospheric Modelling Centre Lahti (AMC-Lahti)(拉赫蒂大气建模中心(AMC-Lahti)) Advanced Micro Devices (AMD)(先进微器件(AMD))

AI总结 CRAN-PM通过跨分辨率注意力机制,融合全球气象数据与局部高分辨率PM2.5数据,实现高效、准确的PM2.5预测,显著降低预测误差和复杂地形中的偏倚。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11695 2026-02-18 cs.LG cs.AI math.OC

Qronos: Correcting the Past by Shaping the Future... in Post-Training Quantization

Qronos:通过塑造未来修正过去……在训练后量化中

Shihao Zhang, Haoyu Zhang, Ian Colbert, Rayan Saab

机构 * Department of Mathematics University of California, San Diego(数学系加州大学圣地亚哥分校) Software Architecture Advanced Micro Devices, Inc.(软件架构先进微器件公司) Department of Mathematics & HDSI University of California, San Diego(数学系及HDSI加州大学圣地亚哥分校)

AI总结 Qronos通过迭代优化框架在训练后量化中显式纠正误差并超越现有方法,提升模型精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11739 2026-02-12 cs.CL cs.AI

ZeroTuning: Unlocking the Initial Token's Power to Enhance Large Language Models Without Training

ZeroTuning: 解锁初始标记的潜力以无需训练的方式提升大语言模型

Feijiang Han, Xiaodong Yu, Jianheng Tang, Delip Rao, Weihua Du, Lyle Ungar

机构 * University of Pennsylvania(宾夕法尼亚大学) AMD(AMD公司) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 ZeroTuning通过仅调整初始标记的注意力实现无需训练的大语言模型性能提升,适用于多种任务和场景。

Comments ICLR 2026 Accepted Version: proofread, introduction rewritten, additional experiments and appendix material added

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05499 2026-02-06 cs.AI

SDFP: Speculative Decoding with FIT-Pruned Models for Training-Free and Plug-and-Play LLM Acceleration

SDFP:基于FIT剪枝模型的投机解码用于无训练和即插即用的大语言模型加速

Hanyu Wei, Zunhai Su, Peng Lu, Chao Li, Spandan Tiwari, Ashish Sirasao, Yuhan Dong

机构 * Tsinghua University(清华大学) Advanced Micro Devices, Inc.(先进微器件公司)

AI总结 SDFP通过FIT剪枝技术实现无训练、即插即用的大语言模型加速,提升解码速度而不影响输出分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02125 2026-02-04 cs.AI cs.CL

Do AI Models Perform Human-like Abstract Reasoning Across Modalities?

AI模型在不同模态下是否能进行类人抽象推理?

Claas Beger, Ryan Yi, Shuhao Fu, Kaleda Denton, Arseny Moskvichev, Sarah W. Tsai, Sivasankaran Rajamanickam, Melanie Mitchell

机构 * Santa Fe Institute, New Mexico, USA(圣菲研究所) Sandia National Laboratories, New Mexico, USA(桑迪亚国家实验室) Advanced Micro Devices Inc., Texas, USA(先进微器件公司)

AI总结 本文研究了AI模型在不同模态下进行抽象推理的能力,发现其在文本和视觉模态中的表现存在显著差异,表明仅依赖准确率评估抽象推理能力存在偏差。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00998 2026-02-03 cs.CL

Reliable Use of Lemmas via Eligibility Reasoning and Section$-$Aware Reinforcement Learning

通过资格推理和面向节段的强化学习可靠地使用引理

Zhikun Xu, Xiaodong Yu, Ben Zhou, Jiang Liu, Jialian Wu, Ze Wang, Ximeng Sun, Hao Chen, Zicheng Liu

机构 * Arizona State University(亚利桑那州立大学) Advanced Micro Devices, Inc.(先进微器件公司)

AI总结 通过资格推理和面向节段的强化学习提升LLM在数学引理应用的可靠性与鲁棒性

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09071 2026-02-02 cs.CV

BlindSight: Harnessing Sparsity for Efficient Vision-Language Models

BlindSight: 利用稀疏性提升视觉-语言模型的效率

Tharun Adithya Srikrishnan, Deval Shah, Timothy Hein, Ahmed Hasssan, Stephen Youn, Steven K. Reinhardt

机构 * Advanced Micro Devices, Inc. (AMD)(先进微器件公司(AMD))

AI总结 BlindSight通过引入输入模板感知的注意力稀疏性掩码,显著提升了视觉-语言模型的推理效率,同时保持较高的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19132 2026-01-28 cs.NI cs.AI cs.AR cs.PF cs.SY eess.SY

In-Network Collective Operations: Game Changer or Challenge for AI Workloads?

网络内集体操作:人工智能工作负载中的变革者还是挑战?

Torsten Hoefler, Mikhail Khalilov, Josiah Clark, Surendra Anubolu, Mohan Kalkunte, Karen Schramm, Eric Spada, Duncan Roweth, Keith Underwood, Adrian Caulfield, Abdul Kabbani, Amirreza Rastegari

机构 * ETH Zürich(苏黎世联邦理工学院) Microsoft(微软) AMD(超威半导体) Broadcom Inc.(博通公司) Hewlett Packard Enterprise(惠普企业)

AI总结 本文探讨了网络内集体操作在人工智能工作负载中的潜力与挑战,分析了边缘和核心INC的性能优势及阻碍其应用的关键障碍,并预测其未来发展方向。

Journal ref IEEE Computer Jan. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏