arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

共收录 11791
2605.25172 2026-05-26 stat.AP cs.DL cs.LG

Rejoinder: The ICML 2023 Ranking Experiment: Examining Author Self-Assessment in ML/AI Peer Review

回复:ICML 2023 排名实验:审视机器学习/人工智能同行评审中的作者自我评估

Buxin Su, Jiayao Zhang, Natalie Collina, Yuling Yan, Didong Li, Kyunghyun Cho, Jianqing Fan, Aaron Roth, Weijie Su

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) New York University(纽约大学) Princeton University(普林斯顿大学) Associate Chair of ICML 2023(ICML 2023 associate chair) Program Chair of ICML 2023(ICML 2023 program chair)

AI总结 本文回应了关于ICML 2023排名实验的讨论,将同行评审视为统计估计问题,探讨了等渗机制的公平性与策略问题,并提出了结合审稿人排名和生成式AI时代以人为中心的评审框架。

Comments Rejoinder to the JASA Discussion of "The ICML 2023 Ranking Experiment: Examining Author Self-Assessment in ML/AI Peer Review" (arXiv:2408.13430)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25036 2026-05-26 cs.CL cs.AI

Language Bias in LVLMs: From In-Depth Analysis to Simple and Effective Mitigation

LVLMs中的语言偏差:从深入分析到简单有效的缓解方法

Yangneng Chen, Jing Li

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳))

AI总结 本文系统研究了大视觉语言模型中的语言偏差问题,发现其根源在于训练中的模态未对齐,并提出了两种简单有效的缓解方法:语言偏差正则化(LBR)和语言偏差惩罚(LBP)。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24993 2026-05-26 cs.AI cs.CV

NeurIPS: Neuro-anatomical Inductive Priors for Sphere-based Brain Decoding

NeurIPS: 基于球面的脑解码的神经解剖学归纳先验

Sijin Yu, Zijiao Chen, Zhenyu Yang, Zihao Tan, Jiakun Xu, Zhongliang Liu, Shengxian Chen, Wenxuan Wu, Xiangmin Xu, Xin Zhang

机构 * South China University of Technology(南方科技大学) Stanford University(斯坦福大学) King's College London(伦敦国王学院) Foshan University(佛山大学) Pazhou Lab(琶洲实验室)

AI总结 提出NeurIPS框架,通过选择性ROI球形分词器和结构引导专家混合模型,将解剖变异转化为归纳先验,在自然场景数据集上实现表面解码器最先进性能,并显著提升训练效率。

Comments International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24961 2026-05-26 cs.LG

MedMamba: Multi-View State Space Models with Adaptive Graph Learning for Medical Time Series Classification

MedMamba: 基于自适应图学习的多视图状态空间模型用于医疗时间序列分类

Da Zhang, Bingyu Li, Zhiyuan Zhao, Hongyuan Zhang, Junyu Gao, Xuelong Li

机构 * Northwest Polytechnical University(西北工业大学) University of Hong Kong(香港大学)

AI总结 提出MedMamba,一种集成状态空间模型与领域特定归纳偏置的端到端架构,通过多尺度卷积嵌入、三支差分状态空间编码器和空间图Mamba模块,分别处理局部-全局动态、非平稳性和潜在通道交互,在五个真实数据集上实现最先进性能。

Comments Accepted to 2026 ICML

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24946 2026-05-26 cs.CV

Interpretability Transfer from Language to Vision via Sparse Autoencoders

通过稀疏自编码器实现从语言到视觉的可解释性迁移

Alexey Kravets, Da Li, Chuan Li, Da Chen, Vinay P. Namboodiri

机构 * University of Bath, UK(巴斯大学) Lambda, Inc.(Lambda公司) Samsung AI Centre Cambridge(三星AI研究中心)

AI总结 提出VISTA框架,通过约束视觉投影器将视觉token映射到LLM的文本SAE空间,实现无需专用视觉SAE的视觉可解释性,并在对象移除和替换任务上分别提升35%和47%。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24914 2026-05-26 cs.IR cs.DB cs.LG

MVR-cache: Optimizing Semantic Caching via Multi-Vector Retrieval and Learned Prompt Segmentation

MVR-cache:通过多向量检索和学习型提示分割优化语义缓存

Ali Noshad, Zishan Zheng, Yinjun Wu

机构 * School of Computer Science, Peking University, Beijing, China(北京大学计算机科学学院,北京,中国) School of Information, Renmin University of China, Beijing, China(中国人民大学信息学院,北京,中国)

AI总结 提出MVR-cache方法,利用多向量检索和学习型提示分割模型,通过强化学习优化缓存命中率,在保证正确性的前提下将缓存命中率提升高达37%。

Comments Published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24879 2026-05-26 cs.LG math.OC

Efficient DP-SGD for LLMs with Randomized Clipping

基于随机裁剪的高效DP-SGD用于大语言模型

Enayat Ullah, Sai Aparna Aketi, Devansh Gupta, Huanyu Zhang, Meisam Razaviyayn

机构 * Meta Platforms Inc(Meta平台公司) University of Southern California(南加州大学)

AI总结 提出DP-SGD-RC算法,利用随机迹估计(Hutchinson和Hutch++)降低每样本梯度范数估计的内存开销,在保持隐私保证的同时减少内存和计算复杂度。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24867 2026-05-26 cs.AI cs.CL cs.NI

Clustering as Reasoning: A $k$-Means Interpretation of Chain-of-Thought Graph Learning

聚类即推理:思维链图学习的 $k$-均值解释

Xuanting Xie, Zhaochen Guo, Bingheng Li, Xingtong Yu, Zhifei Liao, Zhao Kang, Yuan Fang

机构 * University of Electronic Science and Technology of China(电子科技大学) Singapore Management University(新加坡国立大学) Michigan State University(密歇根州立大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出KCoT框架,通过将Transformer块与$k$-均值算法建立数学对应,将思维链推理与图表示学习统一,实现迭代语义-拓扑交互,在标准基准上超越现有方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24862 2026-05-26 cs.LG

Unifying Value Alignment and Assignment in Cross-Domain Offline Reinforcement Learning with Heterogeneous Datasets

统一跨域离线强化学习中异构数据集的价值对齐与价值分配

Zhongjian Qiao, Jiafei Lyu, Chenjia Bai, Peisong Wang, Siyang Gao, Shuang Qiu

机构 * City University of Hong Kong Tencent Institute of Artificial Intelligence (TeleAI), China Telecom Institute of Automation, Chinese Academy of Sciences. Corresponding Author

AI总结 针对异构跨域离线强化学习中价值误分配问题,提出V2A方法,通过时间一致模态表示学习和模态感知优势学习统一动力学对齐、价值对齐与价值分配,显著提升策略性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24816 2026-05-26 cs.CV

AOEPT: Breaking the Implicit Modality-Reduction Bottleneck in Modality-Missing Prompt Tuning

AOEPT:打破模态缺失提示调优中的隐式模态缩减瓶颈

Jian Lang, Rongpei Hong, Ting Zhong, Fan Zhou

机构 * University of Electronic Science and Technology of China(电子科技大学) Intelligent Digital Media Technology Key Laboratory of Sichuan Province(四川省智能数字媒体技术重点实验室)

AI总结 提出AOEPT方法,通过模态上下文提示(MCPs)蒸馏全局模态先验,为缺失模态提供潜在信息源,恢复多模态Transformer的推理范围,解决模态缺失场景下隐式模态缩减瓶颈问题。

Comments 20 pages, Accepted by ICML 2026, Code is available from https://github.com/Jian-Lang/AOEPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24774 2026-05-26 cs.LG physics.comp-ph

Hermite-NGP: Gradient-Augmented Hash Encoding for Learning PDEs

Hermite-NGP:用于学习PDE的梯度增强哈希编码

Jinjin He, Zhiqi Li, Sinan Wang, Bo Zhu

机构 * Georgia Institute of Technology, Atlanta, GA, USA(佐治亚理工学院,亚特兰大,GA,美国)

AI总结 提出Hermite-NGP,一种梯度增强的多分辨率哈希编码,通过显式存储哈希网格顶点处的函数值和混合偏导数并利用Hermite插值实现解析梯度计算,从而快速准确地计算神经PDE求解器的空间导数,并引入多分辨率课程训练策略,在2D和3D PDE基准上实现高达约20倍误差降低和2-10倍收敛时间减少。

Comments Accepted by ICML 2026.Project page: https://jinjinhe2001.github.io/hermite-ngp/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24740 2026-05-26 cs.LG cs.GT

Reinforcement Learning for Reachability: Guaranteeing Asymptotic Optimality

可达性的强化学习:保证渐近最优性

Amogh Palasamudram, Jakub Svoboda, Suguman Bansal, Krishnendu Chatterjee

机构 * Institute of Science and Technology, Austria(奥地利科学与技术研究所) Georgia Institute of Technology, USA(美国佐治亚理工学院) Dartmouth College, USA(美国达特茅斯学院)

AI总结 针对可达性规格的强化学习,提出一种基于PAC学习的迭代方法,在无需已知MDP内部参数的情况下实现渐近最优策略,并通过实验验证收敛动态。

Comments Main text and appendix of work accepted in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24688 2026-05-26 cs.CY

Position: Adopting AI in Practice Does Not Guarantee the Productivity Boost

立场:在实践中采用AI并不能保证生产力提升

Won Ik Cho, Seong-hun Kim, Geunhye Kim

AI总结 本文指出,组织实践中采用AI并不能保证生产力提升,因为人力和环境因素显著调节了AI部署与实际生产力改善之间的关系。

Comments Accepted at ICML 2026 as a position paper; Official link: https://icml.cc/virtual/2026/poster/67097

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24687 2026-05-26 cs.CV cs.AI

HoloFair: Unified T2I Fairness Evaluation and Fair-GRPO Debiasing

HoloFair: 统一的T2I公平性评估与Fair-GRPO去偏

Ruyi Chen, Lu Zhou, Xiaogang Xu, Chiyu Zhang, Jiafei Wu, Liming Fang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) School of Software Technology, Zhejiang University, Ningbo, China(浙江大学宁波校区软件学院) Ningbo Global Innovation Center, Zhejiang University, Ningbo, China(浙江大学宁波全球创新中心) Collaborative Innovation Center of Novel Software Technology and Industrialization(新型软件技术与产业化协同创新中心)

AI总结 提出HoloFair基准框架,通过多属性组间偏差指数(MGBI)评估文本到图像模型的公平性,并引入基于强化学习的Fair-GRPO方法进行去偏,在SD3.5-Medium模型上显著提升多维公平性且保持图像质量。

Comments Accepted to ICML 2026. Code and dataset are available at https://github.com/1059684669/HoloFair

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24631 2026-05-26 cs.LG cs.AI cs.CV

Beyond Generative Priors: Minority Sampling with JEPA-Guided Diffusion

超越生成先验:JEPA引导扩散的少数采样

Sol Park, Soobin Um

机构 * Department of Artificial Intelligence, Kookmin University, Seoul, South Korea(人工智能系,韩国全州大学,首尔)

AI总结 提出一种基于世界模型JEPA引导的扩散采样框架,通过近似策略实现高效计算,在无条件、类别条件和文本到图像生成中提升少数样本的保真度和语义有效性。

Comments ICML 2026, 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24558 2026-05-26 cs.LG

Position: AI for Science Should Treat Measurement-to-Dataset Pipelines as Inference Components

立场:科学人工智能应将测量到数据集的处理流程视为推理组件

Ling Zhan, Xiaoyao Yu, Tao Jia

机构 * College of Computer and Information Science(计算机与信息科学学院) Chongqing Key Laboratory of Brain-Inspired Cognitive Computing and Educational Rehabilitation for Children with Special Needs(重庆脑启发认知计算及特殊需要儿童教育康复重点实验室) Chongqing Normal University(重庆师范大学)

AI总结 本文主张科学人工智能中的测量到数据集流程应被视为推理组件,并揭示了将其输出视为固定数据导致的三个失败模式,通过大规模神经科学实证验证了问题的严重性,呼吁建立可计算的观测框架。

Comments 23 pages, 5 figures, Proceedings of the 43 rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24553 2026-05-26 cs.CV

IQA-Spider: Unifying Multi-Granularity Image Quality Assessment with Reasoning, Grounding and Referring

IQA-Spider:统一多粒度图像质量评估与推理、定位和指代

Xinge Peng, Yiting Lu, Xin Li, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出IQA-Spider框架,通过统一推理、定位和指代任务,实现多粒度图像质量评估,并采用两阶段设计解决现有方法仅支持部分感知维度的问题。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24550 2026-05-26 cs.AI cs.CL cs.LG

Jailbreak to Protect: Buffering and Reinforcing via Temporary Jailbreaking for Safe Fine-Tuning in Large Language Models

越狱以保护:通过临时越狱进行缓冲和强化以实现大型语言模型的安全微调

Seokil Ham, Jaehyuk Jang, Wonjun Lee, Changick Kim

机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院电子工程学院)

AI总结 针对微调即服务中安全对齐被有害微调攻击削弱的问题,提出一种基于梯度分析的缓冲与强化框架,通过临时越狱适配器减少有害更新并利用QR分解合并强化安全,实现无需额外安全数据的高效防御。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21190 2026-05-26 cs.CV

Semantic Granularity Navigation in Image Editing

图像编辑中的语义粒度导航

Liangsi Lu, Minzhe Guo, Xuhang Chen, Yang Shi

机构 * Guangdong University of Technology, Guangzhou, China(广东工业大学,广州,中国) Huizhou University, Huizhou, China(惠州市大学,惠州,中国)

AI总结 提出NaviEdit,一种无需训练、推理时控制的解耦方法,通过自一致性约束将编辑进度与模型尺度解耦,在保持结构保真度的同时提升语义可编辑性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16591 2026-05-26 cs.LG cs.AI

How Few-Shot Examples Add Up: A Causal Decomposition of Function Vectors in In-Context Learning

少样本示例如何累加:上下文学习中函数向量的因果分解

Entang Wang, Yiwei Wang, Aleksandra Bakalova, Michael Hahn

AI总结 本文通过因果分解揭示少样本提示中函数向量由示例级子向量线性组合而成,并发现模型通过注意力重加权机制根据上下文调整示例贡献。

Comments Accepted at ICML 2026. 70 pages, 65 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10989 2026-05-26 cs.LG cs.AI

SURGE: Surrogate Gradient Adaptation in Binary Neural Networks

SURGE: 二值神经网络中的替代梯度自适应

Haoyu Huang, Boyu Liu, Linlin Yang, Yanjing Li, Yuguang Yang, Xuhui Liu, Canyu Chen, Zhongqian Fu, Baochang Zhang

机构 * National College for Excellent Engineers, Beihang University, Beijing, China(北京航空航天大学优秀工程师学院) School of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能学院) School of Electronic and Information Engineering, Beihang University, Beijing, China(北京航空航天大学电子与信息工程学院) King Abdullah University of Science and Technology, Saudi Arabia(沙特国王 Abdullah 科学技术大学) Huawei Noah’s Ark Lab, China(华为诺亚实验室)

AI总结 针对二值神经网络中梯度失配和固定范围梯度裁剪导致的信息损失问题,提出一种基于理论的可学习梯度补偿框架SURGE,通过双路径梯度补偿器和自适应梯度缩放器实现偏差减少的梯度估计与动态平衡,在图像分类、目标检测和语言理解任务上达到最优性能。

Comments Accepted as a poster at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05759 2026-05-26 cs.LG

Full-Spectrum Graph Neural Networks: Expressive and Scalable

全谱图神经网络:表达力与可扩展性

Xiaohan Wang, Deyu Bo, Longlong Li, Kelin Xia

机构 * Division of Mathematical Sciences, School of Physical and Mathematical Sciences, Nanyang Technological University, Singapore 637371, Singapore(数学科学学院,物理与数学科学学院,南洋理工大学,新加坡637371,新加坡)

AI总结 提出全谱图神经网络(FSpecGNN),通过将信号从节点域提升到节点对域并将单变量谱滤波器扩展为双变量滤波器,实现了对节点对信号的通用逼近,同时保持可扩展性。

Comments 41 pages, 4 figures. Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04363 2026-05-26 cs.LG cs.AI

Mitigating Label Shift in Tabular In-Context Learning via Test-Time Posterior Adjustment

通过测试时后验调整缓解表格上下文学习中的标签偏移

Seunghan Lee

机构 * LG AI Research(LG人工智能研究)

AI总结 针对TabPFN在表格数据上下文学习中对标签偏移敏感的问题,提出DistPFN方法,通过测试时后验调整重新缩放类别概率,无需修改架构或额外训练,在250多个OpenML数据集上显著提升分类性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02010 2026-05-26 cs.AI

Reliable AI Needs to Externalize Implicit Knowledge: A Human-AI Collaboration Perspective

可靠AI需要外化隐性知识:人机协作视角

Hengyu Liu, Tianyi Li, Zhihong Cui, Yushuai Li, Zhangkai Wu, Torben Bach Pedersen, Kristian Torp, Christian S. Jensen

机构 * Department of Computer Science, Aalborg University, Aalborg, Denmark(奥胡斯大学计算机科学系) Department of Informatics, University of Oslo, Oslo, Norway(奥斯陆大学信息系) School of Computing, Macquarie University, Sydney, Australia(麦考瑞大学计算科学学院)

AI总结 本文从人机协作视角提出,可靠AI需要基础设施将隐性知识外化为可验证的形式,通过知识对象(KOs)实现人类验证,从而提升可靠性。

Comments Accepted at ICML 2026 (Position Paper Track). 14 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00191 2026-05-26 cs.LG cs.CV

Task-Driven Subspace Decomposition for Knowledge Sharing and Isolation in LoRA-based Continual Learning

基于LoRA的持续学习中任务驱动的子空间分解用于知识共享与隔离

Lingfeng He, De Cheng, Huaijie Wang, Xi Yang, Nannan Wang, Xinbo Gao

机构 * Department of XXX, University of YYY, Location, Country(XXX部门,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) State Key Laboratory of Integrated Services Networks, School of Telecommunications Engineering, Xidian University, Xi'an, China(信息服务网络国家重点实验室,电信工程学院,西安电子科技大学,西安,中国) School of Electronic Engineering, Xidian University, Xi'an, China(电子工程学院,西安电子科技大学,西安,中国)

AI总结 提出LoDA方法,通过任务驱动分解构建通用和任务特定LoRA子空间,结合梯度对齐优化和闭式重校准,实现知识共享与隔离,提升持续学习性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16340 2026-05-26 cs.LG stat.ML

The Implicit Bias of Adam and Muon on Smooth Homogeneous Neural Networks

Adam和Muon在光滑齐次神经网络上的隐式偏差

Eitan Gronich, Gal Vardi

机构 * Department of Computer Science and Applied Mathematics, Weizmann Institute of Science, Rehovot, Israel(计算机科学与应用数学系,魏茨曼科学研究院,以色列雷霍夫特)

AI总结 研究动量优化器在光滑齐次模型上的隐式偏差,证明Muon、MomentumGD和Signum在衰减学习率下近似于最速下降轨迹,并偏向于对应边际最大化问题的KKT点,同时将分析扩展到Adam和混合范数优化器。

Comments ICML 2026. 8 pages, 1 figure (with appendix: 45 pages, 3 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02544 2026-05-26 cs.LG cs.AI

SPA-Cache: Singular Proxies for Adaptive Caching in Diffusion Language Models

SPA-Cache: 扩散语言模型中的自适应缓存奇异代理

Wenhao Sun, Rong-Cheng Tu, Yifu Ding, Zhao Jin, Jingyi Liao, Yongcheng Jing, Dacheng Tao

机构 * College of Computing(计算学院) Data Science, Nanyang Technological University, Singapore, Singapore(数据科学,南洋理工大学,新加坡,新加坡)

AI总结 针对扩散语言模型因非因果特性无法使用标准KV缓存导致计算开销大的问题,提出SPA-Cache方法,通过低维奇异代理识别关键令牌并自适应分配缓存预算,实现高达8倍吞吐量提升和2-4倍加速。

Comments Accepted by ICML 2026.The code repository is available at https://github.com/wenhao728/spa-cache

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25507 2026-05-26 stat.ML cs.LG math.ST stat.ME stat.TH

One-shot Conditional Sampling: MMD meets Nearest Neighbors

一次性条件采样:MMD 遇见最近邻

Anirban Chatterjee, Sayantan Choudhury, Rohan Hore

机构 * University of Chicago(芝加哥大学) MBZUAI(马斯克商学院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出 CGMMD 框架,通过最小化最大均值差异(MMD)实现一次性条件采样,理论保证收敛性,并在图像去噪和超分辨率等任务中表现优异。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05614 2026-05-26 cs.CV cs.AI cs.RO

SpecPrune-VLA: Accelerating Vision-Language-Action Models via Action-Aware Self-Speculative Pruning

SpecPrune-VLA: 通过动作感知的自推测剪枝加速视觉-语言-动作模型

Hanzhen Wang, Jiaming Xu, Yushun Xiang, Jiayi Pan, Yongkang Zhou, Yong-Lu Li, Guohao Dai

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 针对视觉-语言-动作模型推理加速,提出结合全局上下文与局部信息的无训练两层剪枝方法,实现高达1.57倍加速且成功率几乎无下降。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11367 2026-05-26 cs.DC

Efficient Distributed MLLM Training with Cornstarch

使用Cornstarch高效分布式多模态大语言模型训练

Insu Jang, Runyu Lu, Nikhil Bansal, Ang Chen, Mosharaf Chowdhury

AI总结 提出Cornstarch框架,通过冻结感知流水线并行和令牌工作负载平衡的上下文并行,解决多模态大语言模型训练中的异构性问题,平均吞吐量提升2.26倍。

Comments ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏