arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

共收录 11791
2605.17126 2026-06-01 stat.ML cs.LG stat.ME

Multi-task Linear Regression without Eigenvalue Lower Bounds: Adaptivity, Robustness, and Safety

无需特征值下界的多任务线性回归:自适应性、鲁棒性与安全性

Seok-Jin Kim

机构 * Columbia(哥伦比亚大学)

AI总结 针对存在污染任务的多任务线性回归问题,提出基于矩阵加权范数正则化的估计器,引入相对平衡条件,在弱谱假设下达到与现有方法相当的预测误差界,并具备安全性保证。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00747 2026-06-01 cs.CL cs.AI

Decouple Searching from Training: Scaling Data Mixing via Model Merging for Large Language Model Pre-training

将搜索与训练解耦:通过模型合并实现大规模语言模型预训练的数据混合缩放

Shengrui Li, Fei Zhao, Kaiyan Zhao, Jieying Ye, Haifeng Liu, Fangcheng Shi, Zheyong Xie, Yao Hu, Shaosheng Cao

机构 * NLP Team, Xiaohongshu Inc., Shanghai, China(小红书自然语言处理团队,小红书公司,上海,中国) Tsinghua University, Beijing, China(清华大学,北京,中国) The University of Tokyo, Tokyo, Japan(东京大学,东京,日本)

AI总结 提出DeMix框架,通过模型合并预测最优数据配比,在降低搜索成本的同时提升基准性能。

Comments 18 pages, 5 figures, accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15197 2026-06-01 cs.AI cs.CL cs.CV cs.RO

LangForce: Bayesian Decomposition of Vision Language Action Models via Latent Action Queries

LangForce: 通过潜在动作查询对视觉语言动作模型进行贝叶斯分解

Shijie Lian, Bin Yu, Xiaopeng Lin, Laurence T. Yang, Zhaolong Shen, Changti Wu, Yuzhuo Miao, Cong Huang, Kai Chen

机构 * Huazhong University of Science and Technology(华中科技大学) Beijing Zhongguancun Academy(北京中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) Harbin Institute of Technology(哈尔滨工业大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhengzhou University(郑州大学) Beihang University(北航) East China Normal University(东华大学) DeepCybot Co., Ltd.(DeepCybot有限公司)

AI总结 针对VLA模型在训练中因数据偏差导致语言信息被忽略的问题,提出LangForce框架,通过贝叶斯分解和潜在动作查询构建双分支架构,最大化动作与指令的点互信息,无需新数据即可显著提升泛化能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11134 2026-06-01 cs.LG cs.AI

Spurious Correlation Learning in Preference Optimization: Mechanisms, Consequences, and Mitigation via Tie Training

偏好优化中的虚假相关学习:机制、后果及通过平局训练的缓解方法

Christian Moya, Alex Semendinger, Guang Lin, Elliott Thornley

机构 * Department of Mathematics, Purdue University, West Lafayette IN, USA(普渡大学数学系) School of Mechanical Engineering, Purdue University, West Lafayette IN, USA(普渡大学机械工程学院) Massachusetts Institute of Technology, Cambridge MA, USA(麻省理工学院)

AI总结 本文通过统一理论分析揭示了偏好优化(如DPO)中虚假相关学习的机制(均值虚假偏差和因果-虚假相关泄漏),证明其导致分布偏移下的不可逆脆弱性,并提出平局训练数据增强策略以选择性减少虚假学习。

Comments Proceedings of the 43rd International Conference on Machine Learning, 2026, Seoul, South Korea

Journal ref Proceedings of the 43rd International Conference on Machine Learning, 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12579 2026-06-01 cs.LG

EEG-Based Multimodal Learning via Hyperbolic Mixture-of-Curvature Experts

基于EEG的多模态学习:曲率混合专家双曲空间方法

Runhe Zhou, Shanglin Li, Guanxiang Huang, Xinliang Zhou, Qibin Zhao, Motoaki Kawanabe, Yi Ding, Cuntai Guan

机构 * Nanyang Technological University, Singapore(新加坡南洋理工大学) BIFOLD, Berlin Institute for the Foundations of Learning(柏林学习与数据基础研究所) University of Cambridge, Cambridge, UK(剑桥大学)

AI总结 提出EEG-MoCE框架,通过可学习曲率的双曲空间为每个模态分配专家,并采用曲率感知融合策略,实现层次结构建模,在情绪识别、睡眠分期和认知评估任务上达到最优性能。

Comments Accepted at the Forty-third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16165 2026-06-01 cs.LG cs.AI

HiPER: Hierarchical Reinforcement Learning with Explicit Credit Assignment for Large Language Model Agents

HiPER: 具有显式信用分配的分层强化学习用于大型语言模型智能体

Jiangweizhi Peng, Yuanxin Liu, Ruida Zhou, Charles Fleming, Zhaoran Wang, Alfredo Garcia, Mingyi Hong

机构 * University of Minnesota Northwestern University Amazon AGI Texas A\&M University Cisco Research

AI总结 针对稀疏奖励长程任务中LLM智能体信用分配困难的问题,提出HiPER分层规划-执行框架,通过分层优势估计(HAE)在规划和执行层面显式分配信用,在ALFWorld和WebShop上达到97.4%和83.3%的成功率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08145 2026-06-01 cs.CV cs.AI cs.LG

Self-Captioning Multimodal Interaction Tuning: Amplifying Exploitable Redundancies for Robust Vision Language Models

自描述多模态交互调优:放大可利用冗余以实现鲁棒的视觉语言模型

Yuriel Ryan, Hei Man Ip, Adriel Kuek, Paul Pu Liang, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡科技设计大学) DSO National Laboratories(国防部国家实验室) Massachusetts Institute of Technology(麻省理工学院)

AI总结 针对视觉语言模型中的幻觉和鲁棒性问题,提出自描述多模态交互调优方法,通过放大模态间冗余信息来补偿受损模态,并设计多模态交互门机制将独特交互转化为冗余交互,实验表明该方法可减少38.3%的视觉诱导错误并提升16.8%的一致性。

Comments Accepted to ICML 2026. Code: https://github.com/yurielryan/Multimodal-Interaction-Tuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06831 2026-06-01 cs.LG cs.AI

Why DDIM Hallucinates More Than DDPM: A Theoretical Analysis of Reverse Dynamics

为什么DDIM比DDPM更容易产生幻觉:反向动力学的理论分析

Muhammad H. Ashiq, Samanyu Arora, Abhinav N. Harish, Ishaan Kharbanda, Hung Yun Tseng, Grigorios G. Chrysos

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 通过理论分析高斯混合目标下的反向ODE(DDIM)和SDE(DDPM),证明在临界时间τ后DDIM会卡在两个最近模式之间的线段上,而DDPM的随机性帮助其脱离该区域从而避免幻觉。

Comments Accepted in ICML

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05520 2026-06-01 cs.LG stat.AP stat.ML

Bayesian Rain Field Reconstruction using Commercial Microwave Links and Diffusion Model Priors

使用商业微波链路和扩散模型先验的贝叶斯雨场重建

Badr Moufad, Albina Ilina, Hai Victor Habi, Salem Lahlou, Yazid Janati, Hagit Messer, Eric Moulines

机构 * School of Electrical and Computer Engineering, Tel Aviv University, Tel Aviv, Israel(电气与计算机工程学院,特拉维夫大学,特拉维夫,以色列)

AI总结 提出将雨场重建视为贝叶斯逆问题,利用扩散模型作为高保真空间先验,通过无需训练的后验采样方法(如即插即用、序贯蒙特卡洛和副本交换)实现优于传统方法的性能。

Comments Added link to source code

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00265 2026-06-01 cs.LG

Polaris: Coupled Orbital Polar Embeddings for Hierarchical Concept Learning

Polaris: 用于层次概念学习的耦合轨道极坐标嵌入

Sahil Mishra, Srinitish Srinivasan, Sourish Dasgupta, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi, New Delhi, India(印度理工学院德里分校,新德里,印度) Indian Institute of Technology Delhi, Abu Dhabi, UAE(印度理工学院德里分校,阿布扎比,阿联酋) KDM Lab, Dhirubhai Ambani University Gandhinagar, Gujarat, India(KDM实验室,迪鲁布希阿姆巴尼大学冈丁加尔,古吉拉特邦,印度)

AI总结 提出Polaris极坐标超球面嵌入框架,通过角度和半径分离语义与层次,结合局部约束、全局正则化和不确定性感知非对称目标,在多种层次结构扩展任务中显著提升检索性能。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03216 2026-06-01 cs.CL cs.LG

Token Sparse Attention: Efficient Long-Context Inference with Interleaved Token Selection

Token Sparse Attention: 交错令牌选择的高效长上下文推理

Dongwon Jo, Beomseok Kang, Jiwon Song, Jae-Joon Kim

机构 * Department of Electrical and Computer Engineering, Seoul National University, Seoul, South Korea(电气电子工程系,首尔国立大学,首尔,韩国)

AI总结 提出Token Sparse Attention,一种轻量级动态令牌级稀疏化机制,通过交错选择令牌并在注意力前后压缩/解压缩,实现高效长上下文推理,在128K上下文中获得高达3.23倍加速且精度损失小于1%。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23436 2026-06-01 stat.ML cs.LG math.OC stat.CO

Inference of Online Newton Methods with Nesterov's Accelerated Sketching

带有Nesterov加速草图的在线牛顿方法的推断

Haoxuan Wang, Xinchen Du, Sen Na

机构 * School of Industrial and Systems Engineering, Georgia Institute of Technology(工业与系统工程系,佐治亚理工学院)

AI总结 针对在线牛顿方法推断计算成本高的问题,提出结合Hessian平均与Nesterov加速草图投影求解器的方法,在保持一阶方法$O(d^2)$复杂度下实现二阶方法的鲁棒性,并建立了全局收敛性、渐近正态性和在线协方差估计器。

Comments 52 pages, 2 tables, 3 figures; accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09429 2026-06-01 cs.CV cs.AI cs.LG

Rays as Pixels: Learning A Joint Distribution of Videos and Camera Trajectories

射线即像素:学习视频与相机轨迹的联合分布

Wonbong Jang, Shikun Liu, Soubhik Sanyal, Juan Camilo Perez, Kam Woh Ng, Sanskar Agrawal, Juan-Manuel Perez-Rua, Yiannis Douratsos, Tao Xiang

机构 * Meta AI

AI总结 提出一种视频扩散模型(Rays as Pixels),通过将相机表示为密集射线像素(raxels)并与视频帧共享潜在空间,联合去噪实现相机轨迹预测和相机控制视频生成。

Comments Accepted to ICML 2026. 9-page main paper plus supplementary material. Project page: https://wbjang.github.io/raysaspixels/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17551 2026-06-01 cs.LG cs.AI

SVL: Goal-Conditioned Reinforcement Learning as Survival Learning

SVL:目标条件强化学习作为生存学习

Franki Nguimatsia Tiofack, Fabian Schramm, Théotime Le Hellard, Justin Carpentier

机构 * Inria(法国国家信息与自动化研究所) École Normale Supérieure, PSL Research University, Paris, France(巴黎高等师范学院,PSL研究大学)

AI总结 提出生存价值学习(SVL),通过将时间到目标建模为概率分布,将目标条件强化学习重构为生存学习问题,并利用危险模型进行最大似然估计,在离线基准上匹配或超越强基线方法。

Comments Accepted to the 43rd International Conference on Machine Learning, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15959 2026-06-01 cs.LG

Multi-Objective Bayesian Optimization via Adaptive \varepsilon-Constraints Decomposition

基于自适应 ε-约束分解的多目标贝叶斯优化

Yaohong Yang, Sammie Katt, Samuel Kaski

机构 * Department of Computer Science, Aalto University, Espoo, Finland(阿尔托大学计算机科学系,芬兰 Espoo) ELLIS Institute Finland(芬兰 ELLIS 机构) Department of Computer Science, University of Manchester, Manchester, United Kingdom(曼彻斯特大学计算机科学系,英国 Manchester)

AI总结 提出STAGE-BO方法,通过自适应ε-约束分解将多目标优化转化为序列约束子问题,实现均匀帕累托覆盖并处理约束与偏好。

Comments 24 pages, 22 figures, 4 tables. Accepted at the Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09412 2026-06-01 stat.ML cond-mat.dis-nn cs.LG

Sharp description of local minima in the loss landscape of high-dimensional two-layer ReLU neural networks

高维两层ReLU神经网络损失景观中局部极小值的精确描述

Jie Huang, Bruno Loureiro, Stefano Sarao Mannelli

机构 * Physics, Chalmers University of Technology University of Gothenburg Ecole Normale Superieure, PSL \& CNRS Engineering, Chalmers University of Technology School of Computer Science Applied Mathematics, University of the Witwatersrand

AI总结 本文通过总结统计量精确刻画了高维两层ReLU神经网络损失景观中的局部极小值,并建立了与单次SGD的关联,揭示了过参数化对极小值稳定性和可达性的影响。

Comments 29 pages, 18 figures. Accepted as a conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18382 2026-06-01 cs.AI

From Weak Cues to Real Identities: Evaluating Inference-Driven De-Anonymization in LLM Agents

从弱线索到真实身份:评估LLM代理中推理驱动的去匿名化

Myeongseob Ko, Jihyun Jeong, Sumiran Singh Thakur, Gyuhak Kim, Ruoxi Jia

机构 * Department of Electrical and Computer Engineering, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工学院计算机工程系) Center for Advanced AI, Accenture(Accenture高级人工智能中心)

AI总结 研究通过LLM代理结合分散的非识别线索与公开证据重建真实身份的能力,揭示了即使在没有明确标识符的情况下,代理也能以高成功率实现去匿名化,并提出了新的隐私评估维度。

Comments Accepted at ICML 2026

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17145 2026-06-01 cs.LG cs.AI

REAL: Regression-Aware Reinforcement Learning for LLM-as-a-Judge

REAL: 面向LLM评判的回归感知强化学习

Yasi Zhang, Tianyu Chen, Mingyuan Zhou, Oscar Leong, Ying Nian Wu, Michal Lukasik

机构 * University of California, Los Angeles(加州大学洛杉矶分校) The University of Texas at Austin(得克萨斯大学奥斯汀分校) Google Research Now at Google DeepMind(谷歌研究 现在在谷歌深Mind)

AI总结 提出REAL框架,通过广义策略梯度将回归目标融入强化学习,优化LLM作为评分器的数值评估,在多个规模模型上超越SFT和标准RL方法。

Comments Accepted to ICML 2026. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09453 2026-06-01 cs.LG cs.AI stat.ML

Variational Routing: A Scalable Bayesian Framework for Calibrated Mixture-of-Experts Transformers

变分路由:用于校准混合专家Transformer的可扩展贝叶斯框架

Albus Yizhuo Li, Matthew Wicker

机构 * Department of Computing, Imperial College London(伦敦帝国理工学院计算机系)

AI总结 提出变分混合专家路由(VMoER),通过将贝叶斯推断限制在专家选择阶段,实现大规模模型的不确定性校准,在微调基础模型上显著提升路由稳定性、降低校准误差并提高分布外检测AUROC,且额外计算开销极小。

Comments 8 pages, 7 figures for main text; 16 pages for Appendix; Accepted by ICML 2026;

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13875 2026-06-01 cs.CL cs.LG

GradMem: Learning to Write Context into Memory with Test-Time Gradient Descent

GradMem: 通过测试时梯度下降将上下文写入记忆

Yuri Kuratov, Matvey Kairov, Aydar Bulatov, Ivan Rodkin, Mikhail Burtsev

机构 * AXXX, Cognitive AI Systems Lab, Moscow, Russia(AXXX认知人工智能系统实验室,莫斯科,俄罗斯) London Institute for Mathematical Sciences, London, UK(伦敦数学科学研究所,伦敦,英国)

AI总结 提出GradMem方法,利用测试时梯度下降将上下文写入紧凑记忆状态,通过自监督重构损失优化记忆令牌,在键值检索和自然语言任务上优于前向式记忆写入方法。

Comments International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09787 2026-06-01 cs.CV cs.LG

What is Missing? Explaining Neurons Activated by Absent Concepts

缺失的是什么?解释被缺失概念激活的神经元

Robin Hesse, Simone Schaub-Meyer, Janina Hesse, Bernt Schiele, Stefan Roth

机构 * Max Planck Institute for Informatics, SIC(马克斯·普朗克信息研究所,SIC) Department of Computer Science, Technical University of Darmstadt(达姆施塔特技术大学计算机科学系) Leibniz Institute for Resilience Research(莱比锡韧性研究所) Institute for Quantitative and Computational Biosciences, Johannes Gutenberg University Mainz(美因茨雅各布·冯·特利尔大学定量与计算生物科学研究所) University Medical Center Mainz(美因茨大学医学中心)

AI总结 针对深度神经网络中编码缺失(概念缺失导致神经元激活)这一被忽视的因果关系,提出两种扩展归因和特征可视化方法以揭示并解释这种缺失,实验表明ImageNet模型利用此类缺失且考虑它们可改善去偏。

Comments ICML 2025 | Code: https://github.com/visinf/what-is-missing

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09221 2026-06-01 cs.LG

Beyond Test-Time Memory: State-Space Optimal Control for LLM Reasoning

超越测试时记忆:用于LLM推理的状态空间最优控制

Peihao Wang, Shan Yang, Xijun Wang, Tesi Xiao, Xin Liu, Changlong Yu, Yu Lou, Pan Li, Zhangyang Wang, Ming Lin, René Vidal

机构 * vita-group(vita组)

AI总结 提出测试时控制(TTC)层,通过有限时域LQR规划实现推理,作为适配器集成到预训练LLM中,在数学推理任务上提升高达27.8%的准确率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07751 2026-06-01 cs.CV cs.CL

3ViewSense: Spatial and Mental Perspective Reasoning from Orthographic Views in Vision-Language Models

3ViewSense: 视觉-语言模型中基于正交视图的空间与心理视角推理

Shaoxiong Zhan, Yanlin Lai, Zheng Liu, Hai Lin, Shen Li, Xiaodong Cai, Zijian Lin, Wen Huang, Hai-Tao Zheng

机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院) School of Software Engineering, Chongqing University, Chongqing, China(重庆大学软件学院)

AI总结 提出3ViewSense框架,通过正交视图的“模拟-推理”机制解决视觉-语言模型在空间推理中的视角一致性问题,显著提升遮挡计数和空间推理性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02630 2026-06-01 cs.LG cs.AI

MASPOB: Bandit-Based Prompt Optimization for Multi-Agent Systems with Graph Neural Networks

MASPOB: 基于图神经网络的多智能体系统提示优化方法

Zhi Hong, Qian Zhang, Jiahang Sun, Zhiwei Shang, Mingze Kong, Xiangyi Wang, Yao Shu, Zhongxiang Dai

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) South China University of Technology(华南理工大学) Ritsumeikan University(立命馆大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

AI总结 提出基于赌博机的样本高效框架MASPOB,利用UCB平衡探索与利用、GNN捕获拓扑先验、坐标上升分解优化,解决多智能体系统提示优化中的样本效率、拓扑耦合和组合爆炸问题。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22968 2026-06-01 cs.AI cs.CV cs.CY

Certified Circuits: Stability Guarantees for Mechanistic Circuits

认证电路:机械论电路的稳定性保证

Alaa Anani, Tobias Lorenz, Bernt Schiele, Mario Fritz, Jonas Fischer

机构 * Max Planck Institute for Informatics(马克斯·普朗克研究所信息学研究所) CISPA Helmholtz Center for Information Security(信息安全赫尔姆霍茨中心)

AI总结 提出Certified Circuits框架,通过随机数据子采样认证电路组件(神经元或边)对概念数据集编辑距离扰动的稳定性,生成更紧凑、更准确的电路。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10117 2026-06-01 cs.LG cs.AI

Biases in the Blind Spot: Detecting What LLMs Fail to Mention

盲点中的偏见:检测大语言模型未能提及的内容

Iván Arcuschin, David Chanin, Adrià Garriga-Alonso, Oana-Maria Camburu

机构 * Poseidon Research(Poseidon研究) University College London, United Kingdom(伦敦大学学院, 英国) Imperial College London, United Kingdom(伦敦帝国学院, 英国)

AI总结 提出全自动黑盒流水线,通过统计测试和思维链分析,自动检测大语言模型在任务中未明确表述的偏见。

Comments Published at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21340 2026-06-01 cs.LG

HiPPO Zoo: Explicit Memory Mechanisms for Interpretable State Space Models

HiPPO动物园:可解释状态空间模型的显式记忆机制

Jack Goffinet, Casey Hanks, David E. Carlson

机构 * Department of Computer Science, Duke University, Durham NC, USA(计算机科学系,杜克大学,北卡罗来纳州达勒姆)

AI总结 本文通过扩展HiPPO框架,提出五种显式、可解释的记忆机制(统称“HiPPO动物园”),使状态空间模型具备自适应记忆分配和联想记忆等能力,并在合成序列建模任务中验证其有效性。

Comments 24 pages, 7 figures; to be published in ICML 2026; additional experimental results included

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18837 2026-06-01 cs.LG

L2G-Net: Local to Global Spectral Graph Neural Networks via Cauchy Factorizations

L2G-Net:通过柯西分解的局部到全局谱图神经网络

Samuel Fernández-Menduiña, Eduardo Pavez, Antonio Ortega

机构 * University of Southern California(南加州大学)

AI总结 提出L2G-Net,通过将图傅里叶变换精确分解为作用于子图的算子并利用柯西矩阵组合,实现局部到全局的谱图神经网络,避免全特征分解,在长程依赖任务上以极少的可学习参数达到竞争性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08885 2026-06-01 cs.LG cs.AI cs.SC

Breaking the Simplification Bottleneck in Amortized Neural Symbolic Regression

打破摊销神经符号回归中的简化瓶颈

Paul Saegert, Ullrich Köthe

机构 * Heidelberg University(海德堡大学)

AI总结 针对摊销符号回归中表达式简化速度慢的问题,提出基于规则的简化引擎SimpliPy,实现百倍加速,从而提升模型精度和可扩展性。

Comments main text: 8 pages, 7 figures; appendix: 12 pages, 11 figures; code available at https://github.com/psaegert/simplipy and https://github.com/psaegert/flash-ansr; v2: Fixed rendering artifact in Figure 7; v3: Fixed Figure 3 title and formula; v4: Fixed Eq (1), example in App. M, Fig 13; v5: ICML 2026 Camera-Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18333 2026-06-01 cs.LG cs.CL

On the "Induction Bias" in Sequence Models

论序列模型中的“归纳偏置”

M. Reza Ebrahimi, Michaël Defferrard, Sunny Panchal, Roland Memisevic

机构 * Qualcomm AI Research is an initiative of Qualcomm Technologies, Inc(高通人工智能研究,由高通技术公司发起)

AI总结 通过大规模实验比较Transformer和RNN在状态跟踪任务上的数据效率,发现Transformer需要更多训练数据且难以跨长度共享权重,而RNN通过权重共享实现有效学习。

Comments Accepted to the International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏