arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

共收录 9452
2512.09115 2026-05-15 cs.CV

SuperF: Neural Implicit Fields for Multi-Image Super-Resolution

SuperF:基于神经隐式场的多图像超分辨率

Sander Riisøen Jyhne, Christian Igel, Morten Goodwin, Per-Arne Andersen, Serge Belongie, Nico Lang

机构 * University of Agder(阿格德大学) University of Copenhagen(哥本哈根大学)

AI总结 本文提出SuperF,一种基于神经隐式场的多图像超分辨率方法,通过共享隐式神经表示并联合优化帧对齐,实现无需高分辨率训练数据的超分辨率提升。

Comments Published at ICLR 2026, Project website: https://sjyhne.github.io/superf/, 23 pages, 13 figures, 8 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07805 2026-05-15 cs.LG cs.AI cs.CL

Group Representational Position Encoding

群表示位置编码

Yifan Zhang, Zixiang Chen, Yifeng Liu, Zhen Qin, Huizhuo Yuan, Kangping Xu, Yang Yuan, Quanquan Gu, Andrew Chi-Chih Yao

机构 * Princeton University(普林斯顿大学) University of California, Los Angeles(加州大学洛杉矶分校) IIIS, Tsinghua University(清华大学人工智能研究院)

AI总结 GRAPE提出了一种基于群作用的位置编码框架,结合乘法旋转和加法logit偏置机制,扩展了RoPE和ALiBi的应用范围,适用于长上下文模型的位置几何设计。

Comments Published in ICLR 2026. Project Page: https://github.com/model-architectures/GRAPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16060 2026-05-15 cs.LG cs.AI eess.SP

Tokenizing Single-Channel EEG with Time-Frequency Motif Learning

使用时间-频率动机学习对单通道EEG进行分词

Jathurshan Pradeepkumar, Xihao Piao, Zheng Chen, Jimeng Sun

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) SANKEN, Osaka University(大阪大学SANKEN)

AI总结 本文提出TFM-Tokenizer,通过学习单通道EEG信号的时间-频率动机词汇,提升EEG分词准确性,实验显示在多个基准上性能提升达11%,且适用于多种基础模型,具备良好的通用性和可扩展性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00270 2026-05-15 cs.LG cs.AI stat.ML

DUET: Optimizing Training Data Mixtures via Feedback from Unseen Evaluation Tasks

DUET:通过未见评估任务的反馈优化训练数据混合

Zhiliang Chen, Gregory Kang Ruey Lau, Chuan-Sheng Foo, Bryan Kian Hsiang Low

机构 * National University of Singapore(新加坡国立大学) Agency for Research, Science, Technology and Research (A*STAR)(研究、科技与研发机构)

AI总结 本文提出DUET算法,通过结合影响函数与贝叶斯优化,利用未见评估任务的反馈优化训练数据混合,理论证明其能收敛至最优混合,实验显示优于现有方法。

Comments Accepted to ICLR 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18104 2026-05-15 cs.CL cs.AI cs.LG

Training and Evaluating Language Models with Template-based Data Generation

基于模板的数据生成训练和评估语言模型

Yifan Zhang

机构 * University of California Los Angeles(加州大学洛杉矶分校)

AI总结 本文提出Template-based Data Generation方法,通过生成高质量数学问题及可验证解,解决大语言模型在复杂推理任务中的数据稀缺问题,并引入TemplateMath Part I: TemplateGSM数据集。

Comments Published in ICLR 2025 DATA-FM Workshop. Project Page: https://github.com/iiis-ai/TemplateMath

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02753 2026-05-14 cs.CV

DeCo-DETR: Decoupled Cognition DETR for efficient Open-Vocabulary Object Detection

DeCo-DETR:解耦认知DETR用于高效的开放词汇目标检测

Siheng Wang, Yanshu Li, Bohan Hu, Zhengdao Li, Haibo Zhan, Linshan Li, Weiming Liu, Ruizhi Qian, Guangxin Wu, Hao Zhang, Jifeng Shen, Piotr Koniusz, Zhengtao Yao, Junhao Dong, Qiang Sun

机构 * Jiangsu University(江苏大学) Brown University(布朗大学) Nanyang Technological University(南洋理工大学) MBZUAI University of New South Wales(新南威尔士大学) USC University of Toronto(多伦多大学) Data61 CSIRO

AI总结 DeCo-DETR通过统一解耦范式解决开放词汇目标检测中的计算开销与训练目标冲突问题,构建层次化语义原型空间并解耦语义推理与定位,提升推理效率。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22251 2026-05-14 cs.LG cond-mat.mtrl-sci cs.AI

Zatom-1: Towards a Multimodal Foundation Model for 3D Molecules and Materials

Zatom-1:迈向3D分子和材料的多模态基础模型

Alex Morehead, Miruna Cretu, Antonia Panescu, Rishabh Anand, Maurice Weiler, Tynan Perez, Samuel Blau, Steven Farrell, Wahid Bhimji, Anubhav Jain, Hrushikesh Sahasrabuddhe, Pietro Lio, Tommi Jaakkola, Rafael Gomez-Bombarelli, Rex Ying, N. Benjamin Erichson, Michael W. Mahoney

机构 * LBNL(劳伦斯伯克利国家实验室) ICSI(国际计算机科学研究所) University of Cambridge(剑桥大学) Yale University(耶鲁大学) MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校)

AI总结 Zatom-1是一种跨领域、通用的模型架构,统一了3D分子和材料的生成与预测学习,通过多模态流匹配目标实现高效的预训练和稳定采样,提升了生成推理速度和跨领域预测性能。

Comments 38 pages, 10 figures, 15 tables. ICLR 2026 FM4Science. Code, data, and model weights are available at https://github.com/Zatom-AI/zatom

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18608 2026-05-14 cs.AI cs.LG

PolySHAP: Extending KernelSHAP with Interaction-Informed Polynomial Regression

PolySHAP:通过交互信息的多项式回归扩展KernelSHAP

Fabian Fumagalli, R. Teal Witter, Christopher Musco

机构 * Bielefeld University(比勒菲尔德大学) Claremont McKenna College(克莱蒙特麦肯纳学院) New York University(纽约大学)

AI总结 本文提出PolySHAP方法,通过高次多项式回归扩展KernelSHAP,以更准确地估计Shapley值,同时证明配对采样与二阶PolySHAP的等价性,为配对采样提供了理论支持。

Comments Published at ICLR 2026: https://openreview.net/forum?id=M19J8UGguq

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18993 2026-05-14 cs.LG

CR-Net: Scaling Parameter-Efficient Training with Cross-Layer Low-Rank Structure

CR-Net:通过跨层低秩结构实现参数高效训练

Boao Kong, Junzhu Liang, Yuxi Liu, Renjia Deng, Kun Yuan

机构 * Peking University(北京大学)

AI总结 CR-Net通过跨层低秩结构提升大语言模型预训练效率,减少计算和内存需求,同时保持模型性能。

Comments 32 pages. Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15616 2026-05-14 cs.CV

LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models

LENS:基于大语言模型的多级多模态推理评估

Ruilin Yao, Bo Zhang, Jirui Huang, Xinwei Long, Yifang Zhang, Tianyu Zou, Yufei Wu, Shichao Su, Yifan Xu, Wenxi Zeng, Zhaoyu Yang, Guoyou Li, Shilan Zhang, Zichan Li, Yaxiong Chen, Shengwu Xiong, Peng Xu, Jiajun Zhang, Bowen Zhou, David Clifton, Luc Van Gool

机构 * Wuhan University of Technology(武汉理工大学) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai AI Lab(上海人工智能实验室) University of Oxford(牛津大学) INSAIT, Sofia Un. St Kliment Ohridski(索菲亚大学克里门特·欧里迪斯基学院)

AI总结 LENS提出一个包含3.4K图像和60K+问题的多级评估基准,涵盖8个任务和12种日常场景,用于评估大语言模型在多模态推理中的表现。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13151 2026-05-14 cs.CV

GenCape: Structure-Inductive Generative Modeling for Category-Agnostic Pose Estimation

GenCape:基于结构的生成建模用于类别无关姿态估计

Jiyong Rao, Yu Wang, Shengjie Zhao

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

AI总结 GenCape提出一种生成框架,通过图像支持输入推断关键点关系,无需额外文本描述或预定义骨架,提升跨类别姿态估计的鲁棒性和准确性。

Comments Accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12803 2026-05-14 cs.LG

Pitfalls of Unlabeled Disagreement-Based Drift Detection in Streaming Tree Ensembles

流树集成中基于不一致的漂移检测陷阱

Lara Sá Neves, Afonso Lourenço, Lizy K. John, Goreti Marreiros

机构 * GECAD, ISEP, Polytechnic of Porto(GECAD,ISEP,波尔图理工大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 研究探讨了在高速数据流中使用未标记数据进行漂移检测的挑战,发现基于不一致的不确定性方法在集成增量决策树中表现欠佳,归因于IDTs的固有刚性。

Comments Published as a conference paper at CAO Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22853 2026-05-14 cs.CV

Inference-Time Dynamic Modality Selection for Incomplete Multimodal Classification

推理时动态模态选择用于不完整多模态分类

Siyi Du, Xinzhe Luo, Declan P. O'Regan, Chen Qin

机构 * Department of Electrical and Electronic Engineering & I-X(电气与电子工程系及I-X)

AI总结 本文提出DyMo框架,通过动态选择并融合可靠恢复的模态,解决不完整多模态学习中的丢弃或填补困境,实验显示其在多种缺失数据场景下优于现有方法。

Comments 27 pages (including appendix), accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19208 2026-05-14 cs.CL cs.LG

How Do Transformers Learn to Associate Tokens: Gradient Leading Terms Bring Mechanistic Interpretability

Transformer 如何学习关联令牌:梯度主导项带来机制性可解释性

Shawn Im, Changdae Oh, Zhen Fang, Sharon Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Technology Sydney(悉尼技术大学)

AI总结 研究通过梯度主导项分析了注意力语言模型中语义关联的形成机制,揭示了权重的闭式表达及其对文本统计的反映。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10857 2026-05-14 cs.LG cs.AI stat.ML

Generative Modeling from Black-box Corruptions via Self-Consistent Stochastic Interpolants

通过自洽随机插值生成模型中的黑盒破坏

Chirag Modi, Jiequn Han, Eric Vanden-Eijnden, Joan Bruna

机构 * New York University(纽约大学) Flatiron Institute(Flatiron研究所) Machine Learning Lab, Capital Fund Management(资本基金管理有限公司机器学习实验室)

AI总结 本文提出自洽随机插值方法,通过迭代更新传输映射来逆向恢复清洁数据,具有计算效率高、灵活性强和理论保证等优势,应用于自然图像处理和科学重建领域。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19304 2026-05-14 cs.LG

Loopholing Discrete Diffusion: Deterministic Bypass of the Sampling Wall

突破离散扩散:确定性绕过采样壁垒

Mingyu Jo, Jaesik Yoon, Justin Deschenaux, Caglar Gulcehre, Sungjin Ahn

机构 * KAIST(韩国科学技术院) EPFL(苏黎世联邦理工学院) Microsoft(微软) SAP NYU(纽约大学)

AI总结 本文提出Loopholing机制,通过确定性潜在路径解决离散扩散模型采样瓶颈问题,显著降低生成困惑度,提升文本连贯性,并在推理任务中表现优异。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18245 2026-05-14 cs.LG cs.AI

Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs

参数规模与模型架构的交汇:迈向推理高效的大型语言模型

Song Bian, Tao Yu, Shivaram Venkataraman, Youngsuk Park

机构 * UW-Madison(威斯康星大学麦迪逊分校) Amazon Web Services(亚马逊网络服务)

AI总结 本文研究了模型架构因素如何影响推理成本与准确性,提出条件缩放定律并验证了其有效性,结果表明优化架构在相同训练预算下提升了准确率和推理吞吐量。

Comments 32 pages, 27 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23597 2026-05-14 cs.LG cs.AI

Characteristic Root Analysis and Regularization for Linear Time Series Forecasting

特征根分析与线性时间序列预测中的正则化

Zheng Wang, Kaixuan Zhang, Wanfang Chen, Xiaonan Lu, Longyuan Li, Tobias Schlagenhauf

机构 * Bosch Center for AI (BCAI) & Bosch (China) Investment Co., Ltd.(博世人工智能中心(BCAI)及博世(中国)投资有限公司) Robert Bosch GmbH(罗伯特·博世有限公司)

AI总结 本文研究线性模型在时间序列预测中的特征根作用,提出鲁棒根重构策略,通过实验验证了其有效性,实现了高性能的预测模型。

Comments Accepted for publication at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00990 2026-05-14 cs.RO cs.AI cs.CV

Robotic Manipulation by Imitating Generated Videos Without Physical Demonstrations

通过模仿生成视频实现机器人操作

Shivansh Patel, Shraddhaa Mohan, Hanlin Mai, Unnat Jain, Svetlana Lazebnik, Yunzhu Li

机构 * UIUC(伊利诺伊大学香槟分校) UC Irvine(加州大学尔湾分校) Columbia University(哥伦比亚大学)

AI总结 本文提出RIGVid系统,通过模仿AI生成视频使机器人完成复杂操作任务,无需物理示范或特定机器人训练。系统利用视频扩散模型生成潜在示范视频,并通过视觉语言模型筛选符合指令的视频,再通过6D姿态跟踪器提取轨迹并映射到机器人。实验表明生成视频效果与真实示范相当,且性能随生成质量提升。

Comments In ICLR 2026. Website: https://rigvid-robot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12517 2026-05-14 cs.CL cs.AI cs.CV

Bridging the Missing-Modality Gap: Improving Text-Only Calibration of Vision Language Models

弥合缺失模态的差距:改进纯文本校准的视觉语言模型

Mingyeong Kim, Jungwon Choi, Chaeyun Jang, Juho Lee

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

AI总结 本文提出Latent Imagination Module,通过预测文本输入的潜在嵌入来提升纯文本环境下视觉语言模型的准确性和校准性能。

Comments 9 pages, 16 figures. Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI: Interpretability, Robustness, and Safety across Modalities

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11691 2026-05-13 cs.LG

Compositional Neural Operators for Multi-Dimensional Fluid Dynamics

组合神经算子用于多维流体动力学

Hamda Hmida, Hsiu-Wen Chang, Youssef Mesri

机构 * Mines Paris - PSL University, Centre for Material Forming (CEMEF)(巴黎矿学院-PSL大学,材料成形中心(CEMEF)) Mines Paris - PSL University, Centre for Robotics (CAOR)(巴黎矿学院-PSL大学,机器人中心(CAOR))

AI总结 本文提出组合神经算子框架,通过分解复杂PDE为基础模块,提升流体动力学问题的求解效率与可解释性。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11535 2026-05-13 cs.LG

Primal-Dual Policy Optimization for Linear CMDPs with Adversarial Losses

对具有对抗性损失的线性CMDP的对偶策略优化

Kihyun Yu, Seoungbin Bae, Dabeen Lee

机构 * Research Institute of Mathematics, Seoul National University(数学研究所,首尔国立大学) Interdisciplinary Program in Artificial Intelligence, Seoul National University(人工智能跨学科项目,首尔国立大学) Korea Institute for Advanced Study(韩国高级研究院)

AI总结 本文提出了一种新的对偶策略优化算法,用于在线有限时间线性CMDP,解决了对抗性环境下的子线性遗憾和约束违反问题,通过引入加权LogSumExp softmax策略和定期策略混合技术实现。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11414 2026-05-13 cs.LG cs.AI

Generative Diffusion Prior Distillation for Long-Context Knowledge Transfer

生成扩散先验蒸馏用于长上下文知识迁移

Nilushika Udayangani, Kishor Nandakishor, Marimuthu Palaniswami

机构 * Department of Electrical and Electronic Engineering(电子与电气工程系)

AI总结 本文提出GDPD框架,通过扩散模型生成先验知识,帮助短上下文分类器学习长上下文知识,提升在部分数据上的泛化能力。

Comments Published as a conference paper at ICLR 2026 (Brazil, Rio de Janeiro)

Journal ref The Fourteenth International Conference on Learning Representations 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06412 2026-05-13 cs.CL cs.LG

Stopping Computation for Converged Tokens in Masked Diffusion-LM Decoding

在掩码扩散语言模型解码中停止收敛令牌的计算

Daisuke Oba, Danushka Bollegala, Masahiro Kaneko, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学研究所) University of Liverpool(利物浦大学) Amazon(亚马逊) MBZUAI

AI总结 本文提出SureLock方法,通过锁定稳定位置以减少计算开销,提升解码效率,实验证明在LLaDA-8B上节省30-50%的FLOPs同时保持生成质量。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04265 2026-05-13 cs.AI cs.CL math.ST stat.ML stat.TH

Don't Pass@k: A Bayesian Framework for Large Language Model Evaluation

不要Pass@k:大规模语言模型评估的贝叶斯框架

Mohsen Hariri, Amirhossein Samandar, Michael Hinczewski, Vipin Chaudhary

机构 * Department of Computer and Data Sciences, Case Western Reserve University(计算机与数据科学系,凯斯西储大学) Department of Physics, Case Western Reserve University(物理系,凯斯西储大学)

AI总结 本文提出基于贝叶斯的评估框架,用后验估计替代Pass@k和avg@N,提升排名稳定性与透明度,适用于二元和非二元评估。

Comments OpenReview (ICLR 2026): https://openreview.net/forum?id=PTXi3Ef4sT

Journal ref The Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02043 2026-05-13 cs.CV cs.HC cs.LG

Zero-shot Human Pose Estimation using Diffusion-based Inverse solvers

基于扩散模型的零样本人体姿态估计

Sahil Bhandary Karnoor, Romit Roy Choudhury

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出InPose方法,通过预训练扩散模型和旋转测量条件,解决人体姿态估计中用户体型差异导致的泛化问题。

Comments Published as a Conference Paper at The Fourteenth International Conference on Learning Representations

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08902 2026-05-13 cs.LG cs.AI

Intention-Conditioned Flow Occupancy Models

意图条件流占用模型

Chongyi Zheng, Seohong Park, Sergey Levine, Benjamin Eysenbach

机构 * Princeton University(普林斯顿大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出意图条件流占用模型(InFOM),通过引入用户意图的隐变量,提升模型对长期依赖的建模能力,在36个状态基和4个图像基基准任务中实现回报提升1.8倍和成功率提升36%。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20761 2026-05-13 cs.LG stat.ML

Practical estimation of the optimal classification error with soft labels and calibration

实用的软标签与校准下的最优分类误差估计

Ryota Ushio, Takashi Ishida, Masashi Sugiyama

机构 * The University of Tokyo(东京大学) RIKEN AIP(日本科学技术研究院AIP)

AI总结 本文提出一种实用且理论支持的方法,通过软标签和校准估计二分类的贝叶斯误差,解决了硬标签估计偏差问题,并在存在损坏软标签的情况下提供统计一致的估计。

Comments ICLR 2026 camera-ready version updated; 40 pages, 12 figures; GitHub: https://github.com/RyotaUshio/bayes-error-estimation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10713 2026-05-12 stat.ML cs.IT cs.LG math.IT math.ST stat.TH

Price of Quality: Sufficient Conditions for Sparse Recovery using Mixed-Quality Data

质量的价格:使用混合质量数据的稀疏恢复充分条件

Youssef Chaabouni, David Gamarnik

机构 * Operations Research Center(运筹优化中心)

AI总结 研究混合质量数据下的稀疏恢复,提出质量价格概念,分析信息论和算法恢复条件,揭示信息论与算法阈值对数据质量变化的适应差异。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22953 2026-05-12 cs.AI

General Agent Evaluation

通用智能体评估

Elron Bandel, Asaf Yehudai, Lilach Eden, Yehoshua Sagron, Yotam Perlitz, Elad Venezian, Natalia Razinkov, Natan Ergas, Shlomit Shachor Ifergan, Segev Shlomov, Michal Jacovi, Leshem Choshen, Liat Ein-Dor, Yoav Katz, Michal Shmueli-Scheuer

机构 * IBM Research(IBM研究院) MIT(麻省理工学院)

AI总结 本文系统评估了通用智能体在不同协议和环境下的性能,提出统一协议和评估框架,揭示了智能体架构和基础模型对性能的影响,发现通用智能体无需定制即可适应多种领域。

Comments Presented at the ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏