arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

2026-05-14 至 2026-05-14 共收录 15
2604.02753 2026-05-14 cs.CV

DeCo-DETR: Decoupled Cognition DETR for efficient Open-Vocabulary Object Detection

DeCo-DETR:解耦认知DETR用于高效的开放词汇目标检测

Siheng Wang, Yanshu Li, Bohan Hu, Zhengdao Li, Haibo Zhan, Linshan Li, Weiming Liu, Ruizhi Qian, Guangxin Wu, Hao Zhang, Jifeng Shen, Piotr Koniusz, Zhengtao Yao, Junhao Dong, Qiang Sun

机构 * Jiangsu University(江苏大学) Brown University(布朗大学) Nanyang Technological University(南洋理工大学) MBZUAI University of New South Wales(新南威尔士大学) USC University of Toronto(多伦多大学) Data61 CSIRO

AI总结 DeCo-DETR通过统一解耦范式解决开放词汇目标检测中的计算开销与训练目标冲突问题,构建层次化语义原型空间并解耦语义推理与定位,提升推理效率。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22251 2026-05-14 cs.LG cond-mat.mtrl-sci cs.AI

Zatom-1: Towards a Multimodal Foundation Model for 3D Molecules and Materials

Zatom-1:迈向3D分子和材料的多模态基础模型

Alex Morehead, Miruna Cretu, Antonia Panescu, Rishabh Anand, Maurice Weiler, Tynan Perez, Samuel Blau, Steven Farrell, Wahid Bhimji, Anubhav Jain, Hrushikesh Sahasrabuddhe, Pietro Lio, Tommi Jaakkola, Rafael Gomez-Bombarelli, Rex Ying, N. Benjamin Erichson, Michael W. Mahoney

机构 * LBNL(劳伦斯伯克利国家实验室) ICSI(国际计算机科学研究所) University of Cambridge(剑桥大学) Yale University(耶鲁大学) MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校)

AI总结 Zatom-1是一种跨领域、通用的模型架构,统一了3D分子和材料的生成与预测学习,通过多模态流匹配目标实现高效的预训练和稳定采样,提升了生成推理速度和跨领域预测性能。

Comments 38 pages, 10 figures, 15 tables. ICLR 2026 FM4Science. Code, data, and model weights are available at https://github.com/Zatom-AI/zatom

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18608 2026-05-14 cs.AI cs.LG

PolySHAP: Extending KernelSHAP with Interaction-Informed Polynomial Regression

PolySHAP:通过交互信息的多项式回归扩展KernelSHAP

Fabian Fumagalli, R. Teal Witter, Christopher Musco

机构 * Bielefeld University(比勒菲尔德大学) Claremont McKenna College(克莱蒙特麦肯纳学院) New York University(纽约大学)

AI总结 本文提出PolySHAP方法,通过高次多项式回归扩展KernelSHAP,以更准确地估计Shapley值,同时证明配对采样与二阶PolySHAP的等价性,为配对采样提供了理论支持。

Comments Published at ICLR 2026: https://openreview.net/forum?id=M19J8UGguq

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18993 2026-05-14 cs.LG

CR-Net: Scaling Parameter-Efficient Training with Cross-Layer Low-Rank Structure

CR-Net:通过跨层低秩结构实现参数高效训练

Boao Kong, Junzhu Liang, Yuxi Liu, Renjia Deng, Kun Yuan

机构 * Peking University(北京大学)

AI总结 CR-Net通过跨层低秩结构提升大语言模型预训练效率,减少计算和内存需求,同时保持模型性能。

Comments 32 pages. Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15616 2026-05-14 cs.CV

LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models

LENS:基于大语言模型的多级多模态推理评估

Ruilin Yao, Bo Zhang, Jirui Huang, Xinwei Long, Yifang Zhang, Tianyu Zou, Yufei Wu, Shichao Su, Yifan Xu, Wenxi Zeng, Zhaoyu Yang, Guoyou Li, Shilan Zhang, Zichan Li, Yaxiong Chen, Shengwu Xiong, Peng Xu, Jiajun Zhang, Bowen Zhou, David Clifton, Luc Van Gool

机构 * Wuhan University of Technology(武汉理工大学) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai AI Lab(上海人工智能实验室) University of Oxford(牛津大学) INSAIT, Sofia Un. St Kliment Ohridski(索菲亚大学克里门特·欧里迪斯基学院)

AI总结 LENS提出一个包含3.4K图像和60K+问题的多级评估基准,涵盖8个任务和12种日常场景,用于评估大语言模型在多模态推理中的表现。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13151 2026-05-14 cs.CV

GenCape: Structure-Inductive Generative Modeling for Category-Agnostic Pose Estimation

GenCape:基于结构的生成建模用于类别无关姿态估计

Jiyong Rao, Yu Wang, Shengjie Zhao

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

AI总结 GenCape提出一种生成框架,通过图像支持输入推断关键点关系,无需额外文本描述或预定义骨架,提升跨类别姿态估计的鲁棒性和准确性。

Comments Accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12803 2026-05-14 cs.LG

Pitfalls of Unlabeled Disagreement-Based Drift Detection in Streaming Tree Ensembles

流树集成中基于不一致的漂移检测陷阱

Lara Sá Neves, Afonso Lourenço, Lizy K. John, Goreti Marreiros

机构 * GECAD, ISEP, Polytechnic of Porto(GECAD,ISEP,波尔图理工大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 研究探讨了在高速数据流中使用未标记数据进行漂移检测的挑战,发现基于不一致的不确定性方法在集成增量决策树中表现欠佳,归因于IDTs的固有刚性。

Comments Published as a conference paper at CAO Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22853 2026-05-14 cs.CV

Inference-Time Dynamic Modality Selection for Incomplete Multimodal Classification

推理时动态模态选择用于不完整多模态分类

Siyi Du, Xinzhe Luo, Declan P. O'Regan, Chen Qin

机构 * Department of Electrical and Electronic Engineering & I-X(电气与电子工程系及I-X)

AI总结 本文提出DyMo框架,通过动态选择并融合可靠恢复的模态,解决不完整多模态学习中的丢弃或填补困境,实验显示其在多种缺失数据场景下优于现有方法。

Comments 27 pages (including appendix), accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19208 2026-05-14 cs.CL cs.LG

How Do Transformers Learn to Associate Tokens: Gradient Leading Terms Bring Mechanistic Interpretability

Transformer 如何学习关联令牌:梯度主导项带来机制性可解释性

Shawn Im, Changdae Oh, Zhen Fang, Sharon Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Technology Sydney(悉尼技术大学)

AI总结 研究通过梯度主导项分析了注意力语言模型中语义关联的形成机制,揭示了权重的闭式表达及其对文本统计的反映。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10857 2026-05-14 cs.LG cs.AI stat.ML

Generative Modeling from Black-box Corruptions via Self-Consistent Stochastic Interpolants

通过自洽随机插值生成模型中的黑盒破坏

Chirag Modi, Jiequn Han, Eric Vanden-Eijnden, Joan Bruna

机构 * New York University(纽约大学) Flatiron Institute(Flatiron研究所) Machine Learning Lab, Capital Fund Management(资本基金管理有限公司机器学习实验室)

AI总结 本文提出自洽随机插值方法,通过迭代更新传输映射来逆向恢复清洁数据,具有计算效率高、灵活性强和理论保证等优势,应用于自然图像处理和科学重建领域。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19304 2026-05-14 cs.LG

Loopholing Discrete Diffusion: Deterministic Bypass of the Sampling Wall

突破离散扩散:确定性绕过采样壁垒

Mingyu Jo, Jaesik Yoon, Justin Deschenaux, Caglar Gulcehre, Sungjin Ahn

机构 * KAIST(韩国科学技术院) EPFL(苏黎世联邦理工学院) Microsoft(微软) SAP NYU(纽约大学)

AI总结 本文提出Loopholing机制,通过确定性潜在路径解决离散扩散模型采样瓶颈问题,显著降低生成困惑度,提升文本连贯性,并在推理任务中表现优异。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18245 2026-05-14 cs.LG cs.AI

Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs

参数规模与模型架构的交汇:迈向推理高效的大型语言模型

Song Bian, Tao Yu, Shivaram Venkataraman, Youngsuk Park

机构 * UW-Madison(威斯康星大学麦迪逊分校) Amazon Web Services(亚马逊网络服务)

AI总结 本文研究了模型架构因素如何影响推理成本与准确性,提出条件缩放定律并验证了其有效性,结果表明优化架构在相同训练预算下提升了准确率和推理吞吐量。

Comments 32 pages, 27 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23597 2026-05-14 cs.LG cs.AI

Characteristic Root Analysis and Regularization for Linear Time Series Forecasting

特征根分析与线性时间序列预测中的正则化

Zheng Wang, Kaixuan Zhang, Wanfang Chen, Xiaonan Lu, Longyuan Li, Tobias Schlagenhauf

机构 * Bosch Center for AI (BCAI) & Bosch (China) Investment Co., Ltd.(博世人工智能中心(BCAI)及博世(中国)投资有限公司) Robert Bosch GmbH(罗伯特·博世有限公司)

AI总结 本文研究线性模型在时间序列预测中的特征根作用,提出鲁棒根重构策略,通过实验验证了其有效性,实现了高性能的预测模型。

Comments Accepted for publication at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00990 2026-05-14 cs.RO cs.AI cs.CV

Robotic Manipulation by Imitating Generated Videos Without Physical Demonstrations

通过模仿生成视频实现机器人操作

Shivansh Patel, Shraddhaa Mohan, Hanlin Mai, Unnat Jain, Svetlana Lazebnik, Yunzhu Li

机构 * UIUC(伊利诺伊大学香槟分校) UC Irvine(加州大学尔湾分校) Columbia University(哥伦比亚大学)

AI总结 本文提出RIGVid系统,通过模仿AI生成视频使机器人完成复杂操作任务,无需物理示范或特定机器人训练。系统利用视频扩散模型生成潜在示范视频,并通过视觉语言模型筛选符合指令的视频,再通过6D姿态跟踪器提取轨迹并映射到机器人。实验表明生成视频效果与真实示范相当,且性能随生成质量提升。

Comments In ICLR 2026. Website: https://rigvid-robot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12517 2026-05-14 cs.CL cs.AI cs.CV

Bridging the Missing-Modality Gap: Improving Text-Only Calibration of Vision Language Models

弥合缺失模态的差距:改进纯文本校准的视觉语言模型

Mingyeong Kim, Jungwon Choi, Chaeyun Jang, Juho Lee

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

AI总结 本文提出Latent Imagination Module,通过预测文本输入的潜在嵌入来提升纯文本环境下视觉语言模型的准确性和校准性能。

Comments 9 pages, 16 figures. Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI: Interpretability, Robustness, and Safety across Modalities

详情

展开后加载摘要…

URL PDF HTML 收藏