arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

共收录 9454
2510.12312 2026-01-29 cs.LG cs.AI

Deep SPI: Safe Policy Improvement via World Models

深度SPI:通过世界模型实现安全策略改进

Florent Delgrange, Raphael Avalos, Willem Röpke

机构 * AI Lab, Vrije Universiteit Brussel(人工智能实验室,布鲁塞尔自由大学) Cohere

AI总结 DeepSPI通过结合世界模型和表示学习,提出了一种在线策略改进算法,在保持理论保证的同时在ALE-57基准中表现优异。

Comments ICLR 2026, 10 pages main text, 21 pages appendix (excluding references)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01146 2026-01-29 cs.CL cs.AI cs.LG

mR3: Multilingual Rubric-Agnostic Reward Reasoning Models

mR3:多语言无评分标准奖励推理模型

David Anugraha, Shou-Yi Hung, Zilu Tang, Annie En-Shiun Lee, Derry Tanti Wijaya, Genta Indra Winata

机构 * Stanford University(斯坦福大学) University of Toronto(多伦多大学) Boston University(波士顿大学) Ontario Tech University(安大略技术大学) Monash University Indonesia(墨尔本大学印尼分校) Capital One(Capital One公司)

AI总结 mR3是一种多语言无评分标准奖励推理模型,通过72种语言训练实现广泛语言覆盖,超越更大模型并验证其在多语言奖励模型基准上的最佳性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21853 2026-01-29 cs.CV

Dynamic Novel View Synthesis in High Dynamic Range

高动态范围动态新视角合成

Kaixuan Zhang, Zhipeng Xiong, Minxian Li, Mingwu Ren, Jiankang Deng, Xiatian Zhu

机构 * Nanjing University of Science and Technology(南京理工大学) Imperial College London(帝国理工学院) University of Surrey(萨里大学)

AI总结 本文提出HDR-4DGS方法,通过动态色调映射模块实现高动态范围动态新视角合成,提升时间辐射一致性和空间颜色准确性。

Comments It has been accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09332 2026-01-29 cs.RO cs.AI cs.CL cs.CV

OmniEVA: Embodied Versatile Planner via Task-Adaptive 3D-Grounded and Embodiment-aware Reasoning

OmniEVA:通过任务自适应3D grounded和 embodiment-aware推理实现具身 versatile规划

Yuecheng Liu, Dafeng Chi, Shiguang Wu, Zhanguang Zhang, Yuzheng Zhuang, Bowen Yang, He Zhu, Lingfeng Zhang, Pengwei Xie, David Gamaliel Arcos Bravo, Yingxue Zhang, Jianye Hao, Xingyue Quan

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

AI总结 OmniEVA通过任务自适应3D grounding和具身aware推理,解决具身系统中几何适应性和具身约束的限制,实现先进的具身推理和任务规划。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16324 2026-01-29 cs.CV

From Prediction to Perfection: Introducing Refinement to Autoregressive Image Generation

从预测到完美:引入精修到自回归图像生成

Cheng Cheng, Lin Song, Di An, Yicheng Xiao, Xuchong Zhang, Hongbin Sun, Ying Shan

机构 * Xi’an Jiaotong University(西安交通大学) Johns Hopkins University(约翰霍普金斯大学) Tsinghua University(清华大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室)

AI总结 TensorAR通过引入张量预测机制,改进自回归图像生成的质量和性能。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11497 2026-01-29 cs.CV

QVGen: Pushing the Limit of Quantized Video Generative Models

QVGen:推动量化视频生成模型的极限

Yushi Huang, Ruihao Gong, Jing Liu, Yifu Ding, Chengtao Lv, Haotong Qin, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港理工大学) Beihang University(北京航空航天大学) SenseTime Research(商汤科技研究院) Monash University(墨尔本大学) Nanyang Technological University(南洋理工大学) ETH Zürich(苏黎世联邦理工学院)

AI总结 QVGen通过量化感知训练框架在极低比特下实现高性能视频生成模型,首次达到全精度质量并优于现有方法。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00488 2026-01-29 cs.LG cs.AI

Membership Privacy Risks of Sharpness Aware Minimization

sharpness aware minimization 的成员隐私风险

Young In Kim, Andrea Agiollo, Pratiksha Agrawal, Johannes O. Royset, Rajiv Khanna

机构 * Department of Computer Science(计算机科学系) Purdue University(普渡大学) Delft University of Technology(代尔夫特理工大学) Department of Industrial and Systems Engineering(工业与系统工程系) University of Southern California(南加州大学)

AI总结 本文发现SAM在提升泛化能力的同时加剧了成员隐私泄露,通过分析记忆分数和影响分数揭示其对非典型子模式的捕捉能力更强,从而在成员推断攻击中表现更差。

Comments accepted to iclr 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19884 2026-01-28 cs.CV cs.LG

SONIC: Spectral Oriented Neural Invariant Convolutions

SONIC:基于频谱的神经不变卷积

Gijs Joppe Moens, Regina Beets-Tan, Eduardo H. P. Pooch

AI总结 SONIC通过连续频谱参数化方法,实现高效且鲁棒的卷积运算,适用于多种图像和医学数据集。

Comments 10 pages, 4 figures. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19850 2026-01-28 cs.CV

EgoHandICL: Egocentric 3D Hand Reconstruction with In-Context Learning

EgoHandICL: 以自身为中心的3D手重建与上下文学习

Binzhu Xie, Shi Qiu, Sicheng Zhang, Yinqiao Wang, Hao Xu, Muzammal Naseer, Chi-Wing Fu, Pheng-Ann Heng

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学) Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(医学智能与XR研究院,香港中文大学) Department of Computer Science, Khalifa University(计算机科学系,哈利法大学)

AI总结 EgoHandICL通过上下文学习框架提升以自身为中心的3D手重建的鲁棒性和一致性,结合视觉语言模型和掩码自动编码器实现更精确的手-物体交互推理。

Comments Accepted in ICLR 2026, Codebase: https://github.com/Nicous20/EgoHandICL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19739 2026-01-28 cs.CL cs.AI

TokenSeek: Memory Efficient Fine Tuning via Instance-Aware Token Ditching

TokenSeek: 通过实例感知的令牌丢弃实现内存高效的微调

Runjia Zeng, Qifan Wang, Qiang Guan, Ruixiang Tang, Lifu Huang, Zhenting Wang, Xueling Zhang, Cheng Han, Dongfang Liu

机构 * Rochester Institute of Technology(罗切斯特理工学院) Meta AI Kent State University(肯特州立大学) Rutgers University(罗格斯大学) UC Davis(加州大学戴维斯分校) Accenture(安永) University of Missouri-Kansas City(密苏里大学堪萨斯城分校)

AI总结 TokenSeek通过实例感知的令牌丢弃技术,在保持性能的同时显著降低微调的内存消耗。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19707 2026-01-28 cs.LG cs.RO

Scalable Exploration for High-Dimensional Continuous Control via Value-Guided Flow

通过价值引导流实现高维连续控制的可扩展探索

Yunyue Wei, Chenhui Zuo, Yanan Sui

机构 * Tsinghua University(清华大学)

AI总结 Qflex通过价值引导流在高维动作空间中实现高效探索,优于现有方法并在复杂控制任务中表现出色。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19686 2026-01-28 cs.CV

Video-KTR: Reinforcing Video Reasoning via Key Token Attribution

Video-KTR: 通过关键令牌 attribution 增强视频推理

Ziyue Wang, Sheng Jin, Zhongrong Zuo, Jiawei Wu, Han Qiu, Qi She, Hao Zhang, Xudong Jiang

机构 * ByteDance(字节跳动) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) National University of Singapore(国立新加坡大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 Video-KTR通过结合三种attribution信号,提升视频推理的准确性和可解释性,实现状态-of-the-art性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19666 2026-01-28 stat.ME math.ST stat.ML stat.TH

Direct Doubly Robust Estimation of Conditional Quantile Contrasts

条件分位数对比的直接双重稳健估计

Josh Givens, Song Liu, Henry W J Reeve, Katarzyna Reluga

AI总结 本文提出直接双重稳健估计器,用于条件分位数对比的估计,提升估计精度并增强模型可解释性。

Comments To be published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19659 2026-01-28 cs.CV cs.LG

KeepLoRA: Continual Learning with Residual Gradient Adaptation

KeepLoRA: 基于残差梯度适应的持续学习

Mao-Lin Luo, Zi-Hao Zhou, Yi-Lin Zhang, Yuanyu Wan, Tong Wei, Min-Ling Zhang

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of Computer Network and Information Integration (Southeast University), Ministry of Education, China(教育部计算机网络与信息集成重点实验室) School of Software Technology, Zhejiang University(浙江大学软件学院)

AI总结 KeepLoRA通过残差梯度适应方法实现持续学习,有效平衡知识保留、任务知识保持和新知识获取,取得最佳性能。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19580 2026-01-28 cs.CV

QuaMo: Quaternion Motions for Vision-based 3D Human Kinematics Capture

基于四元数的视觉3D人体运动捕捉

Cuong Le, Pavlo Melnyk, Urs Waldmann, Mårten Wadenbäck, Bastian Wandt

机构 * Linköping University(林雪平大学)

AI总结 QuaMo利用四元数微分方程和自适应加速增强,实现更准确的3D人体运动学捕捉。

Comments 10 pages, 4 figures, accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19541 2026-01-28 cs.LG cs.CE

GenCP: Towards Generative Modeling Paradigm of Coupled Physics

GenCP:面向耦合物理的生成建模范式

Tianrun Gao, Haoren Zheng, Wenhao Deng, Haodong Feng, Tao Zhang, Ruiqi Feng, Qianyi Chen, Tailin Wu

机构 * School of Engineering, Westlake University(西lake大学工程学院) Department of Geotechnical Engineering, Tongji University(同济大学地质工程系) Global College, Shanghai Jiao Tong University(上海交通大学全球学院) State Key Laboratory of Advanced Nuclear Energy Technology, Nuclear Power Institute of China(中国核能技术研究院先进核能技术重点实验室)

AI总结 GenCP提出一种新颖的生成范式,通过概率建模与迭代多物理耦合结合,实现对耦合多物理场模拟的高效建模与推断。

Comments ICLR 2026 Accpeted

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19362 2026-01-28 cs.DC cs.AI

Revisiting Parameter Server in LLM Post-Training

重新审视LLM后训练中的参数服务器

Xinyi Wan, Penghui Qi, Guangxing Huang, Chaoyi Ruan, Min Lin, Jialin Li

机构 * Sea AI Lab(海智实验室) National University of Singapore(新加坡国立大学)

AI总结 本文提出On-Demand Communication(ODC),通过优化参数服务器在LLM后训练中的应用,有效应对不平衡负载,提升设备利用率和训练效率。

Comments Accepted in ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19336 2026-01-28 cs.LG cs.AI

From Observations to Events: Event-Aware World Model for Reinforcement Learning

从观测到事件:用于强化学习的事件感知世界模型

Zhao-Han Peng, Shaohui Li, Zhi Li, Shulan Ruan, Yu Liu, You He

AI总结 本文提出事件感知世界模型(EAWM),通过学习事件感知的表示来提升强化学习的样本效率,实验表明其在多个基准上均取得显著性能提升。

Comments 43 pages, accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19333 2026-01-28 cs.LG cs.DS

Metric $k$-clustering using only Weak Comparison Oracles

使用弱比较 oracle 的度量 k-聚类

Rahul Raychaudhury, Aryan Esmailpour, Sainyam Galhotra, Stavros Sintos

机构 * Duke University(杜克大学) University of Illinois Chicago(伊利诺伊大学香槟分校) Cornell University(康奈尔大学)

AI总结 本文提出了一种使用弱比较 oracle 的 k-聚类算法,能够在噪声和成本受限的情况下实现高效的聚类效果。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19204 2026-01-28 cs.AI cs.CV

MATA: A Trainable Hierarchical Automaton System for Multi-Agent Visual Reasoning

MATA:一种用于多智能体视觉推理的可训练分层自动机系统

Zhixi Cai, Fucai Ke, Kevin Leo, Sukai Huang, Maria Garcia de la Banda, Peter J. Stuckey, Hamid Rezatofighi

机构 * Monash University(墨尔本大学)

AI总结 MATA是一种基于分层自动机的多智能体系统,通过可训练超智能体选择最优智能体进行视觉推理,实现高效任务解决。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19156 2026-01-28 stat.ML cs.LG math.OC

Convergence of Muon with Newton-Schulz

穆隆与牛顿-施卢茨的收敛性

Gyu Yeol Kim, Min-hwan Oh

机构 * Seoul National University(首尔国立大学)

AI总结 穆隆通过少量低次牛顿-施卢茨步骤在更快的计算时间上实现与SVD极因子相同的效果,证明了其理论基础。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19030 2026-01-28 cs.LG cs.AI stat.ML

A Unifying View of Coverage in Linear Off-Policy Evaluation

线性反政策评估中覆盖性的统一视角

Philip Amortila, Audrey Huang, Akshay Krishnamurthy, Nan Jiang

AI总结 本文提出了一种新的线性反政策评估中覆盖性的统一视角,通过引入特征动力学覆盖参数,统一了不同设置下的覆盖性定义。

Comments To appear at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19026 2026-01-28 cs.LG cs.AR cs.CL

Is Finer Better? The Limits of Microscaling Formats in Large Language Models

更细更好吗?微缩格式在大语言模型中的局限性

Andrea Fasoli, Monodeep Kar, Chi-Chun Liu, Swagath Venkataramani, Viji Srinivasan, Leland Chang, Naigang Wang

机构 * IBM Research, USA(IBM研究院,美国)

AI总结 研究发现微缩格式中块大小过小会导致模型输出退化,提出 FP8 无符号 E5M3 作为更高效的硬件友好格式,提升大语言模型的压缩性能。

Comments 31 pages, 17 figures, 3 tables; accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18999 2026-01-28 cs.LG cs.AI

Randomization Boosts KV Caching, Learning Balances Query Load: A Joint Perspective

随机化提升KV缓存,学习平衡查询负载:一种联合视角

Fangzhou Wu, Sandeep Silwal, Qiuyi, Zhang

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Google DeepMind(谷歌DeepMind)

AI总结 本文提出统一的数学模型,结合随机化缓存淘汰与学习方法,以平衡查询负载和缓存命中率,实验表明在多个基准上性能提升显著。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08931 2026-01-28 cs.CV cs.AI cs.LG

Astra: General Interactive World Model with Autoregressive Denoising

Astra:通用交互世界模型与自回归去噪

Yixuan Zhu, Jiaqi Feng, Wenzhao Zheng, Yuan Gao, Xin Tao, Pengfei Wan, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

AI总结 Astra提出了一种通用交互世界模型,通过自回归去噪和动作感知适配器实现长周期视频预测与多样化交互。

Comments Accepted in ICLR 2026. Code is available at: https://github.com/EternalEvan/Astra

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06652 2026-01-28 cs.LG cs.AI

Adaptive Test-Time Training for Predicting Need for Invasive Mechanical Ventilation in Multi-Center Cohorts

自适应测试时训练用于多中心队列中预测有创机械通气需求

Xiaolei Lu, Shamim Nemati

AI总结 本文提出自适应测试时训练框架,通过信息论界限和自监督学习提升多中心ICU中IMV预测的泛化性能和鲁棒性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18305 2026-01-28 cs.CV

DiVE-k: Differential Visual Reasoning for Fine-grained Image Recognition

DiVE-k:基于微细图像识别的差分视觉推理

Raja Kumar, Arka Sadhu, Ram Nevatia

机构 * University of Southern California(南加州大学) Meta

AI总结 DiVE-k通过利用模型自身top-k预测作为训练信号,提升细粒度图像识别的差分推理能力,显著优于现有方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11001 2026-01-28 cs.CL cs.AI

DND: Boosting Large Language Models with Dynamic Nested Depth

DND: 通过动态嵌套深度提升大语言模型

Tieyuan Chen, Xiaodong Chen, Haoxing Chen, Zhenzhong Lan, Weiyao Lin, Jianguo Li

机构 * Shanghai Jiao Tong University(上海交通大学) ZhongguanCun Academy(中关村学院) Renmin University of China(中国人民大学) Westlake University(西湖大学)

AI总结 DND通过动态嵌套深度机制提升大语言模型性能,通过路由和阈值控制策略优化令牌选择,显著提升密集和MoE模型表现。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03252 2026-01-28 cs.LG cs.AI cs.CV

Universal Multi-Domain Translation via Diffusion Routers

通用多领域翻译 via 扩散路由器

Duc Kieu, Kien Do, Tuan Hoang, Thao Minh Le, Tung Kieu, Dang Nguyen, Thin Nguyen

机构 * Applied Artificial Intelligence Initiative, Deakin University, Australia(德肯大学应用人工智能计划,澳大利亚) Pennsylvania State University, USA(宾夕法尼亚州立大学,美国) Aalborg University, Denmark(奥胡斯大学,丹麦)

AI总结 本文提出扩散路由器(DR)框架,通过中心域路由实现多领域翻译,实现通用多领域翻译任务,提升翻译效率与任务多样性。

Comments Accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22046 2026-01-28 cs.IR

GoalRank: Group-Relative Optimization for a Large Ranking Model

GoalRank: 为大规模排序模型的组相对优化

Kaike Zhang, Xiaobei Wang, Shuchang Liu, Hailan Yang, Xiang Li, Lantao Hu, Han Li, Qi Cao, Fei Sun, Kun Gai

AI总结 GoalRank提出一种仅生成器的单阶段排序框架,通过组相对方式利用奖励模型构建参考策略,有效提升大规模排序性能。

Comments to appear in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏