arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

共收录 9451
2608.12626 2026-08-14 cs.CL cs.AI cs.MA 新提交

LLMs Are Not Good Strategists, Yet Memory-Enhanced Agency Boosts Reasoning

大型语言模型(LLMs)并非优秀的战略家,然而记忆增强的智能体可提升推理能力

Yi Wu, Zhimin Hu

机构 * University of Chicago(芝加哥大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 该研究针对LLM在长时环境中战略推理的缺陷,提出EpicStar框架,结合跨回合记忆与动态门控机制,在星际争霸II测试中实现更高胜率且令牌消耗大幅减少。

Journal ref Published at Reasoning and Planning for LLMs at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12387 2026-08-14 cs.CL cs.AI 新提交

Query Timing Produces Opposite Positional Biases Between LLMs and Humans

查询时机在大型语言模型(LLMs)与人类之间产生相反的位置偏差

Jasin Cekinmez, Addison J. Wu, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学)

AI总结 该研究探究查询时机对LLMs和人类位置偏差的影响,发现二者存在差异,且新LLMs的位置偏差比前代更显著。

Comments Entropic Award (Top 3 Paper), ICBINB @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06854 2026-08-14 cs.CL 版本更新

SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks

SEMA: 简单却有效的多轮对抗攻击学习

Mingqian Feng, Xiaodong Liu, Weiwei Yang, Jialin Song, Xuekai Zhu, Chenliang Xu, Jianfeng Gao

AI总结 SEMA通过多阶段学习实现高效多轮对抗攻击,无需依赖现有策略,提升攻击成功率并增强安全测试能力。

Comments ICLR 2026, 37 pages, 13 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12062 2026-08-13 cs.CL cs.AI 新提交

Preference Tree Optimization: Enhancing Goal-Oriented Dialogue with Look-Ahead Simulations

偏好树优化:通过前瞻模拟增强面向目标的对话

Lior Baruch, Moshe Butman, Kfir Bar, Doron Friedman

机构 * Reichman University(赖希曼大学) School of Computer Science(计算机科学学院) School of Communications(传播学院)

AI总结 本研究提出偏好树优化(PTO)框架,结合带前瞻的偏好树与直接偏好优化(DPO),在动机访谈领域通过虚拟患者等模拟对话生成偏好数据,训练的对话智能体在关键指标上优于基线。

Comments 13 pages, 4 figures. Accepted at an ICLR 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04013 2026-08-13 cs.LG cond-mat.stat-mech hep-th math.PR stat.ML 版本更新

Weak Correlations as the Underlying Principle for Linearization of Gradient-Based Learning Systems

弱相关性作为基于梯度的学习系统线性化的底层原理

Ori Shem-Ur, Khen Cohen, Aviv Orly, Yaron Oz

AI总结 该研究以宽神经网络等深度学习模型为对象,揭示基于梯度下降的学习系统的线性化源于假设函数导数间的弱相关性,推导了随机梯度下降训练的线性偏离界,并提出了表征随机张量渐近行为的新方法。

Comments 41 pages; 10 pages main tex; 0 figures. Aviv Orly added new results requested by the ICLR reviewers after the discussion phase had ended

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10126 2026-08-12 cs.LG cs.AI cs.CL 新提交

Procedural Fairness Failures in RLHF from Preference Averaging

来自偏好平均的RLHF中的程序公平性失败

M P V S Gopinadh, Karthik Kamuju, Kummari Avinash, John Joshua, Srinivasa Raju Rudraraju

机构 * Vishnu Institute of Technology(维什努理工学院)

AI总结 该研究指出标准RLHF因偏好平均引发程序公平性失败,提出PA-RLHF分开优化不同偏好模式,提升了对齐准确率并缩小了群体公平差距,对大模型和智能体系统有重要意义。

Comments 4 pages, Accepted at the ICLR 2026 Workshop on Algorithmic Fairness Across Alignment Procedures and Agentic Systems (AFAA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23102 2026-08-12 cs.AI cs.CL 版本更新

Multiplayer Nash Preference Optimization

多玩家纳什偏好优化

Fang Wu, Xu Huang, Weihao Xuan, Zhiwei Zhang, Yijia Xiao, Guancheng Wan, Xiaomin Li, Bing Hu, Peng Xia, Jure Leskovec, Yejin Choi

机构 * Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院) The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所智能系统研究中心) Pennsylvania State University(宾夕法尼亚州立大学) University of California, Los Angeles(加州大学洛杉矶分校) Harvard University(哈佛大学) UNC–Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文提出多玩家纳什偏好优化框架,扩展了传统的两玩家纳什对齐方法,通过引入多玩家博弈机制,提升对复杂非传递性人类偏好的对齐能力,并在多个基准测试中表现更优。

Journal ref ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03922 2026-08-12 cs.CL cs.AI cs.CV 版本更新

HSSBench: Benchmarking Humanities and Social Sciences Ability for Multimodal Large Language Models

HSSBench: 多模态大语言模型在人文学与社会科学能力评估中的基准测试

Zhaolu Kang, Junhao Gong, Jiaxu Yan, Wanke Xia, Yian Wang, Ziwen Wang, Huaxuan Ding, Zhuo Cheng, Wenhao Cao, Zhiyuan Feng, Siqi He, Shannan Yan, Junzhe Chen, Xiaomin He, Chaoya Jiang, Wei Ye, Kaidong Yu, Xuelong Li

机构 * National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院) Tsinghua University(清华大学) Chinese Academy of Sciences(中国科学院) University of British Columbia(不列颠哥伦比亚大学) Renmin University of China(中国人民大学)

AI总结 HSSBench是一个专门评估多模态大语言模型在人文学与社会科学任务能力的基准测试,包含多语言样本,通过协作生成数据提升跨学科推理能力。

Comments ICLR 2026 (OpenReview: https://openreview.net/forum?id=iQsKotob31)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19245 2026-08-12 cs.AI cs.LG

Beyond In-Domain Detection: SpikeScore for Cross-Domain Hallucination Detection

超越领域检测:SpikeScore用于跨领域幻觉检测

Yongxin Deng, Zhen Fang, Sharon Li, Ling Chen

机构 * University of Technology Sydney(技术科技大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出SpikeScore方法,通过量化多轮对话中的不确定性波动,实现跨领域幻觉检测的高效识别与高泛化性能。

Journal ref In Proceedings of the Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23548 2026-08-12 cs.LG cs.AI

Disentanglement of Variations with Multimodal Generative Modeling

Yijie Zhang, Yiyang Shen, Weiran Wang

机构 * Department of Computer Science University of Iowa(计算机科学系 印第安纳大学)

Comments 22 pages, 14 figures, 7 tables

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07535 2026-08-11 cs.LG cs.AI cs.CY 新提交

Evolving Safety Landscape of Multi-modal Large Language Models: A Survey of Emerging Threats and Safeguards

多模态大语言模型的演进安全态势:新兴威胁与防护措施综述

Xi Li, Shu Zhao, Xiaohan Zou, Fei Zhao, Fuxiao Liu, Yusen Zhang, Cheng Han, Yushun Dong, Jiaqi Wang

机构 * University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) NVIDIA(英伟达公司) Penn State University(宾夕法尼亚州立大学) Columbia University(哥伦比亚大学) University of Missouri-Kansas City(密苏里大学堪萨斯分校) Florida State University(佛罗里达州立大学) Auburn University(奥本大学)

AI总结 本综述针对多模态大语言模型(MLLMs)的新型安全威胁,提出多模态安全威胁分类法,梳理安全策略进展,探讨未来安全机制的研究方向。

Comments Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15701 2026-08-11 cs.AI cs.CL cs.HC

Collaborative Gym: A Framework for Enabling and Evaluating Human-Agent Collaboration

协作健身房:一种促进和评估人机协作的框架

Yijia Shao, Vinay Samuel, Yucheng Jiang, John Yang, Diyi Yang

AI总结 Co-Gym框架通过模拟和真实环境支持人机协作研究,展示协作代理在任务性能上的优势,同时揭示当前语言模型的局限性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01353 2026-08-11 cs.AI cs.CV cs.LG 版本更新

EgoBrain: Synergizing Minds and Eyes For Human Action Understanding

EgoBrain:协同心智与视觉以实现人类行为理解

Nie Lin, Yansen Wang, Dongqi Han, Weibang Jiang, Jingyuan Li, Ryosuke Furuta, Yoichi Sato, Dongsheng Li

机构 * The University of Tokyo(东京大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 研究人员构建了全球首个同步脑电与第一人称视觉的大规模多模态数据集EgoBrain,开发多模态学习框架实现行为理解,跨参与者与环境验证达66.70%准确率,为脑机接口研究提供新范式。

Comments Accepted to ICLR 2026. Camera-ready version. Project page: https://lin-nie.github.io/EgoBrain/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21827 2026-08-10 cs.AI cs.HC 版本更新

Alignment has a Fantasia Problem

对齐存在幻想问题

Nathanael Jo, Zoe De Simone, Mitchell Gordon, Ashia Wilson

AI总结 该研究指出指令微调AI因不理解人类认知过程会产生幻想交互,剥夺用户任务自主权,进而提出需重新思考对齐研究,优化交互中认知责任分配并规划了相关研究议程。

Comments 10 pages, 2 figures

Journal ref ICLR 2026 Workshop HCAIR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12354 2026-08-10 cs.LG 版本更新

Reducing information dependency does not cause training data privacy. Adversarially non-robust features do

减少信息依赖不会导致训练数据隐私泄露。对抗性非鲁棒特征才会

Rasmus Torp, Shailen K. Smith, Adam Breuer

机构 * Dartmouth College(达特茅斯学院) Breuer Lab(布鲁尔实验室)

AI总结 挑战信息依赖导致训练数据隐私泄露的观点,通过三个结果揭示对抗性非鲁棒特征才是原因,引入反对抗训练建立因果关系并揭示隐私-鲁棒性权衡,修正对训练数据暴露的理解。

Comments In The Fourteenth International Conference on Learning Representations (ICLR'26), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27435 2026-08-10 cs.CL cs.AI 版本更新

Improving Attributed Long-form Question Answering with Intent Awareness

通过意图意识提升带有属性的长形式问答

Xinran Zhao, Aakanksha Naik, Jay DeYoung, Joseph Chee Chang, Jena D. Hwang, Tongshuang Wu, Varsha Kishore

机构 * Allen Institute for AI(艾伦人工智能研究所) Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学)

AI总结 本文提出通过增强模型意图意识来提升长报告生成质量,通过结构化标签方案提取隐含意图,改进零样本生成能力并生成高质量合成数据,实验显示在科学报告生成任务中模型性能平均提升2.9和12.3个百分点。

Comments 39 pages, 7 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05234 2026-08-10 cs.LG cs.CL

Faithful Bi-Directional Model Steering via Distribution Matching and Distributed Interchange Interventions

通过分布匹配和分布式互换干预实现忠实的双向模型引导

Yuntai Bao, Xuhong Zhang, Jintao Chen, Ge Su, Yuxiang Cai, Hao Peng, Bing Sun, Haiqin Weng, Liu Yan, Jianwei Yin

AI总结 本文提出Concept DAS (CDAS)方法,通过分布匹配和分布式互换干预实现模型引导,改进了传统方法的过拟合问题,提高了引导的准确性和稳定性。

Comments camera ready version; 55 pages, 25 figures; accepted for ICLR 2026

Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19399 2026-08-10 cs.LG 版本更新

Iterative Training of Physics-Informed Neural Networks with Fourier-enhanced Features

融合傅里叶增强特征的物理信息神经网络迭代训练

Yulun Wu, Miguel Aguiar, Karl H. Johansson, Matthieu Barreau

机构 * Division of Decision and Control Systems(决策与控制系统 division) Digital Futures(数字未来) KTH Royal Institute of Technology(皇家理工学院)

AI总结 针对PINNs训练的频谱偏差问题,提出IFeF-PINN算法,通过随机傅里叶特征丰富潜在空间,经理论证明与实验验证,该算法在经典基准问题上性能优于现有最优算法。

Comments Accepted at ICLR 2026. 27 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05969 2026-08-07 cs.CV cs.AI cs.CL

Imagine How To Change: Explicit Procedure Modeling for Change Captioning

想象如何改变:用于变化描述的显式过程建模

Jiayang Sun, Zixin Guo, Min Cao, Guibo Zhu, Jorma Laaksonen

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Department of Computer Science, Aalto University(阿alto大学计算机科学系) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 ProCap通过动态过程建模改进变化描述,利用关键帧和可学习查询提升描述准确性与效率。

Comments Accepted to ICLR 2026. Code and models are available at https://github.com/BlueberryOreo/ProCap

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24882 2026-08-07 cs.LG cond-mat.dis-nn cs.AI stat.ML 版本更新

Scaling Laws and Spectra of Shallow Neural Networks in the Feature Learning Regime

浅层神经网络在特征学习 regime 中的缩放定律与谱特性

Leonardo Defilippis, Yizhou Xu, Julius Girardin, Emanuele Troiani, Vittorio Erba, Lenka Zdeborová, Bruno Loureiro, Florent Krzakala

机构 * Departement d’Informatique, École Normale Supérieure, PSL & CNRS(信息学院,巴黎高等师范学院,PSL与CNRS) Statistical Physics of Computation Laboratory, École Polytechnique Fédérale de Lausanne (EPFL)(计算统计物理实验室,洛桑联邦理工学院(EPFL)) Information, Learning and Physics Laboratory, École Polytechnique Fédérale de Lausanne (EPFL)(信息、学习与物理实验室,洛桑联邦理工学院(EPFL))

AI总结 本文研究了浅层神经网络在特征学习 regime 中的缩放定律与谱特性,通过分析二次和对角神经网络的缩放规律,揭示了样本复杂度和权重衰减对过剩风险缩放指数的影响,并建立了这些 regime 与训练网络权重谱性质的精确联系。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14111 2026-08-07 cs.AI cs.DC cs.LG

CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning

CUDA-L1: 通过对比强化学习提升CUDA优化

Xiaoya Li, Albert Wang, Guoyin Wang, Jiwei Li, Chris Shum

机构 * DeepReinforce Team(深强化团队)

AI总结 CUDA-L1通过对比强化学习提升CUDA优化,实现显著加速并展示出优化策略的可移植性和有效性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07885 2026-08-06 cs.AI cs.LG 版本更新

MemFly: On-the-Fly Memory Optimization via Information Bottleneck

MemFly: 通过信息瓶颈实现飞地内存优化

Zhenyuan Zhang, Xianzhang Jia, Zhiqin Yang, Zhenbo Song, Wei Xue, Sirui Han, Yike Guo

机构 * The Hong Kong University of Science(香港科学与技术大学) Nanjing University of Science(南京理工大学)

AI总结 MemFly通过信息瓶颈原理实现LLM的飞地内存优化,采用梯度自由优化器和混合检索机制提升内存效率和多跳查询能力。

Comments Accepted by ICLR 2026 MemAgents Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08633 2026-08-06 cs.CV cs.AI cs.GR cs.LG cs.MM

Time-to-Move: Training-Free Motion Controlled Video Generation via Dual-Clock Denoising

Assaf Singer, Noam Rotstein, Amir Mann, Ron Kimmel, Or Litany

机构 * Technion – Israel Institute of Technology(技术ion – 以色列理工学院) NVIDIA(NVIDIA公司)

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17049 2026-08-06 cs.LG math.OC

Verifying Properties of Binary Neural Networks Using Sparse Polynomial Optimization

Jianting Yang, Srećko Ðurašinović, Jean-Bernard Lasserre, Victor Magron, Jun Zhao

Comments 25 pages, 2 figures, 8 tables

Journal ref ICLR 2025 (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17568 2026-08-05 cs.CV

PAGE-4D: Disentangled pose and geometry estimation for vggt-4d perception

PAGE-4D: 通过解耦姿态与几何估计实现VGGT-4D感知

Kaichen Zhou, Yuhan Wang, Grace Chen, Xinhai Chang, Gaspard Beaudouin, Fangneng Zhan, Paul Pu Liang, Mengyu Wang

机构 * Harvard AI and Robotics Lab, Harvard University(哈佛人工智能与机器人实验室,哈佛大学) Media Lab and Electrical Engineering and Computer Science, Massachusetts Institute of Technology(媒体实验室和电气工程与计算机科学,麻省理工学院) Department of Computing, Imperial College London(计算系,帝国理工学院) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究学院)

AI总结 提出PAGE-4D,扩展VGGT到动态场景,通过动态感知聚合器解耦静态与动态信息,同时提升相机姿态估计、深度预测和点云重建性能。

Comments ICLR 2026, VGGT-4D, Dynamic VGGT

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21012 2026-08-05 cs.LG cs.AI cs.CL 版本更新

Mechanism of Task-oriented Information Removal in In-context Learning

面向任务的信息移除机制在上下文学习中的机制

Hakaze Cho, Haolin Yang, Gouki Minegishi, Naoya Inoue

AI总结 本文研究了上下文学习中信息移除机制,发现通过低秩滤波器选择性移除冗余信息可提升任务性能,并识别出关键的去噪头。

Comments 87 pages, 90 figures, 7 tables, ICLR 2026 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02066 2026-08-05 cs.CV

CLERF: Contrastive LEaRning for Full Range Head Pose Estimation

Ting-Ruen Wei, Haowei Liu, Huei-Chung Hu, Xuyang Wu, Yi Fang, Hsin-Tai Wu

Journal ref ICLR 2026 Workshop GRaM Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02455 2026-08-04 cs.LG stat.ML 新提交

Aggregate-then-Calibrate for Human-centered Assessment with Theoretical Guarantees

面向以人为中心评估的聚合后校准方法(AtC)及理论保证

Zejun Xie, Xintong Li, Guang Wang, Desheng Zhang

AI总结 该研究针对以人为中心评估的两难问题,提出AtC两阶段框架,结合人类判断与模型分数,兼具理论保证,在半合成及真实数据集上提升了评估的准确性与鲁棒性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01734 2026-08-04 cs.LG 新提交

LLM-Guided Retrieval for Prediction of Molecular Perturbation Responses

大语言模型引导的检索用于分子扰动响应预测

Betty Xiong, Jan-Christian Huetter, Gabriele Scalia, Tommaso Biancalani, Sepideh Maleki

机构 * Stanford University(斯坦福大学) Genentech(基因泰克)

AI总结 本研究提出LLM引导的检索方法,在Tahoe-100M数据集上优于多个基线,可提升分子扰动预测的方向准确率,是零样本分子扰动预测的关键驱动因素。

Comments Published at MLGenX @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01160 2026-08-04 cs.LG cs.SI 新提交

Differentiable Lifting for Topological Neural Networks

拓扑神经网络的可微提升

Jorge Luiz Franco, Gabriel Duarte, Alexander Nikitin, Moacir Ponti, Diego Mesquita, Amauri H. Souza

机构 * University of São Paulo(圣保罗大学) Instituto Curvelo(库尔韦洛研究所) Federal Institute of Ceará(塞阿拉联邦学院) Aalto University(阿尔托大学) Getulio Vargas Foundation(热图利奥·瓦加斯基金会)

AI总结 针对拓扑神经网络(TNNs)图提升操作先验识别的缺陷,提出可微提升框架DiffLift,实验显示其在多基准分类任务上优于现有方法,最高提升45%。

Comments Published as a conference paper at ICLR 2026 (OpenReview: https://openreview.net/forum?id=eC89CbINIw). 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏