arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

共收录 9454
2510.13454 2026-03-06 cs.CV

Text-to-3D by Stitching a Multi-view Reconstruction Network to a Video Generator

通过将多视角重建网络缝合到视频生成器中实现文本到3D

Hyojun Go, Dominik Narnhofer, Goutam Bhat, Prune Truong, Federico Tombari, Konrad Schindler

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌)

AI总结 VIST3A通过将多视角重建网络缝合到视频生成器中,实现文本到3D生成,提升3D场景生成质量。

Comments ICLR 2026 (Oral), Project page: https://gohyojun15.github.io/VIST3A/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07093 2026-03-06 cs.LG stat.ML

Non-Asymptotic Analysis of Efficiency in Conformalized Regression

非渐近分析的符合化回归效率

Yunzhen Yao, Lie He, Michael Gastpar

AI总结 本文研究了符合化回归的非渐近效率界,通过SGD训练分位数和中位数回归,建立了预测集长度与理想区间的偏差界,揭示了不同误覆盖水平下的收敛率相变。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02282 2026-03-06 cs.CV cs.LG

VidGuard-R1: AI-Generated Video Detection and Explanation via Reasoning MLLMs and RL

VidGuard-R1: 通过推理MLLMs和RL进行AI生成视频检测与解释

Kyoungjun Park, Yifan Yang, Juheon Yi, Shicheng Zheng, Yifei Shen, Dongqi Han, Caihua Shan, Muhammad Muaz, Lili Qiu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Microsoft Research(微软研究院)

AI总结 VidGuard-R1通过推理MLLMs和强化学习,实现AI生成视频的高准确检测与可解释性分析。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24335 2026-03-06 cs.CV cs.LG

Hyperspherical Latents Improve Continuous-Token Autoregressive Generation

超球面潜在变量改进连续令牌自回归生成

Guolin Ke, Hui Xue

机构 * DP Technology(DP技术公司) Microsoft Research(微软研究院)

AI总结 SphereAR通过超球面约束解决自回归生成中的方差崩溃问题,在ImageNet生成中达到新的SOTA,超越了扩散和掩码生成模型。

Comments ICLR version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24210 2026-03-06 cs.CL cs.AI cs.LG

BeyondBench: Contamination-Resistant Evaluation of Reasoning in Language Models

超越基准:语言模型推理能力的抗污染评估

Gaurav Srivastava, Aafiya Hussain, Zhenyu Bi, Swastik Roy, Priya Pitre, Meng Lu, Morteza Ziyadi, Xuan Wang

AI总结 BeyondBench通过算法问题生成提供抗污染的推理评估,揭示语言模型在复杂任务中的推理缺陷。

Comments Accepted to ICLR 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23589 2026-03-06 cs.AI cs.CV cs.LG

BridgeDrive: Diffusion Bridge Policy for Closed-Loop Trajectory Planning in Autonomous Driving

BridgeDrive: 基于扩散桥的闭环轨迹规划扩散策略

Shu Liu, Wenlin Chen, Weihao Li, Zheng Wang, Lijin Yang, Jianing Huang, Yipin Zhang, Zhongzhan Huang, Ze Cheng, Hao Yang

机构 * Bosch (China) Investment Ltd(博世(中国)投资有限公司)

AI总结 BridgeDrive提出一种基于锚点的扩散桥策略,通过实时闭环轨迹规划提升自动驾驶的安全性和效率。

Comments Accepted for publication at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11950 2026-03-06 cs.LG

TabStruct: Measuring Structural Fidelity of Tabular Data

TabStruct: 表格数据结构忠实性度量

Xiangjian Jiang, Nikola Simidjievski, Mateja Jamnik

机构 * Department of Computer Science and Technology, University of Cambridge(计算机科学与技术系,剑桥大学) Télécom Paris, Institut Polytechnique de Paris(巴黎理工 Télécom Paris)

AI总结 TabStruct提出了一种新的评估框架,结合结构忠实性和传统评估维度,引入全局效用度量,提供对13个表格生成器的全面评估。

Comments Accepted by the Fourteenth International Conference on Learning Representations (ICLR 2026 Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09264 2026-03-06 cs.LG cs.AI eess.IV

Overtone: Cyclic Patch Modulation for Clean, Efficient, and Flexible Physics Emulators

泛音:用于清洁、高效和灵活物理模拟器的循环补丁调制

Payel Mukhopadhyay, Michael McCabe, Ruben Ohana, Miles Cranmer

机构 * University of Cambridge(剑桥大学) Flatiron Institute(Flatiron研究所) Polymathic AI(多维人工智能)

AI总结 Overtone通过动态补丁大小控制,在保持精度的同时提升计算效率,适用于复杂物理模拟场景。

Comments 48 pages, 24 Figures. For code, see https://github.com/payelmuk150/patch-modulator

Journal ref Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07999 2026-03-06 cs.CV cs.AI cs.CL

Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodology

可追溯证据增强的视觉 grounded 推理:评估与方法论

Haochen Wang, Xiangtai Li, Zilong Huang, Anran Wang, Jiacong Wang, Tao Zhang, Jiani Zheng, Sule Bai, Zijian Kang, Jiashi Feng, Zhuochen Wang, Zhaoxiang Zhang

机构 * New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所模式识别新实验室,多模态人工智能系统国家重点实验室,中国科学院)

AI总结 TreeVGR 通过强化学习提升视觉 grounded 推理,实现更准确的定位与可解释的推理路径,验证了可追溯性对提升视觉推理能力的关键作用。

Comments ICLR 2026 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23508 2026-03-06 cs.CL cs.AI

Why Reinforcement Fine-Tuning Enables MLLMs Preserve Prior Knowledge Better: A Data Perspective

为何强化微调能更好地使大语言模型保留先验知识:从数据角度出发

Zhihao Zhang, Qiaole Dong, Qi Zhang, Jun Zhao, Enyu Zhou, Zhiheng Xi, Senjie Jin, Xiaoran Fan, Yuhao Zhou, Mingqi Wu, Yanwei Fu, Tao Ji, Tao Gui, Xuanjing Huang, Kai Chen

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)

AI总结 本文通过数据视角揭示强化微调(RFT)相较于监督微调(SFT)在保留大语言模型先验知识方面的优势,发现RFT通过强化正确样本与基模型对齐,有效减少对先验知识的干扰。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09984 2026-03-06 cs.CV cs.AI cs.SD

InterActHuman: Multi-Concept Human Animation with Layout-Aligned Audio Conditions

InterActHuman: 多概念人类动画与布局对齐的音频条件

Zhenzhi Wang, Jiaqi Yang, Jianwen Jiang, Chao Liang, Gaojie Lin, Zerong Zheng, Ceyuan Yang, Yuan Zhang, Mingyuan Gao, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance(字节跳动)

AI总结 InterActHuman通过引入布局对齐的音频条件,实现多概念人类动画,支持多身份的精确控制与高质量视频生成。

Comments ICLR 2026 Camera Ready Version. TL;DR: The first multi-person dialogue video generation method from pairs of reference image and audio via explicit layout-aligned condition injection. Project page https://zhenzhiwang.github.io/interacthuman/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08762 2026-03-06 q-fin.ST cs.CE cs.CL cs.LG

EDINET-Bench: Evaluating LLMs on Complex Financial Tasks using Japanese Financial Statements

EDINET-Bench:利用日本财务报表评估大语言模型在复杂财务任务中的表现

Issa Sugiura, Takashi Ishida, Taro Makino, Chieko Tazuke, Takanori Nakagawa, Kosuke Nakago, David Ha

机构 * Sakana AI Kyoto University(京都大学)

AI总结 EDINET-Bench通过日本财务报表评估大语言模型在复杂财务任务中的表现,揭示其在会计欺诈检测、盈利预测等任务中仍面临挑战,需更真实的模拟和推理支持。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23648 2026-03-06 cs.LG

Continuous Chain of Thought Enables Parallel Exploration and Reasoning

连续思维链实现并行探索与推理

Halil Alperen Gozeten, M. Emrullah Ildiz, Xuechen Zhang, Hrayr Harutyunyan, Ankit Singh Rawat, Samet Oymak

机构 * University of Michigan - Ann Arbor(密歇根大学安娜堡分校) Google Research NYC(谷歌纽约研究)

AI总结 本文提出CoT2连续思维链方法,通过并行探索与推理提升模型性能,解决组合子集和问题并优化推理效率。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19255 2026-03-06 cs.LG cs.AI

VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use

VTool-R1: 通过在多模态工具使用上的强化学习使VLMs学会通过图像思考

Mingyuan Wu, Jingcheng Yang, Jize Jiang, Meitang Li, Kaizhuo Yan, Hanchao Yu, Minjia Zhang, Chengxiang Zhai, Klara Nahrstedt

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan Ann Arbor(密歇根大学安娜堡分校) Independent Researcher(独立研究者)

AI总结 VTool-R1通过强化学习训练视觉语言模型生成多模态思考链,提升其通过图像进行推理的能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03621 2026-03-06 cs.CV

PhysLLM: Harnessing Large Language Models for Cross-Modal Remote Physiological Sensing

PhysLLM:利用大语言模型进行跨模态远程生理传感

Yiping Xie, Bo Zhao, Mingtong Dai, Jian-Ping Zhou, Yue Sun, Tao Tan, Weicheng Xie, Linlin Shen, Zitong Yu

机构 * Shenzhen University(深圳大学) Great Bay University(大鹏大学) National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息技术重点实验室) Guangdong Medical University(广东医科大学) Southern Medical University (Dongguan People’s Hospital)(南方医科大学(东莞人民医院)) Macao Polytechnic University(澳门理工学院)

AI总结 PhysLLM通过结合大语言模型与领域特定的rPPG组件,利用跨模态学习提升远程生理传感的准确性和鲁棒性。

Comments Accepted by International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04409 2026-03-06 cs.CL cs.AI cs.HC

Unpacking Human Preference for LLMs: Demographically Aware Evaluation with the HUMAINE Framework

解析人类对大语言模型的偏好:基于HUMAINE框架的民主意识评估

Nora Petrova, Andrew Gordon, Enzo Blindow

AI总结 HUMAINE框架通过多维、人口统计学意识的评估方法,揭示了人类对大语言模型的偏好差异,发现年龄是主要分歧轴,且不同评估维度的判别能力差异显著。

Comments Published as a conference paper at ICLR 2026. 21 pages, 11 figures. https://openreview.net/forum?id=kVaE2kYjtV

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04356 2026-03-05 cs.RO cs.AI cs.LG

RoboCasa365: A Large-Scale Simulation Framework for Training and Benchmarking Generalist Robots

RoboCasa365:一种大规模仿真框架,用于训练和评估通用机器人

Soroush Nasiriany, Sepehr Nasiriany, Abhiram Maddukuri, Yuke Zhu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) NVIDIA Research(NVIDIA研究)

AI总结 RoboCasa365通过大规模仿真框架提供多样化任务和环境,用于训练和评估通用机器人,分析任务多样性、数据集规模和环境变化对泛化的影响。

Comments ICLR 2026; First three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04238 2026-03-05 cs.CL

Retrieval or Representation? Reassessing Benchmark Gaps in Multilingual and Visually Rich RAG

检索还是表示?重新评估多语言和视觉丰富的RAG基准差距

Martin Asenov, Kenza Benkirane, Dan Goldwater, Aneiss Ghodsi

机构 * Parexel AI Labs(Parexel AI实验室)

AI总结 该研究通过系统分析发现,文档表示质量是多语言和视觉丰富RAG基准提升的主要因素,而非检索方法改进。

Comments ICLR 2026 Workshop I Can't Believe It's Not Better: Where Large Language Models Need to Improve

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04117 2026-03-05 cs.LG

When to restart? Exploring escalating restarts on convergence

何时重新启动?探索逐步增加的重新启动

Ayush K. Varshney, Šarūnas Girdzijauskas, Konstantinos Vandikas, Aneta Vulgarakis Feljan

机构 * Ericsson Research, Ericsson AB, Sweden(爱立信研究, 爱立信公司, 瑞典) KTH Royal Institute of Technology, Stockholm, Sweden(皇家理工学院) RISE Research Institutes of Sweden, Stockholm, Sweden(瑞典RISE研究机构)

AI总结 本文提出SGD-ER方法,通过逐步增加学习率来提升深度学习模型的收敛性能和测试准确率。

Comments Paper accepted in Sci4DL workshop in ICLR 2026. https://openreview.net/forum?id=18Yf2KKIn0

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03973 2026-03-05 cs.LG cs.CV

Dual-Solver: A Generalized ODE Solver for Diffusion Models with Dual Prediction

Dual-Solver: 一种用于扩散模型的通用微分方程求解器,具有双预测功能

Soochul Park, Yeon Ju Lee

机构 * SteAI MODULABS Korea University(韩国大学)

AI总结 Dual-Solver通过可学习参数泛化多步采样器,提高扩散模型在低NFE下的生成质量。

Comments Published as a conference paper at ICLR 2026. 36 pages, 18 figures

Journal ref Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03825 2026-03-05 cs.CV cs.AI

From Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoning

从窄视场到全景视觉:基于注意力的冷启动重塑多模态推理

Ruilin Luo, Chufan Shi, Yizhen Zhang, Cheng Yang, Songtao Jiang, Tongkun Guan, Ruizhe Chen, Ruihang Chu, Peng Wang, Mingkun Yang, Yujiu Yang, Junyang Lin, Zhibo Yang

机构 * Tsinghua University(清华大学) University of South California(南加州大学) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) University of California San Diego(南加州大学圣地亚哥分校) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出AVAR框架,通过视觉锚定与注意力引导提升多模态推理性能,实现7%的平均提升。

Comments ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03796 2026-03-05 cs.LG cs.AI cs.CV

When and Where to Reset Matters for Long-Term Test-Time Adaptation

长期测试时适应中何时何地重置的问题

Taejun Lim, Joong-Won Hwang, Kibok Lee

机构 * Yonsei University(延世大学) ETRI(韩国电子技术研究院)

AI总结 本文提出了一种自适应选择性重置方案和重要性感知正则化器,以解决长期测试时适应中的模型崩溃问题,并通过实验验证了其有效性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03725 2026-03-05 cs.LG cs.AI

Why Do Unlearnable Examples Work: A Novel Perspective of Mutual Information

为何不可学习的例子有效:互信息的新视角

Yifan Zhu, Yibo Miao, Yinpeng Dong, Xiao-Shan Gao

机构 * State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, Chinese Academy of Sciences(数学科学国家重点实验室,数学与系统科学研究院,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) College of AI, Tsinghua University(清华大学人工智能学院) Shanghai Qi Zhi Institute(上海启智研究院)

AI总结 本文提出了一种基于互信息减少的不可学习方法,通过减少类内特征协方差来有效阻碍深度学习模型的泛化能力。

Comments 32 pages, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00810 2026-03-05 cs.LG cs.NE

Soft Quality-Diversity Optimization

软质量-多样性优化

Saeed Hedayatian, Stefanos Nikolaidis

机构 * University of Southern California(南加州大学) Archimedes AI(阿基米德人工智能)

AI总结 本文提出软QD框架,通过避免离散化解决QD优化问题,推出SQUAD算法在高维问题中具有更好的可扩展性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08417 2026-03-05 cs.LG cs.CV

NeuCLIP: Efficient Large-Scale CLIP Training with Neural Normalizer Optimization

NeuCLIP: 通过神经归一化优化实现高效的大型CLIP训练

Xiyuan Wei, Chih-Jen Lin, Tianbao Yang

机构 * Texas A&M University(德克萨斯大学) National Taiwan University(台湾国立大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 NeuCLIP通过神经归一化优化提升CLIP模型训练效率与性能

Comments Accepted to 40th International Conference on Learning Representations. 32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26840 2026-03-05 cs.DB cs.AI cs.FL cs.LO

SpotIt: Evaluating Text-to-SQL Evaluation with Formal Verification

SpotIt: 通过形式验证评估文本到SQL

Rocky Klopfenstein, Yang He, Andrew Tremante, Yuepeng Wang, Nina Narodytska, Haoze Wu

机构 * Amherst College(阿姆赫斯特学院) Simon Fraser University(西蒙弗雷泽大学) VMware Research by Broadcom(VMware由Broadcom进行的研究)

AI总结 SpotIt通过形式验证评估文本到SQL系统,发现基于测试的方法无法区分生成查询与地面真相的差异。

Comments Accepted at ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26303 2026-03-05 cs.LG cs.AI math.OC stat.ML

Implicit Bias of Per-sample Adam on Separable Data: Departure from the Full-batch Regime

隐式偏置:逐样本Adam在可分离数据上的表现:偏离全批量模式

Beomhan Baek, Minhak Song, Chulhee Yun

机构 * Seoul National University(首尔国立大学) KAIST(韩国科学技术院)

AI总结 本研究揭示增量Adam在可分离数据上的隐式偏置偏离全批量行为,而Signum则保持不变。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17509 2026-03-05 cs.CL

Annotation-Efficient Universal Honesty Alignment

标注高效通用诚实对齐

Shiyu Ni, Keping Bi, Jiafeng Guo, Minghao Tang, Jingtong Wu, Zengxin Han, Xueqi Cheng

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 EliCal通过两阶段框架实现高效标注的通用诚实对齐,仅需少量正确性标注即可达到接近最优的对齐效果。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08580 2026-03-05 cs.SD cs.AI eess.AS

LadderSym: A Multimodal Interleaved Transformer for Music Practice Error Detection

LadderSym: 一种用于音乐练习错误检测的多模态交错Transformer

Benjamin Shiue-Hal Chou, Purvish Jajal, Nick John Eliopoulos, James C. Davis, George K. Thiruvathukal, Kristen Yeon-Ji Yun, Yung-Hsiang Lu

机构 * Purdue University(普渡大学) Loyola University Chicago(芝加哥洛约拉大学)

AI总结 LadderSym通过双流编码器和多模态策略提升音乐练习错误检测的F1分数,显著提高遗漏和额外音符的识别准确率。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05091 2026-03-05 cs.CV

Factuality Matters: When Image Generation and Editing Meet Structured Visuals

事实性至关重要:当图像生成与编辑遇见结构化视觉

Le Zhuo, Songhao Han, Yuandong Pu, Boxiang Qiu, Sayak Paul, Yue Liao, Yihao Liu, Jie Shao, Xi Chen, Si Liu, Hongsheng Li

机构 * CUHK MMLab(香港大学多模态实验室) Beihang University(北京航空航天大学) Krea AI(Krea人工智能) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) Hugging Face National University of Singapore(新加坡国立大学) ByteDance(字节跳动) The University of Hong Kong(香港大学)

AI总结 本文提出了一种统一模型,通过整合视觉语言模型和FLUX.1 Kontext,提升结构化视觉生成与编辑的多模态理解与事实准确性。

Comments Accepted by ICLR 2026, Project page: https://structvisuals.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏