arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

2026-03-06 至 2026-03-06 共收录 55
2601.10482 2026-03-06 q-bio.NC

Convex Efficient Coding

凸高效编码

William Dorrell, Peter E. Latham, James Whittington

AI总结 本文提出了一种可 tractable 但灵活的规范性表征理论,通过优化表征相似性证明了一类凸优化问题,包括线性和非线性神经网络及半非负矩阵分解等,为神经编码提供了新的理论框架。

Comments 37 pages, 4 figures

Journal ref Proceedings of the 14th International Conference on Learning Representations, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21323 2026-03-06 cs.CL cs.LG

Parallel Token Prediction for Language Models

语言模型中的并行令牌预测

Felix Draxler, Justus Will, Farrin Marouf Sofian, Theofanis Karaletsos, Sameer Singh, Stephan Mandt

机构 * Department of Computer Science, University of California, Irvine(加州大学伊维特分校计算机科学系) Chan-Zuckerberg Initiative(张博士基金会) Pyramidal AI(金字塔人工智能) Computer Science & AI in Science Institute, University of California, Irvine(加州大学伊维特分校计算机科学与科学人工智能研究所)

AI总结 提出并行令牌预测框架,通过引入随机输入变量实现多令牌联合预测,提升语言模型解码效率。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13872 2026-03-06 cs.LG

Measuring Uncertainty Calibration

测量不确定性校准

Kamil Ciosek, Nicolò Felicioni, Sina Ghiassian, Juan Elenter Litwin, Francesco Tonolini, David Gustafsson, Eva Garcia-Martin, Carmen Barcena Gonzalez, Raphaëlle Bertrand-Lalo

机构 * Spotify

AI总结 本文提出了一种非渐近的校准误差上界方法,通过修改分类器以高效限制校准误差,同时保持性能,适用于实际数据集。

Comments ICLR 2026, 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06690 2026-03-06 cs.CL

Think-While-Generating: On-the-Fly Reasoning for Personalized Long-Form Generation

在生成过程中思考:面向个性化长文本生成的即兴推理

Chengbing Wang, Yang Zhang, Wenjie Wang, Xiaoyan Zhao, Fuli Feng, Xiangnan He, Tat-Seng Chua

机构 * University of Science and Technology of China(科学技术大学) National University of Singapore(国立新加坡大学) The Chinese University of Hong Kong(香港中文大学) National Engineering Laboratory for BITA, University of Science and Technology of China(BITA国家工程实验室,科学技术大学)

AI总结 FlyThinker通过在生成过程中进行动态推理,提升个性化长文本生成的效率和效果。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01266 2026-03-06 cs.CV cs.LG

MotionStream: Real-Time Video Generation with Interactive Motion Controls

MotionStream: 通过交互式运动控制实现实时视频生成

Joonghyuk Shin, Zhengqi Li, Richard Zhang, Jun-Yan Zhu, Jaesik Park, Eli Shechtman, Xun Huang

机构 * Seoul National University(首尔国立大学) Adobe Research(Adobe研究) Carnegie Mellon University(卡内基梅隆大学) Morpheus AI

AI总结 MotionStream通过交互式运动控制实现实时视频生成,利用因果注意力机制和蒸馏技术,实现亚秒延迟和高效率的无限长视频流式生成。

Comments ICLR 2026, Project webpage: https://joonghyuk.com/motionstream-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22758 2026-03-06 cs.CL

EchoMind: An Interrelated Multi-level Benchmark for Evaluating Empathetic Speech Language Models

EchoMind: 一种相互关联的多级基准,用于评估共情语音语言模型

Li Zhou, Lutong Yu, You Lyu, Yihang Lin, Zefeng Zhao, Junyi Ao, Yuhao Zhang, Benyou Wang, Haizhou Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Research Institute of Big Data(深圳大数据研究院) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 EchoMind是一种多级基准,用于评估SLMs在共情对话中的能力,揭示了现有模型在处理高表现性语音线索方面的不足。

Comments Speech Language Models, Spoken Language Understanding, Vocal Cue Perception, Empathetic Dialogue, Benchmark Evaluation; Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18876 2026-03-06 cs.CV cs.AI cs.CL

Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs

抓取任意区域:迈向多模态大语言模型的精确、上下文像素理解

Haochen Wang, Yuhao Wang, Tao Zhang, Yikang Zhou, Yanwei Li, Jiacong Wang, Jiani Zheng, Ye Tian, Jiahao Meng, Zilong Huang, Guangcan Mai, Anran Wang, Yunhai Tong, Zhuochen Wang, Xiangtai Li, Zhaoxiang Zhang

机构 * New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室、多模态人工智能系统国家重点实验室、自动化研究所、中国科学院(CASIA)) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) Wuhan University(武汉大学) ByteDance(字节跳动)

AI总结 GAR通过RoI对齐特征重放技术实现多区域精准理解与复杂推理,提升多模态大语言模型的上下文感知能力。

Comments ICLR 2026 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16714 2026-03-06 cs.CV cs.AI

SceneCOT: Eliciting Grounded Chain-of-Thought Reasoning in 3D Scenes

SceneCOT: 在3D场景中引导链式推理

Xiongkun Linghu, Jiangyong Huang, Ziyu Zhu, Baoxiong Jia, Siyuan Huang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 本文提出SCENECOT框架,通过分解复杂任务并构建视觉线索,首次在3D场景中实现 grounded 链式推理,提升场景理解的推理能力。

Comments Accepted by ICLR 2026. Project page: https://scenecot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13900 2026-03-06 cs.CL cs.AI

Narrow Finetuning Leaves Clearly Readable Traces in Activation Differences

细粒度微调在激活差异中留下明显可读的痕迹

Julian Minder, Clément Dumas, Stewart Slocum, Helena Casademunt, Cameron Holmes, Robert West, Neel Nanda

机构 * EPFL(苏黎世联邦理工学院) Ecole Normale Supérieure Paris-Saclay(巴黎-萨克雷高等师范学校) Université Paris-Saclay(巴黎-萨克雷大学) Harvard University(哈佛大学) MATS

AI总结 研究发现狭窄微调会在激活中留下明显痕迹,揭示了微调领域偏见,并警告了使用此类模型进行广泛微调研究的局限性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13454 2026-03-06 cs.CV

Text-to-3D by Stitching a Multi-view Reconstruction Network to a Video Generator

通过将多视角重建网络缝合到视频生成器中实现文本到3D

Hyojun Go, Dominik Narnhofer, Goutam Bhat, Prune Truong, Federico Tombari, Konrad Schindler

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌)

AI总结 VIST3A通过将多视角重建网络缝合到视频生成器中,实现文本到3D生成,提升3D场景生成质量。

Comments ICLR 2026 (Oral), Project page: https://gohyojun15.github.io/VIST3A/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07093 2026-03-06 cs.LG stat.ML

Non-Asymptotic Analysis of Efficiency in Conformalized Regression

非渐近分析的符合化回归效率

Yunzhen Yao, Lie He, Michael Gastpar

AI总结 本文研究了符合化回归的非渐近效率界,通过SGD训练分位数和中位数回归,建立了预测集长度与理想区间的偏差界,揭示了不同误覆盖水平下的收敛率相变。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02282 2026-03-06 cs.CV cs.LG

VidGuard-R1: AI-Generated Video Detection and Explanation via Reasoning MLLMs and RL

VidGuard-R1: 通过推理MLLMs和RL进行AI生成视频检测与解释

Kyoungjun Park, Yifan Yang, Juheon Yi, Shicheng Zheng, Yifei Shen, Dongqi Han, Caihua Shan, Muhammad Muaz, Lili Qiu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Microsoft Research(微软研究院)

AI总结 VidGuard-R1通过推理MLLMs和强化学习,实现AI生成视频的高准确检测与可解释性分析。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24335 2026-03-06 cs.CV cs.LG

Hyperspherical Latents Improve Continuous-Token Autoregressive Generation

超球面潜在变量改进连续令牌自回归生成

Guolin Ke, Hui Xue

机构 * DP Technology(DP技术公司) Microsoft Research(微软研究院)

AI总结 SphereAR通过超球面约束解决自回归生成中的方差崩溃问题,在ImageNet生成中达到新的SOTA,超越了扩散和掩码生成模型。

Comments ICLR version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24210 2026-03-06 cs.CL cs.AI cs.LG

BeyondBench: Contamination-Resistant Evaluation of Reasoning in Language Models

超越基准:语言模型推理能力的抗污染评估

Gaurav Srivastava, Aafiya Hussain, Zhenyu Bi, Swastik Roy, Priya Pitre, Meng Lu, Morteza Ziyadi, Xuan Wang

AI总结 BeyondBench通过算法问题生成提供抗污染的推理评估,揭示语言模型在复杂任务中的推理缺陷。

Comments Accepted to ICLR 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23589 2026-03-06 cs.AI cs.CV cs.LG

BridgeDrive: Diffusion Bridge Policy for Closed-Loop Trajectory Planning in Autonomous Driving

BridgeDrive: 基于扩散桥的闭环轨迹规划扩散策略

Shu Liu, Wenlin Chen, Weihao Li, Zheng Wang, Lijin Yang, Jianing Huang, Yipin Zhang, Zhongzhan Huang, Ze Cheng, Hao Yang

机构 * Bosch (China) Investment Ltd(博世(中国)投资有限公司)

AI总结 BridgeDrive提出一种基于锚点的扩散桥策略,通过实时闭环轨迹规划提升自动驾驶的安全性和效率。

Comments Accepted for publication at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11950 2026-03-06 cs.LG

TabStruct: Measuring Structural Fidelity of Tabular Data

TabStruct: 表格数据结构忠实性度量

Xiangjian Jiang, Nikola Simidjievski, Mateja Jamnik

机构 * Department of Computer Science and Technology, University of Cambridge(计算机科学与技术系,剑桥大学) Télécom Paris, Institut Polytechnique de Paris(巴黎理工 Télécom Paris)

AI总结 TabStruct提出了一种新的评估框架,结合结构忠实性和传统评估维度,引入全局效用度量,提供对13个表格生成器的全面评估。

Comments Accepted by the Fourteenth International Conference on Learning Representations (ICLR 2026 Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09264 2026-03-06 cs.LG cs.AI eess.IV

Overtone: Cyclic Patch Modulation for Clean, Efficient, and Flexible Physics Emulators

泛音:用于清洁、高效和灵活物理模拟器的循环补丁调制

Payel Mukhopadhyay, Michael McCabe, Ruben Ohana, Miles Cranmer

机构 * University of Cambridge(剑桥大学) Flatiron Institute(Flatiron研究所) Polymathic AI(多维人工智能)

AI总结 Overtone通过动态补丁大小控制,在保持精度的同时提升计算效率,适用于复杂物理模拟场景。

Comments 48 pages, 24 Figures. For code, see https://github.com/payelmuk150/patch-modulator

Journal ref Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07999 2026-03-06 cs.CV cs.AI cs.CL

Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodology

可追溯证据增强的视觉 grounded 推理:评估与方法论

Haochen Wang, Xiangtai Li, Zilong Huang, Anran Wang, Jiacong Wang, Tao Zhang, Jiani Zheng, Sule Bai, Zijian Kang, Jiashi Feng, Zhuochen Wang, Zhaoxiang Zhang

机构 * New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所模式识别新实验室,多模态人工智能系统国家重点实验室,中国科学院)

AI总结 TreeVGR 通过强化学习提升视觉 grounded 推理,实现更准确的定位与可解释的推理路径,验证了可追溯性对提升视觉推理能力的关键作用。

Comments ICLR 2026 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23508 2026-03-06 cs.CL cs.AI

Why Reinforcement Fine-Tuning Enables MLLMs Preserve Prior Knowledge Better: A Data Perspective

为何强化微调能更好地使大语言模型保留先验知识:从数据角度出发

Zhihao Zhang, Qiaole Dong, Qi Zhang, Jun Zhao, Enyu Zhou, Zhiheng Xi, Senjie Jin, Xiaoran Fan, Yuhao Zhou, Mingqi Wu, Yanwei Fu, Tao Ji, Tao Gui, Xuanjing Huang, Kai Chen

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)

AI总结 本文通过数据视角揭示强化微调(RFT)相较于监督微调(SFT)在保留大语言模型先验知识方面的优势,发现RFT通过强化正确样本与基模型对齐,有效减少对先验知识的干扰。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09984 2026-03-06 cs.CV cs.AI cs.SD

InterActHuman: Multi-Concept Human Animation with Layout-Aligned Audio Conditions

InterActHuman: 多概念人类动画与布局对齐的音频条件

Zhenzhi Wang, Jiaqi Yang, Jianwen Jiang, Chao Liang, Gaojie Lin, Zerong Zheng, Ceyuan Yang, Yuan Zhang, Mingyuan Gao, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance(字节跳动)

AI总结 InterActHuman通过引入布局对齐的音频条件,实现多概念人类动画,支持多身份的精确控制与高质量视频生成。

Comments ICLR 2026 Camera Ready Version. TL;DR: The first multi-person dialogue video generation method from pairs of reference image and audio via explicit layout-aligned condition injection. Project page https://zhenzhiwang.github.io/interacthuman/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08762 2026-03-06 q-fin.ST cs.CE cs.CL cs.LG

EDINET-Bench: Evaluating LLMs on Complex Financial Tasks using Japanese Financial Statements

EDINET-Bench:利用日本财务报表评估大语言模型在复杂财务任务中的表现

Issa Sugiura, Takashi Ishida, Taro Makino, Chieko Tazuke, Takanori Nakagawa, Kosuke Nakago, David Ha

机构 * Sakana AI Kyoto University(京都大学)

AI总结 EDINET-Bench通过日本财务报表评估大语言模型在复杂财务任务中的表现,揭示其在会计欺诈检测、盈利预测等任务中仍面临挑战,需更真实的模拟和推理支持。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23648 2026-03-06 cs.LG

Continuous Chain of Thought Enables Parallel Exploration and Reasoning

连续思维链实现并行探索与推理

Halil Alperen Gozeten, M. Emrullah Ildiz, Xuechen Zhang, Hrayr Harutyunyan, Ankit Singh Rawat, Samet Oymak

机构 * University of Michigan - Ann Arbor(密歇根大学安娜堡分校) Google Research NYC(谷歌纽约研究)

AI总结 本文提出CoT2连续思维链方法,通过并行探索与推理提升模型性能,解决组合子集和问题并优化推理效率。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19255 2026-03-06 cs.LG cs.AI

VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use

VTool-R1: 通过在多模态工具使用上的强化学习使VLMs学会通过图像思考

Mingyuan Wu, Jingcheng Yang, Jize Jiang, Meitang Li, Kaizhuo Yan, Hanchao Yu, Minjia Zhang, Chengxiang Zhai, Klara Nahrstedt

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan Ann Arbor(密歇根大学安娜堡分校) Independent Researcher(独立研究者)

AI总结 VTool-R1通过强化学习训练视觉语言模型生成多模态思考链,提升其通过图像进行推理的能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03621 2026-03-06 cs.CV

PhysLLM: Harnessing Large Language Models for Cross-Modal Remote Physiological Sensing

PhysLLM:利用大语言模型进行跨模态远程生理传感

Yiping Xie, Bo Zhao, Mingtong Dai, Jian-Ping Zhou, Yue Sun, Tao Tan, Weicheng Xie, Linlin Shen, Zitong Yu

机构 * Shenzhen University(深圳大学) Great Bay University(大鹏大学) National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息技术重点实验室) Guangdong Medical University(广东医科大学) Southern Medical University (Dongguan People’s Hospital)(南方医科大学(东莞人民医院)) Macao Polytechnic University(澳门理工学院)

AI总结 PhysLLM通过结合大语言模型与领域特定的rPPG组件,利用跨模态学习提升远程生理传感的准确性和鲁棒性。

Comments Accepted by International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04409 2026-03-06 cs.CL cs.AI cs.HC

Unpacking Human Preference for LLMs: Demographically Aware Evaluation with the HUMAINE Framework

解析人类对大语言模型的偏好:基于HUMAINE框架的民主意识评估

Nora Petrova, Andrew Gordon, Enzo Blindow

AI总结 HUMAINE框架通过多维、人口统计学意识的评估方法,揭示了人类对大语言模型的偏好差异,发现年龄是主要分歧轴,且不同评估维度的判别能力差异显著。

Comments Published as a conference paper at ICLR 2026. 21 pages, 11 figures. https://openreview.net/forum?id=kVaE2kYjtV

详情

展开后加载摘要…

URL PDF HTML 收藏