arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

2026-03-20 至 2026-03-20 共收录 19
2603.19233 2026-03-20 cs.RO

Not All Features Are Created Equal: A Mechanistic Study of Vision-Language-Action Models

并非所有特征都具有同等价值:一种视觉-语言-动作模型的机制研究

Bryce Grant, Xijia Zhao, Peng Wang

机构 * Case Western Reserve University(凯斯西储大学)

AI总结 研究通过激活注入、稀疏自编码器和线性探针分析视觉-语言-动作模型,发现视觉路径主导动作生成,语言敏感性取决于任务结构而非模型设计,且专家路径编码运动程序,VLM路径编码目标语义,释放Action Atlas供探索。

Comments Accepted to Multimodal Intelligence Workshop @ ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18891 2026-03-20 cs.CV cs.LG

PromptHub: Enhancing Multi-Prompt Visual In-Context Learning with Locality-Aware Fusion, Concentration and Alignment

PromptHub: 通过局部感知融合、集中和对齐增强多提示视觉上下文学习

Tianci Luo, Jinpeng Wang, Shiyu Qin, Niu Lian, Yan Feng, Bin Chen, Chun Yuan, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校) Meituan, Beijing(美团,北京)

AI总结 PromptHub通过局部感知融合、集中和对齐方法提升多提示视觉上下文学习性能,验证了其在多种视觉任务中的优越性及泛化能力。

Comments Accepted to ICLR 2026. 17 pages, 11 figures, and 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09731 2026-03-20 cs.LG

FlowCast: Advancing Precipitation Nowcasting with Conditional Flow Matching

FlowCast:通过条件流匹配推进降水现在cast

Bernardo Perrone Ribeiro, Jana Faganeli Pucer

机构 * University of Ljubljana(卢布尔雅那大学)

AI总结 本文提出FlowCast,一种基于条件流匹配的端到端概率模型,用于降水现在cast,解决了大气动力学不确定性与高维数据建模效率问题,实现了高效准确的预测。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17238 2026-03-20 cs.CL

StreamingThinker: Large Language Models Can Think While Reading

StreamingThinker: 大语言模型在阅读时可以思考

Junlong Tong, Yingqi Fan, Anhao Zhao, Yunpu Ma, Xiaoyu Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究院) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Institute of Digital Twin(宁波空间智能与数字衍生关键实验室,数字孪生研究院) Hong Kong Polytechnic University(香港理工大学) Munich Center for Machine Learning, LMU(慕尼黑机器学习中心,莱茵-慕尼黑大学)

AI总结 本文提出StreamingThinker框架,使大语言模型在阅读过程中实现流式思考,通过流式CoT生成、流式约束训练和并行推理提升效率,减少延迟并保持性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11173 2026-03-20 cs.CV cs.MM

CoPRS: Learning Positional Prior from Chain-of-Thought for Reasoning Segmentation

CoPRS:从链式思维中学习位置先验以进行推理分割

Zhenyu Lu, Liupeng Li, Jinpeng Wang, Yan Feng, Bin Chen, Ke Chen, Yaowei Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Meituan, Beijing(北京美团) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出CoPRS模型,通过多模态链式思维生成可解释的位置先验热图,提升推理分割的可解释性和精度,实验表明其在多个数据集上表现优异。

Comments Accepted to ICLR 2026. 20 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00671 2026-03-20 cs.IR cs.CL

Milco: Learned Sparse Retrieval Across Languages via a Multilingual Connector

Milco:通过多语言连接器实现跨语言学习稀疏检索

Thong Nguyen, Yibin Lei, Jia-Huei Ju, Eugene Yang, Andrew Yates

机构 * University of Amsterdam(阿姆斯特丹大学) Johns Hopkins University, HLTCOE(约翰霍普金斯大学,语言学与认知科学系)

AI总结 Milco通过多语言连接器将不同语言的查询和文档映射到共享的英语词汇空间,采用两阶段训练策略提升表示透明性和有效性,实现跨语言稀疏检索的最优性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22925 2026-03-20 cs.CV cs.AI cs.LG

Soft-Di[M]O: Improving One-Step Discrete Image Generation with Soft Embeddings

Soft-Di[M]O: 通过软嵌入提升一步离散图像生成

Yuanzhi Zhu, Xi Wang, Stéphane Lathuilière, Vicky Kalogeiton

机构 * LIX, École Polytechnique, CNRS, IPP(IX实验室,巴黎高等理工学院,法国国家科学研究中心,IPP) Inria at Univ. Grenoble Alpes, CNRS, LJK(里尔大学,法国国家科学研究中心,LJK)

AI总结 本文提出Soft-Di[M]O框架,通过引入软嵌入解决一步生成器中离散token阻断梯度的问题,实现端到端训练并支持GAN精炼、可微奖励微调和TTEO。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08416 2026-03-20 stat.ML cs.LG

Multifidelity Simulation-based Inference for Computationally Expensive Simulators

多保真度模拟基于推断:用于计算昂贵模拟器的推断

Anastasia N. Krouglova, Hayden R. Johnson, Basile Confavreux, Michael Deistler, Pedro J. Gonçalves

机构 * Department of Computer Science, KU Leuven(KU莱文大学计算机科学系) VIB Center for AI and Computational Biology (VIB.AI)(VIB人工智能与计算生物学中心) VIB-KU Leuven Center for Neuroscience(VIB-KU莱文神经科学中心) Gatsby Computational Neuroscience Unit, UCL(Gatsby计算神经科学单元,UCL) Machine Learning in Science, University of Tübingen(科学机器学习,图宾根大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Biological Intelligence, Martinsried(生物智能马克斯·普朗克研究所,马尔茨里德) Department of Electrical Engineering, KU Leuven(KU莱文电子工程系)

AI总结 本文提出了一种多保真度方法,利用迁移学习高效推断高保真度模拟器参数,通过序列变体提升模拟效率,在基准和神经科学任务中减少高保真度模拟次数达两个数量级。

Comments Accepted at ICLR 2026. Available at OpenReview: https://openreview.net/pdf?id=bj0dcKp9t6

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09465 2026-03-20 cs.CV

OFTSR: One-Step Flow for Image Super-Resolution with Tunable Fidelity-Realism Trade-offs

OFTSR: 一种用于图像超分辨率的一步流方法,具有可调保真度-现实感权衡

Yuanzhi Zhu, Ruiqing Wang, Shilin Lu, Junnan Li, Hanshu Yan, Kai Zhang

机构 * Nanjing University(南京大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出OFTSR,一种基于流的图像超分辨率框架,通过可调保真度与现实感权衡实现一步生成。通过训练条件流模型并应用特殊约束,使学生模型预测与教师模型采样轨迹对齐,从而提升性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08531 2026-03-20 cs.LG math.OC stat.ML

Revisiting the Last-Iterate Convergence of Stochastic Gradient Methods

重新审视随机梯度方法的最后迭代收敛性

Zijian Liu, Zhengyuan Zhou

机构 * Stern School of Business, New York University(纽约大学斯特恩商学院)

AI总结 本文研究随机梯度方法的最后迭代收敛性,提出统一证明方法,适用于一般领域、复合目标、非欧几里得范数、Lipschitz条件、光滑性和强凸性,并扩展到重尾和亚Weibull噪声。

Comments The preliminary version has been accepted at ICLR 2024. For the update history, please refer to the PDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18571 2026-03-20 cs.AI cs.CE q-bio.QM

CAPSUL: A Comprehensive Human Protein Benchmark for Subcellular Localization

CAPSUL:一个全面的人类蛋白质基准用于亚细胞定位

Yicheng Hu, Xinyu Lin, Shulin Li, Wenjie Wang, Fengbin Zhu, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

AI总结 CAPSUL基准通过整合多样化3D结构表示和精细亚细胞定位注释,推动结构基模型在亚细胞定位任务中的应用,展示了结构特征的重要性,并通过高尔基体案例研究揭示了α-螺旋在定位中的关键作用。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18426 2026-03-20 cs.AI

Prune-then-Quantize or Quantize-then-Prune? Understanding the Impact of Compression Order in Joint Model Compression

先剪枝后量化还是先量化后剪枝?理解联合模型压缩中压缩顺序的影响

Minjun Kim, Jaehyeon Choi, Hyunwoo Yang, Jongjin Kim, Jinho Song, U Kang

机构 * Seoul National University(首尔国立大学)

AI总结 本文研究了联合模型压缩中压缩顺序对性能的影响,提出渐进强度假说并提供理论和实验验证,证明顺序优化能提升模型效率。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18423 2026-03-20 cs.CV

SynQ: Accurate Zero-shot Quantization by Synthesis-aware Fine-tuning

SynQ:通过合成感知微调实现准确的零样本量化

Minjun Kim, Jongjin Kim, U Kang

机构 * Seoul National University(首尔国立大学)

AI总结 SynQ通过合成感知微调解决零样本量化中合成数据噪声、目标模式预测和错误标签误导问题,提升模型精度。

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18258 2026-03-20 cs.LG cs.AI

Sharpness-Aware Minimization in Logit Space Efficiently Enhances Direct Preference Optimization

在对数空间中进行锐度感知最小化以高效提升直接偏好优化

Haocheng Luo, Zehang Deng, Thanh-Toan Do, Mehrtash Harandi, Dinh Phung, Trung Le

机构 * Monash University(墨尔本大学) Swinburne University of Technology(斯威本科技大学)

AI总结 本文提出logits-SAM方法,通过在对数空间中建模坐标动态,缓解直接偏好优化中的挤压效应,提升模型性能。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18017 2026-03-20 cs.LG cs.CL

Frayed RoPE and Long Inputs: A Geometric Perspective

断裂的RoPE与长输入:一种几何视角

Davis Wertheimer, Aozhong Zhang, Derrick Liu, Penghang Yin, Naigang Wang

机构 * IBM Research(IBM研究院) University at Albany, SUNY(纽约州立大学阿尔巴尼分校)

AI总结 本文从几何角度分析RoPE在长输入下的问题,发现注意力机制导致键和查询向量紧密聚类,而RoPE在长输入时破坏这种聚类,产生病态行为。提出RoPE-ID方法通过高频率应用部分通道解决此问题。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00053 2026-03-20 cs.LG cs.AI stat.ML

Quadratic Direct Forecast for Training Multi-Step Time-Series Forecast Models

二次直接预报用于训练多步时间序列预测模型

Hao Wang, Licheng Pan, Yuan Lu, Zhichao Chen, Tianqiao Liu, Shuting He, Zhixuan Chu, Qingsong Wen, Haoxuan Li, Zhouchen Lin

机构 * Xiaohongshu Inc.(小红书公司) State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(人工智能国家重点实验室,北京大学智能科学与技术学院) College of Engineering, Purdue University(普渡大学工程学院) School of Computing and Artificial Intelligence, Shanghai University of Finance and Economics(上海财经大学计算机与人工智能学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Squirrel AI Center for Data Science, Peking University(北京大学数据科学中心) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Pazhou Laboratory (Huangpu), Guangzhou, Guangdong, China(琶洲实验室(黄埔),广州,广东,中国)

AI总结 本文提出二次加权训练目标,解决多步时间序列预测中标签自相关和任务权重不均的问题,通过Quadratic Direct Forecast算法提升模型性能。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08882 2026-03-20 cs.LG

An Improved Model-Free Decision-Estimation Coefficient with Applications in Adversarial MDPs

一种改进的无模型决策-估计系数及其在对抗性MDPs中的应用

Haolin Liu, Chen-Yu Wei, Julian Zimmert

机构 * University of Virginia(弗吉尼亚大学) Google Research(谷歌研究)

AI总结 本文提出Dig-DEC,一种无模型的决策-估计系数,通过信息增益驱动探索,解决了对抗性MDP中的再生问题,并改进了函数估计过程的性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02460 2026-03-20 cs.CV

GenCompositor: Generative Video Compositing with Diffusion Transformer

GenCompositor:基于扩散变换器的生成视频合成

Shuzhou Yang, Xiaoyu Li, Xiaodong Cun, Guangzhi Wang, Lingen Li, Ying Shan, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省超高清沉浸媒体技术重点实验室) GVC Lab, Great Bay University(Great Bay大学GVC实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出GenCompositor,通过扩散变换器实现自动化视频合成,解决传统方法劳动强度大、成本高的问题,提出轻量背景保存分支、动态元素融合块和ERoPE位置嵌入等创新方法,构建VideoComp数据集并验证方法有效性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21475 2026-03-20 cs.AI

MMSearch-Plus: Benchmarking Provenance-Aware Search for Multimodal Browsing Agents

MMSearch-Plus:面向多模态浏览代理的溯源感知基准测试

Xijia Tao, Yihua Teng, Xinxing Su, Xinyu Fu, Jihao Wu, Chaofan Tao, Ziru Liu, Haoli Bai, Rui Liu, Lingpeng Kong

机构 * The University of Hong Kong (HKU)(香港大学) Huawei Inc(华为公司)

AI总结 MMSearch-Plus是一个包含311个任务的基准测试,通过迭代图像-文本检索和交叉验证在噪声下强制多模态理解,提供模型无关的代理框架和集中标记模块,提升多步推理的鲁棒性。

Comments Project Page: https://mmsearch-plus.github.io

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏