arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-28 至 2026-05-28 共收录 110 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 22 篇

2604.00913 2026-05-28 cs.CV cs.CL 83%

Benchmarking and Mechanistic Analysis of Vision-Language Models for Cross-Depiction Assembly Instruction Alignment

跨描绘装配指令对齐的视觉-语言模型基准测试与机制分析

Zhuchenyang Liu, Yao Zhang, Yu Xiao

机构 * Aalto University(阿alto大学)

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 构建IKEA-Bench基准,评估19个视觉-语言模型在装配图与视频帧对齐任务上的表现,发现视觉编码是提升跨描绘鲁棒性的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27678 2026-05-28 cs.LG cs.DC 79%

Heterogeneous Parallelism for Multimodal Large Language Model Training

多模态大语言模型训练的异构并行

Yashaswi Karnati, Kamran Jafari, Akash Mehra, Li Ding, Pranav Prashant Thombre, Ali Roshan Ghias, Shifang Xu, Parth Mannan, Yu Yao, Hao Wu, Eric Harper, Ashwath Aithal, Nima Tajbakhsh

机构 * NVIDIA

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.LG

AI总结 针对多模态大语言模型训练中单一LLM中心并行布局导致的吞吐量瓶颈,提出异构并行抽象,允许各模块独立布局和放置,并通过边界通信器实现张量语义保持,实验表明可提升TFLOPS/GPU最高49.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12824 2026-05-28 cs.IR cs.CV cs.LG 79%

NanoVDR: Distilling a 2B Vision-Language Retriever into a 70M Text-Only Encoder for Visual Document Retrieval

NanoVDR:将20亿参数的视觉语言检索器蒸馏为7000万参数的纯文本编码器用于视觉文档检索

Zhuchenyang Liu, Yao Zhang, Yu Xiao

机构 * Aalto University(阿alto大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 利用查询-文档不对称性,通过蒸馏将20亿参数的视觉语言模型教师蒸馏为7000万参数的纯文本学生编码器,采用点态余弦对齐目标,实现视觉文档检索的高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27900 2026-05-28 cs.CV 77%

Decoupled Training with Local Reinforcement Fine-Tuning in Federated Learning

联邦学习中解耦训练与局部强化微调

Yuting Ma, Lechao Cheng, Xiaohua Xu

机构 * School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出FedDTL框架,通过解耦图像和文本编码器训练并引入两阶段局部微调(监督微调+强化学习),解决联邦学习中客户端间优化不一致和客户端内过专门化问题,平衡全局任务适应性与泛化能力。

Comments This work has been accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27737 2026-05-28 cs.CV 77%

Bounded-Compute Multimodal Regression for Product-Rating Prediction

有界计算多模态回归用于产品评分预测

William Leach, Ru He, Sizhuo Ma, Yizhen Jia, Min Cao, Jian Wang, Rick Cao

机构 * Snap Inc.

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 针对严格延迟预算下的标量回归任务,提出一种有界计算适配方法,通过替换语言模型头为轻量MLP并固定输入,在LoViF 2026挑战赛中实现高效多模态回归。

Comments Accepted to the LoViF Workshop at CVPR 2026. 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28229 2026-05-28 cs.CV cs.AI 73%

VidPrism: Heterogeneous Mixture of Experts for Image-to-Video Transfer

VidPrism: 用于图像到视频迁移的异构混合专家模型

Rui Lin, Chuanming Wang, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出VidPrism,一种异构时间混合专家框架,通过功能专业化专家、内容感知多速率采样和动态双向融合机制,解决传统MoE中专家同质化问题,在视频识别基准上达到最先进性能。

Comments CVPR2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01990 2026-05-28 cs.LG cs.AI 73%

SAME: Stabilized Mixture-of-Experts for Multimodal Continual Instruction Tuning

SAME: 用于多模态持续指令调优的稳定混合专家模型

Zhen-Hao Xie, Jun-Tao Tang, Yu-Cheng Shi, Han-Jia Ye, De-Chuan Zhan, Da-Wei Zhou

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院)

专题命中 VLM训练与架构 :grounding(abstract);multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 针对多模态持续指令调优中专家路由漂移和专家漂移问题,提出稳定混合专家模型(SAME),通过正交子空间分解路由动态和曲率感知缩放更新专家,实现无重放的状态最优性能。

Comments Accepted to ICML 2026. Code is available at https://github.com/LAMDA-CL/Prism

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28820 2026-05-28 cs.CV 70%

From Pixels to Words -- Towards Native One-Vision Models at Scale

从像素到文字——迈向原生单视觉大规模模型

Haiwen Diao, Jiahao Wang, Penghao Wu, Yuhao Dong, Yuwei Niu, Yue Zhu, Zhongang Cai, Weichen Fan, Linjun Dai, Silei Wu, Xuanyu Zheng, Mingxuan Li, Yuanhan Zhang, Bo Li, Hanming Deng, Huchuan Lu, Quan Wang, Lei Yang, Lewei Lu, Dahua Lin, Ziwei Liu

机构 * S-Lab, NTU(S实验室,国立科技大学) SenseTime Research(商汤科技研究院) DLUT(大连理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 本文提出NEO-ov原生基础模型,通过端到端学习跨帧和像素-文字对应,无需外部编码器或适配器,在细粒度视觉感知上缩小了与模块化模型的差距,验证了原生单视觉架构的可行性和竞争力。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28230 2026-05-28 cs.CV 70%

Proprio: Latent Self-Scoring and Inference-Time Refinement for Physically Plausible Video Generation

Proprio: 用于物理合理视频生成的潜在自评分与推理时精炼

Mariam Hassan, Kaouther Messaoud, Wuyang Li, Alexandre Alahi

机构 * École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Télécom Paris(巴黎电信学院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出Proprio,一种无需训练框架,通过分析模型在潜在扰动下的流残差作为自评分信号,结合最佳N搜索和梯度自精炼,提升冻结视频生成器输出的物理合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27800 2026-05-28 cs.CV 70%

CuriosAI Submission to the CASTLE Challenge at EgoVis 2026

CuriosAI 在 EgoVis 2026 CASTLE 挑战赛中的提交

Yuto Kanda, Hayato Tanoue, Takayuki Hori

机构 * SoftBank Corp(软银公司)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对600多小时多视角自我中心视频的185道选择题,提出SVA(搜索-验证-回答)三阶段流水线和TMKG(时间多模态知识图谱)两种方法,SVA达到0.50准确率并作为最终提交。

Comments The 4th place solution for the CASTLE Challenge at the CVPR EgoVis Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19358 2026-05-28 cs.CE 67%

RoofNet: A Global Multimodal Dataset for Roof Material Identification from Earth Observation

RoofNet: 用于地球观测屋顶材料识别的全球多模态数据集

Benjamin Tarver, Noelle Law, Sasha Getz, Yuki Miura

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

AI总结 针对建筑屋顶材料数据缺失问题,提出RoofNet数据集,包含101个国家49,662个建筑实例的14类屋顶材料标签,结合多模态标注流程和微调方法,将零样本分类准确率从4.9%提升至47.7%,并展示了材料感知数据对灾害风险评估的影响。

Comments v3: Restructured manuscript with updated framing, added hazard case study, clarified data release/licensing, and refined main text and appendix for clarity

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01247 2026-05-28 cs.CV cs.AI cs.LG 67%

Beyond Interpretability: When, Why, and How Sparse Autoencoders Enable Label-Free Visual Steering

超越可解释性:稀疏自编码器何时、为何以及如何实现无标签视觉引导

Gerasimos Chatzoudis, Zhuowei Li, Gemma E. Moran, Hao Wang, Dimitris N. Metaxas

机构 * Department of Computer Science, Rutgers University(罗格斯大学计算机科学系) Department of Statistics, Rutgers University(罗格斯大学统计系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出无标签视觉稀疏引导方法VS2,通过训练稀疏自编码器并利用其重构误差和稀疏特征放大来引导冻结的视觉语言模型,在九个图像分类数据集上提升零样本准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27927 2026-05-28 cs.CV cs.LG 62%

Structure-Guided Visual Perturbation Neutralization for LVLMs

结构引导的视觉扰动中和用于大型视觉语言模型

Yuanhe Zhang, Xueting Wang, YanBin Ren, Haoran Gao, Xinhan Zheng, Zhenhong Zhou, Fanyu Meng, Li Sun, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Science and Technology of China(中国科学技术大学) JIUTIAN Research(JIUTIAN研究所) Nanyang Technological University(南洋理工大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV、cs.LG

AI总结 提出结构诱导引导中和(SIGN)框架,通过先验结构提取和动态引导中和实现轻量级、即插即用的对抗性防御,在仅0.5%像素修改和0.16秒每图下达到87%以上防御成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28231 2026-05-28 cs.RO cs.LG 57%

ProgVLA: Progress-Aware Robot Manipulation Skill Learning

ProgVLA:进度感知的机器人操作技能学习

Seungsu Kim, Jinyoung Choi, Seungmin Baek, Jean-Michel Renders

机构 * NAVER LABS(NAVER实验室) NAVER LABS Europe(NAVER实验室欧洲)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 提出ProgVLA,一种紧凑的视觉-语言-动作模型,通过显式表示任务进度和两阶段Perceiver重采样机制,在有限计算和内存下实现长序列多模态处理,并在多任务操作基准上达到或超越大模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28167 2026-05-28 cs.CV 57%

DebFilter: Eradicating Biases Stashed in Value

DebFilter: 消除隐藏在值中的偏见

Seung Hyuk Lee, Songkuk Kim

机构 * School of Integrated Technology, BK21 Graduate Program in Intelligent Semiconductor Technology(整合技术学院,智能半导体技术BK21研究生项目)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 提出DebFilter,一种轻量级、无需训练的方法,通过调整交叉注意力中的值分量来纠正文本到图像扩散模型中的社会偏见,实现推理时偏差缓解。

Comments 8 pages, 7 figures, supplementary material included, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28000 2026-05-28 cs.SE cs.AI 57%

Tool Forge: A Validation-Carrying Toolchain for Governed Agentic Execution

Tool Forge:一种用于受控代理执行的携带验证的工具链

Swanand Rao

机构 * Next Moca Global, Inc.(Next Moca全球公司)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出 Tool Forge,一种将自然语言能力意图转换为经过验证、沙盒验证、编目工具制品,并通过令牌高效路由层暴露给代理的工具链,解决了代理执行中工具层缺乏治理和验证的问题。

Comments 9 pages, 2 figures, 3 tables. Code: https://github.com/nextmoca/tool-forge

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 4 篇

2605.27449 2026-05-28 cs.IR cs.AI 77%

Checking Fact with Better Retrieval: Dynamic Contrastive Learning for Evidence Retrieval

用更好的检索核查事实:用于证据检索的动态对比学习

Zhongtian Hua, Yi Luo, Meijia Yu, Yingjie Han

机构 * Zhengzhou University(郑州大学) Henan University of Science and Technology(河南科技大学)

专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 提出动态自适应对比学习方法DACLR,通过事件级特征提取、两阶段检索和动态对比损失优化,提升多模态证据检索的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10714 2026-05-28 cs.CV cs.GR 57%

Alterbute: Editing Intrinsic Attributes of Objects in Images

Alterbute: 编辑图像中物体的内在属性

Tal Reiss, Daniel Winter, Matan Cohen, Alex Rav-Acha, Yael Pritch, Ariel Shamir, Yedid Hoshen

机构 * Google(谷歌) The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Reichman University(雷赫曼大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 提出Alterbute方法,通过扩散模型结合松弛训练目标和视觉命名实体,在保持物体身份和场景上下文的同时编辑颜色、纹理、材质和形状等内在属性。

Comments ICML 2026. Project page is available at https://talreiss.github.io/alterbute/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00814 2026-05-28 cs.CV 57%

IRPO: Boosting Image Restoration via Post-training GRPO

IRPO:通过后训练GRPO提升图像恢复

Haoxuan Xu, Yi Liu, Tianfu Li, Ruolin Shen, Boyuan Jiang, Jinlong Peng, Donghao Luo, Xiaobin Hu, Shuicheng Yan, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学) Technical University of Munich(慕尼黑技术大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) National University of Singapore(新加坡国立大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 提出IRPO框架,利用GRPO后训练优化确定性恢复模型,通过数据筛选和复合奖励建模,在域内和域外任务上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27918 2026-05-28 cs.DC 50%

Addressing Variable Heterogeneity in Distributed Multimodal Training with Entrain

解决分布式多模态训练中的变量异构性问题:Entrain

Insu Jang, Mosharaf Chowdhury

专题命中 其他VLM :MLLM(abstract)

AI总结 提出Entrain框架,通过宏观批次的静态模型并行配置和层次化微批次分配算法,解决多模态大语言模型训练中的数据异构性和变量波动,提升吞吐量达1.40倍。

详情

展开后加载摘要…

URL PDF HTML 收藏