arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-10 至 2026-06-10 共收录 15 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 2 篇

2604.23443 2026-06-10 cs.CL 版本更新 78%

Revisiting Greedy Decoding for Visual Question Answering: A Calibration Perspective

重新审视视觉问答中的贪婪解码:一种校准视角

Boqi Chen, Xudong Liu, Yunke Ao, Jianing Qiu

机构 * ETH Zurich(苏黎世联邦理工学院) University of Toronto(多伦多大学) MBZUAI(穆桑比克人工智能研究所)

专题命中 视觉问答 :visual question answering(title,abstract)

AI总结 针对视觉问答任务,从校准角度理论证明贪婪解码优于随机采样,并提出适用于推理模型的贪婪解码方法,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04514 2026-06-10 cs.AI cs.CE cs.CL cs.CV stat.ME 版本更新 73%

ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering

ChartAgent: 一种用于复杂图表问答中视觉基础推理的多模态智能体

Rachneet Kaur, Nishan Srishankar, Zhen Zeng, Sumitra Ganesh, Manuela Veloso

机构 * J.P. Morgan AI Research(摩根大通人工智能研究)

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 提出ChartAgent框架,通过迭代分解查询为视觉子任务并利用图表专用视觉工具(如绘制注释、裁剪区域)进行空间域推理,在ChartBench和ChartX上取得最先进性能,尤其对无标注图表提升显著。

Comments Accepted at ACL 2026 (Main Conference). Also presented as an oral paper at the NeurIPS 2025 Multimodal Algorithmic Reasoning Workshop (https://marworkshop.github.io/neurips25/)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 3 篇

2512.11995 2026-06-10 cs.CV cs.AI cs.LG 版本更新 87%

V-REX: Benchmarking Exploratory Visual Reasoning via Chain-of-Questions

V-REX: 通过问题链进行探索性视觉推理的基准测试

Chenrui Fan, Yijun Liang, Shweta Bhardwaj, Kwesi Cobbina, Ming Li, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学学院市分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 提出V-REX基准,通过问题链将多步探索推理分解为规划和遵循能力,评估视觉语言模型在复杂开放任务中的表现。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23183 2026-06-10 cs.IR cs.AI 版本更新 57%

Reasoning over Semantic IDs Enhances Generative Recommendation

基于语义ID的推理增强生成式推荐

Yingzhi He, Yan Sun, Junfei Tan, Yuxin Chen, Xiaoyu Kong, Chunxu Shen, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) Tencent Inc.(腾讯公司)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 提出SIDReasoner两阶段框架,通过增强语义ID与语言的对齐和结果驱动的强化优化,实现无需大量推理标注的有效推理,提升生成式推荐的准确性、可解释性和跨领域泛化能力。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25371 2026-06-10 cs.RO 版本更新 50%

FOUND-IT: Foundation-model-first Task-driven 3D Scene Graphs with Granularity on Demand

FOUND-IT: 基于基础模型优先、按需粒度的任务驱动3D场景图

Dominic Maggio, Nicolas Gorlo, Kris Hauser, Luca Carlone

机构 * Laboratory for Information & Decision Systems, Massachusetts Institute of Technology(信息与决策系统实验室,麻省理工学院) Samsung Research America(三星美国研究院)

专题命中 视觉推理 :grounding(abstract)

AI总结 提出首个基于未标定单目相机实时构建任意室内外环境分层任务驱动3D场景图的方法,通过几何基础模型和可调整粒度支持动态任务,并在ASHiTA SG3D基准上提升79%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 3 篇

2605.07415 2026-06-10 cs.CV cs.CL 版本更新 79%

ChartREG++: Towards Benchmarking and Improving Chart Referring Expression Grounding under Diverse referring clues and Multi-Target Referring

ChartREG++:面向多样化指代线索和多目标指代的图表指代表达式定位基准与改进

Tianhao Niu, Ziyu Han, Xuan Dong, Qingfu Zhu, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 针对现有图表指代表达式定位基准的局限,提出支持多种定位形式、多目标指代、多样化线索和图表类型的基准,并利用代码驱动合成流水线生成像素级实例掩码,训练实例分割模型集成到多模态定位框架,显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06234 2026-06-10 cs.RO cs.HC 版本更新 50%

RobotEQ: Transitioning from Passive Intelligence to Active Intelligence in Embodied AI

RobotEQ:从被动智能到主动智能的具身AI过渡

Kuofei Fang, Xinyi Che, Haomin Ouyang, Shufan Zhang, Xuehao Wang, Qi Liu, Liyi Liu, Chenqi Zhang, Wenxi Cai, Wenyu Dai, Jinyang Wu, Fan Zhang, Haoyu Chen, Bin He, Zheng Lian

机构 * State Key Laboratory of Autonomous Intelligent Unmanned Systems, Tongji University(自主智能无人系统国家重点实验室,同济大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) CMVS, University of Oulu(奥卢大学CMVS)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出RobotEQ基准,评估模型在具身场景中理解并遵守社会规范的能力,实验表明现有模型在主动智能上仍有不足,利用RAG技术可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18765 2026-06-10 cs.RO 版本更新 50%

Goal-oriented Communication for Fast and Robust Robotic Fault Detection and Recovery

面向快速鲁棒机器人故障检测与恢复的目标导向通信

Shutong Chen, Adnan Aijaz, Yansha Deng

机构 * Department of Engineering, King’s College London(伦敦国王学院工程系) Bristol Research and Innovation Laboratory, Toshiba Europe Ltd.(托bsd欧洲有限公司布里斯托尔研究与创新实验室)

专题命中 视觉定位与Grounding :vision language model(abstract)

AI总结 提出目标导向通信框架,通过联合设计通信-计算-控制回路,利用3D场景图检测故障,并微调小语言模型结合知识蒸馏生成恢复动作,实现故障检测与恢复时间降低82.6%,任务成功率提升76%。

Comments Submit to IEEE for potential publication

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2604.22192 2026-06-10 cs.CV 版本更新 77%

CharTide: Data-Centric Chart-to-Code Generation via Tri-Perspective Tuning and Inquiry-Driven Evolution

CharTide: 数据中心的图表到代码生成通过三视角微调和查询驱动进化

Xiangxi Zheng, Kuang He, Jiayi Hu, Ping Yu, Rui Yan, Yuan Yao, Peng Hou, Anxiang Zeng, Alex Jinpeng Wang

机构 * Nanjing University(南京大学) LLM Team, Shopee Pte. Ltd.(Shopee 联邦学习团队) East China Normal University(华东师范大学) Nanjing University of Science and Technology(南京理工大学) Central South University(中南大学)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出CharTide框架,通过三视角微调解耦视觉感知与代码逻辑,并引入基于信息不变性的查询驱动强化学习进行数据验证,在多个基准上超越GPT-4o。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 2 篇

2605.17254 2026-06-10 cs.AI 版本更新 79%

CatalyticMLLM: A Graph-Text Multimodal Large Language Model for Catalytic Materials

CatalyticMLLM: 一种用于催化材料的图-文本多模态大语言模型

Yanjie Li, Jian Xu, Xu-Yao Zhang, Shiming Xiang, Nian Ran, Weijun Li, Cheng-Lin Liu

机构 * AnnLab(安实验室) Institute of Semiconductors, Chinese Academy of Sciences(中国科学院半导体研究所) Zhongguancun Academy(中关村学院) State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) State Key Laboratory of High Performance Ceramics(高性能陶瓷国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) School of Electronic, Electrical and Communication Engineering(电子电气与通信工程学院) University of ChineseAcademy of Sciences(中国科学院大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 本文提出了一种统一的图-文本多模态大语言模型QE-Catalytic-V2,用于催化材料的性质预测和逆向设计,通过共享的表示空间实现两者的联合建模,从而形成闭环优化流程。

Comments 71 page

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13446 2026-06-10 cs.RO 版本更新 67%

CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models

CAST: 反事实标签提升视觉-语言-动作模型中的指令跟随能力

Catherine Glossop, William Chen, Arjun Bhorkar, Dhruv Shah, Sergey Levine

机构 * University of California Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);grounding(abstract)

AI总结 针对VLA模型难以遵循细粒度指令的问题,提出利用视觉语言模型生成反事实标签增强数据集,提升语言基础多样性,实验表明该方法在导航和操作任务中显著提升指令跟随成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 1 篇

2601.19210 2026-06-10 cs.CV 版本更新 57%

Contrastive Spectral Rectification: Test-Time Defense towards Zero-shot Adversarial Robustness of CLIP

对比谱校正:面向CLIP零样本对抗鲁棒性的测试时防御

Sen Nie, Jie Zhang, Zhuo Wang, Shiguang Shan, Xilin Chen

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 提出对比谱校正(CSR)方法,利用对抗样本在频率衰减下的特征不一致性,通过谱引导对比目标优化校正扰动,在16个分类基准上平均提升18.1%的强攻击鲁棒性,且推理开销低。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

7. VLM训练与架构 3 篇

2606.06493 2026-06-10 cs.RO cs.AI cs.LG 版本更新 73%

HANDOFF: Humanoid Agentic Task-Space Whole-Body Control via Distilled Complementary Teachers

HANDOFF: 通过蒸馏互补教师实现人形机器人任务空间全身控制

Lizhi Yang, Junheng Li, Nehar Poddar, Yiling Hou, Gio Huh, Robert Griffin, Georgia Gkioxari, Aaron Ames

机构 * California Institute of Technology(加州理工学院) The Institute for Human & Machine Cognition(人机认知研究院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出HANDOFF框架,通过多教师KL蒸馏和上下文门控机制,将全身运动跟踪、行走和跌倒恢复三个专家策略融合为混合专家学生策略,实现基于紧凑显式接口的全身控制,在Unitree G1上达到先进的速度跟踪性能并扩展了操作工作空间。

Comments 22 pages, 9 figures, Project page: https://lzyang2000.github.io/HANDOFF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07800 2026-06-10 cs.CV 版本更新 70%

SARA: Semantically Adaptive Relational Alignment for Video Diffusion Models

SARA: 语义自适应关系对齐用于视频扩散模型

Jiesong Lian, Zixiang Zhou, Ruizhe Zhong, Yuan Zhou, Qinglin Lu, Rui Wang, Long Hu, Yixue Hao, Baoru Huang

机构 * Tencent Hunyuan(腾讯文英)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出SARA方法,通过文本条件显著性引导令牌对监督,提升视频扩散模型的文本对齐和运动质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00809 2026-06-10 cs.CV 版本更新 57%

Let ViT Speak: Generative Language-Image Pre-training

让ViT说话:生成式语言-图像预训练

Yan Fang, Mengcheng Lan, Zilong Huang, Weixian Lei, Yunqing Zhao, Yujie Zhong, Yingchen Yu, Qi She, Yao Zhao, Yunchao Wei

机构 * Beijing Jiaotong University(北京交通大学) ByteDance(字节跳动) Nanyang Technological University(南洋理工大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 提出GenLIP框架,通过语言建模目标直接训练ViT从视觉token预测语言token,无需对比学习或额外文本解码器,实现简单、可扩展且性能优异的视觉编码器。

Comments 27 pages, 11 figures. Code and models are available at https://github.com/YanFangCS/GenLIP

详情

展开后加载摘要…

URL PDF HTML 收藏