arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-13 至 2026-07-13 共收录 42 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 2 篇

2510.18346 2026-07-13 cs.CV 版本更新 79%

AV-Master: Dual-Path Comprehensive Perception Makes Better Audio-Visual Question Answering

AV-Master:双路径综合感知实现更优的音频视觉问答

Jiayu Zhang, Shuo Ye, Qilang Ye, Xun Lin, Zihan Song, Zitong Yu

机构 * Great Bay University(大湾区大学) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息科技重点实验室) Nankai University(南开大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 AV-Master通过动态建模时序和模态维度,提升模型在复杂视听场景中提取关键信息的能力,有效解决现有方法在时间采样和模态偏好意识上的不足,从而在复杂场景中增强推理能力。

Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08790 2026-07-13 q-bio.QM 新提交 75%

DentiAsk: A VQA Benchmark for Multimodal Reasoning in Panoramic Dental Radiographs

DentiAsk:全景牙科X光片中多模态推理的视觉问答基准测试

Debesh Jha, Tapas Kumar Dutta, Roshan Paudel, Onkar Kishor Susladkar, Aashish Ghimire, Anupam Dhakal, Sabin Adhikari, Nand Kumar Yadav, Deepak Ranjan Nayak, Pravin Pawar, William C. W. Chen, Glenda Reynolds

专题命中 视觉问答 :vision-language model(abstract);LLaVA(abstract);visual question answering(abstract)

AI总结 研究旨在解决现有医学视觉问答基准测试无法充分体现全景牙科X光片解读复杂性的问题,引入DentiAsk基准测试,涵盖多种病变和推理层次,对10种模型测试发现其在空间定位等方面存在局限,为推进医学成像多模态推理提供挑战基准。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 12 篇

2607.09654 2026-07-13 cs.CV cs.AI 新提交 90%

Evolution of Accuracy and Visual-Cognitive Errors in a Decade of Vision-Language AI Models

十年视觉语言人工智能模型中准确性和视觉认知错误的演变

Shravan Murlidaran, Miguel P. Eckstein

机构 * Psychological & Brain Sciences, University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校心理与脑科学系) Department of Computer Science, University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校计算机科学系) Department of Electrical and Computer Engineering, University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校电气与计算机工程系)

专题命中 视觉推理 :MLLM(summary_cn,abstract_cn);vision language model(abstract);VLM(abstract_cn);visual language model(abstract)

AI总结 研究十年间视觉语言模型进展,引入CSB数据集,评估模型在其上及MS-COCO样本中的准确性与视觉认知错误类型,发现MLLM消除简单与复杂场景描述准确性差距,几乎消除多数错误类型,为模型发展提供全面评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28215 2026-07-13 cs.AI cs.CL cs.LG cs.LO cs.MA 版本更新 82%

Explaining is Harder Than Predicting Alone: Evaluating Concept-based Explanations of MLLMs as ICL Visual Classifiers

解释比单独预测更难:评估基于概念的MLLM解释作为ICL视觉分类器

Carmen Quiles-Ramírez, Leticia L. Rodríguez, Nicolás Martorell, Natalia Díaz-Rodríguez

专题命中 视觉推理 :MLLM(title_cn,abstract_cn);multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过五种形式化程度递增的条件,系统评估多模态大语言模型在少样本上下文学习中的基于概念的可解释性,发现解释比预测更难,且强制生成形式化解释会降低预测准确性。

Comments Accepted to the CompLearn Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12939 2026-07-13 cs.RO 版本更新 82%

RoboStream: Weaving Spatio-Temporal Reasoning with Memory in Vision-Language Models for Robotics

RoboStream: 用记忆融合时空推理提升视觉语言模型在机器人中的应用

Yuzhi Huang, Jie Wu, Weijue Bu, Ziyi Xiong, Gaoyang Jiang, Ye Li, Kangye Ji, Shuzhao Xie, Yue Huang, Chenglei Wu, Jingyan Jiang, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) YXGN Robotics(YXGN机器人) China University of Mining and Technology(中国矿业大学) Shenzhen Technology University(深圳技术大学) Huazhong University of Science and Technology(华中科技大学) Xiamen University(厦门大学)

专题命中 视觉推理 :vision-language model(title);VLM(abstract);grounding(abstract)

AI总结 RoboStream通过时空融合令牌和因果时空图实现持久记忆,解决机器人长时间任务中的几何锚定和状态追踪问题,提升长期任务表现。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07361 2026-07-13 cs.CV 新提交 81%

BUS: Brain-Inspired Unsupervised Self-Reflection via Backward Prediction for Multimodal Reasoning

BUS:用于高级多模态推理的受脑启发的无监督自我反思

Jiacheng Yang, Tongying Xiao, Yunkai Dang, Cong Wang, Yuekun Yang, Qi Fan, Tianyu Ding, Wenbin Li, Feng Miao, Yang Gao

机构 * AAAI Press(美国人工智能协会出版社)

专题命中 视觉推理 :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 研究针对VLM处理复杂视觉任务的不足,受脑启发提出BUS无监督训练框架,通过反向预测提升其反思推理能力,无需标注数据,与多种微调方法兼容,经实验验证在多任务中有效提升了VLM推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09061 2026-07-13 cs.CV cs.AI cs.LG 新提交 78%

On Locality and Length Generalization in Visual Reasoning

关于视觉推理中的局部性和长度泛化

Pulkit Madan, Sanjay Haresh, Reza Ebrahimi, Sunny Panchal, Apratim Bhattacharyya, Roland Memisevic

机构 * Qualcomm AI Research(高通人工智能研究中心)

专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.AI、cs.LG

AI总结 研究从视觉状态跟踪和长度泛化角度,探讨局部、顺序视觉模型是否有计算优势。受语言模型启发,研究简单视觉任务中视觉模型行为。发现其会利用全局捷径,基于严格局部感知的策略可缓解此问题,表明局部注意力对稳健组合泛化很关键。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09068 2026-07-13 cs.CV cs.AI 新提交 73%

OmniMapBench: Benchmarking Visual-Centric Reasoning on Diverse Map Documents

OmniMapBench:对多样化地图文档进行以视觉为中心的推理基准测试

Yang Chen, Yunwen Li, Yufan Shen, Minghao Liu, Tianyu Zheng, Bin Fu, Qunshu Lin, Zhi Yu, Botian Shi

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学)

专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 针对LVLMs文档理解中视觉推理基准测试不足的问题,提出OmniMapBench,含2096个问答对,设计了视觉依赖指数(VDI)量化基准属性,评估25个LVLMs发现性能差距大,推动了以视觉为中心的推理进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29943 2026-07-13 cs.CV 版本更新 70%

Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting

EC-Bench:超长视频的枚举与计数基准

Fumihiko Tsuchiya, Taiki Miyanishi, Shunsuke Yasuki, Mahiro Ukai, Nakamasa Inoue, Shuhei Kurita, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo, Japan(东京大学) Institute of Science Tokyo, Japan(东京科学大学) National Institute of Informatics, Japan(国立信息学研究所)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 EC-Bench针对超长视频的枚举与计数问题,通过152部超过30分钟的视频和1699个查询,评估多模态大语言模型的性能,揭示模型在时间推理和计数任务中的局限性。

Comments The first two authors are equally contributed. The data and code are publicly available at: https://github.com/matsuolab/EC-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09443 2026-07-13 cs.CV cs.AI 新提交 62%

Parameter-Efficient Vision-Language Adaptation with Continuous Metadata Conditioning for Animal Re-Identification

基于连续元数据条件的参数高效视觉语言适配用于动物再识别

Anil Osman Tur, Tonje Knutsen Sordalen, Kim Tallaksen Halvorsen, Cigdem Beyan

机构 * Department of Computer Science, University of Verona(维罗纳大学计算机科学系) Institute of Marine Research(海洋研究所) University of Agder, Centre for Coastal Research(阿格德大学海岸研究中心)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对动物再识别中适应纵向生态环境的挑战,提出基于连续元数据条件的参数高效CLIP适配框架,通过保留元数据连续结构,在训练中平滑调制嵌入空间,提升了对外观变化和分布偏移的鲁棒性,实现纯视觉推理管道。

Comments This is the author's version of the paper accepted for publication in Expert Systems with Applications. The final authenticated version will be available from the publisher

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09438 2026-07-13 cs.CL cs.AI cs.LG 新提交 62%

Test-Time Scaling for Small VLMs on Multilingual Visual MCQ

多语言视觉多项选择题中小视觉语言模型的测试时缩放

Spiros Baxevanakis, Peng-Jian Yang

机构 * ImageCLEF Lab(图像CLEF实验室) University of Amsterdam(阿姆斯特丹大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 研究小型视觉语言模型在多语言视觉多项选择题中的测试时缩放,比较多种方法,发现运行条件重要,可解析性是关键,增加解码预算有帮助,复杂方法贡献小,最佳配置在测试集上表现出色,位居排行榜首位。

Comments 14 pages, 2 figures, accepted at ImageCLEF 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09649 2026-07-13 cs.AI 新提交 57%

ConceptSMILE: Auditing the Trustworthiness of Concept-Based Explainable AI

ConceptSMILE:审计基于概念的可解释人工智能的可信度

Mohadeseh Mollapour, Koorosh Aslansefat, Zeinab Dehghani, Bhupesh Kumar Mishra, Tejal Shah, Zhibao Mian

机构 * University of Hull(赫尔大学) Newcastle University(纽卡斯尔大学)

专题命中 视觉推理 :VLM(abstract);分类 cs.AI

AI总结 研究基于概念的可解释人工智能中概念级输出的可信度问题,提出ConceptSMILE审计框架,通过扰动输入区域等方法评估可靠性,在视网膜眼底图像上评估发现不同概念和路径可靠性有差异,为评估此类人工智能可信度提供独立审计层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09059 2026-07-13 cs.AI 新提交 57%

ARCANA: A Reflective Multi-Agent Program Synthesis Framework for ARC-AGI-2 Reasoning

ARCANA:用于ARC-AGI-2推理的反射式多智能体程序合成框架

Kunbo Zhang, Lei Fu, Zeyu Wang, Zijing Liu, Kejian Tong

机构 * Columbia University(哥伦比亚大学) University of California, Los Angeles(加州大学洛杉矶分校) Northeastern University(东北大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 ARCANA是用于ARC-AGI-2推理的多智能体框架,将任务分解为感知、假设生成等步骤,智能体通过可微黑板通信,由元控制器调度。其设计结合程序搜索与校正,提升了抽象转换任务的推理效率和解决方案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09179 2026-07-13 cs.CR cs.SE 新提交 50%

Malaika: Understanding Malware through Tri-Grounded Agentic Reasoning

Malaika:通过三重基础的智能推理理解恶意软件

Xingzhi Qian, Xinran Zheng, Yiling He, Lorenzo Cavallaro

专题命中 视觉推理 :grounding(abstract)

AI总结 研究针对恶意软件理解挑战,将其视为基础推理问题,提出需三种基础形式。介绍多智能体框架Malaika,通过受分析师启发的推理等实现三种基础机制,用于安卓恶意软件分析,实验表明该框架提高分析质量,为可靠恶意软件理解及软件分析提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 10 篇

2504.15650 2026-07-13 cs.CV 版本更新 80%

AffordanceSAM: Segment Anything Once More in Affordance Grounding

可负担性语义分割模型:在可负担性基础上再次分割任何事物

Dengyang Jiang, Zanyi Wang, Hengzhuang Li, Sizhe Dang, Teli Ma, Wei Wei, Guang Dai, Lei Zhang, Harry Yang, Mengmeng Wang

机构 * SGIT AI Lab(SGIT人工智能实验室) NWPU(西北工业大学) HKUST(香港科技大学) XJTU(西安交通大学) HUST(华中科技大学) ZJUT(浙江工业大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 研究聚焦全监督可负担性基础,提出AffordanceSAM,通过设计适应模块和标注数据集,以三阶段训练方式扩展SAM泛化能力,在AGD20K基准上达最优性能,展现强大泛化能力。

Comments [ACM MM 2026] SAM Meets Affordance Grounding

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08798 2026-07-13 cs.GR cs.CV 新提交 77%

GReFEM: Multimodal LLMs as Zero-Shot Semantic Assistants for Physics-Guided 3D Mesh Refinement

GReFEM:多模态大语言模型作为用于物理引导的3D网格细化的零样本语义助手

Kartik Bali, Mahish K. Guru, Christian J Cyron, Roland Aydin

机构 * Institute of Material Systems Modeling(材料系统建模研究所) Helmholtz Zentrum Hereon(海德堡研究中心Hereon) Institute of Material and Process Design(材料与加工设计研究所) German Research Center for Artificial Intelligence(德国人工智能研究中心)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 研究探索多模态大语言模型能否作为有限元网格细化的零样本几何代理,引入GReFEM框架及orthoViews视图选择模块,经实证评估发现其展示出强大零样本能力,能准确遵循复杂指令,比盲目启发式方法更精确,定义了基础模型在自动模拟中作为语义助手的前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09008 2026-07-13 cs.CV 新提交 74%

C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes

C-GAP:类感知与在线提示改进不均衡类上的视觉语言模型

Francis Fernandez, Arash Jahangiri, Salimeh Sekeh

机构 * San Diego State University(圣地亚哥州立大学)

专题命中 视觉定位与Grounding :vision-language model(title);分类 cs.CV

AI总结 研究针对安全关键感知系统检测小标签空间中罕见物体类别的问题,提出C-GAP框架,通过建立复合字幕基线并利用语言模型迭代细化提示,无需更新检测器权重,有效提升少数类检测精度,实验证明其成效显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03631 2026-07-13 cs.LG cs.AI 版本更新 62%

AnchorMoE: Interpretable Time Series Classification via Anchor-Routed MoE

AnchorMoE: 基于锚点路由的混合专家模型实现可解释时间序列分类

Tao Xie, Zexi Tan, Haoyi Xiao, Mengke Li, Yiqun Zhang, Yang Lu, Cuie Yang, Yiu-ming Cheung

机构 * School of Automation, Guangdong University of Technology(广东工业大学自动化学院) School of Computer Science and Technology, Guangdong University of Technology(广东工业大学计算机科学与技术学院) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) School of Informatics, Xiamen University(厦门大学信息学院) State Key Laboratory of Synthetical Automation for Process Industries, Northeastern University(东北大学过程工业综合自动化国家重点实验室) Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出AnchorMoE框架,利用混合专家架构对局部补丁进行多视角表示并路由至专门专家,通过加性分解实现前向可解释性,并引入几何正交约束和不确定性感知门控机制提升稀疏信号下的分解可靠性与噪声抑制。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09191 2026-07-13 cs.RO cs.LG 新提交 57%

GenVid2Robot: From Video Generation to Robot Manipulation via Rigid-Geometric Consistency

GenVid2Robot:通过刚性几何一致性从视频生成到机器人操作

Haohui Huang, Xi Yuan, Panpan Liao, Tao Teng, Chenguang Yang, Jing Guo, Yi Guo

机构 * School of Automation, Guangdong University of Technology(广东工业大学自动化学院) University of Liverpool(利物浦大学) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) State Key Laboratory of Submarine Geoscience, School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学海洋地球科学国家重点实验室,自动化与智能感知学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 研究旨在将生成视频转换为机器人可执行操作轨迹。核心方法是GenVid2Robot框架,通过采样语义锚点、跟踪验证运动等步骤实现。主要贡献是提高了生成视频引导操作的可靠性,通过多种手段建立视觉运动先验。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09135 2026-07-13 cs.CV 新提交 57%

Super-Generalist: Towards Comprehensive and Accurate Medical Image Understanding via Generalist-Specialist Synergy

超级通才:通过通才-专才协同实现全面准确的医学图像理解

Shaoteng Zhang, Weiwei Cao, Wanxing Chang, Yutong Xie, Kai Cao, Zaiyi Liu, Yu Shi, Tingbo Liang, Qi Zhang, Ling Zhang, Yong Xia, Jianpeng Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(湖畔实验室) Department of Radiology, Ningbo No. 2 Hospital(宁波市第二医院放射科) Department of Radiology, Guangdong Provincial People’s Hospital(广东省人民医院放射科) Department of Radiology, Shanghai Institution of Pancreatic Disease(上海胰腺疾病研究所放射科) Department of Radiology, Shengjing Hospital of China Medical University(中国医科大学附属盛京医院放射科) The First Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院附属第一医院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究旨在通过通才-专才协同实现全面准确的医学图像理解。提出SuG框架,整合多分割专家空间先验进行视觉-语言对齐,利用病变掩码校准注意力。在多CT基准测试中评估,其在疾病诊断任务中性能领先,超越专才模型,有强大病变定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06993 2026-07-13 cs.AI 新提交 57%

Large Behavior Model: A Promptable Digital Twin of the Retail Customer

大型行为模型:零售客户的可提示数字孪生体

Wachiravit Modecrua, Krittin Pachtrachai, Touchapon Kraisingkorn

机构 * Amity Research and Application Center (ARAC), Amity AI Holdings Co., Ltd.(友好研究与应用中心(ARAC),友好人工智能控股有限公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究旨在解决客户行为建模问题,提出大型行为模型(LBM),通过统一公式从零售交易学习客户决策,经多种训练方式优化。该模型在多任务中表现出色,消融研究揭示各因素作用,为客户数字孪生体和行为模拟提供可扩展基础。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03198 2026-07-13 cs.LG math-ph math.MP 新提交 57%

Reduced-Order Models: The Mother of World Models

降阶模型:世界模型之母

Rajat Ghosh

机构 * Independent Researcher(独立研究员)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 探讨世界模型的功能结构早于现代自监督学习,在模型降阶和控制文献中就已独立发展。追溯其在三个领域的发展,对比传统降阶模型与学习型世界模型的优缺点,指出在关键系统中部署世界模型的障碍及统一两者的研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08800 2026-07-13 cs.SD 新提交 50%

Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering

双BEATs:通过抖动在音频大语言模型中解锁零样本立体声音频感知

Shuo-Chun Lin, Hen-Hsen Huang

机构 * Institute of Information Science, Academia Sinica(台湾中央研究院资讯科学研究所)

专题命中 视觉定位与Grounding :multimodal large language model(abstract)

AI总结 研究针对多模态大语言模型空间感知局限,提出双BEATs架构,通过在编码前注入抖动噪声解决归一化问题,在三元方向分类任务中验证该方法有出色空间分辨率且能零样本泛化,证明标准模型经正则化可实现广义立体声音频理解。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14563 2026-07-13 cs.SE cs.CL 版本更新 50%

Remember Your Trace: Memory-Guided Long-Horizon Agentic Framework for Consistent and Hierarchical Repository-Level Code Documentation

记住你的踪迹:一种基于记忆的长周期代理框架,用于一致且分层的仓库级代码文档

Suyoung Bae, Jaehoon Lee, Changkyu Choi, YunSeok Choi, Jee-Hyong Lee

机构 * Sungkyunkwan University(成均馆大学) University of Oslo(奥斯陆大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 MemDocAgent通过依赖感知遍历引导和记忆引导代理交互,生成统一上下文的仓库级代码文档,实现高效且一致的文档生成。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2607.09488 2026-07-13 cs.CV 新提交 70%

SigLIP-HD by Fine-to-Coarse Supervision

通过从细到粗的监督实现SigLIP-HD

Lihe Yang, Zhen Zhao, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 文档图表理解 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 研究如何在低成本下实现精细视觉感知,提出SigLIP-HD,采用从细到粗监督设计,基于SigLIP 2模型构建,在相同推理预算下能产生更好视觉令牌,在多基准测试中结果优于基线模型。

Comments ICLR 2026. Code and model: https://github.com/LiheYoung/SigLIP-HD

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 2 篇

2607.08974 2026-07-13 cs.RO cs.AI 新提交 88%

CLAP: Direct VLM-to-VLA Adaptation via Language-Action Grounding

CLAP:通过语言-动作基础实现从视觉语言模型到视觉语言动作模型的直接适配

Yuri Ishitoya, Jeremy Siburian, Masashi Hamaya, Kuniaki Saito, Cristian C. Beltran-Hernandez, Mai Nishimura

机构 * Ochanomizu University(御茶水女子大学) University of Tokyo(东京大学) OMRON SINIC X Corp(欧姆龙(中国)有限公司)

专题命中 GUI与屏幕智能体 :VLM(title,abstract);grounding(title);分类 cs.AI

AI总结 研究如何将预训练视觉语言模型直接转换为视觉语言动作模型,核心方法是提出CLAP,通过在数字动作序列前加自然语言描述来解决输出分布不匹配问题,单轮微调效果良好,还将发布多尺度紧凑VLA家族助力能力转移分析。

Comments Project website: https://omron-sinicx.github.io/clap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09042 2026-07-13 cs.LG 新提交 57%

Learning More from Less: Reinforcement Learning from Hindsight

从更少中学习更多:事后诸葛亮式强化学习

Iris Xu, Sunshine Jiang, John Marangola, Nitish Dashora, Richard Li, Thomas Liu, Zexue He, Yuheng Zhi, Alex Pentland, Pulkit Agrawal, Zhang-Wei Hong

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) Stanford University(斯坦福大学) University of California, San Diego(加利福尼亚大学圣地亚哥分校)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG

AI总结 研究针对强化学习用于视觉-语言-动作模型后期训练时样本效率低的问题,提出事后诸葛亮式学习方法,通过对失败轨迹重标记,让策略联合原始与重标记轨迹训练,在分布外任务上显著提升样本效率并优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 7 篇

2607.09544 2026-07-13 cs.CV cs.LG 新提交 85%

The Count Is There, but Misaligned: Understanding and Correcting Counting Failures in VLMs

计数存在但未对齐:理解和纠正视觉语言模型中的计数失败

Ahmed Oumar El-Shangiti, Abzal Nurgazy, Hilal AlQuabeh, Nikolai Rozanov, Kentaro Inui

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Imperial College London(伦敦帝国学院)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 研究视觉语言模型计数失败问题,通过对VLM激活进行探测训练及分析,发现其虽常编码正确计数但输出错误,提出探测器引导的自校正方法,在不更新参数时提高计数准确率,揭示内部知识与模型输出差距并提供改进工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09492 2026-07-13 cs.AI 新提交 81%

Multimodal Reward Hacking in Reinforcement Learning

强化学习中的多模态奖励黑客攻击

Jiayu Yao, Yiwei Wang, Anmeng Zhang, Zhe Sun, Songsong Wang, Lingrui Mei, Yuyao Ge, Shenghua Liu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of California, Merced(加州大学默塞德分校) Southeast University(东南大学)

专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);VLM(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 研究强化学习中多模态奖励黑客攻击问题,通过引入新奖励失败率(NRFR)等方法,在多种设置下改变模型规模、算法等因素进行实验,发现仅结果奖励易导致黑客攻击,扩大规模可减少但不能消除,还得出不同算法和奖励方式对黑客攻击的影响及相关结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09562 2026-07-13 cs.CV cs.AI 新提交 81%

TCLA: Training-Free Class-wise Logit Adaptation for Medical Vision-Language Models

TCLA:用于医学视觉语言模型的无训练类级对数几率适应

Tianyou Jiang, Ziyu Zhou

机构 * University of Bern(伯尔尼大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 针对医学视觉语言模型在分布外数据上有效性下降问题,提出无训练的少样本适应方法TCLA。该方法基于支持样本校正推理对数几率,提升模型性能,实验表明其能持续提高模型OOD性能且多数情况下优于现有训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏