arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-05 至 2026-08-05 共收录 66 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 9 篇

2608.03733 2026-08-05 cs.AI 新提交 90%

Failure-Informed Image Self-Augmentation for Multimodal Large Language Model Self-Improvement

面向多模态大语言模型自我改进的故障感知图像自增强

Chunyang Jiang, Pingping Zhang, Yuzhi Zhao, Wenao Ma, Zhijian Hou, Mengyang Wu, Yiyang Cai, Senkang Hu, Sitong Cheng, Chi-Min Chan, Wei Xue, Yike Guo

专题命中 视觉问答 :MLLM(summary_cn,abstract);multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.AI

AI总结 提出FISA框架,基于MLLM失败案例生成保留答案的增强图像,经自检验与双重保真过滤后,可提升视觉问答性能,且兼容文本自增强、数据效率更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02830 2026-08-05 cs.CV cs.AI 新提交 86%

In-Context Collapse in Vision-Language Models and How to Mitigate it?

视觉语言模型中的上下文坍缩及其缓解方法

Mohammad Rostami

机构 * Amazon Generative AI Innovation Center(亚马逊生成式AI创新中心)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文发现视觉语言模型存在随演示增多的上下文坍缩问题,通过因果定位将其归因于视觉-语言整合通路,提出CircA干预方法可有效缓解该问题并实现抗坍缩能力迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02980 2026-08-05 cs.CV 新提交 85%

Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding

Qwen-3D:用于空间理解的通用三维视觉语言模型

Lucy Lin, Ayush Jain, Yifan Liu, Katerina Fragkiadaki

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉问答 :vision-language model(title);visual reasoning(abstract);visual question answering(abstract);grounding(abstract)

AI总结 本研究提出 Qwen-3D 三维视觉语言模型,通过多视角几何线索与三维旋转位置嵌入提升空间推理,在三维任务上超越现有 3D LMM,还保持二维任务性能。

Comments Project Page: https://qwen-3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03890 2026-08-05 cs.CV cs.AI 新提交 82%

CARE-X: Towards Clinically Useful Radiology VLMs with Auxiliary Supervision, Reward-Aligned Learning, and Tool-Augmented Measurement

CARE-X:借助辅助监督、奖励对齐学习与工具增强测量实现临床可用的放射学视觉语言模型

Mercy Prasanna Ranjit, Anirban Porya, Sathvik Joel, Niharika Vadlamudi, Nikhilesh Chowdary Eathamukkala, Prasanth V, Abhyuday Kumara Swamy, Pranay Narhari Umredkar, Pradeep Narayan, Vivek Rajagopal, Tanuja Ganu

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);grounding(abstract)

AI总结 CARE-X是一款胸部X射线视觉语言模型,通过辅助监督、奖励对齐学习及工具增强测量,在多个医学影像任务上实现了优于基线的性能,缩小了放射科医生需求与现有生成模型间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02907 2026-08-05 cs.LG 新提交 79%

Bayesian Data Reweighting Improves Multimodal Retrieval for Knowledge-Based Visual Question Answering

贝叶斯数据重加权改进基于知识的视觉问答的多模态检索

Jingchen Sun, Shaobo Han, Ruiyi Zhang, Naresh Kumar Devulapally, Ming Liu, Yitao Long, Vishnu Suresh Lokhande, Changyou Chen

机构 * University at Buffalo(布法罗大学) NEC Laboratories America(美国 NEC 实验室) Adobe Research(奥多比研究院) Iowa State University(爱荷华州立大学) New York University(纽约大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.LG

AI总结 针对基于知识的视觉问答中多模态检索的负样本处理问题,提出贝叶斯数据重加权框架,通过概率建模与随机EM优化,在三个检索器和七个基准上提升了检索准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03292 2026-08-05 cs.AI 新提交 77%

DocTrace: Towards Traceable Long Document VQA via Hierarchical Evidence Graph Reasoning

DocTrace:面向可追溯的长文档视觉问答的分层证据图推理方法

Le Xiang, Zhicheng Guan, Hong Chen, Xiaocong Lin, Zhenghua Lei, Teng Hu, Bolei He, Long Zeng

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 本文提出DocTrace分层框架,将长文档视觉问答建模为显式证据图推理问题,经两阶段训练优化后,在三个基准上优于现有模型,且推理可追溯。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02615 2026-08-05 cs.CL cs.AI 新提交 77%

OncoTriad-QA: A Patient-Level Radiology-Pathology-Genomics Benchmark for Pan-Cancer Reasoning

OncoTriad-QA:用于泛癌推理的患者级放射学-病理学-基因组学基准

Ahnaf Munir, Dannong Wang, Michael W. McDonald, Mubarak Shah, Pegah Khosravi, Yu Tian

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 本文提出OncoTriad-QA多模态癌症问答基准及OncoVLM模型,实验显示OncoVLM经微调后在泛癌问答任务上优于现有模型,该基准可用于相关模型的训练与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03826 2026-08-05 cs.CV cs.LG 新提交 73%

Geo-Embed: Towards Unified Multimodal Embeddings for Urban Understanding

Geo-Embed:面向城市理解的统一多模态嵌入

Jiapeng Li, Yong Li, Junjie Zhou, Fan Zhang, Yu Liu

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文针对现有多模态嵌入模型难以支持异构地理空间任务的问题,提出GeoMEB基准与Geo-Embed模型,在GeoMEB上实现15.3%的相对性能提升,为地理空间嵌入器发展提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03141 2026-08-05 eess.SP 新提交 50%

Geometric Cross-Modal Token Selection for Latency-Constrained Multimodal Token Communication

面向延迟约束多模态令牌通信的几何跨模态令牌选择

Joohyuk Park, Junyong Shin, Yongjeong Oh, Jihong Park, Yo-Seb Jeon

专题命中 视觉问答 :visual question answering(abstract)

AI总结 该研究针对延迟约束多模态令牌通信问题,提出基于几何的跨模态令牌选择框架及IBS、R-IBS策略,在VQA和AVQA任务上实现了显著的准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 7 篇

2608.03064 2026-08-05 cs.CV 新提交 91%

Global Graph-Validated Optimization for VLM-based 3D Indoor Scene Generation

基于全局图验证的VLM驱动3D室内场景生成优化

Jialu Huang, Yingxuan You, Fei Wang, Zheng Dang

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 该研究针对VLM驱动3D室内布局生成中全局一致性与物理可行性不足的问题,提出结合GSV与GPFS的混合策略,实现了该任务的当前最优性能。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03204 2026-08-05 cs.CL cs.AI 新提交 85%

Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach

测试时对齐大型视觉语言模型:一种轨迹引导的结构化采样方法

Tianbao Jiang, Weicong Ni, Gerard de Melo, Linlin Wang

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);grounding(abstract);分类 cs.AI

AI总结 针对现有视觉语言模型测试时对齐方法资源密集、训练与推理分布不匹配的问题,提出轨迹引导结构化采样的测试时对齐方法,在多模态推理数据集上提升准确率且推理开销可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02833 2026-08-05 cs.CV cs.AI cs.CL 新提交 79%

CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning

CURV:通过课程可视化接地推理增强图表理解

Xuehang Guo, Pingyue Zhang, Ruiyi Zhang, Zhenhailong Wang, Hanrui Lyu, Heng Ji, Tong Sun, Qingyun Wang, Manling Li

专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型视觉接地与推理不足的问题,提出CURV课程学习框架,结合CCQA数据集,在图表问答任务中实现显著性能提升并具备良好泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03918 2026-08-05 cs.CV cs.AI 新提交 73%

When and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video Understanding

何时与何地查看:用于高效长视频理解的自适应视觉证据调度

Ke Li, Jiayu Chen, Maoliang Li, Zihao Zheng, Hailong Zou, Hengyi Zhang, Xuanzhe Liu, Xiang Chen

专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出无需训练的EcoFrame框架,通过熵门控预算调度和注意力引导候选提议实现高效视觉证据调度,在多个长视频理解基准上实现精度与效率的更优权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03187 2026-08-05 cs.NE 新提交 71%

NeuroMosaic: Anatomically Grounded Multimodal Large Language Modeling for Molecularly Aware Glioma Reasoning from 3D MRI and Clinical Narratives

NeuroMosaic:基于解剖学的多模态大语言模型,用于从3D MRI和临床叙事中进行分子感知的胶质瘤推理

Yantong Liu, Zheyu Zhang, Runpeng Liu, Mu Xitang, Seong-Yoon Shin, Hyun-Ae Lee

专题命中 视觉推理 :multimodal large language model(title)

AI总结 该研究针对多模态医疗大语言模型在神经肿瘤学中的结构缺陷,提出NeuroMosaic模型,通过多模块架构实现胶质瘤的准确推理,在多个数据集上取得优异性能,验证了解剖学索引路由机制的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03225 2026-08-05 cs.CV 新提交 57%

Open-Linguistic Concept Unified Learning for Cross-Site Interpretable Dermatology Image Diagnosis

面向跨站点可解释皮肤病图像诊断的开放语言概念统一学习

Chengyu Wu, Junpeng Tan, Wanxiang Luo, Yaqi Wang, Yandong Wen, Yefeng Zheng

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 针对现有概念模型跨站点泛化差、适配FVLMs成本高的问题,提出开放语言概念统一学习框架UniCon,通过共享语义空间等三项创新实现多模态可解释皮肤病诊断,获顶级准确率且具备跨站点干预能力。

Comments accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03161 2026-08-05 cs.AI cs.CL 新提交 57%

Evidence-Grounded Multimodal Knowledge Graph Construction for Multi-Lecture Educational Reasoning

面向多讲座教育推理的证据 grounded 多模态知识图谱构建

Sahil Al Farib, Momota Ahsana Meem, Sheikh Redwanul Islam, Md. Tanvir Raihan

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

AI总结 该研究针对讲座视频知识保留不全问题,提出基于证据的多模态知识图谱构建流程,在神经网络讲座实验中取得高覆盖率与检索准确率,贡献可审计的知识图谱构建方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 16 篇

2608.02791 2026-08-05 cs.CV 新提交 91%

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation

更好、更强、更快、更广泛:基于多模态大型语言模型(MLLM)的结构化全掩码预测分割

Jiazhen Liu, Mingkuan Feng, Long Chen

机构 * The Hong Kong University of Science and Technology (HKUST)(香港科技大学)

专题命中 视觉定位与Grounding :MLLM(title,title_cn);grounding(abstract);分类 cs.CV

AI总结 STAMPlus通过结构化全掩码预测解耦自回归对话与非自回归掩码预测,解决了MLLM分割的三难问题,在提升性能的同时降低延迟,实现多类开放词汇等分割任务的SOTA表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03631 2026-08-05 cs.CV 新提交 89%

SEER: A Self-Grounded Evidence Interface for Controlled Spatial Relation Classification

SEER:用于受控空间关系分类的自 grounding 证据接口

Feixiang Liu, Likun Wang, Qiang Qiu, Hui Xu, Huawei Shen, Xueqi Cheng

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);grounding(title_cn,abstract);分类 cs.CV

AI总结 本文提出针对冻结VLM的无训练推理时证据接口SEER,通过构建查询特定证据缓解空间关系分类错误,在多数据集上取得显著性能提升,证明该干预措施的有效性。

Comments 23 pages total, 2 figures. Code: https://github.com/SouthWinter/SEER

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03179 2026-08-05 cs.CV 新提交 81%

EditFlow3D: Automated Local Editing of 3D Assets with Trajectory Preservation

EditFlow3D:保留轨迹的3D资产自动化局部编辑

Rui Nie, Chuang Wang, Haitao Zhou, Jiahe Song, Buyu Li, Sheng Wang, Qian Yu

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);分类 cs.CV

AI总结 EditFlow3D是一种无需训练的3D局部编辑框架,通过VLM驱动工作流生成掩码与视觉引导,结合掩码引导差分流和轨迹保留技术,在新基准EditFlow-Bench上验证了其编辑准确性与非目标区域保留能力优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03078 2026-08-05 cs.CV 新提交 81%

LDU-Bench: Multimodal LLM Evaluation for Lithography Defect Understanding under Layout-Varying Circuit Backgrounds

LDU-Bench:面向不同布局电路背景下光刻缺陷理解的多模态大语言模型评估基准

Huanglong Ji, Botong Zhao, Shujing Lv, Yue Lv

专题命中 视觉定位与Grounding :multimodal large language model(abstract,abstract_cn);MLLM(summary_cn);分类 cs.CV

AI总结 本文提出LDU-Bench这一多模态基准,将光刻审查工作流程分解为四项任务,评估发现现有多模态大语言模型的缺陷分类能力无法稳定迁移至下游审查阶段,为工业MLLM评估提供了统一平台。

Comments 12 pages, 3 figures, and 5 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03763 2026-08-05 cs.CV 新提交 79%

TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding

TDVR:用于零样本3D视觉定位的联合文本消歧与视点推理框架

Qingxi Du, Junbo Wang, Yuke Li, Yining Zhu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出TDVR框架,通过联合文本消歧与视点推理解决零样本3D视觉定位中的文本歧义与视点不足问题,在ScanRefer数据集上的Acc@0.25和Acc@0.5指标较现有最优方法分别提升15.25%和14.46%

Comments 10 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03322 2026-08-05 cs.CV 新提交 79%

LocAnyMed: Vision-Language Grounding for Multimodal Medical Images

LocAnyMed:面向多模态医学图像的视觉-语言定位

Zihan Wang, Tong Liu, Zhiwei Wang, Tao Huang, Wentao Jiang, Sihan Ma, Shanshan Ye, Xiaohui Yang, Jing Zhang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 该研究构建多模态医学视觉定位数据集LocAnyMed-200K及理由增强子集LocAnyMed-CoT-20K,通过微调LocateAnything-3B提升医学定位性能,为相关研究提供统一基础。

Comments Technical report; work in progress. 28 pages, 5 figures, and 16 tables. Code: https://github.com/MiliLab/LocAnyMed

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03099 2026-08-05 cs.CL 新提交 78%

What Language Does and What the Evidence Supports: A Functional Role Taxonomy and Evidence Audit of Language Grounding in Embodied Agents

语言的作用与证据支持:具身智能体中语言接地的功能角色分类与证据审查

Yifan Guo, Chenghao Li, Zhu Wang, Wei Xu, Yu Li, Yulong Zhu, Zhuo Sun, Bin Guo, Zhiwen Yu

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 本研究提出具身智能体中语言的五种功能角色,构建框架审查现有文献,发现语言功能使用与证据支持存在差距,以角色主张为单位可合理比较不同具身智能体。

Comments 19 pages, 3 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03979 2026-08-05 cs.CV cs.AI 新提交 62%

Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent

Video-DeepResearch:迈向新一代多模态深度研究智能体

Zhen Fang, Yu Zeng, Wenxuan Huang, Yiming Zhao, Shiting Huang, Tianfei Ren, Qi Lu, Qingnan Ren, Qisheng Su, Lionel Z. Wang, Qingyu Yin, Shuang Chen, Zehui Chen, Lin Chen, Zhenfei Yin, Yao Hu, Shaohui Lin, Wanli Ouyang, Shaosheng Cao, Feng Zhao

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出Video-DR智能体框架,通过解耦感知-探索流水线与分阶段工具解锁解决现有多模态模型的模态偏差和知识泄漏问题,构建基准并在视频问答任务上取得SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03911 2026-08-05 cs.CV 新提交 57%

UniEvo-RS: Omni-Prompt Unified Remote Sensing Segmentation with Representative Exemplar-Driven Prototype Evolution

UniEvo-RS:基于代表性示例驱动原型演化的全提示统一遥感分割

Kunquan Zhang, Peilang Li, Xikun Hu, Yunkai Yang, Yushan Zou, Zhiwei Zhang, Runmin Dong

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 UniEvo-RS是配备代表性示例驱动原型演化的全提示统一遥感分割框架,通过多指令提示数据集与原型演化机制,在批量标注中对未见过的类别实现无需训练的精度提升,性能达当前最优。

Comments 18 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03715 2026-08-05 cs.LG cs.CE 新提交 57%

Amortized Interventional Forecasting for Multivariate CIR Processes

多元CIR过程的摊销干预预测

Andreas Sauter, Sumit Sourabh, Drona Kandhai, Erman Acar

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文针对多元CIR过程,提出摊销干预预测框架CIR-ACTIVA,可估计因果效应、预测多horizon冲击响应,在CDS利差测试中优于基线,能解答观测型方法无法处理的假设性查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03655 2026-08-05 cs.CL cs.AI 新提交 57%

Decoupling Generation and Selection for Budget-Constrained Faithful Summarization

面向预算约束的忠实摘要生成:解耦生成与选择

Zeyu Wang, Guanghua Wang, Meng Xu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究针对摘要式模型的事实不一致等问题,提出解耦生成与选择的模块化框架,在多数据集上提升了事实性,仅参考重叠分数略有降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03581 2026-08-05 cs.CY cs.AI 新提交 57%

AI-Assisted Peer Review Across Research Communities: From Reviewer AI Policies to LLM Review Quality

跨研究社区的AI辅助同行评审:从评审人AI政策到大语言模型评审质量

Alexander M. Fichtl, Lukas Ellinger, Josefin Kelber, Kryštof Olík, Georg Groh

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究调研111个顶尖AI/NLP会议及医学期刊的AI评审政策,评估ICLR 2026和《自然·通讯》的AI评审质量,发现AI评审存在系统性缺陷,主张采用多维度评估。

Comments 30 pages, 19 figures, 10 tables. Currently under peer review. GitHub link for code and data is given in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04002 2026-08-05 cs.HC 新提交 50%

Semantic Bundling: Interactive Node and Edge Bundling to Simplify Knowledge Graphs using Large Language Models

语义捆绑:使用大语言模型简化知识图谱的交互式节点与边捆绑

Adam Coscia, Zeyu Hua, Eric Krokos, Timothy Lin, Alex Endert

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究提出基于LLM的语义捆绑技术,在开源系统AgentK中实现,用于简化知识图谱,通过节点边捆绑形成高级结构,在电影评论等场景中可揭示文档集合新见解。

Comments Under review. 12 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03872 2026-08-05 cs.RO 新提交 50%

EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning

EvoHIL:用于鲁棒交互式强化学习的自演化奖励与流匹配策略优化

Shuoqin Zhang, Tongtong Cheng, Xiru Gao, Jinzhuo Peng, Bin Zheng, Jiahao Tu, Ke Wang, Jia Pan, Zhe Hu, Kai Liu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 EvoHIL是适配奖励模型、动作生成器和视觉域的统一交互式学习框架,在六类机械臂操纵任务中提升了成功率、运动平滑度等性能。

详情

展开后加载摘要…

URL PDF HTML 收藏