arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-06 至 2026-08-06 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 5 篇

2608.04765 2026-08-06 cs.RO cs.AI cs.CV 新提交 82%

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models

用于视觉-语言-动作模型长程规划的显式语言记忆

Houze Xu, Jizhong Li, Ziyi Ye

机构 * Fudan University(复旦大学)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对视觉-语言-动作模型长程规划的挑战,提出带显式语言记忆模块的分层架构,经仿真与实机实验验证,可提升复杂长程任务的成功率、鲁棒性与决策可解释性。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01147 2026-08-06 cs.IR cs.CL cs.CV 版本更新 79%

UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering

UniHEAR:面向基于知识的视觉问答的统一异构源注意力检索

Ganzhong Luo, Yang Ren, Hanyong Wang, Shuyu Zheng, Menglong Yang

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 针对KB-VQA现有系统的单源检索瓶颈与检索源盲重排序问题,提出UniHEAR框架,在E-VQA和InfoSeek数据集上实现最优检索与VQA性能,提升Recall@1达6.7和1.2个点。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04515 2026-08-06 cs.CV cs.AI cs.CL 新提交 79%

CARVE: Cross-Slice Anisotropic Reallocation of Visual Evidence for Efficient 3D Medical Volume Understanding

CARVE:用于高效3D医学体积理解的视觉证据跨切片各向异性重分配

Zhenyu Yi, Qiang Hu, Zhenhao Li, Jiaxuan Zhao, Yusong Sun, Lichi Zhang

专题命中 视觉问答 :MLLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对3D医学体积理解中切片式MLLM的视觉令牌冗余问题,提出无需训练的CARVE框架,通过跨切片各向异性重分配压缩80%令牌,在AMOS-MM等基准上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04589 2026-08-06 cs.CV cs.AI 新提交 62%

The First EgoCross Challenge at EgoVis 2026: Cross-Domain Egocentric Video Question Answering

2026年EgoVis首届EgoCross挑战赛:跨域自我中心视频问答

Yuqian Fu, Tianwen Qian, Yanjun Li, Yu Li, Kunyu Peng, Xu Zheng, Yongqin Xian, Alessio Tonioni, Yanwei Fu, Xiaoling Wang, Danda Paudel, Federico Tombari, Luc Van Gool, Leyi Wu, Yifan Zhao, Jinjie Zhang, Yinchuan Li, Yingcong Chen, Zixu Li, Zhiwei Chen, Zhiheng Fu, Wenbo Wang, Yupeng Hu, Weili Guan, Liqiang Nie, Takuya Murakawa, Toru Tamaki, Yi Wen, Zhenglin Du, Zhengyang Li, Lingling Li, Licheng Jiao, Wenping Ma

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文介绍2026年EgoVis研讨会举办的首届EgoCross跨域自我中心视频问答挑战赛,含两个赛道,共获1500余份提交,公布结果与获胜方案,资源公开以推进相关研究。

Comments 1st EgoCross challenge @ EgoVis workshop, CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04124 2026-08-06 cs.CV cs.AI 新提交 62%

Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering

推理前的感知:面向视频理解与问答的动态隐式推理

Haotian Xia, Zilin Xiao, Junbo Zou, Vicente Ordonez, Hanjie Chen

机构 * Rice University(莱斯大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对视频问答现有方法依赖长文本思维链的问题,提出DyLaR模型,通过动态调整感知与推理隐式变量的使用,在9个视频基准上提升准确率且缩短响应长度。

详情

展开后加载摘要…

URL PDF HTML 收藏