arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-29 至 2026-06-29 共收录 11 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 11 篇

2505.10764 2026-06-29 cs.CV 版本更新 89%

SurgXBench: Explainable Vision-Language Model Benchmark for Surgery

SurgXBench: 可解释的视觉-语言模型手术基准

Jiajun Cheng, Xianwu Zhao, Sainan Liu, Xiaofan Yu, Ravi Prakash, Patrick J. Codd, Jonathan Elliott Katz, Shan Lin

机构 * Arizona State University(亚利桑那州立大学) Intel Labs(英特尔实验室) Duke University(杜克大学) University of Miami(迈阿密大学) University of California, Merced(加州大学默塞德分校)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV

AI总结 针对手术视觉-语言模型(VLM)泛化能力不足的问题,提出SurgXBench基准,在零样本设置下评估多个先进VLM在器械与动作分类任务上的表现,并集成可解释AI分析模型注意力与因果解释,揭示模型依赖弱上下文线索而非临床相关证据的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27999 2026-06-29 cs.CV 新提交 77%

HumanMoveVQA: Can Video MLLMs reason about human movement in videos?

HumanMoveVQA:视频多模态大语言模型能否推理视频中的人类运动?

Pulkit Gera, Faegheh Sardari, Asmar Nadeem, Valentina Bono, Padraig Boulton, Adrian Hilton, Armin Mustafa

机构 * CVSSP, University of Surrey, Guildford, UK(萨里大学视觉、语音与信号处理中心,英国吉尔福德) Tesco, UK(乐购,英国)

专题命中 视觉推理 :MLLM(summary_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出HumanMoveVQA基准,通过世界坐标系下的3D运动轨迹生成问答对,评估视频MLLM在全局轨迹和方向推理上的能力,发现现有模型存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28164 2026-06-29 cs.CV cs.LG 新提交 62%

EchoSonar-R: A Multi-View Reasoning-Enabled Model for Disease Classification and Report Generation in Echocardiography

EchoSonar-R: 一种用于超声心动图疾病分类和报告生成的多视图推理增强模型

Darya Taratynova, Ahmed Aly, Numan Saeed, Mohammad Yaqub

机构 * Division of Computing and Mathematical Sciences, Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI), Abu Dhabi, UAE(穆罕默德·本·扎耶德人工智能大学计算与数学科学系,阿布扎比,阿联酋)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 提出EchoSonar-R,一种结合时空视频编码器和结构感知心脏检测器的多视图推理视觉语言模型,通过两阶段训练(监督微调+组相对策略优化)联合实现多标签疾病分类和报告生成,在私有数据集和公共基准上分别提升宏平衡准确率17.1%和6.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27926 2026-06-29 cs.AI cs.CL cs.CV 新提交 62%

Verifiable Geometry Problem Solving: Solver-Driven Autoformalization and Theorem Proposing

可验证几何问题求解:求解器驱动的自动形式化与定理提出

Can Li, Ting Zhang, Junbo Zhao, Hua Huang

机构 * Beijing Normal University(北京师范大学)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 提出SD-GPS框架,通过求解器驱动的自动形式化和可验证定理提出,解决几何问题求解中神经符号方法的瓶颈,在Geometry3K和PGPS9K上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09731 2026-06-29 cs.CV cs.AI cs.CL 版本更新 62%

EXPLORE-Bench: Egocentric Scene Prediction with Long-Horizon Reasoning

EXPLORE-Bench:具有长视距推理的自我中心场景预测

Chengjun Yu, Xuhan Zhu, Chaoqun Du, Pengfei Yu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Foundation Model Team, Li Auto Inc.(蔚来汽车基础模型团队) Tsinghua University(清华大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出EXPLORE-Bench基准,通过初始场景图像和动作序列预测最终场景,评估多模态大模型在自我中心长视距推理中的能力,发现与人类存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27988 2026-06-29 cs.CV 新提交 57%

Latent Visual Diffusion Reasoning with Monte Carlo Tree Search

潜在视觉扩散推理与蒙特卡洛树搜索

Xirui Teng, Nan Xi, Junsong Yuan

机构 * Beijing Jiaotong University(北京交通大学) Virginia Commonwealth University(弗吉尼亚联邦大学) University at Buffalo(布法罗大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

AI总结 提出LVDR框架,结合关键点引导的蒙特卡洛树搜索,实现细粒度技能活动的可解释视觉推理,在多个体育和手术数据集上取得竞争性表现。

Comments Accepted to ECCV 2026. Project page: https://github.com/XiruiTeng/LVDR_Official.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27828 2026-06-29 cs.CV 新提交 57%

Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning

Video-MME-Logical: 面向视频时序逻辑推理的受控诊断基准

Hohin Kwan, Hongyu Li, Ray Zhang, Manyuan Zhang, Xianghao Kong, Anyi Rao, Jiahao Xie, Si Liu

机构 * HKUST(香港科技大学) Colab, Beihang University(北京航空航天大学合作实验室) CUHK(香港中文大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 为隔离评估多模态大模型在视频中的时序逻辑推理能力,提出包含五种时序逻辑操作和25个细粒度任务类别的受控基准,通过控制时间跨度和推理复杂度进行难度可控评估,并支持中间状态诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20328 2026-06-29 cs.CV 版本更新 57%

HyLaR: Hybrid Latent Reasoning with Decoupled Policy Optimization

混合潜在推理与解耦策略优化

Tao Cheng, Shi-Zhe Chen, Hao Zhang, Yixin Qin, Jinwen Luo, Zheng Wei

机构 * Tencent PCG(腾讯PCG) Tencent CSIG(腾讯CSIG)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出HyLaR框架,通过结合离散文本生成与连续视觉潜在表示,提升多模态大语言模型在细粒度感知和通用多模态理解中的性能。

Comments Accepted to ECCV 2026

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20239 2026-06-29 cs.RO cs.CV 版本更新 57%

Rheos: Modelling Continuous Motion Dynamics in Hierarchical 3D Scene Graphs

Rheos: 分层3D场景图中的连续运动动态建模

Iacopo Catalano, Francesco Verdoja, Javier Civera, Jorge Peña-Queralta, Julio A. Placed

机构 * University of Turku(图尔库大学) Centre for Artificial Intelligence, Zürich University of Applied Sciences(应用科学大学人工智能中心) Instituto Tecnológico de Aragón (ITA) and the University of Zaragoza(阿拉贡理工大学和萨拉戈萨大学) University of Zaragoza(萨拉戈萨大学) School of Electrical Engineering, Aalto University(艾尔沃斯大学电气工程学院)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 提出Rheos框架,将连续方向运动模型嵌入分层3D场景图的动态层,通过半包裹高斯混合模型捕获多模态方向流,并采用水库采样和贝叶斯信息准则实现在线操作,优于离散基线方法。

Comments Accepted at IROS 2026, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11266 2026-06-29 cs.CV 版本更新 57%

GraphPilot: Grounded Scene Graph Conditioning for Language-Based Autonomous Driving

GraphPilot: 基于场景图条件化的语言自主驾驶

Fabian Schmidt, Markus Enzweiler, Abhinav Valada

机构 * Esslingen University of Applied Sciences(埃斯林根应用科学大学) University of Freiburg(弗赖堡大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 提出GraphPilot方法,通过交通场景图序列化与结构化提示模板,将关系上下文注入语言驾驶模型,显著提升驾驶分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03180 2026-06-29 cs.CL 50%

BengaliMoralBench: A Benchmark for Auditing Moral Reasoning in Large Language Models within Bengali Language and Culture

BengaliMoralBench:一种用于审计大型语言模型道德推理的基准,针对孟加拉语和文化

Shahriyar Zaman Ridoy, Azmine Toushik Wasi, Koushik Ahamed Tonmoy, Taki Hasan Rafi, Dong-Kyu Chae

机构 * North South University(北南大学) Computational Intelligence and Operations Laboratory(计算智能与运营实验室) Hanyang University(翰林大学)

专题命中 视觉推理 :grounding(abstract)

AI总结 本文提出BengaliMoralBench,一个针对孟加拉语和文化背景的道德推理评估基准,涵盖五个道德领域,通过三种伦理框架进行标注,评估不同模型的性能差异及文化适应性问题。

Comments Accepted at ACM FAccT 2026

Journal ref ACM FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏