arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-24 至 2026-07-24 共收录 22 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 22 篇

2607.21595 2026-07-24 cs.CV cs.AI cs.LG 新提交 88%

3D-Aware VLMs with Implicit and Explicit Geometries

具有隐式和显式几何的3D感知视觉语言模型

Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Ran Xu, Shijian Lu, Gongjie Zhang

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) HuPan Lab(湖畔实验室)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究针对多数2D视觉输入的VLM处理3D任务困难的问题,提出VLM-IE3D框架,通过引入隐式和显式几何令牌及3D感知适配器,融合几何表示与视觉线索,在多种3D任务中表现优异。

Comments Accepted by ECCV 2026, Open Sourced

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31533 2026-07-24 cs.CV 版本更新 86%

MV-GEL: Language-Driven Multi-View Geometric Entity Localization on Meshes

MV-GEL:语言驱动的多视图网格几何实体定位

Kartik Bali, Roland Aydin

机构 * Helmholtz Zentrum Hereon(亥姆霍兹赫里恩研究中心) Institute for Continuum and Material Mechanics, Hamburg University of Technology(汉堡工业大学连续介质与材料力学研究所) German Research Center for Artificial Intelligence(德国人工智能研究中心)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出MV-GEL框架,通过语言查询定位网格上的细粒度几何实体,利用视角选择模块GELviews优先选择可观察性高的视角,结合VLM分割和光线投射提升定位精度。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21065 2026-07-24 cs.CV 新提交 85%

Do Pathology Vision-Language Models Truly See Pathology?

病理学视觉语言模型真的能‘看到’病理学吗?

Chengyang Zhang, Wenchuan Zhang, Bo Li, Xinyu Liu, Jiaming Yang, Mengran Li, Chenxun Deng, Jie Chen, Yang Zhang, Wei Ju, Yuhao Yi, Hong Bu, Jiancheng Lv

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract,abstract_cn);分类 cs.CV

AI总结 研究病理学视觉语言模型评估中被忽视的问题,提出含多类型样本的PathBind基准,通过对多个VLMs评估发现,当前病理学VLMs在答案性能与视觉语义绑定间有显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14675 2026-07-24 cs.RO cs.AI 版本更新 84%

An Intelligent-Cloud Edge Multimodal Interaction System for Robots

一种用于机器人的智能云边缘多模态交互系统

Zihan Guo, Xiaoqi Li

机构 * Hainan University(海南大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.AI

AI总结 针对复杂环境下资源受限机器人的交互问题,提出云边缘多模态交互框架,集成增强YOLO手势检测器与LLM、VLM智能体,改进手势检测方法,经实验验证该系统在手势检测精度、任务成功率及用户满意度方面表现良好,证明了方法的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10230 2026-07-24 cs.LG cs.SD eess.AS 版本更新 79%

Encode Once, Decode Never: Reusing Audio LM Internals for Efficient Temporal Localization

帧级内部工具使用用于音频语言模型中的时序定位

Joseph An, Phillip Keung, Jiaqi Wang, Orevaoghene Ahia, Noah A. Smith

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

AI总结 本文提出帧级内部工具使用方法,通过二元分类器和IHP损失提升音频语言模型的时序定位能力,实现50倍加速和鲁棒长度泛化。

Comments To appear in COLM 2026. Refer to https://github.com/inkitori/taudio/ for the codebase

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20533 2026-07-24 cs.LG cs.AI 新提交 76%

Grounding Investor Views: Neural Predicates in the Black-Litterman Model

在布莱克-利特曼模型中锚定投资者观点:神经谓词

Marcos Florencio

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI、cs.LG

AI总结 研究在布莱克-利特曼模型下投资组合构建问题,提出用神经谓词作为观点生成机制,将结构化金融分析数据经其处理后映射到模型相关矩阵,方法可解释且完全可微,实现端到端学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21496 2026-07-24 eess.SP cs.LG 新提交 74%

Toward Generalizable Cognitive Impairment Detection with Speech-Based Multimodal Large Language Models

使用基于语音的多模态大语言模型实现可泛化的认知障碍检测

Yingchao Huang, Xin Wang, Yuhan Su, Shanshan Yao

机构 * Faculty of Digital Innovation, Arts \& Sciences, Saskatchewan Polytechnic, Regina SK S4S 5X1, Canada School of Basic Medical Sciences, Hebei University, Baoding 071000, China Department of Civil \& Environmental Engineering School of Mining \& Petroleum Engineering, University of Alberta, Edmonton AB T6G 2H5, Canada

专题命中 视觉定位与Grounding :multimodal large language model(title);分类 cs.LG

AI总结 研究针对认知障碍检测问题,提出基于开源大语言模型的多模态检测框架,整合语音音频与转录文本,提取特定模态嵌入后连接成特征向量用于分类,在相关基准数据集上评估,该框架准确率达92.4%,优于单模态基线且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21574 2026-07-24 cs.CL 新提交 71%

Surprisal Theory is Tautological (without Rational Grounding)

惊奇理论是同义反复的(缺乏理性基础)

Ryan Cotterell

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 研究惊奇理论,指出其在无额外约束时是同义反复,任何难度模式都与某语言模型一致,无法证伪。长期被隐含假设掩盖,近期实证削弱该假设。结论是打破同义反复需理性主义干预,相关语言模型应源自非经验驱动模型。

Comments Under "Review" at ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20889 2026-07-24 cs.CV 新提交 70%

Engine-Native Editable 3D World Reconstruction with Objects and Lighting

使用对象和光照进行引擎原生可编辑3D世界重建

Junhao Chen, Xinghao Chen, Henghaofan Zhang, Zihao Qiao, Saining Zhang, Yongzhi Li, Ruqi Huang, Sisi Li, Yimin Sheng, Jianyi Zhu, Hao Zhao

机构 * Tsinghua University(清华大学) Nankai University(南开大学) University of Electronic Science and Technology of China(电子科技大学) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 研究旨在实现引擎原生可编辑3D世界重建。核心方法是引入Lumera管道,基于Lumera-2K数据,用Lumera-Box和Lumera-Light解析相关元素并组装。主要贡献是确立参数化灯光目标,揭示多方面剩余瓶颈,且在检测等方面取得一定分数。

Comments 18 pages, 7 figures, Project Page: https://haidilao0328.github.io/Lumera/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20814 2026-07-24 cs.AI 新提交 70%

Enhancing Explainable Cardiac Diagnosis with Guide-Grounded Multimodal LLMs

用指南引导的多模态语言模型增强可解释的心脏诊断

Hai-Nam Duy Vuong, Duy-Anh Bui, Trong-Nghia Nguyen, Kim-Ngan Thi Nguyen, Trang Mai Xuan, Tien-Cuong Nguyen, Van-Dem Pham, Thien Van Luong

机构 * Business AI Lab, College of Technology, National Economics University(商业人工智能实验室,技术学院,越南国家经济大学) A2I Lab, Phenikaa School of Computing, Phenikaa University(A2I实验室,费尼卡计算机学院,费尼卡大学) VNPT AI, VNPT Group(VNPT人工智能,VNPT集团) FPT University(FPT大学) Department of Pediatrics, Hospital of University Medicine and Pharmacy, Vietnam National University Hanoi(越南河内国家大学医学与药学院儿科学系)

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract);分类 cs.AI

AI总结 研究针对深度学习模型在心脏诊断中可解释性有限等问题,提出指南引导的多模态框架,通过卷积神经网络、Grad-CAM及结构化解释指南生成诊断报告,实验证明该方法能提升报告质量,增强临床合理性。

Comments 12 pages, 3 figures, accepted at CITA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20990 2026-07-24 cs.ET 新提交 67%

LivePhys: Transforming Static Physics Problems into Interactive Simulations via a Scan-to-Play Framework

LivePhys:通过扫描即播放框架将静态物理问题转化为交互式模拟

Xiaowei Dai, Ziyu Luo, Xiangwen Zhang, Xiaoming Chen, Juan Wu, Yonghong Ke

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract)

AI总结 研究针对教科书中静态物理问题学习的高认知负担,提出LivePhys框架,通过多模态处理构建中间表示,用大语言模型推理并由物理引擎执行生成交互式模拟,显著提升模拟性能并降低学习者认知负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20691 2026-07-24 cs.CV cs.AI 新提交 62%

Spatially Grounded Concept Bottleneck Models for Trustworthy Breast Ultrasound Diagnosis

用于可靠乳腺超声诊断的空间基础概念瓶颈模型

Moshiur Rahman Tonmoy, Dunren Che, Haitham Y. Adarbah, Afzel Noore

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究乳腺超声诊断中概念瓶颈模型可信度受监督限制问题,提出空间基础概念瓶颈模型(SG-CBM),利用病变轮廓弱监督,通过导出特定区域训练概念图,经交叉验证等提升诊断指标与概念证据空间对齐,强调数据质量监督设计及可信度验证的必要。

Comments Accepted to the Workshop on Data Quality Aware, High-Performance, and Trustworthy AI Systems for Healthcare at IEEE/ACM CHASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20653 2026-07-24 cs.RO cs.CV cs.LG 新提交 62%

PhysCoRe: Physics-Corrected Residual World Models for Material-Aware Deformable Dynamics

PhysCoRe:用于材料感知可变形动力学的物理校正残差世界模型

Haocheng Yin, Shuohan Tao, Yongsheng Chen, Lu Gan

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 针对可变形物体操作演变预测难题,提出PhysCoRe模型,结合可微MPM模拟器与两个前馈神经网络,通过MfM和RfD模块实现物理校正与残差学习,提升预测精度,其置信度分布为未来探索提供信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21327 2026-07-24 cs.DL cs.AI 新提交 57%

From Static Bibliometrics to Dynamic Knowledge Graphs: An LLM-Powered Framework for Modernizing Science, Technology, and Innovation (STI) Analytics

从静态文献计量学到动态知识图谱:一个由大语言模型驱动的框架,用于实现科学、技术与创新(STI)分析的现代化

Muhsen Hammoud

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对文献计量指标的问题,提出由大语言模型驱动、整合多种传统的混合框架,经五层架构实现,将LLMs作为候选生成器,通过多阶段验证,支持多种分析,贡献了验证中介原则并讨论治理考量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21199 2026-07-24 cs.LO cs.AI 新提交 57%

Towards a Certifying Grounder

迈向一个可验证的基础器

Daimy Van Caudenberg, Alexander Ek, Carlos Cantero, Bart Bogaerts

机构 * KU Leuven, Leuven, Belgium ARC Training Centre OPTIMA, Melbourne, Australia(比利时列日大学 澳大利亚OPTIMA培训中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究为一阶逻辑模型扩展引入可验证基础化框架CertiFOX,含证明格式、基础器GroundFOX和证明检查器CheckFOX,弥合用户规范与求解器输入的信任差距,保证输出与输入等价,实验表明该方法可行。

Comments In Proceedings ICLP 2026, arXiv:2607.17707

Journal ref EPTCS 450, 2026, pp. 309-324

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21007 2026-07-24 cs.CV 新提交 57%

Explainable Deepfake Detection Challenge

可解释的深度伪造检测挑战

Abhijeet Narang, Kartik Kuckreja, Shreya Ghosh, Muhammad Haris Khan, Usman Tariq, Jianfei Cai, Abhinav Dhall

机构 * Monash University(莫纳什大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) The University of Queensland(昆士兰大学) American University of Sharjah(沙迦美国大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 ACM多媒体2026年可解释深度伪造检测挑战基于XPlainVerse基准测试,评估图像分类及解释生成方法。参与者为图像提交真假标签与两种解释,评估结合多种指标,其成果将助力下一代可解释深度伪造检测器发展。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20780 2026-07-24 cs.CV 新提交 57%

Rethinking Open-World Video Anomaly Detection: Diagnosing Definition Blindness

重新思考开放世界视频异常检测:诊断定义盲目性

Inpyo Song, Jangwon Lee

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

AI总结 研究开放世界视频异常检测中定义盲目性问题,分解动态定义评估,引入三个定义条件评估指标及DeCoS,指出OWVAD应按定义条件异常评分评估,改进了多个基线模型的定义跟随能力。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20675 2026-07-24 cs.LG cs.NI 新提交 57%

Explanation-Based Runtime Verification for Trustworthy ML-driven Optical Networks

基于解释的运行时验证用于可信的机器学习驱动的光网络

Omran Ayoub, Carlos Natalino, Ali Al Housseini, Felix Foschum, Philipp Morger, Tiziano Leidi, David Hock, Paolo Monti

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 研究将机器学习模型用于光网络自动化时决策可靠性问题,提出基于解释的运行时验证方法,利用模型解释评估决策合理性,在光路径传输质量分类用例中验证该方法有效,能拦截错误决策并保持高自动化率。

Comments 6 Pages, 2 Figures. Accepted and presented at the 30th International Conference on Optical Network Design and Modelling (ONDM 2026), Munich, Germany, 12-15 May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20553 2026-07-24 cs.AI cs.CL 新提交 57%

CMI-Mem: Toward Generalizable Long-Term Memory Management via CMI-Augmented Reinforcement Learning

CMI-Mem:通过CMI增强的强化学习实现可泛化的长期内存管理

Yubo Wang, Qiuyu Zhao, Zenghui Sun, Shichao Dong, Jinsong Lan, Xiaoyong Zhu, Haoyang Li, Bo Zheng, Lei Chen

机构 * Alibaba Group(阿里巴巴集团) HKUST(香港科技大学) PolyU(香港理工大学) HKUST(GZ)(香港科技大学(广州))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对现有内存管理器模型局限,提出基于强化学习的CMI-Mem模型,结合下游问答正确性与内在条件互信息CMI作为混合奖励,可评估新输入信息,补充而非取代问答基础,实现可泛化的长期内存管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20498 2026-07-24 cs.AI 新提交 57%

AISE-Bench: A Full-Cycle Curated Benchmark for Information Seeking on Academic Knowledge Graphs

AISE-Bench:用于学术知识图谱信息检索的全周期精选基准测试

Fanjin Zhang, Zhengyang Wang, Ruixuan Huang, Kefan Zhang, Amy Xin, Yuanchun Wang, Shu Zhao, Evgeny Kharlamov, Jie Tang, Juanzi Li

机构 * Renmin University of China(中国人民大学) Anhui University(安徽大学) Z-Lab Z.ai Tsinghua University(清华大学) Bosch Center for AI(博世人工智能中心) University of Oslo(奥斯陆大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对学术知识图谱信息检索基准测试不足的问题,引入AISE-Bench,通过定制工作流程和综合评估协议构建基准测试,为多步API使用的大语言模型智能体提供新测试平台,助力评估与改进。

Comments 9 pages, accepted by KDD 2026

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD '26), August 09-13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21462 2026-07-24 cs.CY 新提交 50%

White Box Evidence Packages for Policy Audit Reports

政策审计报告的白盒证据包

Seunghyun Yoo

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究在政策审计中评审者如何判断报告有无证据支持,引入可控评估框架,在多种证据条件下生成报告让评审员评估。结果显示内部证据影响报告引用推理方式,混合接口最有用,随机控制揭示风险,还将内部模型访问重构为证据设计问题。

Comments 16 pages, 5 figures. Presented at the Second Workshop on Technical AI Governance Research (TAIGR) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13357 2026-07-24 cs.HC 版本更新 50%

TANDE: Disentangling Verbal and Nonverbal Backchannels in Emotional AI-Avatar Conversations with Young Adults

TANDE:在与年轻人的情感人工智能-虚拟化身对话中区分言语和非言语反馈渠道

Ann-Kareen Gedeus, Jack Good, Nadine Wagener, Angelique Taylor

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究在与年轻人的情感人工智能-虚拟化身对话中反馈渠道模式的影响,引入TANDE这个由LLM驱动的ECA,通过实验探讨其对融洽关系、同理心和参与度的作用及性别差异,得出相关设计启示。

Comments This paper has been accepted for publication at the 28th ACM International Conference on Multimodal Interaction (ICMI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏