arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-13 至 2026-08-13 共收录 23 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 1 篇

2607.12310 2026-08-13 cs.CL cs.AI 版本更新 57%

LakeQuest: A Three-Domain Benchmark for Grounded Question Answering across Data Lakes

LakeQuest:用于跨数据湖的有基础问答的三领域基准测试

Michael Solodko, Steven Gong, Guangwei Yu, Satya Krishna Gorti, Jesse C. Cresswell, Victor Zhong

机构 * University of Waterloo(滑铁卢大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 介绍LakeQuest基准测试,用于评估跨数据湖的有基础问答。它跨越三个领域,含9846个QA对及证据指针,能暴露系统故障模式。通过基线评估发现高质量检索不能保证正确推理,凸显未来智能QA系统需强大发现和跨文件组合机制。

Comments 24 pages, 4 figures, 18 tables. Accepted at the Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 4 篇

2607.26608 2026-08-13 cs.CV 版本更新 91%

Understanding Knowledge Transfer Mechanism in Heterogeneous MLLM Fusion: A Simple Linear Approach

理解异构多模态大语言模型(MLLM)融合中的知识迁移机制:一种简单线性方法

Yinghao Hou, Jiahe Fan, Yuanhao Pu, Zongyuan Chen, Hong Xie

专题命中 视觉推理 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 该研究针对异构MLLM跨规模知识迁移机制,提出CDPI线性探针,经多组模型与基准测试发现,融合增益集中于高层推理,且正向迁移多发生在小比率区间。

Comments 17 pages, 6 figures; includes supplementary material. Revised presentation and terminology; results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19985 2026-08-13 cs.CV 版本更新 77%

Vision-Reasoning-Guided Occlusion Removal from Light Fields

视觉推理引导的光场遮挡去除

Mohamed Youssef, Oliver Bimber

机构 * Johannes Kepler University(约翰·开普勒大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出结合光场积分与视觉语言模型的框架,通过多视图融合和语义先验恢复被遮挡场景,在合成和真实数据上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08837 2026-08-13 cs.LG cs.AI 版本更新 73%

Prompt-Driven Exploration

提示驱动的探索

Sunshine Jiang, John Marangola, David Zhang, Raghuram Kowdeed, Ruiyang Luo, Nitish Dashora, Richard Li, Pulkit Agrawal, Zhang-Wei Hong

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) Improbable AI Lab(英普罗巴布尔人工智能实验室)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

AI总结 研究针对强化学习中探索难的问题,提出提示驱动的探索策略(PDE),利用视觉-语言模型对轨迹视频推理,从弱策略轨迹中优化提示,实现后验采样,能让强化学习从零奖励起步学习成功策略并提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11150 2026-08-13 cs.CV 版本更新 57%

CausalSplat: Towards Comprehensive Hierarchical Reasoning in 3D Gaussian Splatting

CausalSplat:面向3D高斯溅射的综合层级推理

Jiayu Ding, Meilu Song, Yun Chen, Wei Gao, Ge Li

机构 * Peking University(北京大学) North China Electric Power University(华北电力大学) Hunan University(湖南大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 针对3D高斯溅射推理局限,本文提出CausalSplat框架,结合视觉语言模型与3D场景图,构建两个推理基准,在相关任务上实现最优性能与强泛化性。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 9 篇

2603.08131 2026-08-13 cs.RO cs.CV 版本更新 83%

UniGround: Universal 3D Visual Grounding via Training-Free Scene Parsing

UniGround: 通过无训练场景解析实现通用三维视觉接地

Jiaxi Zhang, Yunheng Wang, Wei Lu, Taowen Wang, Shuning Zhang, Yixiao Feng, Junzhe Xu, Shunwang Sun, Weisheng Xu, Yuetong Fang, Renjing Xu

机构 * The Hong Kong University of Science and Technology(Guangzhou)(香港科学与技术大学(广州)) Shanghai Normal University(上海师范大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract);分类 cs.CV

AI总结 UniGround通过无训练的视觉和几何推理实现通用三维视觉接地,超越训练数据限制,在ScanRefer和EmbodiedScan上取得新突破。

Comments 30 pages,9 figures,11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23733 2026-08-13 cs.CL 版本更新 80%

Multimodal QUD: Inquisitive Questions from Scientific Figures

多模态QUD:来自科学图表的探究性问题

Yating Wu, William Rudman, Venkata S Govindarajan, Alexandros G. Dimakis, Junyi Jessy Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Ithaca College(伊萨卡学院) UC Berkeley, BespokeLabs.ai(伯克利大学,BespokeLabs.ai)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract_cn);VLM(abstract_cn)

AI总结 本文提出多模态QUD数据集,通过结合图表与文本上下文生成探究性问题,提升多模态推理能力,实现更高质量的视觉 grounding。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11839 2026-08-13 cs.LG 版本更新 79%

Grounding Large Language Models as Generalizable Policies in Network Control

大语言模型作为网络优化的通用策略

Duo Wu, Linjia Kang, Zhimin Wang, Fangxin Wang, Wei Zhang, Chongbo Sun, Xuefeng Tao, Wei Yang, Le Zhang, Wenwu Zhu, Peng Cui, Zhi Wang

机构 * Bytedance(字节跳动) Shenzhen International Graduate School(深圳国际研究生院) Tsinghua University(清华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Department of Computer Science and Technology(计算机科学与技术系)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

AI总结 本文提出Trailblazer框架,利用大语言模型实现跨任务和环境的通用网络策略,通过网络对齐和策略协作机制提升效率与泛化能力。

Comments Arxiv version. Official version has been submitted to IEEE Transactions on Mobile Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14098 2026-08-13 cs.CV 版本更新 77%

ForgeryVCR: Visual-Centric Reasoning via Efficient Forensic Tools in MLLMs for Image Forgery Detection and Localization

ForgeryVCR: 通过高效的取证工具在MLLMs中实现视觉中心推理用于图像伪造检测与定位

Youqi Wang, Shen Chen, Haowei Wang, Rongxuan Peng, Taiping Yao, Shunquan Tan, Changsheng Chen, Bin Li, Shouhong Ding

机构 * Shenzhen University(深圳大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 ForgeryVCR通过高效的取证工具实现视觉中心推理,提升图像伪造检测与定位的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09996 2026-08-13 cs.CV 版本更新 70%

Omni-Persona: Systematic Benchmarking and Improving Omnimodal Personalization

Omni-Persona:系统性基准测试与改进多模态个性化

Yeongtak Oh, Dongwook Lee, Sangkwon Park, Heeseung Kim, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电气与计算机工程系) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能跨学科项目) Department of Artificial Intelligence, University of Seoul(首尔大学人工智能系)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 Omni-Persona提出首个多模态个性化基准,通过Persona Modality Graph任务组和细粒度任务,系统分析多模态个性化中的接地行为,提出Calibrated Accuracy评估方法,揭示开源模型在音频与视觉接地上的差距及SFT与RLVR的局限性。

Comments Project Page: https://github.com/oyt9306/Omni-Persona

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24528 2026-08-13 cs.CV cs.AI 版本更新 62%

CORE-3D: Context-aware Open-vocabulary Retrieval by Embeddings in 3D

CORE-3D: 基于嵌入的上下文感知开放词汇检索

Mohamad Amin Mirzaei, Pantea Amoie, Ali Ekhterachian, Matin Mirzababaei, Babak Khalaj

机构 * Department of Electrical Engineering, Sharif University of Technology(电气工程系,谢里夫大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 CORE-3D通过结合上下文感知的CLIP编码和渐进粒度细化,提升3D场景理解中开放词汇检索和语义分割的准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25758 2026-08-13 cs.CV 版本更新 57%

Dual Distribution Estimation for Zero-shot Noisy Test-Time Adaptation with VLMs

基于双分布估计的零样本噪声测试时自适应方法

Wenjie Zhu, Yabin Zhang, Liang Xu, Xin Jin, Wenjun Zeng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 针对噪声测试时自适应中分布外异常值问题,提出双分布估计框架,通过无训练的高斯分布建模实现零样本鲁棒自适应。

Comments Accepted by ECCV2026. Project Page:https://zhuwenjie98.github.io/DDE-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27101 2026-08-13 cs.CV cs.CL 版本更新 57%

Pop-Up Distractions Reveal Bag-of-Events Behavior in Video Large Language Models

弹出式干扰揭示视频大语言模型中的事件袋行为

Oscar Chew, Serhii Honcharenko, Qian-Hui Chen, Patricia Lu, Dishant Zaveri, Khoa D. Doan, Kuan-Hao Huang

机构 * Texas A&M University(德克萨斯A&M大学) National Taiwan University(台湾国立大学) Stanford University(斯坦福大学) VinUniversity(文大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 通过插入无关广告片段,发现视频大语言模型常将不同片段的事件错误关联,表现出将视频视为事件集合而非时间序列的“事件袋”行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24861 2026-08-13 cond-mat.stat-mech cs.IT math.IT 版本更新 50%

First-Order Recoverability Collapse in Self-Referential Information Decoders

自指信息解码器中的一阶可恢复性崩溃

Pieter van Rooyen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究自适应系统在持续非平衡驱动下耦合推理与不可逆动作的可恢复性,发现容量饱和导致可恢复性丧失和诊断发散,反馈使转变变为一阶,出现双稳态区域和滞后现象。

Comments 25 pages, 5 figures, 2 tables. v2: substantially revised - narrowed classification claim (trained artifact vs operating loop), closed-loop phase diagram, instrumented-pipeline measurements with empirical-service spinodal analysis. Part of the Recoverable Self-Coding program (Entropy 2026, Barcelona)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2605.16409 2026-08-13 cs.CV cs.CL cs.LG 版本更新 86%

Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models

多语言OCR感知微调和提示引导的链式思维推理用于多模态大语言模型

Qinwu Xu, Yifan Jiang, Haoyu Ren

机构 * Meta AI UT Austin(德克萨斯大学奥斯汀分校)

专题命中 文档图表理解 :multimodal large language model(title,abstract);grounding(abstract);MLLM(abstract);分类 cs.CV、cs.LG

AI总结 提出一种多语言OCR感知的多模态训练框架,通过合成数据生成、OCR感知微调和结构化视觉链式思维提示,提升多模态大语言模型在复杂视觉条件下的OCR完整性和多语言翻译准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 2 篇

2607.14616 2026-08-13 cs.AI cs.CV 版本更新 73%

SportD: How do VLMs physically strategize?

SportD:视觉语言模型能进行物理策略制定吗?

Jasin Cekinmez, Addison J. Wu, Haotian Xia, Kyumin Andrew Shim, Anay Putty, Jinglin Xiao, Zhuohan Liu, Leo Liu, Weining Shen

机构 * Princeton University(普林斯顿大学) Rice University(莱斯大学) UC Irvine(加州大学欧文分校) POSTECH(浦项科技大学) NYU Shanghai(纽约大学上海分校) UC Santa Barbara(加州大学圣塔芭芭拉分校) Zhejiang University(浙江大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 研究视觉语言模型在足球场景中能否进行物理策略制定,引入SportD基准,通过控球价值模型评估模型决策,发现模型表现低于职业球员,有偏好低方差低回报动作等问题,为衡量模型物理策略推理提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00237 2026-08-13 cs.CV cs.RO 版本更新 57%

Latent-Centroid Steering: Single-Pass Classifier-Free Guidance for Command-Aligned Autonomous Driving

隐式质心引导:用于指令对齐自动驾驶的单次无分类器引导

Meibo Hu, Jiamian Wang, Pichao Wang, Zhiqiang Tao

机构 * Rochester Institute of Technology(罗切斯特理工学院) NVIDIA(英伟达公司)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 针对视觉语言自动驾驶模型的指令跟随差距,提出单次引导机制LCS,降低推理延迟约50%,在Bench2Drive和nuScenes基准上提升指令遵循与驾驶性能。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 3 篇

2607.11175 2026-08-13 cs.AI 版本更新 57%

The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Autonomy

自我进化临床系统之路:将医疗智能体从辅助扩展到自主

Chunzheng Zhu, Lei Tian, Bohan Tan, Ziqi Zhou, Yuxuan Sun, Yijun Wang, Chengchao Lv, Yilin Wen, Yijun He, Jinghao Lin, Yihang Chen, Chee Wei Tan, Qianshan Wei, Lei Zhao, Bin Pu, Kenli Li, Yuan Xue, Jianxin Lin

机构 * Hunan University(湖南大学) ByteDance(字节跳动) Duke University(杜克大学) Westlake University(西湖大学) The University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Macau(澳门大学) The Ohio State University(俄亥俄州立大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 研究探讨大语言模型等对医疗智能体的重塑,从临床部署出发,将其形式化为决策系统并给出自主性分类。沿统一框架扩展,强调临床环境扩展为关键方向,定位临床自我进化为前沿,还研究了多领域应用及挑战,提供医学成像系统路线图。

Comments Project page: https://github.com/zhcz328/Awesome-Medical-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29055 2026-08-13 cs.AI cs.MA 版本更新 57%

Hallucination Mitigation with Agentic AI, Nested Learning, and AI Sustainability via Semantic Caching

基于智能体AI、嵌套学习与语义缓存的幻觉缓解与AI可持续性

Diego Gosmar, Deborah A. Dahl

机构 * Head of AI, Tesisquare Member, Open Voice Interoperability Initiative Linux Foundation AI & Data(AI负责人,Tesisquare成员,开放语音互操作性倡议Linux基金会AI与数据) Principal, Conversational Technologies Member, Open Voice Interoperability Initiative Linux Foundation AI & Data(首席科学家,对话技术成员,开放语音互操作性倡议Linux基金会AI与数据)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 提出一种HOPE启发的嵌套学习架构,结合连续记忆系统和语义缓存,通过三阶段智能体管道在混合基准上实现幻觉缓解,同时降低能耗并提高可观测性。

Comments 33 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24060 2026-08-13 cs.RO 版本更新 50%

RoboHarness: A Memory-Augmented Policy Harness for Vision-Language-Action Model Robustness via In-Context Adaptation

SOMA:通过上下文适应提升视觉-语言-动作模型鲁棒性的战略编排与内存增强系统

Zhuoran Li, Zhiyang Li, Kaijun Zhou, Jinyu Gu

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract)

AI总结 SOMA通过对比双记忆检索增强生成(RAG)、归因驱动大语言模型(LLM)编排器和可扩展模型上下文协议(MCP)干预,提升视觉-语言-动作模型在分布外任务中的鲁棒性,实验表明其在长周期任务链中提升了89.1%的绝对成功率。

Comments 8 pages, 10 figures, 4 tables. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Project page and source code: https://github.com/LZY-1021/RoboHarness

详情

展开后加载摘要…

URL PDF HTML 收藏

7. VLM训练与架构 3 篇

2603.17450 2026-08-13 cs.IR cs.AI 版本更新 85%

VLM2Rec: Resolving Modality Collapse in Vision-Language Model Embedders for Multimodal Sequential Recommendation

VLM2Rec: 解决视觉语言模型嵌入器在多模态序列推荐中的模态崩溃问题

Junyoung Kim, Woojoo Kim, Wonbin Kweon, Jaehyung Lim, Dongha Kim, Hwanjo Yu

机构 * Pohang University of Science

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出VLM2Rec框架,通过弱模态惩罚对比学习和跨模态关系拓扑正则化,解决多模态序列推荐中模态崩溃问题,提升推荐准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08891 2026-08-13 cs.CE 版本更新 82%

Ortho2CAD: 3D CAD generation from orthographic drawings using vision language models

Ortho2CAD:使用视觉语言模型从正投影图生成3D CAD

Aditya Joglekar, Amit Regmi, Kenji Shimada, Levent Burak Kara

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract)

AI总结 研究旨在解决工程设计中从正投影图到3D CAD模型转换的问题,核心方法是利用视觉语言模型Ortho2CAD,通过监督微调与强化学习训练,借助绘图生成器实现大规模学习,主要贡献是代码有效率高且3D CAD精度超基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11211 2026-08-13 cs.CV cs.AI 版本更新 81%

A Simple Efficiency Incremental Learning Framework via Vision-Language Model with Nonlinear Multi-Adapters

通过非线性多适配器的视觉-语言模型实现简单的效率增量学习框架

Haihua Luo, Xuming Ran, Jiangrong Shen, Timo Hämäläinen, Zhonghua Chen, Qi Xu, Fengyu Cong

机构 * Faculty of Information Technology, University of Jyväskylä(信息科技学院,于韦斯屈耶大学) National University of Singapore(新加坡国立大学) Lab of Brain-Machine Intelligence, Zhejiang University(脑机智能实验室,浙江大学) School of Computer Science and Technology, Dalian University of Technology(计算机科学与技术学院,大连理工大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出SimE框架,利用视觉-语言模型与适配器提升增量学习效率,发现适配器连接数与模型能力呈非线性关系,实验表明在TinyImageNet和CIFAR-100上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏