arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-01 至 2026-05-01 共收录 18 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 18 篇

2604.24564 2026-05-01 cs.CL cs.IR cs.IT math.IT 90%

MEG-RAG: Quantifying Multi-modal Evidence Grounding for Evidence Selection in RAG

MEG-RAG: 多模态证据 grounding 的量化研究以提升 RAG 中的证据选择

Xihang Wang, Zihan Wang, Chengkai Huang, Quan Z. Sheng, Lina Yao

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家信息与自动化研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室) Zhejiang University(浙江大学) Peking University(北京大学) University of New South Wales(新南威尔士大学) Macquarie University(麦考瑞大学) CSIRO’s Data61(CSIRO 数据61)

专题命中 视觉定位与Grounding :grounding(title,title_cn);multimodal large language model(abstract)

AI总结 本文提出 MEG-RAG 框架,通过语义感知的多模态证据 grounding 方法提升 RAG 中的证据选择准确性与多模态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14044 2026-05-01 cs.CV cs.AI 88%

OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving

OmniDrive-R1: 基于强化学习的交错多模态链式推理用于可信的视觉-语言自动驾驶

Zhenguo Zhang, Haohan Zheng, Yishen Wang, Le Xu, Tianchen Deng, Xuefeng Chen, Qu Chen, Bo Zhang, Wuxiong Huang

机构 * ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) MEGVII Technology(美科维七科技) AFARI

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出OmniDrive-R1,通过交错多模态链式推理机制统一感知与推理,引入强化驱动的视觉 grounding 能力,提升自动驾驶中的推理准确性和稳定性,实验显示其在DriveLMM-o1数据集上的表现显著优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27969 2026-05-01 cs.SE cs.AI 83%

From Mirage to Grounding: Towards Reliable Multimodal Circuit-to-Verilog Code Generation

从幻象到基础:迈向可靠的多模态电路到Verilog代码生成

Guang Yang, Xing Hu, Xiang Chen, Xin Xi

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security, Hangzhou(杭州高新技术区(滨江)区块链与数据安全研究院,杭州) School of Artificial Intelligence and Computer Science, Nantong University(人工智能与计算机科学学院,南通大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出VeriGround模型,通过标识符匿名化、拒绝增强和D-ORPO对齐,解决了多模态模型在电路到Verilog代码生成中的可靠性问题,验证了真实视觉基础的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10702 2026-05-01 cs.CL cs.AI cs.IR 83%

Grounding Agent Memory in Contextual Intent

在上下文意图中 grounding 代理记忆

Ruozhen Yang, Yucheng Jiang, Yueqi Jiang, Priyanka Kargupta, Yunyi Zhang, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.AI

AI总结 STITCH通过上下文意图索引提升长周期交互的记忆检索能力,有效减少歧义和干扰,实现在动态目标轨迹中的高效检索。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07101 2026-05-01 cs.AI 83%

Grounding Machine Creativity in Game Design Knowledge Representations: Empirical Probing of LLM-Based Executable Synthesis of Goal Playable Patterns under Structural Constraints

将机器创造力扎根于游戏设计知识表示:在结构约束下对基于LLM的可执行合成目标可玩模式的实证探测

Hugh Xuechen Liu, Kıvanç Tatar

机构 * Chalmers University of Technology and University of Gothenburg(楚德大学技术学院和哥德堡大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文探讨了在结构约束下,基于LLM的可执行合成目标可玩模式的可行性,通过对比不同生成方法,揭示了结构和项目层面的瓶颈问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27934 2026-05-01 cs.AI cs.CL 81%

MM-StanceDet: Retrieval-Augmented Multi-modal Multi-agent Stance Detection

MM-StanceDet:基于检索的多模态多智能体立场检测

Weihai Lu, Zhejun Zhao, Yanshu Li, Huan He

机构 * Peking University(北京大学) Baidu Inc(百度公司) Brown University(布朗大学) Amazon(亚马逊)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);分类 cs.AI

AI总结 本文提出MM-StanceDet框架,通过整合检索增强、多模态分析代理、辩论阶段和自我反思,解决多模态立场检测中的上下文 grounding、跨模态解释模糊和单次推理脆弱问题,实验表明其在五个数据集上优于现有方法。

Comments Accepted on ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27600 2026-05-01 cs.IR 80%

Purifying Multimodal Retrieval: Fragment-Level Evidence Selection for RAG

净化多模态检索:用于RAG的片段级证据选择

Xihang Wang, Zihan Wang, Chengkai Huang, Cao Liu, Ke Zeng, Quan Z. Sheng, Lina Yao

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract)

AI总结 本文提出FES-RAG框架,通过片段级证据选择提升多模态检索效果,减少噪声干扰,实验显示在M2RAG基准上性能提升27%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07180 2026-05-01 cs.CL cs.AI cs.CV 79%

Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs

视频中的奉承:视频大语言模型中奉承行为的基准测试与分析

Wenrui Zhou, Mohamed Hendy, Shu Yang, Qingsong Yang, Zikun Guo, Yuyu Luo, Lijie Hu, Di Wang

机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证负责任人工智能与数据 analytics 实验室) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹科学与技术大学) HKUST(香港科技大学) MBZUAI(穆罕默德·本·拉希德人工智能研究所) University of Science and Technology of China(中国科学技术大学) Kyungpook National University(庆尚国立大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VISE基准,用于评估视频大语言模型在面对误导性输入时的奉承行为,通过多类型分析和两种无训练缓解策略提升模型可靠性。

Comments 27 Pages, Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28181 2026-05-01 cs.AI cs.CL cs.LG 62%

Synthetic Computers at Scale for Long-Horizon Productivity Simulation

大规模合成计算机用于长期生产力模拟

Tao Ge, Baolin Peng, Hao Cheng, Jianfeng Gao

机构 * Microsoft(微软)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出大规模合成计算机方法,通过生成真实文件夹结构和内容丰富的 artifacts,模拟长期生产力场景,验证了其在不同领域中的有效性。

Comments Preview version; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12632 2026-05-01 cs.CV cs.LG 62%

TeD-Loc: Text Distillation for Weakly Supervised Object Localization

TeD-Loc: 文本蒸馏用于弱监督目标定位

Shakeeb Murtaza, Soufiane Belharbi, Alexis Guichemerre, Marco Pedersoli, Eric Granger

机构 * LIVIA, ILLS, Dept. of Systems Engineering, ETS Montreal, Canada(LIVIA、ILLs、系统工程系、蒙特利尔工程学院,加拿大)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 TeD-Loc通过对比对齐将CLIP文本嵌入迁移到patch嵌入,实现patch级的前景/背景定位,并引入定位引导的分类模块以提升定位与分类的联合性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28115 2026-05-01 cs.RO cs.CV 57%

FreeOcc: Training-Free Embodied Open-Vocabulary Occupancy Prediction

FreeOcc: 无需训练的具身开放词汇占用预测

Zeyu Jiang, Changqing Zhou, Xingxing Zuo, Changhao Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) MBZUAI

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 FreeOcc通过四层流程实现无需3D标注的开放词汇占用预测,相比传统方法在EmbodiedOcc-ScanNet上提升IoU和mIoU超过2倍,并引入ReplicaOcc基准测试新环境性能。

Comments RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27725 2026-05-01 cs.HC cs.AI 57%

AgentEconomist: An End-to-end Agentic System Translating Economic Intuitions into Executable Computational Experiments

AgentEconomist:一个端到端的代理系统,将经济直觉转化为可执行的计算实验

Jiaju Chen, Jinghua Piao, Xia Xu, Songwei Li, Tong Xia, Xiangnan He, Yong Li

机构 * Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Vanke School of Public Health, Tsinghua University(清华大学万科公共卫生学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 AgentEconomist通过模块化多阶段架构,将经济直觉转化为可执行的计算实验,通过文献基础假设生成、实验设计和执行阶段,结合人类与AI协作,提升研究创新性与文献相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27105 2026-05-01 cs.CV 57%

Automated Detection of Mutual Gaze and Joint Attention in Dual-Camera Settings via Dual-Stream Transformers

通过双流Transformer实现双摄像头设置中互视与联合注意的自动检测

Jakub Kosmydel, Paweł Gajewski, Arkadiusz Białek

机构 * AGH University(AGH大学) Jagiellonian University(雅盖隆大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出双流Transformer架构,用于从同步双摄像头记录中自动检测互视与联合注意,通过冻结的注视感知骨干网络和自定义令牌融合机制,有效提升了多摄像头实验室环境下的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27846 2026-05-01 cs.CL 50%

Multi-Level Narrative Evaluation Outperforms Lexical Features for Mental Health

多层级叙事评估在心理健康预测中优于词法特征

Yuxi Ma, Jieming Cui, Muyang Li, Ye Zhao, Yu Li, Yixuan Wang, Chi Zhang, Yinyin Zang, Yixin Zhu

机构 * Institute for Artificial Intelligence(人工智能研究院) School of Psychological and Cognitive Sciences(心理学与认知科学学院) School of Intelligence Science and Technology(智能科学与技术学院) State Key Laboratory of General AI(通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health(北京行为与心理健康重点实验室) PKU-Changsha Institute for Computing and Digital Economy(北京大学长沙计算与数字经济研究院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出多层级框架,通过830篇中文治疗文本验证,宏观层面的LLM叙事评估在心理健康预测中表现最佳,挑战了词频统计为主的传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27821 2026-05-01 cs.RO 50%

Learning-Based Hierarchical Scene Graph Matching for Robot Localization Leveraging Prior Maps

基于学习的分层场景图匹配用于利用先验地图的机器人定位

Nimrod Millenium Ndulue, Jose Andres Millan-Romera, Matteo Giorgi, Holger Voos, Jose Luis Sanchez-Lopez

机构 * Automation and Robotics Research Group, Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg(卢森堡大学自动化与机器人研究组,安全、可靠性与信任跨学科研究中心(SnT))

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出一种端到端可微 pipeline,通过语义驱动的边类型增强场景图,实现从高层房间概念到低层墙面的同步匹配,优于组合基线,在真实LiDAR环境中运行更快且具备零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08678 2026-05-01 cs.SE cs.HC 50%

The Ultimate Configuration Management Tool? Lessons from a Mixed Methods Study of Ansible's Challenges

终极配置管理工具?来自对Ansible挑战的混合方法研究的启示

Carolina Carreira, Nuno Saavedra, Alexandra Mendes, João F. Ferreira

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过混合方法研究Ansible面临的挑战,揭示了改进Ansible的关键方向,包括增强故障本地性、明确语言与模板边界、针对性文档和改进执行后端,为配置管理工具设计提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27000 2026-05-01 cs.SE cs.CR cs.PL 50%

Adaptive and AI-Augmented Security Testing: A Systematic Survey of Program Analysis, Feedback-Driven Testing, and Hybrid Learning-Based Approaches

自适应与AI增强的安全测试:程序分析、反馈驱动测试和基于混合学习方法的系统性综述

Michael Wienczkowski

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文系统综述了自适应和AI增强的安全测试研究,探讨了程序分析、DevSecOps、反馈驱动模糊测试、LLM自动化测试生成及混合系统等五个领域,揭示了结构化程序表示与自适应测试机制之间的断层,并提出五个开放研究挑战。

Comments 29 pages, submitted for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21995 2026-05-01 cs.HC 50%

Emergent Technology, Emergent Critique: Students and Teachers Developing Critical AI Literacy through Participatory Design around Generative AI

涌现技术,涌现批判:学生和教师通过参与式设计围绕生成式AI发展批判性AI素养

Santiago Ojeda-Ramirez, Eva Durall Gazulla, Kylie Peppler

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文探讨学生和教师通过参与式设计发展批判性AI素养,揭示了共同质疑AI假设、互补学习和基于文化知识的AI批判三种核心实践。

详情

展开后加载摘要…

URL PDF HTML 收藏