arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-17 至 2026-07-17 共收录 16 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 16 篇

2605.21751 2026-07-17 cs.LG 版本更新 85%

Models Can Model, But Can't Bind: Structured Grounding in Text-to-Optimization

模型可以建模,但无法绑定:文本到优化中的结构化 grounding

Zhiqi Gao, Albert Ge, Alexander Berenbeim, Nathaniel D. Bastian, Frederic Sala

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) United States Military Academy(美国军事学院)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.LG

AI总结 本文研究了文本到优化任务中建模与绑定两个关键能力的分离性,发现随着实例数据增长,模型准确性下降,提出BIND方法通过结构化文件外部化数据来提升绑定性能,验证了绑定专精模型在不同优化类别中的优势。

Comments Accepted to COLM 2026. Code and data: https://github.com/SprocketLab/Text2Opt-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15216 2026-07-17 cs.CV cs.AI 新提交 85%

Symbal: Detecting Systematic Misalignments in Model-Generated Captions

Symbal:检测模型生成字幕中的系统性对齐错误

Maya Varma, Jean-Benoit Delbrouck, Sophie Ostmeier, Akshay Chaudhari, Curtis Langlotz

专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 研究多模态大语言模型生成图像字幕时的系统性对齐错误检测问题,提出利用现成基础模型的结构化双阶段设置的Symbal方法,引入SymbalBench基准,Symbal在基准上表现出色,可辅助审核MLLM生成的字幕。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14494 2026-07-17 cs.AI cs.IR cs.LG 新提交 81%

SAGA: Schema-Aware Grounding for Agentic Text-to-SPARQL Generation

SAGA:用于智能文本到SPARQL生成的模式感知基础

Yiming Zhang, Koji Tsuda

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 研究复杂知识库问答中语义解析范式,针对现有智能体类型盲基础问题,提出无训练框架SAGA,通过模式约束基础操作,维护类型状态,过滤候选属性,以紧凑格式呈现图模式,在多基准设置上取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14149 2026-07-17 cs.AI cs.LG 新提交 81%

Enhancing Small Language Models Reasoning through Knowledge Graph Grounding

通过知识图谱基础增强小型语言模型推理

Dimitrios Kelesis, Konstantinos Bougiatiotis, Georgios Paliouras

机构 * Institute of Informatics and Telecommunications, National Center for Scientific Research “Demokritos(信息与电信研究所,国家科学研究中心“德谟克利特”)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 研究利用神经符号智能框架增强小型语言模型推理能力,通过特定工具调用转变模型,在两种场景下评估,发现虽提示提升性能,但受提取瓶颈等限制,还存在“干扰效应”,刻画了挑战并提供迭代验证路线图。

Comments Presented at the 2nd Causal Neuro-symbolic Artificial Intelligence (Causal NeSy): Toward Agentic LLMs with Neuro-Symbolic and Graph Based Reasoning Workshop @ ESWC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09760 2026-07-17 cs.CV cs.RO eess.IV 版本更新 79%

PanoAffordanceNet: Towards Holistic Affordance Grounding in 360° Indoor Environments

PanoAffordanceNet:迈向360°室内环境中的整体 affordance 地标

Guoliang Zhu, Wanjun Jia, Caoyang Shao, Yuheng Zhang, Zhiyong Li, Kailun Yang

机构 * School of Artificial Intelligence and Robotics, Hunan University, China(湖南大学人工智能与机器人学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 PanoAffordanceNet通过DASM和OSDH解决360°室内环境中的整体affordance地标问题,整合多级约束抑制语义漂移,构建360-AGD数据集,提升具身智能的场景感知能力。

Comments Accepted to IEEE/RSJ IROS 2026. The source code and benchmark dataset will be made publicly available at https://github.com/GL-ZHU925/PanoAffordanceNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28149 2026-07-17 cs.CV cs.AI 版本更新 79%

Toward Robust In-Context Segmentation via Concept Guidance

通过概念引导实现鲁棒的上下文分割

Zhigang Chen, Xiawu Zheng, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出概念引导的上下文分割(CG-ICS),通过提取参考图像的高层语义概念而非仅依赖低层视觉匹配,结合文本概念与视觉示例,显著提升分割准确性和鲁棒性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14609 2026-07-17 cs.RO 新提交 78%

Representation-Aligned Tactile Grounding for Contact-Rich Robotic Manipulation

用于接触丰富的机器人操作的表示对齐触觉基础

Ruilin Chen, Jingkai Jia, Tong Yang, Xinyu Zhou, Qiao Sun, Jiangwei Zhong, Shizeng Zhang, Nuo Chen, Bailin He, Wei Li, Wenqiang Zhang

机构 * Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院智能信息处理上海市重点实验室) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Lenovo CTO Organization(联想首席技术官组织) Nanyang Technological University(南洋理工大学) TeleAl, China Telecom(中国电信天翼人工智能公司)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 研究接触丰富的机器人操作中,针对VLA策略不同表示作用下触觉监督应用位置不明的问题,通过线性探针分析找到可预测未来触觉状态的中间动作专家特征,引入LTP,实验证明表示对齐的触觉基础效果更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14400 2026-07-17 cs.CL cs.IR 新提交 78%

DS@GT ARC at LongEval: Citation Integrity and Factual Grounding in Scientific QA

DS@GT ARC参加LongEval:科学问答中的引用完整性和事实基础

Brandon Michaels, Brendon Johnson

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 研究在科学问答中传统评估指标与引用完整性的差异,通过Corrective RAG和CiteFix构建纠正管道,对比前沿模型,发现前沿模型答案生成不依赖文档上下文,而纠正管道提升了引用忠实度和答案基础,提出需奖励严格答案基础的评估指标。

Comments 12 pages, 4 figures. Accepted to the CLEF 2026 LongEval Lab Working Notes

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14202 2026-07-17 cs.CV 新提交 70%

KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation

关键帧指南针:迈向对关键帧条件视频生成的全面评估

Yuqi Tang, Tengfei Liu, Yizheng Lai, Yuran Wang, Yang Shi, Wanshun Su, Zhuoran Zhang, Qixun Wang, Xiaohan Zhang, Xinlei Yu, Xuehai Bai, Xuanyu Zhu, Bohan Zeng, Bozhou Li, Shujie Li, Yifan Dai, Yujie Wei, Shixuan Liu, Haotian Wang, Jialu Chen, Yuanxing Zhang

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 研究关键帧条件视频生成,提出关键帧指南针综合基准及自动评估框架,将关键帧执行分解为六个指标评估,通过实验揭示当前模型在关键帧执行与自然视频合成间存在权衡等局限性。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15265 2026-07-17 cs.CV cs.AI cs.MM cs.SD 新提交 62%

SceneBind: Binding What and Where Across Vision, Audio and Language

SceneBind:跨视觉、音频和语言绑定“什么”与“哪里”

Mingfei Chen, Zijun Cui, Ruoke Zhang, Hyeonggon Ryu, Eli Shlizerman

机构 * University of Washington(华盛顿大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) Hankuk University of Foreign Studies(韩国外国语大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究提出SceneBind全模态场景表示,结合全局语义与对象中心语义空间插槽解决空间结构缺失问题,还提出匹配方案。通过构建新数据集及训练协议进行训练评估,兼容预训练编码器,实现先进检索并能零样本转移到下游任务。

Comments Project website: https://scenebind.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14157 2026-07-17 cs.LG cs.AI cs.IR cs.SY eess.SY 新提交 62%

Certified Domain Consistency for Multi-Domain Retrieval: Label-Free Per-Domain Contamination Control with Conformal Risk Guarantees

多域检索的认证域一致性:具有共形风险保证的无标签逐域污染控制

Jayakumar Manoharan

机构 * Electric Power Research Institute (EPRI)(电力研究协会)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 针对多域检索中错误域证据及污染控制问题,提出C3R控制层。基于风险控制预测集构建双分割方案,认证污染预算。通过实验验证其稳定性及有效性,能减少错误权威基础,且与冻结堆栈和重排器无关。

Comments Submitted to ACM TOI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14547 2026-07-17 cs.CV 新提交 57%

AdaTurn: Budget-Aware Test-Time Scaling for Active Visual Perception Agents

AdaTurn:用于主动视觉感知智能体的预算感知测试时缩放

Susan Liang, Chao Huang, Filippos Bellos, Jing Bi, Jason J Corso, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) Univeristy of Michigan(密歇根大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究主动视觉感知智能体在不同预算下的任务执行问题,提出AdaTurn框架,通过强制答案DAPO等组件,根据预算调整智能体行为,提高低预算准确率,且能有效转移到多基准测试中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14314 2026-07-17 cs.LG 新提交 57%

NeuroGRIP: Retrieval-Augmented Graph Refinement for Knowledge-Grounded EEG Seizure Diagnosis

NeuroGRIP:用于基于知识的脑电图癫痫诊断的检索增强图细化

Lincan Li, Zheng Chen, Yushun Dong

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 研究针对脑电图癫痫诊断难题,提出NeuroGRIP框架,结合外部医学知识校准脑电图图。通过构建知识库、利用大语言模型提取知识图,经对齐感知查询和相似性搜索检索关系证据,提升诊断准确性与可解释性,为临床诊断提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14275 2026-07-17 cs.AI cs.MA 新提交 57%

AI Agents Do Not Fail Alone:The Context Fails First

人工智能智能体并非独自失败:上下文首先失败

Fouad Bousetouane

机构 * The University of Chicago(芝加哥大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究人工智能智能体可靠性,通过ProofAgent-Harness评估上下文七个标准,验证上下文工程质量是智能体可靠性的领先指标,经受控研究表明上下文质量标准可预测行为结果,确立其为预检信号及可审计层。

Comments 24 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31693 2026-07-17 cs.IR cs.AI cs.CL 版本更新 57%

ShopX: A Foundation Model for Intent-to-Item Fulfillment in Agentic Shopping

ShopX:面向智能购物中意图到商品实现的基础模型

Jiacheng Chen, Tao Zhang, Manxi Lin, Dunxian Huang, Teng Shi, Honghao Fu, Mengyan Li, Xinming Zhang, Chenchi Zhang, Xuan Lu, Xiaoxiong Du, Haibin Chen, Shaolin Ye, Hao Chang, Xiaoqi Li, Shuwen Xiao, Yujin Yuan, Jingxuan Feng, Shaopan Xiong, Huimin Yi, Ju Huang, Qiu Shen, Ying Chen, Junjun Zheng, Xiangheng Kong, Dan Ou, Haihong Tang, Yuning Jiang, Bo Zheng

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出ShopX基础模型,通过统一意图理解、执行规划和基于语义ID的商品空间操作,解决大语言模型代理在购物中意图到商品实现的瓶颈,在淘宝生产日志任务上优于工具中介系统。

Comments The new version adds additional results and details

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01086 2026-07-17 cs.AI cs.CR cs.DB cs.DC cs.SE 版本更新 57%

MedBeads: An AI-Native Clinical Context Graph Built from Immutable Beads and Reconstructable Clinical Links

MedBeads:面向可信医疗AI的智能体原生不可变数据基底

Takahito Nakajima

机构 * Diagnostic Imaging and Interventional Radiology, Institute of Medicine, University of Tsukuba(东京大学医学研究院诊断影像与介入放射学部) Center for Cyber Medicine Research, University of Tsukuba(东京大学计算机医学研究中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对医疗AI中电子病历与智能体间的上下文不匹配问题,提出基于Merkle有向无环图的不可变数据架构MedBeads,通过确定性图遍历替代概率检索,实现可审计、防篡改的临床上下文提供。

Comments 23 pages, 5 figures, 3 tables. Reference implementation and reproducible Docker demo available at https://github.com/medbeads/medbeads

详情

展开后加载摘要…

URL PDF HTML 收藏