arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-21 至 2026-08-21 共收录 26 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 26 篇

2608.20069 2026-08-21 cs.CV 新提交 91%

V-REX: Efficient Specialist VLM Training for Veterinary X-Rays

V-REX:面向兽医X光片的高效专用视觉语言模型(VLM)训练

Tim Elsner, Nicole McNally, Andre Dourson, Michael Fitzke

机构 * Vyyo AI Mars Petcare(玛氏宠物护理)

专题命中 视觉定位与Grounding :VLM(title,title_cn);grounding(abstract);分类 cs.CV

AI总结 该研究针对兽医X光片领域,提出高效专用VLM训练方案,无需依赖额外数据,用更少资源开发出能生成兽医X光诊断报告的模型,性能远超同类开源基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19218 2026-08-21 cs.CL cs.AI cs.LG 新提交 86%

Time-Series Retrieval for Grounding Multimodal Language Models in Remaining Useful Life

用于将多模态语言模型与剩余使用寿命关联的时间序列检索

Valeriu Dimidov, Raphaël Frank

机构 * University of Luxembourg(卢森堡大学)

专题命中 视觉定位与Grounding :grounding(title);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出时间序列检索关联的多模态大语言模型框架,在C-MAPSS基准FD001分区实验显示,该方法可提升RUL预测的误差与稳定性,且效果随模型容量变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19752 2026-08-21 cs.SE 新提交 83%

A Fully Automated, Deployment-Aware Testing Pipeline for IoT-Based Automotive Applications

面向物联网汽车应用的全自动、感知部署的测试流水线

Denesa Zyberaj, Roman Vintonyak, Pascal Hirmer, Marco Aiello

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 针对物联网汽车应用的测试难题,提出结合LLM、VLM及人在回路机制的感知部署测试流水线,经CPDS案例验证可实现全需求覆盖与高准确率,适配OEM-供应商测试工作流。

Comments Submitted, accepted and presented at IoTBDS26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17633 2026-08-21 cs.RO 版本更新 83%

OVIP-SG: Open-Vocabulary Instance-Preserving Scene Graphs for Mapping and Retrieval of Small, Fine-Grained Objects

OVIP-SG:用于小型细粒度物体映射与检索的开放词汇实例保留场景图

Tianjing Hao, Haiyu Lan, Angsong Li, Cheng Chen, Enyu Li, Jiarui Yang, Yuning Su, Peiwen Lin, Wang Chuang

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 本文提出OVIP-SG框架,通过VLM等技术实现小型细粒度物体的实例保留映射与语言引导检索,在Replica数据集上的多项指标优于现有方法,且经实际机器人实验验证有效。

Comments 15 pages, 6 figures, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20127 2026-08-21 cs.CV 新提交 83%

ID-VTG: Image-Disambiguated Video Temporal Grounding

ID-VTG:基于图像消歧的视频时间定位

Minghang Zheng, Jingli Wei, Hongyi Yang, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 针对视频时间定位中视觉相似实体的消歧难题,本文提出ID-VTG任务与VGD-Agg框架,构建两个基准数据集,实现了该任务的当前最优性能。

Comments ACM-MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07382 2026-08-21 cs.LG astro-ph.HE astro-ph.IM 版本更新 83%

Generalist Vision-Language Models for Fast Radio Burst detection: a zero-shot benchmark against a specialized detector

用于快速射电暴检测的通用视觉语言模型:针对专用探测器的零样本基准测试

Raiff H. Santos, Amilcar R. Queiroz, Tharcisyo S. S. Duarte, K. E. L. de Farias, Rafael A. Batista

机构 * Universidade Federal de Campina Grande(坎皮纳格兰德联邦大学) Instituto de Formação de Educadores, Universidade Federal do Cariri(卡里里联邦大学教育工作者培训学院)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.LG

AI总结 研究通用视觉语言模型在零样本下检测快速射电暴,从模拟动态频谱中抽取样本作基准,比较其与专用探测器,发现Gemma 4 2B准确率与SwinYNet相近,在结构化RFI上误报率低,重写提示可用于三类分类,准确率较高。

Comments 31 pages, 7 figures. Section added with analysis for real data. New figures and tables added. Other minor changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07761 2026-08-21 cs.CV 版本更新 83%

Video Evidence to Reasoning Efficient Video Understanding via Explicit Evidence Grounding

视频证据推理:通过显式证据接地实现高效的视频理解

Yanxiang Huang, Guohua Gao, Zhaoyang Wei

机构 * Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出CoE框架,通过显式证据接地模块和强化学习优化的锚定协议,提升视频推理的准确性和可靠性。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20336 2026-08-21 cs.CV 新提交 79%

WithEveryone: Unified Planning and Identity Grounding for Group Image Generation

WithEveryone:面向群体图像生成的统一规划与身份定位

Hengyuan Xu, Qixun Wang, Yiji Cheng, Miles Yang, Zhao Zhong, Wei Cheng, Xingjun Ma, Yu-gang Jiang

机构 * Fudan University(复旦大学) Hunyuan, Tencent(腾讯混元) The University of Hong Kong(香港大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 针对多人物群体图像生成的身份保留难题,提出WithEveryone框架,通过布局定位身份损失等技术,提升了人脸相似度并降低伪影,实现高身份覆盖率与低重复率。

Comments Project Page: this http URL (http://doby-xu.github.io/WithEveryone/);Code will be released: this http URL (http://github.com/Doby-Xu/WithEveryone/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19553 2026-08-21 cs.CV 新提交 79%

Where Grounding Accuracy Lives on the IoU Curve: Label-Free Inference-Time Boundary Refinement

IoU曲线上定位精度的核心所在:无标注推理时的边界优化

Bo Ma

机构 * Auckland University of Technology(奥克兰理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出无标注推理时的边界优化(LFPR)方法,在多个视觉-语言定位数据集上提升了IoU曲线各精度指标,证明指代选择与边界精度部分可分离,为定位精度优化提供了新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07932 2026-08-21 cs.CV 版本更新 79%

SportsGrounder: Proposal-Aided Interleaved Grounding for Dense Sports Video Reasoning

SportsGrounder:用于密集体育视频推理的提案辅助交错定位框架

Yizhi Li, Jiawei Jiang, Guanhong Wang, Yingcai Wu, Gaoang Wang

机构 * Zhejiang University(浙江大学) Beijing Jiaotong University(北京交通大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 针对LMMs难以处理密集体育视频细粒度推理的问题,提出SportsGrounder框架,结合IGF机制与AAS模块,在SoccerNet等数据集上实现最优准确率。

Comments ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19995 2026-08-21 cs.NE 新提交 78%

The Forward-Backward Disconnect: State Dynamics, Credit Assignment, and Biological Grounding in Neural Computation

前向-反向脱节:神经计算中的状态动力学、信用分配与生物学基础

Hadi Al Mubasher, Mariette Awad

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 本文指出神经计算中前向计算已多样化但训练方法仍集中于梯度类误差传播机制的前向-反向脱节问题,提出涵盖状态动力学等三要素的分类法,强调需对齐三者以弥合该脱节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17584 2026-08-21 cs.RO 版本更新 75%

HODAgent: Towards On-Demand, Responsive Humanoids for Physical World Human Interaction

HODAgent:面向物理世界人机交互的按需、响应式人形机器人

Wang Warren Chen, Jiahao Zhang, Zhenjiang Li, Mingxu Wang, Lei Yi, Yuchen Kang, Shuo Sun, Ziping Chen, Jie Chen

机构 * Xiaopeng(小鹏)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract)

AI总结 HODAgent作为面向服务人形机器人的System-2具身智能体,通过半双工架构实现自适应服务,在仿真与实体机器人上均显著优于基准模型。

Comments we have received a formal directive from our company requiring all company assets to undergo a mandatory internal review process before any public release. We are now required to immediately withdraw the paper to comply with this policy

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19974 2026-08-21 cs.AI 新提交 74%

ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance

ReguSim:评估大语言模型智能体在金融合规中的规则落地

Yiyang Luo, Yihang Jiang, Qijun Xie, Liang Lan, Lin Willian Cong, Anyi Rao, Yunya Song

机构 * HKUST(香港科技大学) HKBU(香港浸会大学) NTU(新加坡南洋理工大学)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 研究针对LLM智能体在金融合规中的规则落地问题,构建ReguSim环境与ReguBench基准,发现可见规则无法完全消除违规动作,结构化监控基线表现优于纯提示LLM,为金融合规评估提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19673 2026-08-21 cs.HC 新提交 71%

Grounding Mindfulness in Embodied Tangibles: A Scoping Review & Theoretical Framework for HCI Design

将正念建立在具身实体之上:面向人机交互设计的范围综述与理论框架

Tharaka Sachintha Ratnayake, Samangi Wadinambiarachchi, Sarah Schömbs, Jonathan Eden, Denny Oetomo, Wafa Johal

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本研究通过对65项正念实体设备的HCI范围综述,提出基于S-ART框架的理论及ESE、ESA模型,为HCI中正念技术的设计、评估及未来研究提供原则性基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20111 2026-08-21 cs.RO cs.ET 新提交 67%

Planning-Oriented End-to-End Autonomous Driving: Architectures, Evaluation, and Emerging Paradigms

面向规划的端到端自动驾驶:架构、评估与新兴范式

Yanchen Guan, Xingcheng Liu, Bin Rao, Chengyue Wang, Guofa Li, Yunjian Li, Lishengsa Yue, Zhiyong Cui, Chengzhong Xu, Zhenning Li

机构 * University of Macau(澳门大学) Chongqing University(重庆大学) The Hong Kong University of Science and Technology(香港科技大学) Tongji University(同济大学) Beihang University(北京航空航天大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 本综述梳理了端到端自动驾驶从回归任务向面向规划系统的转变,沿四个维度整合方法,分析基准转变,指出需结合一致评估解读架构进展,并总结了多项开放性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01548 2026-08-21 cs.AI cs.LG 版本更新 62%

LLM Capability Limits: Static Emergence and Dynamic Boundary Control

涌现不变性:从符号化思维到结构控制

Yi Liu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 该研究形式化了语言为核心的智能的限制,提出动态边界控制框架,通过DeepSeek V4-Flash实验验证其可提升大语言模型的推理性能,组织了大语言模型的涌现限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19902 2026-08-21 cs.AI q-bio.NC 新提交 57%

Bringing analytic rigor to agentic AI for science: The Brain Researcher platform for neuroimaging data analysis

为面向科学的智能体AI赋予分析严谨性:用于神经影像数据分析的Brain Researcher平台

Zijiao Chen, Nicholas Lu, Xinhui Li, Jocelyn A. Ricard, Ce Ju, Huan H. Wang, Christian Kindermann, Jeanette A. Mumford, Steven Dillmann, James Kent, Alejandro de la Vega, Sanmi Koyejo, Vince D. Calhoun, Joshua W. Buckholtz, Juan Helen Zhou, Steffen Bollmann, Russell A. Poldrack

机构 * Stanford University(斯坦福大学) Tri-institutional Center for Translational Research in Neuroimaging and Data Science (TReNDS)(三机构神经成像与数据科学转化研究中心(TReNDS)) Georgia State University(佐治亚州立大学) Georgia Institute of Technology(佐治亚理工学院) Emory University(埃默里大学) Inria(法国国家信息与自动化研究所) CEA(法国原子能和替代能源委员会) Université(大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究推出Brain Researcher智能体研究平台,用于神经影像数据分析,其遵循分析规则等要求,提升了工具选择准确率与可验证依据,嵌入方法判断以增强智能体AI的分析严谨性。

Comments 103 pages, 19 figures; Supplementary Information included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19535 2026-08-21 cs.AI cs.CL cs.DC cs.IR cs.PF 新提交 57%

From Retrieved Context to Runtime Control: Adaptive Compression for Edge-based RAG

从检索上下文到运行时控制:基于边缘设备的检索增强生成(RAG)的自适应压缩

Zlatan Feric, Amir Taherin, Yanzhi Wang, David Kaeli

机构 * Northeastern University(东北大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究针对边缘RAG的上下文压缩问题,提出遥测驱动的自适应压缩方案,通过实验发现中等压缩可显著降低能耗且质量损失极小,主张基于工作负载和边缘遥测动态管理压缩。

Comments Accepted to appear in the Proceedings of the ACM AI Leadership Summit 2026. Zlatan Feric and Amir Taherin contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17417 2026-08-21 cs.LG physics.chem-ph physics.comp-ph quant-ph 版本更新 57%

Grounded verification of chemical and materials reasoning: detection is the bottleneck

化学与材料推理的有根据验证:检测是瓶颈

Can Polat, Mustafa Kurban, Erchin Serpedin, Hasan Kurban

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 研究针对大语言模型在化学推理中虚构对象的问题,提出分层验证器,通过与数据库核对及门控校正减少公式错误,检索次数大幅减少,修复成功率高,但检测召回率是瓶颈,基于事实验证可提高答案质量,长尾错误处提升明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05605 2026-08-21 cs.LG cs.NE 版本更新 57%

From Prediction to Self: Developmental Conditions for Agency in Minimal Neural Systems

从预测到自我:最小神经系统中能动性的发展条件

Evan Ye

机构 * Independent Researcher(独立研究者)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 通过40个逐步增加的实验,研究最小GRU系统如何区分自我与世界因果影响,发现四个严格顺序的发展条件,并提出能动性增益作为度量指标。

Comments 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19008 2026-08-21 cs.AI 版本更新 57%

Computational Phenomenology of Borderline Personality Disorder: A Comparative Evaluation of LLM-Simulated Expert Personas and Human Clinical Experts

边缘型人格障碍的计算现象学:对LLM模拟专家人设与人类临床专家的比较评估

Marcin Moskalewicz, Anna Sterna, Karolina Drożdż, Kacper Dudzic, Marek Pokropski, Paula Flores

机构 * IDEAS Research Institute(IDEAS研究机构) Adam Mickiewicz University(亚当·密茨凯维奇大学) AMU Center for Artificial Intelligence(AMU人工智能中心) Poznań University of Medical Sciences(波兹南医科大学) Maria Curie-Skłodowska University(玛丽·居里-斯洛多夫斯卡大学) University of Warsaw(华沙大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究比较了LLM模拟专家与人类专家在边缘型人格障碍定性分析中的表现,发现模型在某些方面与人类难以区分,并能识别人类遗漏的主题,展示了AI增强分析的潜力。

Comments 28 pages, 8 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19813 2026-08-21 eess.IV 新提交 50%

Energy-Mamba: A Physics-Constrained State-Space Model for Medical Image Classification

Energy-Mamba:用于医学图像分类的物理约束状态空间模型

Mohamed Mabrok, Yalda Zafari, Essam A. Rashed

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 Energy-Mamba将物理约束融入Mamba状态空间模型,解决医学图像分类的表征漂移问题,在四个医学图像数据集上以更少参数实现了最优分类性能。

Comments This paper was accepted to the MICCAI 2026 workshop MLMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19699 2026-08-21 cs.MA 新提交 50%

An Evidence-Grounded Multi-Agent System for High-Level Bio-Robot Design

一种基于证据的用于高层生物机器人设计的多智能体系统

Yujun Chen, Tianle Li, Jiayu Chen, Zhen Yin

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究提出基于 Qwen3.5-27B 的 micro_biorobot_agent 多智能体系统,用于高层生物机器人设计,在评估中得分领先,来源追踪检查可显著降低错误缺口。

Comments 15 pages, 2 figures, 9 tables, and 4 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19509 2026-08-21 cs.SE 新提交 50%

An Agentic RAG and Evaluation Framework for Assurance Case Generation: Industrial Use Case for the EU Cyber Resilience Act Compliance

用于保障案例生成的智能检索增强生成与评估框架:欧盟网络弹性法案合规性的工业用例

Fariz Ikhwantri, Iker Lasa Ojanguren, Dusica Marijan, Maria I. Maslioukova, José Arias Marin, Pavlos Kosmides

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究提出基于智能RAG的保障案例生成与评估框架,通过案例研究验证其可自动化欧盟网络弹性法案合规评定,减少人工并提升证据可追溯性。

Comments 6 pages, accepted at ISSRE 2026 (Industry track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17546 2026-08-21 cs.SE 版本更新 50%

REST API Testing with Verified LLM-Inferred Dependencies and Response-Driven Refinement

基于经验证的LLM推断依赖关系与响应驱动优化的REST API测试

Tu Nguyen, Thanh Nguyen, Huy Nguyen, Viet Nguyen, Tien N. Nguyen, Vu Nguyen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出APIPilot框架,通过执行验证LLM推断的REST API依赖关系,结合响应驱动优化,在16个真实API上实现高覆盖率与成功率,优于现有基线。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15469 2026-08-21 cs.CY 版本更新 50%

Aspirational Affordances of AI

AI的抱负性可供性

Sina Fazelpour, Meica Magnani

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文引入抱负性可供性与抱负性伤害概念,分析AI对抱负性可供性的影响及相关风险,拓展AI伤害讨论范畴,以深化对AI塑造抱负的心理与社会意义的理解。

详情

展开后加载摘要…

URL PDF HTML 收藏