arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-27 至 2026-07-27 共收录 14 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 14 篇

2607.11957 2026-07-27 cs.CV 版本更新 91%

Anomalous Frame Detection Using VLM-Based Description Comparison for Extracting Expert-Specific Actions and Contextual Decision-Making Scenes with Intra-Video Self-Similarity

基于VLM描述比较的异常帧检测,用于提取特定专家操作和具有视频内自相似性的上下文决策场景

Ryo Sakai, Kaname Yokoyama

专题命中 视觉定位与Grounding :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文针对关键基础设施维护中专家知识传承问题,提出基于VLM描述比较检测异常帧的方法,可提取特定专家操作及上下文决策场景,在模拟实验中该方法的提取率高于传统方法,有效发现含专家知识的候选场景。

Comments 17 pages, 11 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00713 2026-07-27 cs.CV 版本更新 81%

RAD: A Dataset and Benchmark for Real-Life Anomaly Detection with Robotic Observations

RAD:面向机器人观测的真实异常检测数据集与基准

Kaichen Zhou, Xinhai Chang, Taewhan Kim, Jiadong Zhang, Yang Cao, Chufei Peng, Fangneng Zhan, Hao Zhao, Hao Dong, Kai Ming Ting, Ye Zhu

机构 * Massachusetts Institute of Technology(麻省理工学院) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Great Bay University(大湾大学) Harvard University(哈佛大学) Tsinghua University(清华大学) Nanjing University(南京大学) Deakin University(德克萨斯大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出RAD数据集,包含13类日常物体和4种缺陷,从60多个机器人视角在非受控光照下采集,用于评估2D特征、3D重建和视觉语言模型在姿态无关的异常检测中的表现,发现2D方法优于3D和VLM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21615 2026-07-27 cs.AI cs.LG 新提交 76%

FrED: External Data Influence Estimation via Domain Knowledge Graph Grounding

FrED:通过领域知识图谱基础进行外部数据影响估计

Theodoros Aivalis, Iraklis A. Klampanos, Antonis Troumpoukis, Joemon M. Jose

机构 * National Centre for Scientific Research “Demokritos”(国家科学研究中心“德谟克利特”) University of Glasgow(格拉斯哥大学)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI、cs.LG

AI总结 针对生成式AI训练数据归因问题,提出在黑盒设置下运行的概率框架,融合连续特征相似度与领域特定知识图谱,在艺术图像合成和天气预报等领域评估,证明其有效性,为外部数据影响分析提供高效可解释机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22016 2026-07-27 cs.CV cs.AI 新提交 62%

EVL-MCoT: Enhanced Vision-Language Multi-CoT for Harmful Meme Detection

EVL-MCoT:用于有害模因检测的增强视觉语言多思维链

Hao Yang, Jin Wang, Xuejie Zhang

机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对有害模因检测,提出增强视觉语言多CoT(EVL-MCoT)方法,通过促进多CoT及设计解码框架,解决现有方法局限,在相关数据集上获良好结果,且公开了源代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22520 2026-07-27 cs.AI 新提交 57%

The Regression Tax: Decomposing Why Skills Help and Hurt LLM Agents

回归税:剖析技能对大语言模型智能体产生帮助和伤害的原因

Darshan Tank, Baran Nama

机构 * Sentient Labs(森蒂恩实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究剖析大语言模型智能体中技能产生帮助和伤害的原因,通过对比实验区分回归和残余失败两种结果,识别出回归的三个原因,发现现有技能过度强调程序指导,指出应分解技能净效应评估,还识别出应避免的回归模式及可靠性的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16617 2026-07-27 cs.SE cs.AI 版本更新 57%

DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines

DataFlow-Harness:用于构建可编辑大语言模型数据管道的基础代码代理平台

Runming He, Zhen Hao Wong, Hao Liang, Zimo Meng, Chengyu Shen, Xiaochen Ma, Wentao Zhang

机构 * Peking University(北京大学) Institute for Advanced Algorithms Research(先进算法研究所) Zhongguancun Academy(中关村学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对大语言模型数据处理工作流中编码代理脚本无法自动转化为可编辑工件的问题,提出DataFlow-Harness平台,通过类型化增量突变引导构建DAG,结合多种技术,在数据工程基准测试中取得高通过率,降低成本和延迟。

Comments 13 pages, 2 figures, and 5 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16794 2026-07-27 cs.CV 版本更新 57%

LLM-Based Visual Explanation Evaluation Framework for Assessing the Explainability of Facial Skin Disease Classification Models

基于LLM的视觉解释评估框架:用于评估面部皮肤病分类模型的可解释性

Gyuyeon Na

机构 * AI and Business Analytics, Ewha Womans University(人工智能与商业分析,成均馆大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出基于LLM的视觉解释评估框架,通过渐进式提示工程评估Grad-CAM在面部皮肤病诊断模型中的解释质量,聚焦病变定位和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12238 2026-07-27 stat.ML cs.LG math.OC 版本更新 57%

On the Provable Suboptimality of Momentum SGD in Nonstationary Stochastic Optimization

关于动量SGD在非平稳随机优化中的可证明次优性的研究

Sharan Sahu, Cameron J. Hogan, Martin T. Wells

机构 * Cornell University(康奈尔大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文研究了在强凸性和光滑性条件下,随机梯度下降及其动量变体(Polyak重球和Nesterov)在跟踪时间变化最优解时的性能,揭示了动量方法在分布偏移下导致的显式漂移放大惩罚,并证明了这种惩罚并非分析伪影,而是信息论障碍,为动量方法在动态环境中的经验不稳定性提供了理论依据。

Comments Accepted to ICML 2026. 76 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22226 2026-07-27 cs.RO 新提交 50%

Offline Vision-Language Navigation with Geometric Goal Localization for Outdoor Environments

用于户外环境的基于几何目标定位的离线视觉语言导航

Ali Salmasi, Xianjia Yu, Tomi Westerlund

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究针对户外环境下的离线视觉语言导航,通过对17个可边缘部署的SLM与4个在线API进行基准测试,提出轻量级混合语义几何目标定位框架并集成到Edge-BehAV中,提升了性能,降低目标距离误差,实现无网络连接下的有效导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22082 2026-07-27 cs.MA 新提交 50%

When Language Models Meet NeuroGraphs: Exploring Enhanced Agentic LLM Framework Towards Brain Network Analysis

当语言模型遇上神经图谱:探索用于脑网络分析的增强型智能语言模型框架

Jiaxing Li, Rui Dong, Muyao Tang, Youyong Kong

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究针对脑网络分析中现有方法解释性有限等问题,提出BrainAgent智能语言模型框架,将连接组分类设为迭代过程,经特定工具转换、知识检索等步骤生成结构化预测,实验证明其优于基线,为脑网络分析提供实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22020 2026-07-27 cs.RO 新提交 50%

Embodying Multi-Hand Manipulation Policies by Searching the Assignment and Null Spaces

通过搜索分配空间和零空间来体现多手操作策略

Yorai Shaoul, Jiaoyang Li, Maxim Likhachev

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究多臂机器人执行操作策略的问题,基于冲突搜索构建框架,通过搜索轨迹分配空间和零空间,统一处理分配与零空间运动,有效解决多手操作策略执行难题,实现多臂机器人协调操作。

Comments Published in SoCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21961 2026-07-27 cs.CL 新提交 50%

On Improving Faithfulness of Podcasts from Documents

论提高基于文档的播客忠实度

Soumya Dutta, Tejas Indulal Dhamecha, Pannaga Shivaswamy

机构 * Indian Institute of Science(印度科学研究所) Adobe Research(Adobe研究院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究基于文档的播客生成中的忠实度问题,构建数据集并用多个大语言模型生成记录,引入轮次级评判框架。发现先进模型也常生成无根据内容,提出catch - n - repair框架,实验证明该框架能提升播客生成的忠实度。

Comments Under Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21769 2026-07-27 cs.HC 新提交 50%

From Grasping to Speaking: Generative AI-Based Environment-Grounded VR Communication Training for Autistic Individuals

从抓握到说话:基于生成式人工智能的自闭症个体环境基础VR沟通训练

Ziming Li, Roshan L. Peiris

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究探索基于生成式人工智能的VR沟通训练对自闭症个体的作用,通过9名受训者和7名教练参与的三种模式实验发现,C+O+G模式更受青睐,可用性和工作量相当,有助于沟通实践融入任务执行,还讨论了相关设计考量。

Comments 14 pages, ASSETS2026

Journal ref The 28th International ACM SIGACCESS Conference on Computers and Accessibility (ASSETS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15591 2026-07-27 cs.IR 版本更新 50%

RecGPT-V3 Technical Report

RecGPT-V3技术报告

Bowen Zheng, Chao Yi, Dian Chen, Gaoyang Guo, Han Zhu, Jiakai Tang, Jian Wu, Mao Zhang, Wen Chen, Yifan Lu, Yujie Luo, Yuning Jiang, Zhujin Gao, Bo Zheng, Chenchi Zhang, Dixuan Wang, Hao Fang, Jiancai Liu, Jing Yu, Junjun Zheng, Ke Chen, Kewei Zhu, Mengyan Li, Mingke Xu, Wenjun Yang, Xiangheng Kong, Xinming Zhang, Xunke Xi, Zile Zhou

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究针对大规模运行RecGPT的挑战,提出RecGPT-V3这一有状态混合模态推荐系统。通过内存中心、混合模态基础模型和潜在意图推理等方法,在淘宝“猜你喜欢”推荐中取得多指标提升及资源消耗降低的成果。

Comments Technique Report

详情

展开后加载摘要…

URL PDF HTML 收藏