arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-14 至 2026-07-14 共收录 64 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 8 篇

2607.11798 2026-07-14 cs.CV cs.AI 新提交 86%

StoryTeller: Training-Free Narrative Grounding for Long-Form Audio Description

StoryTeller:用于长格式音频描述的免训练叙事接地

Seung Hyun Hahm, Minh T. Dinh, SouYoung Jin

机构 * Dartmouth College(达特茅斯学院)

专题命中 视觉问答 :grounding(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 研究针对长格式音频描述问题,提出免训练的StoryTeller框架。它通过维护叙事记忆跨场景传递信息,仅用原始视频和标题,经语义过滤等确保信息准确。引入StoryAD-QA基准测试,实验证明该框架显著提升了叙事相关能力。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10610 2026-07-14 cs.CV cs.AI 新提交 86%

WasteAssistant: Regulation-Guided Visual Question Answering Framework for Intelligent Waste Segregation and Sustainable Managemen

WasteAssistant:用于智能垃圾分类与可持续管理的监管引导视觉问答框架

Khush Kataruka, Harshit Maurya, Anuja Vats, Murari Mandal, Kiran Raja, Praveen Kumar Chandaliya

机构 * SVNIT(萨达尔·瓦拉巴伊·国家理工学院) NTNU(挪威科技大学) KIIT(卡林加工业技术学院)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对现有智能垃圾分类系统的不足,提出集成视觉语言模型和多模态大语言模型的框架,构建新数据集,经实验验证基于BLIP的模型效果更佳,提升了分类准确率,确保监管合规,推动多模态AI在垃圾管理中的应用。

Comments 12 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10190 2026-07-14 cs.LG cs.AI cs.CV 新提交 86%

PhysMRV: Physical Memory Retrieval and Verification for Physics Plausibility Reasoning

PhysMRV:用于物理合理性推理的物理内存检索与验证

Wenyuan Wang, Lianyu Hu, Hao Wang, Yang Liu

专题命中 视觉问答 :VLM(summary_cn,abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对视频语言模型物理合理性推理不可靠的问题,提出免训练的PhysMRV框架,通过将训练视频转化为分层内存库,利用结构化物理证据指导VLM验证物理合理性,在多基准测试中取得一致改进,有效增强该推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11862 2026-07-14 cs.CV cs.AI 新提交 62%

Evidence-Backed Video Question Answering

有证据支持的视频问答

Shijie Wang, Honglu Zhou, Ziyang Wang, Ran Xu, Caiming Xiong, Silvio Savarese, Chen Sun, Juan Carlos Niebles

机构 * Salesforce, Palo Alto, CA, USA(Salesforce公司) Brown University, Providence, RI, USA(布朗大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究视频问答中模型缺乏可视化依据的问题,提出E-VQA任务及ST-Evidence基准,开发数据集ST-Evidence-Instruct,通过微调提高模型表现,为可解释的视频理解建立基线。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11560 2026-07-14 cs.CV cs.AI 新提交 62%

Technical Report on the CVPR 2026@AdvML Workshop Challenge

关于CVPR 2026@AdvML研讨会挑战赛的技术报告

Tianyuan Zhang, Zonglei Jing, Jiangfan Liu, Ligong Zhang, Ke Ma, Chengzhi Sun, Xiaohai Xu, Zhirui Zhang, Qianqian Xu, Qingming Huang, Hanyu Fang, Junhua Liu, Zheng Wang, Xiaoliang Liu, Yuanbo Li, Shuai Gui, Bin Wang, Menghe Zheng, Jing Nie, Hanyang Meng, Zeyang Zhang, Xiang Zhang, Yongxuan Zhu, Rui Ding, Hainan Li, Yongkang Zhang, Zhilei Zhu, Xianglong Kong, Jin Hu, Zonghao Ying, Yisong Xiao, Lei Chen, Haotong Qin, Jiakai Wang, Aishan Liu, Ruikai Li, Julia Karbing, Yinpeng Dong, Zhenfei Yin, Shao Jing, Xia Hu, Jingyi Xu, Juntao Dai, Xinyun Chen, Vishal M. Patel, Xianglong Liu, Dawn Song, Alan Yuille, Philip H. S. Torr, Dacheng Tao

机构 * Beihang University(北京航空航天大学) University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Tongji University(同济大学) iFLYTEK Co., Ltd.(科大讯飞股份有限公司) Anhui Laboratory for Safe Artificial Intelligence in the Yangtze River Delta(长三角安全人工智能安徽实验室) Wenzhou Business College(温州商学院) Jiangnan University(江南大学) Guangzhou City University of Technology(广州理工学院) Inceptio Technology(智元机器) Institute of Dataspace(数据空间研究所) Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学) ETH Zürich(苏黎世联邦理工学院) University of Oxford(牛津大学) Shanghai AI Laboratory(上海人工智能实验室) BAAI(北京智源人工智能研究院) Meta Johns Hopkins University(约翰·霍普金斯大学) University of California, Berkeley(加州大学伯克利分校) Nanyang Technological University(南洋理工大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 介绍CVPR 2026@AdvML研讨会针对自动驾驶VLAs的对抗性多模态攻击挑战赛,基于多视图视觉问答,参赛者要生成对抗图像和文本扰动。阐述任务设计等,研究领先提交作品发现后缀惩罚等模式,为多模态自动驾驶系统相关工作提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11257 2026-07-14 cs.CV cs.LG 新提交 62%

LaGuadia: Language-Guided Adaptive Distillation from Pathology Foundation Models

拉瓜迪亚:基于病理学基础模型的语言引导自适应蒸馏

Gangsu Kim, Won-Ki Jeong

机构 * College of Informatics, Korea University(韩国大学信息学院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

AI总结 研究针对病理学基础模型计算成本高问题,提出拉瓜迪亚框架,通过多阶段流程,在临床语言指导下整合多模型知识,进行自适应蒸馏。实验表明其87M参数学生模型性能出色,凸显临床语言对构建高效可靠数字病理系统的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10990 2026-07-14 cs.CV 新提交 57%

TreeSoc: Tree-Structured Dynamic Reasoning and Tool Synergy for Soccer Video Understanding

TreeSoc:用于足球视频理解的树状结构动态推理与工具协同

Thanh-Nhan Vo, Thanh-Khoi Nguyen, Trong-Thuan Nguyen, Trung-Hoang Le, Minh-Triet Tran

机构 * University of Science, VNU-HCM(胡志明市越南国立大学科学大学)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

AI总结 针对当代视觉语言模型理解足球视频的挑战,提出TreeSoc框架,通过动态深度优先搜索机制分解查询,支持自适应工具路由,在多个数据集上取得优异成绩,证明其为视频理解的有效范式。

Comments Accepted to ICMV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10494 2026-07-14 cs.SE 新提交 50%

Question Answering for Diagram-Rich Technical Meeting Videos

面向富含图表的技术会议视频的问答

Zhuoran Xu, Jia Li, Dayuan Tan, Mark Cole, Ish Ashraf, Sandeep Puri, Mehrdad Sabetzadeh, Shiva Nejati

专题命中 视觉问答 :grounding(abstract)

AI总结 研究面向富含图表的技术会议视频的问答问题,核心方法是开发基于大语言模型的多模态问答系统LMVQA,主要贡献是显著提高答案准确性,降低响应时间和成本,获领域专家认可。

Comments Accepted for publication in ICSME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 10 篇

2607.10120 2026-07-14 cs.CV 新提交 84%

WeaveEarth: Structured Evidence Construction and Reasoning for Training-Free UHR Remote Sensing Understanding

WeaveEarth:用于免训练超高分辨率遥感理解的结构化证据构建与推理

Xianzhi Ma, Shujun Wang, Xiaohan Li, Hao Liu, Changhua Pei, Jianhui li

机构 * School of Frontier Sciences, Nanjing University(南京大学前沿科学学院) Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 针对UHR遥感图像理解,提出免训练框架WeaveEarth,通过全局感知证据构建选最小支持证据集,经结构化证据推理增强VLM全局-局部联合推理能力,在多基准测试中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10796 2026-07-14 cs.CV 新提交 79%

Mixture of Cognitive Experts in Large Vision-Language Models

大型视觉语言模型中的认知专家混合体

Robert Wijaya, Ngai-Man Cheung

机构 * Singapore University of Technology and Design (SUTD)(新加坡科技设计大学)

专题命中 视觉推理 :vision-language model(title);vision language model(abstract);分类 cs.CV

AI总结 研究大型视觉语言模型中多编码器专家整合难题,提出证据驱动的多模态推理框架,利用布鲁姆分类法及两阶段认知语言化,改进感知和推理能力,实现细粒度分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09839 2026-07-14 cs.AI cs.CV cs.HC 新提交 62%

Exploring Agentic Workflows for Generating High Quality Math Visual Aids

探索用于生成高质量数学视觉辅助工具的智能工作流程

Rizwaan Malik, Ashna Khetan, Isabel Sieh, Samin Khan

机构 * Stanford Graduate School of Education(斯坦福大学教育研究生院) Department of Computer Science(计算机科学系)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 研究针对中学数学图表可靠生成难的问题,引入智能工作流程,让 LLM 智能体评估并迭代改进生成的视觉效果,通过探索性评估确定改进关键领域,初步证明可提高 AI 生成数学图表的可靠性和教育价值。

Comments 13 pages, 9 figures. Exploratory course project on agentic workflows for generating and evaluating K 12 mathematical diagrams

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11529 2026-07-14 cs.CV 新提交 57%

Parse, Search, and Confirmation: Training-Free Aerial Vision-and-Dialog Navigation with Chain-of-Thought Reasoning and Structured Spatial Memory

解析、搜索与确认:基于思维链推理和结构化空间记忆的免训练空中视觉与对话导航

Yu Qi, Hongyu Li, Shaofei Huang, Tianrui Hui, Yaxiong Wang, Lechao Cheng, Zhun Zhong, Si Liu, Meng Wang

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) Jianghuai Advance Technology Center(江淮先进技术中心) Anhui Provincial Key Laboratory of Humanoid Robots(安徽省人形机器人重点实验室) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) University of Macau(澳门大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 研究免训练环境下的空中视觉与对话导航任务,提出PSC - AVDN框架,结合解析 - 搜索 - 确认推理管道与结构化空间记忆,整合多种空间线索,在免训练设置中取得新的最优性能。

Comments 10 pages, 4 figures. Accepted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 23859-23868

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11173 2026-07-14 cs.CV 新提交 57%

When Depth Is Better Told Than Shown: Depth-Ordinal Prompting for Vision-Language Spatial Reasoning

当深度以文字表述比图像展示更好用时:用于视觉语言空间推理的深度序数提示

Quynh Vo, Phuc Dao, Cong-Duy Nguyen, Thong Nguyen

机构 * National University of Singapore(新加坡国立大学) Center of AI Research, VinUniversity(文大人工智能研究中心)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 研究视觉语言模型空间推理难题,提出深度序数提示(DOP)方法,该方法无需训练,将单目深度转换为序数文本提示,在伪深度提供可靠排序时可改善空间推理,简单且针对性强,与其他无需训练的深度提示方法有竞争力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11106 2026-07-14 cs.CV 新提交 57%

Beyond the Eye: Efficient Multimodal Reasoning via Self-Regulated Implicit Visual Tools

超越视觉:通过自我调节的隐式视觉工具实现高效多模态推理

Xiuwei Chen, Quanlin Chen, Wentao Hu, Zisheng Chen, Kun Xiang, Zehua Ma, Mingyang Zhang, Jianhua Han, Hanhui Li, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) The Hong Kong Polytechnic University(香港理工大学) Yinwang Intelligent Technology Co., Ltd.(银望智能科技有限公司)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型推理效率问题,提出超越视觉(BEE)的隐式视觉工具范式,通过将视觉工具调用行为纳入训练目标,经两阶段训练,包括形式化思维链监督微调与自我调节奖励驱动对齐,提升了模型在细粒度视觉感知任务中的性能和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10787 2026-07-14 cs.CV cs.CL 新提交 57%

Detecting AI-Generated Video: A Vision-Language Dual-View Survey

检测人工智能生成的视频:视觉-语言双视角综述

Dylan Xinming Hou, Juntian Zhang, Xu Gu, Yichen Wu, Nils Lukas, Gus Xia, Xiuying Chen, Yuhan Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学中关村人工智能学院) Harvard University(哈佛大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 综述人工智能生成视频检测,将任务重定义为事实保真度验证,提出视觉-语言双视角分类法,基于对221篇论文回顾,综合生成范式、审视检测方法、回顾评估指标,讨论挑战并指出未来方向。

Comments 51 pages, accepted by ACL 2026

Journal ref Association for Computational Linguistics 2026 pages 32221 to 32255

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10004 2026-07-14 cs.CV 新提交 57%

Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning

模型指导绘图:用于统一多模态推理的自适应视觉门控

Wenxi Gao, Guanxi Lu, Didi Zhu, Hao Mark Chen, Quan Deng, Zhican Wang, Jiankang Deng, Hongxiang Fan

机构 * Imperial College London(伦敦帝国理工学院) Tsinghua University(清华大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

AI总结 针对统一多模态模型在视觉推理中存在的问题,提出基于生成意图和视觉保真度两个内部信号的AdaViG方法,可动态评估视觉步骤,避免误导性视觉证据进入推理过程,提升了准确率并降低计算量和延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11736 2026-07-14 cs.CL 新提交 50%

MET: Theory-Grounded and Culture-Aware Multilingual Moral Reasoning

MET:基于理论和文化感知的多语言道德推理

Ayoung Lee, Ryan Kwon, Yunxiang Zhang, Yuxuan Liu, Peter Railton, Lu Wang

机构 * University of Michigan(密歇根大学)

专题命中 视觉推理 :grounding(abstract)

AI总结 研究针对语言模型用于跨语言文化道德决策时存在的多语言性忽视问题,提出MET两步提示法及MET-D自我蒸馏训练,引入MCLASH基准,实验表明MET-D提升模型性能,揭示不同文化有益依据差异,为多语言道德推理开辟道路。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11044 2026-07-14 cs.MM 新提交 50%

RetroHolmes: When Semantic Plausibility Fails Retrospective Physical Process Reasoning

RetroHolmes:当语义合理性失效时的回顾性物理过程推理

Ruoxuan Zhang, Qiyun Zheng, Siyu Wu, Ling Zou, Hongxia Xie, Zhiyu Zhou, Jian-Yu Jiang-Lin, Zihan Li, Zhengguang Wang, Bin Wen, Ling Lo, Jianlong Fu, Meibao Yao, Juncheng Hu, Wen-Huang Cheng

专题命中 视觉推理 :vision language model(abstract)

AI总结 研究针对视觉语言模型物理推理评估不足问题,引入回顾性物理过程推理范式,提出RetroHolmes基准,通过它分析模型,发现失败模式,还展示综合分析实例,验证其诊断价值,凸显物理基础中间表示对物理推理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 18 篇

2607.10826 2026-07-14 cs.CV cs.AI cs.GR 新提交 86%

3D-DefectBench: A Controlled Factorial Study of Vision-Language Model Evaluation Pipelines for Fine-Grained 3D Generation Defects

3D-缺陷基准:用于细粒度3D生成缺陷的视觉语言模型评估管道的控制因子研究

Zhenyu Zhao, Nanshan Jia, Jihyeon Je, Yifu Tang, Alvin Chan, Michael Spedden, Michael V. Palleschi, Sui Huang, Jingshen Wang, Zeyu Zheng

机构 * Roblox Corporation(罗布乐思公司) Berkeley AI Research Lab & Department of Industrial Engineering and Operations Research, University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究实验室及工业工程与运筹学系) Computer Science Department, Stanford University(斯坦福大学计算机科学系) Division of Biostatistics, University of California, Berkeley(加州大学伯克利分校生物统计学系)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 研究基于视觉语言模型的3D缺陷检测管道评估,引入3D-DefectBench基准框架,通过平衡因子设计改变多个管道因素进行实验,发现模型选择影响最大,各因素相互作用,还得出一些协议表现及评判与人工标注对比情况等结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11598 2026-07-14 cs.AI 新提交 85%

Interaction Scaling: Grounding the Third Axis of Test-Time Compute

交互缩放:奠定测试时计算的第三轴基础

Bojie Li, Noah Shi

机构 * Pine AI(松树人工智能公司) University of Washington(华盛顿大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 研究测试时增加计算量的新方法,提出交互缩放概念,通过模型与外部仪器交互突破传统方法局限,在硬编码任务和视觉工件处理上展现优势,表明交互缩放真实且区别于推理和采样,需反馈和度量基于实际。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09876 2026-07-14 cs.CV cs.AI q-bio.NC q-bio.QM 新提交 82%

Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data

Prompting-MammAlps:用于相机陷阱数据的细粒度文本到视频检索

Valentin Gabeff, Baptiste Maquignaz, Jennifer Shan, Sepideh Mamooler, Gencer Sumbul, Blair Costelloe, Devis Tuia, Alexander Mathis

机构 * Ecole Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Max Planck Institute of Animal Behavior(马克斯·普朗克动物行为研究所) University of Konstanz(康斯坦茨大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 针对相机陷阱数据自动检索视频的难题,提出Prompting-MammAlps基准及细粒度可解释TVR方法,训练视觉变压器并结合大语言模型处理查询,在基准测试中取得较好成绩,优于零样本VLM。

Comments Accepted at ECCV 2026; Project page: https://cnai.epfl.ch/prompting-mammalps

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11018 2026-07-14 cs.RO 新提交 82%

Whole-Body Semantic-to-Actuation Grounding of Elephant-Inspired Soft-Trunk Motion via Lightweight Flow Matching

通过轻量级流匹配实现大象启发式软躯干运动的全身语义到驱动的基础

Tingcong Liu, Tongshun Chen, Siyi Ma, Yuhao Wang, Aye Phyu Phyu Aung, Ibrahim Alsarraj, J. Senthilnath, Bo An, Ke Wu

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract)

AI总结 针对近距离人机交互中类似躯干机器人关联开放词汇响应难的问题,提出基于轻量级流匹配的全身语义到驱动基础框架,将多模态大语言模型响应转换为元组,参数化轨迹并采样运动,实验显示其提升关联正确性、减少推理时间,还提升了人机交互满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11339 2026-07-14 cs.CV 新提交 79%

HierCAD: Hierarchical Text-to-CAD Design via Structure Alignment and Parameter Grounding

HierCAD:通过结构对齐和参数接地实现分层文本到CAD设计

Jimin Xu, Tianbao Wang, Tao Jin, Zhou Zhao

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 针对文本到CAD设计中结构一致性和参数确定问题,提出HierCAD框架,通过分解CAD构造树进行渐进推理,并引入SAPG学习策略,在CAD序列生成和模型评估上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11581 2026-07-14 cs.CV 新提交 77%

Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO

作为自身评论家的智能体:通过循环组相对策略优化统一区域理解与定位

Xin Zhang, Haochen Wang, Yikang Zhou, Jason Li, Robby T. Tan

机构 * National University of Singapore(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型的区域理解与定位问题,提出循环组相对策略优化框架CycleGRPO,利用任务对偶性构建自我评估范式,仅需区域输入,通过质量感知奖励评估字幕,在多基准测试中提升能力,为推进MLLMs像素级能力提供新途径。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10598 2026-07-14 cs.CV 新提交 74%

Anomalous Frame Detection by Grouping Frame Similarities between Two Videos Computed by Vision-Language Model to Extract Expert Workers' Unique Actions

通过对视觉语言模型计算的两个视频之间的帧相似性进行分组来检测异常帧,以提取专家工人的独特动作

Ryo Sakai, Yongpeng Cao, Nobutaka Kimura

专题命中 视觉定位与Grounding :vision-language model(title);分类 cs.CV

AI总结 针对熟练维护工人减少的问题,提出通过比较两个视频帧相似性检测异常帧来提取专家独特动作的方法,在模拟实验中对特定动作类型提取率达66.9%,比传统技术提高50个百分点,有助于技能转移和劳动力发展。

Comments 11 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11008 2026-07-14 cs.CV cs.AI 新提交 62%

SynCLIP: Synonym-Coherent Language-Image Pretraining for Robust Open-Vocabulary Dense Perception

SynCLIP:用于鲁棒开放词汇密集感知的同义词一致语言-图像预训练

Mingjie Xie, Guangjun He, Dongli Xu, Youtian Lin, Hongjue Li, Pengming Feng, Jian Guan, Yue Deng

机构 * Beihang University(北京航空航天大学) State Key Laboratory of Space Information System and Integrated Application(空间信息系统与集成应用国家重点实验室) Nanjing University(南京大学) Harbin Engineering University(哈尔滨工程大学) Beijing Zhongguancun Academy(北京中关村科学城)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究针对开放词汇密集感知中同义词引起的定位不一致问题,提出SynCLIP框架,通过SSA和SAR模块增强注意力一致性与定位精度,构建SEViC支持预训练,实验证明该方法显著提升定位一致性并达领先性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11039 2026-07-14 cs.HC cs.AI 新提交 57%

Same Stories, Different Journeys: From Social Comparison to Sensemaking in AI-Mediated Peer Career Exploration

相同的故事,不同的旅程:从社交媒体比较到人工智能介导的同伴职业探索中的意义建构

Pengping Tan, Baoquan Zhao, Zhenhui Peng

机构 * Sun Yat-sen University(中山大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对年轻求职者在社交媒体职业探索时被动浏览的问题,开发JobMate交互式系统,将真实帖子转化为对话式AI代理,通过对比研究发现其能引导社会比较转向建设性自我重构并促进意义建构,还探讨了相关AI系统设计启示。

Comments 10 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10802 2026-07-14 cs.CY cs.LG 新提交 57%

Q-Learning Lab: Teaching Reinforcement Learning Through Learner-Generated Trace Analysis

Q学习实验室:通过学习者生成的轨迹分析教授强化学习

Ekkachai Jueng

机构 * Computer Science Program Faculty of Sciences and Liberal Arts Rajamangala University of Technology Isan(计算机科学系 法学院及文科院 瑞亚玛芒拉大学技术学院伊桑)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 该研究提出Q学习实验室工具,通过学习者生成的轨迹分析教授表格Q学习。工具具可视化及记录功能,核心是学习-导出-分析循环。通过三项评估验证工具,还与现有工具比较、阐述教学法基础并提供教案,工具和代码公开。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10187 2026-07-14 cs.LG cs.SE 新提交 57%

Knowledge-Conditioned, Single-Pass LLM Synthesis of Executable Unity Game Scenes: A Compiler Error Census across 26 Goal Playable Concepts

知识条件下的可执行Unity游戏场景单遍大语言模型合成:26个目标可玩概念的编译器错误普查

Hugh Xuechen Liu, Kıvanç Tatar

机构 * Chalmers University of Technology(查尔姆斯理工大学) University of Gothenburg(哥德堡大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 研究大语言模型为Unity游戏场景编写代码,去除迭代修复循环进行单遍生成评估,通过对多个模型、模式等生成的代码分析编译器错误,发现瓶颈是缺少引擎特定知识,按需求对目标模式排序展示单遍生成断点。

Comments Substantially reframed and extended version of arXiv:2603.07101, with new experiments, figures, and analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10069 2026-07-14 cs.AI 新提交 57%

From ambiguous utterances to governed reuse classes: canonicalization, quotient invariance, and conditional decidability

从模糊话语到受控重用类:规范化、商不变性和条件可判定性

Cosimo Spera, Ray Garcia

机构 * Minerva CQ (Bourbaki Intelligent Systems, Inc.)(密涅瓦CQ(布尔巴基智能系统公司))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究在受控领域改变语义缓存中答案重用对象,基于已解决对话需求的数学特征商。通过三个关系形成细化链,使管道输出不变,明确重用商,阐述支持层强度,包括多种特性及可计算性、可接受性等。

详情

展开后加载摘要…

URL PDF HTML 收藏