arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-14 至 2026-07-14 共收录 109 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 33 篇

2601.13132 2026-07-14 cs.CV 版本更新 87%

SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis

SplatReasoner:通过新颖视图合成增强具身推理与基础能力

Kim Yu-Ji, Dahye Lee, Kim Jun-Seong, Nam Hyeon-Woo, GeonU Kim, Yongjin Kwon, Yu-Chiang Frank Wang, Jaesung Choe, Tae-Hyun Oh

机构 * POSTECH KAIST(韩国科学技术院) ETRI(韩国电子电信研究院) NVIDIA(英伟达)

专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 研究针对视觉语言模型应用于具身场景理解受固定视角限制的问题,提出SplatReasoner框架,利用3D高斯点云将新颖视图合成引入推理过程,经实验验证该方法能提升具身推理和3D基础能力。

Comments Accepted at ECCV 2026. Project page: https://splatreasoner.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17423 2026-07-14 cs.CV cs.HC cs.IT math.IT 版本更新 86%

VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR

VIBE:用于TL;DR的无注释视频到文本信息瓶颈评估

Shenghui Chen, Po-han Li, Sandeep Chinchali, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 针对决策任务中VLM输出冗长及现有评估依赖人工注释的问题,提出无注释的VIBE方法,用基础和效用指标对VLM输出评分并排序选择,在多个数据集上验证该方法能显著提升任务准确性、减少响应时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10826 2026-07-14 cs.CV cs.AI cs.GR 新提交 86%

3D-DefectBench: A Controlled Factorial Study of Vision-Language Model Evaluation Pipelines for Fine-Grained 3D Generation Defects

3D-缺陷基准:用于细粒度3D生成缺陷的视觉语言模型评估管道的控制因子研究

Zhenyu Zhao, Nanshan Jia, Jihyeon Je, Yifu Tang, Alvin Chan, Michael Spedden, Michael V. Palleschi, Sui Huang, Jingshen Wang, Zeyu Zheng

机构 * Roblox Corporation(罗布乐思公司) Berkeley AI Research Lab & Department of Industrial Engineering and Operations Research, University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究实验室及工业工程与运筹学系) Computer Science Department, Stanford University(斯坦福大学计算机科学系) Division of Biostatistics, University of California, Berkeley(加州大学伯克利分校生物统计学系)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 研究基于视觉语言模型的3D缺陷检测管道评估,引入3D-DefectBench基准框架,通过平衡因子设计改变多个管道因素进行实验,发现模型选择影响最大,各因素相互作用,还得出一些协议表现及评判与人工标注对比情况等结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11598 2026-07-14 cs.AI 新提交 85%

Interaction Scaling: Grounding the Third Axis of Test-Time Compute

交互缩放:奠定测试时计算的第三轴基础

Bojie Li, Noah Shi

机构 * Pine AI(松树人工智能公司) University of Washington(华盛顿大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 研究测试时增加计算量的新方法,提出交互缩放概念,通过模型与外部仪器交互突破传统方法局限,在硬编码任务和视觉工件处理上展现优势,表明交互缩放真实且区别于推理和采样,需反馈和度量基于实际。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09876 2026-07-14 cs.CV cs.AI q-bio.NC q-bio.QM 新提交 82%

Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data

Prompting-MammAlps:用于相机陷阱数据的细粒度文本到视频检索

Valentin Gabeff, Baptiste Maquignaz, Jennifer Shan, Sepideh Mamooler, Gencer Sumbul, Blair Costelloe, Devis Tuia, Alexander Mathis

机构 * Ecole Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Max Planck Institute of Animal Behavior(马克斯·普朗克动物行为研究所) University of Konstanz(康斯坦茨大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 针对相机陷阱数据自动检索视频的难题,提出Prompting-MammAlps基准及细粒度可解释TVR方法,训练视觉变压器并结合大语言模型处理查询,在基准测试中取得较好成绩,优于零样本VLM。

Comments Accepted at ECCV 2026; Project page: https://cnai.epfl.ch/prompting-mammalps

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11018 2026-07-14 cs.RO 新提交 82%

Whole-Body Semantic-to-Actuation Grounding of Elephant-Inspired Soft-Trunk Motion via Lightweight Flow Matching

通过轻量级流匹配实现大象启发式软躯干运动的全身语义到驱动的基础

Tingcong Liu, Tongshun Chen, Siyi Ma, Yuhao Wang, Aye Phyu Phyu Aung, Ibrahim Alsarraj, J. Senthilnath, Bo An, Ke Wu

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract)

AI总结 针对近距离人机交互中类似躯干机器人关联开放词汇响应难的问题,提出基于轻量级流匹配的全身语义到驱动基础框架,将多模态大语言模型响应转换为元组,参数化轨迹并采样运动,实验显示其提升关联正确性、减少推理时间,还提升了人机交互满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17343 2026-07-14 cs.CV 版本更新 81%

EvoGuard: An Extensible Agentic RL-based Framework for Practical and Evolving AI-Generated Image Detection

EvoGuard: 一种基于代理强化学习的可扩展框架,用于实际和演化的AI生成图像检测

Chenyang Zhu, Maorong Wang, Jun Liu, Ching-Chun Chang, Isao Echizen

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国家信息研究所)

专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出EvoGuard框架,利用多模态大语言模型和非MLLM检测器,通过能力感知的动态编排机制实现高效AIGI检测,优化后无需细粒度标注,实验表明其在准确性和可扩展性上均达最优。

Comments Template changed

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11339 2026-07-14 cs.CV 新提交 79%

HierCAD: Hierarchical Text-to-CAD Design via Structure Alignment and Parameter Grounding

HierCAD:通过结构对齐和参数接地实现分层文本到CAD设计

Jimin Xu, Tianbao Wang, Tao Jin, Zhou Zhao

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 针对文本到CAD设计中结构一致性和参数确定问题,提出HierCAD框架,通过分解CAD构造树进行渐进推理,并引入SAPG学习策略,在CAD序列生成和模型评估上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06896 2026-07-14 eess.AS cs.CL 版本更新 78%

TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding

TagSpeech:基于细粒度时间定位的端到端多说话人自动语音识别与说话人分离

Mingyue Huo, Yiwen Shao, Yuheng Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 研究提出TagSpeech框架,利用时间锚点定位技术联合多说话人ASR与说话人分离。通过关键设计解决细粒度对齐挑战,端到端建模“谁在何时说了什么”。实验显示其在DER上优于基线,采用参数高效训练范式,低计算成本获强性能。

Comments Accepted to ACL2026 Main Oral; v2: added overlap analysis in Section 5.2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11581 2026-07-14 cs.CV 新提交 77%

Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO

作为自身评论家的智能体:通过循环组相对策略优化统一区域理解与定位

Xin Zhang, Haochen Wang, Yikang Zhou, Jason Li, Robby T. Tan

机构 * National University of Singapore(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型的区域理解与定位问题,提出循环组相对策略优化框架CycleGRPO,利用任务对偶性构建自我评估范式,仅需区域输入,通过质量感知奖励评估字幕,在多基准测试中提升能力,为推进MLLMs像素级能力提供新途径。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03430 2026-07-14 cs.RO 版本更新 75%

ProAct: A Benchmark and Multimodal Framework for Structure-Aware Proactive Response

ProAct:用于结构感知主动响应的基准和多模态框架

Xiaomeng Zhu, Fengming Zhu, Weijie Zhou, Ye Tian, Zhenlin Hu, Yufei Huang, Yuchun Guo, Xinyu Wu, Zhengyou Zhang, Fangzhen Lin, Xuantang Xiong

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology (HKUST), Hong Kong SAR, China(香港科技大学计算机科学与工程系) Tencent, Shenzhen, China(腾讯(中国深圳)) Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究所(SIAT),中国科学院)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);MLLM(abstract)

AI总结 针对主动智能体开发受资源缺乏阻碍的问题,引入ProAct-75基准,提出由多模态大语言模型驱动的ProAct-Helper,其利用任务图进行行动选择,实验证明该方法在触发检测等方面优于闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10598 2026-07-14 cs.CV 新提交 74%

Anomalous Frame Detection by Grouping Frame Similarities between Two Videos Computed by Vision-Language Model to Extract Expert Workers' Unique Actions

通过对视觉语言模型计算的两个视频之间的帧相似性进行分组来检测异常帧,以提取专家工人的独特动作

Ryo Sakai, Yongpeng Cao, Nobutaka Kimura

专题命中 视觉定位与Grounding :vision-language model(title);分类 cs.CV

AI总结 针对熟练维护工人减少的问题,提出通过比较两个视频帧相似性检测异常帧来提取专家独特动作的方法,在模拟实验中对特定动作类型提取率达66.9%,比传统技术提高50个百分点,有助于技能转移和劳动力发展。

Comments 11 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04969 2026-07-14 cs.IR cs.AI 版本更新 70%

MG$^2$-RAG: Multi-Granularity Graph for Multimodal Retrieval-Augmented Generation

MG$^2$-RAG:多粒度图用于多模态检索增强生成

Sijun Dai, Qiang Huang, Xiaoxing You, Jun Yu

机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机学院)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 MG$^2$-RAG通过构建层次化多模态知识图谱,融合文本与视觉信息,提升多模态检索与生成性能,实验显示其在四个任务中均取得最佳效果,同时显著提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11008 2026-07-14 cs.CV cs.AI 新提交 62%

SynCLIP: Synonym-Coherent Language-Image Pretraining for Robust Open-Vocabulary Dense Perception

SynCLIP:用于鲁棒开放词汇密集感知的同义词一致语言-图像预训练

Mingjie Xie, Guangjun He, Dongli Xu, Youtian Lin, Hongjue Li, Pengming Feng, Jian Guan, Yue Deng

机构 * Beihang University(北京航空航天大学) State Key Laboratory of Space Information System and Integrated Application(空间信息系统与集成应用国家重点实验室) Nanjing University(南京大学) Harbin Engineering University(哈尔滨工程大学) Beijing Zhongguancun Academy(北京中关村科学城)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究针对开放词汇密集感知中同义词引起的定位不一致问题,提出SynCLIP框架,通过SSA和SAR模块增强注意力一致性与定位精度,构建SEViC支持预训练,实验证明该方法显著提升定位一致性并达领先性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20681 2026-07-14 cs.CL cs.AI cs.LG 版本更新 62%

Disentangling Feature Structure: A Mathematically Provable Two-Stage Training Dynamics in Transformers

解开特征结构:Transformer中数学上可证明的两阶段训练动态

Zixuan Gong, Shijia Li, Yong Liu, Jiaye Teng

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学耿丽人工智能学院) School of Mechanical-Electronic and Vehicle Engineering, Beijing University of Civil Engineering and Architecture(北京建筑大学机械电子与车辆工程学院) School of Statistics and Management, Shanghai University of Finance and Economics(上海财经大学统计与管理学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究Transformer中特征级两阶段训练动态,通过分析解缠结的两类特征结构引发的学习动态,基于简化设置进行研究,得到该理论框架内首个严格结果,且两阶段过程与注意力权重谱特性相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11039 2026-07-14 cs.HC cs.AI 新提交 57%

Same Stories, Different Journeys: From Social Comparison to Sensemaking in AI-Mediated Peer Career Exploration

相同的故事,不同的旅程:从社交媒体比较到人工智能介导的同伴职业探索中的意义建构

Pengping Tan, Baoquan Zhao, Zhenhui Peng

机构 * Sun Yat-sen University(中山大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对年轻求职者在社交媒体职业探索时被动浏览的问题,开发JobMate交互式系统,将真实帖子转化为对话式AI代理,通过对比研究发现其能引导社会比较转向建设性自我重构并促进意义建构,还探讨了相关AI系统设计启示。

Comments 10 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10802 2026-07-14 cs.CY cs.LG 新提交 57%

Q-Learning Lab: Teaching Reinforcement Learning Through Learner-Generated Trace Analysis

Q学习实验室:通过学习者生成的轨迹分析教授强化学习

Ekkachai Jueng

机构 * Computer Science Program Faculty of Sciences and Liberal Arts Rajamangala University of Technology Isan(计算机科学系 法学院及文科院 瑞亚玛芒拉大学技术学院伊桑)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 该研究提出Q学习实验室工具,通过学习者生成的轨迹分析教授表格Q学习。工具具可视化及记录功能,核心是学习-导出-分析循环。通过三项评估验证工具,还与现有工具比较、阐述教学法基础并提供教案,工具和代码公开。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10187 2026-07-14 cs.LG cs.SE 新提交 57%

Knowledge-Conditioned, Single-Pass LLM Synthesis of Executable Unity Game Scenes: A Compiler Error Census across 26 Goal Playable Concepts

知识条件下的可执行Unity游戏场景单遍大语言模型合成:26个目标可玩概念的编译器错误普查

Hugh Xuechen Liu, Kıvanç Tatar

机构 * Chalmers University of Technology(查尔姆斯理工大学) University of Gothenburg(哥德堡大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 研究大语言模型为Unity游戏场景编写代码,去除迭代修复循环进行单遍生成评估,通过对多个模型、模式等生成的代码分析编译器错误,发现瓶颈是缺少引擎特定知识,按需求对目标模式排序展示单遍生成断点。

Comments Substantially reframed and extended version of arXiv:2603.07101, with new experiments, figures, and analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10069 2026-07-14 cs.AI 新提交 57%

From ambiguous utterances to governed reuse classes: canonicalization, quotient invariance, and conditional decidability

从模糊话语到受控重用类:规范化、商不变性和条件可判定性

Cosimo Spera, Ray Garcia

机构 * Minerva CQ (Bourbaki Intelligent Systems, Inc.)(密涅瓦CQ(布尔巴基智能系统公司))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究在受控领域改变语义缓存中答案重用对象,基于已解决对话需求的数学特征商。通过三个关系形成细化链,使管道输出不变,明确重用商,阐述支持层强度,包括多种特性及可计算性、可接受性等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09762 2026-07-14 cs.AI cs.DB 新提交 57%

BatteryLake: Agentic, Physics-Grounded Curation of Heterogeneous Battery Aging Data and Benchmarking

BatteryLake:基于物理原理的异构电池老化数据智能管理与基准测试

Tianwen Zhu, Hao Wang, Yonggang Wen

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对公共电池老化数据集应用受限问题,BatteryLake通过大语言模型智能体、人在回路机制等,将原始数据转化为可用于基准测试的资产,还发布了含多种任务和协议的开放基准测试。

Comments The platform, benchmark, and curation protocol are publicly available at https://tianwen1209.github.io/batterylake/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09709 2026-07-14 cs.AI cs.SE 新提交 57%

The Verifier is the Curriculum: Execution-Gated Self-Distillation for Cross-Family Game Generation

验证器即课程:用于跨家族游戏生成的执行门控自蒸馏

Chenyu Zhou, Qiliang Jiang, Shuning Wu, Xu Zhou

机构 * Institute of Science Tokyo(东京科学研究所) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对游戏生成中代码生成器的优化,提出执行门控自蒸馏方法,通过严格启动过滤器提升跨家族泛化能力,在GameCraft-Bench上实验表明该方法显著提高干净生成率和覆盖率,验证器对模型学习有重要作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09576 2026-07-14 cs.CL cs.AI cs.ET 版本更新 57%

Conceptual Networks for Cross-Linguistic Idiomatic Expressions: A Feature-Based Graph Approach

跨语言习语表达的概念网络:一种基于特征的图方法

Kiran Pala, Punam Silu, Luxin Yu

机构 * University of Eastern Finland(东芬兰大学) Indian Institute of Technology Ropar(印度理工学院罗帕尔分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究提出基于网络的框架表示八种语言的习语和比喻意义,用概念特征注释构建加权图,通过社区检测发现习语按概念模式聚类,网络能捕获独特语义信息,跨语言转移实验有提升,消融研究表明多特征维度有贡献,提供了可解释的习语意义表示。

Comments Spelling of one of the author's name has been corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06534 2026-07-14 cs.CV 版本更新 57%

CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models

CAIRN:使用拓扑感知大型多模态模型进行跨房间3D场景理解

He Liang, Chenyang Ma, Yiming Zhang, Sangyun Shin, Andrew Markham, Niki Trigoni, Yuhang He

机构 * University of Oxford(牛津大学) Microsoft(微软公司) Simon Fraser University(西蒙弗雷泽大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究针对现有3D-LLMs不能处理多房间场景问题,提出拓扑感知3D-LLM即CAIRN。其将Transformer注意力与场景层次对齐,通过多种方式增强模型能力。在新基准CAIRN-MR上实验,CAIRN在多房间任务中大幅超越前人,单房间任务也具竞争力。

Comments Project Page: https://oceansdepp.github.io/cairn_web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15753 2026-07-14 cs.RO cs.CV 版本更新 57%

Hierarchical and Holistic Open-Vocabulary Functional 3D Scene Graphs for Indoor Spaces

层次化和整体化的开放词汇功能3D场景图用于室内空间

Xinggang Hu, Chenyangguang Zhang, Alexandros Delitzas, Xiangkui Zhang, Marc Pollefeys, Francis Engelmann, Xiangyang Ji

机构 * Tsinghua University(清华大学) ETH Zürich(苏黎世联邦理工学院) MPI for Informatics(信息研究所) Dalian University of Technology(大连理工大学) Microsoft(微软) Stanford University(斯坦福大学) University of Lugano(卢加诺大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出一种开放词汇管道,结合2D视觉定位和3D图优化,解决小规模密集相似实例的场景图推理问题,通过时间图优化和全局层次塑造提升室内空间的功能3D场景图生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22320 2026-07-14 cs.LG stat.AP stat.ML 版本更新 57%

How Can Machine Learning Emulators Best Support Climate Science?

弥合气候科学与机器学习之间的差距:在气候模型模拟中的应用

Luca Schmidt, Nina Effenberger, Vitus Benson, Philine L. Bommer, Robert Brunstein, Mikel N. Legasa, Maxim Samarin, Maybritt Schillinger

机构 * Cluster of Excellence Machine Learning University of Tübingen(图宾根大学机器学习卓越中心) Institute for Atmospheric and Climate Science ETH Zurich(大气与气候科学研究所,苏黎世联邦理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出整合气候科学与机器学习的方法,解决模拟器在气候决策中的应用障碍,通过设计易用且可靠的模拟器促进两领域融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21511 2026-07-14 cs.CV 版本更新 57%

Back to Point: Exploring Point-Language Models for Zero-Shot 3D Anomaly Detection

回到点:探索用于零样本3D异常检测的点语言模型

Kaiqiang Li, Gang Li, Mingle Zhou, Min Li, Delong Han, Jin Wan

机构 * Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences), Jinan, China(计算机功率网络与信息安全重点实验室,教育部,山东计算机科学中心(济南国家超级计算机中心),齐鲁大学(山东科学院),济南,中国) Shandong Provincial Key Laboratory of Computing Power Internet and Service Computing, Shandong Fundamental Research Center for Computer Science, Jinan, China(山东省计算功率互联网与服务计算重点实验室,山东省计算机科学基础研究中心,济南,中国)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出BTP框架,通过结合3D点云和文本嵌入,提升零样本3D异常检测的性能,实验表明其在Real3D-AD和Anomaly-ShapeNet上表现优异。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14954 2026-07-14 cs.LG 版本更新 57%

Multimodal rumor detection enhanced by external evidence and forgery features

通过外部证据和伪造特征增强的多模态谣言检测

Han Li, Hua Sun

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.LG

AI总结 本文提出通过外部证据和伪造特征增强的多模态谣言检测模型,利用ResNet34视觉编码器、BERT文本编码器和伪造特征模块,结合双对比学习模块和门控自适应特征缩放融合机制,提升谣言检测性能。

Comments 20pages,10figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13184 2026-07-14 cs.CV 57%

Triad: Empowering LMM-based Anomaly Detection with Vision Expert-guided Visual Tokenizer and Manufacturing Process

Triad: 通过视觉专家引导的视觉标记器和制造过程增强基于LMM的异常检测

Yuanze Li, Shihao Yuan, Haolin Wang, Qizhang Li, Ming Liu, Chen Xu, Guangming Shi, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Lab(鹏城实验室)

专题命中 视觉定位与Grounding :LLaVA(abstract);分类 cs.CV

AI总结 Triad通过引入视觉专家引导的标记器和制造过程,提升基于LMM的工业异常检测性能。

Journal ref In Proceedings of the IEEE/CVF International Conference on Computer Vision, pp. 21917-21926. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10387 2026-07-14 eess.AS cs.CL 新提交 50%

GigaChat Audio: Time-aware Large Audio Language Model

GigaChat音频:时间感知大型音频语言模型

Aleksandr Kutsakov, Mariia Sadovina, Georgii Gospodinov, Alexandr Maximenko, Oleg Kutuzov, Pavel Bogomolov, Fyodor Minkin

机构 * SaluteDevices, Russia(SaluteDevices)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究音频条件语言模型长录音时间定位难题,提出时间感知音频语言模型,利用合成监督交织时间标记与音频令牌,在多基准测试中实现高精度,支持相关描述与总结,通过消融实验明确多因素影响,并发布模型权重和数据集。

Comments Accepted to Interspeech 2026. Model and dataset: https://huggingface.co/ai-sage/GigaChat3.1-Audio-10B-A1.8B

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11390 2026-07-14 cs.SE 新提交 50%

TerraRepair: A Tool-Grounded LLM Agent for Infrastructure-as-Code Repair

TerraRepair:一种用于基础设施即代码修复的工具接地大语言模型代理

Minase Mekete Mengistu, Juri Di Rocco, Phuong T. Nguyen, Davide Di Ruscio

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究探讨工具接地能否改进基于LLM的Terraform修复及何时升级问题。提出TerraRepair工具接地LLM代理,通过检索上下文等操作进行修复。实验表明其能显著提高扫描器验证修复率,凸显工具接地改进修复效果,同时指出特定部署上下文是自主修复的主要限制。

Comments The paper has been peer reviewed and accepted for publication in the proceedings of the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏