arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1267 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 340 篇

2607.09576 2026-07-14 cs.CL cs.AI cs.ET 版本更新 57%

Conceptual Networks for Cross-Linguistic Idiomatic Expressions: A Feature-Based Graph Approach

跨语言习语表达的概念网络:一种基于特征的图方法

Kiran Pala, Punam Silu, Luxin Yu

机构 * University of Eastern Finland(东芬兰大学) Indian Institute of Technology Ropar(印度理工学院罗帕尔分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究提出基于网络的框架表示八种语言的习语和比喻意义,用概念特征注释构建加权图,通过社区检测发现习语按概念模式聚类,网络能捕获独特语义信息,跨语言转移实验有提升,消融研究表明多特征维度有贡献,提供了可解释的习语意义表示。

Comments Spelling of one of the author's name has been corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06534 2026-07-14 cs.CV 版本更新 57%

CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models

CAIRN:使用拓扑感知大型多模态模型进行跨房间3D场景理解

He Liang, Chenyang Ma, Yiming Zhang, Sangyun Shin, Andrew Markham, Niki Trigoni, Yuhang He

机构 * University of Oxford(牛津大学) Microsoft(微软公司) Simon Fraser University(西蒙弗雷泽大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究针对现有3D-LLMs不能处理多房间场景问题,提出拓扑感知3D-LLM即CAIRN。其将Transformer注意力与场景层次对齐,通过多种方式增强模型能力。在新基准CAIRN-MR上实验,CAIRN在多房间任务中大幅超越前人,单房间任务也具竞争力。

Comments Project Page: https://oceansdepp.github.io/cairn_web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15753 2026-07-14 cs.RO cs.CV 版本更新 57%

Hierarchical and Holistic Open-Vocabulary Functional 3D Scene Graphs for Indoor Spaces

层次化和整体化的开放词汇功能3D场景图用于室内空间

Xinggang Hu, Chenyangguang Zhang, Alexandros Delitzas, Xiangkui Zhang, Marc Pollefeys, Francis Engelmann, Xiangyang Ji

机构 * Tsinghua University(清华大学) ETH Zürich(苏黎世联邦理工学院) MPI for Informatics(信息研究所) Dalian University of Technology(大连理工大学) Microsoft(微软) Stanford University(斯坦福大学) University of Lugano(卢加诺大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出一种开放词汇管道,结合2D视觉定位和3D图优化,解决小规模密集相似实例的场景图推理问题,通过时间图优化和全局层次塑造提升室内空间的功能3D场景图生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22320 2026-07-14 cs.LG stat.AP stat.ML 版本更新 57%

How Can Machine Learning Emulators Best Support Climate Science?

弥合气候科学与机器学习之间的差距:在气候模型模拟中的应用

Luca Schmidt, Nina Effenberger, Vitus Benson, Philine L. Bommer, Robert Brunstein, Mikel N. Legasa, Maxim Samarin, Maybritt Schillinger

机构 * Cluster of Excellence Machine Learning University of Tübingen(图宾根大学机器学习卓越中心) Institute for Atmospheric and Climate Science ETH Zurich(大气与气候科学研究所,苏黎世联邦理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出整合气候科学与机器学习的方法,解决模拟器在气候决策中的应用障碍,通过设计易用且可靠的模拟器促进两领域融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21511 2026-07-14 cs.CV 版本更新 57%

Back to Point: Exploring Point-Language Models for Zero-Shot 3D Anomaly Detection

回到点:探索用于零样本3D异常检测的点语言模型

Kaiqiang Li, Gang Li, Mingle Zhou, Min Li, Delong Han, Jin Wan

机构 * Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences), Jinan, China(计算机功率网络与信息安全重点实验室,教育部,山东计算机科学中心(济南国家超级计算机中心),齐鲁大学(山东科学院),济南,中国) Shandong Provincial Key Laboratory of Computing Power Internet and Service Computing, Shandong Fundamental Research Center for Computer Science, Jinan, China(山东省计算功率互联网与服务计算重点实验室,山东省计算机科学基础研究中心,济南,中国)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出BTP框架,通过结合3D点云和文本嵌入,提升零样本3D异常检测的性能,实验表明其在Real3D-AD和Anomaly-ShapeNet上表现优异。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14954 2026-07-14 cs.LG 版本更新 57%

Multimodal rumor detection enhanced by external evidence and forgery features

通过外部证据和伪造特征增强的多模态谣言检测

Han Li, Hua Sun

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.LG

AI总结 本文提出通过外部证据和伪造特征增强的多模态谣言检测模型,利用ResNet34视觉编码器、BERT文本编码器和伪造特征模块,结合双对比学习模块和门控自适应特征缩放融合机制,提升谣言检测性能。

Comments 20pages,10figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15543 2026-07-10 cs.CL cs.AI 版本更新 57%

ParamMute: Suppressing Knowledge-Critical FFNs for Faithful Retrieval-Augmented Generation

ParamMute:抑制知识关键的前馈神经网络以实现忠实的检索增强生成

Pengcheng Huang, Zhenghao Liu, Yukun Yan, Haiyan Zhao, Xiaoyuan Yi, Hao Chen, Zhiyuan Liu, Maosong Sun, Tong Xiao, Ge Yu, Chenyan Xiong

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学人工智能研究院计算机科学与技术系) Microsoft Research Asia, Beijing, China(微软亚洲研究院) Language Technologies Institute, Carnegie Mellon University, United States(卡内基梅隆大学语言技术研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究RAG中LLMs不忠实生成问题,提出ParamMute框架抑制相关FFNs激活并校准模型,通过CoFaithfulQA基准评估,显著提升忠实性,减少对参数记忆依赖,为提高LLM在RAG中的可信度提供新方向。

Comments 26 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15770 2026-07-09 physics.optics cs.AR cs.CV 版本更新 57%

Physically Grounded Monocular Depth via Nanophotonic Wavefront Encoding

通过纳米光子波前编码实现物理基础的单目深度

Bingxuan Li, Jiahao Wu, Yuan Xu, Zezheng Zhu, Yunxiang Zhang, Kenneth Chen, Yanqi Liang, Nanfang Yu, Qi Sun

机构 * New York University(纽约大学) Columbia University(哥伦比亚大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究旨在解决单目深度感知中度量尺度模糊问题,核心方法是用超透镜通过纳米光子学编码深度线索,结合DFMs与输入自适应策略及模拟管道,实验证明该方法有效提升单目度量深度传感精度。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20735 2026-07-08 cs.AI cs.LO 版本更新 57%

Implementing Metric Temporal Answer Set Programming

实现度量时态回答集编程

Arvid Becker, Pedro Cabalar, Martin Diéguez, Susana Hahn, Javier Romero, Torsten Schaub

机构 * University of Potsdam, Germany(波恩大学) University of Corunna, Spain(科鲁纳大学) University of Angers, France(昂热大学) Potassco Solutions, Germany(Potassco解决方案)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究如何实现度量时态回答集编程,利用带差异约束的ASP扩展处理时间相关方面,有效解耦度量ASP与时间粒度,解决处理细粒度时间约束时的可扩展性问题,使解决方案不受时间精度影响。

Comments Under consideration in Theory and Practice of Logic Programming (TPLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29596 2026-07-07 cs.SI cs.LG 版本更新 57%

Boundary Degree as a Node-level Feature for Epidemic Scenario Identification in Agent-based Cascade Simulations

边界度作为基于智能体的级联模拟中流行病场景识别的节点级特征

Amro Alabsi Aljundi, Galen Harrison, Jiangzhuo Chen, Abhijin Adiga, Anil Kumar Vullikanti, Madhav V. Marathe

机构 * Biocomplexity Institute(生物复杂性研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 提出边界度作为节点级级联特征,通过消融实验证明其单独提升场景识别准确率19%,并理论证明无边界或边信息时某些场景不可区分。

Comments 28 pages, 10 figures, preliminary version; not final

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20494 2026-07-07 cs.LG physics.ao-ph stat.AP 版本更新 57%

A 10,000-Year Global Stochastic Tropical Cyclone Catalog with Wind-Dependent Track Transitions (WHITS)

具有风依赖性路径转换的10,000年全球随机热带气旋目录(WHITS)

Jennifer Nakamura, Upmanu Lall

机构 * Lamont-Doherty Earth Observatory, Columbia University(哥伦比亚大学拉蒙特-多赫蒂地球观测站) School of Complex Adaptive Systems, Arizona State University(亚利桑那州立大学复杂适应系统学院) Earth and Environmental Engineering, Columbia University(哥伦比亚大学地球与环境工程系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出WHITS方法,通过非参数半马尔可夫路径生成器生成全球10,000年合成气旋目录,以提高保险损失评估的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11797 2026-07-07 cs.RO cs.CV 版本更新 57%

AnchorDream: Repurposing Video Diffusion for Embodiment-Aware Robot Data Synthesis

AnchorDream:将视频扩散用于具身感知机器人数据合成

Junjie Ye, Rong Xue, Basile Van Hoorick, Pavel Tokmakov, Muhammad Zubair Irshad, Yue Wang, Vitor Guizilini

机构 * Toyota Research Institute(丰田研究院) USC Physical Superintelligence (PSI) Lab(USC物理超智能(PSI)实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对机器人示范数据收集瓶颈,AnchorDream利用预训练视频扩散模型,通过机器人运动渲染来合成数据,无需环境建模,从少量示范生成多样高质量数据集,提升下游策略学习。

Comments Project page: https://jay-ye.github.io/AnchorDream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01651 2026-07-07 cs.CV 版本更新 57%

Diffusion Models are Open-World Affordance Learners: Leveraging Generative Priors for 3D Affordance Learning

扩散模型是开放世界的功能学习器:利用生成先验进行3D功能学习

Hanqing Wang, Zhenhao Zhang, Kaiyang Ji, Mingyu Liu, Wenti Yin, yuchao chen, Zhirui Liu, Xiangyu Zeng, Tianxiang Gui, Hangxing Zhang, Jiahao Yuan, Zhiqing Cui, Jiaxin Liu, Zhiyuan Ma, Hui Xiong

机构 * The Hong Kong University of Science and Technology(香港科技大学) ShanghaiTech University(上海科技大学) Zhejiang University(浙江大学) Nanjing University(南京大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究3D功能基础问题,利用文本到图像扩散模型提取先验知识,提出基于扩散的DAG框架用于3D功能预测,通过实验证明其优于现有方法且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17965 2026-07-03 cs.SE cs.AI 版本更新 57%

BLAgent: Agentic RAG for File-Level Bug Localization

BLAgent: 一种面向文件级Bug定位的代理RAG

Md Afif Al Mamun, Gias Uddin

机构 * University of Calgary(卡尔加里大学) York University(约克大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出BLAgent,一种新型代理RAG框架,用于文件级Bug定位,通过结合代码结构感知的仓库编码、双视角查询转换和两阶段代理重排序,提高了Bug定位的准确性和效率。

Comments Accepted for publication in ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09446 2026-07-03 cs.CV 版本更新 57%

Defect-aware Hybrid Prompt Optimization via Progressive Tuning for Zero-Shot Multi-type Anomaly Detection and Segmentation

基于渐进调优的缺陷感知混合提示优化用于零样本多类型异常检测与分割

Nadeem Nazer, Hongkuan Zhou, Lavdim Halilaj, Ylli Sadikaj, Steffen Staab

机构 * Corporate Research, Robert Bosch GmbH(罗伯特·博世集团企业研究部) Otto-von-Guericke-University(奥托·冯·格里克大学) Institute for Artificial Intelligence, University of Stuttgart(斯图加特大学人工智能研究所) Faculty of Computer Science, UniVie Doctoral School Computer Science, University of Vienna(维也纳大学计算机科学系) University of Southampton(南安普顿大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 提出DAPO框架,通过混合提示机制结合可读缺陷描述与可学习嵌入,对齐异常视觉特征与文本语义,在零样本多类型异常检测与分割任务中平均提升AUROC 3.6%和5.2%。

Journal ref European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04520 2026-07-03 cs.AI 版本更新 57%

Aria: An Agent For Retrieval and Iterative Auto-Formalization via Dependency Graph

Aria: 基于依赖图的检索与迭代自动形式化智能体

Hanyu Wang, Ruohan Xie, Yutong Wang, Guoxiong Gao, Xintao Yu, Bin Dong

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出Aria系统,通过两阶段思维图过程递归分解定理陈述为依赖图并构建形式化,结合AriaScorer验证语义正确性,在ProofNet、FATE-X和同调猜想数据集上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31597 2026-07-02 cs.CV 版本更新 57%

SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models

SOCO: 视觉基础模型中语义对象对应关系的基准测试

Olaf Dünkel, Basavaraj Sunagad, Haoran Wang, David T. Hoffmann, Christian Theobalt, Adam Kortylewski

机构 * Max Planck Institute for Informatics(马克斯·普朗克研究所信息学研究所) Saarland Informatics Campus(萨尔州信息学校园) CISPA Helmholtz Center for Information Security(信息安全霍夫曼中心) University of Freiburg(弗赖堡大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 提出SOCO基准,通过引入对应类型分类法和100个类别上超过100万对功能上有意义的关键点注释,系统评估视觉基础模型中的语义对应能力,并揭示模型在跨类别迁移、语言引导定位与视觉对应之间的差距。

Comments Project page: https://genintel.github.io/SOCO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14113 2026-07-02 cs.CL cs.AI cs.CR 版本更新 57%

Toward Cybersecurity-Expert Small Language Models

面向网络安全专家的小型语言模型

Matan Levi, Daniel Ohayon, Ariel Blobstein, Ravid Sagi, Ian Molloy, Yair Allouche

机构 * IBM Research(IBM研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对网络安全领域缺乏高质量领域模型和训练数据的问题,提出CyberPal 2.0系列小型语言模型(4B-20B参数),通过SecKnowledge 2.0管道生成增强的思维链指令数据集,在多项网络安全基准测试中超越基线并匹配或超越前沿模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29965 2026-07-01 cs.AI 版本更新 57%

Meta-Programming for Linear-time Temporal Answer Set Programming

线性时态回答集编程的元编程

Susana Hahn, Amadé Nemes, Javier Romero, Torsten Schaub

机构 * University of Potsdam, Germany(波恩大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出一种统一的元编程框架,通过扩展clingo的理论语法并引入转换管道保护嵌套模态,实现了对多种线性时态逻辑(TEL、MEL、DEL)的语义操作化,并开发了metasp系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21466 2026-07-01 cs.CV 版本更新 57%

StreamEdit: Training-Free Video Editing via Few-Step Streaming Video Generation

StreamGVE: 无需训练的视频编辑通过少步流式视频生成

Guanlong Jiao, Chenyangguang Zhang, Jia Jun Cheng Xian, Zewei Zhang, Renjie Liao

机构 * The University of British Columbia(不列颠哥伦比亚大学) ETH Zürich(苏黎世联邦理工学院) McMaster University(麦马斯特大学) Vector Institute(向量研究所) Canada CIFAR AI Chair(加拿大 CIFAR 人工智能主席)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出StreamGVE,一种基于噪声到数据视角的视频编辑方法,通过引入双分支快速采样和自注意力桥接以及交叉注意力接地/增强,实现了高效的视频编辑,能够在少步设置中优于现有方法。

Comments ECCV 2026. Project Page: https://dsl-lab.github.io/StreamEdit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23455 2026-07-01 cs.CV 版本更新 57%

DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection

DetPO:基于多模态大语言模型的上下文学习用于少样本目标检测

Gautam Rajendrakumar Gare, Neehar Peri, Matvei Popov, Shruti Jain, John Galeotti, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学) Roboflow

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出DetPO,一种无需梯度的测试时优化方法,通过最大化少样本视觉训练示例上的检测精度并校准预测置信度,优化文本提示,提升多模态大语言模型在少样本目标检测中的性能。

Comments This work has been accepted to the European Conference on Computer Vision (ECCV) 2026. Project Page: https://ggare-cmu.github.io/DetPO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14171 2026-07-01 cs.AI 版本更新 57%

Paper2Rebuttal: A Multi-Agent Framework for Transparent Author Response Assistance

Paper2Rebuttal: 一种透明的作者回复辅助多智能体框架

Qianli Ma, Chang Guo, Zhiheng Tian, Siyu Wang, Jipeng Xiao, Yuanhao Yue, Zhipeng Zhang

机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出多智能体框架RebuttalAgent,将回复生成重构为以证据为中心的规划任务,通过分解反馈、构建混合上下文和外部搜索模块,提升覆盖度、忠实性和策略连贯性。

Comments Accepted by ACL2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06845 2026-07-01 cs.CV 版本更新 57%

PA-VAD: Diffusion-Based Pseudo-Only Video Anomaly Detection via Domain-Aligned Memory Updates

PA-VAD: 基于扩散的伪异常视频异常检测通过域对齐记忆更新

Satoshi Hashimoto, Yanan Wang, Hitoshi Nishimura, Mori Kurokawa

机构 * KDDI Research, Inc.(KDDI研究所)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 提出PA-VAD框架,仅用真实正常视频和扩散合成伪异常视频训练检测器,通过域对齐正则化模块(DARM)消除伪异常特征偏差,在多个基准上超越使用真实异常视频的方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20094 2026-06-29 cs.AI 版本更新 57%

CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching

CausalFlip: 超越语义匹配的LLM因果判断基准

Yuzhe Wang, Yaochen Zhu, Jundong Li

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出CausalFlip基准,通过构建语义相似但因果答案相反的问题对和噪声前缀评估,揭示LLM依赖语义匹配而非因果推理,并验证内化因果推理方法可提升因果基础。

Comments 8 pages plus references, 3 figures, 3 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03217 2026-06-29 cs.CL cs.AI cs.CY cs.IR 版本更新 57%

Hybrid Fact-Checking that Integrates Knowledge Graphs, Large Language Models, and Search-Based Retrieval Agents Improves Interpretable Claim Verification

混合事实核查:集成知识图谱、大语言模型和基于搜索的检索代理提高可解释的声明验证

Shaghayegh Kolli, Richard Rosenbaum, Timo Cavelius, Lasse Strothe, Andrii Lata, Jana Diesner

机构 * Technical University Munich(慕尼黑工业大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出一种混合事实核查方法,集成知识图谱、大语言模型和实时搜索代理,通过三步流水线(KG检索、LM分类、Web搜索)在FEVER基准上达到0.93 F1分数,无需微调,并有效处理信息不足情况。

Comments Paper has been accepted at 9th wiNLP workshop at EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07460 2026-06-29 cs.CV cs.CL 版本更新 57%

SIGNER: Temporally Grounded Sign Language Generation via Time-Resolved Conditioning

SIGNER: 通过时间分辨条件实现时间对齐的手语生成

Taeryung Lee, Hyeongjin Nam, Gyeongsik Moon, Kyoung Mu Lee

机构 * IPAI Dept. of ECE & ASRI, Seoul National University(首尔大学电子与计算机工程系及ASRI) Dept. of CSE, Korea University(高丽大学计算机科学与工程系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出SIGNER框架,通过时间分辨条件(时间-词汇条件与局部时间融合)确保手语生成中词汇顺序正确和语义准确,在Phoenix-2014T和CSL-Daily上达到最优性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23729 2026-06-23 cs.CV 版本更新 57%

DynProto: Dynamic Prototype Evolution for Out-of-Distribution Detection

DynProto: 动态原型进化用于分布外检测

Yanqi Wu, Xinhua Lu, Runhe Lai, Qichao Chen, Jia-Xin Zhuang, Wei-Shi Zheng, Ruixuan Wang

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) University of Nottingham Malaysia(诺丁汉马来西亚大学) Hong Kong University of Science and Technology(香港科学与技术大学) Key Laboratory of Machine Intelligence and Advanced Computing(智能与先进计算关键实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 DynProto通过动态学习分布内信息生成原型,提升分布外检测性能,减少FPR95并提升AUROC。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00116 2026-06-23 q-bio.NC cs.AI 版本更新 57%

Meta-learning ecological priors from large language models explains human learning and decision making

从大型语言模型中元学习生态先验解释人类学习与决策

Akshay K. Jagadish, Mirko Thalmann, Julian Coda-Forno, Marcel Binz, Eric Schulz

机构 * Institute for Human-Centered AI, Helmholtz Computational Health Center(以人为本的人工智能研究所,海德堡计算健康中心) Computational Principles of Intelligence, Max Planck Institute for Biological Cybernetics(计算智能原理,马克斯·普朗克生物 cybernetics 研究院) Eberhard Karls University of Tübingen(图宾根大学) Princeton AI Lab, Princeton University(普林斯顿大学人工智能实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出生态理性分析框架,利用大语言模型生成生态有效任务,通过元学习得到ERMI算法,该算法内化自然问题空间的统计规律,灵活适应新情境,在15个实验中优于多个认知模型,表明人类认知可能反映对日常问题生态结构的适应性对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20014 2026-06-19 cs.RO cs.AI 版本更新 57%

Bring My Cup! Personalizing Vision-Language-Action Models with Visual Attentive Prompting

Bring My Cup! 使用视觉注意力提示个性化视觉-语言-动作模型

Sangoh Lee, Sangwoo Mo, Wook-Shin Han

机构 * GSAI, POSTECH(POSTECH 人工智能研究所) IME, POSTECH(POSTECH 信息媒体研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对VLA模型难以处理个性化指令的问题,提出无需训练的视觉注意力提示(VAP)方法,通过参考图像作为非参数记忆,利用开放词汇检测和嵌入匹配定位个人物品,并以视觉提示注入模型,在多个仿真和真实场景中显著提升成功率和正确物体操作。

Comments ICML 2026. Project page: https://vap-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03156 2026-06-18 cs.CV 版本更新 57%

CAMEO: A Conditional and Quality-Aware Multi-Agent Image Editing Orchestrator

CAMEO: 一种条件感知与质量驱动的多智能体图像编辑编排器

Yuhan Pu, Hao Zheng, Ziqian Mo, Zirui Pang, Hill Zhang, Tianyi Fan, Shuhong Wu, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Harbin Institute of Technology(哈尔滨工业大学) Shenzhen University(深圳大学) Claremont McKenna College(克莱蒙特麦肯纳学院) Research Institute of Petroleum Exploration and Development, CNPC(石油勘探开发研究院,中石油)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出CAMEO多智能体框架,将条件图像编辑重构为质量感知的反馈驱动过程,通过分解编辑阶段、嵌入评估循环,在异常插入和人体姿态切换任务中平均胜率提升20%。

详情

展开后加载摘要…

URL PDF HTML 收藏