Discovering space - Grounding spatial topology and metric regularity in a naive agent's sensorimotor experience
专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI、cs.LG
Comments 59 pages, 16 figures, submitted to Neural Networks
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI、cs.LG
Comments 59 pages, 16 figures, submitted to Neural Networks
专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI、cs.LG
Comments 6 pages, 3 figures
专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV、cs.LG
Comments Under review on Journal of Artificial Intelligence Research (JAIR) -- Special Track on Deep Learning, Knowledge Representation, and Reasoning
专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI、cs.LG
Comments 14 pages, 4 figures
专题命中 视觉定位与Grounding :grounding(title,comments);分类 cs.LG
Comments D. Matthews, S. Kriegman, C. Cappelle and J. Bongard, "Word2vec to behavior: morphology facilitates the grounding of language in machines," 2019 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Macau, China, 2019. \c{opyright} 2019 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses
专题命中 视觉定位与Grounding :grounding(title,comments);分类 cs.AI
Comments 9 pages, 8 figures, To appear in the Proceedings of the ACL workshop Language Grounding for Robotics, Vancouver, Canada
HODAgent:面向物理世界人机交互的按需、响应式人形机器人
机构 * Xiaopeng(小鹏)
专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract)
AI总结 HODAgent作为面向服务人形机器人的System-2具身智能体,通过半双工架构实现自适应服务,在仿真与实体机器人上均显著优于基准模型。
你会点击什么?基于偏好感知高光检索的个性化视频缩略图生成
专题命中 视觉定位与Grounding :VLM(summary_cn,abstract)
AI总结 研究针对视频平台个性化视频缩略图生成问题,提出两阶段框架,先通过偏好感知检索选取视觉锚点,再经VLM引导的扩散管道生成缩略图,实验和用户研究证明该方法性能优且能提升用户参与度。
ProAct:用于结构感知主动响应的基准和多模态框架
机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology (HKUST), Hong Kong SAR, China(香港科技大学计算机科学与工程系) ; Tencent, Shenzhen, China(腾讯(中国深圳)) ; Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究所(SIAT),中国科学院)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);MLLM(abstract)
AI总结 针对主动智能体开发受资源缺乏阻碍的问题,引入ProAct-75基准,提出由多模态大语言模型驱动的ProAct-Helper,其利用任务图进行行动选择,实验证明该方法在触发检测等方面优于闭源模型。
图像无法表达的:语言引导的嗅觉表征学习
机构 * LIX, École Polytechnique, IP Paris, CNRS(LIX,巴黎高等理工学院,IP巴黎,CNRS)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 研究图像与嗅觉对齐难题,提出SCENT多模态框架,利用视觉语言模型生成场景描述符,训练气味编码器,通过语言引导潜在分解分离特定对象气味与环境贡献,提升跨模态检索性能,产生可解释表征。
Comments ECCV 2026. Project page: https://www.lix.polytechnique.fr/vista/projects/2026_scent_tsonis/
GAVEL:基于视觉定位的标题错误验证与定位
机构 * OMRON SINIC X Corporation(欧姆龙SINIC X公司)
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract_cn);grounding(abstract)
AI总结 提出GAVEL任务,联合解决图像-文本对的验证、解释和定位问题,构建数据集和基准,监督基线在定位和解释指标上持续改进。
Comments conference
面向机器的对称熵约束视频编码
专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);grounding(abstract)
AI总结 提出SEC-VCM框架,通过双向熵约束机制对称对齐视频编解码器与视觉骨干网络,保留语义并丢弃无关信息,结合语义-像素双路径融合提升机器视觉任务性能,在多项任务上显著优于H.266/VVC。
Comments Accepted by IEEE Transactions on Image Processing. This is the author's accepted manuscript (AAM)
视频语言模型何时停止观看?多模态RLVR中视觉捷径的形成与逆转受奖励强度控制
机构 * Zekun Xu(徐泽坤)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 研究多模态强化学习中视觉捷径的形成与逆转机制,发现惩罚强度可控制其出现和消除,且存在关键干预窗口。
Comments 11 pages, 4 figures
Dementia-Agents:用于痴呆分期和表型分析的多模态多智能体系统
机构 * Monash University(莫纳什大学) ; Eastern Health(东部健康) ; Lived Experience Advisor(生活经验顾问)
专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract_cn)
AI总结 提出Dementia-Agents多智能体框架,通过数据翻译、专家预测和协调聚合三步流程,在真实临床队列中实现优于单一MLLM和先前多智能体系统的痴呆综合征级分期与表型分析。
Comments 8 pages
一图足矣:基于文本世界模型的智能体单样本图像生成用于长尾空间感知
机构 * Tsinghua University(清华大学) ; SenseTime Research(商汤科技研究院) ; Sun Yat-Sen University(中山大学) ; Technical University of Munich(慕尼黑工业大学) ; Heilbronn Data Science Center(海尔布隆数据科学中心) ; Munich Data Institute(慕尼黑数据研究所)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出WMGen-v1框架,利用单张参考图像通过LVLM构建结构化场景表示,LLM进行物理合理的场景扩展,再由扩散模型生成多样化的长尾训练数据,缓解空间感知中的数据稀缺问题。
MALLVI:一种多智能体框架用于集成通用机器人操作
机构 * Department of Electrical Engineering, Sharif University of Technology(电气工程系,谢里夫大学)
专题命中 视觉定位与Grounding :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 MALLVI通过多智能体协作实现闭环反馈驱动的机器人操作,提升泛化能力和零样本任务成功率。
Comments Some fundemental change in text and codebase
CURE:基于课程引导的多任务训练实现可靠的解剖学接地报告生成
机构 * Pontificia Universidad Católica de Chile(智利天主教大学) ; CENIA ; iHEALTH ; KAUST(科威特皇家科学与技术局)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出CURE框架,通过课程学习动态调整多任务训练,提升医学报告生成的视觉接地准确性和事实一致性,无需额外数据。
Comments 31 pages, 7 figures, accepted to CVPR 2026 (oral)
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 36279-36289
VAMPS: 视觉辅助数学问题求解基准
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出VAMPS基准,通过1,168道双语多选题评估多模态大模型在借助绘图工具进行数学推理时的表现,发现直接解析求解优于工具辅助视觉求解。
FOCUS: 通过视觉支持约束和策略优化强制上下文目标定位
机构 * Amazon, Seattle, USA(亚马逊(美国西雅图))
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 提出一种两阶段训练框架,通过优化支持框与查询图像间的上下文注意力并结合GRPO强化学习,实现无类别监督的类别无关上下文目标定位,7B模型性能超越72B模型。
Comments Accepted at ICML 2026. * Equal Contributions
VOGUE:面向时尚领域对话式推荐的多模态数据集
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);MLLM(abstract_cn)
AI总结 为弥补多模态对话推荐数据集的不足,构建了包含60个人类对话、2100个细粒度标注话语的VOGUE数据集,支持视觉和上下文推理评估,并揭示了多模态大语言模型在偏好推断上的系统性分布误差。
轻量级多模态大语言模型驱动的输电设备经济高效缺陷分级
专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);multimodal large language model(abstract)
AI总结 提出基于多模态大语言模型的缺陷分级框架,通过上下文学习最大化商业模型潜力,并利用链式思考问答对微调轻量级模型,实现低成本高精度分级。
Comments 9pages, 6figures
SVFSearch: 一种面向游戏垂直领域的多模态知识密集型短视频帧搜索基准
机构 * Kuaishou Technology(快手科技)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出SVFSearch,首个针对中文游戏领域短视频帧搜索的多模态知识密集型基准,通过5000个四选一测试示例和4198个辅助训练示例,评估了从直接问答到计划-行动-重新计划代理等多种方法在短视频帧搜索中的性能。
MedicalBench: 评估大型语言模型以改进医疗概念提取
机构 * Optum AI
专题命中 视觉定位与Grounding :grounding(summary_cn,abstract)
AI总结 本文提出MedicalBench,一个用于评估大型语言模型在医疗概念提取中的表现的基准,重点在于隐含概念的提取和证据 grounding,通过多阶段流程构建数据集并定义两种互补的评估任务,揭示了隐含概念提取的挑战。
增强检索的多模态模型用于虚假新闻检测
机构 * University of International Business and Economics(国际商务经济大学) ; Peking University(北京大学) ; University of Southern California(南加州大学) ; Upstart Holdings, Inc.(Upstart Holdings公司)
专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);multimodal large language model(abstract)
AI总结 本文提出RAMM模型,通过多模态大语言模型和抽象叙述对齐模块,解决虚假新闻检测中跨实例叙述一致性缺失和领域知识不足的问题,实验验证了其有效性。
Comments Accepted to SIGIR 26
FORGE:面向制造场景的细粒度多模态评估
机构 * University of Waterloo(滑铁卢大学) ; University of Sydney(悉尼大学) ; Singapore Management University(新加坡管理大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Hunan University(湖南大学) ; Nanyang Technological University(南洋理工大学) ; Royal Melbourne Institute of Technology(皇家墨尔本理工大学) ; City University of Hong Kong(香港城市大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; City University of Hong Kong Shenzhen Research Institute(香港城市大学深圳研究院)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出FORGE,构建高质量多模态数据集并评估18种先进MLLM在制造任务中的表现,揭示领域知识不足是主要瓶颈,展示结构化标注可提升模型精度。
Comments Project Page:https://ai4manufacturing.github.io/forge-web
挖掘实例导向的视觉-语言上下文以实现人-物交互检测
机构 * Seoul National University(首尔国立大学) ; Hanyang University(汉阳大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出InCoM-Net框架,通过整合VLM提取的语义知识与实例特征,提升人-物交互检测的交互推理能力,实验表明其在HICO-DET和V-COCO基准上达到最优性能。
Comments Accepted to CVPR 2026. Code: https://github.com/nowuss/InCoM-Net
在自监督变压器中发现分布式以对象为中心的属性
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Queensland(昆士兰大学) ; UC Merced(加州大学默塞德分校)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文分析了自监督视觉变压器中对象中心属性的分布式编码机制,提出Object-DINO方法通过聚类注意力头提升无监督对象发现和多模态大语言模型的视觉 grounding。
Comments Computer Vision and Pattern Recognition (CVPR) 2026
从丢弃到恢复:对MLLMs分割能力的机理分析
机构 * Technical University of Munich(慕尼黑技术大学) ; Helmholtz Munich(亥姆霍兹慕尼黑) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))
专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文通过逐层线性探测评估MLLMs整个流程,揭示适配器导致的分割表示下降及LLM层通过注意力机制逐步恢复的机制,为未来分割模型设计提供依据。
增强推理的多模态链式推理
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出RED方法,通过KL约束奖励最大化提升多模态链式推理的准确性和忠实度,实验表明其在多个基准和模型上显著优于传统方法。
Comments Accepted to CVPR 2026 (Main); Code is available at https://github.com/yshinya6/red/
单目3D物体位置估计用于人机交互的VLMs
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本研究利用VLMs通过单目RGB图像、自然语言输入和机器人状态估计3D物体位置,通过微调和条件路由技术提升预测性能,实现人机交互中的鲁棒预测。
Comments Accepted at Workshop on Integrating Image Processing with Large-Scale Language/Vision Models for Advanced Visual Understanding (LVLM) at IEEE International Conference on Image Processing (ICIP) 2025