PhysGraph: A Physics-aware 3D Scene Graph for Perception and Reasoning
PhysGraph:用于感知与推理的物理感知3D场景图
机构 * Duke University(杜克大学)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
AI总结 提出PhysGraph框架,结合符号推理与结构化3D几何,建模杂乱场景中的运动学和物理属性,在语义分割、多物体质量估计和关节预测上达到最优。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
PhysGraph:用于感知与推理的物理感知3D场景图
机构 * Duke University(杜克大学)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
AI总结 提出PhysGraph框架,结合符号推理与结构化3D几何,建模杂乱场景中的运动学和物理属性,在语义分割、多物体质量估计和关节预测上达到最优。
少看多思:面向高效多模态大语言模型的块级注意力跳过
机构 * Xiamen University(厦门大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
AI总结 针对多模态大语言模型视觉注意力饱和问题,提出训练无关的Visual-Skip方法,通过选择性跳过冗余的视觉自注意力模块实现块级稀疏性,并利用轻量级校准动态选择最优稀疏路径,在保持性能的同时显著降低计算成本。
通过最差维度优化改进多模态推理
机构 * Beijing Institute of Technology(北京理工大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
AI总结 提出最差维度优化方法,通过识别并优先优化推理路径中最差的约束维度,提升多模态推理的整体有效性。
复杂视觉查询的符号与抽象推理
机构 * Zhejiang University(浙江大学) ; Nanjing University(南京大学) ; Ant Group(蚂蚁集团)
专题命中 视觉推理 :visual reasoning(abstract)
AI总结 提出复杂视觉查询(CVQ)概念,通过多模态知识图谱合成数据集,并设计两阶段训练框架,提升多模态大语言模型的符号与抽象推理能力。
Comments Work in progress
多模态生成式引擎优化:针对视觉-语言模型排序器的排名操纵
机构 * Georgetown University(乔治城大学) ; University of Southern California(南加州大学) ; University of Maryland, College Park(马里兰大学学院公园分校) ; Arizona State University(亚利桑那州立大学)
专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,abstract_cn);grounding(abstract);分类 cs.AI、cs.LG
AI总结 提出多模态生成式引擎优化(MGEO)方法,通过联合优化图像扰动和文本后缀,利用视觉-语言模型内部跨模态知识耦合,实现对产品排名的有效操纵,揭示了多模态基础模型知识基础的脆弱性。
Comments Proceedings of the 4th Workshop on Towards Knowledgeable Foundation Models (KnowFM) at ACL 2026
ACTIVE-o3:通过纯强化学习赋予多模态大语言模型主动感知能力
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 提出ACTIVE-o3框架,基于GRPO强化学习,通过模块化感知-动作设计和双形式奖励,使MLLM自主学会高效准确的区域选择策略,在开放世界和领域特定任务中显著提升主动感知能力。
Comments Accepted to ICML 2026. Project page: https://aim-uofa.github.io/ACTIVE-o3
视觉语言模型助力视觉数据中的隐私信息去标识化
机构 * Arizona State University(亚利桑那州立大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; North Carolina State University(北卡罗来纳州立大学)
专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);VLM(abstract_cn);visual language model(abstract)
AI总结 提出VisShield框架,通过专用指令微调数据集OPTIC和训练策略,使视觉语言模型精准定位并掩码敏感文本,有效保护医学图像等视觉数据中的隐私信息。
Sci-Rho:面向STEM问题的多语言视觉基础符号基准
机构 * Independent Researcher(独立研究员) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Binus University(比努斯大学) ; Bandung Institute of Technology(万隆理工学院)
专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 提出Sci-Rho,一个多语言、视觉基础的STEM问题动态基准,包含4242个模板和42420个实例,评估17个VLM发现最差精度与平均精度存在差距,且小模型跨语言性能下降。
Comments 22 pages
你能相信你所见的吗?人类与AI对合成法律证据的检测
机构 * Faculty of Law, McGill University(麦吉尔大学法学院)
专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 研究人类和前沿多模态大模型在民事纠纷场景中区分真实照片与AI生成图像的能力,发现两者均不可靠,提出结合人工审查、MLLM筛查和来源认证的解决方案。
TraversalBench: 为视觉语言模型设计的复杂路径挑战测试集
机构 * Massachusetts Institute of Technology, Department of Physics(麻省理工学院物理系) ; Massachusetts Institute of Technology, Institute for Data, Systems, and Society(麻省理工学院数据、系统与社会研究所) ; NSF AI Institute for Artificial Intelligence and Fundamental Interactions(国家科学基金会人工智能与基本相互作用AI研究所)
专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 本文提出TraversalBench,一个用于评估视觉语言模型复杂视觉路径跟随能力的受控基准测试集,发现自相交是主要困难来源,揭示了模型在路径感知上的局限性。
再思考:通过候选发现与比较推理进行分割
机构 * The Chinese University of Hong Kong(香港中文大学) ; Nanjing University(南京大学)
专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 提出两阶段框架Rea2Seg,先基于注意力图生成候选掩码,再用多模态大语言模型推理评分,将分割转化为候选发现与判别选择,并引入新基准ReasonSeg-SGDR全面评估感知、定位与推理能力。
Comments Project page: https://snowball521.github.io/Rea2Seg-Project/
从USD场景到知识图谱:基于LLM的零样本本体接地
机构 * Technical University of Berlin(柏林工业大学) ; Fraunhofer FOKUS(弗劳恩霍夫开放通信系统研究所)
专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI
AI总结 研究利用大语言模型(LLM)零样本地将3D场景对象自动映射到本体类别,无需训练,在厨房场景中达到90-96%准确率,并揭示语义线索是关键。
Comments Accepted to the IEEE ICRA 2026 International Joint Workshop on Ontologies, Semantic Maps and Autonomous Robotics Standardization (J-WOSMARS 2026), Vienna, 2026
VoLo: 面向开放词汇长时程操控的物理编排器
机构 * NVIDIA(英伟达) ; University of Michigan(密歇根大学)
专题命中 视觉定位与Grounding :VLM(summary_cn,abstract)
AI总结 提出VoLoAgent,利用VLM将VLA/WAM作为可中断工具进行物理编排,实现开放词汇长时程操控,并在新基准RoboVoLo上显著优于现有系统。
时间感知推理优化用于视频时间定位
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV
AI总结 提出TaRO框架,通过构造性推理探索和时间敏感性奖励,增强多模态大模型在视频时间定位中的时间感知推理能力,实现最先进性能。
Comments Accepted by ICML 2026
通过小型语言模型的代码重构实现高效技能落地
机构 * KAIST(韩国科学技术院)
专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI
AI总结 提出RECENT框架,通过将技能语义与执行绑定解耦,利用小型语言模型进行代码重构实现高效技能落地,在动态环境中达到与大型语言模型相当的性能。
Comments Accepted to ICML 2026
MemoVAD: 边缘计算场景下基于动态语义记忆的资源高效视频异常检测
机构 * Institute of Artificial Intelligence and Future Networks, Beijing Normal University(北京师范大学人工智能与未来网络研究院) ; School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) ; Engineering Research Center of Cloud-Edge Intelligent Collaboration on Big Data, Ministry of Education, Beijing Normal University(北京师范大学大数据云边智能协同教育部工程研究中心)
专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 提出MemoVAD边缘-云协同框架,通过不确定性感知门控策略选择性调用云端视觉语言模型,并设计动态语义记忆缓存原型,在降低通信开销的同时提升视频异常检测性能。
Comments Accepted by IJCAI2026
BORA: 弥合离线强化学习与在线残差适应以实现真实世界灵巧VLA模型
机构 * Shanghai Jiao Tong University(上海交通大学) ; CASIA(中国科学院自动化研究所) ; Shanghai AI Laboratory(上海人工智能实验室) ; USTC(中国科学技术大学)
专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract);分类 cs.AI
AI总结 提出BORA框架,通过离线构建动作条件价值引导的评论家,并结合在线冻结VLA基础、引入人类在环的分块残差适应机制,解决灵巧操作中高维探索导致的时间不一致、样本低效和硬件风险问题,在五个真实灵巧任务上平均成功率提升33%。
Comments 24 pages,11 figures
面向复杂查询的驾驶视频检索与结构化对齐
机构 * NEC Laboratories, America(美国NEC实验室) ; University of California, Riverside(加州大学河滨分校)
专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV、cs.LG
AI总结 提出STRIVE-D框架,通过弱监督领域视频校准规则、融合视觉语言与关键词检索信号,在驾驶视频检索中实现高达84%的top-1准确率提升。
面向光刻缺陷检测的视觉-语言模型失败感知精炼
机构 * Hanyang University(汉阳大学) ; Korea University(高丽大学) ; Korea Institute of Industrial Technology(韩国生产技术研究院)
专题命中 视觉定位与Grounding :vision-language model(title);分类 cs.CV、cs.AI
AI总结 提出两阶段视觉-语言框架,先微调Qwen3-VL检测缺陷,再通过训练精炼模块修正第一阶段错误,提升检测可靠性。
Comments 6 pages, 3 figures
CURE:基于课程引导的多任务训练实现可靠的解剖学接地报告生成
机构 * Pontificia Universidad Católica de Chile(智利天主教大学) ; CENIA ; iHEALTH ; KAUST(科威特皇家科学与技术局)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出CURE框架,通过课程学习动态调整多任务训练,提升医学报告生成的视觉接地准确性和事实一致性,无需额外数据。
Comments 31 pages, 7 figures, accepted to CVPR 2026 (oral)
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 36279-36289
ExDet: 基于跨模态外推与校正的开放域开放词汇检测
机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部) ; Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced Technology(深圳理工大学计算机科学与人工智能学院) ; School of Artificial Intelligence, Nanchang University(南昌大学人工智能学院)
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出ExDet框架,通过文本引导外推(TGE)和检测器兼容校正(DCR)模块,无需额外训练即可增强开放域开放词汇检测的跨类别和跨域泛化能力,在多个基准上取得最优性能。
OmniFaceRig: 跨多种3D角色拓扑的全自动内口感知面部绑定
机构 * Reality Labs, Meta(Meta现实实验室)
专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出全自动端到端管道OmniFaceRig,将静态表面网格转换为含内口几何的FACS绑定,支持人类、人形及多种动物拓扑,无需手动标注或模板。
PIPE-Cypher:面向文本到Cypher系统的自动企业基准生成
机构 * Halıcıoğlu School of Data Science and Computing, University of California, San Diego(加利福尼亚大学圣迭戈分校哈勒乔卢数据科学与计算学院) ; Independent Researcher(独立研究员)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 提出PIPE-Cypher流水线,利用本地大模型从企业属性图自动生成平衡的NL-to-Cypher基准,通过模式分析、逆向查询约束生成和执行验证等步骤,实现可重复的基准构建。
当没有正确答案时:诊断视频理解中多模态大语言模型的缺失答案检测
机构 * Duke University(杜克大学)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 研究多模态大语言模型在视频理解中检测缺失答案的能力,发现模型倾向于选择干扰项而非识别无正确答案,时间推理任务中问题更严重,链式思维提示虽提升检测率但仍不理想。
Comments Under review
SAGE:适应性组织病理图像分割的形状自适应门控专家
机构 * University of Science, VNU-HCM(越南国家大学科学学院) ; Trivita AI ; University of Technology, VNU-HCM(越南国家大学技术学院) ; Michigan State University, USA(美国密歇根州立大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 视觉定位与Grounding :visual reasoning(abstract);分类 cs.CV、cs.AI
AI总结 SAGE通过动态专家路由框架提升异构视觉网络中细胞形态变化的适应性,实现高精度分割与稳健泛化。
Comments Accepted to CVPR 2026 (Findings Track). Project Page: https://oxyzgiahuy.github.io/sage/
生成AI的另一种轨迹
机构 * Princeton University(普林斯顿大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文提出通过构建领域特定超智能(DSS)来改进生成AI,利用符号抽象提升领域推理能力,避免LLM合成数据的模型崩溃问题,实现可持续发展。
Prisma-World: 相机可控的多智能体视频世界模型
机构 * School of AIA, HUST(华中科技大学人工智能与自动化学院) ; S-Lab, NTU(南洋理工大学S-Lab) ; SenseTime Research(商汤科技研究院) ; FDU(复旦大学) ; SUAT(深圳大学) ; HKU(香港大学) ; CUHK(香港中文大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 提出Prisma-World,通过联合几何感知去噪过程实现多智能体视频生成中的跨视角一致性,支持灵活智能体数量和相机控制。
Comments Project page: https://huiqiang-sun.github.io/prisma-world/
无需训练的通用的少样本分割通过开放词汇语义仲裁
机构 * University of Ghana(加纳大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 提出Open-V框架,通过推理时协调冻结的语义先验(SAM3 PCS与K-shot CLIP支持质心)实现无需训练的通用少样本分割,在多个基准上超越有监督方法。
上下文感知深度学习用于原子分辨率扫描透射电镜中的缺陷分类
机构 * cond-mat.mtrl-sci(材料科学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 提出上下文感知学习框架,融合图像对比度与元数据(成分、束能、探测器几何),解决仅凭图像对比度进行缺陷分类的歧义性,在模拟数据上准确率超98%,实验数据接近人类水平。
Comments 6 figures
通过自进化桥接专家知识与自动化特征工程
机构 * Adobe Media and Data Science Research(Adobe媒体与数据科学研究) ; IIIT-Delhi(德里印度理工学院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 提出FEST方法,结合双流特征生成、语义去重和树引导迭代进化,从原始文本和图像中发现可审计特征,在品牌分类等任务中平均提升4.2个百分点,并实现60-80%的专家特征覆盖。