VLM-Loc: Localization in Point Cloud Maps via Vision-Language Models
基于视觉-语言模型的点云地图定位
AI总结 VLM-Loc通过视觉-语言模型的空间推理能力,实现了更准确的文本到点云定位,提升了复杂环境中的定位鲁棒性。
Comments CVPR 2026
期刊&会议
Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision
基于视觉-语言模型的点云地图定位
AI总结 VLM-Loc通过视觉-语言模型的空间推理能力,实现了更准确的文本到点云定位,提升了复杂环境中的定位鲁棒性。
Comments CVPR 2026
VarSplat: 一种具有不确定性的3D高斯点划法用于鲁棒的RGB-D SLAM
机构 * Department of Computer Science(计算机科学系)
AI总结 VarSplat通过显式学习每个点划的外观方差,提升RGB-D SLAM的鲁棒性和稳定性,实现更可靠的跟踪与建图。
Comments Accepted to CVPR 2026
ParTY: 部分引导用于表达性文本到运动合成
机构 * Kyung Hee University(庆熙大学)
AI总结 ParTY通过部分引导网络、部分感知文本定位和整体-部分融合,提升文本到运动合成中部分表现力和动作连贯性。
Comments Accepted by CVPR 2026. Code: https://github.com/VisualScienceLab-KHU/ParTY
BinaryAttention: 一比特QK-注意力用于视觉和扩散变换器
机构 * The Hong Kong Polytechnic University(香港理工大学) ; OPPO Research Institute(OPPO研究院)
AI总结 BinaryAttention通过1比特QK-注意力实现视觉和扩散变换器的高效加速,有效提升计算效率并保持准确性。
Comments Accepted by CVPR 2026
复兴 ConvNeXt 以实现高效的卷积扩散模型
机构 * KAIST(韩国科学技术院) ; ETH Zürich(苏黎世联邦理工学院) ; ISTI-CNR(意大利国家研究理事会信息与自动化研究所) ; University of Pisa(比萨大学)
AI总结 本文提出全卷积扩散模型 FCDM-XL,通过使用 ConvNeXt 结构实现高效扩散模型,以更少的 FLOPs 和训练步骤达到与 DiT-XL 相当的性能。
Comments CVPR 2026. Official implementation: https://github.com/star-kwon/FCDM
用更短的高斯列表加速3D高斯学习
机构 * Machine Perception Lab, Wayne State University(机器感知实验室,韦恩州立大学)
AI总结 通过缩短高斯列表提升3D高斯学习效率,采用尺度重置和熵约束优化渲染效率。
Comments Accepted to CVPR 2026. Project page: https://github.com/MachinePerceptionLab/ShorterSplatting
从网络视频中隐式几何表示的视觉-语言导航
机构 * Department of Computer Vision, Mohamed Bin Zayed University of Artificial Intelligence(计算机视觉系,Mohamed Bin Zayed人工智能大学) ; School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) ; Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区)
AI总结 本研究提出基于网络视频的隐式几何表示方法,用于视觉-语言导航,通过提升数据利用率和鲁棒性,实现更广泛的应用。
Comments Extension of CVPR 2025 RoomTour3D with implicit geometric representations
点云作为多模态大语言模型的外语
机构 * Concordia University(康科迪亚大学)
AI总结 SAGE是首个端到端3D多模态大语言模型,通过轻量级3D分词器直接处理点云,提升3D任务的推理能力与鲁棒性。
Comments Accepted in The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026
X-AVDT:用于鲁棒深度伪造检测的音频视觉交叉注意力
机构 * Visual Media Lab, KAIST(韩国科学技术院视觉媒体实验室)
AI总结 X-AVDT通过利用生成器内部的音频视觉一致性线索,提出了一种鲁棒且具有通用性的深度伪造检测方法,有效提升了检测性能。
Journal ref CVPR 2026
VirtueBench: 在长视频理解中评估在不确定性下的可信度
AI总结 VirtueBench通过评估模型在不确定性下的可信度,揭示了长视频理解中模型拒绝行为的差异及可靠性问题。
Comments Accepted to CVPR 2026
通过方向解耦对齐缓解偏好模式崩溃在扩散强化学习中
机构 * Tsinghua University(清华大学) ; AMAP, Alibaba Group(阿里云实验室,阿里巴巴集团)
AI总结 本文提出D²-Align框架,通过方向解耦对齐缓解扩散强化学习中的偏好模式崩溃,提升生成多样性。
Comments Accepted by CVPR 2026
当机器人服从补丁:对视觉-语言-动作模型的通用可转移补丁攻击
机构 * ROSE Lab, Interdisciplinary Graduate Programme, Nanyang Technological University(罗思实验室,跨学科研究生项目,南洋理工大学) ; ROSE Lab, School of Electrical and Electronic Engineering, Nanyang Technological University(罗思实验室,电子与电气工程学院,南洋理工大学) ; CCDS, Nanyang Technological University(CCDS,南洋理工大学) ; DSO National Laboratories(国防科学局实验室)
AI总结 本文提出UPA-RFAS框架,通过鲁棒特征、注意和语义方法,实现对视觉-语言-动作模型的通用可转移补丁攻击,揭示了基于补丁的攻击面并为未来防御提供基线。
Comments Accepted by CVPR 2026
V-Attack:针对解耦价值特征的可控对抗攻击LVLMs
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室,计算技术研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Zhejiang University(浙江大学)
AI总结 V-Attack通过精准操控LVLMs中的价值特征,提升对抗攻击的成功率,揭示视觉语言理解的关键漏洞。
Comments Accepted by CVPR 2026
SPAN: 用于单目3D目标检测的空间-投影对齐
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) ; School of Mathematics and Statistics, University of Glasgow(格拉斯哥大学数学与统计学学院) ; Basic Algorithm Center, PCG, Tencent(腾讯计算机系统有限公司基础算法中心)
AI总结 SPAN通过空间点对齐和3D-2D投影对齐解决单目3D目标检测中几何一致性不足的问题,提升检测性能。
Comments Accepted by CVPR 2026
LLaVAShield: 保障视觉语言模型中的多模态多轮对话安全
机构 * Southeast University(东南大学) ; University of California, Santa Cruz(加州大学圣克鲁兹分校) ; Zhejiang University of Technology(浙江工业大学) ; Tsinghua University(清华大学) ; RealAI
AI总结 LLaVAShield通过构建MMDS数据集和MMRT框架,有效提升多模态多轮对话的安全性,优于现有VLMs和内容审查工具,揭示了主流模型的安全漏洞。
Comments Accepted to CVPR 2026
半监督置信预测与未标记非一致性评分
机构 * Southern University of Science and Technology(南方科技大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Fudan University(复旦大学) ; University of Science and Technology of China(中国科学技术大学) ; Shenzhen Loop Area Institute(深圳河套学院)
AI总结 本文提出SemiCP,通过结合标记和未标记数据提升置信预测的覆盖性能,实验表明在有限标记数据下可显著降低覆盖差距。
Comments Accept by CVPR 2026
MVTec AD 2数据集:面向无监督异常检测的高级场景
AI总结 MVTec AD 2数据集提供8000张高分辨率图像,包含工业检测中未被考虑的挑战性场景,用于评估无监督异常检测方法的性能和鲁棒性。
Comments paper under review; dataset first released for the VAND3.0 challenge @ CVPR 2025 https://sites.google.com/view/vand30cvpr2025/challenge
TIMotion: 时空交互框架用于高效的人机运动生成
机构 * Zhejiang University(浙江大学) ; Youtu Lab, Tencent(腾讯优图实验室) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 TIMotion提出一种高效框架,通过因果交互注入、角色演变扫描和局部模式放大,实现高效的人类交互运动生成。
Comments Accepted to CVPR 2025. Project page: https://aigc-explorer.github.io/TIMotion-page/
视觉-语言模型编码临床指南以实现基于概念的医学推理
机构 * Queen’s University(女王大学) ; University of British Columbia(不列颠哥伦比亚大学) ; McMaster University(麦马斯特大学) ; Vector Institute(向量研究所)
AI总结 MedCBR通过整合临床指南与视觉-语言模型,提升医学影像诊断的可解释性和决策支持能力。
Comments CVPR 2026 Findings