DROID-SLAM in the Wild
野外中的DROID-SLAM
机构 * ETH Zurich(苏黎世联邦理工学院) ; Microsoft(微软)
AI总结 本文提出一种鲁棒的实时RGB SLAM系统,通过可微的不确定性感知捆绑调整处理动态环境,实现鲁棒的跟踪与重建。
Comments CVPR 2026, Project Page: https://moyangli00.github.io/droid-w/
期刊&会议
Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision
野外中的DROID-SLAM
机构 * ETH Zurich(苏黎世联邦理工学院) ; Microsoft(微软)
AI总结 本文提出一种鲁棒的实时RGB SLAM系统,通过可微的不确定性感知捆绑调整处理动态环境,实现鲁棒的跟踪与重建。
Comments CVPR 2026, Project Page: https://moyangli00.github.io/droid-w/
SwiftTailor: 基于几何图像表示的高效3D服装生成
机构 * Qualcomm AI Research(高通AI研究) ; Trinity College Dublin(都柏林大学)
AI总结 本文提出SwiftTailor框架,通过紧凑的几何图像表示统一缝纫图案推理与几何网格合成,提升3D服装生成的效率与精度。
Comments CVPR 2026
SEM:用于视觉-语言模型后验去偏的稀疏嵌入调制
机构 * University of Trento(特伦托大学) ; Toyota Motor Europe(丰田欧洲公司) ; Fondazione Bruno Kessler(布鲁诺·凯瑟尔基金会)
AI总结 本文提出SEM框架,通过稀疏自编码器空间调制嵌入,实现视觉-语言模型的后验去偏,提升检索和零样本分类的公平性。
Comments CVPR Findings 2026. Project website: https://sparse-embedding-modulation.github.io/
重新思考MLLM本身作为分割器:仅用一个分割标记
机构 * Beijing Institute of Technology(北京理工大学) ; University of Birmingham(伯明翰大学) ; Beijing Jiaotong University(北京交通大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
AI总结 本文提出SELF1E方法,通过保留原始图像分辨率并利用残差特征提升分割精度,无需外部解码器即可实现与专业解码器相当的分割性能。
Comments Paper is accepted by CVPR 2026
基于统计特征的去噪方法用于快速高分辨率透射电子显微镜成像
机构 * Beijing Institute of Technology(北京理工大学)
AI总结 本文提出一种统计特征引导的去噪网络,通过空间和频域特征指导去噪过程,提升HRTEM图像质量,实验表明其在去噪和定位任务中优于现有方法。
Comments Accepted to CVPR 2026
DA-Mamba: 基于全局-局部对齐的领域感知状态空间模型学习用于领域自适应目标检测
机构 * Intelligent Software Research Center, Institute of Software, CAS(软件研究所智能软件研究中心,中国科学院) ; State Key Lab of Processors, Institute of Computing Technology, CAS(中国科学院计算技术研究所处理器国家重点实验室) ; School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学校)
AI总结 DA-Mamba通过结合CNN与状态空间模型,提升领域自适应目标检测的全局与局部对齐能力,有效解决传统方法在全局特征提取和计算效率上的不足。
Comments Accepted by CVPR 2026
迈向高质量图像分割:通过惩罚邻近像素提高拓扑准确性
机构 * Technical University of Denmark(丹麦技术大学)
AI总结 本文提出SCNP方法,通过惩罚最差分类的邻近像素 logits 来提升拓扑准确性,已在13个数据集上验证有效性,并集成至三种分割框架。
Comments Accepted to CVPR 2026
MRD:多分辨率检索-检测融合用于高分辨率图像理解
机构 * HITSZ(哈尔滨工业大学)
AI总结 本文提出MRD框架,通过多分辨率语义融合和开放词汇检测提升高分辨率图像理解,实现局部和全局视角的增强,取得单目标和多目标理解任务的最先进性能。
Comments Accepted to CVPR 2026
用于扩散模型属性操控的全能滑块
机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学学院) ; Visual Intelligence + X International Cooperation Joint Laboratory of the Ministry of Education(教育部视觉智能+X国际合作联合实验室) ; City University of Macau(澳门城市大学) ; Kuaishou(快手) ; Meitu(美图)
AI总结 本文提出All-in-One滑块模块,通过分解文本嵌入空间实现高效的属性操控,支持多属性组合与零样本操控,提升扩散模型的属性操控精度和可扩展性。
Comments accepted by CVPR 2026
CrossHOI-Bench: 一个统一的HOI评估基准,涵盖视觉-语言模型和特定HOI方法
机构 * National University of Singapore(新加坡国立大学) ; University of Mississippi(密西西比大学) ; ASUS Intelligent Cloud Services(ASUS智能云服务)
AI总结 本文提出CrossHOI-Bench,通过显式正例和 curated 负例,统一评估VLM和HOI方法,揭示两者在多任务和细粒度交互上的互补优劣。
Comments Accepted by CVPR 2026
矫正目标域色散以提升跨域少样本目标检测
机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)
AI总结 本文针对跨域少样本目标检测中目标域色散问题,提出生物启发的注意力细化框架,通过正负模式细化和文本语义对齐模块提升检测精度,实验证明在六个基准上取得新突破。
Comments Accepted to CVPR 2026
OnlinePG: 在线开放词汇全景映射与3D高斯点云分裂
机构 * State Key Lab of CAD & CG(CAD与CG国家重点实验室) ; VIVO BlueImage Lab(VIVO BlueImage实验室) ; HKUST(香港科技大学)
AI总结 本文提出OnlinePG,通过在线全景映射结合3D高斯点云分裂实现开放词汇场景理解,解决现有方法在实时性和实例级理解上的不足。
Comments CVPR 2026
跨领域演示到代码的神经符号反事实推理
机构 * Department of Computer Science and Engineering, Sungkyunkwan University(Sungkyunkwan 大学计算机科学与工程系)
AI总结 本文提出NeSyCR框架,通过神经符号反事实推理解决跨领域机器人编程中的过程不匹配问题,提升任务成功率31.14%。
Comments Accepted at CVPR 2026
基于细胞类型原型的神经网络用于从病理图像估计基因表达
机构 * The University of Osaka, Japan(大阪大学) ; Kyushu University(九州大学) ; National Cancer Center Japan(日本国立癌症中心)
AI总结 本文提出CPNN模型,利用单细胞RNA测序数据估计病理图像中基因表达,通过细胞类型原型指导提升预测精度和可解释性。
Comments Accepted by CVPR 2026
仅训练异构图像-补丁-文本图监督以推进少样本学习适配器
机构 * Edge Hill University(埃德希尔大学)
AI总结 本文提出一种仅训练的异构图监督方法,通过多尺度视觉补丁和文本提示构建统一图,利用模态感知图变压器进行跨模态推理,并通过节点过滤提取高保真类特征,从而提升少样本学习性能。
Comments Accepted at The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026
合成数据在场景文本识别中有什么问题?一个强大的合成引擎与多样化的模拟和自我进化
机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) ; Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) ; WeChat Vision, Tencent Inc.(腾讯公司微信视觉团队)
AI总结 本文提出UnionST合成引擎,通过多样化的模拟和自我进化框架,提升合成数据的现实性和有效性,实验表明其在复杂场景中优于现有合成数据。
Comments Accepted by CVPR 2026
具有鞋款不变性和地面感知的学习用于密集脚部接触估计
机构 * IPAI ; Dept. of ECE & ASRI, Seoul National University(电子工程与智能机器人研究所,首尔国立大学)
AI总结 本文提出FECO框架,通过鞋款不变性和地面感知学习,解决单张RGB图像中密集脚部接触估计的鞋款多样性与地面特征提取问题。
Comments Accepted at CVPR 2026. Project page: https://feco-release.github.io/
Infinity-RoPE: 自动回归自回滚中涌现的无限视频生成
机构 * Virginia Tech(弗吉尼亚理工学院)
AI总结 本文提出Infinity-RoPE,通过Block-Relativistic RoPE、KV Flush和RoPE Cut三个组件解决自回归视频扩散模型的三个瓶颈,实现无限时域、可控和电影级视频生成。
Comments CVPR 2026 | Project Page: https://infinity-rope.github.io/
通过2D语义知识解锁3D affordance分割
机构 * MoE Key Lab of Artificial Intelligence, School of Computer Science, Shanghai Jiaotong University(人工智能大模型实验室,计算机科学学院,上海交通大学)
AI总结 本文提出CMAT预训练策略,利用2D视觉基础模型的语义知识引导3D表征学习,提升3D affordance分割的准确性和效率。
Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition
先看再融合:基于2D引导的跨模态对齐用于鲁棒的3D检测
机构 * Institute of Intelligent Machines, Hefei Institutes of Physical Science, Chinese Academy of Sciences(智能机器研究所,合肥物理科学研究院,中国科学院) ; University of Science and Technology of China(中国科学技术大学)
AI总结 本文提出利用2D对象先验进行跨模态特征预对齐,解决LiDAR与相机特征的空间错位问题,提升3D检测鲁棒性。
Comments accepted to cvpr 2026
TR2M: 通过语言描述和双级尺度导向对比转移单目相对深度到度量深度
机构 * The Chinese University of Hong Kong(香港中文大学)
AI总结 本文提出TR2M框架,通过语言描述和图像输入,利用双级尺度导向对比学习,解决相对深度到度量深度的转换问题,实现跨域的零样本性能。
Comments CVPR 2026
LoST:3D形状的语义层次标记化
机构 * University College London(伦敦大学学院) ; Adobe Research(Adobe研究院)
AI总结 本文提出LoST,通过语义显著性对3D形状进行标记化,实现高效的自回归生成。实验表明LoST在几何和语义重建上优于现有方法,并提升下游任务性能。
Comments CVPR 2026; Project website-- https://lost3d.github.io
SpiderCam: 低功耗差分模糊拍摄深度
机构 * Northwestern University(西北大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Purdue University(普渡大学)
AI总结 SpiderCam通过FPGA实现低功耗差分模糊拍摄深度,实时生成480x400稀疏深度图,功耗仅624mW,首次实现被动FPGA 3D相机亚瓦特总功耗。
Comments Accepted to IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026
TINA:无文本逆向攻击用于未学习的文本到图像扩散模型
机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; City University of Hong Kong(香港城市大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; Peng Cheng Laboratory(鹏城实验室) ; Shandong University(山东大学)
AI总结 TINA通过无文本逆向攻击揭示未学习模型中残留的视觉知识,挑战现有去概念化方法的局限性。
Comments 16 pages, accepted by CVPR 2026
细粒度后训练量化用于大型视觉语言模型的量化感知集成梯度
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,中国科学院自动化所) ; School of Artificial Intelligence, UCAS(人工智能学院,中国科学院大学) ; Beijing National Research Center for Information Science and Technology(北京信息科学研究中心) ; Institute of Artificial Intelligence, USTB(信息科学技术大学人工智能学院) ; School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; Zhongguancun Academy(中关村学院)
AI总结 本文提出细粒度后训练量化方法,通过量化感知集成梯度评估token敏感性,提升大型视觉语言模型的精度与效率。
Comments Accepted by CVPR 2026 Main Conference
YOLO真的需要在每个epoch中都看到每张训练图像吗?
机构 * School of Automation, Northwestern Polytechnical University(西北工业大学自动化学院) ; School of Artificial Intelligence, Chongqing University of Posts and Telecommunications(重庆邮电大学人工智能学院)
AI总结 本文提出反遗忘采样策略(AFSS),通过动态选择训练图像以提高YOLO检测器的训练效率和准确性,在多个数据集上实现了超过1.43倍的加速。
Comments Accepted to CVPR 2026
FINER:MLLMs在细粒度负查询下产生幻觉
机构 * Technical University of Munich(慕尼黑技术大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Helmholtz Munich(海德堡-慕尼黑亥姆霍尔茨中心) ; Google(谷歌) ; LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎理工学院)
AI总结 本文提出FINER基准测试,分析MLLMs在细粒度不匹配与真实元素共存时的幻觉问题,并通过FINER-Tuning提升模型性能。
Comments CVPR 2026
锚定与重缩放注意力以实现语义一致的中间帧生成
机构 * Yonsei University(延世大学)
AI总结 本文提出通过关键帧和文本锚定注意力偏差,提升生成中间帧的语义一致性和时间稳定性,同时引入重缩放时间RoPE增强帧一致性,建立首个文本条件的GI评估基准TGI-Bench。
Comments Accepted to CVPR 2026; Code is released at https://github.com/teunchoi/TGI
无需训练的生成视频检测方法:时空似然方法
机构 * Technion – Israel Institute of Technology(技术学院–以色列理工学院)
AI总结 本文提出STALL方法,通过时空似然建模实现无需训练的视频合成检测,优于传统图像和视频检测方法。
Comments Accepted to CVPR 2026
从遗忘中学习:通过遗忘的逆向预测知识溢出的权重
机构 * ETRI ; UST ; Kyung Hee University(庆北大学)
AI总结 本文提出KNOW预测方法,通过结构化遗忘与逆向建模合成知识丰富的权重,提升下游任务性能。
Comments To appear in CVPR 2026