Hierarchical Textual Knowledge for Enhanced Image Clustering
层次化文本知识用于增强图像聚类
机构 * Tongji University(同济大学) ; Huawei Technologies Ltd.(华为技术有限公司)
AI总结 本文提出KEC方法,通过大语言模型构建层次化概念-属性知识,提升图像聚类的准确性与鲁棒性。
Comments Accepted by CVPR 2026
期刊&会议
Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision
层次化文本知识用于增强图像聚类
机构 * Tongji University(同济大学) ; Huawei Technologies Ltd.(华为技术有限公司)
AI总结 本文提出KEC方法,通过大语言模型构建层次化概念-属性知识,提升图像聚类的准确性与鲁棒性。
Comments Accepted by CVPR 2026
TerraSky3D:欧洲地标多视角4K三维重建
机构 * Graz University of Technology(格拉茨技术大学) ; Sony(索尼)
AI总结 TerraSky3D提供高分辨率的欧洲地标多视角三维重建数据集,包含5万张图像,涵盖地面、空中和混合场景,旨在为3D重建算法提供挑战性训练和评估数据。
Comments Accepted at 3DMV (CVPR Workshop 2026)
学习聚焦与精确裁剪:一种带有信息缺口和接地损失的强化学习框架用于多模态大语言模型
机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) ; Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室)
AI总结 本文提出一种无需轨迹监督的两阶段强化学习框架,通过信息缺口机制和接地损失提升多模态大语言模型在复杂视觉场景中的感知与推理能力,实验显示其在高分辨率视觉问答基准上达到最优性能。
Comments Accepted by CVPR 2026
一种两阶段双模态模型用于面部情绪表达识别
机构 * Shanghai Normal University(上海师范大学)
AI总结 本文提出一种两阶段双模态模型,通过预训练DINOv2编码器提取鲁棒视觉特征,并结合Wav2Vec 2.0音频特征进行融合,提升面部情绪识别性能。
Comments Camera-ready version. 14 pages, 5 figures in total: 8 pages main text with 4 figures, 3 pages references, and 3 pages appendix with 1 figure. Accepted at the 10th ABAW Workshop, CVPR 2026
LEAD:最小化学习者-专家不对称性以实现端到端驾驶
机构 * University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) ; NVIDIA Research(英伟达研究院) ; KE:SAI
AI总结 本文研究了仿真中专家示范与学生观测不一致对模仿学习的影响,提出TransFuser v6在CARLA等基准中取得新突破,提升驾驶性能。
Comments Accepted at CVPR 2026
FRAMER:基于扩散先验的频率对齐自蒸馏与自适应调制的现实世界图像超分辨率
AI总结 FRAMER通过利用扩散先验,采用频率对齐自蒸馏和自适应调制方法,提升现实世界图像超分辨率的PSNR/SSIM及感知指标。
Comments CVPR 2026 (camera ready ver.). Please visit our project page at https://cmlab-korea.github.io/FRAMER/
PnP-CM:一致性模型作为逆问题的即插即用先验
机构 * University of Minnesota(明尼苏达大学)
AI总结 本文提出PnP-CM,将一致性模型视为先验的近端算子,用于解决多种逆问题,通过改进的ADMM框架和噪声扰动,在低NFE情况下实现高质量重建。
Comments IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026
VS-Bench:评估多智能体环境中视觉语言模型的战略能力
机构 * EE, Tsinghua University(清华大学电子工程系) ; SIGS, Tsinghua University(清华大学深圳国际研究生院) ; Li Auto Inc.(理想汽车) ; IIIS, Tsinghua University(清华大学交叉信息研究院)
AI总结 VS-Bench是首个评估多智能体环境中视觉语言模型战略能力的多模态基准,涵盖合作、竞争和混合动机交互,通过感知、推理和决策三个维度评估15种领先模型,揭示当前模型在推理和决策上的显著差距。
Comments Published at CVPR 2026 (Oral)
SpatialScore:迈向空间智能的综合评估
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
AI总结 本文提出SpatialScore,首个全面评估多模态空间智能的基准,评估49个模型发现其在空间理解上存在显著差距,并构建了SpatialCorpus和SpatialAgent提升模型性能。
Comments Accepted by CVPR 2026 (Highlight); Project Page: https://haoningwu3639.github.io/SpatialScore
HumanVBench: 通过自动合成基准测试探测多模态大语言模型中的以人为本的视频理解
机构 * Sun Yat-Sen University(中山大学) ; Alibaba Group(阿里巴巴集团) ; Peng Cheng Laboratory(鹏城实验室) ; Guangdong Provincial Key Laboratory of Fire Science and Intelligent Emergency Technology(广东省消防科学与智能应急技术重点实验室)
AI总结 本文提出HumanVBench,一个针对多模态大语言模型(MLLMs)中以人为本的视频理解能力的综合基准测试,通过自动化流程生成高质量视频注释和挑战性问题,揭示30个领先MLLMs在感知细微情绪和对齐语音与视觉线索方面的不足。
Comments Accepted as a conference paper at CVPR 2026
TetraSphere:一种用于O(3)不变点云分析的神经描述符
机构 * Computer Vision Laboratory, Department of Electrical Engineering, Linköping University(林雪平大学电气工程系计算机视觉实验室)
AI总结 本文提出TetraSphere,一种基于可旋转3D球神经元和向量神经元的O(3)不变描述符,通过端到端训练提升点云旋转不变性,在ScanObjectNN和ModelNet40上取得新突破。
Comments CVPR 2024
HOG-Layout:通过视觉-语言模型实现层次化3D场景生成、优化与编辑
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Beijing Institute of Technology(北京理工大学)
AI总结 HOG-Layout利用大语言模型和视觉-语言模型实现文本驱动的层次化3D场景生成、优化与实时编辑,通过检索增强生成技术提升语义一致性,结合优化模块增强物理一致性,实现高效场景编辑。
Comments CVPR 2026
LogitDynamics:从层间Logit轨迹可靠检测ViT错误
机构 * Technion - Israel Institute of Technology(以色列理工学院)
AI总结 本文提出通过层间Logit轨迹分析可靠检测ViT模型错误,利用轻量线性头提取特征预测错误指示器,提升AUCPR并增强跨数据集泛化能力。
Comments Accepted to the HOW 2026 workshop at CVPR 2026; 7 pages, 3 figures
GeoMeld:迈向遥感领域语义引导的基模模型
机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) ; Space Applications Centre, ISRO(印度空间研究组织空间应用中心) ; University of Trento(特伦托大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
AI总结 本文提出GeoMeld数据集,通过语义引导的监督方法,结合多模态对齐,提升遥感领域基模模型的性能和鲁棒性。
Comments Accepted at CVPR Workshop 2026; 8 pages, 6 figures
TAPNext++: 追踪任意点(TAP)的下一步
机构 * Google(谷歌) ; Google DeepMind(谷歌DeepMind) ; German Aerospace Center (DLR)(德国航空航天中心) ; Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) ; Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) ; Université de Montréal(蒙特利尔大学) ; Chandar Research Lab(钱达尔研究实验室) ; Polytechnique Montréal(蒙特利尔综合理工学院) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) ; Technical University Munich (TUM)(慕尼黑工业大学)
AI总结 TAPNext++通过训练长序列和引入重检指标提升追踪性能,在保持低内存计算开销的同时实现更长序列的追踪。
Comments 8 pages, will be publised at CVPR Findings 2026, Website https://tap-next-plus-plus.github.io
从未标注的多视角图像中学习3D表示以提升空间智能
机构 * Nanjing University of Science and Technology(南京理工大学) ; Zhejiang University(浙江大学) ; Communication University of China(中国传媒大学)
AI总结 本文提出UniSplat框架,通过双掩码策略、高斯溅射策略和姿态条件重校准机制,解决未标注多视角图像中3D表示学习的几何诱导弱、外观细节不足和几何语义不一致问题,实现鲁棒且通用的3D表示。
Comments CVPR 2026
2026年NTIRE挑战赛:基于生成模型的野生短形式UGC视频修复挑战:数据集、方法与结果
AI总结 本文介绍了2026年NTIRE挑战赛,旨在建立强大的基准以修复复杂现实降质下的短形式UGC视频,特别关注基于生成模型的S-UGC视频修复。挑战赛包含合成和真实视频数据,涵盖数据集、方法和结果。
Comments Accepted by CVPR 2026 workshop; NTIRE 2026
可微向量量化用于生成图像压缩的率-失真优化
机构 * University of Electronic Science and Technology of China(电子科技大学) ; The University of Newcastle, Australia(澳大利亚纽卡斯尔大学)
AI总结 本文提出RDVQ框架,通过可微松弛代码本分布实现端到端率-失真优化,结合自回归熵模型实现准确的熵建模和测试时率控制,在极低比特率下取得优异性能。
Comments Accepted for publication at CVPR 2026 as an Oral presentation
STORM:视频中的端到端提及多目标跟踪
机构 * Amazon(亚马逊)
AI总结 STORM通过统一框架联合执行目标定位与跟踪,提升数据效率并构建新数据集,实现多目标跟踪的先进性能。
Comments CVPR 2026 Findings
UDAPose:无监督领域适应用于低光人类姿态估计
机构 * University of Mississippi(密西西比大学) ; National University of Singapore(新加坡国立大学) ; Duksung Women’s University(德成女子大学) ; ASUS Intelligent Cloud Services (AICS)(华硕智能云服务(AICS))
AI总结 UDAPose提出了一种新的框架,通过合成低光图像并动态融合视觉线索与姿态先验,提升低光环境下的人体姿态估计性能。
Comments Accepted at CVPR 2026
领域特定胃肠道疾病识别的参数高效微调
机构 * Auburn University(奥本大学) ; Tribhuvan University(特里布万大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Georgia State University(佐治亚州立大学) ; Middle Tennessee State University(中田纳西州立大学)
AI总结 本文提出使用低秩适应(LoRA)模块进行参数高效微调,以解决跨源医学图像分布偏移问题,提升胃肠道疾病识别的参数效率和性能。
Comments 6 pages, 3 figures, CVPR conference
道路激光雷达用于城市交叉口协作安全审计:迈向可审计的V2X基础设施智能
AI总结 本文提出一种可审计的道路激光雷达框架,用于评估纽约城市信号交叉口的基础设施安全,通过轨迹构建、迭代人工在环质量保证和可解释的近失分析,减少故障模式,展示道路激光雷达作为协作感知系统后验审计机制的可行性。
Comments 9 pages, 7 figures, 2026 CVPR DriveX Workshop
DeepShapeMatchingKit:加速的功能映射求解器和形状匹配流程再审视
机构 * Technical University of Munich(慕尼黑工业大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; MIT(麻省理工学院) ; Adobe ; Imperial College London(帝国理工学院) ; Simon Fraser University(西蒙菲莎大学)
AI总结 本文提出了一种向量化方法,通过单次核调用解决所有线性系统,提升计算效率,并分析了DiffusionNet的空间梯度特征差异,提供了改进的开源代码库。
Comments 10 pages, 8 figures, CVPR 2026 Image Matching Workshop (IEEE proceedings)
在增强现实中评估视觉-语言模型在矛盾虚拟内容攻击下的基准测试
机构 * Duke University(杜克大学)
AI总结 本文提出ContrAR基准,评估视觉-语言模型在增强现实中的鲁棒性,通过312个真实AR视频验证,测试11种VLMs,发现现有模型在检测对抗性内容操纵方面仍有改进空间。
Comments CVPR 2026 Findings
DRIFT:深度恢复、ISP融合与色调映射
机构 * Samsung Research America(三星美国研究院)
AI总结 本文提出DRIFT方法,通过多帧处理网络和深度学习色调映射实现高效移动相机流水线,生成高质量RGB图像,验证了其在性能和效率上的优势。
Comments Proceedings of CVPR 2026
THOM:从文本生成物理合理的手-物体网格
机构 * UNIST(蔚山科学技术院) ; University of Birmingham(伯明翰大学) ; POSTECH(浦项科技大学)
AI总结 THOM通过两阶段流程从文本生成物理合理的手-物体网格,无需模板网格,结合物理优化和视觉语言模型提升交互合理性。
Comments accepted to CVPR Findings 2026
HG-Lane:在恶劣天气和光照条件下无需重新标注的高保真车道场景生成
机构 * Shanghai Jiao Tong University(上海交通大学) ; School of Artificial Intelligence, Henan University(河南大学人工智能学院) ; University of Science and Technology of China(中国科学技术大学) ; AnnLab, Institute of Semiconductors, Chinese Academy of Sciences(中国科学院半导体研究所 AnnLab) ; Nanyang Technological University(南洋理工大学)
AI总结 本文提出HG-Lane框架,通过构建包含30000张图像的基准数据集,提升恶劣天气下车道检测性能,实验显示基于CLRNet的mF1得分提升20.87%。
Comments Accepted by CVPR 2026 (HighLight)
具有特异性的强化学习用于细粒度开放世界分类
机构 * University of Trento(特伦托大学) ; Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)
AI总结 本文提出SpeciaRL框架,通过强化学习提升细粒度开放世界分类的准确性和特异性,优于现有方法。
Comments Accepted at CVPR 2026
构形:基于生成重建的3D构形定位
机构 * Pohang University of Science and Technology (POSTECH)(浦项科技大学) ; RLWRLD
AI总结 本文提出Affostruction框架,通过生成式重建完整物体几何并基于全形体进行构形定位,优于现有方法,在构形定位和3D重建上取得显著成绩。
Comments Accepted to CVPR 2026
M$^3$KG-RAG:多跳多模态知识图谱增强的检索增强生成
机构 * Korea University(高丽大学) ; Sungkyunkwan University(成均馆大学) ; NVIDIA Research(英伟达研究院) ; Hanwha Systems(韩华系统)
AI总结 本文提出M$^3$KG-RAG,通过构建多跳多模态知识图谱并引入GRASP机制,提升多模态大语言模型的推理深度和回答准确性。
Comments Accepted to CVPR 2026