arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-06-23 至 2026-06-23 共收录 16
2606.22959 2026-06-23 cs.AI cs.CV 新提交

The Impact of VAE Design on Latent Pose Representations for Diffusion-based Sign Language Production

VAE设计对基于扩散的手语生成中潜在姿态表示的影响

Guilhem Fauré, Mostafa Sadeghi, Sam Bigeard, Slim Ouni

机构 * CNRS(国家科学研究中心) Inria(法国国家信息与自动化技术研究所) LORIA(洛林信息与自动化研究所)

AI总结 研究变分自编码器(VAE)架构和训练目标设计如何影响潜在空间结构,进而影响基于潜在扩散模型的手语生成性能,发现潜在空间特性比重建精度更能解释生成性能差异。

Journal ref GenSign Generative AI for Sign Language CVPR 2026 Workshop, Jun 2026, Denver (Colorado, USA), France. pp. 10631-10640

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22363 2026-06-23 cs.AI cs.LG cs.RO 新提交

Reference-Free Assessment of Physical Consistency in World Model-based Video Generation

基于世界模型的视频生成中物理一致性的无参考评估

Yun Oh, Sukmin Yun

机构 * Hanyang University ERICA(汉阳大学ERICA校区)

AI总结 提出结合相对与绝对方法的无参考度量,用于评估生成视频的物理一致性,无需人工投票或真实参考,通过DROID-SLAM和SEA-RAFT量化不一致性,过滤后视频任务成功率提升超8%,并实现时空定位。

Comments Accepted to the 2nd 3D-LLM/VLA Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21861 2026-06-23 cs.CV 新提交

Zero-Shot Vision-Language Models for Classroom Engagement Recognition: A Benchmark Study of Prompt Sensitivity and Cross-Dataset Generalization

零样本视觉语言模型用于课堂投入度识别:提示敏感性与跨数据集泛化的基准研究

Aman Goyal, Kshama Nitin Shah, Kemmannu Vineet Venkatesh Rao

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) Magna International(麦格纳国际)

AI总结 本研究系统评估五种视觉语言模型在零样本条件下识别课堂投入度的表现,发现三个主要失败模式:个体学生识别近乎随机、类别崩溃和极端提示敏感性,但场景级分类效果较好。

Comments 11 pages, 6 figures, including supplementary material. Presented as a non-archival paper at the CV4Edu Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21838 2026-06-23 cs.CV cs.LG 新提交

Beyond Flat Labels: Level-Restricted Contrastive Learning for Hierarchical Fine-Grained Vision Classification

超越平面标签:面向层次细粒度视觉分类的层级限制对比学习

Zhiyuan Tao, Srikumar Sastry, Matthew J Thompson, Elizabeth G Campolongo, Net Zhang, Ziheng Zhang, Hilmar Lapp, Yu Su, Tanya Berger-Wolf, Nathan Jacobs, Wei-Lun Chao, Jianyang Gu

机构 * The Ohio State University(俄亥俄州立大学) Washington University in St. Louis(圣路易斯华盛顿大学) Neuromatch Boston University(波士顿大学)

AI总结 针对多模态对比学习在层次标签空间中预测不一致的问题,提出层级限制对比学习,仅在同一层级内进行对比,并采用组平衡设计,显著提升层次一致性和分类精度。

Comments Accepted to CVPR 2026 FGVC Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21753 2026-06-23 cs.GR cs.AI cs.CV 新提交

Scene-Level Heterogeneous Physics Simulation with 3D Gaussian Splats

基于3D高斯散点的场景级异构物理仿真

Xiaoyang Liu, Shangzhe Wu, Kai Han

机构 * The University of Hong Kong(香港大学) University of Cambridge(剑桥大学)

AI总结 提出一种表示抽象框架,将3D高斯散点、虚拟网格和流体等异构资产统一为物理粒子集,实现场景级、多求解器的物理仿真,支持3DGS资产的非刚性变形与复杂双向交互。

Comments Accepted to CVPR 2026 Findings

Journal ref Proc. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026, pp. 6456-6465

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21736 2026-06-23 cs.CV 新提交

Adversarial Domain Prompt Tuning and Generation for Single Domain Generalization

对抗域提示调优与生成用于单域泛化

Zhipeng Xu, De Cheng, Xinyang Jiang, Nannan Wang, Dongsheng Li, Xinbo Gao

机构 * Xidian University(西安电子科技大学) Microsoft Research Asia(微软亚洲研究院) Chongqing University of Posts and Telecommunications(重庆邮电大学)

AI总结 提出渐进式对抗提示调优框架,利用预训练扩散模型生成多样域风格图像,实现单域泛化,性能超越现有方法。

Comments 12 pages, 6 figures, accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21613 2026-06-23 cs.CV cs.AI 新提交

Cross-Modal Corroboration for Annotation-Free Wildlife Monitoring

跨模态验证实现无标注野生动物监测

Bharath Pillai, Varun Viswapriyan, Christopher Stewart, Tanya Berger-Wolf, Jenna Kline

机构 * The Ohio State University(俄亥俄州立大学)

AI总结 提出利用物种活动模式专家知识作为无标注验证信号,通过视觉和声学管道独立恢复活动模式并与行为先验三方一致,实现无需人工标注的野生动物监测。

Comments Presented at the 2026 CV4Animals Workshop, colocated with CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21398 2026-06-23 cs.RO 新提交

BIT-Nav: Brain-Inspired Trajectory Memory for Embodied Navigation

BIT-Nav: 具身导航的脑启发轨迹记忆

Rithvik Jonna, Aakash Gurram, Man Namgung, Wyatt Mackey, Tinoosh Mohsenin

机构 * Johns Hopkins University(约翰霍普金斯大学) DEVCOM Army Research Laboratory(DEVCOM陆军研究实验室)

AI总结 提出BIT-Nav框架,通过轻量级学习轨迹记忆增强冻结的视觉-语言模型导航,解决长序列中帧采样稀疏问题,以恒定token成本编码结构化运动历史。

Comments Accepted to CVPR 2026: 2nd Workshop on 3D-LLM/VLA: Bridging Language, Vision and Action in 3D Environments

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27259 2026-06-23 cs.CV 版本更新

Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark

看到场景才重要:通过场景感知的长视频基准揭示视频理解模型中的遗忘现象

Seng Nam Chen, Hao Chen, Chenglam Ho, Xinyu Mao, Jinping Wang, Yu Zhang, Chao Li

机构 * CUHK (SZ)(香港中文大学(深圳)) University of Cambridge(剑桥大学) UESTC(电子科技大学) CUHK(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出SceneBench基准,揭示视频理解模型在长场景上下文中的遗忘问题,并提出Scene-RAG方法提升性能2.50%。

Comments Accepted to CVPR 2026 (Highlight)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02172 2026-06-23 cs.CV cs.GR cs.LG

SplatSuRe: Selective Super-Resolution for Multi-view Consistent 3D Gaussian Splatting

SplatSuRe:多视角一致3D高斯点溅的选择性超分辨率

Pranav Asthana, Alex Hanson, Allen Tu, Tom Goldstein, Matthias Zwicker, Amitabh Varshney

机构 * University of Maryland, College Park(马里兰大学 College Park分校)

AI总结 SplatSuRe通过选择性超分辨率技术,在多视角一致的3D高斯点溅中提升渲染质量,通过相机姿态与场景几何关系指导超分辨率内容的添加,提升局部前景细节的清晰度和一致性。

Comments Project Page: https://splatsure.github.io/

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21877 2026-06-23 cs.CV

How to Take a Memorable Picture? Empowering Users with Actionable Feedback

如何拍摄令人难忘的照片?通过可操作反馈赋能用户

Francesco Laiti, Davide Talon, Jacopo Staiano, Elisa Ricci

机构 * University of Trento(特伦托大学) University of Pisa(比萨大学) Travelbrain srl(Travelbrain公司) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

AI总结 本文提出MemFeed任务,通过MemCoach利用多模态大语言模型提供自然语言建议,提升图像回忆性,展示其在多个模型上的有效性。

Comments Accepted @ CVPR 2026. Project page: https://laitifranz.github.io/MemCoach/

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 29738-29749

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20208 2026-06-23 cs.LG cs.AI 版本更新

Model Merging in the Essential Subspace

本质子空间中的模型合并

Longhua Li, Lei Qi, Qi Tian, Xin Geng

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其跨学科应用国家重点实验室(东南大学),中华人民共和国,中国) Huawei Technologies, Shanghai, China(华为技术有限公司,上海,中国)

AI总结 提出ESM框架,通过对参数更新引起的特征偏移进行主成分分析,提取本质子空间进行低秩分解,并采用多级极化缩放策略,有效缓解任务干扰,实现多任务模型合并的最优性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07298 2026-06-23 cs.CV 版本更新

Mimic Human Cognition, Master Multi-Image Reasoning: A Meta-Action Framework for Enhanced Visual Understanding

模仿人类认知,掌握多图像推理:增强视觉理解的元动作框架

Jianghao Yin, Qingbin Li, Kun Sun, Cheng Ding, Jie Wang, Qin Chen, Jie Zhou, Nan Wang, Changqing Li, Pei Wu, Jian Xu, Zheming Yang, Liang He

机构 * East China Normal University(华东师范大学) ByteDance(字节跳动)

AI总结 提出受人类认知启发的元动作框架CINEMA,将多图像推理分解为五个结构化元动作,结合检索树采样和两阶段强化学习,在多个基准上超越GPT-4o。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15098 2026-06-23 cs.CV 版本更新

A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models

基于离散扩散的多模态大语言模型中视觉标记冗余的综合研究

Duo Li, Zuhao Yang, Xiaoqin Zhang, Ling Shao, Shijian Lu

机构 * CCDS, NTU, Singapore(南洋理工大学新加坡分校) CCST, ZJUT, China(浙江工业大学中国分校) Terminus AI Lab, UCAS, China(中国科学院大学人工智能实验室)

AI总结 本研究系统分析了离散扩散多模态大语言模型中视觉标记冗余的演化规律,发现其仅出现在从头训练的模型处理长答案任务时,并验证了视觉标记剪枝会导致信息损失,而层跳过和渐进剪枝分别适用于不同架构的加速。

Comments Accepted by CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026, pp. 2823-2833

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13855 2026-06-23 math.OC math.CO

Adaptive Softassign via Hadamard-Equipped Sinkhorn

自适应软分配 via 希尔伯特-装备 Sinkhorn

Binrui Shen, Qiang Niu, Shengxin Zhu

AI总结 本文提出一种自适应软分配方法,通过分析目标得分与参数的关系,自动调整参数以保证准确性,提升图匹配的精度和效率。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2024, pp. 17638-17647

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.12319 2026-06-23 eess.IV cs.CV 版本更新

LVQAC: Lattice Vector Quantization Coupled with Spatially Adaptive Companding for Efficient Learned Image Compression

LVQAC: 结合空间自适应压扩的格矢量量化用于高效学习图像压缩

Xi Zhang, Xiaolin Wu

机构 * Shanghai Jiao Tong University(上海交通大学) McMaster University(麦 master 大学)

AI总结 提出一种格矢量量化与空间自适应压扩(LVQAC)方案,替代均匀量化器,在几乎不增加复杂度的情况下提升端到端图像压缩的率失真性能。

Comments Accepted by CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏