arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-06-03 至 2026-06-03 共收录 18
2606.02642 2026-06-03 eess.AS cs.AI cs.CV cs.LG cs.MM cs.SD

SVHalluc: Benchmarking Speech-Vision Hallucination in Audio-Visual Large Language Models

SVHalluc: 音频-视觉大语言模型中的语音-视觉幻觉基准测试

Chenshuang Zhang, Kyeong Seon Kim, Chengxin Liu, Tae-Hyun Oh

机构 * KAIST(韩国国立信息通信研究院)

AI总结 针对音频-视觉大语言模型中的语音-视觉幻觉问题,提出SVHalluc基准,从语义和时间两个维度评估模型将语音内容与视觉信号对齐的能力,发现现有模型存在跨模态理解局限。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03985 2026-06-03 cs.RO cs.AI cs.CV

Humanoid-GPT: Scaling Data and Structure for Zero-Shot Motion Tracking

Humanoid-GPT:扩展数据与结构以实现零样本运动跟踪

Zekun Qi, Xuchuan Chen, Dairu Liu, Chenghuai Lin, Yunrui Lian, Sikai Liang, Zhikai Zhang, Yu Guan, Jilong Wang, Wenyao Zhang, Xinqiang Yu, He Wang, Li Yi

机构 * Tsinghua University(清华大学) Galbot Inc.(Galbot公司) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Shanghai Qi Zhi Institute(上海启智研究院)

AI总结 提出Humanoid-GPT,一种基于GPT风格的因果Transformer,在十亿级运动语料上预训练,实现全身控制,通过扩展数据和模型容量达到对未见运动和任务的零样本泛化。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03951 2026-06-03 cs.CV

Demo2Tutorial: From Human Experience to Multimodal Software Tutorials

Demo2Tutorial:从人类经验到多模态软件教程

Zechen Bai, Zhiheng Chen, Yiqi Lin, Kevin Qinghong Lin, Difei Gao, Xiangwu Guo, Xin Wang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

AI总结 提出Demo2Tutorial框架,通过屏幕录制和交互日志将人类经验解析为结构化多模态教程,用于人类学习和GUI智能体训练,实验证明其生成质量超越人工教程并提升任务效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03693 2026-06-03 cs.CL cs.CV

Does Language Shift Break Medical Vision-Language Models? Indonesian Radiology Visual Question Answering Case Study

语言转换会破坏医学视觉语言模型吗?印度尼西亚放射学视觉问答案例研究

Pieter Christy Yan Yudhistira, Dzaki Rafif Malik, Novanto Yudistira

机构 * Intelligent System Laboratory, Faculty of Computer Science Brawijaya University(智能系统实验室,计算机科学学院布拉维亚大学)

AI总结 本研究通过构建印尼语放射学VQA数据集IndoRad-VQA,评估医学视觉语言模型在非英语临床语言下的鲁棒性,发现英语与印尼语设置间存在8-25%的性能差距,表明需要更包容的多语言评估。

Comments accepted to MMFM-BIOMED Workshop @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03666 2026-06-03 cs.CV

Beyond Single Solution: Multi-Hypothesis Collaborative Deep Unfolding Network for Image Compressive Sensing

超越单一解:用于图像压缩感知的多假设协作深度展开网络

Wenxue Cui, Hualin Li, Yuhang Qin, Yifu Xu, Xiaopeng Fan, Debin Zhao

机构 * Harbin Institute of Technology, Harbin, China(哈尔滨工业大学) Harbin Institute of Technology Suzhou Research Institute, Suzhou, China(哈尔滨工业大学苏州研究院)

AI总结 针对压缩感知问题的病态性,提出一种多假设协作深度展开网络(MHC-DUN),通过联合优化多个解空间,利用AlphaNet动态预测空间变步长进行梯度下降,并设计多假设协作近端映射模块,以提升重建质量。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03577 2026-06-03 cs.CV

Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching

通过宽基线匹配激发多模态大语言模型中的复杂空间推理

Hao Zhong, Muzhi Zhu, Shenyan Zeng, Anzhou Li, Cong Chen, Hua Geng, Duochao Shi, Wentao Ye, Tao Lin, Hao Chen, Chunhua Shen

机构 * State Key Laboratory of CAD & CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Ant Group(蚂蚁集团) Westlake University(西湖大学)

AI总结 本文提出ReasonMatch-Bench基准和动态对应强化学习(DCRL)方法,以系统评估和提升多模态大语言模型在宽基线匹配任务中的空间推理能力。

Comments CVPR 2026. Project page: https://aim-uofa.github.io/reasonmatch/ Code: https://github.com/aim-uofa/ReasonMatch

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03506 2026-06-03 cs.CV cs.GR

AvatarMix: Identity-Preserving Cross-Avatar Composition for Outfit Personalization

AvatarMix: 保持身份特征的跨化身组合用于服装个性化

Zhaorong Wang, Yoshihiro Kanamori, Yuki Endo

机构 * University of Tsukuba(茨口大学)

AI总结 提出AvatarMix方法,通过直接组合两个高保真高斯化身实现服装迁移,并采用SeamFix和FullbodyFix两级细化策略解决接缝伪影和身体重塑后的外观保真问题。

Comments CVPR 2026 Findings. 16 pages, including supplementary material

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026, pp. 425-435

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03479 2026-06-03 cs.CV cs.GR

PersistGS: Differentiable Physics for Object Permanence in 4D Gaussian Splatting

PersistGS: 4D高斯溅射中物体持久性的可微物理

Adrian Ramlal, John S. Zelek

机构 * University of Waterloo(滑铁卢大学)

AI总结 提出PersistGS方法,通过将可微刚体模拟与3D高斯溅射耦合,在物体被遮挡期间利用物理规律预测其SE(3)轨迹,从而恢复物体持久性,并引入质心轮廓损失降低轨迹误差。

Comments Accepted in IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026 Workshop on Generative 3D Reconstruction

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 4687-4696

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02996 2026-06-03 cs.RO cs.CV cs.HC

MARIO: Motion-Augmented Real-Time Multi-Sensor Inertial Odometry

MARIO: 运动增强的实时多传感器惯性里程计

Yiquan Li, Taeyoung Yeon, Chenfeng Gao, Vasco Xu, Xuanyou Liu, Karan Ahuja

机构 * Northwestern University(西北大学) University of Chicago(芝加哥大学)

AI总结 提出MARIO框架,通过学习IMU推断的人体姿态先验约束运动动力学,并结合多传感器融合(磁力计、气压计、辅助IMU),在Nymeria数据集上将位置漂移降低36%-42%,实现无相机人体跟踪的准确鲁棒惯性里程计。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02962 2026-06-03 cs.CV cs.AI cs.HC eess.IV

Hand Trajectory Fusion for Egocentric Natural Language Query Grounding

面向自我中心自然语言查询定位的手部轨迹融合

Enmin Zhong, Carlos R. del-Blanco, Fernando Jaureguizar, Narciso García

机构 * Grupo de Tratamiento de Imágenes (GTI), Information Processing and Telecommunications Center , ETSI Telecomunicación, Universidad Politécnica de Madrid, Spain(图像处理小组(GTI)、信息处理与电信中心、电信工程学院、马德里理工大学、西班牙)

AI总结 针对自我中心视频中的自然语言查询定位任务,提出手部轨迹编码器与自适应门控交叉注意力融合方法,利用手部运动信息提升查询定位性能。

Comments Accepted for the poster session at the Egocentric Vision (EgoVis) Workshop in Conjunction with CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09233 2026-06-03 cs.CV cs.AI

Towards Robust Sequential Decomposition for Complex Image Editing

面向复杂图像编辑的鲁棒顺序分解

Zilai Zeng, Mingdeng Cao, Zijie Li, Xiaochen Lian, Yichun Shi, Peihao Zhu, Chen Sun, Peng Wang

机构 * Brown University(布朗大学) ByteDance Seed(字节跳动种子) The University of Tokyo(东京大学)

AI总结 提出通过顺序分解将复杂编辑任务拆解为简单步骤,并利用合成数据训练模型,在统一上下文编辑框架下平衡分解优势与误差累积,实现鲁棒改进和从模拟到真实的泛化。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05718 2026-06-03 cs.CV

MPM: Mutual Pair Merging for Efficient Vision Transformers

MPM:用于高效视觉Transformer的互结对合并

Simon Ravé, Pejman Rasti, David Rousseau

机构 * LARIS University of Angers(安格尔大学LARIS实验室) UMR INRAe-IRHS Angers, France(法国安格尔INRAe-IRHS UMR)

AI总结 提出无训练、无参数的互结对合并(MPM)模块,通过余弦空间互近邻配对与平均,记录合并图用于解码器前基于收集的重建,在语义分割中实现端到端加速,且精度损失小。

Comments Accepted to CVPR 2026 (Findings)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026, pp. 2998-3008

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19945 2026-06-03 cs.CV

Low-Resolution Editing is All You Need for High-Resolution Editing

低分辨率编辑足以实现高分辨率编辑

Junsung Lee, Hyunsoo Lee, Yong Jae Lee, Bohyung Han

机构 * ECE & IPAI, Seoul National University(电子与信息物理学院及首尔国立大学IPAI) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出一种测试时优化框架,通过分块优化、细节迁移和同步策略,实现高分辨率图像编辑。

Comments CVPR 2026. Project website: https://hleephilip.github.io/ScaleEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00667 2026-06-03 cs.CV

Act Like a Pathologist: Tissue-Aware Whole Slide Image Reasoning

像病理学家一样:组织感知的全切片图像推理

Wentao Huang, Weimin Lyu, Peiliang Lou, Qingqiao Hu, Xiaoling Hu, Shahira Abousamra, Wenchao Han, Ruifeng Guo, Jiawei Zhou, Chao Chen, Chen Wang

机构 * Stony Brook University(石英溪大学) Mayo Clinic(梅奥诊所) Harvard Medical School(哈佛医学院) Stanford University(斯坦福大学)

AI总结 提出一种问题引导、组织感知的粗到细检索框架HistoSelect,通过识别相关组织区域并选择最具信息量的补丁,在减少70%视觉标记的同时提升病理问答准确性。

Comments 14 pages, 8 figures. Accepted by CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18599 2026-06-03 cs.CV

SJD-PAC: Accelerating Speculative Jacobi Decoding via Proactive Drafting and Adaptive Continuation

SJD-PAC:通过主动草稿和自适应延续加速推测性雅可比解码

Jialiang Kang, Han Shu, Wenshuo Li, Yingjie Zhai, Xinghao Chen

机构 * Peking University(北京大学) Huawei Technologies(华为技术)

AI总结 提出SJD-PAC框架,通过主动草稿策略和自适应延续机制提升推测性雅可比解码的接受率,实现无损加速文本到图像合成。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19995 2026-06-03 cs.CV

CREward: A Type-Specific Creativity Reward Model

CREward:一种类型特定的创造力奖励模型

Jiyeon Han, Ali Mahdavi-Amiri, Hao Zhang, Haedong Jeong

机构 * Simon Fraser University(西蒙弗雷泽大学) Sogang University(首尔大学)

AI总结 提出首个类型特定的创造力奖励模型CREward,通过几何、材质和纹理三个轴评估创造力,并应用于创造力评估、可解释创造力及创意样本获取。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01282 2026-06-03 cs.CV cs.AI

Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model Enhancement

Align-KD:为移动视觉语言模型增强提取跨模态对齐知识

Qianhan Feng, Wenshuo Li, Tong Lin, Xinghao Chen

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University, China(通用人工智能国家重点实验室,智能科学与技术学院,北京大学,中国) Huawei Noah’s Ark Lab, China(华为诺亚方舟实验室,中国)

AI总结 提出Align-KD方法,通过蒸馏教师模型浅层跨模态对齐知识,指导1.7B学生模型学习视觉-文本匹配,在6个基准上平均提升2.0分。

Comments CVPR 2025 Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
1203.2210 2026-06-03 cs.CV cs.NA math.NA

Fixed-Rank Representation for Unsupervised Visual Learning

固定秩表示用于无监督视觉学习

Risheng Liu, Zhouchen Lin, Fernando De la Torre, Zhixun Su

AI总结 本文提出固定秩表示(FRR)作为无监督视觉学习的统一框架,通过闭式解揭示多子空间结构,并引入稀疏正则化以增强鲁棒性,同时开发了快速数值求解器。

Comments accepted by CVPR 2012

详情

展开后加载摘要…

URL PDF HTML 收藏