arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-03-12 至 2026-03-12 共收录 22
2603.07789 2026-03-12 cs.CV

SGI: Structured 2D Gaussians for Efficient and Compact Large Image Representation

SGI:结构化二维高斯用于高效且紧凑的大图像表示

Zixuan Pan, Kaiyuan Tang, Jun Xia, Yifan Qin, Lin Gu, Chaoli Wang, Jianxu Chen, Yiyu Shi

机构 * University of Notre Dame(诺丁汉大学) Tohoku University(东洋大学) Leibniz-Institut für Analytische Wissenschaften – ISAS – e.V.(莱比锡分析科学研究所 – ISAS – e.V.)

AI总结 SGI通过结构化二维高斯方法实现高效且紧凑的大图像表示,实现高达7.5倍的压缩和1.6倍的优化速度,同时保持图像保真度。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03281 2026-03-12 cs.CV cs.LG

CFG-Ctrl: Control-Based Classifier-Free Diffusion Guidance

CFG-Ctrl: 基于控制的分类器自由扩散引导

Hanyang Wang, Yiyang Liu, Jiawei Chi, Fangfu Liu, Ran Xue, Yueqi Duan

AI总结 CFG-Ctrl通过引入滑模控制方法改进分类器自由扩散引导,提升语义对齐和鲁棒性。

Comments Accepted by CVPR 2026; Project Page: https://hanyang-21.github.io/CFG-Ctrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10872 2026-03-12 cs.CV

Bilevel Layer-Positioning LoRA for Real Image Dehazing

双层层位定位LoRA用于真实图像去雾

Yan Zhang, Long Ma, Yuxin Feng, Zhe Huang, Fan Zhou, Zhuo Su

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) National Engineering Research Center of Digital Life(数字生活国家工程研究中心) Dalian University of Technology(大连理工大学) Xidian University(西安电子科技大学)

AI总结 本文提出双层层位定位LoRA方法,通过文本引导损失和自动层搜索提升真实图像去雾的适应性和效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10780 2026-03-12 cs.CV

Guiding Diffusion Models with Semantically Degraded Conditions

通过语义退化条件引导扩散模型

Shilong Han, Yuming Zhang, Hongxia Wang

机构 * College of Science, National University of Defense Technology(国防科技大学理学院)

AI总结 通过语义退化条件引导扩散模型,提升文本图像对齐与组合准确性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10703 2026-03-12 cs.CV cs.CY

WalkGPT: Grounded Vision-Language Conversation with Depth-Aware Segmentation for Pedestrian Navigation

WalkGPT: 基于深度感知的视觉语言对话用于行人导航

Rafi Ibn Sultan, Hui Zhu, Xiangyu Zhou, Chengyin Li, Prashant Khanduri, Marco Brocanelli, Dongxiao Zhu

AI总结 WalkGPT通过结合视觉语言模型与深度感知分割技术,实现无障碍导航指导,提供精准的可访问性评估和深度估计。

Comments Accepted by CVPR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10597 2026-03-12 cs.RO cs.AI

Recover to Predict: Progressive Retrospective Learning for Variable-Length Trajectory Prediction

恢复以预测:渐进性回顾学习用于可变长度轨迹预测

Hao Zhou, Lu Qi, Jason Li, Jie Zhang, Yi Liu, Xu Yang, Mingyu Fan, Fei Luo

机构 * Great Bay University(大湾大学) Tsinghua SIGS(清华大学SIGS) Wuhan University(武汉大学) NTU(国立科技大学) Donghua University(东华大学) CASIA(中国科学院自动化研究所)

AI总结 本文提出渐进回顾框架和滚动起始训练策略,用于解决可变长度轨迹预测中的信息缺口问题,提升预测准确性。

Comments Paper is accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10583 2026-03-12 cs.CV

Attribution as Retrieval: Model-Agnostic AI-Generated Image Attribution

属性作为检索:模型无关的AI生成图像属性

Hongsong Wang, Renxi Cheng, Chaolei Han, Jie Gui

AI总结 本文提出了一种模型无关的AI生成图像归因方法LIDA,通过实例检索问题解决深度伪造检测和图像归因的挑战。

Comments To appear in CVPR 2026, Code is at https://github.com/hongsong-wang/LIDA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10538 2026-03-12 cs.CV

DSFlash: Comprehensive Panoptic Scene Graph Generation in Realtime

DSFlash:实时生成全景场景图

Julian Lorenz, Vladyslav Kovganko, Elias Kohout, Mrunmai Phatak, Daniel Kienzle, Rainer Lienhart

机构 * University of Augsburg(奥格斯堡大学)

AI总结 DSFlash是一种低延迟、资源高效的实时全景场景图生成模型,能够以高帧率处理视频流并提供更丰富的上下文信息。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10526 2026-03-12 cs.CV

Sparse Task Vector Mixup with Hypernetworks for Efficient Knowledge Transfer in Whole-Slide Image Prognosis

通过超网络实现的稀疏任务向量混合用于全滑片图像预后中的高效知识转移

Pei Liu, Xiangxiang Zeng, Tengfei Ma, Yucheng Xing, Xuanbai Ren, Yiping Liu

AI总结 STEPH通过超网络实现稀疏任务向量混合,提升全滑片图像预后中的知识转移效率

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10470 2026-03-12 cs.CV

Fighting Hallucinations with Counterfactuals: Diffusion-Guided Perturbations for LVLM Hallucination Suppression

用反事实对抗幻觉:基于扩散引导的扰动用于LVLM幻觉抑制

Hamidreza Dastmalchi, Aijun An, Ali Cheraghian, Hamed Barzamini

机构 * York University(约克大学) Macquarie University(麦考瑞大学) Northern Illinois University(北伊利诺伊大学)

AI总结 CIPHER通过反事实图像扰动减少LVLM中的视觉幻觉,提升模型忠实性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10341 2026-03-12 cs.LG cs.AI

Federated Active Learning Under Extreme Non-IID and Global Class Imbalance

极端非独立同分布与全局类别不平衡下的联邦主动学习

Chen-Chen Zong, Sheng-Jun Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

AI总结 FairFAL通过自适应类别公平机制,在极端非IID和全局类别不平衡环境下提升联邦主动学习性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09771 2026-03-12 cs.CV cs.AI

Ego: Embedding-Guided Personalization of Vision-Language Models

Ego:基于嵌入的视觉-语言模型个性化

Soroush Seifi, Simon Gardier, Vaggelis Dorovatas, Daniel Olmeda Reino, Rahaf Aljundi

机构 * Toyota Motor Europe(丰田欧洲公司)

AI总结 本文提出了一种基于模型内部机制的高效视觉-语言模型个性化方法,通过提取目标概念的视觉标记实现个性化描述与记忆。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18867 2026-03-12 cs.CV

Similarity-as-Evidence: Calibrating Overconfident VLMs for Interpretable and Label-Efficient Medical Active Learning

相似性作为证据:校准过度自信的视觉语言模型以实现可解释且标注高效的医学主动学习

Zhuofan Xie, Zishan Lin, Jinliang Lin, Jie Qi, Shaohua Hong, Shuo Li

机构 * School of Electronic Technology and Engineering, Xiamen University, Xiamen, China(厦门大学电子技术与工程学院,厦门,中国) School of Informatics, Xiamen University, Xiamen, China(厦门大学信息学院,厦门,中国) School of Engineering, Case Western Reserve University, Cleveland, USA(凯斯西储大学工程学院,克利夫兰,美国)

AI总结 SaE框架通过引入相似性证据头校准视觉语言模型,以提高医学主动学习的可解释性和标注效率。

Comments Accepted to CVPR 2026 (to appear)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04268 2026-03-12 cs.CV

KVSmooth: Mitigating Hallucination in Multi-modal Large Language Models through Key-Value Smoothing

KVSmooth: 通过键值平滑缓解多模态大语言模型中的幻觉

Siyu Jiang, Feiyang Chen, Xiaojin Zhang, Kun He

AI总结 KVSmooth通过键值平滑技术有效缓解多模态大语言模型中的幻觉问题,提升生成精度和召回率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13093 2026-03-12 cs.RO cs.LG

PvP: Data-Efficient Humanoid Robot Learning with Proprioceptive-Privileged Contrastive Representations

PvP: 通过体感优先对比表示实现数据高效的类人机器人学习

Mingqi Yuan, Tao Yu, Haolin Song, Bo Li, Xin Jin, Hua Chen, Wenjun Zeng

机构 * HK PolyU(香港理工大学) LimX Dynamics EIT, Ningbo(宁波工程学院) USTC(中国科学技术大学) ZJU-UIUC(浙江大学-UIUC) ZGCA(浙江工业大学)

AI总结 PvP通过体感优先对比学习提升类人机器人学习的样本效率和性能。

Comments 15 pages, 17 figures

Journal ref 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13043 2026-03-12 cs.CV cs.AI

GTR-Turbo: Merged Checkpoint is Secretly a Free Teacher for Agentic VLM Training

GTR-Turbo:合并的检查点实际上是为代理VLM训练提供免费的教师

Tong Wei, Yijun Yang, Changhao Zhang, Junliang Xing, Yuanchun Shi, Zongqing Lu, Deheng Ye

机构 * Tsinghua University(清华大学) Tencent Hunyuan(腾讯文生) Peking University(北京大学)

AI总结 GTR-Turbo通过合并检查点作为免费教师,提升了多模态代理训练的效率和效果。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12229 2026-03-12 cs.CV

Ultra-Low Bitrate Perceptual Image Compression with Shallow Encoder

超低比特率感知图像压缩与浅层编码

Tianyu Zhang, Dong Liu, Chang Wen Chen

机构 * University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出了一种非对称极值图像压缩框架,利用浅层编码器和单步扩散解码器实现超低比特率下的高保真度重建,同时提升编码效率和解码速度。

Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21145 2026-03-12 cs.CV

TEAR: Temporal-aware Automated Red-teaming for Text-to-Video Models

TEAR:面向文本到视频模型的时序感知自动化红队测试

Jiaming He, Guanyu Hou, Hongwei Li, Zhicong Huang, Kangjie Chen, Yi Yu, Wenbo Jiang, Guowen Xu, Tianwei Zhang

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) University of Manchester(曼彻斯特大学) Ant Group(蚂蚁集团) Nanyang Technological University(南洋理工大学) Jilin University(吉林大学)

AI总结 TEAR通过时序感知自动化红队测试框架,有效识别文本到视频模型中的安全风险,实验显示攻击成功率高达80%

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18810 2026-03-12 cs.RO

MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agent

MergeVLA: 朝着通用视觉-语言-动作代理的跨技能模型合并

Yuxia Fu, Zhizhen Zhang, Yuqi Zhang, Zijian Wang, Zi Huang, Yadan Luo

机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室)

AI总结 MergeVLA通过设计保留模型合并性,利用稀疏激活的LoRA适配器和跨注意力机制,实现多技能任务的高效泛化。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14918 2026-03-12 cs.CV

X-WIN: Building Chest Radiograph World Model via Predictive Sensing

X-WIN:通过预测感知构建胸片世界模型

Zefan Yang, Ge Wang, James Hendler, Mannudeep K. Kalra, Pingkun Yan

AI总结 X-WIN通过预测感知构建胸片世界模型,利用体积数据提炼3D解剖知识,提升CXR的表示学习和诊断能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16410 2026-03-12 cs.CV

REALM: An MLLM-Agent Framework for Open World 3D Reasoning Segmentation and Editing on Gaussian Splatting

REALM:一种用于高斯点划法上开放世界3D推理分割和编辑的MLLM-代理框架

Changyue Shi, Minghao Chen, Yiping Mao, Chuxiao Yang, Xinyuan Hu, Jiajun Ding, Zhou Yu

机构 * Hangzhou Dianzi University(杭州电子科技大学) Peking University(北京大学)

AI总结 REALM通过MLLM-代理框架实现开放世界3D推理分割和编辑,支持多种3D交互任务。

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07516 2026-03-12 cs.CV

Rethinking Two-Stage Referring-by-Tracking in Referring Multi-Object Tracking: Make it Strong Again

重新思考指认多目标跟踪中的两阶段指认跟踪:使其更强大

Weize Li, Yunhao Du, Qixiang Yin, Zhicheng Zhao, Fei Su

AI总结 本文提出FlexHook,一种改进的两阶段指认跟踪框架,通过改进特征构建和对应关系建模,实现了对当前最先进方法的全面超越。

Comments Accepted to the CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏