arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-03-09 至 2026-03-09 共收录 16
2603.06408 2026-03-09 cs.CV cs.AI cs.GR

Physical Simulator In-the-Loop Video Generation

物理模拟器闭环视频生成

Lin Geng Foo, Mark He Huang, Alexandros Lattas, Stylianos Moschoglou, Thabo Beeler, Christian Theobalt

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Singapore University of Technology and Design(新加坡科技设计大学) A*STAR(新加坡科技研究局) Google(谷歌) Saarbrücken Research Center for Visual Computing, Interaction and Artificial Intelligence(斯图加特视觉计算、交互与人工智能研究中心)

AI总结 PSIVG通过整合物理模拟器与扩散模型,生成符合物理规律的视频,提升生成视频的真实性和一致性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06366 2026-03-09 cs.CV

OralGPT-Plus: Learning to Use Visual Tools via Reinforcement Learning for Panoramic X-ray Analysis

OralGPT-Plus:通过强化学习学习使用视觉工具进行全景X射线分析

Yuxuan Fan, Jing Hao, Hong Chen, Jiahao Bao, Yihua Shao, Yuci Liang, Kuo Feng Hung, Hao Tang

机构 * The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学) Faculty of Dentistry, The University of Hong Kong(香港大学牙医学院) School of Computer Science, Peking University(北京大学计算机学院) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)

AI总结 OralGPT-Plus通过强化学习实现全景X射线分析中的交互式对称推理,提升诊断可靠性。

Comments 34 pages, 24 figures, conference

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06213 2026-03-09 cs.CV cs.AI

Cut to the Chase: Training-free Multimodal Summarization via Chain-of-Events

直击核心:一种无需训练的多模态摘要方法 via 事件链

Xiaoxing You, Qiang Huang, Lingyu Li, Xiaojun Chang, Jun Yu

机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机科学学院) School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院)

AI总结 无需训练的多模态摘要方法CoE通过事件链和层次事件图实现跨模态整合与时间推理,提升摘要质量与领域适应性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06120 2026-03-09 cs.LG

Dynamic Momentum Recalibration in Online Gradient Learning

在线梯度学习中的动态动量重校准

Zhipeng Yao, Rui Yu, Guisong Chang, Ying Li, Yu Zhang, Dazhou Li

机构 * Shenyang University of Chemical Technology(沈阳化工大学) University of Louisville(路易斯维尔大学) Northeastern University(东北大学)

AI总结 SGDF通过动态调整动量系数优化梯度估计,提升深度学习优化性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06043 2026-03-09 cs.CV

Learning to Generate via Understanding: Understanding-Driven Intrinsic Rewarding for Unified Multimodal Models

通过理解学习生成:基于理解的内在奖励用于统一多模态模型

Jiadong Pan, Liang Li, Yuxin Peng, Yu-Ming Tang, Shuohuan Wang, Yu Sun, Hua Wu, Qingming Huang, Haifeng Wang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Sun Yat-sen University(中山大学) Baidu Inc.(百度公司)

AI总结 本文提出GvU机制,通过内在奖励提升统一多模态模型的生成能力,同时增强其视觉理解能力,缩小理解与生成之间的能力差距。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05952 2026-03-09 cs.CV

Unify the Views: View-Consistent Prototype Learning for Few-Shot Segmentation

统一视角:用于少样本分割的视图一致原型学习

Hongli Liu, Yu Wang, Shengjie Zhao

机构 * School of Computer Science and Technology, Tongji University(计算机科学与技术学院,同济大学)

AI总结 本文提出VINE框架,通过统一建模结构一致性和前景判别,提升少样本分割在视角变化和复杂结构下的性能。

Comments Accepted by CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05921 2026-03-09 cs.CV cs.AI

BlackMirror: Black-Box Backdoor Detection for Text-to-Image Models via Instruction-Response Deviation

BlackMirror: 通过指令-响应偏差检测文本到图像模型的黑盒后门

Feiran Li, Qianqian Xu, Shilong Bao, Zhiyong Yang, Xilin Zhao, Xiaochun Cao, Qingming Huang

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) BDKM, University of Chinese Academy of Sciences(中国科学院大学BDKM) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) School of Cyber Science and Tech., Shenzhen Campus, Sun Yat-sen University(中山大学深圳校区网络安全科学与技术学院)

AI总结 BlackMirror通过指令-响应偏差检测文本到图像模型的黑盒后门,利用视觉模式与指令的对齐及偏差稳定性评估实现高效检测。

Comments This paper is accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05908 2026-03-09 cs.CV

Pano3DComposer: Feed-Forward Compositional 3D Scene Generation from Single Panoramic Image

Pano3DComposer:从单张全景图像高效生成组合3D场景

Zidian Qiu, Ancong Wu

机构 * Sun Yat-sen University(中山大学)

AI总结 Pano3DComposer通过端到端框架从单张全景图像高效生成高精度3D场景,采用Object-World Transformation Predictor和Coarse-to-Fine对齐机制提升几何一致性。

Comments Accepted to CVPR 2026. Project page: https://qiuzidian.github.io/pano3dcomposer-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05888 2026-03-09 cs.CV cs.GR cs.LG

PixARMesh: Autoregressive Mesh-Native Single-View Scene Reconstruction

PixARMesh: 基于自回归的单视图场景重建

Xiang Zhang, Sohyun Yoo, Hongrui Wu, Chuan Li, Jianwen Xie, Zhuowen Tu

机构 * UC San Diego(加州大学圣地亚哥分校) Lambda, Inc.(Lambda公司)

AI总结 PixARMesh通过自回归方法从单张图像生成高质量3D场景网格,实现统一模型中的布局与几何联合预测,提升重建精度与实用性。

Comments CVPR 2026. Project Page: https://mlpc-ucsd.github.io/PixARMesh

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05729 2026-03-09 cs.CV

Unlocking ImageNet's Multi-Object Nature: Automated Large-Scale Multilabel Annotation

解锁ImageNet的多对象特性:自动化大规模多标签标注

Junyu Chen, Md Yousuf Harun, Christopher Kanan

机构 * University of Rochester(罗切斯特大学) Rochester Institute of Technology(罗切斯特理工学院)

AI总结 本文提出自动化方法将ImageNet训练集转换为多标签数据集,提升模型分类性能和下游任务转移能力。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05629 2026-03-09 cs.CV

Rethinking Concept Bottleneck Models: From Pitfalls to Solutions

重新思考概念瓶颈模型:从误区到解决方案

Merve Tapli, Quentin Bouniot, Wolfgang Stammer, Zeynep Akata, Emre Akbas

AI总结 CBM-Suite通过引入熵度量、非线性层和蒸馏损失,系统解决概念瓶颈模型的准确性、可解释性和系统性研究问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05078 2026-03-09 cs.CV

MoRe: Motion-aware Feed-forward 4D Reconstruction Transformer

MoRe:面向运动的前馈4D重建Transformer

Juntong Fang, Zequn Chen, Weiqi Zhang, Donglin Di, Xuancheng Zhang, Chengmin Yang, Yu-Shen Liu

机构 * School of Software, Tsinghua University(软件学院,清华大学)

AI总结 MoRe通过注意力强制策略和分组因果注意力,高效重建动态3D场景,适用于实时应用。

Comments Accepted by CVPR 2026. Project page:https://hellexf.github.io/MoRe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01034 2026-03-09 cs.CV cs.AI cs.LG

Reparameterized Tensor Ring Functional Decomposition for Multi-Dimensional Data Recovery

重新参数化张量环功能分解用于多维数据恢复

Yangyang Xu, Junbo Ke, You-Wei Wen, Chao Wang

机构 * Key Laboratory of Computing and Stochastic Mathematics (Ministry of Education)(计算与随机数学重点实验室(教育部)) School of Mathematics and Statistics(数学与统计学学院) Department of Statistics and Data Science(统计与数据科学系)

AI总结 本文提出了一种重新参数化的张量环功能分解方法,通过结合可学习的潜在张量和固定基底,提升多维数据恢复的性能。

Comments 22 pages, 18 figures, 12 tables. Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00543 2026-03-09 cs.CV

Cross-Scale Pansharpening via ScaleFormer and the PanScale Benchmark

跨尺度 pansharpening 通过 ScaleFormer 和 PanScale 数据集

Ke Cao, Xuanhua He, Xueheng Li, Lingting Zhu, Yingying Wang, Ao Ma, Zhanjie Zhang, Man Zhou, Chengjun Xie, Jie Zhang

机构 * HFIPS, Chinese Academy of Sciences(中国科学院HFIPS) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) Xiamen University(厦门大学) Zhejiang University(浙江大学)

AI总结 本文提出 ScaleFormer 架构和 PanScale 数据集,通过跨尺度 pansharpening 方法提升多尺度场景下的图像融合质量与泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22654 2026-03-09 cs.CV

Denoising as Path Planning: Training-Free Acceleration of Diffusion Models with DPCache

去噪作为路径规划:通过DPCache实现扩散模型的训练免费加速

Bowen Cui, Yuanbin Wang, Huajiang Xu, Biaolong Chen, Aixi Zhang, Hao Jiang, Zhengzheng Jin, Xu Liu, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团)

AI总结 DPCache通过全局路径规划框架实现扩散模型的高效加速,减少计算开销并提升生成质量。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17353 2026-03-09 eess.IV cs.CV physics.optics

Learning Latent Transmission and Glare Maps for Lens Veiling Glare Removal

学习潜在的传输和眩光地图以去除镜头遮蔽眩光

Xiaolong Qian, Qi Jiang, Lei Sun, Zongxi Yu, Kailun Yang, Peixuan Wu, Jiacheng Zhou, Yao Gao, Yaoguang Ma, Ming-Hsuan Yang, Kaiwei Wang

机构 * Zhejiang University(浙江大学) Hunan University(湖南大学) University of California, Merced(加州大学默塞德分校) Google DeepMind(谷歌DeepMind)

AI总结 本文提出VeilGen和DeVeiler,通过学习潜在传输和眩光地图来有效去除遮蔽眩光,提升光学系统成像质量。

Comments Accepted to CVPR 2026. All code and datasets will be publicly released at https://github.com/XiaolongQian/DeVeiler

详情

展开后加载摘要…

URL PDF HTML 收藏