arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-04-14 至 2026-04-14 共收录 70
2604.02003 2026-04-14 cs.CV

ProDiG: Progressive Diffusion-Guided Gaussian Splatting for Aerial to Ground Reconstruction

ProDiG:渐进式扩散引导高斯点云法用于空到地重建

Sirshapan Mitra, Yogesh S. Rawat

机构 * CRCV, University of Central Florida(中佛罗里达大学计算机视觉研究中心)

AI总结 本文提出ProDiG方法,通过扩散引导逐步将空视图转换为地面级视图,利用几何感知因果注意力模块和距离自适应高斯模块,实现高斯点云的渐进式优化,提升重建的几何一致性和鲁棒性。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27383 2026-04-14 cs.CV

Decompose, Mix, Adapt: A Unified Framework for Parameter-Efficient Neural Network Recombination and Compression

分解、混合、适应:一种统一的框架用于参数高效神经网络重组与压缩

Nazia Tasnim, Shrimai Prabhumoye, Bryan A. Plummer

机构 * Boston University(波士顿大学) NVIDIA(英伟达)

AI总结 本文提出CRISP框架,通过分解预训练权重为基矩阵和混合投影,实现参数高效重组与压缩,优于现有方法4-5%,并在PEFT和PEFT+MC组合中表现更优。

Comments Accepted in CVPR, 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11346 2026-04-14 cs.CV cs.GR cs.RO

Learning to Assist: Physics-Grounded Human-Human Control via Multi-Agent Reinforcement Learning

学习协助:通过多智能体强化学习实现物理基础的人机控制

Yuto Shibata, Kashu Yamazaki, Lalit Jayanti, Yoshimitsu Aoki, Mariko Isogawa, Katerina Fragkiadaki

机构 * Carnegie Mellon University(卡内基梅隆大学) Keio AI Research Center(庆应义塾大学人工智能研究中心) Keio University(庆应义塾大学)

AI总结 本文提出通过多智能体强化学习实现人与人之间力交换的交互动作模仿,解决了连续关注人类伙伴和快速适应其动态的需求,展示了多智能体RL在物理基础和社交感知人形控制中的优势。

Comments Accepted at CVPR 2026 (main). Project page: https://yutoshibata07.github.io/AssistMimic/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08942 2026-04-14 cs.CV cs.AI cs.CL cs.LG

BiCLIP: Domain Canonicalization via Structured Geometric Transformation

BiCLIP:通过结构几何变换实现领域规范化

Pranav Mantini, Shishir K. Shah

机构 * University of Houston(休斯顿大学) The University of Oklahoma(俄克拉荷马大学)

AI总结 BiCLIP通过结构几何变换提升跨模态对齐,利用少量锚点样本实现领域规范化,实验表明其在11个基准测试中均取得最优性能。

Comments Accepted at Domain Generalization: Evolution, Breakthroughs, and Future Horizons Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02123 2026-04-14 cs.AI cs.CV

Nano-EmoX: Unifying Multimodal Emotional Intelligence from Perception to Empathy

Nano-EmoX:从感知到共情的多模态情感智能统一框架

Jiahao Huang, Fengyan Lin, Xuechao Yang, Chen Feng, Kexin Zhu, Xu Yang, Zhide Chen

机构 * Fujian Normal University(福建师范大学) RMIT University(皇家墨尔本理工大学) Minjiang University(闽江学院)

AI总结 本文提出Nano-EmoX,通过认知启发的三级架构整合感知、理解与交互层面的情感任务,首次实现六项核心情感任务的统一建模,展现高效且强大的泛化能力。

Comments This paper has been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06993 2026-04-14 cs.CV

Can Textual Reasoning Improve the Performance of MLLMs on Fine-grained Visual Classification?

文本推理能否提升多模态大语言模型在细粒度视觉分类中的性能?

Jie Zhu, Yiyang Su, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文研究了文本推理对细粒度视觉分类任务的影响,发现推理长度过长会降低分类准确率,提出MRN和ReFine-RFT方法提升性能。

Comments CVPR Finding, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18329 2026-04-14 cs.CV

SciPostLayoutTree: A Dataset for Structural Analysis of Scientific Posters

SciPostLayoutTree:用于科学海报结构分析的数据集

Shohei Tanaka, Atsushi Hashimoto, Yoshitaka Ushiku

机构 * OMRON SINIC X Corporation(欧姆龙SINIC X公司)

AI总结 本文提出SciPostLayoutTree数据集,用于研究科学海报的结构分析,通过标注阅读顺序和父子关系,提升结构感知界面的准确性。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16428 2026-04-14 cs.CV

CylinderDepth: Cylindrical Spatial Attention for Multi-View Consistent Self-Supervised Surround Depth Estimation

CylinderDepth:多视角一致自监督周围深度估计的圆柱空间注意力

Samer Abualhanud, Christian Grannemann, Max Mehltretter

机构 * Leibniz University Hannover(莱布尼茨汉诺威大学)

AI总结 本文提出一种几何引导方法,通过圆柱空间注意力机制提升多视角自监督周围深度估计的精度和一致性。

Comments Accepted at 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18976 2026-04-14 cs.CV cs.HC

Ninja Codes: Neurally Generated Fiducial Markers for Stealthy 6-DoF Tracking

Ninja Codes: 由神经生成的隐匿式六自由度跟踪标记

Yuichiro Takeuchi, Yusuke Imoto, Shunya Kato

机构 * Osaka University(大阪大学) Kyoto University(京都大学)

AI总结 本文提出Ninja Codes,一种由神经网络生成的隐匿式标记,能自然融入真实环境,通过编码网络将任意图像转换为标记,用于机器人和增强现实等领域的隐匿六自由度跟踪。

Comments CVPR 2026 Findings; Project page: https://sento.net/research/ninjacodes

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05217 2026-04-14 cs.CV

Organizing Unstructured Image Collections using Natural Language

用自然语言组织无结构图像集合

Mingxuan Liu, Zhun Zhong, Jun Li, Gianni Franchi, Subhankar Roy, Elisa Ricci

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) ENSTA Paris, Institut Polytechnique de Paris(巴黎高等先进技术学院,巴黎综合理工学院) Hefei University of Technology(合肥工业大学) University of Bergamo(贝加莫大学) Technical University of Munich(慕尼黑工业大学)

AI总结 本文提出OpenSMC任务,通过自然语言发现图像的多种语义聚类标准,并实现自动组织。X-Cluster框架通过文本推理代理,发现多种聚类标准并生成有意义的簇。

Comments Accepted to CVPR 2026 Findings. Project page: https://oatmealliu.github.io/xcluster.html

详情

展开后加载摘要…

URL PDF HTML 收藏