arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11876
2604.13906 2026-04-16 cs.CV

Blind Bitstream-corrupted Video Recovery via Metadata-guided Diffusion Model

基于元数据引导扩散模型的盲视流损坏视频恢复

Shuyun Wang, Hu Zhang, Xin Shen, Dadong Wang, Xin Yu

机构 * The University of Queensland(昆士兰大学) Data61, CSIRO, Australia(澳大利亚CSIRO数据61实验室)

AI总结 本文提出元数据引导扩散模型,用于在无预定义损坏区域掩码的情况下恢复损坏视频,通过双流元数据编码器提取运动向量和帧类型,结合交叉注意力机制与后处理模块提升恢复效果。

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13789 2026-04-16 cs.CV

Temporally Consistent Long-Term Memory for 3D Single Object Tracking

用于3D单目标跟踪的时序一致长期记忆

Jaejoon Yoo, SuBeen Lee, Yerim Jeon, Miso Lee, Jae-Pil Heo

机构 * Sungkyunkwan University(成均馆大学)

AI总结 本文提出ChronoTrack框架,通过长期记忆和双重损失函数提升3D单目标跟踪的时序一致性与效率,实现新的SOTA性能。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20913 2026-04-16 cs.CV

LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding

LongVideo-R1: 低成本长视频理解的智能导航

Jihao Qiu, Lingxi Xie, Xinyue Huo, Qi Tian, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) Huawei Consumer Business Group(华为消费者业务集团)

AI总结 本文提出LongVideo-R1,一种基于多模态大语言模型的智能导航系统,通过高效视频上下文导航减少冗余搜索,提升长视频理解的效率与准确性。

Comments 17 pages, 9 figures, 8 tables, accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02697 2026-04-16 cs.CV

GeoBridge: A Semantic-Anchored Multi-View Foundation Model Bridging Images and Text for Geo-Localization

GeoBridge:一种语义锚定的多视图基础模型,用于图像与文本之间的地理定位

Zixuan Song, Jing Zhang, Di Wang, Zidie Zhou, Wenbin Liu, Haonan Guo, En Wang, Bo Du

机构 * School of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室)

AI总结 GeoBridge通过语义锚定机制实现多视图特征桥接,提升地理定位的鲁棒性和灵活性。该模型构建了首个大规模跨模态多视图对齐数据集GeoLoc,验证了预训练对地理定位精度和跨领域泛化能力的提升。

Comments The paper is accepted by CVPR 2026! Code, dataset, and pretrained models will be released at https://github.com/MiliLab/GeoBridge

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01773 2026-04-16 cs.RO

IGen: Scalable Data Generation for Robot Learning from Open-World Images

IGen: 为机器人学习从开放世界图像中实现可扩展的数据生成

Chenghao Gu, Haolan Kang, Junchao Lin, Jinghe Wang, Duo Wu, Shuzhao Xie, Fanding Huang, Junchen Ge, Ziyang Gong, Letian Li, Hongying Zheng, Changwei Lv, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The University of Hong Kong(香港大学) Beijing University of Chemical Technology(北京化工大学) Shanghai Jiao Tong University(上海交通大学) Shenzhen University of Infomation Technology(深圳信息大学)

AI总结 本文提出IGen框架,通过开放世界图像生成高质量的视觉-运动数据,验证了其在机器人学习中的有效性。

Comments 8 pages, 8 figures; Accepted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13761 2026-04-16 cs.CV cs.LG

Design and Behavior of Sparse Mixture-of-Experts Layers in CNN-based Semantic Segmentation

基于CNN语义分割的稀疏混合专家层的设计与行为

Svetlana Pavlitska, Haixi Fan, Konstantin Ditschuneit, J. Marius Zöllner

机构 * FZI Research Center for Information Technology(弗劳恩霍夫信息技术研究中心) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

AI总结 本文研究了在CNN中集成稀疏混合专家层的粗粒度分块方法,通过实验验证了架构选择对路由动态和专家专业化的影响,实现了性能提升。

Comments Accepted for publication at the SAIAD workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13746 2026-04-16 cs.CV

ClipGStream: Clip-Stream Gaussian Splatting for Any Length and Any Motion Multi-View Dynamic Scene Reconstruction

ClipGStream: 用于任意长度和任意运动多视角动态场景重建的Clip-Stream高斯点云法

Jie Liang, Jiahao Wu, Chao Wang, Jiayu Yang, Xiaoyun Zheng, Kaiqiang Xiong, Zhanke Wang, Jinbo Yan, Feng Gao, Ronggang Wang

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东超高清沉浸式媒体技术省重点实验室) Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Pengcheng Laboratory(鹏城实验室) Peking University(北京大学) MIGU Video Co., Ltd.(MIGU视频有限公司)

AI总结 本文提出ClipGStream框架,通过clip级流优化实现长动态视频的高斯点云重建,兼顾可扩展性和时间一致性。

Comments CVPR 2026, Project pages: https://liangjie1999.github.io/ClipGStreamWeb/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13730 2026-04-16 cs.CV

ReConText3D: Replay-based Continual Text-to-3D Generation

ReConText3D: 基于重放的持续文本到3D生成

Muhammad Ahmed Ullah Khan, Muhammad Haris Bin Amir, Didier Stricker, Muhammad Zeshan Afzal

机构 * DFKI(德累斯顿自由大学) RPTU Kaiserslautern-Landau(科布伦茨-劳恩堡大学)

AI总结 本文提出ReConText3D框架,解决文本到3D生成中的持续学习问题,通过文本嵌入k-Center选择构建紧凑多样回放记忆,实现增量学习新3D类别并保持旧类生成能力。

Comments Accepted at CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13456 2026-04-16 cs.LG cs.CV

MyoVision: A Mobile Research Tool and NEATBoost-Attention Ensemble Framework for Real Time Chicken Breast Myopathy Detection

MyoVision:一种移动研究工具和NEATBoost-Attention集成框架用于实时鸡胸肌病检测

Chaitanya Pallerla, Siavash Mahmoudi, Dongyi Wang

机构 * Department of Biological and Agricultural Engineering, University of Arkansas(亚拉巴马大学生物与农业工程系) Department of Food Science, University of Arkansas(亚拉巴马大学食品科学系)

AI总结 本文提出MyoVision移动透光成像框架,结合NEATBoost-Attention模型实现低成本多类肌病检测,测试准确率达82.4%,优于传统方法并匹配高成本高光谱成像系统性能。

Comments Accepted at CVPR 2026 MetaFoods Workshop. 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13448 2026-04-16 cs.CV cs.AI

A Study of Failure Modes in Two-Stage Human-Object Interaction Detection

两阶段人-物交互检测中故障模式的研究

Lemeng Wang, Qinqian Lei, Vidhi Bakshi, Daniel Yi, Yifan Liu, Jiacheng Hou, Asher Seng Hao, Zheda Mai, Wei-Lun Chao, Robby T. Tan, Bo Wang

机构 * The Ohio State University(俄亥俄州立大学) National University of Singapore(新加坡国立大学) Boston University(波士顿大学) Independent Researcher(独立研究者) University of Mississippi(密西西比大学)

AI总结 本文研究两阶段人-物交互检测模型的故障模式,通过分解检测任务为多个可解释视角,分析模型行为以识别不同失败模式,揭示高基准性能不等于 robust 视觉推理的结论。

Comments Accepted to SAUAFG Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13432 2026-04-16 cs.CV cs.AI

MaMe & MaRe: Matrix-Based Token Merging and Restoration for Efficient Visual Perception and Synthesis

MaMe & MaRe:基于矩阵的令牌合并与恢复用于高效的视觉感知与合成

Simin Huo, Ning Li

AI总结 本文提出MaMe和MaRe,通过矩阵运算实现免训练的令牌合并与恢复,提升视觉模型效率,实验显示在ViT-B上吞吐量提升2%且精度下降1.0%,在图像合成中减少Stable Diffusion v2.1生成延迟31%。

Comments 20 pages. Extended version of CVPR 2026 Findings paper. Neurocomputing (Elsevier) under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13383 2026-04-16 cs.CV

UniBlendNet: Unified Global, Multi-Scale, and Region-Adaptive Modeling for Ambient Lighting Normalization

UniBlendNet:统一的全局、多尺度和区域自适应建模用于环境光照归一化

Jiatao Dai, Wei Dong, Han Zhou, Chengzhou Tang, Jun Chen

机构 * McMaster University(麦斯特大学) University of Manitoba(曼尼托巴大学)

AI总结 UniBlendNet通过统一建模全局光照、多尺度结构和区域自适应细化,提升复杂光照条件下的图像恢复性能,实验表明其优于IFBlend。

Comments Accepted to CVPR 2026 NTIRE Workshop on New Trends in Image Restoration and Enhancement. 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13305 2026-04-16 cs.CV

Bias at the End of the Score

评分末尾的偏见

Salma Abdel Magid, Grace Guo, Esin Tureci, Amaya Dharmasiri, Vikram V. Ramaswamy, Hanspeter Pfister, Olga Russakovsky

机构 * Princeton University(普林斯顿大学) Harvard University(哈佛大学)

AI总结 研究揭示奖励模型在文本到图像生成中因编码人口偏见导致性别和种族刻板印象强化及多样性崩溃的问题。

Comments Accepted to The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13244 2026-04-16 cs.CV cs.AI cs.RO

4th Workshop on Maritime Computer Vision (MaCVi): Challenge Overview

第四届海上计算机视觉研讨会(MaCVi):挑战概述

Benjamin Kiefer, Jan Lukas Augustin, Jon Muhovič, Mingi Jeong, Arnold Wiliem, Janez Pers, Matej Kristan, Alberto Quattrini Li, Matija Teršek, Josip Šarić, Arpita Vats, Dominik Hildebrand, Rafia Rahim, Mahmut Karaaslan, Arpit Vaishya, Steve Xie, Ersin Kaya, Akib Mashrur, Tze-Hsiang Tang, Chun-Ming Tsai, Jun-Wei Hsieh, Ming-Ching Chang, Wonwoo Jo, Doyeon Lee, Yusi Cao, Lingling Li, Vinayak Nageli, Arshad Jamal, Gorthi Rama Krishna Sai Subrahmanyam, Jemo Maeng, Seongju Lee, Kyoobin Lee, Xu Liu, LiCheng Jiao, Jannik Sheikh, Martin Weinmann, Ivan Martinović, Jose Mateus Raitz Persch, Rahul Harsha Cheppally, Mehmet E. Belviranli, Dimitris Gahtidis, Hyewon Chun, Sangmun Lee, Philipp Gorczak, Hansol Kim, Jeeyeon Jeon, Borja Carrillo Perez, Jiahui Wang, Sangmin Park, Andreas Michel, Jannick Kuester, Bettina Felten, Wolfgang Gross, Yuan Feng, Justin Davis

机构 * LOOKOUT Helmut Schmidt University(海姆·施密特大学) catskill GmbH(catskill公司) University of Ljubljana(卢布尔雅那大学) Virginia Tech(弗吉尼亚理工大学) Shield AI Queensland University of Technology(昆士兰理工大学) Dartmouth College(达特茅斯学院) LinkedIn University of Tuebingen(图宾根大学) Konya Technical University(科尼亚技术大学) Schneider Electric Taiwan Co., Ltd.(施耐德电气台湾有限公司) University of Taipei(台北大学) National Yang Ming Chiao Tung University(阳明交通大学) University at Albany, SUNY(阿尔巴尼大学,SUNY) Inventec Corporation(Inventec公司) HD Korea Shipbuilding & Offshore Engineering Co., Ltd.(韩国海事造船与海洋工程公司) Seoul National University(首尔国立大学) Xidian University(西安电子科技大学) Indian Institute of Technology, Tirupati(印度泰浦蒂理工学院) Centre for Artificial Intelligence and Robotics (CAIR), Bangalore, India(人工智能与机器人中心(CAIR),印度班加罗尔) Gwangju Institute of Science and Technology(全州科学技术院) Fraunhofer IOSB(弗劳恩霍夫 IOSB研究所) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Kansas State University(堪萨斯州立大学) Colorado School of Mines(科罗拉多矿业学院) Arquimea Research Center(Arquimea研究中心) Independent Researcher(独立研究员)

AI总结 本文概述了第四届海上计算机视觉研讨会(MaCVi)2026版的挑战设置、评估协议、数据集及基准赛道,分析了方法趋势和优秀团队的技术报告。

Comments Accepted to CVPR 2026 Workshop Proceeding; Maritime Computer Vision Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13153 2026-04-16 cs.CV cs.CR cs.LG

PatchPoison: Poisoning Multi-View Datasets to Degrade 3D Reconstruction

PatchPoison:污染多视图数据集以降质3D重建

Prajas Wadekar, Venkata Sai Pranav Bachina, Kunal Bhosikar, Ankit Gangwal, Charu Sharma

机构 * International Institute of Information Technology(国际信息科技研究所)

AI总结 PatchPoison通过在多视图数据集边缘注入高频率对抗性补丁,干扰SfM管线的特征匹配阶段,从而降低3D重建精度,提供一种无需修改流程的实用预处理方法。

Comments CVPR Workshop on Security, Privacy, and Adversarial Robustness in 3D Generative Vision Models (SPAR-3D), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13098 2026-04-16 cs.MA cs.CV cs.RO

C$^2$T: Captioning-Structure and LLM-Aligned Common-Sense Reward Learning for Traffic--Vehicle Coordination

C$^2$T:基于图像描述与大语言模型对齐的常识奖励学习用于交通-车辆协调

Yuyang Chen, Kaiyan Zhao, Yiming Wang, Ming Yang, Bin Rao, Zhenning Li

机构 * The State Key Laboratory of Internet of Things for Smart City, University of Macau(物联网智能城市国家重点实验室,澳门大学) Wuhan University(武汉大学) Hong Kong Polytechnic University(香港理工大学) Computer and Information Science, University of Macau(澳门大学计算机与信息科学)

AI总结 本文提出C2T框架,通过从交通-车辆动态中学习常识协调模型,结合大语言模型的常识知识,提升交通协调系统的效率、安全性和舒适性。

Comments Accepted to CVPR 2026 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13074 2026-04-16 cs.CL cs.CV

PersonaVLM: Long-Term Personalized Multimodal LLMs

PersonaVLM:长期个性化多模态大语言模型

Chang Nie, Chaoyou Fu, Yifan Zhang, Haihua Yang, Caifeng Shan

机构 * Nanjing University(南京大学) ByteDance(字节跳动)

AI总结 本文提出PersonaVLM,一种支持长期个性化多模态大语言模型框架,通过记忆、推理和响应对齐三大能力,提升个性化交互效果,并在Persona-MME基准测试中取得显著提升。

Comments Accepted by CVPR 2026. Project page: https://PersonaVLM.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10532 2026-04-16 cs.CV

The Second Challenge on Real-World Face Restoration at NTIRE 2026: Methods and Results

NTIRE 2026 实际世界面部修复挑战赛的第二次挑战:方法与结果

Jingkai Wang, Jue Gong, Zheng Chen, Kai Liu, Jiatong Li, Yulun Zhang, Radu Timofte, Jiachen Tu, Yaokun Shi, Guoyi Xu, Yaoxin Jiang, Jiajia Liu, Yingsi Chen, Yijiao Liu, Hui Li, Yu Wang, Congchao Zhu, Alexandru-Gabriel Lefterache, Anamaria Radoi, Chuanyue Yan, Tao Lu, Yanduo Zhang, Kanghui Zhao, Jiaming Wang, Yuqi Li, WenBo Xiong, Yifei Chen, Xian Hu, Wei Deng, Daiguo Zhou, Sujith Roy, Claudia Jesuraj, Vikas B, Spoorthi LC, Nikhil Akalwadi, Ramesh Ashok Tabib, Uma Mudenagudi, Yuxuan Jiang, Chengxi Zeng, Tianhao Peng, Fan Zhang, David Bull Wei Zhou, Linfeng Li, Hongyu Huang, Hoyoung Lee, SangYun Oh, ChangYoung Jeong, Axi Niu, Jinyang Zhang, Zhenguo Wu, Senyan Qing, Jinqiu Sun, Yanning Zhang

机构 * NTIRE 2026

AI总结 本文回顾了NTIRE 2026实际世界面部修复挑战赛,探讨了提出的解决方案和成果,旨在提升感知质量和真实感,采用加权图像质量评估分数和AdaFace模型进行评估。

Comments NTIRE 26: https://cvlai.net/ntire/2026 . NTIRE Real-World Face Restoration: https://ntire-face.github.io/2026/ . CVPR 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27306 2026-04-16 cs.MA cs.AI cs.SY eess.SY

GUIDE: Guided Updates for In-context Decision Evolution in LLM-Driven Spacecraft Operations

GUIDE:用于LLM驱动航天任务中上下文决策演化的引导更新

Alejandro Carrasco, Mariko Storey-Matsutani, Victor Rodriguez-Fernandez, Richard Linares

机构 * Massachusetts Institute of Technology(麻省理工学院) Universidad Politecnica de Madrid(马德里理工大学)

AI总结 GUIDE通过非参数策略改进框架实现跨回合适应,利用结构化决策规则提升航天任务性能,实验表明其在对抗性轨道拦截任务中优于静态基线。

Comments Accepted to AI4Space@CVPR Workshop in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27064 2026-04-16 cs.CV cs.AI cs.CL

ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding

ChartNet: 一个百万级、高质量的多模态数据集,用于稳健的图表理解

Jovana Kondic, Pengyuan Li, Dhiraj Joshi, Isaac Sanchez, Ben Wiesel, Shafiq Abedin, Amit Alfassy, Eli Schwartz, Daniel Caraballo, Yagmur Gizem Cinar, Florian Scheidegger, Steven I. Ross, Daniel Karl I. Weidele, Hang Hua, Ekaterina Arutyunova, Roei Herzig, Zexue He, Zihan Wang, Xinyue Yu, Yunfei Zhao, Sicong Jiang, Minghao Liu, Qunshu Lin, Peter Staar, Luis Lastras, Aude Oliva, Rogerio Feris

机构 * MIT(麻省理工学院) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) IBM Research(IBM研究院) Abaka AI & 2077AI(Abaka AI及2077AI)

AI总结 ChartNet通过生成150万张不同图表样本,提升图表解释和推理能力,包含代码、图像、表格、自然语言和问答数据,支持多模态对齐,公开可用。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20981 2026-04-16 cs.CV cs.AI

Echoes Over Time: Unlocking Length Generalization in Video-to-Audio Generation Models

时间回声:解锁视频到音频生成模型中的长度泛化

Christian Simon, Masato Ishii, Wei-Yao Wang, Koichi Saito, Akio Hayakawa, Dongseok Shim, Zhi Zhong, Shuyang Cui, Shusuke Takahashi, Takashi Shibuya, Yuki Mitsufuji

机构 * Sony Group Corporation(索尼集团公司) Sony AI(索尼人工智能)

AI总结 本文提出MMHNet模型,通过层级结构和非因果Mamba实现长音频生成,提升生成长度至5分钟以上,证明短训练长测试的可行性,优于现有视频到音频生成方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14234 2026-04-16 cs.CV

ViBES: A Conversational Agent with Behaviorally-Intelligent 3D Virtual Body

ViBES:一个具有行为智能的3D虚拟身体对话代理

Juze Zhang, Changan Chen, Xin Chen, Heng Yu, Tiange Xiang, Ali Sartaz Khan, Shrinidhi K. Lakshmikanth, Ehsan Adeli

机构 * Stanford University(斯坦福大学) ByteDance(字节跳动)

AI总结 ViBES通过联合规划语言和运动,实现对话条件下的身体动作生成,提升了多轮对话中的社会交互能力。

Comments Project page: https://ai.stanford.edu/~juze/ViBES/. Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16555 2026-04-16 cs.CV

Lite Any Stereo: Efficient Zero-Shot Stereo Matching

Lite Any Stereo: 高效的零样本立体匹配

Junpeng Jing, Weixun Luo, Ye Mao, Krystian Mikolajczyk

机构 * Imperial College London(伦敦帝国学院)

AI总结 本文提出Lite Any Stereo框架,通过紧凑且表达能力强的主干网络和混合成本聚合模块,实现高效零样本立体匹配,达到四个广泛使用的现实基准的第一名。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13028 2026-04-15 cs.CV

Conflated Inverse Modeling to Generate Diverse and Temperature-Change Inducing Urban Vegetation Patterns

融合反演建模生成多样且能引起温度变化的城区植被模式

Baris Sarper Tezcan, Hrishikesh Viswanath, Rubab Saher, Daniel Aliaga

机构 * Computer Science(计算机科学) Forestry and Natural Resources(林业与自然资源)

AI总结 本文提出融合预测正模与扩散基生成反模的反演框架,用于生成多样且符合特定温度目标的城区植被模式,解决传统方法在数据稀少时无法捕捉模糊性的不足。

Comments Accepted to the CVPR 2026 EarthVision Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12896 2026-04-15 cs.CV cs.LG

Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs

不要显示像素,显示提示:通过感知程序解锁语言模型中的视觉工具推理

Muhammad Kamran Janjua, Hugo Silva, Di Niu, Bahador Rashidi

机构 * Huawei Technologies, Canada(华为技术(加拿大)) University of Alberta, Canada(阿尔伯塔大学(加拿大))

AI总结 本文提出感知程序(P²),通过将视觉工具输出转换为结构化摘要,提升语言模型的视觉推理能力,在六个任务中均取得显著提升。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12894 2026-04-15 cs.CV

Representing 3D Faces with Learnable B-Spline Volumes

用可学习的B样条体积表示3D人脸

Prashanth Chandran, Daoye Wang, Timo Bolkart

机构 * Google(谷歌)

AI总结 本文提出CUBE方法,结合B样条体积与学习特征,用于3D扫描配准和单目3D人脸重建,通过高维控制特征提升模型表达能力,实现局部表面编辑。

Comments Accepted to CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12803 2026-04-15 cs.CV cs.LG

Generative Anonymization in Event Streams

事件流中的生成匿名化

Adam T. Müller, Mihai Kocsis, Nicolaj C. Stache

机构 * Heilbronn University of Applied Sciences(海德堡应用科学大学)

AI总结 本文提出首个事件流生成匿名化框架,通过桥接异步事件与标准空间生成模型,实现隐私保护与数据效用的平衡。

Comments Accepted to the 1st Workshop on Low-Level Vision Frontiers (LoViF) at IEEE/CVF CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12765 2026-04-15 cs.CV cs.GR

A Dataset and Evaluation for Complex 4D Markerless Human Motion Capture

一个用于复杂4D无标记人体运动捕捉的 数据集和评估

Yeeun Park, Miqdad Naduthodi, Suryansh Kumar

机构 * Visual and Spatial AI Lab(视觉与空间人工智能实验室) VCCM Section College of PVFA(VCCM学院物理与虚拟现实学院) Department of ECEN(电子工程系) Department of CSCE(计算机科学与工程系) Texas A&M University(德克萨斯农工大学)

AI总结 本文提出一个复杂4D无标记人体运动捕捉的数据集和评估,包含单人和多人场景,涵盖复杂运动、频繁人与人遮挡、快速位置交换和不同距离变化,验证了现有方法在真实条件下的性能不足。

Comments 14 pages, 11 figures, 4 tables. Accepted for publication at CVPR 2026 4D World Models Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12762 2026-04-15 cs.CV cs.AI cs.MA

ARGOS: Who, Where, and When in Agentic Multi-Camera Person Search

ARGOS:智能多摄像机人像搜索中的谁、哪里和何时

Myungchul Kim, Kwanyong Park, Junmo Kim, In So Kweon

机构 * KAIST(韩国科学技术院) University of Seoul(首尔大学) KIST(韩国科学技术院)

AI总结 ARGOS首次将多摄像机人像搜索转化为交互推理问题,通过智能体在信息不对称下规划、提问和消除候选,包含14个真实场景的2691个任务,实验表明该基准远未解决。

Comments Accepted to CVPR 2026 Workshop on Multimodal Spatial Intelligence (MUSI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12719 2026-04-15 cs.LG stat.ML

Monte Carlo Stochastic Depth for Uncertainty Estimation in Deep Learning

蒙特卡罗随机深度用于深度学习中的不确定性估计

Adam T. Müller, Tobias Rögelein, Nicolaj C. Stache

机构 * Heilbronn University of Applied Sciences(海德堡应用科学大学)

AI总结 本文提出蒙特卡罗随机深度(MCSD)作为贝叶斯近似推断的理论框架,并在目标检测任务中验证其有效性,展示其在预测准确性、校准和不确定性排名上的优势。

Comments Accepted to the 8th Safe Artificial Intelligence for All Domains (SAIAD) workshop at IEEE/CVF CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏