arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11871
2604.24893 2026-04-29 cs.CV

Interactive Episodic Memory with User Feedback

具有用户反馈的交互式事件记忆

Nikesh Subedi, Loris Bazzani, Ziad Al-Halah

机构 * University of Utah(犹他大学) University of Verona(威尼斯大学)

AI总结 本文提出EM-QnF任务,通过用户反馈和补充信息提升事件记忆查询的准确性,引入FALM模块实现高效交互式优化,优于现有方法并在现实场景中表现良好。

Comments Accepted to CVPR 2026. Project Page: https://nsubedi11.github.io/refocus

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24885 2026-04-29 cs.CV cs.LG

VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations

VibeToken: 1D图像分词器和自回归模型的扩展以实现动态分辨率生成

Maitreya Patel, Jingtao Li, Weiming Zhuang, Yezhou Yang, Lingjuan Lv

机构 * Arizona State University(亚利桑那州立大学) SonyAI(索尼人工智能)

AI总结 本文提出VibeToken,一种高效的自回归图像合成方法,支持任意分辨率和纵横比,通过动态序列生成实现高效性能平衡。VibeToken-Gen在低计算资源下生成高质量图像,相比传统扩散模型更高效。

Comments Accepted at CVPR'26 | Project Page: https://github.com/SonyResearch/VibeToken

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22990 2026-04-29 cs.CV cs.AI

Hard to See, Hard to Label: Generative and Symbolic Acquisition for Subtle Visual Phenomena

难以察觉,难以标注:生成与符号获取用于微妙的视觉现象

Renjith Prasad, Rishabh Sharma, Andrew E. Shao, Annmary Justine Koomthanam, Shreyas Kulkarni, Suparna Bhattacharya, Martin Foltin, Amit Sheth, David Orozco, Matthew Quinn, Brian Sammuli

机构 * University of South Carolina(南卡罗来纳大学) AI Research Lab, HPE Labs, Hewlett Packard Enterprise(HPE实验室人工智能研究部) Indian AI Research Organization(印度人工智能研究组织) General Atomics(通用原子公司)

AI总结 本文提出GSAL框架,结合生成模型与语义覆盖先验,解决细微视觉异常标注难题,提升稀有类别检索效率。

Comments Accepted at CVPR 2026 SVC Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17492 2026-04-29 cs.CV

MMLANDMARKS: a Cross-View Instance-Level Benchmark for Geo-Spatial Understanding

MMLANDMARKS: 一种用于地理空间理解的跨视图实例级基准

Oskar Kristoffersen, Alba Reinders Sánchez, Morten Rieger Hannemose, Anders Bjorholm Dahl, Dim P. Papadopoulos

机构 * Technical University of Denmark(丹麦技术大学) Pioneer Center for AI(先锋人工智能中心)

AI总结 本文提出MMLandmarks基准,包含四类数据:高分辨率航拍图、地面视图、文本信息和地理坐标,用于跨视图地物检索、定位及文本到图像等任务,揭示多模态数据对地理空间理解的重要性。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00793 2026-04-29 cs.MM cs.SD

Gesture2Music: A Low-Latency Real-Time Framework for Continuous Gesture-Driven Music Generation

Gesture2Music: 一种低延迟的实时框架,用于连续的手势驱动音乐生成

Rathinaraja Jeyaraj, Barathi Subramanian, Kapilya Gangadharan, Anand Paul

机构 * Stanford University(斯坦福大学) Saveetha Institute of Medical and Technical Sciences(Saveetha医学与技术科学学院) LSU Health Sciences Center New Orleans(路易斯安那州立大学健康科学中心新奥尔良分校)

AI总结 本文提出Gesture2Music框架,通过因果时间卷积网络预测音乐控制事件,结合合成流生成策略和时间一致性损失,实现低延迟的实时连续手势驱动音乐生成。

Comments 43rd The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06100 2026-04-29 cs.CV

High-Precision Dichotomous Image Segmentation via Depth Integrity-Prior and Fine-Grained Patch Strategy

通过深度完整性先验和细粒度补丁策略实现高精度二元图像分割

Xianjie Liu, Keren Fu, Qijun Zhao

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) National Key Lab of Fundamental Science on Synthetic Vision, Sichuan University(合成视觉基础科学国家实验室)

AI总结 本文提出PDFNet网络,结合深度完整性先验和细粒度补丁策略,通过融合RGB和伪深度特征提升二元图像分割精度,实现更高效的高精度分割效果。

Journal ref IEEE Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09034 2026-04-29 cs.LG cs.AI

Contrast-Enhanced Gating in GRUs for Robust Low-Data Sequence Learning

GRU中对比增强门控用于鲁棒低数据序列学习

Barathi Subramanian, Rathinaraja Jeyaraj, Anand Paul

机构 * Stanford University(斯坦福大学) LSU Health Sciences Center New Orleans(路易斯安那州立大学健康科学中心新奥尔良分校)

AI总结 本文提出SST激活函数提升GRU门控性能,尤其在低数据场景下表现更优,增强信息过滤能力,提升训练稳定性。

Comments 43rd The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24419 2026-04-28 cs.CV

BMD-45: A Large-Scale CCTV Vehicle Detection Dataset for Urban Traffic in Developing Cities

BMD-45:一个大规模城市交通CCTV车辆检测数据集

Akash Sharma, Chinmay Mhatre, Sankalp Gawali, Ruthvik Bokkasam, Brij Sharma, Vishwajeet Pattanaik, Punit Rathore, Raghu Krishnapuram, Vijay Gopal Kovvali, Anirban Chakraborty, Yogesh Simmhan

机构 * Department of Computational and Data Sciences (CDS)(计算与数据科学系) Robert Bosch Center for Cyber Physical Systems (RBCCPS)(罗伯特·博世中心(RBCCPS)) Center of Data for Public Good (CDPG)(公共数据中心(CDPG)) Centre for Infrastructure, Sustainable Transportation & Urban Planning (CiSTUP)(基础设施、可持续交通与城市规划中心(CiSTUP)) Indian Institute of Science, Bengaluru, India(印度科学研究院,班加罗尔,印度)

AI总结 BMD-45数据集针对发展中国家城市交通的复杂场景,包含14种细粒度车辆类别,通过大规模标注揭示模型在不同领域间的性能差距,为鲁棒感知系统开发提供基准。

Comments Accepted at CVPR 2026 Findings Track. To appear in the IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24393 2026-04-28 cs.LG cs.CV

Complexity of Linear Regions in Self-supervised Deep ReLU Networks

自监督深度ReLU网络中线性区域的复杂性

Mufhumudzi Muthivhi, Terence L. van Zyl

机构 * University of Johannesburg(约翰内斯堡大学)

AI总结 研究自监督学习中线性区域的局部分布,通过SplineCam提取多边形,分析数量、面积、 eccentricity 和边界变化,发现自监督方法在准确率上与监督方法相当但生成更少区域,对比方法快速扩张区域,自蒸馏方法则倾向于合并邻近区域。

Comments Accepted for publication in 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition - Findings Track (CVPRF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24276 2026-04-28 cs.CV

Instance Awareness of Multi-class Semantic Segmentation Loss Functions

多类语义分割损失函数的实例意识

Soumya Snigdha Kundu, Florian Kofler, Marina Ivory, Hendrik Moller, Jonathan Shapey, Tom Vercauteren

机构 * King’s College London(伦敦国王学院) University of Tübingen(图宾根大学) Technical University of Munich(慕尼黑技术大学) King’s College Hospital(国王学院医院)

AI总结 本文提出通过一对多类分解扩展实例敏感损失以解决多类不平衡问题,改进多类CC损失和blob损失,在BraTS-METS 2025数据集上提升了稀有类Dice分数和Panoptic质量。

Comments 8 pages, 4 Figures, Accepted as Poster at CV4CLINIC workshop at CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21728 2026-04-28 cs.CV cs.LG

Ramen: Robust Test-Time Adaptation of Vision-Language Models with Active Sample Selection

Ramen: 通过主动样本选择实现视觉语言模型的鲁棒性测试时适应

Wenxuan Bao, Yanjun Zhao, Xiyuan Yang, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出Ramen框架,通过主动样本选择实现视觉语言模型在混合域下的鲁棒测试时适应,通过领域一致性与预测平衡准则提升适应性能,实验表明其在多种图像退化和领域偏移基准上表现优异。

Comments Accepted by CVPR 2026 (Findings Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15941 2026-04-28 cs.CV

Towards Fair and Robust Volumetric CT Classification via KL-Regularised Group Distributionally Robust Optimisation

迈向公平且鲁棒的体积CT分类:通过KL正则化组分布鲁棒优化

Samuel Johnny, Blessed Guda, Goodness Obasi, Aaron Emmanuel, Moise Busogi

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出通过KL正则化组分布鲁棒优化方法,解决多站点CT体积中二分类新冠和性别公平的肺部病理识别问题,提升模型鲁棒性和公平性。

Comments CVPR 2026 Medical Imaging & Healthcare Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19339 2026-04-28 cs.CV

POUR: A Provably Optimal Method for Unlearning Representations via Neural Collapse

POUR:一种通过神经坍塌进行表示去学习的可证明最优方法

Anjie Le, Can Peng, Yuyuan Liu, J. Alison Noble

机构 * Institute of Biomedical Engineering, University of Oxford, UK(牛津大学生物医学工程研究所)

AI总结 本文提出POUR方法,通过神经坍塌理论,设计可证明最优的表示去学习算法,有效去除特定概念或训练图像的影响,同时保留保留知识,优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24171 2026-04-28 cs.CV

POCA: Pareto-Optimal Curriculum Alignment for Visual Text Generation

POCA:基于视觉文本生成的帕累托最优课程对齐

Yaohou Fan, Qingzhong Wang, Yongsong Huang, Junyi Liu, Tomo Miyazaki, Shinichiro Omachi

机构 * Tohoku University(东大大学) Amazon Web Services(亚马逊网络服务)

AI总结 本文提出POCA框架,通过多目标优化解决视觉文本生成中文本准确性和图像一致性之间的平衡问题,采用帕累托最优集和自适应课程对齐策略提升生成效果。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24082 2026-04-28 cs.CR cs.AI cs.CL

Jailbreaking Frontier Foundation Models Through Intention Deception

通过意图欺骗突破前沿基础模型

Xinhe Wang, Katia Sycara, Yaqi Xie

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出一种多轮欺骗方法,通过模拟良性意图和模型一致性,引导模型生成有害输出,并揭示了未被注意到的para-jailbreaking漏洞。

Comments Accepted at CVPR 2026 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24044 2026-04-28 cs.CV

CLLAP: Contrastive Learning-based LiDAR-Augmented Pretraining for Enhanced Radar-Camera Fusion

CLLAP:基于对比学习的激光雷达增强预训练用于增强雷达-相机融合

Bingyi Liu, Chuanhui Zhu, Hongfei Xue, Jian Teng, Jipeng Liu, Enshu Wang, Penglin Dai, Pu Wang

机构 * Wuhan University of Technology(武汉理工大学) University of North Carolina at Charlotte(北卡罗来纳州立大学) Wuhan University(武汉大学) Southwest Jiaotong University(西南交通大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 CLLAP通过利用丰富的激光雷达数据生成伪雷达数据,结合双阶段双模态对比学习策略,提升雷达-相机融合模型的特征提取能力,实验证明在NuScenes和Lyft Level 5数据集上显著提升3D目标检测性能。

Comments accepted by 2026 CVPR Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23996 2026-04-28 cs.CV

SMoES: Soft Modality-Guided Expert Specialization in MoE-VLMs

SMoES:在MoE-VLMs中的软模态引导专家专业化

Zi-Hao Bo, Yaqian Li, Anzhou Hou, Rinyoichi Takezoe, Ertao Zhao, Tianxiang Pan, Jiale Yan, Mo Guang, Kaiwen Long

机构 * Li Auto Inc.(李自动公司)

AI总结 本文提出SMoES,通过动态软模态评分、专家分组机制和互信息正则化,提升MoE-VLMs的模态感知专家专业化,实验显示在多模态和语言任务上平均提升0.9%和4.2%,通信开销降低56.1%,吞吐量提升12.3%。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23803 2026-04-28 cs.CV

Bringing a Personal Point of View: Evaluating Dynamic 3D Gaussian Splatting for Egocentric Scene Reconstruction

融入个人视角:评估动态3D高斯散射在眼动场景重建中的应用

Jan Warchocki, Xi Wang, Jonas Kulhanek, Jan van Gemert

机构 * Delft University of Technology(代尔夫特理工大学) TUM/MCML(慕尼黑工业大学/麦克斯·普朗克研究所) Czech Technical University in Prague(布拉格捷克技术大学)

AI总结 本文评估了动态单目3DGS模型在眼动和非眼动视频中的重建效果,发现眼动视角重建质量较低,原因在于模型更擅长静态内容而非动态场景。

Comments Accepted at the EgoVis Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23604 2026-04-28 cs.CV cs.RO

Learning to Identify Out-of-Distribution Objects for 3D LiDAR Anomaly Segmentation

学习识别分布外对象以进行3D激光雷达异常分割

Simone Mosco, Daniel Fusaro, Alberto Pretto

机构 * University of Padova(帕多瓦大学)

AI总结 本文提出了一种高效方法,直接在特征空间中操作,通过建模内类特征分布来约束异常样本,同时引入混合真实-合成数据集以解决3D激光雷达异常分割中的领域差距问题。

Comments This paper has been accepted at the 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21718 2026-04-28 cs.CV cs.AI cs.CL cs.LG cs.MM

Building a Precise Video Language with Human-AI Oversight

构建具有人机监督的精确视频语言

Zhiqiu Lin, Chancharik Mitra, Siyuan Cen, Isaac Li, Yuhan Huang, Yu Tong Tiffany Ling, Hewei Wang, Irene Pi, Shihang Zhu, Ryan Rao, George Liu, Jiaxi Li, Ruojin Li, Yili Han, Yilun Du, Deva Ramanan

AI总结 本文提出CHAI框架,通过专家与AI协作提升视频描述精度,改进开源模型并实现专业级视频生成。

Comments CVPR 2026 Highlight. Project page: https://linzhiqiu.github.io/papers/chai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05621 2026-04-28 cs.CV

FunRec: Reconstructing Functional 3D Scenes from Egocentric Interaction Videos

FunRec:从第一人称交互视频重建功能3D场景

Alexandros Delitzas, Chenyangguang Zhang, Alexey Gavryushin, Tommaso Di Mario, Boyang Sun, Rishabh Dabral, Leonidas Guibas, Christian Theobalt, Marc Pollefeys, Francis Engelmann, Daniel Barath

机构 * ETH Zurich(苏黎世联邦理工学院) Max Planck Institute for Informatics(马克斯·普朗克研究所(信息学)) Stanford University(斯坦福大学) Microsoft(微软) USI Lugano(USI卢加诺)

AI总结 FunRec通过直接从第一人称RGB-D交互视频重建室内场景的3D数字双胞胎,实现了无需控制环境或多状态采集的交互式3D场景重建,提升了部分分割和重建精度。

Comments CVPR 2026. Project page: https://functionalscenes.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16046 2026-04-28 cs.RO cs.CV

DextER: Language-driven Dexterous Grasp Generation with Embodied Reasoning

DextER:基于语言的灵巧抓取生成与具身推理

Junha Lee, Eunha Park, Minsu Cho

机构 * Pohang University of Science and Technology(釜山科学技术大学) RLWRLD

AI总结 DextER通过具身推理生成灵巧抓取,结合任务语义与物理约束,提升抓取成功率与意图对齐度。

Comments CVPR 2026, Project page: https://junha-l.github.io/dexter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10362 2026-04-28 cs.CV cs.AI

Visual Funnel: Resolving Contextual Blindness in Multimodal Large Language Models

视觉漏斗:缓解多模态大语言模型中的上下文盲区

Woojun Jung, Jaehoon Go, Mingyu Jeon, Sunjae Yoon, Junyeong Kim

机构 * Department of AI, Chung-Ang University(Chung-Ang 大学人工智能系)

AI总结 本文提出视觉漏斗方法,通过上下文锚定和熵缩放投资组合缓解多模态大语言模型中的上下文盲区问题,通过动态调整裁剪尺寸和中心点,提升视觉细节与全局上下文的关联性。

Comments Accepted to CVPR 2026(Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07834 2026-04-28 cs.CV

Voxify3D: Pixel Art Meets Volumetric Rendering

Voxify3D:像素艺术与体素渲染的结合

Yi-Chuan Huang, Jiewen Chan, Hao-Jen Chien, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University(阳明交通大学)

AI总结 本文提出Voxify3D框架,通过结合3D网格优化与2D像素艺术监督,解决体素艺术中语义保留、像素美学和离散优化的挑战,实验显示其在多样角色和可控抽象上的优越性能。

Comments CVPR 2026. Project page: https://yichuanh.github.io/Voxify-3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00995 2026-04-28 cs.CV

S2AM3D: Scale-controllable Part Segmentation of 3D Point Clouds

S2AM3D: 可缩放部分的3D点云分割

Han Su, Tianyu Huang, Zichen Wan, Xiaohe Wu, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨理工大学)

AI总结 本文提出S2AM3D,通过结合2D分割先验与3D一致监督,解决3D点云分割中数据稀缺和视图不一致的问题,实现对复杂结构的鲁棒分割。

Comments Accepted by CVPR 2026(Oral). Project page:https://sumuru789.github.io/S2AM3D-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23344 2026-04-28 cs.CV

Exploring Hierarchical Consistency and Unbiased Objectness for Open-Vocabulary Object Detection

探索开放词汇目标检测中的层次一致性与无偏目标性

Sanghoon Lee, Geon Lee, Hyekang Park, Bumsub Ham

机构 * Yonsei University(延世大学) Korea Institute of Science and Technology (KIST)(韩国科学技术院)

AI总结 本文提出一种新颖的伪标签框架,通过层次一致性校准和LoCLIP模型提升开放词汇目标检测的准确性与可靠性。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23314 2026-04-28 cs.CV

Learning from Noisy Prompts: Saliency-Guided Prompt Distillation for Robust Segmentation with SAM

从噪声提示中学习:基于显著性的提示蒸馏用于具有SAM的鲁棒分割

Jingxuan Kang, Ziqi Zhang, Shaoming Zheng, Shuang Li, Uday Bharat Patel, Alexander Harry Fitzhugh, Phillip Lung, Yusuf Kiberu, Nikesh Jathanna, Shahnaz Jamil-Copley, Bernhard Kainz, Chen Qin

机构 * Imperial College London(伦敦帝国学院) Beihang University(北航) National Health Service(国家卫生服务) University of Nottingham(诺丁汉大学)

AI总结 本文提出SPD框架,通过数据驱动的解剖先验知识和上下文提示蒸馏,提升在噪声提示下的分割鲁棒性,实验表明其在MRI和CT基准上优于现有方法。

Comments Accepted to CVPR 2026 (Findings Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23274 2026-04-28 cs.CV

SemiGDA: Generative Dual-distribution Alignment for Semi-Supervised Medical Image Segmentation

SemiGDA: 生成双分布对齐用于半监督医学图像分割

Kaiwen Huang, Yi Zhou, Yizhe Zhang, Jingxiong Li, Tao Zhou

机构 * Nanjing University of Science and Technology(南京理工大学) Southeast University(东南大学)

AI总结 SemiGDA通过双分布对齐模块和一致性驱动跳过适配器提升半监督医学图像分割的语义学习和场景适应性,实验表明其优于现有方法。

Comments This paper have been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23264 2026-04-28 cs.CV

MotionHiFlow: Text-to-motion via hierarchical flow matching

MotionHiFlow:通过分层流匹配实现文本到运动

Heng Li, Xiaotong Lin, Ling-An Zeng, Yulei Kang, Shuai Li, Jian-Fang Hu

机构 * Sun Yat-sen University(中山大学) Shandong University(山东大学) Guangdong Province Key Laboratory of Information Security Technology(广东省信息安全技术重点实验室) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部机器智能与先进计算重点实验室)

AI总结 MotionHiFlow通过分层流匹配框架生成运动,结合文本-运动扩散变压器和拓扑感知运动VAE,实现结构依赖建模,提升语义对齐和细节精度。

Comments accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23173 2026-04-28 cs.CV

One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition

一个身份,多种角色:多模态实体指代用于增强视频情境识别

Balaji Darur, Amanmeet Garg, Makarand Tapaswi

机构 * CVIT, IIIT Hyderabad, India(IIIT海得拉尔学院计算机视觉研究所,印度) Amazon Prime Video, Seattle(亚马逊Prime视频,西雅图)

AI总结 本文提出多模态实体指代(MEC)方法,通过结合文本和视频信息提升视频情境识别的准确性和一致性,实验结果显示在描述和视觉定位方面均取得显著提升。

Comments Accepted to CVPR 2026 Findings. Project Page: https://katha-ai.github.io/projects/cinemec/

详情

展开后加载摘要…

URL PDF HTML 收藏