arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-04-29 至 2026-04-29 共收录 14
2604.25642 2026-04-29 cs.CV cs.AI

Prefill-Time Intervention for Mitigating Hallucination in Large Vision-Language Models

预填充阶段干预用于缓解大视觉-语言模型中的幻觉

Chengsheng Zhang, Chenghao Sun, Xinyan Jiang, Wei Li, Xinmei Tian

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Advanced Research Institute, Chinese Academy of Sciences(上海先进研究院,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出PTI方法,在预填充阶段干预KV缓存以减少幻觉,通过模态感知方向修正错误表示,提升模型可靠性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17070 2026-04-29 cs.CV

NTIRE 2026 Rip Current Detection and Segmentation (RipDetSeg) Challenge Report

2026年NTIRE RipDetSeg挑战报告

Andrei Dumitriu, Aakash Ralhan, Florin Miron, Florin Tatui, Radu Tudor Ionescu, Radu Timofte, Abdullah Naeem, Anav Katwal, Ayon Dey, Md Tamjidul Hoque, Asuka Shin, Hiroto Shirono, Kosuke Shigematsu, Gaurav Mahesh, Anjana Nanditha, Jiji CV, Akbarali Vakhitov, Sang-Chul Lee, Xinger Li, Chun'an Yu, Junhao Chen, Yang Yang, Gundluri Yuvateja Reddy, Harshitha Palaram, Gejalakshmi N, Jeevitha S, Jiachen Tu, Guoyi Xu, Yaoxin Jiang, Jiajia Liu, Yaokun Shi, Amitabh Tripathi, Modugumudi Mahesh, Santosh Kumar Vipparthi, Subrahmanyam Murala

机构 * University of Bucharest, Romania(布加勒斯特大学,罗马尼亚)

AI总结 本报告介绍了NTIRE 2026 RipDetSeg挑战,旨在通过图像自动识别险滩流。挑战基于RipVIS基准,评估检测与分割性能,数据集覆盖10多个国家,包含4种相机方向和多样的海滩与海况,最终有159名参与者提交了9份有效结果。

Comments Challenge report paper from NTIRE Workshop at CVPR 2026

Journal ref 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09923 2026-04-29 cs.CV

Splatent: Splatting Diffusion Latents for Novel View Synthesis

Splatent: 基于扩散模型的潜在空间光场表示用于新视角合成

Or Hirschorn, Omer Sela, Inbar Huberman-Spiegelglas, Netalee Efrat, Eli Alshan, Ianir Ideses, Frederic Devernay, Yochai Zvik, Lior Fritz

机构 * Amazon Prime Video(亚马逊Prime视频) Tel-Aviv University(特拉维夫大学)

AI总结 Splatent通过多视图注意力机制在2D中恢复细节,提升VAE潜在空间光场重建质量,实现高精度稀疏视角3D重建。

Comments CVPR 2026. Project's webpage at https://orhir.github.io/Splatent/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03043 2026-04-29 cs.CV

OneThinker: All-in-one Reasoning Model for Image and Video

OneThinker:面向图像和视频的统一推理模型

Kaituo Feng, Manyuan Zhang, Hongyu Li, Kaixuan Fan, Shuang Chen, Yilei Jiang, Dian Zheng, Peiwen Sun, Yiyuan Zhang, Haoze Sun, Yan Feng, Peng Pei, Xunliang Cai, Xiangyu Yue

机构 * MMLab, CUHK(CUHK多媒体实验室) Meituan Home(美团家)

AI总结 OneThinker提出一个统一的多模态推理模型,整合图像和视频理解,涵盖问答、描述生成、空间时间定位、跟踪和分割等任务,通过构建大规模训练语料和EMA-GRPO算法提升多任务强化学习效果。

Comments CVPR 2026, Project page: https://github.com/tulerfeng/OneThinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25466 2026-04-29 cs.CV

Generalizable Human Gaussian Splatting via Multi-view Semantic Consistency

基于多视角语义一致性的通用人体高斯点云生成

Jingi Kim, Wonjun Kim

机构 * Konkuk University(韩国 Konkuk 大学)

AI总结 本文提出基于多视角语义一致性的方法,通过预测深度图和跨视角注意力机制,解决多视角输入下人体3D高斯点云定位不一致问题,提升渲染质量。

Comments 10 pages, 8 figures, CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25329 2026-04-29 cs.RO

ProDrive: Proactive Planning for Autonomous Driving via Ego-Environment Co-Evolution

ProDrive:通过自我环境共演实现自动驾驶的前瞻性规划

Chuyao Fu, Shengzhe Gan, Zhuoli Ouyang, Yuhan Rui, Xiaowei Chi, Sirui Han, Jiankun Wang, Hong Zhang

机构 * Southern University of Science and Technology(南方科技大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 ProDrive通过自我环境共演实现自动驾驶前瞻性规划,结合查询导向的轨迹规划器和鸟瞰图世界模型,提升安全性和规划效率。

Comments Accepted to CVPR 2026 GigaBrain Challenge Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25276 2026-04-29 cs.CV

OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding

OmniVTG:一种大规模数据集和开放世界视频时间定位的训练范式

Minghang Zheng, Zihao Yin, Yi Yang, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Central Media Technology Institute, Huawei Technologies Ltd.(华为技术有限公司中央媒体技术研究所) PKU-WUHAN Institute for Artificial Intelligence, Peking University(北京大学武汉人工智能研究所)

AI总结 本文提出OmniVTG数据集和Self-Correction Chain-of-Thought训练范式,通过语义覆盖迭代扩展管道构建大规模数据集,并利用多模态大语言模型的密集描述能力提升视频时间定位性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24893 2026-04-29 cs.CV

Interactive Episodic Memory with User Feedback

具有用户反馈的交互式事件记忆

Nikesh Subedi, Loris Bazzani, Ziad Al-Halah

机构 * University of Utah(犹他大学) University of Verona(威尼斯大学)

AI总结 本文提出EM-QnF任务,通过用户反馈和补充信息提升事件记忆查询的准确性,引入FALM模块实现高效交互式优化,优于现有方法并在现实场景中表现良好。

Comments Accepted to CVPR 2026. Project Page: https://nsubedi11.github.io/refocus

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24885 2026-04-29 cs.CV cs.LG

VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations

VibeToken: 1D图像分词器和自回归模型的扩展以实现动态分辨率生成

Maitreya Patel, Jingtao Li, Weiming Zhuang, Yezhou Yang, Lingjuan Lv

机构 * Arizona State University(亚利桑那州立大学) SonyAI(索尼人工智能)

AI总结 本文提出VibeToken,一种高效的自回归图像合成方法,支持任意分辨率和纵横比,通过动态序列生成实现高效性能平衡。VibeToken-Gen在低计算资源下生成高质量图像,相比传统扩散模型更高效。

Comments Accepted at CVPR'26 | Project Page: https://github.com/SonyResearch/VibeToken

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22990 2026-04-29 cs.CV cs.AI

Hard to See, Hard to Label: Generative and Symbolic Acquisition for Subtle Visual Phenomena

难以察觉,难以标注:生成与符号获取用于微妙的视觉现象

Renjith Prasad, Rishabh Sharma, Andrew E. Shao, Annmary Justine Koomthanam, Shreyas Kulkarni, Suparna Bhattacharya, Martin Foltin, Amit Sheth, David Orozco, Matthew Quinn, Brian Sammuli

机构 * University of South Carolina(南卡罗来纳大学) AI Research Lab, HPE Labs, Hewlett Packard Enterprise(HPE实验室人工智能研究部) Indian AI Research Organization(印度人工智能研究组织) General Atomics(通用原子公司)

AI总结 本文提出GSAL框架,结合生成模型与语义覆盖先验,解决细微视觉异常标注难题,提升稀有类别检索效率。

Comments Accepted at CVPR 2026 SVC Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17492 2026-04-29 cs.CV

MMLANDMARKS: a Cross-View Instance-Level Benchmark for Geo-Spatial Understanding

MMLANDMARKS: 一种用于地理空间理解的跨视图实例级基准

Oskar Kristoffersen, Alba Reinders Sánchez, Morten Rieger Hannemose, Anders Bjorholm Dahl, Dim P. Papadopoulos

机构 * Technical University of Denmark(丹麦技术大学) Pioneer Center for AI(先锋人工智能中心)

AI总结 本文提出MMLandmarks基准,包含四类数据:高分辨率航拍图、地面视图、文本信息和地理坐标,用于跨视图地物检索、定位及文本到图像等任务,揭示多模态数据对地理空间理解的重要性。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00793 2026-04-29 cs.MM cs.SD

Gesture2Music: A Low-Latency Real-Time Framework for Continuous Gesture-Driven Music Generation

Gesture2Music: 一种低延迟的实时框架,用于连续的手势驱动音乐生成

Rathinaraja Jeyaraj, Barathi Subramanian, Kapilya Gangadharan, Anand Paul

机构 * Stanford University(斯坦福大学) Saveetha Institute of Medical and Technical Sciences(Saveetha医学与技术科学学院) LSU Health Sciences Center New Orleans(路易斯安那州立大学健康科学中心新奥尔良分校)

AI总结 本文提出Gesture2Music框架,通过因果时间卷积网络预测音乐控制事件,结合合成流生成策略和时间一致性损失,实现低延迟的实时连续手势驱动音乐生成。

Comments 43rd The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06100 2026-04-29 cs.CV

High-Precision Dichotomous Image Segmentation via Depth Integrity-Prior and Fine-Grained Patch Strategy

通过深度完整性先验和细粒度补丁策略实现高精度二元图像分割

Xianjie Liu, Keren Fu, Qijun Zhao

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) National Key Lab of Fundamental Science on Synthetic Vision, Sichuan University(合成视觉基础科学国家实验室)

AI总结 本文提出PDFNet网络,结合深度完整性先验和细粒度补丁策略,通过融合RGB和伪深度特征提升二元图像分割精度,实现更高效的高精度分割效果。

Journal ref IEEE Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09034 2026-04-29 cs.LG cs.AI

Contrast-Enhanced Gating in GRUs for Robust Low-Data Sequence Learning

GRU中对比增强门控用于鲁棒低数据序列学习

Barathi Subramanian, Rathinaraja Jeyaraj, Anand Paul

机构 * Stanford University(斯坦福大学) LSU Health Sciences Center New Orleans(路易斯安那州立大学健康科学中心新奥尔良分校)

AI总结 本文提出SST激活函数提升GRU门控性能,尤其在低数据场景下表现更优,增强信息过滤能力,提升训练稳定性。

Comments 43rd The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏