arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11876
2604.09473 2026-04-13 cs.CV

Realizing Immersive Volumetric Video: A Multimodal Framework for 6-DoF VR Engagement

实现沉浸式体积分量视频:一种多模态框架用于6自由度VR互动

Zhengxian Yang, Shengqi Wang, Shi Pan, Hongshuai Li, Haoxiang Wang, Lin Li, Guanjun Li, Zhengqi Wen, Borong Lin, Jianhua Tao, Tao Yu

机构 * Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Migu Beijing Research Institute(咪咕北京研究院) School of Architecture, Tsinghua University(清华大学建筑学院) Department of Automation, Tsinghua University(清华大学自动化系) BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心)

AI总结 本文提出了一种多模态框架,用于构建沉浸式体积分量视频,通过多视角多模态数据集和动态光场重建框架,实现高分辨率、高帧率的动态内容,支持6自由度VR交互。

Comments Journal extension of CVPR 2025. See also arXiv:2503.14359 . Project page and code: https://github.com/Metaverse-AI-Lab-THU/ImViD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09425 2026-04-13 cs.CV

Do Vision Language Models Need to Process Image Tokens?

视觉语言模型是否需要处理图像标记?

Sambit Ghosh, R. Venkatesh Babu, Chirag Agarwal

机构 * IBM Indian Institute of Science(印度科学研究所) University of Virginia(弗吉尼亚大学)

AI总结 本文研究了视觉语言模型中图像标记的功能,发现视觉表示快速收敛至有限复杂度,而文本表示持续重构。视觉表示在不同层间可互换,任务依赖性影响视觉处理的必要性。

Comments Accepted (Oral) at TRUE-V Workshop CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09415 2026-04-13 cs.CV cs.AI cs.LG cs.RO

PhysInOne: Visual Physics Learning and Reasoning in One Suite

PhysInOne:一套视觉物理学习与推理系统

Siyuan Zhou, Hejun Wang, Hu Cheng, Jinxi Li, Dongsheng Wang, Junwei Jiang, Yixiao Jin, Jiayue Huang, Shiwei Mao, Shangjia Liu, Yafei Yang, Hongkang Song, Shenxing Wei, Zihui Zhang, Peng Huang, Shijie Liu, Zhengli Hao, Hao Li, Yitian Li, Wenqi Zhou, Zhihan Zhao, Zongqi He, Hongtao Wen, Shouwang Huang, Peng Yun, Bowen Cheng, Pok Kazaf Fu, Wai Kit Lai, Jiahao Chen, Kaiyuan Wang, Zhixuan Sun, Ziqi Li, Haochen Hu, Di Zhang, Chun Ho Yuen, Bing Wang, Zhihua Wang, Chuhang Zou, Bo Yang

机构 * vLAR Group(vLAR 研究组) The Hong Kong Polytechnic University(香港理工大学) Syai Singapore(Syai 新加坡) Meta

AI总结 PhysInOne通过大规模合成数据提升AI系统对物理现象的理解,包含200万视频和15万动态3D场景,涵盖71种基本物理现象,用于物理感知视频生成、未来帧预测、物理属性估计和运动转移等应用。

Comments CVPR 2026. Siyuan, Hejun, Hu, Jinxi, Dongsheng, Junwei, Yixiao, Jiayue, and Shiwei are co-first authors. Project page: https://vlar-group.github.io/PhysInOne.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06869 2026-04-13 cs.CV cs.AI

VSI: Visual Subtitle Integration for Keyframe Selection to enhance Long Video Understanding

VSI:视觉字幕整合用于关键帧选择以增强长视频理解

Jianxiang He, Meisheng Hong, Jungang Li, Weiyu Guo, Xuming Hu, Hui Xiong

机构 * AI Thrust, HKUST(GZ)(香港科技大学(广州)) Shandong University(山东大学)

AI总结 VSI通过融合视觉与文本信息提升长视频关键帧检索精度,实现在文本相关任务中的突破性表现。

Comments Accepted to CVPR 2026 Findings, 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06656 2026-04-13 cs.CV

ClusterMark: Towards Robust Watermarking for Autoregressive Image Generators with Visual Token Clustering

ClusterMark:面向自回归图像生成器的鲁棒水印技术:基于视觉token聚类

Denis Lukovnikov, Andreas Müller, Erwin Quiring, Asja Fischer

机构 * Ruhr University Bochum(波鸿鲁尔大学) _fbeta

AI总结 本文提出ClusterMark,通过视觉token聚类提升自回归图像生成器的水印鲁棒性,有效对抗图像扰动和再生攻击,同时保持图像质量,优于现有基线方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04676 2026-04-13 cs.CV cs.AI cs.LG cs.MA

Gen-n-Val: Agentic Image Data Generation and Validation

Gen-n-Val:代理图像数据生成与验证

Jing-En Huang, I-Sheng Fang, Tzuhsuan Huang, Yu-Lun Liu, Chih-Yu Wang, Jun-Cheng Chen

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Research Center for Information Technology Innovation, Academia Sinica(中央研究院资讯科技创新研究中心)

AI总结 针对计算机视觉任务中数据稀缺、标签噪声和长尾类别不平衡问题,Gen-n-Val引入基于Layer Diffusion和大语言模型的代理生成框架,有效提升实例分割和目标检测的合成数据质量与性能。

Comments Accepted to the CVPR 2026 Findings track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09206 2026-04-13 cs.CV

Long-SCOPE: Fully Sparse Long-Range Cooperative 3D Perception

Long-SCOPE:完全稀疏的长距离协作3D感知

Jiahao Wang, Zikun Xu, Yuner Zhang, Zhongwei Jiang, Chenyang Lu, Shuocheng Yang, Yuxuan Wang, Jiaru Zhong, Chuang Zhang, Shaobing Xu, Jianqiang Wang

机构 * Tsinghua University(清华大学) University of Pennsylvania(宾夕法尼亚大学) Nanyang Technological University(南洋理工大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出Long-SCOPE框架,通过几何引导查询生成模块和上下文感知关联模块,解决远距离协作3D感知中的计算复杂性和特征关联问题,实现高精度低开销的长距离感知。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09199 2026-04-13 cs.CV

Globally Optimal Pose from Orthographic Silhouettes

从正交轮廓确定全局最优姿态

Agniva Sengupta, Dilara Kuş, Jianning Li, Stefan Zachow

机构 * Freie Universität Berlin(柏林自由大学) Zuse Institute Berlin(柏林祖斯研究所)

AI总结 本文提出利用轮廓面积连续性特性,通过预计算的轮廓签名响应面实现全局最优姿态估计,无需对应关系,适用于任意形状。

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2026. Denver, Colorado

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09101 2026-04-13 cs.CR cs.AI cs.CV cs.LG

CLIP-Inspector: Model-Level Backdoor Detection for Prompt-Tuned CLIP via OOD Trigger Inversion

CLIP-Inspector:通过OoD触发器反向工程实现提示调优CLIP的模型级后门检测

Akshit Jindal, Saket Anand, Chetan Arora, Vikram Goyal

机构 * IIIT Delhi(印度德里国际信息技术学院) IIT Delhi(印度德里理工学院)

AI总结 针对提示调优CLIP模型中潜在的后门攻击,CLIP-Inspector通过OoD触发器反向工程实现模型级后门检测,利用白盒访问和未标记OoD图像重建可能触发器,验证模型安全性并修复后门效果。

Comments 17 pages (8 main + 2 references + 7 supplementary), Accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09076 2026-04-13 cs.CV

Cross-Modal Knowledge Distillation from Spatial Transcriptomics to Histology

从空间转录组到组织学的跨模态知识蒸馏

Arbel Hizmi, Artemii Bakulin, Shai Bagon, Nir Yosef

机构 * Weizmann Institute of Science(魏茨曼科学研究所) Reichman University(赖希曼大学)

AI总结 本文提出利用空间转录组与H&E数据进行跨模态蒸馏,将转录组学的 niches 结构转移到仅依赖组织学的模型中,提升与转录组学 niches 结构的一致性,并通过细胞类型分析验证生物意义的邻近组成。

Comments Accepted to the CVMI Workshop at CVPR 2026. Project page: https://cross-modal-distillation.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08966 2026-04-13 cs.CV

How Should Video LLMs Output Time? An Analysis of Efficient Temporal Grounding Paradigms

视频大语言模型应如何输出时间?对高效时间接地范式的分析

Shengji Jin, Yuanhao Zou, Victor Zhu, Zhengping Ji, Chen Chen

机构 * The University of Central Florida(中佛罗里达大学) Axon(Axon公司)

AI总结 本文对比三种主流视频时间接地范式,探讨输出设计对精度与效率的影响,发现连续分布范式在效率-精度权衡中表现最佳。

Comments CVPR 2026 Workshop Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08956 2026-04-13 cs.CV cs.LG

Low-Data Supervised Adaptation Outperforms Prompting for Cloud Segmentation Under Domain Shift

低数据监督适应在云分割领域优于提示

Harshith Kethavath, Weiming Hu

机构 * University of Georgia(佐治亚大学)

AI总结 本文研究了在遥感影像云分割任务中,低数据监督微调优于提示方法,发现使用少量标注数据可显著提升性能,而提示方法效果有限。

Comments 10 pages, 6 figures, to be published in EarthVision @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08924 2026-04-13 cs.CV

Customized Fusion: A Closed-Loop Dynamic Network for Adaptive Multi-Task-Aware Infrared-Visible Image Fusion

定制融合:一种闭环动态网络用于自适应多任务感知红外-可见图像融合

Zengyi Yang, Yu Liu, Juan Cheng, Zhiqin Zhu, Yafei Zhang, Huafeng Li

AI总结 本文提出闭环动态网络CLDyN,通过需求驱动语义补偿模块实现多任务自适应的图像融合,实验表明其在保持高质量融合的同时具备强多任务适应性。

Comments This paper has been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08922 2026-04-13 cs.CV

Degradation-Robust Fusion: An Efficient Degradation-Aware Diffusion Framework for Multimodal Image Fusion in Arbitrary Degradation Scenarios

抗退化融合:一种高效的抗退化扩散框架,用于任意退化场景下的多模态图像融合

Yu Shi, Yu Liu, Zhong-Cheng Wu, Juan Cheng, Huafeng Li, Xun Chen

机构 * Department of Biomedical Engineering, Hefei University of Technology(合肥工业大学生物医学工程系) Faculty of Information Engineering and Automation, Kunming University of Science and Technology(昆明理工大学信息工程与自动化学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院)

AI总结 本文提出一种高效的抗退化扩散框架,用于处理多模态图像融合中的复杂退化场景。该框架通过隐式去噪和联合观测模型校正机制,提升了在复杂退化下的融合性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08896 2026-04-13 cs.CV

GeoMMBench and GeoMMAgent: Toward Expert-Level Multimodal Intelligence in Geoscience and Remote Sensing

GeoMMBench 和 GeoMMAgent:迈向地质科学和遥感领域的专家级多模态智能

Aoran Xiao, Shihao Cheng, Yonghao Xu, Yexian Ren, Hongruixuan Chen, Naoto Yokoya

机构 * RIKEN AIP(日本理化学研究所革新智能研究中心) Wuhan University(武汉大学) Linköping University(林雪平大学) University of Tokyo(东京大学) Nanjing University of Information Science and Technology(南京信息工程大学)

AI总结 本文提出 GeoMMBench 和 GeoMMAgent,通过综合多模态问答基准和多智能体框架,解决地质科学和遥感领域知识广、传感器异构、任务碎片化等挑战,提升专家级空间解释能力。

Comments CVPR 2026 Highlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08846 2026-04-13 cs.LG cs.AI cs.CL cs.CV

Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs

字典对齐的概念控制用于保护多模态大语言模型

Jinqi Luo, Jinyu Yang, Tal Neiman, Lei Fan, Bing Yin, Son Tran, Mubarak Shah, René Vidal

机构 * University of Pennsylvania(宾夕法尼亚大学) Amazon(亚马逊) University of Central Florida(中佛罗里达大学)

AI总结 本文提出字典对齐的概念控制框架,通过定制概念字典和稀疏自编码器实现对多模态大语言模型激活的精细控制,提升安全性的同时保持通用能力。

Comments Accepted in CVPR 2026. Project page: https://peterljq.github.io/project/daco

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08836 2026-04-13 cs.CV

CatalogStitch: Dimension-Aware and Occlusion-Preserving Object Compositing for Catalog Image Generation

CatalogStitch: 一种面向目录图像生成的维度感知和遮挡保留物体合成方法

Sanyam Jain, Pragya Kandari, Manit Singhal, He Zhang, Soo Ye Kim

机构 * Adobe

AI总结 CatalogStitch通过自动化修正遮挡元素和适应不同尺寸的产品,简化了目录图像生成流程,提升生成效率和质量。

Comments CVPR 2026 HiGen Workshop. Project page, https://catalogstitch.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08645 2026-04-13 cs.CV cs.AI cs.LG cs.RO

3D-VCD: Hallucination Mitigation in 3D-LLM Embodied Agents through Visual Contrastive Decoding

3D-VCD:通过视觉对比解码缓解3D-LLM具身代理中的幻觉

Makanjuola Ogunleye, Eman Abdelrahman, Ismini Lourentzou

机构 * Virginia Tech(弗吉尼亚理工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出3D-VCD,一种用于缓解3D具身代理幻觉的视觉对比解码框架,通过构造扭曲的3D场景图来提升 grounded 推理能力,实验表明其在3D-POPE和HEAL基准上有效。

Comments 8 pages, 6 figures, Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08627 2026-04-13 cs.LG cs.AI

Evidential Transformation Network: Turning Pretrained Models into Evidential Models for Post-hoc Uncertainty Estimation

证据转换网络:将预训练模型转换为证据模型以进行事后不确定性估计

Yongchan Chun, Chanhee Park, Jeongho Yoon, Jaehyung Seo, Heuiseok Lim

机构 * Korea University(高丽大学) Konkuk University(建国大学)

AI总结 本文提出ETN,一种轻量级模块,将预训练模型转换为证据模型,以提升不确定性估计,同时保持精度并增加极小计算开销。

Comments Accepted to CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08617 2026-04-13 cs.LG cs.AI cs.CV

From Selection to Scheduling: Federated Geometry-Aware Correction Makes Exemplar Replay Work Better under Continual Dynamic Heterogeneity

从选择到调度:联邦几何感知修正使示例回放在持续动态异质性下表现更佳

Zhuang Qi, Ying-Peng Tang, Lei Meng, Guoqing Chao, Lei Wu, Han Yu, Xiangxu Meng

机构 * School of Software, Shandong University(山东大学软件学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)

AI总结 本文提出FEAT方法,通过几何结构对齐模块和能量基几何修正模块,解决联邦持续学习中示例回放在持续动态异质性下的性能问题。

Comments CVPR 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04161 2026-04-13 cs.RO

Adaptive Action Chunking at Inference-time for Vision-Language-Action Models

推理时的自适应动作分块

Yuanchang Liang, Xiaobo Wang, Kai Wang, Shuo Wang, Xiaojiang Peng, Haoyu Chen, David Kim Huat Chua, Prahlad Vadakkepat

机构 * National University of Singapore(新加坡国立大学) Shenzhen University of Advanced Technology(深圳理工大学) Sangfor Technologies Inc.(深信服科技股份有限公司) Mininglamp Technology(明略科技) Shenzhen Technology University(深圳技术大学) City University of Hong Kong(香港城市大学)

AI总结 本文提出自适应动作分块策略,通过动作熵动态调整分块大小,提升机器人操作的反应与一致性。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27817 2026-04-13 cs.CV cs.AI cs.CR

Towards Context-Aware Image Anonymization with Multi-Agent Reasoning

面向多智能体推理的上下文感知图像匿名化

Robert Aufschläger, Jakob Folz, Gautam Savaliya, Manjitha D Vidanalage, Michael Heigl, Martin Schramm

机构 * Deggendorf Institute of Technology(代根多夫应用技术大学)

AI总结 本文提出CAIAMAR框架,通过多智能体推理和扩散匿名化技术,实现上下文感知的PII分割,减少重识别风险并提升图像质量。

Comments Accepted to IEEE CVPR 2026 GRAIL-V Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18561 2026-04-13 cs.CV cs.LG

CausalVAD: De-confounding End-to-End Autonomous Driving via Causal Intervention

CausalVAD:通过因果干预实现端到端自动驾驶的去混淆

Jiacheng Tang, Zhiyuan Zhou, Zhuolin He, Jia Zhang, Kai Zhang, Jian Pu

机构 * Fudan University(复旦大学) Embodiq Robotics Co., Ltd. Beijing Institute of Technology(北京理工大学) East China Normal University(华东师范大学)

AI总结 本文提出CausalVAD框架,通过因果干预解决端到端自动驾驶中统计相关性与真实因果关系的矛盾,提升规划精度与安全性。

Comments Accepted to CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11795 2026-04-13 cs.CV

Intrinsic Concept Extraction Based on Compositional Interpretability

基于组合可解释性的内在概念提取

Hanyu Shi, Hong Tao, Guoheng Huang, Jianbin Jiang, Xuhang Chen, Chi-Man Pun, Shanhu Wang, Pan Pan

机构 * Guangdong University of Technology(广东工业大学) VIPSHOP(唯品会) Huizhou University(惠州学院) University of Macau(澳门大学)

AI总结 本文提出CI-ICE任务,利用扩散模型提取可组合的物体和属性概念,通过超表达方法实现概念解耦与可组合性,提升单图内在概念提取性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19396 2026-04-13 cs.AI

EchoTrail-GUI: Building Actionable Memory for GUI Agents via Critic-Guided Self-Exploration

EchoTrail-GUI: 通过批评者引导的自我探索构建可操作的记忆以改进GUI代理

Runze Li, Yuwen Zhai, Bo Xu, LiWu Xu, Nian Shi, Wei Zhang, Ran Lin, Liang Wang

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团) East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出EchoTrail-GUI框架,通过动态记忆系统提升GUI代理任务成功率和效率,验证了结构化记忆在GUI自动化中的有效性。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07833 2026-04-13 cs.CV cs.AI cs.LG

Relational Visual Similarity

关系视觉相似性

Thao Nguyen, Sicheng Mo, Krishna Kumar Singh, Yilin Wang, Jing Shi, Nicholas Kolkin, Eli Shechtman, Yong Jae Lee, Yuheng Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Adobe Research(Adobe研究院)

AI总结 本文提出通过关系相似性而非视觉属性来衡量图像相似性,构建了首个基于关系逻辑的图像表示空间,揭示了现有视觉模型在捕捉关系相似性方面的不足。

Comments CVPR 2026 camera-ready; Project page, data, and code: https://thaoshibe.github.io/relsim

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02826 2026-04-13 cs.LG cs.AI

From Navigation to Refinement: Revealing the Two-Stage Nature of Flow-based Diffusion Models through Oracle Velocity

从导航到细化:通过Oracle速度揭示基于流的扩散模型的两阶段本质

Haoming Liu, Jinnuo Liu, Yanhao Li, Liuyang Bai, Yunkai Ji, Yuanhe Guo, Shenji Wan, Hongyi Wen

机构 * Center for Data Science, New York University Shanghai(上海纽约大学数据科学中心) New York University(纽约大学)

AI总结 本文通过分析基于流的扩散模型的边际速度场,揭示其两阶段训练目标,解释了模型在早期阶段的全局布局生成和后期阶段的细节记忆行为,为模型设计和算法改进提供了指导。

Comments Accepted to CVPR 2026 (Findings track); 16 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02231 2026-04-13 cs.CV cs.AI cs.LG

See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models

看见、听见与理解:多模态大语言模型中人类语音理解基准测试

Le Thien Phuc Nguyen, Zhuoran Yu, Samuel Low Yu Hang, Subin An, Jeongik Lee, Yohan Ban, SeungEun Chung, Thanh-Huy Nguyen, JuWan Maeng, Soochahn Lee, Yong Jae Lee

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Kookmin University(国民大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出AV-SpeakerBench基准测试,通过3212道多选题评估多模态大语言模型在真实视频中对语音的细粒度理解能力,发现Gemini 2.5 Pro在音频视觉融合方面表现最佳。

Comments Findings of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23369 2026-04-13 cs.CV cs.RO

SimScale: Learning to Drive via Real-World Simulation at Scale

SimScale:通过大规模真实世界模拟学习驾驶

Haochen Tian, Tianyu Li, Haochen Liu, Jiazhi Yang, Yihang Qiu, Guang Li, Junli Wang, Yinfeng Gao, Zhang Zhang, Liang Wang, Hangjun Ye, Tieniu Tan, Long Chen, Hongyang Li

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室) OpenDriveLab at The University of Hong Kong(香港大学OpenDriveLab) Xiaomi EV(小米汽车)

AI总结 本文提出SimScale框架,通过合成大规模未见状态提升自动驾驶鲁棒性和泛化能力,实验显示在navhard和navtest上分别提升8.6和2.9 EPDMS。

Comments CVPR 2026 Oral. Project page: https://opendrivelab.com/SimScale

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20068 2026-04-13 cs.CV

PRADA: Probability-Ratio-Based Attribution and Detection of Autoregressive-Generated Images

PRADA:基于概率比的自回归生成图像归因与检测

Simon Damm, Jonas Ricker, Henning Petzka, Asja Fischer

机构 * Ruhr University Bochum(波鸿鲁尔大学)

AI总结 本文提出PRADA方法,通过分析自回归生成图像的概率比特征,实现对生成图像的可靠检测和归因,适用于多种图像生成模型。

Comments 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition - Findings Track (CVPRF 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏