arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-03-03 至 2026-03-03 共收录 44
2603.00595 2026-03-03 cs.CV

UNICBench: UNIfied Counting Benchmark for MLLM

UNICBench: 多模态多层级计数基准与评估工具包

Chenggang Rong, Tao Han, Zhiyuan Zhao, Yaowu Fan, Jia Wan, Song Guo, Yuan Yuan, Junyu Gao

机构 * Northwestern Polytechnical University(北华大学) Hong Kong University of Science and Technology(香港科技大学) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所) Sun Yat-sen University(中山大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 UNICBench是一个统一的多模态计数基准,通过准确的地面真实值和分层报告,评估45种最先进的MLLMs在图像、文本和音频计数任务上的性能,揭示了模型在推理和难分支上的不足。

Comments This paper has been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00550 2026-03-03 cs.CV

Weakly Supervised Video Anomaly Detection with Anomaly-Connected Components and Intention Reasoning

弱监督视频异常检测与异常连接组件及意图推理

Yu Wang, Shengjie Zhao

机构 * School of Computer Science and Technology, Tongji University, Shanghai, China(计算机科学与技术学院,同济大学,上海,中国)

AI总结 本文提出LAS-VAD框架,通过异常连接组件和意图推理机制,提升弱监督视频异常检测的性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00526 2026-03-03 cs.CV

Mesh-Pro: Asynchronous Advantage-guided Ranking Preference Optimization for Artist-style Quadrilateral Mesh Generation

Mesh-Pro: 异步优势引导的排名偏好优化用于艺术家风格的四边形网格生成

Zhen Zhou, Jian Liu, Biwen Lei, Jing Xu, Haohan Weng, Yiling Zhu, Zhuo Chen, Junfeng Fan, Yunkai Ma, Dazhao Du, Song Guo, Fengshui Jing, Chunchao Guo

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tencent Hunyuan(腾讯文元) Hong Kong University of Science and Technology(香港科技大学)

AI总结 Mesh-Pro通过异步优势引导的排名偏好优化提升3D网格生成的训练效率和生成质量,引入了新的标记化和奖励机制,实现了艺术家风格网格的先进性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00483 2026-03-03 cs.CV cs.AI

RAISE: Requirement-Adaptive Evolutionary Refinement for Training-Free Text-to-Image Alignment

RAISE:基于需求的进化精炼用于无训练文本到图像对齐

Liyao Jiang, Ruichen Chen, Chao Gao, Di Niu

机构 * Department of ECE, University of Alberta, Canada(阿尔伯塔大学电子工程系) Huawei Technologies, Canada(华为技术有限公司)

AI总结 RAISE是一种无训练、需求驱动的进化框架,通过动态调整生成过程实现高效且通用的文本到图像对齐。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00412 2026-03-03 cs.CV

PointAlign: Feature-Level Alignment Regularization for 3D Vision-Language Models

PointAlign:用于3D视觉-语言模型的特征级对齐正则化

Yuanhao Su, Shaofeng Zhang, Xiaosong Jia, Qi Fan

机构 * University of Science and Technology of China(中国科学技术大学) Fuzhou University(福州大学) Fudan University(复旦大学) Nanjing University(南京大学)

AI总结 PointAlign通过特征级对齐正则化提升3D视觉-语言模型的几何信息保留与任务性能

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00324 2026-03-03 cs.CV

Proof-of-Perception: Certified Tool-Using Multimodal Reasoning with Compositional Conformal Guarantees

证明-感知:具有组合性符合保证的认证工具使用多模态推理

Arya Fayyazi, Haleh Akrami

机构 * University of Southern California(南加州大学) Nuro

AI总结 Proof-of-Perception通过组合性符合保证实现多模态推理的可信工具使用,提升性能和可靠性,同时更高效地利用计算资源。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21333 2026-03-03 cs.CV

HorizonForge: Driving Scene Editing with Any Trajectories and Any Vehicles

HorizonForge: 通过任意轨迹和任意车辆驱动场景编辑

Yifan Wang, Francesco Pittaluga, Zaid Tasneem, Chenyu You, Manmohan Chandraker, Ziyu Jiang

机构 * NEC Labs America(NEC美国实验室) Stony Brook University(石溪大学) UC San Diego(圣地亚哥大学)

AI总结 HorizonForge通过任意轨迹和车辆实现驾驶场景的可控编辑,利用高斯溅射体和网格表示,结合视频扩散技术,提升生成场景的真实性和可控性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21029 2026-03-03 cs.LG

FORCE: Transferable Visual Jailbreaking Attacks via Feature Over-Reliance CorrEction

FORCE:通过特征过度依赖校正实现可转移的视觉劫持攻击

Runqi Lin, Alasdair Paren, Suqin Yuan, Muyang Li, Philip Torr, Adel Bibi, Tongliang Liu

机构 * Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) Department of Engineering Science, University of Oxford(工程科学系,牛津大学)

AI总结 FORCE方法通过校正特征过度依赖,提升视觉劫持攻击的跨模型可转移性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06719 2026-03-03 cs.CV cs.AI

Improving Wildlife Out-of-Distribution Detection: Africas Big Five

提升野生动物分布外检测:非洲五大动物

Mufhumudzi Muthivhi, Jiahao Huo, Fredrik Gustafsson, Terence L. van Zyl

机构 * Institute for Artificial Intelligent Systems(人工智能系统研究所) University of Johannesburg(约翰内斯堡大学) Department of Electrical Engineering(电气工程系) Linköping University(利马大学)

AI总结 本研究通过改进的NCM和对比学习方法,提升对非洲五大动物的分布外检测性能,实现AUPR-IN、AUPR-OUT和AUTC指标的显著提升。

Comments Presented at the CV4Animals Workshop at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025

Journal ref CVPR 2025 Workshop on Computer Vision for Animal Behavior Tracking and Modeling (CV4Animals)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17132 2026-03-03 cs.CV cs.CL

Dynamic Token Reweighting for Robust Vision-Language Models

动态令牌重加权用于鲁棒的视觉-语言模型

Tanqiu Jiang, Jiacheng Liang, Rongyi Zhu, Jiawei Zhou, Fenglong Ma, Ting Wang

机构 * Stony Brook University(石溪大学) Pennsylvania State University(宾夕法尼亚州立大学)

AI总结 DTR通过优化KV缓存动态调整视觉令牌权重,提升视觉-语言模型对多模态劫持攻击的鲁棒性,同时保持模型性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02825 2026-03-03 cs.CV

Towards Application-Specific Evaluation of Vision Models: Case Studies in Ecology and Biology

面向应用的视觉模型评估:生态与生物学中的案例研究

Alex Hoi Hang Chan, Otto Brookes, Urs Waldmann, Hemal Naik, Iain D. Couzin, Majid Mirmehdi, Noël Adiko Houa, Emmanuelle Normand, Christophe Boesch, Lukas Boesch, Mimi Arandjelovic, Hjalmar Kühl, Tilo Burghardt, Fumihiro Kano

机构 * Centre for the Advanced Study of Collective Behaviour, University of Konstanz(康斯坦茨大学集体行为高级研究所以及大学) Department of Collective Behavior, Max Planck Institute of Animal Behavior(动物行为马克斯·普朗克研究所集体行为系) Department of Biology, University of Konstanz(康斯坦茨大学生物学系) School of Computer Science, University of Bristol(布里斯托大学计算机科学学院) Wild Chimpanzee Foundation(野生 chimpanzee 基金会) Department of Computer and Information Science, University of Konstanz(康斯坦茨大学计算机与信息科学系) Department of Ecology of Animal Societies, Max Planck Institute of Animal Behavior(动物行为马克斯·普朗克研究所动物社会生态学系) Senckenberg Museum of Natural History Goerlitz(戈尔茨自然史塞肯贝格博物馆) Max Planck Institute for Evolutionary Anthropology(进化人类学马克斯·普朗克研究所)

AI总结 本文提出通过应用特定指标评估视觉模型在生态与生物学中的实际效果,通过两个案例研究展示模型性能对下游分析的影响。

Comments Accepted at CVPR Workshops, CV4Animals 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.06373 2026-03-03 cs.CV

Towards Accurate One-Stage Object Detection with AP-Loss

通过AP损失实现更准确的一阶段目标检测

Kean Chen, Jianguo Li, Weiyao Lin, John See, Ji Wang, Lingyu Duan, Zhibo Chen, Changwei He, Junni Zou

AI总结 本文提出通过AP损失优化一阶段目标检测器,解决分类损失的不平衡问题,提升检测性能。

Comments 13 pages, 7 figures, 4 tables, main paper + supplementary material, accepted to CVPR 2019

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00207 2026-03-03 cs.CV cs.AI

VisRef: Visual Refocusing while Thinking Improves Test-Time Scaling in Multi-Modal Large Reasoning Models

VisRef: 通过思考进行视觉再聚焦以提高多模态大推理模型的测试时间扩展

Soumya Suvra Ghosal, Youngeun Kim, Zhuowei Li, Ritwick Chaudhry, Linghan Xu, Hongjing Zhang, Jakub Zablocki, Yifan Xing, Qin Zhang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Amazon(亚马逊) Physion Labs(Physion实验室)

AI总结 VisRef通过视觉再聚焦提升多模态大推理模型测试时间扩展性能,有效解决视觉依赖任务中推理性能下降问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00149 2026-03-03 cs.CV cs.AI

Physics-Consistent Diffusion for Efficient Fluid Super-Resolution via Multiscale Residual Correction

基于多尺度残差校正的物理一致扩散用于高效流体超分辨率

Zhihao Li, Shengwei Dong, Chuang Yi, Junxuan Gao, Zhilu Lai, Zhiqiang Liu, Wei Wang, Guangtao Zhang

AI总结 ReMD通过多网格残差校正和多小波多尺度建模实现高效流体超分辨率,提升精度和频谱保真度,减少发散并降低采样步骤。

Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏