arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11871
2603.12845 2026-04-24 cs.CV

Multimodal Protein Language Models for Enzyme Kinetic Parameters: From Substrate Recognition to Conformational Adaptation

多模态蛋白质语言模型用于酶动力学参数:从底物识别到构象适应

Fei Wang, Xinye Zheng, Kun Li, Yanyan Wei, Yuxin Liu, Ganpeng Hu, Tong Bao, Jingwen Yang

机构 * School of Computer Science and Information Engineering(计算机科学与信息工程学院) Institute of Artificial Intelligence(人工智能研究院) CVLab, College of Information Technology(CV实验室,信息学院) Intelligent Interconnected Systems Laboratory of Anhui Province(安徽省智能互联系统实验室) School of Food Biological Engineering(食品生物工程学院)

AI总结 本文提出多阶段多模态条件建模方法,通过ERBA模块在蛋白质语言模型中注入跨模态信息,提升酶动力学参数预测的准确性与生物合理性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02409 2026-04-24 cs.CV

Catalyst: Out-of-Distribution Detection via Elastic Scaling

催化剂:通过弹性缩放进行分布外检测

Abid Hassan, Tuan Ngo, Saad Shafiq, Nenad Medvidovic

机构 * University Southern California(南加州大学)

AI总结 本文提出Catalyst框架,通过利用预池化特征图的原始通道统计信息,改进分布外检测的性能,显著降低误报率。

Comments Accepted at Conference on Computer Vision and Pattern Recognition (CVPR) 2026. arXiv admin note: text overlap with arXiv:2601.22703

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18457 2026-04-24 cs.CV cs.LG

VFM-VAE: Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models

VFM-VAE:视觉基础模型可以作为潜在扩散模型的良好分词器

Tianci Bi, Xiaoyi Zhang, Yan Lu, Nanning Zheng

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文提出VFM-VAE,利用冻结的视觉基础模型作为潜在扩散模型的分词器,通过设计新解码器提升图像重建能力,实现分词器与扩散模型的协同优化,提升训练效率与性能。

Comments Accepted at CVPR 2026. Code and models available at: https://github.com/tianciB/VFM-VAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20358 2026-04-23 cs.CV

ConeSep: Cone-based Robust Noise-Unlearning Compositional Network for Composed Image Retrieval

ConeSep: 基于锥的鲁棒噪声-反学习组合网络用于组合图像检索

Zixu Li, Yupeng Hu, Zhiwei Chen, Mingyu Zhang, Zhiheng Fu, Liqiang Nie

机构 * Shandong University(山东大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 本文针对组合图像检索中噪声三元组对应问题,提出ConeSep网络,解决模态抑制、负锚缺乏和反学习反作用三大挑战,通过几何保真量化、负边界学习和边界基于的目标反学习方法,提升检索性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20336 2026-04-23 cs.CV cs.GR

Stability-Driven Motion Generation for Object-Guided Human-Human Co-Manipulation

面向物体引导的人-人协同操作的稳定性驱动运动生成

Jiahao Xu, Xiaohan Yuan, Xingchen Wu, Chongyang Xu, Kun Li, Buzhen Huang

机构 * Tianjin University(天津大学) National University of Singapore(新加坡国立大学) Sichuan University(四川大学)

AI总结 本文提出一种流匹配框架,通过物体 affordance 和空间配置生成自然且有效的协同操作运动,结合对抗性交互先验和稳定性驱动模拟,提升接触精度和交互稳定性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20291 2026-04-23 cs.CV

Efficient INT8 Single-Image Super-Resolution via Deployment-Aware Quantization and Teacher-Guided Training

高效INT8单图像超分辨率通过部署感知量化和教师引导训练

Pham Phuong Nam Nguyen, Nam Tien Le, Thi Kim Trang Vo, Nhu Tinh Anh Nguyen

机构 * University of Information Technology(信息技术大学) Ho Chi Minh City University of Technology(胡志明市技术大学) Vietnam National University, Ho Chi Minh City(胡志明市国家大学)

AI总结 本文提出一种部署导向的量化单图像超分辨率框架,通过三阶段训练提升质量与效率,在INT8部署下实现29.79dB PSNR和0.8634 SSIM。

Comments 10 pages, 4 figures. Accepted at the Mobile AI (MAI) 2026 Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20286 2026-04-23 cs.CV cs.AI

MambaLiteUNet: Cross-Gated Adaptive Feature Fusion for Robust Skin Lesion Segmentation

MambaLiteUNet: 跨门控自适应特征融合用于稳健的皮肤病变分割

Md Maklachur Rahman, Soon Ki Jung, Tracy Hammond

机构 * Texas A&M University(德克萨斯大学) Kyungpook National University(庆尚国立大学)

AI总结 本文提出MambaLiteUNet,通过整合Mamba状态空间模型与U-Net架构,结合三个关键模块提升局部-全局特征交互和空间细节保留,实现高精度分割。

Comments Accepted at CVPR 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20190 2026-04-23 cs.CV cs.LG

WildFireVQA: A Large-Scale Radiometric Thermal VQA Benchmark for Aerial Wildfire Monitoring

WildFireVQA: 一种大规模的辐射热视觉问答基准用于空中 wildfire 监测

Mobin Habibpour, Niloufar Alipour Talemi, John Spodnik, Camren J. Khoury, Fatemeh Afghah

机构 * Clemson University(克莱姆森大学)

AI总结 本文提出WildFireVQA基准,整合RGB影像与辐射热数据,包含6097个样本及207298个问题,评估多模态推理能力,揭示RGB和检索增强热上下文在 wildfire 监测中的表现差异。

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR-W 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19945 2026-04-23 cs.CV

Visual Reasoning through Tool-supervised Reinforcement Learning

通过工具监督强化学习进行视觉推理

Qihua Dong, Gozde Sahin, Pei Wang, Zhaowei Cai, Robik Shrestha, Hao Yang, Davide Modolo

机构 * Northeastern University(东北大学) Amazon AGI(亚马逊人工智能研究院)

AI总结 本文提出工具监督强化学习框架,通过简单可解释的视觉工具提升多模态大语言模型的复杂视觉推理能力,实验表明其高效且具备强大工具使用能力。

Comments Accepted to CVPR 2026 Findings. 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19839 2026-04-23 cs.CV cs.AI

Environmental Understanding Vision-Language Model for Embodied Agent

面向具身智能体的环境理解视觉-语言模型

Jinsik Bang, Jaeyeon Bae, Donggyu Lee, Siyeol Jung, Taehwan Kim

机构 * UNIST(全南国立大学)

AI总结 本文提出EUEA框架,通过细调四项核心技能提升具身智能体的环境理解能力,结合恢复步骤和GRPO阶段提升任务执行效果,实验显示在ALFRED任务中性能显著优于行为克隆基线。

Comments CVPR Findings 2026, Project Page: https://eu-ea.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19386 2026-04-23 cs.CV

Air-Know: Arbiter-Calibrated Knowledge-Internalizing Robust Network for Composed Image Retrieval

Air-Know: 基于仲裁校准的知识内化鲁棒网络用于组合图像检索

Zhiheng Fu, Yupeng Hu, Qianyun Yang, Shiqi Zhang, Zhiwei Chen, Zixu Li

机构 * Shandong University(山东大学)

AI总结 针对组合图像检索中噪声三元组对应问题,Air-Know提出专家-代理-分流解耦范式,通过外部先验仲裁、专家知识内化和双流协调模块,提升鲁棒性和检索性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08923 2026-04-23 cs.AI

Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs

相同内容,不同答案:多模态大语言模型中的跨模态不一致

Angela van Sprang, Laurens Samson, Ana Lucic, Erman Acar, Sennay Ghebreab, Yuki M. Asano

机构 * University of Amsterdam(阿姆斯特丹大学) City of Amsterdam(阿姆斯特丹市) University of Technology Nuremberg(努尔堡技术大学)

AI总结 本文提出REST和REST+基准测试,评估多模态大语言模型的跨模态不一致性。研究发现,即使在相同语义信息下,不同模态的推理结果也不一致,且OCR错误和视觉特征影响模型性能。

Comments Accepted at CVPR 2026. Angela van Sprang and Laurens Samson contributed equally as first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01233 2026-04-23 cs.CV cs.GR cs.HC

Towards Reliable Human Evaluations in Gesture Generation: Insights from a Community-Driven State-of-the-Art Benchmark

迈向可靠的 gesture 生成人类评估:来自社区驱动的最新基准的见解

Rajmund Nagy, Hendric Voss, Thanh Hoang-Minh, Mihail Tsakov, Teodor Nikolov, Zeyi Zhang, Tenglong Ao, Sicheng Yang, Shaoli Huang, Yongkang Cheng, M. Hamza Mughal, Rishabh Dabral, Kiran Chhatre, Christian Theobalt, Libin Liu, Stefan Kopp, Rachel McDonnell, Michael Neff, Taras Kucherenko, Youngwoo Yoon, Gustav Eje Henter

机构 * KTH Royal Institute of Technology(皇家理工学院) Bielefeld University(比勒菲尔德大学) University of Science – VNUHCM(越南胡志明市国家大学) Independent Researcher(独立研究者) Motorica AB(Motorica AB公司) Peking University(北京大学) Tsinghua University(清华大学) Astribot(Astribot公司) Max-Planck Institute for Informatics, SIC(马克斯·普朗克信息研究所,SIC) Trinity College Dublin(都柏林大学) University of California, Davis(加州大学戴维斯分校) SEED – Electronic Arts(SEED–电子艺界) Electronics and Telecommunications Research Institute (ETRI)(电子电信研究院)

AI总结 本文通过社区驱动的基准测试,揭示了 gesture 生成中人类评估的标准化问题,指出 motion 实际和语音-手势对齐的评估结果存在争议,强调需采用解耦的评估方法以提升基准测试的准确性。

Comments Accepted to CVPR 2026, Findings Track. 23 pages, 10 figures. The last two authors made equal contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23733 2026-04-23 cs.CL cs.CV

AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization

AdaMMS: 为异构多模态大语言模型设计的模型融合方法

Yiyang Du, Xiaochen Wang, Chi Chen, Jiabo Ye, Yiru Wang, Peng Li, Ming Yan, Ji Zhang, Fei Huang, Zhifang Sui, Maosong Sun, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能研究院,清华大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) State Key Laboratory of Multimedia Information Processing, Peking University(多媒体信息处理国家重点实验室,北京大学) School of Software Microelectronics, Peking University(软件微电子学院,北京大学) Institute of Intelligent Computing, Alibaba Group(智能计算研究院,阿里巴巴集团) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) Jiangsu Collaborative Innovation Center for Language Competence, Jiangsu, China(江苏省语言能力协同创新中心,江苏,中国) ModelTC Open Source Organization, Beijing, China(ModelTC开源组织,北京,中国)

AI总结 本文提出AdaMMS,一种针对异构多模态大语言模型的模型融合方法,通过映射、融合和搜索三个步骤解决异构模型融合难题,无需标注数据即可在视觉语言基准测试中超越现有方法。

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20825 2026-04-23 cs.LG cs.AI cs.CV cs.DC eess.SP

FedSIR: Spectral Client Identification and Relabeling for Federated Learning with Noisy Labels

FedSIR: 基于谱分析的客户端识别与重标记在具有噪声标签的联邦学习中

Sina Gholami, Abdulmoneam Ali, Tania Haghighi, Ahmed Arafa, Minhaj Nur Alam

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

AI总结 FedSIR通过谱结构分析客户端特征表示,识别并缓解噪声标签影响,采用多阶段框架提升联邦学习鲁棒性,实验表明其在噪声标签下的性能优于现有方法。

Comments Accepted at the 5th Workshop on Federated Learning for Computer Vision (FedVision), CVPR 2026. Sina Gholami and Abdulmoneam Ali contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20715 2026-04-23 cs.CV

GeoRelight: Learning Joint Geometrical Relighting and Reconstruction with Flexible Multi-Modal Diffusion Transformers

GeoRelight: 基于灵活多模态扩散变换器的联合几何重照明与重建

Yuxuan Xue, Ruofan Liang, Egor Zakharov, Timur Bagautdinov, Chen Cao, Giljoo Nam, Shunsuke Saito, Gerard Pons-Moll, Javier Romero

机构 * Codec Avatars Lab, Meta(Meta编码器动画实验室) University of Tübingen(图宾根大学) Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学院,萨尔兰信息校园)

AI总结 本文提出GeoRelight,通过联合解决几何重建与重照明问题,利用iNOD和混合数据训练方法提升性能,优于传统顺序模型和忽略几何的系统。

Comments CVPR 2026 Highlight; Project page: https://yuxuan-xue.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20570 2026-04-23 cs.CV

Exploring Spatial Intelligence from a Generative Perspective

从生成视角探索空间智能

Muzhi Zhu, Shunyao Jiang, Huanyi Zheng, Zekai Luo, Hao Zhong, Anzhou Li, Kaijun Wang, Jintao Rong, Yang Liu, Hao Chen, Tao Lin, Chunhua Shen

机构 * Zhejiang University(浙江大学) State Key Laboratory of CAD & CG(计算机辅助设计与图形学国家重点实验室) Ant Group(蚂蚁集团) Westlake University(西湖大学) Zhejiang University of Technology(浙江工业大学)

AI总结 本文提出GSI-Bench,首个评估生成空间智能的基准,通过空间 grounded 图像编辑量化空间合规性与编辑保真度,实验表明生成训练可提升空间推理能力。

Comments Accepted by CVPR 2026. Project page: https://aim-uofa.github.io/GSI-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19556 2026-04-22 cs.CV

Paparazzo: Active Mapping of Moving 3D Objects

Paparazzo:移动3D物体的主动映射

Davide Allegro, Shiyao Li, Stefano Ghidoni, Vincent Lepetit

机构 * University of Padova(帕多瓦大学)

AI总结 本文提出Paparazzo方法,通过学习-free方案实现移动3D物体的主动映射,提升3D重建的完整性和准确性,建立新基准测试。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19445 2026-04-22 cs.CV

LoViF 2026 Challenge on Real-World All-in-One Image Restoration: Methods and Results

LoViF 2026挑战:现实世界一站式图像修复方法与结果

Xiang Chen, Hao Li, Jiangxin Dong, Jinshan Pan, Xin Li, Xin He, Naiwei Chen, Shengyuan Li, Fengning Liu, Haoyi Lv, Haowei Peng, Yilian Zhong, Yuxiang Chen, Shibo Yin, Yushun Fang, Xilei Zhu, Yahui Wang, Chen Lu, Kaibin Chen, Xu Zhang, Xuhui Cao, Jiaqi Ma, Ziqi Wang, Shengkai Hu, Yuning Cui, Huan Zhang, Shi Chen, Bin Ren, Lefei Zhang, Guanglu Dong, Qiyao Zhao, Tianheng Zheng, Chunlei Li, Lichao Mou, Chao Ren, Wangzhi Xing, Xin Lu, Enxuan Gu, Jingxi Zhang, Diqi Chen, Qiaosi Yi, Bingcai Wei, Mingyu Liu, Pengyu Wang, Ce Liu, Miaoxin Guan, Boyu Chen, Hongyu Li, Jian Zhu, Xinrui Luo, Ziyang He, Jiayu Wang, Yichen Xiang, Huayi Qi, Haoyu Bian, Yiran Li, Sunlichen Zhou

AI总结 本文综述了LoViF挑战在现实世界一站式图像修复中的方法与结果,分析了多种退化条件下的修复技术,推动了统一修复模型的鲁棒性和泛化能力。

Comments CVPR Workshops 2026; https://lowlevelcv.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19432 2026-04-22 cs.CV

DINO Eats CLIP: Adapting Beyond Knowns for Open-set 3D Object Retrieval

DINO Eats CLIP:超越已知领域进行开放集3D物体检索

Xinwei He, Yansong Zheng, Qianru Han, Zhichuan Wang, Yuxuan Cai, Yang Zhou, Jingbo Xia, Yulong Wang, Jinhai Xiang, Xiang Bai

机构 * Huazhong Agricultural University(华中农业大学) Huazhong University of Science and Technology(华中科技大学) Shenzhen University(深圳大学)

AI总结 本文提出DEC框架,通过动态多视图整合和虚拟特征合成模块,提升开放集3D物体检索的性能,解决已知类别过拟合问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19420 2026-04-22 cs.CV

TESO: Online Tracking of Essential Matrix by Stochastic Optimization

TESO:通过随机优化在线跟踪本质矩阵

Jaroslav Moravec, Radim Šára, Akihiro Sugimoto

机构 * Czech Technical University in Prague(捷克技术大学布拉格) National Institute of Informatics(国家信息研究所)

AI总结 本文提出TESO方法,通过鲁棒损失函数和自适应随机优化实现对本质矩阵的在线跟踪,提升立体视觉精度与一致性,适用于资源受限的在线感知系统。

Comments Accepted at CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19392 2026-04-22 cs.CV

HarmoniDiff-RS: Training-Free Diffusion Harmonization for Satellite Image Composition

HarmoniDiff-RS:无训练扩散谐调用于卫星图像合成

Xiaoqi Zhuang, Jefersson A. Dos Santos, Jungong Han

机构 * The University of Sheffield(谢菲尔德大学) Tsinghua University(清华大学)

AI总结 本文提出HarmoniDiff-RS,一种无训练的扩散框架,用于在不同领域条件下谐调合成卫星图像。通过潜在均值偏移操作对齐源域和目标域,结合时间步的潜在融合策略生成候选合成图像,并利用轻量级和谐分类器选择最一致的结果。

Comments 8 pages, 6 figures, CVPR 2026 findings. Code is available at https://github.com/XiaoqiZhuang/HarmoniDiff-RS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19379 2026-04-22 cs.CV

PanDA: Unsupervised Domain Adaptation for Multimodal 3D Panoptic Segmentation in Autonomous Driving

PanDA: 无监督领域自适应用于自动驾驶中的多模态3D全景分割

Yining Pan, Shijie Li, Yuchen Wu, Xulei Yang, Na Zhao

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Institute for Infocomm Research (I2R), A*STAR, Singapore(新加坡资讯通信研究院(I2R),A*STAR,新加坡)

AI总结 本文提出PanDA框架,针对多模态3D全景分割的无监督领域自适应问题,通过不对称多模态增强和双专家伪标签细化模块提升鲁棒性和伪标签完整性,实验表明在多种领域转移场景下超越现有SOTA方法。

Comments Accepted at the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19369 2026-04-22 cs.CV

IonMorphNet: Generalizable Learning of Ion Image Morphologies for Peak Picking in Mass Spectrometry Imaging

IonMorphNet:质谱成像中离子图像形态的通用学习方法用于峰识别

Philipp Weigand, Niels Nawrot, Nikolas Ebert, Carsten Hopf, Oliver Wasenmüller

机构 * Mannheim University of Applied Sciences(曼海姆应用科学大学) Faculty of Biosciences, Heidelberg University(海德堡大学生物科学学院)

AI总结 IonMorphNet通过空间结构感知的表示模型实现无需任务特定监督的全数据驱动峰识别,提升多数据集性能并应用于肿瘤分类。

Comments This paper has been accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22650 2026-04-22 cs.CV cs.RO

MAGICIAN: Efficient Long-Term Planning with Imagined Gaussians for Active Mapping

MAGICIAN: 通过想象高斯分布实现高效的长期规划用于主动建图

Shiyao Li, Antoine Guédon, Shizhe Chen, Vincent Lepetit

机构 * LIGM, École Nationale des Ponts et Chaussées, IP Paris, Univ Gustave Eiffel, CNRS, France(LIGM,巴黎国立桥梁与道路学院,IP巴黎,格雷夫埃菲尔大学,法国国家科学研究中心,法国) École Polytechnique, France(法国高等理工学院,法国) Inria, École normale supérieure, CNRS, PSL Research University, France(法国国家科学研究中心,巴黎高等师范学院,法国国家信息与自动化技术研究院,法国)

AI总结 MAGICIAN通过想象高斯分布实现高效长期规划,提升主动建图的探索效率与重建完整性,适用于不同动作空间的室内和室外基准测试。

Comments Accepted at CVPR 2026 (Oral). Project webpage: https://shiyao-li.github.io/magician/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20409 2026-04-22 cs.CV cs.LG

CLIPoint3D: Language-Grounded Few-Shot Unsupervised 3D Point Cloud Domain Adaptation

CLIPoint3D: 基于语言的少样本无监督3D点云领域适应

Mainak Singha, Sarthak Mehrotra, Paolo Casari, Subhasis Chaudhuri, Elisa Ricci, Biplab Banerjee

机构 * University of Trento(特伦托大学) MDSR Labs Adobe(Adobe MDSR实验室) IIT Bombay(印度理工学院班加罗尔分校) Fondazione Bruno Kessler(布鲁诺·科斯勒基金会)

AI总结 本文提出CLIPoint3D,首个基于CLIP的3D点云无监督领域适应框架,通过知识驱动的提示调优和熵引导视图采样策略,实现跨领域3D点云适应,实验表明在PointDA-10和GraspNetPC-10基准上性能提升3-16%。

Comments Accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03337 2026-04-22 cs.CV

Less is More: Token-Efficient Video-QA via Adaptive Frame-Pruning and Semantic Graph Integration

少即是多:通过自适应帧剪枝和语义图集成实现高效的视频问答

Shaoguang Wang, Weiyu Guo, Ziyang Chen, Yijie Xu, Xuming Hu, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州)中国) The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科技大学,香港特别行政区,中国)

AI总结 本文提出一种结合自适应帧剪枝和轻量级语义图的框架,有效减少视频问答中输入token数量,提升效率并增强基模型性能。

Comments Accepted to CVPR 2026 Findings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.02296 2026-04-22 cs.CV

Data Leakage Detection and De-duplication in Large Scale Geospatial Image Datasets

大规模遥感图像数据集中的数据泄露检测与去重

Yeshwanth Kumar Adimoolam, Charalambos Poullis, Melinos Averkiou

机构 * CYENS Centre of Excellence(CYENS卓越中心) Concordia University(康科迪亚大学) Cyprus University of Technology(塞浦路斯技术大学)

AI总结 研究分析了三个常用数据集,发现AICrowd Mapping Challenge数据集中90%的训练图像存在重复,验证集有93%的数据泄露,提出数据验证管道以解决这些问题,提升模型可靠性。

Comments 15 pages, 8 figures, 6 tables (Accepted as CVPR 2026 Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19318 2026-04-22 cs.CV

Multi-view Crowd Tracking Transformer with View-Ground Interactions Under Large Real-World Scenes

多视角人群跟踪变压器与视图-地面交互在大场景中的应用

Qi Zhang, Jixuan Chen, Kaiyi Zhang, Xinquan Yu, Antoni B. Chan, Hui Huang

机构 * College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院,中国) Department of Computer Science, City University of Hong Kong, China(香港城市大学计算机科学系,中国)

AI总结 本文提出MVTrackTrans模型,通过相机视角与地面平面的交互提升多视角人群跟踪性能,并构建了两个大规模真实世界数据集,验证了模型在大场景下的优势。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19257 2026-04-22 cs.CV

Unposed-to-3D: Learning Simulation-Ready Vehicles from Real-World Images

未置姿到3D:从真实世界图像学习仿真准备的车辆

Hongyuan Liu, Bochao Zou, Qiankun Liu, Haochen Yu, Qi Mei, Jianfei Jiang, Chen Liu, Cheng Bi, Zhao Wang, Xueyang Zhang, Yifei Zhan, Jiansheng Chen, Huimin Ma

机构 * University of Science and Technology Beijing(北京科技大学) Li Auto Inc(利汽车公司)

AI总结 本文提出Unposed-to-3D框架,通过图像-only监督从真实驾驶图像重建3D车辆,解决现有方法在真实世界分布上的领域差距问题,实现姿态一致且符合仿真的3D模型生成。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏