arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-03-24 至 2026-03-24 共收录 70
2603.21295 2026-03-24 cs.CV

Text-Image Conditioned 3D Generation

文本-图像条件的3D生成

Jiazhong Cen, Jiemin Fang, Sikuang Li, Guanjun Wu, Chen Yang, Taoran Yi, Zanwei Zhou, Zhikuan Bao, Lingxi Xie, Wei Shen, Qi Tian

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能大模型重点实验室、人工智能学院、计算机科学学院、上海交通大学) Huawei Inc.(华为公司) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出结合文本和图像条件的3D生成方法,通过跨模态互补性提升生成质量,引入TIGON模型实现高效融合。

Comments CVPR 2026. Project page: https://jumpat.github.io/tigon-page Code: https://github.com/Jumpat/tigon

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21229 2026-03-24 cs.CV

Plant Taxonomy Meets Plant Counting: A Fine-Grained, Taxonomic Dataset for Counting Hundreds of Plant Species

植物分类与植物计数:一个细粒度、分类学数据集,用于计数数百种植物物种

Jinyu Xu, Tianqi Hu, Xiaonan Hu, Letian Zhou, Songliang Cao, Meng Zhang, Hao Lu

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出TPC-268数据集,用于细粒度、分类学-aware的植物计数,包含10,000张图像和678,050个点注释,涵盖268种可计数的植物类别,推动了细粒度类无关计数的发展。

Comments Accepted by CVPR 2026. Project page: https://github.com/tiny-smart/TPC-268

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21217 2026-03-24 cs.CV

Reframing Long-Tailed Learning via Loss Landscape Geometry

通过损失景观几何重新框架长尾学习

Shenghan Chen, Yiming Liu, Yanzhen Wang, Yujia Wang, Xiankai Lu

机构 * Shandong University(山东大学) Zhejiang Sci-Tech University(浙江科技学院)

AI总结 本文提出通过损失景观视角解决长尾数据分布性能权衡问题,引入分组知识保持模块和分组尖锐度感知模块,促进共享解决方案,提升长尾类性能。

Comments Accepted to CVPR 2026. 11 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21111 2026-03-24 cs.CV cs.LG

Frequency Switching Mechanism for Parameter-E!cient Multi-Task Learning

用于参数高效多任务学习的频率切换机制

Shih-Wen Liu, Yen-Chang Chen, Wei-Ta Chu, Fu-En Yang, Yu-Chiang Frank Wang

机构 * National Cheng Kung University(国立成功大学) NVIDIA Research(NVIDIA研究)

AI总结 本文提出Free Sinewich框架,通过频率切换实现近零成本权重调节,结合Sine-AWB层和轻量Clock Net,在密集预测基准中实现性能与效率的最优平衡。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21085 2026-03-24 cs.CV

Taming Sampling Perturbations with Variance Expansion Loss for Latent Diffusion Models

通过方差扩展损失镇定采样扰动以提升潜在扩散模型

Qifan Li, Xingyu Zhou, Jinhua Zhang, Weiyi You, Shuhang Gu

机构 * University of Electronic Science and Technology of China(电子科学与技术大学)

AI总结 本文提出方差扩展损失,通过对抗重建与方差扩展的交互,提升潜在空间鲁棒性,改进扩散生成质量。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21069 2026-03-24 cs.CV

NoOVD: Novel Category Discovery and Embedding for Open-Vocabulary Object Detection

NoOVD:开放词汇物体检测中的新类别发现与嵌入

Yupeng Zhang, Ruize Han, Zhiwei Chen, Wei Feng, Liang Wan

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院) Key Research Center for Surface Monitoring and Analysis of Relics, State Administration of Cultural Heritage(文物表面监测与分析国家重点研究中心) Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced Technology(深圳先进技术大学计算机科学与人工智能学院) School of Artificial Intelligence, Nanchang University(南昌大学人工智能学院)

AI总结 本文提出NoOVD框架,通过自蒸馏机制和K-FPN模块提升开放词汇物体检测中新类别的识别与嵌入效果,同时引入R-RPN提升召回率,实验表明在多个数据集上表现优异。

Comments CVPR 2026 Accept

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21055 2026-03-24 cs.CV

SGAD-SLAM: Splatting Gaussians at Adjusted Depth for Better Radiance Fields in RGBD SLAM

SGAD-SLAM:调整深度的点云溅射以改进RGBD SLAM中的光场

Pengchong Hu, Zhizhong Han

机构 * Machine Perception Lab, Wayne State University, Detroit, USA(机器感知实验室,韦恩州立大学,底特律,美国)

AI总结 SGAD-SLAM通过调整深度的点云溅射方法改进RGBD SLAM中的光场表示,解决传统高斯点云灵活性和运动限制的问题,提升渲染质量和跟踪效率。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20985 2026-03-24 cs.CV

Consistent but Dangerous: Per-Sample Safety Classification Reveals False Reliability in Medical Vision-Language Models

一致却危险:每样本安全分类揭示医疗视觉-语言模型中的虚假可靠性

Binesh Sadanandan, Vahid Behzadan

机构 * SAIL Lab, University of New Haven(SAIL实验室,新罕布什尔大学)

AI总结 研究揭示医疗VLMs中一致性指标的缺陷,通过四象限分类发现危险样本高准确率且低熵,建议部署评估需结合文本基线以识别虚假可靠性。

Comments CVPR 2026 Workshop on Medical Reasoning with Vision Language Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20970 2026-03-24 cs.CV

GraPHFormer: A Multimodal Graph Persistent Homology Transformer for the Analysis of Neuroscience Morphologies

GraPHFormer:一种多模态图持久同调变换器,用于神经科学形态学分析

Uzair Shah, Marco Agus, Mahmoud Gamal, Mahmood Alzubaidi, Corrado Cali, Pierre J. Magistretti, Abdesselam Bouzerdoum, Mowafa Househ

机构 * Hamad Bin Khalifa University(哈马德·本·卡西姆大学) University of Turin(都灵大学) BESE, King Abdullah University of Science and Technology(贝赛,国王阿卜杜勒阿齐兹大学科学与技术学院) University of Wollongong(沃林根大学) Neuroscience Institute Cavalieri Ottolenghi(卡瓦利埃-奥托伦奇神经科学研究所) Université Grenoble-Alpes(格勒诺布尔阿尔卑斯大学)

AI总结 GraPHFormer通过CLIP式对比学习统一拓扑和图结构分析,利用持久图像编码和树状LSTM编码器,实现对神经形态的高精度识别与分类,优于传统方法。

Comments Accepted to IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20818 2026-03-24 cs.CV cs.AI

PlanaReLoc: Camera Relocalization in 3D Planar Primitives via Region-Based Structure Matching

PlanaReLoc:通过基于区域的结构匹配实现3D平面原语的相机重定位

Hanqiao Ye, Yuzhou Liu, Yangdong Liu, Shuhan Shen

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 本文提出PlanaReLoc,利用3D平面原语和地图进行轻量级6自由度相机重定位,通过深度匹配和统一嵌入空间实现可靠的跨模态结构对应。

Comments Accepted by CVPR 2026. 20 pages, 15 figures. Code at https://github.com/3dv-casia/PlanaReLoc

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20808 2026-03-24 cs.CV cs.LG

Predictive Regularization Against Visual Representation Degradation in Multimodal Large Language Models

预测正则化对抗多模态大语言模型中的视觉表征退化

Enguang Wang, Qiang Wang, Yuanchen Wu, Ke Yan, Xinbin Yuan, Shouhong Ding, Xialei Liu, Ming-Ming Cheng

机构 * NKIARI VCIP, CS, Nankai University(VCIP计算机科学系,南开大学) AAIS, Nankai University(AAIS,南开大学) Tencent Youtu Lab(腾讯优设实验室)

AI总结 本文研究多模态大语言模型中的视觉表征退化问题,提出预测正则化方法以维持视觉表征,提升视觉语言性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20782 2026-03-24 cs.CV

MEMO: Human-like Crisp Edge Detection Using Masked Edge Prediction

MEMO: 通过掩码边缘预测实现类人清晰边缘检测

Jiaxin Cheng, Yue Wu, Yicong Zhou

机构 * Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系)

AI总结 本文提出MEMO模型,通过设计训练和推理策略实现清晰边缘检测,利用交叉熵损失在合成数据集上预训练,再通过轻量模块微调,最终通过逐步预测策略生成更精确的边缘。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20755 2026-03-24 cs.CV cs.AI

Memory-Efficient Fine-Tuning Diffusion Transformers via Dynamic Patch Sampling and Block Skipping

通过动态补丁采样和块跳过实现高效的扩散变换器微调

Sunghyun Park, Jeongho Kim, Hyoungwoo Park, Debasmit Das, Sungrack Yun, Munawar Hayat, Jaegul Choo, Fatih Porikli, Seokeon Choi

机构 * Qualcomm AI Research(高通人工智能研究) KAIST(韩国科学技术院)

AI总结 本文提出DiT-BlockSkip框架,通过动态补丁采样和块跳过减少内存使用,提升扩散变换器微调效率,实现设备端部署。

Comments Accepted to CVPR 2026; 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20741 2026-03-24 cs.CV

CTCal: Rethinking Text-to-Image Diffusion Models via Cross-Timestep Self-Calibration

CTCal: 通过跨时间步自校准重新思考文本到图像扩散模型

Xiefan Guo, Xinzhu Ma, Haiyu Zhang, Di Huang

机构 * State Key Laboratory of Complex and Critical Software Environment(复杂与关键软件环境国家重点实验室) School of Computer Science and Engineering(计算机科学与工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 本文提出CTCal,通过利用早期时间步的准确文本-图像对齐来校准后期时间步的表示学习,提升文本到图像生成的对齐精度。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20739 2026-03-24 cs.CV

Mamba Learns in Context: Structure-Aware Domain Generalization for Multi-Task Point Cloud Understanding

Mamba在上下文中学习:面向多任务点云理解的结构感知领域泛化

Jincen Jiang, Qianyu Zhou, Yuhang Li, Kui Su, Meili Wang, Jian Chang, Jian Jun Zhang, Xuequan Lu

机构 * Bournemouth University(伯恩茅斯大学) Jilin University(吉林大学) The University of Western Australia(西澳大学) Hangzhou City University(杭州城市大学) Northwest A&F University(西北农林科技大学)

AI总结 本文提出SADG框架,通过结构感知序列化和层次领域感知建模提升多任务点云领域的结构一致性与性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20721 2026-03-24 cs.CV

Cross-modal Fuzzy Alignment Network for Text-Aerial Person Retrieval and A Large-scale Benchmark

跨模态模糊对齐网络用于文本-空中人检索及一个大规模基准

Yifei Deng, Chenglong Li, Yuyang Zhang, Guyue Hu, Jin Tang

机构 * State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology(光电信息采集与防护技术国家重点实验室) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) The University of Hong Kong(香港大学)

AI总结 本文提出跨模态模糊对齐网络,通过模糊逻辑量化token级可靠性,结合地面图像作为桥梁代理,提升文本与空中图像的语义对齐鲁棒性,并构建了大规模基准数据集AERI-PEDES。

Comments Accepted by CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20708 2026-03-24 cs.CV

High-Quality and Efficient Turbulence Mitigation with Events

高质高效湍流抑制方法

Xiaoran Zhang, Jian Ding, Yuxing Duan, Haoyue Liu, Gang Chen, Yi Chang, Luxin Yan

机构 * State Key Laboratory of Multispectral Information Intelligent Processing Technology(多谱信息智能处理技术国家重点实验室) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)

AI总结 本文提出EHETM方法,利用事件相机的特性,通过事件极性变化和事件管约束实现高效湍流抑制,提升恢复质量并减少数据开销和系统延迟。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20611 2026-03-24 cs.CV

GaussianPile: A Unified Sparse Gaussian Splatting Framework for Slice-based Volumetric Reconstruction

GaussianPile:一种统一的稀疏高斯散射框架用于基于切片的体积分离重建

Di Kong, Yikai Wang, Wenjie Guo, Yifan Bu, Boya Zhang, Yuexin Duan, Xiawei Yue, Wenbiao Du, Yiman Zhong, Yuwen Chen, Cheng Ma

机构 * Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) Beijing Normal University(北京师范大学) Nankai University(南开大学) Beijing Institute of Technology(北京理工大学) Beihang University(北航)

AI总结 本文提出GaussianPile框架,结合3D高斯散射与成像系统感知的聚焦模型,通过切片感知堆叠策略、可微投影算子和紧凑编码优化流程,实现高效体积分离重建,提升压缩效率与诊断精度。

Comments Accepted by IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026 (CVPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17655 2026-03-24 cs.CV cs.AI

Interpretable Cross-Domain Few-Shot Learning with Rectified Target-Domain Local Alignment

可解释的跨领域少样本学习与修正的目标域局部对齐

Yaze Zhao, Yixiong Zou, Yuhua Li, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)

AI总结 本文提出CC-CDFSL方法,通过循环一致性解决CLIP-based CDFSL中的局部对齐问题,提升局部视觉语言对齐和可解释性,实现SOTA性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12918 2026-03-24 cs.CV

VIRD: View-Invariant Representation through Dual-Axis Transformation for Cross-View Pose Estimation

VIRD:通过双轴变换实现视图不变表示的跨视图姿态估计

Juhye Park, Wooju Lee, Dasol Hong, Changki Sung, Youngwoo Seo, Dongwan Kang, Hyun Myung

机构 * Urban Robotics Lab, School of Electrical Engineering, KAIST(首尔国立大学电气工程学院智能城市机器人实验室) Hanwha Aerospace(韩华航空航天)

AI总结 本文提出VIRD方法,通过双轴变换构建视图不变表示,解决地面与卫星视图间显著视角差异问题,提升跨视图姿态估计精度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08536 2026-03-24 cs.CV

SWIFT: Sliding Window Reconstruction for Few-Shot Training-Free Generated Video Attribution

SWIFT: 基于滑动窗口的少样本训练自由生成视频属性识别

Chao Wang, Zijin Yang, Yaofei Wang, Yuang Qi, Weiming Zhang, Nenghai Yu, Kejiang Chen

机构 * University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学)

AI总结 本文提出SWIFT方法,通过滑动窗口实现视频属性识别,无需额外训练即可在多种生成模型上达到90%以上的准确率,支持零样本识别。

Comments 8 pages. Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03744 2026-03-24 cs.CV

DAGE: Dual-Stream Architecture for Efficient and Fine-Grained Geometry Estimation

DAGE:用于高效和细粒度几何估计的双流架构

Tuan Duc Ngo, Jiahui Huang, Seoung Wug Oh, Kevin Blackburn-Matzen, Evangelos Kalogerakis, Chuang Gan, Joon-Young Lee

机构 * UMass Amherst(马萨诸塞大学阿姆赫斯特分校) Adobe Research(Adobe研究) TU Crete(希腊技术大学)

AI总结 DAGE提出双流变压器架构,通过分离全局一致性与细节,实现高效且细粒度的几何估计与相机姿态估计,支持高分辨率和长序列输入。

Comments CVPR 2026. Project page: https://ngoductuanlhp.github.io/dage-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00431 2026-03-24 cs.CV cs.AI

Taxonomy-Aware Representation Alignment for Hierarchical Visual Recognition with Large Multimodal Models

面向层次视觉识别的分类意识表示对齐

Hulingxiao He, Zhi Tan, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机系王轩研究所)

AI总结 本文提出TARA方法,通过生物基础模型的层次对比学习将分类知识注入大模态模型,提升层次视觉识别中对已知和新类别的识别性能。

Comments Published as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21499 2026-03-24 cs.CV

Easy3E: Feed-Forward 3D Asset Editing via Rectified Voxel Flow

Easy3E: 通过校正体素流实现的前馈3D资产编辑

Shimin Hu, Yuanyi Wei, Fei Zha, Yudong Guo, Juyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出基于TRELLIS生成框架的高效前馈3D编辑方法,通过单视角编辑实现3D模型修改,解决训练自由2D编辑适应结构化3D表示及压缩3D特征外观保真度瓶颈问题。

Comments CVPR 2026, Project Page: https://ustc3dv.github.io/Easy3E/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10744 2026-03-24 cs.AI cs.CV

Explore with Long-term Memory: A Benchmark and Multimodal LLM-based Reinforcement Learning Framework for Embodied Exploration

探索与长期记忆:一个基准和基于多模态LLM的强化学习框架用于具身探索

Sen Wang, Bangwei Liu, Zhenkun Gao, Lizhuang Ma, Xuhong Wang, Yuan Xie, Xin Tan

机构 * East China Normal University(东华大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 本文提出LMEE框架,通过多模态LLM强化学习促进终身学习,构建LMEE-Bench基准评估具身探索过程与结果,采用MemoryExplorer方法提升记忆检索与主动探索能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05175 2026-03-24 cs.CV

VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice

VideoAuto-R1:通过一次推理、两次回答实现视频自动推理

Shuming Liu, Mingchen Zhuge, Changsheng Zhao, Jun Chen, Lemeng Wu, Zechun Liu, Chenchen Zhu, Zhipeng Cai, Chong Zhou, Haozhe Liu, Ernie Chang, Saksham Suri, Hongyu Xu, Qi Qian, Wei Wen, Balakrishnan Varadarajan, Zhuang Liu, Hu Xu, Florian Bordes, Raghuraman Krishnamoorthi, Bernard Ghanem, Vikas Chandra, Yunyang Xiong

机构 * Meta AI King Abdullah University of Science and Technology (KAUST)(卡布斯大学) Princeton University(普林斯顿大学)

AI总结 本文提出VideoAuto-R1框架,通过一次推理两次回答策略提升视频理解效率,实现准确率和效率的双重提升。

Comments Accepted to CVPR 2026. Project page: https://ivul-kaust.github.io/projects/videoauto-r1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21778 2026-03-24 cs.CV

Scene-VLM: Multimodal Video Scene Segmentation via Vision-Language Models

Scene-VLM:通过视觉-语言模型进行多模态视频场景分割

Nimrod Berman, Adam Botach, Emanuel Ben-Baruch, Shunit Haviv Hakimi, Asaf Gendler, Ilan Naiman, Erez Yosef, Igor Kviatkovsky

机构 * Ben-Gurion University(本·古里安大学) Amazon Prime Video(亚马逊Prime视频) Tel-Aviv University(特拉维夫大学)

AI总结 本文提出Scene-VLM,首个基于视觉-语言模型的视频场景分割框架,通过融合视觉与文本信息实现多模态推理,提升场景分割的准确性和可解释性。

Comments Accepted for publication at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19402 2026-03-24 cs.RO cs.CV cs.GR

Real2Edit2Real: Generating Robotic Demonstrations via a 3D Control Interface

Real2Edit2Real:通过3D控制界面生成机器人演示

Yujie Zhao, Hongwei Fan, Di Chen, Shengcong Chen, Liliang Chen, Xiaoqi Li, Guanghui Ren, Hao Dong

机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学) PKU-AgiBot Lab(北大AgiBot实验室) AgiBot

AI总结 本文提出Real2Edit2Real框架,通过3D可编辑性与2D视觉数据结合,减少重复数据收集,提升空间泛化能力,实验表明其数据效率提升显著。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05959 2026-03-24 cs.CL cs.AI cs.CV

M4-RAG: A Massive-Scale Multilingual Multi-Cultural Multimodal RAG

M4-RAG:大规模多语言多文化多模态检索增强生成

David Anugraha, Patrick Amadeus Irawan, Anshul Singh, En-Shiun Annie Lee, Genta Indra Winata

机构 * Stanford University(斯坦福大学) MBZUAI Indian Institute of Science(印度科学研究院) Ontario Tech University(安大略技术大学) University of Toronto(多伦多大学) Capital One

AI总结 M4-RAG提出一个覆盖42种语言、56种方言和189个国家的多模态大规模基准,通过构建8万多个文化多样化的图像-问题对,评估跨语言和模态的检索增强视觉问答性能,揭示模型大小与检索效果的不匹配问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03794 2026-03-24 cs.CV cs.AI cs.CL cs.LG

AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition

AdaptVision: 通过自适应视觉获取实现高效的视觉-语言模型

Zichuan Lin, Yicheng Liu, Yang Yang, Lvfang Tao, Deheng Ye

机构 * Tencent Hunyuan(腾讯文言)

AI总结 AdaptVision通过自适应视觉获取机制,结合强化学习与工具学习,提升视觉-语言模型在视觉问答任务中的效率与准确性。

Comments Accepted by CVPR 2026. Code and models are available at https://github.com/AdaptVision/AdaptVision

详情

展开后加载摘要…

URL PDF HTML 收藏