arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 109
2607.11192 2026-07-16 cs.CV 版本更新

GDP.pdf: Benchmarking Grounded Multimodal Reasoning over Professional PDF Documents

GDP.pdf:针对专业PDF文档的基础多模态推理基准测试

Suhaas Garre, Emily Ritchie, Sushant Mehta, Edwin Chen

机构 * Surge AI

AI总结 该研究针对专业PDF文档构建多模态推理基准测试GDP.pdf,由专业人员编写问题-文档对,通过严格筛选保留问题,有详细评分标准和能力分类。评估七个前沿模型,发现多数错误源于特定模式,公开了完整基准测试。

Comments 9 pages. v2: results updated to July 2026 leaderboard (17 models). Accepted at the 2nd Workshop on Knowledge-Intensive Multimodal Reasoning (KnowledgeMR) at CVPR 2026 (non-archival), under the former title "PDFParse: A Benchmark for Grounded Multimodal Reasoning over Professional PDF Documents". Dataset: https://huggingface.co/datasets/surgeai/GDP.pdf ; Code: https://github.com/surge-ai/gdp-pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27232 2026-07-16 cs.CL 版本更新

Targeted Linguistic Analysis of Sign Language Models with Minimal Translation Pairs

基于最小翻译对的手语语言模型目标语言分析

Serpil Karabüklü, Kanishka Misra, Shester Gueuwou, Diane Brentari, Greg Shakhnarovich, Karen Livescu

机构 * Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Linguistics Department, The University of Texas at Austin(德克萨斯大学奥斯汀分校语言学系) Linguistics Department, The University of Chicago(芝加哥大学语言学系)

AI总结 针对手语翻译模型,通过构建美国手语最小翻译对数据集(ASL-MTP)并消融输入线索,分析模型对不同手语现象(尤其是非手动线索)的捕捉能力。

Comments It is accepted to CVPR 2026 Workshop GenSign: Generative AI for Sign Language

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10581 2026-07-16 cs.CV 版本更新

Multi-view Hand Reconstruction with a Point-Embedded Transformer

基于点嵌入变换器的多视图手部重建

Lixin Yang, Licheng Zhong, Pengxiang Zhu, Xinyu Zhan, Junxiao Kong, Jian Xu, Cewu Lu

机构 * School of Artificial Intelligence (SAI), Shanghai Jiao Tong University(人工智能学院(SAI),上海交通大学) School of Mechanical Engineering, Shanghai Jiao Tong University(机械工程学院,上海交通大学) School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(电子信息与电气工程学院,上海交通大学) Institute of Automation Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所(CASIA))

AI总结 研究提出POEM模型用于多视图手部重建,通过在多视图立体空间嵌入基点表示手部网格,并结合多数据集及相机参数随机化训练,实现了通用、实用且经济高效的双手运动捕捉。

Comments TPAMI 2025, Extension of CVPR 2023, correction on Table 4: HO3D results

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01063 2026-07-14 cs.AI 版本更新

MindClaw: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention

MindClaw: 用于精确干预的闭环具身心理状态推理

Ruoxuan Zhang, Qiaoqiao Wan, Zhengguang Wang, Chenghao Yu, Hongxia Xie, Jianlong Fu, Wen-Huang Cheng

机构 * Jilin University(吉林大学) Microsoft Asia(微软亚洲) National Taiwan University(国立台湾大学)

AI总结 提出MindClaw框架,通过闭环具身心理状态推理实现精确干预,结合多源输入、信念记忆、认知触发技能和动作生成,在动态环境中优化干预时机。

Comments Extended version of the CVPR 2026 paper *MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agents*. This work is in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13840 2026-07-14 cs.CV 版本更新

MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation

MoLingo:用于文本到运动生成的运动-语言对齐

Yannan He, Garvita Tiwari, Xiaohan Zhang, Pankaj Bora, Tolga Birdal, Jan Eric Lenssen, Gerard Pons-Moll

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) Imperial College London(伦敦帝国理工学院) Zuse School ELIZA(Zuse ELIZA 学院)

AI总结 本文提出MoLingo模型,通过在连续潜在空间中去噪生成逼真的人体运动。研究如何构建语义对齐的潜在空间和最佳注入文本条件以提高运动真实性与描述一致性。

Comments Accepted by CVPR 2026. Project page: https://hynann.github.io/molingo/MoLingo.html. Title type fixed, content unchanged

Journal ref Proc. IEEE/CVF Conf. Comput. Vis. Pattern Recogn. (CVPR), 2026, pp. 38387-38398

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22042 2026-07-14 cs.CV cs.AI 版本更新

Uncertainty-guided Compositional Alignment with Part-to-Whole Semantic Representativeness in Hyperbolic Vision-Language Models

基于部分-整体语义代表性与不确定性引导的组合对齐超几何视觉语言模型

Hayeon Kim, Ji Ha Jang, Junghun James Kim, Se Young Chun

机构 * Dept. of Electrical and Computer Engineering(电子与计算机工程系) INMC & IPAI(INMC与IPAI) Seoul National University(首尔国立大学)

AI总结 本文提出UNCHA方法,通过超几何不确定性建模部分-整体语义代表性,提升超几何VLM对多物体场景的组合结构理解能力,实现零样本分类等任务的最先进性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21511 2026-07-14 cs.CV 版本更新

Back to Point: Exploring Point-Language Models for Zero-Shot 3D Anomaly Detection

回到点:探索用于零样本3D异常检测的点语言模型

Kaiqiang Li, Gang Li, Mingle Zhou, Min Li, Delong Han, Jin Wan

机构 * Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences), Jinan, China(计算机功率网络与信息安全重点实验室,教育部,山东计算机科学中心(济南国家超级计算机中心),齐鲁大学(山东科学院),济南,中国) Shandong Provincial Key Laboratory of Computing Power Internet and Service Computing, Shandong Fundamental Research Center for Computer Science, Jinan, China(山东省计算功率互联网与服务计算重点实验室,山东省计算机科学基础研究中心,济南,中国)

AI总结 本文提出BTP框架,通过结合3D点云和文本嵌入,提升零样本3D异常检测的性能,实验表明其在Real3D-AD和Anomaly-ShapeNet上表现优异。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19311 2026-07-14 cs.CV cs.AI 版本更新

MixFlow Training: Alleviating Exposure Bias with Slowed Interpolation Mixture

MixFlow训练:用慢插值混合减轻曝光偏差

Hui Li, Fu-Yun Wang, Haoyuan Xia, Jiayue Lyu, Kaihui Cheng, Siyu Zhu, Jingdong Wang

AI总结 研究扩散模型训练-测试差异问题,提出MixFlow方法,利用慢流现象的慢插值混合对预测网络后处理,在类条件图像生成和文本到图像生成实验中验证有效,在RAE模型的ImageNet生成任务上取得好结果。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09881 2026-07-13 cs.CV cs.AI cs.LG 版本更新

Transition Matching Distillation for Fast Video Generation

用于快速视频生成的过渡匹配蒸馏

Weili Nie, Julius Berner, Nanye Ma, Chao Liu, Saining Xie, Arash Vahdat

AI总结 研究针对大型视频模型多步采样低效问题,提出过渡匹配蒸馏框架TMD,将扩散模型多步去噪轨迹与少步概率过渡过程匹配,分解扩散主干为组件,经实验验证TMD在速度和质量权衡上表现出色,优于现有蒸馏模型。

Journal ref Proc. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 4645-4655

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10915 2026-07-13 cs.CV cs.AI cs.LG 版本更新

M4V: Multimodal Mamba for Efficient Text-to-Video Generation

M4V:用于高效文本到视频生成的多模态曼巴

Jiancheng Huang, Gengwei Zhang, Zequn Jie, Siyu Jiao, Yinlong Qian, Ling Chen, Yunchao Wei, Lin Ma

机构 * Meituan(美团) University of Technology Sydney(技术大学悉尼分校) Beijing Jiaotong University(北京交通大学)

AI总结 研究针对文本到视频生成计算量大的问题,引入多模态曼巴框架M4V。设计MM-DiM块,采用多模态令牌重新组合设计,增强时空一致性。实验表明,该框架能在降计算成本的同时生成高质量视频。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12322 2026-07-13 cs.CV 版本更新

Zero-shot 3D General Obstacle Detection via Multimodal Foundation Models and Geometry

通过多模态基础模型和几何进行零样本3D通用障碍物检测

Tamás Matuszka, Péter Hajas, Dávid Szeghy

机构 * aiMotive

AI总结 针对自动驾驶中通用障碍物检测难题,提出结合多模态基础模型与几何推理的免训练零样本方法,能精准定位达100米,借基础模型先验提升召回率,还可实现可扩展自动标注。

Comments Accepted to CVPR 2026 AUTOPILOT Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21917 2026-07-10 cs.CV cs.AI 版本更新

MAVEN: A Multi-stage Agentic Annotation Pipeline for Video Reasoning Tasks

MAVEN:一种多阶段代理标注管道用于视频推理任务

Han Zhang, Wanting Jiang, Tomasz Kornuta, Tian Zheng, Vidya Murali

机构 * NVIDIA

AI总结 本文提出MAVEN,一种多阶段代理标注管道,通过链式推理轨迹生成多任务训练数据,用于视频事件推理任务,核心方法是多尺度时空事件描述,支持代理驱动的领域适应,通过分层细化循环改进数据质量,并在多个数据集上验证了其有效性。

Comments CVPR 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18235 2026-07-10 cs.CV cs.RO 版本更新

BiasBench: A reproducible benchmark for tuning the biases of event cameras

BiasBench:用于调整事件相机偏差的可重现基准测试

Andreas Ziegler, David Joseph, Thomas Gossard, Emil Moldovan, Andreas Zell

机构 * Cognitive Systems Group, University of Tübingen(图宾根大学认知系统组)

AI总结 研究针对事件相机偏差调整工具少的问题,提出BiasBench这一包含多场景的可重现事件数据集,并展示三个场景及下游应用质量指标,还提出基于强化学习的方法促进在线偏差调整。

Comments Accepted to CVPR 2025 Workshop on Event-based Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02915 2026-07-09 cs.CV 版本更新

GP-4DGS: Probabilistic 4D Gaussian Splatting from Monocular Video via Variational Gaussian Processes

GP-4DGS:通过变分高斯过程从单目视频中进行概率性4D高斯点溅射

Mijeong Kim, Jungtaek Kim, Bohyung Han

机构 * IPAI, Seoul National University(首尔大学IPAI) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出GP-4DGS框架,结合高斯过程与4D高斯点溅射,实现动态场景的概率建模。通过引入不确定性量化、运动估计和时间外推,提升重建质量与预测可靠性。

Comments CVPR 2026, Page: https://cv.snu.ac.kr/research/GP4DGS

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23802 2026-07-09 cs.AI cs.CV 版本更新

EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models

EMO-R3:多模态大语言模型中用于情感推理的反射强化学习

Yiyang Fang, Wenke Huang, Pei Fu, Yihao Yang, Kehua Su, Zhenbo Luo, Jian Luan, Mang Ye

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) MiLM Plus, Xiaomi Inc.(小米公司)

AI总结 针对多模态大语言模型情感推理难题,提出EMO-R3框架。引入结构化情感思维并设计反射情感奖励,经大量实验验证,该框架显著提升模型可解释性与情商,在多视觉情感理解基准测试中表现出色。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11539 2026-07-08 cs.CV cs.AI 版本更新

CLAY: Conditional Visual Similarity Modulation in Vision-Language Embedding Space

CLAY:视觉相似性模拟能力在视觉-语言嵌入空间中的条件性

Sohwi Lim, Lee Hyoseok, Jungjoon Park, Tae-Hyun Oh

机构 * KAIST(韩国科学技术院)

AI总结 CLAY通过重构预训练视觉-语言模型的嵌入空间,实现基于文本条件的灵活相似性计算,提升多条件检索效率与准确性。

Comments CVPR 2026, Project page: https://sohwi-lim.github.io/CLAY

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21010 2026-07-07 cs.CV cs.AI cs.CL cs.HC cs.LG 版本更新

ChainReaction: Causal Chain-Guided Reasoning for Modular and Explainable Causal-Why Video Question Answering

ChainReaction:用于模块化和可解释因果关系视频问答的因果链引导推理

Paritosh Parmar, Eric Peh, Basura Fernando

机构 * Institute of High Performance Computing, Agency for Science, Technology and Research, Singapore(新加坡高性能计算研究所,科技研究局) Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore(科技研究局前沿人工智能研究中心,新加坡) College of Computing and Data Science, Nanyang Technological University, Singapore(新加坡南洋理工大学计算与数据科学学院)

AI总结 针对现有因果关系视频问答模型的问题,提出新的模块化范式,将因果推理与答案生成解耦,引入自然语言因果链,介绍两阶段架构及生成因果链方法,新指标,实验证明该方法性能优越。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23216 2026-07-03 cs.CV 版本更新

CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering

CaST-Bench:面向视频问答的因果链时空推理基准

Mingfang Zhang, Jingjing Pan, Ashutosh Kumar, Rajat Saini, Mustafa Erdogan, Hsuan-Kung Yang, Caixin Kang, Yifei Huang, Yoichi Sato, Quan Kong

机构 * Woven by Toyota(丰田公司) The University of Tokyo(东京大学)

AI总结 提出CaST-Bench基准,通过构建包含因果链时空标注的数据集和评估指标,系统评测视觉语言模型在视频因果推理中的细粒度证据定位能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28545 2026-07-03 cs.RO cs.CV 版本更新

ManipArena: Comprehensive Real-world Evaluation of Reasoning-Oriented Generalist Robot Manipulation

ManipArena: 通用机器人操作的综合现实世界评估

Yu Sun, Meng Cao, Yang Ping, Kaidong Zhang, Qingxuan Chen, Rongtao Xu, Liangwang Ruan, Xuecheng Chen, Dongxiu Liu, Yunxiao Yan, Zunnan Xu, Runze Xu, Charles Yang, Peilun Zhang, Xiaofan Li, Ruyi Gan, Liang Ma, Yuehao Yin, Jincheng Yu, Lufang Chen, Yuxin Liang, Peng Zhai, Hao Wang, Ivan Laptev, Ian Reid, Qian Wang, Xiaodan Liang

机构 * SYSU(中山大学) X SQUARE ROBOT MBZUAI(穆罕默德·本·扎耶德人工智能大学) Thsinghua University(清华大学)

AI总结 ManipArena通过标准化框架解决现有评估不足问题,提供真实场景下的多任务测试与多级泛化能力,支持长时移动操作与传感诊断,促进视觉-语言-动作模型和世界模型的发展。

Comments Technical report for CVPR 2026 Challenge ManipArena

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22969 2026-07-02 cs.CV 版本更新

FCL-COD: Weakly Supervised Camouflaged Object Detection with Frequency-aware and Contrastive Learning

FCL-COD:基于频率感知和对比学习的弱监督伪装目标检测

Jingchen Ni, Quan Zhang, Dan Jiang, Keyu Lv, Ke Zhang, Chun Yuan

机构 * Tsinghua University(清华大学) Soochow University(苏州大学)

AI总结 提出频率感知低秩适应(FoRA)和梯度感知对比学习,解决弱监督伪装目标检测中非伪装响应、局部/极端响应及边界模糊问题,在三个基准上超越现有弱监督和部分全监督方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18765 2026-07-02 cs.CV cs.AI 版本更新

NI-Tex: Non-isometric Image-based Garment Texture Generation

NI-Tex: 基于非等距图像的服装纹理生成

Hui Shan, Ming Li, Haitao Yang, Kai Zheng, Sizhe Zheng, Yanwei Fu, Xiangru Huang

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Fudan University(复旦大学)

AI总结 针对非等距图像与3D服装网格间的纹理生成问题,提出结合物理模拟数据集、非等距图像编辑和迭代烘焙的框架,生成高质量PBR纹理。

Comments Accepted to CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22160 2026-06-29 cs.CV cs.AI 版本更新

GenMatter: Perceiving Physical Objects with Generative Matter Models

GenMatter:基于生成物质模型的物理物体感知

Eric Li, Arijit Dasgupta, Yoni Friedman, Mathieu Huot, Vikash Mansinghka, Thomas O'Connell, William T. Freeman, Joshua B. Tenenbaum

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) MIT BCS(麻省理工学院生物学与计算机科学)

AI总结 本文提出一种生成物质模型,通过分层聚类低级运动线索和高级外观特征,实现对不同输入的统一感知框架,验证了其在随机点运动、伪装旋转物体和自然视频中的有效性。

Comments 25 pages, 12 figures, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03723 2026-06-25 cs.CV 版本更新

SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation

SymphoMotion:相机运动与物体动态的联合控制以实现一致的视频生成

Guiyu Zhang, Yabo Chen, Xunzhi Xiang, Junchao Huang, Zhongyu Wang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiaotong University(上海交通大学) Nanjing University(南京大学) Beihang University(北京航空航天大学)

AI总结 SymphoMotion通过联合控制相机运动和物体动态,提高视频生成的一致性和表达性,其核心方法结合了相机轨迹控制与物体动态控制机制,并引入了RealCOD-25K数据集进行大规模训练和评估,显著提升了视觉保真度和物体运动准确性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01759 2026-06-25 cs.LG cs.AI 版本更新

Weight Space Representation Learning via Neural Field Adaptation

通过神经场自适应进行权重空间表示学习

Zhuoqian Yang, Mathieu Salzmann, Sabine Süsstrunk

机构 * EPFL(苏黎世联邦理工学院)

AI总结 提出利用预训练基础模型和低秩自适应约束优化空间,诱导权重空间结构,实现高质量、有区分性和语义结构的表示,并在潜在扩散模型中提升生成质量。

Comments 9 pages body, 9 pages appendix

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14079 2026-06-25 cs.CV 版本更新

VENI: Variational Encoder for Natural Illumination

VENI: 自然光照的变分编码器

Paul Walker, James A. D. Gardner, Andreea Ardelean, William A. P. Smith, Bernhard Egger

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃朗根-纽伦堡弗里德里希-亚历山大大学) University of York(约克大学)

AI总结 提出一种旋转等变变分自编码器,通过新型向量神经元视觉变换器(VN-ViT)编码器和旋转等变条件神经场解码器,在球面上建模自然光照,无需2D投影,实现更平滑的潜空间插值。

Comments Project Repo - https://github.com/paul-pw/veni Project page - https://paul-pw.github.io/veni

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2026) 16248-16257

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24731 2026-06-24 cs.CV 版本更新

EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation

EchoFoley: 面向视频接地创意声音生成的事件中心层次化控制

Bingxuan Li, Yiming Cui, Yicheng He, Yiwei Wang, Shu Zhang, Longyin Wen, Yulei Niu

机构 * ByteDance Intelligent Creation(字节跳动智能创作) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Merced(加州大学默塞德分校) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 提出EchoFoley任务,通过事件级局部控制和层次化语义控制实现视频接地声音生成,构建EchoFoley-6k基准并设计EchoVidia框架,在可控性和感知质量上分别提升40.7%和12.5%。

Comments CVPR-2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27259 2026-06-23 cs.CV 版本更新

Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark

看到场景才重要:通过场景感知的长视频基准揭示视频理解模型中的遗忘现象

Seng Nam Chen, Hao Chen, Chenglam Ho, Xinyu Mao, Jinping Wang, Yu Zhang, Chao Li

机构 * CUHK (SZ)(香港中文大学(深圳)) University of Cambridge(剑桥大学) UESTC(电子科技大学) CUHK(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出SceneBench基准,揭示视频理解模型在长场景上下文中的遗忘问题,并提出Scene-RAG方法提升性能2.50%。

Comments Accepted to CVPR 2026 (Highlight)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20208 2026-06-23 cs.LG cs.AI 版本更新

Model Merging in the Essential Subspace

本质子空间中的模型合并

Longhua Li, Lei Qi, Qi Tian, Xin Geng

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其跨学科应用国家重点实验室(东南大学),中华人民共和国,中国) Huawei Technologies, Shanghai, China(华为技术有限公司,上海,中国)

AI总结 提出ESM框架,通过对参数更新引起的特征偏移进行主成分分析,提取本质子空间进行低秩分解,并采用多级极化缩放策略,有效缓解任务干扰,实现多任务模型合并的最优性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07298 2026-06-23 cs.CV 版本更新

Mimic Human Cognition, Master Multi-Image Reasoning: A Meta-Action Framework for Enhanced Visual Understanding

模仿人类认知,掌握多图像推理:增强视觉理解的元动作框架

Jianghao Yin, Qingbin Li, Kun Sun, Cheng Ding, Jie Wang, Qin Chen, Jie Zhou, Nan Wang, Changqing Li, Pei Wu, Jian Xu, Zheming Yang, Liang He

机构 * East China Normal University(华东师范大学) ByteDance(字节跳动)

AI总结 提出受人类认知启发的元动作框架CINEMA,将多图像推理分解为五个结构化元动作,结合检索树采样和两阶段强化学习,在多个基准上超越GPT-4o。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15098 2026-06-23 cs.CV 版本更新

A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models

基于离散扩散的多模态大语言模型中视觉标记冗余的综合研究

Duo Li, Zuhao Yang, Xiaoqin Zhang, Ling Shao, Shijian Lu

机构 * CCDS, NTU, Singapore(南洋理工大学新加坡分校) CCST, ZJUT, China(浙江工业大学中国分校) Terminus AI Lab, UCAS, China(中国科学院大学人工智能实验室)

AI总结 本研究系统分析了离散扩散多模态大语言模型中视觉标记冗余的演化规律,发现其仅出现在从头训练的模型处理长答案任务时,并验证了视觉标记剪枝会导致信息损失,而层跳过和渐进剪枝分别适用于不同架构的加速。

Comments Accepted by CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026, pp. 2823-2833

详情

展开后加载摘要…

URL PDF HTML 收藏