arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-06 至 2026-04-06 共收录 58 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 7 篇

2604.02345 2026-04-06 cs.LG cs.AI 62%

UI-Oceanus: Scaling GUI Agents with Synthetic Environmental Dynamics

UI-Oceanus:通过合成环境动态扩展GUI代理

Mengzhou Wu, Yuzhe Guo, Yuan Cao, Haochuan Lu, Songhe Zhu, Pingzhe Qu, Xin Chen, Kang Qin, Zhongpu Wang, Xiaode Zhang, Xinyi Wang, Wei Dai, Gang Cao, Yuetang Deng, Zhi Gong, Dezhi Ran, Linyi Li, Wei Yang, Tao Xie

机构 * Key Lab of HCST (PKU), MOE(高可信软件技术教育部重点实验室(北京大学);北京大学计算机学院) School of Computer Science, Peking University(北京通明湖信息技术应用创新中心) Beijing Tongming Lake Information Technology Application Innovation Center(腾讯微信) WeChat, Tencent Inc.(西蒙菲莎大学) Simon Fraser University(德克萨斯大学达拉斯分校) University of Texas at Dallas(复旦大学系统与先进计算研究所) Fudan University Institute of Systems for Advanced Computing(上海开放计算系统研究所) Shanghai Institute of Systems for Open Computing

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出UI-Oceanus框架,通过地面真实环境反馈掌握交互物理,解决GUI代理扩展中的数据瓶颈问题,实验表明其在离线和在线导航中均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06649 2026-04-06 cs.LG cs.AI 62%

Local Reinforcement Learning with Action-Conditioned Root Mean Squared Q-Functions

局部强化学习与基于动作的均方Q函数

Frank Wu, Mengye Ren

机构 * Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于动作的均方Q函数,通过时间差分学习实现局部强化学习,优于现有无反向传播方法,在MinAtar和DeepMind控制套件中表现优异。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03198 2026-04-06 cs.CV cs.AI 62%

FLEX: A Largescale Multimodal, Multiview Dataset for Learning Structured Representations for Fitness Action Quality Assessment

FLEX:一个大规模多模态、多视角数据集,用于学习结构化表示以评估健身动作质量

Hao Yin, Lijun Gu, Paritosh Parmar, Lin Xu, Tianxiao Guo, Xiujin Liu, Weiwei Fu, Yang Zhang, Tianyou Zheng

机构 * School of Biomedical Engineering (Suzhou), USTC(中国科学技术大学苏州生物医学工程学院) Suzhou Institute of Biomedical Engineering and Technology, CAS(中国科学院苏州生物医学工程技术研究所) Institute of High-Performance Computing, A*STAR, Singapore(新加坡科技研究局高性能计算研究所) School of Psychology, Beijing Sports University(北京体育大学心理学院) School of Competitive Sports, Beijing Sports University(北京体育大学竞技体育学院) Department of Robotics, University of Michigan(密歇根大学机器人系)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 FLEX数据集通过多模态融合和结构化知识图谱提升健身动作质量评估的准确性与解释性,支持跨模态预测和生物力学导向的表示学习。

Comments Dataset and code are available at https://github.com/HaoYin116/FLEX . Link to Project page https://haoyin116.github.io/FLEX_Dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02578 2026-04-06 cs.MA cs.AI cs.CL cs.GT 57%

High Volatility and Action Bias Distinguish LLMs from Humans in Group Coordination

高波动性和行动偏差区分LLMs与人类在群体协调中的表现

Sahaj Singh Maini, Robert L. Goldstone, Zoran Tiganj

机构 * Department of Computer Science, Indiana University Bloomington(印第安纳大学布卢明顿分校计算机科学系) Cognitive Science Program, Indiana University Bloomington(印第安纳大学布卢明顿分校认知科学项目) Department of Psychological and Brain Sciences, Indiana University Bloomington(印第安纳大学布卢明顿分校心理与脑科学系)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 研究通过群体二进制搜索游戏比较LLMs与人类在群体协调中的表现,发现LLMs在适应性和稳定性上不如人类,且反馈信息对人类影响大而对LLMs影响小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03139 2026-04-06 cs.RO 50%

FSUNav: A Cerebrum-Cerebellum Architecture for Fast, Safe, and Universal Zero-Shot Goal-Oriented Navigation

FSUNav: 一种用于快速、安全和通用零样本目标导向导航的脑皮层-小脑架构

Mingao Tan, Yiyang Li, Shanze Wang, Xinming Zhang, Wei Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) College of Information Science and Technology, Eastern Institute of Technology(东方理工学院信息科学与技术学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出FSUNav架构,通过整合视觉语言模型与小脑-脑皮层模块,实现跨异构平台的零样本目标导航,提升效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07553 2026-04-06 cs.CL 50%

VeriOS: Query-Driven Proactive Human-Agent-GUI Interaction for Trustworthy OS Agents

VeriOS: 基于查询的人机GUI交互以实现可信操作系统代理

Zheng Wu, Heyuan Huang, Xingyu Lou, Xiangmou Qu, Pengzhou Cheng, Zongru Wu, Weiwen Liu, Weinan Zhang, Jun Wang, Zhaoxiang Wang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)

AI总结 VeriOS通过引入查询驱动的人机GUI交互框架,提升操作系统代理在不可信环境中的任务完成能力,实验显示其在不可信场景中性能显著提升,同时保持正常场景下的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与鲁棒性 5 篇

2511.17722 2026-04-06 cs.CV 83%

Can Vision-Language Models Count? A Synthetic Benchmark and Analysis of Attention-Based Interventions

视觉-语言模型能计数吗?一个合成基准和基于注意力的干预分析

Saurav Sengupta, Nazanin Moradinasab, Jiebei Liu, Donald E. Brown

机构 * School of Data Science, University of Virginia(弗吉尼亚大学数据科学学院)

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文通过合成基准和注意力干预分析,探讨了视觉-语言模型在计数任务中的表现,揭示了视觉和语言复杂性对计数准确率的影响,并展示了针对性的注意力重加权对计数行为的改进。

Comments Accepted at COGVL Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02543 2026-04-06 cs.CV cs.LG 82%

Overconfidence and Calibration in Medical VQA: Empirical Findings and Hallucination-Aware Mitigation

过度自信与校准在医学视觉问答中的研究:实证发现与幻觉意识缓解

Ji Young Byun, Young-Jin Park, Jean-Philippe Corbeil, Asma Ben Abacha

机构 * Johns Hopkins University, School of Medicine(约翰霍普金斯大学医学院) Massachusetts Institute of Technology(麻省理工学院) Microsoft Healthcare & Life Sciences(微软医疗健康与生命科学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);LLaVA(abstract);visual question answering(abstract)

AI总结 本文研究了医学VQA中VLMs的过度自信问题,发现校准方法如Platt缩放能有效提升校准精度,但无法提升预测区分度,提出幻觉意识校准方法以提高可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03045 2026-04-06 cs.CV cs.MM 57%

STEAR: Layer-Aware Spatiotemporal Evidence Intervention for Hallucination Mitigation in Video Large Language Models

STEAR:面向视频大语言模型的层感知时空证据干预以缓解幻觉

Linfeng Fan, Yuan Tian, Ziwei Li, Zhiwu Lu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV

AI总结 STEAR通过层感知的时空证据干预框架,缓解视频大语言模型中的空间和时间幻觉,提升解码的准确性与一致性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17714 2026-04-06 cs.AI 57%

From Virtual Environments to Real-World Trials: Emerging Trends in Autonomous Driving

从虚拟环境到现实世界试验:自动驾驶领域新兴趋势

A. Humnabadkar, A. Sikdar, B. Cave, H. Zhang, N. Bessis, A. Behera

机构 * Edge Hill University(埃奇希尔大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 本文综述了自动驾驶、模拟技术和合成数据集的最新发展,探讨了合成数据在感知与规划中的应用、数字孪生模拟系统验证以及领域适应策略,分析了基准设计趋势及关键挑战,旨在推动安全、可推广的自动驾驶系统发展。

Comments Accepted manuscript - Transactions on Intelligent Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21584 2026-04-06 cs.CV 57%

TARS: MinMax Token-Adaptive Preference Strategy for Hallucination Reduction in MLLMs

TARS:最小最大令牌自适应偏好策略用于减少多模态大语言模型中的幻觉

Kejia Zhang, Keda Tao, Zhiming Luo, Chang Liu, Jiasheng Tang, Huan Wang

机构 * Xiamen University(厦门大学) Westlake University(西湖大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) AWS AI Lab, Amazon(亚马逊AWS AI实验室) Hupan Laboratory(湖畔实验室)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 TARS通过最小最大优化问题重构直接偏好优化,通过对抗性令牌扰动减少多模态大语言模型中的幻觉,通过频域对齐损失提升隐藏表征,优于标准DPO并超越数据增强方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. VLM训练与架构 15 篇

2604.02816 2026-04-06 cs.CV cs.AI 86%

QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models

QAPruner: 量化感知的多模态大语言模型视觉标记剪枝

Xinhao Wang, Zhonyu Xia, Zhiwei Lin, Zhe Li, Yongtao Wang

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出QAPruner框架,通过结合量化误差模拟与异常强度指标,实现多模态大语言模型的视觉标记剪枝与后训练量化联合优化,提升低比特下的推理精度。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18545 2026-04-06 cs.CV cs.AI 81%

CoDA: Exploring Chain-of-Distribution Attacks and Post-Hoc Token-Space Repair for Medical Vision-Language Models

CoDA:探索链式分布攻击及事后令牌空间修复用于医疗视觉-语言模型

Xiang Chen, Fangfang Yang, Chunlei Meng, Yuxian Dong, Ang Li, Yiwei Wei, Jiahuan Long, Jiujiang Guo, Chengyin Hu

专题命中 VLM训练与架构 :vision-language model(title);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CoDA框架,通过构建临床合理的流程偏移,评估医疗视觉-语言模型在真实临床工作流中的可靠性,发现零样本性能显著下降,并引入事后修复策略提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02956 2026-04-06 cs.CV 79%

Collaborative Multi-Mode Pruning for Vision-Language Models

多模式协作剪枝用于视觉-语言模型

Zimeng Wu, Yunhong Wang, Donghao Wang, Jiaxin Chen

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出CoMP框架,通过联合参数和token剪枝,解决单一模式剪枝导致的性能下降问题,通过协作重要性度量和多模式剪枝策略提升高剪枝率下的模型性能。

Comments CVPR2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03231 2026-04-06 cs.CV 77%

CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning

CoME-VL:扩展互补多编码视觉语言学习

Ankan Deria, Komal Kumar, Xilin He, Imran Razzak, Hisham Cholakkal, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出CoME-VL框架,通过融合对比学习和自监督编码器提升视觉语言模型性能,实验显示在多个基准上优于单编码基线。

Comments 16 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20554 2026-04-06 cs.CV 74%

When Negation Is a Geometry Problem in Vision-Language Models

当否定是在视觉-语言模型中一个几何问题

Fawaz Sammani, Tzoulio Chamiti, Paul Gavrikov, Nikos Deligiannis

机构 * ETRO Department, Vrije Universiteit Brussel(布鲁塞尔自由大学ETRO系) imec Independent Researcher(独立研究员)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV

AI总结 本文探讨了视觉-语言模型中否定理解的几何问题,提出基于多模态大语言模型的评估框架,并通过表示工程操控CLIP模型实现否定意识。

Comments Accepted to CVPR (Multimodal Algorithmic Reasoning Workshop) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02870 2026-04-06 cs.CV 72%

Token Warping Helps MLLMs Look from Nearby Viewpoints

令牌扭曲帮助多模态大语言模型从近处视角观察

Phillip Y. Lee, Chanho Park, Mingue Park, Seungwoo Yoo, Juil Koo, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

专题命中 VLM训练与架构 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV;MLLM(comments)

AI总结 本文研究令牌扭曲如何帮助多模态大语言模型从近处视角理解场景,发现反向令牌扭曲在视角变化中更稳定且能更好保持语义一致性。

Comments CVPR 2026, Project Page: https://token-warping-mllm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03114 2026-04-06 cs.CV cs.AI 62%

Can VLMs Truly Forget? Benchmarking Training-Free Visual Concept Unlearning

VLMs真的能忘记吗?基于免训练的视觉概念反向学习基准测试

Zhangyun Tan, Zeliang Zhang, Susan Liang, Yolo Yunlong Tang, Lisha Chen, Chenliang Xu

机构 * University of Rochester(罗切斯特大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLM-UnBench,首个评估VLM免训练视觉概念反向学习的基准,通过四层遗忘等级、七源数据集和十一概念轴,验证提示对概念抑制的真实效果,发现对象和场景概念最难抑制,提示级抑制与真实视觉概念擦除存在明显差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02689 2026-04-06 cs.CV cs.AI 62%

Efficient3D: A Unified Framework for Adaptive and Debiased Token Reduction in 3D MLLMs

Efficient3D: 一种用于3D多模态大语言模型中自适应和去偏token减少的统一框架

Yuhui Lin, Siyue Yu, Yuxing Yang, Guangliang Cheng, Jimin Xiao

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学) University of Liverpool(利物浦大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Efficient3D框架,通过去偏视觉token重要性估计器和自适应token再平衡策略,实现3D MLLMs的高效推理,提升性能并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02477 2026-04-06 cs.CV cs.LG 62%

Guideline2Graph: Profile-Aware Multimodal Parsing for Executable Clinical Decision Graphs

Guideline2Graph:面向可执行临床决策图的多模态解析

Onur Selim Kilic, Yeti Z. Gurbuz, Cem O. Yaldiz, Afra Nawar, Etrit Haxholli, Ogul Can, Eli Waxman

机构 * Georgia Institute of Technology(佐治亚理工学院) MetaDialog Infuse Inc(Infuse公司)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出一种多模态解析方法,通过拓扑感知分块、接口约束分块生成和溯源保留的全局聚合,将完整指南证据转换为可执行临床决策支持图。实验表明,该方法在前列腺指南基准上显著提升了精度和召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08980 2026-04-06 cs.CV cs.AI 62%

Training Multi-Image Vision Agents via End2End Reinforcement Learning

通过端到端强化学习训练多图像视觉代理

Chengqi Dong, Chuhuai Yue, Hang He, Rongge Mao, Fenghe Tang, S Kevin Zhou, Zekun Xu, Xiaohan Wang, Jiajun Chai, Guojun Yin

机构 * MeiTuan(美团) University of Science and Technology of China(中国科学技术大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出IMAgent,通过端到端强化学习训练视觉代理,解决多图像问答任务中的输入限制问题,通过设计视觉反思和验证工具提升模型注意力,首次从注意力角度揭示工具使用对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03172 2026-04-06 cs.CV 57%

EffiMiniVLM: A Compact Dual-Encoder Regression Framework

EffiMiniVLM:一种紧凑的双编码回归框架

Yin-Loon Khor, Yi-Jie Wong, Yan Chai Hum

机构 * Universiti Malaya(马来亚大学) Universiti Tunku Abdul Rahman(拉曼大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出EffiMiniVLM,一种紧凑的双编码回归框架,通过高效网络和轻量级回归头,在冷启动场景中实现高质量产品预测,具有低资源消耗和高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03072 2026-04-06 cs.CV 57%

MI-Pruner: Crossmodal Mutual Information-guided Token Pruner for Efficient MLLMs

MI-Pruner:跨模态互信息引导的令牌修剪器用于高效的大语言模型

Jiameng Li, Aleksei Tiulpin, Matthew B. Blaschko

机构 * Faculty of Medicine, University of Oulu, Finland(芬兰奥卢大学医学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出MI-Pruner,通过计算视觉与文本特征间的互信息来指导令牌修剪,无需依赖注意力机制,实现高效的大语言模型推理。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02973 2026-04-06 cs.CV 57%

Exploring Motion-Language Alignment for Text-driven Motion Generation

探索文本与运动对齐以实现文本驱动的运动生成

Ruxi Gu, Zilei Wang, Wei Wang

机构 * Department of Automation, University of Science and Technology of China(中国科学技术大学自动化系) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,北京通用人工智能研究院)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 本文提出MLA-Gen框架,通过整合全局运动先验与局部条件,提升文本驱动运动生成的对齐精度,并引入SinkRatio指标解决注意力集中问题,提升运动质量和语义对齐。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23032 2026-04-06 cs.CV cs.RO 57%

Generative Event Pretraining with Foundation Model Alignment

基于基础模型对齐的生成事件预训练

Jianwen Cao, Jiaxu Xing, Nico Messikommer, Davide Scaramuzza

机构 * Robotics and Perception Group, University of Zurich(苏黎世大学机器人感知组)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 本文提出GEP框架,通过将互联网级图像数据集中的语义知识迁移到事件数据,并学习事件特有的时间动态,提升事件视觉基础模型在跨任务迁移学习中的性能。

Journal ref CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11538 2026-04-06 cs.IR 50%

Dual-Perspective Disentangled Multi-Intent Alignment for Enhanced Collaborative Filtering

双视角解耦多意图对齐用于增强协同过滤

Shanfan Zhang, Yongyi Lin, Yuan Rao, Bingcan Xia, Tingting Xin, Chenlong Zhang

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文提出DMICF框架,通过双视角解耦多意图对齐方法,提升协同过滤的推荐效果,解决异构交互信号纠缠导致的语义模糊、鲁棒性差和可解释性不足问题。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他VLM 2 篇

2604.00799 2026-04-06 cs.CV cs.CL cs.LG 62%

Multimodal Language Models Cannot Spot Spatial Inconsistencies

多模态语言模型无法发现空间不一致性

Om Khangaonkar, Hadi J. Rad, Hamed Pirsiavash

机构 * University of California, Davis(加州大学戴维斯分校) Shell(壳牌) TU Delft(代尔夫特理工大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 研究探讨多模态大语言模型在识别3D几何空间不一致性方面的不足,提出生成空间不一致图像对的方法,发现先进模型在该任务上表现欠佳,揭示其对物理世界理解的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03016 2026-04-06 cs.AI 57%

Agentic-MME: What Agentic Capability Really Brings to Multimodal Intelligence?

Agentic-MME:代理能力为多模态智能带来了什么?

Qianshan Wei, Yishan Yang, Siyi Wang, Jinglin Chen, Binyu Wang, Jiaming Wang, Shuang Chen, Zechen Li, Yang Shi, Yuqi Tang, Weining Wang, Yi Yu, Chaoyou Fu, Qi Li, Yi-Fan Zhang

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学院大学) SEU(东南大学) NJU(南京大学) PKU(北京大学) BUAA(北京航空航天大学) NTU(南洋理工大学) UCLA(加州大学洛杉矶分校)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 Agentic-MME通过418个真实任务评估多模态代理能力,采用过程验证方法,量化效率并验证工具调用准确性,实验显示模型在复杂任务中表现显著下降。

详情

展开后加载摘要…

URL PDF HTML 收藏