arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2773 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2773 篇

2605.00370 2026-05-12 cs.LG cs.CY cs.MM 70%

Group Cognition Learning: Making Everything Better Through Governed Two-Stage Agents Collaboration

群体认知学习:通过受控的双阶段智能体协作使一切变得更好

Chunlei Meng, Pengbin Feng, Rong Fu, Hoi Leong Lee, Xiaojing Du, Zhaolu Kang, Zeyu Zhang, Weilin Zhou, Chun Ouyang, Zhongxue Gan

机构 * University of Macau(澳门大学) Universiti Malaysia Perlis(马来西亚霹雳大学) Peking University(北京大学) Xinjiang University(新疆大学)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出群体认知学习框架,通过双阶段智能体协作解决多模态学习中的模态主导和虚假耦合问题,实验表明其在回归和分类任务中达到最优性能。

Comments This study has been Accepted by ICML 2026. The current version is a manuscript, please refer to the official version released at ICML 2026 for the final published version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16571 2026-05-11 cs.AI cs.IR cs.MA 70%

LLM-Based Agents for Competitive Landscape Mapping in Drug Asset Due Diligence

基于大语言模型的竞品映射 agent 在药物资产尽调中的应用

Vlad Vinogradov, Alisa Vinogradova, Dmitrii Radkevich, Ilya Yasny, Dmitry Kobyzev, Ivan Izmailov, Katsiaryna Yanchanka, Roman Doronin, Andrey Doronichev

机构 * LanceBio Ventures AI Expert

专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract);分类 cs.AI

AI总结 本文提出一种基于大语言模型的竞品发现 agent,通过结构化数据处理提升药物资产尽调效率,实现竞品检索与属性标准化,实验结果显示其召回率优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16918 2026-04-29 cs.CV 70%

AdaTooler-V: Adaptive Tool-Use for Images and Videos

AdaTooler-V:面向图像和视频的自适应工具使用

Chaoyang Wang, Kaituo Feng, Dongyang Chen, Zhongyu Wang, Zhixun Li, Sicheng Gao, Meng Meng, Xu Zhou, Manyuan Zhang, Yuzhang Shang, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学MML实验室) THU(清华大学) SJTU(上海交通大学) DB Group, CUHK(香港中文大学DB小组) UCF(佛罗里达大学) Sangfor(Sangfor公司) JMU(约翰·霍普金斯大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出AdaTooler-V,通过自适应工具使用提升多模态大语言模型的视觉推理能力,通过强化学习算法和定制数据集优化工具调用策略,实验证明其在多种视觉任务中表现优异。

Comments ACL 2026 Findings, Project page: https://github.com/CYWang735/AdaTooler-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23392 2026-04-28 cs.AI 70%

SoccerRef-Agents: Multi-Agent System for Automated Soccer Refereeing

SoccerRef-Agents: 多智能体系统用于自动足球裁判

Zi Meng, Wanli Song, Yi Hu, Jiayuan Rao, Gang Chen

机构 * University of Michigan(密歇根大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出SoccerRef-Agents多智能体系统,通过构建多模态基准和知识库,提升足球裁判决策的准确性和可解释性。

Comments 26 pages, 8 figures. Submitted to ISACE 2026. Github Repo: https://github.com/yjlog/SoccerRef-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10139 2026-04-28 cs.CR cs.AI 70%

Anonymization-Enhanced Privacy Protection for Mobile GUI Agents: Available but Invisible

增强隐私保护的移动GUI代理:可用但不可见

Lepeng Zhao, Zhenhua Zou, Shuo Li, Zhuotao Liu

机构 * Tsinghua University(清华大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 本文提出一种基于匿名化的隐私保护框架,通过检测敏感UI内容并替换为非识别性占位符,实现敏感信息在任务执行中可用但不可见,减少隐私泄露同时保持代理的无缝使用。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22558 2026-04-27 cs.LG cs.AI 70%

SOLAR-RL: Semi-Online Long-horizon Assignment Reinforcement Learning

SOLAR-RL:半在线长 horizon 分配强化学习

Jichao Wang, Liuyang Bian, Yufeng Zhou, Han Xiao, Yue Pan, Guozhi Wang, Hao Wang, Zhaoxiong Wang, Yafei Wen, Xiaoxin Chen, Shuai Ren, Lingfang Zeng

机构 * vivo AI Lab(vivo人工智能实验室) Zhejiang Lab(浙江实验室) CUHK MMLab(香港大学多模态实验室) Hubei University(湖北省大学) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.AI

AI总结 SOLAR-RL通过整合全局轨迹信息到离线学习中,提升GUI任务的长horizon完成率和鲁棒性,提供高效样本利用的自主导航方案。

Comments 14 pages, 11 figures. Accepted to Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11585 2026-04-14 cs.CV cs.RO 70%

GeomPrompt: Geometric Prompt Learning for RGB-D Semantic Segmentation Under Missing and Degraded Depth

GeomPrompt:用于在缺失和退化深度下的RGB-D语义分割的几何提示学习

Krishna Jaganathan, Patricio Vela

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 GeomPrompt通过从RGB生成任务驱动的几何提示,提升RGB-D语义分割在缺失和退化深度下的性能,同时比单目深度估计器更高效。

Comments Accepted to the CVPR 2026 URVIS Workshop. Project page: https://geomprompt.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02241 2026-04-13 cs.CV cs.RO 70%

UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models

UAV-Track VLA: 通过视觉-语言-动作模型实现具身空中跟踪

Qiyao Zhang, Shuhua Zheng, Jianli Sun, Chengxiang Li, Xianke Wu, Zihan Song, Zhiyong Cui, Yisheng Lv, Yonglin Tian

机构 * Beijing Institute of Technology(北京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Sanya(三亚学院) Beijing University of Posts and Telecommunications(北京邮电大学) Hunan University(湖南大学) Beihang University(北京航空航天大学) Flying Intelligence Team (Virtual Research Community)(飞行智能团队(虚拟研究社区))

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出UAV-Track VLA模型,通过视觉-语言-动作融合解决动态城市场景中的具身跟踪问题,提升UAV的实时控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07432 2026-04-08 cs.AI 70%

TS-Agent: Understanding and Reasoning Over Raw Time Series via Iterative Insight Gathering

TS-Agent:通过迭代洞察获取理解并推理原始时间序列

Penghang Liu, Elizabeth Fons, Annita Vapsi, Mohsen Ghassemi, Svitlana Vyetrenko, Daniel Borrajo, Vamsi K. Potluru, Manuela Veloso

机构 * JPMorgan AI Research, NY, USA(摩根大通人工智能研究院,纽约,美国)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 TS-Agent通过迭代洞察获取机制,在时间序列理解和推理任务中匹配或超越文本、视觉及时间序列语言模型基线,尤其在零样本设置下表现更优。

Comments NeurIPS 2025 Workshop on Foundations of Reasoning in Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10610 2026-04-08 cs.CR cs.AI 70%

LaSM: Layer-wise Scaling Mechanism for Defending Pop-up Attack on GUI Agents

LaSM:用于防御GUI代理中弹出攻击的分层缩放机制

Zihe Yan, Jiaping Gui, Zhuosheng Zhang, Gongshen Liu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出LaSM机制,通过分层放大关键层的注意力和MLP模块,提升模型对任务相关区域的对齐性,有效防御弹出攻击,同时不影响模型整体能力。

Comments Accepted by CVPR-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02794 2026-04-06 cs.AI 70%

CharTool: Tool-Integrated Visual Reasoning for Chart Understanding

CharTool: 集成工具的视觉推理用于图表理解

Situo Zhang, Yifan Zhang, Zichen Zhu, Da Ma, Lei Pan, Danyang Zhang, Zihan Zhao, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院X-LANCE实验室) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) Suzhou Laboratory(苏州实验室) AISpeech Co., Ltd.(思必驰科技股份有限公司)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出CharTool,通过集成工具提升多模态大语言模型对图表的理解能力,通过双重数据管道和代理强化学习,在六个图表基准测试中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21341 2026-03-24 cs.AI 70%

RoboAlign: Learning Test-Time Reasoning for Language-Action Alignment in Vision-Language-Action Models

RoboAlign:学习测试时推理以改进视觉-语言-动作模型中的语言-动作对齐

Dongyoung Kim, Sumin Park, Woomin Song, Seungku Kim, Taeyoung Kim, Huiwon Jang, Jinwoo Shin, Jaehyung Kim, Younggyo Seo

机构 * Yonsei University(延世大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出RoboAlign框架,通过零样本自然语言推理生成动作标记并结合强化学习提升动作准确性,从而在视觉-语言-动作模型中实现语言与低级动作之间的对齐,提升模型性能。

Comments 15 pages, 7 figures, 9 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00171 2026-03-23 cs.CV 70%

CompAgent: An Agentic Framework for Visual Compliance Verification

CompAgent:一种用于视觉合规验证的代理框架

Rahul Ghosh, Baishali Chaudhury, Hari Prasanna Das, Meghana Ashok, Ryan Razkenari, Long Chen, Sungmin Hong, Chun-Hao Liu

机构 * Generative AI Innovation Center(生成式人工智能创新中心) Amazon Web Services(亚马逊网络服务)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出CompAgent,一种基于代理的视觉合规验证框架,通过集成视觉工具和规划代理,提升多模态推理能力,在公开基准测试中取得76%的F1分数,优于现有方法。

Comments Accepted to IEEE CVPR 2026 GRAIL-V Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15039 2026-03-17 cs.CV 70%

GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents

GUI-CEval: 一种用于移动GUI代理的分层和全面的中文基准

Yang Li, Yuchen Liu, Haoyu Lu, Zhiqiang Xia, Hongzhen Wang, Kaiyang Han, Changpeng Yang, Jinyang Wu, Jiaming Xu, Runyu Shi, Ying Huang

机构 * HyperAI Team, Xiaomi Corporation(HyperAI团队,小米公司)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出GUI-CEval,首个针对中文移动GUI代理的全面基准,涵盖201款主流应用,通过分层结构评估感知、规划、反思、执行和评估五方面能力,验证模型在真实交互中的表现。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12597 2026-03-16 cs.LG cs.AI cs.HC cs.MA cs.SE 70%

Feynman: Knowledge-Infused Diagramming Agent for Scalable Visual Designs

Feynman: 一种融合知识的图表生成代理,用于可扩展的视觉设计

Zixin Wen, Yifu Cai, Kyle Lee, Sam Estep, Josh Sunshine, Aarti Singh, Yuejie Chi, Wode Ni

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态Agent :multi-modal(abstract);image-text(abstract);分类 cs.AI

AI总结 本文提出Feynman代理,通过知识组件枚举和代码规划生成高质量图表-描述对,构建了可扩展的图表生成流水线,并创建了视觉语言基准Diagramma。

Comments A previous version was submitted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18064 2026-03-10 cs.CV 70%

3DMedAgent: Unified Perception-to-Understanding for 3D Medical Analysis

3DMedAgent:面向3D医学分析的统一感知-理解框架

Ziyue Wang, Linghan Cai, Chang Han Low, Haofeng Liu, Junde Wu, Jingyu Wang, Rui Wang, Lei Song, Jiang Bian, Jingjing Fu, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) Microsoft Research(微软研究院) TUD Dresden University of Technology(德累斯顿技术大学) University of Oxford(牛津大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 3DMedAgent通过统一框架实现2D MLLMs在3D医学分析中的高效处理,无需3D特定微调,提升3D医学图像的感知与理解能力。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02951 2026-03-10 cs.LG cs.CV 70%

CGL: Advancing Continual GUI Learning via Reinforcement Fine-Tuning

CGL: 通过强化微调推进连续GUI学习

Zhenquan Yao, Zitong Huang, Yihan Zeng, Jianhua Han, Hang Xu, Chun-Mei Feng, Jianwei Ma, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Noah’s Ark Lab(华为诺亚实验室) University College Dublin(都柏林大学) Peking University(北京大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 CGL通过强化微调与监督微调的协同优化,解决GUI连续学习中遗忘旧任务的问题,提出AndroidControl-CL基准验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05535 2026-03-09 eess.IV cs.CV cs.LG 70%

Clinical-Injection Transformer with Domain-Adapted MAE for Lupus Nephritis Prognosis Prediction

具有领域适应MAE的临床注射变换器用于系统性红斑狼疮肾炎的预后预测

Yuewen Huang, Zhitao Ye, Guangnan Feng, Fudan Zheng, Xia Gao, Yutong Lu

机构 * Sun Yat-sen University Department of Nephrology, Guangzhou Women Children's Medical Center, Guangzhou Medical University, Guangzhou, China

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本研究提出了一种多模态计算病理学框架,利用临床数据和常规染色活检,通过临床注射变换器和领域适应MAE实现儿童系统性红斑狼疮肾炎预后预测的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04819 2026-03-06 cs.RO cs.AI cs.LG 70%

On the Strengths and Weaknesses of Data for Open-set Embodied Assistance

关于数据在开放集具身助益中的优势与劣势

Pradyumna Tambwekar, Andrew Silva, Deepak Gopinath, Jonathan DeCastro, Xiongyi Cui, Guy Rosman

专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 本文研究了多模态基础模型在开放集辅助任务中的泛化能力,通过合成数据集评估模型在新用户行为和新配置中的表现,揭示了辅助数据集设计对模型性能的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22939 2026-03-02 cs.CV 70%

ColaVLA: Leveraging Cognitive Latent Reasoning for Hierarchical Parallel Trajectory Planning in Autonomous Driving

ColaVLA: 借助认知潜在推理实现自动驾驶中的分层并行轨迹规划

Qihang Peng, Xuesong Chen, Chenye Yang, Shaoshuai Shi, Hongsheng Li

机构 * Tsinghua University(清华大学) CUHK MMLab(香港中文大学MMLab) Voyager Research, Didi Chuxing(Voyager Research,滴滴出行)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 ColaVLA通过统一视觉-语言-动作框架,解决自动驾驶中轨迹规划的效率与准确性问题,实现高效、安全的多尺度轨迹生成。

Comments CVPR2026(Main Conference). Project page: https://pqh22.github.io/projects/ColaVLA/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15864 2026-02-19 cs.RO cs.CV 70%

ReasonNavi: Human-Inspired Global Map Reasoning for Zero-Shot Embodied Navigation

ReasonNavi: 人类启发的全局地图推理用于零样本具身导航

Yuzhuo Ao, Anbang Wang, Yu-Wing Tai, Chi-Keung Tang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Dartmouth College(达特茅斯学院)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 ReasonNavi通过结合多模态大语言模型与确定性规划器,实现人类启发的全局地图推理,提供无需微调的零样本具身导航解决方案。

Comments 18 pages, 6 figures, Project page: https://reasonnavi.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08368 2026-02-10 cs.MM cs.GR cs.HC cs.MA 70%

T2VTree: User-Centered Visual Analytics for Agent-Assisted Thought-to-Video Authoring

T2VTree: 以用户为中心的视觉分析用于代理辅助的思维到视频创作

Zhuoyun Zheng, Yu Dong, Gaorong Liang, Guan Li, Guihua Shan, Shiyu Cheng, Dong Tian, Jianlong Zhou, Jie Liang

专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract);分类 cs.MM

AI总结 T2VTree通过树形可视化和可编辑代理计划,支持多场景视频创作中的可靠细化、局部比较和实用重用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05863 2026-02-09 cs.LG cs.CL cs.RO 70%

Constrained Group Relative Policy Optimization

带约束的群体相对策略优化

Roger Girgis, Rodrigue de Schaetzen, Luke Rowe, Azalée Robitaille, Christopher Pal, Liam Paull

机构 * Mila - Quebec AI Institute(魁北克AI研究所) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CL

AI总结 本文提出带约束的GRPO,通过拉格朗日松弛解决受约束策略优化问题,实验验证其在网格世界和机器人任务中的有效性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23646 2026-02-06 cs.CV 70%

Active Perception Agent for Omnimodal Audio-Video Understanding

多模态音频视频理解的主动感知代理

Keda Tao, Wenjie Du, Bohan Yu, Weiqiang Wang, Jian Liu, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 OmniAgent通过动态规划和音频引导感知范式,实现多模态细粒度推理,无需训练即超越现有模型性能。

Comments Website:https://kd-tao.github.io/OmniAgent/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04144 2026-02-05 cs.AI cs.LG 70%

OMG-Agent: Toward Robust Missing Modality Generation with Decoupled Coarse-to-Fine Agentic Workflows

OMG-Agent:迈向鲁棒缺失模态生成的解耦粗到细代理工作流

Ruiting Dai, Zheyu Wang, Haoyu Yang, Yihan Liu, Chengzhi Wang, Zekun Zhang, Zishan Huang, Jiaman Cen, Lisi Mo

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.AI

AI总结 OMG-Agent通过解耦粗到细的代理工作流,有效解决多模态数据缺失问题,提升生成的鲁棒性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22528 2026-02-02 cs.AI 70%

Darwinian Memory: A Training-Free Self-Regulating Memory System for GUI Agent Evolution

达尔文记忆:一种无训练的自调节记忆系统用于GUI代理进化

Hongze Mi, Yibo Feng, WenJie Lu, Song Cao, Jinyuan Li, Yanming Li, Xuelin Zhang, Haotian Luo, Songyang Peng, He Cui, Tengfei Tian, Jun Fang, Hua Chai, Naiqiang Tan

机构 * Didichuxing Co. Ltd(滴滴出行有限公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tianjin University(天津大学) Sun Yat-sen University(中山大学) Fudan University(复旦大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.AI

AI总结 达尔文记忆系统通过自进化架构提升GUI代理的执行稳定性与成功率,无需额外训练或架构开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04500 2026-01-09 cs.AI 70%

GUITester: Enabling GUI Agents for Exploratory Defect Discovery

GUITester: 使GUI代理用于探索性缺陷发现

Yifei Gao, Jiang Wu, Xiaoyi Chen, Yifan Yang, Zhe Cui, Tianyi Ma, Jiaming Zhang, Jitao Sang

机构 * Beijing Jiaotong University(北京交通大学) Hithink Research(慧思科技) Nanyang Technological University(南洋理工大学)

专题命中 多模态Agent :multi-modal(abstract);MLLM(abstract);分类 cs.AI

AI总结 GUITester通过解耦导航与验证的多代理框架,有效解决了探索性GUI测试中目标导向遮蔽和执行偏差归因的问题,实现了48.90%的F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24851 2026-01-07 cs.CV cs.RO 70%

VLN-MME: Diagnosing MLLMs as Language-guided Visual Navigation agents

VLN-MME: 诊断MLLMs作为语言引导的视觉导航代理

Xunyi Zhao, Gengze Zhou, Qi Wu

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) Adelaide University(阿德莱德大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 VLN-MME通过统一评估框架揭示MLLMs在具身导航任务中的局限性,发现其3D空间推理能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00598 2026-01-05 cs.CV 70%

Modality Dominance-Aware Optimization for Embodied RGB-Infrared Perception

具身RGB-红外感知的模态主导意识优化

Xianhui Liu, Siqi Jiang, Yi Xie, Yuqing Lin, Siao Liu

机构 * College of Electronics and Information Engineering(电子信息工程学院) School of Computer Science and Technology(计算机科学与技术学院) Department of Electrical and Computer Engineering(电气与计算机工程系) School of Future Science and Engineering(未来科学与工程学院) Key Laboratory of General Artificial Intelligence and Large Models in Provincial Universities(省属大学通用人工智能与大模型重点实验室)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MDACL框架,通过模态主导指数量化模态主导性,结合分层跨模态指导和对抗均衡正则化,有效缓解跨模态融合中的优化偏差,实现SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22009 2025-12-29 cs.CV 70%

iSHIFT: Lightweight Slow-Fast GUI Agent with Adaptive Perception

iSHIFT: 轻量级慢-快 GUI 代理与自适应感知

Sarthak Mehrotra, Sairam V C Rebbapragada, Mani Hemanth Reddy Bonthu, Vineeth N Balasubramanian

机构 * Indian Institute of Technology, Bombay(印度理工学院,孟买) Indian Institute of Technology, Hyderabad(印度理工学院,海得拉巴)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 iSHIFT是一种轻量级GUI代理,通过慢-快混合推理和灵活标记实现高效与精确的视觉交互。

详情

展开后加载摘要…

URL PDF HTML 收藏