arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-21 至 2026-04-21 共收录 14 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 14 篇

2604.17190 2026-04-21 cs.CV 84%

LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation

LookasideVLN: 基于方向的空中视觉与语言导航

Yuwei Ning, Ganlong Zhao, Yipeng Qin, Si Liu, Yang Liu, Liang Lin, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学) Centre for Perceptual and Interactive Intelligence(感知与交互智能中心) Cardiff University(卡迪夫大学) Beihang University(北航) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室)

专题命中 多模态Agent :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出LookasideVLN,通过利用自然语言中的方向线索提升空中视觉与语言导航的准确性和效率,采用方向感知图、空间地标知识库和方向MLLM导航代理三种核心组件。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17611 2026-04-21 cs.LG cs.AI 79%

STEP-PD: Stage-Aware and Explainable Parkinson's Disease Severity Classification Using Multimodal Clinical Assessments

STEP-PD:基于多模态临床评估的阶段感知和可解释性帕金森病严重程度分类

Md Mezbahul Islam, John Michael Templeton, Christian Poellabauer, Ananda Mohan Mondal

机构 * School of Computing & Information Sciences, Florida International University(佛罗里达国际大学计算机与信息科学学院) College of AI, Cybersecurity and Computing, University of South Florida(佛罗里达州立大学人工智能、网络安全与计算学院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出STEP-PD框架,利用PPMI数据中的多模态临床评估,通过SHAP解释性方法实现帕金森病严重程度的可解释分类,XGBoost在多种任务中表现出高准确性和稳定性。

Comments 10 pages, 6 figures, 4 tables, accepted at IEEE International Conference on Healthcare Informatics (ICHI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17503 2026-04-21 cs.AI cs.MA 79%

SkillGraph: Self-Evolving Multi-Agent Collaboration with Multimodal Graph Topology

SkillGraph: 基于多模态图拓扑的自进化多智能体协作

Zheng Nie, Ruolin Shen, Xinlei Yu, Bo Yin, Jiangning Zhang, Xiaobin Hu

机构 * National University of Singapore, Singapore(新加坡国立大学) Technical University of Munich, Munich, Germany(慕尼黑技术大学) Zhejiang University, China(浙江大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 SkillGraph通过联合进化智能体能力与通信拓扑,解决视觉多智能体系统中固定拓扑和静态推理能力的问题,提升协作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19237 2026-04-21 cs.AI cs.RO 79%

Sensorimotor Self-Recognition in Multimodal Large Language Model-Driven Robots

多模态大语言模型驱动机器人中的躯体自我识别

Iñaki Dellibarda Varela, Pablo Romero-Sorozabal, Diego Torricelli, Gabriel Delgado-Oleas, Jose Ignacio Serrano, Maria Dolores del Castillo Sobrino, Eduardo Rocon, Manuel Cebrian

机构 * Center for Automation and Robotics(自动化与机器人中心) University of Azuay(阿祖亚大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文研究多模态大语言模型通过躯体运动经验发展自我识别能力,展示机器人在环境感知、自我识别和预测意识方面的表现,揭示感觉整合对最小自我的影响及记忆协调机制。

Comments 16 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16584 2026-04-21 cs.SE cs.AI cs.PL 79%

Certified Program Synthesis with a Multi-Modal Verifier

带有多模验证器的认证程序合成

Yueyang Feng, Dipesh Kafle, Vladimir Gladshtein, Vitaly Kurin, George Pîrlea, Qiyuan Zhao, Peter Müller, Ilya Sergey

机构 * National University of Singapore(新加坡国立大学) Neapolis University Pafos(纳皮奥斯大学帕福斯)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出LeetProof,通过多模验证器解决认证程序合成中的规范缺陷和验证模式碎片化问题,实现更高效的全认证解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16333 2026-04-21 cs.LG cs.AI 79%

A Discordance-Aware Multimodal Framework with Multi-Agent Clinical Reasoning

一种考虑不一致性的多模态框架与多智能体临床推理

Pegah Ahadian, Mingrui Yang, Sixu Chen, Xiaojuan Li, Qiang Guan

机构 * Department of Computer Science(计算机科学系) Kent State University(肯特州立大学) Department of Biomedical Engineering(生物医学工程系) Cleveland Clinic(克利夫兰诊所)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种结合机器学习模型与多智能体推理系统的多模态框架,用于预测膝骨关节炎的进展并生成临床管理建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17459 2026-04-21 cs.IR 78%

Transparent and Controllable Recommendation Filtering via Multimodal Multi-Agent Collaboration

通过多模态多智能体协作实现透明且可控的推荐过滤

Chi Zhang, Zhipeng Xu, Jiahao Liu, Dongsheng Li, Hansu Gu, Peng Zhang, Ning Gu, Tun Lu

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本文提出一种结合端到云协作、多模态感知和多智能体编排的框架,有效减少推荐系统中的过度关联和误报,提升用户控制和透明度。

Comments 14 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18484 2026-04-21 cs.CV cs.MM cs.RO 62%

XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments

XEmbodied:一种具有增强几何和物理线索的大型规模具身环境基础模型

Kangan Qian, ChuChu Xie, Yang Zhong, Jingrui Pang, Siwen Jiao, Sicong Jiang, Zilin Huang, Yunlong Wang, Kun Jiang, Mengmeng Yang, Hao Ye, Guanghao Zhang, Hangjun Ye, Guang Chen, Long Chen, Diange Yang

机构 * Tsinghua University(清华大学) Automotive and Robotics, Xiaomi Corporation(小鹏汽车与机器人部,小鹏科技) National University of Singapore(新加坡国立大学) McGill University(麦吉尔大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 多模态Agent :image-text(abstract);分类 cs.CV、cs.MM

AI总结 XEmbodied通过整合3D几何表示和物理线索,提升视觉-语言-动作模型在大规模具身环境中的空间推理和语义理解能力,其在18个公开基准测试中表现出色。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21064 2026-04-21 cs.AI cs.CV 62%

OVOD-Agent: A Markov-Bandit Framework for Proactive Visual Reasoning and Self-Evolving Detection

OVOD-Agent:一种用于主动视觉推理和自进化检测的马尔可夫-多臂框架

Chujie Wang, Jianyu Lu, Zhiyuan Luo, Xi Chen, Chu He

机构 * Wuhan University(武汉大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出OVOD-Agent框架,通过将文本优化扩展为可解释的视觉CoT,结合弱马尔可夫决策过程和多臂模块,实现主动视觉推理和自进化检测,提升稀有类别检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16331 2026-04-21 cs.RO cs.AI cs.CV cs.MA 62%

BrainMem: Brain-Inspired Evolving Memory for Embodied Agent Task Planning

BrainMem: 为具身智能任务规划设计的脑启发式记忆系统

Xiaoyu Ma, Lianyu Hu, Wenbing Tang, Zixuan Hu, Zeqin Liao, Zhizhen Wu, Yang Liu

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Tianjin University, Tianjin, China(天津大学,天津,中国)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出BrainMem,一种无训练的分层记忆系统,通过构建知识图谱和符号指南,提升具身智能在复杂环境中的任务规划能力,尤其在长周期和空间复杂任务中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05508 2026-04-21 cs.CV cs.CL 62%

Enabling Stroke-Level Structural Analysis of Hieroglyphic Scripts without Language-Specific Priors

无需语言特定先验知识实现象形文字脚本级别的结构分析

Fuwen Luo, Zihao Wan, Ziyue Wang, Yaluo Liu, Pau Tong Lin Xu, Xuanjia Qiao, Xiaolong Wang, Peng Li, Yang Liu

机构 * THUNLP-MT(清华大学自然语言处理实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出HieroSA框架,使多模态大语言模型能自动从字符位图中提取脚本级结构,无需人工数据,实现跨语言通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06812 2026-04-21 cs.AI cs.CY cs.LG 57%

Generative midtended cognition and Artificial Intelligence. Thinging with thinging things

生成性中介认知与人工智能。思考与思考之物

Xabier E. Barandiaran, Marta Pérez-Verdugo

机构 * IAS-Research Centre for Life, Mind and Society, Dept. Philosophy, UPV/EHU, University of the Basque Country, Donostia, Gipuzkoa (Spain)(生命、心智与社会研究中心,哲学系,巴斯克大学,Donostia, Gipuzkoa (西班牙))

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文探讨生成性中介认知概念,分析生成AI与人类认知的结合,提出该认知类型更接近社会认知而非传统扩展认知,并定义了生成性中介认知的两个维度:宽度和深度。

Comments 16 pages, 2 figures. Post-print of article published in Synthese. The final published version is available open access at https://doi.org/10.1007/s11229-025-04961-4

Journal ref Synthese 205 (2025) 137

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16541 2026-04-21 cs.CV 57%

BOOKAGENT: Orchestrating Safety-Aware Visual Narratives via Multi-Agent Cognitive Calibration

BOOKAGENT:通过多智能体认知校准 orchestrate 安全意识的视觉叙述

Bo Gao, Chang Liu, Yuyang Miao, Siyuan Ma, Ser-Nam Lim

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Science and Technology of China(中国科学技术大学) Imperial College London(伦敦帝国理工学院) Nanyang Technological University(南洋理工大学) University of Central Florida(佛罗里达中央大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 本文提出BOOKAGENT,一种安全意识的多智能体协作框架,用于高质量的视觉叙述生成,通过联合规划、脚本、插图和全局修复不一致,提升叙述连贯性和视觉一致性。

Comments 18 pages, Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16571 2026-04-21 cs.AR cs.SE 50%

EquivFusion: Unifying Hardware Equivalence Checking from Algorithms to Netlists via MLIR

EquivFusion:通过MLIR统一算法到网络列表的硬件等价性检查

Jiaying Zhu, Baoqi Zhang, Mengxia Tao, Kezhi Li, Hao Yan, Qiang Xu, Min Li

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出EquivFusion工具,通过MLIR统一多模态电路设计的算法与硬件等价性检查,解决软件与硬件之间语义差距的问题。

Comments Accepted to FSE 2026 (Tool Demonstration Track)

详情

展开后加载摘要…

URL PDF HTML 收藏