arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2766 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2766 篇

2406.13724 2026-05-11 cs.AI 79%

Heterogeneous Graph Neural Networks with Post-hoc Explanations for Multi-modal and Explainable Land Use Inference

异构图神经网络与事后解释方法用于多模态和可解释的土地利用推断

Xuehao Zhai, Junqi Jiang, Adam Dejl, Antonio Rago, Fangce Guo, Francesca Toni, Aruna Sivakumar

机构 * Imperial College London, Department of Civil and Environmental Engineering(帝国理工学院伦敦校区土木与环境工程系) Imperial College London, Department of Computing(帝国理工学院伦敦校区计算机系)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出一种结合异构图神经网络与可解释AI的方法,用于多模态土地利用推断,提升了准确性和可解释性,尤其在办公和生活用地方面表现突出。

Journal ref Information Fusion, Volume 120, 103057. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05499 2026-05-08 cs.AI 79%

FoodCHA: Multi-Modal LLM Agent for Fine-Grained Food Analysis

FoodCHA:多模态LLM代理用于细粒度食物分析

Woojin Lee, Pranav Mekkoth, Ye Tian, Onat Gungor, Tajana Rosing

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 多模态Agent :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 本文提出FoodCHA,一种多模态代理框架,通过分层决策过程提升食物识别的细粒度属性区分能力,实验显示其在类别和子类识别精度上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10887 2026-05-04 cs.AI 79%

InfantAgent-Next: A Multimodal Generalist Agent for Automated Computer Interaction

InfantAgent-Next:一种用于自动化计算机交互的多模态通用代理

Bin Lei, Weitai Kang, Zijian Zhang, Winson Chen, Xi Xie, Shan Zuo, Mimi Xie, Ali Payani, Mingyi Hong, Yan Yan, Caiwen Ding

机构 * University of Minnesota(明尼苏达大学) University of Illinois Chicago(伊利诺伊大学香槟分校) University of Connecticut(康涅狄格大学) The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) Cisco Research(思科研究)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出InfantAgent-Next,一种多模态通用代理,能够通过文本、图像、音频和视频与计算机交互。该代理结合工具型和纯视觉代理,在高度模块化架构中协同解决解耦任务。在OSWorld等基准上取得7.27%准确率,超越Claude-Computer-Use。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22428 2026-04-27 cs.AI 79%

CognitiveTwin: Robust Multi-Modal Digital Twins for Predicting Cognitive Decline in Alzheimer's Disease

CognitiveTwin: 用于预测阿尔茨海默病认知衰退的稳健多模态数字孪生

Bulent Soykan, Gulsah Hancerliogullari Koksalmis, Hsin-Hsiung Huang, Laura J. Brattain

机构 * Department of Mechanical, Industrial & Manufacturing Eng.(机械、工业与制造工程系) The University of Toledo(托莱多大学) Department of Industrial Eng. and Mngt. Systems(工业工程与管理系统系) University of Central Florida(中央佛罗里达大学) Department of Statistics and Data Science(统计与数据科学系) Department of Internal Medicine(内科医学系)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

AI总结 CognitiveTwin通过融合多模态纵向数据预测个体认知轨迹,展现高准确性和公平性,对缺失数据具有鲁棒性,适用于临床试验和个性化医疗。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20486 2026-04-23 cs.CV 79%

ProMMSearchAgent: A Generalizable Multimodal Search Agent Trained with Process-Oriented Rewards

ProMMSearchAgent:一种通过过程导向奖励训练的通用多模态搜索代理

Wentao Yan, Shengqin Wang, Huichi Zhou, Yihang Chen, Kun Shao, Yuan Xie, Zhizhong Zhang

机构 * East China Normal University(东中国师范大学) Shanghai Innovation Institute(上海创新研究院) Huawei Noah's Ark Lab(华为诺亚实验室) Independent Researcher(独立研究者) University College London(伦敦大学学院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出ProMMSearchAgent,通过过程导向奖励解决多模态代理在知识密集型视觉推理中的训练难题,实现零样本迁移至Google搜索API。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18988 2026-04-22 cs.CV 79%

A Multi-Agent Framework with Structured Reasoning and Reflective Refinement for Multimodal Empathetic Response Generation

一种具有结构化推理和反思细化的多智能体框架用于多模态共情响应生成

Liping Wang, Cheng Ye, Weidong Chen, Peipei Song, Bo Hu, Zhendong Mao

机构 * School of Information Science and Technology, USTC(信息科学与技术学院,中国科学技术大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出多智能体框架,通过结构化推理和反思细化提升多模态共情响应生成的准确性与情感感知能力,实验表明优于现有方法。

Comments Submitted to ACM Multimetida 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17611 2026-04-21 cs.LG cs.AI 79%

STEP-PD: Stage-Aware and Explainable Parkinson's Disease Severity Classification Using Multimodal Clinical Assessments

STEP-PD:基于多模态临床评估的阶段感知和可解释性帕金森病严重程度分类

Md Mezbahul Islam, John Michael Templeton, Christian Poellabauer, Ananda Mohan Mondal

机构 * School of Computing & Information Sciences, Florida International University(佛罗里达国际大学计算机与信息科学学院) College of AI, Cybersecurity and Computing, University of South Florida(佛罗里达州立大学人工智能、网络安全与计算学院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出STEP-PD框架,利用PPMI数据中的多模态临床评估,通过SHAP解释性方法实现帕金森病严重程度的可解释分类,XGBoost在多种任务中表现出高准确性和稳定性。

Comments 10 pages, 6 figures, 4 tables, accepted at IEEE International Conference on Healthcare Informatics (ICHI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17503 2026-04-21 cs.AI cs.MA 79%

SkillGraph: Self-Evolving Multi-Agent Collaboration with Multimodal Graph Topology

SkillGraph: 基于多模态图拓扑的自进化多智能体协作

Zheng Nie, Ruolin Shen, Xinlei Yu, Bo Yin, Jiangning Zhang, Xiaobin Hu

机构 * National University of Singapore, Singapore(新加坡国立大学) Technical University of Munich, Munich, Germany(慕尼黑技术大学) Zhejiang University, China(浙江大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 SkillGraph通过联合进化智能体能力与通信拓扑,解决视觉多智能体系统中固定拓扑和静态推理能力的问题,提升协作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19237 2026-04-21 cs.AI cs.RO 79%

Sensorimotor Self-Recognition in Multimodal Large Language Model-Driven Robots

多模态大语言模型驱动机器人中的躯体自我识别

Iñaki Dellibarda Varela, Pablo Romero-Sorozabal, Diego Torricelli, Gabriel Delgado-Oleas, Jose Ignacio Serrano, Maria Dolores del Castillo Sobrino, Eduardo Rocon, Manuel Cebrian

机构 * Center for Automation and Robotics(自动化与机器人中心) University of Azuay(阿祖亚大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文研究多模态大语言模型通过躯体运动经验发展自我识别能力,展示机器人在环境感知、自我识别和预测意识方面的表现,揭示感觉整合对最小自我的影响及记忆协调机制。

Comments 16 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16584 2026-04-21 cs.SE cs.AI cs.PL 79%

Certified Program Synthesis with a Multi-Modal Verifier

带有多模验证器的认证程序合成

Yueyang Feng, Dipesh Kafle, Vladimir Gladshtein, Vitaly Kurin, George Pîrlea, Qiyuan Zhao, Peter Müller, Ilya Sergey

机构 * National University of Singapore(新加坡国立大学) Neapolis University Pafos(纳皮奥斯大学帕福斯)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出LeetProof,通过多模验证器解决认证程序合成中的规范缺陷和验证模式碎片化问题,实现更高效的全认证解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16333 2026-04-21 cs.LG cs.AI 79%

A Discordance-Aware Multimodal Framework with Multi-Agent Clinical Reasoning

一种考虑不一致性的多模态框架与多智能体临床推理

Pegah Ahadian, Mingrui Yang, Sixu Chen, Xiaojuan Li, Qiang Guan

机构 * Department of Computer Science(计算机科学系) Kent State University(肯特州立大学) Department of Biomedical Engineering(生物医学工程系) Cleveland Clinic(克利夫兰诊所)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种结合机器学习模型与多智能体推理系统的多模态框架,用于预测膝骨关节炎的进展并生成临床管理建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13397 2026-04-16 cs.CV 79%

A Multimodal Clinically Informed Coarse-to-Fine Framework for Longitudinal CT Registration in Proton Therapy

一种多模态的临床导向粗到细框架用于质子治疗纵向CT配准

Caiwen Jiang, Yuzhen Ding, Mi Jia, Samir H. Patel, Terence T. Sio, Jonathan B. Ashman, Lisa A. McGee, Jean-Claude M. Rwigema, William G. Rule, Sameer R. Keole, Sujay A. Vora, William W. Wong, Nathan Y. Yu, Michele Y. Halyard, Steven E. Schild, Dinggang Shen, Wei Liu

机构 * Department of Radiation Oncology, Mayo Clinic, Phoenix, Arizona, USA(梅奥诊所放射肿瘤科) School of Biomedical Engineering, ShanghaiTech University, Shanghai, China(上海科技大学生物医学工程学院) Shanghai United Imaging Intelligence Co., Ltd., Shanghai 200230, China(上海联合影像智能科技有限公司) Shanghai Artificial Intelligence Laboratory, Shanghai 200232, China(上海人工智能实验室) Shanghai Clinical Research and Trial Center, Shanghai 201210, China(上海临床研究与试验中心)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态的临床导向粗到细框架,结合质子放疗工作流程中的多种信息,提升纵向CT配准的准确性和临床适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09426 2026-04-13 cs.HC cs.AI cs.IR 79%

Three Modalities, Two Design Probes, One Prototype, and No Vision: Experience-Based Co-Design of a Multi-modal 3D Data Visualization Tool

三种模态、两种设计探针、一个原型和没有视觉:基于经验的多模态3D数据可视化工具共设计

Sanchita S. Kamath, Aziz N Zeidieh, Venkatesh Potluri, Sile O'Modhrain, Kenneth Perry, JooYoung Seo

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan(密歇根大学)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

AI总结 本文通过基于经验的共设计方法,开发出多模态3D数据可视化工具,提升视障人士对3D数据的分析能力,提供可操作的设计指南和可扩展的无障碍3D可视化方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07973 2026-04-10 cs.AI 79%

How Far Are Large Multimodal Models from Human-Level Spatial Action? A Benchmark for Goal-Oriented Embodied Navigation in Urban Airspace

大型多模态模型距离人类水平的空间行动还有多远?一个面向城市空域目标导向的具身导航基准测试

Baining Zhao, Ziyou Wang, Jianjie Fang, Zile Zhou, Yanggang Xu, Yatai Ji, Jiacheng Xu, Qian Zhang, Weichen Zhang, Chen Gao, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Northeastern University(东北大学) National University of Defense Technology(国防科技大学) Shandong University(山东大学) BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文通过构建包含5037个高质量目标导向导航样本的数据集,评估17种代表性模型在城市3D空间中具身空间行动的能力,发现尽管LMMs展现出新兴行动能力,但仍远未达到人类水平,并揭示导航误差在关键决策分歧后迅速发散的现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07468 2026-04-10 cs.AI 79%

M-ArtAgent: Evidence-Based Multimodal Agent for Implicit Art Influence Discovery

M-ArtAgent:基于证据的多模态代理用于隐式艺术影响发现

Hanyi Liu, Zhonghao Jiu, Minghao Wang, Yuhang Xie, Heran Yang

机构 * China Electronics Technology Group Co., Ltd.(中国电子科技集团有限公司) School of Information Science and Engineering, Southeast University(东南大学信息科学与工程学院) Department of Chemical and Biological Engineering, Hong Kong University of Science and Technology(香港科技大学化学与生物工程系) University of California San Diego(加州大学圣迭戈分校) Northeastern University(东北大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出M-ArtAgent,通过概率裁决框架解决隐式艺术影响发现问题,结合多模态感知与领域约束的反驳机制,实现83.7%的F1分数和0.910的ROC-AUC。

Comments 13 pages, 5 figures, submitted to IEEE Access

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06777 2026-04-09 cs.CV 79%

Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization

行走与言说:通过多模态代理策略优化弥合图像推理与行动之间的差距

Wenhao Yang, Yu Xia, Jinlong Huang, Shiyin Lu, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Yuchen Zhou, Xiaobo Xia, Yuanyu Wan, Lijun Zhang, Tat-Seng Chua

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) AI Business, Alibaba Group(阿里巴巴集团智能计算研究院) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, China(上海交通大学自动化与智能感知学院) School of Intelligent Systems Engineering, Sun Yat-sen University, Shenzhen, China(中山大学智能工程学院(深圳)) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院) School of Software Technology, Zhejiang University, China(浙江大学软件学院) School of Computing, National University of Singapore, Singapore, Singapore(新加坡国立大学计算机学院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MAPO方法,通过强制生成视觉内容的显式文本描述,结合语义对齐与任务奖励,提升多模态推理能力,实验表明其在多个视觉推理基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06376 2026-04-09 cs.CV 79%

MTA-Agent: An Open Recipe for Multimodal Deep Search Agents

MTA-Agent:多模态深度搜索代理的开放配方

Xiangyu Peng, Can Qin, An Yan, Xinyi Yang, Zeyuan Chen, Ran Xu, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce 人工智能研究院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MTA-Agent,通过构建高质量多跳视觉-语言训练数据,实现多模态深度搜索代理,其在六个基准测试中达到54.63%的平均准确率,优于其他模型,同时降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08409 2026-04-09 cs.AI 79%

Faithful-First Reasoning, Planning, and Acting for Multimodal LLMs

多模态大语言模型中的忠实优先推理、规划与行动

Junxian Li, Xinyue Xu, Sai Ma, Di Zhang, Sichao Li

机构 * Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学) The Australian National University(澳大利亚国立大学) Fudan University(复旦大学) University of Sydney(悉尼大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Faithful-First RPA框架,通过逐步监督提升多模态推理的忠实度,实验表明其在多个基准上提升了24%的感知忠实度,且不降低任务准确性。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05533 2026-04-08 cs.AI 79%

Experience Transfer for Multimodal LLM Agents in Minecraft Game

在Minecraft游戏中多模态大语言模型代理的经验迁移

Chenghao Li, Jun Liu, Songbo Zhang, Huadong Jian, Hao Ni, Lik-Hang Lee, Sung-Ho Bae, Guoqing Wang, Yang Yang, Chaoning Zhang

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Echo框架,通过分解经验为五维,使代理能从历史交互中提取可操作知识,提升复杂环境下的任务解决效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18599 2026-04-07 cs.CV 79%

Restore-R1: Efficient Image Restoration Agents via Reinforcement Learning with Multimodal LLM Perceptual Feedback

Restore-R1: 通过多模态大语言模型感知反馈的强化学习图像修复代理

Jianglin Lu, Yuanwei Wu, Ziyi Zhao, Hongcheng Wang, Felix Jimenez, Abrar Majeedi, Yun Fu

机构 * Amazon(亚马逊) Northeastern University(东北大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Restore-R1框架,利用强化学习和多模态大语言模型感知反馈,高效解决图像修复问题,无需标注数据即可实现高质量修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03697 2026-04-07 cs.CV 79%

SGTA: Scene-Graph Based Multi-Modal Traffic Agent for Video Understanding

基于场景图的多模态交通代理:视频理解的模块化框架

Xingcheng Zhou, Mingyu Liu, Walter Zimmer, Jiajie Zhang, Alois Knoll

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.CV

AI总结 SGTA结合结构化场景图与多模态推理,通过检测、跟踪和车道提取构建交通场景图,并利用ReAct处理大语言模型的推理轨迹,实现复杂视频问题的可解释决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03393 2026-04-07 cs.AI 79%

TABQAWORLD: Optimizing Multimodal Reasoning for Multi-Turn Table Question Answering

TABQAWORLD: 优化多模态推理以实现多轮表格问答

Tung Sum Thomas Kwok, Xinyu Wang, Xiaofeng Lin, Peng Lu, Chunhe Wang, Changlun Li, Hanwei Wu, Nan Tang, Elisa Kreiss, Guang Cheng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) SimpleWay

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 TABQAWORLD通过联合优化表格表示与估计,提升多轮表格问答的可靠性与效率,实现4.87%的准确率提升和33.35%的推理延迟降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02097 2026-04-03 cs.CV cs.LG 79%

LatentUM: Unleashing the Potential of Interleaved Cross-Modal Reasoning via a Latent-Space Unified Model

LatentUM:通过潜在空间统一模型释放交错跨模态推理的潜力

Jiachun Jin, Zetong Zhou, Xiao Yang, Hao Zhang, Pengfei Liu, Jun Zhu, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 多模态Agent :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出LatentUM,通过共享语义潜在空间实现跨模态推理与生成,提升计算效率并减少编码器偏差,取得视觉空间规划基准的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01007 2026-04-03 cs.AI 79%

Omni-SimpleMem: Autoresearch-Guided Discovery of Lifelong Multimodal Agent Memory

Omni-SimpleMem:自主研究引导的终身多模态代理记忆发现

Jiaqi Liu, Zipeng Ling, Shi Qiu, Yanqing Liu, Siwei Han, Peng Xia, Haoqin Tu, Zeyu Zheng, Cihang Xie, Charles Fleming, Mingyu Ding, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) University of Pennsylvania(宾夕法尼亚大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California Berkeley(加州大学伯克利分校) Cisco(思科)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Omni-SimpleMem,通过自主研究流程发现多模态记忆框架,提升AI代理的长期记忆能力,其核心贡献在于通过自动实验发现架构改进、数据管道修复等关键突破,超越传统AutoML。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27813 2026-03-31 cs.CV 79%

MuSEAgent: A Multimodal Reasoning Agent with Stateful Experiences

MuSEAgent:一种具有状态化经验的多模态推理代理

Shijian Wang, Jiarui Jin, Runhao Fu, Zexuan Yan, Xingjian Wang, Mengkang Hu, Eric Wang, Xiaoxi Li, Kangning Zhang, Li Yao, Wenxiang Jiao, Xuelian Cheng, Yuan Lu, Zongyuan Ge

机构 * Southeast University(东南大学) Monash University(莫纳什大学) Xiaohongshu Inc.(小红书) Shanghai Jiao Tong University(上海交通大学) University of Hong Kong(香港大学) Zhejiang University(浙江大学) Renmin University of China(中国人民大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 MuSEAgent通过引入状态化经验学习范式,提升多模态推理代理的决策能力,其通过 hindsight reasoning 抽象交互数据为原子决策经验,并在推理时进行质量过滤的经验检索,实验表明其在细粒度视觉感知和复杂多模态推理任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14790 2026-03-31 cs.CV 79%

Mind-of-Director: Multi-modal Agent-Driven Film Previsualization via Collaborative Decision-Making

导演之思:通过协作决策的多模态代理驱动电影预可视化

Shufeng Nan, Mengtian Li, Sixiao Zheng, Yuwei Lu, Han Zhang, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai University(上海大学)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.CV

AI总结 Mind-of-Director通过协作决策过程生成高质量的电影预可视化序列,结合多个专业代理在游戏引擎中协作生成预可视化内容,提升自动化原型制作和人机协同电影制作的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23271 2026-03-25 cs.RO cs.AI 79%

A Multimodal Framework for Human-Multi-Agent Interaction

人-多智能体交互的多模态框架

Shaid Hasan, Breenice Lee, Sujan Sarker, Tariq Iqbal

机构 * University of Virginia(弗吉尼亚大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一个多模态框架,用于人与多智能体交互,通过集成多模态感知和大语言模型驱动的规划,实现自主认知代理的协调决策,解决现有系统在统一框架下整合多模态感知、具身表达和协同决策的难题。

Comments 4 pages, 3 figures. Accepted at ACM/IEEE HRI 2026 Workshop (MAgicS-HRI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11191 2026-03-25 cs.AI cs.RO 79%

Multi-Modal Multi-Task (M3T) Federated Foundation Models for Embodied AI: Potentials and Challenges for Edge Integration

多模态多任务(M3T)联邦基础模型用于具身AI:边缘整合的潜力与挑战

Kasra Borazjani, Payam Abdisarabshali, Fardis Nadimi, Naji Khosravan, Minghui Liwang, Xianbin Wang, Yiguang Hong, Seyyedali Hosseinalipour

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出多模态多任务联邦基础模型(M3T-FFMs)用于具身AI,结合M3T-FMs的任务泛化能力和FL的隐私保护分布式训练,解决边缘部署中的异构具身、模态不平衡、带宽限制等挑战。

Comments Accepted for Publication in IEEE Internet of Things Magazine, 2025

Journal ref IEEE Internet of Things Magazine, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20198 2026-03-24 cs.CR cs.CV cs.LG 79%

Visual Exclusivity Attacks: Automatic Multimodal Red Teaming via Agentic Planning

视觉排斥攻击:通过代理规划实现自动多模态红队行动

Yunbei Zhang, Yingqiang Ge, Weijie Xu, Yuhui Xu, Jihun Hamm, Chandan K. Reddy

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出视觉排斥攻击,通过多模态多轮代理规划框架MM-Plan,实现基于视觉内容的攻击,展示了对前沿模型的高攻击成功率,揭示了当前安全对齐的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16931 2026-03-23 cs.AI cs.RO 79%

Multimodal Fused Learning for Solving the Generalized Traveling Salesman Problem in Robotic Task Planning

多模态融合学习用于解决机器人任务规划中的广义旅行商问题

Jiaqi Cheng, Mingfeng Fan, Xuefeng Zhang, Jingsong Liang, Yuhong Cao, Guohua Wu, Guillaume Adrien Sartoretti

机构 * Central South University(中南大学) National University of Singapore(新加坡国立大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出多模态融合学习框架,通过图和图像表示捕捉问题互补方面,生成高质量实时任务规划方案,实验表明其在各类GTSP实例中性能优于现有方法。

Comments 14 pages, 6 figures, Proceedings of the Conference on Robot Learning (CoRL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏