arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-25 至 2026-03-25 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 10 篇

2601.22060 2026-03-25 cs.CV cs.AI 84%

Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models

Vision-DeepResearch: 促进多模态大语言模型中的深度研究能力

Wenxuan Huang, Yu Zeng, Qiuchen Wang, Zhen Fang, Shaosheng Cao, Zheng Chu, Qingyu Yin, Shuang Chen, Zhenfei Yin, Lin Chen, Zehui Chen, Xu Tang, Yao Hu, Shaohui Lin, Philip Torr, Feng Zhao, Wanli Ouyang

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Vision-DeepResearch,通过多轮、多实体和多尺度的视觉与文本搜索,提升多模态大语言模型在噪声环境下的深度研究能力,实现更高效的多模态深度研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23271 2026-03-25 cs.RO cs.AI 79%

A Multimodal Framework for Human-Multi-Agent Interaction

人-多智能体交互的多模态框架

Shaid Hasan, Breenice Lee, Sujan Sarker, Tariq Iqbal

机构 * University of Virginia(弗吉尼亚大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一个多模态框架,用于人与多智能体交互,通过集成多模态感知和大语言模型驱动的规划,实现自主认知代理的协调决策,解决现有系统在统一框架下整合多模态感知、具身表达和协同决策的难题。

Comments 4 pages, 3 figures. Accepted at ACM/IEEE HRI 2026 Workshop (MAgicS-HRI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11191 2026-03-25 cs.AI cs.RO 79%

Multi-Modal Multi-Task (M3T) Federated Foundation Models for Embodied AI: Potentials and Challenges for Edge Integration

多模态多任务(M3T)联邦基础模型用于具身AI:边缘整合的潜力与挑战

Kasra Borazjani, Payam Abdisarabshali, Fardis Nadimi, Naji Khosravan, Minghui Liwang, Xianbin Wang, Yiguang Hong, Seyyedali Hosseinalipour

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出多模态多任务联邦基础模型(M3T-FFMs)用于具身AI,结合M3T-FMs的任务泛化能力和FL的隐私保护分布式训练,解决边缘部署中的异构具身、模态不平衡、带宽限制等挑战。

Comments Accepted for Publication in IEEE Internet of Things Magazine, 2025

Journal ref IEEE Internet of Things Magazine, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22796 2026-03-25 cs.CV cs.AI cs.RO 62%

PhotoAgent: A Robotic Photographer with Spatial and Aesthetic Understanding

PhotoAgent:一种具有空间与审美理解的机器人摄影师

Lirong Che, Zhenfeng Gan, Yanbo Chen, Junbo Tan, Xueqian Wang

机构 * Center for Artificial Intelligence and Robotics, Shenzhen International Graduate School, Tsinghua University(人工智能与机器人中心,深圳国际研究生院,清华大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 PhotoAgent通过整合大多模态模型与新型控制范式,将主观审美目标转化为几何约束,利用内部视觉模拟实现快速收敛于高质量图像结果。

Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23295 2026-03-25 cs.CV 57%

Mamba-driven MRI-to-CT Synthesis for MRI-only Radiotherapy Planning

基于Mamba的MRI到CT合成用于仅MRI的放疗计划

Konstantinos Barmpounakis, Theodoros P. Vagenas, Maria Vakalopoulou, George K. Matsopoulos

机构 * School of Electrical Computer Engineering, National Technical University of Athens Archimedes, Athena Research Center CentraleSup\'elec, University of Paris-Saclay

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 本文提出基于Mamba架构的MRI到CT合成方法,以提高跨模态翻译的准确性与效率,通过3D Mamba架构捕捉复杂体积特征和长距离依赖,实现快速且精确的CT合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23149 2026-03-25 cs.AI 57%

Describe-Then-Act: Proactive Agent Steering via Distilled Language-Action World Models

描述-然后-行动:通过蒸馏的语言-动作世界模型实现前瞻性智能体导航

Massimiliano Pappa, Luca Romani, Valentino Sacco, Alessio Palma, Stéphane Lathuilière, Fabio Galasso, Xavier Alameda-Pineda, Indro Spinelli

机构 * Sapienza University of Rome, Italy(罗马大学萨皮恩扎) Inria, Univ. Grenoble Alpes, CNRS, LJK(法国国家信息与自动化技术研究所)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.AI

AI总结 本文提出DILLO模型,通过蒸馏方法实现无需视觉模拟的前瞻性智能体导航,提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07315 2026-03-25 cs.MA cs.AI cs.AR 57%

VLM-CAD: VLM-Optimized Collaborative Agent Design Workflow for Analog Circuit Sizing

VLM-CAD:面向模拟电路尺寸设计的VLM优化协作代理设计流程

Guanyuan Pan, Shuai Wang, Yugui Lin, Tiansheng Zhou, Pietro Liò, Zhenxin Zhao, Yaqi Wang

机构 * Hangzhou Dianzi University(杭州电子科技大学) SCBC, Guangdong University of Foreign Studies(广东外语外贸大学) University of Cambridge(剑桥大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出VLM-CAD流程,通过神经符号结构解析模块和ExTuRBO方法提升多模态推理的鲁棒性和可解释性,实验表明其在模拟电路设计中具有高准确性和低功耗。

Comments submitted to the 34th ACM International Conference on Multimedia (ACMMM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23393 2026-03-25 cs.RO 50%

Rectify, Don't Regret: Avoiding Pitfalls of Differentiable Simulation in Trajectory Prediction

纠正,而非后悔:避免可微模拟在轨迹预测中的陷阱

Harsh Yadav, Christian Bohn, Tobias Meisen

机构 * University of Wuppertal(乌珀塔尔大学)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出一种非可微的递推滚动方法,通过切断计算图来避免可微模拟中的捷径学习,提升轨迹预测的鲁棒性和恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23079 2026-03-25 cs.RO 50%

AirSimAG: A High-Fidelity Simulation Platform for Air-Ground Collaborative Robotics

AirSimAG:一种高保真空地协同机器人仿真平台

Yangjie Cui, Xin Dong, Boyang Gao, Jinwu Xiang, Daochun Li, Zhan Tu

机构 * School of Aeronautic Science and Engineering, Beihang University(北京航空航天大学航空科学与工程学院) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) Institution of Unmanned System, Beihang University(北京航空航天大学无人系统研究院)

专题命中 多模态Agent :cross-modal(abstract)

AI总结 本文提出AirSimAG,一种高保真的空地协同机器人仿真平台,支持多智能体同步仿真和异构传感控制接口,通过多个代表性任务验证其在多智能体协调和跨模态数据一致性方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22903 2026-03-25 cs.RO 50%

Task-Aware Positioning for Improvisational Tasks in Mobile Construction Robots via an AI Agent with Multi-LMM Modules

面向即兴任务的移动建筑机器人AI代理的定位任务感知

Seongju Jang, Francis Baek, SangHyun Lee

机构 * University of Michigan(密歇根大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出一种AI代理,通过多LMM模块实现对自然语言描述的即兴任务的理解与定位,使移动建筑机器人能自主完成非预定义任务。

详情

展开后加载摘要…

URL PDF HTML 收藏