arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-24 至 2026-03-24 共收录 16 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 16 篇

2601.10744 2026-03-24 cs.AI cs.CV 81%

Explore with Long-term Memory: A Benchmark and Multimodal LLM-based Reinforcement Learning Framework for Embodied Exploration

探索与长期记忆:一个基准和基于多模态LLM的强化学习框架用于具身探索

Sen Wang, Bangwei Liu, Zhenkun Gao, Lizhuang Ma, Xuhong Wang, Yuan Xie, Xin Tan

机构 * East China Normal University(东华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出LMEE框架,通过多模态LLM强化学习促进终身学习,构建LMEE-Bench基准评估具身探索过程与结果,采用MemoryExplorer方法提升记忆检索与主动探索能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20198 2026-03-24 cs.CR cs.CV cs.LG 79%

Visual Exclusivity Attacks: Automatic Multimodal Red Teaming via Agentic Planning

视觉排斥攻击:通过代理规划实现自动多模态红队行动

Yunbei Zhang, Yingqiang Ge, Weijie Xu, Yuhui Xu, Jihun Hamm, Chandan K. Reddy

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出视觉排斥攻击,通过多模态多轮代理规划框架MM-Plan,实现基于视觉内容的攻击,展示了对前沿模型的高攻击成功率,揭示了当前安全对齐的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22507 2026-03-24 cs.NI cs.MA eess.SP 78%

A Unified Cloud-Edge-Terminal Framework for Multimodal Integrated Sensing and Communication

多模态感知与通信一体化的统一云-边-终端框架

Yubo Peng, Luping Xiang, Kun Yang, Feibo Jiang, Kezhi Wang, Christos Masouros

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本文提出统一云-边-终端框架,通过多模态感知与通信融合,解决异构融合、通信开销和系统扩展性等挑战,提升任务导向的多模态感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01013 2026-03-24 cs.LG 78%

TimeXL: Explainable Multi-modal Time Series Prediction with LLM-in-the-Loop

TimeXL:基于LLM的多模态时间序列预测可解释方法

Yushan Jiang, Wenchao Yu, Geon Lee, Dongjin Song, Kijung Shin, Wei Cheng, Yanchi Liu, Haifeng Chen

机构 * School of Computing, University of Connecticut(大学计算机学院) Data Science & System Security Department, NEC Labs America(数据科学与系统安全部,NEC美国实验室) Kim Jaechul Graduate School of AI, KAIST(金 Jaechul人工智能研究生院,韩国科学技术院)

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 TimeXL通过集成原型时间序列编码器与三个协作LLM,提升时间序列预测的准确性与可解释性,实验证明在四个真实数据集上AUC提升达8.9%。

Comments NeurIPS 2025 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21577 2026-03-24 cs.AI 74%

Mind over Space: Can Multimodal Large Language Models Mentally Navigate?

心灵超越空间:多模态大语言模型能否进行心理导航?

Qihui Zhu, Shouwei Ruan, Xiao Yang, Hao Jiang, Yao Huang, Shiji Zhao, Hanwei Fan, Hang Su, Xingxing Wei

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(清华大学-博世联合机器学习中心、THBI实验室、BNRist中心、清华大学计算机科学与技术系) School of Automation Science and Electrical Engineering , Beihang University(北京航空航天大学自动化科学与电气工程学院) college of AI, Tsinghua University(清华大学人工智能学院) Department of Computer Science and Technology , Tsinghua University(清华大学计算机科学与技术系)

专题命中 多模态Agent :multimodal(title);分类 cs.AI

AI总结 本文提出Video2Mental基准测试,评估多模态大语言模型的空间导航能力,发现标准预训练模型无法自然生成空间表示,NavMind通过显式认知地图提升导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21410 2026-03-24 cs.RO 71%

Bayesian Active Object Recognition and 6D Pose Estimation from Multimodal Contact Sensing

基于多模态接触传感的贝叶斯主动物体识别与6D位姿估计

Haodong Zheng, Gabriele M. Caddeo, Andrei C. Jalba, Wijnand A. IJsselsteijn, Lorenzo Natale, Raymond H. Cuijpers

机构 * Eindhoven University of Technology(埃因霍温理工大学) Italian Institute of Technology(意大利理工学院) Humanoid Sensing and Perception Group(人形感知与感知小组)

专题命中 多模态Agent :multimodal(title)

AI总结 本文提出一种结合触觉与自由空间约束的贝叶斯框架,用于联合物体识别和6D位姿估计,通过定制粒子滤波器提升推理效率,并利用推理结果指导主动探索,实验表明触觉信息显著提升了识别和位姿估计的准确性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21341 2026-03-24 cs.AI 70%

RoboAlign: Learning Test-Time Reasoning for Language-Action Alignment in Vision-Language-Action Models

RoboAlign:学习测试时推理以改进视觉-语言-动作模型中的语言-动作对齐

Dongyoung Kim, Sumin Park, Woomin Song, Seungku Kim, Taeyoung Kim, Huiwon Jang, Jinwoo Shin, Jaehyung Kim, Younggyo Seo

机构 * Yonsei University(延世大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出RoboAlign框架,通过零样本自然语言推理生成动作标记并结合强化学习提升动作准确性,从而在视觉-语言-动作模型中实现语言与低级动作之间的对齐,提升模型性能。

Comments 15 pages, 7 figures, 9 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20200 2026-03-24 cs.RO cs.AI cs.CV 62%

Your Robot Will Feel You Now: Empathy in Robots and Embodied Agents

你的机器人将能感知你:机器人与具身代理中的共情

Angelica Lim, Ö. Nilay Yalçin

机构 * School of Computing Science, Simon Fraser University(计算科学学院,西蒙弗雷泽大学) School of Interactive Arts and Technology, Simon Fraser University(交互艺术与技术学院,西蒙弗雷泽大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了人类机器人交互和具身对话代理领域中共情行为和模型的研究,探讨如何将这些经验应用于当今基于语言的代理系统。

Comments Accepted manuscript. Chapter in "Empathy and Artificial Intelligence: Challenges, Advances and Ethical Considerations" edited by Anat Perry; C. Daryl Cameron

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22280 2026-03-24 cs.CV cs.RO 57%

DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models

DualCoT-VLA: 通过并行推理实现视觉-语言链式思维的视觉-语言-动作模型

Zhide Zhong, Junfeng Li, Junjie He, Haodong Yan, Xin Gong, Guanyi Zhao, Yingjie Cai, Jiantao Gao, Xu Yan, Bingbing Liu, Yingcong Chen, Liuqing Yang, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Huawei Foundation Model Department(华为基础模型部门)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 DualCoT-VLA通过并行推理机制,结合视觉和语言链式思维,解决传统VLA模型在复杂多步骤任务和精细空间感知中的不足,实现更高效的视觉-语言-动作处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21029 2026-03-24 cs.AI 57%

KLDrive: Fine-Grained 3D Scene Reasoning for Autonomous Driving based on Knowledge Graph

KLDrive: 基于知识图谱的细粒度3D场景推理用于自动驾驶

Ye Tian, Jingyi Zhang, Zihao Wang, Xiaoyuan Ren, Xiaofan Yu, Onat Gungor, Tajana Rosing

机构 * University of California San Diego, La Jolla, California, USA(加州大学圣地亚哥分校) University of California Merced, Merced, California, USA(加州大学默塞德分校)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 KLDrive通过构建可靠场景知识图谱和LLM代理进行事实驱动推理,提升自动驾驶中的细粒度问答性能,实验表明其在NuScenes-QA和GVQA上均取得最佳准确率和SPICE分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21706 2026-03-24 physics.med-ph 50%

Comprehensive Dosimetric Verification and Positional Sensitivity Analysis in Brachytherapy: A Unified ESAPI Tool for HDR and LDR Treatments

放射治疗中的全面剂量学验证与位置敏感性分析:一种用于 HDR 和 LDR 治疗的统一 ESAPI 工具

J. A. Valgoma

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出了一种基于 Varian Eclipse Scripting API 的独立软件工具,用于验证 HDR 和 LDR 放射治疗的 QA,通过比较点源和线源模型,分析位置不确定性,并提高临床工作流程的安全性。

Comments 13 pages, 2 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01834 2026-03-24 cs.RO 50%

Concept-Based Dictionary Learning for Inference-Time Safety in Vision Language Action Models

基于概念的词典学习用于推理时的安全性在视觉语言动作模型中

Siqi Wen, Shu Yang, Shaopeng Fu, Jingfeng Zhang, Lijie Hu, Di Wang

机构 * Beijing Jiaotong University(北京交通大学) Provable Responsible AI and Data Analytics (PRADA) Lab(可证责任AI与数据分析实验室) King Abdullah University of Science and Technology(国王 Abdullah 科学技术大学) University of Auckland(奥克兰大学) RIKEN Center for Advanced Intelligence Project (AIP)(理化学研究所高级智能项目中心) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出基于概念的词典学习框架,用于提升视觉语言动作模型推理时的安全性,通过学习稀疏可解释词典识别有害概念方向并抑制风险组件,实验表明其在多个基准上有效降低攻击成功率70%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19988 2026-03-24 stat.ML cs.LG q-bio.QM 50%

BioBO: Biology-informed Bayesian Optimization for Perturbation Design

BioBO:结合生物学知识的贝叶斯优化用于扰动设计

Yanke Li, Tianyu Cui, Tommaso Mansi, Mangal Prakash, Rui Liao

机构 * Johnson & Johnson Innovative Medicine(强生创新医药) ETH Zurich(苏黎世联邦理工学院)

专题命中 多模态Agent :multimodal(abstract)

AI总结 BioBO结合多模态基因嵌入和富集分析,提升代理建模和获取策略,提高标签效率25-40%,并提供路径级解释,链接设计与生物调控电路。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16963 2026-03-24 cs.RO cs.SY eess.SY 50%

A Tactile-based Interactive Motion Planner for Robots in Unknown Cluttered Environments

基于触觉的交互式运动规划器用于未知杂乱环境中的机器人

Chengjin Wang, Yanmin Zhou, Zheng Yan, Feng Luan, Runjie Shen, Hongrui Sang, Zhipeng Wang, Bin He

机构 * Shanghai Research Institute for Intelligent Autonomous Systems(上海智能自主系统研究院) State Key Laboratory of Autonomous Intelligent Unmanned Systems(自主智能无人系统国家重点实验室) Frontiers Science Center for Intelligent Autonomous Systems(智能自主系统前沿科学中心) College of Electronics and Information Engineering, Tongji University(同济大学电子与信息学院)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出了一种基于触觉的交互式运动规划框架,通过多模态触觉感知实时构建接触模型,从而在未知杂乱环境中安全扩展自由运动空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20560 2026-03-24 cs.HC cs.GR 50%

Nevis Digital Twin: Photogrammetry and Immersive Visualization of Historical Sites

Nevis数字孪生:历史遗址的摄影测量与沉浸式可视化

Alex Apffel, Huy Tran, Vuthea Chheang

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出了一种多模态数据采集流程,用于保护受威胁的历史遗址,通过摄影测量和3D高斯点散布实现虚拟重建,以提供可扩展的数字遗产民主化模型。

Comments ARCHERIX Workshop - IEEE VR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20355 2026-03-24 eess.IV 50%

CaroTo: A Tool for Fast Comprehensive Analysis of Carotid Artery Stenosis in 4D PC- and 3D BB-MRI Data

CaroTo:一种用于快速全面分析4D PC-和3D BB-MRI数据颈动脉狭窄的工具

Hinrich Rahlfs, Markus Hüllebrand, Sebastian Schmitter, Jonathan Andrae, Christoph Strecker, Andreas Harloff, Anja Hennemuth

专题命中 多模态Agent :multimodal(abstract)

AI总结 CaroTo工具通过多模态和多维分割、生物标志物提取和可视化,实现颈动脉动脉粥样斑块的标准化评估,提升颈动脉狭窄分析的精度和一致性。

Comments VCBM 2024, Poster Honorable Mention

详情

展开后加载摘要…

URL PDF HTML 收藏