arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-29 至 2026-05-29 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 9 篇

2605.29850 2026-05-29 cs.LG 82%

MIRAGE: Adaptive Multimodal Gating for Whole-Brain fMRI Encoding

MIRAGE:用于全脑fMRI编码的自适应多模态门控

Abdulkadir Gokce, Badr AlKhamissi, Martin Schrimpf

机构 * Qwen3-Omni-30B-A3B-Thinking(通义千问3- Omni-30B-A3B-Thinking)

专题命中 多模态Agent :multimodal(title,abstract);omni-modal(abstract)

AI总结 提出MIRAGE框架,通过原生多模态骨干网络和自适应特征门控,实现全脑fMRI对自然视听刺激的高精度编码,并证明原生多模态特征优于后期融合的单模态特征。

Comments Preprint. First two author contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30318 2026-05-29 cs.GR cs.AI cs.CV 73%

Before the Shutter: Aesthetic and Actionable Portrait Photography Planning in 3D Scenes

快门之前:3D场景中美学的且可执行的人像摄影规划

Ruixiang Jiang, Chang Wen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态Agent :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出在3D场景中生成人像姿态、相机、照明和曝光方案的方法,通过构建摄影场景图实现美学引导的规划,生成视觉上引人注目且几何与光度可行的人像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30117 2026-05-29 cs.AI 70%

VLA-Trace: Diagnosing Vision-Language-Action Models through Representation and Behavior Tracing

VLA-Trace: 通过表示与行为追踪诊断视觉-语言-动作模型

Haoyuan Shi, Xiancong Ren, Yingji Zhang, Qinfan Zhang, Jiayu Hu, Haozhe Shan, Han Dong, Jinpeng Lu, Yinda Chen, Yi Zhang, Yong Dai, Xiaozhu Ju

机构 * University of Science and Technology of China(中国科学技术大学) University of Manchester(曼彻斯特大学) Beihang University(北航) Fudan University(复旦大学) University of New South Wales(新南威尔士大学)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出VLA-Trace诊断框架,通过表示演化、因果控制归因和行为表现分析,揭示VLA模型在多模态知识向具身控制转化中的机制,发现不同模型在微调适应、多模态路由和语义遵循上的差异与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29532 2026-05-29 cs.SE cs.AI 70%

GUITestScape: Towards Open-set Evaluation on Exploratory GUI Testing

GUITestScape:面向探索性GUI测试的开放集评估

Xiaoyi Chen, Yifei Gao, Yang Xu, Xingxing Song, Yi Zhang, Jitao Sang

机构 * Beijing Jiaotong University(北京交通大学) Independent Researcher(独立研究者)

专题命中 多模态Agent :MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出GUITestScape基准和GUIJudge评估器,通过覆盖交互与显示缺陷的508个预设缺陷及过程感知评估方法,解决现有GUI测试评估局限于预定义标注和交互缺陷的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29927 2026-05-29 cs.CL cs.AI cs.LG 62%

Does The Way You Plan Matter? An Empirical Study of Planning Representations for LLM Web Agents

计划方式重要吗?LLM网络代理计划表示的实证研究

Alejandra Zambrano, Sara Vera Marjanovic, Imene Kerboua, Xing Han Lù, Leila Kosseim

机构 * Concordia University(康科德大学) Mila - Quebec AI Institute(魁北克人工智能研究所) University of Copenhagen(哥本哈根大学) Universite Claude Bernard Lyon(克莱尔蒙特-伯恩大学) McGill University(麦吉尔大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出PlanAhead框架,通过自动难度分类和四种计划表示(顺序子目标、叙述、伪代码、检查清单)的对比实验,发现计划表示形式和生成计划的LLM显著影响网络代理的鲁棒性和任务成功率。

Comments Extended version of paper submitted to EMNLP, waiting for acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29560 2026-05-29 cs.AI 57%

Battery-Sim-Agent: Leveraging LLM-Agent for Inverse Battery Parameter Estimation

Battery-Sim-Agent: 利用LLM智能体进行电池逆参数估计

Jiawei Chen, Xiaofan Gui, Shikai Fang, Shengyu Tao, Shun Zheng, Weiqing Liu, Jiang Bian

机构 * Peking University(北京大学) Microsoft Research(微软研究院) Zhejiang University(浙江大学) Chalmers University of Technology(皇家理工学院)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 提出Battery-Sim-Agent框架,将电池逆参数估计重构为推理任务,利用LLM智能体与高保真模拟器闭环交互,通过物理假设和结构化参数更新,显著优于贝叶斯优化等黑箱优化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29074 2026-05-29 cs.CV cs.RO 57%

Embodied3DBench: Benchmarking Low-Level Embodied Spatial Intelligence of Vision Language Models

Embodied3DBench: 视觉语言模型低级具身空间智能的基准测试

Jiyao Zhang, Mingxu Zhang, Yitong Peng, Haoxuan Liu, Chenshuo Wang, Yuxing Long, Haoyang Huang, Dongjiang Li, Nan Duan, Hui Shen, Hao Dong

机构 * CFCS, School of CS, PKU(计算机学院CFCS,北京大学) Jingdong Technology Information Technology Co., Ltd(京东科技信息技术有限公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 提出Embodied3DBench基准,通过6类任务(空间结构理解与交互导向感知)系统评估视觉语言模型在3D环境中的低级空间智能,并合成130万QA对训练数据以弥补能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22743 2026-05-29 physics.med-ph cond-mat.mtrl-sci physics.bio-ph 50%

Combining quasi-static and high frequency experiments for the viscoelastic characterization of brain tissue

结合准静态和高频实验对脑组织进行粘弹性表征

Laura Ruhland, Nina Reiter, Silvia Budday, Kai Willner

专题命中 多模态Agent :multi-modal(abstract)

AI总结 通过准静态大应变流变仪和高频磁共振弹性成像实验,校准分数阶Kelvin-Voigt模型,统一不同时间尺度的脑组织力学行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05968 2026-05-29 cs.LG cs.MA 50%

Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition

离线多智能体强化学习通过序列得分分解

Dan Qiao, Wenhao Li, Shanchao Yang, Hongyuan Zha, Baoxiang Wang

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)数据科学学院) School of Computer Science, Tongji University, Shanghai, China(同济大学计算机科学学院) Vector Institute(向量研究所)

专题命中 多模态Agent :multimodal(abstract)

AI总结 针对离线合作多智能体强化学习中联合动作空间高维和异质行为数据导致的策略分布偏移问题,提出序列得分函数分解方法,利用扩散模型从多模态离线数据中学习每个智能体的正则化信号,指导策略更新至高分、分布内区域,在多个粒子环境和多智能体MuJoCo基准上实现最先进性能。

Comments ICML 2026 Accepted

Journal ref Forty-Third International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏