arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-17 至 2026-03-17 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 8 篇

2603.15260 2026-03-17 cs.AI cs.CV 81%

AGCD: Agent-Guided Cross-Modal Decoding for Weather Forecasting

AGCD:面向天气预报的代理引导跨模态解码

Jing Wu, Yang Liu, Lin Zhang, Junbo Zeng, Jiabin Wang, Zi Ye, Guowen Li, Shilei Cao, Jiashun Cheng, Fang Wang, Meng Jin, Yerong Feng, Hong Cheng, Yutong Lu, Haohuan Fu, Juepeng Zheng

机构 * Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Jiangxi Science and Technology Normal University(江西科技师范大学) China Meteorological Administration(中国气象局) Huawei Technologies Co., Ltd(华为技术有限公司) Guangdong-Hong Kong-Macao Greater Bay Area Weather Research Center for Monitoring Warning and Forecasting(粤港澳大湾区气象监测预警与预报研究中心) National Supercomputing Center in Shenzhen(深圳国家超算中心) Tsinghua University(清华大学)

专题命中 多模态Agent :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 AGCD通过在解码时注入状态条件化的物理先验,提升天气预报的结构一致性和物理一致性,实验显示在不同分辨率和模型上均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15280 2026-03-17 cs.AI 79%

Advancing Multimodal Agent Reasoning with Long-Term Neuro-Symbolic Memory

通过长期神经符号记忆推进多模态代理推理

Rongjie Jiang, Jianwei Wang, Gengda Zhao, Chengyang Luo, Kai Wang, Wenjie Zhang

机构 * University of New South Wales(新南威尔士大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出NS-Mem框架,结合神经记忆与符号结构,提升多模态代理的推理能力,实验证明其在推理准确率上优于纯神经记忆系统。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14540 2026-03-17 cs.RO 78%

Multimodal Belief-Space Covariance Steering with Active Probing and Influence for Interactive Driving

多模态信念空间协方差操控与主动探测及影响的交互驾驶

Devodita Chakravarty, John Dolan, Yiwei Lyu

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本文提出一种多模态信念空间协方差操控方法,通过主动探测和影响策略,在交互驾驶中提升安全性和决策效率。

Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15039 2026-03-17 cs.CV 70%

GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents

GUI-CEval: 一种用于移动GUI代理的分层和全面的中文基准

Yang Li, Yuchen Liu, Haoyu Lu, Zhiqiang Xia, Hongzhen Wang, Kaiyang Han, Changpeng Yang, Jinyang Wu, Jiaming Xu, Runyu Shi, Ying Huang

机构 * HyperAI Team, Xiaomi Corporation(HyperAI团队,小米公司)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出GUI-CEval,首个针对中文移动GUI代理的全面基准,涵盖201款主流应用,通过分层结构评估感知、规划、反思、执行和评估五方面能力,验证模型在真实交互中的表现。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14448 2026-03-17 cs.LG 67%

Zoom to Essence: Trainless GUI Grounding by Inferring upon Interface Elements

聚焦本质:通过推断界面元素实现无训练GUI接地

Ziwei Liu, Tao Feng, Borui Kang, Yanbing Yang, Jun Luo

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract)

AI总结 本文提出ZoomUI,通过推断界面元素实现无训练GUI接地,利用推理缩放引导常见MLLM逐步锚定指令元素到更详细的界面元素,提升GUI代理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13710 2026-03-17 cs.AI 57%

InterventionLens: A Multi-Agent Framework for Detecting ASD Intervention Strategies in Parent-Child Shared Reading

InterventionLens:一种多智能体框架,用于检测自闭症干预策略在父母-儿童共读中的应用

Xiao Wang, Lu Dong, Ifeoma Nwogu, Srirangaraj Setlur, Venu Govindaraju

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出InterventionLens,一种多智能体系统,用于自动检测和时间分割共读视频中的护理人员干预策略,实验表明其在ASD-HI数据集上的F1分数达到79.44%,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08478 2026-03-17 cs.RO cs.LG 50%

STRIDE: Structured Lagrangian and Stochastic Residual Dynamics via Flow Matching

STRIDE: 通过流匹配实现结构化拉格朗日和随机残差动力学

Prakrut Kotecha, Ganga Nair B, Shishir Kolathaya

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出STRIDE框架,结合拉格朗日神经网络与条件流匹配,分离保守刚体动力学与非保守随机交互效应,提升机器人在不确定环境中的预测精度与控制可靠性。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13840 2026-03-17 cs.MA 50%

ClimateAgents: A Multi-Agent Research Assistant for Social-Climate Dynamics Analysis

ClimateAgents: 一种用于社会-气候动态分析的多智能体研究助手

Shan Shan

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出ClimateAgents,一种多智能体研究助手,通过整合多模态数据检索、统计建模和自动推理,帮助研究者探索社会-环境动态,提升气候分析的适应性和解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏