arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-19 至 2026-03-19 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 10 篇

2509.13615 2026-03-19 cs.AI cs.CL cs.HC 81%

See, Think, Act: Teaching Multimodal Agents to Effectively Interact with GUI by Identifying Toggles

看见、思考、行动:通过识别切换器教多模态代理有效交互GUI

Zongru Wu, Rui Mao, Zhiyuan Tian, Pengzhou Cheng, Tianjie Ju, Zheng Wu, Lingzhong Dong, Haiyue Sheng, Zhuosheng Zhang, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出State-aware Reasoning方法,通过识别当前切换状态和指令目标状态,提升多模态代理在GUI切换指令执行的准确性,实验显示准确率提升超30%。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17826 2026-03-19 cs.SE cs.AI 79%

FailureMem: A Failure-Aware Multimodal Framework for Autonomous Software Repair

FailureMem: 一种面向故障的多模态框架用于自主软件修复

Ruize Ma, Yilei Jiang, Shilin Zhang, Zheng Ma, Yi Feng, Vincent Ng, Zhi Wang, Xiangyu Yue, Chuanyi Li, Lewei Lu

机构 * Nanjing University(南京大学) SenseTime(秒速) The Chinese University of Hong Kong(香港中文大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出FailureMem框架,通过融合工作流代理、主动感知工具和故障记忆库,提升多模态自动程序修复的效率与准确性,实验表明其在GUI修复任务中解决率提升3.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17191 2026-03-19 cs.CL cs.LG q-bio.QM 79%

Tabular LLMs for Interpretable Few-Shot Alzheimer's Disease Prediction with Multimodal Biomedical Data

用于多模态生物医学数据的可解释少样本阿尔茨海默病预测的表格LLMs

Sophie Kearney, Shu Yang, Zixuan Wen, Weimin Lyu, Bojian Hou, Duy Duong-Tran, Tianlong Chen, Jason H. Moore, Marylyn D. Ritchie, Chao Chen, Li Shen

机构 * University of Pennsylvania(宾夕法尼亚大学) Stony Brook University(石溪大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Medical University of South Carolina(南卡罗来纳医科大学) Cedars-Sinai Medical Center(西格拉姆山医疗中心)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出TAP-GPT框架,利用预训练的大语言模型进行少样本阿尔茨海默病分类,展示了其在多模态生物医学数据中的优越性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15797 2026-03-19 cs.LG cs.AI 79%

OMNIFLOW: A Physics-Grounded Multimodal Agent for Generalized Scientific Reasoning

OMNIFLOW:一种基于物理的多模态代理用于通用科学推理

Hao Wu, Yongheng Zhang, Yuan Gao, Fan Xu, Fan Zhang, Ruobing Xie, Ruijian Gou, Yuxuan Liang, Xiaomeng Huang, Xian Wu

机构 * Tsinghua University(清华大学) Tencent(腾讯) Shenzhen Loop Area Institute(深圳河套学院) Ocean University of China(海洋大学) HKUST (Guangzhou)(香港科技大学(广州))

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 OMNIFLOW通过引入语义-符号对齐机制和物理引导的推理流程,实现了多模态模型在物理定律下的科学推理,显著提升了零样本泛化和少样本适应能力,提供透明且物理一致的推理报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02458 2026-03-19 cs.CV 79%

Vision to Geometry: 3D Spatial Memory for Sequential Embodied MLLM Reasoning and Exploration

视觉到几何:用于连续具身MLLM推理和探索的3D空间记忆

Zhongyi Cai, Yi Du, Chen Wang, Yu Kong

机构 * ACTION Lab, Michigan State University(密歇根州立大学ACTION实验室) SAIR Lab, University at Buffalo(布法罗大学SAIR实验室)

专题命中 多模态Agent :MLLM(title);multi-modal(abstract);分类 cs.CV

AI总结 本文提出3DSPMR框架,利用视场覆盖作为几何先验,提升具身智能在连续任务中的记忆、推理与探索能力,并引入SEER-Bench基准测试连续具身探索与推理任务。

Comments Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19405 2026-03-19 cs.CV 79%

Multi-modal 3D Pose and Shape Estimation with Computed Tomography

基于计算机断层扫描的多模态3D姿态和形状估计

Mingxiao Tu, Hoijoon Jung, Alireza Moghadam, Jineel Raythatha, Lachlan Allan, Jeremy Hsu, Andre Kyme, Jinman Kim

机构 * School of Computer Science, The University of Sydney, Sydney, NSW 2006, Australia(悉尼大学计算机科学学院) School of Biomedical Engineering, The University of Sydney, Sydney, NSW 2006, Australia(悉尼大学生物医学工程学院) Trauma Service, Westmead Hospital, Australia(西墨迪医院创伤服务)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态在床患者3D姿态和形状估计网络,融合CT扫描的几何特征和深度图,有效重建遮挡区域并提升估计精度,实验表明其在姿态和形状估计上分别优于现有方法23%和49.16%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17043 2026-03-19 cs.CV 77%

OpenQlaw: An Agentic AI Assistant for Analysis of 2D Quantum Materials

OpenQlaw: 一种用于二维量子材料分析的代理AI助手

Sankalp Pandey, Xuan-Bac Nguyen, Hoang-Quan Nguyen, Tim Faltermeier, Nicholas Borys, Hugh Churchill, Khoa Luu

机构 * Quantum AI Lab, University of Arkansas, USA(量子人工智能实验室,美国亚拉巴马大学) University of Utah, USA(美国犹他大学) Department of Physics, University of Arkansas, USA(美国亚拉巴马大学物理系) MonARK NSF Quantum Foundry(MonARK NSF 量子熔炉)

专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 OpenQlaw通过整合NanoBot和QuPAINT,实现二维材料分析中的动态推理与可视化,提升科研人员在高通量器件制造中的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17694 2026-03-19 cs.AI 57%

MALLES: A Multi-agent LLMs-based Economic Sandbox with Consumer Preference Alignment

MALLES:基于多智能体LLM的经济沙盒与消费者偏好对齐

Yusen Wu, Yiran Liu, Xiaotie Deng

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出MALLES,通过大规模模型的泛化能力构建统一模拟框架,利用偏好学习对齐LLM,解决高维环境下的数据稀疏问题,提升经济模拟的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17055 2026-03-19 cs.CV 57%

PaAgent: Portrait-Aware Image Restoration Agent via Subjective-Objective Reinforcement Learning

PaAgent:通过主观-客观强化学习实现的面向人物图像修复代理

Yijian Wang, Qingsen Yan, Jiantao Zhou, Duwei Dai, Wei Dong

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院) State Key Laboratory of Internet of Things for Smart City, University of Macau(澳门大学智慧城市物联网国家重点实验室) National-Local Joint Engineering Research Center of Biodiagnosis and Biotherapy, the Second Affiliated Hospital of Xi’an Jiaotong University(西安交通大学生物诊断与生物治疗国家地方联合工程研究中心) College of Information and Control Engineering, Xi’an University of Architecture and Technology(西安建筑科技大学信息与控制工程学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 PaAgent通过结合自进化的人物银行和检索增强生成技术,提升图像修复任务中对复杂场景的感知能力,通过主观-客观强化学习策略优化修复工具选择,实验验证其在多种修复基准上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17634 2026-03-19 eess.SY cs.SY 50%

Hierarchical Decision-Making under Uncertainty: A Hybrid MDP and Chance-Constrained MPC Approach

在不确定性下的分层决策:一种混合MDP和机会约束MPC方法

Siyuan Li, Chengyuan Liu, Wen-Hua Chen

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出一种混合MDP和机会约束MPC的分层决策框架,用于自动驾驶中处理不确定性,通过多模态预测与安全约束实现 maneuver 选择与动态可行性的统一,验证了其在高速公路和城市环境中的安全性和效率。

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏