arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-19 至 2026-03-19 共收录 79 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 10 篇

2603.17191 2026-03-19 cs.CL cs.LG q-bio.QM 79%

Tabular LLMs for Interpretable Few-Shot Alzheimer's Disease Prediction with Multimodal Biomedical Data

用于多模态生物医学数据的可解释少样本阿尔茨海默病预测的表格LLMs

Sophie Kearney, Shu Yang, Zixuan Wen, Weimin Lyu, Bojian Hou, Duy Duong-Tran, Tianlong Chen, Jason H. Moore, Marylyn D. Ritchie, Chao Chen, Li Shen

机构 * University of Pennsylvania(宾夕法尼亚大学) Stony Brook University(石溪大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Medical University of South Carolina(南卡罗来纳医科大学) Cedars-Sinai Medical Center(西格拉姆山医疗中心)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出TAP-GPT框架,利用预训练的大语言模型进行少样本阿尔茨海默病分类,展示了其在多模态生物医学数据中的优越性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15797 2026-03-19 cs.LG cs.AI 79%

OMNIFLOW: A Physics-Grounded Multimodal Agent for Generalized Scientific Reasoning

OMNIFLOW:一种基于物理的多模态代理用于通用科学推理

Hao Wu, Yongheng Zhang, Yuan Gao, Fan Xu, Fan Zhang, Ruobing Xie, Ruijian Gou, Yuxuan Liang, Xiaomeng Huang, Xian Wu

机构 * Tsinghua University(清华大学) Tencent(腾讯) Shenzhen Loop Area Institute(深圳河套学院) Ocean University of China(海洋大学) HKUST (Guangzhou)(香港科技大学(广州))

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 OMNIFLOW通过引入语义-符号对齐机制和物理引导的推理流程,实现了多模态模型在物理定律下的科学推理,显著提升了零样本泛化和少样本适应能力,提供透明且物理一致的推理报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02458 2026-03-19 cs.CV 79%

Vision to Geometry: 3D Spatial Memory for Sequential Embodied MLLM Reasoning and Exploration

视觉到几何:用于连续具身MLLM推理和探索的3D空间记忆

Zhongyi Cai, Yi Du, Chen Wang, Yu Kong

机构 * ACTION Lab, Michigan State University(密歇根州立大学ACTION实验室) SAIR Lab, University at Buffalo(布法罗大学SAIR实验室)

专题命中 多模态Agent :MLLM(title);multi-modal(abstract);分类 cs.CV

AI总结 本文提出3DSPMR框架,利用视场覆盖作为几何先验,提升具身智能在连续任务中的记忆、推理与探索能力,并引入SEER-Bench基准测试连续具身探索与推理任务。

Comments Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19405 2026-03-19 cs.CV 79%

Multi-modal 3D Pose and Shape Estimation with Computed Tomography

基于计算机断层扫描的多模态3D姿态和形状估计

Mingxiao Tu, Hoijoon Jung, Alireza Moghadam, Jineel Raythatha, Lachlan Allan, Jeremy Hsu, Andre Kyme, Jinman Kim

机构 * School of Computer Science, The University of Sydney, Sydney, NSW 2006, Australia(悉尼大学计算机科学学院) School of Biomedical Engineering, The University of Sydney, Sydney, NSW 2006, Australia(悉尼大学生物医学工程学院) Trauma Service, Westmead Hospital, Australia(西墨迪医院创伤服务)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态在床患者3D姿态和形状估计网络,融合CT扫描的几何特征和深度图,有效重建遮挡区域并提升估计精度,实验表明其在姿态和形状估计上分别优于现有方法23%和49.16%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17043 2026-03-19 cs.CV 77%

OpenQlaw: An Agentic AI Assistant for Analysis of 2D Quantum Materials

OpenQlaw: 一种用于二维量子材料分析的代理AI助手

Sankalp Pandey, Xuan-Bac Nguyen, Hoang-Quan Nguyen, Tim Faltermeier, Nicholas Borys, Hugh Churchill, Khoa Luu

机构 * Quantum AI Lab, University of Arkansas, USA(量子人工智能实验室,美国亚拉巴马大学) University of Utah, USA(美国犹他大学) Department of Physics, University of Arkansas, USA(美国亚拉巴马大学物理系) MonARK NSF Quantum Foundry(MonARK NSF 量子熔炉)

专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 OpenQlaw通过整合NanoBot和QuPAINT,实现二维材料分析中的动态推理与可视化,提升科研人员在高通量器件制造中的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17694 2026-03-19 cs.AI 57%

MALLES: A Multi-agent LLMs-based Economic Sandbox with Consumer Preference Alignment

MALLES:基于多智能体LLM的经济沙盒与消费者偏好对齐

Yusen Wu, Yiran Liu, Xiaotie Deng

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出MALLES,通过大规模模型的泛化能力构建统一模拟框架,利用偏好学习对齐LLM,解决高维环境下的数据稀疏问题,提升经济模拟的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17055 2026-03-19 cs.CV 57%

PaAgent: Portrait-Aware Image Restoration Agent via Subjective-Objective Reinforcement Learning

PaAgent:通过主观-客观强化学习实现的面向人物图像修复代理

Yijian Wang, Qingsen Yan, Jiantao Zhou, Duwei Dai, Wei Dong

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院) State Key Laboratory of Internet of Things for Smart City, University of Macau(澳门大学智慧城市物联网国家重点实验室) National-Local Joint Engineering Research Center of Biodiagnosis and Biotherapy, the Second Affiliated Hospital of Xi’an Jiaotong University(西安交通大学生物诊断与生物治疗国家地方联合工程研究中心) College of Information and Control Engineering, Xi’an University of Architecture and Technology(西安建筑科技大学信息与控制工程学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 PaAgent通过结合自进化的人物银行和检索增强生成技术,提升图像修复任务中对复杂场景的感知能力,通过主观-客观强化学习策略优化修复工具选择,实验验证其在多种修复基准上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17634 2026-03-19 eess.SY cs.SY 50%

Hierarchical Decision-Making under Uncertainty: A Hybrid MDP and Chance-Constrained MPC Approach

在不确定性下的分层决策:一种混合MDP和机会约束MPC方法

Siyuan Li, Chengyuan Liu, Wen-Hua Chen

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出一种混合MDP和机会约束MPC的分层决策框架,用于自动驾驶中处理不确定性,通过多模态预测与安全约束实现 maneuver 选择与动态可行性的统一,验证了其在高速公路和城市环境中的安全性和效率。

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 8 篇

2603.17705 2026-03-19 cs.CV 83%

Parameter-Efficient Modality-Balanced Symmetric Fusion for Multimodal Remote Sensing Semantic Segmentation

参数高效模态平衡对称融合用于多模态遥感语义分割

Haocheng Li, Juepeng Zheng, Shuangxi Miao, Ruibo Lu, Guosheng Cai, Haohuan Fu, Jianxi Huang

机构 * College of Land Science and Technology, China Agricultural University(中国农业大学土地科学与技术学院) Key Laboratory of Remote Sensing for Agri-Hazards, Ministry of Agriculture and Rural Affairs(农业农村部农业灾害遥感重点实验室) Faculty of Geosciences and Engineering, Southwest Jiaotong University(西南交通大学地质科学与工程学院) School of Artificial Intelligence, Sun Yat-Sen University(中山大学人工智能学院) Henan Polytechnic University(河南理工大学) Key Laboratory of Spatio-Temporal Information and Ecological Restoration of Mines, Ministry of Natural Resources of the People’s Republic of China(矿产资源时空信息与生态修复重点实验室) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) National Supercomputing Center in Shenzhen, Shenzhen, China(深圳国家超算中心) Ministry of Education Key Laboratory for Earth System Modeling and the Department of Earth System Science, Tsinghua University(地球系统模拟教育部重点实验室和清华大学地球系统科学系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MoBaNet,通过参数高效和模态平衡的对称融合框架,在减少可训练参数的同时提升多模态遥感语义分割的鲁棒性和平衡性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16421 2026-03-19 cs.CV 83%

HGP-Mamba: Integrating Histology and Generated Protein Features for Mamba-based Multimodal Survival Risk Prediction

HGP-Mamba:整合组织学与生成的蛋白质特征用于基于Mamba的多模态生存风险预测

Jing Dai, Chen Wu, Ming Wu, Qibin Zhang, Zexi Wu, Jingdong Zhang, Hongming Xu

机构 * Cancer Hospital of Dalian University of Technology, Shenyang, China(大连理工大学沈阳医院) School of Biomedical Engineering, Faculty of Medicine, Dalian University of Technology, Dalian, China(大连理工大学生物医学工程学院) Key Laboratory of Integrated Circuit and Biomedical Electronic System, Dalian University of Technology, Dalian, China(大连理工大学集成电路与生物医学电子系统重点实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出HGP-Mamba框架,通过整合组织学与生成蛋白质特征,提升多模态生存风险预测的效率与性能。

Comments Accepted at IEEE ICME 2026. This arXiv version includes additional supplementary experiments and extended discussions beyond the conference version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17753 2026-03-19 cs.CV 79%

PC-CrossDiff: Point-Cluster Dual-Level Cross-Modal Differential Attention for Unified 3D Referring and Segmentation

PC-CrossDiff:点-簇双级跨模态微分注意力用于统一的3D指称与分割

Wenbin Tan, Jiawen Lin, Fangyong Wang, Yuan Xie, Yong Xie, Yachao Zhang, Yanyun Qu

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出PC-CrossDiff框架,通过双级跨模态微分注意力解决复杂多物体场景中指称理解和分割的挑战,提升3D视觉定位的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17347 2026-03-19 cs.MM 79%

Beyond Forced Modality Balance: Intrinsic Information Budgets for Multimodal Learning

超越强制模态平衡:多模态学习中的内在信息预算

Zechang Xiong, Da Li, Kexin Tang, Pengyuan Li, Wenkang Kong, Yulan Hu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出IIBalance框架,通过内在信息预算对齐模态贡献,解决多模态学习中的模态不平衡问题,实验表明其优于现有方法。

Comments 6 pages, 4 figures, paper accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17228 2026-03-19 cs.CV cs.AI cs.LG 73%

From Drop-off to Recovery: A Mechanistic Analysis of Segmentation in MLLMs

从丢弃到恢复:对MLLMs分割能力的机理分析

Boyong Wu, Sanghwan Kim, Zeynep Akata

机构 * Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(亥姆霍兹慕尼黑) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文通过逐层线性探测评估MLLMs整个流程,揭示适配器导致的分割表示下降及LLM层通过注意力机制逐步恢复的机制,为未来分割模型设计提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17809 2026-03-19 cs.CV cs.AI 62%

Fine-Grained Post-Training Quantization for Large Vision Language Models with Quantization-Aware Integrated Gradients

细粒度后训练量化用于大型视觉语言模型的量化感知集成梯度

Ziwei Xiang, Fanhu Zeng, Hongjian Fang, Rui-Qi Wang, Renxing Chen, Yanan Zhu, Yi Chen, Peipei Yang, Xu-Yao Zhang

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,中国科学院自动化所) School of Artificial Intelligence, UCAS(人工智能学院,中国科学院大学) Beijing National Research Center for Information Science and Technology(北京信息科学研究中心) Institute of Artificial Intelligence, USTB(信息科学技术大学人工智能学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Zhongguancun Academy(中关村学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出细粒度后训练量化方法,通过量化感知集成梯度评估token敏感性,提升大型视觉语言模型的精度与效率。

Comments Accepted by CVPR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17647 2026-03-19 cs.CV 57%

Part-Aware Open-Vocabulary 3D Affordance Grounding via Prototypical Semantic and Geometric Alignment

面向部分的开放词汇3D功能接地 via 语义和几何对齐

Dongqiang Gou, Xuming He

机构 * ShanghaiTech University(上海科技大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种双阶段跨模态框架,通过增强语义和几何表示,解决开放词汇3D功能接地中的语义一致性、几何对齐和开放词汇泛化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17311 2026-03-19 cs.CL 57%

Ruyi2.5 Technical Report

Ruyi2.5 技术报告

Huan Song, Shuyu Tian, Qingfei Zhao, Wenhao Hong, Jiang Liu, Ting Long, Jiawei Shao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 Ruyi2.5基于AI Flow框架构建多模态家族模型,通过共享主干架构实现多尺度模型协同训练,提升部署层级语义一致性,同时提出隐私保护摄像头系统及BPPO算法加速强化学习微调。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他多模态 3 篇

2603.17712 2026-03-19 cs.RO cs.CV 70%

AERR-Nav: Adaptive Exploration-Recovery-Reminiscing Strategy for Zero-Shot Object Navigation

AERR-Nav:面向零样本物体导航的自适应探索-恢复-回忆策略

Jingzhi Huang, Junkai Huang, Haoyang Yang, Haoang Li, Yi Wang

机构 * Hong Kong Polytechnic University(香港理工大学) Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 其他多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出AERR-Nav框架,通过自适应探索-恢复-回忆策略和自适应探索状态,解决零样本物体导航中探索与利用的平衡问题,在HM3D和MP3D基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05542 2026-03-19 cs.DB cs.AI cs.ET cs.GR cs.HC cs.MM 62%

Human-Data Interaction, Exploration, and Visualization in the AI Era: Challenges and Opportunities

人工智能时代的人机交互、探索与可视化:挑战与机遇

Jean-Daniel Fekete, Yifan Hu, Dominik Moritz, Arnab Nandi, Senjuti Basu Roy, Eugene Wu, Nikos Bikakis, George Papastefanatos, Panos K. Chrysanthis, Guoliang Li, Lingyun Yu

机构 * Northeastern Univ., USA(东北大学) Ohio State Univ., USA(俄亥俄州立大学) Columbia Univ., USA(哥伦比亚大学) Athena RC, Greece(雅典娜研究组) Tsinghua Univ., China(清华大学) Xi’an Jiaotong-Liverpool Univ., China(西安交通大学利物浦大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 本文探讨人工智能发展带来的挑战,分析用户与数据互动的新方式,并提出构建以人为中心的AI系统的新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17223 2026-03-19 cs.DB cs.IR 50%

ListK: Semantic ORDER BY and LIMIT K with Listwise Prompting

ListK: 基于列表提示的语义ORDER BY和LIMIT K

Jason Shin, Jiwon Chang, Fatemeh Nargesian

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出ListK框架,通过结合列表wise排序算法优化语义ORDER BY和LIMIT K,显著降低延迟且不牺牲准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏