arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-17 至 2026-03-17 共收录 199 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 40 篇

2509.24741 2026-03-17 cs.CV 79%

Collaborating Vision, Depth, and Thermal Signals for Multi-Modal Tracking: Dataset and Algorithm

融合视觉、深度和热信号的多模态跟踪:数据集与算法

Xue-Feng Zhu, Tianyang Xu, Yifan Pan, Jinjie Gu, Xi Li, Jiwen Lu, Xiao-Jun Wu, Josef Kittler

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出多模态跟踪任务,结合RGB、深度和热红外信号,构建RGBDT500数据集,并提出RDTTrack算法,通过融合三模态信息提升复杂场景下的跟踪鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14229 2026-03-17 cs.AI cs.SE 79%

Agentic DAG-Orchestrated Planner Framework for Multi-Modal, Multi-Hop Question Answering in Hybrid Data Lakes

基于代理的DAG编排规划框架:用于混合数据湖中多模态、多跳问答系统

Kirushikesh D B, Manish Kesarwani, Nishtha Madaan, Sameep Mehta, Aldrin Dennis, Siddarth Ajay, Rakesh B R, Renu Rajagopal, Sudheesh Kairali

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出A.DOT规划框架,通过编译自然语言查询为DAG执行计划,实现多模态多跳问答,提升准确性和效率,并生成可追溯的证据链。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00744 2026-03-17 cs.CV 79%

Localizing Before Answering: A Hallucination Evaluation Benchmark for Grounded Medical Multimodal LLMs

先定位后回答:一种用于基于地面的医学多模态大语言模型的幻觉评估基准

Dung Nguyen, Minh Khoi Ho, Huy Ta, Thanh Tam Nguyen, Qi Chen, Kumar Rav, Quy Duong Dang, Satwik Ramchandre, Son Lam Phung, Zhibin Liao, Minh-Son To, Johan Verjans, Phi Le Nguyen, Vu Minh Hieu Phan

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 本文提出HEAL-MedVQA基准,通过创新评估协议和67K VQA数据集,评估医学多模态模型的定位能力与幻觉鲁棒性,提出LobA框架提升视觉推理能力,实验结果表明其在挑战性基准中优于现有生物医学LMMs。

Comments Accepted at Joint Conference on Artificial Intelligence (IJCAI) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13362 2026-03-17 cs.SD cs.AI eess.AS 76%

Patient-Level Multimodal Question Answering from Multi-Site Auscultation Recordings

多站点听诊录音的患者级多模态问答

Fan Wu, Tsai-Ning Wang, Nicolas Zumarraga, Ning Wang, Markus Kreft, Kevin O'Sullivan, Elgar Fleisch, Oliver Aalami, Paul Schmiedmayer, Robert Jakob, Patrick Langer

机构 * Agentic Systems Lab, ETH Zurich(伦理学院系统实验室,苏黎世联邦理工学院) Eindhoven University of Technology(埃因霍温理工大学) Centre for Digital Health Interventions, ETH Zurich(数字健康干预中心,苏黎世联邦理工学院) Centre for Digital Health Interventions, University of St. Gallen(数字健康干预中心,圣加尔登大学) Stanford Mussallem Center for Biodesign, Stanford University(斯坦福穆萨勒姆生物设计中心,斯坦福大学)

专题命中 多模态评测 :multimodal(title);分类 cs.AI、eess.AS

AI总结 本文提出通过门控交叉注意力将多站点听诊录音与冻结的大语言模型嵌入空间对齐,实现患者级评估,在CaReSound基准上取得SOTA结果,展示轻量领域特定编码器与多站点聚合的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12720 2026-03-17 cs.CL cs.CV cs.MM cs.SD 75%

Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception

Omni-Captioner:多模态信息细粒度感知的数据管道、模型与基准

Ziyang Ma, Ruiyang Xu, Zhenghao Xing, Yunfei Chu, Yuxuan Wang, Jinzheng He, Jin Xu, Pheng-Ann Heng, Kai Yu, Junyang Lin, Eng Siong Chng, Xie Chen

专题命中 多模态评测 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 本文提出Omni-Captioner,通过数据管道、模型和基准系统,系统研究多模态细粒度感知,提出Omni-Detective生成高质量数据,实现音频和视频细粒度描述的最优性能。

Comments Accepted by ICLR2026. Open Source at https://github.com/ddlBoJack/Omni-Captioner

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13391 2026-03-17 cs.CV 74%

WebVR: Benchmarking Multimodal LLMs for WebPage Recreation from Videos via Human-Aligned Visual Rubrics

WebVR:通过人类对齐的视觉标准基准测试多模态大语言模型从视频中重建网页

Yuhong Dai, Yanlin Lai, Mitt Huang, Hangyu Guo, Dingming Li, Hongbo Peng, Haodong Li, Yingxiu Zhao, Haoran Lyu, Zheng Ge, Xiangyu Zhang, Daxin Jiang

机构 * StepFun Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 WebVR通过人类对齐的视觉标准评估多模态大语言模型从视频中重建网页的能力,包含175个多样化网页,展示了模型在细节风格和运动质量上的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15540 2026-03-17 cs.CV cs.CL 73%

Beyond Words: Enhancing Desire, Emotion, and Sentiment Recognition with Non-Verbal Cues

超越词语:利用非语言线索增强欲望、情感和情感识别

Wei Chen, Tongguan Wang, Feiyue Xue, Junkai Li, Hui Liu, Ying Sha

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出SyDES框架,通过双向细粒度模态对齐和非语言线索利用,提升多模态欲望、情感和情感识别性能,实验显示在MSED基准上取得新的SOTA成果。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15409 2026-03-17 cs.CL 70%

SEA-Vision: A Multilingual Benchmark for Comprehensive Document and Scene Text Understanding in Southeast Asia

SEA-Vision:面向东南亚的多语言综合文档和场景文本理解基准

Pengfei Yue, Xingran Zhao, Juntao Chen, Peng Hou, Wang Longchao, Jianghang Lin, Shengchuan Zhang, Anxiang Zeng, Liujuan Cao

机构 * Xiamen University, China(厦门大学,中国) Shopee, China(Shopee,中国) Tongji University, China(同济大学,中国)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CL

AI总结 SEA-Vision提出一个多语言基准,用于评估文档解析和文本中心视觉问答,涵盖11种东南亚语言,包含15234页文档和7496对问答对,揭示多语言文档理解的差距。

Comments Accepted By CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07610 2026-03-17 cs.CV cs.CL cs.HC 62%

SpatialViz-Bench: A Cognitively-Grounded Benchmark for Diagnosing Spatial Visualization in MLLMs

SpatialViz-Bench:一种基于认知的多模态基准,用于诊断大语言模型中的空间可视化能力

Siting Wang, Minnan Pei, Luoyang Sun, Cheng Deng, Yuchen Li, Kun Shao, Zheng Tian, Haifeng Zhang, Jun Wang

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出SpatialViz-Bench,一个包含12个任务和4种子能力的多模态基准,通过1180个程序生成问题评估大语言模型的空间可视化能力,揭示了模型在空间任务中的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04779 2026-03-17 cs.CL cs.SD eess.AS 62%

MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark

MMSU:一个大规模多任务语音语言理解与推理基准

Dingdong Wang, Junan Li, Jincenzi Wu, Dongchao Yang, Xueyuan Chen, Tianhua Zhang, Helen Meng

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 MMSU基准通过整合语音的语义、语调和语音学特征,评估语音语言理解与推理能力,发现现有模型存在改进空间,为开发更高级的人机语音交互系统提供新标准。

Comments ICLR 2026. MMSU benchmark is available at https://huggingface.co/datasets/ddwang2000/MMSU. Project page https://github.com/dingdongwang/MMSU

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16643 2026-03-17 cs.CV cs.AI 62%

From Evaluation to Defense: Advancing Safety in Video Large Language Models

从评估到防御:推进视频大语言模型的安全性

Yiwei Sun, Peiqi Jiang, Chuanbin Liu, Luohao Lin, Zhiying Lu, Hongtao Xie

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VideoSafety-R1框架,通过创新方法提升视频大语言模型的安全性,实验显示其在多个安全数据集上取得显著提升。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14426 2026-03-17 cs.CV cs.IR cs.MM 62%

GenState-AI: State-Aware Dataset for Text-to-Video Retrieval on AI-Generated Videos

GenState-AI:面向AI生成视频的基于状态的文本到视频检索数据集

Minghan Li, Tongna Chen, Tianrui Lv, Yishuai Zhang, Suchao An, Guodong Zhou

专题命中 多模态评测 :MLLM(abstract);分类 cs.CV、cs.MM

AI总结 本文提出GenState-AI数据集,通过可控状态转换和显式端状态标注,解决文本到视频检索中时间推理和端状态定位不足的问题,评估两种基线模型并分析时间与语义混淆源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14326 2026-03-17 cs.LG cs.AI cs.CL 62%

ECG-Reasoning-Benchmark: A Benchmark for Evaluating Clinical Reasoning Capabilities in ECG Interpretation

ECG-Reasoning-Benchmark: 一个用于评估心电图解读中临床推理能力的基准

Jungwoo Oh, Hyunseung Chung, Junhee Lee, Min-Gyu Kim, Hangyul Yoon, Ki Seong Lee, Youngchae Lee, Muhan Yeo, Edward Choi

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ECG-Reasoning-Benchmark,通过6400个样本系统评估17种核心心电图诊断的逐步推理能力,发现现有多模态大语言模型在多步逻辑推理中存在严重缺陷,无法有效将心电图发现与实际信号证据关联。

Comments Preprint. 9 pages for main text, 2 pages for references, 19 pages for supplementary materials (appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14323 2026-03-17 cs.CV cs.AI 62%

How Do Medical MLLMs Fail? A Study on Visual Grounding in Medical Images

医学 MLLMs 如何失效?对医学图像中视觉语义关联的探讨

Guimeng Liu, Tianze Yu, Somayeh Ebrahimkhani, Lin Zhi Zheng Shawn, Kok Pin Ng, Ngai-Man Cheung

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了医学 MLLMs 在视觉关联上的不足,通过设计 VGMED 数据集和 VGRefine 方法,验证了其在医学图像任务中的性能瓶颈。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16457 2026-03-17 cs.HC cs.AI cs.CL 62%

Integrating Personality into Digital Humans: A Review of LLM-Driven Approaches for Virtual Reality

将人格融入数字人类:一种基于大语言模型的虚拟现实方法综述

Iago Alves Brito, Julia Soares Dollis, Fernanda Bufon Färber, Pedro Schindler Freire Brasil Ribeiro, Rafael Teixeira Sousa, Arlindo Rodrigues Galvão Filho

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了利用大语言模型驱动虚拟现实中的数字人类人格塑造方法,探讨了零样本、少样本和微调等技术,并指出计算需求、延迟及多模态交互评估框架缺乏等挑战。

Comments Revised and expanded version of the survey published in Findings of EMNLP 2025. Includes 14 pages and 2 figures

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, 9519--9532

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14952 2026-03-17 cs.CV 57%

Pansharpening for Thin-Cloud Contaminated Remote Sensing Images: A Unified Framework and Benchmark Dataset

针对薄云污染的遥感图像全色增强:一个统一框架和基准数据集

Songcheng Du, Yang Zou, Jiaxin Li, Mingxuan Liu, Ying Li, Changjing Shang, Qiang Shen

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出统一全色增强模型与薄云去除框架,通过频率解耦恢复模块和交互频域一致性模块提升图像恢复性能,并构建首个真实世界薄云污染数据集,验证了方法在实际大气退化下的优越性。

Comments 11 pages,5 figures,published in AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14880 2026-03-17 cs.CV 57%

RealVLG-R1: A Large-Scale Real-World Visual-Language Grounding Benchmark for Robotic Perception and Manipulation

RealVLG-R1: 一个大规模真实世界视觉-语言接地基准,用于机器人感知与操作

Linfei Li, Lin Zhang, Ying Shen

机构 * School of Computer Science and Technology, Tongji University, China(同济大学计算机科学与技术学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出RealVLG框架,结合RealVLG-11B数据集和RealVLG-R1模型,统一了真实世界视觉-语言接地与抓取任务,支持零样本感知与操作,提供全面的数据与评估平台。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21071 2026-03-17 cs.HC cs.AI 57%

FingerTip 20K: A Benchmark for Proactive and Personalized Mobile LLM Agents

FingerTip 20K: 一个用于主动和个性化移动大语言模型代理的基准测试

Qinglong Yang, Haoming Li, Haotian Zhao, Xiaokai Yan, Jingtao Ding, Fengli Xu, Yong Li

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出FingerTip 20K基准测试,通过收集20000个真实用户多步骤Android交互演示,评估主动任务建议和个性化任务执行的挑战,展示基于用户信息的移动LLM代理的潜力。

Comments ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14701 2026-03-17 cs.CV 57%

AURORA-KITTI: Any-Weather Depth Completion and Denoising in the Wild

AURORA-KITTI: 任意天气下的深度补全与去噪

Yiting Wang, Tim Brödermann, Hamed Haghighi, Haonan Zhao, Christos Sakaridis, Kurt Debattista, Valentina Donzella

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出AURORA-KITTI,首个大规模多模态多天气基准,通过统一任务深度补全与去噪,在恶劣天气下实现鲁棒的深度重建,同时引入DDCD基线模型提升效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14153 2026-03-17 cs.CV 57%

Garments2Look: A Multi-Reference Dataset for High-Fidelity Outfit-Level Virtual Try-On with Clothing and Accessories

Garments2Look:用于高保真服装级虚拟试穿的多参考数据集

Junyao Hu, Zhongwei Cheng, Waikeung Wong, Xingxing Zou

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Garments2Look数据集,用于高保真的服装级虚拟试穿,包含8万对多件服装到一套搭配的样本,涵盖40大类和300+细分类别,通过合成流程提升数据质量和任务难度,验证现有方法在完整服装试穿和层叠推断上的不足。

Comments CVPR 2026; Project Page: https://artmesciencelab.github.io/Garments2Look

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08741 2026-03-17 cs.CV 57%

HieraRS: A Hierarchical Segmentation Paradigm for Remote Sensing Enabling Multi-Granularity Interpretation and Cross-Domain Transfer

HieraRS: 一种用于遥感的分层分割范式,实现多粒度解释和跨领域迁移

Tianlong Ai, Tianzhu Liu, Haochen Jiang, Yanfeng Gu

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出HieraRS分层分割范式,解决现有方法在多粒度预测和跨领域迁移中的不足,引入BHCCM机制提升语义一致性,提出TransLU框架支持动态类别扩展,并构建MM-5B多模态数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13639 2026-03-17 cs.HC cs.MM cs.SE 57%

Adaptive Virtual Reality Museum: A Closed-Loop Framewor for Engagement-Aware Cultural Heritage

自适应虚拟现实博物馆:一种闭环框架用于参与感知的文化遗产

Joseph Damouni, Wadia Tanus, Naomi Unkelos-Shpigel

专题命中 多模态评测 :multimodal(abstract);分类 cs.MM

AI总结 本文提出一种闭环自适应界面,通过隐式多模态感知实时调整内容深度,提升文化遗产VR体验的参与度与探索时间。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03667 2026-03-17 cs.CV 57%

Colon-X: Advancing Intelligent Colonoscopy toward Clinical Reasoning

Colon-X:推动智能结肠镜向临床推理迈进

Ge-Peng Ji, Jingyi Liu, Deng-Ping Fan, Huazhu Fu, Nick Barnes

机构 * NKIARI & SLAI, Shenzhen Futian and VCIP, Nankai University, Tianjin, China(NKIARI与SLAI,深圳福田及VCIP,南开大学,天津,中国) Australian National University (ANU), Canberra, Australia(澳大利亚国立大学(ANU),堪培拉,澳大利亚) King Abdullah University of Science and Technology (KAUST), Thuwal, Saudi Arabia(国王阿卜杜勒·阿齐兹大学(KAUST),图瓦尔,沙特阿拉伯) Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(高性能计算研究所(IHPC),科学、技术和研究局(A*STAR),新加坡)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Colon-X,构建了最全面的结肠镜多模态数据集ColonVQA,并开发了专为结肠镜设计的ColonR1模型,通过任务自适应奖励和梯度稳定策略优化,在数据稀缺条件下实现了56.61%的总体准确率,优于监督微调方法。

Comments Technical report (v2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01716 2026-03-17 cs.DB cs.LG 50%

SemBench: A Benchmark for Semantic Query Processing Engines

SemBench:语义查询处理引擎的基准测试

Jiale Lao, Andreas Zimmerer, Olga Ovcharenko, Tianji Cong, Matthew Russo, Gerardo Vitagliano, Michael Cochez, Fatma Özcan, Gautam Gupta, Thibaud Hottelier, H. V. Jagadish, Kris Kissel, Sebastian Schelter, Andreas Kipf, Immanuel Trummer

专题命中 多模态评测 :multimodal(abstract)

AI总结 SemBench是一个针对语义查询处理引擎的基准测试,涵盖多场景、多模态和多操作符,评估不同系统在处理多模态数据时的性能。

Comments Accepted to VLDB 2026; Revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14789 2026-03-17 cs.RO 50%

GraspALL: Adaptive Structural Compensation from Illumination Variation for Robotic Garment Grasping in Any Low-Light Conditions

GraspALL: 适应性结构补偿从光照变化以实现机器人在任何低光条件下的服装抓取

Haifeng Zhong, Wenshuo Han, Zhouyu Wang, Runyang Feng, Fan Tang, Tong-Yee Lee, Zipei Fan, Ruihai Wu, Yuran Wang, Hao Dong, Hechang Chen, Hyung Jin Chang, Yixing Gao

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出GraspALL模型,通过编码连续光照变化来指导RGB与非RGB模态之间的自适应特征融合,提升低光环境下服装抓取的鲁棒性,实验表明在不同光照条件下抓取精度提高32-44%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14325 2026-03-17 cs.IT math.IT stat.ML 50%

Fundamental Limits of CSI Compression in FDD Massive MIMO

FDD大规模MIMO中CSI压缩的基本限制

Bumsu Park, Youngmok Park, Chanho Park, Namyoon Lee

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出基于高斯混合的变换编码方法,通过状态自适应变换实现高效CSI压缩,在保持分析 tractability 的同时提升RD性能。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01437 2026-03-17 stat.ME cs.LG stat.CO stat.ML 50%

Sampling as Bandits: Evaluation-Efficient Design for Black-Box Densities

采样作为老虎机:针对黑箱密度的评估高效设计

Takuo Matsubara, Andrew Duncan, Simon Cotter, Konstantinos Zygalakis

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出带老虎机重要性采样(BIS)框架,通过多臂老虎机的序列选择过程优化样本集,提高在目标密度计算昂贵时的采样效率,适用于多模态、重尾分布及现实贝叶斯推断任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.03460 2026-03-17 math.OC 50%

Bilevel Optimization and Heuristic Algorithms for Integrating Latent Demand into the Design of Large-Scale Transit Systems

双层优化与启发式算法在整合潜在需求进入大规模公共交通系统设计中的应用

Hongzhao Guan, Beste Basciftci, Pascal Van Hentenryck

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出双层优化模型TN-DA,结合公共交通运营商和乘客视角,通过启发式算法解决大规模公共交通系统设计中的潜在需求整合问题,验证了算法在实际案例中的高效性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 8 篇

2603.15260 2026-03-17 cs.AI cs.CV 81%

AGCD: Agent-Guided Cross-Modal Decoding for Weather Forecasting

AGCD:面向天气预报的代理引导跨模态解码

Jing Wu, Yang Liu, Lin Zhang, Junbo Zeng, Jiabin Wang, Zi Ye, Guowen Li, Shilei Cao, Jiashun Cheng, Fang Wang, Meng Jin, Yerong Feng, Hong Cheng, Yutong Lu, Haohuan Fu, Juepeng Zheng

机构 * Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Jiangxi Science and Technology Normal University(江西科技师范大学) China Meteorological Administration(中国气象局) Huawei Technologies Co., Ltd(华为技术有限公司) Guangdong-Hong Kong-Macao Greater Bay Area Weather Research Center for Monitoring Warning and Forecasting(粤港澳大湾区气象监测预警与预报研究中心) National Supercomputing Center in Shenzhen(深圳国家超算中心) Tsinghua University(清华大学)

专题命中 多模态Agent :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 AGCD通过在解码时注入状态条件化的物理先验,提升天气预报的结构一致性和物理一致性,实验显示在不同分辨率和模型上均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15280 2026-03-17 cs.AI 79%

Advancing Multimodal Agent Reasoning with Long-Term Neuro-Symbolic Memory

通过长期神经符号记忆推进多模态代理推理

Rongjie Jiang, Jianwei Wang, Gengda Zhao, Chengyang Luo, Kai Wang, Wenjie Zhang

机构 * University of New South Wales(新南威尔士大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出NS-Mem框架,结合神经记忆与符号结构,提升多模态代理的推理能力,实验证明其在推理准确率上优于纯神经记忆系统。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏