arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-31 至 2026-03-31 共收录 162 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 27 篇

2603.27331 2026-03-31 cs.CL cs.MM 81%

SACRED: A Faithful Annotated Multimedia Multimodal Multilingual Dataset for Classifying Connectedness Types in Online Spirituality

SACRED:一个忠实标注的多媒体多模态多语言数据集,用于在线灵性中连接类型的分类

Qinghao Guan, Yuchen Pan, Donghao Li, Zishi Zhang, Yiyang Chen, Lu Li, Flaminia Canu, Emilia Volkart, Gerold Schneider

机构 * University of Zurich(苏黎世大学) Ping An Technology(平安科技)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CL、cs.MM

AI总结 本文提出SACRED数据集,用于分类在线灵性中的连接类型,评估13种LLM及传统方法,发现DeepSeek-V3在抽象概念分类中表现优异,GPT-4o-mini在视觉任务中表现最佳,同时发现新的连接类型。

Comments Accepted by LLMs4SSH 2026 at LREC

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08503 2026-03-31 cs.CV cs.AI 81%

Disrupting Hierarchical Reasoning: Adversarial Protection for Geographic Privacy in Multimodal Reasoning Models

破坏层次推理:多模态推理模型中地理隐私的对抗保护

Jiaming Zhang, Che Wang, Yang Cao, Longtao Huang, Wei Yang Bryan Lim

机构 * Nanyang Technological University(南洋理工大学) Peking University(北京大学) Institute of Science Tokyo(东京科学大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ReasonBreak框架,通过概念感知扰动破坏多模态推理模型中的层次推理,利用GeoPrivacy-6K数据集验证其在提升地理隐私保护效果上的优势。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28550 2026-03-31 cs.CV 79%

MarkushGrapher-2: End-to-end Multimodal Recognition of Chemical Structures

MarkushGrapher-2:端到端多模态识别化学结构

Tim Strohmeyer, Lucas Morin, Gerhard Ingmar Meijer, Valéry Weber, Ahmed Nassar, Peter Staar

机构 * IBM Research(IBM研究院) ETH Zurich(苏黎世联邦理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MarkushGrapher-2,通过OCR提取化学图像文本,结合视觉-文本-布局编码器和光学化学结构识别编码器,实现多模态化学结构识别,并通过两阶段训练策略提升性能,同时构建大规模真实世界Markush结构数据集。

Comments 15 pages, to be published in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09326 2026-03-31 cs.CV 79%

OddGridBench: Exposing the Lack of Fine-Grained Visual Discrepancy Sensitivity in Multimodal Large Language Models

OddGridBench: 暴露多模态大语言模型在细粒度视觉差异敏感性方面的不足

Tengjin Weng, Wenhao Jiang, Jingyi Wang, Ming Li, Lin Ma, Zhong Ming

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Shenzhen Technology University(深圳技术大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Meituan(美团)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出OddGridBench基准,评估多模态大语言模型的视觉差异敏感性,发现其检测能力远低于人类,提出OddGrid-GRPO框架提升模型细粒度视觉辨别能力。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26952 2026-03-31 cs.CV cs.LG 79%

Multimodal Deep Learning for Diabetic Foot Ulcer Staging Using Integrated RGB and Thermal Imaging

多模态深度学习在结合RGB和热成像的糖尿病足溃疡分期中的应用

Gulengul Mermer, Mustafa Furkan Aksu, Gozde Ozsezer, Sevki Cetinkalp, Orhan Er, Mehmet Kemal Gullu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文研究了多模态图像对深度学习模型在糖尿病足溃疡分期中的影响,通过RGB和热成像数据结合提升模型性能,VGG16模型在RGB+热成像数据集上达到93.25%的准确率。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12378 2026-03-31 cs.CV 79%

M4Human: A Large-Scale Multimodal mmWave Radar Benchmark for Human Mesh Reconstruction

M4Human: 一种大规模多模态毫米波雷达基准用于人体网格重建

Junqiao Fan, Yunjiao Zhou, Yizhuo Yang, Xinyuan Cui, Jiarui Zhang, Lihua Xie, Jianfei Yang, Chris Xiaoxuan Lu, Fangqiang Ding

机构 * NTU(南洋理工大学) University of Edinburgh(爱丁堡大学) UPenn(宾夕法尼亚大学) UCL(伦敦大学学院) MIT(麻省理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出M4Human,首个大规模多模态毫米波雷达基准,提供高分辨率雷达、RGB和深度数据,用于解决传统视觉传感的遮挡、光照和隐私问题,推动人体建模研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28115 2026-03-31 cs.LG 78%

Graph Vector Field: A Unified Framework for Multimodal Health Risk Assessment from Heterogeneous Wearable and Environmental Data Streams

图向量场:一种统一的多模态健康风险评估框架,用于异构可穿戴和环境数据流

Silvano Coletti, Francesca Fallucchi

机构 * Università degli Studi Guglielmo Marconi, Roma, Italy(意大利罗马古列尔莫·马可尼大学) Chelonia SA, Lugano, Switzerland(瑞士卢加诺Chelonia SA)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出图向量场框架,通过结合离散微分几何算子与模态结构混合专家,统一多模态健康风险评估,实现可解释的模态解析风险建模。

Comments 25 pages, 6 appendices. Theoretical framework; no empirical experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08752 2026-03-31 cond-mat.mtrl-sci 78%

NMRPeak: a ready-to-use intelligent system for molecular structure elucidation enabled by synergistic cross-modal learning

NMRPeak:一种基于协同跨模态学习的分子结构解析智能系统

Fanjie Xu, Jinyuan Hu, Jingxiang Zou, Junjie Wang, Boying Huang, Zhifeng Gao, Xiaohong Ji, Weinan E, Zhong-Qun Tian, Fujie Tang, Jun Cheng

专题命中 多模态评测 :cross-modal(title,abstract)

AI总结 NMRPeak通过实验驱动设计整合谱预测、检索和生成任务,实现分子结构解析的突破性性能,提升实验场景下的应用效用。

Comments 35 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28651 2026-03-31 cs.AI 70%

Not Search, But Scan: Benchmarking MLLMs on Scan-Oriented Academic Paper Reasoning

不是搜索,而是扫描:在面向学术论文推理的扫描任务上基准测试大语言模型

Rongjin Li, Zichen Tang, Xianghe Wang, Xinyi Hu, Zhengyu Wang, Zhengyu Lu, Yiling Huang, Jiayuan Chen, Weisheng Tan, Jiacheng Liu, Zhongjun Yang, Haihong E

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出ScholScan基准,通过扫描式任务评估大语言模型在学术论文推理中的能力,发现检索增强生成方法在扫描任务上无显著提升,揭示了当前模型在该任务上的系统性缺陷。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24903 2026-03-31 cs.CV 70%

Self-Supervised Learning for Knee Osteoarthritis: Diagnostic Limitations and Prognostic Value of Hospital Data

自监督学习在膝骨关节炎中的应用:医院数据的诊断局限性与预后价值

Haresh Rengaraj Rajamohan, Yuxuan Chen, Kyunghyun Cho, Cem M. Deniz

机构 * Department of Physics, J.K. Institute of Science(物理系,J.K. 科学研究所) World Scientific University(世界科学大学) University of Intelligent Studies(智能研究大学) Center for Data Science, New York University(数据科学中心,纽约大学) Bernard and Irene Schwartz Center for Biomedical Imaging, New York University Langone Health(伯纳德和艾琳·施瓦茨生物医学成像中心,纽约大学朗格尼健康中心) Department of Radiology, New York University Langone Health(放射学系,纽约大学朗格尼健康中心) Perlmutter Cancer Center, New York University Langone Health(珀尔马特癌症中心,纽约大学朗格尼健康中心)

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本研究评估自监督学习是否能提升膝骨关节炎的诊断与预后建模,发现医院数据在诊断分级中表现有限,但对预后预测有显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24569 2026-03-31 cs.CV 70%

POLY-SIM: Polyglot Speaker Identification with Missing Modality Grand Challenge 2026 Evaluation Plan

POLY-SIM:基于缺失模态的多模态说话人识别挑战2026评估计划

Marta Moscati, Muhammad Saad Saeed, Marina Zanoni, Mubashir Noman, Rohan Kumar Das, Monorama Swain, Yufang Hou, Elisabeth Andre, Khalid Mahmood Malik, Markus Schedl, Shah Nawaz

机构 * Institute of Computational Perception, Johannes Kepler University Linz, Austria(林茨约翰·开普勒大学计算感知研究所) University of Michigan-Flint, USA(密歇根大学弗林特分校) Sapienza University of Rome, Italy(罗马大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Fortemedia Singapore, Singapore(新加坡Fortemedia公司) IT:U Interdisciplinary Transformation University Austria(奥地利跨学科转型大学) University of Augsburg, Germany(奥格斯堡大学) Human-centered AI Group, AI Lab, Linz Institute of Technology, Austria(奥地利林茨理工学院人工智能实验室人本人工智能组)

专题命中 多模态评测 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 本文针对多模态说话人识别中缺失模态和跨语言条件下的鲁棒性问题,提出POLY-SIM 2026挑战,设计标准化基准和评估框架以推动更实用的系统发展。

Comments Grand challenge at ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15090 2026-03-31 cs.DB cs.AI cs.CV 62%

SciEGQA: A Dataset for Scientific Evidence-Grounded Question Answering and Reasoning

SciEGQA:一个用于科学证据基础问题回答与推理的数据集

Wenhan Yu, Zhaoxi Zhang, Wang Chen, Guanqiang Qi, Weikang Li, Lei Sha, Deguo Xia, Jizhou Huang

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) The University of Hong Kong(香港大学) Baidu Inc.(百度公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 SciEGQA数据集通过精细标注和大规模自动构建,提升视觉语言模型在科学文档中的证据定位与推理能力。

Comments 8 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16952 2026-03-31 cs.CL cs.AI 62%

AirQA: A Comprehensive QA Dataset for AI Research with Instance-Level Evaluation

AirQA:一个用于人工智能研究的综合性问答数据集,具有实例级评估

Tiancheng Huang, Ruisheng Cao, Yuxin Zhang, Zhangyi Kang, Zijian Wang, Chenrun Wang, Yijie Luo, Hang Zheng, Lirong Qian, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院X-LANCE实验室) Shanghai Innovation Institution(上海创新研究院) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) Suzhou Laboratory(苏州实验室)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AirQA数据集,包含13956篇AI论文和1246个问题,支持多任务、多模态和实例级评估,并提出ExTrActor框架提升小模型多轮工具使用能力。

Comments 29 page, 6 figures, 17 tables, accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26837 2026-03-31 cs.RO cs.AI cs.CV 62%

SpatialAnt: Autonomous Zero-Shot Robot Navigation via Active Scene Reconstruction and Visual Anticipation

SpatialAnt:通过主动场景重建与视觉预判实现自主零样本机器人导航

Jiwen Zhang, Xiangyu Shi, Siyuan Wang, Zerui Li, Zhongyu Wei, Qi Wu

机构 * Fudan University(复旦大学) University of Southern California(南加州大学) Adelaide University(阿德莱德大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 SpatialAnt通过主动场景重建和视觉预判机制,解决零样本机器人导航中自建场景的不完整和噪声问题,提升导航性能。

Comments 10 pages, 4 figures, 5 tables. Homepage: https://imnearth.github.io/Spatial-X/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26831 2026-03-31 cs.CV cs.AI 62%

Envisioning global urban development with satellite imagery and generative AI

用卫星影像和生成式AI展望全球城市发展

Kailai Sun, Yuebing Liang, Mingyi He, Yunhan Zheng, Alok Prakash, Shenhao Wang, Jinhua Zhao, Alex "Sandy'' Pentland

机构 * Singapore–MIT Alliance for Research and Technology Centre (SMART)(新加坡-麻省理工学院研究与技术联盟中心) Department of Urban Planning, Tsinghua University(清华大学城市规划系) Department of Urban Studies and Planning, Massachusetts Institute of Technology(麻省理工学院城市研究与规划系) College of Urban and Environmental Sciences, Peking University(北京大学城市与环境学院) Department of Urban and Regional Planning, University of Florida(佛罗里达大学城市与区域规划系) Stanford Institute for Human-Centered Artificial Intelligence, Stanford University(斯坦福大学以人为本人工智能研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多模态生成式AI框架,通过整合提示和地理空间控制,生成全球500个最大都会区的高保真城市卫星影像,支持可持续城市发展和场景规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24037 2026-03-31 cs.CV 57%

A$^3$: Towards Advertising Aesthetic Assessment

A$^3$:迈向广告审美评估

Kaiyuan Ji, Yixuan Gao, Lu Sun, Yushuo Zheng, Zijian Chen, Jianbo Zhang, Xiangyang Zhu, Yuan Tian, Zicheng Zhang, Guangtao Zhai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) School of Information and Electronic Engineering, East China Normal University(华东师范大学信息与电子工程学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出A$^3$框架,通过理论驱动的A$^3$-Law、大规模标注数据集A$^3$-Dataset、多模态大语言模型A$^3$-Align及基准A$^3$-Bench,解决广告审美评估中主观性、缺乏标准等问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27112 2026-03-31 cs.CV 57%

RailVQA: A Benchmark and Framework for Efficient Interpretable Visual Cognition in Automatic Train Operation

RailVQA: 一个用于自动列车操作中高效可解释视觉认知的基准和框架

Sen Zhang, Runmei Li, Zhichao Zheng, Yuhe Zhang, Jiani Li, Kailun Zhang, Tao Zhang, Wenjun Wu, Qunbo Wang

机构 * School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院) School of Software, Northwestern Polytechnical University(西北工业大学软件学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出RailVQA-bench和RailVQA-CoM,旨在解决ATO中视觉感知与决策推理的高效可解释性问题,通过基准测试和框架提升认知泛化能力与跨领域适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27033 2026-03-31 cs.CV 57%

RealBirdID: Benchmarking Bird Species Identification in the Era of MLLMs

RealBirdID:在MLLM时代鸟类物种识别的基准测试

Logan Lawrence, Mustafa Chasmai, Rangel Daroya, Wuao Liu, Seoyun Jeong, Aaron Sun, Max Hamilton, Fabien Delattre, Oindrila Saha, Subhransu Maji, Grant Van Horn

机构 * Computer Vision Lab, UMass Amherst(马萨诸塞大学阿默斯特分校计算机视觉实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究针对野外细粒度鸟类识别难题,提出RealBirdID基准测试,要求系统在无法识别时提供明确依据。发现开源和专有模型在可回答案例上准确率低,且大模型在无法回答时难以给出正确理由。

Comments Accepted to CVPR26. 23 pages, 23 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11410 2026-03-31 cs.CV 57%

Seeing Isn't Orienting: A Cognitively Grounded Benchmark Reveals Systematic Orientation Failures in MLLMs Supplementary

看见并不意味着定向:一个认知基础的基准揭示了多模态大语言模型在定向任务中的系统性失败

Nazia Tasnim, Keanu Nichols, Yuting Yang, Nicholas Ikechukwu, Elva Zou, Deepti Ghadiyaram, Bryan A. Plummer

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DORI基准,通过分解定向为四个维度,揭示多模态模型在物体定向任务中的系统性不足,指出其依赖分类启发式而非几何推理。

Comments This is a replacement and updated version for submission arXiv:2505.21649 : Right Side Up? Disentangling Orientation Understanding in MLLMs with Fine-grained Multi-axis Perception Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26784 2026-03-31 cs.CV 57%

HighlightBench: Benchmarking Markup-Driven Table Reasoning in Scientific Documents

HighlightBench:科学文档中基于标记的表格推理基准测试

Lexin Wang, Shenghua Liu, Yiwei Wang, Yujun Cai, Yuyao Ge, Jiayu Yao, Jiafeng Guo, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of California, Merced(加州大学默塞德分校) University of Queensland(昆士兰大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出HighlightBench,用于评估文档中基于标记的表格推理能力,通过五个任务家族分解评估,并提供可复现的基准流程,揭示模型在视觉提示与符号推理一致性下的稳定性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27534 2026-03-31 cs.RO 50%

S3KF: Spherical State-Space Kalman Filtering for Panoramic 3D Multi-Object Tracking

S3KF:基于旋转激光雷达和四鱼眼相机的全景三维多目标跟踪框架

Zhongyuan Liu, Shaonan Yu, Jianping Li, Pengfei Wan, Xinhang Xu, Pengfei Wang, Maggie Y. Gao, Lihua Xie

机构 * CertaintyX School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) ST Engineering(新科工程) School of Civil and Environmental Engineering, Nanyang Technological University(南洋理工大学土木与环境工程学院)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出S3KF框架,利用旋转激光雷达和四鱼眼相机实现全景三维多目标跟踪,通过球面状态表示和扩展球面卡尔曼滤波提升跟踪精度与实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 10 篇

2603.26908 2026-03-31 cs.CV 83%

FusionAgent: A Multimodal Agent with Dynamic Model Selection for Human Recognition

FusionAgent:一种具有动态模型选择的多模态代理用于人体识别

Jie Zhu, Xiao Guo, Yiyang Su, Anil Jain, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 FusionAgent通过动态模型选择提升人体识别鲁棒性,利用多模态大语言模型进行样本特定的模型选择,结合ACT分数融合方法,实验表明其在效率和性能上优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28474 2026-03-31 cs.CV cs.AI 81%

CiQi-Agent: Aligning Vision, Tools and Aesthetics in Multimodal Agent for Cultural Reasoning on Chinese Porcelains

CiQi-Agent:在多模态代理中对视觉、工具和美学的对齐用于中国瓷器的文化推理

Wenhan Wang, Zhixiang Zhou, Zhongtian Ma, Yanzhu Chen, Ziyu Lin, Hao Sheng, Pengfei Liu, Honglin Ma, Wenqi Shao, Qiaosheng Zhang, Yu Qiao

机构 * Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Shaanxi Academy of Cultural Relics Conservation(陕西省文物保护研究院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出CiQi-Agent,通过多图像输入、视觉工具调用和多模态检索增强生成,实现对瓷器六个属性的精细分析,同时构建了专家标注的CiQi-VQA数据集和对齐的CiQi-Bench基准,实验表明其在六个属性上的准确率比GPT-5高12.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27813 2026-03-31 cs.CV 79%

MuSEAgent: A Multimodal Reasoning Agent with Stateful Experiences

MuSEAgent:一种具有状态化经验的多模态推理代理

Shijian Wang, Jiarui Jin, Runhao Fu, Zexuan Yan, Xingjian Wang, Mengkang Hu, Eric Wang, Xiaoxi Li, Kangning Zhang, Li Yao, Wenxiang Jiao, Xuelian Cheng, Yuan Lu, Zongyuan Ge

机构 * Southeast University(东南大学) Monash University(莫纳什大学) Xiaohongshu Inc.(小红书) Shanghai Jiao Tong University(上海交通大学) University of Hong Kong(香港大学) Zhejiang University(浙江大学) Renmin University of China(中国人民大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 MuSEAgent通过引入状态化经验学习范式,提升多模态推理代理的决策能力,其通过 hindsight reasoning 抽象交互数据为原子决策经验,并在推理时进行质量过滤的经验检索,实验表明其在细粒度视觉感知和复杂多模态推理任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14790 2026-03-31 cs.CV 79%

Mind-of-Director: Multi-modal Agent-Driven Film Previsualization via Collaborative Decision-Making

导演之思:通过协作决策的多模态代理驱动电影预可视化

Shufeng Nan, Mengtian Li, Sixiao Zheng, Yuwei Lu, Han Zhang, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai University(上海大学)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.CV

AI总结 Mind-of-Director通过协作决策过程生成高质量的电影预可视化序列,结合多个专业代理在游戏引擎中协作生成预可视化内容,提升自动化原型制作和人机协同电影制作的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27202 2026-03-31 cs.PL cs.DC 78%

Sal: Multi-modal Verification of Replicated Data Types

Sal:多模态验证复制数据类型

Pranav Ramesh, Vimala Soundarapandian, KC Sivaramakrishnan

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 Sal通过结合内核可验证的自动化、SMT辅助自动化及AI辅助交互式定理证明,实现CRDT和MRDT的多模态验证,69%的验证条件由内核验证自动化解决,自动生成反例暴露隐秘错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21418 2026-03-31 cs.MA 78%

FUAS-Agents: Autonomous Multi-Modal LLM Agents for Treatment Planning in Focused Ultrasound Ablation Surgery

FUAS-代理:自主多模态大语言模型代理用于聚焦超声消融手术的治疗计划

Lina Zhao, Zihao Bian, Qingyue Chen, Yafang Li, Zhiyi Luo, Jiaxing Bai, Guangbo Li, Min He, Kezhi Li, Huaiyuan Yao, Zongjiu Zhang

专题命中 多模态Agent :multi-modal(title);multimodal(abstract)

AI总结 本文提出FUAS-代理,利用大语言模型的多模态理解和工具使用能力,通过整合患者资料和MRI数据,生成个性化治疗计划,提升临床决策效率和可靠性。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02842 2026-03-31 cs.CL 74%

A Browser-based Open Source Assistant for Multimodal Content Verification

基于浏览器的开源多模态内容验证助手

Rosanna Milner, Michael Foster, Twin Karmakharm, Olesya Razuvayevskaya, Ian Roberts, Valentin Porcellini, Denis Teyssou, Kalina Bontcheva

机构 * University of Sheffield(谢菲尔德大学) AFP Medialab(法新社媒体实验室)

专题命中 多模态Agent :multimodal(title);分类 cs.CL

AI总结 本文提出VERIFICATION ASSISTANT,一种浏览器工具,整合多个NLP服务,为非专家用户提供清晰的可信度信号和反虚假信息指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26741 2026-03-31 cs.CV cs.AI cs.RO 62%

Language-Conditioned World Modeling for Visual Navigation

基于语言的视觉导航世界建模

Yifei Dong, Fengyi Wu, Yilong Dai, Lingdong Kong, Guangyu Chen, Xu Zhu, Qiyu Hu, Tianyu Wang, Johnalbert Garnica, Feng Liu, Siyu Huang, Qi Dai, Zhi-Qi Cheng

机构 * University of Washington(华盛顿大学) National University of Singapore(新加坡国立大学) Clemson University(克莱姆森大学) Drexel University(德雷塞尔大学) Microsoft Research(微软研究院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了基于语言的视觉导航问题,提出LCVN数据集并开发了两种模型家族,通过语言 grounding、未来状态预测和动作生成实现统一任务学习。

Comments 19 pages, 6 figures, Code: https://github.com/F1y1113/LCVN

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28010 2026-03-31 cs.AI 57%

HeteroHub: An Applicable Data Management Framework for Heterogeneous Multi-Embodied Agent System

HeteroHub:一种适用于异构多具身代理系统的数据管理框架

Xujia Li, Xin Li, Junquan Huang, Beirong Cui, Zibin Wu, Lei Chen

机构 * HKUST(香港科技大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出HeteroHub框架,整合静态元数据、任务对齐训练语料和实时数据流,支持任务感知模型训练和闭环控制,实现复杂任务的协调执行。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏