arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-25 至 2026-05-25 共收录 66 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 11 篇

2507.22345 2026-05-25 cs.RO 50%

A Reconfigured Wheel-Legged Robot for Enhanced Steering and Adaptability

一种增强转向能力和适应性的重构轮腿机器人

Zhicheng Song, Jinglan Xu, Chunxin Zheng, Yulin Li, Zhihai Bi, Jun Ma

机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou)(机器人与自主系统方向,香港科技大学(广州))

专题命中 多模态生成 :multi-modal(abstract)

AI总结 提出一种名为FLORES的新型轮腿机器人,通过将前腿的髋关节横滚自由度替换为偏航自由度,并设计定制强化学习控制器,实现了高效转向和多地形适应。

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 6, pp. 7444-7451, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22950 2026-05-25 stat.ML cs.LG math.ST stat.ME stat.TH 50%

Diffusion-based Denoising Beats Vanilla Score Matching in Parameter Estimation: A Theoretical Explanation

基于扩散的去噪在参数估计中优于普通得分匹配:一个理论解释

Benedikt Lütke Schwienhorst, Nadja Klein, Johannes Lederer

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文通过理论分析证明,对于具有分离模态的多峰分布,基于扩散的去噪得分匹配估计器(DDSME)相比普通得分匹配估计器(SME)具有更优的误差界,并解释了扩散方法优越性的原因。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 21 篇

2605.01018 2026-05-25 cs.CV 88%

WildTableBench: Benchmarking Multimodal Foundation Models on Table Understanding In the Wild

WildTableBench:在真实场景中评估多模态基础模型的表格理解能力

Junzhe Huang, Xiaoxiao Sun, Yan Yang, Yuxuan Hou, Ruotian Zhang, Sirui Li, Hehe Fan, Serena Yeung-Levy, Xin Yu

机构 * The University of Queensland(昆士兰大学) Stanford University(斯坦福大学) The Australian National University(澳大利亚国立大学) Zhejiang University(浙江大学) Murdoch University(莫纳什大学) The University of Adelaide(阿德莱德大学)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV

AI总结 提出WildTableBench基准,包含402张真实场景表格图像和928个问答对,评估21个前沿多模态模型,仅一个模型准确率超50%,揭示模型在结构感知和推理方面的持续弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23157 2026-05-25 cs.CL 84%

Same Model, Different Weakness: How Language and Modality Reshape the Jailbreak Attack Surface in Frontier MLLMs

相同模型,不同弱点:语言与模态如何重塑前沿多模态大语言模型的越狱攻击面

Casey Ford, Madison Van Doren, Sicheng Jin, Emily Dix

机构 * Appen(Appliance)

专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CL

AI总结 通过跨语言多模态红队测试,发现语言和模态通过不同机制影响越狱漏洞,导致安全排名跨语言不守恒,需重新设计评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22907 2026-05-25 cs.CV 83%

VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding

VideoOdyssey: 超长上下文与全模态视频理解基准

Haichen He, Jiayi Zhou, Sifeng Shang, Yihan Hu, Yuanhan Zhang, Kaiyang Zhou

机构 * Hong Kong Baptist University(香港 Baptist 大学) S-Lab, Nanyang Technological University(S 实验室,南洋理工大学) GVC Lab, Great Bay University(GVC 实验室,Great Bay 大学)

专题命中 多模态评测 :omni-modal(title,abstract);audio-visual(abstract);分类 cs.CV

AI总结 提出VideoOdyssey基准,通过连续证书长度度量认知负荷,评估多模态大模型在超长视频(平均109分钟)上的连续跟踪、信息整合与记忆能力,涵盖视觉与音视频双模态,揭示模型在长上下文推理、细粒度感知和非语言全模态理解上的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17015 2026-05-25 cs.CV cs.CL 81%

Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models

Multi-SpatialMLLM: 多模态大语言模型的多帧空间理解

Runsen Xu, Weiyao Wang, Hao Tang, Xingyu Chen, Xiaodong Wang, Fu-Jen Chu, Matt Feiszli, Kevin J. Liang

机构 * FAIR, Meta(FAIR,Meta) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.CL

AI总结 提出一种框架,通过整合深度感知、视觉对应和动态感知等基本空间技能,使多模态大语言模型具备多帧空间理解能力,并构建MultiSPA数据集和基准测试,模型Multi-SpatialMLLM在多项任务上取得显著提升。

Comments CVPR 2026 Camera Ready. 27 pages. Project page: https://runsenxu.com/projects/Multi-SpatialMLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08945 2026-05-25 cs.AI 79%

FATHOMS-RAG: A Framework for the Assessment of Thinking and Observation in Multimodal Systems that use Retrieval Augmented Generation

FATHOMS-RAG:评估使用检索增强生成的多模态系统思考与观察的框架

Samuel Hildebrand, Curtis Taylor, Sean Oesch, James M Ghawaly, Amir Sadovnik, Ryan Shivers, Brandon Schreiber, Kevin Kurian

机构 * Louisiana State University(路易斯安那州立大学) Oak Ridge National Lab(橡树岭国家实验室) University of Florida(佛罗里达大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 提出一个评估RAG管道的基准,包含93个多模态问题、短语级召回率指标、最近邻嵌入分类器,并对比开源与闭源管道性能,发现闭源管道在正确性和幻觉指标上显著优于开源。

Comments Accepted at SAFE-ML 2026 Workshop at the International Conference on Software Testing (ICST) 2026 Code: https://github.com/Sam-Hildebrand/FATHOMS-RAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02719 2026-05-25 cs.LG 78%

An Empirical Analysis of Calibration and Selective Prediction in Multimodal Clinical Condition Classification

多模态临床状况分类中的校准与选择性预测的实证分析

L. Julián Lechuga López, Farah E. Shamout, Tim G. J. Rudner

机构 * New York University(纽约大学) University of Toronto(多伦多大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本研究通过实证分析多标签临床状况分类中基于不确定性的选择性预测,发现其性能可能严重下降,原因是类别依赖的误校准,尤其对少数类别,并强调需要校准感知评估来确保临床AI的安全性。

Comments 40 pages, 14 figures, 16 tables. Accepted as a conference paper at AHLI Conference on Health, Inference, and Learning (CHIL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22891 2026-05-25 cs.LG hep-ex 78%

Pointwise Metrics Mislead: An Evaluation Protocol for Multimodal Inverse Problems

逐点度量误导:多模态逆问题的评估协议

Mads H. Baattrup, Jörn Bach, Laurids Jeppe, Finn Labe, Alexander Grohsjean, Christian Schwanenberger, Peer Stelldinger

机构 * Deutsches Elektronen-Synchrotron(德意志电子同步辐射研究中心) CERN(欧洲核子研究中心) University of Hamburg(汉堡大学) HAW Hamburg(汉堡应用技术大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 针对多模态后验的逆问题,指出逐点度量(如RMSE、MAE)会导致谱特征压缩,提出包含CRPS、谱保真度和校准的三部分评估协议。

Comments 29 pages, 9 figures, and 8 tables (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03530 2026-05-25 cs.MM cs.CL cs.CV 75%

How Far Are We from Generating Missing Modalities with Foundation Models?

我们距离用基础模型生成缺失模态还有多远?

Guanzhou Ke, Bo Wang, Guoqing Chao, Weiming Hu, Shengfeng He

机构 * Institute of Data Science and Intelligent Decision Support, Beijing Jiaotong University(数据科学与智能决策支持研究所,北京交通大学) School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡管理大学) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术学院,哈尔滨工业大学)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 本文系统评估了基础模型在缺失模态重建中的三种范式,发现其在细粒度语义提取和生成模态验证方面存在不足,并提出一个包含模态感知挖掘和自精炼机制的智能框架,显著提升了重建质量。

Comments T-PAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23326 2026-05-25 cs.CL 74%

ClimateChat-300K: A Multi-Modal Facebook Dataset for Understanding Diverse Perspectives in Climate Communication

ClimateChat-300K:一个用于理解气候传播中不同观点的多模态Facebook数据集

Wajdi Zaghouani, Md. Rafiul Biswas, Mabrouka Bessghaier, Shimaa Ibrahim, George Mikros

机构 * Northwestern University in Qatar(卡塔尔西北大学) Hamad Bin Khalifa University(哈马德·本·卡伊夫大学)

专题命中 多模态评测 :multi-modal(title);分类 cs.CL

AI总结 通过CrowdTangle平台收集2020年5月至2024年5月间的299,329条Facebook公开帖子,利用主题建模和情感分析识别出政策、行动主义、合作、科学和保护五大领域十个主题,揭示了情感基调、帖子格式和页面身份对受众参与度的显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23068 2026-05-25 cs.CV 74%

RoboSurg-VQA: A Multimodal Benchmark for Surgical Segmentation-Aware Visual Question Answering

RoboSurg-VQA:面向手术分割感知的视觉问答多模态基准

Chengyi Zhang, Zi Ye, Ziyang Wang

机构 * Swansea University, UK(威尔士大学) Maynooth University, Ireland(迈诺特大学) Aston University, UK(阿斯顿大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 提出RoboSurg-VQA基准,通过重新利用公共手术分割数据集,构建分割感知的视觉问答任务,以评估在机器人辅助和微创手术中恶劣视觉条件下的语言化临床问题理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23580 2026-05-25 cs.CV 70%

Calibration-Informative Region Selection for Online LiDAR--Camera Calibration in Agricultural Environments

农业环境中在线LiDAR-相机标定的标定信息区域选择

Rajitha de Silva, Grzegorz Cielniak

机构 * Lincoln Institute for Agri-Food Technology, University of Lincoln, UK(林肯农业食品技术研究所,林肯大学,英国)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出一种基于支持图的在线LiDAR-相机标定方法,通过密集标定支持图识别可靠观测区域,提升标定精度。

Comments Accepted to ICRA 2026 Workshop on Agricultural Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23883 2026-05-25 cs.CV cs.AI 62%

PGT: Procedurally Generated Tasks for improving visual grounding in MLLMs

PGT: 用于提升多模态大语言模型视觉定位的程序化生成任务

Rim Assouel, Amir Bar, Michal Drozdzal, Adriana Romero-Soriano

机构 * Mila - Qu\'ebec AI Institute FAIR at Meta Superintelligence Labs McGill University Canada CIFAR AI Chair

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出程序化生成任务(PGT)框架,通过叠加几何基元生成密集监督信号,解耦视觉定位能力与语义先验,显著提升多模态大语言模型在细粒度理解任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23629 2026-05-25 cs.CV 57%

DDX-TRACE: A Benchmark for Medical Diagnostic Trajectories in VLMs

DDX-TRACE: 视觉语言模型中医学诊断轨迹的基准

Jiazhen Pan, Weixiang Shen, Jun Li, Julian Canisius, Felix Bitzer, Paula Roßmüller, Jiancheng Yang, Virginie Kreutzinger, Daniel Rueckert, Benedikt Wiestler

机构 * Technical University of Munich(慕尼黑技术大学) TUM University Hospital(TUM大学医院) Munich Center for Machine Learning(慕尼黑机器学习中心) LMU Munich(慕尼黑大学) Aalto University(阿尔托大学) Imperial College London(伦敦帝国学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出DDX-TRACE基准,通过隐藏证据的多轮诊断轨迹评估VLM在神经放射学中的工作流质量,揭示最终诊断分数无法反映的推理缺陷。

Comments 41 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23397 2026-05-25 cs.CV 57%

Joint Target-Less Intrinsic and Extrinsic Camera-LiDAR Calibration using Deep Point Correspondences

基于深度点对应的无靶标联合相机-激光雷达内参和外参标定

Simon Bultmann, Daniele Cattaneo, Abhinav Valada

机构 * Department of Computer Science, University of Freiburg, Germany(弗赖堡大学计算机科学系)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 提出首个完全无靶标的联合标定流程,通过深度像素-点对应同时估计相机内参(含畸变)和相机-激光雷达外参,并采用结构运动初始化内参、联合非线性优化。

Comments presented at 2nd German Robotics Conference (GRC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23287 2026-05-25 cs.CV 57%

LangFlash: Feed-forward 3D Language Gaussian Splatting from Sparse Unposed Images

LangFlash: 基于前馈的3D语言高斯泼溅从稀疏无位姿图像

Yilong Liu, Wanhua Li, Chen Zhu-Tian, Hanspeter Pfister

机构 * Harvard University(哈佛大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) University of Minnesota - Twin Cities(明尼苏达大学-双城分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出LangFlash,一种前馈框架,从稀疏无位姿多视图图像直接预测3D高斯原语及其语言对齐语义特征,实现低延迟3D重建和语义一致场景理解。

Comments CVPRF 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23219 2026-05-25 cs.LG cs.AI 57%

PaP-NF: Probabilistic Long-Term Time Series Forecasting via Prefix-as-Prompt Reprogramming and Normalizing Flows

PaP-NF: 通过前缀作为提示重编程和归一化流进行概率长期时间序列预测

Minju Kim, Youngbum Hur

机构 * Department of Industrial Engineering, Inha University, Incheon, Republic of Korea(韩国Inha大学工业工程系)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 提出PaP-NF框架,利用前缀作为提示机制对齐连续时间序列表示与冻结的大语言模型,并基于归一化流解码器生成概率预测,在长期基准上捕获多模态不确定性并保持点预测精度。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28048 2026-05-25 cs.CL cs.SI 57%

Stable Behavior, Limited Variation: Persona Validity in LLM Agents for Urban Sentiment Perception

稳定行为,有限变化:城市情感感知中LLM智能体的角色有效性

Neemias B da Silva, Rodrigo Minetto, Daniel Silver, Thiago H Silva

机构 * University of Toronto(多伦多大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 研究通过多角色提示生成LLM智能体,发现角色内行为稳定但角色间差异有限,且无角色模型在某些任务中表现更优。

Comments 8 pages, 8 figures. IEEE DCOSS - UrbCom

Journal ref IEEE DCOSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13249 2026-05-25 q-bio.BM cs.AI cs.LG 57%

A Systematic Evaluation of Co-folding Model Representations for Small-Molecule Learning

小分子学习的共折叠模型表示的系统评估

Hyosoon Jang, Hyunjin Seo, Honghui Kim, Seonghyun Park, Taewon Kim, Yunhui Jang, Sungsoo Ahn

机构 * KAIST(韩国科学技术院)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.AI

AI总结 本研究利用现代共折叠模型Boltz2,通过系统探测和蒸馏,评估其原子级配体表示在小分子任务中的表现,发现共折叠表示在ADMET基准上匹配或超越现有模型,加速分子生成建模,并提高结构引导配体优化的样本效率,表明蛋白质-配体共折叠是小分子表示学习的有前景的预训练范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17171 2026-05-25 cs.CV cs.LG 57%

FireScope: Wildfire Risk Raster Prediction with a Chain-of-Thought Oracle

FireScope: 基于思维链预言机的野火风险栅格预测

Mario Markov, Stefan Maria Ailuro, Luc Van Gool, Konrad Schindler, Danda Pani Paudel

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出FireScope框架,利用视觉语言模型结合强化学习和视觉监督,通过推理轨迹生成野火风险栅格,在跨大陆泛化中取得显著性能提升。

Comments CVPR 2026, Project Page: https://firescope.ai/research

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23516 2026-05-25 eess.SP 50%

Comprehensive Dataset and Signal Processing Framework for Phonocardiogram-Based Heart Rate and Blood Pressure Estimation

基于心音图的心率和血压估计的综合数据集与信号处理框架

Abdul Ahad Mamun, Utsab Saha, Md Hasibul Hasan, Shahed Ahmed, MD Jahin Alam

专题命中 多模态评测 :multimodal(abstract)

AI总结 提出一种仅使用心音图信号测量心率和血压的低成本PhonoTrack系统,通过峰值检测和多元回归模型实现高精度估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02612 2026-05-25 hep-ph 50%

Model Parameter Reconstruction of Electroweak Phase Transition with TianQin and LISA: Insights from the Dimension-Six Model

天琴和LISA对电弱相变模型参数的重建:来自维度-6模型的见解

Aidi Yang, Chikako Idegawa, Fa Peng Huang

专题命中 多模态评测 :multimodal(abstract)

AI总结 研究天琴和LISA通过随机引力波背景的谱特征重建维度-6希格斯算子扩展标准模型中模型参数Λ的能力,采用Fisher矩阵分析、贝叶斯嵌套采样和机器学习方法实现高精度重建。

Comments 48 pages, 15 figures, 7 tables, accepted version of Physical Review D

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 4 篇

2605.23655 2026-05-25 cs.CV cs.AI cs.LG cs.MM 82%

CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception

CVSearch:赋予多模态大语言模型认知视觉搜索能力以感知高分辨率图像

Liupeng Li, Haoqian Kang, Zhenyu Lu, Jinpeng Wang, Bin Chen, Ke Chen, Yaowei Wang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 提出CVSearch,一种无需训练的自适应框架,通过评估-搜索工作流动态调度视觉搜索策略,解决高分辨率图像感知中覆盖与效率的权衡问题。

Comments Accepted by ICML 2026. 22 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23559 2026-05-25 cs.CV cs.AI 62%

PathNavigate: A Training-Free Pathology Agent with Surprise-Guided Scan and Shared Slide Memory for Whole-Slide Image VQA

PathNavigate: 一种无需训练的病理学代理,具有惊喜引导扫描和共享幻灯片记忆用于全切片图像VQA

Chunze Yang, Qidong Liu, Wenjie Zhao, Yue Tang, Jiusong Ge, Di Zhang, Jiashuai Liu, Lei Wu, Junbo Lu, Ni Zhang, Xian Wu, Zeyu Gao, Chen Li

机构 * School of Comp. Science & Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Tencent Jarvis Lab(腾讯Jarvis实验室) University of Cambridge(剑桥大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出PathNavigate,一种无需训练的病理学代理,通过惊喜引导扫描和共享幻灯片记忆,在严格检查预算下高效定位证据并回答临床查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10347 2026-05-25 cs.AI cs.CL 62%

How Mobile World Model Guides GUI Agents?

移动世界模型如何指导GUI代理?

Weikai Xu, Kun Huang, Yunren Feng, Jiaxing Li, Yuhan Chen, Yuxuan Liu, Zhizheng Jiang, Heng Qu, Pengzhi Gao, Wei Liu, Jian Luan, Xiaolin Hu, Bo An

机构 * Nanyang Technological University(南洋理工大学) MiLM Plus, Xiaomi Inc.(小米公司) Independent Researchers(独立研究人员) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Wuhan University(武汉大学) Xiamen University(厦门大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文通过训练四种模态(增量文本、完整文本、扩散图像、可渲染代码)的世界模型,并评估其在下游任务中的效用,发现可渲染代码重建在分布内保真度高,文本反馈对在线分布外执行更鲁棒,世界模型生成的轨迹可提供迁移经验但无法替代原始分布,且对低熵过度自信的代理,后验自省收益有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09583 2026-05-25 cs.RO cs.AI 57%

AirVista-II: An Agentic System for Embodied UAVs Toward Dynamic Scene Semantic Understanding

AirVista-II:面向动态场景语义理解的具身无人机智能体系统

Fei Lin, Yonglin Tian, Tengchao Zhang, Jun Huang, Sangtian Guan, Fei-Yue Wang

机构 * Department of Engineering Science, Faculty of Innovation Engineering, Macau University of Science and Technology(创新工程学院工程科学系,澳门科学技术大学) State Key Laboratory for Management and Control of Complex Systems, Institute of Automation, Chinese Academy of Sciences(复杂系统管理与控制国家重点实验室,中国科学院自动化研究所) State Key Laboratory for Management and Control of Complex Systems, Chinese Academy of Sciences(复杂系统管理与控制国家重点实验室,中国科学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出AirVista-II端到端智能体系统,通过集成智能体任务识别调度、多模态感知和差异化关键帧提取策略,实现零样本下无人机动态场景的通用语义理解与推理。

Journal ref Proc. 2025 IEEE International Conference on Systems, Man, and Cybernetics (SMC), pp. 6319-6324, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态训练与对齐 7 篇

2601.21692 2026-05-25 cs.AI 92%

TCAP: Tri-Component Attention Profiling for Unsupervised Backdoor Detection in MLLM Fine-Tuning

TCAP: 面向MLLM微调中无监督后门检测的三组件注意力分析

Mingzu Liu, Hao Fang, Runmin Cong

机构 * School of Control Science and Engineering, Shandong University, Jinan, China(控制科学与工程学院,山东大学,济南,中国) Key Laboratory of Industrial Intelligent Systems, Shandong Province, China(山东省工业智能系统重点实验室,中国)

专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对微调即服务中的后门攻击,提出基于三组件注意力分布差异的无监督防御框架TCAP,通过高斯混合模型和EM投票聚合检测中毒样本。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22868 2026-05-25 cs.LG 82%

FusionSense: Tri-Stage Near-Sensor Learning for Runtime-Adaptive Multimodal Edge Intelligence

FusionSense: 用于运行时自适应多模态边缘智能的三阶段近传感器学习

Sanggeon Yun, Ryozo Masukawa, Minhyoung Na, Hyunwoo Oh, Yoshiki Yamaguchi, Wenjun Huang, SungHeon Jeong, Mohsen Imani

机构 * University of California, Irvine(加州大学尔湾分校) Kookmin University(韩国国民大学) Shibaura Institute of Technology(武藏技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 提出FusionSense框架,通过三阶段训练(服务器端融合模型学习、过滤安全标签量化模态必要性、边缘融合模型压缩)实现近传感器分类器,在保持任务质量的同时大幅降低能耗和数据传输。

Comments Accepted to ISLPED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20192 2026-05-25 cs.CL cs.CE cs.CR cs.CY q-fin.CP 79%

Leveraging Large Language Models for Sentiment Analysis: Multi-Modal Analysis of Decentraland's MANA Token

利用大语言模型进行情感分析:Decentraland的MANA代币多模态分析

Xintong Wu, Peiting Tsai, Jing Yuan, Michael Yu, Greg Sun, Luyao Zhang

机构 * University of Pennsylvania(宾夕法尼亚大学) Microsoft(微软) Duke Kunshan University(杜克昆山大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CL

AI总结 本研究利用基于BERT的大语言模型对Decentraland的Discord社区进行情感分析,并结合多模态金融数据(历史价格、情感分数、交易量和市值)构建LSTM模型,发现多模态模型在MANA代币回报预测中显著优于仅基于价格的基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏