arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-22 至 2026-05-22 共收录 90 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 26 篇

2603.15676 2026-05-22 cs.SE cs.AI 57%

Automated Self-Testing as a Quality Gate: Evidence-Driven Release Management for LLM Applications

自动化自我测试作为质量门:基于证据的LLM应用发布管理

Alexandre Cristovão Maiorano

机构 * Lumytics

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出了一种自动化自我测试框架,通过五个实证基础的维度(任务成功率、研究环境保持、P95延迟、安全通过率和证据覆盖)实现基于证据的发布决策(PROMOTE/HOLD/ROLLBACK),并通过长期案例研究评估了该框架在多代理对话AI系统中的有效性。

Comments 20 pages, 6 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11679 2026-05-22 cs.AI 57%

LLMs can construct powerful representations and streamline sample-efficient supervised learning

LLMs can construct powerful representations and streamline sample-efficient supervised learning

Ilker Demirel, Lawrence Shi, Zeshan Hussain, David Sontag

机构 * MIT(麻省理工学院) Harvard Medical School(哈佛医学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种基于LLM的代理流程,通过生成全局 rubric 来提升多模态数据的表示能力,并在15个临床任务中显著优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01851 2026-05-22 cs.CV 57%

How Well Do Models Follow Visual Instructions? VIBE: A Systematic Benchmark for Visual Instruction-Driven Image Editing

模型能多好地遵循视觉指令?VIBE:一个系统性的视觉指令驱动图像编辑基准

Huanyu Zhang, Xuehai Bai, Chengzu Li, Chen Liang, Haochen Tian, Haodong Li, Ruichuan An, Yifan Zhang, Anna Korhonen, Zhang Zhang, Liang Wang, Tieniu Tan

机构 * School of Artificial Intelligence, University of Chinese Academy of Science(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) Peking University(北京大学) South China University of Technology(华南理工大学) Nanjing University(南京大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出VIBE基准,用于评估视觉指令驱动的图像编辑模型,通过三级交互层次评估指涉 grounding、形态操作和因果推理,并发现专有模型在早期阶段表现优异但随着任务难度增加性能下降。

Comments https://vibe-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20912 2026-05-22 cs.AI 57%

DeFacto: Counterfactual Thinking with Images for Enforcing Evidence-Grounded and Faithful Reasoning

DeFacto: 通过图像进行反事实推理以强制证据支持和忠实推理

Tianrun Xu, Haoda Jing, Ye Li, Yuquan Wei, Jun Feng, Guanyu Chen, Haichuan Gao, Tianren Zhang, Feng Chen

机构 * Department of Automation, Tsinghua University, Beijing, China(清华大学自动化系) Zhongguancun Academy, Beijing, China(中关村学院) School of Software, Xinjiang University, Urumqi, China(新疆大学软件学院) College of Materials Science and Engineering, Fuzhou University, Fuzhou, China(福州大学材料科学与工程学院) Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院) Beijing Qianjue Technology Co., Ltd., Beijing, China(北京千 jue 技术有限公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出DeFacto框架,通过整合正例、反事实和随机遮蔽三种训练范式,提升多模态语言模型在证据一致性方面的表现,并引入DeFacto-1.5K基准进行系统评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12506 2026-05-22 cs.LG 50%

On Robustness and Chain-of-Thought Consistency of RL-Finetuned VLMs

关于RL微调VLMs的鲁棒性和链式思维一致性

Rosie Zhao, Anshul Shah, Xiaoyu Zhu, Xinke Deng, Zhongyu Jiang, Yang Yang, Joerg Liebelt, Arnab Mondal

机构 * Apple(苹果公司) OpenAI

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文研究了RL微调VLMs在视觉推理任务中的鲁棒性和链式思维一致性,发现文本扰动和CoT不一致会显著降低模型的鲁棒性和信心,而闭源模型在保持鲁棒性和推理一致性方面表现更佳,指出这一差距源于当前开源RL微调的不足而非任务本身的限制。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06743 2026-05-22 cs.DB 50%

OSM+: Billion-Level OpenStreetMap Dataset for City-wide Experiments

OSM+: 亿级开放街图数据集用于城市级实验

Guanjie Zheng, Ziyang Su, Yiheng Wang, Yuhang Luo, Hongwei Zhang, Xuanhe Zhou, Linghe Kong, Fan Wu, Wen Ling

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出OSM+数据集,通过分布式云计算处理5000个核心,释放了一个包含10亿个顶点的全球道路网络图数据集,用于高可访问性和可操作性,展示了其在城市边界检测、交通预测和交通政策控制中的应用,同时提供了数据处理工具以加速地理基础模型的训练。

Comments to be published in ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21863 2026-05-22 cs.RO 50%

OCELOT: Odometry and Contact Estimation for Legged Robots

OCELOT:用于腿部机器人的步态和接触估计

Emre Girgin, Cagri Kilic

机构 * Department of Aerospace Engineering, Embry-Riddle Aeronautical University(航空航天工程系,埃默里-瑞德航空航天大学)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出了一种基于误差状态扩展卡尔曼滤波器(ESEKF)的完整腿部里程计管道,通过仅使用本体感觉数据(如固定IMU、关节编码器和力传感器)来实现准确的里程计估计,核心贡献是融合接触检测和不确定性量化模块,用于显式识别并拒绝滑动。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 8 篇

2605.19192 2026-05-22 cs.AI cs.CR 79%

Hallucination as Exploit: Evidence-Carrying Multimodal Agents

幻觉作为利用:证据承载多模态智能体

Guijia Zhang, Hao Zheng, Harry Yang

机构 * Shenzhen University(深圳大学) HKUST(香港科技大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文研究了多模态智能体中幻觉导致授权失败的问题,提出证据承载多模态智能体(ECA)方法,通过分解工具调用、获取类型证书并使用确定性门控来授权,从而将模型的模糊信念转换为可审计的残余,提高了系统的安全性。

Comments 23 pages, 6 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05765 2026-05-22 cs.CV 79%

X-OmniClaw Technical Report: A Unified Mobile Agent for Multimodal Understanding and Interaction

X-OmniClaw 技术报告:一种统一的移动代理用于多模态理解和交互

Xiaoming Ren, Ru Zhen, Chao Li, Yang Song, Qiuxia Hou, Yanhao Zhang, Peng Liu, Qi Qi, Quanlong Zheng, Qi Wu, Zhenyi Liao, Binqiang Pan, Haobo Ji, Haonan Lu

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出X-OmniClaw,一种统一的移动代理,用于Android生态系统中的多模态理解和交互,通过统一的感知、记忆和行动架构,提升复杂移动任务的上下文感知能力,展示了其在多模态交互中的高效性和可靠性。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22600 2026-05-22 cs.RO 78%

Branch-Stochastic Model Predictive Control for Motion Planning under Multi-Modal Uncertainty with Scenario Clustering

基于分支随机优化的运动规划在多模态不确定性下的场景聚类

Zekun Xing, Ramkrishna Chaudhari, Marion Leibold, Dirk Wollherr, Martin Buss

机构 * Chair of Automatic Control Engineering(自动控制工程教授会)

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 本文提出一种结合随机模型预测控制与分支结构的方法,用于在多模态不确定性下进行运动规划,通过场景聚类提高实时计算性能并减少保守性。

Comments This work has been accepted for presentation at IFAC World Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21923 2026-05-22 quant-ph 78%

Multi-Modal Spectroscopy Theory for Ultrafast Control of Rabi Oscillations

多模光谱理论用于超快控制Rabi振荡

J. W. Yu, H. B Wang, X. Q. Zhou, M. Tang, Z. B. Ni, X. T. Cheng, Y. Zhao, S. N Ding, J. Y. Yan, H. H. Zhu, C. H. Li, F. Liu, C. Y. Jin

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 本文提出了一种三腔方案,用于在腔量子电动力学(cQED)中实现发射器-腔耦合强度的完全控制。通过耦合振荡器引入了包含多个谱分量的瞬态动力学,显著增加了在时域中解析荧光光谱的数值成本。因此开发了一种通用传感器方法,以简化非稳态量子动力学的表征计算。多模光谱实时揭示了超模的出现、分裂和消失。基于零能超模的耗尽,证明了在时域多模光谱中实现超快的Rabi振荡切换。这些结果展示了从多个振子的谱控制到超快动力学的量子观测的一致图景,确立了传感器方法作为cQED系统超快光谱学的强大理论工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22446 2026-05-22 cs.CV cs.AI cs.RO 62%

Pre-VLA: Preemptive Runtime Verification for Reliable Vision-Language-Action and World-Model Rollouts

Pre-VLA: 预防性运行时验证用于可靠视觉-语言-动作和世界模型展开

Zhen Sun, Yongjian Guo, Haoran Sun, Luqiao Wang, Wei Lu, Jiachi Ji, Shengzhe Ji, Junwu Xiong, Zhijun Meng

机构 * Beihang University(北京航空航天大学) Tsinghua University(清华大学) Peking University(北京大学) JDT AI Infra Zhejiang University(浙江大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Pre-VLA,一种统一的运行时验证架构,用于在物理执行或世界模型想象之前评估动作的有效性,以提高视觉-语言-动作和世界模型展开的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22177 2026-05-22 cs.LG cs.CL 57%

Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles

Maestro:通过强化学习协调分层模型-技能集合

Jinyang Wu, Guocheng Zhai, Ruihan Jin, Yuhao Shen, Zhengxi Lu, Fan Zhang, Haoran Luo, Zheng Lian, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) Tongji University(同济大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL

AI总结 本文提出Maestro框架,通过强化学习协调多模态任务,利用分层模型-技能集合提升多模态任务性能,实现高效且通用的协调策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20342 2026-05-22 cs.CV 57%

ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning

ParaVT: 平衡工具先验悖论以实现代理视频强化学习中的并行工具使用

Zuhao Yang, Kaichen Zhang, Sudong Wang, Keming Wu, Zhongyu Yang, Bo Li, Xiaojuan Qi, Shijian Lu, Xingxuan Li, Lidong Bing

机构 * MiroMind NTU(国立台湾大学) HKU(香港大学) HKUST(GZ)(香港科技大学(广州)) THU(清华大学) LMMs-Lab(LMMs实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出ParaVT,一种用于并行视频工具调用的端到端强化学习框架,通过引入PARA-GRPO机制解决工具先验悖论,提升了长视频理解的性能。

Comments Project Page: https://evolvinglmms-lab.github.io/ParaVT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21844 2026-05-22 nlin.AO cond-mat.stat-mech physics.soc-ph 50%

A Utility-Driven Bounded-Confidence Model for Opinion Dynamics

基于效用的有界信心意见动力学模型

Alex Siebenmorgen, Juan G. Restrepo

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出一种基于效用的有界信心模型,研究意见动态中的社会影响,通过效用景观和学习率确定有效势能,并展示多模态效用函数下的意见状态切换和集群合并。

Comments 5 pages with 4 figures plus Supplementary Material

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 11 篇

2605.22072 2026-05-22 cs.CL cs.CV 81%

Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention

Faithful-MR1: 通过锚定和强化视觉注意力实现忠实的多模态推理

Changyuan Tian, Zhicong Lu, Huaxing Liu, Xiang Wang, Shuai Li, Yu Chen, Wenqian Lv, Zichuan Lin, Juncheng Diao, Deheng Ye

机构 * AMAP, Alibaba Group(阿里云实验室,阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出Faithful-MR1框架,通过锚定和强化视觉注意力解决多模态推理中的忠实性问题,提升模型在多模态基准上的表现。

Comments 20 pages, 7 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22090 2026-05-22 cs.AI 79%

A Camera-Cooperative ISAC Framework for Multimodal Non-Cooperative UAVs Sensing

一种用于多模非合作无人机感知的相机协作ISAC框架

Wenfeng Wu, Luping Xiang, Kun Yang

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Institute of Intelligent Networks and Communications (NINE)(智能网络与通信研究院) School of Intelligent Software and Engineering, Nanjing University (Suzhou Campus)(南京大学智能软件与工程学院(苏州校区))

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出了一种相机协作ISAC框架,通过多模感知实现高效的无人机波束定向和跟踪,提升了感知精度和资源效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22036 2026-05-22 cs.CV cs.AI 79%

GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation

GA-VLN: 用于高效视觉-语言导航的几何感知鸟瞰图表示

Jiahao Yang, Zihan Wang, Xiangyang Li, Xing Zhu, Yujun Shen, Yinghao Xu, Shuqiang Jiang

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Robbyant School of Computing, National University of Singapore(新加坡国立大学计算机学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出GA-VLN框架,通过引入几何感知的鸟瞰图表示(GA-BEV),整合显式和隐式几何信息,提升视觉-语言导航的效率和性能,实验表明其在仅使用导航数据的情况下取得了最先进的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16923 2026-05-22 cs.CV 70%

Neuroscience-inspired Staged Representation Learning with Disentangled Coarse- and Fine-Grained Semantics for EEG Visual Decoding

受神经科学启发的分阶段表征学习:解纠缠的粗粒度和细粒度语义用于EEG视觉解码

Xiang Gao, Hui Tian, Yanming Zhu, Xuefei Yin, Alan Wee-Chung Liew

机构 * School of Information and Communication Technology, Griffith University(信息与通信技术学院,格里菲斯大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种受神经科学启发的分阶段表征学习框架,通过解纠缠的粗粒度和细粒度语义来改进EEG视觉解码,解决了现有方法在人类视觉处理分阶段和层次特性方面的不足。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22581 2026-05-22 cs.CV cs.AI cs.LG 62%

SceneAligner: 3D-Grounded Floorplan Localization in the Wild

SceneAligner: 在真实场景中实现基于3D的平面定位

Junhyeong Cho, Ruojin Cai, Hadar Averbuch-Elor

机构 * Cornell University(康奈尔大学) Kempner Institute, Harvard University(哈佛大学 Kempner 院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种在真实场景中实现基于3D重建的平面定位方法,通过将任务 grounding 在场景的重建3D表示中,解决了现有方法在大规模建筑和栅格化平面图中应用受限的问题。

Comments Project Page: https://Cornell-VAILab.github.io/SceneAligner

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21835 2026-05-22 eess.IV cs.AI cs.CV physics.med-ph 62%

An Open Multi-Center Whole-Body FDG PET/CT Foundation Model for Tumor Segmentation

一种开放的多中心全身FDG PET/CT基础模型用于肿瘤分割

Xiaofeng Liu, Qianru Zhang, Thibault Marin, Menghua Xia, Chi Liu, Georges El Fakhri, Jinsong Ouyang

机构 * Department of Radiology and Biomedical Imaging, Yale Biomedical Imaging Institute, Yale University(放射学与生物医学成像系,耶鲁生物医学影像研究所,耶鲁大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种开放的多中心全身FDG PET/CT基础模型,通过整合四个公开数据集中的4997份标准化扫描,利用层次UNet结构和早期通道拼接实现解剖和代谢特征的交互,提高了肿瘤分割的标签效率和跨模态表征学习能力。

Comments Code available at: https://github.com/liu-xiaofeng/Foundation-Model-for-PET-CT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22558 2026-05-22 cs.CV 57%

GeoWeaver: Grounding Visual Tokens with Geometric Evidence before Scene Reasoning

GeoWeaver: 在场景推理前通过几何证据 grounding 视觉 token

Deshui Miao, Xingsen Huang, Yameng Gu, Xin Li, Haijun Zhang, Ming-Hsuan Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Pazhou Lab (Huangpu)(琶洲实验室(黄埔)) Hainan University(海南大学) University of California at Merced(加州大学默塞德分校)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出 GeoWeaver,一种在场景推理前通过几何证据对视觉 token 进行 grounding 的框架,以提升空间推理能力并保持多模态能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02938 2026-05-22 cs.LG cs.AI 57%

Beyond One-Size-Fits-All: Adaptive Subgraph Denoising for Zero-Shot Graph Learning with Large Language Models

超越一刀切:基于大语言模型的零样本图学习中的自适应子图去噪

Fengzhi Li, Liang Zhang, Yuan Zuo, Ruiqing Zhao, YanSong Liu, Yunfei Ma, Fanyu Meng, Junlan Feng

机构 * JIUTIAN Research(JIUTIAN研究) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) MIIT Key Laboratory of Data and Decision Intelligence(信息与决策智能重点实验室) Beihang University(北航)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出GraphSSR框架,通过自适应子图提取和去噪方法,解决传统图神经网络在零样本学习中泛化能力不足的问题,提升大语言模型在图推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21714 2026-05-22 cs.CV cs.RO 57%

AVI-HT: Adaptive Vision-IMU Fusion for 3D Hand Tracking

AVI-HT:自适应视觉-IMU融合用于3D手部跟踪

Ziyi Kou, Ankit Kumar, Mia Huang, Taylor Niehues, Vatsal Mehta, Ergys Ristani, Li Guan

机构 * Meta Reality Labs(Meta现实实验室)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出AVI-HT,一种自适应视觉-IMU融合方法,通过联合建模第一人称视角图像与手套上的6自由度IMU信号,用于跟踪3D手部姿态。核心方法包括同步多模态训练数据配对和跨传感器深度注意力机制,主要贡献是提高了在手-物体交互场景中的准确性和可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21541 2026-05-22 cs.CR cs.AI cs.LG stat.ML 57%

Frequency-Domain Regularized Adversarial Alignment for Transferable Attacks against Closed-Source MLLMs

频域正则化对抗对齐用于针对闭源大语言模型的可转移攻击

Leitao Yuan, Qinghua Mao, Daizong Liu, Kun Wang, Wenjie Wang, Yan Teng, Jing Shao, Dongrui Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出FRA-Attack,通过频域正则化方法解决对抗转移性问题,通过高通DCT目标和频率域梯度正则化提升跨模型的对抗转移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01760 2026-05-22 cs.CV 57%

MagicFuse: Single Image Fusion for Visual and Semantic Reinforcement

MagicFuse: 单图像融合用于视觉与语义增强

Hao Zhang, Yanping Zha, Zizhuo Li, Meiqi Gong, Jiayi Ma

机构 * Electronic Information School, Wuhan University, China(武汉大学电子信息学院) Suzhou Institute of Wuhan University, China(武汉大学苏州研究院) School of Automation, Wuhan University, China(武汉大学自动化学院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出MagicFuse单图像融合框架,通过扩散模型生成跨光谱场景表示,实现视觉与语义的双重约束,实验表明其性能优于多模态融合方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 4 篇

2605.22726 2026-05-22 eess.SY cs.SY 82%

Dynamic Lane Allocation in UAM Corridors for Efficient Multimodal Door-to-Door Mobility

动态车道分配用于高效多模式门到门移动

Jung Ho Park, Jordan Kam, Vishwanath Bulusu, Alexandre Bayen, Raja Sengupta

专题命中 其他多模态 :multimodal(title,abstract);multi-modal(abstract)

AI总结 本文提出了一种动态方向车道分配方法,用于城市空中交通(UAM)走廊,通过离散时间混合整数线性规划(MILP)模型来动态激活、停用和反转车道方向,以应对双向空域需求的变化。研究通过分解每个行程为多模式序列,并通过垂直机场侧调度模型路由UAM服务的中段,利用旧金山湾区作为案例研究,发现动态策略可减少未使用空域容量5倍,提高车道利用率至67%,并减少通勤人口的平均出行时间高达21.6%。

Comments Submitted to AIAA Aviation Forum

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21935 2026-05-22 cs.RO 78%

Learning to Evolve: Multi-modal Interactive Fields for Robust Humanoid Navigation in Dynamic Environments

学习进化:多模态交互场用于动态环境中的稳健双足机器人导航

Peifeng Jiang, Hong Liu, Jin Jin, Wenshuai Wang, Xia Li

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(一般人工智能国家重点实验室,北京大学深圳研究生院) Oxford Robotics Institute, University of Oxford(牛津大学机器人研究所) Institute for Machine Learning, Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系机器学习研究所)

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 本文提出多模态交互场(MIF)系统,通过结合置信度感知的语义3D高斯溅射、差异触发的空间记忆更新和任务驱动的几何重建,在闭环感知-适应管道中实现稳健的双足机器人导航,显著提高了非静态环境中的重定位成功率并减少了语义内存足迹。

Comments Accepted by Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21565 2026-05-22 cs.LG 78%

Leveraging Self-Paced Curriculum Learning for Enhanced Modality Balance in Multimodal Conversational Emotion Recognition

通过自适应课程学习提升多模态对话情感识别的模态平衡

Phuong-Anh Nguyen, The-Son Le, Duc-Trong Le, Cam-Van Thi Nguyen

机构 * VNU University of Engineering and Technology(越南工程大学)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文提出基于自适应课程学习的框架,通过双层难度评估器解决多模态对话情感识别中的模态不均衡问题,实验表明该方法在IEMOCAP和MELD数据集上显著提升了模型性能。

Comments Accepted at Neural Computing and Applications (Springer), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21685 2026-05-22 eess.SP 50%

Rapid Adaptive Matched Filter for Detecting Radar Targets with Unknown Velocity

快速自适应匹配滤波器用于检测未知速度的雷达目标

Anatolii A. Kononov

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出了一种在严重杂波环境中使用有限训练数据的自适应匹配滤波器(AMF)的多普勒域局部化(DDL)实现,用于雷达目标检测。该检测器利用了可能的目标检测区域(RPTD)的概念,即一组小的多普勒_bins,能够捕捉大部分目标信号功率。与采用检测改进区域(RODI)概念的早期建议的DDL-GLR测试相比,基于RPTD的DDL-AMF检测器在未知目标多普勒频率和多模式杂波谱的情况下,能够实现快速自适应检测和近最优性能。

Comments 41 pages, 19 figures, 2 tables, 5 appendices, 24 references

详情

展开后加载摘要…

URL PDF HTML 收藏