arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-25 至 2026-03-25 共收录 105 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 20 篇

2603.23229 2026-03-25 cs.CL 79%

I Came, I Saw, I Explained: Benchmarking Multimodal LLMs on Figurative Meaning in Memes

我来了,我看到了,我解释了:在表情包中评估多模态大语言模型的隐喻意义

Shijia Zhou, Saif M. Mohammad, Barbara Plank, Diego Frassinelli

机构 * MaiNLP, Center for Information and Language Processing, LMU Munich(MaiNLP,信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) National Research Council Canada(加拿大国家研究委员会)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文评估了八种最先进的生成式多模态大语言模型在检测和解释六种隐喻意义类型上的能力,并通过人工评估验证其解释的合理性与忠实性。

Comments LREC 2026, 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22763 2026-03-25 cs.CV 79%

ENC-Bench: A Benchmark for Evaluating Multimodal Large Language Models in Electronic Navigational Chart Understanding

ENC-Bench:用于评估多模态大语言模型在电子航海图理解中的基准

Ao Cheng, Xingming Li, Xuanyu Ji, Xixiang He, Qiyao Sun, Chunping Qiu, Runke Huang, Qingyong Hu

机构 * National University of Defense Technology(国防科技大学) Intelligent Game and Decision Lab(智能游戏与决策实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 ENC-Bench是首个专注于专业电子航海图理解的基准,包含20490个经过专家验证的样本,评估了10种先进多模态大语言模型在符号识别、空间推理和航海决策中的表现,揭示了模型在符号 grounding、空间计算和多约束推理方面的系统性挑战。

Comments Accepted to CVPR 2026, Project page: https://qingyonghu.github.io/ENC-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22756 2026-03-25 cs.CV 79%

MVPBench: A Multi-Video Perception Evaluation Benchmark for Multi-Modal Video Understanding

MVPBench: 一个多视频感知评估基准用于多模态视频理解

Purui Bai, Tao Wu, Jiayang Sun, Xinyue Liu, Huaibo Huang, Ran He

机构 * MAIS \& NLPR, Institute of Automation Chinese Academy of Sciences Beijing, China SIST ShanghaiTech University Shanghai, China

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 MVPBench通过14个跨多样本域的子任务评估模型从视频序列中提取相关信息的能力,揭示当前模型在多视频处理上的局限性。

Comments 15 pages, 7 figures, accepted by IJCNN 2026, code and dataset available at https://github.com/MVPBench/MVPBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04406 2026-03-25 cs.IR cs.AI cs.IT cs.LG cs.SI math.IT 79%

Training-free Adjustable Polynomial Graph Filtering for Ultra-fast Multimodal Recommendation

无需训练的可调多项式图过滤器用于超快多模态推荐

Yu-Seung Roh, Joo-Young Kim, Jin-Duk Park, Won-Yong Shin

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学) NAVER Corporations(NAVER公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出无需训练的多模态推荐方法,通过构建相似性图并利用多项式图滤波器融合多模态信号,提升推荐准确率并降低计算成本。

Comments 21 pages, 9 figures, 7 tables; published in the Engineering Applications of Artificial Intelligence (Please cite our journal version.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23358 2026-03-25 q-bio.NC 78%

A Synchronous EEG-fNIRS BCI: A Proof-of-Concept for Multimodal Avalanche Analysis of Motor Cognition in Older Adults

一种同步EEG-fNIRS脑机接口:多模态雪崩分析在老年人运动认知中的证明概念研究

Eva Guttmann-Flury, Yun-Hsuan Chen, Qiaoyuan Xiang, Hao Zhang, Mohamad Sawan

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出一种结合同步EEG-fNIRS与神经雪崩分析的多模态框架,用于检测阿尔茨海默病早期网络功能障碍。研究通过小样本试点验证了多模态框架的技术可行性,并发现条件依赖的网络组织模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22933 2026-03-25 q-bio.NC 78%

An Open-Access Multi-modal Dataset for Cognitive, Motor, and Cognitive-Motor Tasks

一个开放获取的多模态数据集用于认知、运动及认知-运动任务

Zaineb Ajra, Grégoire Vergotte, Stéphane Perrey, Lilian Evra, Simon Pla, Gérard Dray, Jacky Montmain, Binbin Xu

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 本文提出一个包含EEG、fNIRS、ECG等多模态数据的开放数据集,用于研究认知与运动任务的交互作用,支持开发先进的预处理方法和分析流程,应用于脑机接口和神经康复等领域。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07990 2026-03-25 cs.LG 78%

MJ1: Multimodal Judgment via Grounded Verification

MJ1: 通过 grounded 验证实现多模态判断

Bhavesh Kumar, Dylan Feng, Leonard Tang

机构 * Haize Labs(哈泽实验室)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 MJ1 通过结构化 grounded 验证链和反事实一致性奖励提升多模态判断准确性,训练后在 MMRB2 数据集上达到 77.0% 准确率,超越更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22915 2026-03-25 cs.CV 70%

When AVSR Meets Video Conferencing: Dataset, Degradation, and the Hidden Mechanism Behind Performance Collapse

当AVSR遇见视频会议:数据集、退化及性能崩溃的隐藏机制

Yihuan Huang, Jun Xue, Liu Jiajun, Daixian Li, Tong Zhang, Zhuolin Yi, Yanzhen Ren, Kai Li

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education(航空航天信息安全部与可信计算教育部重点实验室) School of Cyber Science and Engineering, Wuhan University(武汉大学网络安全科学与工程学院) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 本文系统评估了主流视频会议平台上的最新AVSR模型,发现传输失真和人类超表达导致性能退化,通过构建MLD-VC数据集揭示语音增强算法引起分布偏移,细调模型可降低17.5%的CER。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21395 2026-03-25 cs.CV 70%

Momentum Memory for Knowledge Distillation in Computational Pathology

动量记忆用于计算病理学中的知识蒸馏

Yongxin Guo, Hao Lu, Onur C. Koyun, Zhengjie Zhu, Muhammet Fatih Demir, Metin Nafi Gurcan

机构 * Wake Forest University School of Medicine(威克森林大学医学院)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MoMKD框架,通过动量更新的记忆机制整合基因组和病理学信息,提升跨模态知识蒸馏性能,实验表明其在病理学任务中表现优异。

Comments Accepted by CVPR 2026. Code: https://github.com/CAIR-LAB-WFUSM/MoMKD

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22529 2026-03-25 cs.CV cs.AI cs.CL 67%

Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos

Ego2Web:一种基于第一人称视频的网络代理基准测试

Shoubin Yu, Lei Shu, Antoine Yang, Yao Fu, Srinivas Sunkara, Maria Wang, Jindong Chen, Mohit Bansal, Boqing Gong

机构 * Google DeepMind(谷歌DeepMind) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Ego2Web通过结合真实世界第一人称视频与网络任务,解决网络代理在现实物理环境中的感知问题,提出LLM-as-a-Judge评估方法,揭示当前代理在视觉理解和任务规划上的不足。

Comments CVPR 2026. Project page: https://ego2web.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22492 2026-03-25 cs.AI 57%

RealCQA-V2: A Diagnostic Benchmark for Structured Visual Entailment over Scientific Charts

RealCQA-V2:结构化科学图表视觉蕴含的诊断基准

Saleem Ahmed, Srirangaraj Setlur, Venu Govindaraju

机构 * University at Buffalo, Buffalo, NY, USA(布法罗大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 RealCQA-V2通过将图表问答转化为视觉前提证明任务,提供结构化视觉蕴含验证,揭示多模态推理中的局部-全局推理差距。

Comments Under Review : Code and Data will be made public soon - https://cse-ai-lab.github.io/VPP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23034 2026-03-25 cs.CV 57%

Traffic Sign Recognition in Autonomous Driving: Dataset, Benchmark, and Field Experiment

自动驾驶中的交通标志识别:数据集、基准测试与实地实验

Guoyang Zhao, Weiqing Qi, Kai Zhang, Chenguang Zhang, Zeying Gong, Zhihai Bi, Kai Chen, Benshan Ma, Ming Liu, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Lingnan University(岭大) Shenzhen Unity Drive Innovation Technology Co., Ltd.(深圳Unity Drive创新技术有限公司) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TS-1M数据集及诊断基准,通过跨区域识别、稀有类别识别等挑战性任务,评估现代交通标志识别模型的性能,揭示语义对齐对泛化能力的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22689 2026-03-25 cs.CV 57%

Think 360°: Evaluating the Width-centric Reasoning Capability of MLLMs Beyond Depth

Think 360°: 评估MLLMs的宽度中心推理能力超越深度

Mingrui Chen, Hexiong Yang, Haogeng Liu, Huaibo Huang, Ran He

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) NLPR&MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所NLPR&MAIS) School of Advanced Interdisciplinary Science, University of Chinese Academy of Sciences(中国科学院大学交叉学科学院) Zhongguancun Academy(中关村学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一个全面的多模态基准,评估MLLMs的推理能力,特别关注推理宽度,作为深度的补充维度。通过1200+高质量多模态案例,提出细粒度树状思维评估协议,评估12种模型家族的推理宽度和深度,揭示当前模型在结合深度推理与广泛探索搜索方面的能力不足。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02448 2026-03-25 cs.CV cs.RO 57%

nuScenes Revisited: Progress and Challenges in Autonomous Driving

nuScenes 重新审视:自动驾驶领域的进展与挑战

Whye Kit Fong, Venice Erin Liong, Kok Seang Tan, Holger Caesar

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文重新审视nuScenes数据集,探讨其在自动驾驶发展中的核心作用,分析其技术细节及对后续研究的影响,总结多模态传感器融合与标准化评估的关键贡献。

Comments 18 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23470 2026-03-25 cs.SE 50%

ConceptCoder: Improve Code Reasoning via Concept Learning

ConceptCoder: 通过概念学习提升代码推理

Md Mahbubur Rahman, Hengbo Tong, Wei Le

专题命中 多模态评测 :multimodal(abstract)

AI总结 ConceptCoder通过学习代码概念提升代码推理能力,在漏洞检测任务中显著提高F1值,优于现有方法,并扩展至分支预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22410 2026-03-25 astro-ph.GA astro-ph.SR 50%

Detailed Analysis of the NGC 2168 Cluster, Leveraging Gaia DR3

NGC 2168星团的详细分析,利用Gaia DR3

Nasser M. Ahmed, Remziye Canbay, Deniz Cennet Çınar

专题命中 多模态评测 :multimodal(abstract)

AI总结 利用Gaia DR3数据对NGC 2168星团的运动学、结构和天体物理性质进行分析,确定其年龄、金属度和距离,发现其存在扩展的恒星晕和垂直方向的潮汐加热特征。

Comments 23 pages, including 21 figures and 7 tables accepted for publication in the Advances in Space Research

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 10 篇

2601.22060 2026-03-25 cs.CV cs.AI 84%

Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models

Vision-DeepResearch: 促进多模态大语言模型中的深度研究能力

Wenxuan Huang, Yu Zeng, Qiuchen Wang, Zhen Fang, Shaosheng Cao, Zheng Chu, Qingyu Yin, Shuang Chen, Zhenfei Yin, Lin Chen, Zehui Chen, Xu Tang, Yao Hu, Shaohui Lin, Philip Torr, Feng Zhao, Wanli Ouyang

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Vision-DeepResearch,通过多轮、多实体和多尺度的视觉与文本搜索,提升多模态大语言模型在噪声环境下的深度研究能力,实现更高效的多模态深度研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23271 2026-03-25 cs.RO cs.AI 79%

A Multimodal Framework for Human-Multi-Agent Interaction

人-多智能体交互的多模态框架

Shaid Hasan, Breenice Lee, Sujan Sarker, Tariq Iqbal

机构 * University of Virginia(弗吉尼亚大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一个多模态框架,用于人与多智能体交互,通过集成多模态感知和大语言模型驱动的规划,实现自主认知代理的协调决策,解决现有系统在统一框架下整合多模态感知、具身表达和协同决策的难题。

Comments 4 pages, 3 figures. Accepted at ACM/IEEE HRI 2026 Workshop (MAgicS-HRI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11191 2026-03-25 cs.AI cs.RO 79%

Multi-Modal Multi-Task (M3T) Federated Foundation Models for Embodied AI: Potentials and Challenges for Edge Integration

多模态多任务(M3T)联邦基础模型用于具身AI:边缘整合的潜力与挑战

Kasra Borazjani, Payam Abdisarabshali, Fardis Nadimi, Naji Khosravan, Minghui Liwang, Xianbin Wang, Yiguang Hong, Seyyedali Hosseinalipour

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出多模态多任务联邦基础模型(M3T-FFMs)用于具身AI,结合M3T-FMs的任务泛化能力和FL的隐私保护分布式训练,解决边缘部署中的异构具身、模态不平衡、带宽限制等挑战。

Comments Accepted for Publication in IEEE Internet of Things Magazine, 2025

Journal ref IEEE Internet of Things Magazine, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22796 2026-03-25 cs.CV cs.AI cs.RO 62%

PhotoAgent: A Robotic Photographer with Spatial and Aesthetic Understanding

PhotoAgent:一种具有空间与审美理解的机器人摄影师

Lirong Che, Zhenfeng Gan, Yanbo Chen, Junbo Tan, Xueqian Wang

机构 * Center for Artificial Intelligence and Robotics, Shenzhen International Graduate School, Tsinghua University(人工智能与机器人中心,深圳国际研究生院,清华大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 PhotoAgent通过整合大多模态模型与新型控制范式,将主观审美目标转化为几何约束,利用内部视觉模拟实现快速收敛于高质量图像结果。

Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23295 2026-03-25 cs.CV 57%

Mamba-driven MRI-to-CT Synthesis for MRI-only Radiotherapy Planning

基于Mamba的MRI到CT合成用于仅MRI的放疗计划

Konstantinos Barmpounakis, Theodoros P. Vagenas, Maria Vakalopoulou, George K. Matsopoulos

机构 * School of Electrical Computer Engineering, National Technical University of Athens Archimedes, Athena Research Center CentraleSup\'elec, University of Paris-Saclay

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 本文提出基于Mamba架构的MRI到CT合成方法,以提高跨模态翻译的准确性与效率,通过3D Mamba架构捕捉复杂体积特征和长距离依赖,实现快速且精确的CT合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23149 2026-03-25 cs.AI 57%

Describe-Then-Act: Proactive Agent Steering via Distilled Language-Action World Models

描述-然后-行动:通过蒸馏的语言-动作世界模型实现前瞻性智能体导航

Massimiliano Pappa, Luca Romani, Valentino Sacco, Alessio Palma, Stéphane Lathuilière, Fabio Galasso, Xavier Alameda-Pineda, Indro Spinelli

机构 * Sapienza University of Rome, Italy(罗马大学萨皮恩扎) Inria, Univ. Grenoble Alpes, CNRS, LJK(法国国家信息与自动化技术研究所)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.AI

AI总结 本文提出DILLO模型,通过蒸馏方法实现无需视觉模拟的前瞻性智能体导航,提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07315 2026-03-25 cs.MA cs.AI cs.AR 57%

VLM-CAD: VLM-Optimized Collaborative Agent Design Workflow for Analog Circuit Sizing

VLM-CAD:面向模拟电路尺寸设计的VLM优化协作代理设计流程

Guanyuan Pan, Shuai Wang, Yugui Lin, Tiansheng Zhou, Pietro Liò, Zhenxin Zhao, Yaqi Wang

机构 * Hangzhou Dianzi University(杭州电子科技大学) SCBC, Guangdong University of Foreign Studies(广东外语外贸大学) University of Cambridge(剑桥大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出VLM-CAD流程,通过神经符号结构解析模块和ExTuRBO方法提升多模态推理的鲁棒性和可解释性,实验表明其在模拟电路设计中具有高准确性和低功耗。

Comments submitted to the 34th ACM International Conference on Multimedia (ACMMM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23393 2026-03-25 cs.RO 50%

Rectify, Don't Regret: Avoiding Pitfalls of Differentiable Simulation in Trajectory Prediction

纠正,而非后悔:避免可微模拟在轨迹预测中的陷阱

Harsh Yadav, Christian Bohn, Tobias Meisen

机构 * University of Wuppertal(乌珀塔尔大学)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出一种非可微的递推滚动方法,通过切断计算图来避免可微模拟中的捷径学习,提升轨迹预测的鲁棒性和恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23079 2026-03-25 cs.RO 50%

AirSimAG: A High-Fidelity Simulation Platform for Air-Ground Collaborative Robotics

AirSimAG:一种高保真空地协同机器人仿真平台

Yangjie Cui, Xin Dong, Boyang Gao, Jinwu Xiang, Daochun Li, Zhan Tu

机构 * School of Aeronautic Science and Engineering, Beihang University(北京航空航天大学航空科学与工程学院) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) Institution of Unmanned System, Beihang University(北京航空航天大学无人系统研究院)

专题命中 多模态Agent :cross-modal(abstract)

AI总结 本文提出AirSimAG,一种高保真的空地协同机器人仿真平台,支持多智能体同步仿真和异构传感控制接口,通过多个代表性任务验证其在多智能体协调和跨模态数据一致性方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22903 2026-03-25 cs.RO 50%

Task-Aware Positioning for Improvisational Tasks in Mobile Construction Robots via an AI Agent with Multi-LMM Modules

面向即兴任务的移动建筑机器人AI代理的定位任务感知

Seongju Jang, Francis Baek, SangHyun Lee

机构 * University of Michigan(密歇根大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出一种AI代理,通过多LMM模块实现对自然语言描述的即兴任务的理解与定位,使移动建筑机器人能自主完成非预定义任务。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 14 篇

2603.23272 2026-03-25 cs.CV cs.MM 84%

Multi-Modal Image Fusion via Intervention-Stable Feature Learning

多模态图像融合 via 干预稳定的特征学习

Xue Wang, Zheng Guan, Wenhua Qian, Chengchao Wang, Runzhuo Ma

机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院) School of Artificial Intelligence, Nanyang Normal University(南阳师范学院人工智能学院) Department of Electrical and Electronic Engineering, Hong Kong Polytechnic University(香港理工大学电子与电气工程系)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出基于因果原则的干预框架,通过三种干预策略探索模态关系,设计因果特征整合器捕捉稳健的模态依赖而非虚假关联。

Comments Accpted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23276 2026-03-25 cs.CV 83%

CCF: Complementary Collaborative Fusion for Domain Generalized Multi-Modal 3D Object Detection

CCF:互补协作融合用于领域泛化的多模态3D目标检测

Yuchen Wu, Kun Wang, Yining Pan, Na Zhao

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出CCF方法,通过查询解耦损失、LiDAR引导深度先验和互补跨模态掩码,提升多模态3D目标检测在跨领域场景下的鲁棒性,实验表明优于现有方法且保持源域性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22852 2026-03-25 cs.CV 83%

Gau-Occ: Geometry-Completed Gaussians for Multi-Modal 3D Occupancy Prediction

Gau-Occ:用于多模态3D占用预测的几何完备高斯分布

Chengxin Lv, Yihui Li, Hongyu Yang, YunHong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,北京航空航天大学,北京,中国) School of Computer Science and Engineering, Beihang University, Beijing, China(计算机科学与工程学院,北京航空航天大学,北京,中国) School of Artificial Intelligence, Beihang University, Beijing, China(人工智能学院,北京航空航天大学,北京,中国)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 Gau-Occ通过几何完备的3D高斯分布实现多模态3D占用预测,利用LiDAR完成扩散器恢复缺失结构并融合多视角图像语义,提升空间一致性和语义区分性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20008 2026-03-25 cs.CV cs.AI 81%

Pedestrian Crossing Intention Prediction Using Multimodal Fusion Network

基于多模态融合网络的行人过街意图预测

Yuanzhe Li, Steffen Müller

机构 * Chair of Automotive Engineering, Technische Universität Berlin(柏林技术大学汽车工程系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出多模态融合网络,通过视觉和运动分支提取七种模态特征,有效整合互补信息,提升自动驾驶车辆在城市环境中对行人意图预测的准确性。

Comments 29th IAVSD International Symposium on Dynamics of Vehicles on Roads and Tracks (IAVSD 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏