arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-17 至 2026-03-17 共收录 199 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 8 篇

2602.14540 2026-03-17 cs.RO 78%

Multimodal Belief-Space Covariance Steering with Active Probing and Influence for Interactive Driving

多模态信念空间协方差操控与主动探测及影响的交互驾驶

Devodita Chakravarty, John Dolan, Yiwei Lyu

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本文提出一种多模态信念空间协方差操控方法,通过主动探测和影响策略,在交互驾驶中提升安全性和决策效率。

Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15039 2026-03-17 cs.CV 70%

GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents

GUI-CEval: 一种用于移动GUI代理的分层和全面的中文基准

Yang Li, Yuchen Liu, Haoyu Lu, Zhiqiang Xia, Hongzhen Wang, Kaiyang Han, Changpeng Yang, Jinyang Wu, Jiaming Xu, Runyu Shi, Ying Huang

机构 * HyperAI Team, Xiaomi Corporation(HyperAI团队,小米公司)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出GUI-CEval,首个针对中文移动GUI代理的全面基准,涵盖201款主流应用,通过分层结构评估感知、规划、反思、执行和评估五方面能力,验证模型在真实交互中的表现。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14448 2026-03-17 cs.LG 67%

Zoom to Essence: Trainless GUI Grounding by Inferring upon Interface Elements

聚焦本质:通过推断界面元素实现无训练GUI接地

Ziwei Liu, Tao Feng, Borui Kang, Yanbing Yang, Jun Luo

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract)

AI总结 本文提出ZoomUI,通过推断界面元素实现无训练GUI接地,利用推理缩放引导常见MLLM逐步锚定指令元素到更详细的界面元素,提升GUI代理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13710 2026-03-17 cs.AI 57%

InterventionLens: A Multi-Agent Framework for Detecting ASD Intervention Strategies in Parent-Child Shared Reading

InterventionLens:一种多智能体框架,用于检测自闭症干预策略在父母-儿童共读中的应用

Xiao Wang, Lu Dong, Ifeoma Nwogu, Srirangaraj Setlur, Venu Govindaraju

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出InterventionLens,一种多智能体系统,用于自动检测和时间分割共读视频中的护理人员干预策略,实验表明其在ASD-HI数据集上的F1分数达到79.44%,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08478 2026-03-17 cs.RO cs.LG 50%

STRIDE: Structured Lagrangian and Stochastic Residual Dynamics via Flow Matching

STRIDE: 通过流匹配实现结构化拉格朗日和随机残差动力学

Prakrut Kotecha, Ganga Nair B, Shishir Kolathaya

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出STRIDE框架,结合拉格朗日神经网络与条件流匹配,分离保守刚体动力学与非保守随机交互效应,提升机器人在不确定环境中的预测精度与控制可靠性。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13840 2026-03-17 cs.MA 50%

ClimateAgents: A Multi-Agent Research Assistant for Social-Climate Dynamics Analysis

ClimateAgents: 一种用于社会-气候动态分析的多智能体研究助手

Shan Shan

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出ClimateAgents,一种多智能体研究助手,通过整合多模态数据检索、统计建模和自动推理,帮助研究者探索社会-环境动态,提升气候分析的适应性和解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 31 篇

2602.11656 2026-03-17 cs.CV cs.AI cs.RO 84%

SToRM: Supervised Token Reduction for Multi-modal LLMs toward efficient end-to-end autonomous driving

SToRM:面向高效端到端自动驾驶的多模态大语言模型监督令牌缩减

Seo Hyun Kim, Jin Bok Park, Do Yeon Koo, Hogun Park, Il Yong Chun

专题命中 多模态训练与对齐 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SToRM框架,通过监督令牌缩减方法在保持性能的同时降低计算成本,实现实时端到端自动驾驶。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14132 2026-03-17 cs.CV cs.LG 83%

DualSwinFusionSeg: Multimodal Martian Landslide Segmentation via Dual Swin Transformer with Multi-Scale Fusion and UNet++

DualSwinFusionSeg: 多模态火星滑坡分割 via 双Swin Transformer 与多尺度融合及UNet++

Shahriar Kabir, Abdullah Muhammed Amimul Ehsan, Istiak Ahmmed Rifti, Md Kaykobad Reza

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出DualSwinFusionSeg,通过双Swin Transformer与多尺度融合及UNet++实现多模态火星滑坡分割,验证了在有限标注数据下提升分割精度的效果。

Comments 10 pages, 2 Figures, 12 Tables. Code is available at: https://github.com/amimulamim/Mars-LS-Segmentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13719 2026-03-17 cs.CV 83%

Sparse-Dense Mixture of Experts Adapter for Multi-Modal Tracking

稀疏-密集专家混合适配器用于多模态跟踪

Yabin Zhu, Jianqi Li, Chenglong Li, Jiaxiang Wang, Chengjie Gu, Jin Tang

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出稀疏-密集专家混合适配器框架,通过稀疏MoE和密集共享MoE有效建模多模态特征,结合Gram基于语义对齐超图融合模块,提升多模态跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13272 2026-03-17 cs.LG cs.AI 83%

CAMEL-CLIP: Channel-aware Multimodal Electroencephalography-text Alignment for Generalizable Brain Foundation Models

CAMEL-CLIP:面向通用脑基础模型的通道感知多模态EEG-文本对齐

Hanseul Choi, Jinyeong Park, Seongwon Jin, Sungho Park, Jibum Kim

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Incheon National University(庆尚国立大学) Department of Artificial Intelligence(人工智能系) Inha University(Inha大学) Center for Brain-Machine Interface(脑机接口中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 CAMEL-CLIP通过通道属性位置编码、动态通道投影和双级对比学习,提升EEG-文本多模态基础模型在通道异质性下的鲁棒性,实验表明其在线性探测中表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15168 2026-03-17 cs.CV cs.AI 81%

Multimodal Connectome Fusion via Cross-Attention for Autism Spectrum Disorder Classification Using Graph Learning

通过交叉注意力进行多模态连接组融合用于自闭症谱系障碍分类的图学习

Ansar Rahman, Hassan Shojaee-Mend, Sepideh Hatamikia

机构 * Department of Medicine, Danube Private University (DPU)(丹ube私人大学医学系) Department of Medical Physics and Biomedical Engineering, Medical University of Vienna(维也纳医学大学医学物理与生物医学工程系) Department of Medical Informatics, Faculty of Medicine, Gonabad University of Medical Sciences(戈纳巴德医学院医学信息学系) Austrian Center for Medical Innovation and Technology (ACMIT)(奥地利医学创新与技术中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多模态图学习框架,通过交叉注意力机制融合功能和结构影像数据,提升自闭症谱系障碍分类的准确率。

Comments 29 Pages; 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14976 2026-03-17 cs.MM cs.CV 81%

Anchoring Emotions in Text: Robust Multimodal Fusion for Mimicry Intensity Estimation

在文本中锚定情绪:用于模仿强度估计的鲁棒多模态融合

Lingsi Zhu, Yuefeng Zou, Yunxiang Zhang, Naixiang Zheng, Guoyuan Wang, Jun Yu, Jiaen Liang, Wei Huang, Shengping Liu, Ximin Zheng

机构 * University of Science and Technology of China(中国科学技术大学) Unisound AI Technology Co., Ltd.(Unisound人工智能科技有限公司) Pingan Technology Co., Ltd.(平安科技有限公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出TAEMI框架,通过文本锚定机制融合多模态数据,提升在噪声和缺失数据下的情绪模仿强度估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14891 2026-03-17 cs.CL cs.AI 81%

Decision-Level Ordinal Modeling for Multimodal Essay Scoring with Large Language Models

基于大语言模型的多模态作文评分的决策级序数建模

Han Zhang, Jiamin Su, Li liu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出DLOM方法,通过显式序数决策提升多模态作文评分的准确性,DLOM-GF和DLOM-DA分别引入门控融合模块和距离感知正则化项,实验表明在多模态和纯文本评分任务中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14189 2026-03-17 cs.CV cs.AI 81%

Walking Further: Semantic-aware Multimodal Gait Recognition Under Long-Range Conditions

行走更远:基于语义的多模态步态识别在远距离条件下的应用

Zhiyang Lu, Wen Jiang, Tianren Wu, Zhichao Wang, Changwang Zhang, Siqi Shen, Ming Cheng

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出LRGait基准和EMGaitNet框架,通过语义引导融合和跨模态对齐提升远距离步态识别性能,验证了方法的有效性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18652 2026-03-17 cs.CL 80%

PolyFrame at MWE-2026 AdMIRe 2: When Words Are Not Enough: Multimodal Idiom Disambiguation

PolyFrame在MWE-2026 AdMIRe 2:当词语不够时:多模态成语消歧

Nina Hosseini-Kivanani

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出PolyFrame系统,通过统一管道处理图像+文本排名和纯文本描述排名任务,利用轻量模块提升多语言成语消歧性能,无需微调大模型。

Comments Accepted at AdMIRe 2 shared task (Advancing Multimodal Idiomaticity Representation) colocated with 22nd Workshop on Multiword Expressions (MWE 2026) @EACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15100 2026-03-17 cs.CV 79%

Learning from Limited and Incomplete Data: A Multimodal Framework for Predicting Pathological Response in NSCLC

从有限和不完整数据中学习:一种多模态框架用于预测非小细胞肺癌的病理反应

Alice Natalina Caragliano, Giulia Farina, Fatih Aksu, Camillo Maria Caruso, Claudia Tacconi, Carlo Greco, Lorenzo Nibid, Edy Ippolito, Michele Fiore, Giuseppe Perrone, Sara Ramella, Paolo Soda, Valerio Guarrasi

机构 * Department of Medicine and Surgery(医学与外科系) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering(诊断与介入系,放射物理,生物医学工程) Umeå University, Umeå, Sweden(乌梅大学,瑞典)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态深度学习框架,整合基础模型的CT特征提取与缺失感知架构,以在有限数据和不完整临床资料下准确预测NSCLC的病理反应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13298 2026-03-17 cs.LG cs.AI 79%

FusionCast: Enhancing Precipitation Nowcasting with Asymmetric Cross-Modal Fusion and Future Radar Priors

FusionCast: 通过不对称跨模态融合和未来雷达先验增强降水现在预报

Henan Wang, Shengwu Xiong, Yifang Zhang, Wenjie Yin, Chen Zhou, Yuqiang Zhang, Pengfei Duan

机构 * School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) School of Earth and Space Science and Technology, Wuhan University(武汉大学地球和空间科学与技术学院)

专题命中 多模态训练与对齐 :cross-modal(title);multimodal(abstract);分类 cs.AI

AI总结 本文提出FusionCast框架,结合历史雷达QPE、PWV数据和预测雷达QPE,通过不对称融合和未来先验提升降水现在预报精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13291 2026-03-17 cs.LG cs.AI 79%

FedUAF: Uncertainty-Aware Fusion with Reliability-Guided Aggregation for Multimodal Federated Sentiment Analysis

FedUAF: 基于不确定性融合与可靠性引导聚合的多模态联邦情感分析

Xianxun Zhu, Zezhong Sun, Imad Rida, Erik Cambria, Junqi Su, Rui Wang, Hui Chen

机构 * Shanghai University(上海大学) North China Electric Power University(华北电力大学) Université de Technologie de Compiègne(法国图卢兹国立理工学院) Nanyang Technological University(南洋理工大学) City University of Hong Kong(香港城市大学) Macquarie University(麦考瑞大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出FedUAF框架,通过不确定性融合和可靠性引导聚合解决联邦学习中多模态数据缺失、分布异质和客户端更新不可靠的问题,实验证明其在CMU-MOSI和CMU-MOSEI数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15004 2026-03-17 cs.SE 78%

TriFusion-LLM: Prior-Guided Multimodal Fusion with LLM Arbitration for Fine-grained Code Clone Detection

TriFusion-LLM:基于LLM仲裁的先验引导多模态融合用于细粒度代码克隆检测

Mengdi Li, Yuming Liu, He Wang, Zifeng Xu, Yuqing Zhang

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出TriFusion-LLM框架,结合传统机器学习的启发式相似性先验、AST结构信号和CodeBERT语义嵌入,提升细粒度代码克隆检测的分类性能,实验表明其在BigCloneBench上将Macro-F1提升至0.875。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12192 2026-03-17 physics.optics 78%

Multimodal Fusion Network for Micro-displacement Measurement via Michelson Interferometer

用于迈克尔逊干涉仪的多模融合网络微位移测量

Zixing Jia, Jiawei Li, Ziping Chen, Xin Li

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出一种多模融合网络用于高精度微位移测量,通过引入双头学习机制解决半波位移模糊问题,实现高精度位移和整数干涉阶分类,具备实时性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14493 2026-03-17 cs.CV cs.CL cs.LG 73%

Fine-tuning MLLMs Without Forgetting Is Easier Than You Think

对多模态大语言模型进行微调而不遗忘比你想象的更容易

He Li, Yuhui Zhang, Xiaohan Wang, Kaifeng Lyu, Serena Yeung-Levy

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 本文通过实验框架展示,简单调整微调方法可缓解灾难性遗忘,提出数据混合训练策略解决特定任务过拟合问题,并证明该方法可扩展至持续学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17741 2026-03-17 cs.CV 70%

Reasoning to Attend: Try to Understand How <SEG> Token Works

推理以关注:尝试理解<SEG>标记的作用

Rui Qian, Xin Yin, Dejing Dou

专题命中 多模态训练与对齐 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文研究了<SEG>标记在多模态模型中的作用,通过可视化相似性图揭示其在图像-文本对中的语义相似性贡献,并提出READ方法提升模型的推理能力。

Comments This work has been accepted to CVPR 2025, please refer to https://github.com/rui-qian/READ

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13292 2026-03-17 cs.LG cs.AI 70%

Pragma-VL: Towards a Pragmatic Arbitration of Safety and Helpfulness in MLLMs

Pragma-VL:迈向多模态大语言模型中安全与助人的务实仲裁

Ming Wen, Kun Yang, Xin Chen, Jingyu Zhang, Dingding Han, Shiwen Cui, Yuedong Xu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团) Zhejiang University(浙江大学) UCLA(加州大学洛杉矶分校) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 Pragma-VL通过引入一种端到端的对齐算法,解决了多模态大语言模型在安全与助人之间的平衡问题,通过增强视觉风险感知和理论保证的奖励模型,在多数多模态安全基准上提升了性能。

Comments 31 pages, ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14214 2026-03-17 cs.CV cs.AI 62%

UniFusion: A Unified Image Fusion Framework with Robust Representation and Source-Aware Preservation

UniFusion:一种具有鲁棒表示和源感知保留的统一图像融合框架

Xingyuan Li, Songcheng Du, Yang Zou, HaoYuan Xu, Zhiying Jiang, Jinyuan Liu

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 UniFusion通过统一框架实现跨任务泛化,利用DINOv3提取模态一致特征,引入重建对齐损失保持源信息一致性,并采用双层优化策略平衡重建与融合目标,提升融合质量与泛化能力。

Comments 11 pages, 8 figures, published to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13366 2026-03-17 cs.CV cs.AI 62%

Thinking in Uncertainty: Mitigating Hallucinations in MLRMs with Latent Entropy-Aware Decoding

在不确定性中思考:通过潜在熵感知解码减轻MLRMs中的幻觉

Zhongxing Xu, Zhonghua Wang, Zhe Qian, Dachuan Shi, Feilong Tang, Ming Hu, Shiyan Su, Xiaocheng Zou, Wei Feng, Dwarikanath Mahapatra, Yifan Peng, Mingquan Lin, Zongyuan Ge

机构 * Monash University(墨尔本大学) Georgia Tech(佐治亚理工学院) Cornell University(康奈尔大学) Northeastern University(东北大学) Khalifa University(卡利法大学) University of Minnesota(明尼苏达大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过潜在熵感知解码策略减轻多模态大推理模型中的幻觉问题,利用语义上下文增强推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13335 2026-03-17 cs.CV cs.AI 62%

Information-Theoretic Constraints for Continual Vision-Language-Action Alignment

信息论视角下的持续视觉-语言-动作对齐约束

Libang Zhao, Qixin Zeng, Hongyin Zhang, Donglin Wang

机构 * Westlake University, China(西湖大学) University of Southampton, UK(南安普顿大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Info-VLA框架,通过两个互补约束保持跨模态信息结构,解决持续学习中视觉语言动作对齐退化问题,实验表明其在任务保持与适应性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15452 2026-03-17 cs.AI 57%

Unlocking the Value of Text: Event-Driven Reasoning and Multi-Level Alignment for Time Series Forecasting

释放文本价值:基于事件驱动推理和多级对齐的时间序列预测

Siyuan Wang, Peng Chen, Yihang Wang, Wanghui Qiu, Chenjuan Guo, Bin Yang, Yang Shu

机构 * East China Normal University(华东师范大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出VoT方法,结合事件驱动推理和多级对齐,利用文本信息提升时间序列预测性能,通过历史上下文学习和自适应频率融合实现文本与数值预测的互补。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14892 2026-03-17 cs.CV 57%

Balancing Saliency and Coverage: Semantic Prominence-Aware Budgeting for Visual Token Compression in VLMs

平衡显著性与覆盖:面向视觉令牌压缩的语义显著性感知预算分配

Jaehoon Lee, Mingi Jung, Soohyuk Jang, Seungryong Yoo, Dahuin Jung, Sungroh Yoon

机构 * Interdisciplinary Program in AI, Seoul National University(首尔国立大学人工智能跨学科项目) Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电子与计算机工程系) Department of Artificial Intelligence, Chung-Ang University(成均馆大学人工智能系)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出PromPrune框架,通过语义显著性感知预算分配和两阶段选择流程,在视觉令牌压缩中平衡局部显著性保留与全局覆盖,提升性能并减少计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14822 2026-03-17 cs.CV 57%

RadarXFormer: Robust Object Detection via Cross-Dimension Fusion of 4D Radar Spectra and Images for Autonomous Driving

RadarXFormer: 通过4D雷达光谱与图像的跨维度融合实现稳健的目标检测用于自动驾驶

Yue Sun, Yeqiang Qian, Zhe Wang, Tianhui Li, Chunxiang Wang, Ming Yang

机构 * Global Institute of Future Technology, Shanghai Jiao Tong University(上海交通大学未来技术全球研究院) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Key Laboratory of System Control and Information Processing, Ministry of Education of China(中国教育部系统控制与信息处理重点实验室) SAIC GM Wuling Automobile Company Co., Ltd.(上汽通用五菱汽车有限公司) Guangxi Laboratory of New Energy Automobile(广西新能源汽车实验室)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出RadarXFormer框架,通过融合4D雷达光谱与RGB图像的跨维度信息,提升自动驾驶中的目标检测鲁棒性和准确性,同时保持实时推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14086 2026-03-17 cs.CV 57%

Effective Feature Learning for 3D Medical Registration via Domain-Specialized DINO Pretraining

通过领域专用DINO预训练实现有效的3D医学图像特征学习

Eytan Kats, Mattias P. Heinrich

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文通过领域专用DINO预训练学习3D医学图像密集体积分量特征,提升变形匹配性能,在跨患者腹部注册任务中优于自然图像预训练模型。

Comments Accepted for International Symposium on Biomedical Imaging 2026 (ISBI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏