arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-31 至 2026-03-31 共收录 162 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 10 篇

2603.26997 2026-03-31 cs.RO cs.HC 50%

ROSClaw: An OpenClaw ROS 2 Framework for Agentic Robot Control and Interaction

ROSClaw: 一种用于代理机器人控制与交互的OpenClaw ROS 2框架

Irvin Steve Cardenas, Marcus Anthony Arnett, Natalie Catherine Yeo, Lucky Sah, Jong-Hoon Kim

机构 * Advanced Telerobotics Research Lab, Kent State University(肯特州立大学先进远程机器人研究实验室) OpenDive Technologies

专题命中 多模态Agent :multimodal(abstract)

AI总结 ROSClaw通过整合OpenClaw代理运行时与ROS 2,实现任意基础模型与ROS-enabled机器人之间的交互,支持动态能力发现、多模态观察归一化、预执行动作验证和结构化审计日志,验证了执行层设计对任务完成与安全行为的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 29 篇

2603.03192 2026-03-31 cs.CV cs.CL cs.LG 88%

MoD-DPO: Towards Mitigating Cross-modal Hallucinations in Omni LLMs using Modality Decoupled Preference Optimization

MoD-DPO:通过模态解耦偏好优化缓解多模态幻觉

Ashutosh Chaubey, Jiacheng Pang, Mohammad Soleymani

机构 * University of Southern California(南加州大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);omni-modal(abstract);multimodal foundation model(abstract)

AI总结 本文提出MoD-DPO框架,通过引入模态感知正则化项和语言先验去偏惩罚,提升多模态大模型的模态对齐能力,实验表明其在多模态幻觉基准测试中表现优异。

Comments CVPR 2026. Project Page: https://mod-dpo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26786 2026-03-31 cs.LG cs.AI 85%

A Step Toward Federated Pretraining of Multimodal Large Language Models

迈向多模态大语言模型联邦预训练的一小步

Baochen Xiong, Yifan Xu, Xiaoshan Yang, Yaguang Song, Yaowei Wang, Changsheng Xu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Pengcheng Laboratory(鹏城实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出Fed-MA任务,通过冻结视觉编码器和LLM,协同训练跨模态投影器,解决参数干扰和梯度震荡问题,提出Fed-CMP框架在联邦预训练中取得显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27693 2026-03-31 cs.CV cs.AI cs.LG cs.MA cs.MM 85%

LVRPO: Language-Visual Alignment with GRPO for Multimodal Understanding and Generation

LVRPO:基于GRPO的语言-视觉对齐用于多模态理解和生成

Shentong Mo, Sukmin Yun

机构 * Department of Machine Learning, CMU, USA(卡内基梅隆大学机器学习系,美国) Department of Machine Learning, MBZUAI, UAE(穆罕默德·本·扎耶德人工智能大学机器学习系,阿联酋) Department of Artificial Intelligence, Hanyang University ERICA, South Korea(汉阳大学ERICA校区人工智能系,韩国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出LVRPO框架,通过GRPO显式对齐语言和视觉表示,提升多模态理解和生成性能,无需辅助编码器或人工目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27993 2026-03-31 cs.CV 83%

Progressive Prompt-Guided Cross-Modal Reasoning for Referring Image Segmentation

逐步引导的跨模态推理用于指代图像分割

Jiachen Li, Hongyun Wang, Jinyu Xu, Wenbo Jiang, Yanchun Ma, Yongjian Liu, Qing Xie, Bolong Zheng

机构 * School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) University of Electronic Science and Technology of China(电子科技大学) Wuhan Vocational College of Software and Engineering(武汉软件工程职业学院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出PPCR框架,通过语义理解-空间定位-实例分割流程,改进指代图像分割中语言描述与视觉表示的连接,提升分割精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27321 2026-03-31 cs.LG cs.AI 83%

Multimodal Forecasting for Commodity Prices Using Spectrogram-Based and Time Series Representations

基于频谱和时间序列表示的商品价格多模态预测

Soyeon Park, Doohee Chung, Charmgil Hong

机构 * Impactive AI

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出SEMF方法,结合频谱和时间序列表示,提升多变量时间序列预测的准确性与鲁棒性,通过多模态融合和频谱编码在多个商品价格预测任务中优于七种基线模型。

Comments AAAI 2026 Summer Symposium Series; 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22674 2026-03-31 cs.CV 83%

VisionTrim: Unified Vision Token Compression for Training-Free MLLM Acceleration

VisionTrim: 一种用于无训练多模态大语言模型加速的统一视觉标记压缩方法

Hanxun Yu, Wentong Li, Xuan Qu, Song Wang, Junbo Chen, Jianke Zhu

机构 * State Key Lab of CAD & CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) NUAA(南京航空航天大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 多模态训练与对齐 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出VisionTrim,通过整合DVTS和TGVC模块,有效减少视觉标记,提升多模态大语言模型在高分辨率和视频场景中的计算效率。

Comments ICLR2026, Code Link: https://github.com/hanxunyu/VisionTrim

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27852 2026-03-31 quant-ph 82%

A Resource-Aligned Hybrid Quantum-Classical Framework for Multimodal Face Anti-Spoofing

一种资源对齐的混合量子-经典框架用于多模态面部防伪

Wanqi Sun, Jungang Xu, Chenghua Duan

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出一种混合MPS-VQC框架,通过结构化预量子压缩模块和量子分类器,有效处理多模态面部防伪问题,实现参数高效和资源优化。

Comments Under review at Quantum Information Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27482 2026-03-31 cs.CV cs.AI 81%

Difference Feedback: Generating Multimodal Process-Level Supervision for VLM Reinforcement Learning

差分反馈:为视觉语言模型强化学习生成多模态过程级监督

Feiding, Yongkang Zhang, Yuhao Liao, Zijian Zeng, Chunzheng Zhu, Yaozong Zheng, Yafei Liu, Yeling Peng, Youwei Wang, Sibo Wang, Huiming Yang, Linglin Liao, Shunzhi Yang

机构 * Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出差分反馈方法,通过修复错误推理轨迹自动构建token/步骤级监督掩码,实现多模态推理中的过程级视觉对齐,实验显示在MMMStar和MathVista基准上平均提升3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23153 2026-03-31 cs.CV cs.AI 81%

Efficient Encoder-Free Fourier-based 3D Large Multimodal Model

高效无编码器的基于傅里叶的3D大多模态模型

Guofeng Mei, Wei Lin, Luigi Riz, Yujiao Wu, Yiming Wang, Fabio Poiesi

机构 * Fondazione Bruno Kessler, Italy(意大利布鲁诺·凯斯勒基金会) JKU Linz, Austria(奥地利林茨约翰·开普勒大学) CSIRO, Australia(澳大利亚联邦科学与工业研究组织)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出Fase3D,一种基于傅里叶变换的无编码器3D多模态模型,通过结构化超点和空间填充曲线实现高效全局上下文建模,显著提升计算效率和参数效率。

Journal ref CVPR 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26726 2026-03-31 cs.CV cs.AI 81%

A Multimodal Deep Learning Framework for Edema Classification Using HCT and Clinical Data

一种结合头颅CT和临床数据的多模态深度学习框架用于水肿分类

Aram Ansary Ogholbake, Hannah Choi, Spencer Brandenburg, Alyssa Antuna, Zahraa Al-Sharshahi, Makayla Cox, Haseeb Ahmed, Jacqueline Frank, Nathan Millson, Luke Bauerle, Jessica Lee, David Dornbos, Qiang Cheng

机构 * University of Kentucky(肯塔基大学) Department of Computer Science, University of Kentucky(肯塔基大学计算机科学系) Department of Neurological Surgery, University of Kentucky(肯塔基大学神经外科学系) University of Kentucky College of Medicine(肯塔基大学医学院) Department of Neurology, University of Kentucky(肯塔基大学神经学系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出AttentionMixer框架,通过融合头颅CT和临床数据实现脑水肿检测,采用自监督Vision Transformer Autoencoder编码CT数据,并利用交叉注意力模块整合临床信息,最终通过MLP-Mixer提升分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28058 2026-03-31 cs.MM 79%

Is One-Shot In-Context Learning Helpful for Data Selection in Task-Specific Fine-Tuning of Multimodal LLMs?

在情境学习中选择数据是否有助于多模态大语言模型任务特定微调中的数据选择?

Xiao An, Jiaxing Sun, Ting Hu, Wei He

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出CLIPPER方法,通过情境学习选择数据,提高多模态大语言模型任务特定微调的效率,实验表明其在数据效率和计算成本上优于现有方法。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17209 2026-03-31 cs.CV 79%

Scaling Self-Supervised and Cross-Modal Pretraining for Volumetric CT Transformers

基于体素CT的自监督与跨模态预训练的扩展

Cris Claessens, Christiaan Viviers, Giacomo D'Amicantonio, Egor Bondarev, Fons van der Sommen

机构 * Eindhoven University of Technology(埃因霍温理工大学) ARIA Lab(ARIA实验室) AIMS Lab(AIMS实验室)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 SPECTRE通过可扩展的3D视觉Transformer架构和现代自监督与视觉-语言预训练策略,学习通用CT表示,克服了体素CT的极端标记扩展、几何各向异性及临床监督弱的问题,实现了大规模3D注意力计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27744 2026-03-31 cs.CV 79%

Data Organization Matters in Multimodal Instruction Tuning: A Controlled Study of Capability Trade-offs

多模态指令微调中数据组织的重要性:能力取舍的受控研究

Guowei Tang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 研究探讨了数据组织对多模态指令微调中通用理解、结构化推理和细粒度OCR文档理解能力取舍的影响,发现课程训练在整体表现和结构推理上最佳,平衡采样更利于OCR能力但削弱整体平衡。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20451 2026-03-31 cs.CL 79%

MuVaC: A Variational Causal Framework for Multimodal Sarcasm Understanding in Dialogues

MuVaC:一种用于对话中多模态讽刺理解的变分因果框架

Diandian Guo, Fangfang Yuan, Cong Cao, Xixun Lin, Chuan Zhou, Hao Peng, Yanan Cao, Yanbing Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Beihang University(北京航空航天大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出MuVaC框架,通过变分因果推理实现多模态讽刺检测与解释的联合优化,提升对话中讽刺理解的鲁棒性。

Comments 12 pages, 7 figures. Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24968 2026-03-31 cs.CV 79%

Event-based Facial Keypoint Alignment via Cross-Modal Fusion Attention and Self-Supervised Multi-Event Representation Learning

基于跨模态融合注意力和自监督多事件表征学习的事件面部关键点对齐

Donghwa Kang, Junho Kim, Dongwoo Kang

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出基于跨模态融合注意力和自监督多事件表征学习的事件面部关键点对齐框架,解决事件数据中空间信息有限和标注数据不足的问题,通过实验验证其在多个评估指标上优于现有方法。

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16216 2026-03-31 cs.AI cs.LG 74%

FlipVQA: Scaling Multi-modal Instruction Tuning via Textbook-to-Knowledge Synthesis

FlipVQA: 通过教科书到知识合成实现多模态指令微调的扩展

Zhen Hao Wong, Jingwen Deng, Yuzhao Wang, Wenkai Yu, Jihao Huang, Runming He, Chengyu Shen, Hao Liang, Wentao Zhang

机构 * Peking University(北京大学) Zhongguancun Academy(中关村学院)

专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.AI

AI总结 本文提出FlipVQA-Miner自动化流程,解决OCR文档中的长距离逻辑依赖和跨页断续问题,构建了包含83K问答对的FlipVQA-83K数据集,在保持高结构保真度的同时节省50倍成本,提升了模型推理能力和跨领域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27533 2026-03-31 cs.CV cs.AI 73%

Demo-Pose: Depth-Monocular Modality Fusion For Object Pose Estimation

Demo-Pose: 深度-单目模态融合用于物体姿态估计

Rachit Agarwal, Abhishek Joshi, Sathish Chalasani, Woo Jin Kim

机构 * Samsung Electronics Suwon, Republic of Korea(三星电子水原,韩国)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Demo-Pose,通过新颖的多模态融合策略融合单目语义特征与基于深度的图卷积表示,提升物体姿态估计的几何推理能力,在REAL275数据集上优于现有方法。

Comments Accepted at ICASSP 2026, 5 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27781 2026-03-31 cs.CV 70%

GS3LAM: Gaussian Semantic Splatting SLAM

GS3LAM: 基于高斯语义散射的SLAM

Linfei Li, Lin Zhang, Zhong Wang, Ying Shen

机构 * School of Software Engineering, Tongji University(同济大学软件工程学院) Department of Automation, Shanghai Jiaotong University(上海交通大学自动化系)

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 GS3LAM通过多模态数据融合实现实时一致的语义密集地图,采用语义高斯场和多模态误差约束联合优化,引入深度自适应尺度正则化和随机采样关键帧映射策略,提升跟踪鲁棒性和渲染质量。

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26724 2026-03-31 cs.CV cs.RO 70%

An Annotation-to-Detection Framework for Autonomous and Robust Vine Trunk Localization in the Field by Mobile Agricultural Robots

一种用于田间自主和鲁棒葡萄藤主干定位的标注到检测框架

Dimitrios Chatziparaschis, Elia Scudiero, Brent Sams, Konstantinos Karydis

机构 * Dept. of Environmental Sciences, Univ. of California, Riverside(加州大学河滨分校环境科学系) Gallo(嘉露酒庄)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种标注到检测框架,利用有限标注数据训练多模态检测器,通过跨模态标注转移和早起传感器融合,提升田间葡萄藤主干定位的鲁棒性与准确性。

Comments 7 pages, 6 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10932 2026-03-31 cs.CV cs.AI 62%

BabyVLM-V2: Toward Developmentally Grounded Pretraining and Benchmarking of Vision Foundation Models

BabyVLM-V2:迈向基于发展基础的视觉基础模型预训练与基准测试

Shengao Wang, Wenqi Wang, Zecheng Wang, Max Whitton, Michael Wakeham, Arjun Chandra, Joey Huang, Pengyue Zhu, Helen Chen, David Li, Jeffrey Li, Shawn Li, Andrew Zagula, Amy Zhao, Andrew Zhu, Sayaka Nakamura, Yuki Yamamoto, Jerry Jun Yokono, Aaron Mueller, Bryan A. Plummer, Kate Saenko, Venkatesh Saligrama, Boqing Gong

机构 * Boston University(波士顿大学) Sony Group Corporation(索尼集团公司)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 BabyVLM-V2通过纵向多维预训练集、灵活模型和DevCV工具箱,提升婴儿启发式视觉语言模型性能,实验证明其在基准测试中表现优异。

Comments Accepted to CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26735 2026-03-31 cs.CV cs.AI 62%

Distilled Large Language Model-Driven Dynamic Sparse Expert Activation Mechanism

distilled 大语言模型驱动的动态稀疏专家激活机制

Qinghui Chen, Zekai Zhang, Zaigui Zhang, Kai Zhang, Dagang Li, Wenmin Wang, Jinglin Zhang, Cong Liu

机构 * Laoshan Laboratory(崂山实验室) Jinan Inspur Data Technology Co., Ltd(济南浪潮数据技术有限公司)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出 DS-MoE 框架,通过文本引导的动态路由和轻量多尺度理解,解决跨类模糊问题,实验证明其在 PCB 等数据集上优于现有纯视觉模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28414 2026-03-31 cs.CV 57%

Unified Restoration-Perception Learning: Maritime Infrared-Visible Image Fusion and Segmentation

统一的恢复-感知学习:近岸红外-可见图像融合与分割

Weichao Cai, Weiliang Huang, Biao Xue, Chao Huang, Fei Yuan, Bob Zhang

机构 * Laboratory of Underwater Acoustic Communication and Marine Information Technology, Ministry of Education, Xiamen University(厦门大学水声通信与海洋信息技术教育部重点实验室) PAMI Research Group, Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系PAMI研究组) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络空间安全学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出IVMSD数据集和MCLF框架,通过FSEC、SVCA和跨模态注意力机制实现海洋场景的图像恢复、多模态融合和语义分割,提升复杂海洋环境下的鲁棒性和感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27481 2026-03-31 cs.LG cs.AI 57%

On Token's Dilemma: Dynamic MoE with Drift-Aware Token Assignment for Continual Learning of Large Vision Language Models

关于令牌的困境:具有漂移感知令牌分配的动态MoE用于大视觉语言模型的持续学习

Chongyang Zhao, Mingsong Li, Haodong Lu, Dong Gong

机构 * University of New South Wales (UNSW Sydney)(新南威尔士大学(悉尼新南威尔士大学))

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出LLaVA-DyMoE框架,通过动态MoE和漂移感知令牌分配缓解持续学习中的路由漂移问题,提升模型在持续学习中的性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27448 2026-03-31 cs.LG cs.AI cs.CE 57%

GIFT: Bootstrapping Image-to-CAD Program Synthesis via Geometric Feedback

GIFT: 通过几何反馈提升图像到CAD程序合成

Giorgio Giannone, Anna Clare Doris, Amin Heyrani Nobari, Kai Xu, Akash Srivastava, Faez Ahmed

机构 * DeCoDE Lab, MIT(麻省理工学院DeCoDE实验室) Core AI, IBM(IBM核心人工智能) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出GIFT框架,通过几何反馈生成高质量训练样本,提升CAD程序生成的鲁棒性,无需额外标注。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17470 2026-03-31 cs.CV 57%

PhaSR: Generalized Image Shadow Removal with Physically Aligned Priors

PhaSR:基于物理对齐先验的通用图像阴影去除

Chia-Ming Lee, Yu-Fan Lin, Yu-Jou Hsiao, Jin-Hui Jiang, Yu-Lun Liu, Chih-Chung Hsu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) National Cheng Kung University(国立成功大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 PhaSR通过双层先验对齐解决不同光照条件下阴影去除问题,结合物理对齐归一化和几何-语义校正注意力,提升单光源到多源环境的鲁棒性,实验显示其在复杂光照下表现优异。

Comments CVPR 2026 Camera Ready; Project Page: https://ming053l.github.io/PhaSR_github

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26751 2026-03-31 cs.CV 57%

Survey on Remote Sensing Scene Classification: From Traditional Methods to Large Generative AI Models

遥感场景分类综述:从传统方法到大生成AI模型

Qionghao Huang, Can Hu

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 综述探讨了遥感场景分类从传统方法到大生成AI模型的演变,涵盖深度学习和生成AI的核心方法及最新进展,强调了自监督基础模型和多模态数据融合的挑战与未来方向。

Comments Accepted in Journal of King Saud University Computer and Information Sciences

Journal ref Journal of King Saud University Computer and Information Sciences, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28529 2026-03-31 eess.SY cs.SY 50%

Intelligent Radio Resource Slicing for 6G In-Body Subnetworks

面向6G体内子网络的智能无线电资源切片

Samira Abdelrahman, Hossam Farag

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本文提出基于SAC算法的智能资源切片策略,解决IBS与eMBB用户共存问题,通过优化奖励函数提升用户体验并保障服务质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27672 2026-03-31 stat.ML cs.LG 50%

Energy Score-Guided Neural Gaussian Mixture Model for Predictive Uncertainty Quantification

基于能量分数的神经高斯混合模型用于预测不确定性量化

Yang Yang, Chunlin Ji, Haoyang Li, Ke Deng

机构 * Kuang-Chi Institute of Advanced Technology(光启高等理工研究院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出NE-GMM模型,结合高斯混合模型与能量分数,提升预测不确定性量化能力,通过理论证明和实验验证其有效性。

Comments 39 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26799 2026-03-31 cs.LG 50%

Gaussian Joint Embeddings For Self-Supervised Representation Learning

高斯联合嵌入用于自监督表示学习

Yongchao Huang

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出基于生成联合建模的高斯联合嵌入(GJE)和其多模态扩展GMJE,通过联合密度建模替代黑盒预测,实现对潜在空间几何的控制,并解决传统方法在多模态逆问题中的局限性。

Comments 92 pages

详情

展开后加载摘要…

URL PDF HTML 收藏