arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6878 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6878 篇

2406.06777 2026-02-02 cs.CV cs.AI 81%

MolX: Enhancing Large Language Models for Molecular Understanding With A Multi-Modal Extension

MolX: 通过多模态扩展增强大型语言模型的分子理解能力

Khiem Le, Zhichun Guo, Kaiwen Dong, Xiaobao Huang, Bozhao Nan, Roshni Iyer, Xiangliang Zhang, Olaf Wiest, Wei Wang, Ting Hua, Nitesh V. Chawla

机构 * University of Notre Dame, IN, USA(诺丁汉大学) University of California, Los Angeles, CA, USA(加州大学洛杉矶分校)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 MolX通过多模态扩展提升LLM对分子的理解能力,利用SMILES和分子图提取细粒度特征,并结合分子指纹提升性能,有效提升分子相关任务表现。

Comments MLoG-GenAI@KDD'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19325 2026-01-28 cs.CV cs.AI 81%

Innovator-VL: A Multimodal Large Language Model for Scientific Discovery

Innovator-VL:一种用于科学发现的多模态大语言模型

Zichen Wen, Boxue Yang, Shuang Chen, Yaojie Zhang, Yuhang Han, Junlong Ke, Cong Wang, Yicheng Fu, Jiawang Zhao, Jiangchao Yao, Xi Fang, Zhen Wang, Henxing Cai, Lin Yao, Zhifeng Gao, Yanhui Hong, Nang Yuan, Yixuan Li, Guojiang Zhao, Haoyi Tao, Nan Wang, Han Lyu, Guolin Ke, Ning Liao, Xiaoxing Wang, Kai Chen, Zhiyu Li, Feiyu Xiong, Sihan Hu, Kun Chen, Yanfeng Wang, Weinan E, Linfeng Zhang, Linfeng Zhang

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Institute of Theoretical Physics, Chinese Academy of Sciences(中国科学院理论物理研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Innovator-VL通过高效数据选择和透明训练方法,在科学发现中实现高性能多模态模型。

Comments Innovator-VL tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18589 2026-01-27 cs.CV cs.MM 81%

AGSP-DSA: An Adaptive Graph Signal Processing Framework for Robust Multimodal Fusion with Dynamic Semantic Alignment

AGSP-DSA: 一种用于鲁棒多模态融合的自适应图信号处理框架,具有动态语义对齐

KV Karthikeya, Ashok Kumar Das, Shantanu Pal, Vivekananda Bhat K, Arun Sekar Rajasekaran

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 AGSP-DSA通过自适应图信号处理和动态语义对齐,实现鲁棒的多模态融合,提升情感分析和多媒体分类的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21885 2026-01-27 cs.CV cs.MM cs.RO 81%

Integrating Multi-Modal Sensors: A Review of Fusion Techniques for Intelligent Vehicles

多模态传感器整合:智能车辆融合技术综述

Chuheng Wei, Ziye Qin, Ziyan Zhang, Guoyuan Wu, Matthew J. Barth

机构 * College of Engineering, Center for Environmental Research and Technology, University of California at Riverside(工程学院、环境研究与技术中心、加州大学河滨分校) School of Transportation and Logistics, Southwest Jiaotong University(交通运输与物流学院、西南交通大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文综述了多传感器融合技术在自动驾驶中的应用,分析了深度学习方法、多模态数据集及新兴趋势,强调了其提升系统适应性和鲁棒性的潜力。

Comments Accepted by IEEE IV 2025

Journal ref Proceedings of the 2025 IEEE Intelligent Vehicles Symposium (IV), pp. 1817-1824, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18419 2026-01-15 cs.CV cs.AI cs.RO 81%

A Multimodal Hybrid Late-Cascade Fusion Network for Enhanced 3D Object Detection

一种多模态混合后期级联融合网络用于增强的3D物体检测

Carlo Sgaravatti, Roberto Basla, Riccardo Pieroni, Matteo Corno, Sergio M. Savaresi, Luca Magri, Giacomo Boracchi

机构 * Politecnico di Milano(米兰理工学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种多模态混合后期级联融合网络,通过结合RGB和3D激光雷达检测器,提升3D物体检测的性能,特别是在行人和自行车检测方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08399 2026-01-14 cs.LG cs.AI cs.CV 81%

Aligning by Misaligning: Boundary-aware Curriculum Learning for Multimodal Alignment

通过不一致来对齐:面向多模态对齐的边界感知课程学习

Hua Ye, Hang Ding, Siyuan Chen, Yiyang Jiang, Changyuan Zhang, Xuan Zhang

机构 * Nanjing University(南京大学) Airon Technology CO., LTD(艾润科技有限公司) Shanghai Jiao Tong University(上海交通大学) University of Bristol(布里斯托大学) The Hong Kong Polytechnic University(香港理工大学) The University of Hong Kong(香港大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出BACL方法,通过边界感知负样本采样和局部注意力损失,提升多模态对齐性能,在多个基准上取得优于CLIP的成果。

Comments 24 pages, 6 figures, 5 tables. Submitted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02924 2026-01-07 cs.CV cs.AI 81%

DCG ReID: Disentangling Collaboration and Guidance Fusion Representations for Multi-modal Vehicle Re-Identification

DCG ReID: 解构协作与指导融合表示以实现多模态车辆重识别

Aihua Zheng, Ya Gao, Shihao Li, Chenglong Li, Jin Tang

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 DCG-ReID通过解构协作与指导融合表示,解决多模态车辆重识别中模态质量分布不平衡的问题,提升多模态联合决策性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02414 2026-01-07 cs.CV cs.AI 81%

MIAR: Modality Interaction and Alignment Representation Fuison for Multimodal Emotion

MIAR: 多模态情感的模态交互与对齐表示融合

Jichao Zhu, Jun Yu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 MIAR通过模态交互与对齐表示融合,提升多模态情感识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00742 2026-01-01 cs.CV cs.AI eess.IV 81%

Zoomer: Adaptive Image Focus Optimization for Black-box MLLM

Zoomer: 为黑盒大语言模型实现自适应图像聚焦优化

Jiaxu Qian, Chendong Wang, Yifan Yang, Chaoyun Zhang, Huiqiang Jiang, Xufang Luo, Yu Kang, Qingwei Lin, Anlan Zhang, Shiqi Jiang, Ting Cao, Tianjun Mao, Suman Banerjee, Guyue Liu, Saravan Rajmohan, Dongmei Zhang, Yuqing Yang, Qi Zhang, Lili Qiu

机构 * Microsoft(微软公司) Peking University(北京大学) University of Wisconsin Madison(威斯康星大学麦迪逊分校) University of Southern California(南加州大学)

专题命中 多模态训练与对齐 :MLLM(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Zoomer通过自适应图像聚焦优化提升黑盒MLLM的多模态理解能力,显著提升准确性并减少token使用

Comments TMLR accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22878 2025-12-30 cs.CV cs.AI 81%

SwinTF3D: A Lightweight Multimodal Fusion Approach for Text-Guided 3D Medical Image Segmentation

SwinTF3D: 一种轻量级多模态融合方法用于文本引导的3D医学图像分割

Hasan Faraz Khan, Noor Fatima, Muzammil Behzad

机构 * King Fahd University of Petroleum(国王法赫德石油大学) SDAIA-KFUPM Joint Research Center for Artificial Intelligence(SDAIA-KFUPM人工智能联合研究中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 SwinTF3D通过统一视觉和语言表示,实现文本引导的3D医学图像分割,具备高效且适应性强的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22545 2025-12-30 cs.CV cs.AI 81%

Self-Rewarded Multimodal Coherent Reasoning Across Diverse Visual Domains

跨多模态领域自奖励的推理框架

Jesen Zhang, Ningyuan Liu, Kaitong Cai, Sidi Liu, Jing Yang, Ziliang Chen, Xiaofei Sun, Keze Wang

机构 * Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 SR-MCR通过自奖励机制提升多模态推理的连贯性和准确性,在视觉基准测试中取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21760 2025-12-29 cs.CV cs.AI 81%

A-QCF-Net: An Adaptive Quaternion Cross-Fusion Network for Multimodal Liver Tumor Segmentation from Unpaired Datasets

A-QCF-Net:一种自适应四元数交叉融合网络用于从无配对数据集进行多模态肝肿瘤分割

Arunkumar V, Firos V M, Senthilkumar S, Gangadharan G R

机构 * University College of Engineering, Bharathidasan Institute of Technology Campus, Anna University(安娜大学工程学院,巴拉特拉桑理工学院校区,安娜大学) National Institute of Technology(国家理工学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 A-QCF-Net通过自适应四元数交叉融合网络,实现从无配对CT和MRI数据集中的肝肿瘤分割,提升分割精度并验证模型的临床实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19512 2025-12-25 cs.CV cs.AI 81%

Anatomy-R1: Enhancing Anatomy Reasoning in Multimodal Large Language Models via Anatomical Similarity Curriculum and Group Diversity Augmentation

Anatomy-R1: 通过解剖相似性课程和群体多样性增强多模态大语言模型的解剖推理

Ziyang Song, Zelin Zang, Zuyao Chen, Xusheng Liang, Dong Yi, Jinlin Wu, Hongbin Liu, Jiebo Luo, Zhen. Lei

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Anatomy-R1通过解剖相似性课程和群体多样性增强方法提升多模态大语言模型在医学影像中的解剖推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10036 2025-12-12 cs.CV cs.AI 81%

Rethinking Normalization Strategies and Convolutional Kernels for Multimodal Image Fusion

重新思考归一化策略和卷积核在多模态图像融合中的作用

Dan He, Guofen Wang, Weisheng Li, Yucheng Shu, Wenbo Li, Lijian Yang, Yuping Huang, Feiyan Li

机构 * Chongqing University of Posts and Telecommunications(重庆邮电大学) Chongqing Normal University(重庆师范大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种改进的UNet架构,通过混合实例和组归一化以及多路径自适应融合模块,提升多模态图像融合的性能和细节保留能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08820 2025-12-10 cs.CV cs.AI 81%

Training-Free Dual Hyperbolic Adapters for Better Cross-Modal Reasoning

无需训练的双双曲适配器用于更高效的跨模态推理

Yi Zhang, Chun-Wun Cheng, Junyi He, Ke Yu, Yushun Tang, Carola-Bibiane Schönlieb, Zhihai He, Angelica I. Aviles-Rivero

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Department of Electrical and Electronic Engineering, Southern University of Science and Technology(南方科技大学电子与电气工程系) Department of Applied Mathematics and Theoretical Physics, University of Cambridge(剑桥大学应用数学与理论物理系) Yau Mathematical Sciences Center, Tsinghua University(清华大学应用数学中心)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出无需训练的双双曲适配器方法,通过双曲空间嵌入提升跨模态推理性能,实现更高效的领域泛化和少样本识别。

Comments Accepted in IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06281 2025-12-09 cs.CV cs.AI 81%

Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models

释放多模态大语言模型的内在视觉表示能力

Hengzhuang Li, Xinsong Zhang, Qiming Peng, Bin Luo, Han Hu, Dengyang Jiang, Han-Jia Ye, Teng Zhang, Hai Jin

机构 * HUST(华中科技大学) Tencent Hunyuan Research(腾讯混元研究) HKUST(香港科技大学) NJU(南京大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出LaVer框架,通过掩码图像建模提升多模态大语言模型的视觉表示能力,实验表明其在需要密集视觉能力的场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04425 2025-12-05 cs.CV cs.AI 81%

Explainable Parkinsons Disease Gait Recognition Using Multimodal RGB-D Fusion and Large Language Models

可解释的帕金森病步态识别:基于多模态RGB-D融合与大语言模型

Manar Alnaasan, Md Selim Sarowar, Sungho Kim

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于多模态RGB-D融合与大语言模型的帕金森病步态识别框架,通过增强时空表示和语言解释提高识别准确性和临床可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02055 2025-12-03 cs.CV cs.AI 81%

Leveraging AI multimodal geospatial foundation models for improved near-real-time flood mapping at a global scale

利用AI多模态地理空间基础模型实现全球范围内的改进型实时洪水制图

Mirela G. Tulbure, Julio Caineta, Mark Broich, Mollie D. Gaines, Philippe Rufin, Leon-Friedrich Thomas, Hamed Alemohammad, Jan Hemmerling, Patrick Hostert

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究利用AI多模态地理空间基础模型提升全球实时洪水制图能力,通过微调TerraMind模型并对比不同配置,展示多模态数据整合在洪水检测中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01442 2025-12-02 cs.MM cs.AI 81%

PSA-MF: Personality-Sentiment Aligned Multi-Level Fusion for Multimodal Sentiment Analysis

PSA-MF:基于人格-情感对齐的多级融合用于多模态情感分析

Heng Xie, Kang Zhu, Zhengqi Wen, Jianhua Tao, Xuefei Liu, Ruibo Fu, Changsheng Li

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI、cs.MM

AI总结 PSA-MF通过引入人格-情感对齐和多级融合方法,提升多模态情感分析的识别性能。

Comments AAAI 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01214 2025-12-02 cs.CV cs.AI 81%

M4-BLIP: Advancing Multi-Modal Media Manipulation Detection through Face-Enhanced Local Analysis

M4-BLIP:通过面部增强的局部分析推进多模态媒体篡改检测

Hang Wu, Ke Sun, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing(多媒体可信感知与高效计算重点实验室)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 M4-BLIP通过引入面部增强的局部分析,提升多模态媒体篡改检测的准确性和可解释性。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08679 2025-12-02 cs.CV cs.AI 81%

MMIF-AMIN: Adaptive Loss-Driven Multi-Scale Invertible Dense Network for Multimodal Medical Image Fusion

MMIF-AMIN: 适应性损失驱动的多尺度可逆密集网络用于多模态医学图像融合

Tao Luo, Weihua Xu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 MMIF-AMIN通过可逆密集网络和多尺度互补特征提取模块,实现多模态医学图像融合的高效融合与精准诊断。

Comments This manuscript is withdrawn to allow for substantial expansion and restructuring. Based on recent research progress, we plan to add Generalization experiment and reorganize the manuscript structure to improve readability and logical flow. Thank you for your understanding and support

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01528 2025-12-01 cs.CL cs.AI q-bio.BM 81%

Leveraging Biomolecule and Natural Language through Multi-Modal Learning: A Survey

利用生物分子和自然语言通过多模态学习:一篇综述

Qizhi Pei, Zhimeng Zhou, Kaiyuan Gao, Jinhua Zhu, Yue Wang, Zun Wang, Tao Qin, Lijun Wu, Rui Yan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Huazhong University of Science and Technology(华中科技大学) University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Shanghai AI Laboratory(上海人工智能实验室) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文综述了生物分子与自然语言多模态学习的最新进展,探讨了技术表示、多模态整合方法、应用实例及未来研究方向。

Comments 2025.11.28 Updated Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19887 2025-11-26 cs.CV cs.AI 81%

Distilling Cross-Modal Knowledge via Feature Disentanglement

通过特征解耦进行跨模态知识蒸馏

Junhong Liu, Yuan Zhang, Tao Huang, Wenchao Xu, Renyu Yang

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出频率解耦的跨模态知识蒸馏方法,通过利用频域特征解耦和平衡跨模态知识转移,提升蒸馏效果。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18824 2025-11-25 cs.CV cs.CL 81%

Assessing the alignment between infants' visual and linguistic experience using multimodal language models

利用多模态语言模型评估婴儿的视觉和语言经验一致性

Alvin Wei Ming Tan, Jane Yang, Tarun Sepuri, Khai Loong Aw, Robert Z. Sparks, Zi Yin, Virginia A. Marchman, Michael C. Frank, Bria Long

机构 * Department of Psychology, Stanford University(心理学系,斯坦福大学) Department of Psychology, University of California, San Diego(心理学系,加州大学圣地亚哥分校) Department of Psychology, Tsinghua University(心理学系,清华大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 基于多模态语言模型评估婴儿视觉与语言经验一致性,揭示日常学习中视觉与语言对齐的稀有性及跨儿童差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17965 2025-11-25 cs.CV cs.MM 81%

Signal: Selective Interaction and Global-local Alignment for Multi-Modal Object Re-Identification

信号:选择性交互与全局-局部对齐用于多模态对象重识别

Yangyang Liu, Yuhao Wang, Pingping Zhang

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.MM

AI总结 Signal通过选择性交互和全局-局部对齐框架提升多模态对象重识别的性能。

Comments Accepted by AAAI2026. More modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14169 2025-11-25 cs.CV cs.AI 81%

AdaTok: Adaptive Token Compression with Object-Aware Representations for Efficient Multimodal LLMs

AdaTok: 一种基于对象感知表示的自适应令牌压缩方法,用于高效多模态大语言模型

Xinliang Zhang, Lei Zhu, Hangzhou He, Shuang Zeng, Ourui Fu, Jiakui Hu, Zhengjian Yao, Yanye Lu

机构 * Institute of Medical Technology, Peking University Health Science Center(北京大学医学部医学技术研究所) Department of Biomedical Engineering, Peking University(北京大学生物医学工程系) National Biomedical Imaging Center, Peking University(北京大学国家生物医学成像中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 AdaTok通过自适应令牌压缩方法,利用对象感知表示提升多模态大语言模型的效率,实现高压缩比与高性能的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14969 2025-11-20 eess.AS cs.AI cs.LG eess.IV eess.SP 81%

Quality-Controlled Multimodal Emotion Recognition in Conversations with Identity-Based Transfer Learning and MAMBA Fusion

Zanxu Wang, Homayoon Beigi

机构 * Columbia University, New York, USA(哥伦比亚大学) Recognition Technologies, Inc., New York, USA(识别技术公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI、eess.AS

Comments 8 pages, 14 images, 3 tables, Recognition Technologies, Inc. Technical Report RTI-20251118-01

Journal ref Recognition Technologies, Inc. Technical Reports, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13794 2025-11-19 cs.CV cs.AI 81%

FusionFM: All-in-One Multi-Modal Image Fusion with Flow Matching

Huayi Zhu, Xiu Shu, Youqiang Xiong, Qiao Liu, Rui Chen, Di Yuan, Xiaojun Chang, Zhenyu He

机构 * Guangzhou Institute of Technology, Xidian University(广州理工大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03939 2025-11-07 cs.LG cs.AI cs.CL 81%

RLHF: A comprehensive Survey for Cultural, Multimodal and Low Latency Alignment Methods

Raghav Sharma, Manan Mehta, Sai Tiger Raina

机构 * Northeastern University(东北大学) University of Southern California(南加州大学)

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27208 2025-11-03 cs.CV cs.AI 81%

Multi-Modal Feature Fusion for Spatial Morphology Analysis of Traditional Villages via Hierarchical Graph Neural Networks

Jiaxin Zhang, Zehong Zhu, Junye Deng, Yunqin Li, and Bowen Wang

机构 * Architecture and Design College, Nanchang University(南昌大学建筑与设计学院) SANKEN, The University of Osaka(大阪大学)

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏