arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6878 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6878 篇

2508.07833 2026-04-08 cs.CV 79%

MIMIC: Multimodal Inversion for Model Interpretation and Conceptualization

MIMIC:多模态逆向用于模型解释与概念化

Animesh Jain, Alexandros Stergiou

机构 * University of Twente(特温特大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MIMIC框架,通过逆向处理多模态模型内部编码,提升模型可解释性与概念化能力,采用联合逆向与特征对齐目标,结合三种正则化器提升空间对齐、图像平滑与语义真实度。

Comments Accepted at CVPRw 2026 - How Do Vision Models Work? (HOW) Workshop, Project page: https://anaekin.github.io/MIMIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04797 2026-04-07 cs.CV cs.LG 79%

Multi-Modal Sensor Fusion using Hybrid Attention for Autonomous Driving

多模态传感器融合使用混合注意力用于自动驾驶

Mayank Mayank, Bharanidhar Duraisamy, Florian Geiß, Abhinav Valada

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) University of Freiburg(弗莱堡大学)

专题命中 多模态训练与对齐 :multi-modal(title);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MMF-BEV框架,通过变形注意力实现雷达与摄像头BEV融合,通过传感器贡献分析验证传感器互补性,并在VoD数据集上优于单模态基线。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04496 2026-04-07 cs.CV 79%

The Indra Representation Hypothesis for Multimodal Alignment

多模态对齐的Indra表示假说

Jianglin Lu, Hailing Wang, Kuo Yang, Yitian Zhang, Simon Jenni, Yun Fu

机构 * Northeastern University(东北大学) Adobe Research(Adobe研究院)

专题命中 多模态训练与对齐 :multimodal(title);cross-modal(abstract);分类 cs.CV

AI总结 本文提出Indra表示假说,通过范畴论中的V富化Yoneda嵌入,定义样本间关系轮廓,提升多模态对齐的鲁棒性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04488 2026-04-07 cs.CV cs.LG 79%

A Patch-based Cross-view Regularized Framework for Backdoor Defense in Multimodal Large Language Models

基于补丁的跨视图正则化框架用于多模态大语言模型中的后门防御

Tianmeng Fang, Yong Wang, Zetai Kong, Zengzhen Su, Jun Wang, Chengjin Yu, Wei Wang

机构 * Singapore Management University(新加坡管理大学) China University of Mining and Technology(中国矿业大学) The University of Melbourne(墨尔本大学) Anhui University(安徽大学) Xi’an Jiaotong University(西安交通大学) Sun Yat-sen University(中山大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种基于补丁增强和跨视图正则化的统一后门防御框架,通过约束特征表示和输出分布层面的异常行为,有效降低后门攻击成功率并保持正常生成能力。

Comments 26 pages, 3 figures. Subjects: Machine Learning (cs.LG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17514 2026-04-07 cs.CV 79%

EI: Early Intervention for Multimodal Imaging based Disease Recognition

EI:基于多模态影像的疾病识别早期干预

Qijie Wei, Hailan Lin, Xirong Li

机构 * Renmin University of China(中国人民大学) Beijing Key Laboratory for Intelligent Diagnosis of Fundus Diseases and Drug-Device R&D and Translation(眼底疾病智能诊断与药械研发转化北京市重点实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出EI框架,通过早期干预提升多模态影像疾病识别性能,引入MoR方法优化Vision Foundation Models适应,验证了在三个公开数据集上的有效性。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01924 2026-04-03 cs.CL 79%

Is Clinical Text Enough? A Multimodal Study on Mortality Prediction in Heart Failure Patients

临床文本足够吗?关于心力衰竭患者死亡预测的多模态研究

Oumaima El Khettari, Virgile Barthet, Guillaume Hocquet, Joconde Weller, Emmanuel Morin, Pierre Zweigenbaum

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 本研究比较了文本、结构化数据和多模态方法在心力衰竭患者短期死亡预测中的表现,发现实体层面的表示能提升预测性能,而监督多模态融合表现最佳。

Comments Accepted in LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01184 2026-04-02 cs.CV 79%

Object Affordance Recognition and Grounding via Multi-scale Cross-modal Representation Learning

基于多尺度跨模态表示学习的对象 affordance 识别与定位

Xinhang Wan, Dongqiang Gou, Xinwang Liu, En Zhu, Xuming He

机构 * National University of Defense Technology(国防科技大学) ShanghaiTech University(上海科技大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种新的方法,通过学习 affordance 意识的 3D 表示和分阶段推理策略,解决对象 affordance 定位与分类任务中的依赖关系建模问题,提升识别效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05537 2026-04-02 cs.CV eess.IV 79%

Sketch It Out: Exploring Label-Free Structural Cues for Multimodal Gait Recognition

Sketch It Out: 探索无标签的结构线索用于多模态步态识别

Chao Zhang, Zhuang Zheng, Ruixin Li, Zhanyong Mei

机构 * Chengdu University of Technology(成都理工大学)

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 本文提出SKETCH作为新的步态识别模态,通过无标签的结构线索提升多模态步态识别性能,实验表明其在SUSTech1K和CCPG数据集上取得优异效果。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24680 2026-04-01 cs.CV 79%

ReDiPrune: Relevance-Diversity Pre-Projection Token Pruning for Efficient Multimodal LLMs

ReDiPrune:基于相关性与多样性的预投影令牌剪枝用于高效的多模态大语言模型

An Yu, Ting Yu Tsai, Zhenfei Zhang, Weiheng Lu, Felix X. -F. Ye, Ming-Ching Chang

机构 * University at Albany, SUNY(纽约州立大学奥尔巴尼分校) Peking University(北京大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 ReDiPrune是一种无需训练的预投影令牌剪枝方法,通过选择信息丰富的视觉令牌提升多模态大语言模型的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22779 2026-04-01 cs.IR cs.AI cs.LG 79%

KARMA: Knowledge-Action Regularized Multimodal Alignment for Personalized Search at Taobao

KARMA:面向淘宝个性化搜索的知识-行动正则化多模态对齐

Zhi Sun, Wenming Zhang, Yi Wei, Liren Yu, Zhixuan Zhang, Dan Ou, Haihong Tang

机构 * Taobao \& Tmall Group of Alibaba Hangzhou China Taobao \& Tmall Group of Alibaba

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 KARMA通过知识-行动正则化多模态对齐框架,解决个性化搜索中知识与行动冲突问题,提升语义可解性与行动指标,实现GMV增长。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19910 2026-04-01 cs.CV 79%

Multi-Modal Representation Learning via Semi-Supervised Rate Reduction for Generalized Category Discovery

通过半监督率减少实现多模态表示学习的通用类别发现

Wei He, Xianghan Meng, Zhiyuan Huang, Xianbiao Qi, Rong Xiao, Chun-Guang Li

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Intellifusion Inc., Shenzhen, P.R. China(深圳云天励飞技术股份有限公司)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出SSR²-GCD框架,通过半监督率减少实现多模态表示学习,提升通用类别发现任务的结构属性和知识迁移能力。

Comments 15 pages, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28058 2026-03-31 cs.MM 79%

Is One-Shot In-Context Learning Helpful for Data Selection in Task-Specific Fine-Tuning of Multimodal LLMs?

在情境学习中选择数据是否有助于多模态大语言模型任务特定微调中的数据选择?

Xiao An, Jiaxing Sun, Ting Hu, Wei He

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出CLIPPER方法,通过情境学习选择数据,提高多模态大语言模型任务特定微调的效率,实验表明其在数据效率和计算成本上优于现有方法。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17209 2026-03-31 cs.CV 79%

Scaling Self-Supervised and Cross-Modal Pretraining for Volumetric CT Transformers

基于体素CT的自监督与跨模态预训练的扩展

Cris Claessens, Christiaan Viviers, Giacomo D'Amicantonio, Egor Bondarev, Fons van der Sommen

机构 * Eindhoven University of Technology(埃因霍温理工大学) ARIA Lab(ARIA实验室) AIMS Lab(AIMS实验室)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 SPECTRE通过可扩展的3D视觉Transformer架构和现代自监督与视觉-语言预训练策略,学习通用CT表示,克服了体素CT的极端标记扩展、几何各向异性及临床监督弱的问题,实现了大规模3D注意力计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27744 2026-03-31 cs.CV 79%

Data Organization Matters in Multimodal Instruction Tuning: A Controlled Study of Capability Trade-offs

多模态指令微调中数据组织的重要性:能力取舍的受控研究

Guowei Tang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 研究探讨了数据组织对多模态指令微调中通用理解、结构化推理和细粒度OCR文档理解能力取舍的影响,发现课程训练在整体表现和结构推理上最佳,平衡采样更利于OCR能力但削弱整体平衡。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20451 2026-03-31 cs.CL 79%

MuVaC: A Variational Causal Framework for Multimodal Sarcasm Understanding in Dialogues

MuVaC:一种用于对话中多模态讽刺理解的变分因果框架

Diandian Guo, Fangfang Yuan, Cong Cao, Xixun Lin, Chuan Zhou, Hao Peng, Yanan Cao, Yanbing Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Beihang University(北京航空航天大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出MuVaC框架,通过变分因果推理实现多模态讽刺检测与解释的联合优化,提升对话中讽刺理解的鲁棒性。

Comments 12 pages, 7 figures. Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24968 2026-03-31 cs.CV 79%

Event-based Facial Keypoint Alignment via Cross-Modal Fusion Attention and Self-Supervised Multi-Event Representation Learning

基于跨模态融合注意力和自监督多事件表征学习的事件面部关键点对齐

Donghwa Kang, Junho Kim, Dongwoo Kang

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出基于跨模态融合注意力和自监督多事件表征学习的事件面部关键点对齐框架,解决事件数据中空间信息有限和标注数据不足的问题,通过实验验证其在多个评估指标上优于现有方法。

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26393 2026-03-30 eess.IV cs.CV 79%

Adapting Frozen Mono-modal Backbones for Multi-modal Registration via Contrast-Agnostic Instance Optimization

通过对比无关实例优化适应冻结的单模背骨以实现多模注册

Yi Zhang, Yidong Zhao, Qian Tao

机构 * Department of Imaging Physics, Delft University of Technology, The Netherlands(荷兰代尔夫特理工大学成像物理系)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种结合冻结预训练单模注册模型与轻量级适应流程的多模图像注册框架,通过对比无关的表示生成与优化模块在测试时桥接模态与领域差距,提升注册鲁棒性。

Comments MICCAI Learn2Reg Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26126 2026-03-30 cs.CV 79%

Beyond Where to Look: Trajectory-Guided Reinforcement Learning for Multimodal RLVR

超越寻找范围:用于多模态RLVR的轨迹引导强化学习

Jinda Lu, Junkang Wu, Jinghan Li, Kexin Huang, Shuo Yang, Mingzhu Chen, Jiancan Wu, Kuien Liu, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Pecking University(北京大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出轨迹引导强化学习(TGRL),通过专家推理轨迹引导策略模型整合视觉证据进行精细推理,提升多模态推理性能,弥合视觉感知与逻辑推理间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12760 2026-03-30 cs.CV 79%

HIFICL: High-Fidelity In-Context Learning for Multimodal Tasks

HIFICL:多模态任务的高保真上下文学习

Xiaoyu Li, Yuhang Liu, Xuanshuo Kang, Zheng Luo, Fangqi Lou, Xiaohua Wu, Zihan Xiong

机构 * University of Electronic Science and Technology of China(电子科技大学) Institute of Electronics and Information Industry Technology of Kashgar(喀什电子信息产业技术研究院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 HIFICL通过引入虚拟键值对、低秩分解和端到端训练目标,改进多模态任务的上下文学习机制,实验表明其在多个基准上优于现有近似方法。

Comments Accepted to CVPR 2026. Code available at https://github.com/bbbandari/HiFICL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12944 2026-03-30 cs.CV 79%

AMFD: Distillation via Adaptive Multimodal Fusion for Multispectral Pedestrian Detection

AMFD:基于自适应多模态融合的多光谱行人检测知识蒸馏

Zizhao Chen, Yeqiang Qian, Xiaoxiao Yang, Chunxiang Wang, Ming Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Key Laboratory of System Control and Information Processing, Ministry of Education of China(系统控制与信息处理教育部重点实验室)

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 本文提出AMFD框架,通过自适应多模态融合模块有效利用教师网络的原始模态特征,提升学生网络性能,实验表明其在减少漏检率和提升平均精度方面优于现有方法。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25963 2026-03-30 cs.CV 79%

BEVMAPMATCH: Multimodal BEV Neural Map Matching for Robust Re-Localization of Autonomous Vehicles

BEVMapMatch:多模态鸟瞰神经地图匹配用于自动驾驶车辆的鲁棒重定位

Shounak Sural, Ragunathan Rajkumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出BEVMapMatch框架,利用多模态传感器融合生成鸟瞰图分割,通过交叉注意力机制检索地图片段,实现无需GNSS的鲁棒重定位,实验表明其在GNSS受限环境下的召回率显著提升。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25573 2026-03-27 cs.CV cs.LG 79%

Hierarchy-Guided Multimodal Representation Learning for Taxonomic Inference

层级引导的多模态表示学习用于分类推断

Sk Miraj Ahmed, Xi Yu, Yunqi Li, Yuewei Lin, Wei Xu

机构 * Brookhaven National Laboratory(布鲁克海文国家实验室) Rutgers University(罗格斯大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出两种端到端的多模态学习方法,通过编码生物分类层级结构提升分类鲁棒性,在大规模生物多样性基准上实现超过14%的准确率提升。

Comments Accepted at the ICLR 2026 Workshop on Foundation Models for Science (FM4Science)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20749 2026-03-27 cs.LG cs.AI 79%

Stabilizing Multimodal Autoencoders: A Theoretical and Empirical Analysis of Fusion Strategies

稳定多模态自编码器:融合策略的理论和经验分析

Diyar Altinses, Andreas Schwung

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文研究多模态自编码器的稳定性与鲁棒性,提出基于理论分析的正则化注意力融合方法,通过实验验证其在一致性、收敛速度和精度上的优势。

Journal ref Expert Systems with Applications, Volume 310, 10 May 2026, 131270

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16889 2026-03-27 cs.CL 79%

Can GRPO Boost Complex Multimodal Table Understanding?

GRPO能否提升复杂多模态表格理解?

Xiaoqiang Kang, Shengen Wu, Zimu Wang, Yilin Liu, Xiaobo Jin, Kaizhu Huang, Wei Wang, Yutao Yue, Xiaowei Huang, Qiufeng Wang

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) Information Hub, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) University of Southern California(南加州大学) Duke Kunshan University(杜克大学昆山分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出Table-R1框架,通过预热、感知对齐GRPO和提示-完成GRPO三阶段提升多模态表格理解性能,优于SFT和GRPO。

Comments EMNLP 2025

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24528 2026-03-26 cs.CV 79%

Cross-Modal Prototype Alignment and Mixing for Training-Free Few-Shot Classification

跨模态原型对齐与混合用于无训练少样本分类

Dipam Goswami, Simone Magistri, Gido M. van de Ven, Bartłomiej Twardowski, Andrew D. Bagdanov, Tinne Tuytelaars, Joost van de Weijer

机构 * Department of Computer Science, Universitat Autònoma de Barcelona, Spain(巴塞罗那自治大学计算机科学系) Computer Vision Center, Barcelona, Spain(巴塞罗那计算机视觉中心) Media Integration and Communication Center, University of Florence, Italy(佛罗伦萨大学媒体整合与传播中心) Bernoulli Institute, University of Groningen, the Netherlands(格罗宁根大学伯努利学院) IDEAS Research Institute, Poland(波兰IDEAS研究所) ESAT-PSI, KU Leuven, Belgium(比利时KU莱顿大学ESAT-PSI)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文研究了直接混合图像与文本原型对少样本分类的影响,提出通过投影获取语义对齐的图像子空间,结合文本嵌入和图像特定LDA分类器提升性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23650 2026-03-26 cs.CV 79%

Foundation Model Embeddings Meet Blended Emotions: A Multimodal Fusion Approach for the BLEMORE Challenge

基础模型嵌入与混合情感:一种多模态融合方法用于BLEMORE挑战

Masoumeh Chapariniya, Aref Farhadipour, Sarah Ebling, Volker Dellwo, Teodora Vukovic

机构 * Department of Computational Linguistics, University of Zürich(苏黎世大学计算语言学系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种多模态融合方法,结合六个编码器家族进行后期概率融合,通过选择冻结的Wav2Vec2的语调编码层和Gemini Embedding 2.0,提升了混合情感识别的性能,最终在测试集上获得0.279的分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22847 2026-03-25 cs.CV 79%

Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought

重新思考多模态链式推理的令牌级策略优化

Yunheng Li, Hangyi Kuang, Hengrui Zhang, Jiangxia Cao, Zhaojie Liu, Qibin Hou, Ming-Ming Cheng

机构 * VCIP, School of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出PEPO方法,通过令牌级分析多模态推理轨迹,结合感知先验和熵整合机制,提升多模态推理性能,实验显示在多种基准上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22757 2026-03-25 cs.CV 79%

Multimodal Industrial Anomaly Detection via Geometric Prior

基于几何先验的多模态工业异常检测

Min Li, Jinghui He, Gang Li, Jiachen Li, Jin Wan, Delong Han

机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(教育部计算功率网络与信息安全重点实验室,山东计算机科学中心(济南国家超算中心),齐鲁工业大学(山东省科学院)) Shandong Provincial Key Laboratory of Computing Power Internet and Service Computing, Shandong Fundamental Research Center for Computer Science(山东省计算功率互联网与服务计算重点实验室,山东省计算机科学基础研究中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于几何先验的异常检测网络GPAD,通过点云专家模型提取细粒度几何特征,并结合两阶段融合策略和几何先验实现高效多模态数据融合,提升几何缺陷检测精度。

Comments Accepted for publication in IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22369 2026-03-25 q-bio.GN cs.AI cs.LG 79%

SynLeaF: A Dual-Stage Multimodal Fusion Framework for Synthetic Lethality Prediction Across Pan- and Single-Cancer Contexts

SynLeaF:一种用于跨泛癌和单癌情境的合成致死性预测双阶段多模态融合框架

Zheming Xing, Siyuan Zhou, Ruinan Wang, Rui Han, Shiming Zhang, Shiqu Chen, Yurui Huang, Jiahao Ma, Yifan Chen, Xuan Wang, Yadong Wang, Junyi Li

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 SynLeaF通过双阶段多模态融合框架,有效整合基因表达、突变、甲基化和拷贝数变异等多组学数据,并利用关系图卷积网络捕捉生物医学知识图谱中的结构化基因表示,从而在17/19种场景中实现优于现有方法的性能。

Comments 29 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22345 2026-03-25 cs.AI 79%

Dynamic Fusion-Aware Graph Convolutional Neural Network for Multimodal Emotion Recognition in Conversations

动态融合感知图卷积神经网络用于对话中的多模态情绪识别

Tao Meng, Weilun Tang, Yuntao Shou, Yilong Tan, Jun Zhou, Wei Ai, Keqin Li

机构 * College of Computer and Mathematics, Central South University of Forestry and Technology(林业科技大学计算机与数学学院) Department of Computer Science, State University of New York, New Paltz, New York, 12561, USA(纽约州立大学新帕尔兹分校计算机科学系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出DF-GCN,通过整合微分方程和全局信息向量,动态融合多模态特征,提升对话中情绪识别的灵活性和泛化能力。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏