arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-24 至 2026-04-24 共收录 39 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 2 篇

2604.21061 2026-04-24 cs.AI 83%

InVitroVision: a Multi-Modal AI Model for Automated Description of Embryo Development using Natural Language

InVitroVision:一种多模态AI模型,用于通过自然语言自动描述胚胎发育

Nicklas Neu, Thomas Ebner, Jasmin Primus, Raphael Zefferer, Bernhard Schenkenfelder, Mathias Brunbauer, Florian Kromp

机构 * Software Competence Center Hagenberg GmbH(软件能力中心海根贝格有限公司) Kinderwunsch Zentrum Kepler Universitätsklinikum(儿童愿望中心凯普勒大学诊所) Wunschkind Klinik Dr. Brunbauer(愿望宝宝诊所布兰鲍尔医生)

专题命中 图文多模态 :multi-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 本文提出InVitroVision模型,通过微调多模态视觉语言模型,实现了对胚胎形态和发育的自然语言描述预测,展示了基础视觉语言模型在有限数据下应用于体外受精任务的潜力。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21409 2026-04-24 cs.CV 79%

S1-VL: Scientific Multimodal Reasoning Model with Thinking-with-Images

S1-VL:具有图像思维的科学多模态推理模型

Qingxiao Li, Lifeng Xu, QingLi Wang, Yudong Bai, Mingwei Ou, Shu Hu, Nan Xu

机构 * ScienceOne AI

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 S1-VL是一种支持科学推理和图像思维的多模态模型,通过Python代码执行图像处理,提升科学图表、显微图像和几何推理等复杂场景的性能。

Comments 29 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 2 篇

2604.20940 2026-04-24 cs.MM cs.NI cs.SD 79%

Sema: Semantic Transport for Real-Time Multimodal Agents

Sema:面向实时多模态代理的语义传输

Jiaying Meng, Bojie Li

机构 * Pine AI

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 Sema通过结合离散音频分词与混合屏幕表示及突发性分组传输,有效降低带宽并保持任务准确性,解决多模态代理传输中的语义保真问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20847 2026-04-24 cs.IR cs.AI 57%

Revisiting Content-Based Music Recommendation: Efficient Feature Aggregation from Large-Scale Music Models

重新审视基于内容的音乐推荐:从大规模音乐模型中高效地聚合特征

Yizhi Zhou, Jia-Qi Yang, De-Chuan Zhan, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出TASTE数据集和基准框架,通过整合音频和文本信息提升音乐推荐性能,引入MuQ-token方法优化多层音频特征整合,验证了内容驱动方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 2 篇

2604.21235 2026-04-24 cs.LG cs.CL stat.ME 79%

Learning Dynamic Representations and Policies from Multimodal Clinical Time-Series with Informative Missingness

从具有信息性缺失的多模态临床时间序列中学习动态表示和策略

Zihan Liang, Ziwen Pan, Ruoxuan Xiong

机构 * Emory University(埃默里大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出了一种多模态临床时间序列患者表示学习框架,利用信息性缺失来提升治疗策略学习和患者预后预测性能。

Comments Findings of ACL 2026 (30 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15793 2026-04-24 cs.LG cs.SY eess.SY 78%

Anomaly Detection in Smart Power Grids with Graph-Regularized MS-SVDD: a Multimodal Subspace Learning Approach

基于图正则化的多模态子空间学习的智能电网异常检测

Thomas Debelle, Fahad Sohrab, Pekka Abrahamsson, Moncef Gabbouj

机构 * Faculty of Information Technology and Communication Sciences(信息科技与通讯科学学院) Tampere University(塔尔库大学) Technical University of Darmstadt(达姆施塔特技术大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出一种结合图正则化的多模态子空间学习方法,用于智能电网异常检测,通过共享低维子空间提升鲁棒性,验证了图先验与多模态子空间学习结合的有效性。

Comments 23 pages, 5 figures, supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 2 篇

2604.21326 2026-04-24 cs.CV cs.AI 84%

MiMIC: Mitigating Visual Modality Collapse in Universal Multimodal Retrieval While Avoiding Semantic Misalignment

MiMIC: 缓解通用多模态检索中的视觉模态崩溃并避免语义错位

Juan Li, Chuanghao Ding, Xujie Zhang, Cam-Tu Nguyen

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) School of Artificial Intelligence(人工智能学院)

专题命中 跨模态检索 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 MiMIC通过融合-解码器架构和鲁棒训练方法,解决通用多模态检索中视觉模态崩溃和语义错位问题,在WebQA+和EVQA+数据集上优于早融合和晚融合基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20878 2026-04-24 cs.CL cs.CV cs.LG eess.IV 81%

AITP: Traffic Accident Responsibility Allocation via Multimodal Large Language Models

AITP:通过多模态大语言模型进行交通事故责任分配

Zijin Zhou, Songan Zhang

机构 * Global Institute of Future Technology(未来技术全球研究院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出AITP模型,结合多模态链式推理和法律知识检索,解决交通事故责任分配问题,并构建DecaTARA基准测试集,验证模型在责任分配、事故检测和理解任务中的领先性能。

Journal ref CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 3 篇

2604.21146 2026-04-24 cs.CV 79%

WFM: 3D Wavelet Flow Matching for Ultrafast Multi-Modal MRI Synthesis

WFM:用于超快速多模态MRI合成的3D小波流匹配

Yalcin Tur, Mihajlo Stojkovic, Ulas Bagci

机构 * Department of Computer Science, Stanford University(斯坦福大学计算机科学系) Machine and Hybrid Intelligence Lab, Feinberg School of Medicine, Northwestern University(北western大学费因伯格医学院机器与混合智能实验室)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出WFM方法,通过学习基于小波空间条件均值的直接流,实现高效多模态MRI合成,单模型在BraTS 2024上达到26.8 dB PSNR和0.94 SSIM,速度比扩散模型快250-1000倍。

Comments 17 pages, 4 figures, 3 tables. Accepted at MIDL 2026 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04395 2026-04-24 cs.CV cs.MM 62%

BiTDiff: Fine-Grained 3D Conducting Motion Generation via BiMamba-Transformer Diffusion

BiTDiff:通过BiMamba-Transformer扩散实现细粒度3D导体运动生成

Tianzhi Jia, Kaixing Yang, Xiaole Yang, Xulong Tang, Ke Qiu, Shikui Wei, Yao Zhao

机构 * Institute of Information Science, Beijing Jiaotong University(信息科学学院,北京交通大学) Renmin University of China(中国人民大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出BiTDiff框架,结合BiMamba-Transformer模型和扩散策略,解决3D导体运动生成中的数据和方法限制,构建了首个大规模CM-Data数据集,并实现高质量运动合成与训练自由的联合级运动编辑。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21362 2026-04-24 cs.CV 57%

KD-CVG: A Knowledge-Driven Approach for Creative Video Generation

KD-CVG:一种基于知识的创意视频生成方法

Linkai Liu, Wei Feng, Xi Zhao, Shen Zhang, Xingye Chen, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Yuchen Zhou, Zipeng Guo, Chao Gou

机构 * Sun Yat-sen University(中山大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出KD-CVG方法,通过构建广告创意知识库解决文本到视频模型在语义对齐和运动适应性方面的不足,提升创意视频生成效果。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 12 篇

2510.03247 2026-04-24 cs.LG cs.AI 83%

Towards Multimodal Active Learning: Efficient Learning with Limited Paired Data

迈向多模态主动学习:在有限配对数据下高效学习

Jiancheng Zhang, Yinglun Zhu

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出首个处理对齐数据的多模态主动学习框架,结合不确定性与多样性原则,实现线性时间获取,降低多模态标注成本且保持性能。

Comments Accepted by Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20983 2026-04-24 cs.CV cs.AI cs.CL 82%

Thinking Like a Botanist: Challenging Multimodal Language Models with Intent-Driven Chain-of-Inquiry

像植物学家一样思考:用意图驱动的连续询问挑战多模态语言模型

Syed Nazmus Sakib, Nafiul Haque, Shahrear Bin Amin, Hasan Muhammad Abdullah, Md. Mehedi Hasan, Mohammad Zabed Hossain, Shifat E. Arman

机构 * Department of Robotics and Mechatronics Engineering, University of Dhaka(达卡大学机器人与机电工程系) Department of Computer Science and Engineering, University of Dhaka(达卡大学计算机科学与工程系) Department of Agronomy, Gazipur Agricultural University(加兹ipur农业大学作物学系) Department of Botany, University of Dhaka(达卡大学植物学系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出PlantInquiryVQA基准,通过结构化询问提升植物病害诊断准确性,揭示多步意图驱动的视觉推理方法,改进多模态模型的临床推理能力。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21575 2026-04-24 cs.CV cs.GR 79%

OmniFit: Multi-modal 3D Body Fitting via Scale-agnostic Dense Landmark Prediction

OmniFit:通过尺度无关密集地标预测实现多模态3D身体拟合

Zeyu Cai, Yuliang Xiu, Renke Wang, Zhijing Shao, Xiaoben Li, Siyuan Yu, Chao Xu, Yang Liu, Baigui Sun, Jian Yang, Zhenyu Zhang

机构 * Nanjing University(南京大学) Westlake University(西湖大学) iROOTECH Nanjing University of Science and Technology(南京理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 OmniFit通过尺度无关的密集地标预测,实现对多模态输入(如完整扫描、部分深度观测和图像)的无缝处理,首次在日常和宽松服装场景中超越多视图优化基线,达到毫米级精度。

Comments Project Page: https://zcai0612.github.io/OmniFit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21508 2026-04-24 cs.AI q-bio.BM 79%

BioMiner: A Multi-modal System for Automated Mining of Protein-Ligand Bioactivity Data from Literature

BioMiner:一种用于从文献中自动挖掘蛋白质-配体生物活性数据的多模态系统

Jiaxian Yan, Jintao Zhu, Yuhang Yang, Qi Liu, Kai Zhang, Zaixi Zhang, Xukai Liu, Boyan Zhang, Kaiyuan Gao, Jinchuan Xiao, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室) Princeton University(普林斯顿大学) Huazhong University of Science and Technology(华中科技大学) Infinite Intelligence Pharma(无限智能制药)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 BioMiner通过多模态框架提取生物活性数据,解决手动整理与文献增长不匹配的问题,其核心方法结合直接推理和化学结构解析,实现生物活性三元组的高准确率提取。

Comments 20 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21102 2026-04-24 cs.CV cs.AI 76%

Leveraging Multimodal LLMs for Built Environment and Housing Attribute Assessment from Street-View Imagery

利用多模态大语言模型进行基于街景图像的建筑环境和住房属性评估

Siyuan Yao, Siavash Ghorbany, Kuangshi Ai, Arnav Cherukuthota, Meghan Forstchen, Alexis Korotasz, Matthew Sisk, Ming Hu, Chaoli Wang

机构 * University of Notre Dame(诺丁汉大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

AI总结 本文提出利用大语言模型和谷歌街景图像自动评估美国全国建筑状况,通过微调Gemma 3 27B模型并结合知识蒸馏,实现高效准确的建筑评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05563 2026-04-24 cs.CV cs.SI 74%

What's Left Unsaid? Detecting and Correcting Misleading Omissions in Multimodal News Previews

未被言说之物:检测和纠正多模态新闻预告中的误导性省略

Fanxiao Li, Jiaying Wu, Tingchao Fu, Dayang Li, Herun Wan, Wei Zhou, Min-Yen Kan

机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院) National University of Singapore(新加坡国立大学) Xi’an Jiaotong University(西安交通大学) School of Engineering, Yunnan University(云南大学工程学院)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 本文提出MM-Misleading基准,通过多阶段流程评估开源LVLMs,发现省略性误导的盲区,并提出OMGuard结合细调和引导修正,提升检测与纠正效果,揭示局部叙事变化导致的误导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18908 2026-04-24 cs.AI 74%

Multimodal Bayesian Network for Robust Assessment of Casualties in Autonomous Triage

多模态贝叶斯网络用于自主分诊的稳健评估

Szymon Rusiecki, Cecilia G. Morales, Kimberly Elenberg, Leonard Weiss, Artur Dubrawski

机构 * AGH University of Krakow(AGH克拉科夫大学) Carnegie Mellon University(卡内基梅隆大学) University of Pittsburgh(匹兹堡大学)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 本文提出一种融合多计算机视觉模型输出的贝叶斯网络,通过专家定义规则提升伤员评估准确性,在DARPA分诊挑战中显著优于视觉基线。

Comments Presented at NeurIPS 2025 Workshop: Structured Probabilistic Inference & Generative Modeling

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21346 2026-04-24 cs.AI cs.CL cs.CV 67%

Symbolic Grounding Reveals Representational Bottlenecks in Abstract Visual Reasoning

符号 grounding 揭示了抽象视觉推理中的表征瓶颈

Mohit Vaishnav, Tanel Tammet

机构 * Applied Artificial Intelligence Group, Tallinn University of Technology, Estonia(塔林技术大学应用人工智能小组,爱沙尼亚) Kimova AI, Tallinn, Estonia(Kimova AI,塔林,爱沙尼亚)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文通过Bongard-LOGO基准测试,发现符号输入能显著提升抽象视觉推理性能,揭示了表征能力是核心瓶颈。

Journal ref 30th Conference on Computational Natural Language Learning (CoNLL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21144 2026-04-24 cs.CL cs.AI cs.HC 62%

Using Machine Mental Imagery for Representing Common Ground in Situated Dialogue

利用机器心智 imagery 代表情境对话中的共同背景

Biswesh Mohapatra, Giovanni Duca, Laurent Romary, Justine Cassell

机构 * Inria University of Trento(特伦托大学) Inria, Carnegie Mellon University(Inria 和卡内基梅隆大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种主动视觉支架框架,通过将对话状态转化为持久的视觉历史,减少代表模糊并提高对话理解。

Comments Work under review. Biswesh Mohapatra and Giovanni Duca both contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21478 2026-04-24 cs.CV 57%

Rethinking Cross-Domain Evaluation for Face Forgery Detection with Semantic Fine-grained Alignment and Mixture-of-Experts

重新思考面向面部伪造检测的跨领域评估:基于语义细粒度对齐和专家混合

Yuhan Luo, Tao Chen, Decheng Liu

机构 * School of Cyber Engineering, Xidian University(西安电子科技大学信息工程学院)

专题命中 多模态评测 :image-text(abstract);分类 cs.CV

AI总结 本文提出Cross-AUC评估指标和SFAM框架,通过语义细粒度对齐和专家混合提升面部伪造检测的跨领域鲁棒性,实验证明方法在多个数据集上优于现有技术。

Comments The source code is available at https://github.com/Yuhan-Luo/Semantic-Fine-grained-Alignment-and-Mixture-of-Experts

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21461 2026-04-24 cs.CV cs.HC 57%

Do MLLMs Understand Pointing? Benchmarking and Enhancing Referential Reasoning in Egocentric Vision

多模态大语言模型理解指认吗?在自我中心视觉中的基准测试与增强指认推理

Chentao Li, Zirui Gao, Mingze Gao, Yinglian Ren, Jianjiang Feng, Jie Zhou

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Academy of Art & Design, Tsinghua University(清华大学艺术与设计学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出EgoPoint-Bench基准测试,用于评估和提升自我中心视角下的多模态指认推理能力,通过11k高质量样本展示细调合成数据能显著提升性能和现实迁移能力。

Comments 20 pages, 14 figures. Committed to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20697 2026-04-24 cs.SD cs.AI 57%

Musical Score Understanding Benchmark: Evaluating Large Language Models' Comprehension of Complete Musical Scores

音乐乐谱理解基准:评估大型语言模型对完整乐谱的理解能力

Congren Dai, Yue Yang, Krinos Li, Huichi Zhou, Shijie Liang, Bo Zhang, Enyang Liu, Ge Jin, Hongran An, Haosen Zhang, Peiyuan Jing, Kinhei Lee, Z henxuan Zhang, Xiaobing Li, Maosong Sun

机构 * Central Conservatory of Music(中央音乐学院) Imperial College London(帝国理工学院) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出MSU-Bench基准,评估大型语言模型和视觉-语言模型对完整乐谱的理解能力,发现模型在模态间存在显著差距,通过微调可提升多层级正确性,为多模态推理研究提供基础。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态Agent 4 篇

2604.03956 2026-04-24 cs.CV cs.AI 62%

VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models

VLA-Forget:面向具身基础模型的视觉-语言-动作去学习

Ravi Ranjan, Agoritsa Polyzou

机构 * Florida International University(佛罗里达国际大学)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLA-Forget框架,通过结合感知选择性编辑与层选择性推理去学习,提升去学习效果,保留感知特性和推理能力,减少量化恢复。

Comments 18 pages, 9 figures, Accepted to ACL-2026, KnowFM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21489 2026-04-24 cs.RO cs.AI 57%

MISTY: High-Throughput Motion Planning via Mixer-based Single-step Drifting

MISTY:基于混合器的单步漂移高吞吐量运动规划

Yining Xing, Zehong Ke, Yiqian Tu, Zhiyuan Liu, Wenhao Yu, Jianqiang Wang

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(清华大学智能绿色车辆与移动系统国家重点实验室)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 MISTY通过混合器单步漂移方法实现高吞吐量运动规划,利用变分自编码器和轻量级MLP-Mixer解码器,结合隐空间漂移损失,提升轨迹生成效率与鲁棒性。

Comments 8 pages, 4 figures, 3 tables. Submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06498 2026-04-24 cs.CL astro-ph.IM 57%

Spec-o3: A Tool-Augmented Vision-Language Agent for Rare Celestial Object Candidate Vetting via Automated Spectral Inspection

Spec-o3:一种工具增强的视觉-语言代理,用于通过自动化光谱检查验证稀有天体候选体

Minghui Jia, Qichao Zhang, Ali Luo, Linjing Li, Shuo Ye, Hailing Lu, Wen Hou, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, CAS(SKL-MAIS,自动化研究所,中国科学院) School of Advanced Interdisciplinary Sciences, UCAS(交叉科学学院,中国科学院大学) National Astronomical Observatories, CAS(国家天文台,中国科学院) School of Artificial Intelligence, UCAS(人工智能学院,中国科学院大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL

AI总结 本文提出Spec-o3,一种工具增强的视觉-语言代理,通过多模态链式推理实现天文学家对稀有天体候选体的自动化光谱检查,提升验证效率和准确性。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20948 2026-04-24 cs.HC 50%

Can Virtual Agents Care? Designing an Empathetic and Personalized LLM-Driven Conversational Agent

虚拟代理能关心吗?设计一个具有同理心和个性化的LLM驱动对话代理

Truong Le Minh Toan, Dieu Bang Mach, Tan Duy Le, Nguyen Tan Viet Tuyen

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出一种框架,通过检索增强架构、结构化记忆和多模态交互,设计出具有同理心和个性化支持的虚拟代理,以提升心理健康支持的质量和可靠性。

Comments Accepted manuscript version to be presented at the SCI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 多模态训练与对齐 9 篇

2603.12845 2026-04-24 cs.CV 83%

Multimodal Protein Language Models for Enzyme Kinetic Parameters: From Substrate Recognition to Conformational Adaptation

多模态蛋白质语言模型用于酶动力学参数:从底物识别到构象适应

Fei Wang, Xinye Zheng, Kun Li, Yanyan Wei, Yuxin Liu, Ganpeng Hu, Tong Bao, Jingwen Yang

机构 * School of Computer Science and Information Engineering(计算机科学与信息工程学院) Institute of Artificial Intelligence(人工智能研究院) CVLab, College of Information Technology(CV实验室,信息学院) Intelligent Interconnected Systems Laboratory of Anhui Province(安徽省智能互联系统实验室) School of Food Biological Engineering(食品生物工程学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出多阶段多模态条件建模方法,通过ERBA模块在蛋白质语言模型中注入跨模态信息,提升酶动力学参数预测的准确性与生物合理性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21697 2026-04-24 cs.CR cs.AI cs.MM 81%

Structured Visual Narratives Undermine Safety Alignment in Multimodal Large Language Models

结构化视觉叙事削弱多模态大语言模型的安全对齐

Rui Yang Tan, Yujia Hu, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡技术与设计大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI、cs.MM

AI总结 研究发现结构化视觉叙事在多模态大语言模型中导致安全对齐问题,通过漫画模板劫持攻击展示其危害,揭示现有防御方法在处理非有害敏感内容时的不可靠性。

Comments Code released at: https://github.com/Social-AI-Studio/ComicJailbreak

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21585 2026-04-24 eess.SP 78%

Scalable Multimodal Beam Alignment in V2X: An Anti-Imbalance Graph Learning Approach

面向V2X的可扩展多模态波束对齐:一种反不平衡图学习方法

Jiahui Liang, Shuoyao Wang, Shijian Gao

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出一种分布式多模态图波束对齐框架,利用车载多模态传感数据预测隐式反馈,并通过图神经网络协调多用户对齐,提升可扩展性并减少开销。

详情

展开后加载摘要…

URL PDF HTML 收藏