arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-12 至 2026-05-12 共收录 203 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 18 篇

2605.10172 2026-05-12 cs.CV cs.CL 62%

V-ABS: Action-Observer Driven Beam Search for Dynamic Visual Reasoning

V-ABS:基于动作-观察者的动态视觉推理束搜索

Zhiwei Ning, Xuanang Gao, Jiaxi Cao, Gengming Zhang, Shengnan Ma, Wenwen Tong, Hanming Deng, Jie Yang, Wei Liu

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Institute of Image Processing and Pattern Recognition, Shanghai Jiao Tong University(上海交通大学图像处理与模式识别研究所) SenseTime Research(商汤科技研究院) Institute of Medical Robotics, Shanghai Jiao Tong University(上海交通大学医学机器人研究所)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出V-ABS框架,通过思考-行动-观察循环和熵适应加权算法,缓解IAO偏差,提升多模态模型在复杂视觉推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21232 2026-05-12 cs.AI 57%

ReCAPA: Hierarchical Predictive Correction to Mitigate Cascading Failures

ReCAPA:分层预测性修正以缓解级联故障

Xiyin Zeng, Yuyu Sun, Haoyang Li, Shouqiang Liu, Hao Wang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) South China Normal University(华南师范大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 ReCAPA通过分层预测修正和对齐架构,缓解多模态环境中多步骤任务执行中的级联故障问题,引入新的指标量化误差传播与恢复过程,实验表明其在多个代理基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09528 2026-05-12 cs.AI 57%

Cplus2ASP: Computing Action Language C+ in Answer Set Programming

Cplus2ASP:在答案集编程中计算动作语言C+

Joseph Babb, Joohyung Lee

机构 * School of Computing, Informatics, and Decision Systems Engineering(计算、信息与决策系统工程学院)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 Cplus2ASP 2.0实现了动作语言C+的确定性片段,通过现代答案集求解技术提升效率,结合多种理论成果,利用工具链实现C+到ICLingo的翻译,并支持扩展多模态翻译。

Journal ref In Proceedings of the 12th International Conference on Logic Programming and Nonmonotonic Reasoning (LPNMR 2013), 122-134, 2013

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11604 2026-05-12 cs.CL 57%

Talk to Your Slides: High-Efficiency Slide Editing via Language-Driven Structured Data Manipulation

与幻灯片对话:通过语言驱动的结构化数据操作实现高效幻灯片编辑

Kyudan Jung, Hojun Cho, Jooyeol Yun, Soyoung Yang, Jaehyeok Jang, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究所) Chung-Ang University(Chung-Ang 大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL

AI总结 本文提出Talk-to-Your-Slides,通过语言驱动的结构化数据操作实现高效幻灯片编辑,相较于基于图像的GUI方法,其在文本处理和格式任务中更快、更准确且成本更低。

Comments 30 pages, Accepted at ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05383 2026-05-12 cs.AI cs.MA 57%

AVA: Attentive VLM Agent for Mastering StarCraft II

AVA:面向星际2的注意力视觉语言代理

Weiyu Ma, Yuqian Fu, Zecheng Zhang, Bernard Ghanem, Guohao Li

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 AVA提出一个支持多智能体强化学习和视觉语言模型的星际2基准,通过RGB图像、自然语言观察和结构化状态信息,比较训练和零样本方法在21种场景中的表现,揭示训练效率、性能上限、可解释性和部署成本的权衡。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09005 2026-05-12 cs.RO cs.AI 57%

Towards Backdoor-Based Ownership Verification for Vision-Language-Action Models

面向视觉-语言-动作模型的后门基于所有权验证

Ming Sun, Rui Wang, Xingrui Yu, Lihua Jing, Hangyu Du, Zhenglin Wan, Xu Pan, Ivor Tsang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) A*STAR Institute of High Performance Computing (A*STAR IHPC)(新加坡A*STAR高性能计算研究所) A*STAR Centre for Frontier AI Research (A*STAR CFAR)(新加坡A*STAR前沿人工智能研究中心) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) College of Design and Engineering, Nanyang Technological University(南洋理工大学设计与工程学院) Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS), Wuhan University(武汉大学测绘遥感信息工程国家重点实验室(LIESMARS))

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文提出GuardVLA,首个针对视觉-语言-动作模型的后门基于所有权验证框架,通过在训练中嵌入隐蔽无害的后门水印,实现可靠的模型所有权验证并保持正常任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06226 2026-05-12 cs.AI q-bio.GN 57%

A Versatile AI Agent for Rare Disease Diagnosis and Risk Gene Prioritization

一种多功能AI代理用于罕见病诊断和风险基因优先级排序

Tianyu Liu, Wangjie Zheng, Rui Yang, Benny Kai Guo Loo, Hui Zhang, Jeffries Lauran, Jianlei Gu, Botao Yu, Weihao Xuan, Kexin Huang, Nan Liu, James Zou, Yonghui Jiang, Hua Xu, Hongyu Zhao

机构 * Interdepartmental Program in Computational Biology and Bioinformatics, Yale University(耶鲁大学计算生物学与生物信息学联合计划) Department of Biostatistics, Yale University(耶鲁大学生物统计学系) Broad Institute of MIT and Harvard(哈佛大学与麻省理工学院联合Broad研究所) Center for Biomedical Data Science, Duke-NUS Medical School(杜克-新加坡医学学校生物医学数据科学中心) Sport and Exercise Medicine Service, KK Women’s and Children’s Hospital Training Program, Duke-NUS Medical School(杜克-新加坡医学学校KK妇女儿童医院运动与医学服务培训项目) Training Program, Duke-NUS Medical School(杜克-新加坡医学学校培训项目) Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系) Department of Complexity Science and Engineering, The University of Tokyo(东京大学复杂科学与工程系) Center for Advanced Intelligence Project, RIKEN(日本理化学研究所高级智能项目中心) NUS Artificial Intelligence Institute, National University of Singapore(新加坡国立大学人工智能研究所) Department of Biostatistics and Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系) Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) Department of Genetics, Yale University(耶鲁大学遗传学系) Wu Tsai Institute, Yale University(耶鲁大学吴天教授研究所) Department of Biomedical Informatics and Data Science, Yale University(耶鲁大学生物医学信息学与数据科学系)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文提出Hygieia系统,通过整合多源数据提升罕见病诊断准确性与风险基因优先级排序能力,实验表明其在多个诊断基准上表现优异,有效减轻临床工作负担。

Comments 32 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15784 2026-05-12 physics.soc-ph 50%

Comparing Analytical Approaches for Bike Station Expansion: A Location-Allocation Study in Trondheim, Norway

比较自行车站点扩展的分析方法:挪威特罗姆瑟市的选址-分配研究

M. Tsaqif Wismadi, Oluwaleke Yusuf, Adil Rasheed, Yngve Karl Frøyen, Thomas Alexander Sick Nielsen

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文通过对比三种选址分配方法,探讨了不同模型对城市空间优先级的影响,发现方法选择对空间决策结果有根本性影响。

Comments 28 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09522 2026-05-12 cs.MA 50%

Emergent Communication for Co-constructed Emotion Between Embodied Agents via Collective Predictive Coding

通过集体预测编码实现具身智能体间共构情感的涌现通信

Zehang Zhang, Nguyen Le Hoang, Tadahiro Taniguchi, Takato Horii

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文通过集体预测编码框架,利用Metropolis-Hastings命名游戏模型,研究具身智能体间共构情感的涌现通信过程,发现通信显著提升情感类别的对齐性和一致性,并验证了内脏异质性对共享情感意义的构成作用。

Comments 13 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09265 2026-05-12 cs.CE 50%

Agentic AI for Particle-Based Simulation: Automating SPH Workflows for Debris Flow Modeling

基于代理的AI用于粒子模拟:自动化SPH工作流用于碎屑流建模

Danrong Zhang, Ruijia Wang, Chenying Liu, Yumeng Zhao

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出首个用于无网格模拟的代理AI工作流,通过整合工具编排、多模态输入和人机交互,实现了碎片流建模的端到端模拟,展示了多模态输入在提升用户体验和减少失败模式方面的优势。

Comments 24 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08801 2026-05-12 cs.LG 50%

Data-driven transport modelling without overfit

基于数据的运输建模无需过拟合

Peter Vanya, Katarína Šimková, Rastislav Farkaš

机构 * Sev.en Global Investments(Sev.en全球投资) Vrije Universiteit Brussels(布鲁塞尔自由大学) Université Libre de Bruxelles(布鲁塞尔自由大学) Ministry of Finance of the Slovak Republic(斯洛伐克共和国财政部)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出一种基于交通流量计数的数据驱动建模方法,通过可解释的模型权重和受控路径提升模型复杂度与准确性,用于预测公共政策干预后的交通流。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 32 篇

2605.10765 2026-05-12 cs.CV cs.AI cs.LG 88%

Dynamic Cross-Modal Prompt Generation for Multimodal Continual Instruction Tuning

动态跨模态提示生成用于多模态持续指令微调

Tao Hu, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出DRAPE框架,通过生成连续实例特定的软提示提升多模态持续指令微调性能,采用跨模态注意力和投影梯度投影减少遗忘,实验显示优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17497 2026-05-12 cs.LG cs.AI 87%

Multimodal Representation Learning Conditioned on Semantic Relations

基于语义关系的多模态表示学习

Yang Qiao, Yuntong Hu, Bowen Zhu, Hasibul Haque, Liang Zhao

机构 * Emory University(埃默里大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.AI

AI总结 本文提出RCML框架,通过将语义关系作为显式条件,使多模态表示学习能根据不同的关系上下文生成不同表示,提升检索和分类任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29162 2026-05-12 cs.MM 85%

From Natural Alignment to Conditional Controllability in Multimodal Dialogue

从自然对齐到条件可控性在多模态对话中

Zeyu Jin, Songtao Zhou, Haoyu Wang, Minghao Tian, Kaifeng Yun, Zhuo Chen, Xiaoyu Qin, Jia Jia

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.MM

AI总结 本文提出MM-Dia数据集和MM-Dia-Bench测试集,通过多模态条件控制提升对话生成的可控性和表达性,实验表明现有框架难以复现人类交互的细腻表达。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09902 2026-05-12 cs.CV 84%

Adversarial Attacks Against MLLMs via Progressive Resolution Processing and Adaptive Feature Alignment

通过渐进分辨率处理和自适应特征对齐对多模态大语言模型进行对抗攻击

Haobo Wang, Xiaorong Ma, Weiqi Luo, Xiaojun Jia, Jiwu Huang

机构 * Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出PRAF-Attack框架,通过多尺度语义指导和中间层局部对齐提升多模态大语言模型的对抗攻击转移性,实验表明其在多种黑盒MLLM上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09899 2026-05-12 cs.CV cs.AI 84%

Hyperbolic Distillation: Geometry-Guided Cross-Modal Transfer for Robust 3D Object Detection

双曲蒸馏:几何引导的跨模态迁移用于稳健的3D物体检测

Kanglin Ning, Wenrui Li, Houde Quan, Qifan Li, Xingtao Wang, Xiaopeng Fan

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Suzhou Research Institute of HIT(哈尔滨工业大学苏州研究院) PengChengLab(鹏城实验室)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HGC-Det方法,通过双曲约束跨模态蒸馏提升3D物体检测的鲁棒性,结合图像分支和点云分支,利用双曲几何特性缓解语义损失,实验表明在多个数据集上平衡了检测精度与计算成本。

Comments Current version has been subbmitted to IEEE Transactions on Multimedia. Now, this manuscript's status is Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08592 2026-05-12 cs.CV 83%

Cross-Modal RGB-D Fusion Transformer for 6D Pose Estimation of Non-Cooperative Spacecraft with Stereo-Derived Depth

用于非合作航天器6D位姿估计的跨模态RGB-D融合Transformer

Yongliang Zhen, Bo LÜ, Hang Yang, Xiaotian WU

机构 * School of Physics, Northeast Normal University(东北师范大学物理学院) Changchun Institute of Optics, Fine Mechanics and Physics, Chinese Academy of Science(长春光学精密机械与物理研究所)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出基于被动立体视觉的6D位姿估计方法,通过TSCA-Stereo网络处理空间图像中的弱纹理和强光问题,并结合跨模态Transformer融合RGB和立体深度信息,实现高精度位姿估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12286 2026-05-12 q-bio.GN cs.CL 83%

Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer

不再有间隙:通过一个分词器实现零间隙多模态整合

Yanan Li, Christina Yi Jin, Yuan Jin, Manli Luo, Tie Xu, Shuai Jiao, Wei He, Qing Zhang

机构 * Research Center for Frontier Fundamental Studies, Zhejiang Lab(前沿基础研究研究中心,浙江实验室) Research Center for Scientific Data Hub, Zhejiang Lab(科学数据枢纽研究中心,浙江实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 本文提出One Tokenizer,通过统一词汇实现多模态无缝整合,克服传统架构的几何模态间隙问题,提升生物推理性能。

Comments Under review at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10616 2026-05-12 cs.LG cs.CL cs.CV 81%

MulTaBench: Benchmarking Multimodal Tabular Learning with Text and Image

MulTaBench: 基于文本和图像的多模态表格学习基准测试

Alan Arazi, Eilam Shapira, Shoham Grunblat, Mor Ventura, Elad Hoffer, Gioia Blayer, David Holzmüller, Lennart Purucker, Gaël Varoquaux, Frank Hutter, Roi Reichart

机构 * Technion – Israel Institute of Technology(技术ion – 以色列理工学院) Prior Labs(Prior实验室) NVIDIA SODA Team, INRIA Saclay, Palaiseau(SODA团队,INRIA萨克莱,帕莱索) University of Freiburg(弗赖堡大学) Probabl ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 MulTaBench通过40个数据集评估多模态表格学习,强调任务特定的表示学习,展示目标感知表示在文本和图像模态中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10498 2026-05-12 cs.CV cs.AI stat.ML 81%

Simultaneous Long-tailed Recognition and Multi-modal Fusion for Highly Imbalanced Multi-modal Data

多模态数据中长尾识别与多模态融合的联合处理

Heegeon Yoon, Heeyoung Kim

机构 * Department of Industrial and Systems Engineering, Korea Advanced Institute of Science and Technology (KAIST)(工业与系统工程系,韩国科学技术院(KAIST))

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种处理长尾分布多模态数据的新框架,通过融合异质数据并利用模态特定网络增强信息,提升在长尾类不平衡场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10177 2026-05-12 cs.CV cs.AI cs.RO 81%

MTA-RL: Robust Urban Driving via Multi-modal Transformer-based 3D Affordances and Reinforcement Learning

MTA-RL:通过多模态Transformer-based 3D affordances和强化学习实现鲁棒的城市驾驶

Guangli Chen, Dianzhao Li, Wenjian Zhong, Bangquan Xie, Ostap Okhrin

机构 * Dongguan Key Laboratory of Intelligent Equipment and Smart Industry, School of Advanced Engineering, Great Bay University(东莞智能装备与智能制造重点实验室,先进工程学院,大湾大学) Chair of Applied Statistics, Technische Universität Dresden(应用统计学教授职位,德累斯顿技术大学) Center for Scalable Data Analytics and Artificial Intelligence (ScaDS.AI)(可扩展数据解析与人工智能中心(ScaDS.AI)) College of Automation, Guangdong University of Technology(自动化学院,广东技术大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出MTA-RL框架,通过多模态Transformer-based 3D affordances和强化学习实现可靠的城市自动驾驶,提升样本效率和稳定性,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09262 2026-05-12 cs.CV cs.CL 81%

Reinforcing Multimodal Reasoning Against Visual Degradation

增强多模态推理以对抗视觉退化

Rui Liu, Dian Yu, Haolin Liu, Yucheng Shi, Tong Zheng, Runpeng Dai, Haitao Mi, Pratap Tokekar, Leoweiliang

机构 * Tencent Hunyuan(腾讯文言) University of Maryland, College Park(马里兰大学 College Park 分校) University of Virginia(弗吉尼亚大学) University of North Carolina, Chapel Hill(北卡罗来纳大学 Chapel Hill 分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出ROMA框架,通过优化动态增强多模态大语言模型对视觉退化的鲁棒性,提升在多种基准测试中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01301 2026-05-12 cs.AI cs.CL 81%

Overcoming Multi-step Complexity in Multimodal Theory-of-Mind Reasoning: A Scalable Bayesian Planner

克服多步复杂性以实现多模态理论思维推理:一种可扩展的贝叶斯规划器

Chunhui Zhang, Zhongyu Ouyang, Kwonjoon Lee, Nakul Agarwal, Sean Dae Houlihan, Soroush Vosoughi, Shao-Yuan Lo

机构 * Dartmouth College(达特茅斯学院) Honda Research Institute USA(本田美国研究院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种可扩展的贝叶斯理论思维规划器,通过分步贝叶斯更新分解理论思维推理,利用弱到强控制使小语言模型专精于理论思维似然估计,并将其推理行为转移给大语言模型,从而在多模态理论思维基准测试中实现4.6%的准确率提升。

Comments Accepted as a Spotlight at the 2025 Forty-Second International Conference on Machine Learning (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09614 2026-05-12 cs.CV 79%

Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning

反射锚点用于长链多模态推理中的传播感知视觉保留

Xuan Gong, Hanbo Huang, Hao Zheng, Yiran Zhang, Wenbin Dai, Weishu Zhao, Shiyu Liang

机构 * Shanghai Jiao Tong University(上海交通大学) Lanzhou University(兰州大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出RAPO方法,通过信息论分析优化视觉传播潜力和局部分支空间,提升长链多模态推理的视觉信息保留效果。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09352 2026-05-12 cs.AI 79%

The Wittgensteinian Representation Hypothesis: Is Language the Attractor of Multimodal Convergence?

维特根斯坦表示假说:语言是否是多模态收敛的吸引子?

Zhaoyang Zhang, Run Shao, Dongyue Wu, Jiajie Teng, Chao Tao, Jingdong Chen, Haifeng Li

机构 * Central South University(中南大学) Huazhong University of Science and Technology(华中科技大学) Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 研究探讨了为何不同模态的神经网络收敛于共享表示,发现语言模态对其他模态有显著方向性吸引,提出维特根斯坦表示假说。

Comments 22 pages, 11 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09151 2026-05-12 cs.CV 79%

MultiMedVision: Multi-Modal Medical Vision Framework

多模态医学视觉框架:MultiMedVision

Frank Li, Bardia Khosravi, Mohammadreza Chavoshi, Young Seok Jeon, Theo Dapamede, Hari Trivedi, Janice Newsome, Judy Gichoya

机构 * Emory University(埃默里大学) Yale University(耶鲁大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出MultiMedVision框架,通过稀疏视觉Transformer实现2D/3D医学影像的统一表征学习,无需模态特定适配器,在共享潜在空间中处理混合模态数据,取得2D和3D任务的竞争力表现。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08764 2026-05-12 cs.LG cs.CV eess.IV 79%

Anchoring the Eigengap: Cross-Modal Spectral Stabilization for Sample-Efficient Representation Learning

锚定特征间隙:跨模态谱稳定化以实现样本高效表征学习

Nikhil J. Dhinagar, Vidhi Chhatbar, Chirag Jagad, Pavithra Senthilkumar, Sophia I. Thomopoulos, Mahir H. Khan, Sook-Lei Liew, the ENIGMA-Stroke Recovery Working Group, Paul M. Thompson

机构 * Imaging Genetics Center, Mark & Mary Stevens Neuroimaging & Informatics Institute, Keck School of Medicine, University of Southern California(影像基因中心,马克与玛丽史蒂文斯神经影像与信息学研究所,凯克医学院,南加州大学) Neuroscience Graduate Program, Mark & Mary Stevens Neuroimaging & Informatics Institute, Chan Division of Occupational Science & Occupational Therapy, Biomedical Engineering, University of Southern California(神经科学研究生项目,马克与玛丽史蒂文斯神经影像与信息学研究所,查恩职业科学与职业治疗 division,生物医学工程,南加州大学)

专题命中 多模态训练与对齐 :cross-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出跨模态谱稳定化方法,通过抑制噪声主导方向并保持特征间隙,提升样本效率下的表征学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01402 2026-05-12 cs.CL cs.CV cs.LG 79%

Injecting Distributional Awareness into MLLMs via Reinforcement Learning for Deep Imbalanced Regression

通过强化学习为深度不平衡回归注入分布意识

Yao Du, Shanshan Song, Xiaomeng Li

机构 * The Hong Kong University of Science(香港科学与技术大学)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出基于组相对策略优化的分布感知强化学习框架,通过一致性相关系数奖励实现跨样本关系监督,提升长尾回归任务的分布对齐能力,在中等和少样本场景下表现优异。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09355 2026-05-12 cs.LG 78%

FLAME: Adaptive Mixture-of-Experts for Continual Multimodal Multi-Task Learning

FLAME:适应性专家混合用于连续多模态多任务学习

Xing Han, Shravan Chaudhari, Tanvi Ranade, Rama Chellappa, Suchi Saria

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 FLAME提出了一种可扩展的专家混合框架,支持多任务预训练和连续学习,通过模态特定路由器处理不同模态的任务,同时利用低秩内存子空间压缩专家知识,提升参数效率和减少灾难性遗忘。

Comments 37 pages, 25 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03606 2026-05-12 cs.AI 74%

BioBLP: A Modular Framework for Learning on Multimodal Biomedical Knowledge Graphs

BioBLP: 一个用于多模态生物医学知识图谱学习的模块化框架

Daniel Daza, Dimitrios Alivanistos, Payal Mitra, Thom Pijnenburg, Michael Cochez, Paul Groth

机构 * Vrije Universiteit Amsterdam(荷兰阿姆斯特丹自由大学) University of Amsterdam(阿姆斯特丹大学) Elsevier B.V.(埃森哲公司) Discovery Lab, Elsevier(埃森哲发现实验室)

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.AI

AI总结 本文提出BioBLP框架,用于处理多模态生物医学知识图谱中的实体属性,支持不同模态的数据编码及缺失属性处理,并通过预训练策略提升训练效率,在药物-蛋白质相互作用预测任务中表现优于基线方法。

Journal ref J Biomed Semant 14, 20 (2023)

详情

展开后加载摘要…

URL PDF HTML 收藏