arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-13 至 2026-07-13 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 9 篇

2606.23964 2026-07-13 cs.LG cs.CV q-bio.QM 新提交 83%

3D Masked Autoencoders are Robust Learners of Volumetric and Multimodal Cellular Representations for Microscopy

3D掩码自编码器是显微镜体积和多模态细胞表示的鲁棒学习器

Amirhossein Kardoost, Lion Gleiter, Tingying Peng, Carsten Marr

机构 * Institute of AI for Health & Helmholtz AI, Computational Health Center, Helmholtz Munich – German Research Center for Environmental Health(亥姆霍兹慕尼黑中心 - 德国环境健康研究中心,计算健康中心,健康人工智能研究所与亥姆霍兹人工智能) Department of Medicine III, Ludwig-Maximilian-University Hospital(路德维希-马克西米利安大学医院第三内科) Department of Physics, Ludwig-Maximilian-University(路德维希-马克西米利安大学物理系) German Cancer Consortium (DKTK), partner site Munich(德国癌症联盟(DKTK)慕尼黑合作站点) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 系统比较2D和3D掩码自编码器在体积显微镜数据上的表现,发现3D模型在下游任务中更优,并通过跨模态对齐和频域正则化进一步提升性能,在蛋白质相互作用和定位任务上达到最先进水平。

Comments Code is available at: https://github.com/marrlab/mae3d-opencell

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18822 2026-07-13 cs.CV 版本更新 79%

Robust Self-Supervised Cross-Modal Super-Resolution against Real-World Misaligned Observations

鲁棒的自监督跨模态超分辨率对抗真实世界错位观测

Xiaoyu Dong, Jiahuan Li, Ziteng Cui, Naoto Yokoya

机构 * The Univsrsity of Tokyo(东京大学) RIKEN AIP(理化学研究所)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 RobSelf通过自监督方法实现鲁棒的跨模态超分辨率,通过误对齐感知的特征翻译和内容感知的参考滤波器提升性能和效率。

Comments ECCV 2026. Supp: https://drive.google.com/file/d/1fqTYuSY7Qp7PFHiHViZs7y6lz6Bws7ws/view?usp=sharing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09515 2026-07-13 cs.RO 新提交 78%

One-Shot Multimodal Learning from Demonstration with Force-Constrained Elastic Maps

基于力约束弹性映射的一次性多模态示范学习

Brendan Hertel, Jonathan Spanos, Navya Garg, Reza Azadeh

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对多数示范学习方法忽视力与环境相互作用的问题,提出一次性多模态LfD框架。通过多模态概率分割提取力感知运动原语,扩展弹性映射表示并结合外力约束学习轨迹模型,经实验验证该方法具有多模态分割、力感知再现及跨平台通用性。

Comments 8 pages, 6 figures, 4 tables. Accepted for publication at IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09488 2026-07-13 cs.CV 新提交 77%

SigLIP-HD by Fine-to-Coarse Supervision

通过从细到粗的监督实现SigLIP-HD

Lihe Yang, Zhen Zhao, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 研究如何在低成本下实现精细视觉感知,提出SigLIP-HD,采用从细到粗监督设计,基于SigLIP 2模型构建,在相同推理预算下能产生更好视觉令牌,在多基准测试中结果优于基线模型。

Comments ICLR 2026. Code and model: https://github.com/LiheYoung/SigLIP-HD

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09481 2026-07-13 cs.CV cs.AI 新提交 73%

Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation

用于文本引导医学分割的骨干网络与语言引导解耦

Yungeng Liu, Xuanzi Fang, Haijin Zeng, Qi Dai, Yongyong Chen

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) NingBo No.2 Hospital(宁波第二医院)

专题命中 多模态训练与对齐 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 研究针对文本引导医学分割中模型组件紧密耦合问题,提出可转移骨干层次适配器框架BTHA,通过稳定特征级接口、分层监督策略和自适应门控语义引导适配器,有效提升分割效果且计算开销适度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09143 2026-07-13 cs.CV 新提交 70%

Weaving Light and Time: Unified Harmonic-Geometric Representation Learning for Dense RGB-Event Parsing

编织光与时间:用于密集RGB-事件解析的统一谐波-几何表示学习

Chenxu Peng, Chongtian zhou, Dicheng Liu, Bo-Wen Yin, Yimian Dai, Xialei Liu, Ming-Ming Cheng, Xiang Li

机构 * NKIARI(鹏城实验室) VCIP, CS, Nankai University(南开大学视觉计算与图像处理研究室) AAIS, Nankai University(南开大学人工智能学院)

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 研究针对RGB-事件解析中统一主干应用的挑战,提出Evita统一主干,嵌入几何视差校正等协同学习模块,构建N-ImageNetV2及预训练协议,经多基准评估,其实现新指标,在实时多模态上精度-延迟权衡表现卓越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18043 2026-07-13 cs.CL cs.AI cs.CV 版本更新 67%

GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs

GrAInS:基于梯度的大语言模型和视觉语言模型推理时引导方法

Duy Nguyen, Archiki Prasad, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究针对推理时引导LLMs和VLMs的方法局限,提出GrAInS。该方法基于梯度归因识别关键令牌构建引导向量,推理时调整激活。实验显示其性能优于微调及现有基线,能在保持模型流畅性和通用能力的同时提升多项指标。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09126 2026-07-13 cs.CV cs.CL 新提交 62%

VTaMo: Video-Text Alignment Model for Sign Language Translation

VTaMo:用于手语翻译的视频-文本对齐模型

Junyi Hu, Zhewen He, Haomian Huang, Aoxiang Yang, Yi Fang

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) ChatSign Technology(ChatSign科技)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 研究手语翻译问题,提出VTaMo框架,通过局部、全局对齐及位置对齐对比学习实现多粒度对齐,在多个数据集实验中展现领先性能,各组件贡献互补。

Comments 18 pages, 5 figures, 8 tables. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09351 2026-07-13 cs.CV 新提交 61%

Simon-SR: Spatially Adaptive Modulation and Visual Prompt Adaptation for Text-Reinforced Super-Resolution

Simon-SR:用于文本增强超分辨率的空间自适应调制和视觉提示适配

Haotong Cheng, Yuxuan Li, Zijie Cui, Rongling Tan, Chenyuan Wang

机构 * College of Electronic Science and Engineering, Jilin University(吉林大学电子科学与工程学院)

专题命中 多模态训练与对齐 :multi-modal(abstract,comments);分类 cs.CV

AI总结 针对单图像超分辨率问题,提出Simon-SR框架,利用可学习提示进行语义挖掘和文本-图像融合,结合对比提示学习与空间自适应细化,实验证明该方法超越现有技术,在多项指标上有明显提升。

Comments Multi-modal Single Image Super-Resolution

详情

展开后加载摘要…

URL PDF HTML 收藏