arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-14 至 2026-07-14 共收录 88 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 8 篇

2607.10966 2026-07-14 cs.AI 新提交 79%

SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning

SVR-R1:在强化学习中通过自我验证引导多模态推理

Mingyuan Wu, Jingcheng Yang, Shengyi Qian, Xudong Wang, Jize Jiang, Qifan Wang, Aashu Singh, Khoi Pham, Fei Liu, Zhaolun Su, Zhuokai Zhao, Klara Nahrstedt, Jianyu Wang, Hanchao Yu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta

专题命中 图文多模态 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 SVR-R1是一个多轮强化学习框架,将模型自身验证转化为学习信号。通过GRPO和异步多轮展开框架实现,无需外部监督。在视觉语言推理基准上评估,大幅提高准确率,弥合推理时自我优化与强化学习训练交叉点,还将开源以促研究。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10991 2026-07-14 cs.RO cs.AI cs.CV 新提交 62%

Think When It Matters: Conditional VLM Reasoning for Social Navigation with RL Policies

在重要时刻思考:用于社交导航的基于RL策略的条件VLM推理

Ali Ahmadi, Hamed Rahimi, Adrien Jacquet Cretides, Marie Samson, Mahdi Khoramshahi, Mohamed Chetouani

机构 * Institut des Systèmes Intelligents et de Robotique (ISIR)(智能系统与机器人研究所)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究社交机器人导航中强化学习策略缺乏语义推理能力的问题,提出HUMA混合架构,动态平衡RL策略与VLM的优势。在基准测试中任务成功率提高,减少碰撞,消融研究验证组件,实际部署证明方法可行。

Comments CoRL 2026 submission. 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10787 2026-07-14 cs.CV cs.CL 新提交 62%

Detecting AI-Generated Video: A Vision-Language Dual-View Survey

检测人工智能生成的视频:视觉-语言双视角综述

Dylan Xinming Hou, Juntian Zhang, Xu Gu, Yichen Wu, Nils Lukas, Gus Xia, Xiuying Chen, Yuhan Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学中关村人工智能学院) Harvard University(哈佛大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 综述人工智能生成视频检测,将任务重定义为事实保真度验证,提出视觉-语言双视角分类法,基于对221篇论文回顾,综合生成范式、审视检测方法、回顾评估指标,讨论挑战并指出未来方向。

Comments 51 pages, accepted by ACL 2026

Journal ref Association for Computational Linguistics 2026 pages 32221 to 32255

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10610 2026-07-14 cs.CV cs.AI 新提交 62%

WasteAssistant: Regulation-Guided Visual Question Answering Framework for Intelligent Waste Segregation and Sustainable Managemen

WasteAssistant:用于智能垃圾分类与可持续管理的监管引导视觉问答框架

Khush Kataruka, Harshit Maurya, Anuja Vats, Murari Mandal, Kiran Raja, Praveen Kumar Chandaliya

机构 * SVNIT(萨达尔·瓦拉巴伊·国家理工学院) NTNU(挪威科技大学) KIIT(卡林加工业技术学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对现有智能垃圾分类系统的不足,提出集成视觉语言模型和多模态大语言模型的框架,构建新数据集,经实验验证基于BLIP的模型效果更佳,提升了分类准确率,确保监管合规,推动多模态AI在垃圾管理中的应用。

Comments 12 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11562 2026-07-14 cs.CV 新提交 57%

MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

MonkeyOCRv2:用于文档人工智能的视觉-文本基础模型

Yuliang Liu, Zhang Li, Ziyang Zhang, Shuo Zhang, Qiang Liu, Jiajun Song, Zidun Guo, Xinhan Wang, Handong Zheng, Yang Liu, Dongliang Luo, Zhiyin Ma, Jiarui Zhang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Kingsoft Office(金山办公软件)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究针对主流视觉编码器难以应用于文档图像的问题,提出MonkeyOCRv2模型。通过构建大型文档图像预训练语料库及采用联合预训练策略,在多个文档分析任务中提升性能,并验证其作为视觉编码器在文档解析和理解任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10796 2026-07-14 cs.CV 新提交 57%

Mixture of Cognitive Experts in Large Vision-Language Models

大型视觉语言模型中的认知专家混合体

Robert Wijaya, Ngai-Man Cheung

机构 * Singapore University of Technology and Design (SUTD)(新加坡科技设计大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究大型视觉语言模型中多编码器专家整合难题,提出证据驱动的多模态推理框架,利用布鲁姆分类法及两阶段认知语言化,改进感知和推理能力,实现细粒度分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10329 2026-07-14 cs.CV 新提交 57%

Imperceptible and Reversible Adversarial Examples against Vision-Language Models for Privacy Protection

用于隐私保护的针对视觉语言模型的不可察觉且可逆的对抗性示例

Qi Lu, Ziqi Zhou, Yufei Song, Zijing Li, Lulu Xue, Minghui Li, Shengshan Hu, Leo Yu Zhang

机构 * School of Cyber Science and Engineering, Huazhong University of Science and Technology(华中科技大学网络空间安全学院) College of Computer Science, Chongqing University(重庆大学计算机科学学院) School of Software and engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究针对视觉语言模型基于文本的隐私攻击问题,提出CloakDiff框架,结合扩散对抗编辑与可逆网络生成不可察觉的对抗性示例,设计EDM启发式采样提高保真度,实验证明该框架能实现多模态隐私保护且具高视觉质量和可逆性。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10269 2026-07-14 cs.CR 新提交 50%

Devil in the Lens: Analyzing and Defending Physical Prompt Injection Against Vision-Language Models on Wearable Devices

镜头中的恶魔:分析并防御可穿戴设备上针对视觉语言模型的物理提示注入

Yaxin Li, Hao Wang, Yanda Shao, Shuhao Zhang, Yan Long

专题命中 图文多模态 :multimodal(abstract)

AI总结 研究针对可穿戴设备上视觉语言模型的物理提示注入攻击,利用真实环境照片分析出6种威胁向量及对12个模型的影响,攻击成功率高,还提出基于掩码的外部过滤器和基于语义向量的内部检测器两种防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 7 篇

2607.10299 2026-07-14 cs.LG 新提交 85%

Empowering Long-form Omni-modal Understanding with Robust Audio Perception

通过强大的音频感知增强长格式全模态理解

Kaiying Yan, Luoyi Sun, Xiao Zhou, Weidi Xie

机构 * SAI, Shanghai Jiao Tong University(上海交通大学 上海人工智能研究院) Zhejiang University(浙江大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 音频语音多模态 :omni-modal(title,abstract);multimodal(abstract);audio-visual(abstract)

AI总结 为解决全模态理解不足问题,提出AVDC数据集及AVDC-QA-CoT数据集,利用现成模型标注视频,采用两阶段训练范式,在多下游任务实验中取得显著性能提升,推动全模态感知发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11654 2026-07-14 cs.RO cs.SE 新提交 78%

A Model for Mediating Multi-Modal Human Intent into Safe Maneuvers for UAVs

一种将多模态人类意图转化为无人机安全机动的中介模型

Sofia Nelson, Dalal Alrajeh, Pedro Antonio Alarcon Granadeno, Jane Cleland-Huang

机构 * University of Notre Dame(诺丁汉大学) Imperial College London(伦敦帝国理工学院)

专题命中 音频语音多模态 :multi-modal(title,abstract)

AI总结 研究如何将多模态人类意图转化为无人机安全机动,提出需求导向的机动响应模型,通过结构化管道处理操作员输入,经多种约束验证后执行,还形式化为此类规范模型,经实验室验证可可靠解释并安全执行相关输入。

Comments 11 pages, 4 figures, preprint for MODRE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11487 2026-07-14 cs.CL cs.AI cs.CV cs.HC cs.MM 新提交 70%

LightMem-Ego: Your AI Memory for Everyday Life

LightMem-Ego:适用于日常生活的人工智能记忆

Yijun Chen, Boyi Xiao, Yixian Zhao, Haoting Xia, Buqiang Xu, Jizhan Fang, Yanya Li, Yaqi Zheng, Xuehai Wang, Zirui Xue, Liuxin Zhang, Hui Li, Ningyu Zhang

机构 * Zhejiang University(浙江大学) South China University of Technology(华南理工大学) Central China Normal University(华中师范大学) Lenovo Group Limited(联想集团有限公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对移动和可穿戴设备上个人AI助手回答过去经历查询难的问题,提出LightMem-Ego轻量级流多模态记忆系统,能捕获、对齐并组织视觉和音频流成分层记忆,基于多模态证据生成答案,可部署在多种设备上提供多种支持。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11120 2026-07-14 cs.CV cs.CL eess.AS 新提交 67%

Simple Features and Honest Calibration for Ambivalence and Hesitancy Recognition in Video

视频中矛盾与犹豫识别的简单特征与诚实校准

Vikas Kumar, Aditya Mishra, Haroon R. Lone

机构 * Indian Institute of Science Education and Research Bhopal(印度科学教育与研究学院博帕尔分院)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、cs.CL、eess.AS

AI总结 针对ABAW 2026 BAH挑战赛中的矛盾与犹豫识别问题,系统结合情感专用多模态表示与语言犹豫线索,经AMF融合及AP加权集成。引入‘ASR擦除时间’构建特征,实验表明语言是最强通道,校准比架构重要,固定阈值AP加权测试集得分0.731。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10628 2026-07-14 cs.CL cs.AI cs.HC 新提交 62%

Anamnesis: An Open-Source Platform for Large-Scale Backstory-Conditioned Survey Simulation

记忆回溯:一个用于大规模背景条件调查模拟的开源平台

Song-Ze Yu, Joseph Suh, Serina Chang, David M. Chan

机构 * University of California, Berkeley(加利福尼亚大学伯克利分校)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 介绍开源平台记忆回溯,用于大规模背景条件调查模拟。它运用大语言模型,基于文集和他性框架,支持多模态调查。通过案例研究评估,其产生的意见分布更接近真实数据,为专有模拟服务提供替代。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11792 2026-07-14 cs.RO eess.AS 新提交 57%

Casting Everything to Online API Services? A Survey of Integrating Localized Speech Recognition Models in Robotic Systems

将所有内容都转换为在线 API 服务?关于在机器人系统中集成本地化语音识别模型的综述

Sheng Li, Jing Li, Felix Schijve, Jun Hu, Emilia Barakova

机构 * Institute of Science Tokyo(东京科学研究所) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 综述自动语音识别技术在机器人系统中的集成,涵盖其从传统到深度学习模型的演变、相关数据集与工具包,介绍基于 ASR 模型家族等的部署策略及实际平台,指出挑战与未来方向,助力社交机器人研究人员探索人机交互领域。

Comments accepted in 18th International Conference on Social Robotics (ICSR + ART 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10494 2026-07-14 cs.SE 新提交 50%

Question Answering for Diagram-Rich Technical Meeting Videos

面向富含图表的技术会议视频的问答

Zhuoran Xu, Jia Li, Dayuan Tan, Mark Cole, Ish Ashraf, Sandeep Puri, Mehrdad Sabetzadeh, Shiva Nejati

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 研究面向富含图表的技术会议视频的问答问题,核心方法是开发基于大语言模型的多模态问答系统LMVQA,主要贡献是显著提高答案准确性,降低响应时间和成本,获领域专家认可。

Comments Accepted for publication in ICSME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 12 篇

2607.11839 2026-07-14 cs.CV cs.AI 新提交 81%

LoRA-Based Cascaded Multimodal Fusion for Action Recognition in Medical Training Environments

基于LoRA的级联多模态融合在医学训练环境中的动作识别

Divya Mereddy, Jeevan Beedareddy

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究面向医疗训练环境的动作识别,提出基于LoRA的级联多模态融合框架,结合特定模态适应与顺序融合,无需重新训练组件,在两个数据集上评估,结果显示该策略优于单模态模型且性能有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10206 2026-07-14 cs.RO cs.AI 新提交 79%

Source-Lifted Flow Matching for Intervenable Multimodal Imitation

用于可干预多模态模仿的源提升流匹配

He Zhang, Ying Sun, Pengteng Li, Ziyang Chen, Yiren Zhao, Ziyang Rao, Weiyu Guo, Yandong Guo, Hui Xiong

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 研究提出源提升流匹配(SL - FM)解决多模态模仿学习中流匹配策略随机性被动问题,核心机制为正交源提升,实验表明其能将被动源随机性转化为可操作变量,提升多模态控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09955 2026-07-14 cs.LG cs.AI 新提交 79%

A Foundation Model for Multimodal Event Sequences in Financial Applications

金融应用中多模态事件序列的基础模型

Nikita Rusakov, Vladislav Meshkov, Konstantin Zorin, Gleb Zaripov, Alexander Uglov, Alexey Vasilev, Anton Klenitskiy

机构 * Sber(俄罗斯储蓄银行) Sber AI Lab(俄罗斯储蓄银行人工智能实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 研究金融应用中多模态事件序列预测建模,提出预训练基础变压器模型统一多源事件成序列,经下一个事件预测学习通用表示,结合现有特征训练轻量级神经模型用于多下游任务,优于传统模型并减少开发开销且已应用取得业务改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11570 2026-07-14 cs.RO cs.HC 新提交 78%

ERR@HRI 3.0 Challenge: Multimodal Detection of Errors and Anticipation in Human-Robot Interactions

ERR@HRI 3.0 挑战赛:人机交互中错误与预期的多模态检测

Maria Teresa Parreira, Micol Spitale, Maia Stiber, Shiye Cao, Amama Mahmood, Chien-Ming Huang, Hatice Gunes, Wendy Ju

机构 * Cornell University(康奈尔大学) Microsoft Research(微软研究院) Johns Hopkins University(约翰霍普金斯大学) University of Cambridge(剑桥大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 ERR@HRI 3.0 挑战赛提供自然场景视频数据集,供研究者开发多模态机器学习模型检测人机交互错误与预期,三个团队提交的有效模型超卷积神经网络基线,为构建相关检测系统提供了数据、任务、基线及结果等参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11270 2026-07-14 cs.RO cs.AI 新提交 70%

Towards Predictive, Aligned, and Scalable Robot Learning

迈向可预测、对齐且可扩展的机器人学习

Peijun Tang, Shangjin Xie, Baifu Huang, Binyan Sun, Haotian Yang, Kuncheng Luo, Weiqi Jin, Shilin Fang, Jianan Wang

机构 * Astribot Team(Astribot团队)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 研究旨在实现可预测、对齐且可扩展的机器人学习。核心方法是引入Lumo - 2潜在世界 - 动作模型,提出多阶段模态预对齐策略。主要贡献是该模型在实证研究中表现出色,优于基线,验证了结构化多模态对齐和预测推理对具身智能的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10706 2026-07-14 cs.RO cs.AI cs.CV cs.LG 新提交 62%

Action Map Policy: Learning 3D Closed-loop Manipulation via Pixel Classification

动作映射策略:通过像素分类学习3D闭环操作

Haojie Huang, Zhang Ye, Linfeng Zhao, Boce Hu, Mingxi Jia, Yu Qi, Ahmed Agha, Dian Wang, Robert Platt, Robin Walters

机构 * Northeastern University(东北大学) Stanford University(斯坦福大学) Brown University(布朗大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对机器人学习中动作空间的挑战,提出动作映射策略(AMP),将3D闭环操作策略学习转为图像空间分类问题,通过投影动作到图像平面,以像素为类别控制维度,实现高精度、快速推理,实验证明其优于基线。

Comments Project Website: https://haojhuang.github.io/amp_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09773 2026-07-14 cs.AI cs.CL cs.LG 新提交 62%

EvoCUA-1.5: Online Reinforcement Learning for Multi-turn Computer-Use Agents

EvoCUA-1.5:用于多轮计算机使用智能体的在线强化学习

Mianqiu Huang, Taofeng Xue, Chong Peng, Jinrui Ding, Sicheng Fan, Jiale Hong, Yufei Gao, Xiaocheng Zhang, Linsen Guo, Xin Yang, Dengchang Zhao, Yuchen Xie, Peng Pei, Xunliang Xie, Xipeng Qiu

机构 * Meituan(美团) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 研究多轮计算机使用智能体的在线强化学习问题,提出EvoCUA-1.5,通过STEPO、DTAC等方法应对多轮交互挑战,经实验验证其提高了训练稳定性和下游性能,为在线强化学习提供实用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11646 2026-07-14 cs.CV cs.RO 新提交 57%

Event-RGB Adaptive Tracking for Nighttime Highway Perception

用于夜间高速公路感知的事件-RGB自适应跟踪

Haidong Wang, Hengxing Cai, Wanlei Li, Xiaogang Xiong, Renxin Zhong

机构 * School of Intelligent Systems Engineering, Sun Yat-sen University(中山大学智能系统工程学院) School of Intelligence Science and Engineering, Harbin Institute of Technology(哈尔滨工业大学智能科学与工程学院)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 针对高速公路夜间低光条件下RGB感知性能差的问题,提出JEAT框架,通过自适应扩展卡尔曼滤波器动态融合事件流与RGB帧,还创建SEHN数据集,为多模态融合研究提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10990 2026-07-14 cs.CV 新提交 57%

TreeSoc: Tree-Structured Dynamic Reasoning and Tool Synergy for Soccer Video Understanding

TreeSoc:用于足球视频理解的树状结构动态推理与工具协同

Thanh-Nhan Vo, Thanh-Khoi Nguyen, Trong-Thuan Nguyen, Trung-Hoang Le, Minh-Triet Tran

机构 * University of Science, VNU-HCM(胡志明市越南国立大学科学大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 针对当代视觉语言模型理解足球视频的挑战,提出TreeSoc框架,通过动态深度优先搜索机制分解查询,支持自适应工具路由,在多个数据集上取得优异成绩,证明其为视频理解的有效范式。

Comments Accepted to ICMV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10369 2026-07-14 cs.RO cs.AI 新提交 57%

VINE: Taming Generative Control Policies for Reinforcement Learning

VINE:驯服强化学习中的生成控制策略

Rushuai Yang, Zhuo Han, Houlin Li, Hecheng Wang, Zhichao Wu, Rui Zhang, Zhaowei Zhang, Zihong Chen, Xiaohan Yan, Chiming Liu, Yi Chen, Wei Shan, Maoqing Yao

机构 * AgiBot(未知机构) The Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究针对流匹配策略在值梯度强化学习中训练不稳定的问题,提出VINE方法。该方法通过在去噪步骤重建插值状态,创建稳定可微路径,实现稳定的端到端值梯度优化,在相关基准和任务中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10098 2026-07-14 cs.CV cs.LG 新提交 57%

DynaFilter: Cloud-driven Dynamic Filtering for Satellite Edge Intelligence

DynaFilter:用于卫星边缘智能的云驱动动态过滤

Ziyang Zhang, Jie Liu, Luca Mottola

机构 * Politecnico di Milano(米兰理工大学) Harbin Institute of Technology Shenzhen(哈尔滨工业大学(深圳))

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对卫星边缘系统带宽受限等问题,设计DynaFilter动态过滤技术,通过建立云查询语义与压缩域特征的映射,让边缘设备在压缩域直接进行选择性RoI推理,实现减少数据量、节省带宽、降低能耗及加快推理延迟等效果。

Comments 15 pages, 23 figures, accepted by ACM MobiCom 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09746 2026-07-14 q-bio.QM eess.IV 新提交 50%

Longitudinal MRI template of the baboon brain from birth to adolescence

从出生到青春期的狒狒大脑纵向MRI模板

Katherine L. Bryant, Arnaud Le Troter, David Meunier, Yannick Becker, Scott A. Love, Siham Bouziane, Kep Kee Loh, Julien Sein, Luc Renaud, Olivier Coulon, Adrien Meguerditchian

专题命中 视频多模态 :multi-modal(abstract)

AI总结 该研究针对狒狒大脑从出生到青春期的发育,提出BABACOOL方法创建多模态发育图谱,生成BaBa21纵向发育模板,还提供全自动生成中间年龄模板的方法,为狒狒数据归一化及相关研究提供便利。

Comments 21 pages, 6 Figures, 6 Supplementary Figures, In Press

Journal ref Imaging Neuroscience, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 3 篇

2607.10909 2026-07-14 cs.IR 新提交 78%

Stream-aware Side Adaptation for Large Pre-trained Multimodal Embedding Models in Sequential Recommendation

用于序列推荐中大型预训练多模态嵌入模型的流感知侧适应

Junchen Fu, Kaiwen Zheng, Ioannis Arapakis, Wenhao Deng, Xin Xin, Joemon M. Jose, Xuri Ge

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 针对大型预训练多模态嵌入模型用于序列推荐时因域不对准性能不佳的问题,提出Stresa框架,通过流感知隐藏适配器融合和残差流适配器,有效解锁模型潜力,实验证明其性能优于标准侧适配器和基线。

Comments Accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10698 2026-07-14 cs.LG cs.CV 新提交 74%

On the modality gap and the contrastive loss in multi-modal representation learning

关于多模态表示学习中的模态差距和对比损失

Fabian Mager, Hiba Nassar, Lars Kai Hansen

机构 * Technical University of Denmark(丹麦技术大学)

专题命中 跨模态检索 :multi-modal(title);分类 cs.CV

AI总结 研究CLIP风格双编码器对比学习中的模态差距,发现是InfoNCE公式在低温下的模式失败所致。提出xNCE方法,使用跨模态和模态内负对比对,能缩小模态差距,提升零样本分类性能且不牺牲判别几何。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09697 2026-07-14 cs.LG 新提交 50%

Safe responses matter: Output-aware safety guardrail mitigate over-refusal in MLLMs

安全响应很重要:输出感知安全护栏减轻多模态大语言模型中的过度拒绝

Jiayi Li, Kun Zhan

机构 * Lanzhou University(兰州大学)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 研究多模态大语言模型安全机制权衡问题,提出输出感知安全护栏范式,通过在模型隐藏状态空间预测及多实例对比学习训练分类器,减少过度拒绝,匹配安全性能,保留模型效用与安全能力。

Comments Accepted to ECCV 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏