arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-21 至 2026-07-21 共收录 54 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4 篇

2510.00037 2026-07-21 cs.CV cs.AI cs.RO 版本更新 84%

RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations

针对多模态扰动的视觉-语言-动作模型的鲁棒性

Jianing Guo, Zhenhong Wu, Chang Tu, Yiyao Ma, Xiangqi Kong, Zhiqian Liu, Jiaming Ji, Shuning Zhang, Yuanpei Chen, Kai Chen, Qi Dou, Yaodong Yang, Xianglong Liu, Huijie Zhao, Weifeng Lv, Simin Li

专题命中 图文多模态 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出RobustVLA,通过多模态鲁棒优化提升视觉-语言-动作模型在多种扰动下的鲁棒性,实验表明其在性能和推理速度上均优于现有方法。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03117 2026-07-21 cs.CV 版本更新 70%

Revealing Physical-World Semantic Vulnerabilities: Universal Adversarial Patch for Infrared Vision-Language Models

揭示物理世界语义漏洞:用于红外视觉语言模型的通用对抗性补丁

Chengyin Hu, Yuxian Dong, Yikun Guo, Xiang Chen, Qike Zhang, Junqi Wu, Jiahuan Long, Jiujiang Guo, Yiwei Wei, Tingsong Jiang, Wen Yao

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出通用曲网格补丁框架UCGP,用于揭示红外视觉语言模型的语义鲁棒性漏洞,通过扰动视觉表征空间以削弱跨模态语义对齐,验证了其在多种架构和数据集上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06491 2026-07-21 cs.RO cs.AI 版本更新 57%

TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies

TempoVLA: 学习速度可控的视觉-语言-动作策略

Dong Jing, Jingchen Nie, Tianqi Zhang, Jiaqi Liu, Huaxiu Yao, Zhiwu Lu, Mingyu Ding

机构 * RUC(中国人民大学) FDU(福建大学) UNC(北卡罗来纳大学教堂山分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出TempoVLA,通过可变速度轨迹增强和速度条件机制,实现机器人操作中速度的双向灵活控制,并支持动态速度调节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02924 2026-07-21 cs.CL 版本更新 57%

AutoNeural: Co-Designing Vision-Language Models for NPU Inference

AutoNeural:为 NPU 推理协同设计视觉语言模型

Wei Chen, Liangmin Wu, Yunhai Hu, Zhiyuan Li, Zhiyuan Cheng, Yicheng Qian, Lingyue Zhu, Zhipeng Hu, Luoyi Liang, Qiang Tang, Zhen Liu, Han Yang

机构 * Nexa AI Geely Auto

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CL

AI总结 研究针对 NPU 推理的视觉语言模型硬件与模型不匹配问题,提出 AutoNeural 架构,用深度可分离卷积骨干替换 ViT 编码器,结合状态空间模型与 Transformer 层,提升效率,降低量化误差与延迟,验证了在实际应用中的实时性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 3 篇

2602.18528 2026-07-21 cs.LG cs.SD 版本更新 82%

Audio-Visual Continual Test-Time Adaptation without Forgetting

音频视觉持续测试时间适应无需遗忘

Sarthak Kumar Maharana, Akshay Mehra, Bhavya Ramakrishna, Yunhui Guo, Guan-Ming Su

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract)

AI总结 本文提出AVReCAP方法,在测试时无需源数据即可提升模型性能,通过动态检索最佳融合层参数减少灾难性遗忘。

Comments ECCV 2026 & ICML 2026 Workshop Continual Adaptation at Scale: Towards Sustainable AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03920 2026-07-21 cs.RO 版本更新 78%

LH-AVLN: A Benchmark for Long-Horizon Audio-Visual-Language Navigation

LH-AVLN:长距离视听语言导航基准测试

Rufeng Chen, Yue Chang, Zili Shao, Zhaofan Zhang, Li Chen, Hechang Chen, Hui Xiong, Sihong Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Jilin University(吉林大学)

专题命中 音频语音多模态 :audio-visual(title,abstract)

AI总结 介绍长距离视听语言导航基准LH-AVLN,结合多目标任务执行等。提出免训练参考智能体PAG-Nav,可维护语义地图并规划。实验表明现有智能体完成任务有困难,PAG-Nav提供更强诊断基线。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17576 2026-07-21 cs.CV 版本更新 74%

LoGSAM: Parameter-Efficient Cross-Modal Grounding for MRI Segmentation

LoGSAM: 用于MRI分割的参数高效跨模态接地

Mohammad Robaitul Islam Bhuiyan, Sheethal Bhat, Melika Qahqaie, Andreas Maier, Tri-Thien Nguyen, Paula Andrea Pérez-Toro, Tomás Arias-Vergara

机构 * Pattern Recognition Lab, Friedrich-Alexander-Universität, Erlangen, Germany(德国埃朗根-纽伦堡大学模式识别实验室) Siemens Healthineers, Erlangen, Germany(德国埃朗根西门子医疗)

专题命中 音频语音多模态 :cross-modal(title);分类 cs.CV

AI总结 LoGSAM通过将放射科医生的语音转录为文本提示,利用预训练基础模型实现MRI肿瘤的高效分割,采用LoRA微调提升领域适应性,达到80.32%的Dice分数。

Comments 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 3 篇

2606.19341 2026-07-21 cs.CV cs.CL cs.SD 版本更新 84%

Native Active Perception as Reasoning for Omni-Modal Understanding

原生主动感知作为全模态理解的推理

Zhenghao Xing, Ruiyang Xu, Yuxuan Wang, Jinzheng He, Ziyang Ma, Qize Yang, Yunfei Chu, Jin Xu, Junyang Lin, Chi-Wing Fu, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队)

专题命中 视频多模态 :omni-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.CL

AI总结 提出OmniAgent,一种基于POMDP迭代观察-思考-行动循环的原生全模态智能体,通过主动感知将推理复杂度与视频时长解耦,在多个基准上达到开源模型最优性能。

Comments Accepted at ICML 2026. Code and models: https://github.com/harryhsing/omniagent

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04723 2026-07-21 eess.SP 版本更新 78%

CIG-MAE: Cross-Modal Information-Guided Masked Autoencoder for Self-Supervised WiFi Sensing

CIG-MAE:用于自监督WiFi感知的跨模态信息引导掩码自动编码器

Gang Liu, Yanling Hao, Yixuan Zou

专题命中 视频多模态 :cross-modal(title,abstract)

AI总结 研究利用WiFi CSI进行人类行为识别,针对监督方法受限及现有SSL不适用于CSI的问题,提出CIG-MAE,采用对称双流架构、自适应掩码策略和正则化器,实验证明其在多方面优于现有方法,提升了数据效率等。

Comments 12 pages, 7 figures. Published in IEEE Internet of Things Journal (Early Access)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13247 2026-07-21 cs.CV 版本更新 57%

STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits

STARCaster:用于身份和视图感知的会说话肖像的时空自回归视频扩散

Foivos Paraperas Papantoniou, Stathis Galanakis, Rolandos Alexandros Potamias, Bernhard Kainz, Stefanos Zafeiriou

机构 * Imperial College London, UK(伦敦帝国理工学院) FAU Erlangen–Nürnberg, Germany(埃朗根-纽伦堡大学)

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV

AI总结 研究提出STARCaster模型,通过重新思考参考和几何范式,采用组合方法及解耦学习,解决语音驱动肖像动画和动态视点控制问题,能有效泛化,超越先前方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 3 篇

2604.25693 2026-07-21 cs.AI 版本更新 83%

RADD: Retrieval-Augmented Discrete Diffusion for Multi-Modal Knowledge Graph Completion

RADD:基于检索的离散扩散用于多模态知识图谱补全

Guanglin Niu, Bo Li

机构 * School of Artificial Intelligence, Beihang University(北航人工智能学院)

专题命中 跨模态检索 :multi-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 本文提出RADD框架,通过分离检索与重排序过程,提升多模态知识图谱补全的性能,实验表明其在多个基准上表现最佳。

Comments 13 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10677 2026-07-21 cs.CL cs.AI 版本更新 62%

A Survey on Knowledge-Oriented Retrieval-Augmented Generation

面向知识的检索增强生成综述

Mingyue Cheng, Yucong Luo, Jie Ouyang, Qi Liu, Huijie Liu, Li Li, Shuo Yu, Bohou Zhang, Jiawei Cao, Jie Ma, Daoyu Wang, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 该综述对检索增强生成进行全面概述,涵盖其基本组件、关键特性、分类法、评估基准及应用等,讨论了相关挑战与新兴研究方向,强调其在自然语言处理中应对现实挑战及推动发展的潜力。

Comments Accepted by ACM Transactions on Information Systems (TOIS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05353 2026-07-21 cs.LG cs.IT math.IT 版本更新 50%

GlyRAG: Context-Aware Retrieval-Augmented Framework for Blood Glucose Forecasting

GlyRAG:用于血糖预测的上下文感知检索增强框架

Shovito Barua Soumma, Hassan Ghasemzadeh

机构 * College of Health Solutions, Arizona State University(亚利桑那州立大学健康解决方案学院) School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 研究旨在利用连续血糖监测数据进行准确血糖预测,开发了GlyRAG框架,结合大语言模型提取上下文信息并通过检索增强预测,在OhioT1DM和AZT1D数据集上评估,显著提高长期预测的均方根误差,多数预测落在临床可接受区域。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 7 篇

2607.13125 2026-07-21 cs.CV cs.AI 版本更新 81%

Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget

Boogu-Image-0.1:提升开源统一多模态理解与生成能力

Guoxuan Chen, Chufeng Xiao, Haoran Yang, Siyue Xie, Binxiao Huang, Ming Zhang, Cheuk Him Chau, Xinyu Fu, Yingzhao Lian, Tom S. Y. Li, Jintao Lin, Bowen Dong, Zian Qian, Yuhao Liu, Yuxuan Hu, Weikang Shi, Bin Zou, Bowen Zheng, Haoxuan Che, Chang Chen, Yuyang He, Heyang Sun, Tianyu Huang, Chong Hou Choi, Cheng Gong, Han Shi, Haoli Bai, Xihui Liu, Hongsheng Li, Qifeng Chen, Chao Huang, Rui Liu, Chenyang Lei

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 介绍开源统一多模态模型Boogu-Image-0.1,通过改进模型理解、数据质量和训练管道等,结合智能推理扩展,提升生成和编辑性能,在标准基准测试中表现出色,成本低,还分享实践讨论并开源代码等推动相关生态发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19789 2026-07-21 cs.CV 版本更新 79%

OmniMotion-X: Versatile Multimodal Whole-Body Motion Generation

OmniMotion-X:通用多模态全身运动生成

Guowei Xu, Yuxuan Bian, Ailing Zeng, Zhuo Chen, Mingyi Shi, Shaoli Huang, Wen Li, Lixin Duan, Qiang Xu

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 介绍用于全身人类运动生成的OmniMotion-X框架,利用自回归扩散变换器,提出参考运动等方法,构建数据集并采用新训练策略,超越现有方法,在多模态任务中表现出色,可交互式生成逼真连贯可控的长时间运动。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12923 2026-07-21 eess.SY cs.SY 版本更新 78%

Information-Optimal Formation Geometry Design for Multimodal UAV Cooperative Perception

多模态无人机协同感知的信息最优编队几何设计

Kai Xiong, Xingyu Wu, Anna Duan, Gang Li, Yongjun Huang, Supeng Leng, Jianhua He

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 针对多模态无人机协同感知,提出信息最优优化框架,通过最大化Fisher信息矩阵行列式优化分配与控制,引入等效编队转换策略及稳定飞行控制方案,相比传统方法,视场覆盖、通信信号强度和能耗等方面有显著提升,验证了任务驱动几何分配的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26800 2026-07-21 cs.CV cs.GR cs.LG 版本更新 70%

OmniX: From Unified Panoramic Generation and Perception to Graphics-Ready 3D Scenes

OmniX:从统一全景生成与感知到适用于图形的3D场景

Yukun Huang, Jiwen Yu, Yanning Zhou, Jianan Wang, Xintao Wang, Pengfei Wan, Xihui Liu

机构 * University of Hong Kong(香港大学) Kuaishou Technology(快手科技) Tencent(腾讯)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究基于全景的2D提升技术,提出OmniX框架,利用跨模态适配器结构和循环空间算子,将预训练2D流匹配先验用于多模态联合建模,构建数据集,实现适用于图形的3D场景生成,为虚拟世界创建开辟新可能。

Comments ECCV 2026; Project page: https://yukun-huang.github.io/OmniX/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00126 2026-07-21 cs.RO 版本更新 50%

Compositional Diffusion with Guided Search for Long-Horizon Planning

用于长期规划的带引导搜索的组合扩散

Utkarsh A Mishra, David He, Yongxin Chen, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究针对组合生成模型在局部分布多模态时的模式平均问题,提出带引导搜索的组合扩散方法(CDGS),通过特定采样、过滤和重采样解决问题,在机器人操作任务上表现出色且跨领域通用。

Comments 38 pages, 18 figures, ICLR 2026 ORAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10201 2026-07-21 cs.GR 版本更新 50%

B-repLer: Language-guided Editing of CAD Models

B-repLer:CAD模型的语言引导编辑

Yilin Liu, Niladri Shekhar Dutt, Changjian Li, Niloy J. Mitra

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究语言引导的CAD编辑问题,提出B-repLer框架直接连接自然语言与CAD模型编辑,绕过构建历史,还引入数据集,展示其自动生成等方法,能对复杂CAD形状准确执行复杂编辑。

Comments Accepted by SIGGRAPH 2026; Project page at https://yilinliu77.github.io/brepler.github.io Code at https://github.com/yilinliu77/Brepler

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10051 2026-07-21 q-bio.NC cs.ET 版本更新 50%

An Intelligent Infrastructure as a Foundation for Modern Science

作为现代科学基础的智能基础设施

Satrajit S. Ghosh

专题命中 多模态生成 :multimodal(abstract)

AI总结 以神经科学多模态和多尺度数据增长为背景,提出将基础设施转变为动态、与人工智能契合的生态系统的范式转变,给出实施原则的操作指南,强调人工智能协调作用,有望加速科学发现并转化为社会利益。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 10 篇

2606.25325 2026-07-21 cs.AI 版本更新 85%

Omni-Perception Policy Optimization for Multimodal Emotion Reasoning

全模态感知策略优化用于多模态情感推理

Zhiyuan Han, Beier Zhu, Wenwen Tong, Pengyang Shao, Peipei Song, Xinyi Wang, Jiangnan Chen, Lewei Lu, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) SenseTime Research(商汤科技研究院) National University of Singapore(新加坡国立大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);omni-modal(abstract);分类 cs.AI

AI总结 提出OPPO强化学习框架,通过全模态感知奖励和损失优化多模态感知,提升情感推理中模态利用率和忠实度,在多个基准上达到最优。

Comments Accepted at ICML 2026. Project page: https://zjycutieee.github.io/OPPO-page/ Code: https://github.com/ZhiyuanHan-Aaron/OPPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06618 2026-07-21 cs.CV cs.AI 版本更新 84%

Overview of the NLPCC 2026 Shared Task 1: Difficulty-Aware Multilingual and Multimodal Medical Instructional Video Understanding Evaluation

NLPCC 2026共享任务1概述:难度感知多语言多模态医学教学视频理解评估

Shenxi Liu, Kan Li, Mingyang Zhao, Yuhang Tian, Bin Li

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与工程学院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 NLPCC 2026的DA - MIVQA共享任务,通过区分问题难度扩展多语言多模态医学视频基准,含三个赛道。其数据集来自公共医学教学渠道,涵盖多种场景并经人工标注难度。该任务为评估医学教学视频问答系统提供实用基准。

Comments 19 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04141 2026-07-21 cs.CV cs.CL 版本更新 84%

MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos

MMR-V:未言明的是什么?视频中多模态深度推理的基准测试

Kejian Zhu, Zhuoran Jin, Hongbang Yuan, Jiachun Li, Shangqing Tu, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院,北京,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 针对视频多模态推理挑战,提出MMR-V基准测试,具有长程多帧推理等特点。该基准测试含317个视频和1257个任务,实验发现当前模型多模态推理困难,最佳模型准确率低,现有增强策略收益有限,旨在推动多模态推理能力研究。

Comments Accepted at ICLR 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08879 2026-07-21 cs.CL 版本更新 83%

GRASP: Grounded CoT Reasoning with Dual-Stage Optimization for Multimodal Sarcasm Target Identification

GRASP:基于双阶段优化的 grounded CoT 推理用于多模态讽刺目标识别

Faxian Wan, Xiaocui Yang, Yifan Cao, Shi Feng, Daling Wang, Yifei Zhang

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 GRASP通过整合视觉定位与显式Co-T推理,解决多模态讽刺目标识别中的细粒度定位问题,提出MSTI-MAX数据集和双阶段联合优化策略,实验表明其在多模态讽刺目标识别中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20804 2026-07-21 cs.AI 版本更新 83%

MMGraphRAG: Bridging Vision and Language with Interpretable Multimodal Knowledge Graphs

MMGraphRAG: 通过可解释的多模态知识图谱弥合视觉与语言的鸿沟

Xueyao Wan, Hang Yu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 MMGraphRAG通过引入可解释的多模态知识图谱,解决多模态场景下的实体链接和跨模态推理问题,实现最先进的多模态信息处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12775 2026-07-21 cs.MM cs.AI cs.CL 版本更新 82%

Unsupervised Multimodal Clustering for Semantics Discovery in Multimodal Utterances

用于多模态话语语义发现的无监督多模态聚类

Hanlei Zhang, Hua Xu, Fei Long, Xin Wang, Kai Gao

机构 * State Key Laboratory of Intelligent Technology and Systems, Department of Computer Science and Technology, Tsinghua University(智能技术与系统国家重点实验室,计算机科学与技术系,清华大学) School of Information Science and Engineering, Hebei University of Science and Technology(信息科学与工程学院,河北科技大学) Samton (Jiangxi) Technology Development Co.,Ltd(江西松通科技发展有限公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 本文针对多模态话语语义发现问题,提出无监督多模态聚类方法UMC。通过构建增强视图预训练、动态选样及自动确定参数优化样本选择,在基准数据集上实验,UMC比现有方法聚类指标提升2-7%,取得开创性成果。

Comments Accepted by ACL 2024, Main Conference, Long Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14957 2026-07-21 cs.CV 版本更新 79%

Learning Sparse Latent Predictive Foundation Model for Multimodal Neuroimaging

学习用于多模态神经影像的稀疏潜在预测基础模型

Haoxu Huang, Long Chen, Jingyun Chen, Jinu Hyun, James Ryan Loftus, Kara Melmed, Daniel Orringer, Jennifer Frontera, Seena Dehkharghani, Arjun Masurkar, Narges Razavian

机构 * New York University, Center for Data Science(纽约大学数据科学中心) NYU Grossman School of Medicine, Department of Radiology(纽约大学格罗斯曼医学院放射学系) State University of New York at Binghamton, School of Computing(纽约州立大学宾汉姆顿分校计算机学院) NYU Grossman School of Medicine, Department of Neurology(纽约大学格罗斯曼医学院神经病学系) NYU Grossman School of Medicine, Department of Neurosurgery(纽约大学格罗斯曼医学院神经外科学系) NYU Grossman School of Medicine, Department of Pathology(纽约大学格罗斯曼医学院病理学系) School of Medicine, Department of Radiology, Stanford(斯坦福大学医学院放射学系) NYU Grossman School of Medicine, Department of Neuroscience(纽约大学格罗斯曼医学院神经科学系) NYU Grossman School of Medicine, Neuroscience Institute(纽约大学格罗斯曼医学院神经科学研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 提出Neuro-JEPA模型,结合潜在预测目标和专家混合架构,学习T1w、T2w和FLAIR三种MRI序列的统一表示,在25项临床任务和22项公开数据集任务上优于现有基础模型和CNN基线。

Comments Under Review Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27958 2026-07-21 cs.AI 版本更新 79%

CARV: A Diagnostic Benchmark for Compositional Analogical Reasoning in Multimodal LLMs

CARV:多模态大语言模型中组合类比推理的诊断基准

Yongkang Du, Xiaohan Zou, Minhao Cheng, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出CARV任务及5500样本数据集,评估多模态大语言模型在组合类比推理中的能力,发现Gemini-2.5 Pro准确率仅为40.4%,远低于人类水平,揭示模型在规则提取与组合变换上的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10922 2026-07-21 cs.AI 版本更新 79%

Data-Efficient Curation for Multimodal Reasoning under Fixed Training Protocols

固定训练协议下多模态推理的数据高效整理

Yosub Shin, Michael Buriek, Boris Sobolev, Pavel Bushuyeu, Vikas Kumar, Haoyang Xu, Samuel Watson, Igor Molybog

机构 * University of Hawai'i at M\=anoa, Honolulu, HI, USA

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 研究固定协议微调下多模态推理的数据整理,以NeurIPS 2025 DCVLR挑战为测试平台,分析多种因素对推理准确性的影响,发现对齐源语料库的难度过滤增益最强,为数据受限的多模态推理微调提供经验方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20575 2026-07-21 cs.CV 版本更新 57%

An interactive enhanced driving dataset for autonomous driving

一种交互增强的自动驾驶数据集

Haojie Feng, Xinrui Zhang, Mengjie Tian, Peizhi Zhang, Zhuoren Li, Junpeng Huang, Xiurong Wang, Junfan Zhu, Jianzhou Wang, Dongxiao Yin, Lu Xiong

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出交互增强驾驶数据集,通过生成合成视频实现多模态对齐,用于评估和优化自动驾驶模型的推理能力。

Comments Accepted for publication in Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏