arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-25 至 2026-06-25 共收录 15 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 15 篇

2606.24187 2026-06-25 cs.CV 新提交 79%

Towards Fast and Effective Long Video Understanding of Multimodal Large Language Models via Adaptive Quasi-Gaussian Sampling

面向多模态大语言模型的长视频快速有效理解:自适应准高斯采样

Kun Zhang, Chenxin Fang, Tao Chen, Baiyang Song, Yunhang Shen, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出自适应无训练帧采样方法AdaQ,基于高斯分布3-σ规则动态调整采样区间,在仅用64帧下使Qwen3-VL-8B平均超越GPT4o 15.8%,显著提升长视频理解的鲁棒性和效率。

Comments NeurIPS 2026 submission. 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25352 2026-06-25 astro-ph.IM 新提交 71%

M-EPDet: Real-Time Real-Bogus Classification and Transient Candidate Judgement for the EP-WXT Pipeline via Multi-Modal Data

M-EPDet:基于多模态数据的EP-WXT流水线实时真实-虚假分类与瞬变候选判断

Lang Chen, Yunfei Xu, Zhen Zhang, Dongyue Li, Hui Sun, Yuan Liu, Chenzhou Cui, Jinhui Xie, XiaoXiong Zuo, Shirui Wei, Wujun Shao

专题命中 视频多模态 :multi-modal(title)

AI总结 提出M-EPDet三阶段框架,结合ResNet臂滤波器、双分支时-谱宇宙射线滤波器和背景感知贝叶斯块模块,实现EP-WXT数据实时候选筛选,真实源召回率98.31%,候选量减少99.25%。

Comments 20 pages, 13 figures, accepted by ApJS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25658 2026-06-25 cs.CV 新提交 70%

Towards a Dynamic and Fixed-budget Memory Bank for Efficient Streaming Video Understanding

面向高效流式视频理解的动态固定预算记忆库

Baiyang Song, Yuli Lin, Qiong Wu, Tao Chen, Jun Peng, Xiao Chen, Yiyi Zhou, Rongrong Ji

机构 * Xiamen University(厦门大学)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 提出无训练方法CausalMem,通过在线语义基动态更新记忆库,在有限预算下最大化流式视频信息量,实现20倍视觉令牌压缩和82MB存储。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25585 2026-06-25 cs.CV 新提交 70%

FeVOS: Foresight Expression Video Object Segmentation

FeVOS:前瞻性表达视频目标分割

Kehan Lan, Kaining Ying, Henghui Ding

机构 * Institute of Big Data, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院大数据研究所)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出前瞻性表达视频目标分割任务,通过推理时空线索预测未来目标,并构建FeVOS数据集和FeVOS-R1模型,实现最先进性能。

Comments Accepted by ECCV 2026. Homepage: https://henghuiding.com/FeVOS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07512 2026-06-25 cs.CV cs.AI cs.CL 新提交 67%

MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism

MemDreamer: 通过分层图记忆和智能体检索机制解耦感知与推理以实现长视频理解

Cong Chen, Guo Gan, Kaixiang Ji, ZhaoYang Zhang, Zhen Yang, Guangming Yao, Hao Chen, Jingdong Chen, Yi Yuan, Chunhua Shen

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学) Central South University(中南大学) HKUST(GZ)(香港科技大学(广州))

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出MemDreamer框架,通过分层图记忆和智能体检索机制解耦感知与推理,将长视频理解转化为智能体探索过程,在四个基准上达到SOTA,推理上下文窗口仅占全量2%且准确率提升12.5点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16863 2026-06-25 cs.CV cs.AI cs.CL 版本更新 67%

Position: Reasoning After Perception Means Reasoning Without Vision

立场:感知之后推理意味着无视觉推理

Hongcheng Gao, Zihao Huang, Jingyi Tang, Lin Xu, Xinhao Li, Haoyang Li, Yue Liu, Minhua Lin, Xinlong Yang, Taihang Hu, Ge Wu, Balong Bi, Hongyu Chen, Olive Huang, Wentao Zhang

机构 * Tsinghua University(清华大学) Peking University(北京大学) National University of Singapore(新加坡国立大学) Zhongguancun Academy(中关村学院) Nanjing University(南京大学) Nankai University(南开大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文质疑多模态研究中语言推理能弥补视觉缺陷的假设,提出“感知-推理”范式导致视觉推理退化为文本空间推理,并通过图灵眼测试验证文本推理无法修复感知失败,主张转向感知内的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26095 2026-06-25 cs.RO cs.AI cs.CV 新提交 62%

Learning Action Priors for Cross-embodiment Robot Manipulation

跨具身机器人操作的动作先验学习

Dong Jing, Tianqi Zhang, Jiaqi Liu, Jinman Zhao, Zelong Sun, Li Erran Li, Zhiwu Lu, Mingyu Ding

机构 * Renmin University of China(中国人民大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Toronto(多伦多大学) Amazon(亚马逊)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出两阶段训练框架,先通过流匹配预训练动作模块学习跨具身时间运动结构,再迁移至VLA训练,提升数据效率与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25905 2026-06-25 cs.CV 新提交 57%

SurgAtlas: A Large-Scale Surgical Video-Language Dataset with 2,391 Hours of Open and Minimally Invasive Surgery

SurgAtlas:一个包含2,391小时开放和微创手术的大规模手术视频-语言数据集

Filippos Bellos, Andre S. Gala-Garza, Miaowei Wang, Alyssa M. Hardin, Ahmad M. Hider, Yayuan Li, Jing Bi, Susan Liang, Chenliang Xu, Donald S. Likosky, Jason J. Corso

机构 * University of Michigan(密歇根大学) University of Edinburgh(爱丁堡大学) Vanderbilt University Medical Center(范德比尔特大学医学中心) University of Colorado(科罗拉多大学) University of Rochester(罗切斯特大学) Michigan Medicine(密歇根医学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出SurgAtlas,最大手术视频-语言数据集(15,291视频,2,391小时,18专科,5,000+术式),首次大规模纳入开放手术并建立基准,通过多层级自动标注管道生成丰富注释,微调Qwen3-VL-8B在多个基准上达到领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25736 2026-06-25 cs.CV 新提交 57%

UniTeD: Unified Temporal Diffusion for Joint Perception and Planning in Autonomous Driving

UniTeD: 面向自动驾驶联合感知与规划的时域统一扩散模型

Bo Zhao, Xinting Zhao, Naifan Li, Erkang Cheng, Haibin Ling

机构 * Nullmax Westlake University(西湖大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出UniTeD框架,通过共享生成空间的迭代去噪统一建模感知与规划,引入时域过渡模块和锚点刷新策略,在多个基准上达到最先进性能。

Comments Accept to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25535 2026-06-25 cs.CV 新提交 57%

Spatio-Temporal Mixture-of-Modality-Experts Diffusion for Quantitative DCE-MRI Synthesis from Incomplete MR Sequences

时空模态专家混合扩散:从不完整MR序列合成定量DCE-MRI

Junhyeok Lee, Kyu Sung Choi

机构 * Interdisciplinary Program in Cancer Biology, Seoul National University College of Medicine(首尔大学医学院癌症生物学跨学科项目) Department of Radiology, Seoul National University Hospital(首尔大学医院放射科) Department of Radiology, Seoul National University College of Medicine(首尔大学医学院放射科) Healthcare AI Research Institute, Seoul National University Hospital(首尔大学医院医疗人工智能研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出时空模态专家混合(ST-MoME)条件扩散框架,通过时空门控网络融合多模态专家特征,从任意子集合成3D DCE参数图,在386例脑肿瘤数据上16种缺失场景下取得最优NMSE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25329 2026-06-25 cs.CV cs.LG 新提交 57%

State Space Models Meet Remote Sensing: A Survey

状态空间模型遇上遥感:综述

Qinzhe Yang, Chenyang Liu, Jia Xu, Zhenwei Shi, Zhengxia Zou

机构 * Shen Yuan Honors College, Beihang University(北航沈元荣誉学院) Department of Aerospace Intelligent Science and Technology, School of Astronautics, Beihang University(北京航空航天大学宇航学院航天智能科学与技术系) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) Qian Xuesen Laboratory of Space Technology, China Academy of Space Technology(中国空间技术研究院钱学森空间技术实验室)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文综述了状态空间模型(SSM)在遥感中的应用,分析了其在密集视觉预测、多模态和时序遥感数据中的优势,并总结了架构设计进展与未来挑战。

Comments 25 pages, 5 figures, has been published in SCIS SCIQ1 IF=8.1 https://doi.org/10.1007/s11432-025-4780-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25122 2026-06-25 cs.RO cs.AI cs.LG 新提交 57%

AeroCast: Probabilistic 3D Trajectory Prediction for Non-Cooperative Aerial Obstacles via Transformer-MDN Architecture

AeroCast: 基于Transformer-MDN架构的非合作空中障碍物概率3D轨迹预测

Syed Izzat Ullah, Jose Baca

机构 * Department of Engineering, Texas A&M University–Corpus Christi(德克萨斯A&M大学科珀斯克里斯蒂分校工程系)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 提出AeroCast框架,结合Transformer编码器和混合密度网络,预测非合作空中障碍物的多模态轨迹,在五秒预测范围内将位移误差降低约50%,并支持实时部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24986 2026-06-25 cs.LG cs.AI 新提交 57%

When Multi-Sensor Fusion Fails to Generalize: Cattle Posture Classification Under Animal-Level and Temporal Distribution Shift

当多传感器融合无法泛化:动物级别和时间分布偏移下的牛姿势分类

Leutrim Uka, Severino Pinto, Gundula Hoffmann, Marina M. -C. Höhne

机构 * Institute of Computer Science, University of Potsdam(波茨坦大学计算机科学研究所) Department of Sensors and Modelling, Leibniz Institute for Agricultural Engineering and Bioeconomy - ATB(莱布尼茨农业工程与生物经济研究所传感器与建模系) Department of Data Science in Bioeconomy, Leibniz Institute for Agricultural Engineering and Bioeconomy - ATB(莱布尼茨农业工程与生物经济研究所生物经济数据科学系)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究评估多传感器融合在牛姿势分类中的鲁棒性,发现跨年评估性能大幅下降(F1从0.94降至0.49),表明常用评估高估实际性能,融合可能降低而非提升鲁棒性。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26093 2026-06-25 cs.RO 新提交 50%

ForceBand: Learning Forceful Manipulation with sEMG

ForceBand: 利用表面肌电信号学习有力操作

Botao He, Zhi Wang, Linna Kuang, Ishaan Ghosh, Jitendra Malik, Cornelia Fermuller, Tingfan Wu, Jiayuan Mao, Ruoshi Liu, Haozhi Qi, Yiannis Aloimonos

机构 * Amazon FAR(亚马逊 FAR) University of Maryland(马里兰大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出ForceBand,一种低成本腕戴式sEMG系统,通过预测手指力来增强人类演示数据,用于机器人有力操作策略学习,在多种物体上实现87%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24962 2026-06-25 cs.LG 新提交 50%

Towards Scalable Multi-Task Reinforcement Learning with Large Decision Models

迈向可扩展的多任务强化学习与大决策模型

Thibaut Kulak

专题命中 视频多模态 :multi-modal(abstract)

AI总结 提出LDM-v0,一个在大规模异构强化学习环境上离线预训练的Transformer策略,通过监督下一动作预测实现多任务学习,在约1000个环境中达到与独立训练策略相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏