arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4728 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4728 篇

2606.24986 2026-06-25 cs.LG cs.AI 新提交 57%

When Multi-Sensor Fusion Fails to Generalize: Cattle Posture Classification Under Animal-Level and Temporal Distribution Shift

当多传感器融合无法泛化:动物级别和时间分布偏移下的牛姿势分类

Leutrim Uka, Severino Pinto, Gundula Hoffmann, Marina M. -C. Höhne

机构 * Institute of Computer Science, University of Potsdam(波茨坦大学计算机科学研究所) Department of Sensors and Modelling, Leibniz Institute for Agricultural Engineering and Bioeconomy - ATB(莱布尼茨农业工程与生物经济研究所传感器与建模系) Department of Data Science in Bioeconomy, Leibniz Institute for Agricultural Engineering and Bioeconomy - ATB(莱布尼茨农业工程与生物经济研究所生物经济数据科学系)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究评估多传感器融合在牛姿势分类中的鲁棒性,发现跨年评估性能大幅下降(F1从0.94降至0.49),表明常用评估高估实际性能,融合可能降低而非提升鲁棒性。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23705 2026-06-24 stat.AP cs.AI 新提交 57%

Event-Aligned Analysis of Multi-Rater Pain Assessments Using Continuous Wearable Physiology

使用连续可穿戴生理数据进行多评估者疼痛评估的事件对齐分析

Saba A. Farahani, Elahe Khatibi, Thomas D. Hughes, Ariana M. Nelson, Hung Cao, Amir M. Rahmani

机构 * University of California, Irvine(加州大学伊维奇分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出一种考虑评估者身份的事件对齐框架,将稀疏的疼痛评分转化为离散事件,并对齐连续可穿戴生理信号,揭示评估者间差异及生理模式依赖。

Comments 6 pages, 3 figures. Accepted at IEEE EMBC 2026 (Toronto, Canada, July 26-30, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24636 2026-06-24 cs.AI 新提交 57%

CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning

CineCap: 基于时空锚点的结构化推理用于电影化视频描述

Xinyu Mao, Yuhui Zeng, Xiaokun Liu, Wenyu Qin, Meng Wang, Xin Tao, Pengfei Wan, Xiaohan Xing, Max Meng

机构 * The Chinese University of Hong Kong(香港中文大学) Xiamen University(厦门大学) Kling Team, Kuaishou Technology(快手科技Kling团队) National University of Singapore(新加坡国立大学) Southern University of Science and Technology(南方科技大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出CineCap框架,通过时空锚点结构化推理和强化学习(覆盖完整性、准确性和门控覆盖奖励)生成电影化视频描述,在CineCap Bench基准上达到新最优。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24602 2026-06-24 cs.CV 新提交 57%

ViTexQA: A Multi-Frame Temporal Perception Dataset for Video Text Question Answering

ViTexQA: 面向视频文本问答的多帧时序感知数据集

Zhentao Guo, Chen Duan, Tongkun Guan, Zining Wang, Kai Zhou, Pengfei Yan

机构 * Meituan(美团) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出ViTexQA数据集和FrameThinker方法,通过跨帧文本融合的问答对和两阶段训练(CoT微调+时序强化学习),解决多帧时序文本感知难题,ROUGE-L提升6.3%。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24282 2026-06-24 cs.CV 新提交 57%

UniRED: Unified RGB-D Video Frame Interpolation with Event Guidance

UniRED: 基于事件引导的统一RGB-D视频帧插值

Yinuo Zhang, Guangshun Wei, Yuanfeng Zhou, Yiran Shen

机构 * School of Software, Shandong University(山东大学软件学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出统一多模态框架UniRED,融合RGB外观、深度几何和事件时间线索,通过双向流估计与运动基细化实现高质量RGB-D视频帧插值,并构建RGB-D-Event数据集缓解数据稀缺。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24175 2026-06-24 cs.CV 新提交 57%

Tri-Efficient Transfer Learning for Point Cloud Videos

点云视频的三效迁移学习

Yiding Sun, Dongxu Zhang, Jihua Zhu, Haozhe Cheng, Zhengqiao Li, Pengcheng Li, Chaowei Fang, Yonghao Dong, Lin Chen

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件学院) School of Information and Communication Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院) SIGS, Tsinghua University(清华大学深圳国际研究生院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出PoinTriE框架,通过伪运动轨迹合成、几何-运动对偶网络和时空侧网络,实现数据、参数和内存三方面高效的点云视频迁移学习,在动作识别和语义分割任务上取得新最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24731 2026-06-24 cs.CV 版本更新 57%

EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation

EchoFoley: 面向视频接地创意声音生成的事件中心层次化控制

Bingxuan Li, Yiming Cui, Yicheng He, Yiwei Wang, Shu Zhang, Longyin Wen, Yulei Niu

机构 * ByteDance Intelligent Creation(字节跳动智能创作) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Merced(加州大学默塞德分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出EchoFoley任务,通过事件级局部控制和层次化语义控制实现视频接地声音生成,构建EchoFoley-6k基准并设计EchoVidia框架,在可控性和感知质量上分别提升40.7%和12.5%。

Comments CVPR-2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00324 2026-06-24 cs.RO cs.CV cs.HC 版本更新 57%

MILE: A Mechanically Isomorphic Hand Exoskeleton and Visuotactile Robotic Hand for Data Collection in Dexterous Manipulation

MILE:一种用于灵巧操作的指尖视觉触觉传感的机械同构外骨骼数据采集系统

Jinda Du, Jieji Ren, Qiaojun Yu, Ningbin Zhang, Yu Deng, Xingyu Wei, Yufei Liu, Guoying Gu, Xiangyang Zhu

机构 * State Key Laboratory of Mechanical System and Vibration, School of Mechanical Engineering, Shanghai Jiao Tong University, Shanghai 200240, China(机械系统与振动国家重点实验室,上海交通大学机械工程学院,上海200240,中国) Shanghai Key Laboratory of Intelligent Robotics, Shanghai Jiao Tong University, Shanghai 200240, China(智能机器人上海重点实验室,上海交通大学,上海200240,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) Humanoid Robot (Shanghai) Co., Ltd., Shanghai, China(上海人形机器人有限公司,上海,中国)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对现有灵巧操作数据采集系统运动重定向不准确、效率低、缺乏高分辨率指尖触觉传感的问题,提出MILE系统,通过从人手到外骨骼再到机械手的机械同构设计,实现无重定向精确控制,并集成指尖视觉触觉模块,采集多模态数据集,显著提升遥操作成功率。

Comments 18 pages including supplementary material. Main manuscript and supplementary material included in this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23503 2026-06-23 cs.CV 新提交 57%

UniverSat: Resolution- and Modality-Agnostic Transformers for Earth Observation

UniverSat:面向地球观测的分辨率与模态无关的Transformer

Yohann Perron, Guillaume Astruc, Nicolas Gonthier, Clement Mallet, Loic Landrieu

机构 * LIGM, Ecole Nationale des Ponts et Chaussées, IP Paris, Univ Gustave Eiffel, CNRS(LIGM,巴黎国立桥梁与道路学院,IP巴黎,埃夫尔大学,CNRS) LASTIG, Univ Gustave Eiffel, IGN, ENSG(LASTIG,埃夫尔大学,国家地理信息学院,ENSG) IGN(国家地理信息学院) CNES(国家航天中心) EFEO(埃克塞特东方研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出UniverSat,一种基于通用补丁编码器的ViT骨干网络,能处理任意空间、光谱和时间分辨率的光学与非光学传感器数据,通过自监督学习在异构多模态语料上训练单一模型,在多个EO基准上取得强分类与分割结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22126 2026-06-23 cs.CL 新提交 57%

From Recognition to Understanding: Unlocking Cognitive Time Series Reasoning with LLMs

从识别到理解:利用LLM解锁认知时间序列推理

Xin Qiu, Junlong Tong, Yao Zhang, Yunpu Ma, Wei Zhang, Xiaoyu Shen

机构 * Institute of Digital Twin, Eastern Institute of Technology(东方理工数字孪生研究所) Zhejiang University(浙江大学) Munich Center for Machine Learning, LMU(慕尼黑机器学习中心,慕尼黑大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 针对现有时间序列任务与LLM能力不匹配的问题,提出多模态基准TSCognition和统一框架TSAlign,通过认知推理任务和语义对齐提升LLM的时间序列推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21607 2026-06-23 cs.CV 新提交 57%

T-MOR: Learning Motion-Aware Skeleton Representations for Human Action Recognition

T-MOR:学习面向运动感知的骨架表示用于人体动作识别

Di Yang, Mahmoud Ali, Quan Kong, Gianpiero Francesca, Francois Bremond

机构 * Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) Inria Center at Université Côte d'Azur(法国蔚蓝海岸大学Inria中心) Woven by Toyota Toyota Motor Europe(丰田汽车欧洲公司)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出T-MOR框架,通过多模态对比学习对齐骨架运动与视觉、文本表示,仅用轻量骨架输入实现高效动作识别,并在大规模数据集PoseCap-1M上预训练,在多个基准上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20857 2026-06-23 cs.AI cs.LG cs.RO 新提交 57%

SignVLA: Real-Time Sign Language-Guided Robotic Manipulation via Attention LSTM and Vision-Language-Action Models

SignVLA: 通过注意力LSTM和视觉-语言-动作模型实现实时手语引导的机器人操作

Ningwei Bai, Xinyu Tan, Harry Gardner, Zhengyang Zhong, Liuhaichen Yang, Luoyu Zhang, Zhekai Duan, Monkgogi Galeitsiwe, Zezhi Tang

机构 * University College London(伦敦大学学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出SignVLA框架,通过注意力LSTM网络将手语手势实时转换为语义指令,驱动VLA模型执行机器人操作任务,为听障用户提供无障碍交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27259 2026-06-23 cs.CV 版本更新 57%

Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark

看到场景才重要:通过场景感知的长视频基准揭示视频理解模型中的遗忘现象

Seng Nam Chen, Hao Chen, Chenglam Ho, Xinyu Mao, Jinping Wang, Yu Zhang, Chao Li

机构 * CUHK (SZ)(香港中文大学(深圳)) University of Cambridge(剑桥大学) UESTC(电子科技大学) CUHK(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SceneBench基准,揭示视频理解模型在长场景上下文中的遗忘问题,并提出Scene-RAG方法提升性能2.50%。

Comments Accepted to CVPR 2026 (Highlight)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07298 2026-06-23 cs.CV 版本更新 57%

Mimic Human Cognition, Master Multi-Image Reasoning: A Meta-Action Framework for Enhanced Visual Understanding

模仿人类认知,掌握多图像推理:增强视觉理解的元动作框架

Jianghao Yin, Qingbin Li, Kun Sun, Cheng Ding, Jie Wang, Qin Chen, Jie Zhou, Nan Wang, Changqing Li, Pei Wu, Jian Xu, Zheming Yang, Liang He

机构 * East China Normal University(华东师范大学) ByteDance(字节跳动)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出受人类认知启发的元动作框架CINEMA,将多图像推理分解为五个结构化元动作,结合检索树采样和两阶段强化学习,在多个基准上超越GPT-4o。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20312 2026-06-19 cs.CV 新提交 57%

Reliability-Aware Prototype Calibration for Frozen Pose-Flow Video Anomaly Detection

面向冻结姿态流视频异常检测的可靠性感知原型校准

Ning Dong, Yingna Su, Xin Dong, Ziyun Jiao, Xinnian Guo, Zhuangzhuang Pan

机构 * School of Information Engineering(信息工程学院) Suqian University(宿迁大学) School of Electronic & Information Engineering(电子与信息工程学院) Nanjing University of Information Science and Technology(南京信息科学技术大学) University of Electronic Science and Technology of China(电子科学与技术大学) Institute for Advanced Studies(高级研究机构) Universiti Malaya(马来亚大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出一种后验评分校准方法RPC,通过标准化潜在空间中的最近原型偏差修正冻结姿态流检测器的排名,在8个骨干-数据集组合上平均提升AUROC 2.03个百分点。

Comments 15 pages, 5 figures, 7 tables. Code available at https://github.com/iNing10/RPC

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20135 2026-06-19 cs.RO cs.AI 新提交 57%

Frequency-Aware Flow Matching for Continuous and Consistent Robotic Action Generation

频率感知流匹配用于连续且一致的机器人动作生成

Jianing Guo, Fangzheng Chen, Zihao Mao, Wong Lik Hang Kenny, Zhenhong Wu, Yu Li, Yishuai Cai, Yuanpei Chen, Yikun Ban, Kai Chen, Qi Dou, Yaodong Yang, Xianglong Liu, Huijie Zhao, Simin Li

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学) PKU-Psibot Lab(北大-智源机器人实验室) Zhongguancun Laboratory(中关村实验室) Hefei Comprehensive National Science Center(合肥综合性国家科学中心)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出频率感知流匹配(FAFM),通过离散余弦变换将离散动作序列转换到频域进行流匹配,并正则化一阶时间导数以生成平滑连续的动作,提升成功率、多模态表达性和运动平滑性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19927 2026-06-19 cs.CV 新提交 57%

CARE: Competence-Aware Reward Shaping for Adaptive Reasoning Length in Video-MLLMs

CARE: 面向视频多模态大语言模型的自适应推理长度的能力感知奖励塑形

Chengwen Liu, Hao Peng, Jisheng Dang, Hong Peng, Bin Hu, Tat-Seng Chua

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) School of Medical Technology, Beijing Institute of Technology(北京理工大学医学技术学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出CARE框架,通过能力感知奖励塑形自适应优化推理长度,利用指数移动平均估计能力并分阶段调整奖励偏好,结合批次归一化和后验放大器提升效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09547 2026-06-19 cs.CV cs.LG 新提交 57%

Streaming Interventions: Can Video Large Language Models Correct Mistakes as They Occur?

流式干预:视频大语言模型能否在错误发生时即时纠正?

Apratim Bhattacharyya, Shweta Mahajan, Sanjay Haresh, Rajeev Yasarla, Reza Pourreza, Litian Liu, Risheek Garrepalli, Roland Memisevic

机构 * Qualcomm AI Research(高通人工智能研究院) York University(约克大学) Vector Institute for AI(向量人工智能研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出Ego-MC-Bench基准评估视频LLM在烹饪场景中的实时干预能力,并构建Ego-CoMist反事实合成数据集提升小模型性能。

Comments The project page is available at https://apratimbh.github.io/livecookv2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07628 2026-06-19 cs.AI cs.LG 版本更新 57%

SleepMaMi: A Universal Sleep Foundation Model for Integrating Macro- and Micro-structures

SleepMaMi:一种融合宏观与微观结构的通用睡眠基础模型

Keondo Park, Younghoon Na, Yourim Choi, Hyunwoo Ryu, Hyun-Woo Shin, Hyung-Sin Kim

机构 * Graduate School of Data Science, Seoul National University, Seoul, South Korea(首尔国立大学数据科学研究生院,韩国首尔) Department of Biomedical Sciences, Seoul National University College of Medicine, Seoul, Republic of Korea(首尔国立大学医学院生物医学科学系,韩国首尔) Obstructive Upper Airway Research (OUaR) Laboratory, Department of Pharmacology, Seoul National University College of Medicine, Seoul, Republic of Korea(首尔国立大学医学院药理学系阻塞性上气道研究(OUaR)实验室,韩国首尔) Department of Otorhinolaryngology-Head and Neck Surgery, Seoul National University Hospital, Seoul, Republic of Korea(首尔国立大学医院耳鼻喉头颈外科系,韩国首尔)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 提出SleepMaMi睡眠基础模型,通过分层双编码器设计(宏观编码器建模整夜时间依赖,微观编码器捕捉生物信号短时特征),结合人口统计引导对比学习和混合掩码自编码器训练,在超过2万条PSG记录上预训练,在下游任务中优于或匹配现有基础模型。

Comments 8 pages, Appendix 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17298 2026-06-17 cs.CV 新提交 57%

Reasoning Text-to-Video Retrieval for Operating Room Clips via Action-Driven Digital Twins

面向手术室视频的推理式文本-视频检索:基于动作驱动数字孪生

Yiqing Shen, Hao Ding, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 提出OR3方法,通过动作驱动数字孪生(ActDT)将视频片段转化为结构化表示,并利用大语言模型生成假设ActDT进行检索,结合证据修正实现隐式查询推理,在手术室视频检索中显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15200 2026-06-16 cs.CV 新提交 57%

Keep It in Mind: User Centric Continual Spatial Intelligence Reasoning in Egocentric Video Streams

铭记于心:面向用户中心的持续空间智能推理在自我中心视频流中的应用

Yun Wang, Junbin Xiao, Han Lyu, Yifan Wang, Jing Zuo, Zhanjie Zhang, Hong Huang, Dapeng Wu, Angela Yao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出UCS-Bench数据集和DirectMe框架,通过增量构建结构化空间记忆,实现自我中心视频流中动态空间推理、长期记忆与用户实时位置对齐,显著提升多模态大模型的空间推理能力。

Comments 45 pages. https://icml.cc/virtual/2026/poster/63682

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01900 2026-06-16 cs.CV 版本更新 57%

Auteur: Language-Driven Cinematographic Framing for Human-Centric Video Generation

Auteur: 以语言驱动的电影化取景实现以人为中心的视频生成

Muhammed Burak Kizil, Enes Sanli, Niloy J. Mitra, Xuelin Chen, Erkut Erdem, Aykut Erdem, Duygu Ceylan

机构 * Koç University(科克大学) University College London(伦敦大学学院) Adobe(Adobe公司) Hacettepe University(哈切特佩大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出Auteur方法,通过将相机运动参数化为以人为中心的取景(包括镜头尺寸、角度和构图),并利用领域特定语言(DSL)和微调的多模态大语言模型,实现语言驱动的电影化取景,在人类中心视频生成中优于现有方法。

Comments Project Page: https://cyberiada.github.io/Auteur/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14127 2026-06-15 cs.IR cs.CL 新提交 57%

CoRe: A Continuously Reward-Finetuned LLM Query Rewriter for Multi-Stage Context-Aware Relevance in Web-Scale Video Search

CoRe:一种持续奖励微调的LLM查询重写器,用于大规模视频搜索中的多阶段上下文感知相关性

Yilin Wen, Rong Yang, Xiaojia Chang, Hong Sun, Gefu Tang, Chunhui Liu, Jeffrey Chen, Zeyu Ma, Lisong Qiu, Xiaochuan Fan, Congjia Yu, Quan Zhou, Yuheng Chen, Zian Wang

机构 * TikTok

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 提出CoRe系统,通过半在线混合偏好优化和乘法奖励比,实现每周重新部署的LLM查询重写器,在多阶段视频搜索中显著降低变更查询率并提升相关性指标。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14482 2026-06-12 cs.CV 版本更新 57%

V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning

V-JEPA 2.1: 解锁视频自监督学习中的密集特征

Lorenzo Mur-Labadia, Matthew Muckley, Amir Bar, Mido Assran, Koustuv Sinha, Mike Rabbat, Yann LeCun, Nicolas Ballas, Adrien Bardes

机构 * FAIR at Meta(Meta的FAIR) Universidad de Zaragoza(萨拉戈萨大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出V-JEPA 2.1系列自监督模型,通过密集预测损失、深度自监督、多模态分词器和有效缩放,学习图像和视频的密集高质量视觉表示,在多个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03340 2026-06-12 cs.LG cs.AI cs.CE physics.comp-ph 版本更新 57%

Equivariant Flow Matching for Symmetry-Breaking Bifurcation Problems

等变流匹配用于对称破缺分岔问题

Fleur Hendriks, Ondřej Rokoš, Martin Doškář, Marc G. D. Geers, Vlado Menkovski

机构 * Department of Mechanical Engineering, Eindhoven University of Technology(埃因霍温理工大学机械工程系) DIFFER – Dutch Institute for Fundamental Energy Research(荷兰基础能源研究所) Faculty of Civil Engineering, Department of Mechanics, Czech Technical University in Prague(布拉格捷克技术大学土木工程学院力学系) Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 针对非线性动力系统中对称破缺导致的多稳态共存问题,提出等变流匹配方法,结合等变架构与最优传输耦合机制,准确捕捉多模态分布和对称破缺分岔,优于非概率和变分方法。

Comments 9 pages, 7 figures including appendices. Accepted to Machine Learning and the Physical Sciences Workshop, NeurIPS 2025 (https://ml4physicalsciences.github.io/2025/). Repository with corresponding code: https://github.com/FHendriks11/bifurcationML/. Video explanation: https://www.youtube.com/watch?v=wsL3h17KtjY

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12125 2026-06-11 cs.CV 新提交 57%

Q-Fold: Query-Aware Focus-Context Spatio-Temporal Folding for Long Video Understanding

Q-Fold: 查询感知的焦点-上下文时空折叠用于长视频理解

Biao Tang, Xu Chen, Shuxiang Gou, Jingyi Yuan, Yuhan Zhang, Chenqiang Gao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳高等研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出Q-Fold,一种无需训练的长视频输入构建框架,通过查询引导将相关片段保留为高保真焦点帧,不相关片段折叠为上下文布局,在固定预算下提升多模态大模型的长视频理解性能。

Comments 10 pages, 5 figures, 8 tables. Code will be made publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11770 2026-06-11 cs.AI 新提交 57%

SVoT: State-aware Visualization-of-Thought for Spatial Reasoning via Reinforcement Learning

SVoT: 基于强化学习的空间推理状态感知思维可视化

Chao Lei, Yanbei Jiang, Markus Hiller, Zhijian Zhou, Xunye Tian, Krista A. Ehinger, Nir Lipovetzky

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出SVoT框架,通过强化学习生成可验证的中间状态和可视化,结合文本与视觉推理链,提升多模态大模型在多跳空间推理中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20190 2026-06-11 cs.CV 版本更新 57%

CoVR-R:Reason-Aware Composed Video Retrieval

CoVR-R: 推理感知的组合视频检索

Omkar Thawakar, Dmitry Demidov, Vaishnav Potlapalli, Sai Prasanna Teja Reddy Bogireddy, Viswanatha Reddy Gajjala, Alaa Mostafa Lasheen, Rao Muhammad Anwer, Fahad Khan

机构 * Mohamed bin Zayed University of AI(莫扎德·本·扎耶德人工智能大学) University of Chicago(芝加哥大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Linköping University(林奈大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出一种零样本推理优先方法,利用大型多模态模型推断编辑的因果和时序后效,并构建CoVR-Reason基准评估,在隐式效应子集上显著优于强基线。

Comments 9 Pages, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10517 2026-06-10 cs.CV 新提交 57%

LAFP: Preserving Latent Action Structure in Latent Policy Learning via Flow Matching

LAFP:通过流匹配在潜在策略学习中保留潜在动作结构

Jiexi Lyu, Xizhou Bu, Qingqiu Huang, Chufeng Tang, Xiaoshuai Hao, Hongbo Wang, Wei Li

机构 * Fudan University(复旦大学) Morphi

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出LAFP方法,利用流匹配学习潜在策略,并引入推理时插值机制缓解随机性导致的错位,在模仿学习任务中成功率提升10-15%,推理开销增加不到1倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09681 2026-06-10 cs.CV 版本更新 57%

GenEyePose: Patient-Free, Knowledge-Based Saccadic Eye Movement Modeling for Digital Neurophysiologic Biomarker Development

GenEyePose:用于数字神经生理学生物标志物开发的无患者、基于知识的扫视眼动建模

Tianyu Lin, Jooyoung Ryu, Puvada Sreevarsha, Rahul Srinivasaragavan, Riya Satavlekar, Susan Kim, Nidhi Soley, Yujie Yan, Ishan Vatsaraj, Carl Harris, Aimon Rahman, Vishal Patel, Joseph Greenstein, Casey Taylor, Kemar E. Green

机构 * Whiting School of Engineering, Johns Hopkins University(约翰霍普金斯大学惠廷工程学院) Department of Neurology, Johns Hopkins Medicine(约翰霍普金斯医学院神经内科)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出首个全合成、无患者的多模态眼动生成流水线,用于泛化扫视分析;基于合成数据训练的深度学习分类器在真实临床数据上区分正常与异常扫视精度,AUROC达0.76。

详情

展开后加载摘要…

URL PDF HTML 收藏