arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 535 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 31 篇

2606.20731 2026-06-23 cs.CV cs.AI 新提交 57%

XmoPipe: A Pipeline for Large-Scale In-the-Wild Human Motion Dataset Construction

XmoPipe:大规模野外人体运动数据集构建流水线

Nathan Salazar, Emmanuel Dellandréa, Mathieu Lefort, Alexandre Meyer

机构 * Ecole Centrale de Lyon, CNRS, INSA Lyon, Universite Claude Bernard Lyon 1, LIRIS, UMR5205(里昂中央理工学院, 法国国家科学研究中心, 国立应用科学学院里昂, 克洛德·贝尔纳里昂第一大学, 里昂信息与系统研究实验室, UMR5205) Univ Rennes, Inria, CNRS, IRISA - UMR 6074(雷恩大学, 法国国家信息与自动化研究所, 法国国家科学研究中心, 雷恩计算机科学研究所 - UMR 6074) Universite Claude Bernard Lyon 1, CNRS, INSA Lyon, LIRIS, UMR5205(克洛德·贝尔纳里昂第一大学, 法国国家科学研究中心, 国立应用科学学院里昂, 里昂信息与系统研究实验室, UMR5205)

专题命中 动作与事件理解 :video-language(abstract);分类 cs.CV

AI总结 提出可扩展的流水线,从关键词检索视频、提取3D身体和面部运动并生成文本描述,用于构建野外人体运动数据集,训练的运动模型性能与基于传统动捕数据集训练的模型相当。

Comments 12 pages, presented at CASAXR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20711 2026-06-23 cs.CV cs.AI 新提交 57%

Video2Code: Generating Interactive Webpages from UI Videos via Action-Aware Revisit

Video2Code: 通过动作感知重访从UI视频生成交互式网页

Mingde Xu, Zhen Yang, Yan Wang, Yu Wang, Xijun Liu, Zijun Dou, Wenyi Hong, Xiaotao Gu, Bin Xu, Jie Tang

机构 * University of Waterloo(滑铁卢大学) Tsinghua University(清华大学) Zhipu AI(智谱AI) Beihang University(北京航空航天大学)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 提出Video2Code方法,通过动作感知重访UI视频中的关键区域,恢复可执行的状态转换,生成HTML/CSS/JavaScript代码,提升多步交互的代码功能正确性。

Comments 31 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19676 2026-06-19 cs.CV cs.AI 新提交 57%

TeleMorpher: Toward Robust Simultaneous Motion-Location Editing

TeleMorpher: 迈向鲁棒的同步运动-位置编辑

Haengbok Chung

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 提出TeleMorpher,一种基于扩散模型的一步式框架,通过运动先验、姿态扭曲和基线运动编辑器注入,实现视频中主角运动与位置的同步编辑,在定量和定性评估中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13674 2026-06-16 cs.CV 新提交 57%

RepWAM: World Action Modeling with Representation Visual-Action Tokenizers

RepWAM:基于表示视觉-动作分词器的世界动作建模

Junke Wang, Qihang Zhang, Shuai Yang, Yiming Luo, Yujun Shen, Zuxuan Wu, Yu-Gang Jiang, Yinghao Xu

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Robbyant, Ant Group(蚂蚁集团 Robbyant) Hongkong University of Science and Technology(香港科技大学)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 提出RepWAM,一种基于表示视觉-动作分词器的世界动作模型,通过联合建模未来视觉状态和潜在动作,在真实和仿真机器人操作任务中取得优异性能。

Comments Project page: https://wdrink.github.io/RepWAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12033 2026-06-11 cs.CV 新提交 57%

SpikeTAD: Spiking Neural Networks for End-to-End Temporal Action Detection

SpikeTAD:用于端到端时序动作检测的脉冲神经网络

Min Yang, Mi Zhou, Limin Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 提出首个基于脉冲神经网络的端到端时序动作检测架构SpikeTAD,在保持极低功耗的同时,在THUMOS14和ActivityNet-1.3上分别达到67.2%和37.42%的平均mAP。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11605 2026-08-13 cs.AI 新提交 50%

Foresight Without Seeing: Latent Futures for World Action Models

无视觉前瞻:面向世界动作模型的潜在未来

Jiakai Huang, Zhongbo Wu, Zheng Zhang, Zihan Wang, Shan You, Tao Huang

机构 * Shanghai Jiao Tong University(上海交通大学) ACE Robotics(ACE机器人公司) Nanyang Technological University(南洋理工大学)

专题命中 动作与事件理解 :video generation(abstract)

AI总结 本文提出ForeWAM,一种动力学条件下的直接策略WAM,通过Future-KV和动力学寄存器在无需显式生成未来视频的情况下,使直接策略WAMs兼具高效动作预测与预测动力学暴露能力,在LIBERO和LIBERO-Plus上取得高成功率。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14997 2026-07-17 cs.RO 新提交 50%

AeroAct: Action-Centered World-Action Models for Language-Conditioned Quadrotor Flight

AeroAct:用于语言条件四旋翼飞行的以动作中心的世界-动作模型

Xinhong Zhang, Qiyuan Zhu, Yubo Huang, Haolin Chen, Runqing Wang, Yuhao Mo, Zhongxin Chen, Yu Hu, Xinjiang Wang, Jian Sun, Gang Wang

机构 * School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院)

专题命中 动作与事件理解 :video diffusion(abstract)

AI总结 研究语言条件下四旋翼飞行问题,提出AeroAct模型,利用预训练视频扩散Transformer,结合相关采集设备和程序获取数据,经实验验证该模型能提升四旋翼飞行的目标跟踪和物体搜索性能,且对应策略可在实体四旋翼上执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04988 2026-07-07 cs.RO 新提交 50%

InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization

InternVLA-A1.5:统一理解、潜在预见与组合泛化的行动

Haoxiang Ma, Junhao Cai, Xiaoxu Xu, Hao Li, Yuyin Yang, Yang Tian, Jiafei Cao, Hongrui Zhu, Zherui Qiu, Zhaxizhuoma, Yuqiang Yang, Jiaqi Peng, Xueyuan Wei, Yangkun Zhu, Jiahao Jiang, Xing Gao, Hanqing Wang, Feng Yuan, Kailin Li, Xueyue Zhu, Tai Wang, Yan Ding, Jiangmiao Pang, Jia Zeng, Jingjing Zhang, Bowen Zhou, Yao Mu, Chunhua Shen, Weinan Zhang

机构 * Physical Intelligence Team Shanghai AI Laboratory(上海人工智能实验室物理智能团队)

专题命中 动作与事件理解 :video generation(abstract)

AI总结 研究旨在统一机器人操作模型,提出InternVLA-A1.5,基于原生VLM骨干构建策略,将未来预测转化为潜在查询问题,继承预训练视频生成模型动力学先验,在模拟和现实基准测试中效果良好。

Comments Homepage: https://internrobotics.github.io/internvla-a15.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03964 2026-07-07 cs.RO cs.AI 新提交 50%

Worldscape-MoE: A Unified Mixture-of-Experts World Model for Scalable Heterogeneous Action Control

Worldscape-MoE:用于可扩展异构动作控制的统一专家混合世界模型

Jianjie Fang, Yongyan Xu, Ziyou Wang, Chen Gao, Yuchao Huang, Zhaolu Wang, Rongze Tang, Mingyuan Jia, Baining Zhao, Weichen Zhang, Xin Zhang, Haisheng Su, Yu Shang, Wei Wu, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学) Manifold AI

专题命中 动作与事件理解 :video generation(abstract)

AI总结 研究视频生成世界模型控制接口碎片化瓶颈,提出基于扩散变换器的专家混合世界模型Worldscape-MoE,通过模态感知控制注入等实现异构动作控制,实验验证其有效性和扩展性。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31101 2026-07-01 cs.RO 新提交 50%

Efficient Sim-to-Real Transfer of World-Action Models from Synthetic Priors

基于合成先验的世界-动作模型的高效仿真到现实迁移

Zixing Wang, Kausik Sivakumar, Jinghuan Shang, Yafei Hu, Zhaoming Xie, Ran Gong, Xiaohan Zhang, Karl Schmeckpeper

机构 * Purdue University(普渡大学) Robotics and AI Institute(机器人与人工智能研究所)

专题命中 动作与事件理解 :video diffusion(abstract)

AI总结 本文研究从合成先验训练世界-动作模型并零样本部署到真实机器人操作,通过域随机化和AnyTask运动规划生成演示,首次成功实现仿真到现实的迁移。

Comments This work is accepted by CVPR'26, Embodied AI Workshop. This paper represent a part of early result of our official world-action model zero-shot sim-to-real transfer work, which will be released soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15768 2026-06-16 cs.RO cs.AI 新提交 50%

LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies

LaWAM: 用于高效动力学感知机器人策略的潜在世界行动模型

Jialei Chen, Kai Wang, Kang Chen, Shuaihang Chen, Feng Gao, Wenhao Tang, Zhiyuan Li, Weilin Liu, Zhuyu Yao, Boxun Li, Yuanbo Xu, Chao Yu

机构 * Tsinghua University(清华大学) Jilin University(吉林大学) Nankai University(南开大学) Peking University(北京大学) Harbin Institute of Technology(哈尔滨工业大学) Zhongguancun Academy(中关村学院) Striding.AI Infinigence AI

专题命中 动作与事件理解 :video generation(abstract)

AI总结 提出LaWAM模型,通过潜在视觉子目标预测场景变化,实现动力学感知的机器人控制,在多个基准上达到最优或竞争性成功率,且推理延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长视频与时序推理 43 篇

2608.07663 2026-08-11 cs.CV cs.AI cs.CL 新提交 88%

Keep It Simple: Multi-Key Episodic Memory Retrieval for Ultra-Long Video Understanding

保持简洁:用于超长视频理解的多键情景记忆检索

Yeeun Choi, Youngbeom Yoo, Joon-Young Lee, Hyolim Kang, Seon Joo Kim

机构 * Yonsei University(延世大学) Adobe Research(奥多比研究院)

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 针对超长视频理解的两阶段范式需求,提出MERIT框架,通过多键表示与按需时间扩展实现精准检索,在三个长视频基准数据集上取得最优性能。

Comments Accepted to ECCV 2026 (Oral). Project Page: https://choi-yeeun.github.io/MERIT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15772 2026-07-20 cs.CV 新提交 88%

SlotMem: Character-Addressable Internal Memory for Narrative Long Video Generation

SlotMem:用于叙事长视频生成的字符可寻址内部存储器

Yilai Liu, Xin Zhang, Shiyuan Zhang, Hongyang Du

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 研究针对叙事长视频生成中保持角色身份的挑战,提出SlotMem框架,通过字符语义探测器定位视觉令牌,记忆编码器压缩记忆,记忆写入器更新记忆,逐角色交叉注意力检索记忆,提升了远程角色一致性与视频质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19706 2026-06-19 cs.CV cs.CL 新提交 88%

NEST: Narrative Event Structures in Time for Long Video Understanding

NEST:面向长视频理解的时间叙事事件结构

Ali Asgarov, Kaushik Narasimhan, Najibul Haque Sarker, Hani Alomari, Chia-Wei Tang, Anushka Sivakumar, Zaber Ibn Abdul Hakim, Shaurya Mallampati, Chris Thomas

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系)

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 提出NEST数据集(1005部全长电影),通过多模态叙事事件标注和关系链接,评估模型在长视频中理解事件结构、时间顺序和长程依赖的能力,实验表明事件检测等任务极具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06481 2026-07-08 cs.CV cs.AI 新提交 85%

Prompt-Adapter Context Routing for Parameter-Efficient Multi-Shot Long Video Extrapolation

用于参数高效多镜头长视频外推的提示适配器上下文路由

Anna Córdoba, Adam Puente Tercero, Nerea Angulo Hijo, Mar Linares Tercero, Julia Barrientos, Ainhoa Miranda, Jesús Olivera

机构 * Instituto de Investigación en Visión Artificial(人工视觉研究所)

专题命中 长视频与时序推理 :long video(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 研究多镜头长视频外推问题,提出PACR-Video框架,通过冻结文本到视频扩散变换器,用低秩时间适配器及递归提示库增强,结合特定调优目标和调度,在多基准测试中优于多种基线,证明其能为长视频外推提供可控能力。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17798 2026-06-17 cs.CV cs.AI 新提交 83%

LiveStarPro: Proactive Streaming Video Understanding with Hierarchical Memory for Long-Horizon Streams

LiveStarPro: 具有分层记忆的主动式流视频理解用于长时域流

Zhenyu Yang, Kairui Zhang, Bing Wang, Shengsheng Qian, Changsheng Xu

机构 * IEEE

专题命中 长视频与时序推理 :video understanding(title,abstract);video-language(abstract);分类 cs.CV

AI总结 提出LiveStarPro,通过流验证解码、流因果注意力掩码和树结构分层记忆三个组件,实现长时域流媒体视频的主动理解,在语义正确性和时序误差上分别提升28.9%和降低18.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13861 2026-06-15 cs.CV 新提交 83%

Temporal Backtracking Search for Test-time Generative Video Reasoning

时间回溯搜索:测试时生成式视频推理

Sejoon Jun, Zheng Ding, Huangyuan Su, Weirui Ye, Yilun Du

机构 * Northeastern University(东北大学) Independent Researcher(独立研究者) Harvard & Kempner(哈佛大学与肯普纳研究所) MIT(麻省理工学院)

专题命中 长视频与时序推理 :video reasoning(title,abstract);video generation(abstract);分类 cs.CV

AI总结 提出时间回溯搜索(TBS),通过将搜索空间转移到时间轴,在扩散过程中定位失败点并回溯重启,显著提升视频模型在测试时的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13210 2026-08-14 cs.CV cs.AI cs.MM 新提交 81%

NARU: A Benchmark for NARrative Evolution and Cultural Nuance Understanding in Japanese Extreme Long Video

NARU:用于理解日语超长视频中叙事演变与文化细微差别的基准

Yuheng Huang, Jianlang Chen, Jiayang Song, Hua Qi, Aza Kai, Vincent Markert, Edison Marrese-Taylor, Jianjun Zhao, Lei Ma

机构 * The University of Tokyo(东京大学) Kyushu University(九州大学) Macau University of Science and Technology(澳门科技大学) Infinimind Japan Inc.(Infinimind日本公司) University of Alberta(阿尔伯塔大学)

专题命中 长视频与时序推理 :long video(title);video understanding(abstract);分类 cs.CV、cs.MM

AI总结 该研究推出NARU基准,涵盖155个146.8小时日语视频的1481个问题,评估模型在长程叙事整合与文化推理上的局限,为MLLM开发提供测试平台。

Comments Yuheng Huang and Jianlang Chen contributed equally to this work. More details available on the project's website https://ma-labo.github.io/naru/ and https://infinimind.io/en/company/news/2026/narubench-release

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15689 2026-07-20 cs.CV 新提交 79%

Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors

基于注意力的MLLM选择器在测试时对长视频进行高效帧选择

Yilin Wang, Xiangxi Zheng, Dongxing Mao, Linjie Li, Zhengyuan Yang, Ping Yu, Rui Yan, Yuan Yao, Alex Jinpeng Wang

机构 * ZJU(浙江大学) NJU(南京大学) CSU(中南大学) Microsoft(微软公司) NJUST(南京理工大学)

专题命中 长视频与时序推理 :long video(title,abstract);分类 cs.CV

AI总结 研究利用MLLMs中验证选择提取层的跨模态注意力构建无训练的DAFS帧选择器,通过查询条件聚合提取帧级证据,将候选池大小和每帧令牌预算联合分配问题用动态规划解决,在Video-MME上表现出色,且无需重新训练即可跨多种模型和任务泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00858 2026-07-02 cs.CV cs.LG 新提交 79%

MoVA: Learning Asymmetric Dual Projections for Modular Long Video-Text Alignment

MoVA: 面向模块化长视频-文本对齐的非对称双投影学习

Peiyuan Zhu, Shaoan Xie, Zijian Li, Yifan Shen, Namrata Deka, Harsh Shrivastava, Guangyi Chen, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 长视频与时序推理 :long video(title,abstract);分类 cs.CV

AI总结 针对视频-文本对比学习中时间错位和语义不对称问题,提出MoVA框架,通过非对称双投影(文本侧自适应选择帧感知子空间,视频侧解缠文本相关视觉概念)实现灵活对齐,在多个任务上超越现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20561 2026-06-19 cs.CV 新提交 79%

TimeProVe: Propose, then Verify for Efficient Long Video Temporal Reasoning in Activities of Daily Living

TimeProVe: 先提出后验证,实现日常活动中的高效长视频时间推理

Arkaprava Sinha, Dominick Reilly, Siddharth Krishnan, Hieu Le, Srijan Das

机构 * University of North Carolina, Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 长视频与时序推理 :long video(title,abstract);分类 cs.CV

AI总结 提出TimeProVe框架,先通过轻量模块生成基于动作的候选假设,再调用昂贵VLM验证,在长视频问答中降低75%VLM调用和93%推理成本,性能提升7.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05089 2026-07-07 cs.CV 新提交 77%

TimeThink: Reasoning with Time for Video LLMs

TimeThink:用于视频语言模型的时间推理

Handong Li, Longteng Guo, Zikang Liu, Dongze Hao, Yepeng Tang, Zijia Zhao, Jie Jiang, Zhiwei Jin, Chen Chen, Haonan Lu, Jing Liu

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) OPPO AI Center, OPPO Inc.(OPPO公司OPPO人工智能中心)

专题命中 长视频与时序推理 :video understanding(abstract);video reasoning(abstract);long video(abstract);分类 cs.CV

AI总结 研究视频推理中模型发现时间证据的问题,提出TimeThink框架,将时间线索步骤作为优化原语,引入奖励和优化目标,构建数据集,实验表明该框架提升了时间定位和推理性能。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14015 2026-08-17 cs.CV cs.AI 新提交 74%

MedClaw: Heuristic Agent Harness for Long-Horizon Surgical Video Reasoning

MedClaw:用于长程手术视频推理的启发式智能体框架

Yingying Fan, Penghui Du, Leyan Zhu, Runze He, Zimeng Wu, Yuxuan Zhang, Liang Chen, Jiahao Xie, Jiangtang Wang, Shuai Shao, Anchao Yang, Yutong Bai, Yan Wang

机构 * School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院) University of Maryland(马里兰大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) University of British Columbia(不列颠哥伦比亚大学) Beijing Tiantan Hospital, Capital Medical University(首都医科大学附属北京天坛医院)

专题命中 长视频与时序推理 :video reasoning(title);分类 cs.CV

AI总结 本研究提出MedClaw智能体框架,通过分离推理与感知、启发式技能蒸馏循环,在仅需约100个标注示例的情况下,于自建及公开手术视频基准MedClawBench上,显著优于现有一次性VLM和通用视频智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22043 2026-06-23 cs.AI cs.CV cs.LG 新提交 74%

When Does a Video-Language Model Stop Watching? Reward Strength Controls the Formation and Reversal of Visual Shortcuts in Multimodal RLVR

视频语言模型何时停止观看?多模态RLVR中视觉捷径的形成与逆转受奖励强度控制

Zekun Xu

机构 * Zekun Xu(徐泽坤)

专题命中 长视频与时序推理 :video-language(title);分类 cs.CV

AI总结 研究多模态强化学习中视觉捷径的形成与逆转机制,发现惩罚强度可控制其出现和消除,且存在关键干预窗口。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13141 2026-06-12 cs.AI 新提交 71%

Rethinking RAG in Long Videos: What to Retrieve and How to Use It?

重新思考长视频中的RAG:检索什么以及如何使用?

Yuho Lee, Jisu Shin, Nicole Hee-Yeon Kim, Jihwan Bang, Juntae Lee, Kyuwoong Hwang, Fatih Porikli, Hwanjun Song

机构 * Department of Computer Science, Cranberry-Lemon University(蔓越莓柠檬大学计算机科学系)

专题命中 长视频与时序推理 :long video(title)

AI总结 针对视频检索增强生成中检索粒度单一和基准测试缺陷,提出V-RAGBench基准和CARVE方法,通过分块自适应重排序实现多配置交错证据,显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13113 2026-08-14 cs.CV cs.AI 新提交 70%

EgoMonth: A Month-Level Egocentric Video Benchmark for Long-Term Spatiotemporal Memory

EgoMonth:面向长期时空记忆的月级自我中心视频基准

Weitao Chen, Hu Jiaxin, Xie Tianyidan, Yang Li, Yuyi Qian, Banghao Xu, Ziheng Tang, Shenyi Wang, Mingyue Yu, Duo Li, Jiacheng Shi, Gao Wang, Zhan Xu, Zhicheng Qiu, Xuanfu Li, Jian Yang, Lanjun Wang, Zili Yi

机构 * Nanjing University(南京大学) Huawei Technologies Co., Ltd.(华为技术有限公司) Tianjin University(天津大学)

专题命中 长视频与时序推理 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 研究人员推出首个月级自我中心视频基准EgoMonth,评估发现当前主流MLLMs的长期时空记忆能力远逊于人类,仅为有损总结器而非忠实记忆器。

Comments 21 pages, 4 figures, 6 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11312 2026-07-14 cs.CV 新提交 70%

SLVMBench: Skill Learning from Video Memory

SLVMBench:从视频记忆中学习技能

Yudong Yang, Guangzhi Sun, Yixuan Li, Chao Zhang

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学)

专题命中 长视频与时序推理 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 SLVMBench是首个用于评估视频大语言模型从长视频记忆学习技能并应用于实时任务能力的基准测试,通过特定视频流和人工标注进行测试,发现现有视频LLMs在此方面有局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10190 2026-07-14 cs.LG cs.AI cs.CV 新提交 70%

PhysMRV: Physical Memory Retrieval and Verification for Physics Plausibility Reasoning

PhysMRV:用于物理合理性推理的物理内存检索与验证

Wenyuan Wang, Lianyu Hu, Hao Wang, Yang Liu

专题命中 长视频与时序推理 :video understanding(abstract);video-language(abstract);分类 cs.CV

AI总结 针对视频语言模型物理合理性推理不可靠的问题,提出免训练的PhysMRV框架,通过将训练视频转化为分层内存库,利用结构化物理证据指导VLM验证物理合理性,在多基准测试中取得一致改进,有效增强该推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31734 2026-07-01 cs.CV 新提交 70%

MemLearner: Learning to Query Context memory for Video World Models

MemLearner: 学习查询上下文记忆用于视频世界模型

Jiwen Yu, Jianxiong Gao, Jianhong Bai, Yiran Qin, Kaiyi Huang, Quande Liu, Xintao Wang, Pengfei Wan, Kun Gai, Xihui Liu

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Zhejiang University(浙江大学) Kuaishou Technology(快手科技)

专题命中 长视频与时序推理 :video generation(abstract);long video(abstract);分类 cs.CV

AI总结 提出基于学习的自适应上下文查询方法MemLearner,利用视频生成模型自身进行上下文记忆查询,解决视频世界模型在遮挡和动态场景下的场景一致性问题。

Comments ECCV 2026, Project Page: https://yujiwen.github.io/memlearner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11136 2026-07-14 cs.DC 新提交 67%

Xema: Efficient Diffusion Serving through Fine-Grained Memory Management and Auto-Configuration

Xema:通过细粒度内存管理和自动配置实现高效扩散服务

Xueze Kang, Guangyu Xiang, Suyi Li, Yuxin Wang, Shaohuai Shi, Lin Zhang, Xiaowen Chu

专题命中 长视频与时序推理 :video generation(abstract);long video(abstract)

AI总结 研究针对扩散模型服务受GPU内存限制问题,提出Xema系统,通过细粒度内存管理和自动配置,利用可预测张量生命周期优化内存,引入离线规划器联合选择参数,实现高效扩散服务,相比现有配置提升SLO达成率并降低规划成本。

详情

展开后加载摘要…

URL PDF HTML 收藏