arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-07-31 至 2026-07-31 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 3 篇

2605.20290 2026-07-31 cs.GR cs.CV 版本更新 70%

PhysOmni: Physics-Grounded Multi-Object Scene Generation from a Single Image with Real-Time Interaction

TelePhysics: 从单张图像生成物理一致的多物体场景 with 实时交互

Xin Zhang, Yabo Chen, Yijie Fang, Wanying Qu, Haibin Huang, Chi Zhang, Feng Xu, Xuelong Li

机构 * Fudan University(复旦大学) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI))

专题命中 长视频与时序推理 :video generation(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出TelePhysics,一种无需训练的框架,通过整体场景级3D重建将单张图像转换为物理一致且可控的视频。该方法通过统一的空间坐标系统表示完整场景几何,解决物体穿透和对齐模糊问题,实现准确的多物体交互和更丰富的复杂控制类型,从而在保持逼真视觉保真度的同时实现实时物理交互预览。

Comments ACMMM 2026. Project page: https://physomni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28627 2026-07-31 cs.CV cs.AI cs.LG 新提交 57%

ReToken: One Token to Improve Vision-Language Models for Visual Retrieval

ReToken:用一个标记改进用于视觉检索的视觉-语言模型

Yao Xiao, Reuben Tan, Zhen Zhu, Yuqun Wu, Jianfeng Gao, Derek Hoiem

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research(微软研究院) Google DeepMind(谷歌DeepMind)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 该研究提出轻量级ReToken,通过选择视觉键值缓存中与查询相关的稀疏标记解决长视觉上下文的视觉检索难题,在多基准测试中提升Qwen3VL-8B等模型性能,且可在单H100运行。

Comments Code: https://github.com/avaxiao/ReToken

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28156 2026-07-31 cs.CL 新提交 50%

RRM: Experience-Driven Reflective Retrieval Memory for Long-Horizon Multimodal Reasoning

RRM:用于长周期多模态推理的经验驱动反思式检索记忆

Jingxiang Fan, Junbao Zhuo, Bochao Zou

专题命中 长视频与时序推理 :long video(abstract)

AI总结 该研究针对现有多模态长期智能体检索机制不足的问题,提出RRM框架,通过反思式经验记忆提炼跨任务检索策略,在多个多模态推理数据集上取得优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏