2601.08010 2026-07-15 cs.CV 版本更新 70% CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation CASHEW: 通过迭代轨迹聚合稳定多模态推理 Chaoyu Li, Fei Tao, Pooyan Fazli 机构 * Arizona State University(亚利桑那州立大学) ; NewsBreak 纠错 专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV AI总结 提出CASHEW框架,通过迭代聚合多候选推理轨迹并利用视觉验证过滤幻觉步骤,以及其强化学习变体CASHEW-RL,显著提升多模态推理的稳定性和准确性。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2602.16918 2026-07-15 cs.CV cs.AI 版本更新 57% Xray-Visual Models: Scaling Vision models on Industry Scale Data Xray-Visual模型:在产业级数据上扩展视觉模型 Shlok Mishra, Tsung-Yu Lin, Linda Wang, Hongli Xu, Yimin Liu, Michael Hsu, Chaitanya Ahuja, Hao Yuan, Jianpeng Cheng, Hong-You Chen, Haoyuan Xu, Chao Li, Sreya Dutta Roy, Abhijeet Awasthi, Jihye Moon, Don Husa, Michael Ge, Sumedha Singla, Arkabandhu Chowdhury, Phong Dingh, Satya Narayan Shukla, Yonghuan Yang, David Jacobs, Qi Guo, Jun Xiao, Xiangjun Fan, Aashu Singh 机构 * Meta-AI ; MIT(麻省理工学院) ; University of Maryland(马里兰大学) 纠错 专题命中 视频理解 :video understanding(abstract);分类 cs.CV AI总结 Xray-Visual通过三阶段训练流程和LLM2CLIP技术,在产业级数据上实现高效多模态视觉模型,取得最佳性能并提升鲁棒性与泛化能力。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2606.31946 2026-07-15 cs.CV 版本更新 79% World Narrative Model for Highly Controllable Video Generation: A Paradigm Shift from Pixel Sampling to Physical World Orchestration 世界叙事模型:从像素采样到物理世界编排的高度可控视频生成范式转变 Ye Chen, Xuanhong Chen, Yupeng Zhu, Liming Tan, Zhewen Wan, Yuxuan Xiong, Tielong Wang, Jinfan Liu, Wuze Zhang, Xiongzhen Zhang, Feifei Li, Xianglin Luo, Zhehan Zhao, Zhifan Zhang, Laisheng Kou, Zhujin Liang, Yugang Chen, Muchun Chen, Xu Miao, Yijing Zhang, Xiaojie Sheng, Qiang Hu, Jialiang Chen, Weimin Zhang, Wenjun Zhang, Bingbing Ni 机构 * Shanghai Jiao Tong University(上海交通大学) 纠错 专题命中 视频生成 :video generation(title,abstract);分类 cs.CV AI总结 提出世界叙事模型(WNM),将视频生成解耦为结构化物理叙事与像素渲染,通过协同代理将多模态输入转化为可编辑的4D世界表示,驱动基础模型生成符合创作者意图的视频,大幅提升可控性。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2412.09122 2026-07-15 cs.CV 版本更新 79% LVMark: Robust Watermark for Latent Video Diffusion Models LVMark:用于潜在视频扩散模型的鲁棒水印 Youngdong Jang, MinHyuk Jang, JaeHyeok Lee, Feng Yang, Gyeongrok Oh, Jongheon Jeong, Sangpil Kim 机构 * Department of Artificial Intelligence, Korea University, Seoul 02841, Republic of Korea(人工智能系,韩国大学,首尔02841,大韩民国) ; Google DeepMind, Mountain View, CA 94043, USA(谷歌DeepMind,山景城,加利福尼亚州94043,美国) 纠错 专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV AI总结 针对视频扩散模型现有水印方法的局限,提出LVMark方法,通过学习相邻帧一致性设计新颖水印解码器,结合小波域低频分量与视频颜色特征确保解码准确,训练潜在解码器保持视觉保真,平衡视觉质量与比特精度,实现高容量鲁棒水印嵌入。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2607.01117 2026-07-15 cs.CV 版本更新 57% MoHallBench: A Benchmark for Motion Hallucination in Video Large Language Models MoHallBench: 视频大语言模型中运动幻觉的基准测试 Sihan Chen, Jiale Li, Jianghang Lin, Mengyuan Liu 机构 * Xiamen University(厦门大学) ; South China University of Technology(华南理工大学) ; Peking University(北京大学) 纠错 专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV AI总结 提出MoHallBench基准,系统评估视频大语言模型中的运动幻觉,涵盖共现先验、顺序推理和相似混淆三类来源,揭示动作识别与幻觉抵抗的解耦现象。 Comments 19 pages, 5 figures 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图