arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1299 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 1299 篇

2608.07864 2026-08-12 cs.CV 版本更新 57%

UniScale: Arbitrary-Scale Industrial Anomaly Generation

UniScale:任意尺度的工业异常生成

Shilei Zeng, Linxin Guan, Xurui Li, Yaohan Tang, Yu Zhou

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对工业异常检测中真实异常样本不足及小尺度异常易丢失的问题,提出UniScale框架,通过EMT策略和生成后融合去噪方法,在VisA、MVTec AD 2等数据集上显著优于现有方法。

Comments Accepted at ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28803 2026-08-12 cs.CV cs.LG 版本更新 57%

HoloQ-VLA: Uniform W4A4 Quantization of Vision-Language-Action Models

Ω-QVLA: 通过复合旋转和逐步缩放实现视觉-语言-动作模型的鲁棒量化

Xinyu Wang, Mingze Li, Sicheng Lyu, Dongxiu Liu, Kaicheng Yang, Ziyu Zhao, Yufei Cui, Xiao-Wen Chang, Peng Lu

机构 * McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Mila – Quebec AI Institute(魁北克AI研究所)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出Ω-QVLA,首个无需训练的后训练量化框架,通过复合SVD-Hadamard旋转和逐步DiT激活缩放量化,将VLA模型的语言骨干和扩散动作头统一压缩至W4A4精度,在LIBERO上达到或超越FP16性能,内存减少71.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02979 2026-08-11 cs.CV 版本更新 57%

Not All Frames Deserve Full Computation: Accelerating Autoregressive Video Generation via Selective Computation and Predictive Extrapolation

并非所有帧都值得完全计算:通过选择性计算和预测外推加速自回归视频生成

Hanshuai Cui, Zhiqing Tang, Zhi Yao, Fanshuai Meng, Weijia Jia, Wei Zhao

机构 * Institute of Artificial Intelligence and Future Networks, Beijing Normal University(北京师范大学人工智能与未来网络研究院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Shenzhen University of Advanced Technology(深圳理工大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SCOPE框架,通过三模式调度器和选择性计算,提升自回归视频扩散模型效率,在保持质量的同时实现4.73倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00633 2026-08-11 cs.CV cs.AI 版本更新 57%

From Alignment to Synthesis Contrastive Volumetric Grounding for Text-to-CT Generation

从对齐到合成:用于文本到CT生成的对比体 grounding

Daniele Molino, Camillo Maria Caruso, Filippo Ruffini, Paolo Soda, Valerio Guarrasi

机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma(人工智能与计算机系统单位,工程系,罗马生物医学大学) Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University(诊断与干预部门,生物医学工程与放射物理学,乌梅拉大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对文本到CT生成的视觉-语言对齐瓶颈,提出带结构化难负样本的3D-CLIP编码器,结合端到端潜在扩散模型,在CT-RATE数据集上实现了优于现有方法的性能。

Comments Accepted at BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05663 2026-08-10 cs.CV cs.SD 版本更新 57%

Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

Vorch-Streamer:将人类音视频生扩展至实时长格式流式生成

Menglin Han, Yang Ding, Yulei Lu, Haoran Yu, Xin Ma, Junyi Chen, Zhangkai Ni, Lin Ma, Yaohui Wang

机构 * Vorch Team(Vorch团队) Tongji University(同济大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 Vorch-Streamer是一款后训练框架,通过混合训练、自强制与DMD蒸馏等技术,实现了超24 FPS的实时长格式T2AV流式音视频生成,兼具音唇同步性与身份保留能力。

Comments Project page: https://vorch-project.github.io/Vorch-Streamer-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26839 2026-08-10 cs.RO cs.CV 版本更新 57%

Ordinal Neural Collapse as a Representation Prior for Visual Navigation

序数神经坍缩作为视觉导航的表征先验

E-In Son, Jung-Taak Kim, Seung-Woo Seo

机构 * Seoul National University(首尔大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对视觉模仿学习中编码器学习到模糊、动作无关表征的问题,提出ORION方法,利用导航动作的序数结构显式组织表征空间,在仿真和真实环境中显著提升导航成功率。

Comments 27 pages, 14 figures. Supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23655 2026-08-10 cs.MM 版本更新 57%

A 3D-Cascading Crossing Coupling Framework for Hyperchaotic Map Construction and Its Application to Color Image Encryption

一种用于超混沌映射构建的3D级联交叉耦合框架及其在彩色图像加密中的应用

Jilei Sun, Dianhong Wu

专题命中 扩散模型 :diffusion(abstract);分类 cs.MM

AI总结 本文提出了一种3D级联交叉耦合框架用于构建超混沌映射,并应用于彩色图像加密,实现了高安全性的加密方案。

Comments Withdrawn as the research requires substantial additional work and major revisions to meet the standard of a complete study

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12236 2026-08-10 eess.IV cs.CV 版本更新 57%

Resolution-Agnostic Neural Operators for Multi-Rate Sparse-View CT

分辨率无关的神经算子用于多速率稀疏视角CT

Aujasvit Datta, Jiayun Wang, Asad Aali, Anima Anandkumar

机构 * Caltech(加州理工学院) IIT Kanpur(印度理工学院坎普尔分校) Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 CTO提出一种分辨率无关的神经算子框架,通过连续函数空间实现多速率稀疏视角CT重建的泛化,提升重建质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04955 2026-08-07 cs.CV 版本更新 57%

Towards Valid B-Rep Generation: Training-Free Wireframe Anomaly Detection and Repair

面向有效边界表示(B-Rep)生成:无需训练的线框异常检测与修复

Jingyu Wu, Youcheng Cai, Tengyu Luo, Ligang Liu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对CAD模型B-Rep生成中线框的几何拓扑异常问题,提出无需训练的WDR框架,通过GTAD检测风险、EGGTR修复,提升了B-Rep有效性且保留模型质量,可集成至多种生成流水线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04657 2026-08-07 cs.CV 版本更新 57%

MobileWAM: Bridging World Action Models to Mobile Manipulation with Chain-of-Foresight

MobileWAM:用前瞻链将世界动作模型(WAM)与移动操作任务对接

Zehua Fan, Junjie He, Wenxuan Song, Xi Wang, Wenqi Lyu, Linge Zhao, Fuhao Li, Zihan You, Yifei Yang, Kaiming Xu, Qi Jiang, Yue Jiang, Haoang Li, Cheng Chi, Feng Gao, Bailin Li, Yan Wang

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) AIR Wuxi Innovation Center, Tsinghua University(清华大学AIR无锡创新中心) The University of Adelaide(阿德莱德大学) Wuhan University(武汉大学) Southeast University(东南大学) Beijing Jiaotong University(北京交通大学) Fudan University(复旦大学) Li Auto(理想汽车) School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 MobileWAM是一种混合Transformer架构,通过前瞻链(CoF)解决移动操作的异质动态问题,在ManiSkill-HAB上超越SOTA策略,可微调至真实移动操作机器人且泛化性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26320 2026-08-07 cs.RO cs.CV 版本更新 57%

DFM-VLA: Iterative Action Refinement for Robot Manipulation via Discrete Flow Matching

DFM-VLA:通过离散流匹配实现机器人操作的迭代动作细化

Jiayi Chen, Wenxuan Song, Jiaxin Fang, Ruiqing Yin, Jingbo Wang, Shuai Chen, Jieyuan Pei, Yikai Qin, Feifan Chen, Haodong Yan, Zhide Zhong, Wen Chen, Yan Wang, Yuxiang Gao, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Harbin Institute of Technology(哈尔滨工业大学) ShanghaiTech University(上海科技大学) Shanghai Institute of Technical Physics, CAS(中国科学院上海技术物理研究所)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 DFM-VLA通过离散流匹配实现机器人操作中动作token的迭代细化,采用动态概率速度场和双阶段解码策略,提升了动作生成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18831 2026-08-07 cs.CV 版本更新 57%

IDperturb: Enhancing Variation in Synthetic Face Generation via Angular Perturbation

IDperturb: 通过角度扰动增强合成人脸生成的多样性

Fadi Boutros, Eduarda Caldeira, Tahar Chettaoui, Naser Damer

机构 * Fraunhofer IGD(弗劳恩霍夫图像识别研究所) Department of Computer Science, TU Darmstadt(图腾大学计算机科学系)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 IDperturb通过角度扰动提升合成人脸生成的多样性,从而提高FR模型的性能和泛化能力。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17850 2026-08-06 cs.CV 版本更新 57%

UniCSG: Unified High-Fidelity Content-Constrained Style-Driven Generation via Staged Semantic and Frequency Disentanglement

UniCSG:通过分阶段语义和频率解耦实现统一的高保真内容约束风格驱动生成

Jingwei Yang, Ruoxi Wu, Wei Shen, Meng Li, Yulong Liu, Huimin She, Lunxi Yuan

机构 * China University of Mining and Technology(中国矿业大学) OPPO Artificial Intelligence Center(OPPO人工智能中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 UniCSG通过分阶段语义和频率解耦,解决风格迁移中内容与风格纠缠问题,提升生成内容的忠实度和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01693 2026-08-06 cs.CV 版本更新 57%

From Understanding to Erasing: Towards Complete and Stable Video Object Removal

从理解到擦除:迈向完全且稳定的视频对象移除

Dingming Liu, Wenjing Wang, Chen Li, Jing Lyu, Haotian Dong

机构 * Peking University(北京大学) WeChat Vision, Tencent Inc.(腾讯微信视觉)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出通过外部和内部指导机制,结合视觉基础模型与视频扩散模型,提升视频对象移除的物理和语义理解能力,实现清晰且连贯的移除效果,并建立首个真实世界基准测试。

Comments Code: https://github.com/WeChatCV/UnderEraser

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15065 2026-08-05 cs.RO cs.CV cs.LG 版本更新 57%

DriftWorld: Fast World Modeling through Drifting

DriftWorld:通过漂移实现快速世界建模

Susie Lu, Haonan Chen, Weirui Ye, Yilun Du

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对预测性世界模型生成展开慢的问题,提出基于漂移生成模型的DriftWorld,训练时学习动作条件漂移以快速生成未来帧,在机器人操作基准测试中实现快速准确决策,还能作离线模拟器,性能优于基于扩散的基线。

Comments Website at https://susie-lu.github.io/driftworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14019 2026-08-05 cs.CV 版本更新 57%

RISE: Single Static Radar-based Indoor Scene Understanding

RISE:基于单静态雷达的室内场景理解

Kaichen Zhou, Laura Dodds, Sayed Saad Afzal, Fadel Adib

机构 * Massachusetts Institute of Technology(麻省理工学院) Cartesian Systems

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出RISE系统,利用毫米波雷达的多径反射(传统视为噪声)编码几何线索,通过双角度多径增强和模拟到现实的分层扩散框架,实现布局重建和物体检测,在50,000帧数据集上布局重建倒角距离降低60%,首次实现基于毫米波雷达的物体检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18792 2026-08-05 cs.CV 版本更新 57%

Rethinking Uncertainty Quantification and Entanglement in Image Segmentation

重新思考图像分割中的不确定性量化与纠缠

Jakob Lønborg Christensen, Vedrana Andersen Dahl, Morten Rieger Hannemose, Anders Bjorholm Dahl, Christian F. Baumgartner

机构 * Technical University of Denmark, DTU Compute(丹麦技术大学,DTU计算学院) University of Lucerne, Faculty of Health Sciences and Medicine(卢塞恩大学,医学与健康科学学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文研究了图像分割中不确定性量化的分解与纠缠问题,分析了不同模型组合的不确定性纠缠程度,并提出量化指标,评估了不同任务下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27110 2026-08-04 cs.CV 版本更新 57%

FreqForcing: Autoregressive Long Video Generation via Spectral Self-Anchoring

FreqForcing:基于频谱自锚定的自回归长视频生成方法

Jiatong Li, Leo Liang, Linghe Kong, Yulun Zhang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文针对自回归长视频生成中的误差累积问题,提出无需训练的FreqForcing框架,通过频谱自锚定技术实现24倍外推,性能优于现有无训练方法且与有训练方法有竞争力。

Comments Code is available at: https://github.com/jiatongli2024/FreqForcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26817 2026-08-04 cs.RO cs.CV 版本更新 57%

From Uncertainty to Determinism: Coarse-to-Fine Visual Floorplan Localization without Ray Matching

从不确定性到确定性:无射线匹配的由粗到细视觉楼层平面图定位

Shiyong Meng, Bolei Chen, Ping Zhong, Yang Wan, Rongzhi Wang, Jiazhi Xia, Jianxin Wang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对视觉楼层平面图定位的多模态姿态分布问题,提出无射线匹配的由粗到细框架,通过图像条件姿态扩散模型与局部细化器实现定位,在S3D和ZInD基准上达到最优精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24024 2026-08-04 cs.CV 版本更新 57%

GeoStereo: A Unified Stereo Geometry Estimation Framework for Disparity and Surface Normal

用于视差和表面法线的统一立体几何估计框架

Qizhe Wei, Xianda Guo, Shaocong Xu, Hong Li, Runyi Yang, Hao Zhao

机构 * Beijing Institute of Technology(北京理工大学) School of Computer Science, Wuhan University(武汉大学计算机科学学院) Beihang University(北京航空航天大学) INSAIT, Sofia University(索非亚大学INSAIT) BAAI AIR, Tsinghua University(清华大学BAAI AIR)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文针对立体匹配和表面法线估计问题,提出统一框架GeoStereo,结合前馈立体匹配与基于扩散的法线估计分支,引入初始化策略与扭曲条件,实现有效交互,在多场景表现可靠,零样本设置下视差和法线估计精度高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06216 2026-08-04 cs.CV 版本更新 57%

MoWorld: A Flash World Model

MoWorld:一种快速世界模型

Team Moxin, Deyi Ji, Tianrun Chen, Xin Zhang, Jiale Yang, Qi Zhu, An Zhao, Zihao Xie, Han Wang, Xuanyi Liu, Yixiang Zhou, Pei Liu, Yi Tan, Cheng Chen, Dayi Zhu, Mingyu Wei, Hanjie Xu, Jun Liao, Siqi Li, Lingyu Lu, Hongye Fang, Hongming Tan, Youjiang Zhu, Taiyu Zhang, Zejian Li, Chaotao Ding, Zhipeng Liang, Wenxuan Song, Yi Li, Baochuan Yang, Xin Jiang, Ben Feng, Jingyuan Zou, Yanlin Liu, Rong Shi, Lingfeng Li, Liyi Yao, Lanyun Zhu, Yunhe Pan, Lingyun Sun

机构 * Moxin Technology(魔心科技)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究旨在提升世界模型实用性与推理效率。提出MoWorld,基于3D原生数据引擎,有课程跨帧预训练等策略,能在NPU上达50 FPS实时交互,平均推理成本低,为世界模型大规模应用提供基础并展示多种应用。

Comments Project Page: https://moxin-tech.github.io/moworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12255 2026-08-04 cs.CV cs.AI 版本更新 57%

ARGen: Affect-Reinforced Generative Augmentation towards Vision-based Dynamic Emotion Perception

ARGen:基于情感强化的生成增强方法用于基于视觉的动态情绪感知

Huanzhen Wang, Ziheng Zhou, Jiaqi Song, Li He, Yunshi Lan, Yan Wang, Wenqiang Zhang

机构 * Fudan University(复旦大学) East China Normal University(华东师范大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出ARGen框架,通过情感语义注入和自适应强化扩散阶段,解决野外动态表情识别中的数据稀缺问题,提升情绪感知的生成质量和识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02817 2026-08-04 cs.CV 版本更新 57%

MMPhysVideo: Physically Plausible Video Generation Through Joint RGB-Perception Modeling

MMPhysVideo: 通过联合多模态建模提升视频生成的物理合理性

Shubo Lin, Xuanyang Zhang, Wei Cheng, Weiming Hu, Gang Yu, Jin Gao

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) StepFun(阶跃星辰) Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(多模态信息超级智能安全北京市重点实验室) School of Information Science and Technology, Shanghai Tech University(上海科技大学信息科学与技术学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 MMPhysVideo通过联合多模态建模提升视频生成的物理合理性,将感知线索统一为伪RGB格式,提出双向控制教师架构以减少跨模态干扰,并通过MMPhysPipe构建物理丰富的多模态数据集,提升物理合理性和视觉质量。

Comments Project Page: https://shubolin028.github.io/MMPhysVideo-Page

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10719 2026-08-04 cs.RO cs.CV 版本更新 57%

From Representational Complementarity to Dual Systems: Synergizing VLM and Vision-Only Backbones for End-to-End Driving

从表征互补性到双系统:协同VLM和纯视觉骨干网络用于端到端驾驶

Sining Ang, Yuguang Yang, Chenxu Dang, Canyu Chen, Cheng Chi, Haiyan Liu, Xuanyao Mao, Jason Bao, Xuliang, Bingchuan Sun, Yan Wang

机构 * Department of Automation, University of Science and Technology of China(中国科学技术大学自动化系) School of Electronic Information Engineering, Beihang University(北京航空航天大学电子信息工程学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) National Superior College for Engineers, Beihang University(北京航空航天大学国家级工程师学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Lenovo Group Limited(联想集团有限公司) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文通过协同VLM和纯视觉骨干网络,提出HybridDriveVLA和DualDriveVLA,提升端到端驾驶的PDMS性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05950 2026-08-04 cs.CV cs.AI 版本更新 57%

CLONE: Continuous Latent Optimization for Normal Estimation via 3D Gaussian Splatting

CLONE: 基于3DGS的闭环可微优化框架用于单图像法线估计

Yanxing Liang, Yinghui Wang, Wei Li, Tao Yan, Jiaxing Shen

机构 * School of Artificial Intelligence and Computer Science, Jiangnan University, Wuxi, China(江南大学人工智能与计算机科学学院,中国无锡) School of Data Science, Lingnan University, Hong Kong, China(岭南大学数据科学学院,中国香港)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出CLONE框架,通过3D高斯泼溅参数化场景并利用协方差特征分解得到连续可微法线,结合可微光照模型和一步确定性扩散精化网络,在统一重投影目标下联合优化,实现无需真值法线监督的几何一致性单图像法线估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21529 2026-08-03 cs.CV cs.AI 版本更新 57%

ElasticTTT: Prior-Preserving Test-Time Tuning for Video Editing

ElasticTTT:用于视频编辑的保留先验的测试时调优

Yueyi Liu, Chi Zhang, Sen Cui, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对预训练扩散模型的测试时调优中存在的问题,提出ElasticTTT框架,通过目标分布正则化、对比条件采样和异步噪声调度等方法,成功保留基础模型生成先验,在一次性视频编辑中达领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25333 2026-08-03 cs.CV 版本更新 57%

Teaching Video Generators to Remember: Eliciting Dynamic Memory for Out-of-Sight State Evolution

教会视频生成器记忆:为不可见状态演化引出动态记忆

Tianshuo Xu, Yichen Xie, Depu Meng, Chensheng Peng, Quentin Herau, Bo Jiang, Yihan Hu, Wei Zhan

机构 * Applied Intuition(应用直觉) University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对视频生成模型在观测中断时状态冻结的问题,提出ReMind框架,通过面向记忆的数据构建、事件感知训练和缓存适配,利用KV缓存机制实现动态记忆,在STEVO-Bench和恢复任务上取得最佳成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08328 2026-08-03 cs.LG cs.CV 版本更新 57%

P-Flow: Proxy-gradient Flows for Linear Inverse Problems

P-Flow:用于线性逆问题的代理梯度流

Zehua Jiang, Fenghao Zhu, Xinquan Wang, Chongwen Huang, Zhaoyang Zhang

机构 * Zhejiang University(浙江大学) University of Notre Dame(诺丁汉大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 P-Flow通过代理梯度更新源点,稳定逆问题重建过程,避免长链微分的数值不稳定性与计算开销,结合高维空间测度集中现象,提供理论分析和实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16870 2026-08-03 cs.CV cs.AI 版本更新 57%

Demystifying Video Reasoning

揭秘视频推理

Ruisi Wang, Zhongang Cai, Fanyi Pu, Junxiang Xu, Wanqi Yin, Maijunxian Wang, Ran Ji, Chenyang Gu, Bo Li, Ziqi Huang, Hokin Deng, Dahua Lin, Ziwei Liu, Lei Yang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) University of California, San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文通过实验揭示视频扩散模型中的推理主要发生在去噪步骤中,提出链式步骤(CoS)机制,并发现工作记忆、自我修正和感知先行等涌现行为,最后提出一种无需训练的集成策略来提升推理能力。

Comments Homepage: https://www.wruisi.com/demystifying_video_reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08390 2026-08-03 cs.RO cs.CV 版本更新 57%

DuetHOI: Language-Guided Bimanual Hand--Object Motion Generation with Articulation Planning and Contact Refinement

StructBiHOI: 结构化关节建模用于长时程双臂手-物体交互生成

Zhi Wang, Yuyan Liu, Liu liu, Ruonan Liu, Ruixuan Liu

机构 * Hefei University of Technology(合肥工业大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 StructBiHOI通过结构化关节建模框架实现长时程双臂手-物体交互生成,提升稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏