arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2289 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2289 篇

2607.17773 2026-07-21 cs.MM 新提交 57%

FillGauss: Fine-Grained Filling-Aware Impact Sound Generation for 3D Gaussian Splatting

FillGauss:用于3D高斯点云的细粒度填充感知撞击声生成

Chen Yang, Ganye Wen, Bin Huang, Jiayi Lyu, Zehai Niu, Linlin Shen, Jinbao Wang

专题命中 扩散模型 :diffusion(abstract);分类 cs.MM

AI总结 研究针对多模态AI中从视觉合成撞击声的挑战,提出细粒度填充感知撞击声生成任务。基于FillImpact数据集,构建FillGauss框架,融合多种要素实现位置、撞击物及填充感知音频生成,达物理基础跨模态音频生成新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17725 2026-07-21 cs.GR 新提交 57%

Fast VEM Fluid Simulation

快速虚拟单元法流体模拟

Runze Zhang, Bo Ren

专题命中 扩散模型 :diffusion(abstract);分类 cs.GR

AI总结 研究流体与复杂边界相互作用模拟难题,提出FastVEM框架,采用虚拟单元法离散、特定网格构建策略及加速压力投影的求解器,相比先前方法,大幅加速压力投影阶段,能处理更复杂边界几何。

Journal ref ACM Transactions on Graphics, Vol. 45, No. 4, Article 65, 18 pages, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17675 2026-07-21 cs.CV 新提交 57%

ShotPlan: Cinematic Video Generation with Learnable Planning Token

ShotPlan:使用可学习规划令牌生成电影级视频

Su Guo, Guangce Liu, Haosen Yang, Jiepeng Wang, Cong Liu, Junqi Liu, Haibin Huang, Hongxun Yao, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI)) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对电影级视频生成难题,提出ShotPlan框架,基于视频扩散基础模型,引入可学习规划令牌捕捉镜头过渡线索,结合分数时间旋转位置嵌入在帧级别建模,实验证明其优于现有方法,提升了镜头管理与一致性。

Comments Project page: https://pensioner-11.github.io/ShotPlan/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17611 2026-07-21 cs.CV cs.AI 新提交 57%

Coarse-to-fine Framework for Generative MEF via Implicit Neural Representation

基于隐式神经表示的生成式多曝光融合粗到细框架

Sangmin Han, Jinho Kim, Jinwoo Kim, Dongyoung Kim, Seon Joo Kim

机构 * Yonsei University(延世大学) LG Electronics(LG电子)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对多曝光融合问题,提出LIIFusion粗到细框架,粗阶段通过自适应曝光校正进行低分辨率生成融合,细阶段将局部隐式图像函数适配为多曝光融合函数,加速达3.5倍,提升了结构保真度和感知质量,为生成式MEF实际应用提供途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17097 2026-07-21 cs.CV 新提交 57%

HarmoHOI: Harmonizing Appearance and 3D Motion for Multi-view Hand-Object Interaction Synthesis

HarmoHOI:用于多视图手-物体交互合成的外观与3D运动协调

Lingwei Dang, Juntong Li, Zonghan Li, Hongwen Zhang, Liang An, Wei Min, Yebin Liu, Qingyao Wu

机构 * South China University of Technology(华南理工大学) Beijing Normal University(北京师范大学) Tsinghua University(清华大学) Shadow AI(影谱科技)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对多视图手-物体交互合成难题,提出HarmoHOI统一扩散框架,用多视图扩散Transformer混合模型联合建模视频与点轨迹,结合全局运动对齐扩散确保一致性,采用混合数据学习策略,实现多视图HOI高质量合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16283 2026-07-21 cs.CV cs.AI 新提交 57%

GenSyn10: A Multi-Generative AI Dataset For Benchmarking Image Classification

GenSyn10:用于图像分类基准测试的多生成式人工智能数据集

Md Faraz Kabir Khan, Saeed Anwar, Ghulam Mubashar Hassan

机构 * The University of Western Australia(西澳大利亚大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对生成式AI输出检测难的问题,引入GenSyn10数据集,由三种模型生成图像。通过标准化协议整理数据,评估17个分类模型,结果显示CIFAR-10训练模型在该数据集上有一定准确率,确立其为合成图像检测基准,助力相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16190 2026-07-20 cs.CV 新提交 57%

FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation

FVAttn:用于视频生成的具有运行时负载均衡的自适应稀疏注意力

Hao Liu, Chenghuan Huang, Ye Huang, Zhiying Wen, Hao Liu, Mohan Zhang, Chen Li, Ziyang Ma, Jing Lyu, Jiangsu Du

机构 * Tencent Inc.(腾讯公司) Peking University(北京大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究视频生成中自注意力瓶颈问题,提出FVAttn方法,通过Top-$p$路由等技术及运行时负载均衡等策略,提升自适应稀疏注意力分布式执行效率,降低负载不平衡,实现注意力和推理加速,且视频质量有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15898 2026-07-20 cs.CV cs.AI cs.LG cs.RO 新提交 57%

Orbis 2: A Hierarchical World Model for Driving

Orbis 2:一种用于驾驶的分层世界模型

Sudhanshu Mittal, Arian Mousakhan, Silvio Galesso, Karim Farid, Jonannes Dienert, Rajat Sahay, Thomas Brox

机构 * University of Freiburg(弗莱堡大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对当前世界模型不足提出分层驾驶世界模型,跨两层分解预测,结合扩散强制预训练和教师强制微调,在长距离生成保真度等多方面取得领先成果。

Comments Project page: https://lmb-freiburg.github.io/orbis2.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15849 2026-07-20 cs.CV cs.AI 新提交 57%

Test-Time Noise Guided Adaptation for Realistic Autoregressive Video Generation

用于逼真自回归视频生成的测试时噪声引导适应

Dimitrios Karageorgiou, Symeon Papadopoulos, Ioannis Kompatsiaris, Efstratios Gavves

机构 * Information Technologies Institute, CERTH(信息技术研究所,希腊研究与技术中心) University of Amsterdam(阿姆斯特丹大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对自回归视频扩散模型误差积累问题,提出TANGO方法,通过噪声引导优化避免模型陷入终点,在VBench上有显著改进,降低了弗雷歇视频距离。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15667 2026-07-20 cs.CV 新提交 57%

PE-Field 4D: Video Generation Models as Canvas

PE-Field 4D:作为画布的视频生成模型

Yunpeng Bai, Haoxiang Li, Qixing Huang

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Pixocial Technology(皮克社交科技)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究视频生成中扩散变换器控制场景几何形状的挑战,通过重新审视位置编码作用,引入几何感知交叉注意力机制及相关编码方案,构建可控视频生成框架,提升视点相关编辑任务的空间可控性且保留模型生成先验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14898 2026-07-17 cs.CV cs.AI 新提交 57%

FlashDecoder: Real-Time Latent-to-Pixel Streaming Decoder with Transformers

FlashDecoder:基于Transformer的实时潜空间到像素流解码器

Minguk Kang, Suha Kwak

机构 * Pika Labs(皮卡实验室) POSTECH(浦项科技大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对实时视频生成中潜视频扩散模型解码慢、内存占用大的问题,提出FlashDecoder,一种基于Transformer的纯视频解码器,通过滚动KV缓存和顺序处理帧实现快速解码,在重建质量匹配卷积解码器的同时大幅提升速度并减少内存占用。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14088 2026-07-16 cs.CV 新提交 57%

VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders

VideoRAE:通过表示自动编码器驯服用于生成建模的视频基础模型

Zhihao Xie, Junfeng Wu, Xinting Hu, Junchao Huang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huazhong University of Science and Technology(华中科技大学) Shenzhen Loop Area Institute(深圳河套学院) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究视频生成模型潜在空间问题,提出VideoRAE,利用冻结视频基础编码器特征经1D自注意力投影仪压缩,支持多种潜在空间,通过多码本高维量化等实现强大重建,收敛快,验证了冻结VFM表示的有效性。

Comments Home page: https://zhxie0117.github.io/VideoRAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13522 2026-07-16 cs.RO cs.CV 新提交 57%

Kepler-Encoder-v0.1: Towards a Multimodal Embedding Model for Robots

开普勒编码器v0.1:迈向机器人的多模态嵌入模型

Ishneet Sukhvinder Singh, Dhanoosh Pooranakumaran, Alex Nguyen, Jia Qi Yip

机构 * Menlo Research(门洛研究公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对机器人理解自身状态问题,提出开普勒编码器v0.1,通过学习查询交叉注意力层融合多模态信息,经自监督训练。实验表明其仅视觉潜空间能恢复末端执行器状态,优于其他方法,单个编码器涵盖多个机器人,冻结潜空间有多种用途。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13365 2026-07-16 cs.CV 新提交 57%

DiffGI: Differentiable Geometry Images for High-Fidelity Thin-Shell 3D Generation

DiffGI:用于高保真薄壳3D生成的可微几何图像

Eungjune Shim, Hansol Lee, Eunjung Ju

机构 * CLO Virtual Fashion Inc.(CLO虚拟时尚公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 DiffGI针对现有3D生成模型问题,提出端到端3D到2D映射框架,用连续函数取代二进制图,引入可微算法,训练相关模型,在薄壳3D生成中实现高保真、高精度,减少计算资源需求。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13017 2026-07-15 cs.RO cs.CV 新提交 57%

FlowWAM: Optical Flow as a Unified Action Representation for World Action Models

FlowWAM:光流作为世界动作模型的统一动作表示

Yixiang Chen, Peiyan Li, Yuan Xu, Qisen Ma, Jiabing Yang, Kai Wang, Jianhua Yang, Dong An, He Guan, Gaoteng Liu, Jianlou Si, Jun Huang, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges(无) MBZUAI(无) Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对世界动作模型控制中动作表示难题,提出FlowWAM双流扩散框架,以光流为统一动作表示。该框架可实现WAMs两种模式,能利用无动作标签视频预训练,实验表明在操纵和世界建模任务中表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12404 2026-07-15 cs.CV 新提交 57%

Contrastive-Augmented Flow Matching for Style-Content Disentanglement

用于风格-内容解缠的对比增强流匹配

Yusong Li, Pingchuan Ma, Ming Gui, Vincent Tao Hu, Björn Ommer

机构 * University of Munich(慕尼黑大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究如何分离内容和风格表示,提出对比增强流匹配框架,将对比正则化融入可逆流匹配,在多个数据集实验中提升了内容和风格检索、增强嵌入簇分离及开集鲁棒性,改进了分布转移下的解缠和鲁棒性。

Comments under review, code available at: https://github.com/CompVis/SCFlow/tree/main#-catfm-follow-up

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12379 2026-07-15 cs.CV 新提交 57%

SeamGen: Artist-Aligned UV Seam Generation via Graph Flow Matching

SeamGen:通过图流匹配生成与艺术家对齐的UV接缝

Hao Xu, Yuqing Zhang, Yiqian Wu, Xueqi Ma, Ding Liang, Yan-Pei Cao, Ying-Tian Liu, Xiaogang Jin

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) VAST(未提及,可能是一个缩写,无法准确翻译)

专题命中 扩散模型 :inpainting(abstract);分类 cs.CV

AI总结 研究针对3D内容创作中UV接缝放置问题,提出SeamGen模型,通过流匹配从现有接缝布局学习,设计Mesh Transformer主干,利用流模型修复能力,能生成更符合艺术家偏好的UV布局,提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12171 2026-07-15 cs.CV cs.AI cs.LG 新提交 57%

Self-Consistent Flow: Unifying Velocity and Endpoint Prediction for Rectified Flow Models

自洽流:统一整流流模型的速度和端点预测

Xu Han, Jiajing Hu, Li-Ping Liu

机构 * Tufts University(塔夫茨大学)

专题命中 扩散模型 :image generation(abstract);分类 cs.CV

AI总结 研究基于整流流的生成模型中不同参数化预测目标的问题,提出自洽流方法,通过轻量级一致性损失联合训练网络预测速度和端点,提升模型性能,在图像生成任务中显著优于标准整流流基线。

Comments Published in Transactions on Machine Learning Research

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11836 2026-07-14 cs.CV 新提交 57%

Cycle-World: Mitigating Error Accumulation in Long-term Video World Models via Reverse-Prediction Cycle Consistency

循环世界:通过反向预测循环一致性减轻长期视频世界模型中的误差累积

Zihan Su, Teng Hu, Jiangning Zhang, Ruiyan Wang, Ran Yi, Lizhuang Ma, Dacheng Tao

机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) Institute of Cyber-Systems and Control, Zhejiang University, Hangzhou, China(浙江大学控制系统研究所) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对自回归扩散模型在长视频生成中误差累积问题,提出循环世界框架,通过训练和推理阶段的时间可逆性及反向预测模型抑制误差,实验证明其在VBench基准测试中显著减轻误差漂移,提升生成质量和时间一致性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11364 2026-07-14 cs.LG cs.AI cs.MM 新提交 57%

BackgroundMellow: A Multi-Modal Cohesive Framework for Narrative-Driven Rich Cinematic Soundscape Generation

BackgroundMellow:一种用于叙事驱动的丰富电影音效生成的多模态凝聚框架

Ajitesh Jamulkar, Aritra Hazra

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡拉格布尔分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.MM

AI总结 多模态AI中为文本叙事生成电影音效困难,BackgroundMellow框架将其视为编排与信号处理问题,通过主 - 专家架构、Tango2模型、背景音乐检索器及NLP模块实现,经实验验证在时间同步等方面有效。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10781 2026-07-14 cs.CV cs.RO 新提交 57%

Is Energy Guidance All You Need? Training-Free Norm Injection for Driving World Models

你所需要的只是能量引导吗?用于驱动世界模型的无训练规范注入

Xiyan Su, Frank Diermeyer, Markus Lienkamp

机构 * Institute of Automotive Technology, Technical University of Munich(慕尼黑工业大学汽车技术研究所)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究基于大型视频扩散主干的驾驶世界模型难以控制的问题,提出通过可微能量函数在采样时操控规划轨迹,无需重新训练主干,以Open-Sora 2.0 MM-DiT主干模型为例验证,指出跨流耦合是端到端可控关键。

Comments Accepted to Robotics: Science and Systems 2026 Robot World Models Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10706 2026-07-14 cs.RO cs.AI cs.CV cs.LG 新提交 57%

Action Map Policy: Learning 3D Closed-loop Manipulation via Pixel Classification

动作映射策略:通过像素分类学习3D闭环操作

Haojie Huang, Zhang Ye, Linfeng Zhao, Boce Hu, Mingxi Jia, Yu Qi, Ahmed Agha, Dian Wang, Robert Platt, Robin Walters

机构 * Northeastern University(东北大学) Stanford University(斯坦福大学) Brown University(布朗大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对机器人学习中动作空间的挑战,提出动作映射策略(AMP),将3D闭环操作策略学习转为图像空间分类问题,通过投影动作到图像平面,以像素为类别控制维度,实现高精度、快速推理,实验证明其优于基线。

Comments Project Website: https://haojhuang.github.io/amp_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10695 2026-07-14 cs.CV cs.CR 新提交 57%

Effective Synthetic Image Detection via Noise Residual Clustering

通过噪声残差聚类实现有效的合成图像检测

Caihui Yan, Gang Cao, Huawei Tian, Zhen Li, Yuhang Zhai

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对合成图像检测问题,提出一种无训练方法,先提取噪声残差指纹,再经视觉Transformer提取多尺度特征并融合,用少量真实图像样本初始化聚类中心,在四个基准数据集上平均准确率达82.2%,泛化能力优于现有检测器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10329 2026-07-14 cs.CV 新提交 57%

Imperceptible and Reversible Adversarial Examples against Vision-Language Models for Privacy Protection

用于隐私保护的针对视觉语言模型的不可察觉且可逆的对抗性示例

Qi Lu, Ziqi Zhou, Yufei Song, Zijing Li, Lulu Xue, Minghui Li, Shengshan Hu, Leo Yu Zhang

机构 * School of Cyber Science and Engineering, Huazhong University of Science and Technology(华中科技大学网络空间安全学院) College of Computer Science, Chongqing University(重庆大学计算机科学学院) School of Software and engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对视觉语言模型基于文本的隐私攻击问题,提出CloakDiff框架,结合扩散对抗编辑与可逆网络生成不可察觉的对抗性示例,设计EDM启发式采样提高保真度,实验证明该框架能实现多模态隐私保护且具高视觉质量和可逆性。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09818 2026-07-14 cs.RO cs.AI cs.CV 新提交 57%

TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging

TS-Mask VLA:用于视觉-语言-动作模型的具有有效桥接的二维时空掩码

Shengzhuo Yang, Ronghao Yu, Chuanjie Lv, Linpeng Peng, Hang Yu, Jie Ren, Jiajun Lv, Yong Liu

机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学网络系统与控制研究所) Tongji University(同济大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对视觉-语言-动作模型问题,提出TS-Mask VLA框架,基于离散扩散动作专家和时空二维掩码策略,在模拟基准和现实任务实验中表现出色,验证了设计有效性。

Comments 9 pages, 5 figures, accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09193 2026-07-13 cs.CV 新提交 57%

YeTI: You Only Need Two Noisy Images for Real-World sRGB Noise Generation

YeTI:仅需两张噪声图像即可生成真实世界的sRGB噪声

Jaekyun Ko, Byung Wan Lim, Soomin Lee, Dongjin Kim, Tae Hyun Kim

机构 * Department of Computer Science, Hanyang University(汉阳大学计算机科学系) Mobile Experience (MX) Division, Samsung Electronics(三星电子移动体验部门)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对真实世界sRGB图像去噪难题,提出YeTI框架,仅从同一场景两张噪声图像学习,利用重构自编码器和条件扩散Transformer分离场景与噪声特征,生成逼真噪声,经实验验证其有效性及在下游去噪任务中的实用价值。

Comments Accepted to ECCV 2026. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09125 2026-07-13 cs.CV 新提交 57%

4D Human-Scene Reconstruction from Low-Overlap Captures

从低重叠度捕获中进行4D人体场景重建

Minhyuk Hwang, Sangmin Kim, Seunguk Do, Daneul Kim, Jaesik Park

机构 * Seoul National University(首尔国立大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对现实场景中低重叠度相机的4D人体场景重建问题,提出StudioRecon方法,通过解耦背景和人体,利用视频扩散模型强化背景监督,结合跨视图关联等初始化人体,经递归增强模块避免伪影,实现了高水准新视图合成及相关应用。

Comments Accepted to SIGGRAPH Conference Papers '26. First two authors contributed equally. Project page: https://sisyphm.github.io/studiorecon-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09081 2026-07-13 cs.CV 新提交 57%

Adaptive Latent Trajectory Anchoring for Action Segmentation Dataset Condensation

用于动作分割数据集压缩的自适应潜在轨迹锚定

Artheme Gauthier-Villar, Guodong Ding, Angela Yao

机构 * National University of Singapore(新加坡国立大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对动作分割数据集压缩问题,提出利用去噪扩散隐式模型,将动作段表示为噪声流形中由稀疏潜在点锚定连续轨迹的方法,并引入自适应分配机制。实验表明,该框架显著优于现有方法,在保持低压缩率时实现与真实数据训练相当的性能。

Comments 16 pages, 5 figures, accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08270 2026-07-10 cs.CV 新提交 57%

Progression as Latent Drift: Generative Forecasting of Slow-Evolving Pathologies

作为潜在漂移的进展:缓慢演变病理的生成预测

Yuxiang Feng, Juncheng Wang, Chao Xu, Wenlong Hou, Huihan Wang, Yijie Qian, Yang Liu, Baigui Sun, Yong Liu, Shujun Wan

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学) IROOTECH TECHNOLOGY(IROOTECH技术) Wolf 1069 b Lab, Sany Group(Wolf 1069 b实验室,三一集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对缓慢演变神经退行性疾病未来解剖结构预测难题,提出潜在漂移的渐进生成框架,在压缩语义表示中学习变化,结合有限标量量化抑制干扰波动,实验表明该方法在神经预测上优于基线。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07880 2026-07-10 cs.CV 新提交 57%

GIRAF: Towards Generalizable Human Interactions with Articulated Objects

GIRAF:迈向与关节物体的可泛化人类交互

Xiaohan Zhang, Sebastian Starke, Alexander Winkler, Federica Bogo, Samir Aroudj, Yuting Ye

机构 * Meta

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对合成与关节物体的逼真全身人类交互难题,现有模型有局限。本文提出文本条件扩散模型,通过以物体为中心的表示、混合域训练策略和基于接触的增强方案应对挑战,实验证明其对未见物体配置泛化能力强,超越现有方法。

Comments 12 pages, 6 figures, 3 tables. Accepted at the Third Workshop on Human Motion Generation (HuMoGen), CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏