arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-21 至 2026-04-21 共收录 133 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 9 篇

2604.18167 2026-04-21 cs.CV 87%

Embedding Arithmetic: A Lightweight, Tuning-Free Framework for Post-hoc Bias Mitigation in Text-to-Image Models

嵌入算术:一种轻量级、无需调优的文本到图像模型后处理偏见缓解框架

Venkatesh Thirugnana Sambandham, Torsten Schön

机构 * AIMotion Bavaria, Technische Hochschule Ingolstadt(AIMotion巴伐利亚、英格尔施泰特技术大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract,abstract_cn);image generation(abstract);分类 cs.CV

AI总结 本文提出一种轻量级、无需调优的后处理框架,通过嵌入算术分析并修正嵌入空间中的偏见,保持语义和视觉上下文,提升多样性的同时维持高概念一致性。

Comments A demo notebook with basic implementations can be found at \url{https://github.com/cvims/EMBEDDING-ARITHMETIC}

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18258 2026-04-21 cs.CV cs.AI 86%

Long-Text-to-Image Generation via Compositional Prompt Decomposition

通过组合提示分解实现长文本到图像生成

Jen-Yuan Huang, Tong Lin, Yilun Du

机构 * Peking University(北京大学) Harvard University(哈佛大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 本文提出PRISM方法,通过轻量模块提取长提示的组成部分,使预训练T2I模型能处理长序列输入,实现对复杂场景的建模,优于基线模型。

Comments Accepted to the Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18269 2026-04-21 cs.CL cs.CV 86%

TextTIGER: Text-based Intelligent Generation with Entity Prompt Refinement for Text-to-Image Generation

TextTIGER:基于实体提示精炼的文本智能生成用于文本到图像生成

Shintaro Ozaki, Tomoyuki Jinno, Kazuki Hayashi, Yusuke Sakai, Jingun Kwon, Hidetaka Kamigaito, Katsuhiko Hayashi, Manabu Okumura, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技術研究所) The University of Tokyo(东京大学) Chungnam National University(Chungnam国立大学) Institute of Science Tokyo(东京科学研究所)

专题命中 文生图 :image generation(title,abstract);text-to-image(title);分类 cs.CV

AI总结 TextTIGER通过增强外部信息和大语言模型总结,优化实体描述以提升文本到图像生成性能,实验表明其在多种评估指标上优于仅使用描述的提示方法。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16516 2026-04-21 cs.CV cs.LG cs.MM 84%

Operationalizing Fairness in Text-to-Image Models: A Survey of Bias, Fairness Audits and Mitigation Strategies

在文本到图像模型中实现公平性:对偏见、公平性审计及缓解策略的综述

Megan Smith, Venkatesh Thirugnana Sambandham, Florian Richter, Laura Crompton, Matthias Uhl, Torsten Schön

机构 * AImotion Bavaria, Technische Hochschule Ingolstadt(AImotion巴伐利亚、因戈尔施塔特技术大学) School of Transformation and Sustainability, Catholic University of Eichstätt-Ingolstadt(转型与可持续性学院,埃施塔特-因戈尔施塔特天主教大学) Chair of Economic and Social Ethics, University of Hohenheim(经济与社会伦理系,霍亨海姆大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文综述了文本到图像模型中的公平性研究,分析了偏见类型和公平性概念的分类,指出现有研究在目标公平与阈值公平之间的差距,并提出新的公平性操作框架。

Comments ICLR 2026 Algorithmic Fairness Across Alignment Procedures and Agentic Systems (AFAA) Workshop, reviews can be found at: https://openreview.net/forum?id=8DOkyBGWwP

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20751 2026-04-21 cs.CV 83%

Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning

Pref-GRPO:基于偏好奖励的GRPO用于稳定文本到图像强化学习

Yibin Wang, Zhimin Li, Yuhang Zang, Yujie Zhou, Jiazi Bu, Chunyu Wang, Qinglin Lu, Cheng Jin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Hunyuan, Tencent(腾讯文脉) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出Pref-GRPO方法,通过偏好奖励机制提升文本到图像生成的稳定性,同时引入UniGenBench基准测试评估模型性能。

Comments Project Page: https://codegoat24.github.io/UnifiedReward/Pref-GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18376 2026-04-21 cs.CV 79%

Towards Robust Text-to-Image Person Retrieval: Multi-View Reformulation for Semantic Compensation

面向鲁棒的文本到图像人物检索:多视图重新公式化用于语义补偿

Chao Yuan, Yujian Zhao, Haoxuan Xu, Guanglin Niu

机构 * Beihang University(北航)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出基于大语言模型的语义补偿框架,通过多视图语义重新公式化和特征补偿提升跨模态表示一致性,解决文本到图像检索中的表达漂移问题,实验表明其在三个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16363 2026-04-21 cs.CR cs.AI cs.CV 79%

CSF: Black-box Fingerprinting via Compositional Semantics for Text-to-Image Models

CSF:通过组合语义进行文本到图像模型的黑盒指纹识别

Junhoo Lee, Mijin Koo, Nojun Kwak

机构 * Seoul National University(首尔国立大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出CSF,一种基于组合语义的黑盒指纹识别方法,用于在不接触模型内部的情况下,通过查询访问确定文本到图像模型的版权归属。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17206 2026-04-21 cs.CV 70%

SciDraw-6K: A Multilingual Scientific Illustration Dataset Generated by Google Gemini

SciDraw-6K:由Google Gemini生成的多语言科学插图数据集

Davie Chen

机构 * University of Arts in Poznań(波兹南艺术大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 SciDraw-6K是6291个由Google Gemini生成的科学插图数据集,涵盖11种语言,用于支持多语言文本到图像研究和科学可视化领域适应。

Comments 9 pages, 5 figures. Dataset: https://huggingface.co/datasets/SciDrawAI/SciDraw-6K. Code: https://github.com/SciDrawAI/scidraw-6k

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11314 2026-04-21 cs.CV cs.CL 57%

CROC: Evaluating and Training T2I Metrics with Pseudo- and Human-Labeled Contrastive Robustness Checks

CROC:通过伪标签和人工标注的对比鲁棒性检查评估和训练T2I度量

Christoph Leiter, Yuki M. Asano, Margret Keuper, Steffen Eger

机构 * University of Mannheim(曼海姆大学) University of Technology Nuremberg(纽伦堡技术大学) Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰信息校园)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出CROC框架,通过合成对比测试案例评估和训练T2I度量,生成超过100万对对比提示-图像对的伪标签数据集,并训练出CROCScore指标,展示其在开放源方法中的最佳性能。

Comments pre-MIT Press publication version; Accepted at TACL

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 2 篇

2604.17500 2026-04-21 cs.CV 57%

Edit Fidelity Field: Semantics-Aware Region Isolation for Training-Free Scene Text Editing

编辑保真场:面向免训练场景文本编辑的语义感知区域隔离

Guandong Li, Mengxia Ye

机构 * iFLYTEK Aegon THTF

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Edit Fidelity Field,通过语义感知的连续场控制每个像素的编辑保真度,解决场景文本编辑中非目标区域的编辑溢出问题,实验显示保真度提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17021 2026-04-21 cs.CV 57%

LIVE: Leveraging Image Manipulation Priors for Instruction-based Video Editing

LIVE: 利用图像篡改先验知识进行基于指令的视频编辑

Weicheng Wang, Zhicheng Zhang, Zhongqi Zhang, Juncheng Zhou, Yongjie Zhu, Wenyu Qin, Meng Wang, Pengfei Wan, Jufeng Yang

机构 * Nankai University(南开大学) Pengcheng Laboratory(鹏城实验室) Kuaishou Technology(快手科技) Nankai International Advanced Research Institute (SHENZHEN·FUTIAN)(南开国际先进研究院(深圳·福田))

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出LIVE框架,结合大规模高质量图像编辑数据和视频数据提升编辑能力,通过帧级噪声策略和两阶段训练策略,构建包含60多项挑战性任务的评估基准,实验表明方法达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 99 篇

2604.16481 2026-04-21 cs.CV cs.AI 88%

Erasing Thousands of Concepts: Towards Scalable and Practical Concept Erasure for Text-to-Image Diffusion Models

消除数千种概念:面向文本到图像扩散模型可扩展和实用的概念消除

Hoigi Seo, Byung Hyun Lee, Jaehyun Cho, Sungjin Lim, Se Young Chun

机构 * Dept. of Electrical and Computer Engineering(电气与计算机工程系) INMC(智能纳米研究中心) IPAI(人工智能研究所) Seoul National University(首尔国立大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ETC框架,通过tMM模型和MoEraser模块实现大规模概念消除,提升生成质量与鲁棒性,验证了在2000多个概念上的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17287 2026-04-21 cs.CV 87%

Spectral Forensics of Diffusion Attention Graphs for Copy-Move Forgery Detection

扩散注意力图的频谱取证用于复制-移动伪造检测

H. M. Shadman Tabib, Tasriad Ahmed Tias, Nafis Tahmid

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 本文提出GraphSpecForge框架,通过分析预训练Stable Diffusion U-Net的注意力图频谱结构,检测复制-移动伪造。利用归一化图拉普拉斯矩阵的频谱重分布特性,构建基于Wasserstein距离的异常检测器,无需重新训练,在多个基准数据集上取得良好效果。

Comments Preprint before NeurIPS main track submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18076 2026-04-21 cs.CV cs.AI 85%

Class-specific diffusion models improve military object detection in a low-data domain

特定类别的扩散模型在低数据域中改进军事目标检测

Ella P. Fokkinga, Jan Erik van Woerden, Thijs A. Eker, Sebastiaan P. Snel, Elfi I. S. Hofmeijer, Klamer Schutte, Friso G. Heslinga

机构 * TNO - Intelligent Imaging(TNO智能成像实验室)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文通过特定类别的扩散模型生成合成数据,提升低数据条件下军事车辆检测性能,特别是在样本稀少时效果显著,同时引入结构引导生成数据进一步增强模型表现。

Comments Submitted to SPIE Defense + Security

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18201 2026-04-21 cs.CV cs.LG 83%

DiffuSAM: Diffusion Guided Zero-Shot Object Grounding for Remote Sensing Imagery

DiffuSAM: 基于扩散的零样本目标定位用于遥感影像

Geet Sethi, Panav Shah, Ashutosh Gandhe, Soumitra Darshan Nayak

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出DiffuSAM,结合扩散模型与先进分割模型,提升遥感影像目标定位精度,实验显示在Acc@0.5上提升超14%。

Comments Accepted at ICLR 2026 ML4RS Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17773 2026-04-21 cs.CV 83%

Structure-Adaptive Sparse Diffusion in Voxel Space for 3D Medical Image Enhancement

针对体素空间的结构自适应稀疏扩散用于3D医学图像增强

Hongxu Jiang, Fei Li, Boxiao Yu, Ying Zhang, Kaleb Smith, Kuang Gong, Wei Shao

机构 * Department of Electrical and Computer Engineering, University of Florida, Gainesville, FL, USA(佛罗里达大学电气与计算机工程系) Department of Medicine, University of Florida, Gainesville, FL, USA(佛罗里达大学医学系) Department of Biomedical Engineering, University of Florida, Gainesville, FL, USA(佛罗里达大学生物医学工程系) Research Computing, University of Florida, Gainesville, FL, USA(佛罗里达大学研究计算中心) NVIDIA, Santa Clara, CA, USA(英伟达)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种稀疏体素空间扩散框架,通过结构感知轨迹调制模块实现结构自适应去噪,提升3D医学图像的去噪和超分辨率性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17492 2026-04-21 cs.CV 83%

Coevolving Representations in Joint Image-Feature Diffusion

联合图像-特征扩散中的共进化表示

Theodoros Kouzelis, Spyros Gidaris, Nikos Komodakis

机构 * Archimedes, Athena RC(阿基米德,雅典RC) University of Crete(克里特大学) National Technical University of Athens(雅典技术大学) IACM-Forth(IACM-第四研究机构)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出CoReDi框架,通过共进化语义空间提升图像生成质量,实验显示其收敛更快且样本质量更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16483 2026-04-21 cs.CV cs.AI 83%

Dynamic Eraser for Guided Concept Erasure in Diffusion Models

动态擦除器:扩散模型中的引导概念擦除

Qinghui Gong

机构 * Southwest Jiaotong university(西南交通大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出动态语义引导(DSS)框架,通过敏感语义边界建模和敏感语义引导实现可控的概念擦除,提升安全内容生成效果。

Comments 26 pages,21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13366 2026-04-21 cs.LG cs.RO cs.SY eess.SY 82%

Diffusion Sequence Models for Generative In-Context Meta-Learning of Robot Dynamics

扩散序列模型用于生成性上下文元学习机器人动力学

Angelo Moroncelli, Matteo Rufolo, Gunes Cagin Aydin, Asad Ali Shahid, Loris Roveda

机构 * University of Applied Science and Arts of Southern Switzerland, Department of Innovative Technologies, IDSIA-SUPSI(瑞士南方应用科学与艺术大学创新技术系,IDSIA-SUPSI) Università della Svizzera Italiana, Faculty of Informatics(瑞士意大利大学信息学院) Politecnico di Milano, Mechanical Department(米兰理工学院机械系)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 本文提出利用扩散序列模型进行机器人动力学的生成性上下文元学习,通过对比确定性和生成性模型,展示扩散模型在分布偏移下的鲁棒性提升。

Comments Angelo Moroncelli, Matteo Rufolo and Gunes Cagin Aydin contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17566 2026-04-21 eess.SY cs.LG cs.SY physics.flu-dyn 82%

Target Parameterization in Diffusion Models for Nonlinear Spatiotemporal System Identification

扩散模型中的目标参数化用于非线性时空系统识别

Achraf El Messaoudi, Noureddine Khaous, Karim Cherifi

机构 * Université Marie et Louis Pasteur, SUPMICROTECH, CNRS, institut FEMTO-ST(玛丽-路易·巴斯蒂安大学,SUPMICROTECH,法国国家科学研究中心,FEMTO-ST研究所) LLF, CNRS, Université Paris Cité(LLF,法国国家科学研究中心,巴黎cité大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文探讨了扩散模型在非线性时空系统识别中的目标参数化问题,通过湍流模拟实验表明,清洁状态预测能提升 rollout 稳定性和减少长时误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17585 2026-04-21 cs.CV cs.AI cs.LG 80%

DGSSM: Diffusion guided state-space models for multimodal salient object detection

DGSSM:基于扩散引导的状态空间模型的多模态显著目标检测

Suklav Ghosh, Arijit Sur, Pinaki Mitra

机构 * Dept. of Computer Science and Engineering, Indian Institute of Technology, Guwahati(计算机科学与工程系,印度理工学院,果阿提)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DGSSM,一种结合扩散模型结构先验和多尺度状态空间编码的多模态显著目标检测框架,通过迭代Mamba扩散细化机制提升边界精度,实验表明其在多个评估指标上优于现有方法。

Comments Accepted at ICPR 2026. Diffusion-guided Mamba framework for multimodal salient object detection. Evaluated on 13 benchmarks (RGB, RGB-D, RGB-T)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18393 2026-04-21 cs.CV 79%

One-Step Diffusion with Inverse Residual Fields for Unsupervised Industrial Anomaly Detection

一步扩散与逆残差场用于无监督工业异常检测

Boan Zhang, Wen Li, Guanhua Yu, Xiyang Liu, Wenchao Chen, Long Tian

机构 * Department of Computer Science and Technology(计算机科学与技术系) Xidian University(西电大学) Department of Electronic Engineering(电子工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出OSD-IRF方法,通过逆残差场实现无监督工业异常检测,利用单步扩散提升推理效率,并在多个基准测试中取得最优或竞争性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18313 2026-04-21 cs.CV 79%

Denoise and Align: Diffusion-Driven Foreground Knowledge Prompting for Open-Vocabulary Temporal Action Detection

去噪与对齐:基于扩散的前景知识提示用于开放词汇时序动作检测

Sa Zhu, Wanqian Zhang, Lin Wang, Jinchao Zhang, Cong Wang, Bo Li

机构 * Institute of Information Engineering, Chinese Academy of Sciences School of Cyber Security, University of Chinese Academy of Sciences State Key Laboratory of Cyberspace Security Defense Beijing China Institute of Information Engineering, Chinese Academy of Sciences Beijing China Hangzhou Dianzi University Hangzhou China Institute of Information Engineering, Chinese Academy of Sciences\ Key Laboratory of Cyberspace Security Defense Beijing China Engineering, Zhejiang University Hangzhou China Institute of Information Engineering, Chinese Academy of Sciences State Key Laboratory of Cyberspace Security Defense Beijing China Institute of Information Engineering, Chinese Academy of Sciences School of Cyber Security, University of Chinese Academy of Sciences State Key Laboratory of Cyberspace Security Defense Institute of Information Engineering, Chinese Academy of Sciences Hangzhou Dianzi University Institute of Information Engineering, Chinese Academy of Sciences\ Key Laboratory of Cyberspace Security Defense Engineering, Zhejiang University Institute of Information Engineering, Chinese Academy of Sciences State Key Laboratory of Cyberspace Security Defense

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DFAlign框架,通过扩散去噪生成前景知识,解决开放词汇时序动作检测中语义不平衡问题,提升动作相关片段的判别性。

Comments Accepted by SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13182 2026-04-21 cs.CV 79%

Diffusion-Based Feature Denoising and Using NNMF for Robust Brain Tumor Classification

基于扩散的特征去噪和使用NNMF进行鲁棒性脑肿瘤分类

Hiba Adil Al-kharsan, Róbert Rajkó

机构 * Doctoral School of Computer Science, University of Szeged(计算机科学博士学院,塞格德大学) Academic Staff, Doctoral School of Computer Science, University of Szeged(学术人员,计算机科学博士学院,塞格德大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出结合NNMF、轻量CNN和扩散去噪的鲁棒脑肿瘤分类框架,通过预处理MRI图像并提取可解释特征,提升对抗扰动下的分类鲁棒性。

Comments 30 pages, 29 figures

Journal ref Mach. Learn. Knowl. Extr. 2026, 8(4), 105

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26010 2026-04-21 cs.CV 79%

New Fourth-Order Grayscale Indicator-Based Telegraph Diffusion Model for Image Despeckling

新的第四阶灰度指标基于电报扩散模型用于图像去斑

Rajendra K. Ray, Manish Kumar

机构 * School of Mathematical and Statistical Sciences, Indian Institute of Technology Mandi(印度理工学院曼迪数学与统计科学学院) Department of Mathematics, Indian Institute of Technology Delhi(印度理工学院德里数学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种第四阶非线性PDE模型,结合扩散和波特性,以改善去斑效果,通过PSNR、MSSIM和SI指标验证其有效性,并扩展至彩色图像处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08013 2026-04-21 cs.CV cs.AI cs.LG 79%

StableMTL: Repurposing Latent Diffusion Models for Multi-Task Learning from Partially Annotated Synthetic Datasets

StableMTL: 利用潜在扩散模型重新利用多任务学习于部分标注的合成数据集

Anh-Quan Cao, Ivan Lopes, Raoul de Charette

机构 * Inria(法国国家科研机构)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出StableMTL,通过利用扩散模型的泛化能力,在部分标注的合成数据集上进行多任务学习,采用统一的潜在损失和多流模型促进任务间协同,优于基线模型。

Comments Accepted at CVPR 2026. Code is at https://github.com/astra-vision/StableMTL

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17818 2026-04-21 cs.CV 79%

AnyLift: Scaling Motion Reconstruction from Internet Videos via 2D Diffusion

AnyLift: 通过2D扩散模型从互联网视频中扩展运动重建

Hongjie Li, Heng Yu, Jiaman Li, Hong-Xing Yu, Ehsan Adeli, C. Karen Liu, Jiajun Wu

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出AnyLift框架,利用2D扩散模型从互联网视频中重建3D人体运动和人-物交互,通过合成多视角2D运动数据和训练相机条件多视角2D运动扩散模型,提升动态摄像下运动重建的准确性和鲁棒性。

Comments CVPR 2026. Project website: https://awfuact.github.io/anylift/ The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03692 2026-04-21 cs.CV cs.AI 79%

Error as Signal: Stiffness-Aware Diffusion Sampling via Embedded Runge-Kutta Guidance

误差作为信号:通过嵌入式龙格-库塔引导的刚性感知扩散采样

Inho Kong, Sojin Lee, Youngjoon Hong, Hyunwoo J. Kim

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) Seoul National University(首尔国立大学) Korea Institute for Advanced Study(韩国高级研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出嵌入式龙格-库塔引导方法,通过识别刚性区域减少局部截断误差,提升扩散模型采样稳定性与质量。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20033 2026-04-21 cs.CV 79%

FlashLips: 100-FPS Mask-Free Latent Lip-Sync using Reconstruction Instead of Diffusion or GANs

FlashLips: 100-FPS 无掩码的潜在唇部同步使用重建而非扩散或GANs

Andreas Zinonos, Michał Stypułkowski, Antoni Bigata, Stavros Petridis, Maja Pantic, Nikita Drobyshev

机构 * Imperial College London(帝国理工学院伦敦分校) Cantina Labs(Cantina实验室) NatWest AI Research(NatWest人工智能研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FlashLips是一种无掩码的唇部同步系统,通过重建而非扩散或GANs实现实时性能,其U-Net变体在单GPU上达100FPS,视觉质量媲美先进模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19979 2026-04-21 cs.CV 79%

CamPVG: Camera-Controlled Panoramic Video Generation with Epipolar-Aware Diffusion

CamPVG:基于视图控制的全景视频生成与视图感知扩散

Chenhao Ji, Chaohui Yu, Junyao Gao, Fan Wang, Cairong Zhao

机构 * Tongji University(同济大学) DAMO Academy, Alibaba Group(阿里达摩院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CamPVG,首个基于视图控制的全景视频生成框架,通过全景Plücker嵌入和视图感知模块提升生成视频的质量与一致性。

Comments SIGGRAPH Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏