arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-18 至 2026-08-18 共收录 60 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 2 篇

2603.27959 2026-08-18 cs.CV 版本更新 86%

MathGen: Revealing the Illusion of Mathematical Competence through Text-to-Image Generation

MathGen:通过文本到图像生成揭示数学能力的幻觉

Ruiyao Liu, Hui Shen, Ping Zhang, Yunta Hsieh, Yifan Zhang, Jing Xu, Qi Han, Junchen Li, Jiawei Lu, Jianing Ma, Jiaqi Mo, Sicheng Chen, Zhen Zhang, Zhongwei Wan, Jing Xiong, Xin Wang, Ziyuan Liu, Hangrui Cao, Ngai Wong

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Michigan(密歇根大学) The Ohio State University(俄亥俄州立大学) USTC(中国科学技术大学) City University of Hong Kong(香港城市大学) University of Wisconsin(威斯康星大学) UCSB(加州大学圣塔芭芭拉分校) University of Hong Kong(香港大学) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 MathGen通过900道跨七个核心领域的数学问题,评估生成模型在视觉化数学解答中的准确性,发现现有模型在数学 fidelity 上存在显著瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00410 2026-08-18 cs.AI cs.CL cs.CV 版本更新 57%

Where did the ambiguity go? Examining how multimodal models interpret polysemous words

歧义去了哪里?探究多模态模型如何解释多义词

Jasin Cekinmez, Addison J. Wu, Raja Marjieh, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 该研究对比17个文本到图像模型和15个文本生成模型,发现多模态模型生成图像的词义多样性低于文本,揭示了基础模型在不同模态间意义表达的迁移 gap。

Comments Oral Presentation, Sci-FM Workshop @ COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 2 篇

2602.20839 2026-08-18 cs.CV 版本更新 83%

Training-Free Multi-Concept Image Editing

无需训练的多概念图像编辑

Niki Foteinopoulou, Ignas Budvytis, Stephan Liwicki

机构 * Cambridge Research Laboratory, Toshiba Europe(东芝欧洲剑桥研究实验室)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出无需训练的多概念图像编辑方法,通过概念蒸馏采样实现多视觉概念的无缝组合与控制,提升图像编辑的精度与细节表现。

Comments Accepted in ECCV'26 (17 pages, 13 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24900 2026-08-18 cs.CV cs.AI 版本更新 79%

OpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation and Editing

OpenGPT-4o-Image:用于高级图像生成与编辑的综合数据集

Zhihong Chen, Xuehai Bai, Yang Shi, Chaoyou Fu, Huanyu Zhang, Haotian Wang, Xiaoyan Sun, Zhang Zhang, Liang Wang, Yuanxing Zhang, Pengfei Wan, Yi-Fan Zhang

机构 * USTC(中国科学技术大学) Kling Team(Kling团队) HDU(华中科技大学) PKU(北京大学) NJU(南京大学) CASIA(中国科学院自动化研究所) THU(清华大学)

专题命中 图像编辑 :image generation(title,abstract);分类 cs.CV

AI总结 该研究构建了涵盖11个领域51个子任务的OpenGPT-4o-Image数据集,经其微调主流模型后,图像编辑任务性能最高提升18%、生成任务最高提升13%,证实系统化数据构建对多模态AI的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 42 篇

2607.16491 2026-08-18 physics.med-ph 版本更新 86%

Continuous 3-D Latent Diffusion for Medical Image Generation and Reconstruction

用于医学生成与重建的连续3D潜扩散

Youness Mellak, Antoine De Paepe, Dimitris Visvikis, Alexandre Bousse

专题命中 扩散模型 :diffusion(title,abstract);image generation(title)

AI总结 研究针对高分辨率三维医学扩散模型成本问题,提出连续3D潜扩散模型框架,核心是含特定解码器的紧凑自动编码器,经实验评估,该框架在计算效率、内存使用和重建效果间达平衡,能支持多种医学影像任务。

Comments 14 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23811 2026-08-18 cs.SD cs.CL 版本更新 82%

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers

基于解耦时间深度扩散变换器的内存高效音频合成

Dongseong Hwang, Prasanth Yadla, Kaan Elgin, Shifas Padinjaru Veettil, Sivanand Achanta, Dipjyoti Paul, Ramya Rasipuram, Tyler Johnson, Emad Soroush, Chung-Cheng Chiu, Zhifeng Chen

机构 * Apple(苹果公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究提出基于解耦时间深度扩散变换器的内存高效音频合成架构,通过特定设计将语义音频令牌转换为RVQ表示,用单个深度解码器和因果滑动窗口注意力降低内存复杂度,在AMX上实现高效合成,提升音频质量。

Comments 11 pages, ICASSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26632 2026-08-18 cs.LG 版本更新 82%

RT-Lynx: Putting GEMM Sparsity in the Right Place for Diffusion Models

RT-Lynx:以正确方式将GEMM稀疏性应用于扩散模型

Xing Cong, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Chenhao Xie

机构 * Alibaba Group(阿里巴巴集团) Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 针对扩散模型推理成本高的问题,提出将N:M半结构化稀疏性从权重转移到激活,结合误差补偿技术,实现线性层平均1.55倍加速且保持生成质量。

Comments 33 pages, 18 figures, Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16871 2026-08-18 cs.RO 版本更新 82%

SADP: Subgoal-Aware Diffusion Policy for Long-Horizon Manipulation Learned from Foundation Model Generated Demonstrations

SADP:基于基础模型生成示范的子目标感知扩散策略用于可解释机器人

Site Hu, Takato Horii

机构 * Department of Systems Innovation, Graduate School of Engineering Science, Osaka University(系统创新系,工学研究科,大阪大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出SADP,一种基于基础模型生成示范的子目标感知扩散策略,用于可解释机器人,通过自主生成子目标标注的示范数据,训练扩散策略,使机器人能够通过子目标结构和执行进度向用户解释决策过程,从而在长周期操作中实现更高的任务成功率和故障诊断能力。

Comments Revised manuscript with an updated title, evaluation protocol, and simulation results

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10162 2026-08-18 cs.CV 版本更新 79%

MAD-HOI: Masked Autoregressive Diffusion for Generating Articulated Hand Object Interactions from Text

MAD-HOI:用于从文本生成关节手-物体交互的掩码自回归扩散模型

Ananya Bal, Kartik Sharma, Ethan Lai, Samyak Tiwari, Liza Dahiya, Chaitanya Chawla, Laszlo A. Jeni

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MAD-HOI是一种结合掩码自回归与扩散的HOI生成模型,可生成多样且符合物理规律的手-物体交互序列,支持可变长度生成、运动补全填充等功能,在ARCTIC和GRAB数据集上优于开源基线。

Comments 17 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18736 2026-08-18 cs.CV 版本更新 79%

Spectral Progressive Diffusion for Efficient Image and Video Generation

频域渐进扩散用于高效图像和视频生成

Howard Xiao, Brian Chao, Lior Yariv, Gordon Wetzstein

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种频域渐进扩散框架,通过在预训练扩散模型的去噪轨迹中逐步提高分辨率,实现高效的图像和视频生成,同时改进了效率和质量。

Comments Project website at this https URL (https://howardxiao.ca/speed)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17555 2026-08-18 cs.CV cs.AI 版本更新 79%

FrescoDiffusion: 4K Image-to-Video with Prior-Regularized Tiled Diffusion

FrescoDiffusion: 4K图像到视频的先验正则化拼接扩散

Hugo Caselles-Dupré, Mathis Koroglu, Guillaume Jeanneret, Arnaud Dapogny, Matthieu Cord

机构 * Obvious Research, Paris, France Institute of Intelligent Systems(Obvious Research,巴黎,法国智能系统研究所) Robotics - Sorbonne University, Paris, France(机器人学 - 索邦大学,巴黎,法国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FrescoDiffusion通过先验正则化拼接扩散方法,实现从单张复杂图像生成4K图像到视频,提升全局一致性与细节保真度。

Comments 5 authors. Hugo Caselles-Dupré, Mathis Koroglu, and Guillaume Jeanneret contributed equally. 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10076 2026-08-18 cs.CV 版本更新 79%

Mitigating Error Accumulation in Co-Speech Motion Generation via Global Rotation Diffusion and Multi-Level Constraints

通过全局旋转扩散和多级约束缓解语音同步运动生成中的误差累积

Xiangyue Zhang, Jianfang Li, Jianqiang Ren, Jiaxu Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GlobalDiff,通过全局旋转扩散和多级约束缓解语音同步运动生成中的误差累积,提升生成运动的平滑度和准确性。

Comments AAAI 2026. Project page: this https URL (https://xiangyuezhang.com/GlobalDiff/;) code and pretrained models: this https URL (https://github.com/Xiangyue-Zhang/GlobalDiff)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18911 2026-08-18 cs.LG cs.AI cs.CV 版本更新 79%

Rethinking Token-wise Feature Caching: Accelerating Diffusion Transformers with Dual Feature Caching

重新思考逐令牌特征缓存:通过双特征缓存加速扩散Transformer

Chang Zou, Shikang Zheng, Evelyn Zhang, Runlin Guo, Haohang Xu, Zhengyi Shi, Conghui He, Xuming Hu, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) South China University of Technology(南方科技大学) Beihang University(北航) Huawei Technologies Ltd(华为技术有限公司) Shanghai AI Lab(上海人工智能实验室) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文针对逐令牌特征缓存的核心问题提出质疑,提出双特征缓存方法DuCa,在DiT等生成模型上实现了优于现有逐令牌特征缓存的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14097 2026-08-18 eess.AS cs.SD 版本更新 78%

Ambisonics Encoding of Room Impulse Responses using a Device-Agnostic Diffusion Model

使用设备无关扩散模型的房间冲激响应的Ambisonics编码

Eloi Moliner, Christoph Hold, Juan Azcarreta Ortiz, Sebastian Prepelita, Ishwarya Ananthabhotla, Daniel Wong, Sanjeel Parekh, Sanha Lee

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对不规则/稀疏等空间捕获能力有限的麦克风阵列无法用线性方法重建HOA RIR高阶空间细节的问题,提出基于扩散的生成框架,实现设备无关编码,实验显示其性能优于基线,可支撑可扩展声学模拟。

Comments IWAENC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03025 2026-08-18 cs.AI 版本更新 78%

DiffImaginE: Imagine to Verify Entity Types with Diffusion

DiffImaginE:通过想象验证实体类型

Feng Zhang, Feiyu Han, Rongxin Yang, Yang Liu, Yancheng Chen, Rui Wang, Yingguang Yang, Tian Xueyun, Chongyang Zhang, Hao Zheng, Xu Kefu, Congjing Ran, Fuhai Chen, Bin Chong

机构 * Fuzhou University(福州大学) Chinese Academy of Sciences(中国科学院) Peking University(北京大学) Alibaba Group(阿里巴巴集团) University of Science and Technology of China(中国科学技术大学) Fullive Innovation (Beijing) AI Technology Co., Ltd.(福莱创新(北京)人工智能科技有限公司) Baidu(百度) Wuhan University(武汉大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DiffImaginE将多模态命名实体识别的类型验证建模为条件潜在扩散推理,在Twitter-2015和Twitter-2017数据集上,相比确定性对照模型取得了一致的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04253 2026-08-18 q-bio.PE math.PR 版本更新 78%

Diffusion bridge with randomized initial and terminal times and its application to fish migration

具有随机初始和终止时间的扩散桥及其在鱼类洄游中的应用

Hidekazu Yoshioka, Mohammed Louriki

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 构建含环境因素影响的随机微分方程模型(非利普希茨扩散系数的扩散桥),通过时变产生随机初末时间,建立模型适定性,依水温影响鱼洄游假设估算参数并探索环境DNA数据分析应用。

Comments Updated on August 17, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29066 2026-08-18 cs.CL 版本更新 78%

$x$-Prediction Flow: Efficient Continuous Decoding for Masked Diffusion Language Models

掩码扩散解码作为 $x$-预测流

Weitian Wang, Lianlei Shan, Shubham Rai, Cecilia De La Parra, Akash Kumar

机构 * Robert Bosch GmbH(罗伯特博世集团) Ruhr University Bochum(博尔茨大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对掩码扩散语言模型标准解码中二元决策导致信息丢失和性能差的问题,提出连续解码框架,通过重新解释掩码预测为清洁状态预测,引入置信度驱动的异步更新和强化学习策略网络,在减少解码预算时保持高性能。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27481 2026-08-18 hep-lat cond-mat.str-el cs.LG 版本更新 78%

Sampling the Schwinger Model with Gauge-Equivariant Diffusion

使用规范等变扩散采样Schwinger模型

Octavio Vega, Aida X. El-Khadra

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出基于扩散的生成模型加速N_f=2格点Schwinger模型采样,利用U(1)等变评分模型生成规范链接构型,通过似然计算获得与MCMC匹配的无偏估计,并缓解拓扑冻结问题。

Comments v2: Updated acknowledgements, paper unchanged. Conference paper at PAI 2026. 6 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21003 2026-08-18 physics.chem-ph cond-mat.stat-mech 版本更新 78%

Generalized Mpemba effect in diffusion-controlled spin-dependent delayed fluorescence

扩散控制的依赖于自旋的延迟荧光中的广义Mpemba效应

Kazuhiko Seki

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文在扩散控制的三重态融合延迟荧光系统中,通过外部控制自旋选择性动力学,实现了广义Mpemba效应,并推导出轨迹交叉的动力学判据。

Comments 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03820 2026-08-18 stat.ML cs.LG 版本更新 78%

A Quantitative Approximation Framework for Flow Distillation in Diffusion Models

扩散模型中流蒸馏的定量近似框架

Weiguo Gao, Ming Li, Lei Shi, Hanfei Zhou

机构 * School of Mathematical Sciences, Fudan University(复旦大学数学学院) Shanghai Key Laboratory of Contemporary Applied Mathematics, Fudan University(复旦大学当代应用数学重点实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对扩散模型中的流蒸馏,提出一个定量近似框架,将少步采样视为学习流映射组合下的误差传播,通过理论分析和实验验证了稳定性平衡的非均匀时间网格能显著降低端到端相对MSE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02599 2026-08-18 math.NA 版本更新 78%

Physics-Informed Neural Network for Diffusion-Reaction Problems with Dead-Core Formation in Catalyst Slabs

用于催化剂平板中死核形成的扩散反应问题的物理信息神经网络

Piotr Skrzypacz, Kaisar Tangirbergen, Jan Valdman

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出一种物理信息神经网络(PINN)框架,通过嵌入界面渐近行为的硬约束试验解和将死核位置作为可训练参数,同时逼近浓度分布和识别自由边界,无需显式界面跟踪。

Comments 15 pages, 3 figures, 4 tables, proceeding of PPAM conference 2026 in Poznan

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10961 2026-08-18 cond-mat.stat-mech 版本更新 78%

Dynamical Regimes of Discrete Diffusion Models

离散扩散模型的动力学区域

Tomoei Takahashi, Takashi Takahashi, Yoshiyuki Kabashima

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了离散扩散模型的动力学行为,通过统计力学方法分析了其在二类Ising变量数据上的反向动力学,发现物种化和崩溃转变分别对应二级相变和凝结转变,理论预测通过数值模拟得到验证。

Comments 36 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17749 2026-08-18 math.AP 版本更新 78%

A heterogeneous nonlocal advection--diffusion system

一个异质非局部对流-扩散系统

Joseph McCusker, John Christopher Meyer, Mabel Lizzy Rajendran

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了非局部对流-扩散方程组在异质种群上的局部和全局适定性,通过半群理论和压缩映射原理获得弱解的局部适定性及正则性,利用Nash不等式和初始数据小性条件分别建立正则核和非正则核的全局界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19431 2026-08-18 nucl-ex hep-ex 版本更新 78%

Observation of the jet diffusion wake using dijets in heavy ion collisions

利用重离子碰撞中的dijet观测喷流扩散尾

CMS Collaboration

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究通过比较PbPb和pp碰撞中的dijet-Hadron相关性,观测到喷流扩散尾的存在,揭示了喷流在高温等离子体中的能量沉积效应。

Comments Replaced with the published version. Added the journal reference and the DOI. All the figures and tables, including additional supplementary figures, can be found at this http URL (http://cms-results.web.cern.ch/cms-results/public-results/publications/HIN-25-012) (CMS Public Pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05513 2026-08-18 cs.RO cs.AI 版本更新 78%

DECO: Decoupled Multimodal Diffusion Transformer for Bimanual Dexterous Manipulation with a Plugin Tactile Adapter

DECO:解耦多模态扩散变压器用于配备插件触觉适配器的双臂灵巧操作

Xukun Li, Yu Sun, Lei Zhang, Bosheng Huang, Yibo Peng, Yuan Meng, Haojun Jiang, Shaoxuan Xie, Guocai Yao, Alois Knoll, Zhenshan Bing, Xinlong Wang, Zhenguo Sun

机构 * Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院) School of Computation, Information and Technology, Technical University of Munich, Garching, Germany(慕尼黑技术大学计算与信息学院) Department of Shenyang Institute of Computing Technology, University of Chinese Academy of Sciences, Beijing, China(中国科学院沈阳计算技术研究所部门) State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家重点实验室) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DECO通过解耦多模态输入和触觉适配器,实现了双臂灵巧操作的高效整合与高成功率

Comments 25 pages, 8 figures. Project Page: this https URL (https://baai-humanoid.github.io/DECO-webpage/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00944 2026-08-18 hep-ph cs.LG hep-th 版本更新 78%

Diffusion-model approach to flavor models: A case study for $S_4^\prime$ modular flavor model

扩散模型在味模型中的应用:以$S_4^\prime$模味模型为例

Satsuki Nishimura, Hajime Otsuka, Haruki Uchiyama

机构 * Department of Physics, Kyushu University(九州大学物理系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 利用扩散模型(一种生成式人工智能)提出一种数值方法,通过实验约束搜索味模型参数,并以$S_4^\prime$模味模型为例,构建神经网络再现夸克质量、CKM矩阵和Jarlskog不变量,发现新的现象学感兴趣参数区域,并确认自发CP破坏。

Comments 23 pages, 5 figures, v2: published version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05950 2026-08-18 cs.CV cs.AI 版本更新 74%

Reprojection-Guided 3D Gaussian Splatting Diffusion for Weakly Supervised Single-Image Normal Estimation

CLONE: 基于3DGS的闭环可微优化框架用于单图像法线估计

Yanxing Liang, Yinghui Wang, Wei Li, Tao Yan, Jiaxing Shen

机构 * School of Artificial Intelligence and Computer Science, Jiangnan University, Wuxi, China(江南大学人工智能与计算机科学学院,中国无锡) School of Data Science, Lingnan University, Hong Kong, China(岭南大学数据科学学院,中国香港)

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 提出CLONE框架,通过3D高斯泼溅参数化场景并利用协方差特征分解得到连续可微法线,结合可微光照模型和一步确定性扩散精化网络,在统一重投影目标下联合优化,实现无需真值法线监督的几何一致性单图像法线估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05811 2026-08-18 cs.CV 版本更新 70%

Energy-Guided Flow Matching

能量引导的流匹配(Energy-Guided Flow Matching)

Haoyang Tong, Yu He, Fang Li, Lichen Ma, Jingling Fu, Dong Chen, Zhen Chen, Junshi Huang, Jie Cao

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出能量引导的流匹配(EG-FM),通过移动端点显式建模从粗到细的生成轨迹,无需额外适配,在ImageNet类条件图像生成及文本到图像生成任务中均取得优异性能。

Comments 19 pages, Code: this https URL (https://github.com/ysng123/EG-FM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13602 2026-08-18 cs.MM cs.CV cs.SD 版本更新 62%

Omni-LiveAvatar: Minute-Level Real-Time Streaming Joint Audio-Video Avatar Generation

Omni-LiveAvatar:分钟级实时流式视听联动数字人生成

Lunjie Zhu, Xingtong Ge, Fangyu Lin, Yi Zhang, Zhening Liu, Mengfei Li, Yumeng Zhang, Guanglu Song, Yu Liu, Jun Zhang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本研究提出Omni-LiveAvatar框架,通过渐进式自回归蒸馏等技术,实现分钟级实时流式视听联动数字人生成,速度较LTX-2提升33倍且性能优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18898 2026-08-18 cs.CV cs.GR 版本更新 62%

GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling

GestureLSM:基于隐式捷径的时空建模语音同步手势生成

Pinxin Liu, Luchuan Song, Junhua Huang, Haiyang Liu, Junfan Zhu, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 GestureLSM通过时空建模与改进的流匹配方法,在BEAT2数据集上实现了最优语音同步手势生成,同时大幅缩短推理时间,可用于增强数字人和具身智能体。

Comments Accepted to ICCV 2025. Project Page: this https URL (https://andypinxinliu.github.io/GestureLSM)

详情

展开后加载摘要…

URL PDF HTML 收藏