arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3019 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 196 篇

2607.17916 2026-07-21 cs.GR cs.CV cs.MM 新提交 67%

Packet-Loss Robust 3D Gaussian Compression via Atomic Packaging and GNN-based Error Concealment

通过原子封装和基于GNN的错误隐藏实现抗丢包的3D高斯压缩

Yuxuan Tao, Xuerui Ma, Hao Zhang, Chunhua Peng

机构 * Central South University Changsha China Malanshan Audio \& Video Laboratory Changsha China Central South University Malanshan Audio \& Video Laboratory

专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 研究3D高斯压缩在网络流传输中丢包问题,提出通过原子封装、分层随机分组及基于GNN的错误隐藏框架,改进丢包时的渲染效果,相比无隐藏传输有显著提升,平均PSNR退化限制在约3dB。

Comments 21 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13041 2026-06-12 cs.CV cs.GR cs.MM 新提交 67%

SeamEdit: A Black-Box VLM-Agnostic Pipeline for Large-Image Semantic Editing

SeamEdit: 一种用于大图像语义编辑的黑盒VLM无关流水线

Xiangyu Lyu, Dan Lei

机构 * Technische Universität Darmstadt(达姆施塔特工业大学) Fine-Arts Educator, Yuncheng Middle School(运城中学美术教师)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 提出SeamEdit,一种无需训练、模型无关的流水线,通过五阶段后处理解决大图像分块编辑中的语义变形、对齐漂移和接缝伪影问题,实现高质量语义编辑。

Comments 19 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08553 2026-08-11 cs.CV cs.LG cs.MM 新提交 62%

MotionCraft: Latent World Modeling with Sparse Attention for Visual Upscaling

MotionCraft:用于视频超分辨率的基于稀疏注意力的潜在世界建模

Rong Fu, Chunlei Meng, Yangchen Zeng, Xiaowen Ma, Yongtai Liu, Wangyu Wu, Shuo Yin, Zijian Zhang, Sicheng Li, Yingrui Ji, Chenhao Wang, Simon Fong

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 MotionCraft是一种可控视频超分辨率框架,通过结合鲁棒运动融合、潜在世界Transformer与自适应稀疏注意力,实现了时间一致的高质量视频重建,且能灵活权衡时间平滑性与重建保真度。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04737 2026-08-06 cs.CV cs.GR 新提交 62%

Dense Metric Depth Completion from Sparse Direct Time-of-Flight Sensors

基于稀疏直接飞行时间传感器的密集度量深度补全

Hakyeong Kim, Ruicheng Wang, Chengtang Yao, Jiaolong Yang, Min H. Kim

机构 * KAIST(韩国科学技术院) USTC(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出一种深度引导双分支视觉Transformer框架,结合dToF模拟流程,实现稀疏dToF到密集度量深度的零样本泛化补全,性能优于现有方法且高效。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22808 2026-07-28 cs.CV cs.AI cs.GR eess.IV 新提交 62%

Hybrid Semantic and Spectral Ensemble for Robust Synthetic Image Source Attribution

用于稳健合成图像源归属的混合语义与频谱集成

Md. Ajwad Hossain

机构 * Chittagong University of Engineering and Technology(吉大港工程技术大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 针对文本到图像模型发展带来的合成图像源归属问题,提出融合语义深度学习与数学取证特征提取的双分支集成框架,经实验验证准确率高且计算高效,突出数学取证在实际部署中的优势。

Comments Peer-reviewed and accepted to the DLMMDD Challenge Workshop at the 35th International Conference on Artificial Neural Networks (ICANN 2026). 7 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12206 2026-07-15 cs.CV cs.GR 新提交 62%

RegHead: Non-Humanoid Head Blendshapes via Feed-Forward Registration

RegHead:通过前馈配准生成非拟人头部混合形状

Jiahao Luo, Hao Zhang, Jianqi Chen, Yijie He, Jiaxu Zou, Michael Vasilkovsky, Sergei Korolev, Sergey Tulyakov, Chaoyang Wang, Peter Wonka, James Davis, Jian Wang

机构 * UCSC(加州大学圣克鲁兹分校) UIUC(伊利诺伊大学厄巴纳-香槟分校) KAUST(阿卜杜拉国王科技大学) Snap Inc.(Snap公司)

专题命中 可控生成 :image editing(abstract);分类 cs.CV、cs.GR

AI总结 针对非拟人头部头像构建语义混合形状集成本高的问题,提出含大规模数据集、特定运动表示及快速前馈配准模型的RegHead框架,实验表明其生成表情网格保真度高、速度快,还能实现实时重定向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24021 2026-06-24 cs.CV cs.GR 新提交 62%

Token-to-Token Alignment of Text Embeddings for Semantic Blending

Token-to-Token对齐的文本嵌入用于语义融合

Saar Huberman, Ron Mokady, Or Patashnik, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学) BRIA AI

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 提出Token-to-Token对齐框架,通过结构对齐和嵌入对齐建立提示词间语义对应,使线性插值实现平滑语义过渡,用于图像融合和连续编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18560 2026-08-20 cs.HC cs.CV 新提交 57%

SemanticSlider3D: Training-Free Continuous Semantic Editing for 3D Objects

SemanticSlider3D:无需训练的3D物体连续语义编辑

Ru Wang, Rahul Jain, Koichiro Niinuma, Aakar Gupta

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 SemanticSlider3D是一种无需训练的3D物体连续语义编辑技术,通过在先进3D生成模型潜空间构建语义编辑方向,在技术验证与用户研究中均表现优于基线方法,可作为现有3D创作工作流的有效补充。

Comments UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17559 2026-08-19 cs.CV 新提交 57%

MSEditor: Toward Consistent Multi-Shot Video Editing

MSEditor:面向一致性多镜头视频编辑

Kunyu Feng, Yue Ma, Bingyuan Wang, Yuefeng Wang, Zhiyuan Qin, Hao Cheng, Hao Li, Qifeng Chen, Zeyu Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对多镜头视频编辑的身份漂移与累积误差问题,提出首个专用框架MSEditor,通过监督适配器与跨镜头打包策略实现一致性编辑,在基准上性能优于现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16863 2026-08-18 cs.CV 新提交 57%

SplatGuide: Geometric Priors from 3D Gaussians for Pose-Free Novel View Synthesis

SplatGuide:用于无姿态新视图合成的3D高斯几何先验

Yejun Zhang, Zihan Wang, Xu Ji, Yihao Wang, Yuxin Hou, Junyuan Fang, Juho-Matti Kilpeläinen, Arno Solin, Hamed Rezazadegan Tavakoli, Esa Rahtu, Juho Kannala

机构 * Aalto University(阿尔托大学) Deep Render(深度渲染公司) ELLIS Institute Finland(芬兰ELLIS研究所) Nokia Technologies(诺基亚技术公司) Tampere University(坦佩雷大学) University of Oulu(奥卢大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SplatGuide复用单个3DGS场景生成三种互补信号,实现无姿态新视图合成,在多个基准数据集上达到SOTA,在RealEstate10K上超越真实姿态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16220 2026-08-18 cs.SD cs.CV 新提交 57%

SingDance: Compositional Zero-Shot Singing-and-Dancing Video Generation with Role-Aware Audio Conditioning

SingDance:基于角色感知音频条件的组合式零样本歌舞视频生成

Tao Feng, Xu Li, Xiangyang Luo, Ming Wen, Huadai Liu, Chen Zhang, Wei Xue

机构 * Kuaishou Technology(快手科技)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SingDance是统一视频扩散框架,将语音表达设为语义角色,通过硬紧凑路由等技术实现组合式零样本歌舞视频生成,参数少且性能具竞争力。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16008 2026-08-18 cs.CV 新提交 57%

Spatial Temporal Synergy: Balancing Change and Invariance in Text Driven 3D Human Motion Editing

时空协同:文本驱动的三维人体动作编辑中变化与不变性的平衡

Shaohui Lin, Zhenwu Shi, Jingyu Gong, Jiao Xie, Yu Zhou, Baochang Zhang, Lizhuang Ma, Chia-Wen Lin

机构 * East China Normal University(华东师范大学) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) School of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海教育人工智能研究院) School of Statistics, East China Normal University(华东师范大学统计学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对文本驱动3D人体动作编辑中变化与不变性难以平衡的问题,提出CIME框架,通过空间姿态和时间节奏维度的解耦实现最优性能,相关成果已开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15749 2026-08-18 cs.CV 新提交 57%

ES3D: Embedding Semantics into 3D Space for Component-Aware Editing

ES3D:将语义嵌入3D空间以实现组件感知编辑

Xuancheng Jin, Rengan Xie, Jiayuan Lu, Wenting Zheng, Rui Wang, Yuchi Huo, Lincheng Li, Yingfeng Chen

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 ES3D是将语义嵌入3D空间的框架,通过多视图语义特征构建3D语义嵌入,实现组件感知的3D资产检索与编辑,可生成几何一致、语义连贯的编辑结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15163 2026-08-18 cs.CV cs.HC 新提交 57%

From "What-If" to "What-Is": Counterfactual Thinking-Inspired Semantic Alignment for Visual Brain Decoding

从“假设”到“事实”:面向视觉脑解码的反事实思维启发语义对齐

Kaitao Yan, Chi Liu, Congcong Zhu, Huajie Chen, Gengshen Wu, Minghao Wang, Xiaotong Han, Tianqing Zhu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出ConceptAlign框架,通过反事实语义对齐解决视觉脑解码的语义错误问题,在自然场景数据集上相比MindEye2提升了重构、语义区分等指标。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14530 2026-08-17 cs.CV cs.AI 新提交 57%

Marionette: Predicting World States, Rendering Geometry, Painting Appearance

Marionette:预测世界状态、渲染几何、绘制外观

Zian Meng, Zhen Li, Chuanhao Li, Qiang Li, Kaipeng Zhang

机构 * Alaya Lab(Alaya实验室) Shanghai Innovation Institute(上海创新研究院) Huazhong University of Science and Technology(华中科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Marionette是面向带关节角色的交互式游戏的世界模型,通过显式建模3D世界状态、委托几何计算、合成外观,实现了可控的长时序行为,且外观生成无明显保真度损失。

Comments Project page: https://alayalab.github.io/Marionette/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13183 2026-08-14 cs.CV 新提交 57%

A Controlled Study of Self-Supervised Image and Video Pretraining under Limited Resources

有限资源下自监督图像与视频预训练的对照研究

Brunó B. Englert, Gijs Dubbelman

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 该研究对照研究有限资源下的图像与视频自监督预训练,发现DINOv2式预训练性能最优,结合其与VideoMAE可提升图像任务性能但降低部分视频任务性能,为资源有限场景的视觉模型训练提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10289 2026-08-12 cs.CV cs.LG 新提交 57%

SeFaR: Semantic Feature-aware Robustness Testing of Deep Neural Networks

SeFaR:面向深度神经网络的语义特征感知鲁棒性测试

Nusrat Jahan Mozumder, Divya Gopinath, Corina Pasareanu, Matthew Dwyer

机构 * University of Virginia(弗吉尼亚大学) KBR Inc.(KBR公司) NASA Ames(美国国家航空航天局艾姆斯研究中心) Carnegie Mellon University(卡内基梅隆大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SeFaR是一个以语义特征为核心的视觉模型鲁棒性测试框架,可在保留需求满足性的前提下,生成测试输入以识别影响模型决策的特征,进而发现故障并关联相关特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07948 2026-08-11 cs.CV 新提交 57%

SynVAR: Synergizing Spatial and Semantic Alignment in Visual Autoregressive Model

SynVAR:在视觉自回归模型中协同空间与语义对齐

Zhennan Chen, Tianxing Shi, Pengcheng Xu, Kepan Nan, Qian Wang, Zili Yi, Jian Yang, Ying Tai

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Western University(西安大略大学) JIUTIAN Research, CMCC, China(中国移动通信集团九天研究)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出首个专为视觉自回归模型(VAR)定制的无训练增强框架SynVAR,通过空间-语义协同控制策略及三个关键组件抑制误差,显著提升了VAR的复杂场景建模能力。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07541 2026-08-11 cs.CV cs.AI cs.MA 新提交 57%

NeuroPilot: An Agent-Driven Smart Pipeline for Processing, Quality Control, and Managing Neuroimages

NeuroPilot:一种用于神经影像处理、质量控制与管理的智能体驱动智能流程

Yiyao Chen, Yucheng Li, Jungong Tong, Shaoqi Wang, Kunhao Zhou, Ziquan Wei, Monica Murea, Marissa DiPiero, Tingting Dan, Guorong Wu

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出NeuroPilot多智能体系统,整合神经影像处理、质控与管理流程,在17个超12.3万受试者的队列中验证,将传统2-3个月的工作压缩至一周,提升了可扩展性与效率。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06770 2026-08-10 cs.AI cs.CV 新提交 57%

Surg-UniWorld: A Unified Surgical World Model with Multimodal Control Experts

Surg-UniWorld:具有多模态控制专家的统一外科世界模型

Rulin Zhou, Wanhao Liu, Guoheng Ma, Liangjin Shao, Qiujie Song, Yidu Wang, Guankun Wang, Tong Chen, Long Bai, Luping Zhou, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) Shenzhen Loop Area Institute(深圳河套学院) the University of Sydney(悉尼大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出Surg-UniWorld统一外科世界模型,构建Chlec80-SurgWAM基准,经实验证实其在可控外科视频生成相关指标上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06231 2026-08-07 cs.CV 新提交 57%

EmoWorld: A Decoupled Affective Field for Controllable Emotional Video Generation

EmoWorld:用于可控情感视频生成的解耦情感场

Bingyuan Wang, Baistan Zhyldyzbekov, Kunyu Feng, Zeyu Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 EmoWorld是一种解耦情感场框架,通过VAS、SAS、TAS三个引导模块优化可控情感视频生成,在Wan2.2等基准上实现情感对齐、线索检测及过渡单调性提升,具备多骨干网络可移植性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05803 2026-08-07 cs.CV 新提交 57%

Vorch-Omni: Multi-Task Orchestration of Sight and Sound

Vorch-Omni:视觉与听觉的多任务编排

Vorch Team, Xiaoyu Chen, Yang Ding, Cong Han, Menglin Han, Yuxin Hong, Jiebo Hou, Zequn Jie, Xiang Li, Jing Liu, Qi Liu, Yulei Lu, Siyuan Luo, Lin Ma, Xin Ma, Yinlong Qian, Peng Shi, Fang Wan, Siqi Wang, Yaohui Wang, Yaole Wang, Yidi Wu, Siqian Yang, Mingyu Yin, Haoran Yu, Gang Yue, Lisai Zhang, Yuting Zhang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Vorch-Omni是基于流匹配扩散Transformer的统一多任务视听合成框架,支持10余项视听相关任务,为通用视听生成与操作提供可扩展基础。

Comments Project Page: https://vorch-project.github.io/Vorch-Omni-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05069 2026-08-06 cs.CV cs.AI 新提交 57%

VQ-VAD: Vector-quantized Motion Representation Learning for Human-centric Video Anomaly Detection

VQ-VAD:面向以人为中心的视频异常检测的向量量化运动表示学习

Narges Rashvand, Ghazal Alinezhad Noghre, Shanle Yao, Gabriel Maldonado, Hamed Tabkhi

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 针对现有基于姿态的视频异常检测方法的局限,提出VQ-VAD框架,通过向量量化学习离散运动表示,在多评估设置的基准测试中取得优异性能,代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04622 2026-08-06 cs.CV 新提交 57%

DAC-Pose: Dual-Agent Collaborative Framework for Pose-Guided Human Generation

DAC-Pose:用于姿态引导人体生成的双智能体协作框架

Haotian Yang, Zhile Yang, Huiyu Zhou, Xin Sun

机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Shenzhen University of Advanced Technology(深圳理工大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 针对姿态引导人体生成在剧烈视角变化下的视觉伪影问题,提出双智能体协作框架DAC-Pose,通过PSR与DAVE智能体的反馈循环实现高保真合成,在DeepFashion和Market-1501基准上验证了其优越性。

Comments Code is available at DAC-Pose" target="_blank" rel="noopener">https://github.com/AIVRC/DAC-Pose

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03971 2026-08-05 cs.CV 新提交 57%

UniWorld-Design: From Pixel Generation to Layer-Native Design

UniWorld-Design:从像素生成到层原生设计

Zongjian Li, Zhiyuan Yan, Chenxu Bai, Chen Chen, Haoxiang Sun, Shaodong Wang, Feize Wu, Shenghai Yuan, Bin Lin, Zheyuan Liu, Yuwei Niu, Li Yuan

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 UniWorld-Design是一种以语义RGBA层为原子单元的图像生成框架,含T2RGBA和I2L两个模型,在Crello基准测试中I2L和T2RGBA均优于现有相关模型。

Comments Project page: https://rabbitvis.rabbitpre.com/blog

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02214 2026-08-04 cs.CV 新提交 57%

VARPose: Flexible 2D Pose Densification via Visual Autoregressive Modeling for Enhanced 3D Lifting

VARPose:基于视觉自回归建模的灵活2D姿态密集化以提升3D姿态提升性能

Kaiyuan Pu, Tiantian Yang, Dan Zeng

机构 * School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) The Technology Innovation Center for Collaborative Applications of Natural Resources Data in GBA, MNR(自然资源部粤港澳大湾区自然资源数据协同应用技术创新中心)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 VARPose基于VAR建模,通过GPT分词器和UniSkelar自回归模型实现2D姿态灵活密集化,在3D姿态估计等下游任务上性能优于现有方法且可泛化到新粒度。

Comments ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01978 2026-08-04 cs.CV 新提交 57%

Proxy Avatar Meets Low-Rank Caching: Real-Time One-Shot Emotion-Controllable Portrait Animation

代理化身与低秩缓存结合:实时单样本情感可控肖像动画

Haijie Yang, Jindi Bao, Yixuan Dong, Hongliang Zhang, Jian Bi, Hao Tang, Zhenyu Zhang, Jianjun Qian, Jian Yang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出结合代理化身与低秩缓存的级联框架,解决音频驱动肖像动画的实时性与情感控制问题,实现了情感表达、身份保留及推理效率的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01726 2026-08-04 cs.CV 新提交 57%

G-Skin: Learning to Bind 3D Gaussians with Generative Visual Priors

G-Skin:学习结合生成式视觉先验的3D高斯绑定方法

Yuxin Yao, Kendong Liu, Shiqi Zhou, Jiazhi Xia, Junhui Hou

机构 * City University of Hong Kong(香港城市大学) Central Media Technology Institute, Huawei(华为中央媒体技术研究院) Central South University(中南大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文针对3D高斯资产绑定的难题,提出生成式蒙皮框架G-Skin,利用2D视觉基础模型提炼运动先验构建优化流程,可灵活泛化并优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00663 2026-08-04 cs.CV 新提交 57%

Geometry-guided Emotion Modulation for Controllable and Photorealistic Emotional Talking Face Generation

几何引导的情感调制用于可控且照片级真实感的情感说话人脸生成

Chenggong Hu, Shaoyin Ma, Yi Wang, Li Sun, Mingli Song, Jie Song

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 GemTalk框架结合隐式表示与显式几何先验,通过V-AEP、D-GPG和GEM模块,实现情感说话人脸的可控生成,在照片真实感与情感动态上表现优异。

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28955 2026-08-03 cs.CV cs.AI 新提交 57%

Retrieval-Driven Training-Free AI-Generated Video Attribution

检索驱动的无训练AI生成视频溯源

Renxi Cheng, Chaolei Han, Jie Gui, Hongsong Wang

机构 * School of Cyber Science and Engineering, Southeast University(东南大学网络空间科学与工程学院) Purple Mountain Laboratories(紫金山实验室) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 针对现有视觉溯源方法泛化性不足的问题,本文提出检索驱动的无训练AI生成视频溯源范式,基于生成指纹的流程在GenVidBench上实现优于SOTA的检测与溯源性能。

详情

展开后加载摘要…

URL PDF HTML 收藏