arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1738 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 102 篇

2605.27735 2026-08-10 quant-ph 版本更新 71%

An IQP Born Machine for Calorimeter Image Generation at 64 Qubits with Compiled-IQP Deployment

用于64量子比特量热仪图像生成的IQP玻恩机及编译IQP部署

Jamal Slim, Saverio Monaco, Florian Rehm, Dirk Krücker, Kerstin Borras

专题命中 可控生成 :image generation(title)

AI总结 提出一种瞬时量子多项式时间(IQP)玻恩机架构,通过编译为单次采样困难的IQP电路,在64量子比特上实现高能物理量热仪簇射图像的生成,并达到优于经典基线的相关性度量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08061 2026-08-04 math.AP math.DS 版本更新 71%

Uniform $L^{\infty}$-Boundedness of Global Attractors for Reaction-Diffusion Equations with Neumann boundary condition in Uniformly Perturbed Non-Smooth Domains

在均匀扰动的非光滑区域中具有诺伊曼边界条件的反应扩散方程全局吸引子的一致\(L^{\infty}\)有界性

Antonio L. Pereira

专题命中 可控生成 :diffusion(title)

AI总结 研究一族在非光滑区域上具诺伊曼边界条件的半线性抛物方程,通过特定条件建立适定性与吸引子存在性,利用多种方法证明吸引子族\(L^\infty\)一致有界,且在区域体积收敛时关于强\(H^1\)拓扑在\(\mu = 0\)处上半连续。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06058 2026-07-15 quant-ph 版本更新 71%

SQGen: Structured Quantum Image Generation with Latent-Modulated Quantized Tensor Trains

SQGen:基于潜变量调制量化张量列车的结构化量子图像生成

Guang Lin, Qibin Zhao

专题命中 可控生成 :image generation(title)

AI总结 研究旨在解决NISQ硬件上直接从量子系统生成图像的问题,核心方法是提出基于潜变量调制量化张量列车的SQGen,主要贡献为能稳定训练,端到端生成图像且无需经典解码器,在真实量子硬件上有可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21263 2026-08-12 cs.CV 版本更新 70%

Towards Geometry-Grounded Dense Semantic Matching with VGGT Priors

基于VGGT先验的几何基础密集语义匹配研究

Songlin Yang, Tianyi Wei, Yushi Lan, Zeqi Xiao, Anyi Rao, Xingang Pan

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Visual Geometry Group, University of Oxford(牛津大学视觉几何组)

专题命中 可控生成 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 本文针对现有语义匹配方法的几何歧义与最近邻规则局限,采用VGGT先验,通过特征调整、循环训练等策略实现适配,在多方面性能优于基线。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12853 2026-07-07 eess.IV cs.CV 版本更新 70%

BrainNormalizer: Anatomy-Informed Pseudo-Healthy Brain Reconstruction from Tumor MRI via Edge-Guided ControlNet

BrainNormalizer:通过边缘引导控制网络从肿瘤MRI进行解剖学信息伪健康脑重建

Min Gu Kwak, Yeonju Lee, Hairong Wang, Kristin R. Swanson, Jing Li

机构 * University of Pittsburgh(匹兹堡大学) Georgia Institute of Technology(佐治亚理工学院) University of Texas at Austin(德克萨斯大学奥斯汀分校) Cedars-Sinai Medical Center(西德萨斯医疗中心) Mayo Clinic Arizona(梅奥诊所亚利桑那分部)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 针对脑肿瘤致结构变形难区分肿瘤与解剖变异问题,提出BrainNormalizer框架,用两阶段训练学习解剖先验等,通过特定策略实现伪健康脑重建,实验表明其有优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20935 2026-07-01 cs.CV 版本更新 70%

ISAC: Training-Free Instance-to-Semantic Attention Control for Multi-Instance Generation

ISAC:无需训练的实例到语义注意力控制用于多实例生成

Sanghyun Jo, Wooyeol Lee, Ziseok Lee, Jonghyun Choi, Jaesik Park, Kyungsu Kim

机构 * OGQ Seoul National University(首尔大学)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出ISAC方法,通过先稳定自注意力布局再绑定交叉注意力语义,无需训练即可解决多实例生成中的遗漏、合并和语义混淆问题。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20237 2026-06-23 cs.CV 版本更新 70%

AnimeAdapter: A Modular Adapter for Appearance-Consistent Anime Character Generation

AnimeAdapter: 细粒度且一致的零样本动漫人物生成

Yixuan Han

机构 * National University of Singapore, Singapore(新加坡国立大学)

专题命中 可控生成 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出了一种轻量级的外观适配器,用于在多样编辑条件下实现可控且一致的动漫人物生成,通过注入单张参考图像的细粒度视觉特征到扩散过程中,并结合CLIP的局部空间化特性,开发出语义选择性局部注意力机制,进一步解耦人物外观与空间布局,从而实现高效的动漫人物生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18493 2026-06-12 cs.CV 版本更新 70%

ShowFlow: From Robust Single Concept to Condition-Free Multi-Concept Generation

ShowFlow: 从鲁棒的单概念到无条件的多概念生成

Trong-Vu Hoang, Quang-Binh Nguyen, Thanh-Toan Do, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science(科学大学) Vietnam National University(越南国家大学) Monash University(墨尔本大学) University of Dayton(Dayton大学)

专题命中 可控生成 :image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出ShowFlow框架,通过KronA-WED适配器和语义感知注意力正则化增强单概念生成,并利用SAMA和布局一致性指导实现无额外条件的多概念生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12261 2026-06-11 cs.LG cs.AI cs.CV 版本更新 70%

The Latent Color Subspace: Emergent Order in High-Dimensional Chaos

潜在颜色子空间:高维混沌中的涌现秩序

Mateusz Pach, Jessica Bader, Quentin Bouniot, Serge Belongie, Zeynep Akata

机构 * University of California, Berkeley(加州大学伯克利分校) University of Toronto(多伦多大学) University of Cambridge(剑桥大学) University of Oxford(牛津大学)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文揭示了FLUX.1变分自编码器潜在空间中颜色表示的HSL结构,并提出一种无需训练的闭式潜在空间操作方法,实现对生成图像颜色的预测与显式控制。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00967 2026-06-09 cs.CV 版本更新 70%

MedSyn2: Flexible Control of 3D CT Generation via Text and Semantically-Defined Segmentation Prompts

通过文本和语义定义的分割提示灵活控制3D CT生成

Weicheng Dai, Chenyu Wang, Binxu Li, Shantanu Ghosh, Afrooz Zandifar, Christina LeBedis, Kayhan Batmanghelich

机构 * Boston University School of Engineering(波士顿大学工程学院) Stanford University(斯坦福大学) University of Pittsburgh Medical Center(匹兹堡大学医学中心) Boston University School of Medicine(波士顿大学医学院)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出一种灵活的多模态框架,通过文本和可选分割提示控制3D CT生成,实现高分辨率、解剖一致且可控的体数据生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16611 2026-08-05 cs.GR cs.CV 版本更新 62%

Style-Aware Gloss Control for Generative Non-Photorealistic Rendering

风格感知的光泽控制用于生成非照片实感渲染

Santiago Jimenez-Navarro, Belen Masia, Ana Serrano

机构 * University of Zaragoza -- I3A(萨拉戈萨大学--I3A)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出了一种风格感知的光泽控制方法,通过训练生成模型来解耦光泽与艺术风格,实现对非照片实感图像的精细控制。

Comments Published in Computers & Graphics journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01390 2026-07-03 cs.CV cs.AI cs.MM 版本更新 62%

SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment

SEPS:面向细粒度跨模态对齐的语义增强补丁精简框架

Xinyu Mao, Junsi Li, Haoji Zhang, Yu Liang, Ming Sun

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV、cs.MM

AI总结 提出SEPS框架,通过两阶段机制整合稠密与稀疏文本语义,识别显著视觉补丁,并利用相关性感知选择与均值计算突出关键补丁-词对应,提升跨模态相似度评估,在Flickr30K和MS-COCO上rSum提升23%-86%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01503 2026-08-18 cs.CV 版本更新 57%

Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task

通过深度排序任务解构视觉语言模型中的图像线索理解与语言偏差

Yiqian Liu, Iuliia Kotseruba, John K. Tsotsos

机构 * York University(约克大学) University of Guelph(圭尔夫大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 提出深度排序与异常检测任务,结合控制图像线索和语言表达,量化视觉语言模型的深度感知能力,发现模型对深度线索利用不足且存在语言偏差。

Comments 15 pages, 7 figures, accepted to ECCV 2026 (30 pages, 13 figures, supplementary materials included)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23649 2026-08-18 cs.RO cs.CV 版本更新 57%

RoboMirror: Understand Before You Imitate for Video to Humanoid Locomotion

RoboMirror: 在模仿之前理解以实现视频到仿人运动

Zhe Li, Boan Zhu, Yangyang Wei, Shuanghao Bai, Yuheng Ji, Yibo Peng, Tao Huang, Pengwei Wang, Zhongyuan Wang, S. -H. Gary Chan, Chang Xu, Cheng Chi, Jianfei Yang, Shanghang Zhang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 RoboMirror通过视觉语言模型将视频提炼为视觉运动意图,直接生成物理合理的仿人运动,无需姿态重建,实现远程存在并提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08784 2026-08-13 cs.CV 版本更新 57%

simpleposter: A simple baseline for product poster generation

simpleposter: 产品海报生成的一个简单基线

Benlei Cui, Fangao Zeng, Weitao Jiang, Yuwen Zhai, Haiwen Hong, Longtao Huang, Hui Xue, Wenxiang Shang, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出SimplePoster,一种基于修复的简单框架,实现产品外观忠实保留和精确文本布局控制,实验显示其在主体保留率和文本准确性上优于现有方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03314 2026-08-12 cs.CV 版本更新 57%

TASE: Truncation-Aware Semantic Embeddings for 3D Scene Understanding and Editing

TASE: 用于3D场景理解与编辑的截断感知语义嵌入

Tim-Felix Faasch, Jochen Kall, Lucas Nunes, Jens Behley, Cyrill Stachniss

机构 * Bosch Research(博世研究院) Rheinisch-Westfälische Technische Hochschule Aachen(亚琛工业大学) University of Bonn(波恩大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出TASE方法,通过将预训练的2D语义特征投影到截断感知嵌入空间,结合尺度和平移等变损失,实现可控的3D场景文本驱动编辑,在大几何修改任务上显著优于现有方法。

Comments Code: https://github.com/boschresearch/TASE

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07218 2026-08-12 cs.CV 版本更新 57%

SceneNAT: Masked Generative Modeling for Language-Guided Indoor Scene Synthesis

SceneNAT:基于语言引导的室内场景合成的掩码生成模型

Jeongjun Choi, Yeonsoo Park, H. Jin Kim

机构 * Seoul National University(首尔国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SceneNAT通过掩码非自回归Transformer实现语言引导的室内场景合成,提升性能与效率,同时降低计算成本。

Comments Under review. Project page: https://scenenat.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04635 2026-08-11 cs.CV 版本更新 57%

UniPCB: A Generation-Assisted Vision-Based Measurement Framework for PCB Defect Inspection

UniPCB: 一种用于PCB缺陷检测的生成辅助检测框架

Huan Zhang, Lianghong Tan, Yichu Xu, Zishan Su, Jiangzhong Cao, Huanqi Wu, Linwei Zhu, Xu Zhang

机构 * School of Information Engineering, Guangdong University of Technology(广东工业大学信息工程学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出UniPCB框架,通过多模态条件生成器合成缺陷样本以增强数据,并设计倒残差移位注意力与跨级互补融合模块提升检测性能,在DsPCBSD+上实现98.0% mAP@0.5。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16060 2026-08-06 cs.CV 版本更新 57%

ArtChart: Faithful Artistic Chart Generation with Integrated Text Rendering

ArtChart:一个用于忠实生成艺术图表并集成文本渲染的基准测试

Meijia Huang, Yingjie Yin, Shihao Wang, Chenguang Ma

机构 * Ant Group(蚂蚁集团)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 研究旨在解决艺术图表生成难题,提出ArtChart框架,含特定即插即用模块及强化学习等策略,构建基准测试和评估套件,实验证明该框架能生成兼具美观与数学准确性的图表,优于开源基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12000 2026-08-06 cs.CV 版本更新 57%

MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors

MetaView:基于尺度感知隐式几何先验的单目新视图合成

Yufei Cai, Xuesong Niu, Hao Lu, Kun Gai, Kai Wu, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) Kolors Team, Kuaishou Technology(快手科技色彩团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 研究提出MetaView框架,结合隐式几何建模与少量显式3D线索,利用前馈几何感知网络隐式几何先验及度量深度,实现大视角下单目新视图合成,实验证明该方法在挑战性场景中显著优于现有方法且泛化能力强。

Comments accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00094 2026-08-05 cs.CV 版本更新 57%

Video Models as Native 4D Renderers: World-Grounded Conditioning from Animated Mesh

视频模型作为原生4D渲染器:基于动画网格的世界 grounding 条件

Junhao Chen, Mingjin Chen, Henghaofan Zhang, Minglin Chen, Liaoyuan Fan, Boran Zhang, Saining Zhang, Mingze Sun, Hao Zhao, Ruqi Huang, Zhihao Li, Yufei Wang

机构 * Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Sun Yat-sen University(中山大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出参考引导渲染器DAR,扩展Wan2.2相机控制,用跟踪和世界位置组成的4D G缓冲作为条件,在DAR-4D基准上实现优于现有方法的视频生成性能。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28394 2026-08-04 cs.CV 版本更新 57%

Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer

大基础模型时代的手物交互:重建、生成与具身迁移

Weiquan Lin, Yu Deng, Shiyang Liu, Luping Xiao, Xu Tang, Junzhi Yu, Jiaolong Yang, Lei Zhang, Xingyu Chen

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本综述系统梳理大基础模型在手物交互(HOI)领域的应用,建立基础模型子先验分类,分析其在HOI任务与机器人学习中的作用,总结数据集与评估协议并展望未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30514 2026-08-04 cs.CV 版本更新 57%

3D Scene-Adaptive Trajectory-Controllable Human Image Animation with Camera Movement

3D场景自适应轨迹可控的人体图像动画与相机运动

Deyin Liu, Jicheng Xu, Lin Yuanbo Wu, Xiaowei Zhao, Xiatian Zhu, Zhe Jin, Anjan Dutta

机构 * Engineering Research Center of Autonomous Unmanned System Technology(自主无人系统工程研究中心) Ministry of Education(教育部) Anhui Provincial Key Laboratory of Security Artificial Intelligence(安徽省安全人工智能重点实验室) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) University of Warwick(沃林格大学) Zhejiang Yuexiu University(浙江越秀大学) University of Surrey(萨里大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出场景自适应人体动画框架,通过地面自适应3D运动重定向和视角自适应潜在融合机制,实现自然场景中人体运动与相机轨迹的可控视频生成。

Comments Accepted to the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19350 2026-08-03 cs.GR cs.LG 版本更新 57%

CompoSE: Compositional Synthesis and Editing of 3D Shapes via Part-Aware Control

CompoSE:通过部分感知控制进行3D形状的组合合成与编辑

Habib Slim, Shariq Farooq Bhat, Mohamed Elhoseiny, Yifan Wang, Mike Roberts

机构 * King Abdullah University of Science and Technology (KAUST)(卡布斯大学) Adobe Research(Adobe研究)

专题命中 可控生成 :diffusion(abstract);分类 cs.GR

AI总结 本文提出CompoSE方法,通过部分感知控制实现3D形状的组合合成与编辑,核心方法是使用扩散变压器架构在局部和全局之间交替处理部分,并通过新颖的条件技术确保对用户输入的强遵循,主要贡献是无需部分级文本提示即可直接从用户粗略布局指导中学习部分语义和对称性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02330 2026-08-03 cs.CV cs.AI cs.LG 版本更新 57%

ActionParty: Multi-Subject Action Binding in Generative Video Games

ActionParty:生成视频游戏中的多主体动作绑定

Alexander Pondaven, Ziyi Wu, Igor Gilitschenski, Philip Torr, Sergey Tulyakov, Fabio Pizzati, Aliaksandr Siarohin

机构 * Snap Research(Snap研究院) University of Oxford(牛津大学) University of Toronto(多伦多大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出ActionParty,一种可控制多主体的生成视频游戏世界模型,通过引入主体状态标记和空间偏置机制,提升动作关联准确性与身份一致性。

Comments ECCV 2026 - Project page: https://action-party.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22718 2026-07-31 cs.CV 版本更新 57%

Generative Relightable Avatars

生成式可重光照虚拟化身

Kunwar Maheep Singh, Christian Theobalt, Rishabh Dabral

机构 * Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学研究所,萨尔兰信息学园区)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出生成式可重光照虚拟化身(GRA),结合物理光照与概率细化,实现全身人物的自由视角渲染和环境图重光照,在感知质量上优于现有方法。

Comments Project Page: https://vcai.mpi-inf.mpg.de/projects/GRA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19651 2026-07-30 cs.AI cs.CV cs.LG 版本更新 57%

BrainG3N: A Dual-Purpose Tokenizer for Controllable 3D Brain MRI Generation

BrainG3N:用于可控3D脑MRI生成的双用途分词器

Max Van Puyvelde, Ibrahim Gulluk, Wim Van Criekinge, Olivier Gevaert

机构 * Department of Biomedical Data Science, Stanford University School of Medicine(斯坦福大学医学院生物医学数据科学系) Department of Mathematical Modelling, Statistics & Bioinformatics, Ghent University(根特大学数学建模、统计与生物信息学系) Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出基于3D掩码自编码器的分词器,解耦编码器与解码器,在23项线性探测任务中21项超越SOTA,并支持条件生成和纵向预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27351 2026-07-29 cs.CV 版本更新 57%

Feedforward 3D Editing Learns from Semantic-Part Transformation

前馈3D编辑从语义部分变换中学习

Jiawei Weng, Saining Zhang, Zhenxin Diao, Peishuo Li, Henghaofan Zhang, Junhao Chen, Hao Zhao

机构 * Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 提出Pxform数据集和PartFlow网络,通过语义部分变换实现高质量前馈3D编辑,在几何和外观编辑基准上达到最优性能。

Comments 31 pages, 22 figures. Project Page: https://dennis-jwweng.github.io/pxform/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16727 2026-07-22 cs.CV cs.LG 版本更新 57%

Pain in 3D: Generating Controllable Synthetic Faces for Automated Pain Assessment

3D 中的疼痛:生成用于自动疼痛评估的可控合成面部

Xin Lei Lin, Soroush Mehraban, Abhishek Moturu, Babak Taati

机构 * Vector Institute(向量研究所) KITE Research Institute(KITE研究机构) University Health Network(大学健康网络) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Department of Medical Imaging, University of Toronto(多伦多大学医学成像系) Institute of Biomedical Engineering, University of Toronto(多伦多大学生物医学工程研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 研究针对面部表情自动疼痛评估面临的数据稀缺等问题,提出3DPain数据集及三阶段框架合成多视图面部,还引入ViTPain框架,为可推广的自动疼痛评估建立了可控、多样且基于临床的基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19789 2026-07-21 cs.CV 版本更新 57%

OmniMotion-X: Versatile Multimodal Whole-Body Motion Generation

OmniMotion-X:通用多模态全身运动生成

Guowei Xu, Yuxuan Bian, Ailing Zeng, Zhuo Chen, Mingyi Shi, Shaoli Huang, Wen Li, Lixin Duan, Qiang Xu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 介绍用于全身人类运动生成的OmniMotion-X框架,利用自回归扩散变换器,提出参考运动等方法,构建数据集并采用新训练策略,超越现有方法,在多模态任务中表现出色,可交互式生成逼真连贯可控的长时间运动。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏