arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 184 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 184 篇

2608.06770 2026-08-10 cs.AI cs.CV 新提交 57%

Surg-UniWorld: A Unified Surgical World Model with Multimodal Control Experts

Surg-UniWorld:具有多模态控制专家的统一外科世界模型

Rulin Zhou, Wanhao Liu, Guoheng Ma, Liangjin Shao, Qiujie Song, Yidu Wang, Guankun Wang, Tong Chen, Long Bai, Luping Zhou, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) Shenzhen Loop Area Institute(深圳河套学院) the University of Sydney(悉尼大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出Surg-UniWorld统一外科世界模型,构建Chlec80-SurgWAM基准,经实验证实其在可控外科视频生成相关指标上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06231 2026-08-07 cs.CV 新提交 57%

EmoWorld: A Decoupled Affective Field for Controllable Emotional Video Generation

EmoWorld:用于可控情感视频生成的解耦情感场

Bingyuan Wang, Baistan Zhyldyzbekov, Kunyu Feng, Zeyu Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 EmoWorld是一种解耦情感场框架,通过VAS、SAS、TAS三个引导模块优化可控情感视频生成,在Wan2.2等基准上实现情感对齐、线索检测及过渡单调性提升,具备多骨干网络可移植性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05803 2026-08-07 cs.CV 新提交 57%

Vorch-Omni: Multi-Task Orchestration of Sight and Sound

Vorch-Omni:视觉与听觉的多任务编排

Vorch Team, Xiaoyu Chen, Yang Ding, Cong Han, Menglin Han, Yuxin Hong, Jiebo Hou, Zequn Jie, Xiang Li, Jing Liu, Qi Liu, Yulei Lu, Siyuan Luo, Lin Ma, Xin Ma, Yinlong Qian, Peng Shi, Fang Wan, Siqi Wang, Yaohui Wang, Yaole Wang, Yidi Wu, Siqian Yang, Mingyu Yin, Haoran Yu, Gang Yue, Lisai Zhang, Yuting Zhang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Vorch-Omni是基于流匹配扩散Transformer的统一多任务视听合成框架,支持10余项视听相关任务,为通用视听生成与操作提供可扩展基础。

Comments Project Page: https://vorch-project.github.io/Vorch-Omni-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05069 2026-08-06 cs.CV cs.AI 新提交 57%

VQ-VAD: Vector-quantized Motion Representation Learning for Human-centric Video Anomaly Detection

VQ-VAD:面向以人为中心的视频异常检测的向量量化运动表示学习

Narges Rashvand, Ghazal Alinezhad Noghre, Shanle Yao, Gabriel Maldonado, Hamed Tabkhi

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 针对现有基于姿态的视频异常检测方法的局限,提出VQ-VAD框架,通过向量量化学习离散运动表示,在多评估设置的基准测试中取得优异性能,代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04622 2026-08-06 cs.CV 新提交 57%

DAC-Pose: Dual-Agent Collaborative Framework for Pose-Guided Human Generation

DAC-Pose:用于姿态引导人体生成的双智能体协作框架

Haotian Yang, Zhile Yang, Huiyu Zhou, Xin Sun

机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Shenzhen University of Advanced Technology(深圳理工大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 针对姿态引导人体生成在剧烈视角变化下的视觉伪影问题,提出双智能体协作框架DAC-Pose,通过PSR与DAVE智能体的反馈循环实现高保真合成,在DeepFashion和Market-1501基准上验证了其优越性。

Comments Code is available at DAC-Pose" target="_blank" rel="noopener">https://github.com/AIVRC/DAC-Pose

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03971 2026-08-05 cs.CV 新提交 57%

UniWorld-Design: From Pixel Generation to Layer-Native Design

UniWorld-Design:从像素生成到层原生设计

Zongjian Li, Zhiyuan Yan, Chenxu Bai, Chen Chen, Haoxiang Sun, Shaodong Wang, Feize Wu, Shenghai Yuan, Bin Lin, Zheyuan Liu, Yuwei Niu, Li Yuan

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 UniWorld-Design是一种以语义RGBA层为原子单元的图像生成框架,含T2RGBA和I2L两个模型,在Crello基准测试中I2L和T2RGBA均优于现有相关模型。

Comments Project page: https://rabbitvis.rabbitpre.com/blog

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02214 2026-08-04 cs.CV 新提交 57%

VARPose: Flexible 2D Pose Densification via Visual Autoregressive Modeling for Enhanced 3D Lifting

VARPose:基于视觉自回归建模的灵活2D姿态密集化以提升3D姿态提升性能

Kaiyuan Pu, Tiantian Yang, Dan Zeng

机构 * School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) The Technology Innovation Center for Collaborative Applications of Natural Resources Data in GBA, MNR(自然资源部粤港澳大湾区自然资源数据协同应用技术创新中心)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 VARPose基于VAR建模,通过GPT分词器和UniSkelar自回归模型实现2D姿态灵活密集化,在3D姿态估计等下游任务上性能优于现有方法且可泛化到新粒度。

Comments ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01978 2026-08-04 cs.CV 新提交 57%

Proxy Avatar Meets Low-Rank Caching: Real-Time One-Shot Emotion-Controllable Portrait Animation

代理化身与低秩缓存结合:实时单样本情感可控肖像动画

Haijie Yang, Jindi Bao, Yixuan Dong, Hongliang Zhang, Jian Bi, Hao Tang, Zhenyu Zhang, Jianjun Qian, Jian Yang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出结合代理化身与低秩缓存的级联框架,解决音频驱动肖像动画的实时性与情感控制问题,实现了情感表达、身份保留及推理效率的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01726 2026-08-04 cs.CV 新提交 57%

G-Skin: Learning to Bind 3D Gaussians with Generative Visual Priors

G-Skin:学习结合生成式视觉先验的3D高斯绑定方法

Yuxin Yao, Kendong Liu, Shiqi Zhou, Jiazhi Xia, Junhui Hou

机构 * City University of Hong Kong(香港城市大学) Central Media Technology Institute, Huawei(华为中央媒体技术研究院) Central South University(中南大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文针对3D高斯资产绑定的难题,提出生成式蒙皮框架G-Skin,利用2D视觉基础模型提炼运动先验构建优化流程,可灵活泛化并优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00663 2026-08-04 cs.CV 新提交 57%

Geometry-guided Emotion Modulation for Controllable and Photorealistic Emotional Talking Face Generation

几何引导的情感调制用于可控且照片级真实感的情感说话人脸生成

Chenggong Hu, Shaoyin Ma, Yi Wang, Li Sun, Mingli Song, Jie Song

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 GemTalk框架结合隐式表示与显式几何先验,通过V-AEP、D-GPG和GEM模块,实现情感说话人脸的可控生成,在照片真实感与情感动态上表现优异。

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28955 2026-08-03 cs.CV cs.AI 新提交 57%

Retrieval-Driven Training-Free AI-Generated Video Attribution

检索驱动的无训练AI生成视频溯源

Renxi Cheng, Chaolei Han, Jie Gui, Hongsong Wang

机构 * School of Cyber Science and Engineering, Southeast University(东南大学网络空间科学与工程学院) Purple Mountain Laboratories(紫金山实验室) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 针对现有视觉溯源方法泛化性不足的问题,本文提出检索驱动的无训练AI生成视频溯源范式,基于生成指纹的流程在GenVidBench上实现优于SOTA的检测与溯源性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28285 2026-07-31 cs.CV 新提交 57%

Beyond Visual Ambiguity: Guiding Robust Monocular Depth Estimation in Challenging Scenarios via Detailed Long Captions

超越视觉歧义:通过详细长文本引导具有挑战性场景下的鲁棒单目深度估计

Junrui Zhang, Jiaqi Li, Yiran Wang, Liao Shen, Zhiguo Cao

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 该研究针对单目深度估计的视觉歧义问题,提出CapDepth框架,通过详细长文本引导,在非朗伯表面和恶劣天气下的深度误差较现有最优方法分别降低25.0%和22.0%。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26529 2026-07-30 cs.CV 新提交 57%

CineWeaver: Training-Free Reference-Controllable Multi-Shot Long Video Generation for Cinematic Storytelling

CineWeaver:用于电影叙事的无训练参考可控多镜头长视频生成

Yuyang Huang, Yabo Chen, Wenrui Dai, Ziyang Zheng, Haibin Huang, Chi Zhang, Junni Zou, Hongkai Xiong, Xuelong Li

机构 * Shanghai Jiao Tong University(上海交通大学) China Telecom(中国电信) Institute of Artificial Intelligence (TeleAI)(人工智能研究院(电信AI))

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 CineWeaver是首个无训练的统一框架,通过操控位置编码、注意力模式等,实现参考可控的多镜头长视频生成,产出的电影视频时长较长且质量高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26411 2026-07-30 cs.CV 新提交 57%

Do Unified Multimodal Models Think in One Space? A Lens Through Cross-Branch Steering

统一多模态模型是否在同一空间中思考?通过跨分支引导的视角

Yu Wang, Sharon Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 本研究针对统一多模态模型是否共享统一可迁移语义空间的问题,提出跨分支语义引导框架,发现理解分支的引导向量可迁移至生成分支,揭示架构统一不保证语义对齐,该框架可用于探测多模态表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22302 2026-07-27 cs.CV 新提交 57%

fMRI2Face: A Full-HD fMRI-Video Dataset and Geometry-Guided Neural Decoding Framework for Dynamic Human Face Reconstruction

fMRI2Face:用于动态人脸重建的全高清功能磁共振成像视频数据集和几何引导神经解码框架

Jingyang Huo, Xiangru Huang, Chentao Shen, Yikai Wang, Yun Wang, Jianxiong Gao, Shihao Jin, Yanwei Fu, Jianfeng Feng

机构 * Fudan University(复旦大学) Westlake University(西湖大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Xmov(未提及通用中文名,可音译为艾莫夫)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出fMRI-Face数据集及fMRI2Face框架,用于从大脑活动重建动态人脸。框架从大脑活动中获取两种互补神经控制,经整合实现高保真面部视频重建,实验显示其性能优于基线,为动态面部感知研究提供了新平台和基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20866 2026-07-24 cs.CV 新提交 57%

Agentic Designer: Progressive Multi-Agent Collaboration for Structure-Aware Interior Layout Generation

智能设计师:用于结构感知室内布局生成的渐进式多智能体协作

Zhijing Yang, Haocheng Lin, Zhihua Xu, Haojie Li, Keze Wang, Liang Lin, Tianshui Chen

机构 * Guangdong University of Technology(广东工业大学) South China University of Technology(华南理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对室内布局生成难题,提出智能设计师这一渐进式多智能体框架,将布局生成视为迭代约束验证决策过程,通过渐进共识机制协调三个智能体,经实验验证其显著优于现有方法,提升了结构遵循和功能设计连贯性。

Comments TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19000 2026-07-22 cs.CV 新提交 57%

Learning Semantic-Robust Change Detection via Semantic-Invariant Self-Distillation

通过语义不变自蒸馏学习语义鲁棒的变化检测

Jiuhe Qu, Yingping Liang, Ying Fu

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 研究针对遥感图像变化检测中模型特征易受非语义变化干扰的问题,提出SCDistill框架,通过语义不变自蒸馏策略和扩散扰动模拟管道,增强语义一致性并扩展数据,提升变化检测性能,在多基准测试中达最优,泛化能力强。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18924 2026-07-22 cs.CV 新提交 57%

Learning Explicit Physical Parameter Control and Benchmarking for Video Generation

学习用于视频生成的显式物理参数控制和基准测试

Yanxun Li, Hao Wen, Bingze Song, Jiashu Zhu, Aiming Hao, Chubin Chen, Jintao Chen, Jiahong Wu, Xiangxiang Chu, Miao Wang

机构 * Beihang University(北京航空航天大学) Alibaba Group(阿里巴巴集团)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 研究针对图像到视频生成中物理参数控制问题,引入含密集物理参数化的数据集PhyParam-Dataset,提出物理引导的扩散模型PhyParam,建立基准PhyParam-Bench,通过实验证明该模型能在保持视觉保真度时提升物理一致性。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18917 2026-07-22 cs.CV 新提交 57%

TAP-RAG: Task-Aware Policy Control for Long-Document Multimodal Question Answering

TAP-RAG:用于长文档多模态问答的任务感知策略控制

Zhong Ji, Keqi Jin, Yan Zhang, Jiasheng Li

机构 * School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院) The International Joint Institute of Tianjin University(天津大学国际联合学院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 研究长文档多模态问答,提出TAP-RAG框架,含任务感知策略控制器及两个执行器,能预测任务先验、估计证据信号并生成策略,在多模态文档图上扩展证据,在相关数据集上取得最佳总体准确率。

Comments 18 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17638 2026-07-21 cs.CV 新提交 57%

Reviving Ancient Paintings via Poem: A Colorization Framework for Aligning Cultural Semantics

通过诗歌复兴古画:一种用于对齐文化语义的色彩化框架

Junming Gao, Biao Zhu, Xiaosong Wang, Tan Tang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对古画褪色问题,提出PoemColor框架,通过诗歌绘画投影仪和结构感知语义注意力,将诗歌文化语义与绘画恢复对齐,并构建混合数据集。实验证明该框架显著优于现有方法,能实现可控色彩化,恢复古画历史真实性与诗歌语义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12433 2026-07-15 cs.CV cs.AI 新提交 57%

ARDepth: Auto-regressive Monocular Depth Estimation with Progressive Visual Conditioning

ARDepth:基于渐进视觉条件的自回归单目深度估计

Zijie Wang, Wei Zhang, Weiming Zhang, Xiao Tan, Weikai Chen, Xiaoxu Li, Guanbin Li

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Shenzhen Loop Area Institute(深圳河套学院) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室) Baidu Inc.(百度公司) LightSpeed Studios, Tencent America(美国光速工作室,腾讯) School of Computer Science and Artificial Intelligence, Lanzhou University of Technology(兰州理工大学计算机科学与人工智能学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 研究单目深度估计问题,提出ARDepth方法,将其作为结构化自回归生成任务,通过尺度渐进条件和语义感知引导,逐步构建深度表示,实现跨尺度结构一致的深度预测,验证了自回归生成是几何建模的有前景范式。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10537 2026-07-14 cs.SD cs.MM eess.AS 新提交 57%

Dance to Music Generation leveraging Pre-training with Unpaired data and Contrastive Alignment

利用未配对数据和对比对齐进行预训练的舞蹈音乐生成

Ryota Kimura, Sangheon Park, Natalia Polouliakh, Taketo Akama

机构 * Sony Computer Science Laboratories(索尼计算机科学实验室) Keio University(庆应义塾大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.MM

AI总结 针对舞蹈音乐生成中高质量配对数据稀缺问题,提出利用未配对和配对数据的框架,结合预训练单峰编码器、对比预训练及控制网络模块,实验证明该方法提升了舞蹈音乐对齐和音频质量,优于现有技术。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09362 2026-07-13 cs.CV cs.AI 新提交 57%

CtrlVTON: Controllable Virtual Try-On via Visual-Instance-Prompt Segmentation

CtrlVTON:通过视觉实例提示分割实现可控虚拟试穿

Seungyong Lee, Hyun Jun Jang, Sangoh Kim, Sungjoon Park

机构 * NXN Labs(NXN实验室) KAIST(韩国科学技术院)

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 研究旨在解决虚拟试穿中用户对服装穿着方式控制不足的问题。提出通过VIP - SAM解决视觉实例提示分割,引入CtrlVTON可控框架,将试穿转为图像编辑问题并添加分割掩码控制布局。二者在各自任务达先进水平,CtrlVTON能更忠实地遵循用户布局且保证服装逼真度。

Comments 13 + 17 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09024 2026-07-13 cs.CV cs.AI 新提交 57%

Video Generation Models are General-Purpose Vision Learners

视频生成模型是通用视觉学习者

Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu

机构 * Google DeepMind(谷歌DeepMind)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 研究探讨计算机视觉中实现通用模型的催化剂,提出大规模文本到视频生成是预训练范式。介绍GenCeption模型,利用视频生成扩散主干定义感知模型。实验表明该模型在多任务中性能领先,有数据效率优势且具涌现行为,为通用视觉智能提供基础路径。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27071 2026-07-10 cs.CV 新提交 57%

PanoImager: Geometry-Guided Novel View Synthesis and Reconstruction from Sparse Panoramic Views

PanoImager:基于几何引导的稀疏全景视图新视角合成与重建

Zhisong Xu, Takeshi Oishi

机构 * Institute of Industrial Science, The University of Tokyo(东京大学生产技术研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出PanoImager框架,无需SfM,结合前馈位姿/深度先验、几何条件扩散视图补全和深度引导3DGS优化,从稀疏全景图像实现稳定新视角合成与重建。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06871 2026-07-09 cs.CV 新提交 57%

Geometric Collapse: When Vision Models Fail to Verify Physical Causality

几何崩溃:视觉模型何时无法验证物理因果关系

Wentao Zhang, Jinhu Qi, Weiqiang Jin, Yifei Zhang, Chan-Tong Lam, Irwin King

机构 * Faculty of Applied Sciences, Macao Polytechnic University(澳门理工学院应用科学学院) The Chinese University of Hong Kong(香港中文大学) AgentecFusion Limited(AgentecFusion有限公司) School of Information and Communications Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院) School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 研究视觉模型在验证物理因果关系时的问题,提出“Scrambled Edges”方法,通过特定控制分离无支撑边缘证据影响,实验表明该方法使预测偏差增大,几何崩溃全局传播,为改进模型物理合理性提供依据。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06560 2026-07-08 cs.CV 新提交 57%

Vision as Unified Multimodal Generation

视觉作为统一的多模态生成

Xiaoyang Han, Jianhua Li, Kewang Deng, Zukai Chen, Xuanke Shi, Sihan Wang, Boxuan Li, Linyan Wang, Siyi Xie, Xin You, Jinsheng Quan, Zhongang Cai, Haiwen Diao, Ziwei Liu, Lei Yang, Dahua Lin, Quan Wang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 该研究将计算机视觉表述为统一多模态生成,SenseNova-Vision用自然语言指令等指定任务并生成多种输出。通过转换注释形成语料库训练模型,其涵盖多种视觉任务,实验显示统一模型能匹配专用系统,为集成视觉能力到通用模型提供可扩展途径。

Comments 48 pages,22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06555 2026-07-08 cs.CV 新提交 57%

ProxyPose: 6-DoF Pose Tracking via Video-to-Video Translation

ProxyPose:通过视频到视频转换进行六自由度姿态跟踪

Ruihang Zhang, Felix Taubner, Pooja Ravi, Kiriakos N. Kutulakos, David B. Lindell

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 研究旨在解决单目视频中6-DoF姿态跟踪问题,核心方法是将其转化为视频到视频转换,利用视频扩散模型生成代理视频,通过现成求解器恢复姿态。主要贡献是在无额外输入下实现高精度,且可扩展到多种场景。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05787 2026-07-08 cs.CV 新提交 57%

DeSeG: Decoupling Semantic Intent and Geometric Constraints for Physically Plausible Human-Scene Interaction

DeSeG:解耦语义意图和几何约束以实现物理上合理的人机场景交互

Jiakun Li, Zhe Li, Wenqiang Wu, Zheng Chang, Mingqi Gao, Jinyu Yang, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) Spatialtemporal AI(时空人工智能) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) University of Sheffield(谢菲尔德大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对合成物理合理人机场景交互时语义 - 几何纠缠问题,提出DeSeG分层框架,通过残差语义规划器和物理正则化扩散执行器解耦语义意图与几何约束,实验表明该方法性能达最优,有效降低场景穿透率并提高语义对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04311 2026-07-08 cs.CV 新提交 57%

Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment

Aura:通过基于VLM的语义对齐实现一致的多主体视频生成

Zixiang Zhou, Zhentao Yu, Yifeng Ma, Hongmei Wang, Wenqing Yu, Cong Wang, Zilin Yang, Rui Chen, Jiarong Ou, Yezhou Liu, Yuan Zhou, Qinglin Lu

机构 * Tencent Hunyuan(腾讯混元)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出Aura框架用于高保真和身份一致的视频生成,引入AI导演级字幕、利用VLM提取多模态语义特征,设计对齐策略,采用多种机制减少伪影,在多主体视频生成上达先进性能。

Comments Project page: https://aura-project-page.github.io/ Code: https://github.com/Camellia997/Aura

详情

展开后加载摘要…

URL PDF HTML 收藏