arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-03 至 2026-08-03 共收录 72 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 6 篇

2605.19350 2026-08-03 cs.GR cs.LG 版本更新 57%

CompoSE: Compositional Synthesis and Editing of 3D Shapes via Part-Aware Control

CompoSE:通过部分感知控制进行3D形状的组合合成与编辑

Habib Slim, Shariq Farooq Bhat, Mohamed Elhoseiny, Yifan Wang, Mike Roberts

机构 * King Abdullah University of Science and Technology (KAUST)(卡布斯大学) Adobe Research(Adobe研究)

专题命中 可控生成 :diffusion(abstract);分类 cs.GR

AI总结 本文提出CompoSE方法,通过部分感知控制实现3D形状的组合合成与编辑,核心方法是使用扩散变压器架构在局部和全局之间交替处理部分,并通过新颖的条件技术确保对用户输入的强遵循,主要贡献是无需部分级文本提示即可直接从用户粗略布局指导中学习部分语义和对称性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02330 2026-08-03 cs.CV cs.AI cs.LG 版本更新 57%

ActionParty: Multi-Subject Action Binding in Generative Video Games

ActionParty:生成视频游戏中的多主体动作绑定

Alexander Pondaven, Ziyi Wu, Igor Gilitschenski, Philip Torr, Sergey Tulyakov, Fabio Pizzati, Aliaksandr Siarohin

机构 * Snap Research(Snap研究院) University of Oxford(牛津大学) University of Toronto(多伦多大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出ActionParty,一种可控制多主体的生成视频游戏世界模型,通过引入主体状态标记和空间偏置机制,提升动作关联准确性与身份一致性。

Comments ECCV 2026 - Project page: https://action-party.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29563 2026-08-03 math.OC cs.SY eess.SY 新提交 50%

Node-Wise Dynamic Optimal Control for Evolutionary Games on General Multilayer Networks

通用多层网络上演化博弈的节点级动态最优控制

Rio Aurachman, Giuliano Punzo

专题命中 可控生成 :diffusion(abstract)

AI总结 针对通用多层网络中演化博弈的最优控制问题,通过求解哈密尔顿-雅可比-贝尔曼方程得到节点级动态最优激励的解析解,经数值验证后与现有文献结果对比,为促进种群合作提供了新方案。

Comments 17 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11885 2026-08-03 cs.RO 版本更新 50%

Choose What to Manipulate: Revealing Data Scaling Laws in Bounding-Box Guided Policies for Semantic Manipulation

学习操控一切:揭示在边界框引导策略中的数据扩展定律

Yihao Wu, Jinming Ma, Junbo Tan, Yanzhao Yu, Shoujie Li, Mingliang Zhou, Diyun Xiang, Xueqian Wang

机构 * Center for Intelligent Control and Telescience, Tsinghua Shenzhen International Graduate School(智能控制与遥科学中心,清华大学深圳国际研究生院) Beijing Xiaomi Robot Technology Co., Ltd(北京小米机器人科技有限公司)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出利用边界框指令提升语义操控的泛化能力,并揭示数据扩展定律,通过高效数据收集和解耦框架实现85%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04521 2026-08-03 math.OC cs.LG q-fin.CP 版本更新 50%

Unified continuous-time q-learning for mean-field game and mean-field control problems

面向平均场博弈与平均场控制问题的统一连续时间Q学习方法

Xiaoli Wei, Xiang Yu, Fengyi Yuan

专题命中 可控生成 :diffusion(abstract)

AI总结 本文针对环境模拟器无法直接获取群体分布的场景,提出解耦Iq函数,设计统一参数化Q学习算法,验证其在MFG与MFC学习任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 1 篇

2607.29133 2026-08-03 cs.GR 新提交 83%

Interactive Generative Motion Editing via Scheduled Inpainting

基于调度补全的交互式生成运动编辑

Dhruv Agrawal, Dominik Borer, Luca Vögeli, Robert Sumner, Martin Guay, Jakob Buhmann

专题命中 图像修复 :inpainting(title,abstract);分类 cs.GR

AI总结 本研究提出调度补全方法,实现交互式生成运动编辑,结合运动合成与编辑,可优化现有动画并支持多类编辑应用,经多组实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 1 篇

2607.26976 2026-08-03 cs.CR cs.CV 版本更新 57%

InkShield: Writing Style Protection Against Unauthorized Handwriting Mimicry

InkShield:抵御未授权笔迹模仿的书写风格保护

Jian Xiong, Wenbo Jiang, Zihan Wang, Rui Zhang, Wenshu Fan, Hongwei Li, Guowen Xu

专题命中 个性化与一致性 :image editing(abstract);分类 cs.CV

AI总结 InkShield是一种主动书写风格防御方案,通过限制扰动在墨迹笔画边缘保护手写参考图像,可降低未授权笔迹模仿的检索率,且视觉质量与可读性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 1 篇

2607.29679 2026-08-03 cs.CV 新提交 57%

Scaling Properties of Text Conditioning in Visual Generation

视觉生成中文本条件的缩放特性

Zilong Chen, Chaorui Deng, Kunchang Li, Hongyi Yuan, Haoqi Fan

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 该研究探究视觉生成中文本条件的缩放特性,采用GPG、ED量化结构化语言,据此构建结构化提示并训练提示生成器,所得系统在多基准上超越多数开放权重模型、匹配或超越最强封闭权重模型。

Comments Code: https://github.com/heheyas/context-scaling Models: https://huggingface.co/collections/heheyas/context-scaling Demo: https://heheyas-context-scaling.hf.space/ Project page: https://heheyas.github.io/context-scaling

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 3 篇

2602.03811 2026-08-03 cs.CV 版本更新 79%

Progressive Checkerboards for Autoregressive Multiscale Image Generation

渐进棋盘用于自回归多尺度图像生成

David Eigen

专题命中 效率与蒸馏 :image generation(title,abstract);分类 cs.CV

AI总结 本研究提出了一种基于渐进棋盘的多尺度自回归图像生成方法,通过并行采样和保持平衡结构,实现高效且有效的条件建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25318 2026-08-03 cs.CV 版本更新 57%

Dataset Distillation Based on Saliency-Driven Prototype Alignment

超越背景偏差:用于数据集蒸馏的显著性驱动原型对齐

Yawen Zou, Wenqi Cai, Guang Li, Ling Xiao, Chunzhi Gu, Chao Zhang

机构 * University of Toyama(富山大学) Hokkaido University(北海道大学) University of Fukui(福井大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对数据集蒸馏中基于扩散方法的局限性,提出显著性驱动蒸馏框架,通过两步构建类判别潜在原型,增强代表性与泛化能力,实验证明其性能优于强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29470 2026-08-03 math.NA cs.NA 新提交 50%

iSMART: An Iterative Sampling-and-Regression Technique for Solving Martingale-Based PDEs

iSMART:一种求解基于鞅的偏微分方程的迭代采样-回归技术

Tiejun Li, Xiaoguang Li, Fugui Ma

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 研究针对高维基于鞅的PDE,提出iSMART迭代采样-回归技术,通过停止梯度等方法规避对抗优化,引入冻结-补偿技术优化HJB方程收敛性,经多类高维数值实验验证其准确性、效率与鲁棒性。

Comments 32 pages, 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他图像生成 1 篇

2607.28974 2026-08-03 cs.CV cs.AI 新提交 57%

RAID: Towards Robust AI-Generated Image Detection with Bit-Reversed Images

RAID:利用位反转图像实现鲁棒的AI生成图像检测

Renxi Cheng, Jie Gui, Hongsong Wang

机构 * School of Cyber Science and Engineering, Southeast University(东南大学网络空间科学与工程学院) Purple Mountain Laboratories(紫金山实验室) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 本研究提出RAID方法,通过位反转图像构建、梯度块选择与卷积分类器实现AI生成图像检测,在40多个基准上优于现有方法且速度快约100倍,还提供了理论分析与新数据集。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏