arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-18 至 2026-08-18 共收录 15 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 15 篇

2608.15705 2026-08-18 cs.CV 新提交 88%

PixelControl: Fine-Grained Condition Fidelity in Text-to-Image Diffusion

PixelControl:文本到图像扩散中的细粒度条件保真度

Xin Lin, Haodong Li, Zhifei Zhang, Yutong Yang, Haitian Zheng, Juanxi Tian, Zhe Lin, Truong Nguyen

机构 * Adobe Research(奥多比研究院) Nanyang Technological University(南洋理工大学) University of California San Diego(加州大学圣迭戈分校)

专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 针对可控文本到图像扩散模型细粒度结构保真度不足的问题,提出PixelControl框架,通过结构感知控制注入与多尺度金字塔循环损失等设计,提升了边界及中/小区域的结构保真度。

Comments The project homepage can be found: this https URL (https://linxin0.github.io/pixelcontrol_homepage/pixelcontrol-site/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15583 2026-08-18 cs.CV 新提交 85%

PoseAdapter: Dual-Stream 2.5D Controllable Image Generation for Complex Multi-Object Scenes

PoseAdapter:面向复杂多目标场景的双流2.5D可控图像生成

Yufeng Chi, Huimin Ma, Fan Gao, Zhice Niu, Keqin Li, Jianmin Li

机构 * Tsinghua University(清华大学) National University of Defense Technology(国防科技大学)

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 PoseAdapter是一种轻量2.5D可控图像生成框架,通过双流表示解决多目标场景属性泄漏问题,构建OrientLayout数据集,在空间精度等指标上优于现有最优方法。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15694 2026-08-18 cs.CV cs.AI 新提交 79%

RRFC: Recursive Refinement via Feedback Conditioning for Iterative Image-to-Image Generation

RRFC:基于反馈条件的递归精修用于迭代式图像到图像生成

Kareem Hassani, Chaymaa Abbas, Hadi Al Mubasher, Mariette Awad

专题命中 可控生成 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 该研究提出RRFC框架,通过反馈条件实现迭代式图像到图像生成的输出精修,在多类模型和任务上评估发现其增益集中于目标属性重叠的任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23924 2026-08-18 cs.CV 版本更新 79%

DepthArb: Training-Free Depth-Arbitrated Generation for Occlusion-Robust Image Synthesis

DepthArb: 无训练深度仲裁生成用于遮挡鲁棒图像合成

Hongjin Niu, Jiahao Wang, Xirui Hu, Weizhan Zhang, Lan Ma, Yuan Gao, Feng Lei

机构 * School of Computer Science and Technology(计算机科学与技术学院) China Telecom(中国电信)

专题命中 可控生成 :image synthesis(title);text-to-image(abstract);分类 cs.CV

AI总结 本文提出DepthArb,通过仲裁交互对象的注意力竞争解决遮挡歧义,采用注意力仲裁调制和空间紧凑性控制机制,无需重新训练即可提升遮挡生成的准确性和视觉保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16100 2026-08-18 cs.CV cs.NI 新提交 70%

TISC: A Text-Driven Image Semantic Communication System for Faithful Reconstruction

TISC:用于忠实重建的文本驱动图像语义通信系统

Feifan Zhang, Yuyang Du, Xiaoyan Liu, Soung Chang Liew

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出文本驱动图像语义通信框架TISC,通过树结构属性语义提取(TSASE)和初始噪声优化(INO)机制解决现有方法的语义损失与重建忠实度不足问题,经多数据集实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16863 2026-08-18 cs.CV 新提交 57%

SplatGuide: Geometric Priors from 3D Gaussians for Pose-Free Novel View Synthesis

SplatGuide:用于无姿态新视图合成的3D高斯几何先验

Yejun Zhang, Zihan Wang, Xu Ji, Yihao Wang, Yuxin Hou, Junyuan Fang, Juho-Matti Kilpeläinen, Arno Solin, Hamed Rezazadegan Tavakoli, Esa Rahtu, Juho Kannala

机构 * Aalto University(阿尔托大学) Deep Render(深度渲染公司) ELLIS Institute Finland(芬兰ELLIS研究所) Nokia Technologies(诺基亚技术公司) Tampere University(坦佩雷大学) University of Oulu(奥卢大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SplatGuide复用单个3DGS场景生成三种互补信号,实现无姿态新视图合成,在多个基准数据集上达到SOTA,在RealEstate10K上超越真实姿态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16220 2026-08-18 cs.SD cs.CV 新提交 57%

SingDance: Compositional Zero-Shot Singing-and-Dancing Video Generation with Role-Aware Audio Conditioning

SingDance:基于角色感知音频条件的组合式零样本歌舞视频生成

Tao Feng, Xu Li, Xiangyang Luo, Ming Wen, Huadai Liu, Chen Zhang, Wei Xue

机构 * Kuaishou Technology(快手科技)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SingDance是统一视频扩散框架,将语音表达设为语义角色,通过硬紧凑路由等技术实现组合式零样本歌舞视频生成,参数少且性能具竞争力。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16008 2026-08-18 cs.CV 新提交 57%

Spatial Temporal Synergy: Balancing Change and Invariance in Text Driven 3D Human Motion Editing

时空协同:文本驱动的三维人体动作编辑中变化与不变性的平衡

Shaohui Lin, Zhenwu Shi, Jingyu Gong, Jiao Xie, Yu Zhou, Baochang Zhang, Lizhuang Ma, Chia-Wen Lin

机构 * East China Normal University(华东师范大学) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) School of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海教育人工智能研究院) School of Statistics, East China Normal University(华东师范大学统计学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对文本驱动3D人体动作编辑中变化与不变性难以平衡的问题,提出CIME框架,通过空间姿态和时间节奏维度的解耦实现最优性能,相关成果已开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15749 2026-08-18 cs.CV 新提交 57%

ES3D: Embedding Semantics into 3D Space for Component-Aware Editing

ES3D:将语义嵌入3D空间以实现组件感知编辑

Xuancheng Jin, Rengan Xie, Jiayuan Lu, Wenting Zheng, Rui Wang, Yuchi Huo, Lincheng Li, Yingfeng Chen

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 ES3D是将语义嵌入3D空间的框架,通过多视图语义特征构建3D语义嵌入,实现组件感知的3D资产检索与编辑,可生成几何一致、语义连贯的编辑结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15163 2026-08-18 cs.CV cs.HC 新提交 57%

From "What-If" to "What-Is": Counterfactual Thinking-Inspired Semantic Alignment for Visual Brain Decoding

从“假设”到“事实”:面向视觉脑解码的反事实思维启发语义对齐

Kaitao Yan, Chi Liu, Congcong Zhu, Huajie Chen, Gengshen Wu, Minghao Wang, Xiaotong Han, Tianqing Zhu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出ConceptAlign框架,通过反事实语义对齐解决视觉脑解码的语义错误问题,在自然场景数据集上相比MindEye2提升了重构、语义区分等指标。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01503 2026-08-18 cs.CV 版本更新 57%

Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task

通过深度排序任务解构视觉语言模型中的图像线索理解与语言偏差

Yiqian Liu, Iuliia Kotseruba, John K. Tsotsos

机构 * York University(约克大学) University of Guelph(圭尔夫大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 提出深度排序与异常检测任务,结合控制图像线索和语言表达,量化视觉语言模型的深度感知能力,发现模型对深度线索利用不足且存在语言偏差。

Comments 15 pages, 7 figures, accepted to ECCV 2026 (30 pages, 13 figures, supplementary materials included)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23649 2026-08-18 cs.RO cs.CV 版本更新 57%

RoboMirror: Understand Before You Imitate for Video to Humanoid Locomotion

RoboMirror: 在模仿之前理解以实现视频到仿人运动

Zhe Li, Boan Zhu, Yangyang Wei, Shuanghao Bai, Yuheng Ji, Yibo Peng, Tao Huang, Pengwei Wang, Zhongyuan Wang, S.-H. Gary Chan, Chang Xu, Cheng Chi, Jianfei Yang, Shanghang Zhang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 RoboMirror通过视觉语言模型将视频提炼为视觉运动意图,直接生成物理合理的仿人运动,无需姿态重建,实现远程存在并提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16153 2026-08-18 cs.RO 新提交 50%

Unified Condition-Action Modeling for Accurate One-Step Action Generation

用于精准单步动作生成的统一条件-动作建模

Xinyu Zhou, Zikun Cai, Kuangji Zuo, Gen Li, Boyu Ma, Yanshuo Lu, Yutong Song, Mingqi Yuan, Jiayu Chen, Jianfei Yang

机构 * NTU(南洋理工大学) HKU(香港大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 该研究提出UCA-Flow统一条件-动作建模框架,通过共享令牌空间与改进双路监督方案,提升机器人单步动作生成的成功率与推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30006 2026-08-18 physics.flu-dyn 版本更新 50%

Exact analytical solutions for the piston effect in supercritical fluids under post-acoustic approximation -- Short-time asymptotics, thermal penetration depth and comparison with the Spacelab D-2 experiments

超临界流体中活塞效应的精确解析解:声学近似后的短时渐近、热穿透深度及与Spacelab D-2实验的比较

Mátyás Szücs

专题命中 可控生成 :diffusion(abstract)

AI总结 针对超临界流体中的活塞效应,在线性后声学近似下推导了直角和球坐标中一维问题的精确解析解,分析了短时渐近和热穿透深度,并通过考虑容器热容与Spacelab D-2实验数据良好吻合。

Comments 33 pages, 12 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15173 2026-08-18 math.OC q-fin.MF 版本更新 50%

Equilibrium stochastic control with implicitly defined objective functions

具有隐式定义目标函数的均衡随机控制问题

Zongxia Liang, Jianming Xia, Keyu Zhang

专题命中 可控生成 :diffusion(abstract)

AI总结 本文针对含隐式目标函数的时间不一致随机控制问题,在受控扩散框架中推导均衡策略的充要条件,并将其应用于两类带约束的动态投资组合选择问题,明确了确定市场系数下的均衡策略形式。

Comments To appear in SCIENTIA SINICA Mathematica

详情

展开后加载摘要…

URL PDF HTML 收藏