arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-30 至 2026-06-30 共收录 14 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 14 篇

2606.29282 2026-06-30 cs.CV 79%

ScaleErasure: Inference-Time Minimal Intervention for Precise Concept Erasure in Next-Scale Autoregressive Image Generation

ScaleErasure:下一尺度自回归图像生成中精确概念擦除的推理时最小干预

Cong Wang, Haiyu Wu, Zhiwei Jiang, Zifeng Cheng, Fei Shen, Yafeng Yin, Qing Gu

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 提出ScaleErasure方法,通过推理时对与不安全概念最相关的logits进行选择和引导,在下一尺度自回归图像生成中实现精确概念擦除,同时保持生成能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29924 2026-06-30 cs.CV 57%

DCGrasp: Distance-aware Controllable Grasp Generation

DCGrasp: 距离感知的可控抓取生成

Hiroyasu Akada, Jesús Pérez, Emre Aksan, Vasileios Choutas, Cristian Romero, Alberto Garcia-Garcia, Vladislav Golyanik, Christian Theobalt, Thabo Beeler

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出DCGrasp系统,利用距离感知抓取能量项生成高质量、物理合理的3D手-物交互,支持灵活用户控制并泛化到多样物体和手形。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29807 2026-06-30 cs.CR cs.CV 57%

Rethinking Forgery Attacks on Semantic Watermarks in Black-Box Settings: A Geometric Distortion Perspective

重新思考黑盒设置下语义水印的伪造攻击:一种几何畸变视角

Cheng-Yi Lee, Yichi Zhang, Yuchen Yang, Chun-Shien Lu, Jun-Cheng Chen

机构 * Academia Sinica(中国台湾“学术院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文从率-畸变理论出发,揭示代理模型与目标模型间的结构失配导致不可约畸变,并将其建模为潜在流形上的全局漂移和局部变形,进而提出一种方案无关的检测方法以区分伪造样本。

Comments Accepted at ICML 2026, updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19679 2026-06-30 cs.CV 57%

MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation

MMControl: 多模态控制用于联合音频视频生成

Liyang Li, Wen Wang, Canyu Zhao, Tianjian Feng, Zhiyue Zhao, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出MMControl,通过双流条件注入机制实现联合音频视频生成的多模态控制,支持视觉和听觉信号的精细控制,提升跨模态对齐效果。

Comments Accepted to ECCV 2026. Project page: https://aim-uofa.github.io/MMControl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07753 2026-06-30 cs.CV cs.CL cs.LG 57%

Symbiotic-MoE: Unlocking the Synergy between Generation and Understanding

共生MoE:解构生成与理解之间的协同效应

Xiangyue Liu, Zijian Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Ping Tan

机构 * HKUST(香港科技大学) Tencent Hunyuan(腾讯混元)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出Symbiotic-MoE框架,通过模态感知专家解缠绕和渐进训练策略,解决生成与理解任务间的冲突,提升多模态协同能力,在MMLU和OCRBench上取得显著提升。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02714 2026-06-30 cs.CV 57%

ExploreVLA: Dense World Modeling and Exploration for End-to-End Autonomous Driving

ExploreVLA: 为端到端自动驾驶的密集世界建模与探索

Zihao Sheng, Xin Ye, Jingru Luo, Sikai Chen, Liu Ren

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出基于世界建模的统一理解与生成框架,通过密集监督和内在奖励提升自动驾驶策略探索能力,在NAVSIM和nuScenes基准上取得优异性能。

Comments Accepted to ECCV 2026. The code is available at https://zihaosheng.github.io/ExploreVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22960 2026-06-30 cs.CV 57%

UCM: Unified Modeling of Camera Control and Memory with Time-aware Positional Encoding Warping for World Models

UCM:基于时间感知位置编码变形的相机控制与内存统一建模

Tianxing Xu, Zixuan Wang, Guangyuan Wang, Li Hu, Zhongyi Zhang, Peng Zhang, Bang Zhang, Songhai Zhang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 UCM通过时间感知位置编码变形机制实现相机控制与长期记忆的统一建模,在真实和合成基准测试中显著提升场景一致性并实现高保真视频生成的精确控制。

Comments Project Page: https://humanaigc.github.io/ucm-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06344 2026-06-30 cs.CV 57%

SDGIC: A Semantic Disambiguation-Guided Generative Image Compression Method for Ultra-Low Bitrates

SDGIC: 一种基于语义消歧的生成图像压缩方法,用于超低比特率

Kaile Wang, Lijun He, Haisheng Fu, Haixia Bi, Fan Li

机构 * School of Information and Communications Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院) Department of Electrical and Computer Engineering, Faculty of Applied Science, The University of British Columbia(不列颠哥伦比亚大学应用科学学院电气与计算机工程系)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SDGIC框架,通过三种互补的指导流约束扩散重建,提升超低比特率下的语义一致性与感知质量,减少23.4%的AFINE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30320 2026-06-30 math.OC 50%

Continuous-Time Information Design for Hurricane Evacuation: Disclosure, Congestion, and Optimal Phasing under Model Uncertainty

飓风疏散的连续时间信息设计:模型不确定性下的信息披露、拥堵与最优分阶段策略

Furkan Sezer

专题命中 可控生成 :diffusion(abstract)

AI总结 研究应急管理机构通过信息精度和分阶段疏散调度引导战略疏散区的连续时间信息设计,证明分阶段疏散优于同步建议,且信息精度存在符号模糊性(信息Braess效应),校准至丽塔飓风数据可减少89%的社会成本。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30106 2026-06-30 math.AP 50%

Uniqueness and non-uniquess for the mean field control of fisheries

渔业均值场控制的唯一性与非唯一性

Greta Lamonaca, Idriss Mazari, Grégoire Nadin

专题命中 可控生成 :diffusion(abstract)

AI总结 研究渔业管理中均值场控制系统的解的非唯一性问题,通过分支理论证明多解存在,并给出改进的唯一性判据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29474 2026-06-30 math.OC cs.AI cs.NA math.NA 50%

A Posteriori Error Analysis for Decoupled Neural Approximations of Fully Coupled FBSDEs with Control Mismatch

完全耦合FBSDE解耦神经逼近的后验误差分析与控制失配

Xichuan Zhang

机构 * Intelligent Game and Decision Lab(智能游戏与决策实验室)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出完全耦合正倒向随机微分方程解耦神经逼近的后验误差分析框架,通过引入辅助控制处理控制失配,导出可计算的后验误差界,数值实验验证了指标的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28886 2026-06-30 math.OC 50%

Optimal control of diffusive mean-field models for swarming particles on the sphere

球面上群集粒子的扩散平均场模型的最优控制

Jinwook Jung, Dohyun Kim

专题命中 可控生成 :diffusion(abstract)

AI总结 针对球面上带扩散的Kuramoto型一致性动力学,研究平均场最优控制问题,控制通过漂移场和相互作用增益实现,证明了微观最优控制收敛到平均场最优控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28351 2026-06-30 cs.IR 50%

HyperSU: Corpus-Driven Semantic-Unit Hypergraph for Retrieval-Augmented Generation

HyperSU:面向检索增强生成的语料驱动语义单元超图

Jiate Liu, Liuyi Chen, Zhengyi Yang, Chuan He, Mingchen Ju, Bocheng Han, Ruyi Liu, Xu Zhou

专题命中 可控生成 :diffusion(abstract)

AI总结 提出HyperSU框架,通过语义单元超图和线索引导的双向检索,解决超图RAG中的幻觉、高索引成本和语义漂移问题,在GraphRAG-Bench上准确率提升14.7%。

Comments 24 pages, 6 figures, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07744 2026-06-30 cs.RO 50%

AeroPlace-Flow: Language-Grounded Object Placement for Aerial Manipulators via Visual Foresight and Object Flow

AeroPlace-Flow:基于视觉前瞻和物体流的语言引导空中机械臂物体放置

Sarthak Mishra, Rishabh Dev Yadav, Naveen Nair, Wei Pan, Spandan Roy

机构 * Robotics Research Center, IIIT Hyderabad, India(印度IIIT海得拉巴机器人研究中心) Department of Computer Science, University of Manchester, UK(英国曼彻斯特大学计算机科学系) Newcastle University, UK(英国新castle大学)

专题命中 可控生成 :image editing(abstract)

AI总结 本文提出AeroPlace-Flow框架,通过视觉前瞻和3D几何推理实现语言引导的空中物体放置,无需预设姿态或任务特定训练,在多样化的空中场景中实现75%的平均成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏