arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-02 至 2026-06-02 共收录 13 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 13 篇

2507.02792 2026-06-02 cs.CV 88%

RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation

RichControl: 面向文本到图像生成的、结构和外观丰富的免训练空间控制

Lexi Pang, Liheng Zhang, Hang Ye, Xiaoxuan Ma, Yizhou Wang

机构 * Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 可控生成 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 提出一种免训练框架,通过解耦条件特征的采样调度与去噪过程,并引入重启细化调度和外观丰富提示策略,在复杂条件下实现结构和外观平衡的受控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00121 2026-06-02 cs.CV cs.AI 86%

Versatile Framework with Semantic and Structural guidance for Image Reconstruction from Brain Activity

基于语义和结构引导的大脑活动图像重建通用框架

Yizhuo Lu, Changde Du, Qiongyi Zhou, Liuyun Jiang, Huiguang He

机构 * State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑启发智能技术国家重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 可控生成 :diffusion(summary_cn,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出MindDiffuser两阶段框架,结合CLIP文本嵌入和视觉特征,通过Stable Diffusion生成语义图像并迭代优化结构信息,在fMRI、EEG、MEG三种模态上显著提升图像重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01608 2026-06-02 cs.CV 57%

Exploiting Semantic and Pixel Representations for Ultra-Low Bitrate Image Compression

利用语义和像素表示进行超低比特率图像压缩

Hao Wei, Yanhui Zhou, Chenyang Ge, Saeed Anwar, Ajmal Mian

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学) School of Information and Telecommunication, Xi’an Jiaotong University(信息与电信学院,西安交通大学) Department of Computer Science and Software Engineering, The University of Western Australia(计算机科学与软件工程系,西澳大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出SPRDiff扩散压缩方法,通过三重编码器架构和失真感知重建模块,在超低比特率下同时保持语义一致性和像素级保真度,实现率-失真-感知权衡最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00954 2026-06-02 cs.CV 57%

COLLAR: Cascaded Object-Level Latent Refinement for High-Fidelity Conditional Generation

COLLAR: 级联对象级潜在精化用于高保真条件生成

Xinlong Zhang, Jia Wei, Xiaoyu Zhang, Teng Zhou, Chengyu Lin, Yongchuan Tang

机构 * College of Computer Science, Zhejiang University(浙江大学计算机科学学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出COLLAR框架,通过视场扩展和级联对象级潜在精化,在扩散Transformer中实现无训练的高保真对象级控制,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25195 2026-06-02 cs.CV 57%

Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation

Baton: 用于联合视频-音频生成的显式语义蓝图

Shuyuan Tu, Qi Tian, Zihan Yang, Yue Wu, Xintong Han, Weijie Kong, Jiangfeng Xiong, Jian-Wei Zhang, Zhao Zhong, Liefeng Bo, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Tencent Hunyuan(腾讯幻元)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出Baton框架,通过VA-Planner生成语义对齐的模态感知规划令牌作为蓝图,注入扩散骨干以协调视频和音频去噪,解决现有方法因缺乏共享长期规划导致的跨模态对齐脆弱问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09877 2026-06-02 cs.CV cs.AI cs.RO 57%

Genie 4D: Semantic-Prior-Guided 4D Dynamic Scene Reconstruction

Genie 4D:语义先验引导的4D动态场景重建

Yiru Yang, Zhuojie Wu, Nishant Kumar Singh, Max Schulthess

机构 * University of Zurich(苏黎世大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出Genie 4D框架,结合实时视觉惯性高斯泼溅前端和前馈4D骨干网络,利用冻结的DINOv3特征作为结构先验抑制身份漂移,并通过条件扩散精炼器恢复高频细节,最终通过轻量级潜在动作头实现用户可控的4D世界模型重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09390 2026-06-02 cs.CV 57%

Training-Free Coverless Multi-Image Steganography with Access Control

免训练的无载体多图像隐写术与访问控制

Minyeol Bae, Si-Hyeon Lee

机构 * Department of Computer Science, Seoul National University(首尔国立大学计算机科学系)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出MIDAS框架,通过潜在级融合实现免训练的多图像隐写与用户特定访问控制,引入随机基机制抑制残差结构信息,并理论分析信息泄露。

Comments Accepted (Poster) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03938 2026-06-02 physics.optics cs.CV cs.NE physics.app-ph 57%

Super-resolution image projection over an extended depth of field using a diffractive decoder

使用衍射解码器实现扩展景深上的超分辨率图像投影

Hanlong Chen, Cagatay Isil, Tianyi Gan, Mona Jarrahi, Aydogan Ozcan

机构 * Electrical and Computer Engineering Department, University of California, Los Angeles, California 90095, USA(加州大学洛杉矶分校电子与计算机工程系) Bioengineering Department, University of California, Los Angeles, California 90095, USA(加州大学洛杉矶分校生物工程系) California NanoSystems Institute (CNSI), University of California, Los Angeles, California 90095, USA(加州大学洛杉矶分校加州纳米系统研究所)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 提出一种混合图像投影系统,结合CNN编码器和全光学衍射解码器,实现扩展景深和像素超分辨率,提升空间带宽积。

Comments 18 Pages, 6 Figures

Journal ref Light: Science & Applications (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01938 2026-06-02 cond-mat.mes-hall quant-ph 50%

Magnetic control of electron scattering in silicene quantum dots

硅烯量子点中电子散射的磁控制

Mohamed El Azar, Elmustapha Feddi, Pablo Díaz, David Laroze, Ahmed Jellal

专题命中 可控生成 :diffusion(abstract)

AI总结 通过外加垂直磁场和硅烯自旋轨道耦合,研究电子在硅烯量子点中的准束缚态形成机制,并证明自旋选择性约束。

Comments 12 pages, 7 figures

Journal ref Annals of Physics 492 (2026) 170543

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01597 2026-06-02 cs.RO cs.MA 50%

Physics-Informed Modeling and Control of Emergent Behaviors in Robot Swarms

机器人群体涌现行为的物理信息建模与控制

Zixuan Jin, Wenzhuo Zhang, Shuxian Quan, Zirui Dong, Fangwen Ye, Yuchen Shi, Cheng Xu

机构 * School of Computer and Communication Engineering, University of Science and Technology Beijing(北京科技大学计算机与通信工程学院) Shunde Innovation School, University of Science and Technology Beijing(北京科技大学顺德创新学院)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出PhySwarm框架,利用多阶段对流-扩散-反应宏观模型和等效确定性运动微观模型,结合神经物理控制器,实现机器人群体多阶段涌现行为的建模与控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01122 2026-06-02 cs.LG q-fin.CP 50%

A Per-Component Diagnostic Protocol for Neural HJB-PIDE Solvers under Control-Dependent Lévy Jumps

控制依赖 Lévy 跳跃的神经 HJB-PIDE 求解器的逐分量诊断协议

R. Drissi

专题命中 可控生成 :diffusion(abstract)

AI总结 提出一个五步诊断协议,用于检测残差训练的神经 HJB-PIDE 求解器在控制依赖 Lévy 跳跃下的算子计算错误,并通过 CRRA-Merton-Variance-Gamma 基准案例验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00960 2026-06-02 quant-ph 50%

Palindromic structure of depth-efficient quantum search algorithms

深度高效的量子搜索算法的回文结构

Kun Zhang, Hai-Long Shi, Xiao-Hui Wang, Vladimir Korepin

专题命中 可控生成 :diffusion(abstract)

AI总结 通过将非结构化量子搜索建模为电路深度优化问题,发现回文结构可对称替换Grover扩散层,实现深度高效振幅放大,并导出最小期望深度的解析表达式,对X型混频器、局部扩散算子和嵌套局部扩散算子应用后,总电路深度减少约40%。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30895 2026-06-02 cs.CE 50%

CamGeo: Sparse Camera-Conditioned Image-to-Video Generation with 3D Geometry Priors

CamGeo: 基于稀疏相机条件的图像到视频生成与3D几何先验

Xuanyi Liu, Deyi Ji, Liqun Liu, Lanyun Zhu, Xuhang Chen, Qianxiong Xu, Peng Shu, Huan Yu, Jie Jiang, Feng Gao, Siwei Ma

专题命中 可控生成 :diffusion(abstract)

AI总结 提出CamGeo框架,通过从预训练视频到3D模型蒸馏3D几何知识,结合关键帧轨迹蒸馏、跨帧一致性蒸馏和三阶段课程学习,解决稀疏相机条件下图像到视频生成中的姿态漂移和运动不连续问题。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏