arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-08 至 2026-05-08 共收录 9 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 9 篇

2505.18875 2026-05-08 cs.CV 70%

Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation

稀疏视频生成2:通过语义感知排列加速视频生成

Shuo Yang, Haocheng Xi, Yilong Zhao, Muyang Li, Jintao Zhang, Han Cai, Yujun Lin, Xiuyu Li, Chenfeng Xu, Jianfei Chen, Song Han, Kurt Keutzer, Ion Stoica

机构 * University of California, Berkeley(加州大学伯克利分校) MIT(麻省理工学院) NVIDIA(英伟达) Stanford University(斯坦福大学)

专题命中 可控生成 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出SVG2框架,通过语义感知排列提升视频生成的准确性和效率,实现生成质量与效率的帕累托最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16472 2026-05-08 cs.CR eess.SP 67%

Secure Intellicise Wireless Network: Agentic AI for Coverless Semantic Steganography Communication

安全智能无线网络:面向无载体语义隐写通信的智能体AI

Rui Meng, Song Gao, Bingxuan Xu, Xiaodong Xu, Jianqiao Chen, Nan Ma, Pei Xiao, Ping Zhang, Rahim Tafazolli

专题命中 可控生成 :image generation(abstract);diffusion(abstract)

AI总结 本文提出基于智能体AI的无载体语义隐写通信方案,通过消除载体图像和私有语义密钥的需求,提升隐写容量与传输安全。

Comments 16 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06667 2026-05-08 cs.CV cs.AI cs.LG 57%

ActCam: Zero-Shot Joint Camera and 3D Motion Control for Video Generation

ActCam: 零样本联合摄像机和3D运动控制用于视频生成

Omar El Khalifi, Thomas Rossi, Oscar Fossey, Thibault Fouque, Ulysse Mizrahi, Philip Torr, Ivan Laptev, Fabio Pizzati, Baptiste Bellot-Gurlet

机构 * University of Oxford(牛津大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ActCam通过零样本方法实现视频生成中演员动作与摄像机轨迹的联合控制,通过几何一致的条件生成提升摄像机适应性和动作真实性。

Comments SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05377 2026-05-08 cs.CV 57%

Can Vision-Language Models Think from the Sky? Unifying UAV Reasoning and Generation

无人机视角下视觉语言模型能否思考?统一无人机推理与生成

Jintao Sun, Gangyi Ding, Donglin Di, Hu Zhang, Zhedong Zheng

机构 * Beijing Institute of Technology(北京理工大学) Harbin Institute of Technology(哈尔滨工业大学) CSIRO Data61(澳大利亚联邦科学与工业研究组织 Data61 分部) University of Macau(澳门大学)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出UAVReason数据集,用于研究无人机视角下的统一推理与生成,通过改进模型在高海拔场景下的表现,提升视觉语言模型在复杂环境中的能力。

Comments 21 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05781 2026-05-08 cs.CV cs.AI 57%

Steering Visual Generation in Unified Multimodal Models with Understanding Supervision

通过理解监督引导统一多模态模型的视觉生成

Zeyu Liu, Zanlin Ni, Yang Yue, Cheng Da, Huan Yang, Di Zhang, Kun Gai, Gao Huang

机构 * Tsinghua University(清华大学) Kolors Team, Kuaishou Technology(快手技术团队)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出UNO框架,通过将理解作为监督信号引导生成,提升多模态模型在图像生成与编辑中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05722 2026-05-08 cs.CV 57%

$\mathcal{B}^{3}$-Net: Controlled Posterior Bridge Learning for Multi-Task Dense Prediction

$\mathcal{B}^{3}$-Net:多任务密集预测中的受控后验桥学习

Meihua Zhou, Li Yang

机构 * Wannan Medical University(皖南医学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出$\mathcal{B}^{3}$-Net,通过可靠性估计、后验桥构建和受限再分配机制,改进多任务密集预测中任务证据的显式建模,提升共享表征的可靠性。

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14209 2026-05-08 cs.CV cs.AI 57%

ChArtist: Generating Pictorial Charts with Unified Spatial and Subject Control

ChArtist:通过统一的空间和主题控制生成图像图表

Shishi Xiao, Tongyu Zhou, David Laidlaw, Gromit Yeuk-Yin Chan

机构 * Adobe Research(Adobe研究院) Brown University(布朗大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ChArtist通过统一的空间和主题控制生成图像图表,结合骨骼基空间控制和主题驱动控制,提升数据准确性与视觉美感。

Comments Project page: https://chartist-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06407 2026-05-08 eess.AS cs.AI cs.CL 50%

WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling

WavCube:通过语义-声音联合建模统一语音表示以实现理解和生成

Guanrou Yang, Tian Tan, Qian Chen, Zhikang Niu, Yakun Song, Ziyang Ma, Yushen Chen, Zeyu Xie, Tianrui Wang, Yifan Yang, Wenxi Chen, Qi Chen, Wenrui Liu, Shan Yang, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Tencent(腾讯) Independent Researcher(独立研究员) Peking University(北京大学) Tianjin University(天津大学) Zhejiang University(浙江大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 WavCube通过语义-声音联合建模统一语音表示,解决语音理解和生成的表示兼容问题,实现压缩后的高性能语音任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05667 2026-05-08 cond-mat.mtrl-sci physics.app-ph 50%

Si/SiGe multi-channel superlattice structure epitaxial growth with segmented temperature control for Next-Generation Logic Devices

Si/SiGe多通道超晶格结构分子束外延生长与分段温度控制用于下一代逻辑器件

Wenlong Yao, Zhigang Li, Guobin Bai, Jianfeng Gao, Jiahan Yu, Junfeng Li, Xiaolei Wang, Jun Luo

专题命中 可控生成 :diffusion(abstract)

AI总结 本文通过分段温度控制实现Si/SiGe多通道超晶格生长,抑制Ge-Si扩散和应变松弛,提升界面质量与材料性能,为2nm以下逻辑器件提供高质量基础材料。

详情

展开后加载摘要…

URL PDF HTML 收藏