SE360: Semantic Edit in 360$^\circ$ Panoramas via Hierarchical Data Construction
SE360:通过分层数据构建实现360度全景图的语义编辑
专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV
AI总结 SE360通过分层数据构建实现360度全景图的语义编辑,提出自主数据生成管道和两阶段数据精修策略,提升编辑质量和语义准确性。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
SE360:通过分层数据构建实现360度全景图的语义编辑
专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV
AI总结 SE360通过分层数据构建实现360度全景图的语义编辑,提出自主数据生成管道和两阶段数据精修策略,提升编辑质量和语义准确性。
CETCAM: 通过一致且可扩展的分词实现相机可控的视频生成
机构 * Georgia Institute of Technology(佐治亚理工学院) ; ByteDance(字节跳动) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV
AI总结 CETCAM通过一致且可扩展的分词方案实现相机可控的视频生成,提高了几何一致性和视觉真实性,同时支持额外的控制模式。
超越语义特征:用于通用AI生成图像检测的像素级映射
专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出通过像素级映射预处理破坏图像语义特征,提升AI生成图像检测器的跨模型泛化能力。
Comments Accepted by AAAI 2026
TextEditBench: 评估超出渲染的推理-aware文本编辑
机构 * Central South University(中南大学) ; Pengcheng Laboratory(鹏城实验室)
专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV
AI总结 TextEditBench 旨在评估文本编辑中超出渲染的推理能力,通过引入语义期望维度,推动多模态生成中的文本引导编辑技术发展。
JoDiffusion: 通过像素级标注联合扩散图像以促进语义分割
专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 JoDiffusion通过联合扩散图像与像素级标注,提升语义分割的性能和可扩展性。
Comments Accepted at AAAI 2026
细粒度模糊模糊控制用于生成图像模型
机构 * University of Michigan(密歇根大学) ; Adobe Research(Adobe研究)
专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出了一种基于EXIF数据的文本到图像扩散模型,通过生成可控的镜头模糊效果,实现细粒度的模糊控制,提升图像生成的可控性与真实性。
Comments Project link: https://www.ayshrv.com/defocus-blur-gen
H2R-Grounder:一种无需配对数据的视频到物理 grounded 机器人视频翻译范式
机构 * Show Lab, National University of Singapore(新加坡国立大学显示实验室)
专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV
AI总结 H2R-Grounder通过无需配对数据的方法,将人类交互视频转换为物理 grounded 的机器人视频,提升机器人学习的现实感和扩展性。
Comments 13 pages, 6 figures
单图像提示下的可控3D物体生成
机构 * College of Computer Science, Kookmin University, Seoul, Korea(计算机科学学院,韩国高丽大学,首尔)
专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出两种方法,通过单图像提示生成可控的3D物体,提升3D一致性并优于现有文本倒置方法。
Journal ref Pattern Recognition. ICPR 2024. Lecture Notes in Computer Science, vol 15306. Springer, Cham. p222-238
CameraMaster: 用于摄影修饰的统一相机语义-参数控制
机构 * Tianjin University(天津大学) ; vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) ; NUS(国立大学)
专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV
AI总结 CameraMaster通过统一相机感知框架实现精确摄影修饰,通过解耦相机指令和参数嵌入,提升多参数控制与语义-参数对齐能力。
无需训练生成多样化且高保真的图像 via 提示语义空间优化
机构 * Queen Mary University of London(伦敦女王学院) ; Centre for AI, AstraZeneca(AstraZeneca人工智能中心) ; University of Bedfordshire(贝德福德大学) ; Samsung AI Center(三星人工智能中心)
专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出TPSO方法,通过优化提示语义空间提升图像生成的多样性和保真度,无需训练且适用于多种模型。
Comments under review
生成合成人类囊胚图像用于体外受精囊胚分级
专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 DIA框架通过生成高保真的合成囊胚图像,解决体外受精中囊胚分级的数据稀缺和类别不平衡问题,提升AI评估工具的性能和标准化。
Comments The manuscript is 23 pages, with five main figures and one table. The supplemental material includes 23 pages with fourteen figures and four tables
机构 * Yale University(耶鲁大学) ; University of Edinburgh(爱丁堡大学)
专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV
机构 * Department of Electronic and Electrical Engineering, Southern University of Science and Technology, Shenzhen, China(南方科技大学电子与电气工程系) ; Department of Automation, Tsinghua University, Beijing, China(清华大学自动化系) ; Jiaxing Research Institute, Southern University of Science and Technology, Jiaxing, China(南方科技大学嘉兴研究所) ; Department of Electrical and Electronic Engineering, the University of Hong Kong, Hong Kong, China(香港大学电子与电气工程系)
专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV
Comments Accepted to TPAMI2025
机构 * Adobe Research(Adobe研究)
专题命中 可控生成 :image generation(abstract);text-to-image(abstract);分类 cs.CV
Comments ACM TOG Dec 2025, Siggraph Asia, Project page: https://katha-ai.github.io/projects/maler/
机构 * Southern University of Science and Technology, Shenzhen, China(南方科技大学)
专题命中 可控生成 :image generation(abstract);text-to-image(abstract);分类 cs.CV
机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) ; School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) ; Engineering Research Center of Machine Learning and Industry Intelligence, Ministry of Education, Chengdu, China(教育部机器学习与工业智能工程研究中心)
专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV
Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (2025) 3330-3339
机构 * KAIST(韩国科学技术院) ; Adobe Research(Adobe研究院) ; Chung-Ang University(Chung-Ang 大学)
专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV
Comments The first two authors contributed equally to this work. The last two authors are co-corresponding authors
专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV
Comments Project's webpage at https://orronai.github.io/FlowOpt/
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Pixocial Technology(Pixocial技术)
专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV
Comments 8 pages, 9 figures
机构 * University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) ; University of Tübingen, Tübingen AI Center, MPI for Informatics, SIC(图宾根大学,图宾根人工智能中心,马克斯·普朗克信息研究所,SIC) ; University of Tübingen(图宾根大学)
专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV
Comments Accepted to ACM SIGGRAPH Asia 2025. Project website: https://yuxuan-xue.com/infini-human
机构 * Boston University(波士顿大学) ; Runway
专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
Comments 23 pages, 18 figures
专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
Comments Tech report
机构 * Computer Science and Engineering(计算机科学与工程)
专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV
Comments PhD Thesis, overlap with arXiv:2507.20855 and arXiv:2501.15878
机构 * Simon Fraser University(西蒙弗雷泽大学)
专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
Comments SIGGRAPH Asia, 2025. Project Page: https://sairajk.github.io/asia/
机构 * Department of Computer Science and Engineering(计算机科学与工程系) ; Korea University(韩国大学) ; Electrical and Computer Engineering(电气与计算机工程系) ; University of Michigan(密歇根大学)
专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
Comments BMVC 2025
机构 * Universiti Malaya(马来大学) ; Zhejiang University of Finance and Economics Dongfang College(浙江财经大学东阳学院) ; Kunming University of Science and Technology(昆明理工大学) ; University of Central Florida(佛罗里达中央大学) ; Toronto metropolitan university(多伦多 Metropolitan 大学) ; Amazon Web Services(亚马逊网络服务) ; Deakin University(德肯大学) ; University of Sheffield(谢菲尔德大学)
专题命中 可控生成 :diffusion(abstract);image synthesis(abstract);分类 cs.CV
机构 * Peking University(北京大学) ; Xiaohongshu Inc(小红书公司)
专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
机构 * Center for Artificial Intelligence in Medicine and Imaging, Stanford University(斯坦福大学人工智能医学与成像中心) ; Department of Radiology, Stanford University(斯坦福大学放射科) ; Department of Applied Physics, Stanford University(斯坦福大学应用物理系) ; Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) ; Institute for Diagnostic and Interventional Radiology, University Hospital Zurich, University of Zurich(苏黎世大学医院诊断与介入放射学研究所) ; LAION ; Juelich Supercomputing Center (JSC), Research Center Juelich (FZJ)(耶鲁超级计算中心(JSC)、耶鲁研究中心(FZJ)) ; Department of Radiology & Imaging Sciences, Emory University(埃默里大学放射科与成像科学系) ; Department of Radiology, University of Florida College of Medicine(佛罗里达大学医学院放射科)
专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
机构 * Ye Tao
专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV
机构 * University of Electronic Science and Technology of China(电子科技大学) ; The Chinese University of Hong Kong(香港中文大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Megvii Technology(商汤科技)
专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV
Comments To appear at the European Conference on Computer Vision (ECCV) 2024