arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-07 至 2026-04-07 共收录 111 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 9 篇

2406.16042 2026-04-07 cs.CV 79%

Pose-dIVE: Pose-Diversified Augmentation with Diffusion Model for Person Re-Identification

姿态多样化扩散模型:用于人体重识别的姿态多样化增强

Inès Hyeonsu Kim, Woojeong Jin, Soowon Son, Junyoung Seo, Seokju Cho, JeongYeol Baek, Byeongwon Lee, JoungBin Lee, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能学院) SK Telecom(SK电讯)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Pose-dIVE,通过扩散模型结合姿态和视角信息,增强重识别模型对姿态和视角变化的鲁棒性,提升模型泛化能力。

Comments CVPR 2026 Findings, Project page: https://cvlab-kaist.github.io/Pose-dIVE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04057 2026-04-07 cs.IT math.IT 78%

CTD-Diff: Cooperative Time-Division Diffusion for Multi-User Semantic Communication Systems

CTD-Diff: 多用户语义通信系统中的协作时分扩散

Chengyang Liang, Dong Li

专题命中 可控生成 :diffusion(title,abstract)

AI总结 本文提出CTD-Diff框架,通过时分多址技术实现多用户协作,将物理信道噪声转化为扩散噪声,提升低信噪比下的语义通信可靠性与重建精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04406 2026-04-07 cs.CV 57%

3D-Fixer: Coarse-to-Fine In-place Completion for 3D Scenes from a Single Image

3D-Fixer:从单张图像生成3D场景的粗到细就地补全

Ze-Xin Yin, Liu Liu, Xinjie Wang, Wei Sui, Zhizhong Su, Jian Yang, Jin Xie

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Horizon Robotics(地平线机器人) D-Robotics

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出3D-Fixer,通过粗到细的生成方案解决单张图像生成3D场景的布局和3D资产恢复问题,结合双分支条件网络和Occlusion-Robust Feature Alignment策略,提升生成精度和效率,同时引入ARSG-110K数据集提升训练效果。

Comments 17 pages, 10 figures, CVPR 2026, project page: https://zx-yin.github.io/3dfixer

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01554 2026-04-07 cs.LG cs.AI cs.CV 57%

InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs

InfoTok: 基于信息理论的容量受限共享视觉标记化在统一多模态大语言模型中的应用

Lv Tang, Tianyi Zheng, Bo Li, Xingyu Li

机构 * University of Alberta(阿尔伯塔大学) vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出InfoTok,一种基于信息瓶颈原理的信息正则化标记化机制,通过互信息约束平衡压缩与任务相关性,提升统一多模态大语言模型的图像理解和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18716 2026-04-07 cs.CV 57%

SketchDeco: Training-Free Latent Composition for Precise Sketch Colourisation

SketchDeco:无需训练的潜在空间构图用于精确草图着色

Chaitat Utintu, Yi-Zhe Song

机构 * SketchX, CVSSP, University of Surrey(萨里大学CVSSP实验室SketchX团队)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SketchDeco通过无需训练的潜在空间构图方法,实现精确草图着色,结合专业设计需求与直观区域控制,利用简单掩码和颜色调色板实现空间和色彩精确指定,无需手动分配或文本提示模糊性。

Comments Accepted in CVPR 2026. Project page available at https://chaitron.github.io/SketchDeco/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03315 2026-04-07 cs.CV cs.AI 57%

StoryBlender: Inter-Shot Consistent and Editable 3D Storyboard with Spatial-temporal Dynamics

StoryBlender: 具有时空动态的跨镜头一致且可编辑的3D分镜

Bingliang Li, Zhenhong Sun, Jiaming Bian, Yuehao Wu, Yifu Wang, Hongdong Li, Yatao Bian, Huadong Mo, Daoyi Dong

机构 * Independent Researcher(独立研究员) Australia National University(澳大利亚国立大学) Central South University(中南大学) University of New South Wales(新南威尔士大学) Vertex Lab(Vertex实验室) National University of Singapore(新加坡国立大学) University of Technology Sydney(悉尼科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 StoryBlender通过三阶段流程实现跨镜头一致性和可编辑性,结合语义空间接地、资产材料化和时空动态,提升3D分镜生成的连续性和编辑精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03305 2026-04-07 cs.CV 57%

HVG-3D: Bridging Real and Simulation Domains for 3D-Conditional Hand-Object Interaction Video Synthesis

HVG-3D: 联接真实与仿真领域用于3D条件手-物体交互视频合成

Mingjin Chen, Junhao Chen, Zhaoxin Fan, Yujian Lee, Zichen Dang, Lili Wang, Yawen Cui, Lap-Pui Chau, Yi Wang

机构 * Dept. of EEE, The Hong Kong Polytechnic University(香港理工大学电机及电子工程学系) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院未来区块链与隐私计算北京高精尖创新中心) Tsinghua University(清华大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院) State Key Laboratory of Virtual Reality Technology and Systems, School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院虚拟现实技术与系统国家重点实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 HVG-3D提出一种统一框架,通过显式3D表示条件生成3D-aware手-物体交互视频,结合3D ControlNet与扩散架构,实现高保真度与时空可控性。

Comments Project page: https://hvg3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04528 2026-04-07 cs.AI 50%

Receding-Horizon Control via Drifting Models

通过漂移模型实现滚动预测控制

Daniele Foffano, Alessio Russo, Alexandre Proutiere

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) Boston University(波士顿大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出Drifting MPC框架,结合漂移生成模型与未知动态下的滚动规划,从离线轨迹数据中学习最优轨迹分布,提升轨迹生成效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09216 2026-04-07 cs.LG q-bio.QM stat.ML 50%

Controllable protein design with particle-based Feynman-Kac steering

基于粒子的费曼-卡茨引导可控蛋白质设计

Erik Hartman, Jonas Wallin, Johan Malmström, Jimmy Olsson

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出利用费曼-卡茨框架引导RFdiffusion生成具有指定性质的蛋白质,通过设计引导势能提升预测界面能量并提高结合设计性。

Comments In version 2 we added an experiment on improving designability through steering towards lower delta G

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 3 篇

2506.04869 2026-04-07 cs.CV 79%

Geological Field Restoration through the Lens of Image Inpainting

通过图像修复视角进行地质场恢复

Vladislav Trifonov, Ivan Oseledets, Ekaterina Muravleva

机构 * AIRI Skoltech(斯科尔科沃科学技术学院) Sberbank of Russia(俄罗斯联邦储蓄银行)

专题命中 图像修复 :inpainting(title,abstract);分类 cs.CV

AI总结 研究在有限观测下地质场重建问题,借鉴图像修复方法,将部分观测空间场建模为多维张量,通过全局低秩结构与空间平滑性恢复缺失值,实验表明在SPE10模型上优于普通克里金法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22647 2026-04-07 cs.CV 57%

FinPercep-RM: A Fine-grained Reward Model and Co-evolutionary Curriculum for RL-based Real-world Super-Resolution

FinPercep-RM:一种细粒度奖励模型和协同进化课程用于基于强化学习的现实世界超分辨率

Yidi Liu, Zihao Fan, Jie Huang, Jie Xiao, Dong Li, Wenlong Zhang, Lei Bai, Xueyang Fu, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 图像修复 :image generation(abstract);分类 cs.CV

AI总结 本文提出FinPercep-RM细粒度奖励模型和协同进化课程学习机制,通过生成感知退化图提升超分辨率模型的感知质量,解决传统IQA模型对局部细粒度失真不敏感的问题。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09228 2026-04-07 cs.CV cs.AI 57%

Clear Roads, Clear Vision: Advancements in Multi-Weather Restoration for Smart Transportation

清晰的道路,清晰的视野:智能交通中多天气恢复的进展

Vijay M. Galshetwar, Praful Hambarde, Prashant W. Patil, Akshay Dudhane, Sachin Chaudhary

机构 * Finolex Academy of Management and Technology(Finolex管理与技术学院) Drone Lab, Centre for Artificial Intelligence and Robotics, IIT Mandi(印度理工学院曼迪分校人工智能与机器人中心无人机实验室) Mehta Family School of Data Science and Artificial Intelligence, IIT Guwahati(印度理工学院古瓦哈提分校梅塔家族数据科学与人工智能学院) SPACE42 Centre of Excellence: Artificial Intelligence, School of Computer Science, UPES Dehradun(UPES德拉敦分校计算机科学学院人工智能卓越中心)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 本文综述了图像和视频恢复技术,以缓解天气引起的视觉障碍,分类了传统方法和数据驱动模型,并讨论了多天气系统和未来方向。

Comments Accepted for publication in IEEE Transactions on Intelligent Transportation Systems (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 2 篇

2504.15958 2026-04-07 cs.CV 86%

FreeGraftor: Training-Free Cross-Image Feature Grafting for Subject-Driven Text-to-Image Generation

FreeGraftor:无需训练的跨图像特征移植用于主体驱动的文本到图像生成

Zebin Yao, Lei Ren, Huixing Jiang, Wei Chen, Xiaojie Wang, Ruifan Li, Fangxiang Feng

机构 * College of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Li Auto Inc.(理想汽车)

专题命中 个性化与一致性 :image generation(title,abstract);text-to-image(title);分类 cs.CV

AI总结 本文提出FreeGraftor,通过跨图像特征移植解决主体驱动图像生成中保真度与效率的平衡问题,采用语义匹配和位置约束注意力融合,结合新的噪声初始化策略,实现高保真主体身份迁移和文本对齐的场景合成。

Comments Code: https://github.com/Nihukat/FreeGraftor

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03549 2026-04-07 cs.HC 50%

Beyond Generation: An Empirical Study on Redefining the Act of Drawing Through an 85% Time Reduction in Picture-Book Production

超越生成:通过减少85%的图画书生产时间重新定义绘画行为的实证研究

Cosei Kawa

专题命中 个性化与一致性 :image generation(abstract)

AI总结 本研究通过实证评估AI协作流程,发现其在减少生产时间的同时,将节省的时间用于高水平的艺术判断和完成工作,从而提升创作体验。

Comments 10 pages, 6 figures, 1 table. This study provides an empirical comparison between conventional and AI-collaborative picture-book production workflows

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 4 篇

2503.12575 2026-04-07 cs.CV cs.AI 77%

BalancedDPO: Adaptive Multi-Metric Alignment

BalancedDPO:适应性多指标对齐

Dipesh Tamboli, Souradip Chakraborty, Aditya Malusare, Biplab Banerjee, Amrit Singh Bedi, Vaneet Aggarwal

机构 * Purdue University(普渡大学) University of Maryland(马里兰大学) Indian Institute of Technology Bombay(印度理工学院孟买分校) University of Central Florida(中佛罗里达大学)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 BalancedDPO通过多指标共识和动态参考模型更新,在DPO框架中实现多指标偏好对齐,提升模型在不同评估标准下的稳定性与性能。

Comments Transactions on Machine Learning Research, Apr 2026

Journal ref Transactions on Machine Learning Research, Apr 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04172 2026-04-07 cs.CV cs.AI 70%

GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models

GENFIG1:学术工作的视觉摘要对视觉-语言模型的挑战

Yaohan Guan, Pristina Wang, Najim Dehak, Alan Yuille, Jieneng Chen, Daniel Khashabi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 GENFIG1基准测试要求视觉-语言模型生成能清晰表达论文核心思想的图表,强调科学理解与视觉合成的结合,揭示生成高质量学术图表的难度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14194 2026-04-07 cs.CV cs.AI 57%

VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model

VLBiasBench: 一个用于评估大视觉-语言模型偏见的综合性基准

Sibo Wang, Xiangkui Cao, Jie Zhang, Zheng Yuan, Shiguang Shan, Xilin Chen, Wen Gao

机构 * Key Laboratory of AI Safety of CAS, Institute of Computing Technology (ICT)(中国科学院人工智能安全重点实验室,计算技术研究所) University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Peking University(北京大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出VLBiasBench,通过覆盖九种社会偏见类别和两个交叉偏见类别的大规模数据集,评估大视觉-语言模型的偏见问题,基于15种开源和两种闭源模型进行广泛评估,揭示模型中的偏见特征。

Comments Accepted By TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03819 2026-04-07 cs.CV 57%

ActivityForensics: A Comprehensive Benchmark for Localizing Manipulated Activity in Videos

活动取证:一种全面的基准,用于定位视频中的篡改活动

Peijun Bao, Anwei Luo, Gang Pan, Alex C. Kot, Xudong Jiang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) School of Computing and Artificial Intelligence, Jiangxi University of Finance and Economics(江西财经大学计算机与人工智能学院) Jiangxi Provincial Key Laboratory of Multimedia Intelligent Processing(江西省多媒体智能处理重点实验室) Faculty of Engineering, Shenzhen MSU-BIT University(深圳北理莫斯科大学工程系) VinUniversity

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出ActivityForensics基准,用于定位视频中被篡改的活动。该基准包含6000多个无缝融合的篡改视频片段,并引入了Temporal Artifact Diffuser方法,评估了多种最先进的伪造定位器。

Comments [CVPR 2026] The first benchmark for action-level deepfake localization

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 2 篇

2604.04018 2026-04-07 cs.CV 70%

1.x-Distill: Breaking the Diversity, Quality, and Efficiency Barrier in Distribution Matching Distillation

1.x-Distill: 突破分布匹配蒸馏中的多样性、质量和效率壁垒

Haoyu Li, Tingyan Wen, Lin Qi, Zhe Wu, Yihuang Chen, Xing Zhou, Lifei Zhu, Xueqian Wang, Kai Zhang

机构 * Tsinghua University(清华大学) Central Media Technology Institute, Huawei(华为中央媒体技术研究院)

专题命中 效率与蒸馏 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出1.x-Distill框架,通过引入教师CFG修改和分阶段聚焦蒸馏方法,突破传统整数步蒸馏限制,实现更高质量和多样性的蒸馏扩散模型生成。

Comments Project page: https://thu-accdiff.github.io/1.x-distill-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28498 2026-04-07 eess.IV cs.AI cs.CV 57%

MRI-to-CT synthesis using drifting models

利用漂移模型进行MRI到CT合成

Qing Lyu, Jianxu Wang, Jeremy Hudson, Ge Wang, Chirstopher T. Whitlow

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文研究了漂移模型在MRI到CT合成中的应用,通过对比不同方法验证了其在图像质量和效率上的优势,为快速高质量的骨盆合成CT生成提供了新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他图像生成 1 篇

2512.18388 2026-04-07 cs.HC cs.AI 50%

Exploration vs. Fixation: Scaffolding Divergent and Convergent Thinking for Human-AI Co-Creation with Generative Models

探索与固定:基于生成模型的人机协同创作中发散与聚合思维的支架设计

Chao Wen, Tung Phung, Pronita Mehrotra, Sumit Gulwani, Roger E. Beaty, Tomohiro Nagashima, Adish Singla

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Microsoft(微软) Pennsylvania State University(宾夕法尼亚州立大学) Saarland Informatics Campus, Saarland University(萨尔大学萨尔信息学园区)

专题命中 其他图像生成 :image generation(abstract)

AI总结 本文提出HAICo系统,通过发散与聚合两种模式引导人机协同创作,提升创意和可用性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏