arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-08 至 2026-04-08 共收录 84 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 9 篇

2604.05730 2026-04-08 cs.LG 85%

Controllable Image Generation with Composed Parallel Token Prediction

通过组合并行令牌预测实现可控图像生成

Jamie Stirling, Noura Al-Moubayed, Chris G. Willcocks, Hubert P. H. Shum

机构 * Durham University(杜伦大学)

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract)

AI总结 本文提出一种理论指导的离散生成过程组合方法,通过掩码生成(吸收扩散)实现多输入条件的精确组合,相比现有方法在误差率和FID上均有显著提升,并实现高效的文本到图像生成控制。

Comments 8 pages + references, 7 figures, accepted to CVPR Workshops 2026 (LoViF). arXiv admin note: substantial text overlap with arXiv:2405.06535

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05761 2026-04-08 cs.CV 70%

Improving Controllable Generation: Faster Training and Better Performance via $x_0$-Supervision

提升可控生成:通过$x_0$监督实现更快训练和更好性能

Amadou S. Sangare, Adrien Maglo, Mohamed Chaouch, Bertrand Luvison

机构 * Université Paris-Saclay, CEA, List(巴黎-萨克雷大学,法国原子能委员会,信息与系统实验室)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文通过分析去噪动态,提出$x_0$监督方法,提升可控扩散模型的收敛速度和生成质量,实验显示收敛速度提升2倍,视觉质量和条件准确性均得到改善。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04953 2026-04-08 cs.CV cs.AI cs.HC cs.IR cs.MM 62%

Generative AI for Video Trailer Synthesis: From Extractive Heuristics to Autoregressive Creativity

生成AI用于视频预告片合成:从提取启发式方法到自回归创造力

Abhishek Dharmaratnakar, Srivaths Ranganathan, Debanshu Das, Anushree Sinha

机构 * Google LLC(谷歌有限责任公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文综述了自动视频预告片生成领域从启发式提取到深度生成合成的转变,探讨了自回归Transformer、LLM协同流程和文本到视频基础模型等生成技术,并讨论了高保真神经合成的伦理挑战。

Comments 7 pages, 3 figures, accepted in WSDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00503 2026-04-08 cs.CV 57%

Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction Models

Diff4Splat:基于潜在动态重建模型的可控4D场景生成

Panwang Pan, Chenguo Lin, Jingjing Zhao, Chenxin Li, Yuchen Lin, Haopeng Li, Honglei Yan, Kairun Wen, Yunlong Lin, Yixuan Yuan, Yadong Mu

机构 * Peking University(北京大学) Xiamen University(厦门大学) CUHK(香港中文大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Diff4Splat通过单张图像和相机轨迹生成可控的4D场景,结合视频扩散模型的生成先验与大规模4D数据集学习的几何和运动约束,在单次前向传递中直接预测可变形3D高斯场,无需测试时优化。

Comments Accepted to CVPR 2026. Project page: https://paulpanwang.github.io/Diff4Splat

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05731 2026-04-08 cs.CV 57%

FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips

FoleyDesigner:基于精确时空对齐的沉浸式立体声 Foley 生成

Mengtian Li, Kunyan Dai, Yi Ding, Ruobing Ni, Ying Zhang, Wenwu Wang, Zhifeng Xie

机构 * Shanghai Film Academy, Shanghai University(上海大学上海电影学院) Shanghai Engineering Research Center of Motion Picture Special Effects(上海电影特效工程技术研究中心) University of Surrey, UK(英国萨里大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出 FoleyDesigner 框架,结合视频分析与可控 Foley 生成,引入 FilmStereo 数据集,实现高质量立体声生成与专业音频混合,提升电影沉浸体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18093 2026-04-08 cs.CV 57%

One-to-More: High-Fidelity Training-Free Anomaly Generation with Attention Control

一至多:基于注意力控制的高保真无训练异常生成

Haoxiang Rao, Zhao Wang, Chenyang Si, Yan Lyu, Yuanyi Duan, Fang Zhao, Caifeng Shan

机构 * Nanjing University(南京大学) China Mobile Zijin Innovation Institute(中国移动紫金创新研究院) Shandong University of Science and Technology(山东科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出O2MAG方法,通过自注意力机制生成更真实的异常,解决传统方法训练耗时且分布不真实的问题,实验表明其在下游任务中表现更优。

Comments Accepted by CVPR2026. Code: https://github.com/echrao/O2MAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06133 2026-04-08 cs.RO 50%

Learning-Guided Force-Feedback Model Predictive Control with Obstacle Avoidance for Robotic Deburring

具有障碍物避障的力反馈模型预测控制学习方法用于机器人去毛刺

Krzysztof Wojciechowski, Ege Gursoy, Arthur Haffemayer, Sebastien Kleff, Vincent Bonnet, Florent Lamiraux, Nicolas Mansard

机构 * LAAS-CNRS, Universite de Toulouse, CNRS, Toulouse, France(法国国家科学研究中心LAAS实验室,图卢兹大学,法国图卢兹) Inria, AUCTUS team, Talence, France(法国国家信息与自动化研究所AUCTUS团队,法国塔朗斯) Image and Pervasive Access Laboratory (IPAL), CNRS-UMI, 2955, Singapore(图像与普适接入实验室(IPAL),法国国家科学研究中心-国际联合实验室2955,新加坡) Artificial and Natural Intelligence Toulouse Institute, France(图卢兹人工智能与自然智能研究所,法国)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出结合力反馈MPC与扩散运动先验的框架,解决机器人去毛刺任务中力控制、碰撞避免和复杂运动的问题,通过实验验证其在工业场景下的可靠性与有效性。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14093 2026-04-08 cs.LG cs.AI 50%

Not All Latent Spaces Are Flat: Hyperbolic Concept Control

并非所有潜在空间都是平坦的:双曲概念控制

Maria Rosaria Briglia, Simone Facchiano, Paolo Cursi, Alessio Sampieri, Emanuele Rodolà, Guido Maria D'Amely di Melendugno, Luca Franco, Fabio Galasso, Iacopo Masi

专题命中 可控生成 :text-to-image(abstract)

AI总结 本文提出双曲控制机制,利用双曲表示空间提升概念操控的表达力和稳定性,通过四个安全基准和四个T2I模型验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 1 篇

2604.05651 2026-04-08 cs.CV 57%

Probing Intrinsic Medical Task Relationships: A Contrastive Learning Perspective

探测内在医学任务关系:一种对比学习视角

Jonas Muth, Zdravko Marinov, Simon Reiß

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 本文通过对比学习框架TaCo,探讨医学视觉任务之间的内在关系,分析30种任务在不同医学影像数据集中的表示特性,揭示任务间的相似性与关联性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 3 篇

2604.05183 2026-04-08 cs.CV cs.AI cs.LG 74%

OrthoFuse: Training-free Riemannian Fusion of Orthogonal Style-Concept Adapters for Diffusion Models

OrthoFuse:无训练的正交风格-概念适配器的黎曼融合

Ali Aliev, Kamil Garifullin, Nikolay Yudin, Vera Soboleva, Alexander Molozhavenko, Ivan Oseledets, Aibek Alanov, Maxim Rakhuba

机构 * HSE University(高等经济大学) FusionBrain Lab(FusionBrain实验室) AXXX

专题命中 个性化与一致性 :diffusion(title);分类 cs.CV

AI总结 本文提出无训练的正交适配器融合方法,通过几何性质和谱恢复变换实现多任务适配器的高效融合,适用于生成模型的主体驱动生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05296 2026-04-08 cs.CV 57%

From Measurement to Mitigation: Quantifying and Reducing Identity Leakage in Image Representation Encoders with Linear Subspace Removal

从测量到缓解:量化并减少图像表示编码器中的身份泄露

Daniel George, Charles Yeh, Daniel Lee, Yifei Zhang

机构 * Persona Identities

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种针对图像表示编码器中身份泄露的评估基准和缓解方法,通过线性子空间移除技术在保持实用性的前提下提升隐私保护。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05039 2026-04-08 cs.CV cs.AI 57%

ID-Sim: An Identity-Focused Similarity Metric

ID-Sim:一种以身份为中心的相似性度量

Julia Chae, Nicholas Kolkin, Jui-Hsien Wang, Richard Zhang, Sara Beery, Cusuh Ham

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Adobe Research(Adobe研究院)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 本文提出ID-Sim,一种以身份为中心的相似性度量,通过高质量图像数据集和生成合成数据,提升身份识别和生成任务的评估能力。

Comments SB and CH equal advising; Project page https://juliachae.github.io/id_sim.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 4 篇

2604.04192 2026-04-08 cs.CV cs.AI cs.LG 70%

Graphic-Design-Bench: A Comprehensive Benchmark for Evaluating AI on Graphic Design Tasks

Graphic-Design-Bench:一个全面的评估AI在图形设计任务中的基准测试

Adrienne Deganutti, Elad Hirsch, Haonan Zhu, Jaejung Seol, Purvanshi Mehta

专题命中 图像生成评测 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出GraphicDesignBench,首个针对专业图形设计任务的全面基准测试集,评估AI模型在布局、排版、信息图、模板设计和动画等任务中的表现,揭示当前模型在空间推理、矢量代码生成和动画分解等方面存在的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04997 2026-04-08 cs.IR cs.AI cs.CL cs.CV cs.LG 57%

Evaluation of Embedding-Based and Generative Methods for LLM-Driven Document Classification: Opportunities and Challenges

嵌入式与生成方法在LLM驱动文档分类中的评估:机遇与挑战

Rong Lu, Hao Liu, Song Hou

专题命中 图像生成评测 :generative vision(abstract);分类 cs.CV

AI总结 本文比较了基于嵌入和生成模型在地学技术文档分类中的表现,发现增强的生成视觉-语言模型在零样本准确率上表现更优,但监督微调对训练数据不平衡敏感。

Comments Accepted at the IMAGE'25 Workshop (PCW-11), Society of Exploration Geophysicists (SEG). Published version available at https://doi.org/10.1190/image2025-w11-03.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08336 2026-04-08 cs.CL cs.CV 57%

From Reasoning to Pixels: Benchmarking the Alignment Gap in Unified Multimodal Models

从推理到像素:统一多模态模型中对齐差距的基准测试

Cheng Yang, Chufan Shi, Bo Shui, Yaokang Wu, Muzi Tao, Huijuan Wang, Ivan Yee Lee, Yong Liu, Xuezhe Ma, Taylor Berg-Kirkpatrick

机构 * University of California San Diego(加利福尼亚大学圣迭戈分校) University of Southern California(南加利福尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文通过UReason基准测试,探讨统一多模态模型中模态对齐问题,发现去上下文生成在图像生成任务中表现更优,揭示了文本推理与生成图像之间存在对齐差距。

Comments Project page: https://ureason.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14949 2026-04-08 cs.CL cs.CV cs.LG 57%

DialectGen: Benchmarking and Improving Dialect Robustness in Multimodal Generation

DialectGen:多模态生成中方言鲁棒性评估与改进

Yu Zhou, Sohyun An, Haikang Deng, Da Yin, Clark Peng, Cho-Jui Hsieh, Kai-Wei Chang, Nanyun Peng

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文通过构建涵盖六种英语方言的大型基准,评估多模态生成模型在方言输入下的表现,提出一种通用编码器策略提升方言鲁棒性,同时保持标准美式英语性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 7 篇

2604.05934 2026-04-08 cs.CV eess.IV 79%

Leveraging Image Editing Foundation Models for Data-Efficient CT Metal Artifact Reduction

利用图像编辑基础模型实现数据高效的CT金属伪影减少

Ahmet Rasim Emirdagi, Süleyman Aslan, Mısra Yavuz, Görkay Aydemir, Yunus Bilge Kurt, Nasrin Rahimi, Burak Can Biner, M. Akın Yılmaz

机构 * Codeway AI Research(Codeway AI 研究院)

专题命中 效率与蒸馏 :image editing(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出利用视觉语言扩散基础模型进行金属伪影减少,通过参数高效低秩适应技术,仅需16-128对训练样本即可实现高效伪影抑制,并证明领域适应对减少幻觉至关重要。

Comments Accepted to CVPRW 2026 Med-Reasoner

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13592 2026-04-08 cs.LG cs.CV 79%

Image Diffusion Preview with Consistency Solver

图像扩散预览与一致性求解器

Fu-Yun Wang, Hao Zhou, Liangzhe Yuan, Sanghyun Woo, Boqing Gong, Bohyung Han, Ming-Hsuan Yang, Han Zhang, Yukun Zhu, Ting Liu, Long Zhao

机构 * Google DeepMind(谷歌DeepMind) The Chinese University of Hong Kong(香港中文大学) Seoul National University(首尔大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ConsistencySolver,通过强化学习优化的轻量高阶求解器,提升图像扩散预览的质量与一致性,减少推理步骤,提高交互效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05551 2026-04-08 cs.CL cs.AI cs.LG 78%

FastDiSS: Few-step Match Many-step Diffusion Language Model on Sequence-to-Sequence Generation--Full Version

FastDiSS: 少步匹配多步扩散语言模型在序列到序列生成中的应用——完整版本

Dat Nguyen-Cong, Tung Kieu, Hoang Thanh-Tung

机构 * FPT Software AI Center, FPT Corporation(FPT软件人工智能中心,FPT公司) Department of Computer Science, Aalborg University(奥尔堡大学计算机科学系) Quantum AI and Cyber Security Institute, FPT Corporation(FPT公司量子人工智能与网络安全研究所)

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 本文提出FastDiSS模型,通过改进自条件机制和引入噪声感知机制,提升少步采样下的生成质量,并实现400倍更快的推理速度。

Comments camera-ready version, accepted by ACL Findings (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11911 2026-04-08 cs.CV 57%

InSpatio-WorldFM: An Open-Source Real-Time Generative Frame Model

InSpatio-WorldFM:一种开源的实时生成帧模型

InSpatio Team, Donghui Shen, Guofeng Zhang, Haomin Liu, Haoyu Ji, Jialin Liu, Jing Guo, Nan Wang, Siji Pan, Weihong Pan, Weijian Xie, Xiaojun Xiang, Xiaoyu Zhang, Xianbin Liu, Yifu Wang, Yipeng Chen, Zhewen Le, Zhichao Ye, Ziqiang Zhao

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出InSpatio-WorldFM,一种基于帧的实时生成模型,通过3D锚点和隐式空间记忆保持场景几何与细节,采用三阶段训练流程实现低延迟实时生成。

Comments Project page: https://inspatio.github.io/worldfm/ Code: https://github.com/inspatio/worldfm

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13009 2026-04-08 cs.CV 57%

Matrix-game 2.0: An open-source real-time and streaming interactive world model

矩阵游戏2.0:一个开源的实时和流式交互世界模型

Xianglong He, Chunli Peng, Zexiang Liu, Boyang Wang, Yifan Zhang, Qi Cui, Fei Kang, Biao Jiang, Mengyin An, Yangyang Ren, Baixin Xu, Hao-Xiang Guo, Kaixiong Gong, Size Wu, Wei Li, Xuchen Song, Yang Liu, Yangguang Li, Yahui Zhou

机构 * Skywork AI(天工AI)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Matrix-Game 2.0,通过少步自回归扩散生成长视频,解决传统交互世界模型实时性差的问题,实现25FPS高速生成。

Comments Project Page: https://matrix-game-v2.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05837 2026-04-08 cond-mat.mtrl-sci 50%

Near 13% efficient semitransparent Cu(In,Ga)S2 solar cells with band gap of 1.6 eV on transparent back contact

近13%效率的半透明Cu(In,Ga)S2太阳能电池,带隙为1.6 eV,采用透明背接触

Kulwinder Kaur, Arivazhagan Valluvar Oli, Michele Melchiorre, Wolfram Hempel, Wolfram Witte, Jan Keller, Susanne Siebentritt

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 研究了采用In2O3:Sn(ITO)作为透明背接触的宽带隙Cu(In,Ga)S2太阳能电池,探讨了Na对性能的影响,并实现了12.7%效率的半透明太阳能电池,带隙为1.6 eV。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20309 2026-04-08 cs.LG 50%

QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models

QuantVLA: 用于视觉-语言-动作模型的可扩展后训练量化

Jingxuan Zhang, Yunta Hsieh, Zhongwei Wan, Haokun Lin, Xin Wang, Ziqi Wang, Yingtie Lei, Mi Zhang

机构 * The Ohio State University(俄亥俄州立大学) University of Michigan(密歇根大学) City University of Hong Kong(香港城市大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 QuantVLA是一种无需训练的后训练量化框架,首次应用于视觉-语言-动作系统,并成功量化了扩散变换器(DiT)动作头,通过三种可扩展组件实现了高效的低比特量化,显著提升任务成功率并降低内存消耗。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他图像生成 1 篇

2604.06129 2026-04-08 cs.CV cs.AI 57%

PoM: A Linear-Time Replacement for Attention with the Polynomial Mixer

PoM:一种线性时间的注意力替代方案:多项式混合器

David Picard, Nicolas Dufour, Lucas Degeorge, Arijit Ghosh, Davide Allegro, Tom Ravaud, Yohann Perron, Corentin Sautier, Zeynep Sonat Baltaci, Fei Meng, Syrine Kalleli, Marta López-Rauhut, Thibaut Loiseau, Ségolène Albouy, Raphael Baena, Elliot Vincent, Loic Landrieu

机构 * LIGM, CNRS, Univ Gustave Eiffel, ENPC, Institut Polytechnique de Paris(LIGM,法国国家科学研究中心,古斯塔夫·埃菲尔大学,巴黎高科路桥学院,巴黎综合理工学院) LIX, École Polytechnique, CNRS, IP Paris(LIX,巴黎综合理工学院,法国国家科学研究中心,巴黎综合理工学院) Department of Information Engineering, Università degli Studi di Padova(帕多瓦大学信息工程系) AMIAD, Pole recherche, EFEO(AMIAD,法国远东学院研究部) LASTIG, Univ Gustave Eiffel, IGN, Géodata Paris(LASTIG,古斯塔夫·埃菲尔大学,法国国家地理与森林信息研究所,巴黎地理数据)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出PoM,一种线性复杂度的替代注意力机制,通过学习多项式函数聚合输入令牌,实现高效序列处理,减少长序列计算成本。

Comments Accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏