arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-18 至 2026-03-18 共收录 86 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 62 篇

2511.18803 2026-03-18 cond-mat.soft cond-mat.stat-mech 50%

Emergence of oscillatory states of self-propelled colloids under optical confinement

在光学约束下自驱动胶体的振荡态出现

Farshad Darabi, Juan Ruben Gomez-Solano

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究光束作用下自驱动胶体的单粒子运动,发现其在接近固体表面时表现出准二维活性运动,并通过旋转反转形成稳定振荡态,提出包含非线性扭矩效应的最小现象模型解释其定向变化。

Comments 13 pages, 5 figures

Journal ref New J. Phys. 28, 034604 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14740 2026-03-18 q-bio.PE 50%

Modeling the impact of temperature and bird migration on the spread of West Nile virus

建模温度和鸟类迁徙对西尼罗河病毒传播的影响

Pride Duve, Felix Sauer, Renke Lühken

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过空间模型研究温度和鸟类迁徙对西尼罗河病毒传播的影响,利用偏微分方程模拟病毒在宿主和传播者间的扩散过程,发现温度与扩散过程共同驱动病毒传播,而迁徙鸟类的输运在2023年对预测新热点至关重要。

Comments 1 supplentary pdf file, 6 videos

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13336 2026-03-18 stat.ML cs.LG math.ST stat.TH 50%

On the minimax optimality of Flow Matching through the connection to kernel density estimation

流匹配的极小极大最优性:通过与核密度估计的联系

Lea Kunkel, Mathias Trabs

机构 * Ruhr University Bochum and Karlsruhe Institute of Technology(博鲁姆鲁尔大学和卡尔斯鲁厄理工学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过将流匹配与核密度估计联系起来,证明了流匹配在Wasserstein距离下的最优收敛速率,并展示了其在高维设置中的理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03819 2026-03-18 stat.ML cs.LG 50%

Do we need rebalancing strategies? A theoretical and empirical study around SMOTE and its variants

我们是否需要再平衡策略?围绕SMOTE及其变体的理论和实证研究

Abdoulaye Sakho, Emmanuel Malherbe, Erwan Scornet

机构 * Artefact Research Center CNRS(国家科学研究中心) LPSM(概率与统计实验室)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过理论分析和实证研究,探讨SMOTE及其变体在处理不平衡数据集中的有效性,发现多数情况下无需再平衡策略即可获得良好预测性能。

Journal ref International Conference on Artificial Intelligence and Statistics, May 2026, Tanger, Morocco

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.10024 2026-03-18 econ.EM 50%

Linear Regression with Centrality Measures

基于中心性指标的线性回归

Yong Cai

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了网络数据稀疏且观测有误时线性回归中心性指标的性质,发现OLS估计在稀疏性下可能不一致,提出偏倚修正和推断方法,通过模拟验证方法有效性,并在坦桑尼亚Nyakatoke的消费平滑与非正式保险关系中展示实证相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15662 2026-03-18 math.DS cs.NA math.NA math.PR 50%

The Geometry of Quasi-Cycles: How Stoichiometric Covariance Alters Pre-Bifurcation Signatures

准周期的几何学:斯托克斯系数如何改变预分支特征

Louis Shuo Wang, Jiguang Yu, Ye Liang, Jilin Zhang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了在罗森茨威格-马卡罗模型中,机械推导的种群噪声如何影响近霍普夫动力学,通过比较两种具有相同确定性漂移但捕食诱导协方差结构不同的扩散闭合方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 11 篇

2603.15484 2026-03-18 cs.CV cs.AI 83%

RSGen: Enhancing Layout-Driven Remote Sensing Image Generation with Diverse Edge Guidance

RSGen: 通过多样边缘引导增强布局驱动的遥感图像生成

Xianbao Hou, Yonghao He, Zeyd Boukhers, John See, Hu Su, Wei Sui, Cong Yang

机构 * School of Future Science and Engineering, Soochow University, Suzhou, China(未来科学与工程学院,苏州大学) D-Robotics, Beijing, China(北京D-机器人) Fraunhofer Institute for Applied Information Technology, Sankt Augustin, Germany(弗劳恩霍夫应用信息技术研究所) School of Mathematical and Computing Sciences, Heriot-Watt University Malaysia, Putrajaya, Malaysia(数学与计算科学学院,赫瑞-瓦德大学马来西亚分校) Institute of Automation, Chinese Academy of Sciences, Beijing, China(自动化研究所,中国科学院北京分院)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 RSGen通过多样边缘引导提升布局驱动的遥感图像生成,增强细粒度控制并严格遵守边界框约束,实验表明其显著提升了现有L2I模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16576 2026-03-18 cs.CV cs.AI cs.CR cs.LG 79%

REFORGE: Multi-modal Attacks Reveal Vulnerable Concept Unlearning in Image Generation Models

REFORGE:多模态攻击揭示图像生成模型中的脆弱概念反向学习

Yong Zou, Haoran Li, Fanxiao Li, Shenyang Wei, Yunyun Dong, Li Tang, Wei Zhou, Renyang Liu

机构 * Yunnan University(云南大学) Northeastern University(东北大学) National University of Singapore(新加坡国立大学)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 REFORGE通过对抗性图像提示评估图像生成模型反向学习的鲁棒性,揭示现有方法的持续漏洞,提出更高效的多模态对抗攻击策略。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10402 2026-03-18 cs.LG cs.AI cs.CE 78%

Controllable Graph Generation with Diffusion Models via Inference-Time Tree Search Guidance

通过推理时间树搜索引导实现可控图生成

Jiachi Zhao, Zehong Wang, Yamei Liao, Chuxu Zhang, Yanfang Ye

机构 * University of Notre Dame(内布拉斯加大学) Independent Researcher(独立研究者) University of Connecticut(康涅狄格大学)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 本文提出TreeDiff框架,通过MCTS引导双空间扩散模型实现可控图生成,解决传统方法控制不足的问题,实验显示其在分子生成中表现优异。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16871 2026-03-18 cs.CV 57%

WorldCam: Interactive Autoregressive 3D Gaming Worlds with Camera Pose as a Unifying Geometric Representation

WorldCam: 交互式自回归3D游戏世界与相机姿态作为统一的几何表示

Jisu Nam, Yicong Hong, Chun-Hao Paul Huang, Feng Liu, JoungBin Lee, Jiyoung Kim, Siyoon Jin, Yunsung Lee, Jaeyoon Jung, Suhwan Choi, Seungryong Kim, Yang Zhou

机构 * Adobe Research(Adobe研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出WorldCam,通过将相机姿态作为统一的几何表示,解决交互式游戏世界中动作控制与长时序3D一致性问题,结合物理连续动作空间和全局相机姿态索引提升导航与视觉质量。

Comments Project page is available at https://cvlab-kaist.github.io/WorldCam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16373 2026-03-18 cs.CV 57%

Semantic One-Dimensional Tokenizer for Image Reconstruction and Generation

语义一维分词器用于图像重建与生成

Yunpeng Qu, Kaidong Zhang, Yukang Ding, Ying Chen, Jian Wang

机构 * Tsinghua University, Beijing, China(清华大学,北京,中国) Alibaba Group, Beijing, China(阿里巴巴集团,北京,中国)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出SemTok,一种语义一维分词器,通过压缩2D图像为1D离散token实现高效图像重建,采用三重创新框架提升生成效果。

Comments 18 pages,12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16362 2026-03-18 cs.CV cs.AI 57%

$D^3$-RSMDE: 40$\times$ Faster and High-Fidelity Remote Sensing Monocular Depth Estimation

$D^3$-RSMDE:40倍更快且高保真度的遥感单目深度估计

Ruizhi Wang, Weihan Li, Zunlei Feng, Haofei Zhang, Mingli Song, Jiayu Wang, Jie Song, Li Sun

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出$D^3$-RSMDE框架,结合ViT快速生成初步深度图并利用轻量级U-Net进行细节优化,实现高效高保真度的遥感单目深度估计,比现有方法快40倍且LPIPS指标降低11.85%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16188 2026-03-18 cs.CV 57%

ECHO: Edge-Cloud Humanoid Orchestration for Language-to-Motion Control

ECHO:边缘-云计算人形机器人语言到动作控制

Haozhe Jia, Jianfei Song, Yuan Zhang, Honglei Jin, Youcheng Fan, Wenshuo Chen, Wei Zhang, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) LimX Dynamics Technology Co., Ltd.(LimX动力技术有限公司) Shandong University(山东大学) Institute of Deep Perception Technology, Jiangsu Industrial Technology Research Institute (JITRI)(江苏工业技术研究院深度感知技术研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ECHO提出边缘-云计算框架,通过云端扩散模型生成自然语言指令对应动作,边缘设备通过强化学习跟踪执行,采用紧凑的机器人本征动作表示实现高效控制,实现实时动作生成与安全执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16169 2026-03-18 cs.CV 57%

Gaze-guided Hand-Object Interaction Synthesis: Dataset and Method

引导注视的手-物体交互合成:数据集与方法

Jie Tian, Ran Ji, Lingxiao Yang, Suting Ni, Yuexin Ma, Lan Xu, Jingyi Yu, Ye Shi, Jingya Wang

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出 gaze-guided 手-物体交互合成任务,引入首个捕捉 gaze、手和物体交互的 GazeHOI 数据集,并提出 GHO-Diffusion 模型以解决高一致性与物理合理性问题。

Comments Accepted by IEEE Transactions on Multimedia (TMM), 2026. Project Page: https://takiee.github.io/gaze-hoi/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16397 2026-03-18 cs.CL cs.AI 50%

Fanar 2.0: Arabic Generative AI Stack

Fanar 2.0:阿拉伯生成AI堆栈

FANAR TEAM, Ummar Abbas, Mohammad Shahmeer Ahmad, Minhaj Ahmad, Abdulaziz Al-Homaid, Anas Al-Nuaimi, Enes Altinisik, Ehsaneddin Asgari, Sanjay Chawla, Shammur Chowdhury, Fahim Dalvi, Kareem Darwish, Nadir Durrani, Mohamed Elfeky, Ahmed Elmagarmid, Mohamed Eltabakh, Asim Ersoy, Masoomali Fatehkia, Mohammed Qusay Hashim, Majd Hawasly, Mohamed Hefeeda, Mus'ab Husaini, Keivin Isufaj, Soon-Gyo Jung, Houssam Lachemat, Ji Kim Lucas, Abubakr Mohamed, Tasnim Mohiuddin, Basel Mousi, Hamdy Mubarak, Ahmad Musleh, Mourad Ouzzani, Amin Sadeghi, Husrev Taha Sencar, Mohammed Shinoy, Omar Sinan, Yifan Zhang

机构 * Qatar Computing Research Institute (QCRI)(卡塔尔计算研究 institute) Hamad Bin Khalifa University(哈马德·本·卡西姆大学)

专题命中 可控生成 :image generation(abstract)

AI总结 Fanar 2.0在资源受限条件下实现卓越性能,通过数据质量优先、持续预训练和模型融合,提升阿拉伯语知识、语言、方言及英语能力,同时引入多项新功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16383 2026-03-18 math.OC 50%

Exact Cost-Increment Formula for Optimal Control of Semilinear Evolution Equations

半线性演算方程最优控制的精确成本增量公式

Roman Chertovskih, Nikolay Pogodaev, Maxim Staritsyn, A. Pedro Aguiar

专题命中 可控生成 :diffusion(abstract)

AI总结 本文推导了半线性演算方程在Banach空间中多控制通道最优控制的精确成本增量公式,提出无需线性化或步长调节的单调下降算法,并在受控反应扩散方程上验证了方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16359 2026-03-18 cs.HC 50%

One Kiss: Emojis as Agents of Genre Flux in Generative Comics

一吻:表情符号在生成漫画中的风格流动作用

Xiruo Wang, Xinyi Jiang, Ziqi Lyu

专题命中 可控生成 :text-to-image(abstract)

AI总结 One Kiss通过表情符号引导漫画生成,使用户通过表情符号设定情感基调,实现风格流动,重新定义用户角色为叙事导演。

Comments Accepted to CHI 202X Extended Abstracts

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 2 篇

2603.16769 2026-03-18 cs.CV 57%

GDPO-SR: Group Direct Preference Optimization for One-Step Generative Image Super-Resolution

GDPO-SR:基于群直接偏好优化的一步生成图像超分辨率

Qiaosi Yi, Shuai Li, Rongyuan Wu, Lingchen Sun, Zhengqiang Zhang, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 本文提出GDPO-SR,通过整合RL方法提升一步生成图像超分辨率性能,引入噪声感知扩散模型和群相对优势计算策略,优化局部细节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16306 2026-03-18 cs.CV 57%

DriveFix: Spatio-Temporally Coherent Driving Scene Restoration

DriveFix:时空一致的驾驶场景修复

Heyu Si, Brandon James Denis, Muyang Sun, Dragos Datcu, Yaoru Li, Xin Jin, Ruiju Fu, Yuliia Tatarinova, Federico Landi, Jie Song, Mingli Song, Qi Guo

机构 * Zhejiang University(浙江大学) Huawei(华为)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 DriveFix提出一种多视角修复框架,通过交错扩散变换器架构和几何感知损失,实现驾驶场景时空一致性,提升4D世界建模的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 2 篇

2603.16219 2026-03-18 cs.CL 78%

SpecSteer: Synergizing Local Context and Global Reasoning for Efficient Personalized Generation

SpecSteer:协同局部上下文与全局推理以实现高效个性化生成

Hang Lv, Sheng Liang, Hao Wang, Yongyue Zhang, Hongchao Gu, Wei Guo, Defu Lian, Yong Liu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 个性化与一致性 :personalized generation(title,abstract)

AI总结 本文提出SpecSteer框架,通过结合本地上下文与云端推理,解决个性化生成中的隐私与推理能力矛盾,实现高效生成并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15679 2026-03-18 cs.CR cs.AI cs.CV 57%

IdentityGuard: Context-Aware Restriction and Provenance for Personalized Synthesis

IdentityGuard: 基于上下文的限制与溯源的个性化合成

Lingyun Zhang, Yu Xie, Ping Chen

机构 * School of Computer Science and Technology, Fudan University(复旦大学计算机科学与技术学院) Institute of Big Data, Fudan University(复旦大学大数据研究院) Purple Mountain Laboratories(紫金山实验室)

专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出IdentityGuard,通过上下文感知的限制和概念特定水印,实现个性化合成的安全控制,防止滥用同时保持模型效用。

Comments 5 pages, 3 figures, Accepted to ICASSP

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 1 篇

2509.05469 2026-03-18 cs.AI cs.CV cs.CY cs.HC 74%

From Image Generation to Infrastructure Design: a Multi-agent Pipeline for Street Design Generation

从图像生成到基础设施设计:一种多智能体管道用于街道设计生成

Chenguang Wang, Xiang Yan, Yilong Dai, Ziyi Wang, Susu Xu

机构 * Johns Hopkins University(约翰霍普金斯大学) Stony Brook University(石溪大学) University of Florida(佛罗里达大学) University of Maryland(马里兰大学)

专题命中 图像生成评测 :image generation(title);分类 cs.CV

AI总结 本文提出一种多智能体系统,直接在真实街道视图上编辑和重新设计自行车设施,整合车道定位、提示优化、设计生成和自动评估,生成符合情境的街道设计。

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 4 篇

2505.20107 2026-03-18 cs.LG cs.CV 79%

Refining Few-Step Text-to-Multiview Diffusion via Reinforcement Learning

通过强化学习细化少步文本到多视图扩散模型

Ziyi Zhang, Li Shen, Deheng Ye, Yong Luo, Huangxuan Zhao, Meng Liu, Wei Yu, Lefei Zhang

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University(计算机学院、多媒体软件国家工程研究中心和湖北多媒体与网络通信工程重点实验室、武汉大学) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学信息科学与技术学院深圳校区) Tencent Inc.(腾讯公司) Xiaomi Inc., China(小米公司,中国)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出MVC-ZigAL框架,通过联合视图奖励模型和自适应优化策略,提升少步多视图扩散模型的生成质量和一致性。

Comments Accepted to CVPR 2026

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16489 2026-03-18 cs.CV cs.AI 70%

Unlearning for One-Step Generative Models via Unbalanced Optimal Transport

通过不平衡最优传输实现一步生成模型的反学习

Hyundo Choi, Junhyeong An, Jinseong Park, Jaewoong Choi

机构 * Sungkyunkwan University(成均馆大学) Korea Institute for Advanced Study(韩国高级研究院)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出UOT-Unlearn框架,通过不平衡最优传输实现一步生成模型的反学习,平衡遗忘成本与f-散度惩罚,提升去学习效果和保留质量。

Comments 27 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14895 2026-03-18 cs.SI 50%

FS_GPlib: Breaking the Web-Scale Barrier - A Unified Acceleration Framework for Graph Propagation Models

FS_GPlib:突破网络级障碍——图传播模型的统一加速框架

Chang Guo, Juyuan Zhang, Chang Su, Tianlong Fan, Linyuan Lü

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出FS_GPlib,通过微粒同步消息传递与宏观批量蒙特卡洛模拟结合,实现大规模图传播建模的高效高保真模拟,实验显示其在标准库上达到3.5万倍加速,可在11秒内完成亿级边图的完整蒙特卡洛模拟。

Comments Accepted at ACM Web Conference 2026 (WWW2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15190 2026-03-18 cs.LG cs.AI 50%

Masked Auto-Regressive Variational Acceleration: Fast Inference Makes Practical Reinforcement Learning

遮蔽自回归变分加速:快速推理使强化学习实用

Yuxuan Gu, Weimin Bai, Yifei Wang, Weijian Luo, He Sun

机构 * Peking University(北京大学) Rice University(Rice大学) hi-lab, Xiaohongshu Inc(小红书实验室,小红书公司)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出MARVAL框架,通过压缩扩散链为单步自回归生成,提升推理效率并使强化学习实用化,实现了生成模型的快速采样和偏好对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏