arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-19 至 2026-06-19 共收录 21 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 1 篇

2601.21081 2026-06-19 cs.CV 版本更新 70%

Shape of Thought: Progressive Object Assembly via Visual Chain-of-Thought

思维形状:通过视觉思维链进行渐进式物体组装

Yu Huo, Siyu Zhang, Kun Zeng, Haoyue Liu, Owen Lee, Junlin Chen, Yuquan Lu, Yifu Guo, Yaodong Liang, Xiaoying Tang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Sun Yat-sen University(中山大学) The Hong Kong University of Science and Technology, Guangzhou(香港科学与技术大学(广州)) Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来网络智能研究所(FNii-Shenzhen)) Guangdong Provincial Key Laboratory of Future Networks of Intelligence, CUHK(SZ)(广东省未来网络智能重点实验室,CUHK(SZ))

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出Shape-of-Thought (SoT)框架,通过视觉思维链在渲染2D域中逐步组装形状,解决文本到图像生成中的组合结构约束问题,在组件计数和结构拓扑上显著优于直接生成。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 2 篇

2603.07236 2026-06-19 cs.CV 版本更新 74%

HY-WU (Part I): An Extensible Functional Neural Memory Framework and An Instantiation in Text-Guided Image Editing

HY-WU (第一部分): 一种可扩展的功能性神经记忆框架及其在文本引导图像编辑中的应用

Mengxuan Wu, Xuanlei Zhao, Ziqiao Wang, Ruicheng Feng, Zhangyang Wang, Kai Wang

机构 * Tencent HY Team(腾讯 HY 团队)

专题命中 图像编辑 :image editing(title);分类 cs.CV

AI总结 提出HY-WU框架,通过功能性神经记忆模块即时生成实例特定权重更新,避免共享权重覆盖导致的干扰,解决持续学习与个性化中的灾难性遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21542 2026-06-19 cs.CV cs.AI 版本更新 57%

Bi-Anchor Interpolation Solver for Accelerating Generative Modeling

双锚点插值求解器加速生成建模

Hongxu Chen, Hongxiang Li, Zhen Wang, Long Chen

机构 * The Hong Kong University of Science(香港科学与技术大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出BA-solver,通过轻量SideNet(1-2%主干大小)学习双向时间感知和双锚点速度积分,在不重新训练主干的情况下,以极低训练成本实现10步内达到100+步Euler求解器质量,支持即插即用。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 15 篇

2603.12252 2026-06-19 cs.CV cs.CL 版本更新 79%

EndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion Models

EndoCoT:扩散模型中的内生思维链推理扩展

Xuanlang Dai, Yujie Zhou, Long Xing, Jiazi Bu, Xilin Wei, Yuhong Liu, Beichen Zhang, Kai Chen, Yuhang Zang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出EndoCoT框架,通过迭代思维引导模块激活MLLM的推理潜力,并利用终端思维接地模块确保推理轨迹与文本监督对齐,使DiT逐步执行复杂任务,在多个基准上平均准确率达92.1%。

Comments 23 pages, 18 figures, The code and dataset are publicly available at https://internlm.github.io/EndoCoT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03112 2026-06-19 eess.IV cs.CV 版本更新 79%

DiT-JSCC: Rethinking Deep JSCC with Diffusion Transformers and Semantic Representations

DiT-JSCC:基于扩散变换器与语义表示的深度JSCC再思考

Kailin Tan, Jincheng Dai, Sixian Wang, Guo Lu, Shuo Shao, Kai Niu, Wenjun Zhang, Ping Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) University of Shanghai for Science and Technology(上海科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出DiT-JSCC框架,联合学习语义优先表示编码器和扩散变换器生成解码器,通过粗细粒度条件解码和基于Kolmogorov复杂度的自适应带宽分配,在极端信道条件下提升语义一致性与传输效率。

Comments 14pages, 14figures, 2tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04037 2026-06-19 cs.LG cs.RO 版本更新 78%

DADP: Domain Adaptive Diffusion Policy

DADP: 领域自适应扩散策略

Pengcheng Wang, Qinghang Liu, Haotian Lin, Yiheng Li, Guojian Zhan, Masayoshi Tomizuka, Yixiao Wang

机构 * University of California, Berkeley, California, USA(加州大学伯克利分校) Peking University, Beijing, China(北京大学) Tsinghua University, Beijing, China(清华大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出DADP,通过无监督解耦和领域感知扩散注入,实现跨动态环境的鲁棒零样本适应,在运动与操控任务上超越先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25702 2026-06-19 cs.CL 版本更新 78%

S2D2: Fast Decoding for Diffusion LLMs via Training-Free Self-Speculation

S2D2:通过免训练自我推测实现扩散LLM的快速解码

Ligong Han, Hao Wang, Han Gao, Kai Xu, Akash Srivastava

机构 * Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Iowa State University(爱荷华州立大学) Core AI, IBM(IBM核心AI)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出S2D2,一种免训练的自我推测解码框架,通过将块扩散模型在块大小为1时变为自回归模型,实现草稿与验证角色复用,在不增加训练或测试计算下提升解码速度与准确性。

Comments Code is available at https://github.com/phymhan/S2D2

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20455 2026-06-19 math.OC 版本更新 78%

Time-Reversed BSDEs for Accurate Gradient Estimation in Diffusion Models

时间反向BSDE用于扩散模型中的精确梯度估计

Yuhang Mei, Amirhossein Taghvaei

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对扩散模型微调中梯度估计不稳定问题,提出基于时间反向BSDE的自适应伴随过程,降低方差并提高稳定性。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05533 2026-06-19 cs.AI 版本更新 78%

Conditional Diffusion Guidance under Hard Constraint: A Stochastic Analysis Approach

硬约束下的条件扩散引导:一种随机分析方法

Zhengyi Guo, Wenpin Tang, Renyuan Xu

机构 * Department of Industrial Engineering and Operations Research, Columbia University(哥伦比亚大学工业工程与运营管理系) Department of Management Science and Engineering, Stanford University(斯坦福大学管理科学与工程系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出基于Doob h-变换和鞅表示的条件扩散引导框架,通过鞅损失和鞅协方差损失学习条件函数梯度,确保硬约束满足并给出非渐近保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16233 2026-06-19 cs.SI cs.AI 版本更新 78%

Policy-Embedded Graph Expansion: Networked HIV Testing with Diffusion-Driven Network Samples

策略嵌入图扩展:基于扩散驱动网络样本的网络化HIV检测

Akseli Kangaslahti, Davin Choo, Lingkai Kong, Milind Tambe, Alastair van Heerden, Cheryl Johnson

机构 * Harvard University(哈佛大学) University of Witwatersrand(沃特瓦特斯兰大学) Wits Health Consortium(沃茨健康联盟) World Health Organization(世界卫生组织)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出策略嵌入图扩展(PEGE)框架,将图扩展的生成分布直接嵌入决策策略,结合基于扩散的图扩展模型DDB,在真实HIV传播网络上实现优于基线17.3%的折扣奖励和15.4%的检测提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12870 2026-06-19 cs.CE 版本更新 78%

Text2Structure3D: Graph-Based Generative Modeling of Equilibrium Structures with Diffusion Transformers

Text2Structure3D: 基于扩散变换器的图生成建模平衡结构

Lazlo Bleker, Zifeng Guo, Kaleb E. Smith, Kam-Ming Mark Tam, Karla Saldaña Ochoa, Pierluigi D'Acunto

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出Text2Structure3D,结合潜在扩散、变分图自编码器和图变换器,从自然语言提示生成接近平衡状态的结构图,并通过残余力优化确保完全满足静力平衡。

Journal ref Results in Engineering 31 (2026) 111375

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12307 2026-06-19 math.NA cs.NA 版本更新 78%

Fully mixed virtual element schemes for a new model of steady-state poroelastic stress-assisted diffusion in the brain

脑稳态孔隙弹性应力辅助扩散新模型的完全混合虚拟元方案

Isaac Bermudez, Bryan Gomez-Vargas, Kent-Andre Mardal, Andres E. Rubiano, Ricardo Ruiz-Baier

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出完全混合虚拟元法求解线性孔隙弹性与应力依赖非线性扩散的耦合问题,通过解耦不动点策略证明解存在性,并建立先验误差估计,数值实验验证了最优收敛性和参数鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04081 2026-06-19 cs.NI 版本更新 78%

Graph Diffusion-Based AeBS Deployment and Resource Allocation in RSMA-Enabled URLLC Low-Altitude Wireless Networks

基于图扩散的RSMA使能URLLC低空无线网络中AeBS部署与资源分配

Xudong Wang, Lei Feng, Jiacheng Wang, Hongyang Du, Changyuan Zhao, Wenjing Li, Ping Zhang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对低空无线网络中频谱受限和同频干扰问题,提出基于速率分割多址接入(RSMA)的传输设计,并利用生成式图扩散模型联合优化AeBS部署、用户关联和资源分配,以最大化总速率和覆盖率。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01565 2026-06-19 cs.LG cs.DC 版本更新 67%

TetriServe: Efficiently Serving Mixed DiT Workloads

TetriServe: 高效服务混合DiT工作负载

Runyu Lu, Shiqi He, Wenxuan Tan, Shenggui Li, Ruofan Wu, Jeff J. Ma, Ang Chen, Mosharaf Chowdhury

机构 * University of Michigan(密歇根大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract)

AI总结 针对混合分辨率与截止时间的异构DiT工作负载,提出基于步骤级序列并行的TetriServe系统,通过轮次调度与自适应并行度,在保证图像质量下将SLO达成率提升32%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17006 2026-06-19 cs.CV cs.RO 版本更新 57%

CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning

CoMo: 从互联网视频中学习连续潜在运动以实现可扩展的机器人学习

Jiange Yang, Yansong Shi, Haoyi Zhu, Mingyu Liu, Kaijing Ma, Yating Wang, Gangshan Wu, Tong He, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Lab(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Fudan University(复旦大学) Tongji University(同济大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出CoMo方法,通过早期时间差分和时序对比学习从互联网视频中学习连续潜在运动,避免离散化信息损失,实现零样本泛化生成伪动作标签,联合训练策略在仿真和真实实验中表现优异。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15228 2026-06-19 cs.CV 版本更新 57%

Collaborative Multi-Modal Coding for High-Quality 3D Generation

协作多模态编码用于高质量3D生成

Ziang Cao, Zhaoxi Chen, Liang Pan, Ziwei Liu

机构 * S-Lab, Nanyang Technological University, Singapore(南洋理工大学S实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出TriMM,首个前馈式3D原生生成模型,通过协作多模态编码融合RGB、RGBD和点云特征,结合辅助2D/3D监督和三平面潜在扩散模型,实现高质量3D资产生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02989 2026-06-19 cs.IT eess.SP math.IT stat.ML 版本更新 50%

Information Theory and Statistical Learning

信息论与统计学习

Abbas El Gamal

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文是Cover & Thomas《信息论基础》第三版的章节预印本,系统介绍了散度度量在模型训练中的作用,涵盖线性回归、生成扩散模型等,并给出了扩散模型更系统的推导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00271 2026-06-19 cs.RO 版本更新 50%

Learn from What We HAVE: History-Aware VErifier that Reasons about Past Interactions Online

从我们所拥有的学习:在线推理过去交互的历史感知验证器

Yishu Li, Xinyi Mao, Ying Yuan, Kyutae Sim, Ben Eisner, David Held

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出历史感知验证器HAVE,通过解耦动作生成与验证,利用历史交互在线消除歧义,理论证明其提升期望动作质量,在多个模拟和真实环境中验证有效性。

Comments CoRL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 可控生成 1 篇

2602.15819 2026-06-19 cs.CV 版本更新 57%

VideoSketcher: Sequential Sketch Generation Using Video Model Priors

VideoSketcher:利用视频模型先验的序列草图生成

Hui Ren, Yuval Alaluf, Omer Bar Tal, Alexander Schwing, Antonio Torralba, Yael Vinker

机构 * MIT(麻省理工学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出VideoSketcher方法,结合LLM的语义规划与视频扩散模型的时序渲染,通过两阶段微调从少量样本学习笔画顺序与风格,生成高质量序列草图。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 1 篇

2506.06952 2026-06-19 cs.CV 版本更新 57%

LaTtE-Flow: Layerwise Timestep-Expert Flow-based Transformer

LaTtE-Flow: 基于层间时间步专家流的Transformer

Ying Shen, Zhiyang Xu, Jiuhai Chen, Shizhe Diao, Jiaxin Zhang, Yuguang Yao, Joy Rimchala, Ismini Lourentzou, Lifu Huang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Maryland(马里兰大学) Nvidia(英伟达) Salesforce AI Research(Salesforce AI研究) Intuit AI Research(Intuit AI研究)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 提出LaTtE-Flow,一种基于预训练视觉语言模型的高效统一架构,通过层间时间步专家流和条件残差注意力机制,实现图像理解与生成,生成速度提升约6倍。

Comments Unified multimodal model, Flow-matching

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他图像生成 1 篇

2605.10898 2026-06-19 cs.HC 版本更新 71%

How Creatives Approach GenAI Image Generation: Tensions Between Structured Guidance, Self-Experimentation, and Creative Autonomy

创意人士如何接近生成式AI图像生成:结构化指导、自我实验与创意自主之间的张力

Haidan Liu, Isabelle Kwan, Taiga Okuma, Jeffrey Loverock, Nicholas Vincent, Parmit K Chilana

专题命中 其他图像生成 :image generation(title)

AI总结 研究探讨创意人士在使用生成式AI图像工具时如何平衡结构化指导与自我实验,发现尽管指导有助于理解AI,但许多人仍倾向于自我探索以保持创意自由。

Comments Accepted at ACM Creativity & Cognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏