arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-03 至 2026-07-03 共收录 28 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 3 篇

2511.17089 2026-07-03 cs.CV cs.AI 版本更新 70%

Spanning Tree Autoregressive Visual Generation

生成树自回归视觉生成

Sangkyu Lee, Changho Lee, Janghoon Han, Hosung Song, Tackgeun You, Hwasup Lim, Stanley Jungkyu Choi, Honglak Lee, Youngjae Yu

机构 * Yonsei University(延世大学) Korea Institute of Science and Technology(韩国科学技术院) LG AI Research(LG人工智能研究) University of Michigan(密歇根大学) Seoul National University(首尔国立大学)

专题命中 图像编辑 :image editing(abstract);inpainting(abstract);分类 cs.CV

AI总结 提出生成树自回归(STAR)建模,通过均匀生成树的遍历顺序在保持采样性能的同时提供灵活序列顺序,支持图像编辑。

Comments Published as a main conference paper at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05778 2026-07-03 cs.CV 版本更新 57%

Beyond Absolute Scores: Relative Edit-induced Difference for Generalizable Image Aesthetic Assessment

超越绝对分数:基于编辑诱导差异的通用图像美学评估

Qifei Jia, Xintong Yao, Yasen Zhang, Minghao Li, Yajie Chai, Qiming Lu, Baoyue Shen, Runyu Shi, Ying Huang, Yue Zhang

机构 * Xiaomi Corporation, Beijing, China(小米公司,北京,中国)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出RED-Aes框架,利用可控图像编辑模型模拟人类审美推理,通过相对编辑诱导差异学习通用美学原则,实现跨场景泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01521 2026-07-03 cs.CV 版本更新 57%

MiraGe: Editable 2D Images using Gaussian Splatting

MiraGe: 使用高斯溅射的可编辑2D图像

Joanna Waczyńska, Tomasz Szczepanik, Piotr Borycki, Sławomir Tadeja, Thomas Bohné, Przemysław Spurek

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出MiraGe方法,利用镜面反射在3D空间中感知2D图像,并通过平面控制的高斯函数实现精确编辑,提升渲染质量并支持物理仿真修改。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 扩散模型 18 篇

2512.23426 2026-07-03 cs.CV 版本更新 85%

Direct Diffusion Score Preference Optimization via Stepwise Contrastive Policy-Pair Supervision

直接扩散分数偏好优化:通过逐步对比策略对监督

Dohyun Kim, Seungwoo Lyu, Seung Wook Kim, Paul Hongsuck Seo

机构 * Dept. of CSE, Korea University(韩国大学计算机科学与工程系) NVIDIA

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出DDSPO方法,通过对比策略对直接监督反向去噪步骤,无需奖励建模或人工标注,在文本-图像对齐和美学质量任务上优于现有方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28417 2026-07-03 cs.CV 版本更新 83%

DiffRGD: An Inference-Time Diffusion Guidance Through Riemannian Gradient Descent

DiffRGD:通过黎曼梯度下降的推理时扩散引导

Jia-Wei Liao, Li-Xuan Peng, Mei-Heng Yueh, Min Sun, Cheng-Fu Chou, Jun-Cheng Chen

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出DiffRGD框架,通过黎曼梯度下降在球流形上求解约束优化,保持潜在高斯分布,提升图像恢复与条件生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02657 2026-07-03 cs.LG cs.AI 版本更新 82%

Locality-Aware Continual Unlearning for Diffusion Models

面向扩散模型的局部感知持续遗忘学习

Naveen George, Naoki Murata, Yuhta Takida, Konda Reddy Mopuri, Yuki Mitsufuji

机构 * Indian Institute of Technology Hyderabad(印度海得拉巴印度理工学院) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

AI总结 提出局部感知持续遗忘框架,通过局部感知目标选择和局部感知回放机制,解决扩散模型在连续概念移除中的性能崩溃问题,在10步顺序遗忘中保持高相关保留和通用保留。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11437 2026-07-03 cs.CV cs.HC 版本更新 79%

Hi-DREAM: Brain-Inspired Hierarchical Diffusion for fMRI-to-Image Reconstruction via ROI Encoder and VisuAl Mapping

Hi-DREAM: 基于脑启发的层次化扩散用于fMRI到图像重建,通过ROI编码器和视觉映射

Guowei Zhang, Yun Zhao, Kai Sun, Moein Khajehnejad, Adeel Razi, Dinh Phung, Levin Kuhlmann

机构 * Dept of Data Science and AI, Monash University, Melbourne, Australia(数据科学与人工智能系,墨尔本大学,澳大利亚) School of Psychological Sciences, Monash University, Melbourne, Australia(心理学科学学院,墨尔本大学,澳大利亚) Brain and Mind Centre, University of Sydney, Sydney, Australia(脑与心智中心,悉尼大学,澳大利亚)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Hi-DREAM框架,利用层次化扩散模型,通过ROI适配器将早期、中期和晚期视觉ROI流转换为多尺度皮层金字塔,并用轻量级ROI条件ControlNet注入解剖先验,在NSD数据集上实现最先进的高层语义重建和强低层结构。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05624 2026-07-03 cs.AI 版本更新 78%

ADMC: Attention-based Diffusion Model for Missing Modalities Feature Completion

ADMC: 基于注意力扩散模型的缺失模态特征补全

Yuhan Li, Wei Zhang, Juan Chen, Jiangjia Yan, Peng Xiangli, Liangze Yin

机构 * National University of Defense Technology(国防科学技术大学) The Fifth Electronic Research Institute of MIIT(信息产业部第五电子研究所) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology Beijing(北京科技大学) Hunan University(湖南大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出基于注意力扩散的缺失模态特征补全方法,通过独立训练各模态特征网络避免过耦合,利用注意力扩散网络生成与真实分布一致的缺失模态特征,在IEMOCAP和MIntRec基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04015 2026-07-03 cs.DL 版本更新 71%

Examining persistence of European open repository infrastructure and its diffusion in the scholarly record

欧洲开放仓储基础设施的持久性及其在学术记录中的扩散研究

George Macgregor, Joy Davidson

专题命中 扩散模型 :diffusion(title)

AI总结 通过整合仓储注册数据和网络抓取信息,评估欧洲仓储的持久性,发现超过20%的仓储已“死亡”,约1.2万篇学术作品引用了无法检索的仓储内容,并提出了政策干预建议。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19226 2026-07-03 cs.CV 版本更新 57%

Under One Sun: Multi-Object Generative Perception of Materials and Illumination

同一太阳下:材质与光照的多物体生成式感知

Nobuo Yoshii, Xinran Nicole Han, Ryo Kawahara, Todd Zickler, Ko Nishino

机构 * Kyoto University(京都大学) Harvard University(哈佛大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出MultiGP生成式逆渲染方法,利用同一场景物体共享光照的共识,从单张图像中随机采样反射率、纹理和光照,通过级联架构、协调调度、轴向注意力和纹理提取控制网络实现解耦。

Comments ECCV2026. Project page: https://vision.ist.i.kyoto-u.ac.jp/research/onesun/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10083 2026-07-03 cs.CV 版本更新 57%

A locally statistical active contour model for SAR image segmentation can be solved by denoising algorithms

一种可由去噪算法求解的局部统计活动轮廓模型用于SAR图像分割

Guangming Liu

机构 * Yantai Science and Technology Association(烟台科技协会)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出基于I散度-TV去噪模型的局部统计活动轮廓模型,融合GAC和ACWE模型,用于分割乘性伽马噪声图像,并通过反应扩散方程和ROF模型转化实现快速求解。

Comments 19 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03056 2026-07-03 cs.AI 版本更新 50%

SkillDAG: Self-Evolving Typed Skill Graphs for LLM Skill Selection at Scale

SkillDAG:面向大规模LLM技能选择的自演化类型化技能图

Tong Bai, Zhenglin Wan, Pengfei Zhou, Xingrui Yu, Yang You, Ivor W. Tsang

机构 * Fudan University(复旦大学) National University of Singapore(国立新加坡大学) CFAR A*STAR

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出SkillDAG,通过类型化有向图建模技能间关系,并作为推理时可调用的结构化检索接口,支持在线演化,在ALFWorld和SkillsBench上显著超越基线。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25098 2026-07-03 physics.optics physics.comp-ph 版本更新 50%

Resolved Anderson localization of light in dense three-dimensional dielectric disorder

介质无序中光的三维安德森局域化

Yevgen Grynko, Jens Förstner

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过大规模时域模拟,从动力学、光谱和实空间特征证明高折射率介质无序系统中存在三维安德森局域化矢量电磁模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12448 2026-07-03 astro-ph.HE astro-ph.GA gr-qc hep-th 版本更新 50%

Precessing Black Hole Jets and Galactic Fossils

盘旋黑洞喷流与银河化石

Maria J. Rodriguez

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出银河中心γ射线过剩现象与费米和eROSITA气泡是SgrA*过去活动的化石印记,通过盘旋抛物线Blandford-Znajek喷流解释其形成机制和贡献。

Comments 44 pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09007 2026-07-03 cond-mat.mtrl-sci 版本更新 50%

Metadynamics for Vacancy Dynamics in Crystals

晶体中空位动力学的元动力学方法

Kazuaki Toyoura, Shunya Yamada

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出基于元动力学的空位自由能面构建方法,利用平行偏置元动力学与分族策略,无需定义唯一空位坐标或引入强控制拓扑的参数,通过多山策略提升效率,验证了其在金属和离子晶体中自扩散和杂质扩散的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08436 2026-07-03 cond-mat.stat-mech cond-mat.dis-nn cond-mat.soft math.PR 版本更新 50%

Exact Stationary State of a $d$-dimensional Run-and-Tumble Particle in a Harmonic Potential

谐波势中$d$维跑-颠簸粒子的精确稳态

Mathis Guéneau, Satya N. Majumdar, Grégory Schehr

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文推导了各向同性谐波陷阱中$d$维跑-颠簸粒子的精确非平衡稳态,通过旋转对称性降维,利用Kesten型递归得到一维广义陷阱粒子的封闭解,并重构了径向分布和联合分布,揭示了持久性控制的形状转变。

Comments 38 pages, 11 figures

Journal ref Phys. Rev. E 114, 014144 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05800 2026-07-03 math.NA cs.NA 版本更新 50%

A Perturbation-Correction Method Based on Local Randomized Neural Networks for Quasi-Linear Interface Problems

基于局部随机神经网络的扰动校正方法用于拟线性界面问题

Siyuan Lang, Zhiyue Zhang

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对拟线性椭圆界面问题,提出一种局部随机神经网络扰动校正方法(LRaNN-PC),通过主阶段和扰动校正阶段缓解非凸目标泛函导致的停滞,数值实验显示相对L2误差降低4-7个数量级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11606 2026-07-03 cs.SD cs.LG eess.SP 版本更新 50%

Scaling to Multimodal and Multichannel Heart Sound Classification with Synthetic and Augmented Biosignals

利用合成与增强生物信号实现多模态和多通道心音分类的规模化

Milan Marocchi, Matthew Fynn, Kayapanda Mandana, Yue Rong

机构 * School of Electrical Engineering, Computing, and Mathematical Sciences (EECMS), Faculty of Science and Engineering, Curtin University, Bentley, WA 6102, Australia(电气工程、计算与数学科学学院(EECMS),科学与工程学院, Curtin 大学,Bentley,WA 6102,澳大利亚)

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对心音分类中同步和多通道数据集有限的问题,提出结合传统信号处理与去噪扩散模型生成增强数据,微调Wav2Vec 2.0分类器,在多个数据集上取得最优性能。

Comments 35 pages, 37 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05941 2026-07-03 cs.RO 版本更新 50%

Latent Policy Barrier: Learning Robust Visuomotor Policies by Staying In-Distribution

潜在策略屏障:通过保持分布内学习鲁棒的视觉运动策略

Zhanyi Sun, Shuran Song

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出潜在策略屏障(LPB)框架,通过将专家演示的潜在嵌入作为隐式屏障,分离精确模仿与分布外恢复,利用基础扩散策略和动力学模型提升视觉运动策略的鲁棒性和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16275 2026-07-03 math.ST stat.TH 版本更新 50%

Semiparametric Bernstein-von Mises theorems for reversible diffusions

可逆扩散的半参数Bernstein-von Mises定理

Matteo Giordano, Kolyan Ray

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对周期可逆多维扩散模型,建立了基于连续观测的贝叶斯非参数先验的半参数Bernstein-von Mises定理,并应用于高斯和Besov-Laplace先验,验证了其有效性和不确定性量化。

Comments 43 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04357 2026-07-03 math.AT 版本更新 50%

Circular Max-Flow for Periodic Data via Reeb Graphs

基于Reeb图的周期数据环形最大流

Matteo Pegoraro, Lisbeth Fajstrup

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对周期性边界条件数据,利用Reeb图将空间几何简化为有向一维隧道网络,并引入容量约束定义环形最大流,通过线性优化求解,无需指定进出口。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 可控生成 7 篇

2604.01761 2026-07-03 cs.CV 版本更新 79%

Control-DINO: Feature Space Conditioning for Controllable Image-to-Video Diffusion

Control-DINO:用于可控图像到视频扩散的特征空间条件

Edoardo A. Dominici, Thomas Deixelberger, Konstantinos Vardis, Markus Steinberger

机构 * Huawei Technologies, Switzerland(华为技术(瑞士)) Huawei Technologies, Austria(华为技术(奥地利)) Graz University of Technology, Austria(格拉茨技术大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Control-DINO,通过解耦外观与其他特征,实现对视频扩散模型的可控生成,提升生成渲染的可控性。

Comments ECCV 2026 - Project Page https://dedoardo.github.io/projects/control-dino/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01390 2026-07-03 cs.CV cs.AI cs.MM 版本更新 62%

SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment

SEPS:面向细粒度跨模态对齐的语义增强补丁精简框架

Xinyu Mao, Junsi Li, Haoji Zhang, Yu Liang, Ming Sun

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV、cs.MM

AI总结 提出SEPS框架,通过两阶段机制整合稠密与稀疏文本语义,识别显著视觉补丁,并利用相关性感知选择与均值计算突出关键补丁-词对应,提升跨模态相似度评估,在Flickr30K和MS-COCO上rSum提升23%-86%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24969 2026-07-03 cs.CV 版本更新 57%

PASDiff: Physics-Aware Semantic Guidance for Joint Real-World Low-Light Face Enhancement and Restoration

PASDiff: 面向真实世界低光人脸增强与恢复的物理感知语义引导

Yilin Ni, Wenjie Li, Zhengxue Wang, Juncheng Li, Guangwei Gao, Jian Yang

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) Beijing University of Posts and Telecommunications(北京邮电大学) PCA Lab, Nanjing University of Science and Technology(南京理工大学PCA实验室) East China Normal University(华东师范大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出PASDiff,一种无需训练的物理感知语义扩散模型,通过逆强度加权和Retinex理论引入光度约束,并利用风格无关结构注入从现成人脸先验中提取结构,在真实低光人脸增强上实现自然光照、色彩恢复和身份一致性的优越平衡。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12770 2026-07-03 cs.CV 版本更新 57%

One-Shot Feed-Forward 360$^{\circ}$ Animatable Avatar via Inpainted UV-Space Gaussian Modeling

通过修补UV空间高斯建模的一次前馈360度可动画化头像

Shuling Zhao, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zeekr Automobile R&D Co., Ltd(Zeekr汽车研发有限公司)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 提出一种基于UV空间高斯建模的一次前馈框架,利用预训练3D GAN的先验知识修补缺失区域,实现360度全头可动画化头像的高质量重建与实时动画。

Comments Accepted by ECCV 2026. Project page: https://shaelynz.github.io/fhavatar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01204 2026-07-03 cs.CV 版本更新 57%

TabletopGen: Tabletop Scene Generation and Interactive Simulation for Robotic Manipulation

TabletopGen: 桌面场景生成与机器人操作的交互式仿真

Ziqian Wang, Yonghao He, Licheng Yang, Wei Zou, Hongxuan Ma, Liu Liu, Wei Sui, Yuxin Guo, Hu Su

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院多模态人工智能系统国家重点实验室) D-Robotics Horizon Robotics

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 提出TabletopGen,一种无需训练的全自动桌面场景生成与交互仿真引擎,通过实例提取、位姿对齐和物理仿真生成可交互场景,用于机器人操作数据合成。

Comments Project page: https://d-robotics-ai-lab.github.io/TabletopGen.project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08580 2026-07-03 math.OC cs.LG 版本更新 50%

Adjoint Matching through the Lens of the Stochastic Maximum Principle in Optimal Control

通过随机最大原理视角的伴随匹配

Carles Domingo-Enrich, Jiequn Han

机构 * Microsoft Research New England(微软研究院新英格兰) Flatiron Institute(熨斗研究所)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文基于随机最优控制问题,重新推广并严谨推导了伴随匹配方法,将其置于随机最大原理基础上,提出通用Hamiltonian伴随匹配目标,并展示其在连续时间下的实现方法,为随机控制问题提供新的可实施目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18368 2026-07-03 cs.RO 版本更新 50%

Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation

学习多任务机器人操作的语义原子技能

Yihang Zhu, Weiqing Wang, Shijie Wu, Ye Shi, Jingya Wang

机构 * ShanghaiTech University(上海科技大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出AtomSkill框架,通过语义对比对齐和关键姿态想象,从演示中学习可重用原子技能,实现多任务机器人操作,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏