arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-13 至 2026-08-13 共收录 26 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 2 篇

2608.10798 2026-08-13 cs.CV cs.AI cs.LG 版本更新 57%

Beyond Fixed Luminance: Towards Panchromatic and Orthochromatic Image Colorization

超越固定亮度:迈向全色与正色图像上色

Swarnim Maheshwari, Syed Imam Ali, Vineeth N. Balasubramanian

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 该研究针对固定亮度图像上色系统在正色摄影输入下不可靠的问题,提出基于基础图像编辑模型的亮度无关框架,结合混合灰度目标训练,提升了正色输入上色的鲁棒性并减少色彩伪影。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07826 2026-08-13 cs.CV 版本更新 57%

OpenVE-3M: A Large-Scale High-Quality Dataset for Instruction-Guided Video Editing

OpenVE-3M: 一种大规模高质量的指令引导视频编辑数据集

Haoyang He, Jie Wang, Jiangning Zhang, Zhucun Xue, Xingyuan Bu, Qiangpeng Yang, Shilei Wen, Lei Xie

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 OpenVE-3M是一个大规模高质量的指令引导视频编辑数据集,包含多种编辑类型,通过精心设计的数据管道生成,并展示了高效的5B模型在基准测试中的卓越性能。

Comments Accepted by ECCV'26. Project page: https://lewandofskee.github.io/projects/OpenVE

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 扩散模型 21 篇

2602.23783 2026-08-13 cs.CV 版本更新 89%

Diffusion Probe: Generated Image Result Prediction Using CNN Probes

扩散探针:利用CNN探针进行生成图像结果预测

Benlei Cui, Bukun Huang, Zhizeng Ye, Xuemei Dong, Tuo Chen, Hui Xue, Dingkang Yang, Longtao Huang, Jingqun Tang, Haiwen Hong

机构 * Alibaba Group(阿里巴巴集团) Laboratory for Statistical Monitoring and Intelligent Governance of Common Prosperity, School of Statistics and Data Science, Zhejiang Gongshang University(浙江工商大学统计与数据科学学院共同富裕统计监测与智能治理实验室) Southeast University(东南大学) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) ByteDance Inc.(字节跳动有限公司)

专题命中 扩散模型 :diffusion(title,summary_cn);text-to-image(abstract);分类 cs.CV

AI总结 本文提出Diffusion Probe框架,通过早期扩散交叉注意力分布预测最终图像质量,提升文本生成图像的效率与质量。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17585 2026-08-13 cs.CV 版本更新 83%

Pixel-Space Diffusion Transformers

像素空间扩散变换器

Renye Yan, Jikang Cheng, You Wu, Ling Liang, Wei Peng, Athanasios V. Vasilakos, Qingyu Zhao, Yu Zhang, Yimao Cai, Kilian M. Pohl, Guoying Zhao

机构 * Peking University(北京大学) Nanjing University(南京大学) Stanford University(斯坦福大学) Cornell University(康奈尔大学) University of Oulu(奥卢大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文探讨像素空间扩散变换器,针对潜在扩散模型的局限,研究直接对原始像素建模的像素空间扩散方法,介绍其在高维建模中的挑战与多模态建模优势,从多方面回顾pDiTs,总结方法、识别挑战并展望未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27345 2026-08-13 cs.CV 版本更新 79%

SCoPE: Sightline-Coordinate Positional Encoding for Video Diffusion Transformers

RayPE: 用于3D感知视频生成的射线空间位置编码

Minghao Yin, Jiahao Lu, Wenbo Hu, Wang Zhao, Shan Ying, Kai Han

机构 * The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科技大学) ARC Lab, Tencent(腾讯ARC Lab)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出RayPE,通过向自注意力注入6D Plücker坐标编码射线几何关系,提升视频扩散Transformer的3D一致性和相机可控性。

Comments Project page: https://visual-ai.github.io/scope/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07661 2026-08-13 cs.CV 版本更新 79%

Optimization-Guided Diffusion for Interactive Scene Generation

基于优化的扩散生成交互场景

Shihao Li, Naisheng Ye, Tianyu Li, Kashyap Chitta, Tuo An, Peng Su, Boyang Wang, Haiou Liu, Chen Lv, Hongyang Li

机构 * Beijing Institute of Technology(北京理工大学) OpenDriveLab at The University of Hong Kong(香港大学OpenDriveLab) Nanyang Technological University(南洋理工大学) NVIDIA Research(英伟达研究院) Yinwang Intelligent Tech. Co. Ltd.(银网智能科技有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出OMEGA框架,通过优化引导扩散过程生成符合物理和行为约束的多智能体驾驶场景,提升生成场景的真实性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02943 2026-08-13 cs.CV 版本更新 79%

TC-Padé: Trajectory-Consistent Padé Approximation for Diffusion Acceleration

TC-Padé:轨迹一致的Padé近似用于扩散加速

Benlei Cui, Shaoxuan He, Bukun Huang, Zhizeng Ye, Yunyun Sun, Longtao Huang, Hui Xue, Yang Yang, Jingqun Tang, Zhou Zhao, Haiwen Hong

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Zhejiang Gongshang University(浙江工商大学) ByteDance Intelligent Creation(字节跳动智能创作)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出轨迹一致的Padé近似方法,通过有理函数建模特征演变,实现低步数下的高效扩散模型加速。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12236 2026-08-13 cs.RO cs.AI cs.LG 版本更新 78%

TMRL: Diffusion Timestep-Modulated Pretraining Enables Exploration for Efficient Policy Finetuning

TMRL: 差分时间步调节预训练实现高效策略微调的探索

Matthew M. Hong, Jesse Zhang, Anusha Nagabandi, Abhishek Gupta

机构 * University of Washington(华盛顿大学) Amazon FAR(亚马逊FAR)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出TMRL框架,通过结合行为克隆预训练与强化学习微调,解决预训练中动作分布狭窄的问题,提升机器人策略微调的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29426 2026-08-13 cs.NI cs.LG 版本更新 78%

Diffusion-Guided Cooperative Policy Learning for Target Tracking Based on Underwater Mobile Agent Networks

基于监督扩散辅助多智能体强化学习的多水下机器人协作目标跟踪

Jiaao Ma, Chuan Lin, Guangjie Han, Shengchao Zhu, Zhenyu Wang, Chen An

机构 * Software College, Northeastern University(东北大学软件学院) Key Laboratory of Maritime Intelligent Network Information Technology, Ministry of Education, Hohai University(河海大学教育部海事智能网络信息技术重点实验室) College of Computer Science and Software Engineering, Hohai University(河海大学计算机与软件学院) College of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于监督扩散辅助多智能体强化学习(SDA-MARL)的多水下机器人协作目标跟踪方法,通过分层架构和创新算法解决非平稳性、稀疏奖励探索和水扰动鲁棒性等挑战,提升水下目标跟踪精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06491 2026-08-13 math.NA cs.NA 版本更新 78%

An explicit adaptive time-stepping scheme for superlinear stochastic diffusion systems

显式自适应时间步长方法在具有局部Lipschitz系数的随机扩散系统中的强收敛性

Xueqi Wen, Guozhen Li, Yuanping Cui, Xiaoyue Li

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种自适应时间步长方法,用于求解具有局部Lipschitz系数的随机扩散系统,实现了强收敛性,并通过实验验证了其计算效率的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03890 2026-08-13 math.CT 版本更新 78%

Categorical Diffusion of Weighted Lattices

加权格的范畴扩散

Robert Ghrist, Miguel Lopez, Paige Randall North, Hans Riess

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出加权格的范畴扩散框架,通过Lawvere拉普拉斯和Hodge-Lawvere定理,提供了一种离散时间谐波流用于信息聚合的构造方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.08911 2026-08-13 math.PR 版本更新 78%

Uniform convergence of conditional distributions for one-dimensional diffusion processes

一维扩散过程条件分布的一致收敛性

Guoman He, Hanjun Zhang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文针对一类带特殊边界的一维扩散过程,运用Doob的h变换证明其条件分布依两种范数指数收敛到唯一拟平稳分布,还讨论了条件经验测度的收敛速率,并用种群动力学实例验证结果。

Comments 23 pages. Comments welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10479 2026-08-13 cs.CV 版本更新 57%

Bridging Event Streams and DiT: Event-Guided Video Frame Interpolation

连接事件流与DiT:事件引导的视频帧插值

Guixu Lin, Yuyang Yu, Xiang Ji, Linyao Chen, Zhengwei Yin, Mengshun Hu, Mingdeng Cao, Shengfeng He, Yinqiang Zheng

机构 * The University of Tokyo(东京大学) South China University of Technology(华南理工大学) Wuhan University(武汉大学) Singapore Management University(新加坡管理大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于适配器的框架,将事件衍生提示融入预训练图像转视频扩散模型,利用IWEs与双向稀疏光流引导生成,提升视频帧插值质量,效果优于现有SOTA方法。

Comments https://joseph-lin-tech.github.io/BridgeEventDiT-VFI/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08672 2026-08-13 cs.GR cs.CG cs.NA math.NA 版本更新 57%

Adaptive Volumetric Parameterization of Simply Connected 3-Manifolds with Applications

单连通三维流形的自适应体积参数化及应用

Zhiyuan Lyu, Qiguang Chen, Lok Ming Lui, Gary P. T. Choi

专题命中 扩散模型 :diffusion(abstract);分类 cs.GR

AI总结 本文针对现有体积参数化方法不匹配三维流形形状导致畸变的问题,提出自适应体积参数化框架,含三类目标域设置与三步算法,可应用于多分辨率重网格化等任务,验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05474 2026-08-13 cs.CV 版本更新 57%

3D Scene Generation: A Survey

3D场景生成:一项综述

Haozhe Xie, Beichen Wen, Zhaoxi Chen, Fangzhou Hong, Ziwei Liu

机构 * S-Lab, Nanyang Technological University, Singapore(南洋理工大学S实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本综述系统梳理3D场景生成的四大范式方法,分析其技术基础与挑战,展望物理感知生成等方向,为该领域发展提供参考。

Comments Accepted by IJCV. Project Page: https://github.com/hzxie/Awesome-3D-Scene-Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02961 2026-08-13 cs.LG cond-mat.stat-mech cs.AI cs.SY eess.SY math.OC 版本更新 50%

Analytic Bridge Diffusions for Controlled Path Generation

用于受控路径生成的解析桥扩散方法

Michael Chertkov

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出可解析求解的LQ-GM-PID模型,将桥扩散转化为路径塑形的解析可控实验室,在多类路径生成任务中验证其有效性,可作为测试相关方法的参考模型。

Comments 62 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02168 2026-08-13 cs.LG 版本更新 50%

Empowering Credit Risk Detection in Weixin Pay with Billion-Scale Deep Graph Learning

基于十亿级深度图学习增强微信支付的信用风险检测

Xin Liu, Xiyuan Chen, Chenglong Wu, Xuan Zong, Jun Zhou, Dawei Cheng

机构 * Tongji University(同济大学) Tencent Inc.(腾讯公司)

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对微信支付十亿级用户信用风险检测需求,提出风险感知重叠子图学习框架,解决工业级GNN拓扑完整性损失问题,实验显示其性能优于现有策略。

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD '26), pp. 7679-7690, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22300 2026-08-13 physics.optics cond-mat.dis-nn cond-mat.mtrl-sci cond-mat.soft 版本更新 50%

Structural and physical properties of gyromorphs and disordered stealthy hyperuniform media

Gyromorphs与无序隐身超均匀介质的结构与物理性质

Murray Skolnick, Riccardo Franchi, Luca Dal Negro, Paul J. Steinhardt, Salvatore Torquato

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文证明gyromorphs实际上属于最弱超均匀性(III类),其物理性能(如光子带隙、透明度等)相比最强超均匀性(I类)的隐身超均匀介质有所退化,并通过谱格林矩阵方法验证了这一点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23553 2026-08-13 cond-mat.stat-mech math-ph math.MP math.PR 版本更新 50%

Skewness tunes the small-drift record rate of random walks and Lévy flights

偏度调节随机游走和莱维飞行的小漂移记录率

José Ricardo G. Mendonça

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究小正漂移随机游走的记录率,发现其随漂移趋于零而消失,且指数由稳定律的正性参数决定,偏度通过该参数调节指数。

Comments Preprint, 19 pages, 4 figures, 33 references. In the latest version the results are derived in greater detail

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03752 2026-08-13 cond-mat.soft 版本更新 50%

Continuous limit of a discrete stochastic model of cell migration

细胞迁移离散随机模型的连续极限

Nino Despeignes, Marc Durand

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过粗粒化离散晶格动力学,解析推导了一维细胞在恒定力和跑-停驱动力下的Cellular Potts模型连续极限,得到控制细胞大小和质心位置的Fokker-Planck方程,揭示了低力区的过阻尼Langevin动力学以及高力区的算法伪影,并证明Glauber动力学能缓解这些伪影。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10889 2026-08-13 hep-ph 版本更新 50%

Heavy-quark transport across the QCD crossover driven by a lattice-constrained in-medium potential

重夸克在QCD相变区域的输运受介子介质势约束

Wu Wang, Yuqi Luo, Fei Sun, Sa Wang, Jungang Deng, Wei Xie, Shuang Li, Kejun Wu

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一个自洽框架,研究重夸克在夸克胶子等离子体中穿过QCD相变区域的输运,通过统一相互作用核融合微扰和非微扰相互作用,避免传统软-硬动量分离尺度的依赖,揭示非微扰弦张力对介质极端不透明性的重要性。

Comments 13 pages, 7 figures

Journal ref Phys. Rev. D 114, 036014 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07182 2026-08-13 physics.app-ph 版本更新 50%

Physical mechanisms of ohmic contact and tunnel diode: A novel explanation in terms of impurity-photovoltaic-effect resulting from infrared self-emission at room-temperature

金属接触和隧道二极管的物理机制:一种基于红外自发光的杂质-光伏效应的新解释

Jianming Li

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文基于红外自发光和杂质-光伏效应,提出金属接触和隧道二极管的新解释,通过缺陷相关能级的子带隙激发产生载流子,从而形成反向电流。

Comments 4 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05588 2026-08-13 astro-ph.HE 版本更新 50%

Radiation GRMHD Models of Accretion onto Stellar-Mass Black Holes: III. Near-Eddington Accretion

辐射GRMHD模型中的恒星质量黑洞吸积:III. 近爱丁顿吸积

Lizhong Zhang, James M. Stone, Shane W. Davis, Yan-Fei Jiang, Patrick D. Mullen, Christopher J. White

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过求解包含完整辐射输运的GRMHD方程,研究了四个近爱丁顿黑洞吸积模型,揭示了磁场拓扑和黑洞自旋对吸积盘结构及喷流的影响。

Comments 29 pages, 24 figures, 3 tables, submitted to ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 可控生成 1 篇

2605.08784 2026-08-13 cs.CV 版本更新 57%

simpleposter: A simple baseline for product poster generation

simpleposter: 产品海报生成的一个简单基线

Benlei Cui, Fangao Zeng, Weitao Jiang, Yuwen Zhai, Haiwen Hong, Longtao Huang, Hui Xue, Wenxiang Shang, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出SimplePoster,一种基于修复的简单框架,实现产品外观忠实保留和精确文本布局控制,实验显示其在主体保留率和文本准确性上优于现有方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像修复 1 篇

2604.13309 2026-08-13 cs.RO 版本更新 78%

Utilizing Inpainting for Keypoint Detection for Vision-Based Control of Robotic Manipulators

利用图像修复进行基于视觉的机械臂运动控制的关键点检测

Sreejani Chatterjee, Venkatesh Mullur, Abhinav Gandhi, Berk Calli

机构 * Worcester Polytechnic Institute(沃斯彻斯特理工学院)

专题命中 图像修复 :inpainting(title,abstract)

AI总结 本文提出一种新的视觉伺服框架,通过纯自然视觉特征控制机械臂的配置空间。通过图像修复生成无标记的机械臂图像,训练关键点检测算法以实现基于自然特征的控制,无需依赖相机校准或机器人模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 1 篇

2608.02474 2026-08-13 cs.CV 版本更新 57%

EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation

EchoCache:面向高效音频驱动视频生成的能量引导跨模态缓存

Jiayu Chen, Xiaoyu Wu, Rongshan Gao, Maoliang Li, Zihao Zheng, Xinhao Sun, Hailong Zou, Guojie Luo, Xiang Chen

机构 * Peking University(北京大学) Taiyuan University of Technology(太原理工大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 EchoCache是一种能量引导跨模态缓存框架,通过利用音频时频能量锚点与动态缓存机制,在保持音频驱动视频生成质量的同时,实现了2.46倍的推理加速,优化了延迟-质量权衡。

Comments EchoCache is honored to be accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏