arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-13 至 2026-07-13 共收录 45 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 38 篇

2601.21764 2026-07-13 math.NA cs.NA math.OC 版本更新 50%

Solving Hamilton-Jacobi equations by residual minimization of monotone finite-difference discretizations

通过最小化单调离散化的残差来求解哈密顿-雅可比方程

Olivier Bokanowski, Carlos Esteve-Yagüe, Richard Tsai

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种求解哈密顿-雅可比方程的新方法,通过最小化残差来保证解的唯一性和稳定性,并扩展到椭圆和抛物型问题,同时提供了后验误差估计和多级预热策略。

Comments 48 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24553 2026-07-13 cond-mat.stat-mech 版本更新 50%

Energetics of stochastic limit-cycle oscillators: when does coupling reduce dissipation?

随机极限环振子的能量学:当耦合减少耗散时是什么情况?

Anton F. Burnet, Vansh Kharbanda, David Tobias, Benedikt Sabass

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究随机极限环振子的能耗,探讨耦合如何影响耗散,发现Cartesian耦合在不同条件下均能降低耗散。

Comments 29 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16966 2026-07-13 cs.CR cs.AI 50%

Visual Inception: Compromising Long-term Planning in Agentic Recommenders via Multimodal Memory Poisoning

视觉 inception:通过多模态记忆污染在代理推荐系统中妥协长期规划

Jiachen Qian

机构 * City University of Hong Kong(香港城市大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出视觉 inception 攻击,通过污染用户上传的图片在代理推荐系统中影响长期规划,提出 CognitiveGuard 防御框架以降低攻击风险。

Comments 17 pages, 6 figures, 16 tables

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 20846-20862, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19037 2026-07-13 astro-ph.HE 版本更新 50%

Non-Markovian Cosmic-Ray Pitch-Angle Transport from Mirror Interactions

非马尔可夫ian宇宙射线 pitch 角输运来自镜像相互作用

Kai Yan, Huirong Yan, Parth Pavaskar, Chuanpeng Hou, Ruo-Yu Liu

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究揭示了磁流体动力学湍流中宇宙射线 pitch 角输运由磁镜效应与回旋共振散射的相互作用主导,发现大pitch角粒子受镜像陷阱和回旋共振逃逸共同调节,输运特性从异常扩散转为正常扩散。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03202 2026-07-13 eess.IV 版本更新 50%

Quality assurance of the Federal Interagency Traumatic Brain Injury Research (FITBIR) database for multi-site MRI analysis

用于多站点MRI分析的联邦跨部门创伤性脑损伤研究(FITBIR)数据库的质量保证

Adam M. Saunders, Michael E. Kim, Gaurav Rudravaram, Elyssa M. McMaster, Chloe Scholten, Sequoia Wade, Marselle Rasdall, Simon Vandekar, Tonia S. Rex, François Rheault, Bennett A. Landman

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对FITBIR数据库,将其结构和扩散MRI及相关信息整理统一,用UNesT分割分析指标,经质量保证后用GAMLSS建模,发现TBI受试者与对照组相比,15个脑区体积有显著差异。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20078 2026-07-13 math.PR 版本更新 50%

Propagation of chaos in Fisher information

费希尔信息中的混沌传播

Jules Grass, Arnaud Guillin, Christophe Poquet

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究具有光滑相互作用和漂移粒子在费希尔信息中的混沌传播,利用新引理及精细估计,通过BBGKY层次结构得到微分不等式系统,实现混沌传播推广,且通过高斯例子证明衰减率最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19947 2026-07-13 q-bio.BM cond-mat.soft 版本更新 50%

Modeling multiscale architecture of biofilm extracellular matrix and its role in oxygen transport

生物膜胞外基质的多尺度结构建模及其在氧传输中的作用

Raghu K. Moorthy, Eoin Casey

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究生物膜胞外基质微观结构对氧传输的影响,通过开发多尺度“细胞-荚膜”连续体模型,结合反应扩散框架和几何特征量化其作用,发现离散荚膜相降低氧可用性,荚膜厚度和基质压实共同控制相关因子,为生物膜模拟提供新框架。

Comments 5 figures, 3 tables; typos corrected, 1 table added, 1 more discussion subsection added, references added

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17724 2026-07-13 physics.chem-ph 版本更新 50%

Non-equilibrium state during proton-deuteron exchange at a liquid-liquid interface

液-液界面质子-氘核交换过程中的非平衡态

Tillmann Buttersack, Niclas Sven Mueller, Giulia Carini, Henrik Haak, Hanna Bordyuh, Dipali Singh, Sandy Gewinner, Marco De Pas, Wieland Schöllkopf, Martin Wolf, Hendrik Bluhm, Nils Huse, Bernd Winter, Gerard Meijer, Alexander Paarmann

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究液-液界面质子-氘核交换,用快速流动液体平面射流结合红外光谱成像定量测量HDO形成,揭示早期非平衡态,提取反应速率常数,为研究广泛化学反应的快速动力学提供方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 3 篇

2607.08879 2026-07-13 cs.CV 新提交 70%

Decoupled Illumination Priors for Spatially Controllable Multi-View Indoor Scene Relighting

用于空间可控多视图室内场景重光照的解耦光照先验

Chenjian Gao, Linning Xu, Tianfan Xue

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港研发平台下的CPII)

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 研究室内场景重光照问题,提出Lume-Palette框架,通过将重光照解耦为光照蒸馏和投射两阶段,并引入不对称多视图条件策略,实现了逼真、空间可控且多视图一致的重光照效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09362 2026-07-13 cs.CV cs.AI 新提交 57%

CtrlVTON: Controllable Virtual Try-On via Visual-Instance-Prompt Segmentation

CtrlVTON:通过视觉实例提示分割实现可控虚拟试穿

Seungyong Lee, Hyun Jun Jang, Sangoh Kim, Sungjoon Park

机构 * NXN Labs(NXN实验室) KAIST(韩国科学技术院)

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 研究旨在解决虚拟试穿中用户对服装穿着方式控制不足的问题。提出通过VIP - SAM解决视觉实例提示分割,引入CtrlVTON可控框架,将试穿转为图像编辑问题并添加分割掩码控制布局。二者在各自任务达先进水平,CtrlVTON能更忠实地遵循用户布局且保证服装逼真度。

Comments 13 + 17 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09024 2026-07-13 cs.CV cs.AI 新提交 57%

Video Generation Models are General-Purpose Vision Learners

视频生成模型是通用视觉学习者

Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu

机构 * Google DeepMind(谷歌DeepMind)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 研究探讨计算机视觉中实现通用模型的催化剂,提出大规模文本到视频生成是预训练范式。介绍GenCeption模型,利用视频生成扩散主干定义感知模型。实验表明该模型在多任务中性能领先,有数据效率优势且具涌现行为,为通用视觉智能提供基础路径。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 1 篇

2601.10037 2026-07-13 cs.ET 版本更新 50%

Parameter Efficient Machine Unlearning on Hybrid Resistive Memory based Compute-in-Memory Accelerators

基于混合电阻式内存的内存计算加速器上的参数高效机器遗忘

Ning Lin, Jichang Yang, Yangu He, Zijian Ye, Kwun Hang Wong, Xinyuan Zhang, Songqi Wang, Zihao Li, Yuxi Chen, Jiajia Zha, Wenxing Li, Yi Li, Kemi Xu, Leo Yu Zhang, Xiaoming Chen, Dashan Shang, Chaoliang Tan, Han Wang, Xiaojuan Qi, Zhongrui Wang

专题命中 个性化与一致性 :image generation(abstract)

AI总结 研究基于混合电阻式内存的计算加速器上的机器遗忘问题,提出硬件和软件协同设计方法,通过LoRA风格参数高效更新,将适应限制在数字参数,避免模拟权重重复编程,降低成本能耗,验证框架并展示其能实现高效部署后适应。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 效率与蒸馏 3 篇

2601.09881 2026-07-13 cs.CV cs.AI cs.LG 版本更新 57%

Transition Matching Distillation for Fast Video Generation

用于快速视频生成的过渡匹配蒸馏

Weili Nie, Julius Berner, Nanye Ma, Chao Liu, Saining Xie, Arash Vahdat

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究针对大型视频模型多步采样低效问题,提出过渡匹配蒸馏框架TMD,将扩散模型多步去噪轨迹与少步概率过渡过程匹配,分解扩散主干为组件,经实验验证TMD在速度和质量权衡上表现出色,优于现有蒸馏模型。

Journal ref Proc. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 4645-4655

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10915 2026-07-13 cs.CV cs.AI cs.LG 版本更新 57%

M4V: Multimodal Mamba for Efficient Text-to-Video Generation

M4V:用于高效文本到视频生成的多模态曼巴

Jiancheng Huang, Gengwei Zhang, Zequn Jie, Siyu Jiao, Yinlong Qian, Ling Chen, Yunchao Wei, Lin Ma

机构 * Meituan(美团) University of Technology Sydney(技术大学悉尼分校) Beijing Jiaotong University(北京交通大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究针对文本到视频生成计算量大的问题,引入多模态曼巴框架M4V。设计MM-DiM块,采用多模态令牌重新组合设计,增强时空一致性。实验表明,该框架能在降计算成本的同时生成高质量视频。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09336 2026-07-13 cs.LG cs.AI cs.RO 新提交 50%

Shortcut Trajectory Planning for Efficient Offline Reinforcement Learning

用于高效离线强化学习的捷径轨迹规划

Guanquan Wang, Yoshimasa Tsuruoka

机构 * The University of Tokyo(东京大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 研究针对离线强化学习中轨迹规划器的问题,提出捷径轨迹规划(STP)框架,将捷径模型作为轨迹生成器,单阶段训练条件捷径轨迹模型,支持可调推理,用增强可行性感知校正的评论家选候选计划,在多任务基准测试中性能强且简化训练管道。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏