arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1764 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 82 篇

2604.02270 2026-07-02 cs.LG cs.AI 版本更新 50%

Crystalite: A Lightweight Transformer for Efficient Crystal Modeling

晶体:一种轻量级Transformer用于高效的晶体建模

Tin Hadži Veljković, Joshua Rosenthal, Ivor Lončarić, Jan-Willem van de Meent

机构 * UvA-Bosch Delta Lab(阿姆斯特丹大学-博世三角洲实验室) University of Amsterdam(阿姆斯特丹大学) Ruđer Bošković Institute(鲁杰尔·博斯科维奇研究所)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出Crystalite,一种轻量级扩散Transformer,通过子原子标记化和几何增强模块提升晶体建模效率,实现最佳晶体结构预测性能。

Comments 39 pages, 13 figures. Code available at: https://github.com/joshrosie/crystalite

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10263 2026-07-02 cs.RO cs.LG 版本更新 50%

From Prior to Pro: Efficient Skill Mastery via Distribution Contractive RL Finetuning

从先验到专家:通过分布收缩强化学习微调实现高效技能掌握

Zhanyi Sun, Shuran Song

机构 * Stanford University(斯坦福大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出DICE-RL框架,将强化学习作为分布收缩算子,通过在线反馈放大高成功行为,将预训练行为先验微调为高性能专家策略,实现稳定、样本高效的复杂操作技能掌握。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02415 2026-07-02 cond-mat.mtrl-sci 版本更新 50%

Efficient spin-pumping and spin transport across epitaxial Mn$_3$Sn(0001) noncollinear antiferromagnet/permalloy interfaces

高效自旋泵浦与跨 epitaxial Mn$_3$Sn(0001) 非列线反铁磁体/铁氧体界面的自旋传输

Surya N. Panda, Ning Mao, Nikolai Peshcherenko, Xiaolong Feng, Yang Zhang, Anastasios Markou, Claudia Felser, Edouard Lesne

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 研究通过系统分析 epitaxial Mn$_3$Sn 薄膜中的自旋电流生成及自旋-电荷转换现象,发现自旋霍尔角为0.9%,自旋霍尔电导率约为44.4 ($\hbar$/e) $\Omega^{-1}$.cm$^{-1}$,并观察到高自旋混合电导和界面自旋透明度。

Journal ref npj Spintronics 4, 17 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07175 2026-07-01 cs.RO 版本更新 50%

Continuous-Space Roadmap Generation for Mobile Robot Fleets with Distance Constraints and Geometry-Aware Discretization

面向距离约束与几何感知离散化的移动机器人车队连续空间路图生成

Marvin Rüdt, Constantin Enke, Kai Furmans

机构 * Institute for Material Handling and Logistics, Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院物流与物料搬运研究所)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出一种连续空间路图生成方法,通过凸角点与站点交互点布点、局部网格扩展离散化、机器人尺寸约束及运输需求驱动的K最短路径剪枝,实现高冗余、短路径与足够间距的路图,在多智能体拾取与交付任务中优于现有方法。

Comments Accepted for publication at the 31st IEEE International Conference on Emerging Technologies and Factory Automation (ETFA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11604 2026-06-29 cond-mat.mes-hall quant-ph 版本更新 50%

Quantization Mapping on Dirac Dynamics via Voltage-Driven Charge Density in Monolayer Graphene: A Klein Paradox and Entropy-Ruled Wavevector Mechanics Study

单层石墨烯中通过电压驱动电荷密度的狄拉克动力学量子化映射:克莱因悖论与熵控波矢力学研究

Karuppuchamy Navamani

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本研究通过电压驱动电荷密度的经验关系,利用微分熵控波矢力学对狄拉克材料进行能量量子化映射,揭示了克莱因悖论下的电子动力学,并发现量子态跃迁遵循N(k)=N(U)^3关系。

Comments 18 pages, 4 Figures, 3 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07533 2026-06-29 cs.AI 版本更新 50%

Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models

联合奖励建模:将思维链内化以实现高效的视觉奖励模型

Yankai Yang, Yancheng Long, Hongyang Wei, Wei Chen, Tianke Zhang, Kaiyu Jiang, Haonan Fan, Changyi Liu, Jiankang Chen, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Kuaishou Technology(快手科技)

专题命中 效率与蒸馏 :image editing(abstract)

AI总结 提出联合奖励建模(JRM),通过共享视觉-语言骨干联合优化偏好学习和语言建模,将生成模型的语义推理能力内化到判别表示中,实现快速准确评估,在MMRB2和EditReward-Bench上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13648 2026-06-26 math.PR cs.NA math.NA 版本更新 50%

Sticky CIR process with potential: invariant measure and exact sampling

具有势函数的粘性CIR过程:不变测度与精确采样

Tony Shardlow

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文研究了一维粘性CIR过程,该过程在[0,∞)上扩散,并在原点处具有粘性边界条件,出现在基于Hadamard-Langevin动力学的稀疏贝叶斯推断框架中。对于参数范围δ∈(1,2),其中原点可到达但不可吸收,证明了过程的良定性和不变测度的唯一性,该测度是零点质量与内部加权伽马型密度的混合。通过构造一个显式格林函数,用以构造零势情况下的精确采样器。对于非平凡势函数G,通过Girsanov测度变换建立倾斜不变测度的存在性和唯一性,并开发了两种采样算法:一种是修正的Metropolis-Hastings采样器,可精确采样目标不变测度;另一种是未调整的Langevin算法(ULA),每步成本较低但引入O(h)的偏差。数值实验验证了预测行为:Metropolis-Hastings采样器在所有步长下都能达到目标不变测度,而ULA表现出预期的O(h)偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12647 2026-06-23 astro-ph.HE physics.plasm-ph 版本更新 50%

Ballistic Surfing Acceleration as a Coherent Mechanism for Electron Acceleration in Galaxy Cluster Shocks

弹道冲浪加速作为星系团激波中电子加速的相干机制

Ji-Hoon Ha, Krzysztof Stasiewicz

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 针对星系团激波中电子加速效率低的问题,提出弹道冲浪加速(BSA)作为替代机制,推导平衡方程并模拟辐射,解释“香肠”和“牙刷”射电遗迹的观测特征。

Comments 10 pages, 3 figures, Accepted for publication in MNRAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15379 2026-06-17 stat.ML cs.LG math.PR math.ST stat.TH 版本更新 50%

Randomized Midpoint Method for Log-Concave Sampling under Constraints

对数凹分布约束采样的随机中点方法

Yifeng Yu, Shijie Zhang, Lu Yu

机构 * Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系) Artificial Intelligence Research Institute, Shenzhen MSU-BIT University(深圳MSU-BIT大学人工智能研究院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出约束域中过阻尼和动能朗之万扩散的随机中点离散化方法,通过投影算子建立统一框架,证明Wasserstein-q距离下的收敛保证并得到近最优下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10820 2026-06-11 cs.LG cs.AI cs.CL 版本更新 50%

K-Forcing: Joint Next-K-Token Decoding via Push-Forward Language Modeling

K-Forcing:通过前推语言建模进行联合下一K词解码

Zhiwei Tang, Yuanyu He, Yizheng Han, Wangbo Zhao, Jiasheng Tang, Fan Wang, Bohan Zhuang

机构 * DAMO Academy, Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出K-Forcing范式,通过前推映射将自回归模型蒸馏为单次前向传播生成多个未来词,实现2.4-3.5倍加速,质量损失小。

Comments Code: https://github.com/alibaba-damo-academy/K-Forcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13753 2026-06-11 math.AP 版本更新 50%

Strong solution for polymeric fluid-structure interaction with small initial acceleration

具有小初始加速度的聚合物流体-结构相互作用的强解

Prince Romeo Mensah

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 针对三维-三维-二维耦合的溶质-溶剂-结构三态系统,通过解耦和不动点论证构造了强解的唯一高阶正则性,并证明了移动域上Stokes问题的最大正则性结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08922 2026-06-09 cs.LG stat.ML 版本更新 50%

The Mirrored Influence Hypothesis: Efficient Data Influence Estimation by Harnessing Forward Passes

镜像影响假说:利用前向传播的高效数据影响估计

Myeongseob Ko, Feiyang Kang, Weiyan Shi, Ming Jin, Zhou Yu, Ruoxi Jia

机构 * Virginia Tech(弗吉尼亚理工大学) Columbia University(哥伦比亚大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出镜像影响假说,将训练数据对测试预测的影响转化为逆问题,通过测试样本梯度加训练样本前向传播高效估计数据影响,显著提升效率。

Comments The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2024

Journal ref The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09580 2026-06-08 cs.RO cs.LG 版本更新 50%

SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows

SERNF: 通过动作块评论家和归一化流实现样本高效的真实世界灵巧策略微调

Chenyu Yang, Denis Tarasov, Davide Liconti, Romain Guntz, Hehui Zheng, Robert K. Katzschmann

机构 * Soft Robotics Lab, D-MAVT(软机器人实验室,D-MAVT) ETH Zurich(苏黎世联邦理工学院)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出SERNF框架,结合归一化流策略和动作块评论家,实现真实世界灵巧操作策略的样本高效微调,解决多模态动作分布和信用分配问题。

Comments https://srl-ethz.github.io/SERNF/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他图像生成 11 篇

2607.16824 2026-07-22 cs.CV 版本更新 79%

Test-Time Registers as Global Priors for Tokenized Image Generation

作为令牌化图像生成全局先验的测试时寄存器

Cheng-Yao Hong, Yifan Wang, Yuewei Lin, Chenyu You

机构 * Stony Brook University(纽约州立大学石溪分校) Brookhaven National Laboratory(布鲁克海文国家实验室)

专题命中 其他图像生成 :image generation(title,abstract);分类 cs.CV

AI总结 研究在令牌化图像生成中,基于测试时寄存器特征低频集中度高及与DCT低频能量相关的发现,引入RegToken,通过三步将寄存器结构转换为全局先验令牌,插入生成管道可提升指标、加速优化,证明相关结构可作轻量级全局先验。

Comments 39 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00233 2026-07-09 quant-ph cs.CV cs.LG 版本更新 79%

Scaling Quantum Machine Learning without Tricks: Full-Resolution and Diverse Image Generation

无技巧扩展量子机器学习:全分辨率与多样图像生成

Jonas Jäger, Florian J. Kiwit, Carlos A. Riofrío

机构 * BMW Group, Munich, Germany(宝马集团,慕尼黑,德国) Department of Computer Science and Institute of Applied Mathematics, University of British Columbia (UBC), Vancouver, Canada(计算机科学系和应用数学研究所,不列颠哥伦比亚大学(UBC),温哥华,加拿大) Stewart Blusson Quantum Matter Institute (QMI), Vancouver, Canada(斯图尔特·布卢森量子物质研究所(QMI),温哥华,加拿大) Ludwig Maximilian University, Munich, Germany(路德维希-马克西米利安大学,慕尼黑,德国)

专题命中 其他图像生成 :image generation(title,abstract);分类 cs.CV

AI总结 研究如何在量子机器学习中无技巧地扩展,通过在经典MNIST和Fashion - MNIST数据集上训练量子瓦瑟斯坦GAN,实现全分辨率图像生成,还能扩展到彩色图像,分析了变分电路架构等因素对性能的影响,在多种条件下取得有前景成果。

Comments 29 pages, 17 figures, 3 tables. Main text: 17 pages, 10 figures. Appendix: 11 pages, 7 figures, 3 tables

Journal ref Quantum Sci. Technol. 11(3), 035042, (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10898 2026-06-19 cs.HC 版本更新 71%

How Creatives Approach GenAI Image Generation: Tensions Between Structured Guidance, Self-Experimentation, and Creative Autonomy

创意人士如何接近生成式AI图像生成:结构化指导、自我实验与创意自主之间的张力

Haidan Liu, Isabelle Kwan, Taiga Okuma, Jeffrey Loverock, Nicholas Vincent, Parmit K Chilana

专题命中 其他图像生成 :image generation(title)

AI总结 研究探讨创意人士在使用生成式AI图像工具时如何平衡结构化指导与自我实验,发现尽管指导有助于理解AI,但许多人仍倾向于自我探索以保持创意自由。

Comments Accepted at ACM Creativity & Cognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03471 2026-08-17 cs.CV 版本更新 57%

Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding

Hi-Token:用于生成式视觉定位的分层坐标分词

Xiuyuan Zhu, Ke Lu, Kun Dong, Siwen Jiao, Hao Wu, Zijin Du, Shun Mao, Dongming Zhang, Jian Xue

专题命中 其他图像生成 :generative vision(abstract);分类 cs.CV

AI总结 该研究提出Hi-Token分层坐标分词方法,结合基于几何的Hi-GAR奖励,在生成式视觉定位任务中提升了多模型多基准的定位性能,优于强专用基线。

Comments 15 pages, 7 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17390 2026-07-09 cs.CV 版本更新 57%

FMMC: Harnessing the Power of Foundation Models for Accurate Material Classification

利用基础模型提升材料分类的准确性

Qingran Lin, Fengwei Yang, Chaolun Zhu

机构 * Georgia Institute of Technology(佐治亚理工学院) Duke University(杜克大学) Waseda University(早稻田大学)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出一种利用基础模型克服数据限制并提升分类准确性的新框架,通过生成高质量数据集和融合视觉语言模型先验知识,有效提高材料分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25682 2026-07-01 cs.CV 版本更新 57%

Few-Shot Synthetic Image Attribution: Identifying Unseen Generators with Limited Samples

少样本合成图像溯源:有限样本下识别未见生成器

Shiyu Wu, Shuyan Li, Jing Li, Jing Liu, Yequan Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peking University(北京大学)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 提出少样本合成图像溯源新范式,构建含45个生成器、117万图像的OmniFake数据集,并设计OmniDFA基线,实现少样本下识别未见生成器,在AIGI检测中达到最优泛化性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14877 2026-06-18 cs.CV 版本更新 57%

HeatKV: Head-tuned KV-cache Compression for Visual Autoregressive Modeling

HeatKV:针对视觉自回归建模的头部调制KV缓存压缩

Jonathan Cederlund, Axel Berg, William Isaksson, Durmus Alp Emre Acar, Chuteng Zhou, Pontus Giselsson

机构 * Dept. of Automatic Control, Lund University(自动控制系,吕勒欧大学) Arm(Arm公司)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出HeatKV方法,通过根据每个头部对先前生成尺度的注意力进行调整,实现更高效的KV缓存压缩,提升内存利用率并保持图像生成质量。

Comments 18 pages total including appendix; 6 main-paper figures, 2 appendix figures; 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13901 2026-08-19 astro-ph.IM 版本更新 50%

Prospecting MeerKAT Continuum Data for Enigmatic Radio Sources with Unsupervised Vector-Quantised Variational Autoencoders

利用无监督向量量化变分自编码器探测恩igmatic射电源的MeerKAT连续数据

Fernando L. Ventura, Kshitij Thorat, Anna Bosman, Roger Deane, Christopher Cleghorn

专题命中 其他图像生成 :image generation(abstract)

AI总结 利用无监督向量量化变分自编码器探测MeerKAT连续数据中的异常射电源,提升大规模数据搜索效率。

Comments 12 pages, 14 figures, submitted to RAS Techniques and Instruments

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14999 2026-07-16 cs.LG 版本更新 50%

Unlocking Latent Dimensions: Exploring Representations of Large-Scale X-ray Scattering Data using Variational Autoencoders

解锁潜在维度:使用变分自编码器探索大规模X射线散射数据的表示

Monika Choudhary, Xiaoya Chong, Runbo Jiang, Wiebke Koepp, Petrus H. Zwart, Damon English, Gregory M. Su, Eric Schaible, Chenhui Zhu, Mostafa Nassr, Noah P. Wamble, Kelvin Kam-Yun Li, Jonathan M. Chan, Jose Carlos Diaz, Cameron McKay, Lynn Katz, Benny Freeman, Guillaume Freychet, Yevgen Matviychuk, Eliot Gann, Daniel B. Allan, Benedikt Sochor, Frank Schluenzen, Stephan V. Roth, Ethan J. Crumlin, Dylan McReynolds, Tanny Chavez, Alexander Hexemer

机构 * Advanced Light Source, Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室先进光源) Center for Advanced Mathematics for Energy Research Applications, Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室能源研究应用高级数学中心) Molecular Biophysics & Integrated Bioimaging Division, Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室分子生物物理学与综合生物成像部) Berkeley Synchrotron Infrared Structural Biology program, Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室伯克利同步辐射红外结构生物学项目) Materials Sciences Division, Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室材料科学部) McKetta Department of Chemical Engineering, University of Texas(德克萨斯大学麦凯塔化学工程系)

专题命中 其他图像生成 :image generation(abstract)

AI总结 针对X射线散射数据离线探索和实时分析两大挑战,训练领域特定注意力卷积变分自编码器(C-VAE),学习低维表示以捕捉结构变化,并集成到MLExchange平台的Latent Space Explorer中,支持交互式结构探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10751 2026-07-09 cs.LG 版本更新 50%

Predicting integers from continuous parameters

从连续参数预测整数

Bas Maat, Peter Bloem

机构 * Learning & Reasoning Group Vrije Universiteit Amsterdam(阿姆斯特丹自由大学学习与推理组)

专题命中 其他图像生成 :image generation(abstract)

AI总结 本文研究了从连续参数预测整数标签的问题,探讨了离散分布在整数预测中的应用,并测试了多种分布模型在不同任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13212 2026-07-08 cs.LG 版本更新 50%

MAME: Multidimensional Adaptive Metamer Exploration with Human Perceptual Feedback

MAME:基于人类感知反馈的多维自适应同态体探索

Mina Kamao, Hayato Ono, Ayumu Yamashita, Kaoru Amano, Masataka Sawayama

机构 * Graduate School of Information Science and Technology(信息科学与技术研究生学校) The University of Tokyo(东京大学) Graduate School of System Informatics(系统信息科学研究生学校) Kobe University(大阪大学) Hokkaido University(北海道大学) Prometech CG Research(Prometech CG研究所)

专题命中 其他图像生成 :image generation(abstract)

AI总结 该研究针对人脑网络与人工模型对齐问题,提出MAME框架,通过人类感知反馈引导在线图像生成,在单个心理物理实验中成功测量多维人类同态体空间,发现人类与CNN模型在低级处理同态体空间对齐较差,强调早期视觉计算重要性,为研究人类视觉功能提供工具。

Comments 26 pages, 12 figures. Accepted at Journal of Vision

Journal ref Journal of Vision, 26(8):1, 1-14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏