arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-25 至 2026-05-25 共收录 79 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 65 篇

2603.07615 2026-05-25 cs.LG cs.CV 74%

Compression as Adaptation: Implicit Visual Representation with Diffusion Foundation Models

压缩即适应:基于扩散基础模型的隐式视觉表示

Zongyu Guo, Jiajun He, Zhaoyang Jia, Xiaoyi Zhang, Jiahao Li, Xiao Li, Bin Li, José Miguel Hernández-Lobato, Yan Lu

机构 * Microsoft Research Asia(微软亚洲研究院) University of Cambridge(剑桥大学)

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 提出一种将视觉信号编码为函数的新框架,通过冻结的视觉生成模型附加低秩适应参数实现隐式表示,并进一步哈希为紧凑向量,在极低比特率下实现强感知视频压缩,同时支持推理时缩放和调控,统一了视觉压缩与生成。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09330 2026-05-25 physics.flu-dyn cs.LG physics.comp-ph 71%

WellPINN: Accurate Well Representation for Transient Fluid Pressure Diffusion in Subsurface Reservoirs with Physics-Informed Neural Networks

WellPINN:基于物理信息神经网络的瞬态流体压力扩散在储层中的精确井表征

Linus Walter, Qingkai Kong, Sara Hanson-Hedgecock, Víctor Vilarrasa

机构 * Global Change Research Group (GCRG), IMEDEA, CSIC-UIB(全球变化研究组(GCRG),IMEDEA,CSIC-UIB)

专题命中 扩散模型 :diffusion(title)

AI总结 提出WellPINN工作流,通过多阶段顺序训练物理信息神经网络(PINNs)并逐步缩小等效井半径,解决了现有PINN方法在注入早期井附近压力捕捉不准的问题,实现了全注入周期内由泵注速率精确推断流体压力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23410 2026-05-25 cs.LG cs.CV 70%

What Linear Probes Miss: Multi-View Probing for Weight-Space Learning

线性探测的盲区:面向权重空间学习的多视角探测

Eunwoo Heo, Kyeongkook Seo, Jaejun Yoo

机构 * Graduate School of Artificial Intelligence, Ulsan National Institute of Science(乌山国立科学技术研究生院)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 针对现有探测方法仅捕获一阶结构而忽略行列交互中的高阶相关模式的问题,提出多视角探测框架MVProbe,通过融合一阶信号与基于Gram的交互感知视图,并基于不同探测阶数的缩放定律推导标准化与融合策略,在Model Jungle基准上超越现有方法。

Comments Accepted at ICML 2026. Code: https://github.com/AI-hew-math/MVProbe ; Project page: https://ai-hew-math.github.io/MVProbe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23361 2026-05-25 physics.optics 67%

Approaching physical limits of latent dimensionality in optical computing

接近光学计算中潜在维度的物理极限

Zhenyu Zhao, Zijun Qiu, Xuan Hu, Yao Zhou, Jinlong Xiang, Youlve Chen, Chaojun Xu, Yuchen Yin, Tao Lin, Yikai Su, Xuhan Guo

专题命中 扩散模型 :diffusion(abstract);image synthesis(abstract)

AI总结 通过探索有界光学域潜在维度的物理极限,设计并实现了超紧凑多模光子处理器,在实验上逼近这些极限,为光学计算架构提供了缺失的理论参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23878 2026-05-25 cs.CV 57%

LaMo: Self-Supervised Latent Motion Priors for Physical Realism in Video Generation

LaMo: 视频生成中物理真实性的自监督潜在运动先验

Bo Jiang, Depu Meng, Yihan Hu, Yichen Xie, Tianshuo Xu, Wei Zhan

机构 * Applied Intuition University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出LaMo,通过自监督方式从无标签视频中提取运动先验,包括宏运动漂移损失和微运动场引导,无需外部监督即可提升视频扩散模型的物理一致性。

Comments Project Page: https://lamo-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23868 2026-05-25 cs.CV 57%

Vision Transformers Need Better Token Interaction

视觉Transformer需要更好的Token交互

Linxiang Su

机构 * University of Szeged(塞格德大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对视觉Transformer在密集预测任务中补丁表示退化的问题,本文提出通过稀疏注意力(entmax-1.5)替代softmax注意力来增强token交互的选择性,从而在不损失全局上下文的前提下显著提升语义分割性能。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23602 2026-05-25 cs.CV 57%

GlowGS: Generative Semantic Feature Learning for 3D Gaussian Splatting in Nighttime Glow Scenes

GlowGS: 夜间发光场景中用于3D高斯溅射的生成式语义特征学习

Beibei Lin, Xiao Cao, Jingyuan Guo, Robby T. Tan

机构 * National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对夜间发光场景中3D高斯溅射因缺乏纹理和边缘等结构特征而难以渲染高质量新视图的问题,提出GlowGS方法,利用扩散模型和视觉基础模型生成语义特征作为隐式结构线索,并通过新视图语义学习实现无真实标签的优化,显著提升渲染质量。

Comments Accepted by CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23555 2026-05-25 cs.CV 57%

Generator-Refiner-Examiner: A Tri-Module Data Augmentation Framework for 3D Human Avatar Learning from Monocular Videos

生成器-精炼器-检验器:一种用于从单目视频学习3D人体虚拟形象的三模块数据增强框架

Gangjian Zhang, Jian Shu, Sicheng Yu, Wenhao Shen, Yu Feng, Hao Wang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对单目视频中3D人体虚拟形象重建的数据稀缺问题,提出由生成器、精炼器和检验器组成的三模块框架TrioMan,通过姿态和相机扰动生成多样样本、扩散模型精炼质量、注意力机制筛选一致样本,在X-Humans和NeuMan基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23245 2026-05-25 cs.CV cs.AI 57%

SimInsert: Seamless Video Object Insertion via Regional Sparse Attention Fusion

SimInsert: 通过区域稀疏注意力融合实现无缝视频对象插入

Xinyu Chen, Yuyi Qian, Jiang Lin, Shenyi Wang, Gao Wang, Zhiqiu Zhang, Jizhi Zhang, Mingjie Wang, Qiang Tang, Qian Wang, Song Wu, Zili Yi

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学) JIUTIAN Research(JIUTIAN研究机构) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) Zhejiang Sci-Tech University(浙江科技学院) The University of British Columbia(不列颠哥伦比亚大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出SimInsert,一种无需训练的视频对象插入方法,利用图像到视频扩散模型的先验和区域稀疏注意力融合,实现时空一致和交互真实感,在PSNR、SSIM和LPIPS上分别提升18.8%、20.1%和降低44.1%。

Comments Accepted by ICME2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23113 2026-05-25 cs.CV 57%

Inconsistency-aware Multimodal Schrödinger Bridge for Deepfake Localization

不一致感知多模态薛定谔桥用于深度伪造定位

Jiayu Xiong, Jing Wang, Qi Zhang, Wanlong Wang, Jun Xue

机构 * Department of Computer Science and Techonology, Huaqiao University(华侨大学计算机科学与技术系) Xiamen Key Laboratory of Computer Vision and Pattern Recognition, Huaqiao University(厦门计算机视觉与模式识别重点实验室) Tongji University(同济大学) School of Cyber Science and Engineering, Wuhan University(武汉大学网络空间安全学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出IaMSB框架,利用薛定谔桥统一一致性估计、跨模态信息选择和桥步调度,实现高精度区间级深度伪造定位。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23065 2026-05-25 cs.CV cs.AI cs.LG 57%

Dithering Defense: Adversarial Robustness of Vision Foundation Models via Multi-Level Floyd-Steinberg Dithering

抖动防御:通过多级 Floyd-Steinberg 抖动实现视觉基础模型的对抗鲁棒性

Yury Belousov, Brian Pulfer, Vitaliy Kinakh, Slava Voloshynovskiy

机构 * Department of Computer Science, University of Geneva, Switzerland(日内瓦大学计算机科学系)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出多级 Floyd-Steinberg 误差扩散抖动作为轻量级、模型无关的输入变换,以破坏对抗扰动同时保留语义内容,在多个任务和模型上超越或匹配包括基于扩散的去噪在内的基线方法。

Comments Paper accepted at the IEEE International Conference on Image Processing (ICIP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22635 2026-05-25 cs.LG cs.CL cs.CV 57%

The Double Dilemma in Multi-Task Radiology Report Generation: A Gradient Dynamics Analysis and Solution

多任务放射学报告生成中的双重困境:梯度动力学分析与解决方案

Erjian Zhang, Yatong Hao, Liejun Wang, Zhiqing Guo

机构 * School of Computer Science and Technology(计算机科学与技术学院) Xinjiang University(新疆大学) Information Security Engineering Technology Research Center(信息安全工程技术研究中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对多任务放射学报告生成中线性标量化策略无法平衡判别性临床监督与生成平滑性的问题,提出基于梯度动力学的冲突规避幅度增强梯度下降(CAME-Grad)优化器,通过方向修正与能量注入实现动态平衡,在八个方法上平均提升2.3%和1.9%的临床效能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07590 2026-05-25 cs.CV 57%

Beyond Defenses: Manifold-Aligned Regularization for Intrinsic 3D Point Cloud Robustness

超越防御:面向内在3D点云鲁棒性的流形对齐正则化

Pedro Alonso, Chongshou Li, Tianrui Li

机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算机与人工智能学院,西南交通大学) Engineering Research Center of Sustainable Urban Intelligent Transportation, Ministry of Education, Southwest Jiaotong University(可持续城市智能交通工程研究中心,教育部,西南交通大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出流形对齐点识别(MAPR)框架,通过正则化潜在几何结构并施加内在扰动一致性损失,在不依赖对抗训练或额外数据的情况下显著提升点云模型对多种攻击的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00948 2026-05-25 cs.CV 57%

InfVSR: Toward Consistency-Driven Streaming Generative Video Super-Resolution

InfVSR:迈向一致性驱动的流式生成视频超分辨率

Ziqing Zhang, Kai Liu, Zheng Chen, Xi Li, Yucong Chen, Bingnan Duan, Linghe Kong, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出InfVSR,通过自回归单步扩散范式与流式推理,实现长视频的高效、一致超分辨率,速度提升达58倍。

Comments Code and model are available at https://github.com/Kai-Liu001/InfVSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23372 2026-05-25 cs.CV 57%

UniEmo: Unifying Emotional Understanding and Generation with Learnable Expert Queries

UniEmo: 利用可学习专家查询统一情感理解与生成

Yijie Zhu, Lingsen Zhang, Zitong Yu, Rui Shao, Tao Tan, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Great Bay University(大湾区大学) School of Computing and Information Technology(计算机与信息学院) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息科技重点实验室) Shenzhen Loop Area Institute(深圳河套学院) Macao Polytechnic University(澳门 polytechnic 大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出UniEmo统一框架,通过可学习专家查询的分层情感理解链提取多尺度情感特征,并融合情感表示引导扩散模型生成情感图像,同时利用生成驱动的双重反馈提升理解能力,在情感理解和生成任务上超越现有方法。

Comments Accepted to TIP 2026

Journal ref IEEE Transactions on Image Processing, vol. 35, pp. 5165-5180, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03535 2026-05-25 cs.CV 57%

BVI-RLV: A Fully Registered Dataset for Low-Light Video Enhancement

BVI-RLV:一个完全配准的低光视频增强数据集

Ruirui Lin, Guoxi Huang, Joanne Lin, Qi Sun, Alexandra Malyugina, David R Bull, Nantheera Anantrasirichai

机构 * Visual Information Laboratory, Bristol Vision Institute (BVI), University of Bristol(视觉信息实验室,布里斯托尔视觉研究所(BVI),布里斯托尔大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对低光视频增强中缺乏像素对齐训练数据的问题,提出了BVI-RLV数据集,通过电动滑轨和图像优化实现亚像素配准,并基于CNN、Transformer、Mamba和扩散模型提供基线,实验证明配准对监督学习至关重要。

Comments arXiv admin note: text overlap with arXiv:2402.01970

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23678 2026-05-25 math.OC 50%

Concentration of measure-valued solutions for semilinear parabolic equations

半线性抛物型方程的测度值解的集中性

Charlie Lebarbé, Émilien Flayac, Michel Fournié, Didier Henrion, Milan Korda

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文证明反应扩散型标量半线性抛物型PDE的矩-平方和松弛无间隙,通过将线性测度方程的解构造为满足能量恒等的Young测度空间中的能量测度值解,并证明该解在非线性PDE解存在唯一时集中其上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23893 2026-05-25 cs.LG 50%

Complete-muE: Optimal Hyperparameter Transfer and Scaling for MoE Models

Complete-muE:MoE模型的最优超参数迁移与缩放

Hongwu Peng, Ohiremen Dibua, Yuanjun Xiong, Yifan Gong, Jianming Zhang, Yan Kang

机构 * Adobe Research(Adobe研究院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出Complete-muE框架,通过双桥系统实现稠密FFN与混合专家(MoE)架构间的超参数迁移,支持MoE模型在激活专家数、总容量、粒度等方面的缩放,并验证了“一次调优稠密模型,迁移至所有MoE配置”的实用策略。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23856 2026-05-25 cs.RO 50%

Point Tracking Improves World Action Models

点跟踪改进了世界动作模型

Jiarui Guan, Wenshuai Zhao, Yue Pei, Ziliang Chen, Arno Solin, Juho Kannala

机构 * Aalto University(阿alto大学) ELLIS Institute Finland(ELLIS研究所芬兰) University of Oulu(奥卢大学) Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Beihang University(北京航空航天大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出联合像素与跟踪的世界动作模型JOPAT,通过预测2D点跟踪和动作来提升机器人策略学习,在长时域、遮挡和离屏运动任务上优于纯像素方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23847 2026-05-25 cs.RO 50%

Instrumentation for Imitation Learning: Enhancing Training Datasets for Clothes Hanger Insertion

模仿学习的仪器化:增强衣架插入训练数据集

Remko Proesmans, Thomas Lips, Francis wyffels

机构 * AI and Robotics Lab (IDLab-AIRO)(人工智能与机器人实验室(IDLab-AIRO)) Ghent University—imec(根特大学—imec)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过仪器化(在物体中集成传感器)提供状态信息,训练扩散策略进行衣架插入任务,实验表明仪器化策略比纯视觉策略成功率提高14-25%,且黑箱模仿学习能自动优先使用仪器信号。

Comments Accepted for presentation at ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23803 2026-05-25 cond-mat.stat-mech cond-mat.mes-hall math-ph math.MP physics.chem-ph 50%

Chirality-sensitive mobility and dissipation of Brownian motion on a helical landscape

螺旋景观上布朗运动的旋性敏感迁移率与耗散

Debankur Bhattacharyya, Abraham Nitzan

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究惯性粒子在圆柱表面二维螺旋势场中的布朗动力学,通过投影零模构建稳定子空间线性响应理论,得到迁移率张量解析表达式,揭示螺旋几何导致的交叉响应和能量耗散不对称性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18510 2026-05-25 cond-mat.stat-mech hep-th 50%

Three faces of random walks in hyperbolic domain: BKT, Lifshitz tails, and KPZ

双曲域中随机游走的三个面孔:BKT、Lifshitz 尾和 KPZ

Daniil Fedotov, Sergei Nechaev

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过庞加莱双曲上半平面中的连续随机游走(扩散)统一描述了 Berezinskii-Kosterlitz-Thouless (BKT) 转变、Kardar-Parisi-Zhang (KPZ) 指数和 Lifshitz 尾 (LT) 三种看似无关的现象,并利用重正化群、WKB 方法和瞬子方法进行分析。

Comments 20 pages, 4 figures (detected errors have been fixed)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23529 2026-05-25 math.PR 50%

Generalized Bessel-Dunkl diffusions

广义Bessel-Dunkl扩散

Jacek Małecki

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文针对经典根系Weyl室中的Bessel-Dunkl型扩散,建立了包含时变、位变系数及可退化奇异排斥项的统一理论,证明了弱存在性、路径唯一性、强存在性及平均场收敛定理。

Comments 90 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23365 2026-05-25 cs.LG cs.AI 50%

Score-Based One-step MeanFlow Policy Optimization

基于分数的单步MeanFlow策略优化

Kyungyoon Kim, Donghyeon Ki, Hee-Jun Ahn, Byung-Jun Lee

机构 * Korea University, Decision Making Lab(韩国大学,决策实验室) Gauss Labs Inc.(Gauss实验室)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出SOM算法,通过分数估计和概率流ODE从Q函数构建目标速度场,实现单步生成,在在线强化学习中达到最优性能并大幅减少训练和推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23307 2026-05-25 astro-ph.EP 50%

Superrotation and Jet Migration in Simulations of Jupiter's Convective Zone and Weather Layer

木星对流层和天气层模拟中的超旋转和急流迁移

Loren Matilsky, Geoffrey Vallis, Matthew Browning, Nicholas Brummell

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过三维球壳弹性对流模拟,研究木星对流层和天气层中平均纬向流的驱动机制,发现位涡均质化产生高纬度急流,而Busse柱角动量输运驱动赤道超旋转,且天气层显著改变热风平衡导致急流极向迁移。

Comments 31 pages, 17 figures, 1 animation, submitted to PSJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23207 2026-05-25 stat.ME 50%

Mixture-of-Finite-Mixtures Wishart Model for Clustering Covariance Matrices with an Application to Brain Functional Connectivity

有限混合威沙特模型用于协方差矩阵聚类及其在脑功能连接中的应用

Zongyu Li, Stefano Castruccio, Zhiyong Zhang

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出MFM-Wishart贝叶斯模型,结合威沙特混合分量与有限混合先验,实现协方差矩阵数据的聚类与簇数联合推断,并应用于婴儿睡眠功能连接聚类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22982 2026-05-25 physics.flu-dyn 50%

Transient and asymptotic Taylor--Aris dispersion of Brownian rods in arbitrary regular-polygonal ducts

任意正多边形管道中布朗棒的瞬态和渐近Taylor-Aris弥散

Jingsen Feng, Xu Chu

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究布朗棒在任意正多边形管道中的Taylor-Aris弥散,通过Jeffery-Brownian闭合和细胞问题分析剪切对齐与横向混合的耦合效应,揭示了平均速度的非单调偏移和Taylor系数的增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22279 2026-05-25 physics.app-ph cond-mat.mtrl-sci 50%

Simultaneously monitoring Ga adsorption and desorption kinetics on GaN(0001) using four in situ techniques

使用四种原位技术同时监测GaN(0001)上Ga的吸附和解吸动力学

Huaide Zhang, Philipp John, Jingxuan Kang, Lutz Geelhaar, Yongjin Cho, Oliver Brandt

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过四种原位技术同时监测,系统研究了GaN(0001)表面Ga的吸附和解吸动力学,并建立统一动力学模型定量复现所有信号,得到解吸活化能为(2.87±0.04) eV。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15652 2026-05-25 cs.NE cs.AI 50%

Bridging Silicon and the Hippocampus: Algebro-Deterministic Memory "VaCoAl" as a Substrate for Vector-HaSH and TEM

连接硅与海马体:作为Vector-HaSH和TEM基底的代数确定性记忆“VaCoAl”

Hiroyuki Chuma, Kanji Otsuka, Yoichi Sato

机构 * Institute of Innovation Research, Hitotsubashi University(立命馆大学创新研究所) Meisei University(明海大学) Shuhari System(Shuhari系统)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出VaCoAl,一种基于伽罗瓦域线性反馈移位寄存器的代数确定性超维记忆架构,为Vector-HaSH和TEM提供基底级替代,并解释海马体回放衰减的代数模型。

Comments 52 pages, 5 figures, 1 table, 3 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10347 2026-05-25 cs.AI cs.CL 50%

How Mobile World Model Guides GUI Agents?

移动世界模型如何指导GUI代理?

Weikai Xu, Kun Huang, Yunren Feng, Jiaxing Li, Yuhan Chen, Yuxuan Liu, Zhizheng Jiang, Heng Qu, Pengzhi Gao, Wei Liu, Jian Luan, Xiaolin Hu, Bo An

机构 * Nanyang Technological University(南洋理工大学) MiLM Plus, Xiaomi Inc.(小米公司) Independent Researchers(独立研究人员) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Wuhan University(武汉大学) Xiamen University(厦门大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过训练四种模态(增量文本、完整文本、扩散图像、可渲染代码)的世界模型,并评估其在下游任务中的效用,发现可渲染代码重建在分布内保真度高,文本反馈对在线分布外执行更鲁棒,世界模型生成的轨迹可提供迁移经验但无法替代原始分布,且对低熵过度自信的代理,后验自省收益有限。

详情

展开后加载摘要…

URL PDF HTML 收藏