arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4216 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4216 篇

2607.10625 2026-07-14 cs.RO 新提交 50%

Dual-Process Atomic Skill Learning: Decoupling Semantic Reasoning and Real-Time Control

双过程原子技能学习:解耦语义推理与实时控制

Jun Chen, Erdent Bao, Wenlong Dong, Jierui Liu, Qi Cai, Hao Wan, Shaopeng Li, Weijun Qin, Jing Liang, Huiping Zhuang

机构 * University of Electronic Science and Technology of China(电子科技大学) Huazhong University of Science and Technology(华中科技大学) Southern University of Science and Technology(南方科技大学) South China University of Technology(华南理工大学) EbTech Co. Ltd.(依比特科技有限公司)

专题命中 可控生成 :diffusion(abstract)

AI总结 研究针对语言条件模仿学习推广到多步组合任务的挑战,提出双过程原子技能学习框架DASL,通过解耦语义推理与实时控制,含低频和高频策略,有效减轻技能码本干扰问题,性能显著优于现有基线。

Comments 28 pages,20 figures,21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10550 2026-07-14 quant-ph 新提交 50%

Coherent Quantum Schrodinger Bridge: Two-Boundary Optimal Control for Quantum Algorithm Design

相干量子薛定谔桥:量子算法设计的双边界最优控制

Masayuki Ohzeki

专题命中 可控生成 :diffusion(abstract)

AI总结 研究将量子算法双边界过程视为相干量子薛定谔桥,利用阿哈罗诺夫双态矢量和庞特里亚金原理得出最优哈密顿量,应用此框架重构多种算法,将不同算法范式统一为选择边界条件和实现最优流的几何原理。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06558 2026-07-14 cs.RO 版本更新 50%

RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation

RynnWorld-Teleop:用于数字遥操作的动作条件世界模型

Haoyu Zhao, Xingyue Zhao, Hangyu Li, Biao Gong, Kehan Li, Siteng Huang, Xin Li, Deli Zhao, Zhongyu Li

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hong Kong Embodied AI Lab(香港具身人工智能实验室) CUHK(香港中文大学) Hupan Lab(湖畔实验室) Alibaba Group(阿里巴巴集团) Ant Group(蚂蚁集团)

专题命中 可控生成 :diffusion(abstract)

AI总结 研究针对机器人学习数据收集瓶颈,提出数字遥操作范式,用生成世界模型解耦数据收集与物理约束。以RynnWorld-Teleop系统实现,含多种技术,能实时生成,训练策略可零样本转移,还能增强数据集,是高保真可扩展数据引擎。

Comments Project Page: https://alibaba-damo-academy.github.io/RynnWorld-Teleop.github.io, Github: https://github.com/alibaba-damo-academy/RynnWorld-Teleop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07896 2026-07-10 math.OC 新提交 50%

On the Approximation of Optimal Control in Regime-Switching Diffusions

关于状态切换扩散中最优控制的逼近

Somnath Pradhan, Dinesh Rathia

专题命中 可控生成 :diffusion(abstract)

AI总结 研究状态切换扩散中最优控制策略的逼近与简化问题,利用方程正则性、策略密度结果等,构建Euler - Maruyama逼近和有限状态逼近,证明相关收敛性,为该类控制问题提供系统逼近框架及数值实现依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07389 2026-07-09 quant-ph cs.NA math.NA 新提交 50%

Circuit Depth Reduction of One-Ancilla Quantum Differential Equation Solver via Extrapolation

通过外推法降低单辅助量子微分方程求解器的电路深度

Di Fang, Justin Park

专题命中 可控生成 :diffusion(abstract)

AI总结 研究如何降低单辅助量子微分方程求解器的电路深度,通过结合求解器与经典步长后处理,在对数数量的有限时间步长上运行求解器并利用经典后处理消除误差,将最大单次运行电路深度降至\(O(\mathrm{polylog}(1/\epsilon))\),数值实验验证了方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05725 2026-07-08 math.AP 新提交 50%

Decay of solutions and bilinear control to trajectories of a 1D degenerate parabolic system

一维退化抛物型系统解的衰减及轨迹的双线性控制

Alfredo S. Gamboa, André Da Rocha Lopes, Luis P. Yapu

专题命中 可控生成 :diffusion(abstract)

AI总结 研究一类含弱退化扩散系数的一维非线性抛物型系统,通过反应项系数控制,利用局部反演方法结合先验估计,分析其解的衰减及轨迹可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08317 2026-07-08 math.OC 版本更新 50%

Stationary Mean-Field Games of Singular Control under Knightian Uncertainty

奈特不确定性下奇异控制的平稳平均场博弈

Giorgio Ferrari, Ioannis Tzouanas

专题命中 可控生成 :diffusion(abstract)

AI总结 研究奈特不确定性下奇异控制的平稳平均场博弈,主体通过单边奇异随机控制调整动力学以最大化奖励,利用构造性方法证明平稳平均场均衡的存在唯一性,并给出数值基准及分析不确定性对均衡的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04474 2026-07-07 cs.CR 新提交 50%

AMRM-Pure: Semantic-Preserving Adversarial Purification

AMRM-Pure:语义保留对抗净化

Zhihao Dou, Zhiqiang Gao, Dongfei Cui, Weida Wang, Qinjian Zhao, Dinggen Zhang, Jun Yan, Zeke Xie, Shufei Zhang

专题命中 可控生成 :diffusion(abstract)

AI总结 研究从保留图像块语义关系角度探索对抗净化,用注意力掩码重建模型(AMRM),提出AMRM-Pure框架,通过保留块级语义去噪对抗输入,经分类损失微调增强鲁棒性,实验验证方法有效性。

Comments AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04240 2026-07-07 cs.AI q-bio.CB 新提交 50%

Biological Motifs for Agentic Control

用于智能体控制的生物基序

Bogdan Banu

专题命中 可控生成 :diffusion(abstract)

AI总结 研究大语言模型向自主智能体转变带来的可靠性等挑战,通过基因调控网络与智能体软件系统的类型化接口对应,映射生物基序到软件设计模式,给出智能体操作数等核心贡献并具实践可行性。

Comments 80 pages. Preprint; feedback welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03964 2026-07-07 cs.RO cs.AI 新提交 50%

Worldscape-MoE: A Unified Mixture-of-Experts World Model for Scalable Heterogeneous Action Control

Worldscape-MoE:用于可扩展异构动作控制的统一专家混合世界模型

Jianjie Fang, Yongyan Xu, Ziyou Wang, Chen Gao, Yuchao Huang, Zhaolu Wang, Rongze Tang, Mingyuan Jia, Baining Zhao, Weichen Zhang, Xin Zhang, Haisheng Su, Yu Shang, Wei Wu, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学) Manifold AI

专题命中 可控生成 :diffusion(abstract)

AI总结 研究视频生成世界模型控制接口碎片化瓶颈,提出基于扩散变换器的专家混合世界模型Worldscape-MoE,通过模态感知控制注入等实现异构动作控制,实验验证其有效性和扩展性。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03952 2026-07-07 math.OC cs.SY eess.SY 新提交 50%

L1 Optimal Control of Continuous-Time Stochastic Positive Systems

连续时间随机正系统的 L1 最优控制

Alba Gurpegui, Takashi Tanaka, Anders Rantzer

专题命中 可控生成 :diffusion(abstract)

AI总结 研究连续时间随机正系统的 L1 最优控制问题,考虑线性非负成本及输入约束,建立正象限前向不变性并提出模拟方法,给出有限和无限时域问题的显式解,证明对乘性随机不确定性的鲁棒性。

Comments 14 Pages. 2 Figures. Accepted for publication in IEEE Control Systems Letters (L-CSS) and under review for the 65th IEEE Conference in decision and control 2026 (CDC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05137 2026-07-07 physics.plasm-ph cs.CE physics.comp-ph 新提交 50%

SoPlasmaFoam: an OpenFOAM-based solver for streamer and dielectric barrier discharges with adaptive mesh refinement

SoPlasmaFoam:基于OpenFOAM的用于流光和介质阻挡放电的求解器及自适应网格细化

R. Pasolari, K. Kourtzanidis

专题命中 可控生成 :diffusion(abstract)

AI总结 研究基于OpenFOAM构建求解器SoPlasmaFoam,通过耦合泊松方程求解带电粒子输运。评估对流方案,分析泊松输运耦合,引入边界条件。该求解器经验证并展示多区域能力,为多物理模拟提供模块化基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22726 2026-07-07 cs.AI 新提交 50%

Text Dictates, Music Decorates: Energy-based Attention for Editable Dance Motion Generation

文本主导,音乐装饰:基于能量的注意力机制用于可编辑舞蹈动作生成

Seong Jong Yoo, Siyuan Peng, Felix Gu, Stratis Aloimonos, Cornelia Fermüller

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出STREAM模型,通过模态解耦的扩散变压器分离文本语义和音乐节奏控制,实现可编辑舞蹈动作生成,并引入新数据集Motorica++和评估指标EDS。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24589 2026-07-07 eess.AS cs.SD 版本更新 50%

YingMusic-Singer: Controllable Singing Voice Synthesis with Flexible Lyric Manipulation and Annotation-free Melody Guidance

YingMusic-Singer-Plus: 可控歌唱语音合成与灵活歌词操控及无标注旋律引导

Chunbo Hao, Junjie Zheng, Guobin Ma, Yuepeng Jiang, Huakang Chen, Wenjie Tian, Gongyu Chen, Zihao Chen, Lei Xie

机构 * AI Lab, GiantNetwork(巨人网络AI实验室)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出YingMusic-Singer-Plus,一种基于扩散模型的可控歌唱语音合成方法,支持灵活歌词操控和无标注旋律引导,优于现有基准模型。

Comments INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02948 2026-07-07 cs.LG cs.NA math.NA 版本更新 50%

Variational Sparse Paired Autoencoders (vsPAIR) for Inverse Problems and Uncertainty Quantification

用于逆问题和不确定性量化的变分稀疏配对自动编码器(vsPAIR)

Jack Michael Solomon, Rishi Leburu, Matthias Chung

机构 * Emory University Department of Mathematics(埃默里大学数学系)

专题命中 可控生成 :inpainting(abstract)

AI总结 针对逆问题,提出变分稀疏配对自动编码器(vsPAIR)。架构通过学习的潜在映射连接标准VAE和稀疏VAE,能进行不确定性估计,鼓励可解释性,提供结构化不确定性估计,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03324 2026-07-07 math.PR 版本更新 50%

Strong law of large numbers and L log L condition for supercritical branching processes

超临界分支过程的强大数定律和L log L条件

Vincent Bansaye, Tresnia Berah, Bertrand Cloez

专题命中 可控生成 :diffusion(abstract)

AI总结 研究结构化种群的超临界分支过程,在重正化半群加权全变差范数收敛假设下,结合鞅族、半群收缩等技术,证明归一化经验测度强收敛等,在Llog L条件下扩展大数定律适用范围。

Comments MISTEA - Axe syst{è}mes dynamiques

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02195 2026-07-03 cs.RO 新提交 50%

Bridge-WA: Predicting Where and How the World Changes for Robotic Action

Bridge-WA: 预测世界变化的位置和方式以支持机器人动作

Yongjie Bai, Hanting Wang, Mingtong Dai, Qijun Zhong, Yang Liu, Liang Lin

机构 * Sun Yat-sen University(中山大学) Pengcheng Laboratory(鹏城实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) X-Era AI Lab(X-Era AI实验室)

专题命中 可控生成 :image generation(abstract)

AI总结 提出Bridge-WA轻量框架,通过蒸馏未来变化教师模型为三个紧凑先验,引导动作生成聚焦于场景变化的位置和方式,提升机器人操作的成功率和鲁棒性。

Comments 21 pages, 8 figures, https://hcplab-sysu.github.io/BRIDGE-WA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01347 2026-07-03 math.OC 新提交 50%

Bilinear control of age--space structured populations

年龄-空间结构化群体的双线性控制

Jiguang Yu, Louis Shuo Wang

专题命中 可控生成 :diffusion(abstract)

AI总结 研究具有更新边界条件和内源性监测反馈的非局部年龄-空间结构化种群方程的双线性最优控制,通过特征温和公式建立闭环适定性和弗雷歇可微性,推导降阶和反馈校正伴随方程,并证明一阶最优性条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08580 2026-07-03 math.OC cs.LG 版本更新 50%

Adjoint Matching through the Lens of the Stochastic Maximum Principle in Optimal Control

通过随机最大原理视角的伴随匹配

Carles Domingo-Enrich, Jiequn Han

机构 * Microsoft Research New England(微软研究院新英格兰) Flatiron Institute(熨斗研究所)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文基于随机最优控制问题,重新推广并严谨推导了伴随匹配方法,将其置于随机最大原理基础上,提出通用Hamiltonian伴随匹配目标,并展示其在连续时间下的实现方法,为随机控制问题提供新的可实施目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18368 2026-07-03 cs.RO 版本更新 50%

Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation

学习多任务机器人操作的语义原子技能

Yihang Zhu, Weiqing Wang, Shijie Wu, Ye Shi, Jingya Wang

机构 * ShanghaiTech University(上海科技大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出AtomSkill框架,通过语义对比对齐和关键姿态想象,从演示中学习可重用原子技能,实现多任务机器人操作,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31426 2026-07-01 eess.SP 新提交 50%

Towards a Joint Task-Oriented and Generative Semantic Communication Framework for 6G Networks

面向6G网络的联合任务导向与生成式语义通信框架

Soheyb Ribouh, Phil Polo Ditsia Di Ngoma

专题命中 可控生成 :diffusion(abstract)

AI总结 提出一种基于OFDM的端到端语义通信框架,通过图表示提取视觉语义,结合ST-GNN进行碰撞风险估计,并利用扩散模型重建场景,在MIMO配置下实现99.1%数据压缩,优于JPEG/HEVC,同时保持下游推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31132 2026-07-01 cs.RO 新提交 50%

ELASTIC: Efficiently Learning to Adaptively Scale Test-Time Compute for Generative Control Policies

ELASTIC: 高效学习自适应缩放测试时计算以生成控制策略

Andrew Zou Li, Gokul Swamy, Yonatan Bisk, Andrea Bajcsy

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出ELASTIC算法,通过元强化学习为生成控制策略学习状态依赖的测试时计算调度,在扩散策略和视觉-语言-动作模型上实现帕累托最优,减少34%延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31968 2026-07-01 math.OC math.AP 新提交 50%

Approximate Controllability of the generalized Burgers-Huxley equation in one dimension

一维广义Burgers-Huxley方程的近似可控性

Aman Patel, Mohmedmunavvar Mubarak Bapu, Mrinmay Biswas

专题命中 可控生成 :diffusion(abstract)

AI总结 研究广义Burgers-Huxley方程通过内部控制的可控性,证明非全局近似可控,但可在适当时间内将系统从任一稳态驱动到另一稳态的任意小邻域,前提是两者在同一连通分量中。

Comments 48 pages, Comments Welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30320 2026-06-30 math.OC 50%

Continuous-Time Information Design for Hurricane Evacuation: Disclosure, Congestion, and Optimal Phasing under Model Uncertainty

飓风疏散的连续时间信息设计:模型不确定性下的信息披露、拥堵与最优分阶段策略

Furkan Sezer

专题命中 可控生成 :diffusion(abstract)

AI总结 研究应急管理机构通过信息精度和分阶段疏散调度引导战略疏散区的连续时间信息设计,证明分阶段疏散优于同步建议,且信息精度存在符号模糊性(信息Braess效应),校准至丽塔飓风数据可减少89%的社会成本。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30106 2026-06-30 math.AP 50%

Uniqueness and non-uniquess for the mean field control of fisheries

渔业均值场控制的唯一性与非唯一性

Greta Lamonaca, Idriss Mazari, Grégoire Nadin

专题命中 可控生成 :diffusion(abstract)

AI总结 研究渔业管理中均值场控制系统的解的非唯一性问题,通过分支理论证明多解存在,并给出改进的唯一性判据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29474 2026-06-30 math.OC cs.AI cs.NA math.NA 50%

A Posteriori Error Analysis for Decoupled Neural Approximations of Fully Coupled FBSDEs with Control Mismatch

完全耦合FBSDE解耦神经逼近的后验误差分析与控制失配

Xichuan Zhang

机构 * Intelligent Game and Decision Lab(智能游戏与决策实验室)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出完全耦合正倒向随机微分方程解耦神经逼近的后验误差分析框架,通过引入辅助控制处理控制失配,导出可计算的后验误差界,数值实验验证了指标的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28886 2026-06-30 math.OC 50%

Optimal control of diffusive mean-field models for swarming particles on the sphere

球面上群集粒子的扩散平均场模型的最优控制

Jinwook Jung, Dohyun Kim

专题命中 可控生成 :diffusion(abstract)

AI总结 针对球面上带扩散的Kuramoto型一致性动力学,研究平均场最优控制问题,控制通过漂移场和相互作用增益实现,证明了微观最优控制收敛到平均场最优控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28351 2026-06-30 cs.IR 50%

HyperSU: Corpus-Driven Semantic-Unit Hypergraph for Retrieval-Augmented Generation

HyperSU:面向检索增强生成的语料驱动语义单元超图

Jiate Liu, Liuyi Chen, Zhengyi Yang, Chuan He, Mingchen Ju, Bocheng Han, Ruyi Liu, Xu Zhou

专题命中 可控生成 :diffusion(abstract)

AI总结 提出HyperSU框架,通过语义单元超图和线索引导的双向检索,解决超图RAG中的幻觉、高索引成本和语义漂移问题,在GraphRAG-Bench上准确率提升14.7%。

Comments 24 pages, 6 figures, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07744 2026-06-30 cs.RO 50%

AeroPlace-Flow: Language-Grounded Object Placement for Aerial Manipulators via Visual Foresight and Object Flow

AeroPlace-Flow:基于视觉前瞻和物体流的语言引导空中机械臂物体放置

Sarthak Mishra, Rishabh Dev Yadav, Naveen Nair, Wei Pan, Spandan Roy

机构 * Robotics Research Center, IIIT Hyderabad, India(印度IIIT海得拉巴机器人研究中心) Department of Computer Science, University of Manchester, UK(英国曼彻斯特大学计算机科学系) Newcastle University, UK(英国新castle大学)

专题命中 可控生成 :image editing(abstract)

AI总结 本文提出AeroPlace-Flow框架,通过视觉前瞻和3D几何推理实现语言引导的空中物体放置,无需预设姿态或任务特定训练,在多样化的空中场景中实现75%的平均成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27515 2026-06-29 cs.LG physics.geo-ph 新提交 50%

Boundary condition fidelity for bottom-hole pressure and CO2 plume prediction in geological carbon storage

地质碳封存中井底压力与CO2羽流预测的边界条件保真度

Romal Ramadhan, Seyyed A. Hosseini, Larry W. Lake

机构 * Department of Earth and Planetary Sciences, Jackson School of Geosciences, The University of Texas at Austin(德克萨斯大学奥斯汀分校杰克逊地球科学学院地球与行星科学系) Bureau of Economic Geology, The University of Texas at Austin(德克萨斯大学奥斯汀分校经济地质局) Hildebrand Department of Petroleum and Geosystems Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校希尔德布兰德石油与地质系统工程系)

专题命中 可控生成 :diffusion(abstract)

AI总结 研究通过对比十种截断域边界处理方法与全域参考模拟,评估边界条件保真度对井底压力和CO2羽流预测的影响,发现保留角点孔隙体积是关键,而透射率修正并非普遍有益,渐进修正结合透射率修正效果最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏