arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3019 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 197 篇

2606.31426 2026-07-01 eess.SP 新提交 50%

Towards a Joint Task-Oriented and Generative Semantic Communication Framework for 6G Networks

面向6G网络的联合任务导向与生成式语义通信框架

Soheyb Ribouh, Phil Polo Ditsia Di Ngoma

专题命中 可控生成 :diffusion(abstract)

AI总结 提出一种基于OFDM的端到端语义通信框架,通过图表示提取视觉语义,结合ST-GNN进行碰撞风险估计,并利用扩散模型重建场景,在MIMO配置下实现99.1%数据压缩,优于JPEG/HEVC,同时保持下游推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31132 2026-07-01 cs.RO 新提交 50%

ELASTIC: Efficiently Learning to Adaptively Scale Test-Time Compute for Generative Control Policies

ELASTIC: 高效学习自适应缩放测试时计算以生成控制策略

Andrew Zou Li, Gokul Swamy, Yonatan Bisk, Andrea Bajcsy

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出ELASTIC算法,通过元强化学习为生成控制策略学习状态依赖的测试时计算调度,在扩散策略和视觉-语言-动作模型上实现帕累托最优,减少34%延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31968 2026-07-01 math.OC math.AP 新提交 50%

Approximate Controllability of the generalized Burgers-Huxley equation in one dimension

一维广义Burgers-Huxley方程的近似可控性

Aman Patel, Mohmedmunavvar Mubarak Bapu, Mrinmay Biswas

专题命中 可控生成 :diffusion(abstract)

AI总结 研究广义Burgers-Huxley方程通过内部控制的可控性,证明非全局近似可控,但可在适当时间内将系统从任一稳态驱动到另一稳态的任意小邻域,前提是两者在同一连通分量中。

Comments 48 pages, Comments Welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27515 2026-06-29 cs.LG physics.geo-ph 新提交 50%

Boundary condition fidelity for bottom-hole pressure and CO2 plume prediction in geological carbon storage

地质碳封存中井底压力与CO2羽流预测的边界条件保真度

Romal Ramadhan, Seyyed A. Hosseini, Larry W. Lake

机构 * Department of Earth and Planetary Sciences, Jackson School of Geosciences, The University of Texas at Austin(德克萨斯大学奥斯汀分校杰克逊地球科学学院地球与行星科学系) Bureau of Economic Geology, The University of Texas at Austin(德克萨斯大学奥斯汀分校经济地质局) Hildebrand Department of Petroleum and Geosystems Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校希尔德布兰德石油与地质系统工程系)

专题命中 可控生成 :diffusion(abstract)

AI总结 研究通过对比十种截断域边界处理方法与全域参考模拟,评估边界条件保真度对井底压力和CO2羽流预测的影响,发现保留角点孔隙体积是关键,而透射率修正并非普遍有益,渐进修正结合透射率修正效果最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25985 2026-06-25 cs.RO 新提交 50%

Action ControlNet: A Lightweight Delay-Aware Adapter for Smooth Asynchronous Control in Vision-Language-Action Models

Action ControlNet: 一种轻量级延迟感知适配器,用于视觉-语言-动作模型中的平滑异步控制

Tiecheng Guo, Meng Guo

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出Action ControlNet,一种轻量级延迟感知适配器,通过将已执行的动作后缀作为残差条件,在不重新训练骨干网络的情况下,减少异步执行中的动作不连续和抖动,提升机器人操控的鲁棒性和平滑性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23979 2026-06-24 math.OC 新提交 50%

Traveling profiles and control cost for a PDE describing the evolution of invasive species

描述入侵物种演化的偏微分方程的传播轮廓与控制成本

Stefano Bianchini, Chiara Trifone

专题命中 可控生成 :diffusion(abstract)

AI总结 本文研究入侵物种控制模型中最优行波解的结构,通过相平面分析得到唯一最优轮廓,并证明控制成本函数关于速度仅C1光滑、关于非线性项Lipschitz连续,且一般非凸非次加性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23800 2026-06-24 quant-ph 新提交 50%

Unitary Designs from Doped Matchgate Circuits

掺杂匹配门电路中的酉设计

Fabian Ballar Trigueros, Zheng-Hang Sun, Xhek Turkeshi, Piotr Sierant, Poetri Sonya Tarabunga

专题命中 可控生成 :diffusion(abstract)

AI总结 研究通过掺杂非高斯门突破匹配门电路的可积性限制,利用匹配门交换子框架分析酉2-设计形成,得到非高斯门数量的严格界限,并展示在局部电路中的扩散限制。

Comments 38 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21769 2026-06-23 q-fin.MF q-fin.TR 新提交 50%

Optimal Dynamic Fees for Automated Market Makers: A Stochastic Control Approach to Loss-Versus-Rebalancing

自动做市商的最优动态费用:针对再平衡损失的随机控制方法

Farbod Ghasemlu

专题命中 可控生成 :diffusion(abstract)

AI总结 研究恒定乘积自动做市商中流动性提供者的最优动态费用策略,通过随机控制方法平衡交易收入与套利损失,证明最优费用与波动率正相关且具有顺周期性。

Comments 18 pages, 3 figures, 1 table; JEL: G12, G14, C61, D47

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21765 2026-06-23 math.OC 新提交 50%

Optimal Control Problem with Mixed Control and State Constraints for Cancer Chemotherapy and Treatment Optimization

具有混合控制和状态约束的癌症化疗与治疗优化最优控制问题

David Lassounon, Aziz Belmiloudi, Mounir Haddou

专题命中 可控生成 :diffusion(abstract)

AI总结 针对化疗药物递送策略,提出具有混合控制和状态约束的最优控制问题,通过非线性反应扩散方程建模,推导最优性必要条件,并在肺癌消除案例中验证策略有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21575 2026-06-23 math.OC math.PR 新提交 50%

Nonsmooth Obstacles and Killed Resolvents in Reflected Stochastic Control

反射随机控制中的非光滑障碍与杀灭预解式

Louis Shuo Wang, Jiguang Yu, Ye Liang

专题命中 可控生成 :diffusion(abstract)

AI总结 针对具有非光滑最大型收益的二维反射扩散最优停止问题,提出测度值变分公式化,证明停止增益为带奇异性支撑的Radon测度,并给出杀灭预解表示,修正了无效的无限制预解公式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19957 2026-06-19 cs.CY 新提交 50%

Modest, artistic, and radical solutions to the environmental impact of image-generating machine learning

图像生成机器学习的环境影响:温和、艺术与激进的解决方案

Laura U. Marks, Jess MacCormack, Kehui Li

专题命中 可控生成 :image generation(abstract)

AI总结 针对图像生成ML的高能耗问题,从计算机工程、媒体研究和艺术角度探索非精确计算、小模型、低精度硬件等解决方案,并提出真实成本核算。

Comments Paper in Proceedings of LIMITS 2026: 12th Workshop on Computing within Limits, 2026-06-23-25, Online

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19016 2026-06-18 quant-ph 新提交 50%

Coherent Microwave Control of Optically Addressable Donor Qubits in ZnO

ZnO中光学可寻址施主量子比特的相干微波控制

Ethan R. Hansen, Dong-Rong Wu, Yixuan Li, Yaser Silani, Joseph Falson, Yusuke Kozuka, Masashi Kawasaki, Yuan Ping, Kai-Mei C Fu

专题命中 可控生成 :diffusion(abstract)

AI总结 通过微波脉冲实现ZnO中注入的$^{115}$In施主电子自旋的相干控制,利用光泵浦初始化与读出,观测到拉比振荡和超精细跃迁,但低场下相干时间显著短于预期。

Comments 14 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17893 2026-06-18 eess.SP cs.IT math.IT 新提交 50%

Condition-Wise Sinkhorn Drifting for One-Shot Learned Channel Simulation

条件式Sinkhorn漂移用于一次性学习信道仿真

Rick Fritschek, Rafael F. Schaefer

专题命中 可控生成 :diffusion(abstract)

AI总结 针对学习通信系统中扩散式反向采样成本高的问题,提出条件式Sinkhorn漂移,一种一次性信道替代方法,通过条件Sinkhorn目标训练生成器,在AWGN、瑞利衰落等信道下评估,条件式变体在条件诊断和符号编码检查中表现最强。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17971 2026-06-17 cs.CE math-ph math.MP 新提交 50%

Online Spectral Deflation for State Constrained Optimal Control Problems

状态约束最优控制问题的在线谱消去法

Teeratorn Kadeethum, Francesco Ballarin, Youngsoo Choi, Sanghyun Lee

专题命中 可控生成 :diffusion(abstract)

AI总结 针对参数化PDE约束最优控制中的点态状态约束问题,提出一种可复用的谱消去策略,通过预计算参考Schur补的低阶特征模态并在在线阶段限制到非活动集,结合A-DEF2消去基加速Jacobi预处理CG求解,在多个基准测试中减少55-98%的CG迭代次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16435 2026-06-16 eess.AS cs.SD 新提交 50%

Unified Audio Generation and Editing via Joint Condition Modeling and Progressive Training

统一音频生成与编辑:联合条件建模与渐进训练

Haocheng Dong, Yuheng Lu, Cheng Gong, Shansong Liu, Xiao-Lei Zhang, Xuelong Li

机构 * Department of Electronic Engineering and Information Science, University of Science and Technology of China(电子工程与信息科学系,中国科学技术大学) Tianjin Key Laboratory of Cognitive Computing and Application, School of Artificial Intelligence, Tianjin University(认知计算与应用重点实验室,天津大学人工智能学院) Institute of Artificial Intelligence of China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI))

专题命中 可控生成 :diffusion(abstract)

AI总结 提出AudioWeave统一模型,通过联合条件建模和渐进多阶段训练策略,实现文本到音频生成和音频编辑的单一框架,性能与专用模型相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15930 2026-06-16 cs.RO cs.AI 新提交 50%

ControlMap: Controllable High-Definition Map Generation for Traffic Scenario Simulation

ControlMap: 用于交通场景仿真的可控高清地图生成

Marwan Farag, Steffen Wäldele, Yu Yao

机构 * University of Stuttgart(斯图加特大学) Robert Bosch GmbH(博世公司) Motional, Inc(Motional公司)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出基于潜在扩散和ControlNet的数据驱动管道,实现可控高清地图生成,支持空间引导、条件强度调整和城市风格迁移,并引入新指标评估控制信号遵循度和地图真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15319 2026-06-16 cs.DC 新提交 50%

Adaptive Resource Management and Quality Control for Streaming Video Generation

自适应资源管理与质量控制用于流式视频生成

Yifei Xia, Hao Yuan, Suhan Ling, Haoran Sun, Hanke Zhang, Xupeng Miao, Fangcheng Fu, Bin Cui

专题命中 可控生成 :diffusion(abstract)

AI总结 针对自回归扩散Transformer在实时流式视频生成中的播放连续性SLO,提出基于播放余量的服务系统SlackServe,通过三级优先级队列、重新归位和弹性序列并行重新分配资源,并在质量下限下通过双模帕累托路由选择每块保真度配置,显著提升QoE并降低首块延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07015 2026-06-16 cs.SD cs.AI 新提交 50%

Towards Unified Song Generation and Singing Voice Conversion with Accompaniment Co-Generation

面向统一歌曲生成与带伴奏共生成的歌声转换

Ziyu Zhang, Chunyu Qiang, Xiaopeng Wang, Yuxin Guo, Kang Yin, Wenjie Tian, Jingbin Hu, Tianlun Zuo, Zhao Guo, Teng Ma, Yuzhe Liang, Chen Zhang, Lei Xie

机构 * Northwestern Polytechnical University(西北工业大学) Kuaishou Technology(快手科技) Beijing Institute of Technology(北京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出UniSinger框架,基于多模态扩散Transformer统一零样本歌曲生成与伴奏共生成歌声转换,通过共享说话人嵌入和课程学习策略实现跨任务音色控制与多任务优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14255 2026-06-15 cs.RO 新提交 50%

ReactVLA: Fast and Lightweight Reactive Robot Manipulation via Improved Mean Flow Action Generation

ReactVLA: 通过改进的平均流动作生成实现快速轻量级反应式机器人操作

Yanzhao Guo, Wenkai Chen, Jianwei Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Technical Aspects of Multimodal Systems (TAMS), Department of Informatics, Universität Hamburg(汉堡大学信息学系多模态系统技术方面(TAMS))

专题命中 可控生成 :diffusion(abstract)

AI总结 提出ReactVLA框架,结合改进的平均流动作生成器和注意力残差机制,实现轻量低延迟的实时机器人操作,在模拟和真实任务中性能提升达1.65倍,推理速度提升4倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13394 2026-06-12 cs.RO 新提交 50%

GeoHAT: Geometry-Adaptive Hybrid Action Transformer for Mobile Manipulation

GeoHAT: 几何自适应混合动作Transformer用于移动操作

Xiangyu Zhu, Renjun Wu, Luzhou Ge, Jinyan Liu, Xuesong Li

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出GeoHAT框架,通过轻量级傅里叶空间编码器注入几何信息,并采用混合全身动作解码器分解机械臂与基座动作,在ManiSkill-HAB基准上成功率提升23.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10340 2026-06-10 cs.RO 新提交 50%

OMG: Omni-Modal Motion Generation for Generalist Humanoid Control

OMG: 面向通用人形机器人的全模态运动生成

Siqiao Huang, Kun-Ying Lee, Dongming Qiao, Guanqi He, Zhenyu Wang, Yitang Li, Shaoting Zhu, Hang Zhao

机构 * Tsinghua University(清华大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出OMG框架,通过精心策划的数据流程和扩散模型,实现基于语言、音频和参考动作的全模态全身控制,展示了最先进的性能和可扩展性。

Comments Project Page: https://tsinghua-mars-lab.github.io/OMG/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10948 2026-06-10 nlin.AO nlin.CD 新提交 50%

Complexity synchronization as a diagnostic and control principle for adaptive systems

自适应系统的复杂性同步作为诊断与控制原则

Korosh Mahmoodi, Scott E. Kerick, Piotr J. Franaszczuk, David L. Boothe, Paolo Grigolini, Bruce J. West

专题命中 可控生成 :diffusion(abstract)

AI总结 提出复杂性同步(CS)作为自适应系统的诊断与干预原则,通过多智能体模型验证其与协作性能的关系,揭示功能相关子系统并指导修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09572 2026-06-09 cs.RO cs.AI 新提交 50%

CT-VAM: A Cerebello-Thalamic-Inspired Vision-Action Model for Efficient Visuomotor Control

CT-VAM: 一种小脑-丘脑启发的视觉-动作模型用于高效视觉运动控制

Jiacheng Li, Yize Guo, Jiabin Guo, Qingchen Liu, Jiahu Qin

机构 * University of Science and Technology of China(中国科学技术大学) AIRLab, Department of Automation(自动化系AIRLab)

专题命中 可控生成 :inpainting(abstract)

AI总结 提出CT-VAM模型,通过TARS条件注意力解码器融合异构输入,以68M参数实现与大型VLA模型相当的LIBERO成功率,并降低推理延迟,支持高频控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08003 2026-06-09 gr-qc astro-ph.CO hep-th 新提交 50%

Does Eternal Inflation Violate the Smeared Null Energy Condition?

永恒暴胀是否违反涂抹零能条件?

Dong-Hui Yu, Yong Cai

专题命中 可控生成 :diffusion(abstract)

AI总结 研究永恒暴胀中暴胀子的随机向上涨落是否违反涂抹零能条件(SNEC),通过Fokker-Planck方程和单轨迹分析表明,引力反作用在SNEC界限达到前已破坏背景时空假设,因此不违反SNEC。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 47 篇

2607.20789 2026-07-24 cs.CV cs.GR 新提交 84%

3D-GIMP: When 3D Gaussian Inpainting Meets PatchMatch

3D-GIMP:当3D高斯图像修复与PatchMatch相遇

Xuening Tian, Dieter Schmalstieg, Shohei Mori

机构 * University of Stuttgart(斯图加特大学)

专题命中 图像修复 :inpainting(title,abstract);diffusion(abstract);分类 cs.CV、cs.GR

AI总结 针对3D场景编辑中迭代扩散模型的问题,提出3D-GIMP混合范式,通过在关键参考视图进行图像修复并利用3D感知PatchMatch算法传播纹理,优先保证重建一致性,在渲染速度和视图一致性上表现更优。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29133 2026-08-03 cs.GR 新提交 83%

Interactive Generative Motion Editing via Scheduled Inpainting

基于调度补全的交互式生成运动编辑

Dhruv Agrawal, Dominik Borer, Luca Vögeli, Robert Sumner, Martin Guay, Jakob Buhmann

专题命中 图像修复 :inpainting(title,abstract);分类 cs.GR

AI总结 本研究提出调度补全方法,实现交互式生成运动编辑,结合运动合成与编辑,可优化现有动画并支持多类编辑应用,经多组实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10140 2026-07-14 cs.CV cs.AI 新提交 83%

FlowPainter: Inpainting Optical Flow via Confidence-Guided Completion

FlowPainter:通过置信度引导完成来修复光流

Yuang Meng, Chenyang Wu, Xianshun Liu, Chun-Le Guo, Zichen Liang, Lina Lei, Jie Liang, Hui Zeng, Chongyi Li, Lei Zhang

机构 * Nankai University(南开大学) The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

专题命中 图像修复 :inpainting(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 研究光流估计问题,提出FlowPainter框架,结合迭代优化和扩散估计范式,用轻量级置信度感知网络区分区域,通过置信度引导完成光流修复,实验表明其在可比训练下精度高、收敛快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27584 2026-06-29 cs.CV cs.AI 新提交 83%

CoIn: Comprehensive 2D-3D Inpainting with Gaussian Splatting Guidance

CoIn:基于高斯泼溅引导的全面2D-3D修复

Hana Kim, Minje Kim, Tae-Kyun Kim

机构 * LG Electronics(LG电子) KAIST(韩国科学技术院)

专题命中 图像修复 :inpainting(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出CoIn框架,通过多阶段一致性流水线桥接2D修复模型与3D高斯泼溅,支持任意形状掩码的物体移除与插入,实现双向信息流引导的3D场景修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19195 2026-06-18 cs.CV 新提交 83%

Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance

Moebius: 0.2B轻量级图像修复框架,性能达10B级别

Kangsheng Duan, Ziyang Xu, Wenyu Liu, Xiaohu Ruan, Xiaoxin Chen, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) VIVO AI Lab(VIVO人工智能实验室)

专题命中 图像修复 :inpainting(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出Moebius轻量级图像修复框架,通过局部-λ混合交互模块和自适应多粒度蒸馏策略,以0.22B参数实现与10B级模型FLUX.1-Fill-Dev相当甚至更优的生成质量,推理速度提升15倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07250 2026-07-09 eess.SP 新提交 82%

Flow-PIN: A Two-Stage Power-Flow-Guided Method for System-Wide Multivariate Profile Inpainting in Distribution Networks

Flow-PIN:一种用于配电网全系统多变量剖面修复的两阶段潮流引导方法

Zhenghao Zhou, Yiyan Li, Yike Guo, Xinyi Ma, Zheng Yan, Mo-Yuen Chow

专题命中 图像修复 :inpainting(title,abstract);diffusion(abstract)

AI总结 针对配电网数据缺失恢复问题,提出两阶段物理引导框架Flow-PIN。第一阶段用条件流匹配模型结合物理惩罚生成候选值,第二阶段用拓扑感知潮流引导细化器校正偏差,实现了高精度、捕捉波动及保留相关性的多变量剖面修复。

详情

展开后加载摘要…

URL PDF HTML 收藏