arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-16 至 2026-06-16 共收录 15 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 15 篇

2606.15889 2026-06-16 cs.CV 新提交 79%

SiGnature: Explicit Motion Diffusion for Stylized Semantic Gesture

SiGnature: 显式运动扩散用于风格化语义手势

Adi Rosenthal, Tomer Koren, Nadav Shaked, Doron Friedman, Ariel Shamir

机构 * Reichman University(赖希曼大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 提出SiGnature框架,通过显式关节旋转空间和免训练推理机制JMI,实现语义手势的精准控制与说话人风格的高保真保持,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16345 2026-06-16 math.OC cs.SY eess.SY 新提交 78%

Output-Feedback Boundary Control of Reaction--Diffusion PDEs on Arbitrary Lipschitz Domains: A Target-Domain Approach

任意Lipschitz域上反应-扩散PDE的输出反馈边界控制:一种目标域方法

Rafael Vazquez

专题命中 可控生成 :diffusion(title,abstract)

AI总结 提出一种域扩展框架,通过将不规则域嵌入已知稳定设计的目标域(如球或矩形),实现任意有界Lipschitz域上反应-扩散方程的输出反馈边界镇定,并保证适定性和指数稳定性。

Comments Preprint submitted to IEEE Transactions on Automatic Control

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08946 2026-06-16 stat.CO physics.chem-ph physics.comp-ph 新提交 78%

A Diffusion Monte Carlo algorithm employing depth first traversal and a stack instead of a swarm

一种采用深度优先遍历和栈而非群体的扩散蒙特卡罗算法

Bastiaan J. Braams

专题命中 可控生成 :diffusion(title,abstract)

AI总结 提出基于深度优先遍历和栈的扩散蒙特卡罗算法(DMCD),通过栈管理分裂历史,相比传统广度优先群体方法更节省内存,并统一了特征值问题与线性方程问题的算法处理。

Comments 12 pages. The code in the original (v1) Arxiv submission could randomly get trapped in a cycle where the same walker is all the time restarted with ever decreasing weight. The issue is described and addressed in this (v2) submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15819 2026-06-16 cs.CV cs.AI 新提交 77%

SACE: Concept Erasure at the Semantic Singularity in Visual Autoregressive Models

SACE: 视觉自回归模型中的语义奇点概念擦除

Siya Yang, Nanxiang Jiang, Zhaoxin Fan, Yunfeng Diao

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对视觉自回归模型应用现有擦除技术导致语义崩溃和视觉伪影的问题,提出语义奇点公理并通过增量语义显著性分析验证,进而引入首个尺度感知的概念擦除框架SACE,在首尺度耦合熵正则化擦除目标与恢复性保存损失,实现精确概念擦除。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17040 2026-06-16 cs.RO cs.CV 新提交 57%

R2RDreamer: 3D-aware Data Augmentation for Spatially-generalized 2D Manipulation Policies

R2RDreamer: 面向空间泛化的2D操作策略的3D感知数据增强

Xiuwei Xu, Haowen Sun, Angyuan Ma, Yiwei Zhang, Zhenyu Wu, Xiaofeng Wang, Bingyao Yu, Zheng Zhu, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) BUPT(北京邮电大学) GigaAI

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出R2RDreamer框架,通过轻量级3D编辑和2D视频补全,从少量真实演示生成几何一致的增强数据,提升2D操作策略的空间泛化能力。

Comments Project page: https://r2rdreamer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15592 2026-06-16 cs.CV 新提交 57%

DenseControl: Instance-Level Controllable Synthesis of Dense Crowd Image

DenseControl: 密集人群图像的实例级可控合成

Juncheng Wang, Lei Shang, Wang Lu, Baigui Sun, Shujun Wang

机构 * the Hong Kong Polytechnic University(香港理工大学) Tongyi lab, Alibaba Group(阿里巴巴集团通义实验室) Tsinghua University(清华大学)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 提出DenseControl管道,通过隔离对象嵌入图和隐式尺度嵌入策略,实现密集人群图像中实例位置、大小、背景、风格和属性的精确控制,在合成质量和下游应用中达到最优。

Comments Accepted to IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15341 2026-06-16 cs.CV 新提交 57%

CausalDrive: Real-time Causal World Models for Autonomous Driving

CausalDrive: 用于自动驾驶的实时因果世界模型

Tianyi Yan, Huan Zheng, Dubing Chen, Meizhi Qu, Yingying Shen, Lijun Zhou, Mingfei Tu, Bing Wang, Guang Chen, Hangjun Ye, Haiyang Sun, Cheng-zhong Xu, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学协同创新研究院,科技学院) Xiaomi EV(小米汽车) CASIA(中国科学院自动化研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出CausalDrive,一种可控、实时的驾驶世界渲染器,通过因果预测和Context-Forced DMD架构实现交互式模拟,支持闭环评估、强化学习后训练和人在环仿真。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15072 2026-06-16 cs.CV 新提交 57%

Texture-Shape Bias Balancing for Robust Synthetic-to-Real Semantic Segmentation in Automotive NIR Imagery

纹理-形状偏差平衡用于汽车近红外图像中鲁棒的合成到真实语义分割

Felix Stillger, Ben Hamscher, Lukas Hahn, Annika Mütze, Tobias Meisen, Kira Maag

机构 * University of Wuppertal(伍珀塔尔大学) Aptiv(Aptiv公司) Heinrich Heine University Düsseldorf(海因里希·海涅大学杜塞尔多夫) Osnabrück University(奥斯纳布吕克大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出生成式增强框架,通过目标风格适配和Voronoi风格多样化策略平衡纹理-形状偏差,实现近红外图像合成到真实域适应,将域差距减少高达63.6%。

Comments Accepted at ECML PKDD 2026 (ADS Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16435 2026-06-16 eess.AS cs.SD 新提交 50%

Unified Audio Generation and Editing via Joint Condition Modeling and Progressive Training

统一音频生成与编辑:联合条件建模与渐进训练

Haocheng Dong, Yuheng Lu, Cheng Gong, Shansong Liu, Xiao-Lei Zhang, Xuelong Li

机构 * Department of Electronic Engineering and Information Science, University of Science and Technology of China(电子工程与信息科学系,中国科学技术大学) Tianjin Key Laboratory of Cognitive Computing and Application, School of Artificial Intelligence, Tianjin University(认知计算与应用重点实验室,天津大学人工智能学院) Institute of Artificial Intelligence of China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI))

专题命中 可控生成 :diffusion(abstract)

AI总结 提出AudioWeave统一模型,通过联合条件建模和渐进多阶段训练策略,实现文本到音频生成和音频编辑的单一框架,性能与专用模型相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15930 2026-06-16 cs.RO cs.AI 新提交 50%

ControlMap: Controllable High-Definition Map Generation for Traffic Scenario Simulation

ControlMap: 用于交通场景仿真的可控高清地图生成

Marwan Farag, Steffen Wäldele, Yu Yao

机构 * University of Stuttgart(斯图加特大学) Robert Bosch GmbH(博世公司) Motional, Inc(Motional公司)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出基于潜在扩散和ControlNet的数据驱动管道,实现可控高清地图生成,支持空间引导、条件强度调整和城市风格迁移,并引入新指标评估控制信号遵循度和地图真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15319 2026-06-16 cs.DC 新提交 50%

Adaptive Resource Management and Quality Control for Streaming Video Generation

自适应资源管理与质量控制用于流式视频生成

Yifei Xia, Hao Yuan, Suhan Ling, Haoran Sun, Hanke Zhang, Xupeng Miao, Fangcheng Fu, Bin Cui

专题命中 可控生成 :diffusion(abstract)

AI总结 针对自回归扩散Transformer在实时流式视频生成中的播放连续性SLO,提出基于播放余量的服务系统SlackServe,通过三级优先级队列、重新归位和弹性序列并行重新分配资源,并在质量下限下通过双模帕累托路由选择每块保真度配置,显著提升QoE并降低首块延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07015 2026-06-16 cs.SD cs.AI 新提交 50%

Towards Unified Song Generation and Singing Voice Conversion with Accompaniment Co-Generation

面向统一歌曲生成与带伴奏共生成的歌声转换

Ziyu Zhang, Chunyu Qiang, Xiaopeng Wang, Yuxin Guo, Kang Yin, Wenjie Tian, Jingbin Hu, Tianlun Zuo, Zhao Guo, Teng Ma, Yuzhe Liang, Chen Zhang, Lei Xie

机构 * Northwestern Polytechnical University(西北工业大学) Kuaishou Technology(快手科技) Beijing Institute of Technology(北京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出UniSinger框架,基于多模态扩散Transformer统一零样本歌曲生成与伴奏共生成歌声转换,通过共享说话人嵌入和课程学习策略实现跨任务音色控制与多任务优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00924 2026-06-16 cs.LG cs.AI 版本更新 50%

StyleShield: Exposing the Fragility of AIGC Detectors through Continuous Controllable Style Transfer

StyleShield: 通过连续可控风格迁移揭示AIGC检测器的脆弱性

Guantian Zheng

机构 * National University of Singapore(新加坡国立大学)

专题命中 可控生成 :image synthesis(abstract)

AI总结 提出StyleShield,一种基于流匹配的条件文本风格迁移框架,通过连续控制风格迁移强度,在保持语义相似度的同时实现高规避率,并引入RateAudit算法质疑基于分数的检测可靠性。

Comments 12 pages, 5 figures. Code and model weights will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21391 2026-06-16 cs.RO cs.AI 版本更新 50%

From Noise to Intent: Anchoring Generative VLA Policies with Residual Bridges

从噪声到意图:基于残差桥的生成式VLA策略锚定

Yiming Zhong, Yaoyu He, Zemin Yang, Pengfei Tian, Yifan Huang, Qingqiu Huang, Xinge Zhu, Yuexin Ma

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出ResVLA架构,通过频谱分析将机器人控制解耦为确定性低频锚点和随机高频残差,利用残差扩散桥聚焦局部动态精化,实现高效表示与强条件对齐。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10680 2026-06-16 cs.DB 50%

Evaluating SQL Understanding in Large Language Models

评估大型语言模型对SQL的理解能力

Ananya Rahaman, Anny Zheng, Mostafa Milani, Fei Chiang, Rachel Pottinger

专题命中 可控生成 :image generation(abstract)

AI总结 本文评估大型语言模型在SQL任务中的理解能力,通过检测语法错误、识别缺失token、预测查询性能等任务,揭示模型在语义理解和连贯性方面的局限。

Comments 12 pages conference submission

Journal ref Proc. EDBT 2025, pp. 909-921, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏