SiGnature: Explicit Motion Diffusion for Stylized Semantic Gesture
SiGnature: 显式运动扩散用于风格化语义手势
机构 * Reichman University(赖希曼大学)
专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV
AI总结 提出SiGnature框架,通过显式关节旋转空间和免训练推理机制JMI,实现语义手势的精准控制与说话人风格的高保真保持,优于现有方法。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
SiGnature: 显式运动扩散用于风格化语义手势
机构 * Reichman University(赖希曼大学)
专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV
AI总结 提出SiGnature框架,通过显式关节旋转空间和免训练推理机制JMI,实现语义手势的精准控制与说话人风格的高保真保持,优于现有方法。
任意Lipschitz域上反应-扩散PDE的输出反馈边界控制:一种目标域方法
专题命中 可控生成 :diffusion(title,abstract)
AI总结 提出一种域扩展框架,通过将不规则域嵌入已知稳定设计的目标域(如球或矩形),实现任意有界Lipschitz域上反应-扩散方程的输出反馈边界镇定,并保证适定性和指数稳定性。
Comments Preprint submitted to IEEE Transactions on Automatic Control
一种采用深度优先遍历和栈而非群体的扩散蒙特卡罗算法
专题命中 可控生成 :diffusion(title,abstract)
AI总结 提出基于深度优先遍历和栈的扩散蒙特卡罗算法(DMCD),通过栈管理分裂历史,相比传统广度优先群体方法更节省内存,并统一了特征值问题与线性方程问题的算法处理。
Comments 12 pages. The code in the original (v1) Arxiv submission could randomly get trapped in a cycle where the same walker is all the time restarted with ever decreasing weight. The issue is described and addressed in this (v2) submission
SACE: 视觉自回归模型中的语义奇点概念擦除
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)
专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV
AI总结 针对视觉自回归模型应用现有擦除技术导致语义崩溃和视觉伪影的问题,提出语义奇点公理并通过增量语义显著性分析验证,进而引入首个尺度感知的概念擦除框架SACE,在首尺度耦合熵正则化擦除目标与恢复性保存损失,实现精确概念擦除。
R2RDreamer: 面向空间泛化的2D操作策略的3D感知数据增强
机构 * Tsinghua University(清华大学) ; BUPT(北京邮电大学) ; GigaAI
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出R2RDreamer框架,通过轻量级3D编辑和2D视频补全,从少量真实演示生成几何一致的增强数据,提升2D操作策略的空间泛化能力。
Comments Project page: https://r2rdreamer.github.io/
DenseControl: 密集人群图像的实例级可控合成
机构 * the Hong Kong Polytechnic University(香港理工大学) ; Tongyi lab, Alibaba Group(阿里巴巴集团通义实验室) ; Tsinghua University(清华大学)
专题命中 可控生成 :image synthesis(abstract);分类 cs.CV
AI总结 提出DenseControl管道,通过隔离对象嵌入图和隐式尺度嵌入策略,实现密集人群图像中实例位置、大小、背景、风格和属性的精确控制,在合成质量和下游应用中达到最优。
Comments Accepted to IEEE TMM
CausalDrive: 用于自动驾驶的实时因果世界模型
机构 * SKL-IOTSC, CIS, University of Macau(澳门大学协同创新研究院,科技学院) ; Xiaomi EV(小米汽车) ; CASIA(中国科学院自动化研究所)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出CausalDrive,一种可控、实时的驾驶世界渲染器,通过因果预测和Context-Forced DMD架构实现交互式模拟,支持闭环评估、强化学习后训练和人在环仿真。
纹理-形状偏差平衡用于汽车近红外图像中鲁棒的合成到真实语义分割
机构 * University of Wuppertal(伍珀塔尔大学) ; Aptiv(Aptiv公司) ; Heinrich Heine University Düsseldorf(海因里希·海涅大学杜塞尔多夫) ; Osnabrück University(奥斯纳布吕克大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出生成式增强框架,通过目标风格适配和Voronoi风格多样化策略平衡纹理-形状偏差,实现近红外图像合成到真实域适应,将域差距减少高达63.6%。
Comments Accepted at ECML PKDD 2026 (ADS Track)
统一音频生成与编辑:联合条件建模与渐进训练
机构 * Department of Electronic Engineering and Information Science, University of Science and Technology of China(电子工程与信息科学系,中国科学技术大学) ; Tianjin Key Laboratory of Cognitive Computing and Application, School of Artificial Intelligence, Tianjin University(认知计算与应用重点实验室,天津大学人工智能学院) ; Institute of Artificial Intelligence of China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI))
专题命中 可控生成 :diffusion(abstract)
AI总结 提出AudioWeave统一模型,通过联合条件建模和渐进多阶段训练策略,实现文本到音频生成和音频编辑的单一框架,性能与专用模型相当。
ControlMap: 用于交通场景仿真的可控高清地图生成
机构 * University of Stuttgart(斯图加特大学) ; Robert Bosch GmbH(博世公司) ; Motional, Inc(Motional公司)
专题命中 可控生成 :diffusion(abstract)
AI总结 提出基于潜在扩散和ControlNet的数据驱动管道,实现可控高清地图生成,支持空间引导、条件强度调整和城市风格迁移,并引入新指标评估控制信号遵循度和地图真实性。
自适应资源管理与质量控制用于流式视频生成
专题命中 可控生成 :diffusion(abstract)
AI总结 针对自回归扩散Transformer在实时流式视频生成中的播放连续性SLO,提出基于播放余量的服务系统SlackServe,通过三级优先级队列、重新归位和弹性序列并行重新分配资源,并在质量下限下通过双模帕累托路由选择每块保真度配置,显著提升QoE并降低首块延迟。
面向统一歌曲生成与带伴奏共生成的歌声转换
机构 * Northwestern Polytechnical University(西北工业大学) ; Kuaishou Technology(快手科技) ; Beijing Institute of Technology(北京理工大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Science and Technology of China(中国科学技术大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 可控生成 :diffusion(abstract)
AI总结 提出UniSinger框架,基于多模态扩散Transformer统一零样本歌曲生成与伴奏共生成歌声转换,通过共享说话人嵌入和课程学习策略实现跨任务音色控制与多任务优化。
StyleShield: 通过连续可控风格迁移揭示AIGC检测器的脆弱性
机构 * National University of Singapore(新加坡国立大学)
专题命中 可控生成 :image synthesis(abstract)
AI总结 提出StyleShield,一种基于流匹配的条件文本风格迁移框架,通过连续控制风格迁移强度,在保持语义相似度的同时实现高规避率,并引入RateAudit算法质疑基于分数的检测可靠性。
Comments 12 pages, 5 figures. Code and model weights will be released upon acceptance
从噪声到意图:基于残差桥的生成式VLA策略锚定
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 可控生成 :diffusion(abstract)
AI总结 提出ResVLA架构,通过频谱分析将机器人控制解耦为确定性低频锚点和随机高频残差,利用残差扩散桥聚焦局部动态精化,实现高效表示与强条件对齐。
Comments Accepted to ICML 2026
评估大型语言模型对SQL的理解能力
专题命中 可控生成 :image generation(abstract)
AI总结 本文评估大型语言模型在SQL任务中的理解能力,通过检测语法错误、识别缺失token、预测查询性能等任务,揭示模型在语义理解和连贯性方面的局限。
Comments 12 pages conference submission
Journal ref Proc. EDBT 2025, pp. 909-921, 2025