arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-02 至 2026-07-02 共收录 53 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 2 篇

2606.08492 2026-07-02 cs.CV cs.AI 新提交 86%

Seeing is Believing: Aligning Prompt Rewriting with Visual Anchors for Text-to-Image Generation

眼见为实:基于视觉锚点的提示重写对齐用于文本到图像生成

Xuanyi Liu, Deyi Ji, Junyu Lu, Jing Wang, Lanyun Zhu, Qianxiong Xu, Xuhang Chen, Tianrun Chen, Siwei Ma

机构 * Peking University(北京大学) Tencent(腾讯) Dalian University of Technology(大连理工大学) Nanyang Technological University(南洋理工大学) University of Cambridge(剑桥大学) Zhejiang University(浙江大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 提出FaithRewriter框架,利用多模态大模型生成中间视觉线索,结合大语言模型生成视觉锚定的增强提示,再蒸馏至小模型,以缩小用户意图与生成图像之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24548 2026-07-02 cs.CV 新提交 79%

Are Text-to-Image Models Inductivist Turkeys? A Counterfactual Benchmark for Causal Reasoning

文本到图像模型是归纳主义的火鸡吗?一个用于因果推理的反事实基准

Jiayi Lei, Yuandong Pu, Xingyu Han, Rongpeng Zhu, Jing Xu, Jinyao Wang, Zijian Zhou, Bin Fu, Yuewen Cao, Yihao Liu, Hongsheng Li

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 提出反事实基准CF-World,通过三个递进层级测试T2I模型在违反现实先验规则下的图像生成能力,发现所有模型在反事实设置下性能急剧下降,原因是模型将世界知识与视觉外观编码为紧密耦合的模式。

Comments 10 pages, 7 figures. Project page: https://github.com/jylei16/CF-World.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 1 篇

2607.00410 2026-07-02 cs.CV cs.LG 新提交 70%

MindAU: EEG-Conditioned Facial Action Unit Editing via Dual-Stream Manifold Alignment

MindAU: 基于双流流形对齐的脑电条件面部动作单元编辑

Zhenhang Li, Xin Zhou, Hao Deng, Lijun Yin

机构 * Binghamton University(宾汉姆顿大学) Massachusetts General Hospital(马萨诸塞综合医院) Harvard Medical School(哈佛医学院)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 提出MindAU框架,通过双流流形对齐将EEG特征与AU文本语义和视觉位移对齐,实现高保真身份保持的面部动作单元编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 38 篇

2607.00402 2026-07-02 cs.CV cs.AI cs.LG 新提交 88%

The Illusion of High Utility in Safety Alignment of Text-to-Image Diffusion Models

文本到图像扩散模型安全对齐中的高效用幻觉

Adeel Yousaf, Soumik Ghosh, James Beetham, Amrit Singh Bedi, Mubarak Shah

机构 * Institute of Artificial Intelligence University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 揭示安全对齐方法在粗粒度指标上看似高效用,但在细粒度语义正确性上显著下降,提出结构感知几何正则化(SAGE)以恢复结构化效用。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00817 2026-07-02 cs.CV 新提交 85%

Training-Free Debiasing of Diffusion Models via CLIP-Guided Denoising Optimization

无需训练的扩散模型去偏方法:基于CLIP引导的去噪优化

Dain Kim, Jinseo Kim, Sungyong Baik

机构 * Dept. of Artificial Intelligence, Hanyang University(汉阳大学人工智能系) Dept. of Data Science, Hanyang University(汉阳大学数据科学系)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出TES框架,通过扩散过程中优化文本嵌入来缓解人口统计偏见,无需重新训练,使用两阶段策略(早期全局对齐+迭代去噪时CLIP反馈)实现稳定可控的属性引导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01147 2026-07-02 cs.CV 新提交 83%

EquiSteer: Cross-Attention Steering Towards a Fairer Text-Guided Image Generation

EquiSteer: 面向更公平的文本引导图像生成的交叉注意力引导

Tatiana Gaintseva, Akshit Achara, Gregory Slabaugh, Jiankang Deng, Ismail Elezi

机构 * Queen Mary University of London(伦敦玛丽女王大学) Huawei Noah’s Ark(华为诺亚方舟实验室) King’s College London(伦敦国王学院) Imperial College London(帝国理工学院)

专题命中 扩散模型 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出EquiSteer,一种无需训练的方法,通过在推理时引导交叉注意力激活来减少文本到图像扩散模型中的性别偏见,平均减少高达87%的性别差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00183 2026-07-02 cs.CV 新提交 83%

DriftScope: Measuring The Hidden Effects of Diffusion Model Adaptation

DriftScope: 测量扩散模型适应的隐藏效应

Héctor Laria, Yiping Han, Julian D. Santamaria, Kai Wang, Bogdan Raducanu, Joost van de Weijer, Alexandra Gomez-Villa

机构 * Computer Vision Center, Barcelona, Spain(巴塞罗那计算机视觉中心) Universitat Autonoma de Barcelona, Barcelona, Spain(巴塞罗那自治大学) Program of Computer Science, City University of Hong Kong (Dongguan), China(香港城市大学(东莞)计算机科学项目) City University of Hong Kong, HK SAR, China(香港城市大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对预训练文本到图像扩散模型的适应(概念定制或遗忘),提出DriftScope诊断工具,通过稀疏自编码器和零样本分类揭示模型权重修改导致语义无关概念系统性漂移,FID/KID无法早期检测,而特定类别零样本准确率下降高达18.9点。

Comments 22 pages, 5 figures, Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00987 2026-07-02 cs.CV 新提交 79%

AVSR-Diff: Scale-Agnostic Diffusion Priors for Temporally Consistent Arbitrary-Scale Video Super-Resolution

AVSR-Diff: 用于时间一致任意尺度视频超分辨率的尺度无关扩散先验

Geunhyuk Youk, Jeonghyeok Do, Dayeon Kim, Jihyong Oh, Munchurl Kim

机构 * KAIST(韩国科学技术院) CMLab, Chung-Ang University(中央大学CMLab)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出AVSR-Diff框架,通过解耦尺度无关的潜在去噪与连续坐标渲染,并引入时间门控特征循环和尺度感知傅里叶细化模块,实现任意尺度下的高保真时间一致视频超分辨率。

Comments Accepted to ECCV 2026. Project page: https://kaist-viclab.github.io/AVSR-Diff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00647 2026-07-02 cs.CV 新提交 79%

Not All Prediction Targets Keep Training-Free Diffusion Guidance on the Manifold

并非所有预测目标都能保持无训练扩散引导在流形上

Yunsung Lee, Hyeongmin Lee

机构 * Seoul National University of Science and Technology(首尔科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文分析不同预测目标对无训练扩散引导中干净图像估计精度的影响,提出x预测能最可靠地保持引导样本在数据流形上,并引入Child FID指标评估流形损伤。

Comments Accepted to ECCV 2026. 15-page main paper with appendix (48 pages total, 14 figures). Project page: https://manluml.github.io/on-manifold-tfg

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00509 2026-07-02 cs.CV 新提交 79%

AnF-DiffPET: Anatomy- and Frequency-Guided Diffusion for PET/CT Denoising

AnF-DiffPET: 用于PET/CT去噪的解剖与频率引导扩散

Xuepeng Liu, Ruili Li, Zetong Liu, Renyiming Li, Yan Li, Yin Dai, Chao Li, Yueyang Teng

机构 * College of Medicine and Biological Information Engineering, Northeastern University(东北大学医学与生物信息工程学院) Tohoku University School of Medicine(东北大学医学院) Department of Clinical Neurosciences, University of Cambridge(剑桥大学临床神经科学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出AnF-DiffPET框架,通过解剖-频率引导、多尺度交叉变换重建和频率对比硬挖掘,解决低剂量PET去噪中的解剖引导不足、多尺度特征传播不稳定和频域恢复不确定性问题,在多个数据集上优于现有方法。

Comments 11 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00382 2026-07-02 cs.CV 新提交 79%

Vitality-Aware Compression for Efficient Image-to-Shape Diffusion Transformers

活力感知压缩:面向高效图像到形状扩散Transformer

Jaeah Lee, Hyunjin Kim, Jaewoong Cho, Gihyun Kwon

机构 * KRAFTON AI, Republic of Korea(KRAFTON AI, 韩国) Amazon, Australia(亚马逊, 澳大利亚)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出首个针对图像到形状扩散Transformer的压缩方法,通过活力引导的结构化剪枝、自适应量化和微调,在保持几何保真度下实现高达66%的模型尺寸缩减。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00058 2026-07-02 cs.CV 新提交 79%

Joint Medical Image Enhancement and Segmentation with Diffusion-based Symbiotic Information Interaction

基于扩散的共生信息交互的联合医学图像增强与分割

Ying Chen, Jinyue Li, Qiankun Li

机构 * Shenzhen Research Institute, The Chinese University of Hong Kong(香港中文大学深圳研究院) University of Science and Technology of China(中国科学技术大学) Imperial Global Singapore, Imperial College London(伦敦帝国学院新加坡分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出DiSIINet,利用扩散模型和共生信息交互模块,在统一框架中实现图像增强与分割的相互促进,在多模态医学图像上取得显著性能提升。

Comments Accepted by IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01105 2026-07-02 cs.LG 新提交 78%

SynLaD: Latent Diffusion for Generating Synthesizable Molecules Conditioned on 3D Pharmacophore Profiles

SynLaD: 基于3D药效团轮廓的条件可合成分子生成的潜在扩散模型

Miruna Cretu, John Bradshaw, Patricia Suriana, Saeed Saremi, Omar Mahmood, Kirill Shmilovich, Kangway Chuang, Vishnu Sresht, Colin Grambow

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出SynLaD框架,结合潜在扩散与反应约束生成,在3D药效团条件下同时优化分子可合成性和形状匹配,优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00917 2026-07-02 cs.LG cs.AI 新提交 78%

Valdi: Value Diffusion World Models

Valdi: 价值扩散世界模型

Christopher Lindenberg, Kashyap Chitta

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出Valdi框架,结合端到端在线训练与潜在扩散动力学模型,在CarRacing环境中使用单步扩散达到与确定性MLP基线相当的性能,揭示了预测多模态与控制性能之间的权衡。

Comments RLC 2026 WMW

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00773 2026-07-02 cs.LG cs.DC cs.DS cs.NA math.NA 新提交 78%

Accelerating Discrete Diffusion Models with Parallel-In-Time Sampling

加速离散扩散模型的时间并行采样

Yu Yao, Huanjian Zhou, Andi Han, Wei Huang, Masashi Sugiyama

机构 * The University of Tokyo(东京大学) The University of Sydney(悉尼大学) RIKEN AIP(日本理化学研究所革新智能研究中心) The Institute of Statistical Mathematics(统计数理研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出基于连续时间马尔可夫链框架的并行τ-leaping算法,利用Picard迭代实现时间并行采样加速,将复杂度从O(d log S)降至O(log(d log S)·log d),在合成和真实数据上实现7-9倍加速。

Comments 33 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00458 2026-07-02 math.AP math.PR 新提交 78%

Kinetic Fokker-Planck Equations with Nonlinear Diffusion

具有非线性扩散的动力学Fokker-Planck方程

Zimo Hao, Zhengyan Wu, Xicheng Zhang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究非线性动力学Fokker-Planck方程的存在性、正则性和唯一性,通过动力学半群平滑估计处理仅作用于速度变量的非线性扩散,建立弱解和Besov正则性,并在质量临界条件下得到唯一性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00489 2026-07-02 math.NA cs.NA physics.comp-ph 新提交 78%

A Nonstandard Finite Difference Scheme for a Nonlinear Parabolic Equation with p-Laplacian-Type Diffusion

具有p-Laplacian型扩散的非线性抛物方程的非标准有限差分格式

Achraf Zinihi, Matthias Ehrhardt, Moulay Rchid Sidi Ammi

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对含p-Laplacian型扩散的非线性抛物方程,提出一种非标准有限差分格式,通过非线性分母函数和非局部逼近保持正性、有界性和稳定性,避免标准方法的伪振荡和非物理解。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00588 2026-07-02 cs.CL 新提交 78%

Low Perplexity is Repetition: A One-Dimensional Self-Conditioning Attractor in Continuous Diffusion LMs

低困惑度即重复:连续扩散语言模型中的一维自调节吸引子

Shuai Zhang, Zijie Chen, Hongliang He, Lun Du, Zhenzhong Lan

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Ant Group(蚂蚁集团)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 发现连续扩散语言模型(如ELF)的低困惑度源于过度重复,提出一维吸引子机制并设计ACE方法消除重复,提升文本质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00208 2026-07-02 cs.CL cs.AI cs.LG 新提交 78%

SLIM-RL: Risk-Budgeted Random-Masking RL for Diffusion LLMs Without Trajectory Slicing

SLIM-RL: 无需轨迹切分的扩散LLM风险预算随机掩码强化学习

Ruikang Zhao, Zhenting Wang, Han Gao, Ligong Han

机构 * Technical University of Denmark(丹麦技术大学) MBZUAI Institute of Foundation Models(穆罕默德·本·扎耶德人工智能大学基础模型研究所) Iowa State University(爱荷华州立大学) Red Hat AI Innovation(红帽人工智能创新实验室) MIT–IBM Watson AI Lab(麻省理工学院-IBM沃森人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出SLIM-RL方法,通过τ预算解码器控制每步提交风险,结合无迹随机掩码目标和自适应方差缩减技术,在不重构训练轨迹的情况下匹配或超越现有轨迹感知方法,在数学和代码任务上取得显著提升。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00428 2026-07-02 cs.CV 新提交 70%

HyFL-CLIP: Hyperbolic Fine-Tuning of CLIP for Robust Long-Context Understanding

HyFL-CLIP: 用于鲁棒长上下文理解的CLIP双曲微调

Ji Ha Jang, Hayeon Kim, Chulwon Lee, Junghun James Kim, Se Young Chun

机构 * Dept. of Electrical and Computer Engineering(电气与计算机工程系) IPAI INMC & AIIS(智能计算与人工智能研究所) Seoul National University(首尔国立大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 提出HyFL-CLIP,通过双曲空间微调CLIP,利用跨流形相似性蒸馏和爱因斯坦中点聚合建模层次蕴含关系,提升长上下文理解鲁棒性,在文本扰动下长文本跨模态检索提升高达19.5%。

Comments Accepted to ECCV 2026. Project page: https://janeyeon.github.io/hyflclip

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01176 2026-07-02 cs.CV 新提交 57%

High-dimensional Embedding Prior for Noisy K-space Domain MRIReconstruction

高维嵌入先验用于噪声k空间域MRI重建

Yu Guan, Tianjia Huang, Qinrong Cai, Qiuyun Fan, Dong Liang, Qiegen Liu

机构 * School of Advanced Manufacturing, Nanchang University(南昌大学先进制造学院) School of Mathematics and Computer Science, Nanchang University(南昌大学数学与计算机科学学院) School of Information Engineering, Nanchang University(南昌大学信息工程学院) Academy of Medical Engineering and Translational Medicine, Medical School, Faculty of Medicine, Tianjin University(天津大学医学部医学工程与转化医学研究院) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对噪声k空间MRI重建,提出高维嵌入框架增强扩散模型表示能力,在多种噪声和欠采样条件下提升重建质量,尤其在高噪声场景效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00975 2026-07-02 cs.CV cs.AI 新提交 57%

TRCGL-Net: A Long-Tailed Multi-Label Chest X-Ray Classification Framework with Generative Data Augmentation and Label Co-Occurrence Modeling

TRCGL-Net:基于生成式数据增强和标签共现建模的长尾多标签胸部X光分类框架

Tong Shao, Hongshun Ling, Li Zhang, Jinjing Wu, Junke Wang, Yuan Gao, Fang Wang

机构 * School of Biomedical Engineering, South-Central Minzu University(中南民族大学生物医学工程学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对胸部X光多标签分类中的长尾分布问题,提出TRCGL-Net,利用可学习文本引导扩散模型生成尾部类样本、通道重加权和类别注意力机制增强特征,以及基于标签共现的图卷积网络建模类别关系,在PadChest数据集上尾部类mAP达0.4904。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00486 2026-07-02 cs.LG cs.AI cs.CV 新提交 57%

PAPA: Online Personalized Active Preference Alignment

PAPA:在线个性化主动偏好对齐

Anindya Sarkar, Nasik Muhammad Nafi, Isaac Lyngaas, Muralikrishnan Gopalakrishnan Meena, Yevgeniy Vorobeychik

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出PAPA方法,无需参数化奖励模型,通过实时用户反馈直接优化扩散模型,实现高效的偏好对齐,并基于理论提出加速微调的EPAPA策略。

Comments Accepted to ECML PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00310 2026-07-02 cs.CV cs.AI 新提交 57%

RetailSMV: Exocentric vs. Egocentric Adaptation of Foundation Video World Models in Retail

RetailSMV:零售场景中基础视频世界模型的外视角与内视角适应

Amirreza Rouhi, Rajat Aggarwal, Parikshit Sakurikar, Anoop M. Namboodiri, Sashi P. Reddi

机构 * DreamVu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究零售场景下基础视频世界模型的外视角与内视角适应,发现仅用外视角数据训练的模型在多项指标上优于或等同于联合训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00899 2026-07-02 eess.AS 新提交 50%

Positive-Incentive Noise Predictor for Adversarial Purification in Speaker Verification

说话人验证中对抗净化的正激励噪声预测器

Yibo Bai, Sizhou Chen, Michele Panariello, Hao Ma, Xiao-Lei Zhang, Xuelong Li, Massimiliano Todisco, Nicholas Evan

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出正激励噪声预测器(PnP),通过学习输入自适应的正激励噪声并混合到输入中,提升下游ASV系统的鲁棒性,在防御效果、自然语音性能和推理效率间取得平衡。

Comments Submitted to IEEE TASLP.13 pages for maunscript, 2 pages for supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00370 2026-07-02 eess.IV 新提交 50%

Enhancing Prostate Cancer Segmentation for Multi-Domain Generalization using a novel Parallel-Route Coherent Mixup Regularization Training

使用新颖的并行路由连贯混合正则化训练增强前列腺癌分割的多域泛化能力

Josiah Simeth, Sudharsan Madhavan, Victoria Brennan, Sean McBride, James Janopaul-Naylor, Justin Haseltine, Daniel Gorovets, Himanshu Nagar, Neelam Tyagi, Harini Veeraraghavan

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出并行路由连贯混合(PaRC-mix)训练方法,通过多网络层特征增强实现单源到多域泛化,在前列腺癌病灶分割中显著提升检测精度和泛化性能。

Comments 28 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00883 2026-07-02 q-fin.MF 新提交 50%

Tail Risk Management with Puts and Trend Following: A CVaR Framework for Crashes and Drawdowns

利用看跌期权和趋势跟踪进行尾部风险管理:针对崩盘和回撤的CVaR框架

Miquel Noguer I Alonso, Ali Al Fallouji

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出一个连续时间CVaR框架,将长期虚值看跌期权和系统趋势跟踪统一在尾部风险任务中,通过分析两种保护机制的时间差异,给出混合配置的充分条件,并引入四轴诊断层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01225 2026-07-02 cs.LG cs.AI 新提交 50%

Language-Critique Imitation Learning from Suboptimal Demonstrations

语言-批评模仿学习从次优演示中

Chih-Han Yang, Dai-Jie Wu, Yun-Ping Huang, Ping-Chun Hsieh, Kenneth Marino, Shao-Hua Sun

机构 * Graduate Institute of Communication Engineering, National Taiwan University (NTU)(国立台湾大学电信工程学研究所) University of Utah(犹他大学) National Yang Ming Chiao Tung University(国立阳明交通大学) NTU Artificial Intelligence Center of Research Excellence(国立台湾大学人工智能卓越研究中心)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出语言批评框架,用自然语言作为结构化监督信号从次优演示中学习策略,避免压缩为标量,在连续控制任务上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01111 2026-07-02 cs.RO cs.AI cs.LG 新提交 50%

FAR: Failure-Aware Retry for Test-Time Recovery and Continual Policy Improvement

FAR: 面向测试时恢复与持续策略改进的失败感知重试

Haoran Hao, Shahram Najam Syed, Jeffrey Ichnowski, Jeff Schneider

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出FAR框架,通过失败对比偏好适应和轻量动作扰动,使机器人从测试时失败中学习并自主恢复,结合成功轨迹持续改进策略,在仿真和真实任务中成功率分别提升17.6%和11.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00947 2026-07-02 cs.LG 新提交 50%

Diffeomorphic Optimization

微分同胚优化

Ludwig Winkler, Andrew Leaver-Fay, Joseph Kleinhenz, Pan Kessel

机构 * Microsoft Research AI4Science(微软研究院AI4Science) Prescient Design, Genentech Roche(Prescient Design, 基因泰克/罗氏)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出微分同胚优化方法,利用扩散/流模型将数据流形映射到简单基空间进行梯度下降,等价于流形上的黎曼梯度下降,并扩展到SO(3)和SE(3)群,在蛋白质设计中显著提升二级结构靶向、肽结合亲和力和Rosetta能量优化。

详情

展开后加载摘要…

URL PDF HTML 收藏