arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-15 至 2026-07-15 共收录 50 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 1 篇

2607.12042 2026-07-15 cs.CV cs.LG 新提交 57%

SymbOmni: Evolving Agentic Omni Models via Symbolic Concept Learning

SymbOmni:通过符号概念学习进化智能全能模型

Jinxiu Liu, Jianru Li, Tanqing Kuang, Xuanming Liu, Kangfu Mei, Yandong Wen, Weiyang Liu

机构 * South China University of Technology(华南理工大学) Westlake University(西湖大学) Johns Hopkins University(约翰·霍普金斯大学) The Chinese University of Hong Kong(香港中文大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 针对视觉生成模型无法累积学习与自主进化的问题,提出SymbOmni智能全能模型,通过符号概念学习和归纳-转导循环运行,经言语反向传播训练。实验验证其在多方面性能优越,能有效降低令牌消耗并实现持续学习。

Comments ECCV 2026 (49 pages, 10 figures, project page: https://spherelab.ai/symbomni)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 2 篇

2607.12450 2026-07-15 cs.CV 新提交 70%

Let RGB Be the Language of Vision

让 RGB 成为视觉的语言

Timing Yang, Jinrui Yang, Xinlong Li, Yuhan Wang, Haoran Li, Yanqing Liu, Guoyizhe Wei, Jixuan Ying, Chen Wei, Rama Chellappa, Yuyin Zhou, Cihang Xie, Alan Yuille, Feng Wang

机构 * Johns Hopkins University(约翰·霍普金斯大学) UC Santa Cruz(加州大学圣克鲁兹分校) Carnegie Mellon University(卡内基梅隆大学) Rice University(莱斯大学)

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 该研究为视觉模型引入统一表述 RGB In and RGB Out(RINO),将多种视觉信息转为 RGB 图像编辑问题,共享架构参数,基于通用主干无需微调,在多视觉任务上有强大零样本性能,为统一视觉语言系统提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12539 2026-07-15 cs.CV 新提交 57%

DiTailed: Ensuring Visual Object Consistency in Text-Image-to-Image Flow Matching Models

DiTailed:在文本-图像到图像流匹配模型中确保视觉对象一致性

Francesco Taioli, Daniel Coelho, Iaroslav Melekhov, Roberto Alcover-Couso, Jose Miguel Grande Saiz, Virginia Fernandez Arguedas, Artur Bekasov

机构 * Amazon(亚马逊) Faculty(学院)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究文本引导图像编辑中生成模型视觉对象一致性问题,提出ABO-Edit数据集,发现图像编辑整流流模型条件嵌入空间特性,进而提出FlowMirror无参数辅助损失,无需架构改变提升了生成质量。

Comments Accepted to ECCV 2026. Project page: https://francescotaioli.github.io/DiTailed/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 39 篇

2607.12937 2026-07-15 eess.IV cs.CV 新提交 79%

Exact and Calibrated Diffusion Reconstruction for Digital Breast Tomosynthesis

数字乳腺断层合成的精确校准扩散重建

Imade Bouftini

机构 * Imade Bouftini

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对有限角度数字乳腺断层合成,提出用精确欧几里得投影替换近端更新来确保数据一致性,通过等渗重新校准解决不确定性问题,修复投影仪伴随不匹配,实现首个数据一致、不确定性校准的学习重建,提高了重建保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13031 2026-07-15 cs.LG cs.CV 新提交 79%

The Seriality Gap in Video Diffusion Models

视频扩散模型中的序列性差距

Jorge Diaz Chao, Konpat Preechakul, Yuxi Liu, Yutong Bai

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究视频扩散模型在多球动力学实验中的表现,发现其存在序列性差距,即任务所需串行计算与模型去噪循环不匹配,增加有效串行计算的方法可提升性能,还证明去噪步骤在串行推理和模拟任务上有结构障碍。

Comments Jorge Diaz Chao and Konpat Preechakul contributed equally. 24 pages, 12 figures, and 5 tables. Project page: https://seriality-gap.jdiazchao.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12464 2026-07-15 cs.CV cs.LG 新提交 79%

Steering Diffusion Models via Class-Contrastive Influence for Few-Shot Medical Classification

通过类对比影响引导扩散模型进行少样本医学分类

Jeeyung Kim, Erfan Esmaeili, Qiang Qiu

机构 * Purdue University(普渡大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对少样本医学分类中标记数据稀缺,现有方法忽视样本对分类有用性衡量与优化的问题,提出类对比影响(C2I)准则,通过强化学习用C2I奖励微调扩散模型,引导生成类信息丰富样本,提高了下游准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11941 2026-07-15 cs.CV cs.LG 新提交 79%

GenDiff: A Dose and Anatomy Aware Diffusion Model with Structural Prior Refinement for Low-Dose CT Reconstruction and Generalization

GenDiff:一种具有结构先验细化的剂量和解剖感知扩散模型,用于低剂量CT重建和泛化

Md Imam Ahasan, Guangchao Yang, A F M Abdun Noor, Kah Ong Michael Goh, S. M. Hasan Mahmud, Md Mahfuzur Rahman

机构 * Faculty of Information Science & Technology, Multimedia University, Malaysia(马来西亚多媒体大学信息科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对低剂量CT重建中现有方法局限性,提出GenDiff框架,联合建模剂量与解剖信息,集成多种模块,经多数据集实验验证,该方法在不同条件下鲁棒性强且重建质量优,是低剂量CT成像的有前途方案。

Comments 20 pages, 8 figures, 4 tables. Under review at PeerJ Computer Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13013 2026-07-15 cs.AI cs.SD 新提交 78%

Audio-Native Speech Recognition with a Frozen Discrete-Diffusion Language Model

使用冻结离散扩散语言模型的音频原生语音识别

Harsha Vardhan Khurdula, Abhinav Kumar Singh, Yoeven D Khemlani, Vineet Agarwal

机构 * Interfaze AI(Interfaze人工智能公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 探讨离散扩散语言模型能否用于语音识别,训练音频原生接口,用冻结Whisper编码器等,约42M参数。自然训练目标遇问题,连接主义时间分类损失打破僵局,模型在LibriSpeech test-clean上字错误率6.6%,能并行转录多种语言。

Comments 10 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12829 2026-07-15 cs.LG cs.AI cs.CL 新提交 78%

Accelerating Masked Diffusion Large Language Models: A Survey of Efficient Inference Techniques

加速掩码扩散大语言模型:高效推理技术综述

Daehoon Gwak, Minhyung Lee, Junwoo Park, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究所) Yonsei University(延世大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 综述介绍用于扩散大语言模型的统一延迟分解框架,以理清算法、架构和系统因素对推理速度的影响,将加速技术分类,提供可重复基准测试指导方针并强调实现并行生成潜力的挑战。

Comments Accepted at IJCAI-ECAI 2026 (Survey Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12576 2026-07-15 cs.SD 新提交 78%

UD-ASD: A Unified Diffusion Model for Anomalous Sound Detection

UD-ASD:一种用于异常声音检测的统一扩散模型

Pengxiang Gao, Yu Qiu, Yanzhi Song

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对异常声音检测,提出含轻量级模块的统一扩散模型,先将音频转对数梅尔频谱图,通过嵌入机器ID引导模型为特定机器重建数据,经高斯混合模型拟合误差分布,实验验证该模型在DCASE2022任务2中相比基线有显著提升。

Comments 5 pages, 3 figures, Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12423 2026-07-15 cs.RO 新提交 78%

Model-Based Diffusion Optimal Control for Multi-Robot Motion Planning

基于模型的扩散最优控制用于多机器人运动规划

Zhilin He, Yorai Shaoul, Jiaoyang Li

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对多机器人运动规划难题,介绍基于模型的扩散最优控制(MDOC),它不依赖数据,通过结合动力学模型与控制障碍函数约束投影,利用基于冲突搜索的安全机制,在模拟实验中展现出优于基线规划器的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12422 2026-07-15 cs.AI 新提交 78%

Accepted Prefixes Are Not All You Need: A Negative Result on PEFT-Based Block-Diffusion Drafting

接受前缀并非全部所需:基于PEFT的块扩散草稿生成的负面结果

Abdurrahman Javat, Allan Kazakov

机构 * Bahçeşehir University(巴赫切希尔大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究基于PEFT - BD的推测性解码方法,虽有避免分词器不匹配等优点,但在Qwen3 - 0.6B实验中未实现实际加速,因草稿生成器计算不高效。结果表明成功推测性解码需草稿生成器执行成本远低于验证器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12391 2026-07-15 cs.LG 新提交 78%

ReDiTT: Retrieval Augmented Conditional Diffusion Transformers for Asynchronous Time Series

ReDiTT:用于异步时间序列的检索增强条件扩散变压器

Saiyue Lyu, Zhitian Zhang, Ruizhi Deng, Thibaut Durand

机构 * University of British Columbia(英属哥伦比亚大学) RBC Borealis(加拿大皇家银行北极星)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对异步时间序列预测问题,提出ReDiTT模型,通过在潜在空间运行并从记忆库检索相似潜在序列作为参考条件,利用交叉注意力机制,实现稳定的长期预测并提高样本多样性,在多个数据集上取得最优性能。

Comments Accepted at TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12349 2026-07-15 cs.LG 新提交 78%

Generating Developable 3D Molecules via Pocket-Conditioned Diffusion and Property-Aware Optimization

通过口袋条件扩散和性质感知优化生成可开发的3D分子

Ruoxi Gao, Jiangweizhi Peng, Ziqi Chen, Frazier N. Baker, David C. Kombo, John L. Kane, Andrew A. Scholte, Yi Li, Matthew J. LaMarche, Luigi I. Iconaru, Hans-Peter Biemann, Mingyi Hong, Xia Ning

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对药物发现难题,提出基于条件扩散的SBDD框架conDitar-dev,含msPRL、conDitar和paOPT三个模块。在新基准上表现出色,在ADMET属性上性能提升显著,应用于两个靶点验证了其生成可开发分子的能力,还发现了新抑制剂及药物重新定位机会。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12104 2026-07-15 cs.SE cs.LG 新提交 78%

TraceSynth: Generating Production-Quality Kernel Traces with Constraint-Guided Diffusion Models

TraceSynth:使用约束引导扩散模型生成生产质量的内核跟踪

Yuvraj Sehgal, Sneh Patel, Mahsa Panahandeh, Naser Ezzati-Jivan, Francois Tetreault

机构 * Department of Computer Science, Brock University(布罗克大学计算机科学系) School of Electrical Engineering and Computer Science, University of Ottawa(Ottawa 大学电气工程与计算机科学学院) Ciena Corporation(Ciena 公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对工业系统收集内核执行跟踪成本高的问题,提出TraceSynth框架,利用基于Transformer的去噪扩散过程及约束引导修复生成合成内核跟踪,在六个基准测试中验证效果,显示其能经济高效增强跟踪并助于判断合成数据替代真实跟踪的时机。

Comments 11 pages, 2 figures, 6 tables. Author's accepted version. Published in the Industry Track of the 34th ACM Joint European Software Engineering Conference and Symposium on the Foundations of Software Engineering (FSE Companion '26), Montreal, QC, Canada. Code: https://github.com/17YuvrajSehgal/SyntheticLogGeneration

Journal ref FSE Companion '26: Companion Proceedings of the 34th ACM Joint European Software Engineering Conference and Symposium on the Foundations of Software Engineering, Montreal, QC, Canada, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11974 2026-07-15 cs.LG cs.AI 新提交 78%

Learning to Discretize: Diffusion-Based Adaptive Mesh with Spectral Guidance

学习离散化:基于扩散的具有谱引导的自适应网格

Zixuan Shen, Bingchuan Wang, Zhi Wang, Yong Wang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究提出能否让替代模型在预测场演化前学习分辨率位置的问题,构建两阶段扩散框架解决自适应离散化,通过多种约束使网格生成器正则化,结果显示该方法在五个PDE regime有竞争力,表明离散化应依 regime学习,重构了自适应网格划分问题。

Comments 19 pages, 11 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11894 2026-07-15 cs.CL cs.AI 新提交 78%

Graph-Based Detection of Disinformation Narrative Diffusion between Russian and Ukrainian Telegram Channels

基于图的俄罗斯和乌克兰Telegram频道间虚假信息叙事传播检测

Yuliia Vistak, Viktoriia Makovska, Vera Schmitt, Veronika Solopova

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究社交媒体虚假信息叙事检测难题,提出基于图的框架,结合弱监督与传播图分析,聚合语义相关断言建模传播,可检测协调叙事放大及虚假信息叙事传播,提供可扩展检测方法。

Comments UNLP 2026 The Fifth Ukrainian Natural Language Processing Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12897 2026-07-15 math.AP 新提交 78%

Analysis of a multispecies cross-diffusion Keller-Segel system with volume filling

具有体积填充的多物种交叉扩散Keller-Segel系统分析

Noah Geltner, Ansgar Jüngel, Mingyue Zhang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究趋化性驱动的多相多物种扩散系统,通过耦合相关方程并基于质量和力平衡定律推导得出模型,建立了全局弱解等性质,将熵有界方法扩展到特定解值域,得出多方面成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12871 2026-07-15 math.AP 新提交 78%

Graph-space well-posedness for diffusion equations with degenerate instantaneous diffusion

具有退化瞬时扩散的扩散方程的图空间适定性

Hiroki Ishizaka

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究具有完全单调记忆的扩散方程,通过引入扩展状态、利用算子伴随性使增强生成器\(m\)-耗散,得到唯一温和解等,证明了相关收敛性,为记忆主导扩散的离散化提供连续稳定性目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12472 2026-07-15 math.AP 新提交 78%

On a two-species Keller-Segel model with degenerate diffusion and two stimuli

关于具有退化扩散和两种刺激的双物种凯勒 - 塞格尔模型

Shen Bian

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究全空间中具有退化扩散的双物种趋化系统,通过精细能量估计建立弱解全局存在性,在参数额外假设下得出解向常数稳态的指数收敛速率,揭示强退化扩散确保全局有界性和指数稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11971 2026-07-15 math.GM 新提交 78%

Uncertainty-Aware Crack Growth Forecasting via Conditional Denoising Diffusion Models for Phase-Field Fracture

基于相场断裂的条件去噪扩散模型的不确定性感知裂纹扩展预测

Jahnavi Krishna Koda, S. M. Mallikarjunaiah

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对传统方法预测脆性裂纹扩展的计算瓶颈,提出基于物理的条件去噪扩散概率模型,可进行全场时空断裂演化预测,能在不修改模型下量化不确定性,有精度提升、跨状态泛化等优势,且推理速度有改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12587 2026-07-15 hep-lat cond-mat.str-el 新提交 78%

Lattice Configuration Generation with a Self-Learning Diffusion Model

用自学习扩散模型生成格点配置

Akio Tomiya

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究无需外部蒙特卡罗计算准备数据来训练格点场配置扩散采样器,构建自引导采样器SLDiffusion,在二维紧凑XY模型中自训练,结果显示能量和涡旋密度与独立计算相符,积分自相关时间短,证明可自训练。

Comments 34 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12727 2026-07-15 cond-mat.stat-mech quant-ph 新提交 78%

Emergence of drifted diffusion in quantum walks with subspace restart

具有子空间重启的量子行走中漂移扩散的出现

Liwei Qiao, Ruoyu Yin, Wei Zhang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究通过引入子空间重启协议,以离散时间量子行走为例,利用选择性重置驱动其进入漂移扩散区域,借助惠更斯 - 菲涅耳机制解释现象,确立了子空间重启是控制合成晶格中量子到经典转变的途径。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13017 2026-07-15 cs.RO cs.CV 新提交 57%

FlowWAM: Optical Flow as a Unified Action Representation for World Action Models

FlowWAM:光流作为世界动作模型的统一动作表示

Yixiang Chen, Peiyan Li, Yuan Xu, Qisen Ma, Jiabing Yang, Kai Wang, Jianhua Yang, Dong An, He Guan, Gaoteng Liu, Jianlou Si, Jun Huang, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges(无) MBZUAI(无) Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对世界动作模型控制中动作表示难题,提出FlowWAM双流扩散框架,以光流为统一动作表示。该框架可实现WAMs两种模式,能利用无动作标签视频预训练,实验表明在操纵和世界建模任务中表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12404 2026-07-15 cs.CV 新提交 57%

Contrastive-Augmented Flow Matching for Style-Content Disentanglement

用于风格-内容解缠的对比增强流匹配

Yusong Li, Pingchuan Ma, Ming Gui, Vincent Tao Hu, Björn Ommer

机构 * University of Munich(慕尼黑大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究如何分离内容和风格表示,提出对比增强流匹配框架,将对比正则化融入可逆流匹配,在多个数据集实验中提升了内容和风格检索、增强嵌入簇分离及开集鲁棒性,改进了分布转移下的解缠和鲁棒性。

Comments under review, code available at: https://github.com/CompVis/SCFlow/tree/main#-catfm-follow-up

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12379 2026-07-15 cs.CV 新提交 57%

SeamGen: Artist-Aligned UV Seam Generation via Graph Flow Matching

SeamGen:通过图流匹配生成与艺术家对齐的UV接缝

Hao Xu, Yuqing Zhang, Yiqian Wu, Xueqi Ma, Ding Liang, Yan-Pei Cao, Ying-Tian Liu, Xiaogang Jin

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) VAST(未提及,可能是一个缩写,无法准确翻译)

专题命中 扩散模型 :inpainting(abstract);分类 cs.CV

AI总结 研究针对3D内容创作中UV接缝放置问题,提出SeamGen模型,通过流匹配从现有接缝布局学习,设计Mesh Transformer主干,利用流模型修复能力,能生成更符合艺术家偏好的UV布局,提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12171 2026-07-15 cs.CV cs.AI cs.LG 新提交 57%

Self-Consistent Flow: Unifying Velocity and Endpoint Prediction for Rectified Flow Models

自洽流:统一整流流模型的速度和端点预测

Xu Han, Jiajing Hu, Li-Ping Liu

机构 * Tufts University(塔夫茨大学)

专题命中 扩散模型 :image generation(abstract);分类 cs.CV

AI总结 研究基于整流流的生成模型中不同参数化预测目标的问题,提出自洽流方法,通过轻量级一致性损失联合训练网络预测速度和端点,提升模型性能,在图像生成任务中显著优于标准整流流基线。

Comments Published in Transactions on Machine Learning Research

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12593 2026-07-15 eess.IV cs.RO cs.SY eess.SY 新提交 50%

Improving Autonomous Nano-drones Performance via Automated End-to-End Optimization and Deployment of DNNs

通过深度神经网络的自动化端到端优化和部署提高自主纳米无人机性能

Vlad Niculescu, Lorenzo Lamberti, Francesco Conti, Luca Benini, Daniele Palossi

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究如何通过自动化端到端优化和部署DNN提高自主纳米无人机性能,聚焦PULP-Dronet在Crazyflie 2.1纳米无人机上的部署,实现内存占用减少、推理时间加速,提升了无人机在避障、自由飞行和车道跟随等方面的性能,还开源了相关软件设计。

Comments 16 pages, 8 figures, 5 tables. This paper has been accepted for publication in the IEEE Journal on Emerging and Selected Topics in Circuits and Systems (JETCAS) copyright 2021 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12965 2026-07-15 cs.RO 新提交 50%

MAMMOTH: A Multi-Modal End-to-End Policy for Off-Road Mobility Robust to Missing Modality

MAMMOTH:一种对缺失模态具有鲁棒性的越野移动多模态端到端策略

Ahaan Kotian, Shivani Subramanyan, Suresh Sundaram

机构 * Indian Institute of Science(印度科学研究所)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究针对非结构化越野环境自主导航难题,提出MAMMOTH多模态端到端策略。它融合多模态观测,用模态丢弃训练,还采用扩散策略学习联合概率分布,经实验验证性能优越,能提升避撞等能力及对缺失模态的泛化。

Comments Accepted to IROS 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12380 2026-07-15 cs.LG 新提交 50%

SinAE: A Single-Architecture Flow-Matching Autoencoder for Cross-Domain Atomic Systems

SinAE:用于跨域原子系统的单架构流匹配自动编码器

Yuxuan Ren, Fan Yang, Jianhua Yao, Yatao Bian

机构 * National University of Singapore(新加坡国立大学) Tencent AI for Life Science Lab(腾讯生命科学人工智能实验室)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究针对小分子、晶体和蛋白质跨域生成管道分散问题,提出单架构流匹配自动编码器SinAE,用普通Transformer编码器和解码器,将重建负担转移到迭代流匹配解码器,实现跨域近无损重建,在生成基准测试中表现出色。

Comments conference

详情

展开后加载摘要…

URL PDF HTML 收藏