arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-08 至 2026-07-08 共收录 62 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 1 篇

2607.06120 2026-07-08 cs.CV 新提交 83%

AEGIS: A Mechanism-Guided Defense against Visual Synonym Jailbreaks in Text-to-Image Models

AEGIS:一种针对文本到图像模型中视觉同义词越狱的机制引导防御

Yuanmin Huang, Zhenfei Zhang, Mi Zhang, Geng Hong, Qinqin He, Jialing Tao, Hui Xue, Min Yang

机构 * Fudan University(复旦大学) Alibaba Group(阿里巴巴集团) Shanghai Pudong Research Institute of Cryptology(上海浦东密码研究所) Engineering Research Center of Cyber Security Auditing and Monitoring, Ministry of Education(教育部网络安全审计与监测工程研究中心)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 研究针对文本到图像模型中视觉同义词越狱问题,提出AEGIS防御机制,通过动态追踪不安全语义生成过程,利用稀疏语义注入注意力头,在推理时仅对易受攻击头部应用相似性感知排斥,提升了模型安全与效用。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 扩散模型 46 篇

2607.06136 2026-07-08 cs.CV cs.MM 新提交 90%

Tuning-Free Latent Diffusion Models for Ultrahigh-Resolution Image Editing

用于超高分辨率图像编辑的免调优潜在扩散模型

Wanglong Lu, Lingming Su, Kaijie Shi, Minglun Gong, Xiaogang Jin, Hanli Zhao, Xianta Jiang

机构 * College of Computer Science and Artificial Intelligence, Wenzhou University(温州大学计算机科学与人工智能学院) Department of Computer Science, Memorial University of Newfoundland(纽芬兰纪念大学计算机科学系) AI Analytics Team, Nasdaq(纳斯达克人工智能分析团队) State Key Laboratory of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);image editing(title,abstract);image generation(abstract);分类 cs.CV、cs.MM

AI总结 针对现有图像编辑方法在高分辨率处理上的局限,提出免调优的UltraDiffEdit框架,通过多尺度渐进编辑、多补丁编码、全局-局部一致性去噪及补丁混合采样等技术,实现高质量超高分辨率图像编辑,处理能力达8K且灵活性高。

Comments 29 pages, 29 figures. Published in IEEE Transactions on Neural Networks and Learning Systems

Journal ref IEEE Transactions on Neural Networks and Learning Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05722 2026-07-08 cs.CL 新提交 89%

Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding

Nemotron-Labs-Diffusion:一种统一自回归、扩散和自推测解码的三模式语言模型

Yonggan Fu, Lexington Whalen, Abhinav Garg, Chengyue Wu, Maksim Khadkevich, Nicolai Oswald, Enze Xie, Daniel Egert, Sharath Turuvekere Sreenivas, Shizhe Diao, Chenhan Yu, Ye Yu, Weijia Chen, Sajad Norouzi, Jingyu Liu, Shiyi Lan, Ligeng Zhu, Jin Wang, Jindong Jiang, Morteza Mardani, Mehran Maghoumi, Song Han, Ante Jukić, Nima Tajbakhsh, Jan Kautz, Pavlo Molchanov

机构 * Nemotron-Labs(Nemotron实验室)

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 介绍了统一AR、扩散和自推测解码的三模式语言模型Nemotron-Labs-Diffusion,通过联合目标训练,能切换模式。研究表明其目标互补,自推测模式表现优,有长期潜力,该模型家族在精度和速度上优于现有开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20416 2026-07-08 cs.LG cs.CV 新提交 87%

On the Redundancy of Timestep Embeddings in Diffusion Models

扩散模型中时间步嵌入的冗余性研究

José A. Chávez

机构 * Independent Researcher, Lima, Peru(独立研究者,秘鲁利马)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 本文通过理论和实验证明,在U-Net和Diffusion Transformer架构中,扩散模型无需显式时间步嵌入也能达到全局最优,甚至在某些指标上超越有条件模型。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06335 2026-07-08 cs.CV 新提交 79%

Bridging Diffusion Pruning and Step Distillation with Teacher-Aligned Repair

通过教师对齐修复弥合扩散剪枝与步长蒸馏

Jincheng Ying, Li Wenlin, Minghui Xu, Yinhao Xiao

机构 * School of Big Data and Artificial Intelligence(大数据与人工智能学院) Guangdong University of Finance and Economics(广东财经大学) School of Computer Science(计算机科学学院) Shandong University(山东大学) GDUFE-UCM Joint Institute(广东财经大学-UCM联合学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究扩散模型推理成本高的问题,提出用教师对齐修复阶段连接剪枝与步长蒸馏,解决剪枝后重新训练难题,在ImageNet-512上实验,不同剪枝比例下模型参数减少、评估次数降低,FID有相应变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05711 2026-07-08 cs.LG cs.CV 新提交 79%

FourTune: Towards Fully 4-Bit Efficient Post-Training for Diffusion Models

FourTune:迈向扩散模型的全4位高效训练后优化

Bowen Xue, Zihan Min, Xingyang Li, Zhekai Zhang, Haocheng Xi, Lvmin Zhang, Maneesh Agrawala, Jun-Yan Zhu, Song Han, Yujun Lin, Muyang Li

机构 * Nunchux AI MIT(麻省理工学院) CMU(卡内基梅隆大学) UC Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对大型扩散模型训练后优化的挑战,提出FourTune框架,基于端到端W4A4G4范式,引入三分支混合管道、硬件高效量化等,在多任务中质量与全精度微调相当,在特定数据集上降低内存开销、提高训练吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05702 2026-07-08 cs.CV 新提交 79%

Robust Face Super-Resolution and Recognition Through Multi-Feature Aggregation in Diffusion Models

基于扩散模型中的多特征聚合实现鲁棒的面部超分辨率和识别

Marcelo dos Santos, Rayson Laroca, João Carlos Raposo Neves, David Menotti

机构 * Federal University of Paraná(巴拉那联邦大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对监控图像质量低影响人脸识别的问题,提出基于扩散模型的FASR++算法,通过整合多图像特征生成超分辨率输出,减少身份失真,经实验验证,该算法在多指标上取得最优结果,提升了人脸识别性能。

Journal ref Journal of the Brazilian Computer Society, vol. 32, no. 1, pp. 1457-1470, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05637 2026-07-08 cs.CV 新提交 79%

Recovering Cloud Microstructures with Cascaded Diffusion Inversion

通过级联扩散反演恢复云微观结构

Hanan Gani, Guy Pulik, Daniel Rosenfeld, Duncan Watson-Parris, Salman Khan

机构 * Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学) University of California, San Diego(加利福尼亚大学圣地亚哥分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对卫星云图像分辨率不足及现有方法不适用于此类图像的问题,提出基于扩散的两阶段超分辨率框架,能将云微观结构分辨率提高4倍,在精度和视觉质量上优于现有方法,为云微物理分析及利用AI促进气候和可持续性提供路径。

Comments Published at ML4RS Workshop ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02998 2026-07-08 cs.CV cs.AI cs.LG 新提交 79%

CONFLUX: A Latent Diffusion Model for 3D Chest-CT Synthesis with RL Post-Training

CONFLUX:一种用于3D胸部CT合成的潜在扩散模型及强化学习后训练

Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge, Olivier Gevaert

机构 * Department of Biomedical Data Science, Stanford University School of Medicine(斯坦福大学医学院生物医学数据科学系) Department of Mathematical Modelling, Statistics & Bioinformatics, Ghent University(根特大学数学建模、统计与生物信息学系) Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出CONFLUX潜在扩散模型用于胸部CT合成,由3D变分自编码器和整流流变压器构成,基于放射学元数据生成,通过强化学习后训练增强对临床属性控制,在三平面弗雷歇距离上领先并发布模型与数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05636 2026-07-08 eess.SP 新提交 78%

Sensor-Adaptive Infrared Spectral Reconstruction with Plug-and-Play Diffusion Priors

基于即插即用扩散先验的传感器自适应红外光谱重建

Alireza Siyavashi, Jon Schlipf, Sebastian Reiter, Inga Fischer, Christian Wenger, Christian Herglotz

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对现有光谱仪局限,提出用伪逆引导扩散模型从窄带光电流进行稀疏光谱重建,利用去噪扩散概率模型学习光谱先验,具传感器自适应能力,平均估计误差低,为资源受限平台光谱恢复提供准确紧凑方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06355 2026-07-08 q-fin.PR q-fin.MF q-fin.ST 新提交 78%

Entropic Dynamics of Jump-Diffusion Option Pricing

跳跃扩散期权定价的熵动力学

Mohammad Abedi

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究基于熵推理框架从信息约束推导股票价格动态和期权估值过程,核心是利用市场对回报的偏好确定对数价格为变量,通过连续与跳跃通道表示价格变化,推导出相关方程及结果,不同模型因信息不同而有差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06546 2026-07-08 cs.LG cs.AI 新提交 78%

Graph Convolutional Attention: A Spectral Perspective on Graph Denoising and Diffusion

图卷积注意力:图去噪与扩散的谱视角

Shervin Khalafi, Igor Krawczuk, Sergio Rozada, Charilaos Kanatsoulis, Antonio G Marques, Alejandro Ribeiro

机构 * University of Pennsylvania(宾夕法尼亚大学) King Juan Carlos University(胡安·卡洛斯国王大学) Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究图去噪问题,提出图卷积注意力(GCA)方法,通过利用输入图谱实现谱去噪,在随机块模型中与理想机制匹配,实验证明其能提升图去噪和扩散性能,在 DiGress 中表现良好且推理更快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06264 2026-07-08 math.AP 新提交 78%

Global stability and anisotropic large-time behavior of the three-dimensional compressible Navier--Stokes equations with eddy diffusion

具有涡扩散的三维可压缩纳维 - 斯托克斯方程的全局稳定性和各向异性大时间行为

Zefu Feng, Guangyi Hong, Yinghui Wang, Jiahong Wu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究具有涡扩散的三维可压缩纳维 - 斯托克斯方程柯西问题,通过格林矩阵各向异性谱分解等方法,证明常数非真空平衡对小扰动全局非线性稳定,给出密度和速度各向异性衰减率,为首例全空间相关结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06421 2026-07-08 physics.comp-ph 新提交 78%

Gradient-Based Inverse Design of Free-Energy Landscapes with Diffusion Models

基于梯度的扩散模型自由能景观逆设计

Eli Zick, Dan Mendels

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对自由能表面直接优化的挑战,提出基于梯度的自由能表面优化框架GB-FESO,利用条件扩散模型,通过反向传播分布级损失优化条件变量,在高斯系综和玩具肽上验证,为分子系统逆设计提供了有前途的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06091 2026-07-08 physics.comp-ph 新提交 78%

Mass-Conserving Physics-Informed Neural Networks For The One-Dimensional Advection-Diffusion Equation

用于一维平流扩散方程的质量守恒物理信息神经网络

Eszra Forenita Sigalingging, Liu Kin Men, Setianto Setianto, Ferry Faizal

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究一维平流扩散方程中质量守恒问题,评估质量惩罚PINN,通过软质量守恒约束增强标准PINN损失,在不同佩克莱数和模拟时间尺度下比较其与普通PINN及克兰克 - 尼科尔森格式性能,发现该方法显著提高PINN长期可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05824 2026-07-08 physics.optics 新提交 78%

Numerical-aperture transfer in holotomography with a deterministic diffusion prior

基于确定性扩散先验的全层析成像中的数值孔径转移

Dong-min Ryu, Jeong-hyun Roh, Woon-soo Lee, Hansol Yoon, Hyun-seok Min, Yongkeun Park

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对高通量全层析成像中低NA限制高空间频率获取的问题,提出ResShift - ODE框架,通过扩散先验逆问题将低NA RI断层图像转移到高NA等效体积,在去噪评估、精度及速度上有优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06122 2026-07-08 cond-mat.mtrl-sci 新提交 78%

Multiscale modelling of diffusion and retention of hydrogen in multi-occupancy traps in irradiated bcc metals

辐照体心立方金属中多占据陷阱内氢扩散与滞留的多尺度建模

Daniel Mason, Sanjeet Kaur, Samanyu Tirumala, Prashanth Srinivasan, Ville Jantunen, Max Boleininger

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究用分子动力学模拟计算氢气原子在特定结构中的有效扩散率,与解析近似比较验证模型。通过多种方法证明相关现象,从第一性原理预测钨中孔隙内氢的扩散和滞留,其解析形式优于现有单占据陷阱形式体系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08048 2026-07-08 cs.CL cs.LG cs.PF 新提交 78%

Diffusion Language Model Parallel Decoding via Product-of-Experts Bridge

通过专家乘积桥接的扩散语言模型并行解码

Juntong Shi, Brian L. Trippe, Jure Leskovec, Stefano Ermon, Minkai Xu

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出PoE-Bridge框架,通过专家乘积构建中间分布,结合扩散语言模型并行解码和自回归模型质量,实现5倍加速并恢复至少95%的AR性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05649 2026-07-08 cs.CV cs.LG 新提交 77%

REVIVE: A Multi-Modal Framework for Vandalism Detection and Recovery in Autonomous Vehicles

REVIVE:一种用于自动驾驶车辆中破坏行为检测与恢复的多模态框架

Abdullah Tariq Choudhry, Tapadhir Das

机构 * University of the Pacific(太平洋大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);inpainting(abstract);分类 cs.CV

AI总结 研究自动驾驶车辆中破坏行为导致的遮挡攻击问题,提出REVIVE多模态框架,集成多种检测与恢复方法,如二进制VOA检测、多类VOA模式识别等,实验表明该框架能有效恢复图像,提升目标检测指标,提供结构化恢复方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06432 2026-07-08 cs.LG cs.AI cs.CV 新提交 70%

TILDE: TILt-based Distributional Erasure for Concept Unlearning

TILDE:基于倾斜的概念遗忘分布擦除

Naveen George, Naoki Murata, Yuhta Takida, Konda Reddy Mopuri, Yuki Mitsufuji

机构 * Indian Institute of Technology Hyderabad(印度理工学院海得拉巴分校) Sony AI(索尼人工智能公司) Sony Group Corporation(索尼集团公司)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 文本到图像扩散模型的概念遗忘研究中,提出TILDE方法,将概念遗忘视为分布对齐问题,通过能量倾斜的无锚点目标抑制概念图像,用残差∇-GFlowNet训练实例化,实验显示其在多方面实现强大遗忘效果,提升保留率和分布保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00047 2026-07-08 cs.MM cs.CV cs.GR 新提交 67%

Vertigo Vertigo: Reconstructing a Cinematic Ideal through its Predictive AI Double

眩晕眩晕:通过其预测性AI双重重建电影理想

Adam Cole, Mick Grierson

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 使用仅2.78%原始帧通过视频扩散模型重建希区柯克《迷魂记》,验证生成系统编码的经典电影规范,73.1%帧可识别,3.6%严重失败。

Comments Accepted to Ars Electronica EXPANDED 2026 - Conference on Animation and Interactive Art (in cooperation with ACM SIGGRAPH), Ars Electronica Festival, Linz. 7 pages, 7 figures. Authors' version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06516 2026-07-08 cs.CV 新提交 57%

Point as Skeleton: Accumulated Point Cloud Enhanced Autoregressive Generation for Closed-Loop Autonomous Driving Simulation

点作为骨架:累积点云增强自回归生成用于闭环自动驾驶模拟

Songbur Wong, Xiaosong Jia, Junqi You, Bo Zhang, Pei Xu, Renqiu Xia, Yuping Qiu, Shaofeng Zhang, Zelin Zhao, Xuechao Yan, Yuchen Zhou, Yurui Chen, Wen Guo, Hang Xu, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Yinwang Intelligent Technology Co., Ltd.(银望智能科技有限公司) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对自动驾驶模拟难题,提出“点作为骨架”框架,通过自回归生成器结合多种条件合成视频,引入Reset-and-Roll支持闭环,用点云骨架稳定误差,实现基于nuPlan的闭环生成接口,实验证明其提升了闭环自回归生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06281 2026-07-08 cs.CV 新提交 57%

Straight-Path Flow Matching for Incomplete Multi-View Clustering

用于不完整多视图聚类的直线路径流匹配

Yiteng Yuan, Junyan Wang, Zheyuan Liu, Hong Jia, Lei Fan, Zhulin Tao, Lianbo Guo

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) University of Auckland(奥克兰大学) University of New South Wales(新南威尔士大学) Communication University of China(中国通信大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究不完整多视图聚类问题,提出基于直线路径流匹配的框架,通过线性插值路径用概率流替代扩散,集成视图完成与聚类对齐,实验证明该框架在标准基准上达最优性能。

Comments Accepted to ECCV 2026. 28 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05850 2026-07-08 cs.CV 新提交 57%

Breaking Spurious Correlations via Generative Randomization and Cross-Variant Self-Supervised Learning

通过生成式随机化和跨变体自监督学习打破虚假相关性

Suraj Yadav, Anjaneya Sharma, Siddharth Yadav

机构 * Indraprastha Institute of Information Technology Delhi(德里英迪拉甘地信息技术学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对深度神经网络在分布转移时因利用虚假相关性而失败的问题,提出两阶段框架,先通过生成式干预分离前景对象并生成变体,再引入跨变体自监督学习,经微调后在多个基准测试中取得优异最差组性能。

Comments Accepted at CVPR Workshop 2026 GCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05733 2026-07-08 cs.CV 新提交 57%

ARMS: Anchor-Relational Motion Streaming for Seamless Solo-Social Motion Transitions

ARMS:用于无缝单人-社交运动转换的锚定关系运动流

Huakun Liu, Qing Yu, Kent Fujiwara, Hideaki Uchiyama, Kiyoshi Kiyokawa

机构 * Nara Institute of Science and Technology(奈良科学技术研究所) LY Corporation(LY 公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究旨在从文本生成连续且连贯的人类运动。提出ARMS框架,统一单人运动和人际互动,引入动态不对称表示,用因果关系扩散模型及关系门控实现。实验表明其提升了转换平滑度与社会连贯性,在互动基准测试中表现良好。

Comments Accepted by ECCV 2026. Project page: https://hkliu.com/arms

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05352 2026-07-08 cs.CV cs.AI cs.LG 新提交 57%

Multiplayer Interactive World Models with Representation Autoencoders

基于表示自编码器的多智能体交互世界模型

Anthony Hu, Václav Volhejn, Adrien Ramanana Rahary, Chris Mulder, Aditya Makkar, Alyx Liao, Amélie Royer, Manu Orsini, Adam Jelley, Eloi Alonso, Florian Laurent, Fredrik Norén, James Swingos, Jan Hünermann, Kent Rollins, Lucas Hosseini, Matthieu Le Cauchois, Maxim Peter, Pim de Witte, Tim Brown, Vincent Micheli, Moritz Böhle, Gabriel de Marmiesse, Viktoriia Sharmanska, Lucia Specia, Michael Black, Patrick Pérez

机构 * Epic Games École nationale des ponts et chaussées(法国国家桥梁与道路学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对复杂物理交互的高动态环境,该研究提出首个多智能体世界模型,以多智能体动作流为条件训练隐扩散模型,可实时生成稳定长时四智能体对局,开源相关资源。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06559 2026-07-08 cs.RO 新提交 50%

RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation

RynnWorld-4D:用于机器人操作的4D具身世界模型

Haoyu Zhao, Xingyue Zhao, Siteng Huang, Xin Li, Deli Zhao, Zhongyu Li

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hong Kong Embodied AI Lab(香港具身人工智能实验室) CUHK(香港中文大学) Hupan Lab(湖畔实验室)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究针对开放世界机器人操作,提出RynnWorld-4D生成模型,通过RGB-DF捕捉4D动态,其具三分支架构,还整理数据集并提出RynnWorld-4D-Policy,实验证明该模型在时空预测及实际操作任务中表现出色。

Comments Project Page: https://alibaba-damo-academy.github.io/RynnWorld-4D.github.io, Github: https://github.com/alibaba-damo-academy/RynnWorld-4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06505 2026-07-08 cs.SE cs.AI cs.DB 新提交 50%

Industry Classification of GitHub Repositories Using the North American Industry Classification System (NAICS)

使用北美行业分类系统(NAICS)对GitHub仓库进行行业分类

Kevin Xu, Alexander Quispe

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究利用北美行业分类系统对GitHub仓库进行行业分类,提出结合多种技术的检索与验证管道生成标签,构建NAICS-GH语料库,测试表明标签精度高,还对预训练编码器进行基准测试,相关数据和代码开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06497 2026-07-08 cs.LG q-bio.QM stat.ML 新提交 50%

EntroPath: Maximum Entropy Path Ensemble Embedding for Manifold Learning

EntroPath:用于流形学习的最大熵路径集成嵌入

Przemysław Rola

机构 * Krakow University of Economics(克拉科夫经济大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究提出EntroPath流形学习方法,基于最大熵随机游走构建差异,通过Varadhan热核公式使自由能差异在短时间极限下收敛于平方测地线距离,在合成流形和单细胞基准测试中表现良好,尤其在特定流形上优势明显。

Comments 40 pages, 15 figures. Code: https://github.com/rpprzemek/entropath

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05400 2026-07-08 cs.PF cs.LG 新提交 50%

Performance Optimization and Comparative Analysis of Generative AI Models on Advanced Accelerators

生成式人工智能模型在先进加速器上的性能优化与比较分析

Amitash Nanda, Javier Hernandez Nicolau, Madhusudan Gujral, Mahidhar Tatineni, Amitava Majumdar, Debashis Sahoo

机构 * University of California San Diego(加州大学圣地亚哥分校) San Diego Supercomputer Center(圣地亚哥超级计算机中心)

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对生成式人工智能模型部署难题,开展系统研究,通过新颖的混合精度训练后量化评估等方法,对多种模型在不同下游任务及跨异构平台进行性能优化与比较分析。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏