arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-01 至 2026-04-01 共收录 85 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3 篇

2403.10853 2026-04-01 cs.LG cs.AI cs.CV 57%

GenOL: Generating Diverse Examples for Name-only Online Learning

GenOL:为名称-only在线学习生成多样化示例

Minhyuk Seo, Seongwon Cho, Minjae Lee, Diganta Misra, Hyeonbeom Choi, Seon Joo Kim, Jonghyun Choi

机构 * KU Leuven(鲁汶大学) Seoul National University(首尔大学) ELLIS(欧洲学习与智能系统实验室) MPI-IS Tübingen(马克斯·普朗克智能系统研究所图宾根) Yonsei University(延世大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 针对在线学习中数据分布偏移问题,提出GenOL框架,通过生成模型提升名称-only训练中图像的内在和跨模型多样性,优于传统监督和网络监督方法。

Comments TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29022 2026-04-01 cs.CV 57%

UltraG-Ray: Physics-Based Gaussian Ray Casting for Novel Ultrasound View Synthesis

UltraG-Ray:基于物理的高斯射线投射用于新型超声成像合成

Felix Duelmer, Jakob Klaushofer, Magdalena Wysocki, Nassir Navab, Mohammad Farid Azampour

机构 * Chair for Computer Aided Medical Procedures (CAMP), Technical University of Munich(慕尼黑工业大学计算机辅助医疗程序教席) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出UltraG-Ray,通过学习3D高斯场和物理模块生成更真实的超声B模图像,提升成像真实性与质量。

Comments Accepted at MIDL 2026 / to appear in PMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09666 2026-04-01 cs.CV 57%

Unified Multimodal Models as Auto-Encoders

统一多模态模型作为自编码器

Zhiyuan Yan, Kaiqing Lin, Zongjian Li, Junyan Ye, Hui Han, Haochen Wang, Zhendong Wang, Bin Lin, Hao Li, Xinyan Xiao, Jingdong Wang, Haifeng Wang, Li Yuan

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Baidu(百度) Rabbitpre AI(兔展智能) SYSU(中山大学) USTC(中国科学技术大学) CASIA(中国科学院自动化研究所)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出统一GRPO方法,通过强化学习联合优化图像到文本和文本到图像任务,利用重建奖励提升语义一致性,增强多模态协同效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 3 篇

2603.29736 2026-04-01 cs.MM 89%

Editing on the Generative Manifold: A Theoretical and Empirical Study of General Diffusion-Based Image Editing Trade-offs

生成流形上的编辑:通用扩散图像编辑权衡的理论与实证研究

Yi Hu, Leying Yi, Emily Davis, Finn Carter

专题命中 图像编辑 :diffusion(title,abstract);image editing(title,abstract);inpainting(abstract);分类 cs.MM

AI总结 本文理论与实证分析了通用扩散图像编辑,通过将编辑视为引导传输在学习图像流形上的过程,探讨了可控性、意图忠实度、语义一致性、局部性和感知质量等核心指标。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29602 2026-04-01 cs.GR cs.AI cs.CV cs.MA 81%

IMAGAgent: Orchestrating Multi-Turn Image Editing via Constraint-Aware Planning and Reflection

IMAGAgent:通过约束感知规划与反思协调多轮图像编辑

Fei Shen, Chengyu Xie, Lihong Wang, Zhanyi Zhang, Xin Jiang, Xiaoyu Du, Jinhui Tang

机构 * National University of Singapore(新加坡国立大学) Nanjing University of Science and Technology(南京理工大学) Nanjing Forestry University(南京林业大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV、cs.GR

AI总结 IMAGAgent通过闭环机制整合指令解析、工具调度与自适应修正,解决多轮图像编辑中的上下文感知与反馈问题,提升编辑精度与整体质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29386 2026-04-01 cs.CV cs.AI 57%

PromptForge-350k: A Large-Scale Dataset and Contrastive Framework for Prompt-Based AI Image Forgery Localization

PromptForge-350k:一种大规模数据集和对比框架用于基于提示的AI图像伪造定位

Jianpeng Wang, Haoyu Wang, Baoying Chen, Jishen Zeng, Yiming Qin, Yiqi Yang, Zhongjie Ba

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出PromptForge-350k数据集和ICL-Net网络,通过自动化标注框架和对比学习提升伪造定位精度,实验显示在IoU指标上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 57 篇

2603.29029 2026-04-01 cs.CV cs.AI 83%

MMFace-DiT: A Dual-Stream Diffusion Transformer for High-Fidelity Multimodal Face Generation

MMFace-DiT:一种双流扩散变换器用于高保真多模态人脸生成

Bharath Krishnamurthy, Ajita Rattani

机构 * University of North Texas(北德克萨斯大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 MMFace-DiT通过双流Transformer实现多模态人脸生成,融合空间和语义信息,提升生成质量与控制能力,相比现有方法提升40%的视觉保真度和提示对齐度。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026. 22 pages (Main Text + Supplementary), 14 figures, 5 tables, 4 algorithms. Project page: https://vcbsl.github.io/MMFace-DiT/ and Code Repository: https://github.com/Bharath-K3/MMFace-DiT

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14157 2026-04-01 cs.CV cs.AI cs.LG 83%

When Test-Time Guidance Is Enough: Fast Image and Video Editing with Diffusion Guidance

测试时指导足矣:基于扩散指导的快速图像和视频编辑

Ahmed Ghorbel, Badr Moufad, Navid Bagheri Shouraki, Alain Oliviero Durmus, Thomas Hirtz, Eric Moulines, Jimmy Olsson, Yazid Janati

机构 * CMAP, Ecole Polytechnique(巴黎综合理工学院CMAP实验室) Institute of Foundation Models(基础模型研究所) MBZUAI(穆罕默德·本·扎耶德人工智能大学) EPITA(法国高等信息技术学院) Sorbonne University(索邦大学) Lagrange Mathematics and Computing Research Center(拉格朗日数学与计算研究中心) EPITA Research Lab(EPITA研究实验室) KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出通过测试时指导实现高效的图像和视频编辑,理论分析并扩展了现有方法,证明测试时指导能与训练时方法媲美甚至超越。

Journal ref ICLR 2026, ReALM-GEN workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06679 2026-04-01 cs.AI cs.CV cs.GR 81%

MultiGen: Level-Design for Editable Multiplayer Worlds in Diffusion Game Engines

MultiGen:扩散游戏引擎中可编辑多人世界的层级设计

Ryan Po, David Junhao Zhang, Amir Hertz, Gordon Wetzstein, Neal Wadhwa, Nataniel Ruiz

机构 * Stanford University(斯坦福大学) Google(谷歌)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出MultiGen,通过引入显式外部内存模块,实现可编辑多人世界中的环境控制与共享推理,提升交互性和一致性。

Comments Project page here: https://ryanpo.com/multigen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29239 2026-04-01 cs.CV 80%

Diffusion Mental Averages

扩散心理平均

Phonphrm Thawatdamrongkit, Sukit Seripanitkarn, Supasorn Suwajanakorn

机构 * VISTEC(泰国威斯泰克科学技术研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出扩散心理平均(DMA),通过在扩散模型语义空间内平均生成样本,解决传统方法在生成相同提示下的模糊问题,实现一致且逼真的概念平均。

Comments CVPR 2026. Project page: https://diffusion-mental-averages.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29569 2026-04-01 cs.GR 79%

AdaptDiff: Adaptive Guidance in Diffusion Models for Diverse and Identity-Consistent Face Synthesis (Student Abstract)

AdaptDiff: 差分模型中适应性引导以生成多样且身份一致的面部合成

Eduarda Caldeira, Tahar Chettaoui, Naser Damer, Fadi Boutros

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 本文提出动态加权方案,通过适应性引导抑制无关属性,提升生成面部的一致性和多样性。

Comments Accepted at AAAI 2026 Student Abstract and Poster Program

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15713 2026-04-01 cs.CV 79%

DiffusionVL: Translating Any Autoregressive Models into Diffusion Vision Language Models

DiffusionVL: 将任意自回归模型转化为扩散视觉语言模型

Lunbin Zeng, Jingfeng Yao, Bencheng Liao, Hongyuan Tao, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DiffusionVL,通过高效扩散微调将预训练自回归模型转化为扩散视觉语言模型,实现高效生成和性能提升。

Comments 12 pages, 4 figures, conference or other essential info

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19114 2026-04-01 cs.CV 79%

CreatiDesign: A Unified Multi-Conditional Diffusion Transformer for Creative Graphic Design

CreatiDesign: 一种统一的多条件扩散变换器用于创意图形设计

Hui Zhang, Dexiang Hong, Maoke Yang, Yutao Cheng, Zhao Zhang, Weidong Chen, Jie Shao, Xinglong Wu, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室) Bytedance Intelligent Creation(字节跳动智能创作) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CreatiDesign,一种统一的多条件扩散变换器,解决多条件控制问题,通过多模态注意力掩码机制和自动化数据集构建,提升图形设计生成的准确性和和谐度。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16205 2026-04-01 cs.CV eess.IV 79%

Generative AI Enables Structural Brain Network Construction from fMRI via Symmetric Diffusion Learning

生成式AI通过对称扩散学习从fMRI构建结构脑网络

Qiankun Zuo, Bangjun Lei, Wanyu Qiu, Changhong Jing, Jin Hong, Shuqiang Wang

机构 * Department of Computing, Hong Kong Polytechnic University(香港理工大学计算学系) School of Information Engineering, Nanchang University(南昌大学信息工程学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DiffGAN-F2S模型,通过统一框架从fMRI预测结构连接,利用对称扩散生成对抗网络和自适应学习生成高保真结构连接,测试表明其在结构连接预测上优于其他模型,并能识别重要脑区和连接,为多模态脑网络融合提供新方法。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29343 2026-04-01 cs.CV 79%

FOSCU: Feasibility of Synthetic MRI Generation via Duo-Diffusion Models for Enhancement of 3D U-Nets in Hepatic Segmentation

FOSCU:通过双扩散模型生成合成MRI的可行性,以增强肝部分割的3D U-Net

Youngung Han, Kyeonghun Kim, Seoyoung Ju, Yeonju Jean, Minkyung Cha, Seohyoung Park, Hyeonseok Jung, Nam-Joon Kim, Woo Kyoung Jeong, Ken Ying-Kai Liao, Hyuk-Jae Lee

机构 * Seoul National University(首尔国立大学) Sangmyung University(祥明大学) Ewha Womans University(梨花女子大学) Chung-Ang University(中央大学) Samsung Medical Center, Sungkyunkwan University School of Medicine(三星医学中心,成均馆大学医学院) NVIDIA(英伟达)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出FOSCU,通过双扩散模型生成高分辨率合成MRI数据及分割标签,结合改进的3D U-Net训练流程,提升肝部分割的鲁棒性与图像真实性。

Comments 10 pages, 5 figures. Accepted at IEEE APCCAS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15968 2026-04-01 cs.CV 79%

HyperAlign: Hypernetwork for Efficient Test-Time Alignment of Diffusion Models

HyperAlign:用于扩散模型高效测试时对齐的超网络

Xin Xie, Jiaxian Guo, Dong Gong

机构 * University of New South Wales (UNSW Sydney)(新南威尔士大学(悉尼新南威尔士大学)) Google Research(谷歌研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 HyperAlign通过训练超网络实现扩散模型测试时对齐,平衡对齐质量与计算效率,提升语义一致性和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24176 2026-04-01 cs.CV cs.LG 79%

Guiding a Diffusion Transformer with the Internal Dynamics of Itself

通过自身内部动态引导扩散变换器

Xingyu Zhou, Qifan Li, Xiaobin Hu, Hai Chen, Shuhang Gu

机构 * University of Electronic Science and Technology of China(电子科技大学) National University of Singapore(新加坡国立大学) Sun Yat-sen University(中山大学) North China Institute of Computer Systems Engineering(华北计算机系统工程研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出内部引导策略,通过训练过程中中间层的辅助监督和采样时的中间层输出扩展,提升训练效率和生成质量,在ImageNet上取得显著效果。

Comments Accepted to CVPR 2026. Project Page: https://zhouxingyu13.github.io/Internal-Guidance/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11423 2026-04-01 cs.CV 79%

JoyStreamer-Flash: Real-time and Infinite Audio-Driven Avatar Generation with Autoregressive Diffusion

JoyStreamer-Flash: 基于自回归扩散的实时和无限音频驱动化身生成

Chaochao Li, Ruikui Wang, Liangbo Zhou, Jinheng Feng, Huaishao Luo, Huan Zhang, Youzheng Wu, Xiaodong He

机构 * JD Technology(京东科技)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出JoyStreamer-Flash,一种能实现实时推断和无限长度视频生成的音频驱动自回归模型,通过渐进式步进 bootstrap、运动条件注入和无界RoPE via Cache-Resetting提升生成质量与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04466 2026-04-01 cs.CV 79%

Emotional Speech-driven 3D Body Animation via Disentangled Latent Diffusion

基于解耦潜在扩散的情感语音驱动3D人体动画

Kiran Chhatre, Radek Daněček, Nikos Athanasiou, Giorgio Becherini, Christopher Peters, Michael J. Black, Timo Bolkart

机构 * KTH Royal Institute of Technology, Sweden(瑞典皇家理工学院) Max Planck Institute for Intelligent Systems, Germany(德国马克斯·普朗克智能系统研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出AMUSE模型,通过解耦潜在向量实现情感语音驱动的3D人体动画生成,能控制情绪和风格,生成更符合语音内容且表现更真实的情绪动作序列。

Comments Conference on Computer Vision and Pattern Recognition (CVPR) 2024. Webpage: https://amuse.is.tue.mpg.de/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29822 2026-04-01 eess.SP 78%

Conditional Diffusion-Based Point Cloud Imaging for UAV Position and Attitude Sensing

基于条件扩散的点云成像用于无人机位置和姿态感知

Xinhong Dai, Yuan Gao, Hao Jiang, Xiaojun Yuan, Xin Wang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种基于条件扩散模型的点云成像方法,用于无人机位置和姿态感知,通过电磁点云提取无人机的空间信息和电磁特性,提升成像精度和姿态识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11161 2026-04-01 stat.ML cs.LG math.ST stat.TH 78%

Drift Estimation for Diffusion Processes Using Neural Networks Based on Discretely Observed Independent Paths

基于离散观测独立路径的扩散过程漂移估计

Yuzhen Zhao, Yating Liu, Marc Hoffmann

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于神经网络的非参数估计方法,用于估计扩散过程中在紧致域上的漂移函数,通过高频离散观测获得收敛率,并在高维情况下展示出优于B-样条方法的性能。

Comments Accepted for an oral presentation at the 40th Annual AAAI Conference on Artificial Intelligence (AAAI-26)

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 2026, 40(34), 28778-28785

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02308 2026-04-01 cs.RO cs.LG 78%

Real-Time Operator Takeover for Visuomotor Diffusion Policy Training

视觉-运动扩散策略训练中的实时操作员接管

Marco Moletta, Michael C. Welle, Nils Ingelhag, Jesper Munkeby, Danica Kragic

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) INCAR Robotics AB(INCAR机器人公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出实时操作员接管框架,允许操作员无缝控制机器人运动,提升策略性能。通过针对性演示改进策略表现,并分析马哈拉诺布斯距离用于识别异常状态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11338 2026-04-01 q-bio.MN 78%

A spontaneously patterning reaction diffusion network, containing an integrated activator inhibitor and substrate depletion mechanism, specifies trichoblast cell fate in Arabidopsis roots

一种自发形成图案的反应扩散网络,包含整合的激活-抑制和底物耗尽机制,指定拟南芥根部的三基细胞命运

Hayley Mills, George Janes, Anthony Bishopp, Natasha Savage

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究通过数学建模整合实验数据,揭示拟南芥根部表皮细胞命运由自发反应扩散网络调控,该网络整合激活-抑制和底物耗尽机制。

Comments main 28 pages. 6 supplementary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29469 2026-04-01 cs.HC cs.AI 78%

iPoster: Content-Aware Layout Generation for Interactive Poster Design via Graph-Enhanced Diffusion Models

iPoster:基于图增强扩散模型的交互式海报布局生成

Xudong Zhou, Jinyuan Liang, Qiuyi Guo, Guozheng Li

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 iPoster通过图增强扩散模型实现交互式海报布局生成,支持用户指定约束条件,生成符合要求的布局,并在实验中表现出卓越的布局质量和可控性。

Journal ref Extended Abstracts of the 2026 CHI Conference on Human Factors in Computing Systems (CHI EA '26), April 13--17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29434 2026-04-01 math.AP 78%

Reaction-Diffusion System Approximation to the Fast Diffusion Equation

反应-扩散系统近似用于快速扩散方程

Hideki Murakawa, Florian Salin

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种针对奇异扩散问题的新型反应-扩散系统近似方法,通过反应松弛参数和时间导数正则化参数构建系统,证明了其well-posedness并推导了统一的先验估计,通过紧致性论证在三种不同渐进行为下证明了近似解收敛于目标奇异扩散方程的唯一弱解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29339 2026-04-01 cs.SD eess.AS 78%

LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space

LongCat-AudioDiT:在波形潜在空间中实现高保真的扩散文本到语音

Detai Xin, Shujie Hu, Chengzuo Yang, Chen Huang, Guoqiao Yu, Guanglu Wan, Xunliang Cai

机构 * Meituan LongCat Team(美团LongCat团队)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 LongCat-AudioDiT通过在波形潜在空间中直接操作,实现了高保真的文本到语音生成,无需复杂多阶段训练流程或高质量标注数据,展现出卓越的零样本语音克隆性能。

Comments Code and model weights are available at https://github.com/meituan-longcat/LongCat-AudioDiT

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19261 2026-04-01 cs.LG cs.AI cs.NE 78%

DGPO: RL-Steered Graph Diffusion for Neural Architecture Generation

DGPO:基于强化学习的图扩散用于神经架构生成

Aleksei Liuliakov, Luca Hermes, Barbara Hammer

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DGPO通过拓扑节点排序和位置编码扩展强化学习微调,用于生成有向无环图的神经架构搜索,验证结果表明其在NAS-Bench-201任务中达到最优性能,且模型能学习可转移的结构先验。

Comments Submitted to IJCNN 2026 (IEEE WCCI). 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18229 2026-04-01 physics.flu-dyn 78%

Performance of Flamelet Models with Epsilon Tracking for Diffusion Flame Simulations

火焰let模型与epsilon追踪在扩散火焰模拟中的性能

Sylvain L. Walsh, Yalu Zhu, Feng Liu, William A. Sirignano

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了传统火焰let进展变量模型在扩散火焰模拟中的物理一致性,并提出一种基于湍流动能耗散率ε的压缩性火焰let方法,通过分析湍流混合层中的耦合关系,改进了火焰let模型的物理一致性。

Comments Submitted to AIAA SciTech 2026 Forum

Journal ref AIAA SciTech 2026 Forum, Paper 2026-2908

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10848 2026-04-01 cs.CL cs.AI cs.LG 78%

Accelerating Diffusion Large Language Models with SlowFast Sampling: The Three Golden Principles

通过SlowFast采样加速扩散大语言模型:三大黄金原则

Qingyan Wei, Yaojie Zhang, Zhiyuan Liu, Puyu Zeng, Yuxuan Wang, Biqing Qi, Dongrui Liu, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学 EPIC 实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出SlowFast采样策略,通过三大原则动态切换探索与加速解码阶段,提升扩散语言模型的生成速度与效率。

Comments 11 pages; 5 figures;

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07158 2026-04-01 cs.CR 78%

Real-Time Bit-Level Encryption of Full High-Definition Video Without Diffusion

全高清视频实时位级加密无需扩散

Dong Jiang, Hui-ran Luo, Zi-jian Cui, Xi-jue Zhao, Lin-sheng Huang, Liang-liang Lu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于异构并行计算的实时视频加密协议,通过SHA-256哈希实现位级加密,提升并行性与效率,实现实时高分辨率视频加密。

Journal ref Journal of Information Security and Applications 99, 104450 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏