arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2931
2602.11909 2026-03-03 cs.SD cs.LG

Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning

Echo:通过音频交错推理实现高级音频理解

Daiqing Wu, Xuan Zhang, Dongbao Yang, Jiashu Yao, Longfei Chen, Qingsong Liu, Sicheng Zhao, Can Ma, Yangyang Kang, Yu Zhou

机构 * IIE, Chinese Academy of Sciences(中国科学院信息工程研究所) Zhejiang University(浙江大学) ByteDance China(字节跳动中国) VCIP & TMCC & DISSec, College of Computer Science, Nankai University(VCIP与TMCC与DISSec,南开大学计算机学院) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 Echo通过音频交错推理方法,提升音频理解能力,在基准测试中表现出色。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00428 2026-03-03 cs.CL cs.AI cs.CR

When Agents "Misremember" Collectively: Exploring the Mandela Effect in LLM-based Multi-Agent Systems

当智能体“误忆”时:探索基于大语言模型的多智能体系统中的曼德拉效应

Naen Xu, Hengyu An, Shuo Shi, Jinghuai Zhang, Chunyi Zhou, Changjiang Li, Tianyu Du, Zhihui Fu, Jun Wang, Shouling Ji

机构 * Zhejiang University(浙江大学) University of California, Los Angeles(加州大学洛杉矶分校) Palo Alto Networks(帕洛阿尔托网络公司) OPPO Research Institute(OPPO研究院) Zhejiang Key Laboratory of Decision Intelligence(浙江决策智能重点实验室)

AI总结 本文研究了基于大语言模型的多智能体系统中的曼德拉效应,提出MANBENCH基准并提出缓解策略,实现74.40%的效应减少。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01822 2026-03-03 cs.CL cs.AI cs.CV cs.LG cs.MA

InnoGym: Benchmarking the Innovation Potential of AI Agents

InnoGym:评估AI智能体创新潜力的基准测试

Jintian Zhang, Kewei Xu, Jingsheng Zheng, Zhuoyun Yu, Yuqi Zhu, Yujie Luo, Lanning Wei, Shuofei Qiao, Lun Du, Da Zheng, Shumin Deng, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) National University of Singapore(新加坡国立大学) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(知识图谱联合实验室)

AI总结 InnoGym通过引入性能提升和新颖性两个指标,首次系统评估AI智能体的创新潜力,揭示了创造力与有效性的平衡问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27492 2026-03-03 cs.CV

ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning

ThinkMorph:多模态交错链式推理中的涌现特性

Jiawei Gu, Yunzhuo Hao, Huichen Will Wang, Linjie Li, Michael Qizhe Shieh, Yejin Choi, Ranjay Krishna, Yu Cheng

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) University of Washington(华盛顿大学) Stanford University(斯坦福大学) absolute AI The Chinese University of Hong Kong(香港中文大学)

AI总结 ThinkMorph通过统一模型提升多模态推理性能,展现视觉操控与模式切换等新兴能力。

Comments project page: https://thinkmorph.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24711 2026-03-03 cs.CV

Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing Guidance

MoE中的路由问题:通过显式路由指导扩展扩散Transformer

Yujie Wei, Shiwei Zhang, Hangjie Yuan, Yujin Han, Zhekai Chen, Jiayu Wang, Difan Zou, Xihui Liu, Yingya Zhang, Yu Liu, Hongming Shan

机构 * Fudan University(复旦大学) Tongyi Lab, Alibaba Group(阿里云实验室,阿里巴巴集团) Zhejiang University(浙江大学) The University of Hong Kong(香港大学) MMLab Institute of Science and Technology for Brain-inspired Intelligence, MOE Frontiers Center for Brain Science, Key Laboratory of Computational Neuroscience and Brain-Inspired Intelligence, and State Key Laboratory of Brain Function and Disorders, Fudan University(脑启发智能科学技术研究院、MOE前沿脑科学中心、计算神经科学与脑启发智能重点实验室、脑功能与疾病国家重点实验室,复旦大学)

AI总结 ProMoE通过显式路由指导提升视觉MoE性能,结合两步路由策略和原型路由机制,在ImageNet基准上优于现有方法。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18866 2026-03-03 cs.CL cs.AI cs.CV cs.LG cs.MA

LightMem: Lightweight and Efficient Memory-Augmented Generation

LightMem: 轻量级和高效的内存增强生成

Jizhan Fang, Xinle Deng, Haoming Xu, Ziyan Jiang, Yuqi Tang, Ziwen Xu, Shumin Deng, Yunzhi Yao, Mengru Wang, Shuofei Qiao, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) State Key Lab. for Novel Software Technology, Nanjing University, P.R. China(南京大学软件新技术国家重点实验室,中国)

AI总结 LightMem通过三阶段内存系统提升LLM在动态环境中的效率和性能,实现问答准确率提升和token使用减少。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17050 2026-03-03 cs.CV

Geodesic Prototype Matching via Diffusion Maps for Interpretable Fine-Grained Recognition

通过扩散映射的测地原型匹配用于可解释的细粒度识别

Junhao Jia, Yunyou Liu, Yifei Sun, Huangwei Chen, Feiwei Qin, Changmiao Wang, Yong Peng

机构 * Hangzhou Dianzi University(杭州电子科技大学) Zhejiang University(浙江大学) Shenzhen Research Institute of Big Data(深圳大数据研究院)

AI总结 本文提出通过扩散映射的测地原型匹配方法,用于可解释的细粒度识别,通过内在几何结构提升原型的语义对应性。

Comments The paper has been accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14965 2026-03-03 cs.CV

Brain-HGCN: A Hyperbolic Graph Convolutional Network for Brain Functional Network Analysis

Brain-HGCN: 基于双曲几何的脑功能网络分析超图卷积网络

Junhao Jia, Yunyou Liu, Cheng Yang, Yifei Sun, Feiwei Qin, Changmiao Wang, Yong Peng

机构 * Hangzhou Dianzi University(杭州电子科技大学) Zhejiang University(浙江大学) Shenzhen Research Institute of Big Data(深圳大数据研究院)

AI总结 Brain-HGCN通过双曲几何建模脑功能网络分层结构,优于传统欧几里得GNNs,在精神疾病分类中表现优异。

Comments The paper has been accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03214 2026-03-03 cs.CV

RTGMFF: Enhanced fMRI-based Brain Disorder Diagnosis via ROI-driven Text Generation and Multimodal Feature Fusion

RTGMFF:基于ROI驱动文本生成和多模态特征融合的增强型fMRI脑部疾病诊断

Junhao Jia, Yifei Sun, Yunyou Liu, Cheng Yang, Changmiao Wang, Feiwei Qin, Yong Peng, Wenwen Min

机构 * Hangzhou Dianzi University(杭州电子科技大学) Zhejiang University(浙江大学) Shenzhen Research Institute of Big Data(深圳大数据研究院) Yunnan University(云南大学)

AI总结 RTGMFF通过结合ROI驱动文本生成和多模态特征融合,提升fMRI在脑部疾病诊断中的准确性。

Comments The paper has been accepted by BIBM 2025

Journal ref 2025 IEEE International Conference on Bioinformatics and Biomedicine (BIBM). IEEE, 2025, pp. 2301-2308

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06566 2026-03-03 cs.CV

Dynamic Uncertainty Learning with Noisy Correspondence for Text-Based Person Search

基于噪声对应关系的动态不确定性学习用于基于文本的人脸搜索

Zequn Xie, Haoming Ji, Chengxuan Li, Lingwei Meng

机构 * Zhejiang University(浙江大学) Beijing University of Posts Telecommunications(北京邮电大学) Beijing Forestry University(北京林业大学) Northwest Normal University(西北师范大学)

AI总结 本文提出DURA框架,通过动态不确定性学习和关系对齐方法,提升基于文本的人脸搜索在噪声环境下的鲁棒性和检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00188 2026-03-03 cs.CV cs.AI cs.LG

Efficient Long-Horizon GUI Agents via Training-Free KV Cache Compression

通过无训练KV缓存压缩实现高效的长周期GUI代理

Bowen Zhou, Zhou Xu, Wanli Li, Jingyu Xiao, Haoqian Wang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 ST-Lite通过无训练的KV缓存压缩方法,提升GUI代理的解码效率,实现2.45倍加速并保持性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23945 2026-03-02 cs.CV cs.AI cs.MM

PointCoT: A Multi-modal Benchmark for Explicit 3D Geometric Reasoning

PointCoT: 一种用于显式3D几何推理的多模态基准

Dongxu Zhang, Yiding Sun, Pengcheng Li, Yumou Liu, Hongqiang Lin, Haoran Xu, Xiaoxuan Mu, Liang Lin, Wenbiao Yan, Ning Yang, Chaowei Fang, Juanjuan Zhao, Jihua Zhu, Conghui He, Cheng Tan

机构 * Xi'an Jiaotong University(西安交通大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Institute of Automation, CASIA(中国科学院自动化研究所) Taiyuan University of Technology(太原理工大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 PointCoT通过显式链式推理提升3D几何推理能力,提出多模态基准和双流架构,实现对3D点云的高精度理解与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23864 2026-03-02 cs.AI

RUMAD: Reinforcement-Unifying Multi-Agent Debate

RUMAD:强化统一多智能体辩论

Chao Wang, Han Lin, Huaze Tang, Huijing Lin, Wenbo Ding

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学)

AI总结 RUMAD通过强化学习动态控制通信拓扑,提升多智能体辩论的效率和准确性,实现80%以上的token成本降低和跨域泛化能力。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23806 2026-03-02 cs.CV cs.AI

See, Act, Adapt: Active Perception for Unsupervised Cross-Domain Visual Adaptation via Personalized VLM-Guided Agent

看见、行动、适应:通过个性化VLM引导代理的主动感知用于无监督跨域视觉适应

Tianci Tang, Tielong Cai, Hongwei Wang, Gaoang Wang

机构 * Zhejiang University, Hangzhou, China(浙江大学)

AI总结 Sea$^2$通过智能姿态控制代理实现无监督跨域视觉适应,利用现成感知模型提升视觉任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23803 2026-03-02 eess.IV cs.CV

BiM-GeoAttn-Net: Linear-Time Depth Modeling with Geometry-Aware Attention for 3D Aortic Dissection CTA Segmentation

BiM-GeoAttn-Net:基于几何感知注意力的线性时间深度建模用于3D主动脉夹层CTA分割

Yuan Zhang, Lei Liu, Jialin Zhang, Ya-Nan Zhang, Ling Wang, Nan Mu

机构 * College of Computer Science Sichuan Normal University(四川师范大学计算机学院) Zhejiang University(浙江大学) Ant Group(蚂蚁集团) State Key Laboratory of Public Big Data Guizhou University(贵州公共大数据省重点实验室贵州大学)

AI总结 BiM-GeoAttn-Net通过几何感知注意力与线性时间深度建模,实现高效准确的3D主动脉夹层CTA分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23761 2026-03-02 cs.LG cs.CV

OPTIAGENT: A Physics-Driven Agentic Framework for Automated Optical Design

OPTIAGENT:一种基于物理的代理框架用于自动光学设计

Yuyu Geng, Lei Sun, Yao Gao, Xinxin Hu, Zhonghua Yi, Xiaolong Qian, Weijian Hu, Jian Bai, Kaiwei Wang

机构 * Zhejiang University(浙江大学) INSAIT, Sofia University(INSAIT,索菲亚大学)

AI总结 OPTIAGENT通过结合LLM与物理驱动的优化方法,首次实现了无需专业光学知识即可自动设计光学系统,提升了光学设计的自动化水平和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22695 2026-03-02 cs.CV

GFRRN: Explore the Gaps in Single Image Reflection Removal

GFRRN: 探索单图像反光去除中的空白

Yu Chen, Zewei He, Xingyu Liu, Zixuan Chen, Zheming Lu

机构 * Zhejiang University(浙江大学) Huanjiang Laboratory(焕江实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 GFRRN通过引入PEFT策略、标签生成器和自适应频率学习块,解决单图像反光去除中的语义差距和标签不一致问题,实现更高效的反光去除性能。

Comments CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22006 2026-03-02 cs.RO

Parallel Continuous-Time Relative Localization with Augmented Clamped Non-Uniform B-Splines

并行连续时间相对定位与增强钳制非均匀B样条

Jiadong Lu, Zhehan Li, Tao Han, Miao Xu, Chao Xu, Yanjun Cao

机构 * State Key Laboratory of Industrial Control Technology, Institute of Cyber-Systems and Control, Zhejiang University(工业控制技术国家重点实验室,系统与控制研究所,浙江大学) Huzhou Institute of Zhejiang University(浙江大学湖州研究院) Department of Automatic Control, Faculty of Engineering, Lund University(自动控制系,工程学院, Lund大学)

AI总结 本文提出CT-RIO框架,利用钳制非均匀B样条实现高精度、低延迟的多机器人相对定位,通过灵活的节点管理提升计算效率。

Comments 26 pages, 23 figures, submitted to IEEE Transactions on Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12113 2026-03-02 cs.AI cs.CL

Stop Unnecessary Reflection: Training LRMs for Efficient Reasoning with Adaptive Reflection and Length Coordinated Penalty

停止不必要的反思:通过自适应反思和长度协调惩罚训练高效的推理模型

Zewei Yu, Lirong Gao, Yuke Zhu, Bo Zheng, Junbo Zhao, Sheng Guo, Haobo Wang

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) MYbank, Ant Group(蚂蚁集团MYbank) Innovation and Management Center, School of Software Technology (Ningbo), Zhejiang University(浙江大学软件学院(宁波)创新与管理中心)

AI总结 通过自适应反思和长度协调惩罚方法,提升推理效率和准确性,减少响应长度并提高性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05362 2026-03-02 cs.CV

Imagine a City: CityGenAgent for Procedural 3D City Generation

想象一座城市:CityGenAgent用于程序化3D城市生成

Zishan Liu, Zecong Tang, RuoCheng Wu, Xinzhe Zheng, Jingyu Hu, Ka-Hei Hui, Haoran Xie, Bo Dai, Zhengzhe Liu

机构 * Lingnan University, Hong Kong SAR, China(岭南大学) Zhejiang University, Hangzhou, China(浙江大学) The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学) Autodesk AI Lab, Canada(Autodesk AI实验室) The University of Hong Kong, Hong Kong SAR, China(香港大学)

AI总结 CityGenAgent通过自然语言驱动的分层程序化生成方法,实现了高质量3D城市生成,提升了语义对齐、视觉质量和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21135 2026-03-02 cs.RO cs.AI cs.CV

SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation

SocialNav: 为社交感知具身导航训练的人类启发式基础模型

Ziyi Chen, Yingnan Guo, Zedong Chu, Minghua Luo, Yanfen Shen, Mingchao Sun, Junjun Hu, Shichao Xie, Kuan Yang, Pei Shi, Zhining Gu, Lu Liu, Honglin Han, Xiaolong Wu, Mu Xu, Yu Zhang, Ning Guo

机构 * Amap, Alibaba Group, China(阿里集团阿地图,中国) Zhejiang University, China(浙江大学,中国)

AI总结 SocialNav通过分层架构和多阶段训练,实现了社交感知导航,显著提升了导航性能和社会合规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21171 2026-03-02 cs.CV

TokenCLIP: Token-wise Prompt Learning for Zero-shot Anomaly Detection

TokenCLIP: 基于令牌的提示学习用于零样本异常检测

Qihang Zhou, Binbin Gao, Guansong Pang, Xin Wang, Jiming Chen, Shibo He

机构 * Zhejiang University(浙江大学) Tencent YouTu Lab(腾讯YouTu实验室) Singapore Management University(新加坡管理学院) Qilu University of Technology (Shandong Academy of Sciences)(青岛科技大学(山东科学院))

AI总结 TokenCLIP通过动态对齐视觉与文本子空间,实现细粒度异常检测,提升零样本异常检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21021 2026-03-02 cs.LG cs.AI stat.ML

Efficient Ensemble Conditional Independence Test Framework for Causal Discovery

高效的因果发现条件独立性测试框架

Zhengkang Guan, Kun Kuang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 本文提出了一种高效的条件独立性测试框架,通过分组聚合策略降低计算复杂度并提升因果发现性能。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17966 2026-03-02 cs.IR cs.CV

LLM-Enhanced Multimodal Fusion for Cross-Domain Sequential Recommendation

基于大语言模型的跨域序列推荐多模态融合

Wangyu Wu, Zhenhong Chen, Wenqiao Zhang, Xianglin Qiu, Siqi Song, Xiaowei Huang, Fei Ma, Jimin Xiao

机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) University of Liverpool(利物浦大学) Microsoft(微软公司) Zhejiang University(浙江大学)

AI总结 本文提出LLM-EMF方法,通过融合视觉和文本数据提升跨域序列推荐性能,利用CLIP模型生成多模态嵌入并引入多重注意力机制,实验证明其在多领域推荐中的有效性。

Comments arXiv admin note: substantial text overlap with arXiv:2504.15085

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18579 2026-03-02 cs.LG

Sparsity Forcing: Reinforcing Token Sparsity of MLLMs

稀疏性强制:强化多模态大语言模型的token稀疏性

Feng Chen, Yefei He, Lequan Lin, Chenhui Gou, Jing Liu, Bohan Zhuang, Qi Wu

机构 * AIML, University of Adelaide, Australia(AIML,澳大利亚阿德莱德大学) ZIP Lab, Zhejiang University, China(浙江工业大学ZIP实验室) University of Sydney, Australia(悉尼大学) Monash University, Australia(墨尔本大学)

AI总结 本文提出Sparsity Forcing方法,通过强化学习框架在多模态大语言模型中提升token稀疏性,实现75%的token减少与极小的精度损失。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23103 2026-02-27 cs.CV

SpectralMamba-UNet: Frequency-Disentangled State Space Modeling for Texture-Structure Consistent Medical Image Segmentation

SpectralMamba-UNet: 频率解耦的状态空间建模用于纹理-结构一致的医学图像分割

Fuhao Zhang, Lei Liu, Jialin Zhang, Ya-Nan Zhang, Nan Mu

机构 * College of Computer Science(计算机科学学院) Sichuan Normal University(四川师范大学) Zhejiang University(浙江大学) Ant Group(蚂蚁集团) State Key Laboratory of Public Big Data(公共大数据国家重点实验室) Guizhou University(贵州大学)

AI总结 SpectralMamba-UNet通过频域解耦结构与纹理信息,提升医学图像分割的精度和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22777 2026-02-27 cs.LG

KMLP: A Scalable Hybrid Architecture for Web-Scale Tabular Data Modeling

KMLP:一种可扩展的混合架构用于网络级表格数据建模

Mingming Zhang, Pengfei Shi, Zhiqing Xiao, Feng Zhao, Guandong Sun, Yulin Kang, Ruizhe Gao, Ningtao Wang, Xing Fu, Weiqiang Wang, Junbo Zhao

机构 * Zhejiang University(浙江大学)

AI总结 KMLP通过结合KAN前端和gMLP后端,实现了对大规模网络表格数据的高效建模,展现了在处理高维异质特征时的优越性能。

Comments Accepted by THE ACM WEB CONFERENCE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22150 2026-02-27 cs.CV

CoLoGen: Progressive Learning of Concept-Localization Duality for Unified Image Generation

CoLoGen:渐进式学习概念定位二元性以实现统一图像生成

YuXin Song, Yu Lu, Haoyuan Sun, Huanjin Yao, Fanglong Liu, Yifan Sun, Haocheng Feng, Hang Zhou, Jingdong Wang

机构 * Baidu Inc.(百度公司) Zhejiang University(浙江大学) Tsinghua University(清华大学)

AI总结 CoLoGen通过渐进式学习概念与定位的二元性,实现统一图像生成的高效表示学习。

Comments Accepted by CVPR2026. 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02700 2026-02-27 cs.CV cs.LG

VLM-Pruner: Buffering for Spatial Sparsity in an Efficient VLM Centrifugal Token Pruning Paradigm

VLM-Pruner: 为高效VLM离心令牌剪枝范式中的空间稀疏性引入缓冲

Zhenkai Wu, Xiaowen Ma, Zhenliang Ni, Dengming Zhang, Han Shu, Xin Jiang, Xinghao Chen

机构 * Zhejiang University(浙江大学) Huawei Technologies(华为技术)

AI总结 VLM-Pruner通过平衡冗余与空间稀疏性,提升VLMs的效率和性能。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04504 2026-02-27 cs.CV

Asynchronous Denoising Diffusion Models for Aligning Text-to-Image Generation

异步去噪扩散模型用于文本到图像生成对齐

Zijing Hu, Yunze Tong, Fengda Zhang, Junkun Yuan, Jun Xiao, Kun Kuang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出异步扩散模型,通过为不同像素分配不同时间步以改进文本到图像生成的对齐效果。

Comments Accepted to ICLR 2026, 25 pages, 13 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏