arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4556
2602.13810 2026-03-10 cs.LG cs.AI

Mean Flow Policy with Instantaneous Velocity Constraint for One-step Action Generation

具有瞬时速度约束的一步动作生成均流策略

Guojian Zhan, Letian Tao, Pengcheng Wang, Yixiao Wang, Yiheng Li, Yuxin Chen, Hongyang Li, Masayoshi Tomizuka, Shengbo Eben Li

机构 * School of Vehicle and Mobility & College of AI, Tsinghua University(车辆与移动学院及人工智能学院,清华大学) Berkeley AI Research (BAIR), UC Berkeley(伯克利人工智能研究(BAIR),加州大学伯克利分校) The University of Hong Kong(香港大学)

AI总结 本文提出均速度策略(MVP),通过引入瞬时速度约束来提升动作生成效率,实现高效的一步动作生成并在机器人操作任务中取得最佳性能。

Comments ICLR Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12575 2026-03-10 cs.CL cs.LG

Discovering Semantic Latent Structures in Psychological Scales: A Response-Free Pathway to Efficient Simplification

在心理量表中发现语义潜在结构:一种无响应路径的高效简化方法

Bo Wang, Yuxuan Zhang, Yueqin Hu, Hanchao Hou, Kaiping Peng, Shiguang Ni

机构 * Department of Psychological and Cognitive Sciences, Tsinghua University, Beijing, China(心理学与认知科学系,清华大学,北京,中国) Shenzhen International Graduate School, Tsinghua University, Shenzehen, China(深圳国际研究生院,清华大学,深圳,中国) Faculty of Psychology, Beijing Normal University, Beijing, China(心理学系,北京师范大学,北京,中国) Beijing Key Laboratory of Applied Experimental Psychology, National Demonstration Center for Experimental Psychology Education, Faculty of Psychology, Beijing Normal University, Beijing, China(应用实验心理学北京市重点实验室,国家级实验心理学教育示范中心,心理学系,北京师范大学,北京,中国)

AI总结 本文提出一种基于语义结构的无响应方法,通过主题建模简化心理量表,实现60.5%的长度缩减并保持心理测量有效性。

Comments 79 pages, 20 figures; parameter perturbation result of epoch-cn updated; minor revisions on grammars

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11492 2026-03-10 cs.AI

BoxMind: Closed-loop AI strategy optimization for elite boxing validated in the 2024 Olympics

BoxMind: 闭环AI策略优化用于精英拳击的验证在2024年奥运会

Kaiwen Wang, Kaili Zheng, Rongrong Deng, Qingmin Fan, Milin Zhang, Zongrui Li, Xuesi Zhou, Bo Han, Liren Chen, Chenyi Guo, Ji Wu

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Tsinghua University(清华大学) Beijing Sport University(北京体育大学) Beijing National Research Center for Information Science and Technology(北京国家信息科学与技术研究中心)

AI总结 BoxMind通过闭环AI策略优化在2024年奥运会中验证,实现了拳击比赛的高效战术调整和战略决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03034 2026-03-10 cs.CV

MAViD: A Multimodal Framework for Audio-Visual Dialogue Understanding and Generation

MAViD:一种多模态框架用于音频-视觉对话理解和生成

Youxin Pang, Jiajun Liu, Lingfeng Tan, Yong Zhang, Feng Gao, Xiang Deng, Zhuoliang Kang, Xiaoming Wei, Yebin Liu

机构 * Tsinghua University(清华大学) Meituan(美团)

AI总结 MAViD提出了一种多模态框架,通过Conductor-Creator架构实现音频-视觉对话的理解与生成,结合自回归和扩散模型提升长时多模态内容生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02486 2026-03-10 cs.LG

Dual-Robust Cross-Domain Offline Reinforcement Learning Against Dynamics Shifts

对抗动态偏移的双鲁棒跨域离线强化学习

Zhongjian Qiao, Rui Yang, Jiafei Lyu, Xiu Li, Zhongxiang Dai, Zhuoran Yang, Siyang Gao, Shuang Qiu

机构 * CityUHK(城市大学 Hong Kong 分校) UIUC(伊利诺伊大学香槟分校) Tsinghua University(清华大学) Yale University(耶鲁大学) CUHK(SZ)(香港中文大学(深圳)) Tencent(腾讯)

AI总结 本文提出DROCO算法,通过引入鲁棒跨域Bellman算子和动态价值惩罚等技术,提升跨域离线强化学习在动态偏移下的双鲁棒性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13795 2026-03-10 cs.CV cs.AI

Bee: A High-Quality Corpus and Full-Stack Suite to Unlock Advanced Fully Open MLLMs

Bee:一个高质量语料库和全栈工具包,解锁高级完全开放的多模态大语言模型

Yi Zhang, Bolin Ni, Xin-Sheng Chen, Heng-Rui Zhang, Yongming Rao, Houwen Peng, Qinglin Lu, Han Hu, Meng-Hao Guo, Shi-Min Hu

机构 * Tsinghua University(清华大学) Tencent Hunyuan Team(腾讯文英团队)

AI总结 Bee通过高质量数据集和全栈工具包,提升完全开放多模态大语言模型的性能,达到与半开放模型相当甚至超越的水平。

Comments homepage: https://open-bee.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01487 2026-03-10 cs.CV

PointSlice: Accurate and Efficient Slice-Based Representation for 3D Object Detection from Point Clouds

PointSlice: 用于点云3D物体检测的准确且高效的基于切片的表示方法

Liu Qifeng, Zhao Dawei, Dong Yabo, Xiao Liang, Wang Juan, Min Chen, Li Fuyang, Jiang Weizhong, Lu Dongming, Nie Yiming

机构 * Zhejiang University(浙江大学) Defense Innovation Institute(国防科技创新研究院) Tsinghua University(清华大学)

AI总结 PointSlice提出了一种基于切片的点云表示方法,通过引入切片交互网络提升3D物体检测的精度与效率。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10934 2026-03-10 cs.DB cs.LG

Towards Practical Benchmarking of Data Cleaning Techniques: On Generating Authentic Errors via Large Language Models

面向数据清洗技术实用基准测试的探索:通过大语言模型生成真实错误

Xinyuan Liu, Jiahui Chen, Bocheng Hu, Yu Sun, Xinyang Chen, Shaoxu Song, Yongxin Tong

机构 * Nankai University(南开大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua University(清华大学) Beihang University(北京航空航天大学)

AI总结 TableEG利用大语言模型生成真实错误,通过三元组表示和表格微调策略,提升数据清洗技术的基准测试效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23932 2026-03-10 cs.CL

SwingArena: Competitive Programming Arena for Long-context GitHub Issue Solving

SwingArena: 用于长上下文GitHub问题解决的竞争性编程竞技场

Wendong Xu, Jing Xiong, Chenyang Zhao, Qiujiang Chen, Haoran Wang, Hui Shen, Zhongwei Wan, Jianbo Dai, Taiqiang Wu, He Xiao, Chaofan Tao, Z. Morley Mao, Ying Sheng, Zhijiang Guo, Hongxia Yang, Bei Yu, Lingpeng Kong, Quanquan Gu, Ngai Wong

机构 * The University of Hong Kong(香港大学) University of California Los Angeles(加州大学洛杉矶分校) Tsinghua University(清华大学) University of Michigan Ann Arbor(密歇根大学安娜堡分校) The Ohio State University(俄亥俄州立大学) University of Edinburgh(爱丁堡大学) The Chinese University of Hong Kong(香港中文大学) The Hong Kong Polytechnic University(香港理工大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) LMSYS Org(LMSYS组织)

AI总结 SwingArena是一个用于评估LLM在真实CI驱动软件开发环境中性能的竞争性编程竞技场,通过模拟软件迭代过程,结合检索增强型代码生成模块,实现对长上下文问题的高效处理。

Comments The paper has been accepted as an oral presentation at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14357 2026-03-10 cs.CV cs.LG

Vid2World: Crafting Video Diffusion Models to Interactive World Models

Vid2World: 构建视频扩散模型以交互式世界模型

Siqiao Huang, Jialong Wu, Qixing Zhou, Shangchen Miao, Mingsheng Long

机构 * Tsinghua University(清华大学) Chongqing University(重庆大学)

AI总结 Vid2World通过因果化视频扩散模型,提升其在交互式世界建模中的可控性和生成能力,适用于机器人操作、游戏模拟和开放世界导航等多种领域。

Comments Project page: http://knightnemo.github.io/vid2world/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09587 2026-03-10 cs.RO

GeoNav: Empowering MLLMs with dual-scale geospatial reasoning for language-goal aerial navigation

GeoNav: 通过双尺度地理推理赋能大语言模型实现语言目标的空中导航

Haotian Xu, Yue Hu, Chen Gao, Zhengqiu Zhu, Yong Zhao, Yong Li, Quanjun Yin

机构 * College of Systems Engineering, National University of Defense Technology(系统工程学院,国防科技大学) State Key Laboratory of Digital Intelligent Modeling and Simulation(数字智能建模与仿真国家重点实验室) BNRist, Tsinghua University(清华大学BNRist)

AI总结 GeoNav通过双尺度地理推理赋能大语言模型,实现语言目标的空中导航,提升城市场景下的导航成功率和精度。

Comments Published in Pattern Recognition (2026)

Journal ref Pattern Recognition, Volume 177, 113365, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19747 2026-03-10 cs.CL cs.AR

HaLoRA: Hardware-aware Low-Rank Adaptation for Large Language Models Based on Hybrid Compute-in-Memory Architecture

HaLoRA: 基于混合计算-内存架构的硬件感知低秩适应法用于大型语言模型

Taiqiang Wu, Chenchen Ding, Wenyong Zhou, Yuxin Cheng, Xincheng Feng, Shuqi Wang, Wendong Xu, Chufan Shi, Zhengwu Liu, Ngai Wong

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学)

AI总结 HaLoRA通过在混合计算-内存架构中部署低秩适应,利用RRAM和SRAM实现高效能和高精度的LLM微调。

Comments 22 pages, Accepted by TODAES (ACM Transactions on Design Automation of Electronic Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17635 2026-03-10 cs.CV

LangSurf: Language-Embedded Surface Gaussians for 3D Scene Understanding

LangSurf: 语言嵌入的表面高斯用于3D场景理解

Hao Li, Minghan Qin, Zhengyu Zou, Diqi He, Xinhao Ji, Bohan Li, Bingquan Dai, Dingewn Zhang, Junwei Han

机构 * Brain and Artificial Intelligence Lab, Northwestern Polytechnical University(脑科学与人工智能实验室,西北工业大学) Tsinghua University(清华大学) Shanghai Jiaotong University(上海交通大学) Peking University(北京大学) School of Artifical Intelligence, Chongqing University of Posts and Telecommunications(人工智能学院,重庆邮电大学)

AI总结 LangSurf通过语言嵌入的表面高斯实现3D场景理解,提升2D和3D分割精度,扩展了下游任务如去除和编辑。

Comments \url{https://langsurf.github.io}

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08687 2026-03-10 cs.RO cs.LG

xTED: Cross-Domain Adaptation via Diffusion-Based Trajectory Editing

xTED: 通过扩散基于轨迹编辑实现跨域适应

Haoyi Niu, Qimao Chen, Tenglong Liu, Jianxiong Li, Guyue Zhou, Yi Zhang, Jianming Hu, Xianyuan Zhan

机构 * Tsinghua University(清华大学) National University of Defense Technology(国防科技大学)

AI总结 xTED通过扩散模型实现跨域轨迹编辑,有效弥合领域差距,提升数据真实性和动态可靠性,适用于多种下游策略学习任务。

Comments xTED offers a novel, generic, flexible, simple and effective paradigm that casts cross-domain policy adaptation as a data pre-processing problem

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07244 2026-03-10 cs.CV

PresentBench: A Fine-Grained Rubric-Based Benchmark for Slide Generation

PresentBench: 一种基于评分标准的细粒度幻灯片生成基准

Xin-Sheng Chen, Jiayu Zhu, Pei-lin Li, Hanzheng Wang, Shuojin Yang, Meng-Hao Guo

机构 * Tsinghua University(清华大学)

AI总结 PresentBench提出了一种细粒度、基于评分标准的幻灯片生成评估基准,通过238个实例和54.1个检查清单项目,实现更精确的评估,展示了NotebookLM在该领域的显著优势。

Comments 27 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07169 2026-03-10 cs.LG stat.ML

Making LLMs Optimize Multi-Scenario CUDA Kernels Like Experts

使LLMs像专家一样优化多场景CUDA内核

Yuxuan Han, Meng-Hao Guo, Zhengning Liu, Wenguang Chen, Shi-Min Hu

机构 * Tsinghua University(清华大学)

AI总结 本文提出CUDAMaster系统,通过多代理和硬件感知方法,实现对多场景CUDA内核的高效优化,显著提升性能并超越现有闭源库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07116 2026-03-10 cs.CR cs.AI

aCAPTCHA: Verifying That an Entity Is a Capable Agent via Asymmetric Hardness

aCAPTCHA:通过非对称难度验证实体是否为有能力的代理

Zuyao Xu, Xiang Li, Fubin Wu, Yuqi Qiu, Lu Sun, FaSheng Miao

机构 * Nankai University(南开大学) Tsinghua University(清华大学)

AI总结 aCAPTCHA通过非对称难度验证机制,为需要实体类型验证的服务提供一个无需基础设施的准入解决方案。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07090 2026-03-10 cs.CR cs.AI cs.CV

mAVE: A Watermark for Joint Audio-Visual Generation Models

mAVE:联合音频-视觉生成模型的水印

Luyang Si, Leyi Pan, Lijie Wen

机构 * School of Software, Tsinghua University(清华大学软件学院)

AI总结 mAVE是一种为联合音频-视觉生成模型原生设计的水印框架,通过加密绑定音频和视频潜在向量,提供对交换攻击的强安全保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07048 2026-03-10 cs.CV cs.AI

Looking Back and Forth: Cross-Image Attention Calibration and Attentive Preference Learning for Multi-Image Hallucination Mitigation

回望与前行:用于多图像幻觉缓解的跨图像注意力校准与关注偏好学习

Xiaochen Yang, Hao Fang, Jiawei Kong, Yaoxin Mao, Bin Chen, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology(哈尔滨工业大学) Beijing Institute of Technology(北京理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校)

AI总结 本文提出CAPL框架,通过跨图像注意力校准和偏好学习缓解多图像幻觉问题,提升模型对跨图像关联的建模能力,并在多个任务中取得稳定性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06993 2026-03-10 cs.CV

AdaGen: Learning Adaptive Policy for Image Synthesis

AdaGen: 为图像合成学习自适应策略

Zanlin Ni, Yulin Wang, Yeguo Hua, Renping Zhou, Jiayi Guo, Jun Song, Bo Zheng, Gao Huang

机构 * Department of Automation, BNRist, Tsinghua University(自动化系、BNRist、清华大学)

AI总结 AdaGen通过学习自适应策略提升图像合成性能,采用强化学习优化调度过程,实现更高效的生成效果和可控的保真度-多样性权衡。

Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Journal version of arXiv:2409.00342 (ECCV 2024). Code is available at: https://github.com/LeapLabTHU/AdaGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06732 2026-03-10 cs.CV

HERO: Hierarchical Embedding-Refinement for Open-Vocabulary Temporal Sentence Grounding in Videos

HERO: 分层嵌入-细化用于视频中开放词汇时间句接地

Tingting Han, Xinsong Tao, Yufei Yin, Min Tan, Sicheng Zhao, Zhou Yu

机构 * Laboratory of Complex Systems Modeling and Simulation, School of Computer Science and Technology, Hangzhou Dianzi University(电子科技大学复杂系统建模与仿真实验室,计算机科学与技术学院) Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(浙江省空间信息感知与传输重点实验室,电子科技大学) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系)

AI总结 HERO提出一种分层嵌入-细化框架,用于视频中开放词汇时间句接地,通过多级语义建模和跨模态细化提升视频与语言的对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06726 2026-03-10 cs.LG cs.AI

Regression Models Meet Foundation Models: A Hybrid-AI Approach to Practical Electricity Price Forecasting

回归模型与基础模型相遇:一种混合AI方法用于实际电价预测

Yunzhong Qiu, Binzhu Li, Hao Wei, Shenglin Weng, Chen Wang, Zhongyi Pei, Mingsheng Long, Jianmin Wang

机构 * School of Software, BNRist Tsinghua University(软件学院,北京理工大学) Suzhou Industrial Park Xingzhixun CS Co., Ltd.(苏州工业园区星讯CS公司)

AI总结 本文提出FutureBoosting方法,通过整合时间序列基础模型生成的预测特征,提升回归模型在电价预测中的性能,实现MAE降低超过30%。

Comments 15 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02426 2026-03-10 cs.LG

Personalized Multi-Agent Average Reward TD-Learning via Joint Linear Approximation

个性化多智能体平均回报TD学习 via 联合线性近似

Leo Muxing Wang, Pengkun Yang, Lili Su

机构 * Northeastern University(东北大学) Tsinghua University(清华大学)

AI总结 本文提出通过联合线性近似实现个性化多智能体平均回报TD学习,通过共享子空间和局部头部的分解,有效缓解信号冲突并实现线性加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16160 2026-03-10 cs.CV

Video2Layout: Recall and Reconstruct Metric-Grounded Cognitive Map for Spatial Reasoning

Video2Layout: 重建用于空间推理的度量基础认知图

Yibin Huang, Wang Xu, Wanyue Zhang, Helu Zhi, Jingjing Huang, Yangbin Xu, Yangang Sun, Conghui Zhu, Tiejun Zhao

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Institute of Microelectronics of the Chinese Academy of Sciences(中国科学院微电子研究所)

AI总结 Video2Layout通过重建度量基础的空间布局,提升多模态大语言模型在空间推理中的性能,其方法结合监督微调与强化微调,实现更精确的空间认知图构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14106 2026-03-10 cs.CL

Stealth Fine-Tuning: Efficiently Breaking Alignment in RVLMs Using Self-Generated CoT

隐形微调:通过自动生成的CoT打破RVLMs的对齐

Le Yu, Zhengyue Zhao, Yawen Zheng, Yunhao Liu

机构 * Machine Intelligence Laboratory, Sichuan University(四川大学人工智能实验室) University of Wisconsin--Madison(威斯康星大学麦迪逊分校) Department of Automation, Tsinghua University(清华大学自动化系) Global Innovation Exchange, Tsinghua University(清华大学全球创新交流中心)

AI总结 本文提出隐形微调方法,通过分段干扰和自动生成输出,有效绕过RVLMs的安全对齐防御,实现更高的ASR性能同时保持推理能力。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10851 2026-03-10 cs.RO

Preference-Conditioned Multi-Objective RL for Integrated Command Tracking and Force Compliance in Humanoid Locomotion

基于偏好条件的多目标强化学习用于人形机器人集成指令跟踪与力合规

Tingxuan Leng, Yushi Wang, Tinglong Zheng, Changsheng Luo, Mingguo Zhao

机构 * Tsinghua University, Beijing 100084, China(清华大学,北京100084,中国) Beijing Jiaotong University, Beijing 100044, China(北京交通大学,北京100044,中国)

AI总结 本文提出基于偏好的多目标强化学习框架,用于实现人形机器人在指令跟踪与力顺应性之间的平衡,通过用户指定偏好输入实现稳定训练和可部署的运动控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02937 2026-03-10 math.OC cs.LG stat.ML

Faster Gradient Methods for Highly-Smooth Stochastic Bilevel Optimization

更高效的梯度方法用于高光滑随机双层优化

Lesi Chen, Junru Li, El Mahdi Chayti, Jingzhao Zhang

机构 * Tsinghua University(清华大学) Shanghai Qizhi Institude(上海启智研究所) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院)

AI总结 本文提出F²SA-p方法,通过高阶有限差分提升随机双层优化的收敛速度,达到近最优的复杂度界。

Comments ICLR 2026; Add one additional author compared to v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00790 2026-03-10 cs.CV cs.AI

LD-RPS: Zero-Shot Unified Image Restoration via Latent Diffusion Recurrent Posterior Sampling

LD-RPS:通过潜势扩散递归后验采样实现零样本统一图像修复

Huaqiu Li, Yong Wang, Tongwen Huang, Hailang Huang, Haoqian Wang, Xiangxiang Chu

机构 * Tsinghua University(清华大学) AMAP, Alibaba Group(阿里云(AMAP))

AI总结 LD-RPS通过潜势扩散递归后验采样实现零样本统一图像修复,结合多模态模型和轻量模块提升修复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06710 2026-03-10 cs.LG cs.AI stat.ML

Variational Learning of Gaussian Process Latent Variable Models through Stochastic Gradient Annealed Importance Sampling

通过随机梯度退火重要性采样学习高斯过程潜在变量模型

Jian Xu, Shian Du, Junmei Yang, Qianli Ma, Delu Zeng, John Paisley

机构 * South China University of Technology(华南理工大学) Tsinghua University(清华大学) Columbia University(哥伦比亚大学)

AI总结 本研究提出了一种基于退火重要性采样的方法,用于改进高斯过程潜在变量模型的变分推断,通过重新参数化ELBO提升效率,并在多个数据集上验证了其优越的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19931 2026-03-10 cs.CV cs.AI cs.LG

Exploring Diffusion Models' Corruption Stage in Few-Shot Fine-tuning and Mitigating with Bayesian Neural Networks

探索扩散模型在少样本微调中的腐蚀阶段并利用贝叶斯神经网络缓解

Xiaoyu Wu, Jiaru Zhang, Yang Hua, Bohan Lyu, Hao Wang, Tao Song, Haibing Guan

机构 * Shanghai Jiao Tong University(上海交通大学) Queen’s University Belfast(女王学院 Belfast) Tsinghua University(清华大学) Stevens Institute of Technology(史蒂文斯理工学院)

AI总结 本研究通过贝叶斯神经网络缓解扩散模型在少样本微调中的腐蚀阶段问题,提升生成图像质量。

Comments Accepted by KDD' 26

详情

展开后加载摘要…

URL PDF HTML 收藏