arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3038
2605.00370 2026-05-12 cs.LG cs.CY cs.MM

Group Cognition Learning: Making Everything Better Through Governed Two-Stage Agents Collaboration

群体认知学习:通过受控的双阶段智能体协作使一切变得更好

Chunlei Meng, Pengbin Feng, Rong Fu, Hoi Leong Lee, Xiaojing Du, Zhaolu Kang, Zeyu Zhang, Weilin Zhou, Chun Ouyang, Zhongxue Gan

机构 * University of Macau(澳门大学) Universiti Malaysia Perlis(马来西亚霹雳大学) Peking University(北京大学) Xinjiang University(新疆大学)

AI总结 本文提出群体认知学习框架,通过双阶段智能体协作解决多模态学习中的模态主导和虚假耦合问题,实验表明其在回归和分类任务中达到最优性能。

Comments This study has been Accepted by ICML 2026. The current version is a manuscript, please refer to the official version released at ICML 2026 for the final published version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11566 2026-05-12 cs.CV

R4Det: 4D Radar-Camera Fusion for High-Performance 3D Object Detection

R4Det:用于高性能3D目标检测的4D雷达-摄像头融合

Zhongyu Xia, Yousen Tang, Yongtao Wang, Zhifeng Wang, Weijun Qin

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) EBTech Co. Ltd(EBTech公司)

AI总结 R4Det通过全景深度融合模块提升深度估计,设计变形门控时间融合模块以不依赖车辆姿态,结合实例引导动态细化模块,实现更准确的3D目标检测。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09465 2026-05-12 cs.CV cs.AI

EvoDriveVLA: Evolving Driving VLA Models via Collaborative Perception-Planning Distillation

EvoDriveVLA: 通过协作感知-规划蒸馏进化驾驶VLA模型

Jiajun Cao, Xiaoan Zhang, Xiaobao Wei, Liyuqiu Huang, Zijian Wang, Hanzhen Zhang, Zhengyu Jia, Wei Mao, Hao Wang, Xianming Liu, Shuchang Zhou, Yang Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) XPeng Motors(小鹏汽车)

AI总结 本文提出EvoDriveVLA框架,结合自我锚定感知约束和未来引导轨迹优化,解决自动驾驶中感知退化和长期规划不稳定问题,实现nuScenes和NAVSIM的SOTA性能。

Comments 19 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06527 2026-05-12 cs.AI

HyPER: Bridging Exploration and Exploitation for Scalable LLM Reasoning with Hypothesis Path Expansion and Reduction

HyPER:通过假设路径扩展与缩减实现可扩展的大语言模型推理中的探索与利用平衡

Shengxuan Qiu, Haochen Huang, Shuzhang Zhong, Pengfei Zuo, Meng Li

机构 * Institute for Artificial Intelligence, Peking University, Beijing(北京大学人工智能研究院) Huawei(华为) School of Integrated Circuits, Peking University, Beijing(北京大学集成电路学院)

AI总结 HyPER通过动态扩展-缩减控制问题优化多路径解码,提升推理准确性与计算效率,实验显示在不同基准上准确率提升8-10%,token使用减少25-40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11233 2026-05-12 cs.CL

CNSocialDepress: A Chinese Social Media Dataset for Depression Risk Detection and Structured Analysis

CNSocialDepress:一种用于抑郁症风险检测和结构化分析的中文社交媒体数据集

Jinyuan Xu, Tian Lan, Xintao Yu, Xue He, Hezhi Zhang, Ying Wang, Pierre Magistry, Mathieu Valette, Lei Li

机构 * Ertim Inalco Milkuya Studio Sorbonne Université(索邦大学) IRD Lab(IRD实验室) Faculty of Psychology, Peking University(北京大学心理学系) Faculty of Psychology and Cognitive Science, Beijing Normal University(北京师范大学心理学与认知科学系) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出CNSocialDepress数据集,用于中文社交媒体中抑郁症风险检测与结构化分析,包含44178条帖子及10306个抑郁症相关片段,支持多维度心理属性分析及NLP任务应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10027 2026-05-12 cs.CL cs.AI

Speech-based Psychological Crisis Assessment using LLMs

基于语音的心理危机评估使用大语言模型

Terumi Chiba, Yang Luo, Ziyun Cui, Yongsheng Tong, Chao Zhang

机构 * Tsinghua University(清华大学) Peking University Huilongguan Clinical Medical School(北京大学回龙guan临床医学院) WHO Collaborating Centre for Research and Training in Suicide Prevention(世界卫生组织自杀预防研究与培训协作中心)

AI总结 本文提出利用大语言模型自动分类危机等级,通过引入语音学注入方法和增强推理训练策略,提升热线服务质量。

Comments 5 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09972 2026-05-12 cs.RO cs.CV

HiDrive: A Closed-Loop Benchmark for High-Level Autonomous Driving

HiDrive:面向高级自动驾驶的闭环基准测试

Zhongyu Xia, Guanyu Zhu, Guo Tang, Wenhao Chen, Yongtao Wang

机构 * Wangxuan Institute of Computer Technology, Peking University(王炫计算机技术研究所,北京大学)

AI总结 HiDrive提出一个强调长尾场景的闭环基准测试,评估驾驶能力的更全面系统,包含碰撞避免、交通规则合规和道德推理指标,提供更真实的测试环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09954 2026-05-12 cs.RO cs.CV

JODA: Composable Joint Dynamics for Articulated Objects

JODA:可组合的联合动力学用于连杆物体

Tianhong Gao, Cheng Yu, Yinghao Xu, Mengyu Chu

机构 * Peking University(北京大学) Ant Group, Robbyant(蚂蚁集团,Robbyant)

AI总结 JODA通过结构化三通道场生成关节级动力学,结合视觉和语言模型推断并优化关节动力学,实现可控的连杆物体动力学建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09856 2026-05-12 cs.CV cs.AI

MoPO: Incorporating Motion Prior for Occluded Human Mesh Recovery

MoPO:结合运动先验进行遮挡人体网格恢复

Tao Tang, Hong Liu, Xinshun Wang, Wanruo Zhang

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School, China(一般人工智能国家重点实验室,北京大学,深圳研究生院,中国)

AI总结 本文提出MoPO,通过结合运动先验来提高遮挡人体网格恢复的鲁棒性,采用时空遮挡检测和轻量运动预测模块,结合图像特征进行融合与优化,提升恢复精度和时间一致性。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09422 2026-05-12 cs.CL cs.CV

Perception Without Engagement: Dissecting the Causal Discovery Deficit in LMMs

无参与的感知:LMMs中因果发现缺陷的剖析

Jiafeng Liang, Zhihao Zhu, Zihan Zhang, Baoqi Ren, Shixin Jiang, Runxuan Liu, Tao Ren, Ming Liu, See-Kiong Ng, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) National University of Singapore(新加坡国立大学) Peking University(北京大学) Harvard University(哈佛大学)

AI总结 本文探讨了大型多模态模型在因果发现中的缺陷,提出ProCauEval评估协议和ADPO框架,通过扰动分析揭示模型在视觉和文本模态间的依赖关系,提升视觉推理能力。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09387 2026-05-12 cs.AI cs.RO

NEXUS: Continual Learning of Symbolic Constraints for Safe and Robust Embodied Planning

NEXUS:用于安全和稳健体素规划的符号约束连续学习

Tiehan Cui, Peipei Liu, Yanxu Mao, Congying Liu, Mingzhe Xing, Datao You

机构 * School of Artificial Intelligence and Automation(人工智能与自动化学院) Huazhong University of Science and Technology(华中科技大学) School of Software(软件学院) Henan University(河南大学) Institute of Information Engineering(信息工程研究所) Chinese Academy of Sciences(中国科学院) School of Cyberspace Security(网络空间安全学院) University of the Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学)

AI总结 NEXUS通过模块化框架实现体素代理的连续学习,将符号 artifacts 用于符号 grounding 和知识演化,将概率风险评估转化为确定性硬约束,提升任务成功率并抵御对抗攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09299 2026-05-12 cs.GR cs.LG

LagrangianSplats: Divergence-Free Transport of Gaussian Primitives for Fluid Reconstruction

LagrangianSplats: 用于流体重建的无散度传输高斯原语

Ningxiao Tao, Baoquan Chen, Mengyu Chu

机构 * School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学) Peking University(北京大学) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学)

AI总结 本文提出一种基于无散度核的框架,通过拉格朗日3D高斯点散布实现流体重建,确保流体不可压缩性和远距离传输一致性,实验显示其在传输一致性和物理准确性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09276 2026-05-12 cs.LG cs.CV

Uncertainty-Aware Token Importance Estimation in Spiking Transformers

在脉冲变换器中考虑不确定性的标记重要性估计

Wenxuan Liu, Zecheng Hao, Tong Bu, Yuran Wang, Zhaofei Yu

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Computer Science, Peking University. Institute for Artificial Intelligence, Peking University(北京大学计算机科学学院。人工智能研究所) Peking University(北京大学)

AI总结 本文提出Uncert框架,通过建模类证据和时间不确定性模式,提升脉冲变换器的标记重要性估计,实现更高效的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13630 2026-05-12 cs.CR cs.AI

SafeHarness: Lifecycle-Integrated Security Architecture for LLM-based Agent Deployment

SafeHarness:面向LLM代理部署的生命周期集成安全架构

Xixun Lin, Yang Liu, Yancheng Chen, Yongxuan Wu, Yucheng Ning, Yilong Liu, Nan Sun, Shun Zhang, Bin Chong, Chuan Zhou, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Institute of Applied Physics and Computational Mathematics(应用物理与计算数学研究所) Peking University(北京大学)

AI总结 本文提出SafeHarness架构,通过四个防御层集成到代理生命周期中,解决现有安全方法的结构性不匹配问题,降低不安全行为和攻击成功率。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11258 2026-05-12 cs.LG cs.AI cs.CL

Knowledge is Not Enough: Injecting RL Skills for Continual Adaptation

知识不足:注入强化学习技能以实现持续适应

Pingzhi Tang, Yiding Wang, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Yuanpei College, Peking University(北京大学元培学院)

AI总结 本文提出PaST框架,通过提取领域无关的Skill Vector,实现高效知识适应。实验表明PaST在知识问答和工具使用任务中优于现有方法,展现出良好的可扩展性和跨领域迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08960 2026-05-12 cond-mat.mtrl-sci cs.LG physics.chem-ph physics.comp-ph

CrystalREPA: Transferring Physical Priors from Universal MLIPs to Crystal Generative Models

CrystalREPA: 从通用机器学习 interatomic 势能中转移物理先验到晶体生成模型

Chengqian Zhang, Yucheng Jin, Duo Zhang, Tiejun Li, Han Wang

机构 * AI for Science Institute, Beijing, China(人工智能科学研究院,北京,中国) Center for Data Science, Peking University, Beijing, China(数据科学中心,北京大学,北京,中国) LMAM and School of Mathematical Sciences, Peking University, Beijing, China(LMAM与数学科学学院,北京大学,北京,中国) Center for Machine Learning Research, Peking University, Beijing, China(机器学习研究中心,北京大学,北京,中国) National Key Laboratory of Computational Physics, Institute of Applied Physics and Computational Mathematics, Beijing, China(国家计算物理重点实验室,应用物理与计算数学研究所,北京,中国) HEDPS, CAPT, College of Engineering, Peking University, Beijing, China(HEDPS、CAPT、工程学院,北京大学,北京,中国)

AI总结 CrystalREPA 通过在训练时对齐生成编码器的原子隐藏状态与冻结的 MLIP 表示,转移稳定性感知的原子先验,提升生成晶体的热力学稳定性、结构有效性及结构保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08762 2026-05-12 cs.SD cs.LG

Omni-DeepSearch: A Benchmark for Audio-Driven Omni-Modal Deep Search

Omni-DeepSearch:一种基于音频的多模态深度搜索基准

Tao Yu, yiming ding, Shenghua Chai, Minghui Zhang, Zhongtian Luo, Xinming Wang, Xinlong Chen, Zhaolu Kang, Junhao Gong, Yuxuan Zhou, Haopeng Jin, Zhiqing Cui, Jiabing Yang, YiFan Zhang, Hongzhu Yi, Zheqi He, Xi Yang, Yan Huang, Liang Wang

机构 * CASIA UCAS BAAI Peking University(北京大学) Tsinghua University(清华大学)

AI总结 本文提出Omni-DeepSearch基准,用于评估基于音频的多模态深度搜索能力,通过多跳推理生成客观答案,结果显示该任务极具挑战性。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08761 2026-05-12 cs.MA cs.LG

Beyond the All-in-One Agent: Benchmarking Role-Specialized Multi-Agent Collaboration in Enterprise Workflows

超越全能代理:企业工作流中角色专业化多代理协作的基准测试

Tao Yu, Hao Wang, Changyu Li, Shenghua Chai, Minghui Zhang, Zhongtian Luo, Yuxuan Zhou, Haopeng Jin, Zhaolu Kang, Jiabing Yang, YiFan Zhang, Xinming Wang, Hongzhu Yi, Zheqi He, Jing-Shu Zheng, Xi Yang, Yan Huang, Liang Wang

机构 * BAAI(北京人工智能研究院) CASIA(中国科学院自动化研究所) UCAS(中国科学技术大学) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 本文提出EntCollabBench,用于评估企业多代理协作,模拟权限隔离组织,包含工作流和审批两个子集,通过执行轨迹、数据库验证和确定性政策裁决评估代理系统,实验表明当前模型在企业协作中仍存在缺陷。

Comments 45 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08741 2026-05-12 cs.CL

Training with Harnesses: On-Policy Harness Self-Distillation for Complex Reasoning

通过Harness训练:面向复杂推理的在线策略Harness自蒸馏

Zhengyang Zhao, Lu Ma, Wentao Zhang

机构 * Peking University(北京大学)

AI总结 本文提出OPHSD方法,通过将增强的模型作为教师进行自蒸馏,提升模型在复杂推理任务中的泛化能力和独立表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08722 2026-05-12 cs.RO cs.MA

HULK: Large-scale Hierarchical Coordination under Continual and Uncertain Temporal Tasks

HULK:大规模层次协调在连续和不确定的时间任务中

Qingyuan Luo, Jie Li, Meng Guo

机构 * Department of Mechanics and Engineering Science, College of Engineering, Peking University(力学与工程科学系,工程学院,北京大学) National University of Defense Technology(国防科学技术大学)

AI总结 本文提出HULK框架,解决连续和不确定时间任务下的大规模协调问题,通过分层结构提升计算效率和鲁棒性。

Comments Accepted to the IEEE International Conference on Robotics and Automation. 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08639 2026-05-12 cs.LG

ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning

ReLibra:基于路由回放的MoE训练负载均衡

Chao Jin, Xinming Wei, Yinmin Zhong, Chengxu Yang, Bingyang Wu, Ruidong Zhu, Zili Zhang, Yuliang Liu, Xin Jin

机构 * School of Computer Science, Peking University(北京大学计算机学院)

AI总结 ReLibra通过利用强化学习的回放训练流程中的路由回放机制,在微批次粒度上实现细粒度负载均衡,提升MoE训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04665 2026-05-12 cs.CL

Paraphrase-Induced Output-Mode Collapse: When LLMs Break Character Under Semantically Equivalent Inputs

句式转换导致的输出模式崩溃:当LLMs在语义等价输入下失衡

Aofan Liu, Jingxiang Meng

机构 * Peking University(北京大学) University of Chicago(芝加哥大学)

AI总结 研究发现,当请求内容被重写时,大语言模型往往无法保持原任务格式,提出了提示变体输出模式崩溃现象,并通过PARACONSIST基准测试评估模型鲁棒性。

Comments Added a footnote; author order is alphabetical by last name

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03456 2026-05-12 cs.CV

VL-SAM-v3: Memory-Guided Visual Priors for Open-World Object Detection

VL-SAM-v3:基于记忆的开放世界目标检测视觉先验

Chih-Chung Liu, Zhiwei Lin, Yongtao Wang

机构 * Wangxuan Institute of Computer Technology, Peking University, China(北京大学计算机科学技术研究院)

AI总结 VL-SAM-v3通过引入检索驱动的外部视觉记忆,提升开放世界目标检测的性能,尤其在稀有类别和复杂场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00327 2026-05-12 cs.AI cs.HC

SayNext-Bench: Why Do LLMs Struggle with Next-Utterance Anticipation?

SayNext-Bench:为什么LLMs在下一句预测中挣扎?

Yueyi Yang, Haotian Liu, Fang Kang, Mengqi Zhang, Zheng Lian, Hao Tang, Haoyu Chen

机构 * University of Oulu(奥卢大学) College of William and Mary(威廉与玛丽学院) Tongji University(同济大学) Peking University(北京大学)

AI总结 研究探讨LLM在人类对话中的下一句预测能力,指出人类可通过多模态线索预测,而LLM表现不足。提出SayNext-Bench基准,结合多模态数据集和评估框架,开发SayNext-Chat模型,证明其在多层面优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19115 2026-05-12 cs.CV

Generative Giants, Retrieval Weaklings: Why do Multimodal Large Language Models Fail at Multimodal Retrieval?

生成巨人,检索弱者:为何多模态大语言模型在多模态检索中表现不佳?

Hengyi Feng, Zeang Sheng, Meiyi Qiang, Yang Li, Wentao Zhang

机构 * University of Electronic Science and Technology of China(电子科技大学) Peking University(北京大学) Tencent Inc(腾讯公司) Zhongguancun Academy(中关村学院)

AI总结 研究揭示多模态大语言模型在多模态检索中表现不佳的原因,通过稀疏自编码器分析发现其表示空间主要由文本语义构成,视觉语义不足,导致检索性能下降,提出ReAlign方法提升检索效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12542 2026-05-12 cs.LG cs.AI cs.CV stat.ML

PLD: A Choice-Theoretic List-Wise Knowledge Distillation

PLD: 一种基于选择理论的列表级知识蒸馏

Ejafa Bassam, Dawei Zhu, Kaigui Bian

机构 * School of Computer Science, Peking University(北京大学计算机科学学院)

AI总结 本文提出PLD,一种基于Plackett-Luce模型的列表级知识蒸馏方法,通过将教师logits视为'价值'评分,直接优化教师最优排名,实现凸且平移不变的替代目标,涵盖加权交叉熵。

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025), 136090--136112 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01352 2026-05-12 cs.LG

TAH-QUANT: Effective Activation Quantization in Pipeline Parallelism over Slow Network

TAH-QUANT: 在慢速网络下的流水线并行中有效的激活量化

Guangxin He, Yuan Cao, Yutong He, Tianyi Bai, Kai Chen, Kun Yuan, Binhang Yuan

机构 * HKUST(香港科技大学) Peking University(北京大学)

AI总结 本文提出TAH-Quant框架,通过细粒度切片量化、熵引导的自适应位分配和Hadamard变换,减少量化误差并提升训练效率,实验证明其在保持收敛性的同时提升了吞吐量和速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13451 2026-05-12 cs.RO

MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation

MapNav: 一种通过标注语义地图的新型记忆表示方法用于视觉-语言导航

Lingfeng Zhang, Xiaoshuai Hao, Qinwen Xu, Qiang Zhang, Xinyao Zhang, Pengwei Wang, Jing Zhang, Zhongyuan Wang, Shanghang Zhang, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) Beijing Innovation Center of Humanoid Robotics Co., Ltd.(北京人形机器人创新中心有限公司) School of Computer Science, Wuhan University(武汉大学计算机学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室,计算机学院)

AI总结 本文提出MapNav,通过标注语义地图替代传统历史帧,提升视觉-语言导航任务的性能,实验表明其在模拟和现实环境中均达到SOTA水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08296 2026-05-12 cs.CV eess.SP

BenchHAR: Benchmarking Self-Supervised Learning for Generalizable Sensor-based Activity Recognition

BenchHAR: 用于通用传感器活动识别的自监督学习基准测试

Yize Cai, Rui Feng, Anlan Yu, Baoshen Guo, Zhiqing Hong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Peking University(北京大学) Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联合研究技术联盟)

AI总结 BenchHAR针对传感器活动识别中数据异质性和标注数据稀缺问题,系统比较了自监督学习方法的泛化性能,发现混合范式和CNN编码器在性能上表现最佳,且增加预训练数据量能提升泛化能力。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08250 2026-05-12 cs.CV cs.AI

Why Do DiT Editors Drift? Plug-and-Play Low Frequency Alignment in VAE Latent Space

为何DiT编辑器会漂移?VAE潜在空间中的插件式低频对齐

Xiaoce Wang, Sifan Zhou, Kaifei Wang, Leli Xu, Xuerui Qiu, Tao He, Ming Li

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) Peking University(北京大学) CASIA University of Electronic Science and Technology of China(电子科技大学) Guangming Laboratory(光明实验室)

AI总结 本文从潜在空间频率角度研究DiT编辑器漂移问题,提出无需训练的VAE-LFA方法,通过低频对齐抑制语义漂移并保持高频细节,适用于白盒和黑盒DiT编辑器。

Comments 9 pages main paper, 12 figures, 25 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏