arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

共收录 2228
2512.03056 2025-12-04 cs.LG cs.AI

Delta Sampling: Data-Free Knowledge Transfer Across Diffusion Models

Delta Sampling: 数据无源的知识迁移跨扩散模型

Zhidong Gao, Zimeng Pan, Yuhang Yao, Chenyue Xie, Wei Wei

机构 * Shanxi University(山西大学) Google Cloud(谷歌云) Carnegie Mellon University(卡内基梅隆大学) University of Science and Technology of China(中国科学技术大学)

AI总结 Delta Sampling通过推理时利用模型预测差异实现跨不同架构基模型的知识迁移,无需原始训练数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02933 2025-12-04 cs.CV

LoVoRA: Text-guided and Mask-free Video Object Removal and Addition with Learnable Object-aware Localization

LoVoRA: 基于文本引导和无掩码的视频对象移除与添加方法

Zhihan Xiao, Lin Liu, Yixin Gao, Xiaopeng Zhang, Haoxuan Che, Songping Mai, Qi Tian

机构 * Tsinghua University(清华大学) Huawei Inc.(华为公司) University of Science and Technology of China(中国科学技术大学)

AI总结 LoVoRA通过可学习的对象感知定位机制实现无掩码的视频对象移除与添加,结合图像到视频转换和光流传播,实现端到端视频编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03724 2025-12-04 cs.CL

MemOS: A Memory OS for AI System

MemOS:人工智能系统中的内存操作系统

Zhiyu Li, Chenyang Xi, Chunyu Li, Ding Chen, Boyu Chen, Shichao Song, Simin Niu, Hanyu Wang, Jiawei Yang, Chen Tang, Qingchen Yu, Jihao Zhao, Yezhaohui Wang, Peng Liu, Zehao Lin, Pengyuan Wang, Jiahao Huo, Tianyi Chen, Kai Chen, Kehang Li, Zhen Tao, Huayi Lai, Hao Wu, Bo Tang, Zhengren Wang, Zhaoxin Fan, Ningyu Zhang, Linfeng Zhang, Junchi Yan, Mingchuan Yang, Tong Xu, Wei Xu, Huajun Chen, Haofen Wang, Hongkang Yang, Wentao Zhang, Zhi-Qin John Xu, Siheng Chen, Feiyu Xiong

机构 * MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司) Institute for Advanced Algorithms Research, Shanghai(上海先进算法研究所) Research Institute of China Telecom(中国电信研究院) Tongji University(同济大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Renmin University of China(中国人民大学) Beihang University(北航) Shanghai Jiao Tong University(上海交通大学)

AI总结 MemOS是一种面向人工智能系统的内存操作系统,通过统一管理不同类型的内存资源,提升长上下文推理和持续个性化的能力。

Comments 36 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02834 2025-12-03 cs.RO cs.AI

Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach

引导视觉-语言-动作模型作为反探索:一种测试时间缩放方法

Siyuan Yang, Yang Zhang, Haoran He, Ling Pan, Xiu Li, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom(中国电信人工智能研究院) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 本文提出TACO框架,通过测试时间缩放方法在视觉-语言-动作模型中引入反探索机制,提升推理稳定性和任务成功率。

Comments The first two authors contributed equally. Yang Zhang leads the whole project

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02812 2025-12-03 cs.AI

Enhancing Automated Paper Reproduction via Prompt-Free Collaborative Agents

通过无提示协作代理增强自动论文复现

Zijie Lin, Qilin Cai, Liang Shen, Mingjun Xiao

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团)

AI总结 本文提出一种无提示协作代理框架,通过验证和细化代理提升论文到代码生成的准确性和完整性,实验显示性能提升约15%和13%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02624 2025-12-03 cs.CV

PPTBench: Towards Holistic Evaluation of Large Language Models for PowerPoint Layout and Design Understanding

PPTBench: 向大语言模型在PowerPoint布局和设计理解的全面评估迈进

Zheng Huang, Xukai Liu, Tianyu Hu, Kai Zhang, Ye Liu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

AI总结 PPTBench通过全面评估大语言模型在PowerPoint布局和设计理解上的能力,揭示了当前模型在视觉布局推理和生成中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22052 2025-12-03 cs.CV

Ov3R: Open-Vocabulary Semantic 3D Reconstruction from RGB Videos

Ov3R:从RGB视频流中进行开放词汇语义3D重建

Ziren Gong, Xiaohan Li, Fabio Tosi, Jiawei Han, Stefano Mattoccia, Jianfei Cai, Matteo Poggi

机构 * University of Bologna(博洛尼亚大学) USTC(中科大) BIT(北京理工) Monash University(墨尔本大学)

AI总结 Ov3R通过结合CLIP语义和融合描述符,实现从RGB视频流中进行开放词汇语义3D重建,提升空间人工智能的实时性和语义感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21025 2025-12-03 cs.SD cs.AI cs.LG eess.AS

Text-Queried Audio Source Separation via Hierarchical Modeling

通过分层建模实现文本查询的音频源分离

Xinlei Yin, Xiulian Peng, Xue Jiang, Zhiwei Xiong, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学) School of Information and Communication Engineering, Communication University of China(中国通信大学信息与通信工程学院) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文提出HSM-TSS框架,通过分层建模实现文本查询的音频源分离,结合双阶段语义分离与结构保持重建,提升复杂场景下的分离性能与语义一致性。

Comments Accepted by TASLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02536 2025-12-03 cs.CV

WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens

WeMMU: 通过噪声查询标记增强视觉-语言模型与扩散模型的桥梁

Jian Yang, Dacheng Yin, Xiaoxuan He, Yong Li, Fengyun Rao, Jing Lyu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知联合实验室,中国科学技术大学) ZheJiang University(浙江大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 WeMMU通过噪声查询标记和VAE分支,提升视觉-语言模型与扩散模型的连接效率,缓解泛化崩溃问题,实现稳定持续学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02523 2025-12-03 cs.SD cs.LG

Generative Multi-modal Feedback for Singing Voice Synthesis Evaluation

生成式多模态反馈用于歌唱语音合成评估

Xueyan Li, Yuxin Wang, Mengjie Jiang, Qingzi Zhu, Jiang Zhang, Zoey Kim, Yazhe Niu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Columbia University(哥伦比亚大学) Dalian University of Technology(大连理工大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出生成式多模态反馈框架,通过音频-语言模型生成多维语言和音频反馈,提升歌唱语音合成评估的准确性和可解释性。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00723 2025-12-02 cs.CV cs.RO

TrajDiff: End-to-end Autonomous Driving without Perception Annotation

TrajDiff: 无需感知标注的端到端自动驾驶

Xingtai Gui, Jianbo Zhao, Wencheng Han, Jikai Wang, Jiahao Gong, Feiyang Tan, Cheng-zhong Xu, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学智能物联网与交通系统研究中心,计算机学院) University of Science and Technology of China(中国科学技术大学) Mach Drive

AI总结 TrajDiff通过无需感知标注的轨迹导向鸟瞰图扩散框架,实现了端到端自动驾驶,达到领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00706 2025-12-02 cs.CV cs.AI

Optimizing LVLMs with On-Policy Data for Effective Hallucination Mitigation

利用策略数据优化LVLMs以实现有效的幻觉缓解

Chengzhi Yu, Yifan Xu, Yifan Chen, Wenyi Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Hong Kong Baptist University(香港 Baptist 大学)

AI总结 本文提出利用策略数据优化LVLMs,通过幻觉分类器和动态加权DPO算法,显著降低幻觉率并提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00438 2025-12-02 cs.CV cs.AI

FR-TTS: Test-Time Scaling for NTP-based Image Generation with Effective Filling-based Reward Signal

FR-TTS: 基于有效填充奖励信号的NTP图像生成测试时扩展

Hang Xu, Linjiang Huang, Feng Zhao

机构 * MoE Key Lab of BIPC, USTC(信息与通信技术联合实验室,中国科学技术大学) Beihang University(北京航空航天大学)

AI总结 FR-TTS通过有效填充奖励信号提升NTP图像生成的测试时扩展性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03657 2025-12-02 cs.CV

Dynamic Multimodal Prototype Learning in Vision-Language Models

视觉-语言模型中的动态多模态原型学习

Xingyu Zhu, Shuo Wang, Beier Zhu, Miaoge Li, Yunfan Li, Junfeng Fang, Zhicai Wang, Dongsheng Wang, Hanwang Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学) National University of Singapore(新加坡国立大学) Shenzhen University(深圳大学)

AI总结 本文提出ProtoMM框架,通过动态更新视觉粒子和多模态原型学习,提升视觉-语言模型在测试时的适应性能。

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.12973 2025-12-02 cs.AI cs.IR

Uncertainty Calibration for Counterfactual Propensity Estimation in Recommendation

反事实倾向性估计中的不确定性校准

Wenbo Hu, Xin Sun, Qiang liu, Le Wu, Liang Wang

机构 * School of Computer and Information, Hefei University of Technology(合肥工业大学计算机与信息学院) University of Science and Technology of China(中国科学技术大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 本文提出通过预期校准误差(ECE)校准倾向性分数,以提升反事实转化率预测的准确性与可靠性。

Comments This is the accepted manuscript version of the IEEE TKDE paper. The final published version will be available at: https://doi.ieeecomputersociety.org/10.1109/TKDE.2025.3552658

Journal ref IEEE Trans. Knowl. Data Eng. 37(6): 3781-3793, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00308 2025-12-02 cs.CV

Optimizing Distributional Geometry Alignment with Optimal Transport for Generative Dataset Distillation

基于最优传输的分布几何对齐优化用于生成数据集蒸馏

Xiao Cui, Yulei Qin, Wengang Zhou, Hongsheng Li, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) CUHK MMLab(香港中文大学多媒体实验室) Independent Researcher(独立研究者)

AI总结 本文提出基于最优传输的分布几何对齐方法,通过优化传输距离提升数据集蒸馏效果,实验表明在ImageNet-1K上准确率提升至少4%。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10125 2025-12-02 cs.CV cs.MM

Proxy-Tuning: Tailoring Multimodal Autoregressive Models for Subject-Driven Image Generation

代理调优:为以主题驱动的图像生成定制多模态自回归模型

Yi Wu, Shengju Qian, Lingting Zhu, Lei Liu, Wandi Qiao, Ziqiang Li, Lequan Yu, Bin Li

机构 * University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Nanjing University of Information Science and Technology(南京信息工程大学)

AI总结 本文提出代理调优方法,通过扩散模型增强AR模型在主题驱动图像生成中的能力,揭示了弱到强泛化现象,提升了多主题组合和上下文理解的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23282 2025-12-01 cs.LG cs.DC cs.IT math.IT

Closing the Generalization Gap in Parameter-efficient Federated Edge Learning

缩小参数高效联邦边缘学习中的泛化差距

Xinnong Du, Zhonghao Lyu, Xiaowen Cao, Chunyang Wen, Shuguang Cui, Jie Xu

机构 * School of Science and Engineering (SSE)(科学与工程学院) Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来网络智能研究所) Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来网络智能重点实验室) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) School of Electrical Engineering and Computer Science(电气工程与计算机科学学院) KTH Royal Institute of Technology(皇家理工学院) College of Electronic and Information Engineering(电子与信息工程学院) University of Science and Technology of China (USTC)(中国科学技术大学)

AI总结 本文提出了一种参数高效的联邦边缘学习框架,通过联合模型剪枝和客户端选择,解决本地数据异质性和资源受限问题,提升模型泛化能力和学习性能。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23225 2025-12-01 cs.CL cs.CV cs.LG

TWEO: Transformers Without Extreme Outliers Enables FP8 Training And Quantization For Dummies

TWEO: 无需极端异常值的Transformer 使FP8训练和量化变得容易

Guang Liang, Jie Shao, Ningyuan Tang, Xinyao Liu, Jianxin Wu

机构 * Nationa Key Laboratory for Novel Software Technology(新型软件技术国家实验室) School of Artificial Intelligence(人工智能学院) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学)

AI总结 TWEO通过简单损失函数有效减少训练中的极端异常值,使FP8训练和量化成为可能,显著提升训练效率和模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01528 2025-12-01 cs.CL cs.AI q-bio.BM

Leveraging Biomolecule and Natural Language through Multi-Modal Learning: A Survey

利用生物分子和自然语言通过多模态学习:一篇综述

Qizhi Pei, Zhimeng Zhou, Kaiyuan Gao, Jinhua Zhu, Yue Wang, Zun Wang, Tao Qin, Lijun Wu, Rui Yan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Huazhong University of Science and Technology(华中科技大学) University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Shanghai AI Laboratory(上海人工智能实验室) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

AI总结 本文综述了生物分子与自然语言多模态学习的最新进展,探讨了技术表示、多模态整合方法、应用实例及未来研究方向。

Comments 2025.11.28 Updated Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22549 2025-12-01 cs.CV

Diff-ICMH: Harmonizing Machine and Human Vision in Image Compression with Generative Prior

Diff-ICMH: 在图像压缩中融合机器与人类视觉

Ruoyu Feng, Yunpeng Qi, Jinming Liu, Yixin Gao, Xin Li, Xin Jin, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Eastern Institute of Technology, Ningbo(宁波工程技术院)

AI总结 Diff-ICMH通过融合机器与人类视觉,提出了一种生成图像压缩框架,利用生成先验和语义一致性损失提升压缩质量,同时支持多种智能任务。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22134 2025-12-01 cs.CV cs.RO

DualVLA: Building a Generalizable Embodied Agent via Partial Decoupling of Reasoning and Action

DualVLA: 通过推理与行动部分解耦构建通用具身代理

Zhen Fang, Zhuoyang Liu, Jiaming Liu, Hao Chen, Yu Zeng, Shiting Huang, Zehui Chen, Lin Chen, Shanghang Zhang, Feng Zhao

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知国家重点实验室,中国科学技术大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,北京大学计算机学院) CUHK(香港大学)

AI总结 DualVLA通过推理与行动部分解耦,提升通用具身代理的行动与多模态理解平衡能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22055 2025-12-01 cs.CV cs.MM

OralGPT-Omni: A Versatile Dental Multimodal Large Language Model

OralGPT-Omni: 一种多功能的牙科多模态大语言模型

Jing Hao, Yuci Liang, Lizhuo Lin, Yuxuan Fan, Wenkai Zhou, Kaixin Guo, Zanting Ye, Yanpeng Sun, Xinyu Zhang, Yanqi Yang, Qiankun Li, Hao Tang, James Kit-Hon Tsoi, Linlin Shen, Kuo Feng Hung

机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学) School of Biomedical Engineering, Southern Medical University(南方医科大学生物医学工程学院) Singapore University of Technology and Design(新加坡科技与设计大学) University of Auckland(奥克兰大学) University of Science and Technology of China(中国科学技术大学) School of Computer Science, Peking University(北京大学计算机学院) College of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院)

AI总结 OralGPT-Omni是一种专门用于牙科的多模态大语言模型,通过TRACE-CoT数据集和四阶段训练范式,实现了对牙科图像的高效分析和高准确率评估。

Comments 47 pages, 42 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21688 2025-12-01 cs.CV cs.AI cs.CL

G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning

G$^2$VLM:基于几何的视觉语言模型,实现统一的3D重建与空间推理

Wenbo Hu, Jingli Lin, Yilin Long, Yunlong Ran, Lihan Jiang, Yifan Wang, Chenming Zhu, Runsen Xu, Tai Wang, Jiangmiao Pang

机构 * Shanghai AI Lab(上海人工智能实验室) UCLA(加州大学洛杉矶分校) SJTU(上海交通大学) FDU(福建师范大学) ZJU(浙江大学) USTC(中国科学技术大学) HKU(香港大学) CUHK(香港中文大学)

AI总结 G$^2$VLM通过统一3D重建与空间推理,提升视觉语言模型在空间智能任务中的性能。

Comments code are released at https://github.com/InternRobotics/G2VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20330 2025-12-01 cs.RO cs.CV

ArtiBench and ArtiBrain: Benchmarking Generalizable Vision-Language Articulated Object Manipulation

ArtiBench 和 ArtiBrain:可泛化的视觉-语言操纵基准测试

Yuhan Wu, Tiantian Wei, Shuo Wang, ZhiChao Wang, Yanyong Zhang, Daniel Cremers, Yan Xia

机构 * University of Science and Technology of China(中国科学技术大学) Technical University of Munich(慕尼黑技术大学)

AI总结 ArtiBench和ArtiBrain通过统一高层推理与自适应低层控制,提升可操纵物体操作的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20270 2025-12-01 cs.CV

ParticleGS: Learning Neural Gaussian Particle Dynamics from Videos for Prior-free Physical Motion Extrapolation

ParticleGS: 从视频中学习神经高斯粒子动力学以实现无先验的物理运动外推

Jinsheng Quan, Qiaowei Miao, Yichao Xu, Zizhuo Lin, Ying Li, Wei Yang, Zhihui Li, Yawei Luo

机构 * Zhejiang University(浙江大学) North China University of Technology(华北理工大学) University of Science and Technology of China(中国科学技术大学)

AI总结 ParticleGS通过学习神经高斯粒子动力学,实现无先验的物理运动外推,提升动态3D场景的预测准确性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17983 2025-12-01 cs.CV

Histomorphology-Guided Prototypical Multi-Instance Learning for Breast Cancer WSI Classification

基于组织学引导的原型多实例学习用于乳腺癌WSI分类

Baizhi Wang, Rui Yan, Wenxin Ma, Xu Zhang, Yuhao Wang, Xiaolong Li, Yunjie Gu, Zihang Jiang, S. Kevin Zhou

机构 * School of Biomedical Engineering, USTC(生物医学工程学院) USTC Center for Medical Imaging, Robotics, Analytic Computing & Learning (MIRACLE)(USTC医学影像、机器人、分析计算与学习中心) Key Laboratory of Intelligent Information Processing, ICT, CAS(智能信息处理重点实验室) State Key Laboratory of Precision and Intelligent Chemistry, USTC(精密与智能化学国家重点实验室)

AI总结 本文提出HGPMIL框架,通过整合组织学信息提升乳腺癌WSI分类的准确性与鲁棒性。

Comments 11 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21136 2025-11-27 cs.CV cs.AI

Efficient Training for Human Video Generation with Entropy-Guided Prioritized Progressive Learning

高效训练人类视频生成的熵引导优先级渐进学习

Changlin Li, Jiawei Zhang, Shuhao Liu, Sihao Lin, Zeyi Shi, Zhihui Li, Xiaojun Chang

机构 * Stanford University(斯坦福大学) North China Electric Power University(华北电力大学) University of Adelaide(阿德莱德大学) University of Technology Sydney(悉尼技术大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出熵引导优先级渐进学习方法,通过条件熵膨胀和自适应渐进计划,高效训练扩散模型生成人类视频,实现训练速度提升和内存消耗降低。

Comments Project page: https://github.com/changlin31/Ent-Prog

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21122 2025-11-27 cs.CV cs.AI

Which Layer Causes Distribution Deviation? Entropy-Guided Adaptive Pruning for Diffusion and Flow Models

哪一层导致分布偏离?面向扩散和流模型的熵引导自适应剪枝

Changlin Li, Jiawei Zhang, Zeyi Shi, Zongxin Yang, Zhihui Li, Xiaojun Chang

机构 * Stanford University(斯坦福大学) North China Electric Power University(华北电力大学) University of Technology Sydney(悉尼科技大学) Harvard University(哈佛大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出EntPruner,通过熵引导的自适应剪枝方法,有效减少扩散和流模型的参数冗余,提升推理速度并保持生成质量。

Comments Project page: https://github.com/changlin31/EntPruner

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20994 2025-11-27 cs.CV cs.AI cs.CR

GuardTrace-VL: Detecting Unsafe Multimodel Reasoning via Iterative Safety Supervision

GuardTrace-VL: 通过迭代安全监督检测不安全的多模型推理

Yuxiao Xiang, Junchi Chen, Zhenchao Jin, Changtao Miao, Haojie Yuan, Qi Chu, Tao Gong, Nenghai Yu

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络安全学院) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) The University of Hong Kong(香港大学)

AI总结 GuardTrace-VL通过联合图像-文本分析监控多模态推理全过程,有效检测不安全推理内容,实现93.1%的F1分数提升。

详情

展开后加载摘要…

URL PDF HTML 收藏