arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanjing University(南京大学)

共收录 1177
2601.22275 2026-02-02 cs.CV cs.AI

VMonarch: Efficient Video Diffusion Transformers with Structured Attention

VMonarch:具有结构注意力的高效视频扩散变换器

Cheng Liang, Haoxian Chen, Liang Hou, Qi Fan, Gangshan Wu, Xin Tao, Limin Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

AI总结 VMonarch通过结构化注意力机制提升视频扩散变换器的效率,减少计算量并提高处理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10197 2026-02-02 cs.AI

Don't Just Fine-tune the Agent, Tune the Environment

不要只微调智能体,而是微调环境

Siyuan Lu, Zechuan Wang, Hongxuan Zhang, Qintong Wu, Leilei Gan, Chenyi Zhuang, Jinjie Gu, Tao Lin

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Nanjing University(南京大学)

AI总结 本文提出环境微调方法,通过结构化课程和环境增强,使智能体无需专家轨迹即可高效学习复杂行为,实现更稳健的泛化能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03846 2026-02-02 cs.LG

Can Distillation Mitigate Backdoor Attacks in Pre-trained Encoders?

知识蒸馏能否缓解预训练编码器中的后门攻击?

TIngxu Han, Wei Song, Weisong Sun, Ziqi Ding, Yebo Feng, Chunrong Fang, Jun Li, Hanwei Qian, Zhenyu Chen, Yang Liu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Shenzhen Research Institute of Nanjing University(南京大学深圳研究院) School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院) School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院)

AI总结 本文提出利用知识蒸馏技术缓解预训练编码器中的后门攻击,通过提取良性知识并去除后门,显著降低攻击成功率,同时保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21968 2026-01-30 cs.CL

OVD: On-policy Verbal Distillation

OVD:在线语言蒸馏

Jing Xiong, Hui Shen, Shansan Gong, Yuxin Cheng, Jianghan Shen, Chaofan Tao, Haochen Tan, Haoli Bai, Lifeng Shang, Ngai Wong

机构 * The University of Hong Kong, Hong Kong, China(香港大学) Nanjing University, Nanjing, China(南京大学) Huawei Technologies, China(华为技术)

AI总结 OVD通过离散语言分数替代token级对齐,实现高效在线蒸馏,提升Web问答和数学推理任务的性能与训练效率。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21589 2026-01-30 cs.LG

Heterogeneity-Aware Knowledge Sharing for Graph Federated Learning

面向异质性的知识共享图联邦学习

Wentao Yu, Sheng Wan, Shuo Chen, Bo Han, Chen Gong

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology, Nanjing, China(南京理工大学计算机科学与工程学院) College of Smart Agriculture, Nanjing Agricultural University, Nanjing, China(南京农业大学智能农业学院) School of Intelligence Science and Technology, Nanjing University, Suzhou, China(南京大学智能科学与技术学院) Department of Computer Science, Hong Kong Baptist University, Hong Kong, China(香港 Baptist 大学计算机科学系) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, Shanghai, China(上海交通大学自动化与智能感知学院)

AI总结 FedSSA通过语义和结构对齐方法,解决图联邦学习中的异质性问题,提升模型性能。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19859 2026-01-30 cs.RO

Unifying Perception and Action: A Hybrid-Modality Pipeline with Implicit Visual Chain-of-Thought for Robotic Action Generation

统一感知与行动:一种融合模态的管道,具有隐式视觉推理链的机器人行动生成

Xiangkai Ma, Lekai Xing, Han Zhang, Wenzhong Li, Sanglu Lu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

AI总结 VITA通过融合视觉和动作的共享潜在空间,实现机器人行动生成的统一感知与行动,提升了多个任务的成功率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06411 2026-01-30 cs.AI cs.LG

SofT-GRPO: Surpassing Discrete-Token LLM Reinforcement Learning via Gumbel-Reparameterized Soft-Thinking Policy Optimization

SofT-GRPO:通过Gumbel-重新参数化软思考策略优化超越离散标记LLM强化学习

Zhi Zheng, Yu Gu, Wei Liu, Yee Whye Teh, Wee Sun Lee

机构 * School of Computing, National University of Singapore, Singapore(新加坡国立大学计算机学院) Department of Statistics, University of Oxford, United Kingdom(英国牛津大学统计系) School of Intelligence Science(智能科学学院) Technology, Nanjing University, China(技术学院,南京大学,中国)

AI总结 SofT-GRPO通过引入Gumbel噪声和重新参数化技巧,在软思考模式下提升LLM推理性能,使其在Pass@1和Pass@32任务中分别优于离散标记GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25262 2026-01-30 cs.LG cs.AI

IBNorm: Information-Bottleneck Inspired Normalization for Representation Learning

IBNorm: 信息瓶颈启发的表示学习规范化方法

Xiandong Zou, Jia Li, Xiaotong Yuan, Pan Zhou

机构 * Singapore Management University(新加坡管理大学) Beijing Normal University(北京师范大学) Nanjing University(南京大学)

AI总结 IBNorm基于信息瓶颈原理,通过有界压缩操作提升表示学习的信息量和稳定性,实验表明其在多种模型中优于传统规范化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14250 2026-01-30 cs.LG

Towards Anomaly-Aware Pre-Training and Fine-Tuning for Graph Anomaly Detection

面向图异常检测的异常感知预训练与微调

Yunhui Liu, Jiashun Cheng, Yiqing Lin, Qizhuo Xie, Jia Li, Fugee Tsung, Hongzhi Yin, Tao Zheng, Jianhua Zhao, Tieke He

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) HKUST(GZ)(香港科技大学(广州)) Tsinghua University(清华大学) The University of Queensland(昆士兰大学)

AI总结 本文提出APF框架,通过预训练和微调提升图异常检测的异常感知能力,结合谱多项式滤波器和门控融合机制,实现更有效的异常识别。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20120 2026-01-30 cs.CV

Rethinking Multimodal Learning from the Perspective of Mitigating Classification Ability Disproportion

从缓解分类能力失衡角度重新思考多模态学习

QingYuan Jiang, Longfei Huang, Yang Yang

机构 * Nanjing University of Science and Technology(南京理工大学) State Key Lab. for Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室)

AI总结 本文提出了一种基于提升原理的多模态学习方法,通过动态平衡弱强模态的分类能力以缓解模态不平衡问题。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20852 2026-01-29 cs.LG cs.CV

C3Box: A CLIP-based Class-Incremental Learning Toolbox

C3Box: 基于CLIP的类增量学习工具箱

Hao Sun, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学)

AI总结 C3Box是一个基于CLIP的类增量学习工具箱,整合了多种CIL方法,提供统一框架和标准化流程,提升持续学习研究的可重复性和实用性。

Comments The code is available at https://github.com/LAMDA-CL/C3Box

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20791 2026-01-29 cs.CV cs.AI

FAIRT2V: Training-Free Debiasing for Text-to-Video Diffusion Models

FAIRT2V:无需训练的文本到视频扩散模型去偏框架

Haonan Zhong, Wei Song, Tingxu Han, Maurice Pagnucco, Jingling Xue, Yang Song

机构 * School of Computer Science and Engineering, University of New South Wales, Australia.(新南威尔士大学计算机科学与工程学院,澳大利亚) State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室,中国)

AI总结 FAIRT2V通过无需训练的去偏框架减少文本到视频扩散模型中的性别偏见,通过中和提示嵌入和动态去噪计划实现,有效降低偏见同时保持视频质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19785 2026-01-29 cs.CV

GeoDiff3D: Self-Supervised 3D Scene Generation with Geometry-Constrained 2D Diffusion Guidance

GeoDiff3D: 基于几何约束的2D扩散引导的自监督3D场景生成

Haozhi Zhu, Miaomiao Zhao, Dingyao Liu, Runze Tian, Yan Zhang, Jie Guo, Fenggen Yu

机构 * Nanjing University(南京大学) Simon Fraser university(西蒙弗雷泽大学)

AI总结 GeoDiff3D通过几何约束的2D扩散模型和自监督机制,实现高效且高质量的3D场景生成,减少对标注数据的依赖,提升复杂场景的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18543 2026-01-29 cs.CV

GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning

GenAgent:通过代理多模态推理扩展文本到图像生成

Kaixun Jiang, Yuzheng Wang, Junjie Zhou, Pandeng Li, Zhihang Liu, Chen-Wei Xie, Zhaoyu Chen, Yun Zheng, Wenqiang Zhang

机构 * Fudan University(复旦大学) Tongyi Lab(通义实验室) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学)

AI总结 GenAgent通过代理多模态推理提升文本到图像生成性能,采用两阶段训练策略实现自主多轮交互与任务自适应推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19712 2026-01-28 cs.SD cs.MM

Physics-Aware Novel-View Acoustic Synthesis with Vision-Language Priors and 3D Acoustic Environment Modeling

具有视觉-语言先验和3D声学环境建模的物理感知新视角声音合成

Congyi Fan, Jian Guan, Youtian Lin, Dongli Xu, Tong Ye, Qiaoxi Zhu, Pengming Feng, Wenwu Wang

机构 * Group of Intelligent Signal Processing(智能信号处理组) Harbin Engineering University(哈尔滨工程大学) School of Intelligence Science and Technology(智能科学与技术学院) Nanjing University(南京大学) Processing Speech and Images(语音与图像处理) KU Leuven(库尔勒文大学) Acoustics Lab(声学实验室) University of Technology Sydney(悉尼技术大学) State Key Laboratory of Space Information System and Integrated Application(空间信息系统与集成应用国家重点实验室) Centre for Vision Speech and Signal Processing(视觉语音与信号处理中心) University of Surrey(萨里大学)

AI总结 Phys-NVAS通过整合视觉-语言语义先验与3D声学环境建模,实现了具有物理感知的新视角声音合成,提升了声音的真实感和物理一致性。

Comments ICASSP 2026 Accept, Project page: https://physnvas.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19278 2026-01-28 cs.CL

DART: Diffusion-Inspired Speculative Decoding for Fast LLM Inference

DART:基于扩散的推测解码用于快速大语言模型推理

Fuliang Liu, Xue Li, Ketai Zhao, Yinxi Gao, Ziyan Zhou, Zhonghui Zhang, Zhibin Wang, Wanchun Dou, Sheng Zhong, Chen Tian

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Alibaba Group(阿里巴巴集团)

AI总结 DART通过并行生成和高效树修剪算法,提升大语言模型推理速度,比EAGLE3快30%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19267 2026-01-28 cs.CL

DiaDem: Advancing Dialogue Descriptions in Audiovisual Video Captioning for Multimodal Large Language Models

DiaDem: 促进音频视频字幕中的对话描述以提升多模态大语言模型

Xinlong Chen, Weihong Lin, Jingyun Hua, Linli Yao, Yue Ding, Bozhou Li, Bohan Zeng, Yang Shi, Qiang Liu, Yuanxing Zhang, Pengfei Wan, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别新实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Peking University(北京大学) Nanjing University(南京大学)

AI总结 DiaDem通过合成高质量数据集和难度分区的两阶段GRPO策略,提升了音频视频字幕中的对话描述准确性,并在多种基准测试中表现出色。

Comments Project webpage: https://diadem-captioner.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11027 2026-01-28 cs.CV

Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning

Vlaser:具有协同具身推理能力的视觉-语言-动作模型

Ganlin Yang, Tianyi Zhang, Haoran Hao, Weiyun Wang, Yibin Liu, Dehui Wang, Guanzhou Chen, Zijian Cai, Junting Chen, Weijie Su, Wengang Zhou, Yu Qiao, Jifeng Dai, Jiangmiao Pang, Gen Luo, Wenhai Wang, Yao Mu, Zhi Hou

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Nanjing University(南京大学) Fudan University(复旦大学) Tsinghua University(清华大学) NUS(新加坡国立大学) Northeastern University(东北大学) Shenzhen University(深圳大学)

AI总结 Vlaser通过整合高级推理与低级控制,解决了具身推理与VLA策略学习之间的关键差距,在多个基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12825 2026-01-28 cs.LG stat.ML

Theoretical Investigation on Inductive Bias of Isolation Forest

对隔离森林归纳偏置的理论研究

Qin-Cheng Zheng, Shao-Qun Zhang, Shen-Huan Lyu, Yuan Jiang, Zhi-Hua Zhou

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家实验室,南京大学) School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学) School of Intelligence Science and Technology, Nanjing University, China(智能科学与技术学院,南京大学) College of Computer and Information, Hohai University, China(计算机与信息学院,河海大学) Key Laboratory of Water Resources Big Data Technology of Ministry of Water Resources, Hohai University, China(水利部水资源大数据技术重点实验室,河海大学)

AI总结 本文通过理论分析揭示了隔离森林在异常检测中的归纳偏置,指出其对中心异常的低敏感性和较高的参数适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15169 2026-01-27 cs.AI

SafeRBench: Dissecting the Reasoning Safety of Large Language Models

SafeRBench: 解析大语言模型推理安全性的本质

Xin Gao, Shaohan Yu, Zerui Chen, Yueming Lyu, Weichen Yu, Guanghao Li, Jiyao Liu, Jianxiong Gao, Jian Liang, Ziwei Liu, Chenyang Si

机构 * Nanjing University(南京大学) Fudan University(复旦大学) Carnegie Mellon University(卡内基梅隆大学) Chinese Academy of Sciences(中国科学院) Nanyang Technological University(南洋理工大学)

AI总结 SafeRBench通过端到端评估方法解析大语言模型推理过程中的安全性问题,提出风险分层探测、微思维分析和10项细粒度指标,揭示大模型在增强安全性的同时可能增加可操作风险的悖论。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02567 2026-01-27 cs.CV

Unified Multimodal Understanding and Generation Models: Advances, Challenges, and Opportunities

统一的多模态理解和生成模型:进展、挑战与机遇

Shanshan Zhao, Xinjie Zhang, Jintao Guo, Jiakui Hu, Lunhao Duan, Minghao Fu, Yong Xien Chng, Guo-Hua Wang, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang

机构 * Alibaba Group(阿里巴巴集团) Hong Kong University of Science and Technology(香港科学与技术大学) Nanjing University(南京大学) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 本文探讨了多模态理解和生成模型的统一进展、挑战与机遇,分析了不同架构范式及未来研究方向。

Comments In this version, we incorporate new papers (after Aug. 2025), datasets, and benchmarks. This work is still in progress; Github project: https://github.com/AIDC-AI/Awesome-Unified-Multimodal-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17885 2026-01-27 cs.CV cs.AI cs.RO

PEAfowl: Perception-Enhanced Multi-View Vision-Language-Action for Bimanual Manipulation

PEAfowl:感知增强的多视角视觉-语言-动作用于双臂操作

Qingyu Fan, Zhaoxiang Li, Yi Lu, Wang Chen, Qiu Shen, Xiao-xiao Long, Yinghao Cai, Tao Lu, Shuo Wang, Xun Cao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学)

AI总结 PEAfowl通过增强感知的多视角视觉-语言-动作策略,提升双臂操作在复杂环境中的稳定性和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17814 2026-01-27 cs.AI

MMR-Bench: A Comprehensive Benchmark for Multimodal LLM Routing

MMR-Bench: 多模态大语言模型路由的综合基准

Haoxuan Ma, Guannan Lai, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学)

AI总结 MMR-Bench提供多模态大语言模型路由的统一基准,通过可控环境和广泛任务集评估路由策略,实验证明多模态信号可提升路由性能并超越单模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17733 2026-01-27 cs.CV cs.GR

Flatten The Complex: Joint B-Rep Generation via Compositional $k$-Cell Particles

扁平化复杂:通过组合k-cell粒子进行联合B-Rep生成

Junran Lu, Yuanqi Li, Hengji Li, Jie Guo, Yanwen Guo

机构 * Nanjing University(南京大学)

AI总结 本文提出了一种基于组合k-cell粒子的B-Rep生成方法,通过解耦层次结构实现拓扑与几何的联合生成,提升生成模型的精度和可编辑性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17671 2026-01-27 cs.CL

Align to the Pivot: Dual Alignment with Self-Feedback for Multilingual Math Reasoning

对齐基准:双语自反馈的多语言数学推理

Chunxu Zhao, Xin Huang, Xue Han, Shujian Huang, Chao Deng, Junlan Feng

机构 * JIUTIAN Research, China Mobile, Beijing, China(JIUTIAN研究, 中国移动, 北京) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室, 南京大学)

AI总结 PASMR通过基准语言自反馈机制提升多语言数学推理能力,解决LLMs在多语言环境下的性能下降问题。

Comments This paper has been accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17301 2026-01-27 cs.LG

Tabular Foundation Models are Strong Graph Anomaly Detectors

表格基础模型是强大的图异常检测器

Yunhui Liu, Tieke He, Yongchao Liu, Can Yi, Hong Jin, Chuntao Hong

机构 * State Key Laboratory for Novel Software Technology Nanjing University Nanjing China(新型软件技术国家重点实验室 南京大学 南京 中国) State Key Laboratory for Novel Software Technology Nanjing University(新型软件技术国家重点实验室 南京大学)

AI总结 本文提出TFM4GAD,利用表格基础模型解决图异常检测问题,通过增强特征表和上下文学习提升跨领域泛化能力。

Comments Accepted by WWW 2026 (Short Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14746 2026-01-27 cs.LG

RefProtoFL: Communication-Efficient Federated Learning via External-Referenced Prototype Alignment

RefProtoFL:通过外部参考原型对齐实现高效的联邦学习

Hongyue Wu, Hangyu Li, Guodong Fan, Haoran Zhu, Shizhan Chen, Zhiyong Feng

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学) State Key Lab. for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Yunnan Key Lab. of Service Computing, Yunnan University of Finance and Economics(云南服务计算重点实验室,云南财经大学)

AI总结 RefProtoFL通过外部参考原型对齐和自适应概率更新丢弃技术,实现高效联邦学习,提升异构客户端下的分类准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.06400 2026-01-27 cs.CV

PyMAF-X: Towards Well-aligned Full-body Model Regression from Monocular Images

PyMAF-X:迈向从单目图像中恢复对齐的完整身体模型

Hongwen Zhang, Yating Tian, Yuxiang Zhang, Mengcheng Li, Liang An, Zhenan Sun, Yebin Liu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Department of Computer Science and Technology, Nanjing University(计算机科学与技术系,南京大学) Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)

AI总结 PyMAF-X通过改进的回归方法实现从单目图像中准确恢复对齐的完整身体模型,提升了网格与图像的对齐性能。

Comments Article in IEEE TPAMI 2023, Update project page: https://zhanghongwen.cn/pymaf-x, An eXpressive extension of PyMAF [arXiv:2103.16507] for monocular human/hand/face/whole-body motion capture

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10759 2026-01-26 stat.ML cs.LG

Mass Distribution versus Density Distribution in the Context of Clustering

密度分布与质量分布在聚类中的对比

Kai Ming Ting, Ye Zhu, Hang Zhang, Tianrun Liang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China 210023(新型软件技术国家重点实验室,南京大学,中国) School of Artificial Intelligence, Nanjing University, Nanjing, China 210023(人工智能学院,南京大学,南京,中国) School of IT, Deakin University, Geelong, Australia 3125(信息技术学院,德金大学,Geelong,澳大利亚)

AI总结 本文提出质量最大化聚类算法,用于克服密度分布的高密度偏见问题,以发现任意形状和密度的聚类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15240 2026-01-22 cs.SD eess.AS

WeDefense: A Toolkit to Defend Against Fake Audio

WeDefense:一种用于对抗假音频的工具包

Lin Zhang, Johan Rohdin, Xin Wang, Junyi Peng, Tianchi Liu, You Zhang, Hieu-Thi Luong, Shuai Wang, Chengdong Liang, Anna Silnova, Nicholas Evans

机构 * Johns Hopkins University(约翰霍普金斯大学) Brno University of Technology(布拉格技术大学) National Institute of Informatics(国家信息研究所) National University of Singapore(新加坡国立大学) University of Rochester(罗切斯特大学) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) WeNet Opensource Community(WeNet开源社区) EURECOM

AI总结 WeDefense是一个开源工具包,旨在提供标准化的假音频检测与定位解决方案,包含灵活的输入增强、校准、分数融合和标准化评估指标等核心功能。

Comments This is an ongoing work. v1 corresponds to the version completed by June 4, 2025 and previously submitted to ASRU 2025

详情

展开后加载摘要…

URL PDF HTML 收藏