arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

共收录 2400
2512.22780 2025-12-30 cs.CV eess.IV

Plug In, Grade Right: Psychology-Inspired AGIQA

插入选项,正确评分:心理学启发的AGIQA

Zhicheng Liao, Baoliang Chen, Hanwei Zhu, Lingyu Zhu, Shiqi Wang, Weisi Lin

机构 * School of Computer Science, South China Normal University(南方科技大学计算机科学学院) School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院) School of Computer Science, City University of Hong Kong(香港城市大学计算机科学学院)

AI总结 基于心理学的AGIQA模型通过改进的分级响应模型提升图像质量评分的准确性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22664 2025-12-30 cs.CV cs.AI

Unleashing Foundation Vision Models: Adaptive Transfer for Diverse Data-Limited Scientific Domains

释放基础视觉模型:面向多样化数据受限科学领域的自适应迁移

Qiankun Li, Feng He, Huabao Chen, Xin Ning, Kun Wang, Zengfu Wang

机构 * University of Science and Technology of China(中国科学技术大学) AnnLab, Institute of Semiconductors, Chinese Academy of Sciences(中国科学院半导体研究所) Nanyang Technological University(南洋理工大学)

AI总结 本文提出CLAdapter,通过自适应迁移技术提升基础视觉模型在数据受限科学领域中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22630 2025-12-30 cs.CL

On the Role of Discreteness in Diffusion LLMs

扩散语言模型中离散性的作用

Ziqi Jin, Bin Wang, Xiang Lin, Lidong Bing, Aixin Sun

机构 * MiroMind AI Nanyang Technological University(南洋理工大学)

AI总结 本文探讨了扩散语言模型中离散性的重要性,指出现有方法在结构权衡上的不足,并提出了更符合文本结构的扩散过程改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10704 2025-12-30 cs.CV cs.MM

Error Analyses of Auto-Regressive Video Diffusion Models: A Unified Framework

自回归视频扩散模型的误差分析:一个统一的框架

Jing Wang, Fengzhuo Zhang, Xiaoli Li, Vincent Y. F. Tan, Tianyu Pang, Chao Du, Aixin Sun, Zhuoran Yang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Singapore University of Technology and Design(新加坡科技设计大学) Sea AI Lab(海思人工智能实验室) Yale University(耶鲁大学)

AI总结 本文提出Meta-ARVDM框架,通过分析自回归视频扩散模型的历史遗忘与时间退化现象,揭示其理论机制并提出新的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22118 2025-12-29 cs.CV

ProEdit: Inversion-based Editing From Prompts Done Right

ProEdit: 通过正确提示实现基于反向的编辑

Zhi Ouyang, Dian Zheng, Xiao-Ming Wu, Jian-Jian Jiang, Kun-Yu Lin, Jingke Meng, Wei-Shi Zheng

机构 * Sun Yat-sen University(中山大学) CUHK MMLab(香港中文大学MMLab) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) The University of Hong Kong(香港大学) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(中国教育部机器智能与高级计算重点实验室)

AI总结 ProEdit通过改进注意力和潜在领域,实现更稳定的基于反向的编辑,能有效提升图像和视频编辑的性能和一致性。

Comments Equal contributions from first two authors. Project page: https://isee-laboratory.github.io/ProEdit/ Code: https://github.com/iSEE-Laboratory/ProEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21883 2025-12-29 cs.CV

Reloc-VGGT: Visual Re-localization with Geometry Grounded Transformer

Reloc-VGGT: 基于几何基础的变换器视觉重定位

Tianchen Deng, Wenhua Wu, Kunzhen Wu, Guangming Wang, Siting Zhu, Shenghai Yuan, Xun Chen, Guole Shen, Zhe Liu, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Cambridge University(剑桥大学)

AI总结 Reloc-VGGT通过早期融合机制和稀疏掩码注意力策略,实现高效多视图空间整合,提升复杂环境下的视觉定位准确性和实时性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21220 2025-12-29 cs.AI cs.CV cs.RO

RoboSafe: Safeguarding Embodied Agents via Executable Safety Logic

RoboSafe: 通过可执行的安全逻辑保障具身智能体

Le Wang, Zonghao Ying, Xiao Yang, Quanchen Zou, Zhenfei Yin, Tianlin Li, Jian Yang, Yaodong Yang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航大学) AI Security Lab(360AI安全实验室) The University of Sydney(悉尼大学) Nanyang Technological University(南洋理工大学) Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 RoboSafe通过可执行的安全逻辑保障具身智能体,减少危险行为并保持任务性能。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21185 2025-12-29 cs.CV cs.GR

UltraShape 1.0: High-Fidelity 3D Shape Generation via Scalable Geometric Refinement

UltraShape 1.0:通过可扩展的几何细化实现高保真的3D形状生成

Tanghui Jia, Dongyu Yan, Dehao Hao, Yang Li, Kaiyi Zhang, Xianyi He, Lanjiong Li, Yuhan Wang, Jinnan Chen, Lutao Jiang, Qishen Yin, Long Quan, Ying-Cong Chen, Li Yuan

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) The Hong Kong University of Science(香港科学大学) National University of Singapore(新加坡国立大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

AI总结 UltraShape 1.0通过可扩展的几何细化方法实现高质量3D形状生成,采用两阶段流程提升几何质量,支持公开数据集的精细化处理。

Comments 14 pages, 10 figures, Technical Report,

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21699 2025-12-29 cs.AI

Towards Responsible and Explainable AI Agents with Consensus-Driven Reasoning

迈向负责任和可解释的AI代理:基于共识驱动的推理

Eranga Bandara, Tharaka Hewa, Ross Gore, Sachin Shetty, Ravi Mukkamala, Peter Foytik, Abdul Rahman, Safdar H. Bouk, Xueping Liang, Amin Hass, Sachini Rajapakse, Ng Wee Keong, Kasun De Zoysa, Aruna Withanage, Nilaan Loganathan

机构 * Old Dominion University, Norfolk, VA, USA(老奥本大学) Center for Wireless Communications, University of Oulu, Finland(无线通信中心,奥卢大学) Florida International University, USA(佛罗里达国际大学) Nanyang Technological University, Singapore(南洋理工大学) University of Colombo, Sri Lanka(科伦坡大学) Accenture Technology Labs, Arlington, VA, USA(Accenture技术实验室)

AI总结 本文提出了一种基于多模型共识和推理层治理的负责任和可解释的AI代理架构,通过结构化整合不同模型的输出以提升系统鲁棒性、透明度和责任性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21596 2025-12-29 cs.PL cs.FL cs.LG cs.LO cs.SC

Quantitative Verification of Omega-regular Properties in Probabilistic Programming

在概率编程中进行omega-正则性质的定量验证

Peixin Wang, Jianhao Bai, Min Zhang, C. -H. Luke Ong

机构 * East China Normal University, China(华东师范大学) Nanyang Technological University, Singapore(南洋理工大学)

AI总结 本文提出时间后验推断框架,用于在概率编程中定量验证omega-正则性质,通过分解Rabin条件并构建随机屏障证书,实现对概率行为的高效推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21482 2025-12-29 cs.AI

LogicLens: Visual-Logical Co-Reasoning for Text-Centric Forgery Analysis

LogicLens:面向文本导向伪造分析的视觉-逻辑协同推理

Fanwei Zeng, Changtao Miao, Jing Huang, Zhiya Tan, Shutao Gong, Xiaoming Yu, Yang Wang, Huazhe Tan, Weibin Yao, Jianshu Li

机构 * Ant Group(蚂蚁集团) Nanyang Technological University(南洋理工大学)

AI总结 LogicLens通过视觉-逻辑协同推理框架,提升文本导向伪造分析的准确性和鲁棒性,其在多个基准测试中表现优异。

Comments 11 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21338 2025-12-29 cs.CV

HiStream: Efficient High-Resolution Video Generation via Redundancy-Eliminated Streaming

HiStream: 通过消除冗余的流式传输实现高效的高分辨率视频生成

Haonan Qiu, Shikun Liu, Zijian Zhou, Zhaochong An, Weiming Ren, Zhiheng Liu, Jonas Schult, Sen He, Shoufa Chen, Yuren Cong, Tao Xiang, Ziwei Liu, Juan-Manuel Perez-Rua

机构 * Meta AI Nanyang Technological University(南洋理工大学)

AI总结 HiStream通过空间、时间及时间步压缩优化,实现高分辨率视频生成的高效去噪,相比基线模型提升107.5倍速度并保持高质量。

Comments Project Page: http://haonanqiu.com/projects/HiStream.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14537 2025-12-29 cs.CV

Personalize Your Gaussian: Consistent 3D Scene Personalization from a Single Image

为Gaussian个性化:从单张图像实现一致的3D场景个性化

Yuxuan Wang, Xuanyu Yi, Qingshan Xu, Yuan Zhou, Long Chen, Hanwang Zhang

机构 * Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 本文提出CP-GS框架,通过逐步传播单视角参考外观到新视角,有效缓解视角偏差,实现高质量3D场景个性化。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21236 2025-12-25 cs.CR cs.AI cs.SE

Casting a SPELL: Sentence Pairing Exploration for LLM Limitation-breaking

为LLM突破限制而探索句子配对:恶意代码生成的测试框架

Yifan Huang, Xiaojun Jia, Wenbo Guo, Yuqiang Sun, Yihao Huang, Chong Wang, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学)

AI总结 SPELL框架通过智能句子配对探索LLM在恶意代码生成中的安全漏洞,有效提升对抗测试效果。

Comments Accepted to FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21133 2025-12-25 cs.RO

SparScene: Efficient Traffic Scene Representation via Sparse Graph Learning for Large-Scale Trajectory Generation

SparScene: 通过稀疏图学习实现大规模轨迹生成的高效交通场景表示

Xiaoyu Mo, Jintian Ge, Zifan Wang, Chen Lv, Karl Henrik Johansson

机构 * Division of Decision and Control Systems, School of Electrical Engineering and Computer Science, KTH Royal Institute of Technology(决策与控制系统系,电气工程与计算机科学学院,皇家理工学院) iFLYTEK Co., Ltd.(iFLYTEK公司) School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院,南洋理工大学)

AI总结 SparScene通过稀疏图学习实现高效交通场景表示,显著提升大规模轨迹生成的效率和可扩展性。

Comments 13 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20556 2025-12-24 cs.CV

Multi-Grained Text-Guided Image Fusion for Multi-Exposure and Multi-Focus Scenarios

多粒度文本引导图像融合用于多曝光和多聚焦场景

Mingwei Tang, Jiahao Nie, Guang Yang, Ziqing Cui, Jie Li

机构 * Xidian University(西安电子科技大学) Nanyang Technological University(新加坡国立大学) Xi’an University of Technology(西安理工大学)

AI总结 本文提出MTIF方法,通过多粒度文本描述和跨模态调节模块提升多曝光和多聚焦图像融合性能。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20224 2025-12-24 cs.RO

UrbanV2X: A Multisensory Vehicle-Infrastructure Dataset for Cooperative Navigation in Urban Areas

UrbanV2X: 一种用于城市区域协同导航的多感官车辆-基础设施数据集

Qijun Qin, Ziqi Zhang, Yihan Zhong, Feng Huang, Xikun Liu, Runzhi Hu, Hang Chen, Wei Hu, Dongzhe Su, Jun Zhang, Hoi-Fung Ng, Weisong Wen

机构 * Department of Aeronautical and Aviation Engineering, The Hong Kong Polytechnic University(航空与航空工程系,香港理工大学) Hong Kong Applied Science and Technology Research Institute (ASTRI)(香港应用科学和技术研究院) Nanyang Technological University(南洋理工大学)

AI总结 UrbanV2X数据集通过多感官数据支持城市区域的协同导航研究,包含车辆和基础设施的同步传感器数据及算法评估

Comments 8 pages, 9 figures, IEEE ITSC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19731 2025-12-24 cs.LG cs.CV

Exploring Deep-to-Shallow Transformable Neural Networks for Intelligent Embedded Systems

探索用于智能嵌入式系统的深度到浅层可转换神经网络

Xiangzhong Luo, Weichen Liu

机构 * School of Computer Science and Engineering, Southeast University (SEU)(东南大学计算机科学与工程学院) College of Computing and Data Science, Nanyang Technological University (NTU)(南洋理工大学计算机科学与数据科学学院)

AI总结 Double-Win NAS通过深度到浅层可转换神经网络搜索提升嵌入式系统的精度与硬件效率。

Comments Accepted by IEEE Transactions on Computer-Aided Design of Integrated Circuits and Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19730 2025-12-24 cs.LG cs.CR

ArcGen: Generalizing Neural Backdoor Detection Across Diverse Architectures

ArcGen: 在多样架构上实现神经后门检测的泛化

Zhonghao Yang, Cheng Luo, Daojing He, Yiming Li, Yu Li

机构 * Software Engineering Institute, East China Normal University(东华大学软件工程学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) Nanyang Technological University(南洋理工大学) College of Integrated Circuits, Zhejiang University(浙江大学集成电路学院)

AI总结 ArcGen通过引入对齐层和损失函数,提升神经后门检测在不同架构上的泛化能力,实现42.5%的性能提升。

Comments 16 pages, 8 figures. This article was accepted by IEEE Transactions on Information Forensics and Security. DOI: 10.1109/TIFS.2025.3610254

Journal ref in IEEE Transactions on Information Forensics and Security, vol. 20, pp. 10082-10097, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08151 2025-12-24 cs.AI

Trust Semantics Distillation for Collaborator Selection via Memory-Augmented Agentic AI

基于记忆增强代理AI的信任语义蒸馏用于协作者选择

Botao Zhu, Jeslyn Wang, Dusit Niyato, Xianbin Wang

机构 * Western University(西方大学) University of Toronto(多伦多大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出基于记忆增强代理AI的任务特定信任语义蒸馏模型,通过教师-学生架构实现高效协作者选择,提升信任评估的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02824 2025-12-24 cs.CV cs.AI cs.CR

Towards Dataset Copyright Evasion Attack against Personalized Text-to-Image Diffusion Models

面向个性化文本到图像扩散模型的数据集版权规避攻击

Kuofeng Gao, Yufei Zhu, Yiming Li, Jiawang Bai, Yong Yang, Zhifeng Li, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Peng Cheng Laboratory(鹏城实验室) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Nanyang Technological University(南洋理工大学) Tencent(腾讯)

AI总结 本文提出CEAT2I,一种针对文本到图像扩散模型中数据集版权验证机制的版权规避攻击方法,通过检测水印样本、识别触发令牌和移除水印三阶段实现绕过验证。

Comments Accepted by IEEE Transactions on Information Forensics and Security

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06050 2025-12-24 cs.CV cs.RO

Incremental Joint Learning of Depth, Pose and Implicit Scene Representation on Monocular Camera in Large-scale Scenes

单目相机在大规模场景中增量联合学习深度、姿态和隐式场景表示

Tianchen Deng, Nailin Wang, Chongdi Wang, Shenghai Yuan, Jingchuan Wang, Hesheng Wang, Danwei Wang, Weidong Chen

机构 * Institute of Medical Robotics and Department of Automation, Shanghai Jiao Tong University(上海交通大学医学机器人研究所和自动化系) Key Laboratory of System Control and Information Processing, Ministry of Education, Shanghai(系统控制与信息处理重点实验室,教育部,上海) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院)

AI总结 本文提出了一种增量联合学习框架,通过视觉Transformer提升大规模场景的深度、姿态估计和隐式场景表示能力。

Journal ref IEEE Transactions on Automation Science and Engineering, vol. 22, pp. 22541-22552, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19539 2025-12-23 cs.CV

StoryMem: Multi-shot Long Video Storytelling with Memory

StoryMem: 基于记忆的多镜头长视频叙事

Kaiwen Zhang, Liming Jiang, Angtian Wang, Jacob Zhiyuan Fang, Tiancheng Zhi, Qing Yan, Hao Kang, Xin Lu, Xingang Pan

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室)

AI总结 StoryMem通过基于记忆的迭代镜头合成,实现了高质量多镜头视频叙事,提升了跨镜头一致性与审美质量。

Comments Project page: https://kevin-thu.github.io/StoryMem

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19537 2025-12-23 cs.CL

Event Extraction in Large Language Model

大规模语言模型中的事件提取

Bobo Li, Xudong Han, Jiang Liu, Yuzhe Ding, Liqiang Jing, Zhaoqi Zhang, Jinheng Li, Xinya Du, Fei Li, Meishan Zhang, Min Zhang, Aixin Sun, Philip S. Yu, Hao Fei

机构 * National University of Singapore(新加坡国立大学) University of Sussex(苏塞克斯大学) Wuhan University(武汉大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) Nanyang Technological University(南洋理工大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) University of Illinois at Chicago(伊利诺伊大学香槟分校)

AI总结 本文探讨了大规模语言模型中事件提取的系统组件,提出通过事件方案、结构和存储提升事件处理的可靠性与智能体准备性。

Comments 38 pages, 9 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.20034 2025-12-23 cs.CV cs.RO

NeSLAM: Neural Implicit Mapping and Self-Supervised Feature Tracking With Depth Completion and Denoising

NeSLAM: 基于深度补全与去噪的神经隐式映射与自监督特征跟踪

Tianchen Deng, Yanbo Wang, Hongle Xie, Hesheng Wang, Jingchuan Wang, Danwei Wang, Weidong Chen

机构 * Institute of Medical Robotics and Department of Automation, Shanghai Jiao Tong University(上海交通大学医疗机器人研究所和自动化系) Key Laboratory of System Control and Information Processing, Ministry of Education, Shang hai 200240, China(教育部系统控制与信息处理重点实验室,上海200240,中国) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院)

AI总结 NeSLAM通过深度补全与去噪网络和SDF表示,实现高精度的3D重建、鲁棒的相机跟踪和视点合成。

Journal ref IEEE Transactions on Automation Science and Engineering, vol. 22, pp. 12309-12321, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18386 2025-12-23 cs.CV

RecurGS: Interactive Scene Modeling via Discrete-State Recurrent Gaussian Fusion

RecurGS: 通过离散状态递归高斯融合实现交互式场景建模

Wenhao Hu, Haonan Zhou, Zesheng Li, Liu Liu, Jiacheng Dong, Zhizhong Su, Gaoang Wang

机构 * Zhejiang University(浙江大学) Horizon Robotics Nanyang Technological University(南洋理工大学)

AI总结 RecurGS通过递归融合框架实现离散状态的交互式场景建模,提升3D环境的更新效率和逼真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17932 2025-12-23 eess.AS cs.SD

Continual Learning for Acoustic Event Classification

连续学习用于音频事件分类

Yang Xiao

机构 * School of Computer Science and Engineering(计算机科学与工程学院) NANYANG TECHNOLOGICAL UNIVERSITY(南洋理工大学)

AI总结 本研究提出了一种基于多样性意识的增量学习方法,用于设备端音频事件分类,有效解决灾难性遗忘问题,提升分类准确率和计算效率。

Comments Master project report

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14757 2025-12-23 cs.SE cs.AI

SWE-Synth: Synthesizing Verifiable Bug-Fix Data to Enable Large Language Models in Resolving Real-World Bugs

SWE-Synth:合成可验证的bug修复数据以使大语言模型能够解决现实中的bug

Minh V. T. Pham, Huy N. Phan, Hoang N. Phan, Cuong Le Chi, Tien N. Nguyen, Nghi D. Q. Bui

机构 * FPT Software AI Center, Viet Nam(越南FPT软件AI中心) Nanyang Technological University, Singapore(新加坡南洋理工大学) University of Texas at Dallas, US(美国德克萨斯大学达拉斯分校)

AI总结 SWE-Synth通过合成可验证的bug修复数据集,提升大语言模型在解决现实bug中的性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01431 2025-12-23 cs.LG cs.AI

Efficient Deep Learning Infrastructures for Embedded Computing Systems: A Comprehensive Survey and Future Envision

面向嵌入式计算系统的高效深度学习基础设施:全面综述与未来展望

Xiangzhong Luo, Di Liu, Hao Kong, Shuo Huai, Hui Chen, Guochu Xiong, Weichen Liu

机构 * Nanyang Technological University(南洋理工大学) Norwegian University of Science and Technology(挪威科学技术大学)

AI总结 本文综述了面向嵌入式计算系统的高效深度学习基础设施,涵盖从训练到推理、从手动到自动化、从卷积神经网络到大语言模型的多种方法,旨在缩小计算资源差距以实现无处不在的嵌入式智能。

Comments ACM Transactions on Embedded Computing Systems (TECS) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16442 2025-12-22 cs.CV cs.AI

EDVD-LLaMA: Explainable Deepfake Video Detection via Multimodal Large Language Model Reasoning

EDVD-LLaMA: 通过多模态大语言模型推理进行可解释的深度伪造视频检测

Haoran Sun, Chen Cai, Huiping Zhuang, Kong Aik Lee, Lap-Pui Chau, Yi Wang

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(电子与电气工程系,香港理工大学) School of Electrical and Electronic Engineering, Nanyang Technological University(电子与电气工程学院,南洋理工大学) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(智能工程学院,华南理工大学)

AI总结 EDVD-LLaMA通过多模态大语言模型推理实现深度伪造视频检测的可解释性,结合时空特征提取和细粒度推理机制,提升检测准确性与解释可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏