arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

共收录 2393
2603.17436 2026-03-19 cs.LG cs.AI

TimeAPN: Adaptive Amplitude-Phase Non-Stationarity Normalization for Time Series Forecasting

TimeAPN: 用于时间序列预测的自适应幅度-相位非平稳归一化

Yue Hu, Jialiang Tang, Siwei Yu, Baosheng Yu, Jing Zhang, Dacheng Tao

机构 * School of Mathematics, Harbin Institute of Technology(哈尔滨工业大学数学学院) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李科钦医学院) School of Computer Science, Wuhan University(武汉大学计算机学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 本文提出TimeAPN框架,通过时间与频率域联合建模和预测非平稳因素,结合自适应归一化机制提升长周期时间序列预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17420 2026-03-19 cs.AI

From Digital Twins to World Models:Opportunities, Challenges, and Applications for Mobile Edge General Intelligence

从数字孪生到世界模型:移动边缘通用智能的机会、挑战与应用

Jie Zheng, Dusit Niyato, Changyuan Zhao, Jiawen Kang, Jiacheng Wang

机构 * State-Province Joint Engineering and Research Center of Advanced Networking and Intelligent Information Services, College of Computer, Northwest University(高级网络与智能信息服务省州联合工程研究中心,计算机学院,西北大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) Automation of School, Guangdong University of Technology(自动化学院,广东工业大学)

AI总结 本文探讨了从数字孪生到世界模型的转变,分析了其在移动边缘通用智能中的作用,涵盖概念差异、设计原则、关键组件及应用挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17368 2026-03-19 cs.AI

Towards Safer Large Reasoning Models by Promoting Safety Decision-Making before Chain-of-Thought Generation

通过在链式思考生成前促进安全决策来构建更安全的大推理模型

Jianan Chen, Zhifang Zhang, Shuo He, Linan Yue, Lei Feng, Minling Zhang

机构 * Southeast University, China(东南大学,中国) The University of Queensland, Australia(昆士兰大学,澳大利亚) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

AI总结 本文提出在链式思考生成前促进安全决策的方法,提升大推理模型的安全性同时保持推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17351 2026-03-19 cs.RO

OmniVLN: Omnidirectional 3D Perception and Token-Efficient LLM Reasoning for Visual-Language Navigation across Air and Ground Platforms

OmniVLN:面向空和地面平台的全方位3D感知与高效token LLM推理的视觉语言导航

Zhongyuang Liu, Min He, Shaonan Yu, Xinhang Xu, Muqing Cao, Jianping Li, Jianfei Yang, Lihua Xie

机构 * CertaintyX School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 OmniVLN结合全方位3D感知与高效token分层推理,提升空和地面机器人在复杂环境中的视觉语言导航能力,提升空间指认准确率并减少token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16927 2026-03-19 cs.CV eess.IV

Leveraging Large Vision Model for Multi-UAV Co-perception in Low-Altitude Wireless Networks

利用大型视觉模型实现低空无线网络中多无人机协同感知

Yunting Xu, Jiacheng Wang, Ruichen Zhang, Changyuan Zhao, Yinqiu Liu, Dusit Niyato, Liang Yu, Haibo Zhou, Dong In Kim

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) Alibaba Cloud(阿里云) School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与技术学院) Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电子与计算机工程系)

AI总结 本文提出一种通信高效的多无人机协同感知框架BHU,通过Top-K选择机制和Swin-large-based MaskDINO编码器提升感知性能,同时利用深度强化学习优化协作无人机选择和资源分配,实验表明在资源受限环境下感知性能提升超5%且通信开销降低85%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16301 2026-03-19 cs.RO

OGScene3D: Incremental Open-Vocabulary 3D Gaussian Scene Graph Mapping for Scene Understanding

OGScene3D: 增量式开放词汇3D高斯场景图映射用于场景理解

Siting Zhu, Ziyun Lu, Guangming Wang, Chenguang Huang, Yongbo Chen, I-Ming Chen, Wolfram Burgard, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Cambridge(剑桥大学) University of Technology Nuremberg(纽伦堡技术大学) Nanyang Technological University(南洋理工大学) Department of Automation, Key Laboratory of System Control and Information Processing of Ministry of Education, State Key Laboratory of Avionics Integration and Aviation System-of-Systems Synthesis, Shanghai Key Laboratory of Navigation and Location Based Services, Shanghai Jiao Tong University(自动化系,教育部系统控制与信息处理重点实验室,航空系统集成与航空系统-of-系统综合国家重点实验室,上海导航与定位基于服务重点实验室,上海交通大学)

AI总结 OGScene3D通过增量式3D高斯场景图映射,实现开放词汇场景理解,结合高斯表示与层次优化策略,提升语义一致性与长期优化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13293 2026-03-19 cs.CV eess.IV

NutVLM: A Self-Adaptive Defense Framework against Full-Dimension Attacks for Vision Language Models in Autonomous Driving

NutVLM: 一种针对自动驾驶中视觉语言模型全维度攻击的自适应防御框架

Xiaoxu Peng, Dong Zhou, Jianwen Zhang, Guanghui Sun, Anh Tu Ngo, Anupam Chattopadhyay

机构 * Department of Control Science and Engineering, Harbin Institute of Technology(控制科学与工程系,哈尔滨工业大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

AI总结 本文提出NutVLM框架,通过NutNet++ sentinel检测并净化良性样本、局部修补和全局扰动,结合高效灰度遮蔽和专家引导的对抗提示调优,提升自动驾驶中视觉语言模型的鲁棒性与性能。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05186 2026-03-19 cs.RO cs.CV

Learning to See and Act: Task-Aware Virtual View Exploration for Robotic Manipulation

学习感知与行动:面向机器人操作的任务感知虚拟视角探索

Yongjie Bai, Zhouxia Wang, Yang Liu, Kaijun Luo, Yifan Wen, Mingtong Dai, Weixing Chen, Ziliang Chen, Lingbo Liu, Guanbin Li, Liang Lin

机构 * Sun Yat-sen University(中山大学) Pengcheng Laboratory(鹏城实验室) Nanyang Technological University(南洋理工大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) X-Era AI Lab(X-Era AI实验室)

AI总结 本文提出TVVE框架,通过动态选择任务相关虚拟视角和重构场景表示,提升机器人操作在遮挡和跨任务迁移中的性能,实验验证其鲁棒性。

Comments 24 pages, 15 figures, Project page: https://hcplab-sysu.github.io/TAVP, Code: https://github.com/HCPLab-SYSU/TAVP.git, Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16669 2026-03-18 cs.RO cs.CV

Kinema4D: Kinematic 4D World Modeling for Spatiotemporal Embodied Simulation

Kinema4D: 用于空间时间具身模拟的运动学4D世界建模

Mutian Xu, Tianbao Zhang, Tianqi Liu, Zhaoxi Chen, Xiaoguang Han, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab) SSE, CUHKSZ(香港中文大学深圳校区SSE)

AI总结 本文提出Kinema4D,一种基于动作条件的4D生成机器人模拟器,通过精确的4D机器人控制表示和环境反应的生成建模,实现了高精度的空间时间交互模拟,并首次展示零样本迁移能力。

Comments Project page: https://mutianxu.github.io/Kinema4D-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16459 2026-03-18 cs.CL

DynHD: Hallucination Detection for Diffusion Large Language Models via Denoising Dynamics Deviation Learning

DynHD: 通过去噪动态偏差学习检测扩散大语言模型的幻觉

Yanyu Qian, Yue Tan, Yixin Liu, Wang Yu, Shirui Pan

机构 * Nanyang Technological University, Singapore(新加坡南洋理工大学) Griffith University, Australia(澳大利亚格里菲斯大学)

AI总结 本文提出DynHD,通过空间和时间视角解决扩散大语言模型幻觉检测中的信息密度不均和去噪动态建模问题,采用语义感知证据构造模块和偏差检测器提升检测性能。

Comments 15 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16099 2026-03-18 cs.CV

OneWorld: Taming Scene Generation with 3D Unified Representation Autoencoder

OneWorld: 通过3D统一表示自编码器驯服场景生成

Sensen Gao, Zhaoqing Wang, Qihang Cao, Dongdong Yu, Changhu Wang, Tongliang Liu, Mingming Gong, Jiawang Bian

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·泽亚德人工智能大学) AISphere Shanghai Jiao Tong University(上海交通大学) University of Melbourne(墨尔本大学) Nanyang Technological University(南洋理工大学)

AI总结 OneWorld通过3D统一表示自编码器直接在3D空间中进行扩散,解决跨视角一致性和几何一致性问题,实验表明其生成的3D场景质量优于现有2D方法。

Comments Code: https://github.com/SensenGao/OneWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15921 2026-03-18 cs.SE cs.AI

VIBEPASS: Can Vibe Coders Really Pass the Vibe Check?

VIBEPASS:振动编码器真的能通过振动检查吗?

Srijan Bansal, Jiao Fangkai, Yilun Zhou, Austin Xu, Shafiq Joty, Semih Yavuz

机构 * Salesforce AI Research(Salesforce AI研究院) Nanyang Technological University(南洋理工大学)

AI总结 本文研究了振动编码器在自主软件工程中的能力,发现故障定位推理是瓶颈,而非代码生成或测试有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13397 2026-03-18 cs.CV

TennisExpert: Towards Expert-Level Analytical Sports Video Understanding

TennisExpert: 向专家级分析体育视频理解迈进

Zhaoyu Liu, Xi Weng, Lianyu Hu, Zhe Hou, Kan Jiang, Jin Song Dong, Yang Liu

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Griffith University(格里菲斯大学)

AI总结 本文提出TennisExpert框架,通过整合视频语义解析器和基于Qwen3-VL-8B的记忆增强模型,实现高效多模态网球理解,提升战术分析和比赛动态捕捉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21435 2026-03-18 cs.CV

Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking

融合理解与生成的交错分析-草稿思维

Shengqiong Wu, Bobo Li, Xinkai Wang, Xiangtai Li, Lei Cui, Furu Wei, Shuicheng Yan, Hao Fei, Tat-seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学) Microsoft Research(微软研究院)

AI总结 本文提出AD-Loop机制,通过交错分析与草稿操作提升视觉语言模型的理解与生成能力,实验表明其在多个基准测试中表现优异,具备良好的迁移性。

Comments 28 pages, 17 figures, 6 tables, ICLR conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06698 2026-03-18 cs.RO

Crowd-FM: Learned Optimal Selection of Conditional Flow Matching-generated Trajectories for Crowd Navigation

Crowd-FM: 基于学习的条件流匹配生成轨迹的最优选择用于人群导航

Antareep Singha, Laksh Nanwani, Mathai Mathew P., Samkit Jain, Phani Teja Singamaneni, Arun Kumar Singh, K. Madhava Krishna

机构 * Robotics Research Center, IIIT Hyderabad, India(IIIT海得拉巴机器人研究中心,印度) Nanyang Technological University, Singapore(新加坡南洋理工大学) University of Tartu, Estonia(爱沙尼亚塔尔图大学) Inria, Université de Lorraine, France(法国里尔大学Inria研究院)

AI总结 本文提出Crowd-FM方法,通过条件流匹配学习碰撞自由的轨迹生成策略,提升机器人在人群中的安全性和人似性。

Comments Accepted at IEEE ICRA 2026. Authors Antareep Singha and Laksh Nanwani have equal contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10376 2026-03-18 cs.CV cs.RO

MSGNav: Unleashing the Power of Multi-modal 3D Scene Graph for Zero-Shot Embodied Navigation

MSGNav: 释放多模态3D场景图在零样本具身导航中的潜力

Xun Huang, Shijia Zhao, Yunxiang Wang, Xin Lu, Wanfa Zhang, Rongsheng Qu, Weixin Li, Yunhong Wang, Chenglu Wen

机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing(福建智能感知与计算重点实验室) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(多媒体可信感知与高效计算重点实验室) Beihang University(北航) Nanyang Technological University(南洋理工大学) University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Academy(中关村学院)

AI总结 MSGNav通过多模态3D场景图实现零样本具身导航,引入关键子图选择模块、自适应词汇更新模块和闭环推理模块,解决开放词汇和视觉证据保留问题,实验表明其在GOAT-Bench和HM3D-ObjNav基准上表现优异。

Comments 18 pages, Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19596 2026-03-18 eess.SP cs.LG

Towards Robust Multimodal Physiological Foundation Models: Handling Arbitrary Missing Modalities

迈向稳健的多模态生理基础模型:处理任意缺失模态

Wei-Bang Jiang, Xi Fu, Yi Ding, Cuntai Guan

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出PhysioOmni模型,通过解耦多模态信号提取通用表示,解决现有方法在跨数据集泛化和缺失模态处理上的不足,实验显示其在情绪识别等任务中表现优异。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09037 2026-03-18 cs.AI cs.CL

A Survey of Frontiers in LLM Reasoning: Inference Scaling, Learning to Reason, and Agentic Systems

大语言模型推理前沿的综述:推理扩展、学习推理与代理系统

Zixuan Ke, Fangkai Jiao, Yifei Ming, Xuan-Phi Nguyen, Austin Xu, Do Xuan Long, Minzhi Li, Chengwei Qin, Peifeng Wang, Silvio Savarese, Caiming Xiong, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI研究) National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) A*STAR, Singapore(新加坡A*STAR)

AI总结 本文综述了大语言模型推理的前沿方法,从推理阶段和架构两个维度分类,探讨了推理扩展到学习推理及代理系统的发展趋势,涵盖监督微调、强化学习等算法及代理工作流设计。

Comments 72 pages, 6 figures. Accepted to TMLR, with Survey Certification award

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15616 2026-03-17 cs.CV

GlyphPrinter: Region-Grouped Direct Preference Optimization for Glyph-Accurate Visual Text Rendering

GlyphPrinter: 基于区域分组的直接偏好优化用于精确的视觉文本渲染

Xincheng Shuai, Ziye Li, Henghui Ding, Dacheng Tao

机构 * Institute of Big Data, College of Computer Science and Artificial Intelligence, Fudan University(大数据研究院,计算机科学与人工智能学院,复旦大学) Generative AI Lab, College of Computing and Data Science, Nanyang Technological University(生成式人工智能实验室,计算与数据科学学院,南洋理工大学)

AI总结 本文提出GlyphPrinter,通过区域分组直接偏好优化提升文本渲染的字形准确性,引入区域级字形偏好标注和区域优化目标,有效解决复杂或非领域字符的字形误差问题。

Comments CVPR 2026, Project Page: https://henghuiding.com/GlyphPrinter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15612 2026-03-17 cs.CV cs.RO

HSImul3R: Physics-in-the-Loop Reconstruction of Simulation-Ready Human-Scene Interactions

HSImul3R:物理循环中的人机交互仿真准备重建

Yukang Cao, Haozhe Xie, Fangzhou Hong, Long Zhuo, Zhaoxi Chen, Liang Pan, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) ACE Robotics(ACE机器人公司) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 HSImul3R通过物理引导的双向优化框架,解决人机交互仿真中的感知与仿真差距问题,实现稳定且可部署的3D重建。

Comments https://yukangcao.github.io/HSImul3R/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15469 2026-03-17 cs.RO cs.AI

RoCo Challenge at AAAI 2026: Benchmarking Robotic Collaborative Manipulation for Assembly Towards Industrial Automation

AAAI 2026机器人协作操作挑战赛:面向工业自动化的协作操作基准测试

Haichao Liu, Yuheng Zhou, Zhenyu Wu, Ziheng Ji, Ziyu Shan, Qianzhun Wang, Ruixuan Liu, Zhiyuan Yang, Yejun Gu, Shalman Khan, Shijun Yan, Jun Liu, Haiyue Zhu, Changliu Liu, Jianfei Yang, Jingbing Zhang, Ziwei Wang

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Beijing University of Posts and Telecommunications, Beijing, China(北京邮电大学,北京,中国) Carnegie Mellon University, Pittsburgh, USA(卡内基梅隆大学,匹兹堡,美国) Agency for Science, Technology and Research (A*STAR), Singapore(科技研究局(A*STAR),新加坡)

AI总结 本文提出RoCo挑战赛,通过模拟和真实世界装配任务,推动工业机器人协作操作能力的发展,展示了双模型框架和故障恢复数据在长周期多任务学习中的有效性。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15152 2026-03-17 cs.RO

Master Micro Residual Correction with Adaptive Tactile Fusion and Force-Mixed Control for Contact-Rich Manipulation

通过自适应触觉融合和力混合控制实现接触密集操作的主微残差校正

Xingting Li, Yifan Xie, Han Liu, Wei Hou, Guangyu Chen, Shoujie Li, Wenbo Ding

机构 * Shenzhen Ubiquitous Data Enabling Key Lab, Shenzhen International Graduate School, Tsinghua University, Shenzhen 518055, China(深圳智能数据赋能重点实验室,深圳国际研究生院,清华大学,深圳518055,中国) School of Electronics and Communication Engineering, Sun Yat-sen University, Shenzhen 518107, China(电子与通信工程学院,中山大学,深圳518107,中国) School of Mechanical and Aerospace Engineering, Nanyang Technological University, Singapore 639956, Singapore(机械与航空航天工程学院,南洋理工大学,新加坡639956,新加坡)

AI总结 本文提出M2-ResiPolicy,结合高阶动作指导与低阶校正,通过触觉强度驱动的自适应融合机制和力混合PBIC执行层,提升接触密集操作的精度与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15019 2026-03-17 cs.CV

Reference-Free Omnidirectional Stereo Matching via Multi-View Consistency Maximization

无参考全景立体匹配 via 多视角一致性最大化

Lehuai Xu, Weiming Zhang, Yang Li, Sidan Du, Lin Wang

机构 * Nanjing University, Nanjing, China(南京大学) Nanyang Technological University, Singapore(南洋理工大学)

AI总结 本文提出FreeOmniMVS框架,通过多视角一致性最大化实现无参考全景立体匹配,解决传统方法在几何关系和全局依赖性方面的不足,提升遮挡和基线变化下的鲁棒性。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14951 2026-03-17 cs.CV

GT-PCQA: Geometry-Texture Decoupled Point Cloud Quality Assessment with MLLM

GT-PCQA: 一种基于多模态大语言模型的几何-纹理解耦点云质量评估方法

Guohua Zhang, Jian Jin, Meiqin Liu, Chao Yao, Weisi Lin, Yao Zhao

机构 * Beijing Jiaotong University(北京交通大学) Nanyang Technological University(南洋理工大学) University of Science and Technology Beijing(北京科技大学)

AI总结 本文提出GT-PCQA框架,通过2D-3D联合训练和几何-纹理解耦策略,解决点云质量评估中数据量少和模型对几何退化不敏感的问题,实现高效且泛化能力强的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13435 2026-03-17 cs.CV cs.AI cs.CR

CtrlAttack: A Unified Attack on World-Model Control in Diffusion Models

CtrlAttack:一种针对扩散模型世界模型控制的统一攻击

Shuhan Xu, Siyuan Liang, Hongling Zheng, Yong Luo, Han Hu, Lefei Zhang, Dacheng Tao

机构 * Wuhan University(武汉大学) Nanyang Technological University(南洋理工大学) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出CtrlAttack攻击方法,针对扩散模型中的时间动态建模漏洞,通过低维速度场干扰状态转移,提升攻击成功率并揭示模型在状态动态层面的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13434 2026-03-17 cs.LG cs.AI

Modality-free Graph In-context Alignment

无模态图上下文对齐

Wei Zhuo, Siqiang Luo

机构 * Nanyang Technological University(南洋理工大学)

AI总结 本文提出MF-GIA框架,通过梯度指纹捕捉领域特征,实现跨异构域的无模态few-shot预测与泛化。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13375 2026-03-17 cs.CV cs.LG

InfiniteDance: Scalable 3D Dance Generation Towards in-the-wild Generalization

InfiniteDance: 可扩展的3D舞蹈生成以实现真实场景泛化

Ronghui Li, Zhongyuan Hu, Li Siyao, Youliang Zhang, Haozhe Xie, Mingyuan Zhang, Jie Guo, Xiu Li, Ziwei Liu

机构 * Tsinghua University(清华大学) Peng Cheng Laboratory(鹏城实验室) Nanyang Technological University(南洋理工大学)

AI总结 本文提出InfiniteDance,通过扩大数据与模型设计,实现可扩展的3D舞蹈生成,解决了真实场景下的泛化问题。

Comments project page: https://infinitedance.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13291 2026-03-17 cs.LG cs.AI

FedUAF: Uncertainty-Aware Fusion with Reliability-Guided Aggregation for Multimodal Federated Sentiment Analysis

FedUAF: 基于不确定性融合与可靠性引导聚合的多模态联邦情感分析

Xianxun Zhu, Zezhong Sun, Imad Rida, Erik Cambria, Junqi Su, Rui Wang, Hui Chen

机构 * Shanghai University(上海大学) North China Electric Power University(华北电力大学) Université de Technologie de Compiègne(法国图卢兹国立理工学院) Nanyang Technological University(南洋理工大学) City University of Hong Kong(香港城市大学) Macquarie University(麦考瑞大学)

AI总结 本文提出FedUAF框架,通过不确定性融合和可靠性引导聚合解决联邦学习中多模态数据缺失、分布异质和客户端更新不可靠的问题,实验证明其在CMU-MOSI和CMU-MOSEI数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24267 2026-03-17 cs.CV

FakeScope: Large Multimodal Expert Model for Transparent AI-Generated Image Forensics

FakeScope:大型多模态专家模型用于透明的AI生成图像取证

Yixuan Li, Yu Tian, Yipo Huang, Wei Lu, Shiqi Wang, Weisi Lin, Anderson Rocha

机构 * College of Computing, City University of Hong Kong(城市大学 computing 学院) School of Data Science and Artificial Intelligence, Chang’an University(长安大学数据科学与人工智能学院) School of Computer Science and Engineering, Ministry of Education Key Laboratory of Information Technology, Guangdong Province Key Laboratory of Information Security Technology, Sun Yat-Sen University(中山大学计算机科学与工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学 computing 与数据科学学院) Artificial Intelligence Lab. (Recod.ai) at the University of Campinas(坎皮纳斯大学人工智能实验室)

AI总结 FakeScope通过多模态专家模型提升AI生成图像的检测能力,提供可解释的取证分析,实现高精度识别与深入解释,具备零样本检测和跨生成器泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12989 2026-03-16 cs.CV cs.CR

Test-Time Attention Purification for Backdoored Large Vision Language Models

针对受污染的大视觉语言模型的测试时间注意力净化

Zhifang Zhang, Bojun Yang, Shuo He, Weitong Chen, Wei Emma Zhang, Olaf Maennel, Lei Feng, Miao Xu

机构 * University of Queensland(昆士兰大学) Southeast University(东南大学) Nanyang Technological University(南洋理工大学) Adelaide University(阿德莱德大学)

AI总结 本文提出CleanSight,一种无需训练的测试时间防御方法,通过检测和净化异常的视觉-文本注意力分布来对抗后门攻击,显著优于现有基于像素的净化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏