arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

共收录 2400
2512.00300 2025-12-02 cs.CV

TGSFormer: Scalable Temporal Gaussian Splatting for Embodied Semantic Scene Completion

TGSFormer:可扩展的时序高斯点云用于具身语义场景补全

Rui Qian, Haozhi Cao, Tianchen Deng, Tianxin Hu, Weixiang Guo, Shenghai Yuan, Lihua Xie

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiaotong University(上海交通大学)

AI总结 TGSFormer通过时序高斯点云框架实现了具身语义场景补全的高精度与可扩展性。

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22961 2025-12-01 cs.CV

HMR3D: Hierarchical Multimodal Representation for 3D Scene Understanding with Large Vision-Language Model

HMR3D:用于大视觉-语言模型的层次多模态表示以实现3D场景理解

Chen Li, Eric Peh, Basura Fernando

机构 * Institute of High-Performance Computing, Agency for Science, Technology and Research, Singapore(高性能计算研究所,科技研究局,新加坡) Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore(前沿人工智能研究中心,科技研究局,新加坡) College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)

AI总结 HMR3D通过层次化多模态表示,结合多视图图像和文本描述,提升3D场景理解的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01886 2025-12-01 cs.LG

Deep Reinforcement Learning for Drone Route Optimization in Post-Disaster Road Assessment

灾难道路评估中用于无人机路线优化的深度强化学习

Huatian Gong, Jiuh-Biing Sheu, Zheng Wang, Xiaoguang Yang, Ran Yan

机构 * School of Civil and Environmental Engineering, Nanyang Technological University(南洋理工大学土木与环境工程学院) Department of Business Administration, National Taiwan University(台湾大学商业行政系) School of Maritime Economics and Management, Dalian Maritime University(大连海事大学海运经济与管理学院) The Key Laboratory of Road and Traffic Engineering of the Ministry of Education, Tongji University(同济大学交通工程教育部长期实验室)

AI总结 本研究提出基于深度强化学习的AEDM模型,用于灾后道路评估中的无人机路线优化,显著提升解决方案质量和推理速度,适用于时间敏感的灾害响应场景。

Comments 28 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12465 2025-12-01 cs.CV

PhysX-3D: Physical-Grounded 3D Asset Generation

PhysX-3D:基于物理的3D资产生成

Ziang Cao, Zhaoxi Chen, Liang Pan, Ziwei Liu

机构 * Nanyang Technological University(南洋理工大学) Shanghai AI Lab(上海人工智能实验室)

AI总结 PhysX-3D提出一种基于物理的3D资产生成方法,通过构建物理标注数据集和双分支框架,提升生成资产的物理合理性和几何质量。

Comments Accepted by NeurIPS 2025, Spotlight Project page: https://physx-3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01734 2025-12-01 cs.CL

Benford's Curse: Tracing Digit Bias to Numerical Hallucination in LLMs

本福特定律的诅咒:追踪数字偏差到大语言模型中的数值幻觉

Jiandong Shao, Yao Lu, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学) University College London(伦敦大学学院)

AI总结 研究发现LLMs在预训练中学习到的数字偏倚导致数值生成偏差,通过修剪特定神经元可缓解错误输出。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22471 2025-12-01 cs.CV

Rethinking Cross-Generator Image Forgery Detection through DINOv3

重新思考通过DINOv3进行跨生成器图像伪造检测

Zhenglin Huang, Jason Li, Haiquan Wen, Tianxiao Li, Xi Yang, Lu Qi, Bei Peng, Xiaowei Huang, Ming-Hsuan Yang, Guangliang Cheng

机构 * University of Liverpool, UK(利物浦大学) Nanyang Technological University(南洋理工大学) HKUST(香港科技大学) UC Merced(加州大学默塞德分校) University of Sheffield(谢菲尔德大学)

AI总结 通过DINOv3发现无需训练即可实现跨生成器图像伪造检测,利用令牌排名策略提升检测准确度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22080 2025-12-01 cs.LG cs.AI cs.DC

A Fast and Flat Federated Learning Method via Weighted Momentum and Sharpness-Aware Minimization

一种通过加权动量和尖锐意识最小化实现快速且平坦的联邦学习方法

Tianle Li, Yongzhi Huang, Linshan Jiang, Chang Liu, Qipeng Xie, Wenfeng Du, Lu Wang, Kaishun Wu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) National University of Singapore(新加坡国立大学) Nanyang Technological University, Singapore(南洋理工大学,新加坡) Shenzhen University(深圳大学)

AI总结 FedWMSAM通过加权动量和尖锐意识最小化解决非IID联邦学习中的局部-全局曲率不一致和动量-回声振荡问题,提升模型收敛速度和泛化能力。

Journal ref Advances in Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21780 2025-12-01 cs.MM cs.SD

3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation

3MDiT:用于文本驱动同步音频视频生成的统一三模态扩散变换器

Yaoru Li, Heyu Si, Federico Landi, Pilar Oplustil Gallegos, Ioannis Koutsoumpas, O. Ricardo Cortez Vazquez, Ruiju Fu, Qi Guo, Xin Jin, Shunyu Liu, Mingli Song

机构 * Zhejiang University(浙江大学) Huawei(华为) Nanyang Technological University(南洋理工大学)

AI总结 3MDiT提出了一种统一三模态扩散变换器,通过联合演变流实现文本驱动的同步音频视频生成,提升多模态对齐与同步性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09042 2025-12-01 eess.SY cs.LG cs.SY

MAKO: Meta-Adaptive Koopman Operators for Learning-based Model Predictive Control of Parametrically Uncertain Nonlinear Systems

MAKO:基于元学习的Koopman算子用于参数不确定非线性系统的基于学习的模型预测控制

Minghao Han, Kiwan Wong, Adrian Wing-Keung Law, Xunyuan Yin

机构 * Water Research Institute (NEWRI), Nanyang Technological University, Singapore(新跃大学水研究 institute(NEWRI)) School of Chemistry, Chemical Engineering and Biotechnology, Nanyang Technological University, Singapore(新跃大学化学、化工与生物技术学院) Soft Robotics Lab, ETH Zurich, Switzerland(苏黎世联邦理工学院软机器人实验室) Department of Civil and Environmental Engineering, National University of Singapore, Singapore(新加坡国立大学土木与环境工程系)

AI总结 MAKO通过元学习方法实现对参数不确定非线性系统的高效建模与预测控制,提升系统稳定性和控制效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09432 2025-11-27 cs.LG stat.ML

Establishing Linear Surrogate Regret Bounds for Convex Smooth Losses via Convolutional Fenchel-Young Losses

通过卷积Fenchel-Young损失建立线性替代遗憾界

Yuzhou Cao, Han Bao, Lei Feng, Bo An

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) The Institute of Statistical Mathematics(统计数学研究所) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Skywork AI

AI总结 本文提出通过卷积Fenchel-Young损失构建凸光滑替代损失,以实现线性替代遗憾界,从而解决凸光滑损失与线性遗憾界之间的权衡问题。

Comments NeurIPS 2025 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21369 2025-11-27 physics.comp-ph cs.LG physics.flu-dyn

Differentiable Physics-Neural Models enable Learning of Non-Markovian Closures for Accelerated Coarse-Grained Physics Simulations

可微物理-神经模型使非马尔可夫闭合学习成为可能,以加速粗粒化物理模拟

Tingkai Xue, Chin Chun Ooi, Zhengwei Ge, Fong Yew Leong, Hongying Li, Chang Wei Kang

机构 * Department of Mechanical Engineering(机械工程系) National University of Singapore(新加坡国立大学) Institute of High Performance Computing(高性能计算研究所) Agency for Science, Technology and Research(科学、技术与研究局) Dept of Mechanical and Aerospace Engineering(机械与航空航天工程系) Nanyang Technological University(南洋理工大学)

AI总结 本文提出了一种可微物理-神经模型,通过联合学习物理模型参数和非马尔可夫神经闭合模型,实现快速准确的粗粒化物理模拟代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21032 2025-11-27 cs.LG

A Probabilistic Framework for Temporal Distribution Generalization in Industry-Scale Recommender Systems

面向工业级推荐系统的时间分布泛化概率框架

Yuxuan Zhu, Cong Fu, Yabo Ni, Anxiang Zeng, Yuan Fang

机构 * Shopee Pte. Ltd.(Shopee公司) Nanyang Technological University(南洋理工大学) Singapore Management University(新加坡管理学院)

AI总结 本文提出ELBO_TDS框架,通过因果图建模和自监督变分目标提升工业级推荐系统的时间分布泛化能力,实测提升GMV 2.33%并已部署于Shopee产品搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16149 2025-11-27 quant-ph cs.LG cs.NA math.NA stat.ML

Approximation rates of quantum neural networks for periodic functions via Jackson's inequality

量子神经网络对周期函数的逼近率 via Jackson 不等式

Ariel Neufeld, Philipp Schmocker, Viet Khoa Tran

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ETH Zurich, Switzerland(苏黎世联邦理工学院,瑞士)

AI总结 本文利用Jackson不等式研究量子神经网络对周期函数的逼近能力,通过减少参数数量提升逼近效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08532 2025-11-27 cs.AI

Safe and Economical UAV Trajectory Planning in Low-Altitude Airspace: A Hybrid DRL-LLM Approach with Compliance Awareness

低空经济环境下安全且经济的无人机轨迹规划:一种融合DRL与LLM的混合方法与合规意识

Yanwei Gong, Junchao Fan, Ruichen Zhang, Dusit Niyato, Yingying Yao, Xiaolin Chang

机构 * Beijing Key Laboratory of Security and Privacy in Intelligent Transportation, Beijing Jiaotong University, P.R. China(北京智能交通安全与隐私北京市重点实验室,北京交通大学,中国) School of Computer Science and Engineering, Nanyang Technological University, Singapore(计算机科学与工程学院,南洋理工大学,新加坡)

AI总结 本文提出一种融合深度强化学习与大型语言模型的无人机轨迹规划方法,以实现安全、合规且经济的路径规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20226 2025-11-26 cs.RO

Toward generic control for soft robotic systems

面向通用控制的软机器人系统

Yu Sun, Yaosheng Deng, Wenjie Mei, Xiaogang Xiong, Yang Bai, Masaki Ogura, Zeyu Zhou, Mir Feroskhan, Michael Yu Wang, Qiyang Zuo, Yao Li, Yunjiang Lou

机构 * Shenzhen Key Lab of Advanced Motion Control Technology and Modern Automation Equipment(深圳先进运动控制技术及现代自动化装备重点实验室) School of Intelligence Science and Engineering(智能科学与工程学院) College of Artificial Intelligence(人工智能学院) Harbin Institute of Technology(哈尔滨工业大学) School of Mechanical and Aerospace Engineering(机械与航空航天工程学院) Nanyang Technological University(南洋理工大学) School of Robotics and Automation(机器人与自动化学院) Nanjing University(南京大学) School of Advanced Engineering(先进工程学院) Great Bay University(大贝大学) Center for Precision Engineering(精密工程中心) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)

AI总结 本文提出了一种基于控制顺应性的通用软机器人控制框架,通过模仿人类运动控制原理,实现了稳定、安全且跨平台可转移的行为,为统一软机器人控制提供了新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18808 2025-11-26 cs.CL cs.AI

HyperbolicRAG: Enhancing Retrieval-Augmented Generation with Hyperbolic Representations

HyperbolicRAG: 通过双曲表示增强检索增强生成

Linxiao Cao, Ruitao Wang, Jindong Li, Zhipeng Zhou, Menglin Yang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学)

AI总结 HyperbolicRAG通过整合双曲几何提升基于图的检索增强生成,以更准确地捕捉语义和层次结构关系。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19425 2025-11-25 cs.CV

SAM3-Adapter: Efficient Adaptation of Segment Anything 3 for Camouflage Object Segmentation, Shadow Detection, and Medical Image Segmentation

SAM3-Adapter: 高效适应Segment Anything 3用于伪装物分割、阴影检测和医学图像分割

Tianrun Chen, Runlong Cao, Xinda Yu, Lanyun Zhu, Chaotao Ding, Deyi Ji, Cheng Chen, Qi Zhu, Chunyan Xu, Papa Mao, Ying Zang

机构 * KOKONI, Moxin (Huzhou) Tech. Co., LTD(摩西(湖州)科技有限公司) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Information Engineering, Huzhou University(湖州大学信息工程学院) School of Electrical and Electronic Engineering, Nanyang Technological University(新加坡南洋理工大学电子与电气工程学院) College of Computing and Data Science, Nanyang Technological University(新加坡南洋理工大学计算与数据科学学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院)

AI总结 SAM3-Adapter通过高效适配框架提升SAM3在伪装物分割、阴影检测和医学影像分割等任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19368 2025-11-25 cs.LG cs.NI

LLM-Driven Stationarity-Aware Expert Demonstrations for Multi-Agent Reinforcement Learning in Mobile Systems

基于大语言模型的站稳意识专家示范的多智能体强化学习在移动系统中的应用

Tianyang Duan, Zongyuan Zhang, Zheng Lin, Songxiao Guo, Xiuxian Guan, Guangyu Wu, Zihan Fang, Haotian Meng, Xia Du, Ji-Zhe Zhou, Heming Cui, Jun Luo, Yue Gao

机构 * Division of Computer Science, The University of Hong Kong(计算机科学系,香港大学) Department of Electrical and Electronic Engineering, The University of Hong Kong(电气电子工程系,香港大学) Department of Computer Science and Technology, Peking University(计算机科学与技术系,北京大学) Department of Computer Science, City University of Hong Kong(计算机科学系,城市大学) China Unicom Digital Technology, China Unicom co.,Ltd(中国联合数字技术,中国联合有限公司) School of Computer and Information Engineering, Xiamen University of Technology(计算机与信息工程学院,厦门理工学院) School of Computer Science, Engineering Research Center of Machine Learning and Industry Intelligence, Sichuan University(计算机科学学院,机器学习与工业智能工程研究中心,四川大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) Institute of Space Internet, Fudan University(空间互联网研究院,复旦大学) School of Computer Science, Fudan University(计算机科学学院,复旦大学)

AI总结 本文提出RELED框架,通过大语言模型驱动的专家示范与自主探索相结合,提升多智能体强化学习在移动系统中的性能和稳定性。

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19168 2025-11-25 cs.LG cs.CL

RAVEN++: Pinpointing Fine-Grained Violations in Advertisement Videos with Active Reinforcement Reasoning

RAVEN++: 通过主动强化推理精准定位广告视频中的细粒度违规

Deyi Ji, Yuekui Yang, Liqun Liu, Peng Shu, Haiyang Wu, Shaogang Tang, Xudong Chen, Shaoping Ma, Tianrun Chen, Lanyun Zhu

机构 * Tencent(腾讯) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

AI总结 RAVEN++通过主动强化推理提升广告视频中细粒度违规检测的精度与泛化能力

Comments EMNLP 2025 (Oral, Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18708 2025-11-25 cs.RO

GVD-TG: Topological Graph based on Fast Hierarchical GVD Sampling for Robot Exploration

GVD-TG:基于快速分层GVD采样的拓扑图用于机器人探索

Yanbin Li, Canran Xiao, Shenghai Yuan, Peilai Yu, Ziruo Li, Zhiguo Zhang, Wenzheng Chi, Wei Zhang

机构 * School of Electronics Engineering, Beijing University of Posts and Telecommunications(北京邮电大学电子工程学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区计算机科学与技术学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) Institute for Computer Science, Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学计算机科学研究所) Key Lab of Smart Agriculture Systems, China Agricultural University(中国农业大学智能农业系统重点实验室) Robotics and Microsystems Center, School of Mechanical and Electric Engineering, Soochow University(苏州大学机械与电子工程学院机器人与微系统中心)

AI总结 本文提出基于快速分层GVD采样的拓扑图方法,用于提升机器人探索任务中的拓扑地图更新效率与路径规划灵活性。

Comments 12 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13589 2025-11-25 cs.CV

AdaVideoRAG: Omni-Contextual Adaptive Retrieval-Augmented Efficient Long Video Understanding

AdaVideoRAG:多情境自适应检索增强高效长视频理解

Zhucun Xue, Jiangning Zhang, Xurong Xie, Yuxuan Cai, Yong Liu, Xiangtai Li, Dacheng Tao

机构 * Zhejiang University(浙江大学) Youtu Lab, Tencent(腾讯优图实验室) Huazhong University of Science and Technolog(华中科技大学) Nanyang Technological University(南洋理工大学)

AI总结 AdaVideoRAG通过自适应检索增强框架提升长视频理解效率与准确性,支持多层级知识检索与深度语义分析。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20951 2025-11-25 cs.CV

DSOcc: Leveraging Depth Awareness and Semantic Aid to Boost Camera-Based 3D Semantic Occupancy Prediction

DSOcc: 利用深度感知和语义辅助提升基于相机的3D语义占用预测

Naiyu Fang, Zheyuan Zhou, Kang Wang, Ruibo Li, Lemiao Qiu, Shuyou Zhang, Zhe Wang, Guosheng Lin

机构 * S-Lab & College of Computing and Data Science, Nanyang Technological University(S实验室及计算与数据科学学院,南洋理工大学) MMLab, The Chinese University of Hong Kong(M实验室,香港中文大学) State Key Laboratory of Fluid Power & Mechatronic Systems, Zhejiang University(流体动力与机电系统国家重点实验室,浙江大学) SenseTime Research, Hong Kong(商汤研究,香港)

AI总结 DSOcc通过深度感知和语义辅助提升基于相机的3D语义占用预测,实现高效且鲁棒的占用状态和类别推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17852 2025-11-25 cs.CV

Sketch-1-to-3: One Single Sketch to 3D Detailed Face Reconstruction

Sketch-1-to-3: 一个单轮廓到三维详细面部重建

Liting Wen, Zimo Yang, Xianlin Zhang, Chi Ding, Mingdao Wang, Xueming Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

AI总结 Sketch-1-to-3通过引入GCTD模块和定制损失函数,实现从单个轮廓到高保真三维面部重建的突破性进展。

Comments Accepted by ACM MMAsia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07608 2025-11-25 cs.CV

Faster and Better 3D Splatting via Group Training

更高效且更好的3D点云绘制方法:通过分组训练

Chengbo Wang, Guozheng Ma, Yifei Xue, Yizhen Lao

机构 * Hunan University(湖南大学) Nanyang Technological University(南洋理工大学) Lushan Innovation Lab(庐山创新实验室) Key Laboratory of Digital Culture Smart Design Technology, Minstry of Culture and Tourism(文化与旅游部数字文化智能设计技术重点实验室)

AI总结 本文提出分组训练方法,通过将高斯基本形体分组优化训练效率和渲染质量,实现更高效的3D点云绘制

Comments Accepted to ICCV 2025. Code is available at https://github.com/Chengbo-Wang/3DGS-with-Group-Training

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03177 2025-11-25 cs.CV

PanoDiffusion: 360-degree Panorama Outpainting via Diffusion

PanoDiffusion:通过扩散模型实现360度全景补全

Tianhao Wu, Chuanxia Zheng, Tat-Jen Cham

机构 * Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学)

AI总结 PanoDiffusion通过双模潜在扩散模型实现360度全景补全,提升全景环绕一致性并生成高质量深度全景图。

Comments Project Page: https://sm0kywu.github.io/panodiffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17943 2025-11-25 cs.CV

SciEducator: Scientific Video Understanding and Educating via Deming-Cycle Multi-Agent System

SciEducator: 基于Deming循环多智能体系统的科学视频理解与教育

Zhiyu Xu, Weilong Yan, Yufei Shi, Xin Meng, Tao He, Huiping Zhuang, Ming Li, Hehe Fan

机构 * Jinan University(济南大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Peking University(北京大学) University of Electronic Science and Technology of China(电子科技大学) South China University of Technology(华南理工大学) Guangming Laboratory(光明实验室) Zhejiang University(浙江大学)

AI总结 SciEducator通过Deming循环多智能体系统实现科学视频的自演化理解与教育,生成多模态教学内容并超越现有大语言模型和视频智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17923 2025-11-25 cs.CL cs.AI

Towards Efficient LLM-aware Heterogeneous Graph Learning

面向高效LLM-aware异构图学习

Wenda Li, Tongya Zheng, Shunyu Liu, Yu Wang, Kaixuan Chen, Hanyang Yuan, Bingde Hu, Zujie Ren, Mingli Song, Gang Chen

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Zhejiang Lab(浙江实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Zhejiang Provincial Engineering Research Center for Real-Time SmartTech in Urban Security Governance, School of Computer and Computing Science, Hangzhou City University(浙江省实时智能城市安全治理工程技术研究中心,杭州城市大学计算机与计算科学学院) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security, Hangzhou, Zhejiang, China(杭州高新技术区(滨江)区块链与数据安全研究院,杭州,浙江,中国) Nanyang Technological University(南洋理工大学) Bangsun Technology(邦sun科技)

AI总结 本文提出ELLA框架,通过LLM-aware关系分词器和层次关系图变压器,高效解决异构图中复杂关系语义建模和任务间语义间隙问题,实现性能与效率的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17672 2025-11-25 cs.AI

Cognitive Inception: Agentic Reasoning against Visual Deceptions by Injecting Skepticism

认知 inception:通过注入怀疑进行视觉欺骗的代理推理

Yinjie Zhao, Heng Zhao, Bihan Wen, Joey Tianyi Zhou

机构 * CFAR, Agency for Science, Technology and Research (A*STAR), Singapore(科技研究局(A*STAR)认知智能研究所,新加坡) IHPC, Agency for Science, Technology and Research (A*STAR), Singapore(科技研究局(A*STAR)信息处理中心,新加坡) ROSE Lab, School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院ROSE实验室)

AI总结 本文提出Inception框架,通过注入怀疑提升LLM对视觉欺骗的抵御能力,实现可推广的真伪验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17450 2025-11-24 cs.CV cs.AI cs.CL

Planning with Sketch-Guided Verification for Physics-Aware Video Generation

基于草图引导验证的物理感知视频生成规划

Yidong Huang, Zun Wang, Han Lin, Dong-Ki Kim, Shayegan Omidshafiei, Jaehong Yoon, Yue Zhang, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) FieldAI Nanyang Technological University(南洋理工大学)

AI总结 SketchVerify通过草图验证和动态轨迹优化提升物理感知视频生成的效率与质量。

Comments website: https://sketchverify.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17448 2025-11-24 cs.CV

MMT-ARD: Multimodal Multi-Teacher Adversarial Distillation for Robust Vision-Language Models

MMT-ARD: 多模态多教师对抗蒸馏用于鲁棒视觉-语言模型

Yuqi Li, Junhao Dong, Chuanguang Yang, Shiping Wen, Piotr Koniusz, Tingwen Huang, Yingli Tian, Yew-Soon Ong

机构 * The City University of New York, CUNY(纽约城市大学) Nanyang Technological University(南洋理工大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Technology Sydney(悉尼技术大学) Data61, CSIRO(CSIRO数据61研究所) Shenzhen University of Advanced Technology(深圳先进技术大学)

AI总结 MMT-ARD通过多教师对抗蒸馏提升视觉-语言模型的对抗鲁棒性,实验显示鲁棒精度提升4.32%,训练效率提高2.3倍。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏