arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

共收录 2400
2512.10945 2025-12-13 cs.CV

MeViS: A Multi-Modal Dataset for Referring Motion Expression Video Segmentation

MeViS:一种多模态数据集,用于指称运动表达视频分割

Henghui Ding, Chang Liu, Shuting He, Kaining Ying, Xudong Jiang, Chen Change Loy, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai University of Finance and Economics(上海财经大学) Nanyang Technological University(南洋理工大学)

AI总结 MeViS数据集通过多模态数据提升视频分割中运动表达的理解能力,提出LMPM++方法实现新突破。

Comments IEEE TPAMI, Project Page: https://henghuiding.com/MeViS/

Journal ref in IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 47, no. 12, pp. 11400-11416, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10522 2025-12-12 cs.LG

Disentangled and Distilled Encoder for Out-of-Distribution Reasoning with Rademacher Guarantees

解耦并压缩的编码器用于具有Rademacher保证的分布外推理

Zahra Rahiminasab, Michael Yuhas, Arvind Easwaran

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Nanyang Technological University(南洋理工大学) Energy Research Institute(能源研究研究所)

AI总结 本文提出了解耦压缩编码器框架,通过约束优化保持解耦性,以减少模型大小用于资源受限设备的分布外推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05104 2025-12-12 cs.CV

EvoIR: Towards All-in-One Image Restoration via Evolutionary Frequency Modulation

EvoIR:通过进化频率调制实现全方位图像修复

Jiaqi Ma, Shengkai Hu, Xu Zhang, Jun Wan, Jiaxing Huang, Lefei Zhang, Salman Khan

机构 * MBZUAI Abu Dhabi, UAE(阿布扎赫德MBZUAI) ZUEL Wuhan, China(武汉中南大学) Wuhan University Wuhan, China(武汉大学) Nanyang Technological University Singapore(新加坡南洋理工大学)

AI总结 EvoIR通过进化频率调制实现全方位图像修复,结合频率调制模块和进化优化策略,提升图像修复的结构保真度和细节质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03040 2025-12-12 cs.CV cs.AI

Video4Spatial: Towards Visuospatial Intelligence with Context-Guided Video Generation

Video4Spatial: 通过基于场景的视频生成实现视觉空间智能

Zeqi Xiao, Yiwei Zhao, Lingxiao Li, Yushi Lan, Ning Yu, Rahul Garg, Roshni Cooper, Mohammad H. Taghavi, Xingang Pan

机构 * Netflix Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学) Eyeline Studios

AI总结 Video4Spatial通过仅使用视频数据训练的生成模型,实现了复杂空间任务的视觉空间智能,展示了视频生成模型在空间推理中的潜力。

Comments Project page at https://xizaoqu.github.io/video4spatial/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15365 2025-12-12 eess.SY cs.LG cs.MA cs.SY

TranSimHub:A Unified Air-Ground Simulation Platform for Multi-Modal Perception and Decision-Making

TranSimHub:一个多模态感知与决策的空地协同仿真平台

Maonan Wang, Yirong Chen, Yuxin Cai, Aoyu Pang, Yuejiao Xie, Zian Ma, Chengcheng Xu, Kemou Jiang, Ding Wang, Laurent Roullet, Chung Shue Chen, Zhiyong Cui, Yuheng Kan, Michael Lepech, Man-On Pun

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai AI Laboratory(上海人工智能实验室) Stanford University(斯坦福大学) Nanyang Technological University(南洋理工大学) SenseTime Group Ltd(商汤科技有限公司) Beihang University(北京航空航天大学) Nokia Bell Labs(诺基亚贝尔实验室)

AI总结 TranSimHub是一个用于空地协同智能的统一仿真平台,支持多模态感知与决策研究,提供同步渲染和可控场景编辑功能。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17552 2025-12-12 cs.CL cs.AI

Can LLMs Reason Over Non-Text Modalities in a Training-Free Manner? A Case Study with In-Context Representation Learning

LLMs能否在无训练模式下推理非文本模态?一种基于上下文表示学习的案例研究

Tianle Zhang, Wanlong Fang, Jonathan Woo, Paridhi Latawa, Deepak A. Subramanian, Alvin Chan

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) AI-X, Interdisciplinary Graduate Programme, Nanyang Technological University(南洋理工大学人工智能交叉研究生项目) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李科钦医学院) Centre of AI in Medicine (C-AIM), Nanyang Technological University(南洋理工大学医学人工智能中心) University of Toronto(多伦多大学) Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里洛妇女医院) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文提出ICRL框架,使LLMs在无训练情况下利用非文本模态表示,通过少量学习实现多模态推理,为适应性泛化提供新方向。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19486 2025-12-12 eess.SY cs.LG cs.MA cs.SY

VLMLight: Safety-Critical Traffic Signal Control via Vision-Language Meta-Control and Dual-Branch Reasoning Architecture

VLMLight:通过视觉-语言元控制与双分支推理架构实现安全关键的交通信号控制

Maonan Wang, Yirong Chen, Aoyu Pang, Yuxin Cai, Chung Shue Chen, Yuheng Kan, Man-On Pun

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Nokia Bell Labs(诺基亚贝尔实验室) Fourier Intelligence(Fourier智能)

AI总结 VLMLight通过视觉-语言元控制与双分支推理架构,实现安全关键的交通信号控制,显著减少紧急车辆等待时间并提升系统安全性。

Comments 25 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09411 2025-12-11 cs.RO

D$^2$GSLAM: 4D Dynamic Gaussian Splatting SLAM

D$^2$GSLAM: 4D动态高斯点云SLAM

Siting Zhu, Yuxiang Huang, Wenhua Wu, Chaokang Jiang, Yongbo Chen, I-Ming Chen, Hesheng Wang

机构 * Department of Automation, Shanghai Jiao Tong University(自动化系,上海交通大学) School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(信息科学与电子工程学院,上海交通大学) Bosch(博世) School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院,南洋理工大学) Department of Automation, Key Laboratory of System Control and Information Processing of Ministry of Education, State Key Laboratory of Avionics Integration and Aviation System-of-Systems Synthesis, Shanghai Key Laboratory of Navigation and Location Based Services, Shanghai Jiao Tong University(自动化系,教育部系统控制与信息处理重点实验室,航空系统集成与航空系统-of-系统综合国家重点实验室,导航与位置基于服务上海市重点实验室,上海交通大学)

AI总结 D$^2$GSLAM通过4D动态高斯点云实现动态环境中的精准SLAM建图与跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09349 2025-12-11 cs.RO

COVLM-RL: Critical Object-Oriented Reasoning for Autonomous Driving Using VLM-Guided Reinforcement Learning

COVLM-RL:基于VLM引导强化学习的自动驾驶中关键对象导向推理

Lin Li, Yuxin Cai, Jianwu Fang, Jianru Xue, Chen Lv

机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, National Engineering Research Center for Visual Information and Applications, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人机混合增强智能国家重点实验室、视觉信息与应用国家工程研究中心、人工智能与机器人研究院)

AI总结 COVLM-RL通过结合关键对象导向推理与VLM引导强化学习,提升了自动驾驶系统的泛化能力和训练效率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05137 2025-12-11 cs.CL

Demystifying deep search: a holistic evaluation with hint-free multi-hop questions and factorised metrics

解析深度搜索:基于无提示多跳问题和因子化指标的全面评估

Maojia Song, Renhang Liu, Xinyu Wang, Yong Jiang, Pengjun Xie, Fei Huang, Jingren Zhou, Dorien Herremans, Soujanya Poria

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Nanyang Technological University(南洋理工大学) Tongyi Lab, Alibaba Group(阿里云实验室)

AI总结 本文提出WebDetective基准测试,通过无提示多跳问题和因子化指标,揭示深度搜索中模型在知识利用和拒绝行为上的系统性弱点,并开发EvidenceLoop工作流程以改进自主推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.10496 2025-12-11 cs.CV cs.CL

Two Causal Principles for Improving Visual Dialog

为改进视觉对话的两个因果原则

Jiaxin Qi, Yulei Niu, Jianqiang Huang, Hanwang Zhang

机构 * Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) Damo Academy, Alibaba Group(阿里达摩院)

AI总结 本文提出两个因果原则以改进视觉对话模型,通过移除对话历史的直接输入和消除未观察到的混杂因素,提升模型性能。

Comments Accepted by CVPR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08769 2025-12-10 cs.AI

A Practical Guide for Designing, Developing, and Deploying Production-Grade Agentic AI Workflows

生产级智能体AI工作流设计、开发与部署的实用指南

Eranga Bandara, Ross Gore, Peter Foytik, Sachin Shetty, Ravi Mukkamala, Abdul Rahman, Xueping Liang, Safdar H. Bouk, Amin Hass, Sachini Rajapakse, Ng Wee Keong, Kasun De Zoysa, Aruna Withanage, Nilaan Loganathan

机构 * Old Dominion University(旧 Dominion 大学) Florida International University(佛罗里达国际大学) Nanyang Technological University(南洋理工大学) University of Colombo(科伦坡大学)

AI总结 本文提出了一套生产级智能体AI工作流的设计、开发和部署的最佳实践,涵盖架构设计、多智能体模式、模型上下文协议及环境感知部署策略,旨在提升系统的可靠性与可维护性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07720 2025-12-10 cs.CV

ViSA: 3D-Aware Video Shading for Real-Time Upper-Body Avatar Creation

ViSA: 一种3D感知的视频着色方法用于实时上半身数字人生成

Fan Yang, Heyuan Li, Peihao Li, Weihao Yuan, Lingteng Qiu, Chaoyue Song, Cheng Chen, Yisheng He, Shifeng Zhang, Xiaoguang Han, Steven Hoi, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tongyi Lab, Alibaba Group(阿里云实验室)

AI总结 ViSA结合3D重建与视频生成技术,实时生成高质量上半身数字人,减少模糊和僵硬问题,提升视觉质量。

Comments Project page: \url{https://lhyfst.github.io/visa}

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18321 2025-12-10 cs.CL cs.AI

LLMs Can't Handle Peer Pressure: Crumbling under Multi-Agent Social Interactions

大语言模型难以应对同伴压力:在多智能体社交互动中崩溃

Maojia Song, Tej Deep Pala, Ruiwen Zhou, Weisheng Jin, Amir Zadeh, Chuan Li, Dorien Herremans, Soujanya Poria

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Lambda Labs(Lambda实验室)

AI总结 研究探讨了大语言模型在多智能体社交互动中的表现,提出KAIROS基准用于评估模型在复杂社交动态中的决策能力,发现模型规模和训练方法对抵抗社交影响至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14570 2025-12-10 cs.RO cs.SY eess.SY

Haptic-based Complementary Filter for Rigid Body Rotations

基于触觉的互补滤波器用于刚体旋转

Amit Kumar, Domenico Campolo, Ravi N. Banavar

机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University, Singapore(机械与航空航天工程学院,南洋理工大学)

AI总结 本文提出了一种基于触觉和视觉传感器的互补滤波器,用于估计刚体旋转,通过利用$\mathbf{\mathbb{SO}(3)}$的对称性和超级二次曲面表示,提高了三维方向估计的鲁棒性和稳定性。

Comments 7 pages, 7 figures; Updated filter design; Submitted to IFAC for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06909 2025-12-10 cs.LG cs.AI cs.GT

Meta-Computing Enhanced Federated Learning in IIoT: Satisfaction-Aware Incentive Scheme via DRL-Based Stackelberg Game

元计算增强的联邦学习在工业物联网中的应用:基于DRL的Stackelberg博弈的满足感知激励方案

Xiaohuan Li, Shaowen Qin, Xin Tang, Jiawen Kang, Jin Ye, Zhonghua Zhao, Yusi Zheng, Dusit Niyato

机构 * Guangxi University Key Laboratory of Intelligent Networking and Scenario System (School of Information and Communication, Guilin University of Electronic Technology)(广西智能网络与场景系统重点实验室(信息与通信学院,桂林电子科技大学)) National Engineering Laboratory for Comprehensive Transportation Big Data Application Technology (Guangxi)(综合交通运输大数据应用技术国家工程实验室(广西)) School of Automation, Guangdong University of Technology(自动化学院,广东工业大学) Guangxi Key Laboratory of Multimedia Communications and Network Technology, Nanning(广西多媒体通信与网络技术重点实验室,南宁) School of Computer and Electronic Information, Guangxi University(计算机与电子信息学院,广西大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

AI总结 本文提出一种基于DRL的Stackelberg博弈的满足感知激励方案,通过优化IIoT中模型质量和训练延迟的平衡,提升联邦学习的效用和应用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07132 2025-12-09 cs.CL cs.AI cs.CV

DART: Leveraging Multi-Agent Disagreement for Tool Recruitment in Multimodal Reasoning

利用多智能体分歧进行多模态推理中的工具招募

Nithin Sivakumaran, Justin Chih-Yao Chen, David Wan, Yue Zhang, Jaehong Yoon, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Nanyang Technological University(南洋理工大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 DART通过多智能体分歧识别有用视觉工具,提升多模态推理中的工具调用效果。

Comments Code: https://github.com/nsivaku/dart

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05524 2025-12-09 cs.CV

VOST-SGG: VLM-Aided One-Stage Spatio-Temporal Scene Graph Generation

VOST-SGG:基于视觉语言模型的一阶段时空场景图生成

Chinthani Sugandhika, Chen Li, Deepu Rajan, Basura Fernando

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院) Institute of High-Performance Computing, Agency for Science, Technology and Research, Singapore(科学、技术与研究局高性能计算研究所) Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore(科学、技术与研究局前沿人工智能研究中心)

AI总结 VOST-SGG通过整合视觉语言模型的常识推理能力,提出了一种基于多模态特征和双源查询初始化的一阶段时空场景图生成方法,实现了对视频中对象及其关系的高效建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05397 2025-12-09 cs.HC cs.AI

Simulating Life Paths with Digital Twins: AI-Generated Future Selves Influence Decision-Making and Expand Human Choice

用数字双胞胎模拟人生路径:AI生成的未来自我影响决策并拓展人类选择

Rachel Poonsiriwong, Chayapatr Archiwaranguprok, Constanze Albrecht, Peggy Yin, Nattavudh Powdthavee, Hal Hershfield, Monchai Lertsutthiwong, Kavin Winson, Pat Pataranutaporn

机构 * MIT Media Lab(MIT媒体实验室) Stanford University(斯坦福大学) Nanyang Technological University(南洋理工大学) University of California, Los Angeles(加州大学洛杉矶分校) KASIKORN Labs(KASIKORN实验室)

AI总结 本研究利用AI生成的未来自我虚拟形象,通过模拟人生路径拓展人类选择,发现平衡呈现和新增选项能有效影响决策,提升自主性认知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02292 2025-12-09 cs.AI cs.LG

FinWorld: An All-in-One Open-Source Platform for End-to-End Financial AI Research and Deployment

FinWorld: 一个全方位的开源平台,用于端到端的金融AI研究与部署

Wentao Zhang, Yilei Zhao, Chuqiao Zong, Xinrun Wang, Bo An

机构 * Nanyang Technological University Skywork AI(南洋理工大学Skywork AI) Nanyang Technological University(南洋理工大学) Singapore Management University(新加坡管理学院)

AI总结 FinWorld是一个全方位的开源平台,提供端到端的金融AI研究与部署支持,通过整合异构金融数据和强化学习技术,提升可重复性和部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19912 2025-12-09 cs.CV cs.LG cs.RO

Enhanced Spatiotemporal Consistency for Image-to-LiDAR Data Pretraining

增强的时空一致性用于图像到LiDAR数据预训练

Xiang Xu, Lingdong Kong, Hui Shuai, Wenwei Zhang, Liang Pan, Kai Chen, Ziwei Liu, Qingshan Liu

机构 * College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) School of Computing, Department of Computer Science, National University of Singapore(新加坡国立大学计算机学院) School of Computer Science, Nanjing University of Posts and Telecommunications(南京邮电大学计算机学院) Shanghai AI Laboratory(上海人工智能实验室) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

AI总结 SuperFlow++通过整合时空线索提升图像到LiDAR数据预训练效果,实现更鲁棒的特征表示和更高效的自动驾驶感知。

Comments IEEE Transactions on Pattern Analysis and Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06702 2025-12-09 cs.LG

Pathway to $O(\sqrt{d})$ Complexity bound under Wasserstein metric of flow-based models

基于Wasserstein度量的流模型复杂度界路径

Xiangjun Meng, Zhongjian Wang

机构 * Division of Mathematical Sciences, School of Physical and Mathematical Sciences, Nanyang Technological University, Singapore(数学科学学院,物理与数学科学学院,南洋理工大学,新加坡)

AI总结 本文基于流模型和Föllmer过程,研究了在Wasserstein度量下生成模型的误差控制与复杂度界,证明采样复杂度与协方差算子的迹平方根成线性关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06692 2025-12-09 cs.LG

State Diversity Matters in Offline Behavior Distillation

状态多样性在离线行为蒸馏中至关重要

Shiye Lei, Zhihao Cheng, Dacheng Tao

机构 * School of Computer Science, Faculty of Engineering, The University of Sydney(悉尼大学计算机科学学院,工程学院) Generative AI Lab, College of Computing and Data Science, Nanyang Technological University(南洋理工大学生成人工智能实验室,计算与数据科学学院)

AI总结 本文揭示了离线行为蒸馏中状态多样性的重要性,提出状态密度加权算法以提升合成数据的质量和多样性。

Comments 12 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06589 2025-12-09 cs.CR cs.CV

OmniSafeBench-MM: A Unified Benchmark and Toolbox for Multimodal Jailbreak Attack-Defense Evaluation

OmniSafeBench-MM:多模态 jailbreak 攻击-防御评估的统一基准和工具箱

Xiaojun Jia, Jie Liao, Qi Guo, Teng Ma, Simeng Qin, Ranjie Duan, Tianlin Li, Yihao Huang, Zhitao Zeng, Dongxian Wu, Yiming Li, Wenqi Ren, Xiaochun Cao, Yang Liu

机构 * Nanyang Technological University, Singapore(南洋理工大学) BraneMatrix AI, China(BraneMatrix AI) Chongqing University, China(重庆大学) Xi’an Jiaotong University, China(西安交通大学) Northeastern University, China(东北大学) Sun Yat-sen University, China(中山大学) Alibaba, China(阿里巴巴) National University of Singapore, Singapore(新加坡国立大学) ByteDance, China(字节跳动)

AI总结 OmniSafeBench-MM提供一个多模态jailbreak攻击-防御评估的统一基准和工具箱,整合13种攻击方法、15种防御策略及广泛数据集,通过三维评估协议深入分析安全与效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02002 2025-12-09 cs.LG cs.CE

Generative Large-Scale Pre-trained Models for Automated Ad Bidding Optimization

生成式大规模预训练模型用于自动化广告竞价优化

Yu Lei, Jiayang Zhao, Yilei Zhao, Zhaoqi Zhang, Linyou Cai, Qianlong Xie, Xingxing Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

AI总结 GRAD通过生成式模型结合专家混合模块和因果变压器,提升广告竞价效率与收益,实现更高 ROI 和 GMV。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23565 2025-12-09 cs.AI

Semantic Chain-of-Trust: Autonomous Trust Orchestration for Collaborator Selection via Hypergraph-Aided Agentic AI

语义信任链:通过超图辅助的智能体AI实现自主信任协调以选择协作者

Botao Zhu, Xianbin Wang, Dusit Niyato

机构 * Department of Electrical and Computer Engineering, Western University(电气与计算机工程系,西部大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

AI总结 本文提出基于超图和智能体AI的语义信任链模型,通过多维度语义评估实现高效协作者选择,实验表明其在信任评估上具有100%准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16302 2025-12-09 cs.LG cs.AI cs.CR cs.CV

Towards Resilient Safety-driven Unlearning for Diffusion Models against Downstream Fine-tuning

面向对抗下游微调的鲁棒安全驱动遗忘方法用于扩散模型

Boheng Li, Renjie Gu, Junjie Wang, Leyi Qi, Yiming Li, Run Wang, Zhan Qin, Tianwei Zhang

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Central South University, China(中南大学,中国) Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University, China(航空航天信息安全部门,教育部,武汉大学,中国) State Key Laboratory of Blockchain and Data Security, Zhejiang University, China(区块链与数据安全国家重点实验室,浙江大学,中国)

AI总结 本文提出ResAlign,一种针对扩散模型对抗下游微调的鲁棒安全驱动遗忘框架,通过隐含优化问题建模和元学习策略提升安全性和生成能力。

Comments Accepted to the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05818 2025-12-08 cond-mat.mtrl-sci cs.LG

Machine-learning-enabled interpretation of tribological deformation patterns in large-scale MD data

基于机器学习的大型分子动力学数据中摩擦变形模式的解释

Hendrik J. Ehrich, Marvin C. May, Stefan J. Eder

机构 * organization= Institute for Engineering Design organization= AC2T research GmbH , addressline= Viktor-Kaplan-Straße 2/C , city= 2700 Wiener Neustadt , country= Austria organization= School of Mechanical \& Aerospace Engineering, Nanyang Technological University , addressline= 50 Nanyang Avenue , country= 639798 Singapore

AI总结 本研究利用机器学习自动解析大型分子动力学数据中的摩擦变形模式,通过压缩数据并训练CNN-MLP模型,实现96%的预测准确率。

Comments 19 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05137 2025-12-08 cs.CV cs.AI

ChromouVQA: Benchmarking Vision-Language Models under Chromatic Camouflaged Images

ChromouVQA:在色度伪装图像下评估视觉-语言模型的基准测试

Yunfei Zhang, Yizhuo He, Yuanxun Shao, Zhengtao Yao, Haoyan Xu, Junhao Dong, Zhen Yao, Zhikang Dong

机构 * Amazon(亚马逊公司) Google(谷歌公司) MurcuryMind(MurcuryMind公司) University of Southern California(南加州大学) Nanyang Technological University(南洋理工大学) Lehigh University(莱斯大学) Stony Brook University(石溪大学)

AI总结 ChromouVQA通过色度伪装图像评估视觉-语言模型在复杂背景下的表现,提出对比度配方提升形状恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16334 2025-12-08 cs.AI cs.CL

OpenMMReasoner: Pushing the Frontiers for Multimodal Reasoning with an Open and General Recipe

OpenMMReasoner: 推动多模态推理的前沿研究:一个开放且通用的配方

Kaichen Zhang, Keming Wu, Zuhao Yang, Bo Li, Kairui Hu, Bin Wang, Ziwei Liu, Xingxuan Li, Lidong Bing

机构 * MiroMind AI Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) LMMs-Lab Team(多模态实验室团队)

AI总结 OpenMMReasoner提出了一种开放且通用的多模态推理训练配方,通过两阶段方法提升推理性能,实现在多个基准测试中超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏