arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

2026-06-16 至 2026-06-16 共收录 10
2605.03297 2026-06-16 cs.SD cs.LG 版本更新

Contrastive Regularization for Accent-Robust ASR

对比正则化用于口音鲁棒的ASR

Van-Phat Thai, Aradhya Dhruv, Duc-Thinh Pham, Sameer Alam

机构 * Air Traffic Management Research Institute, Nanyang Technological University, Singapore(新加坡南洋理工大学航空交通管理研究所) Center of AI Research, VinUniversity, Vietnam(越南Vin大学人工智能研究中心)

AI总结 提出使用监督对比学习作为轻量级口音不变辅助目标,在CTC微调中正则化编码器表示,无需架构修改或显式口音监督,在L2-ARCTIC基准上实现高达25-29%的未见口音词错误率降低。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29509 2026-06-16 cs.CV 版本更新

KGEdit: Ambiguity-Aware Knowledge Graphs for Training-Free Precise Video Generation and Editing

KGEdit: 面向无训练精确视频生成与编辑的歧义感知知识图谱

Mingshu Cai, Miao Zhang, Chenghe Yang, Yixuan Li, Osamu Yoshie, Yuya Ieiri

机构 * Waseda University, Japan(日本早稻田大学) College of Computer Engineering, Jimei University(集美大学计算机工程学院) Department of Language Science and Technology, The Hong Kong Polytechnic University(香港理工大学语言科学与技术系) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 提出KGEdit框架,通过构建歧义感知知识图谱和结构化语义注入模块,解决文本到视频扩散模型中的语义歧义、概念绑定错误和跨帧不一致问题,实现无需额外训练的精确视频生成与编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28185 2026-06-16 cs.CV 版本更新

Visual Generation in the New Era: An Evolution from Atomic Mapping to Agentic World Modeling

新时代的视觉生成:从原子映射到智能世界建模的演进

Keming Wu, Zuhao Yang, Kaichen Zhang, Shizun Wang, Haowei Zhu, Sicong Leng, Zhongyu Yang, Qijie Wang, Sudong Wang, Ziting Wang, Zili Wang, Hui Zhang, Haonan Wang, Hang Zhou, Yifan Pu, Xingxuan Li, Fangneng Zhan, Bo Li, Lidong Bing, Yuxin Song, Ziwei Liu, Wenhu Chen, Jingdong Wang, Xinchao Wang, Xiaojuan Qi, Shijian Lu, Bin Wang

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) University of Waterloo(滑铁卢大学) StepFun MiroMind Baidu(百度) Fudan University(复旦大学) Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) LMMs-Lab(LMMs实验室)

AI总结 提出五级分类法(原子生成、条件生成、上下文生成、智能生成、世界建模生成),分析流匹配、统一理解与生成模型等关键技术,并指出现有评估高估感知质量而忽视结构、时序和因果缺陷。

Comments Project Page: https://github.com/EvolvingLMMs-Lab/Evolving-Visual-Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12279 2026-06-16 cs.CV cs.AI cs.LG 版本更新

UniT: Unified Multimodal Chain-of-Thought Test-time Scaling

UniT:统一多模态思维链测试时扩展

Leon Liangyu Chen, Haoyu Ma, Zhipeng Fan, Ziqi Huang, Animesh Sinha, Xiaoliang Dai, Jialiang Wang, Zecheng He, Jianwei Yang, Chunyuan Li, Junzhe Sun, Chu Wang, Serena Yeung-Levy, Felix Juefei-Xu

机构 * Stanford University(斯坦福大学) Meta Superintelligence Labs(Meta超级智能实验室) Nanyang Technological University(南洋理工大学)

AI总结 提出UniT框架,通过多轮推理、验证和细化实现统一多模态模型的测试时扩展,实验表明短推理轨迹可泛化到长链,顺序思维链比并行采样更高效。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08306 2026-06-16 cs.LG 版本更新

TextResNet: Decoupling and Routing Optimization Signals in Compound AI Systems via Deep Residual Tuning

TextResNet:通过深度残差调优解耦和路由复合AI系统中的优化信号

Suizhi Huang, Mei Li, Han Yu, Xiaoxiao Li

机构 * Nanyang Technological University, Singapore(南洋理工大学) Jinan-NTU Green Technology Research Institute, China(济南-NTU绿色技术研究所) The University of British Columbia, Canada(不列颠哥伦比亚大学) Vector Institute, Canada(向量研究所)

AI总结 针对文本梯度优化器在深度链中因语义纠缠导致归因模糊的问题,提出TextResNet框架,通过前向加性语义增量、后向语义梯度分解、因果路由和密度感知调度实现信号解耦与精准路由,在复合AI系统中性能优于TextGrad且更稳定。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15296 2026-06-16 cs.CV cs.AI 版本更新

A Survey on 3D Skeleton Based Person Re-Identification: Taxonomy, Advances, Challenges, and Interdisciplinary Prospects

基于3D骨架的行人重识别综述:分类、进展、挑战与跨学科前景

Haocong Rao, Chunyan Miao

机构 * College of Computing and Data Science, Nanyang Technological University (NTU), Singapore(南洋理工大学计算与数据科学学院,新加坡) Joint NTU-UBC Research Centre of Excellence in Active Living for the Elderly (LILY), NTU, Singapore(老龄化积极生活卓越研究中心(LILY),南洋理工大学,新加坡) Alibaba-NTU Global e-Sustainability CorpLab (ANGEL), NTU, Singapore(阿里巴巴-南洋理工大学全球可持续发展企业实验室(ANGEL),南洋理工大学,新加坡)

AI总结 本文系统综述了基于3D骨架的行人重识别方法,提出了手工、序列和图建模三类分类法,并评估了监督、自监督和无监督学习范式下的最新技术,最后讨论了关键挑战与跨学科应用前景。

Comments Accepted by IJCAI 2026. A curated collection of valuable resources is available at https://github.com/Kali-Hac/3D-SRID-Survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07797 2026-06-16 cs.CV 版本更新

Power Battery Detection

动力电池检测

Xiaoqi Zhao, Peiqian Cao, Chenyang Yu, Zonglei Feng, Lihe Zhang, Hanqi Liu, Jiaming Zuo, Youwei Pang, Jinsong Ouyang, Weisi Lin, Georges El Fakhri, Huchuan Lu, Xiaofeng Liu

机构 * Yale University, USA(耶鲁大学,美国) Dalian University of Technology, China(大连理工大学,中国) Volkswagen Automotive Co., Ltd(大众汽车有限公司) X3000 Inspection Co., Ltd(X3000检测有限公司) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

AI总结 针对动力电池X射线图像中极板端点定位任务,提出首个大规模基准PBD5K和点级分割模型MDCNeXt,通过多维度结构线索与状态空间模块提升检测精度。

Comments Accepted by International Journal of Computer Vision (IJCV). Code: https://github.com/NTU-AI4X/X-ray-PBD

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01062 2026-06-16 cs.LG cs.CR cs.CV 版本更新

Random Erasing vs. Model Inversion: A Promising Defense or a False Hope?

随机擦除 vs. 模型反演:有希望的防御还是虚假的希望?

Viet-Hung Tran, Ngoc-Bao Nguyen, Son T. Mai, Hans Vandierendonck, Ira Assent, Alex Kot, Ngai-Man Cheung

机构 * Temasek Laboratories, Singapore University of Technology and Design(Temasek实验室,新加坡技术与设计大学) The Queen’s University Belfast(女王大学贝尔法斯特分校) Aarhus University(阿arhus大学) Nanyang Technological University (NTU)(南洋理工大学(NTU);河内 Vin 大学) VinUniversity, Hanoi, Vietnam

AI总结 本文探索随机擦除(RE)作为防御模型反演攻击的方法,通过特征空间分析揭示其有效性,并在37种设置下实现隐私-效用权衡的最优性能。

Comments Accepted in Transactions on Machine Learning Research (TMLR). First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05873 2026-06-16 cs.RO 版本更新

AC-LIO: Towards Asymptotic Compensation for Distortion in LiDAR-Inertial Odometry via Selective Intra-Frame Smoothing

AC-LIO:通过选择性帧内平滑实现激光雷达-惯性里程计中畸变的渐近补偿

Tianxiang Zhang, Xuanxuan Zhang, Wenlei Fan, Xin Xia, Huai Yu, Lin Wang, You Li

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS), Wuhan University, China(信息工程测绘遥感国家重点实验室(LIESMARS),武汉大学,中国) Department of Mechanical Engineering, University of Michigan-Dearborn(密歇根大学迪尔伯恩分校机械工程系) Electronic Information School, Wuhan University, China(武汉大学电子信息学院,中国) School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电子电气工程学院,新加坡)

AI总结 提出AC-LIO框架,通过渐近反向传播更新项并在收敛准则指导下补偿残余运动畸变,以最小计算开销提升离散状态LIO系统精度,在长期大尺度定位中平均RMSE降低30.4%。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06173 2026-06-16 cs.LG 版本更新

Concrete Subspace Learning based Interference Elimination for Multi-task Model Fusion

基于具体子空间学习的多任务模型融合干扰消除

Anke Tang, Xianglin Luo, Li Shen, Yong Luo, Liang Ding, Han Hu, Bo Du, Dacheng Tao

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团) School of Information and Electronics, Beijing Institute of Technology(北京理工大学信息与电子学院) Nanyang Technological University(南洋理工大学)

AI总结 提出连续松弛离散子空间学习方法,通过元学习框架识别低维共享子空间,解决多任务模型融合中的参数冲突问题,在视觉和语言任务上验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏