arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Nanyang Technological University(南洋理工大学)

2026-03-04 至 2026-03-04 共收录 12
2603.03241 2026-03-04 cs.CV cs.AI

UniG2U-Bench: Do Unified Models Advance Multimodal Understanding?

UniG2U-Bench: 统一模型是否能提升多模态理解?

Zimo Wen, Boxiu Li, Wanbo Zhang, Junxiang Lei, Xiaoyu Chen, Yijia Fan, Qi Zhang, Yujiang Wang, Lili Qiu, Bo Li, Ziwei Liu, Caihua Shan, Yifan Yang, Yifei Shen

机构 * Microsoft Research Asia(微软亚洲研究院) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) University of Oxford(牛津大学)

AI总结 UniG2U-Bench通过系统评估生成到理解的任务,揭示统一模型在多模态理解中的局限性和改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03198 2026-03-04 cs.RO cs.CL cs.CV

ACE-Brain-0: Spatial Intelligence as a Shared Scaffold for Universal Embodiments

ACE-Brain-0:空间智能作为通用具身化体系的共享框架

Ziyang Gong, Zehang Luo, Anke Tang, Zhe Liu, Shi Fu, Zhi Hou, Ganlin Yang, Weiyun Wang, Xiaofeng Wang, Jianbo Liu, Gen Luo, Haolan Kang, Shuang Luo, Yue Zhou, Yong Luo, Li Shen, Xiaosong Jia, Yao Mu, Xue Yang, Chunxiao Liu, Junchi Yan, Hengshuang Zhao, Dacheng Tao, Xiaogang Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) University of Science(科学技术大学) Fudan University(复旦大学) Xiamen University(厦门大学) East China Normal University(华东师范大学) Wuhan University(武汉大学) Sun Yat-sen University(中山大学)

AI总结 ACE-Brain-0 通过空间智能作为共享框架,统一了自动驾驶、机器人和 UAVs 的具身化任务,采用 SSR 范式和 GRPO 方法实现跨领域泛化和领域精通的平衡。

Comments Code: https://github.com/ACE-BRAIN-Team/ACE-Brain-0 Hugging Face: https://huggingface.co/ACE-Brain/ACE-Brain-0-8B

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03005 2026-03-04 cs.AI

OrchMAS: Orchestrated Reasoning with Multi Collaborative Heterogeneous Scientific Expert Structured Agents

OrchMAS: 基于多协作异构科学专家结构代理的协同推理

Yichao Feng, Haoran Luo, Zhenghong Lin, Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh, Anh Tuan Luu

机构 * Magellan Technology Research Institute (MTRI)(Magellan技术研究 institute) Nanyang Technological University(南洋理工大学)

AI总结 OrchMAS通过双层多模型编排框架,实现异构科学专家代理的动态协作,提升复杂科学推理的鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02846 2026-03-04 cs.LG cs.AI

Learning Memory-Enhanced Improvement Heuristics for Flexible Job Shop Scheduling

学习记忆增强的改进启发式方法用于灵活作业车间调度

Jiaqi Wang, Zhiguang Cao, Peng Zhao, Rui Cao, Yubin Xiao, Yuan Jiang, You Zhou

机构 * Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室) College of Software(软件学院) College of Computer Science and Technology(计算机科学与技术学院) Singapore Management University(新加坡管理大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出MIStar框架,通过记忆增强的异构图神经网络和并行贪婪搜索策略,提升灵活作业车间调度的调度效果。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22901 2026-03-04 eess.SY cs.AI cs.LG cs.SY eess.SP

A Neural Network-Based Real-time Casing Collar Recognition System for Downhole Instruments

基于神经网络的实时套管接箍识别系统用于井下仪器

Si-Yu Xiao, Xin-Di Zhao, Xiang-Zhan Wang, Tian-Hao Mao, Ying-Kai Liao, Xing-Yu Liao, Yu-Qiao Chen, Jun-Jie Wang, Shuang Liu, Tu-Pei Chen, Yang Liu

机构 * State Key Laboratory of Electronic Thin Films and Integrated Devices, University of Electronic Science and Technology of China(电子薄膜与集成器件国家重点实验室,电子科学与技术大学) Southwest Branch of China National Petroleum Corporation Logging Co., Ltd.(中国石油天然气集团有限公司西南分公司) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院)

AI总结 本文提出了一种轻量级神经网络,用于在井下环境中实现实时、鲁棒的套管接箍识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07177 2026-03-04 cs.CV cs.AI

Frame Guidance: Training-Free Guidance for Frame-Level Control in Video Diffusion Models

帧引导:基于帧级信号的无训练引导用于视频扩散模型的可控生成

Sangwon Jang, Taekyung Ki, Jaehyeong Jo, Jaehong Yoon, Soo Ye Kim, Zhe Lin, Sung Ju Hwang

机构 * KAIST(韩国国立科学技术院) NTU Singapore(南洋理工大学) Adobe Research(Adobe研究)

AI总结 帧引导通过帧级信号实现无训练的视频生成控制,支持多种任务如关键帧引导、风格化和循环,无需训练即可生成高质量视频。

Comments ICLR 2026. Project page: https://frame-guidance-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19892 2026-03-04 cs.AI

OptMerge: Unifying Multimodal LLM Capabilities and Modalities via Model Merging

OptMerge: 通过模型融合统一多模态大语言模型的能力与模态

Yongxian Wei, Runxi Cheng, Weike Jin, Enneng Yang, Li Shen, Lu Hou, Sinan Du, Chun Yuan, Xiaochun Cao, Dacheng Tao

机构 * Tsinghua University(清华大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学)

AI总结 OptMerge通过模型融合统一多模态大语言模型的能力与模态,提出基准和算法提升性能2.48%

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02729 2026-03-04 cs.LG math.OC stat.ML

The power of small initialization in noisy low-tubal-rank tensor recovery

小初始化在噪声低管秩张量恢复中的作用

ZHiyu Liu, Haobo Geng, Xudong Wang, Yandong Tang, Zhi Han, Yao Wang

机构 * State Key Laboratory of Robotics and Intelligent Systems, Shenyang Institute of Automation, Chinese Academy of Sciences, China(机器人与智能系统国家重点实验室,沈阳自动化研究所,中国科学院,中国) University of Chinese Academy of Sciences, China(中国科学院大学,中国) School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院,新加坡) The Center for Intelligent Decision-making and Machine Learning, School of Management, Xi’an Jiaotong University, China(智能决策与机器学习中心,西安交通大学管理学院,中国)

AI总结 本文研究了在噪声环境下利用小初始化改进低管秩张量恢复的性能,证明了小初始化能实现接近最优的恢复误差,同时提供了理论保证和实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02635 2026-03-04 cs.LG

SaFeR-ToolKit: Structured Reasoning via Virtual Tool Calling for Multimodal Safety

SaFeR-ToolKit: 通过虚拟工具调用实现多模态安全的结构化推理

Zixuan Xu, Tiancheng He, Huahui Yi, Kun Wang, Xi Chen, Gongli Xi, Qiankun Li, Kang Li, Yang Liu, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) West China Hospital, Sichuan University(四川大学华西医院) Nanyang Technological University(南洋理工大学)

AI总结 SaFeR-ToolKit通过虚拟工具调用实现多模态安全的结构化推理,提升安全性、帮助性和推理严谨性,同时保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02022 2026-03-04 cs.SD cs.AI

CodecFlow: Efficient Bandwidth Extension via Conditional Flow Matching in Neural Codec Latent Space

CodecFlow:通过条件流匹配在神经编解码器潜在空间中实现高效的带宽扩展

Bowen Zhang, Junchuan Zhao, Ian McLoughlin, Ye Wang, A S Madhukumar

机构 * Singapore Institute of Technology(新加坡理工学院) Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学)

AI总结 CodecFlow通过条件流匹配和结构受限量化器,在神经编解码器潜在空间中实现高效语音带宽扩展,提升频谱保真度和感知质量。

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18560 2026-03-04 cs.SE cs.AI

WebDevJudge: Evaluating (M)LLMs as Critiques for Web Development Quality

WebDevJudge: 评估 (M)LLMs 作为 Web 开发质量的批评者

Chunyang Li, Yilun Zheng, Xinting Huang, Tianqing Fang, Jiahao Xu, Lihui Chen, Yangqiu Song, Han Hu

机构 * Tencent AI Lab(腾讯AI实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Nanyang Technological University(南洋理工大学)

AI总结 WebDevJudge 提出了一种评估 LLM 作为 Web 开发质量批评者的基准,揭示了 LLM 与人类专家之间的显著差距,指出了模型在功能等价性识别、任务可行性验证和偏见缓解方面的根本性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08862 2026-03-04 cs.CV cs.LG

StreamSplat: Towards Online Dynamic 3D Reconstruction from Uncalibrated Video Streams

StreamSplat: 向动态3D重建的在线方法:从未校准视频流中

Zike Wu, Qi Yan, Xuanyu Yi, Lele Wang, Renjie Liao

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(人工智能向量研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) Nanyang Technological University(南洋理工大学)

AI总结 StreamSplat通过在线动态3D重建方法,实现从未校准视频流中快速生成高精度3DGS表示,支持任意长度视频的实时重建。

Comments Accepted by ICLR 2026, Project page: https://streamsplat3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏