arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

2026-08-05 至 2026-08-05 共收录 11
2608.02993 2026-08-05 cs.AI cs.RO 新提交

Neurosymbolic Reasoning with Incremental Knowledge for Sample Efficient Hierarchical Reinforcement Learning

结合增量知识的神经符号推理用于样本高效分层强化学习

Subrat Prasad Panda, Blaise Genest, Arvind Easwaran

机构 * NTU Singapore(新加坡南洋理工大学) IPAL, CNRS, France(法国IPAL-CNRS)

AI总结 本研究提出结合增量知识(InK)的神经符号分层强化学习,通过符号高层组件执行符号规划、低层神经模块学习运动原语,在导航任务中显著提升了样本效率,还开发了信念世界树搜索方法。

Comments Published in ECML-PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02886 2026-08-05 cs.RO cs.SY eess.SY 新提交

Control Barrier Functions via Minkowski Operations for Safe Navigation among Polytopes

基于闵可夫斯基运算的控制障碍函数用于多面体间的安全导航

Yi-Hsuan Chen, Shuo Liu, Wei Xiao, Calin Belta, Michael Otte

机构 * University of Maryland(马里兰大学) Boston University(波士顿大学) Nanyang Technological University(南洋理工大学)

AI总结 该研究针对多面体环境的机器人安全导航问题,提出结合非光滑控制障碍函数与闵可夫斯基运算的精确符号距离函数方法,可实现非保守机动与安全恢复。

Comments 16 pages, 13 figures. Expanded version of a paper published in IEEE CDC 2025. Demo video: https://youtu.be/D0zVswzyxaE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00094 2026-08-05 cs.CV 版本更新

Video Models as Native 4D Renderers: World-Grounded Conditioning from Animated Mesh

视频模型作为原生4D渲染器:基于动画网格的世界 grounding 条件

Junhao Chen, Mingjin Chen, Henghaofan Zhang, Minglin Chen, Liaoyuan Fan, Boran Zhang, Saining Zhang, Mingze Sun, Hao Zhao, Ruqi Huang, Zhihao Li, Yufei Wang

机构 * Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Sun Yat-sen University(中山大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学)

AI总结 该研究提出参考引导渲染器DAR,扩展Wan2.2相机控制,用跟踪和世界位置组成的4D G缓冲作为条件,在DAR-4D基准上实现优于现有方法的视频生成性能。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27180 2026-08-05 cs.CV cs.RO 版本更新

HumanCLAW: Can Vision-Language Models Act Through a Body?

HumanCLAW:视觉-语言模型能否通过实体身体执行动作

Li Siyao, Jiawei Gu, Shuai Liu, Kairui Hu, Zekun Li, Linjie Li, Chengcheng Tang, Po-Chen Wu, Ivan Shugurov, Lingni Ma, Michael Zollhoefer, Sizhe An, Abhay Mittal, Amy Zhao, Ranjay Krishna, Manling Li, Ziwei Liu, Chuan Guo

机构 * Meta Nanyang Technological University(南洋理工大学) University of Washington(华盛顿大学) Brown University(布朗大学) Northwestern University(西北大学)

AI总结 本研究提出HumanCLAW框架与HumanCLAW-Bench基准,测试9个先进VLM发现其均未解决具身动作任务,最优仅16.8%成功率,核心缺失具身自我意识。

Comments Project page: https://human-claw.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20697 2026-08-05 cs.LG cs.CL 版本更新

Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning

Token Buncher: 保护大语言模型免受有害强化学习微调的威胁

Weitao Feng, Lixu Wang, Peizhuo Lv, Tianyi Wei, Jie Zhang, Chongyang Gao, Sinong Zhan, Wei Dong

机构 * Nanyang Technological University(南洋理工大学) Centre for Frontier AI Research, A*STAR(前沿人工智能研究中心,A*STAR) Northwestern University(西北大学)

AI总结 本文提出TokenBuncher,通过限制模型响应熵来防御基于强化学习的有害微调,实验显示其能有效抑制有害行为同时保持正常任务性能。

Comments Accepted by ACM CCS 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01346 2026-08-05 cs.CV 版本更新

CHASE: Competing Hypotheses for Ambiguity-Aware Selective Prediction

CHASE:对抗性假设用于意识化选择预测

Kartik Jhawar, Yuhao Geng, Atul N. Parikh, Lipo Wang

机构 * Institute for Digital Molecular Analytics and Science, NTU, Singapore(数字分子分析与科学研究所,南洋理工大学,新加坡) School of Electrical and Electronic Engineering, NTU, Singapore(电子与电气工程学院,南洋理工大学,新加坡) School of Materials Science and Engineering, NTU, Singapore(材料科学与工程学院,南洋理工大学,新加坡) Singapore Centre for Environmental Life Sciences Engineering, NTU, Singapore(新加坡环境生命科学工程中心,南洋理工大学,新加坡)

AI总结 CHASE通过比较结构化时间解释来确定是否做出决策或 abstain,提升在部分可观测性下的选择预测性能,尤其在高模糊度情况下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27975 2026-08-05 cs.CV cs.AI 版本更新

TransVLM: A Vision-Language Framework and Benchmark for Detecting Any Shot Transitions

TransVLM:一种用于检测任意 shot 转换的视觉-语言框架和基准

Ce Chen, Yi Ren, Yuanming Li, Viktor Goriachko, Zhenhui Ye, Zujin Guo, Zhibin Hong, Mingming Gong

机构 * University of Melbourne(墨尔本大学) HeyGen Research(HeyGen研究院) Nanyang Technological University(南洋理工大学)

AI总结 TransVLM 提出了一种视觉-语言框架,通过注入光流作为关键运动先验,提升对任意 shot 转换的检测能力,同时设计了可扩展的数据引擎和基准测试,实验表明其性能优于传统方法和现有 VLM。

Comments v2: Corrected an inaccurate statement in the abstract regarding production deployment. Accepted by ECCV 2026. For more related research, please visit HeyGen Research (https://www.heygen.com/research) and HeyGen Avatar-V (https://www.heygen.com/research/avatar-v-model). Project page: https://chence17.github.io/TransVLM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07916 2026-08-05 cs.CV 版本更新

Tarot-SAM3: Training-free SAM3 for Any Referring Expression Segmentation

Tarot-SAM3: 无需训练的SAM3用于任意指称表达分割

Weiming Zhang, Dingwen Xiao, Songyue Guo, Guangyu Xiang, Shiqi Wen, Minwei Zhao, Lei Chen, Lin Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学)

AI总结 Tarot-SAM3通过引入推理辅助提示和自修复机制,实现对任意指称表达的高效分割,有效解决传统方法对长或隐含表达的处理难题。

Comments We need to make a huge revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16548 2026-08-05 cs.CR cs.CV 版本更新

SAMSEM -- A Generic and Scalable Approach for IC Metal Line Segmentation

SAMSEM -- 一种通用且可扩展的集成电路金属线分割方法

Christian Gehrmann, Jonas Ricker, Simon Damm, Deruo Cheng, Julian Speith, Yiqiong Shi, Asja Fischer, Christof Paar

机构 * Max Planck Institute for Security and Privacy (MPI-SP)(安全与隐私研究所(MPI-SP)) Ruhr University Bochum (RUB)(博德姆鲁尔大学(RUB)) Nanyang Technological University (NTU)(南洋理工大学(NTU))

AI总结 本文提出SAMSEM,通过改进Meta的Segment Anything Model 2,实现跨不同IC技术节点和制造工艺的金属线分割,实验表明其在不同IC上的分割误差率低至0.62%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12953 2026-08-05 cs.CV cs.AI cs.IR cs.MM 版本更新

Epistemic-aware Vision-Language Foundation Model for Fetal Ultrasound Interpretation

具备知识意识的视觉-语言基础模型用于胎儿超声解读

Xiao He, Huangxuan Zhao, Guojia Wan, Jiancheng Pan, Yanxing Liu, Yong Luo, Juhua Liu, Yongchao Xu, Wei Zhou, Dacheng Tao, Bo Du

机构 * National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University(国家多媒体软件工程技术研究中心,武汉大学计算机学院) College of Computing and Data Science, Nanyang Technological University(computing and Data Science学院,南洋理工大学)

AI总结 FetalMind通过Salient Epistemic Disentanglement方法,提升胎儿超声解读的准确性和效率,实现多视图图像推理和疾病诊断的高效处理。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15599 2026-08-05 eess.AS cs.SD 版本更新

MAGENTA: Magnitude and Geometry-Enhanced Training Approach for Long-Tailed Sound Event Localization and Detection

MAGENTA:面向长尾声音事件定位与检测的幅度与几何增强训练方法

Jun-Wei Yeow, Ee-Leng Tan, Santi Peksi, Woon-Seng Gan

机构 * Smart Nation TRANS Lab, School of Electrical and Electronic Engineering(智能国家TRANS实验室,电子与电气工程学院) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

AI总结 针对长尾声学环境下SELD系统的检测怯懦问题,提出与架构无关的MAGENTA损失框架,通过几何分解回归误差、难度驱动退火等机制,在STARSS23数据集上使聚合SELD误差相对降低20.5%,同时提升尾类性能且不损失头类精度。

Comments Accepted for publication in IEEE Transactions on Audio, Speech, and Language Processing. Substantially expanded from v1

详情

展开后加载摘要…

URL PDF HTML 收藏