arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

2026-06-30 至 2026-06-30 共收录 18
2606.30537 2026-06-30 cs.RO cs.AI cs.CV cs.LG

Learning from Mistakes: Rollout-Retrieval Lifelong Policy Learning for Autonomous Driving

从错误中学习:面向自动驾驶的展开-检索终身策略学习

Cheng Gong, Haoyang Wang, Chao Lu, Zirui Li, Jianwei Gong

机构 * School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院) School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院)

AI总结 提出R²LPL框架,通过从可恢复的闭环驾驶错误中检索纠正目标并进行终身学习,将稀疏失败证据转化为监督知识,持续提升自动驾驶策略性能。

Comments 15 pages, 6 figures. Code available at: https://github.com/Engibacter/R2LPL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30339 2026-06-30 cs.CL cs.LG

REAR: Test-time Preference Realignment through Reward Decomposition

REAR: 通过奖励分解实现测试时偏好重对齐

Fuxiang Zhang, Pengcheng Wang, Chenran Li, Yi-Chen Li, Yuxin Chen, Lang Feng, Chenfeng Xu, Masayoshi Tomizuka, Bo An

机构 * Nanyang Technological University(新加坡国立大学) Nanjing University(南京大学)

AI总结 提出REAR框架,通过将奖励函数分解为问题相关和偏好相关两部分,推导出可线性组合的对齐奖励,实现无需训练的测试时偏好重对齐,适用于多种任务。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30275 2026-06-30 cs.RO

ActiveVital: Geometry-Aware Embodied Vital Signs Monitoring for Home Healthcare Robots

ActiveVital:面向家庭医疗保健机器人的几何感知体感生命体征监测

Yuxuan Hu, Shihao Li, Yang Xiao, Gen Li, Feng Xu, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University, Singapore(MARS实验室,南洋理工大学,新加坡) Fudan University, Shanghai, China(复旦大学,上海,中国)

AI总结 提出ActiveVital框架,通过视觉引导机器人主动调整毫米波雷达与胸腔的几何对齐,将生命体征监测从被动信号恢复转为主动几何调控,显著降低呼吸和心率误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30190 2026-06-30 cs.CV cs.AI cs.LG

Few-Shot Domain Incremental Learning via Continual Vision-Language Consolidation

少样本领域增量学习通过持续视觉-语言整合

Naeem Paeedeh, Mahardhika Pratama, Wolfgang Mayer, Mukesh Prasad, Weiping Ding, Yew-Soon Ong

机构 * School of Computer Science and IT, Adelaide University, Australia(阿德莱德大学计算机科学与信息技术学院,澳大利亚) Faculty of Engineering and IT, University of Technology Sydney (UTS), Australia(悉尼大学工程与信息技术学院(UTS),澳大利亚) School of Artificial Intelligence and Computer Science, Nantong University, China(南通大学人工智能与计算机科学学院,中国) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院,新加坡)

AI总结 针对少样本领域增量学习问题,提出持续视觉-语言整合(CVLC)算法,通过基础域潜在空间预留和双共轭投影(DCP)参数高效微调,融合视觉与语言原型,在多个基准上性能提升高达16%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30085 2026-06-30 cs.CL econ.GN q-fin.EC

Not-quite-human tastes: the stylized omnivorousness of LLM survey surrogates

非完全人类品味:LLM调查替代者的程式化杂食性

Xiangyu Ma, Mengmi Zhang, Shannon Ang, Minne Chen

机构 * Nanyang Technological University Singapore(新加坡南洋理工大学)

AI总结 本研究使用多个大型语言模型生成大量调查替代者,发现其品味存在系统性正向偏差、丧失真实品味结构的复杂关系,且扭曲了品味与社会空间的关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30026 2026-06-30 cs.CV cs.AI

MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs

MuseBench: 多模态大语言模型中意图级视听艺术理解的基准测试

Yuxuan Fan, Gyusik Seo, Jing Hao, Jaemin Cho, Mohit Bansal, Jaehong Yoon

机构 * NTU Singapore(南洋理工大学) The University of Hong Kong(香港大学) Johns Hopkins University(约翰霍普金斯大学) AI2(人工智能研究所) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 提出MuseBench基准,通过4016道涵盖电影、视觉艺术、舞台表演和游戏艺术的选择题,评估多模态大模型对艺术创作意图的理解,发现最佳模型准确率仅48.29%,远低于人类专家的87.18%。

Comments Project page: https://musebench.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29577 2026-06-30 cs.CV cs.AI

ReMAP-PET: Beyond Visual Understanding -- Learning Region-Guided Metabolic Alignment Semantics from Brain PET

ReMAP-PET:超越视觉理解——从脑PET学习区域引导的代谢对齐语义

Dasen Dai, Yanteng Zhang, Shuoqi Li, Yuxiang Wei, Hongjie Yu, Qingxin Zhang, Qizhen Lan, Jagath C. Rajapakse, Vince D. Calhoun

机构 * The Chinese University of Hong Kong, HKSAR(香港中文大学) TReNDS Center (Georgia State, Georgia Tech, Emory)(TReNDS中心(佐治亚州立大学、佐治亚理工学院、埃默里大学)) ShanghaiTech University, Shanghai, P.R.China(上海科技大学) University of California, Berkeley, USA(加州大学伯克利分校) University of Texas Health Science Center at Houston, USA(德克萨斯大学健康科学中心(休斯顿)) Nanyang Technological University, Singapore(南洋理工大学)

AI总结 提出ReMAP-PET框架,通过联合回归和对比学习监督3D ResNet-50学习脑PET的区域代谢语义,在SUVR预测和检索上显著优于基线,并实现与临床语言的对齐及报告生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29531 2026-06-30 cs.CV cs.AI

MotionAtlas: Detailed Region Captioning for Motion-Centric Videos

MotionAtlas: 面向运动中心视频的详细区域描述

Weisong Liu, Haochen Wang, Kuan Gao, Yuhao Wang, Yikang Zhou, Zhongwei Ren, Jacky Mai, Anna Wang, Yanwei Li, Jason Li, Zhaoxiang Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Peking University(北京大学) Wuhan University(武汉大学) Beijing Jiaotong University(北京交通大学)

AI总结 提出MotionAtlas系统,通过区域感知运动描述、自举精炼数据管道和定制训练策略,在运动中心视频描述中显著提升细粒度理解,超越现有模型。

Comments Accepted to ECCV 2026. Project page: https://kagura-0001.github.io/projects/MotionAtlas

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29240 2026-06-30 cs.LG cs.SI

Blackknife: Hard-Label Query-Limited Black-Box Attacks on Heterogeneous Graph Neural Networks

Blackknife: 异构图神经网络上的硬标签、查询受限黑盒攻击

Honglin Gao, Junhao Ren, Lan Zhao, Yue Yang, Jindong Chang, Gaoxi Xiao

机构 * Nanyang Technological University(南洋理工大学) Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心)

AI总结 提出Blackknife框架,在仅依赖局部一跳异构结构和少量硬标签查询的严格黑盒约束下,通过局部关系感知替代模型和投影梯度下降优化离散结构扰动,实现对异构图神经网络的高效攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04050 2026-06-30 cs.LG cs.AI

LiftQuant: Continuous Bit-Width LLM via Dimensional Lifting and Projection

LiftQuant: 通过维度提升和投影实现连续位宽的LLM

Liulu He, XuanAng Liu, Juntao Liu, Taolue Feng, Ting Lu, Chunsheng Gan, Zhiyv Peng, Yuan Du, Huanrui Yang, Yijiang Liu, Li Du

机构 * Nanyang Technological University(南洋理工大学)

AI总结 提出LiftQuant框架,通过“提升-投影”机制实现准连续位宽控制,以精确适配内存预算,在70B模型上以2.4位压缩超越现有2位模型。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02980 2026-06-30 cs.SD cs.CY

A Training-Efficient Transformer-Based Anti-Spoofing Network for Logical Access in ASVspoof 5

一种训练高效的基于Transformer的反欺骗网络用于ASVspoof 5中的逻辑访问

Sidan Yin, Bo Zhao

机构 * Nanyang Technological University(南洋理工大学)

AI总结 针对ASVspoof 5 Track 1封闭条件,提出TFPARN网络,结合焦点分类损失和成对排序损失,通过Transformer编码器和注意力池化实现高效反欺骗,在minDCF和EER上优于AASIST和RawNet2,且推理内存更低、训练更快。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28123 2026-06-30 cs.CV cs.AI cs.CL

Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL

超越SFT到RL:通过黑盒在线策略蒸馏进行预对齐以多模态RL

Sudong Wang, Weiquan Huang, Xiaomin Yu, Zuhao Yang, Hehai Lin, Keming Wu, Chaojun Xiao, Chen Chen, Wenxuan Wang, Beier Zhu, Yunjian Zhang, Chengwei Qin

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出PRISM框架,通过在SFT和RLVR之间插入显式分布对齐阶段,解决多模态RL中的分布漂移问题,利用基于策略蒸馏的对抗游戏提升对齐效果,实验显示在多个RL算法和基准上性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20610 2026-06-30 cs.SE cs.CL

SpecMind: Cognitively Inspired, Interactive Multi-Turn Framework for Postcondition Inference

SpecMind:基于认知的、交互式多轮框架用于后置条件推断

Cuong Chi Le, Minh V. T Pham, Tung Vu Duy, Cuong Duc Van, Huy N. Phan, Hoang N. Phan, Tien N. Nguyen

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) FPT Software AI Center(FPT软件AI中心) VinUniversity(文大学) Nanyang Technological University(南洋理工大学)

AI总结 SpecMind通过多轮交互式提示方法提升后置条件生成的准确性和完整性,利用反馈驱动模型迭代优化,增强代码理解和程序行为对齐。

Comments Accepted in ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19119 2026-06-30 cs.CV

MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images

MonoSR: 从单目图像进行开放词汇空间推理

Qirui Wang, Jingyi He, Yining Pan, Si Yong Yeo, Xulei Yang, Shijie Li

机构 * Technical University of Munich(慕尼黑工业大学) A*STAR Institute of Advanced Intelligence and Computing(新加坡科技研究局高级智能与计算研究所) Singapore University of Technology and Design(新加坡科技设计大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出MonoSR大规模单目空间推理数据集,涵盖多种场景并支持多种问题类型,评估先进视觉-语言模型并分析辅助信息对单目空间推理的重要性,为开放世界中的单目空间推理提供基础。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14511 2026-06-30 cs.RO cs.SY eess.SY

Stability Boundaries and Motor Performance in Delayed Robot-Mediated Dyadic Interactions

延迟机器人介导双人交互中的稳定性边界与运动表现

Mingtian Du, Suhas Raghavendra Kulkarni, Simone Kager, Erkan Kayacan, Domenico Campolo

机构 * Robotics Research Centre, School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空工程学院机器人研究中心) Department of Computer Science and Artificial Intelligence, University of Technology Nuremberg(纽伦堡工业大学计算机科学与人工智能系)

AI总结 本文通过频率域零穿越方法建立了考虑网络诱导时延的机器人介导双人交互系统的稳定性边界,分析了交互刚度对系统稳定性的影响,并通过实验验证了理论稳定性边界与实际运动表现的相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12159 2026-06-30 cs.SE cs.AI

EfficientUICoder: A Bidirectional Token Compression Framework for Efficient MLLM-Based UI Code Generation

EfficientUICoder: 一种用于高效基于多模态大语言模型的UI代码生成的双向标记压缩框架

Jingyu Xiao, Zhongyi Zhang, Yuxuan Wan, Yintong Huo, Yang Liu, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Huazhong University of Science and Technology(华中科技大学) Singapore Management University(新加坡管理大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出EfficientUICoder,通过元素和布局感知标记压缩、区域感知标记精炼和自适应重复标记抑制,有效压缩UI代码生成的标记数量,提升生成效率和代码质量。

Comments Published in the Proceedings of the 2026 ACM International Conference on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07445 2026-06-30 cs.AI

StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley

StarDojo:基于Stardew Valley的多模态大语言模型在生产-生活模拟中的开放性行为基准测试

Weihao Tan, Changjiu Jiang, Yu Duan, Mingcong Lei, Jiageng Li, Yitian Hong, Xinrun Wang, Bo An

机构 * Nanyang Technological University(南洋理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China University of Science and Technology(华东理工大学) Singapore Management University(新加坡管理大学)

AI总结 StarDojo通过Stardew Valley模拟评估多模态大语言模型在生产与社交活动中的综合能力,包含1000个任务,发现GPT-4.1在视觉理解与多模态推理方面存在显著不足。

Comments Accepted by ECCV 2026. Project website: https://weihaotan.github.io/StarDojo

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17559 2026-06-30 cs.AI cs.GT

GraphChase: A Platform and Benchmark for Urban Network Security Games

GraphChase:城市网络安全博弈的平台与基准

Shuxin Zhuang, Shuxin Li, Tianji Yang, Muheng Li, Xianjie Shi, Bo An, Youzhi Zhang

机构 * City University of Hong Kong(香港城市大学) CAIR, Hong Kong Institute of Science & Innovation, CAS(中国科学院香港创新研究院人工智能与机器人创新中心) Nanyang Technological University(南洋理工大学) Georgia Institute of Technology(佐治亚理工学院) University of Toronto(多伦多大学) The University of Hong Kong(香港大学)

AI总结 GraphChase为城市网络安全博弈提供统一平台,支持算法开发与评估,揭示现有方法在鲁棒性和可扩展性上的不足,强调仿真到现实的泛化差距。

详情

展开后加载摘要…

URL PDF HTML 收藏