arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

2026-07-08 至 2026-07-08 共收录 7
2606.03949 2026-07-08 cs.RO 版本更新

Preference-Calibrated Human-in-the-Loop Reinforcement Learning for Robotic Manipulation

偏好校准的人机协同强化学习用于机器人操作

Zeyi Liu, Guangyao Liu, Yinuo Qu, Yuquan Xue, Bofang Jia, Chunhua Yang, Weihua Gui, Keke Huang, Ziwei Wang

机构 * Central South University(中南大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

AI总结 提出PACT框架,通过干预隐式偏好信号进行信用重分配和策略对齐,提升人机协同强化学习的样本效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24690 2026-07-08 cs.CV 版本更新

UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy

UniICL:通过能力导向的分类系统化统一多模态上下文学习

Yicheng Xu, Jiangning Zhang, Zhucun Xue, Teng Hu, Ran Yi, Xiaobin Hu, Yong Liu, Dacheng Tao

机构 * Zhejiang University(浙江大学) Shanghai Jiaotong University(上海交通大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出能力导向的分类系统,通过构建UniICL-760K语料库和UniICL-Bench评估体系,提出Context-Adaptive Prototype Modulator模块,提升多模态少样本学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02401 2026-07-08 cs.CV 版本更新

Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation

超人:统一骨骼与视觉用于人体运动感知与生成

Xinshun Wang, Peiming Li, Ziyi Wang, Zhongbin Fang, Zhichao Deng, Songtao Wu, Jason Li, Mengyuan Liu

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(通用人工智能国家重点实验室,北京大学深圳研究生院) Sony R&D Center(索尼研发中心) Nanyang Technological University(南洋理工大学)

AI总结 针对人体运动分析范式碎片化问题,提出Superman统一框架,通过视觉引导运动分词器创建跨模态运动词汇,训练单一MLLM架构处理多任务,实验表明该方法在运动任务中性能领先或具竞争力,为运动分析提供高效可扩展路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21738 2026-07-08 cs.CV cs.AI 版本更新

From Global to Granular: Revealing IQA Model Performance via Correlation Surface

从全局到粒度:通过相关表面揭示图像质量评估模型性能

Baoliang Chen, Danni Huang, Hanwei Zhu, Lingyu Zhu, Wei Zhou, Shiqi Wang, Yuming Fang, Weisi Lin

机构 * School of Computer Science, South China Normal University(华南师范大学计算机科学学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Computer Science, City University of Hong Kong(香港城市大学计算机科学学院) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) School of Computing and Artificial Intelligence, Jiangxi University of Finance and Economics(江西财经大学计算机科学与人工智能学院) Jiangxi Provincial Key Laboratory of Multimedia Intelligent Processing(江西省多媒体智能处理重点实验室)

AI总结 研究针对IQA模型评估受全局相关度量限制的问题,提出粒度调制相关(GMC)方法,通过粒度调制器和分布调节器分析IQA性能,以相关表面呈现结果,实验证明该方法能揭示标量度量不可见的性能特征,为IQA模型分析等提供更优范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06521 2026-07-08 cs.CV cs.CL 版本更新

BabyVision: Visual Reasoning Beyond Language

BabyVision:超越语言的视觉推理

Liang Chen, Weichu Xie, Yiyan Liang, Hongfeng He, Hans Zhao, Zhibo Yang, Zhiqi Huang, Haoning Wu, Haoyu Lu, Y. charles, Yiping Bao, Yuantao Fan, Guopeng Li, Haiyang Shen, Xuanzhong Chen, Wendong Xu, Shuzheng Si, Zefan Cai, Wenhao Chai, Ziqi Huang, Fangfu Liu, Tianyu Liu, Baobao Chang, Ming Wu, Xiaobo Hu, Kaiyuan Chen, Yixin Ren, Yang Liu, Yuan Gong, Kuan Li

机构 * UniPat AI xbench Alibaba Group(阿里巴巴集团) MoonShot AI StepFun Peking University(北京大学) Tsinghua University(清华大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Princeton University(普林斯顿大学) Nanyang Technological University(南洋理工大学) G Labs Equal Core Contributors(0G Labs 等核心贡献者)

AI总结 研究发现当代多模态语言模型依赖语言先验,在基本视觉任务上表现差。为此引入BabyVision基准评估其核心视觉能力,涵盖多任务。结果显示模型缺乏基本视觉原语,BabyVision的进展迈向人类水平视觉能力,还探索了用生成模型解决视觉推理的方法。

Comments 26 pages, Homepage at https://unipat.ai/blog/BabyVision

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01642 2026-07-08 cs.RO 版本更新

FailSafe: Reasoning and Recovery from Failures in Vision-Language-Action Models

FailSafe: 视觉-语言-动作模型中的失败推理与恢复

Zijun Lin, Jiafei Duan, Haoquan Fang, Dieter Fox, Ranjay Krishna, Cheston Tan, Bihan Wen

机构 * Nanyang Technological University(南洋理工大学) Centre for Frontier AI Research, A*STAR(A*STAR前沿人工智能研究中心) Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

AI总结 提出FailSafe系统,自动生成多样化失败案例及可执行恢复动作,微调LLaVA-OV-7B构建FailSafe-VLM,使机器人检测并恢复失败,在ManiSkill任务上平均提升三个VLA模型性能达22.6%。

Comments IROS 2026. Project Page: https://jimntu.github.io/FailSafe

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07892 2026-07-08 cs.SE cs.AI 版本更新

Leveraging Metamemory Agent for Enhanced Data-Free Code Generation in Large Language Models

利用元记忆智能体增强大语言模型的无数据代码生成

Shengsheng Zhou, Shuai Wang, Liang Ding, Yibing Zhan, Yong Luo, Zheng He, Fu Lin, Dapeng Tao

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院,新加坡) School of Computer Science, National Engineering Research Center for Multimedia Software, Wuhan University, Wuhan, China(多媒体软件国家工程研究中心计算机学院,武汉大学,中国) The University of Sydney, Sydney, Australia(悉尼大学,澳大利亚) Yunnan United Vision Technology Company Ltd., China(云南联合视界技术有限公司,中国) School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机学院,中国) School of Information Science and Engineering, Yunnan University, Kunming, China(云南大学信息科学与工程学院,中国)

AI总结 提出元记忆智能体,通过引导模型回忆、评估和选择性利用相关知识,无需外部示例即可提升无数据场景下的单次代码生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏