arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

National University of Singapore(新加坡国立大学)

2026-07-01 至 2026-07-01 共收录 11
2606.31933 2026-07-01 cs.CV 新提交

No Place to Hide: Benchmarking Video Hallucination with Background-Controlled Pairs

无处可藏:基于背景控制对的视频幻觉基准测试

Haojian Huang, Harold Haodong Chen, Meng Luo, Junjia Du, Shanqing Xu, Ziheng Chen, Yanxiang Huang, Yinchuan Li, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Knowin AI(考恩人工智能) The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Huazhong University of Science and Technology(华中科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 提出VidPair-Halluc基准,通过背景相似但前景语义不同的视频对,精确评估大型视频模型中的视频幻觉,包含1K对抗视频对和11K时空问答对。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31435 2026-07-01 cs.AI cs.CL 新提交

CDR-Bench: Evaluating Faithful Execution of Compositional, Order-Sensitive Data Refinement Recipes

CDR-Bench:评估组合式、顺序敏感数据精炼配方的忠实执行

Yuchen Huang, Xiang Li, Zhenqing Ling, Sijia Li, Qianli Shen, Daoyuan Chen, Yi R. Fung, Yaliang Li

机构 * HKUST(香港科技大学) NUS(新加坡国立大学)

AI总结 提出CDR-Bench基准,包含3462个高质量任务,评估LLM在组合式和顺序敏感设置下直接执行数据精炼配方的能力,发现当前LLM缺乏程序忠实性。

Comments 29 pages, 20 figures. Corresponding authors: Daoyuan Chen and Yi R. Fung

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31392 2026-07-01 cs.AI 新提交

ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents

ReGRPO: 用于工具使用智能体的反思增强策略优化

Binjie Zhang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab)

AI总结 提出ReGRPO框架,通过反思数据引擎和联合优化反射令牌与纠正动作,提升工具使用智能体在故障后的恢复能力,在GTA和GAIA上取得最佳效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31257 2026-07-01 cs.CV 新提交

Decodable Is Not Grounded: A Vision-Ablation Arbiter for VLM Spatial Reasoning

可解码不等于已接地:用于VLM空间推理的视觉消融仲裁器

Chih-Ting Liao, Fei Shen, Xin Cao, Tat-Seng Chua

机构 * University of New South Wales(新南威尔士大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出一种视觉消融仲裁方法,通过将图像替换为灰色空白,揭示视觉语言模型在空间推理中存在的三种接地机制:接地、先验和反转,并证明线性探针和转向恢复会系统性地高估模型的实际视觉接地能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31023 2026-07-01 cs.CR cs.LG 新提交

Certified Speculative Execution for Untrusted AI Agents

不可信AI代理的认证推测执行

Chenyu Zhou, Qiliang Jiang, Shuning Wu, Xu Zhou

机构 * School of Engineering, Institute of Science Tokyo, Japan(东京科学大学工学院) College of Control Science and Engineering, Zhejiang University, China(浙江大学控制科学与工程学院) Department of Electrical and Computer Engineering, National University of Singapore, Singapore(新加坡国立大学电气与计算机工程系)

AI总结 提出证书门控前缀接受(CGPA)方法,通过可信验证器、保形校准值边界和求解器延迟机制,实现安全、遗憾和速度的解耦,将不可信AI代理的违规率降至零。

Comments 15 pages, 2 figures, 24 tables. Includes a technical appendix (full proofs and all supplementary tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30755 2026-07-01 cs.CR cs.AI 新提交

Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens

通过计算机系统视角理解与评估爪类智能体安全性

Peizhi Niu, Wenjie Qu, Shangding Gu, Tianneng Shi, Yuankai Li, Ahmad Tawaha, Hend Alzahrani, Vincent Siu, Boyi Li, Chenguang Wang, Jiaheng Zhang, Basel Alomair, Ming Jin, Muhao Chen, Chi Wang, Costas Spanos, Dawn Song

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) NUS(新加坡国立大学) UC Berkeley(加州大学伯克利分校) UC Davis(加州大学戴维斯分校) Virginia Tech(弗吉尼亚理工大学) KACST(阿卜杜勒阿齐兹国王科技城) UC Santa Cruz(加州大学圣克鲁兹分校) NVIDIA(英伟达) Google DeepMind(谷歌DeepMind) UW Seattle(华盛顿大学西雅图分校) HUMAIN(胡迈因研究所)

AI总结 针对爪类AI智能体安全漏洞,提出计算机系统类比,构建SafeClawArena基准测试,评估406个对抗任务,发现最高攻击成功率70%,恶意插件100%成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08758 2026-07-01 eess.IV cs.CV 版本更新

M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding

M3CoTBench:医学图像理解中多模态大语言模型的思维链基准测试

Juntao Jiang, Jiangning Zhang, Yali Bi, Jinsheng Bai, Weixuan Liu, Weiwei Jin, Zhucun Xue, Yong Liu, Xiaobin Hu, Shuicheng Yan

机构 * Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) East China Normal University(华东师范大学) Zhejiang Provincial People’s Hospital(浙江省人民医院) National University of Singapore(新加坡国立大学)

AI总结 提出M3CoTBench基准,通过多层级难度数据集和专用评估指标,系统评测多模态大语言模型在医学图像理解中的思维链推理正确性、效率、影响和一致性。

Comments 39 pages, 8 figures; accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07939 2026-07-01 cs.RO physics.flu-dyn 版本更新

Unified Structural-Hydrodynamic Modeling of Underwater Underactuated Mechanisms and Soft Robots

水下欠驱动机构与软体机器人的统一结构-水动力学建模

Chenrui Zhang, Yiyuan Zhang, Yunfei Ye, Junkai Chen, Haozhe Wang, Cecilia Laschi

机构 * Department of Mechanical Engineering and Advanced Robotics Centre, National University of Singapore(新加坡国立大学机械工程系与先进机器人中心) Singapore-MIT Alliance for Research and Technology (SMART) Centre(新加坡-麻省理工学院研究与技术联盟中心)

AI总结 提出一种轨迹驱动的全局优化框架,基于CMA-ES同时识别弹性、阻尼和分布式水动力学参数,实现水下欠驱动机构和软体机器人的高保真建模,仅需单段视频。

Comments The first two listed authors contributed equally. Yiyuan Zhang is the corresponding author. This paper has been accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20055 2026-07-01 cs.RO cs.AI cs.CV 版本更新

CoReLIN: Constraint-based Reasoning for Zero-shot Lifelong Interactive Navigation

CoReLIN: 基于约束推理的零样本终身交互式导航

Apoorva Vashisth, Manav Kulshrestha, Pranav Bakshi, Damon Conover, Guillaume Sartoretti, Aniket Bera

机构 * Purdue University(普渡大学) Indian Institute of Technology, Kharagpur(印度理工学院卡哈拉格普尔分校) DEVCOM Army Research Lab(DEVCOM陆军研究实验室) National University of Singapore(新加坡国立大学)

AI总结 提出CoReLIN框架,利用LLM和场景图推理,在终身交互式导航中通过移动物体开辟路径并完成任务,显著提升长期效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15614 2026-07-01 cs.RO 版本更新

AION: Aerial Indoor Object-Goal Navigation Using Dual-Policy Reinforcement Learning

AION: 基于双策略强化学习的空中室内目标导航

Zichen Yan, Yuchen Hou, Shenao Wang, Yichao Gao, Rui Huang, Lin Zhao

机构 * Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电子与计算机工程系)

AI总结 提出AION,一种端到端双策略强化学习框架,解耦探索与目标到达行为,用于视觉空中目标导航,无需外部定位或全局地图,在AI2-THOR和IsaacSim中验证了优越性能。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17979 2026-07-01 cs.CV 版本更新

FeRA: Frequency-Energy Constrained Routing for Effective Diffusion Adaptation Fine-Tuning

FeRA: 面向高效扩散自适应微调的频率能量约束路由

Bo Yin, Xiaobin Hu, Xingyu Zhou, Yu He, Peng-Tao Jiang, Yue Liao, Junwei Zhu, Jiangning Zhang, Ying Tai, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) vivo Tencent(腾讯) Nanjing University(南京大学)

AI总结 提出FeRA框架,通过揭示扩散模型去噪过程中的频率能量机制,利用频率能量指示器、软频率路由和频率能量一致性正则化,实现参数更新与内在频率能量进程对齐,从而高效稳定地微调扩散模型。

详情

展开后加载摘要…

URL PDF HTML 收藏