arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

National University of Singapore(新加坡国立大学)

共收录 2361
2501.08579 2026-07-07 cs.CL 版本更新

LLM-based Human Simulations Have Not Yet Been Reliable

基于大语言模型的人类模拟尚不可靠

Qian Wang, Jiaying Wu, Zichen Jiang, Zhenheng Tang, Bingqiao Luo, Nuo Chen, Wei Chen, Huacan Wang, Bingsheng He

机构 * National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港理工大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 研究指出基于大语言模型(LLM)的人类模拟不可靠,通过系统回顾找出其在多领域模拟中的问题源于LLM局限与设计缺陷,提出强化数据、提升模型能力及稳健设计的解决框架与算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07447 2026-07-07 cs.PF cs.AI 版本更新

Saving GPU Hours in LLM Inference System Development and Online Workloads with Simulation and DBMS-Inspired Cache Replacement Policies

通过模拟和受数据库管理系统启发的缓存替换策略在大语言模型推理系统开发和在线工作负载中节省GPU时间

Kyoungmin Kim, Jiacheng Li, Kijae Hong, Qunyou Liu, Darong Huang, Anastasia Ailamaki

机构 * EPFL, Switzerland(苏黎世联邦理工学院) NUS, Singapore(新加坡国立大学) POSTECH, South Korea(POSTECH大学)

AI总结 研究大语言模型推理系统,通过模拟和受数据库管理系统启发的缓存替换策略,节省GPU时间,提出新缓存替换策略并证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01299 2026-07-07 cs.CV cs.AI cs.CL cs.LG 版本更新

CausalChaos! Dataset for Comprehensive Causal Action Question Answering Over Longer Causal Chains Grounded in Dynamic Visual Scenes

因果混沌!用于基于动态视觉场景的更长因果链上的综合因果动作问答的数据集

Paritosh Parmar, Eric Peh, Ruirui Chen, Ting En Lam, Yuhan Chen, Elston Tan, Basura Fernando

机构 * Institute of High-Performance Computing, Agency for Science, Technology and Research, Singapore(高性能计算研究所,科技研究局,新加坡) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Singapore Polytechnic(新加坡理工学院)

AI总结 针对因果视频问答中现有数据集因果推理深度不足的问题,利用卡通特性构建CausalChaos!数据集,含因果链等问题并引入错误答案挖掘,为因果关系建模等发展助力。

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02503 2026-07-03 cs.RO 新提交

VT-WAM: Visual-Tactile World Action Model for Contact-Rich Manipulation

VT-WAM: 面向密集接触操作的视觉-触觉世界动作模型

Shuai Tian, Yupeng Zheng, Yuhang Zheng, Songen Gu, Yujie Zang, Yuxing Qin, Weize Li, Haoran Li, Wenchao Ding, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统管理与控制国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) TARS Robotics National University of Singapore(新加坡国立大学) Fudan University(复旦大学)

AI总结 提出VT-WAM,在统一流匹配框架中联合学习视觉预测、触觉变形预测和动作预测,通过非对称混合Transformer注意力和接触门控注意力引导,在六项真实密集接触操作任务中平均成功率71.67%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02291 2026-07-03 cs.LG cs.CV 新提交

Optimizing Visual Generative Models via Distribution-wise Rewards

通过分布级奖励优化视觉生成模型

Ruihang Li, Mengde Xu, Shuyang Gu, Leigang Qu, Fuli Feng, Han Hu, Wenjie Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Hunyuan Frontier Lab, Tencent(腾讯混元前沿实验室) National University of Singapore(新加坡国立大学)

AI总结 提出分布级奖励框架,通过子集替换策略高效估计奖励并优化模型合并系数,解决样本级奖励导致的模式崩溃和视觉异常问题,在SiT和EDM2上显著提升FID-50K。

Comments ICML 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02166 2026-07-03 cs.LG cs.AI 新提交

Dynamic Neural Graph Encoding of Inference Processes in Deep Weight Space

深度权重空间中推理过程的动态神经图编码

Di Wu, Huan Liu, Zhixiang Chi, Yuanhao Yu, Konstantinos N. Plataniotis, Yang Wang

机构 * University of Toronto(多伦多大学) National University of Singapore(新加坡国立大学) McMaster University(麦马斯特大学) Concordia University(康科迪亚大学)

AI总结 提出动态神经图编码器(DNG-Encoder),通过动态图表示神经网络参数并保留推理的时序特性,在INR分类任务上比现有方法提升约10%准确率。

Comments Published in Transactions on Machine Learning Research (TMLR), 2026. 28 pages, 5 figures

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02018 2026-07-03 cs.CV 新提交

UnderOneFacade: Worldwide Facade Semantic Segmentation Benchmark Dataset

UnderOneFacade:全球立面语义分割基准数据集

Yi Wang, Fan Wang, Prabin Gyawali, Ziyang Xu, Anna Klimkowska, Yixiong Jing, Wanru Yang, Filip Biljecki, Christoph Holst, Benjamin Busam, Brian Sheil, Olaf Wysocki

机构 * Technical University of Munich(慕尼黑工业大学) University of Cambridge(剑桥大学) University of Nottingham(诺丁汉大学) National University of Singapore(新加坡国立大学)

AI总结 针对现有立面解析数据集地理范围窄、语义不一致的问题,提出全球最大跨国家、跨洲的3D立面基准UnderOneFacade,包含27亿标注点,评估多种模型并揭示其跨域性能下降,为鲁棒可迁移的3D分割模型提供基准。

Comments accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01952 2026-07-03 cs.CV 新提交

Personalized 4D Whole-Heart Mesh Reconstruction from Cine MRI via Multi-Scale Temporal Modeling and Differentiable Contour Rendering

基于多尺度时间建模与可微分轮廓渲染的个性化4D全心网格重建

Xiaoyue Liu, Dongcheng Cang, Xiaohan Yuan, Mark YY Chan, Ching-Hui Sia, Lei Li

机构 * Department of Biomedical Engineering, National University of Singapore(新加坡国立大学生物医学工程系) School of Automation, Southeast University(东南大学自动化学院) Department of Medicine, National University of Singapore(新加坡国立大学医学系) Department of Cardiology, National University Heart Centre Singapore(新加坡国立大学心脏中心心脏病学系)

AI总结 提出端到端框架,从稀疏电影MRI重建4D全心网格,利用可微分轮廓渲染和多尺度时间建模,实现低误差(1.68 mm)和高运动平滑度。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01819 2026-07-03 eess.SY cs.LG cs.SY 新提交

Koopman operator theory: fundamentals, control, and applications

Koopman算子理论:基础、控制与应用

Igor Mezić, Jorge Cortés, Karl Worthmann, Mircea Lazar, Armin Lederer

机构 * Department of Mechanical Engineering, University of California, Santa Barbara(加州大学圣芭芭拉分校机械工程系) Department of Mechanical and Aerospace Engineering, University of California, San Diego(加州大学圣地亚哥分校机械与航空航天工程系) Optimization-based Control Group, TU Ilmenau(图林根工业大学优化控制组) Constrained Control of Complex Systems Lab, Control Systems Group, Department of Electrical Engineering, TU Eindhoven(埃因霍温理工大学复杂系统约束控制实验室,控制系统组,电气工程系) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系)

AI总结 本文介绍Koopman算子理论,通过数据驱动方法(如EDMD和机器学习)构建非线性系统的全局线性表示,并扩展到有输入系统的控制器设计,提供仿真代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01800 2026-07-03 cs.LG cs.CL 新提交

Do LLMs Truly Generalize in the Molecular Domain? A Perturbation-Based Analysis

LLMs 在分子领域真的能泛化吗?基于扰动的分析

Jiatong Li, Weida Wang, Changmeng Zheng, Shufei Zhang, Yatao Bian, Xiao-yong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学) Shanghai AI Lab(上海人工智能实验室) Fudan University(复旦大学)

AI总结 提出分子扰动框架,通过控制图编辑距离生成结构变体,揭示分子LLMs对微小结构变化敏感,局部信任区域狭窄;上下文调优可部分缓解脆弱性。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01764 2026-07-03 cs.AI 新提交

Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction

Mastermind: 基于策略学习的仓库级漏洞复现

Mingzhe Du, Luu Anh Tuan, Tianyi Wu, Renyang Liu, Zhijiang Guo, Dong Huang, See-Kiong Ng

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 提出Mastermind双循环框架,通过策略学习(SFT+GRPO)提升LLM代理在仓库级漏洞复现中的表现,在260个训练任务和200个测试任务上达到84.5%通过率,并成功迁移至不同执行器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01621 2026-07-03 cs.AI 新提交

Spatial Support Matters: Geometry-Aware Graph Fusion for Rainfall Field Reconstruction

空间支撑至关重要:面向降雨场重建的几何感知图融合

Low Jun Yu, Niramay Kachhadiya, Herath Mudiyanselage Viraj Vidura Herath, Sanka Rasnayaka, Lucy Amanda Marshall

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) Faculty of Engineering, The University of Sydney(悉尼大学工程学院)

AI总结 针对降雨场重建中多源观测支撑(点、线、面)的几何差异问题,提出几何感知多支撑异构图神经网络,通过跨支撑消息传递融合并重建降雨场,在新加坡数据上RMSE降低23.2%。

Comments Submitted to WACV 2027, applications track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07931 2026-07-03 math.PR cond-mat.stat-mech cs.IT cs.LG math.IT math.ST stat.TH 新提交

Pointwise Complexity for Gaussian Fields: Upper Envelopes, Algorithmic Lower Bounds, and Separation

高斯场的逐点复杂度:上包络、算法下界与分离

Yunbei Xu

机构 * National University of Singapore(新加坡国立大学)

AI总结 本文证明了一个方差感知的逐点主测度定理,为高斯过程提供高概率上包络,并通过贝叶斯算法下界和加权基示例,揭示了逐点复杂度与全局极小极大风险之间的分离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03056 2026-07-03 cs.AI 版本更新

SkillDAG: Self-Evolving Typed Skill Graphs for LLM Skill Selection at Scale

SkillDAG:面向大规模LLM技能选择的自演化类型化技能图

Tong Bai, Zhenglin Wan, Pengfei Zhou, Xingrui Yu, Yang You, Ivor W. Tsang

机构 * Fudan University(复旦大学) National University of Singapore(国立新加坡大学) CFAR A*STAR

AI总结 提出SkillDAG,通过类型化有向图建模技能间关系,并作为推理时可调用的结构化检索接口,支持在线演化,在ALFWorld和SkillsBench上显著超越基线。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16046 2026-07-03 cs.SE cs.AI 版本更新

XSearch: Explainable Code Search via Concept-to-Code Alignment

XSearch: 通过概念到代码对齐实现可解释的代码搜索

Yiming Liu, Ruofan Liu, Yun Lin, Zicong Zhang, Weiyu Kong, Pengnian Qi, Xiao Cheng, Weinan Zhang, Qianxiang Wang, Linpeng Huang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学) Huawei Technologies Co., Ltd(华为技术有限公司)

AI总结 本文提出XSearch框架,通过将代码搜索转化为概念对齐问题,提升代码搜索的可解释性和泛化能力,在分布偏移基准测试中性能提升显著。

Comments Accepted to ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27313 2026-07-03 cs.RO 版本更新

MetaTune: Adjoint-based Meta-tuning via Robotic Differentiable Dynamics

MetaTune: 通过机器人可微动力学进行基于共轭的元调优

Xiexin Peng, Bingheng Wang, Tao Zhang, Que Dong, Ying Zheng

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) The Shenzhen Huazhong University of Science and Technology Research Institute(华中科技大学深圳研究院)

AI总结 本文提出MetaTune框架,通过可微闭环元学习实现反馈控制器与扰动观测器的联合自调优,减少计算复杂度并提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19013 2026-07-03 cs.CV 版本更新

GenHOI: Generalized Hand-Object Pose Estimation with Occlusion Awareness

GenHOI:具有遮挡意识的通用手-物体姿态估计

Hui Yang, Wei Sun, Jian Liu, Jian Xiao, Tao Xie, Hossein Rahmani, Ajmal Saeed Mian, Nicu Sebe, Gim Hee Lee

机构 * Hunan University(湖南大学) Lancaster University(兰卡斯特大学) University of Western Australia(西澳大学) University of Trento(特伦托大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出GenHOI框架,通过整合层次语义知识与手部先验,提升在遮挡条件下手-物体姿态估计的泛化能力,实验表明在DexYCB和HO3Dv2基准上达到SOTA性能。

Comments European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00671 2026-07-02 cs.LG cs.AI 新提交

Multi-Label Node Classification with Label Influence Propagation

多标签节点分类中的标签影响传播

Yifei Sun, Zemin Liu, Bryan Hooi, Yang Yang, Rizal Fathony, Jia Chen, Bingsheng He

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Capital One GrabTaxi Holdings Pte. Ltd.(GrabTaxi控股私人有限公司)

AI总结 提出标签影响传播(LIP)模型,通过分解GNN的消息传递为传播和变换操作,量化标签间影响,构建标签影响图传播高阶影响,动态调整学习过程,在多标签节点分类任务上超越现有方法。

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00529 2026-07-02 cs.CV 新提交

NoPA: Non-Parametric Online 3D Scene Graph Generation

NoPA: 非参数化在线3D场景图生成

Qi Xun Yeo, Seungjun Lee, Yan Li, Gim Hee Lee

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系)

AI总结 针对现有3D场景图生成方法无法实时运行的问题,提出NoPA,用非参数化分布表示物体,保留几何细节,并通过基于最大均值差异的合并策略和关系传播,实现实时且准确的在线场景图生成。

Comments This paper has been accepted in ECCV 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00115 2026-07-02 cs.CV 新提交

PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking

PixelEyes: 解耦感知与推理以实现精准视觉证据查找

Dengxian Gong, Yuanzheng Wu, Haobo Yuan, Zhengdong Hu, Tao Zhang, Yikang Zhou, Shihao Chen, Quanzhu Niu, Kai Wang, Jason Li, Haochen Wang, Lu Qi, Shunping Ji, Ming-Hsuan Yang

机构 * Wuhan University(武汉大学) UC Merced(加州大学默塞德分校) UTS(UTS大学) NUS(新加坡国立大学) NTU(南洋理工大学) CASIA(中国科学院自动化所)

AI总结 针对多轮视觉推理中目标定位失败导致轨迹冗余的问题,提出PixelEyes,通过解耦推理与感知(推理器决定查找目标,专用感知工具定位),引入掩码引导视觉搜索和语义区域广度优先搜索,构建PixelEyes-6K数据集和Pinpoint-Bench基准,显著提升定位准确性。

Comments 22pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00060 2026-07-02 cs.CV 新提交

Synergistic Perception-Reasoning Governance: Grounding Medical MLLMs with Verifiable Anatomical Evidence

协同感知-推理治理:用可验证解剖证据为医学多模态大语言模型提供基础

Rui Hao, Qiankun Li, Junyuan Mao, Linghao Meng, Dirui Xie, Dayu Tan, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) Imperial Global Singapore, Imperial College London(帝国理工学院新加坡全球中心) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Anhui University(安徽大学)

AI总结 提出一种无需训练的证据注入框架,通过ROI引导的视觉激活调制和解剖坐标语义标记,协同校准视觉感知与文本推理,动态路由任务特定干预,有效减少医学MLLM的幻觉。

Comments Accepted by MICCAI 2026 (Early Accept, Top 9%)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01080 2026-07-02 cs.LG cs.IT math.IT 新提交

Balancing Expressivity and Learnability in Quantum Kernel Bandit Optimization

平衡量子核赌博机优化中的表达性与可学习性

Yuqi Huang, Vincent Y. F. Tan, Sharu Theresa Jose

机构 * National University of Singapore(新加坡国立大学) University of Birmingham(伯明翰大学)

AI总结 针对量子核高斯过程赌博机优化,提出投影量子核与经典核近似技术以降低特征维度,推导了误设定GP赌博机算法的遗憾界,平衡了近似误差与信息增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18367 2026-07-02 cs.LG 新提交

Do Time Series Foundation Model Benchmarks Hide Regime-Dependent Failures? Evidence from Traffic Speed Forecasting

时间序列基础模型基准是否隐藏了依赖于状态的失败?来自交通速度预测的证据

Yingshuo Wang, Xian Sun, Lingdong Kong, Wei Gao, Yanhang Li, Zhichao Fan, Zexin Zhuang

机构 * University of California, Berkeley(加州大学伯克利分校) Duke University(杜克大学) National University of Singapore(新加坡国立大学) Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Southern Methodist University(南卫理公会大学)

AI总结 本文提出状态分层评估方法,发现时间序列基础模型在交通状态转换时准确率和预测区间覆盖率显著下降,并提出了双峰混合增强方法以改善转换状态覆盖。

Comments 5 pages, 2 figures. Accepted at the Workshop on Forecasting as a New Frontier of Intelligence, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27757 2026-07-02 cs.CV cs.RO 版本更新

E-TIDE: Fast, Structure-Preserving Motion Forecasting from Event Sequences

E-TIDE:从事件序列中快速、结构保持的运动预测

Biswadeep Sen, Benoit R. Cottereau, Nicolas Cuperlier, Terence Sim

机构 * National University of Singapore(新加坡国立大学) IPAL CNRS IRL 2955 CerCo, CNRS UMR 5549, Université de Toulouse(CerCo, CNRS UMR 5549, 图卢兹大学) ETIS UMR8051, CY Cergy Paris Université, ENSEA, CNRS(ETIS UMR8051, CY塞尔吉巴黎大学, ENSEA, 法国国家科学研究中心)

AI总结 本文提出E-TIDE,一种轻量级端到端架构,用于高效预测事件张量,通过高效时空交互设计捕捉时间依赖性,实现低计算复杂度下的高性能运动预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12110 2026-07-02 cs.CV cs.AI 版本更新

MediRound: Multi-Round Entity-Level Reasoning Segmentation in Medical Images

MediRound:医学图像中的多轮实体级推理分割

Qinyue Tong, Ziqian Lu, Jun Liu, Rui Zuo, Zheming Lu, Yueming Jin

机构 * Zhejiang University(浙江大学) Zhejiang Sci-Tech University(浙江理工大学) National University of Singapore(新加坡国立大学)

AI总结 提出多轮实体级医学推理分割任务MEMR-Seg,构建大规模数据集MR-MedSeg,并设计基线模型MediRound,通过判断与纠正机制缓解错误传播,在医学教育场景中优于传统方法。

Comments In this version, we have improved some suboptimal expressions in the manuscript and completed the authors' information, such as ORCID IDs

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31933 2026-07-01 cs.CV 新提交

No Place to Hide: Benchmarking Video Hallucination with Background-Controlled Pairs

无处可藏:基于背景控制对的视频幻觉基准测试

Haojian Huang, Harold Haodong Chen, Meng Luo, Junjia Du, Shanqing Xu, Ziheng Chen, Yanxiang Huang, Yinchuan Li, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Knowin AI(考恩人工智能) The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Huazhong University of Science and Technology(华中科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 提出VidPair-Halluc基准,通过背景相似但前景语义不同的视频对,精确评估大型视频模型中的视频幻觉,包含1K对抗视频对和11K时空问答对。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31435 2026-07-01 cs.AI cs.CL 新提交

CDR-Bench: Evaluating Faithful Execution of Compositional, Order-Sensitive Data Refinement Recipes

CDR-Bench:评估组合式、顺序敏感数据精炼配方的忠实执行

Yuchen Huang, Xiang Li, Zhenqing Ling, Sijia Li, Qianli Shen, Daoyuan Chen, Yi R. Fung, Yaliang Li

机构 * HKUST(香港科技大学) NUS(新加坡国立大学)

AI总结 提出CDR-Bench基准,包含3462个高质量任务,评估LLM在组合式和顺序敏感设置下直接执行数据精炼配方的能力,发现当前LLM缺乏程序忠实性。

Comments 29 pages, 20 figures. Corresponding authors: Daoyuan Chen and Yi R. Fung

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31392 2026-07-01 cs.AI 新提交

ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents

ReGRPO: 用于工具使用智能体的反思增强策略优化

Binjie Zhang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab)

AI总结 提出ReGRPO框架,通过反思数据引擎和联合优化反射令牌与纠正动作,提升工具使用智能体在故障后的恢复能力,在GTA和GAIA上取得最佳效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31257 2026-07-01 cs.CV 新提交

Decodable Is Not Grounded: A Vision-Ablation Arbiter for VLM Spatial Reasoning

可解码不等于已接地:用于VLM空间推理的视觉消融仲裁器

Chih-Ting Liao, Fei Shen, Xin Cao, Tat-Seng Chua

机构 * University of New South Wales(新南威尔士大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出一种视觉消融仲裁方法,通过将图像替换为灰色空白,揭示视觉语言模型在空间推理中存在的三种接地机制:接地、先验和反转,并证明线性探针和转向恢复会系统性地高估模型的实际视觉接地能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31023 2026-07-01 cs.CR cs.LG 新提交

Certified Speculative Execution for Untrusted AI Agents

不可信AI代理的认证推测执行

Chenyu Zhou, Qiliang Jiang, Shuning Wu, Xu Zhou

机构 * School of Engineering, Institute of Science Tokyo, Japan(东京科学大学工学院) College of Control Science and Engineering, Zhejiang University, China(浙江大学控制科学与工程学院) Department of Electrical and Computer Engineering, National University of Singapore, Singapore(新加坡国立大学电气与计算机工程系)

AI总结 提出证书门控前缀接受(CGPA)方法,通过可信验证器、保形校准值边界和求解器延迟机制,实现安全、遗憾和速度的解耦,将不可信AI代理的违规率降至零。

Comments 15 pages, 2 figures, 24 tables. Includes a technical appendix (full proofs and all supplementary tables)

详情

展开后加载摘要…

URL PDF HTML 收藏