arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

National University of Singapore(新加坡国立大学)

共收录 304
2606.13755 2026-06-26 cs.CY cs.AI cs.LG 新提交

Position: Align AI to Our Aspirations, Not Our Flaws

立场:将AI对齐于我们的抱负,而非缺陷

Nikita Kazeev, Bui Nhat Huyen Phan

机构 * National University of Singapore(新加坡国立大学)

AI总结 本文主张AI不应与聚合的人类偏好对齐,而应基于能力、事实准确性、诚实和合法性等客观目标底线,在底线之上允许多元价值权衡。

Journal ref Pluralistic Alignment Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11171 2026-06-26 cs.LG cond-mat.stat-mech cs.IT math.IT math.OC math.ST stat.TH 新提交

Bellman-sufficient Information Complexity

核赌博机中的算法与极小极大复杂度

Yunbei Xu

机构 * National University of Singapore(新加坡国立大学)

AI总结 本文通过统一MAIR框架,将GP-UCB与MAMS算法置于共同语言下,提出结合两者优势的安全主算法,并证明在过参数化模型中算法复杂度比类宽极小极大或DEC证书更具信息性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25504 2026-06-25 cs.RO 新提交

GROVE: Grounded Pedestrian Simulation via Natural Language for Interactive Social Robot Navigation

GROVE: 基于自然语言的地面行人仿真用于交互式社交机器人导航

Duc Tai Nguyen, Volodymyr Shcherbyna, Anh Do Duc, Zhengcheng Shen, Teham Buiyan, Linh Kästner

机构 * Singapore Management University(新加坡管理大学) Technical University Berlin(柏林工业大学) National University of Singapore(新加坡国立大学)

AI总结 提出GROVE框架,通过自然语言指令生成逼真且具有社交挑战性的行人仿真场景,结合多种SotA方法模拟长时人类行为、中时行人导航和短时机器人社交交互,缩小仿真到现实的差距。

Comments Accepted at IROS 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25442 2026-06-25 cs.CL 新提交

PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models

PolicyAlign: 大型语言模型的直接基于策略的安全对齐

Chang Wu, Junfeng Fang, Houcheng Jiang, Kai Tang, Pengyu Cheng, Xiaoxi Jiang, Guanjun Jiang, Xiang Wang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴通义千问大模型应用团队) National University of Singapore(新加坡国立大学) Zhongguancun Academy(中关村学院)

AI总结 提出PolicyAlign框架,通过合成违规指令和策略敏感过滤,直接根据自然语言安全策略对齐LLM,提升安全性并保持低过度拒绝和通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25360 2026-06-25 cs.RO 新提交

Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning

解耦语义与几何基础:面向语言条件模仿学习的空间视觉提示

Yanzhe Tang, Xinyu Shao, Yuxuan Hu, Siyu Chen, Bowen Yang, Yajun Gao, Tongtong Cao, Xiu Li, Long Zeng

机构 * Tsinghua University(清华大学) Huawei Technologies Co., Ltd.(华为技术有限公司) National University of Singapore(新加坡国立大学)

AI总结 提出SVP-IL解耦架构,通过视觉语言基础模型将指令解析为零样本几何掩码,生成空间视觉提示并注入连续动作生成器,在低数据条件下显著提升语言条件模仿学习的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24994 2026-06-25 cs.LG cs.AI 新提交

ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning

ExTra: 面向语言模型强化学习的探索性轨迹优化

Wenyang Hu, Junxiang Jia, Zhen Shu, Daniel Dahlmeier, See-Kiong Ng, Bryan Kian Hsiang Low

机构 * National University of Singapore(新加坡国立大学) SAP

AI总结 提出ExTra框架,通过新颖性奖励和熵引导前缀再生增强GRPO,在数学推理基准上提升pass@1约5%、pass@16约7%。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24958 2026-06-25 cs.LG cs.RO math.DS 新提交

Swarm-Inspired Generation of Collective Behaviors in Graph Dynamical Systems

图动力系统中集体行为的群智能启发生成

Ji Chen, Song Chen, Chengzhang Gong, Li Fan, Chao Xu

机构 * Zhejiang University(浙江大学) Huzhou Institute of Zhejiang University(浙江大学湖州研究院) National University of Singapore(新加坡国立大学)

AI总结 提出SIES框架,结合显式动力学与局部智能体,学习可泛化的局部交互规则,实现图上的可控同步控制与异配图表示学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22027 2026-06-25 cs.RO cs.AI 新提交

RARM: Confidence-Gated Progress Reward Modeling for RL in Manipulation

RARM:基于置信度门控的进展奖励建模用于操作中的强化学习

Pengzhi Yang, Xinyu Wang, Pengyu Jing, Kehan Wen, Yiduo Qu, Zhenhao Huang, Minghao Fu, Xin Liu, Yaheng Shen, Fan Shi

机构 * NUS Human-Centered Robotic Lab(新加坡国立大学人机共融机器人实验室) University of Cambridge(剑桥大学) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

AI总结 提出参考锚定奖励模型(RARM),通过对比时间目标从通用视频中学习,将单个成功演示转化为密集进展奖励,并在部署时通过置信度门控抑制虚假正奖励,在长时域操作任务中显著提升强化学习成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24636 2026-06-24 cs.AI 新提交

CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning

CineCap: 基于时空锚点的结构化推理用于电影化视频描述

Xinyu Mao, Yuhui Zeng, Xiaokun Liu, Wenyu Qin, Meng Wang, Xin Tao, Pengfei Wan, Xiaohan Xing, Max Meng

机构 * The Chinese University of Hong Kong(香港中文大学) Xiamen University(厦门大学) Kling Team, Kuaishou Technology(快手科技Kling团队) National University of Singapore(新加坡国立大学) Southern University of Science and Technology(南方科技大学)

AI总结 提出CineCap框架,通过时空锚点结构化推理和强化学习(覆盖完整性、准确性和门控覆盖奖励)生成电影化视频描述,在CineCap Bench基准上达到新最优。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24552 2026-06-24 cs.RO 新提交

Enabling Robust Cloth Manipulation via Inference-Time Simulator-in-the-Loop Refinement

通过推理时仿真器在环优化实现鲁棒的布料操作

Xin Liu, Yulin Li, Ziming Li, Pengyu Jing, Zhenhao Huang, Bingyang Zhou, Ziqiu Zeng, Siyuan Luo, Chenkun Qi, Fan Shi

机构 * National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出基于仿真器在环优化的布料操作框架,通过合成数据训练的真实到仿真模块和稀疏网格滚动结合先验引导MPPI,从单RGB输入实现鲁棒操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24510 2026-06-24 cs.AI cs.CL 新提交

A specialized reasoning large language model for accelerating rare disease diagnosis: a randomized AI physician assistance trial

一种用于加速罕见病诊断的专用推理大语言模型:随机AI辅助医生试验

Haichao Chen, Songchi Zhou, Zhengyun Zhao, Shikai Hu, Xianghong Jin, Hongwei Ji, Li He, Shuli Li, Yiming Qin, Xin Tan, Runfeng Shi, Yih Chung Tham, Jiaye Zhu, Ye Li, Ye Jin, Longhao Cao, Dawei Li, Honghan Wu, Hongqiu Gu, Guanqiao Li, Tudor Groza, Chunying Li, Dian Zeng, Weihong Yu, Gareth Baynam, Saumya Shekhar Jamuar, Min Shen, Shuyang Zhang, Bin Sheng, Sheng Yu, Tien Yin Wong

机构 * Tsinghua Medicine, Tsinghua University(清华大学医学部,清华大学) Department of Ophthalmology, Peking Union Medical College Hospital, Chinese Academy of Medical Sciences & Peking Union Medical College(北京大学人民医院眼科,中国医学科学院 & 北京大学医学部) Department of Statistics and Data Science, Tsinghua University(清华大学统计与数据科学系) Department of Rheumatology and Clinical Immunology, Peking Union Medical College Hospital, Chinese Academy of Medical Sciences & Peking Union Medical College(北京大学人民医院风湿免疫科,中国医学科学院 & 北京大学医学部) Department of Rare Diseases, Peking Union Medical College Hospital, Chinese Academy of Medical Sciences & Peking Union Medical College(北京大学人民医院罕见病科,中国医学科学院 & 北京大学医学部) Department of Dermatology, Xijing Hospital, Air Force Medical University(西安空军军医大学西京医院皮肤科) School of Computer Science and Technology, East China Normal University (ECNU)(东华大学计算机科学与技术学院) Department of Neurosurgery, Xuanwu Hospital, Capital Medical University(首都医科大学宣武医院神经外科) Department of Ophthalmology, National University of Singapore(新加坡国立大学眼科) Singapore Eye Research Institute, Singapore National Eye Centre(新加坡眼科学研究所,新加坡国家眼科中心) Ophthalmology and Visual Science Academic Clinical Program, Duke-NUS Medical School(杜克-国立新加坡大学医学学校眼科与视觉科学学术临床项目) Department of Pediatrics, The First Hospital of Tsinghua University(清华大学第一医院儿科) College of Future Technology, Peking University(北京大学未来技术学院) School of Health and Wellbeing, University of Glasgow(格拉斯哥大学健康与福祉学院)

AI总结 提出开源推理大模型RaDaR(32B参数),通过增强推理训练和合成数据,在罕见病诊断中超越DeepSeek-R1等模型,随机试验显示其辅助使医生诊断准确率提升21.44个百分点。

Comments 36 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24448 2026-06-24 cs.RO 新提交

Supervise What Survives: Geometry-Guided VLA Adaptation from Synthetic Robot Videos

监督幸存信息:基于几何引导的合成机器人视频VLA适配

Danze Chen, Yanzhe Chen, Qiming Huang, Zhijun Cao, Chen Gao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学 Show Lab)

AI总结 提出GRA方法,从合成视频中提取几何信息(2D末端执行器路径点)监督视觉表征,仅用真实演示训练动作头,在真实机器人任务中优于伪动作基线。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24255 2026-06-24 cs.CV cs.AI 新提交

Social Structure Matters in 3D Human-Human Interaction Generation

社会结构在三维人-人交互生成中的重要性

Zhongju Wang, Beier Wang, Yatao Bian, Pichao Wang, Zhi Wang, Daoyi Dong, Hongdong Li, Huadong Mo, Zhenhong Sun

机构 * University of New South Wales(新南威尔士大学) National University of Singapore(新加坡国立大学) NVIDIA(英伟达) Nanjing University(南京大学) University of Technology Sydney(悉尼科技大学) Australian National University(澳大利亚国立大学)

AI总结 提出Solo-to-Social框架,利用LLM规划社会结构(阶段分解、角色分配)并指导运动执行器生成协调的双人3D运动,解决文本驱动的人-人交互生成问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23238 2026-06-24 cs.AI 新提交

HOLMES: Evaluating Higher-Order Logical Reasoning in LLMs

HOLMES: 评估大语言模型中的高阶逻辑推理

Yucheng Wu, Jundong Xu, Mingzhen Ju, Yue Yu, Chenpeng Wang, Haoxuan Li, Liangming Pan

机构 * State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) School of Computer Science, Peking University(北京大学计算机科学学院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) YiXin-AILab, YIXIN(YiXin-AILab,YIXIN)

AI总结 提出HOLMES基准,基于高阶逻辑评估LLM在规则、谓词和约束上的推理能力,发现当前模型平均准确率仅50.64%,揭示高阶符号推理是关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21894 2026-06-24 cs.SE cs.AI 新提交

Skills for the future software profession: beyond agentic AI!

未来软件职业的技能:超越智能体AI!

Sungmin Kang, Baishakhi Ray, Abhik Roychoudhury

机构 * National University of Singapore(新加坡国立大学) Columbia University(哥伦比亚大学)

AI总结 本文通过2026年在纽约和新加坡举行的两场圆桌会议,总结未来软件工程师所需的核心技能,强调验证与确认在智能体处理实现时的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23126 2026-06-23 cs.CV 新提交

MambaADv2: Evolving Duality-enhanced State Space Model for Unsupervised Anomaly Detection

MambaADv2: 面向无监督异常检测的进化型对偶增强状态空间模型

Xiaobin Hu, Haoyang He, Bo Yin, Yu He, Lei Xie, Jiangning Zhang, Yu-Gang Jiang, Shuicheng Yan

机构 * Zhejiang University(浙江大学) School of Computing, National University of Singapore(新加坡国立大学计算机学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所)

AI总结 提出MambaADv2框架,通过集成对偶增强状态空间模块和混合状态空间块,结合线性递归与并行矩阵计算,实现高效全局依赖与局部表示建模,提升多类无监督异常检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22955 2026-06-23 cs.CV 新提交

Evo-RAD: Navigating Rare Retinal Disease Diagnosis via Self-Evolving Agentic Retrieval

Evo-RAD:通过自进化代理检索导航罕见视网膜疾病诊断

Wangding Xia, Ye Du, Jiashi Lin, Meng Wang, Danli Shi, Shujun Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) Northwestern Polytechnical University(西北工业大学) National University of Singapore(新加坡国立大学)

AI总结 提出Evo-RAD框架,将检索增强诊断建模为马尔可夫决策过程,通过图代理动态删除不相关证据、插入病理一致样本或终止进化,利用同质性感知奖励优化,显著提升罕见视网膜疾病诊断性能。

Comments Accepted by MICCAI 2026. 10 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22876 2026-06-23 cs.CV 新提交

Full-Body Golf Swing Kinematic Reconstruction From a Smartwatch IMU

基于智能手表IMU的全身高尔夫挥杆运动学重建

Yuanshuo Tan, Kezhe Zhu, Xiujie Sun, Chunping Liang, Shuoyang Zhu, Chenquan Xu, Licheng Zhong, Huiming Pan, Yinri Jin, Chang Liu, Bo Xiao, Shenglong Le, Bryndan W. Lindsey, Peter B. Shull

机构 * State Key Laboratory of Mechanical System and Vibration, School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械与动力工程学院机械系统与振动国家重点实验室) Key Laboratory for Power Machinery and Engineering of the Ministry of Education, Shanghai Jiao Tong University(上海交通大学动力机械与工程教育部重点实验室) Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) School of Physical Education, Shanghai University of Sport(上海体育大学体育教育学院) Department of Physical Education, Shanghai Jiao Tong University(上海交通大学体育系) Department of Physical Therapy(物理治疗系)

AI总结 提出一种单手腕IMU方法(WIT-KinNet),通过时间运动编码学习手腕到全身关节角度映射,实现高尔夫挥杆全身运动学估计,平均绝对误差8.11°。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22875 2026-06-23 cs.CV 新提交

FedOT: Ownership Verification and Leakage Tracing via Watermarks for Federated LDMs

FedOT: 联邦潜扩散模型的所有权验证与泄露追踪水印

Wenlong Cheng, Yuan Gan, Yunqiu Xu, Jiaxu Miao

机构 * Northwest Normal University(西北师范大学) The University of Tokyo(东京大学) National University of Singapore(新加坡国立大学) Sun Yat-sen University(中山大学)

AI总结 提出FedOT框架,通过分块水印和潜向量变换解决联邦学习中潜扩散模型的所有权验证与恶意客户端泄露追踪问题。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22829 2026-06-23 cs.CV cs.AI 新提交

DBT-Bleed: Dual-Branch Temporal Modeling with Key-Frame Selection for Surgical Bleeding Detection

DBT-Bleed: 用于手术出血检测的双分支时间建模与关键帧选择

Sudhanshu Mishra, Jialang Xu, Jensen Ang, Evangelos B. Mazomenos, Beng Ti Ang, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) University College London(伦敦大学学院) National Neuroscience Institute(国家神经科学研究所)

AI总结 提出DBT-Bleed双分支多尺度时间建模框架,结合HiRED分层熵驱动帧选择策略,有效区分手术出血与视觉相似的残留血液,在MultiBypass数据集上F1提升6.53%,并首次引入神经外科IAE标注数据集EndoPit-IAE。

Comments 11 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22787 2026-06-23 cs.CV 新提交

Visual Geometry Transformer in the Wild: Distractor-Free 3D Reconstruction

野外视觉几何变换器:无干扰物的三维重建

Tianbo Pan, Xingyi Yang, Shizun Wang, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 提出VGTW框架,通过干扰物感知训练策略分离并抑制干扰区域,实现从不一致视角进行鲁棒的三维重建,无需额外三维监督。

Comments Project page: https://tianbo-pan.github.io/vgt-w/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22613 2026-06-23 cs.AI 新提交

SkillAudit: From Fixed-Suite Benchmarking to Skill-Centered Assessment

SkillAudit:从固定套件基准测试到以技能为中心的评估

Dexu Yu, Youhua Li, Zhaoyang Guan, Xianhao Lin, Jining Luan, Zihao Rao, Xuanqi Lan, Yang Ran, Bo Lan, Nai-Xin Zhai, Hanwen Du, Junchen Fu, Wenhao Deng, Yongxin Ni, Chunxiao Li

机构 * Northeastern University(东北大学) City University of Hong Kong(香港城市大学) Northwestern University(西北大学) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Santa Clara University(圣克拉拉大学) Fenz AI Ohio State University(俄亥俄州立大学) University of Glasgow(格拉斯哥大学) National University of Singapore(新加坡国立大学) DeciLix Lab(DeciLix实验室)

AI总结 提出SkillAudit框架,自动生成技能的多维度评估报告,涵盖效用、效率/成本和安全性,通过基线比较和两阶段检测解决固定套件评估的不足。

Comments Preprint. Project page: https://skillaudit.github.io/. Code and evaluation artifacts: https://github.com/SkillAudit/skillaudit

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22402 2026-06-23 cs.SE cs.AI cs.CL cs.LG 新提交

Reinforcement learning to improve large language model-based automated code compliance systems

强化学习改进基于大语言模型的自动化代码合规系统

Jack Wei Lun Shi, Minghao Dang, Wawan Solihin, Leong Hien Poh, Justin K. W. Yeoh

机构 * National University of Singapore(新加坡国立大学) Harbin Institute of Technology(哈尔滨工业大学) NovaCITYNETS

AI总结 提出P4IR两阶段框架,先通过监督微调注入领域知识,再用GRPO优化高层代码骨架的准确性,在零样本设置下优于多个领先大语言模型。

Comments 22 pages, 12 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21935 2026-06-23 cs.RO 新提交

CoRDE: Concept-Prior Routed Diffusion Experts for Structural Generalization in Robot Manipulation

CoRDE:面向机器人操作结构泛化的概念先验路由扩散专家

Haidong Huang, Xixin Zhao, Yaohua Zhou, Jiayu Song, Jiayi Zhang, Jun Ma, Haiyue Zhu, Xiaocong Li

机构 * College of Information Science and Technology, Eastern Institute of Technology, Ningbo(宁波东方理工大学(暂名)信息科学与技术学院) Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin, Eastern Institute of Technology, Ningbo(浙江省工业智能与数字孪生重点实验室,宁波东方理工大学(暂名)) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)机器人与自主系统学域) Faculty of Science and Engineering, University of Nottingham Ningbo China(宁波诺丁汉大学理工学院)

AI总结 提出CoRDE框架,通过概念先验引导路由和低秩专家池,解决扩散模型在多任务长时程操作中的结构泛化不足和路由崩溃问题。

Comments 8 pages, 3 figures, Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21885 2026-06-23 cs.LG cs.AI 新提交

Cohort-Anchored Foundation Models for Electronic Health Records: From Risk Scores to Auditable Peer Cohorts

基于队列锚定的电子健康记录基础模型:从风险评分到可审计的同行队列

Kaiping Zheng

机构 * National University of Singapore(新加坡国立大学)

AI总结 提出CAFM框架,将患者队列作为一等对象融入学习流程,通过四个阶段提升数据质量、组织表示并支持可审计决策,以解决基础模型在临床部署中的可解释性、分布偏移和临床对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21819 2026-06-23 cs.CV 新提交

RAPID: A Reproducible Multi-Agent Pipeline for Interpretable Disaster Damage Assessment from Satellite and Street-View Imagery

RAPID:一种可复现的多智能体管道,用于从卫星和街景图像中进行可解释的灾害损害评估

Yifan Yang, Wenjing Gong, Kaili Zhang, Lei Zou, Zhengzhong Tu, Hao Li, Zongrong Li, Xinyue Ye

机构 * National University of Singapore(新加坡国立大学) The University of Alabama(阿拉巴马大学)

AI总结 提出RAPID,一种可复现的多智能体管道,无需任务特定微调即可实现零样本灾害损害评估,通过跨视图理解、图像恢复和结构化识别生成可解释的评估报告,在多种灾害中达到0.92的分类准确率。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21409 2026-06-23 cs.AI 新提交

Don't Blindly Trust It: How Unreliable Feedback Breaks Tool-Using LLM Agents

不要盲目信任:不可靠反馈如何破坏使用工具的LLM智能体

Chubin Zhang, Zhenglin Wan, Xingrui Yu, Pengfei Zhou, Wangbo Zhao, Jingxuan Wu, Yaxin Zhou, Ivor Tsang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) CFAR Agency for Science Technology and Research(新加坡科技研究局计算与推理中心) IHPC Agency for Science Technology and Research(新加坡科技研究局高性能计算研究所) Department of Statistics and Operations Research UNC-Chapel Hill(北卡罗来纳大学教堂山分校统计与运筹学系) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究不可靠反馈对工具增强型LLM智能体的影响,通过匹配循环对比实验发现,误导性反馈会导致价值反转,使智能体表现低于无反馈基线,并强调无反馈回退控制对评估的必要性。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21399 2026-06-23 cs.AI 新提交

Calibration Is Not Control: Why LLM-Agent Oversight Needs Intervention

校准不是控制:为什么LLM代理监督需要干预

Chubin Zhang, Zhenglin Wan, Xingrui Yu, Jingxuan Wu, Qi Wen, Pengfei Zhou, Wangbo Zhao, Ivor Tsang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) CFAR Agency for Science Technology and Research(科技研究局CFAR) IHPC Agency for Science Technology and Research(科技研究局IHPC) Department of Statistics and Operations Research UNC-Chapel Hill(北卡罗来纳大学教堂山分校统计与运筹学系)

AI总结 本文指出LLM代理运行时监督中常用的标量风险预测存在目标错误,提出以干预优势为决策对象,并引入前缀分支方法进行动作条件控制,实验表明该方法能显著降低控制遗憾。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20781 2026-06-23 cs.RO cs.CV 新提交

World Action Models: A Survey

世界行动模型:综述

Qiuhong Shen, Shihua Zhang, Yue Liao, Qi Li, Zhenxiong Tan, Shizun Wang, Shuicheng Yan, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

AI总结 本文综述世界行动模型(WAMs),通过两种互补视角组织现有工作,揭示其设计权衡与未来趋势。

Comments 57 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20757 2026-06-23 cs.LG 新提交

Evidential Fusion Network for Multimodal Survival Prediction under Missing Modalities

缺失模态下的多模态生存预测证据融合网络

Yucheng Xing, Hailan Mo, Zi Wang, Ling Huang, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) Imperial College London(帝国理工学院)

AI总结 提出EMMS模型,利用Dempster-Shafer理论和高斯随机模糊数融合多模态决策,处理缺失模态下的生存预测,无需生成缺失数据,在四个癌症数据集上达到最优性能并提供校准的不确定性估计。

详情

展开后加载摘要…

URL PDF HTML 收藏