arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

National University of Singapore(新加坡国立大学)

2026-06-04 至 2026-06-04 共收录 21
2606.05122 2026-06-04 cs.CL

Self-Evaluation Is Already There: Eliciting Latent Judge Calibration in Base LLMs with Minimal Data

自我评估已然存在:用最少数据激发基础LLM中的潜在评判校准

XiuYu Zhang, Yi Shan, Junfeng Fang, Zhenkai Liang

机构 * National University of Singapore(新加坡国立大学) Beijing University of Technology(北京理工大学)

AI总结 本文提出自我评估激发(SEE)方法,通过少量数据(160个示例)结合校准耦合强化学习和掩码蒸馏,激发基础LLM中已有的预测外部评判者评分能力,在保持答案质量的同时显著提升校准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05121 2026-06-04 cs.SD cs.AI cs.CL cs.MM eess.AS

Audio Interaction Model

音频交互模型

Zhifei Xie, Zihang Liu, Ze An, Xiaobin Hu, Yue Liao, Ziyang Ma, Dongchao Yang, Mingbao Lin, Deheng Ye, Shuicheng Yan, Chunyan Miao

机构 * NTU(国立新加坡大学) NUS(新加坡国立大学) CUHK(香港大学)

AI总结 提出一种统一的在线大型音频语言模型Audio-Interaction,通过始终在线的感知-决策-响应循环实现实时音频交互,并构建了StreamAudio-2M数据集和Proactive-Sound-Bench基准,在保持主流音频任务性能的同时解锁了实时ASR、流式音频指令跟随和主动帮助等能力。

Comments Next generation of LALMs, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05080 2026-06-04 cs.AI cs.LG

AutoLab: Can Frontier Models Solve Long-Horizon Auto Research and Engineering Tasks?

AutoLab:前沿模型能否解决长周期自动研究与工程任务?

Zhangchen Xu, Junda Chen, Yue Huang, Dongfu Jiang, Jiefeng Chen, Hang Hua, Zijian Wu, Zheyuan Liu, Zexue He, Lichi Li, Shizhe Diao, Jiaxin Pei, Jinsung Yoon, Hao Zhang, Mengdi Wang, Radha Poovendran, Misha Sra, Alex Pentland, Zichen Chen

机构 * MIT(麻省理工学院) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) University of California, Los Angeles(加州大学洛杉矶分校) University of California, San Diego(加州大学圣地亚哥分校) University of Washington(华盛顿大学) University of Toronto(多伦多大学) University of Michigan(密歇根大学) National University of Singapore(新加坡国立大学) University of Tokyo(东京大学)

AI总结 本文提出AutoLab基准,通过36个专家策划的长周期闭环优化任务评估前沿模型,发现持续迭代和利用经验反馈比初始尝试质量更重要。

Comments Code: https://github.com/autolabhq/autolab ; Website: https://autolab.moe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05004 2026-06-04 cs.CR cs.AI

SharedRequest: Privacy-Preserving Model-Agnostic Inference for Large Language Models

SharedRequest: 面向大型语言模型的隐私保护模型无关推理

Peihua Mai, Xuanrong Gao, Youlong Ding, Xianglong Du, Wei Liu, Yan Pang

机构 * National University of Singapore (Chongqing) Research Institute(新加坡国立大学(重庆)研究院) Chongqing Key Laboratory of Trusted Perception and Interaction Technology for Intelligent and Connected Vehicles(重庆智能网联车辆可信感知与交互技术重点实验室) National University of Singapore(新加坡国立大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学) State Key Laboratory of Intelligent Vehicle Safety Technology, Chongqing, China(重庆智能车辆安全技术国家重点实验室) CHONGQING CHANGAN AUTOMOBILE Co., Ltd(重庆长安汽车有限公司)

AI总结 提出一种模型无关的隐私保护推理框架SharedRequest,通过批量级别混淆和语义分组实现高效隐私保护,相比差分隐私基线效用提升20%以上,查询成本降低5倍。

Comments accepted by ACL 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04662 2026-06-04 cs.LG cs.AI

Why Muon Outperforms Adam: A Curvature Perspective

为什么 Muon 优于 Adam:曲率视角

Shuche Wang, Fengzhuo Zhang, Jiaxiang Li, Dirk Bergemann, Zhuoran Yang

机构 * National University of Singapore(新加坡国立大学) Yale University(耶鲁大学) University of Minnesota(明尼苏达大学)

AI总结 从曲率视角出发,通过泰勒展开和曲率分解,发现 Muon 因更低的归一化方向锐度(NDS)而比 Adam 实现更大的一步损失下降,数据不平衡和层内曲率是其主要优势来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04646 2026-06-04 cs.CL cs.AI cs.IR

QO-Bench: Diagnosing Query-Operator-Preserving Retrieval over Typed Event Tuples

QO-Bench: 诊断类型化事件元组上的查询操作符保持检索

Mengao Zhang, Xiang Yang, Chang Liu, Tianhui Tan, Ke-wei Huang

机构 * Asian Institute of Digital Finance, National University of Singapore(亚洲数字金融研究所,新加坡国立大学)

AI总结 提出QO-Bench基准,通过类型化事件元组上的确定性评估,诊断检索增强生成系统在查询操作符(如连接、交集)上的执行瓶颈。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04466 2026-06-04 cs.CL

Learning What to Learn: Stage-Specific Data Sets for SFT-then-RL in Small Language Model Reasoning

学习什么:小语言模型推理中SFT-then-RL的阶段特定数据集

Chongyang He, Rui Zhang, Zixuan Wang, Xin Li

机构 * Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) DiDi(滴滴出行) University of Electronic Science and Technology of China(电子科技大学)

AI总结 提出一种难度感知的SFT-then-RL框架,通过阶段特定数据集(SFT阶段使用桥接机制,RL阶段使用批判微调)协调数据难度,提升小语言模型推理性能。

Comments 25 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04465 2026-06-04 cs.CL cs.AI

SePO: Self-Evolving Prompt Agent for System Prompt Optimization

SePO: 用于系统提示优化的自我进化提示智能体

Wangcheng Tao, Han Wu, Weng-Fai Wong

机构 * National University of Singapore(新加坡国立大学) City University of Hong Kong(香港城市大学)

AI总结 提出SePO方法,通过自我指涉设计让提示智能体同时优化任务智能体和自身的系统提示,采用两阶段进化训练,在多个基准上平均准确率提升4.49%。

Comments 26 pages. Code: https://github.com/taowangcheng/SePO

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04457 2026-06-04 cs.CV

Imagine Before You Draw: Visual Prompt Engineering for Image Generation

先构思再绘制:面向图像生成的视觉提示工程

Liyu Jia, Fengda Zhang, Jiachun Pan, Kesen Zhao, Saining Zhang, Wang Lin, Weijia Wu, Yue Liao, Aojun Zhou, Hanwang Zhang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出视觉提示工程(VPE),通过在单一模型内先生成视觉语义令牌作为中间计划,再生成完整图像,从而避免信息瓶颈,提升图像生成质量与编辑保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02166 2026-06-04 cs.LG

EEG-FuseFormer: A Transformer-Driven Feature Fusion Framework for Seizure Onset Prediction

EEG-FuseFormer: 一种用于癫痫发作预测的Transformer驱动特征融合框架

Vigneshwar Hariharan, Chithra Reghuvaran, Arlene John, Nhat Pham, Omer Rana, Deepu John, Ganesh Neelakanta Iyer

机构 * National University of Singapore(新加坡国立大学) University College Dublin(都柏林大学) University of Twente(特文特大学) Cardiff University(卡迪夫大学)

AI总结 提出EEG-FuseFormer框架,融合CNN-LSTM和ResNet-18提取的时空特征与频谱特征,利用Transformer编码器进行融合,在CHB-MIT数据集上达到98.85%的平均召回率,优于多数现有方法。

Comments IEEE International Instrumentation and Measurement Technology Conference (I2MTC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12988 2026-06-04 cs.LG stat.ML

Why Ask One When You Can Ask $k$? Learning-to-Defer to the Top-$k$ Experts

为何只问一个专家?学习将任务推迟到Top-$k$专家

Yannis Montreuil, Axel Carlier, Lai Xing Ng, Wei Tsang Ooi

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) Fédération ENAC, ISAE-SUPAERO, ONERA, Université de Toulouse(ENAC联合会、ISAE-SUPAERO、ONERA、图卢兹大学) Agency for Science, Technology and Research, Institute for Infocomm Research(科技研究局、信息通信研究所)

AI总结 提出Top-$k$学习推迟框架,通过将查询分配给最优的$k$个专家,实现多专家协作,并开发了与$k$无关的替代损失函数,在准确性和成本之间取得更优权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15761 2026-06-04 cs.CL cs.LG stat.ML

Optimal Query Allocation in Extractive QA with LLMs: A Learning-to-Defer Framework with Theoretical Guarantees

基于LLM的抽取式问答中的最优查询分配:一个具有理论保证的学习-推迟框架

Yannis Montreuil, Shu Heng Yeo, Axel Carlier, Lai Xing Ng, Wei Tsang Ooi

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) Fédération ENAC ISAE-SUPAERO ONERA, Université de Toulouse, France(法国图卢兹大学ENAC ISAE-SUPAERO ONERA联合体) Institute for Infocomm Research (A*STAR), Singapore(新加坡信息与通信研究院(A*STAR)) IPAL, IRL 2955, Singapore(新加坡IPAL实验室)

AI总结 提出一个学习-推迟框架,通过将查询分配给专门专家,在保证高置信度预测的同时优化计算效率,并在SQuADv1、SQuADv2和TriviaQA上验证了其提高答案可靠性和降低计算开销的效果。

Comments 25 pages, 17 main paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08665 2026-06-04 cs.CL

Hint Tuning: Less Data Makes Better Reasoners

Hint Tuning:更少的数据造就更好的推理者

Siqi Fan, Minghao Li, Xiaoqian Ma, Xiusheng Huang, Zhuo Chen, Bowen Qin, Liujie Zhang, Shuo Shang, Weihang Chen

机构 * University of Electronic Science and Technology of China(电子科技大学) Xiaohongshu Inc.(小红书公司) National University of Singapore(新加坡国立大学)

AI总结 提出Hint Tuning方法,通过自动构建三种提示状态(无提示、稀疏提示、完整提示)的训练数据,使推理模型根据问题难度校准推理深度,仅用1K样本即可在多个主流推理模型上平均减少31.5%的token生成,同时保持竞争性准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14177 2026-06-04 cs.CV

Improving Semantic Uncertainty Quantification in LVLMs with Semantic Gaussian Processes

利用语义高斯过程改进LVLM中的语义不确定性量化

Joseph Hoche, Andrei Bursuc, David Brellmann, Gilles Louppe, Pavel Izmailov, Angela Yao, Gianni Franchi

机构 * AMIAD, Pôle Recherche, Palaiseau(AMIAD研究部,Palaiseau) valeo.ai Safran Tech University of Liège(利耶大学) New York University(纽约大学) National University of Singapore(新加坡国立大学) ENSTA Paris(巴黎ENSTA)

AI总结 提出语义高斯过程不确定性(SGPU)框架,通过分析答案嵌入的几何结构来量化语义不确定性,避免脆弱的聚类方法,在多个模型和数据集上实现了最先进的校准和判别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18577 2026-06-04 cs.AI

MedForge: Interpretable Medical Deepfake Detection via Forgery-aware Reasoning

MedForge:基于伪造感知推理的可解释医学深度伪造检测

Zhihui Chen, Kai He, Qingyuan Lei, Bin Pu, Jian Zhang, Yuling Xu, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Hunan University(湖南大学) Xi’an Jiaotong University(西安交通大学) Guangdong Provincial People’s Hospital(广东省人民医院)

AI总结 提出MedForge框架,通过构建大规模基准数据集MedForge-90K和局部-分析推理方法,实现可解释的医学图像伪造检测,在准确性和专家对齐解释上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09242 2026-06-04 cs.CV

When Detectors Forget Forensics: Blocking Semantic Shortcuts for Generalizable AI-Generated Image Detection

当检测器遗忘取证:阻断语义捷径以实现可泛化的AI生成图像检测

Chao Shuai, Shaojing Fan, Chenlin Zou, Bin Gong, Weichen Lian, Xiuli Bi, Zhenguang Liu, Zhongjie Ba, Kui Ren

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) National University of Singapore(新加坡国立大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

AI总结 本文提出几何语义解耦(GSD)框架,通过抑制语义主导方向来促进不变取证表征,从而解决预训练视觉基础模型在AI生成图像检测中因语义回退导致的泛化不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05633 2026-06-04 cs.CL

GIFT: Games as Informal Training for Generalizable LLMs

GIFT:游戏作为通用型LLM的非正式训练

Nuoyan Lyu, Bingbing Xu, Xueyun Tian, Weihao Meng, Yige Yuan, Yang Zhang, Zhiyong Huang, Tat-Seng Chua, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) University of Washington(华盛顿大学) National University of Singapore(新加坡国立大学)

AI总结 提出将游戏作为非正式训练环境,结合协调子任务训练(CST)方法,提升LLM在抽象推理、规划、创造力等通用能力上的泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00801 2026-06-04 cs.CV cs.MM

Med-Banana: Learning Quality-Controlled Medical Image Editing from Success-and-Failure Trajectories

Med-Banana:从成功与失败轨迹中学习质量可控的医学图像编辑

Zhihui Chen, Qingyuan Lei, Kai He, Yanrui Du, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 提出Med-Banana框架,通过收集成功与失败编辑轨迹数据集Med-Banana-80K,联合训练编辑器、验证器和优化器,实现质量可控的医学图像编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18721 2026-06-04 math.ST cs.CR cs.LG stat.ME stat.ML stat.TH

Differentially Private Joint Independence Test

差分隐私联合独立性检验

Xingwei Liu, Yuexin Chen, Jin-Ting Zhang, Wangli Xu

机构 * Center for Applied Statistics and School of Statistics, Renmin University of China(应用统计中心和中国人民大学统计学院) Department of Statistics and Data Science, National University of Singapore(统计与数据科学系,新加坡国立大学)

AI总结 针对隐私约束下的多随机向量联合依赖检测问题,提出基于差分隐私置换的dHSIC检验方法,实现有效水平、点态一致性和极小极大最优功效。

Comments 57 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.06366 2026-06-04 cs.LG cs.SY eess.SY stat.ML

Detecting and Diagnosing Incipient Building Faults Using Uncertainty Information from Deep Neural Networks

利用深度神经网络的不确定性信息检测和诊断建筑初期故障

Baihong Jin, Dan Li, Seshadhri Srinivasan, See-Kiong Ng, Kameshwar Poolla, Alberto~Sangiovanni-Vincentelli

机构 * Department of EECS, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) The Berkeley Education Alliance for Research in Singapore(新加坡伯克利教育联盟)

AI总结 本文提出利用蒙特卡洛dropout方法增强监督学习流程,以检测和诊断未见过的初期故障,并在RP-1043数据集上验证其在指示最可能的初期故障类型方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.06361 2026-06-04 cs.LG cs.NE cs.SY eess.SY stat.ML

A One-Class Support Vector Machine Calibration Method for Time Series Change Point Detection

一种用于时间序列变化点检测的一类支持向量机校准方法

Baihong Jin, Yuxin Chen, Dan Li, Kameshwar Poolla, Alberto Sangiovanni-Vincentelli

机构 * Department of EECS, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系) California Institute of Technology(加州理工学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所)

AI总结 本文提出了一种校准一类支持向量机(OC-SVM)的方法,用于时间序列变化点检测,通过启发式搜索方法找到输入数据和超参数的最优组合,实验表明OC-SVM在少量训练数据下也能有效检测变化点,优于现有深度学习方法。

详情

展开后加载摘要…

URL PDF HTML 收藏