Internalizing LLM Reasoning via Discovery and Replay of Latent Actions
将LLM推理内化:通过发现和重播潜在动作
机构 * Tsinghua University(清华大学) ; National University of Singapore(新加坡国立大学) ; Fuzhou University(福州大学)
AI总结 STIR通过动态潜在轨迹控制实现LLM推理内化,提升准确率并减少token消耗。
高校专区
将LLM推理内化:通过发现和重播潜在动作
机构 * Tsinghua University(清华大学) ; National University of Singapore(新加坡国立大学) ; Fuzhou University(福州大学)
AI总结 STIR通过动态潜在轨迹控制实现LLM推理内化,提升准确率并减少token消耗。
逐步压缩大型语言模型以像沸 frog 一样进行推理
机构 * Salesforce AI Research(Salesforce AI研究部) ; National University of Singapore(新加坡国立大学)
AI总结 本文提出了一种渐进压缩方法,通过剪枝-微调循环逐步减少大型语言模型大小,同时保持推理性能,适用于多种剪枝策略和后期训练方法。
VisMem: 通过潜在视觉记忆解锁视觉-语言模型的潜力
机构 * National University of Singapore(新加坡国立大学) ; Fudan University(复旦大学) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; University of Science and Technology of China(中国科学技术大学) ; vivo
AI总结 VisMem通过引入动态潜在视觉记忆模块,提升视觉-语言模型在复杂视觉任务中的性能,实现感知准确性和语义一致性之间的平衡。
超越多示例翻译:为低资源机器翻译扩展上下文演示
机构 * Institute of Information Science, Academia Sinica(台湾“中央研究院”信息科学研究所) ; National Taiwan University of Science and Technology(台湾科技大学) ; Ecole Centrale de Marseille(马赛中央理工学院) ; National University of Singapore(新加坡国立大学)
AI总结 本研究探索了通过扩展上下文长度来改进低资源机器翻译的ICL方法,发现增加上下文可提升性能但存在饱和点,且不同语料库类型对结果影响显著。
Comments 8 pages, 18 figures, EACL 2026 Conference - LoResMT workshop
从数据到行为:在训练前预测未预料的模型行为
机构 * Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学)
AI总结 提出MDF方法,通过数据均值表示预测模型预训练阶段的潜在偏见和安全风险,实现高效检测。
Comments Work in progress
medR:通过三驱动势函数实现临床离线强化学习中的奖励工程
机构 * National University of Singapore(新加坡国立大学) ; University of Helsinki(赫尔辛基大学) ; Harbin Institute of Technology(哈尔滨工业大学)
AI总结 medR通过三驱动势函数实现临床离线强化学习中的自动化奖励设计,提升策略性能。
通过群表示学习对称性的字典
机构 * Department of Mathematics, National University of Singapore(新加坡国立大学数学系) ; School of Mathematical Sciences, University of Chinese Academy of Sciences(中国科学院大学数学科学学院)
AI总结 本文通过群表示理论,提出了一种学习具有对称性不变性的字典的方法,并在SO(2)和SO(3)群上进行了验证。
Comments 33 pages, 3 figures
缺失的一半:揭示训练时间隐含的安全风险
机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学智能对话研究院) ; National University of Singapore(新加坡国立大学) ; Pattern Recognition Center, WeChat AI, Tencent Inc, China(腾讯人工智能研究院)
AI总结 本文首次系统研究训练期间隐式安全风险,揭示模型内部激励和上下文信息驱动的有害行为,并通过实验展示其广泛存在和严重性。
VLS:通过视觉-语言模型引导预训练的机器人策略
机构 * University of Washington(华盛顿大学) ; University of Oxford(牛津大学) ; National University of Singapore(新加坡国立大学) ; Allen Institute for Artificial Intelligence(人工智能研究院)
AI总结 VLS通过视觉-语言模型在推理时引导预训练机器人策略,实现无需训练的适应,提升在不同环境下的表现。
Comments 11 Pages, Project page: https://vision-language-steering.github.io/webpage/
分段后审计:用于语言指代音频视频分段的无参考掩码质量评估
机构 * MBZUAI ; National University of Singapore(国立新加坡大学) ; Fudan University(复旦大学)
AI总结 本研究提出 MQA-RefAVS 任务,通过多模态大语言模型评估语言指代音频视频分段中掩码质量,提升分割准确性与可解释性。
WMVLM:通过视觉-语言模型评估扩散模型图像水印
机构 * University of Science and Technology of China(中国科学技术大学) ; Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) ; National University of Singapore(新加坡国立大学)
AI总结 WMVLM通过视觉-语言模型提出首个统一且可解释的扩散模型图像水印评估框架,重新定义了残差和语义水印的评估指标,并通过三阶段训练策略提升模型性能。
强化微调用于历史感知密集检索器在RAG中
机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院) ; Ningbo Global Innovation Center, Zhejiang University, Ningbo, China(浙江大学宁波全球创新中心) ; Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系)
AI总结 本文提出通过强化学习优化RAG中的检索器,通过引入随机采样和历史状态缓解状态别名问题,提升检索性能。
Comments On going work. Codes are released at https://github.com/zyc140345/HARR
前瞻路径似然优化用于扩散大语言模型
机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) ; School of Computing, National University of Singapore(计算学院,新加坡国立大学) ; School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学)
AI总结 本文提出POKE-SMC方法,通过优化路径似然提升扩散大语言模型的解屏蔽路径准确性,实验表明在同等计算开销下,平均提升2%-3%的准确性。
PWAVEP: 通过频谱图小波净化3D点云中的不可察觉对抗扰动
机构 * Software College, Northeastern University(东北大学软件学院) ; Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) ; Software College, Shenyang University of Technology(沈阳理工大学软件学院)
AI总结 PWAVEP通过频谱图小波技术净化3D点云中的不可察觉对抗扰动,提升准确性和鲁棒性。
Comments Accepted by WWW 2026
Risky-Bench: 探索现实部署中智能体安全风险
机构 * National University of Singapore(国立新加坡大学) ; University of Science and Technology of China(中国科学技术大学) ; Southern University of Science and Technology(南方科技大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Nanyang Technological University(南洋理工大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
AI总结 Risky-Bench通过基于现实部署的安全原则,系统评估智能体在复杂任务中的安全风险,适用于多种部署场景。
NSC-SL:一种带宽感知的神经子空间压缩用于通信高效的分裂学习
机构 * School of Computer and Information Engineering, Xiamen University of Technology, Xiamen, China(厦门理工学院计算机与信息工程学院) ; Department of Electrical and Electronic Engineering, The University of Hong Kong, Hong Kong, China(香港大学电子与电气工程系) ; Department of Computer Science, City University of Hong Kong, Hong Kong, China(香港城市大学计算机科学系) ; Department of Computer Science, The University of Hong Kong, Hong Kong, China(香港大学计算机科学系) ; School of Computing, National University of Singapore, Singapore(新加坡国立大学计算机学院)
AI总结 NSC-SL通过带宽感知的自适应压缩算法,实现通信高效的分裂学习,有效减少通信开销并保持模型收敛所需的语义信息。
Comments 5 pages, 3 figures
为抵御网络攻击,我们必须教AI代理黑客
机构 * Monash University(墨尔本大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; University of California, Santa Barbara(加州大学圣巴巴拉分校) ; National University of Singapore(新加坡国立大学)
AI总结 本文主张AI代理驱动的网络攻击不可避免,需转变防御策略,提出构建全面基准、发展训练代理发现漏洞及实施治理限制进攻性AI能力,以负责任地掌握进攻性AI能力作为防御基础设施。
ToolTok: 为高效且通用的GUI代理的工具标记化
机构 * Department of Computer Science, Tsinghua University, Beijing, China(清华大学计算机科学系) ; Guangming Laboratory, Shenzhen, China(光明实验室) ; National University of Singapore, Singapore(新加坡国立大学) ; Peking University, Beijing, China(北京大学) ; MSU-BIT-SMBU Joint Research Center of Applied Mathematics, Shenzhen MSU–BIT University(MSU-BIT-SMBU应用数学联合研究中心)
AI总结 ToolTok通过多步路径寻找范式,利用语义锚定机制和易到难课程,实现高效且通用的GUI代理,以较少数据获得优异性能。
Comments 8 pages main paper, 18 pages total, 8 figures, 5 tables, code at https://github.com/ZephinueCode/ToolTok
基于轨迹的测试时改进诊断评估:LLM代理中的测试时改进
机构 * Xi’an Jiaotong University(西安交通大学) ; The University of Hong Kong(香港大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanjing University(南京大学) ; National University of Singapore(新加坡国立大学)
AI总结 TIDE提出了一种评估框架,用于诊断LLM代理在测试时改进中的性能瓶颈,通过分析任务完成的时间动态、递归循环行为和记忆负担,优化代理与环境的交互。
Comments 29pages, 10 figures
一种低成本的基于视觉的触觉夹具,用于接触丰富的操作
机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) ; Innovation and Research and Development Department, BoardWare Information System Company Ltd.(创新与研发部,BoardWare信息系统有限公司) ; School of Artificial Intelligence, Nanjing Agricultural University(人工智能学院,南京农业大学) ; School of Computing, National University of Singapore(计算机学院,新加坡国立大学) ; School of Electronic Engineering and Automation, Guilin University of Electronic Technology(电子工程与自动化学院,桂林电子科技大学)
AI总结 本研究提出了一种低成本的视觉-触觉夹具,通过融合视觉和触觉反馈,提升接触丰富环境中的操作性能。
SAIL-RL: 通过双奖励强化学习调优引导MLLM在何时以及如何思考
机构 * National University of Singapore(新加坡国立大学)
AI总结 SAIL-RL通过双奖励强化学习调优,提升多模态大语言模型的推理能力和可靠性。
UrbanGraph: 基于物理的时空动态异质图用于城市微气候预测
机构 * National University of Singapore(新加坡国立大学) ; Tongji University(同济大学) ; Tsinghua University(清华大学)
AI总结 UrbanGraph通过显式编码物理因果关系,提升城市微气候预测的物理一致性和效率,实现高性能和高精度的时空动态异质图建模。
UniFGVC: 一种通用无训练少样本细粒度视觉分类方法通过属性感知多模态检索
机构 * School of Traffic and Transportation, Beijing Jiaotong University(交通与运输学院,北京交通大学) ; Foundation Modal Research Center, Institute of Automation, Chinese Academy of Sciences(基础模态研究中心,自动化研究所) ; Queen Mary School Hainan, Beijing University of Posts and Telecommunications(海南女王学院,北京邮电大学) ; Department of Computer Science, NUS School of Computing(计算机科学系,国立大学计算机学院)
AI总结 UniFGVC通过属性感知多模态检索方法,实现无训练少样本细粒度视觉分类,优于现有方法。
OpenSeal: 通过并行数据高效构建开源东南亚LLM
机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系)
AI总结 OpenSeal通过并行数据高效构建了首个开源东南亚LLM,实现了与现有模型相当的性能。
S3-CoT:自采样简洁推理实现高效链式推理LLM
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; National University of Singapore(新加坡国立大学)
AI总结 S3-CoT通过自采样简洁推理实现高效链式推理LLM,解决冗余推理问题,提升模型性能与泛化能力。
超越精度:训练-推理不匹配是一个优化问题,简单的学习率调度器可以解决它
机构 * National University of Singapore(新加坡国立大学) ; Fudan University(复旦大学) ; CHUK-Shenzhen(CHUK-深圳) ; University of Science and Technology of China(中国科学技术大学)
AI总结 本文提出通过动态学习率调度器解决强化学习中训练-推理不匹配问题,通过减少学习率来抑制梯度噪声,从而稳定训练过程。
通过群鲁棒马尔可夫决策过程从多个来源学习顺序决策
机构 * Department of Statistics and Data Science, National University of Singapore(新加坡国立大学统计与数据科学系) ; Department of Neurology, University of Pittsburgh(匹兹堡大学神经病学系) ; Department of Biostatistics, Harvard T.H. Chan School of Public Health(哈佛大学T.H. Chan公共卫生学院生物统计学系) ; Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) ; Department of Industrial Engineering and Decision Analytics, Hong Kong University of Science and Technology(香港科学与技术大学工业工程与决策分析系)
AI总结 本文提出了一种群鲁棒马尔可夫决策过程框架,通过特征层面的不确定性集和悲观价值迭代算法,从多地点异质数据中学习鲁棒的顺序决策策略。
MSign: 通过稳定秩恢复防止大语言模型训练不稳定
机构 * National University of Singapore(新加坡国立大学) ; Microsoft Research(微软研究院)
AI总结 MSign通过稳定秩恢复机制防止大语言模型训练不稳定,有效减少训练失败并降低计算开销
思维博弈:利用博弈论的大型语言模型鲁棒信息检索
机构 * Department of Computer Science, National University of Singapore, 13 Computing Drive, Singapore 117417(新加坡国立大学计算机科学系)
AI总结 本文提出Game of Thought框架,通过博弈论技术提升大型语言模型在信息检索中的鲁棒性,实验证明其在最坏情况下的性能优于传统方法。
Comments 23 pages, 10 figures, under review at ICML 2026
PRISM:Festina Lente主动性——面向风险敏感和不确定性意识的主动代理 deliberation
机构 * Shanghai University of Engineering Science(上海工程技术大学) ; National University of Singapore(新加坡国立大学)
AI总结 PRISM通过决策理论门控与选择性慢速推理,提升主动代理的精确性和可控性。