arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

National University of Singapore(新加坡国立大学)

共收录 2361
2512.23192 2026-07-08 cs.LG 版本更新

PGOT: A Physics-Geometry Operator Transformer for Complex PDEs

PGOT:用于复杂偏微分方程的物理-几何运算变换器

Zhuo Zhang, Xi Yang, Ying Miao, Xiaobin Hu, Yifu Gao, Yong Yang, Canqun Yang, Boocheong Khoo

机构 * National University of Defense Technology(国防科技大学) National SuperComputer Center in Tianjin(天津国家超算中心) National University of Singapore(新加坡国立大学) Tiangong University(天工大学) Peking University(北京大学)

AI总结 PGOT通过显式几何意识重建物理特征学习,利用SpecGeo-Attention机制在保持线性计算复杂度的同时,保留多尺度几何特征,实现高精度物理场建模。

Comments 24 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24690 2026-07-08 cs.CV 版本更新

UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy

UniICL:通过能力导向的分类系统化统一多模态上下文学习

Yicheng Xu, Jiangning Zhang, Zhucun Xue, Teng Hu, Ran Yi, Xiaobin Hu, Yong Liu, Dacheng Tao

机构 * Zhejiang University(浙江大学) Shanghai Jiaotong University(上海交通大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出能力导向的分类系统,通过构建UniICL-760K语料库和UniICL-Bench评估体系,提出Context-Adaptive Prototype Modulator模块,提升多模态少样本学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17240 2026-07-08 cs.IT cs.DM cs.LG math.IT math.PR 版本更新

A Fast Binary Splitting Approach for Non-Adaptive Learning of Erdős--Rényi Graphs

一种用于非自适应学习厄多斯 - 雷尼图的快速二分法

Hoang Ta, Jonathan Scarlett

机构 * National University of Singapore(国立新加坡大学) Hanoi University of Science and Technology(胡志明市科技大学)

AI总结 研究非自适应学习厄多斯 - 雷尼图问题,扩展二分法,设计测试 - 解码方案,用\(O(\bar{k}\log n)\)次测试高概率恢复边集,解码时间为\(O(\bar{k}^{1+\delta}\log n)\),改进先前工作。

Journal ref IEEE Transactions on Information Theory (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05051 2026-07-07 cs.SD 新提交

Listen, Think, Transcribe: Continuous Latent Test-Time Scaling for ASR

倾听、思考、转录:用于自动语音识别的连续潜在测试时间缩放

Ho Lam Chung, Yiming Chen, Dau-Cheng Lyu, Hsiao-Tsung Hung, Hung-yi Lee

机构 * National Taiwan University, Taiwan(台湾国立台湾大学) ASUS, Taiwan(台湾ASUS) National University of Singapore, Singapore(新加坡国立大学)

AI总结 提出LatentASR方法,通过两个可训练模块在冻结的ASR主干上添加连续潜在测试时间缩放,在极小数据量下降低词错误率,动态停止可节省计算量,还能在多语言中泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04972 2026-07-07 cs.RO cs.AI 新提交

Multi-Robot Open Adaptive Teaming Across Unseen Environments, Partners, and Scales

跨未知环境、伙伴和规模的多机器人开放式自适应协作

Yang Li, Feng Xue, Fan Mo, Yunhao Liu, Jianhong Wang, Ying Wen, Qingrui Zhang, Shaoshuai Mou, Wei Pan

机构 * Shanghai Jiao Tong University(上海交通大学) Sun Yat-sen University(中山大学) National University of Singapore(新加坡国立大学) Genisom AI University of Bristol(布里斯托大学) Purdue University(普渡大学) Newcastle University(新castle大学)

AI总结 研究多机器人在未知环境、伙伴及规模下的协作,提出超图形式博弈公式,开发HOLA算法,能在训练中扩展多样性,在多平台实验中性能优于基线,策略可直接部署到硬件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04761 2026-07-07 cs.CV 新提交

DeGenseGS: Geometrically and Semantically Decoupled Surgical Scene Understanding in 4D Gaussian Splatting

DeGenseGS:4D高斯点云渲染中几何与语义解耦的手术场景理解

Yimo Wang, Bin Kang, Shuojue Yang, Yueming Jin

机构 * School of Automation, Southeast University(东南大学自动化学院) School of Internet of Things, Nanjing University of Posts and Telecommunications(南京邮电大学物联网学院) Department of Biomedical Engineering, National University of Singapore(新加坡国立大学生物医学工程系)

AI总结 研究针对自主手术交互中语义与解剖错位问题,提出DeGenseGS框架,独立建模语义演变与几何变形,用时空纠缠模块同步语义与场景动态,还设计机制确保鲁棒性,提升了手术场景理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04534 2026-07-07 cs.CL 新提交

Mechanism-level routing failure in LLMs over Lean-verified algebraic structures

基于精益验证代数结构的大语言模型中的机制级路由失败

Manuel Israel Cázares, Wenlin Zhang, Haobo Ma

机构 * Bytepro AI(字节宝人工智能公司) National University of Singapore(新加坡国立大学) Omega Institute(欧米茄研究所) ChronoAI(chrono人工智能公司)

AI总结 研究大语言模型在形式验证代数语料库中的结构路由失败,通过在固定模板集选正确证明机制标签任务,发现机制级路由上限,揭示主导失败类型及模型差异,扩展了路由器假设。

Comments Code, data, and evaluation pipeline available at https://github.com/bytepro-ai/fiber-routing-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04484 2026-07-07 cs.CV 新提交

TrustCLIP: Learning Private Visual Features via Adversarial Reconstruction

TrustCLIP:通过对抗性重建学习隐私视觉特征

Nikos Athanasiou, Ilya A. Petrov, Angela Yao, Shugao Ma, Eric Sauser, Edoardo Remelli, Shreyas Hampali, Johannes Schönberger, Fadime Sener, Bugra Tekin

机构 * Meta Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Tübingen(图宾根大学) National University of Singapore(新加坡国立大学)

AI总结 研究视觉和视觉语言模型中视觉特征隐私问题,提出TrustCLIP框架,以特征条件生成器为隐私对手,优化编码器特征与下游模块投影,降低生成式反演保真度并保持下游任务性能。

Comments https://atnikos.github.io/trustclip/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04439 2026-07-07 cs.AI 新提交

ResearchStudio-Idea: An Evidence-Grounded Research-Ideation Skill Suite from ML Conference Outcomes

研究工作室-创意:基于机器学习会议成果的有证据支持的研究创意技能套件

Qihao Zhao, Yangyu Huang, Yalun Dai, Lingao Xiao, Jianjun Gao, Xin Zhang, Wenshan Wu, Scarlett Li, Yang He, Yan Lu, Yap Kim Hui

机构 * Nanyang Technological University(南洋理工大学) Microsoft Research(微软研究院) National University of Singapore(新加坡国立大学) CFAR, A*STAR(计算机辅助放射治疗中心,新加坡科技研究局)

AI总结 研究问题是提升研究创意,核心方法是构建包含多种技能的套件,主要贡献是揭示31个反复出现的创意子模式并整合为15个可复用模式,能将其转化为可追溯研究提案,经评估效果优于基线。

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04433 2026-07-07 cs.IR cs.CL 新提交

Autonomous Information Seeking: A Roadmap for Agentic Recommender Systems

自主信息寻求:智能推荐系统路线图

Xinyu Lin, Yashar Deldjoo, Sunhao Dai, Honghui Bao, Xiaopeng Ye, Fatemeh Nazary, Wenjie Wang, Tommaso Di Noia, Jun Xu, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Polytechnic University of Bari(巴里理工大学) Renmin University of China(中国人民大学) University of Science and Technology of China(中国科学技术大学)

AI总结 综述基于大语言模型的智能体融入推荐系统带来的转变,介绍基于自主性水平的分类法及三种核心范式,分析各范式采用的架构和智能体对关键组件的增强,探讨评估方法及未解决问题,指出开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04428 2026-07-07 cs.CL cs.AI 新提交

dOPSD: On-Policy Self-Distillation for Diffusion Language Models

dOPSD:扩散语言模型的策略内自蒸馏

Phuong Tuan Dat, Qi Li, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

AI总结 研究扩散语言模型强化推理难的问题,提出dOPSD,通过从学生去噪轨迹直接推导教师特权信息,实现策略内自蒸馏,提升模型在数学推理和代码生成等任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04332 2026-07-07 cs.LG 新提交

On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models

关于强化学习中奖励函数对大语言模型置信度校准的有效性

Chee Heng Tan, Zhuoyi Lin, Mehul Motani, Wee Sun Lee

机构 * School of Computing National University of Singapore(新加坡国立大学计算机学院) Institute of Advanced Intelligence and Computing(高级智能与计算研究所) Agency for Science, Technology and Research(科技研究局) Department of Electrical & Computer Engineering(电气与计算机工程系)

AI总结 研究大语言模型用强化学习训练以提升推理准确性和表达置信度时,奖励函数的设计问题。提出不可破解置信奖励方案概念并定义相关奖励方案谱,指出实际数据集中存在的问题及最佳校准奖励方案因数据集和应用而异。

Comments 50 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03595 2026-07-07 cs.CV cs.AI cs.RO 新提交

Token-Based Affordance Grounding with Large Vision-Language Models

基于令牌的大型视觉语言模型的可供性基础

Seung Il Lee, Qinqian Lei, Daguang Xu, Dong Yang, Robby T. Tan, Yixin Chen, Bo Wang

机构 * University of Mississippi(密西西比大学) National University of Singapore(新加坡国立大学) NVIDIA(英伟达)

AI总结 研究旨在解决现有视觉语言模型在行动定位上的问题,提出TokAG零样本可供性基础框架,利用令牌级语义空间信号定位相关区域,引入空间感知令牌选择机制,在多基准测试中优于先前方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02963 2026-07-07 cs.CV cs.AI cs.MM 新提交

Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning

用于全模态密集视频字幕的并行自回归解码

Wenzheng Zeng, Siyi Jiao, Chen Gao, Hwee Tou Ng, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学)

AI总结 研究密集视频字幕生成,提出并行自回归框架,利用事件间弱局部依赖重组因果依赖图,引入全局规划和事件分解并行解码机制,提升效率与字幕性能。

Comments ECCV 2026. Project website: https://github.com/showlab/PadCaptioner

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02961 2026-07-07 cs.CV cs.CR 新提交

Overloading Large Vision-Language Models for Jailbreaking

通过信息过载对大型视觉语言模型进行越狱攻击

Haoyu Zhang, Yangyang Guo, Mohan Kankanhalli

机构 * National University of Singapore(新加坡国立大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

AI总结 研究大型视觉语言模型易受越狱攻击问题,提出基于递归图像排版布局的信息过载方法,含大量文本和多维图像攻击,大幅提升攻击成功率,凸显此为现实部署安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02896 2026-07-07 cs.IT cs.LG math.IT math.ST stat.ML stat.TH 新提交

Open Problem: Is Interaction Necessary for Order-Optimal 1-bit Mean Estimation?

开放问题:1比特均值估计的最优阶是否需要交互?

Ivan Lau, Jonathan Scarlett

机构 * National University of Singapore(新加坡国立大学)

AI总结 探讨非参数有限矩类上1比特均值估计最优阶是否需交互。自适应阈值查询协议可达最优阶极小极大率,非自适应中阈值和区间查询次优,任意非自适应量化器情况未决。

Comments COLT 2026 Open Problem

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03904 2026-07-07 cs.LG astro-ph.IM gr-qc 新提交

Transformers with Physics-Informed Encodings and Simulation-Based Inference for Robust Detection of Eccentric Binary Black Holes in Pulsar Timing Array Data

具有物理信息编码和基于模拟推理的变压器用于脉冲星计时阵列数据中偏心双黑洞的稳健检测

Subhajit Dandapat, Alvin J. K. Chua

机构 * Department of Physics, National University of Singapore(新加坡国立大学物理系) Department of Mathematics, National University of Singapore(新加坡国立大学数学系)

AI总结 研究利用含物理信息编码框架的Transformer从脉冲星计时阵列数据高效推断相对论轨道上偏心双黑洞,用生成模型在模拟推理框架中推断后验分布,相比无物理基线有改进。

Comments 24 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15198 2026-07-07 cs.CV cs.HC 新提交

City landscape in sight: A crowdsourced framework for unlocking urban-scale window view perceptions from real estate imagery

城市景观在望:一种从房地产图像解锁城市尺度窗景感知的众包框架

Chucai Peng, Sijie Yang, Ang Liu, Yang Xiang, Zhixiang Zhou, Filip Biljecki

机构 * National University of Singapore(新加坡国立大学)

AI总结 提出一种利用房地产平台真实窗景图像(WVI)进行大规模感知映射的方法,通过混合神经网络模型预测六维感知并分析空间分布,发现楼层高度和窗景组成(如天空、树木比例)对感知有非线性影响。

Journal ref Landscape and Urban Planning, 275, 105734 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10522 2026-07-07 cs.CV 新提交

GUI-AC: Enhancing Continual Learning in GUI Agents

GUI-AC:增强GUI代理的持续学习能力

Can Lin, Tao Feng, Hangjie Yuan, Dan Zhang, Yifan Zhu, Zhonghong Ou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

AI总结 针对GUI代理在持续学习中的分布漂移和强化微调不稳定性问题,提出GUI-AC方法,通过自适应优势和动态裁剪机制提升性能,超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30919 2026-07-07 cs.LG cs.AI 版本更新

De-attribute to Forget for LLM Unlearning

De-attribute to Forget for LLM Unlearning

Xinyang Lu, Jiabao Pan, Rachael Hwee Ling Sim, See-Kiong Ng, Anthony Kum Hoe Tung, Bryan Kian Hsiang Low

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系)

AI总结 本文提出基于数据归因奖励的LLM遗忘框架DareU,通过强化学习降低生成响应与遗忘数据的归因分数,实现有效遗忘并平衡模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27991 2026-07-07 stat.ML cs.LG 版本更新

Gradient-Flow Optimization as Dynamic Random-Effects Inference: Testing and Early Stopping with Applications to Deep Learning

深度神经网络训练作为随机效应:优化-推断对偶性

Minhao Yao, Ruoyu Wang, Xihong Lin, Lin Liu, Zhonghua Liu

机构 * Centre for Biomedical Data Science, Duke-NUS Medical School, National University of Singapore(生物医学数据科学中心,国立新加坡大学杜克-新加坡医学学校) Department of Biostatistics, Harvard T.H. Chan School of Public Health, Boston, MA, USA(生物统计学系,哈佛T.H. Chan公共卫生学院,马萨诸塞州波士顿,美国) Institute of Natural Sciences, MOE-LSC, School of Mathematical Sciences, CMA-Shanghai, SJTU-Yale Joint Center of Biostatistics and Data Science, Shanghai Jiao Tong University(自然科学院,MOE-LSC,数学科学学院,CMA-上海,SJTU-耶鲁联合生物统计学与数据科学中心,上海交通大学) Department of Biostatistics, Columbia University, New York, NY, USA(生物统计学系,哥伦比亚大学,纽约州纽约市,美国)

AI总结 本文提出深度神经网络训练与经典随机效应模型等价,揭示了优化-推断对偶性,并利用限制最大似然估计实现基于似然的早停规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09018 2026-07-07 cs.NE cs.AI cs.LG 版本更新

Evolutionary Ensemble of Agents

进化代理群体

Zongmin Yu, Liu Yang

机构 * National University of Singapore(新加坡国立大学)

AI总结 本文提出EvE框架,通过进化编码代理群体实现算法发现,解决了传统方法的局限,展示了自修正群体在复杂代码库中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16771 2026-07-07 cs.SE cs.AI cs.HC 版本更新

EyeMulator: Improving Code Language Models by Mimicking Human Visual Attention

EyeMulator:通过模仿人类视觉注意力改进代码语言模型

Yifan Zhang, Chen Huang, Yueke Zhang, Jiahao Zhang, Toby Jia-Jun Li, Collin McMillan, Kevin Leach, Yu Huang

机构 * Vanderbilt University(范德比大学) National University of Singapore(新加坡国立大学) University of Notre Dame(诺丁汉大学)

AI总结 本文提出EyeMulator,通过提取眼动数据中的扫描路径,调整代码语言模型的注意力机制,使其更符合人类视觉注意力模式,从而在翻译和摘要任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26306 2026-07-07 cs.AI 版本更新

Interactive Learning for LLM Reasoning

为LLM推理设计的交互学习

Hehai Lin, Shilei Cao, Sudong Wang, Haotian Wu, Minzhi Li, Linyi Yang, Juepeng Zheng, Chengwei Qin

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Sun Yat-sen University(中山大学) Southern University of Science and Technology(南方科技大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出ILR框架,通过动态交互和感知校准提升LLM独立问题解决能力,实验表明其在多个基准测试中优于单agent学习。

Comments The code is available at https://github.com/linhh29/Interactive-Learning-for-LLM-Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28660 2026-07-07 cs.CV 版本更新

Industrial3D: A Water-Treatment TLS Point Cloud Dataset and Cross-Paradigm Benchmark for MEP Scene Understanding

Industrial3D: 一个用于工业基础设施的地面激光雷达点云数据集和跨范式基准

Chao Yin, Hongzhe Yue, Qing Han, Difeng Hu, Zhenyu Liang, Fangzhou Lin, Bing Sun, Boyu Wang, Mingkai Li, Wei Yao, Jack C. P. Cheng

机构 * Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(香港科技大学土木与环境工程系) Guangzhou Institute of Geography, Guangdong Academy of Sciences(广东省科学院广州地理研究所) School of Civil Engineering, Southeast University(东南大学土木工程学院) College of Geography and Tourism, Hengyang Normal University(衡阳师范学院地理与旅游学院) Department of Architecture and Civil Engineering, City University of Hong Kong(香港城市大学建筑与土木工程系) S.M.A.R.T. Construction Research Group, New York University Abu Dhabi(纽约大学阿布扎比分校S.M.A.R.T.建筑研究组) Department of the Built Environment, National University of Singapore(新加坡国立大学建筑环境系) Spatial Intelligence and Urban Computing, Institute of Urban Environment, Chinese Academy of Sciences(中国科学院城市环境研究所空间智能与城市计算) State Key Lab of Ecological Security of Regions and Cities, Institute of Urban Environment, Chinese Academy of Sciences(中国科学院城市环境研究所区域与城市生态安全国家重点实验室)

AI总结 本文提出Industrial3D数据集,包含6.12亿个高精度标注点云,用于解决工业设施中密集点云的语义理解难题,并建立首个跨范式基准,揭示了工业TLS数据中统计稀有性和几何模糊性带来的领域迁移挑战。

Comments 52 pages, 8 figure, 14 tables

Journal ref 2026, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28345 2026-07-07 cs.SE cs.AI 版本更新

Reachability Across the NL/PL Boundary: A Taxonomy-Driven Dataflow Model for LLM-Integrated Applications

当代码遇见自然语言:基于分类法的LLM集成应用信息流分析

Zihao Xu, Xiao Cheng, Ruijie Meng, Yuekang Li

机构 * University of New South Wales(新南威尔士大学) Macquarie University(麦考瑞大学) National University of Singapore(新加坡国立大学)

AI总结 提出一种基于定量信息流理论的分类法,定义24个标签以跨越LLM调用的自然语言与编程语言边界,实现信息流分析,并在污点传播和程序切片中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24025 2026-07-07 cs.LG stat.ME 版本更新

i-IF-Learn: Iterative Feature Selection and Unsupervised Learning for High-Dimensional Complex Data

i-IF-Learn: 迭代特征选择与无监督学习用于高维复杂数据

Chen Ma, Wanjie Wang, Shuhao Fan

机构 * SUSTech(华南理工大学) NUS(国立大学)

AI总结 本文提出i-IF-Learn框架,通过迭代特征选择与聚类,有效识别高维数据中的关键特征,提升聚类性能并增强下游模型表现。

Comments 28 pages, 5 figures, including appendix. Accepted at AISTATS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07965 2026-07-07 stat.ML cs.LG 版本更新

Local Constrained Bayesian Optimization

局部约束贝叶斯优化

Jing Jingzhe, Fan Zheyi, Szu Hui Ng, Qingpei Hu

机构 * Department of Industrial Systems Engineering & Management, National University of Singapore, Singapore(新加坡国立大学工业系统工程与管理系,新加坡)

AI总结 针对高维约束问题的贝叶斯优化面临挑战,提出局部约束贝叶斯优化框架。利用约束惩罚替代函数的可微景观,在局部下降与探索间交替,理论证明其收敛率,实验表明优于现有基线。

Comments 28 pages, 7 figures, accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06575 2026-07-07 cs.RO cs.CV 版本更新

Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies

通过本体感知进行思考:用于VLA策略的状态基础视觉令牌选择

Fangyuan Wang, Peng Zhou, Jiaming Qi, Shipeng Lyu, Chengyang He, David Navarro-Alarcon, Guodong Guo

机构 * The Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology(东区技术研究所) Great Bay University(大湾大学) Northeast Forestry University(东北林业大学) National University of Singapore(新加坡国立大学)

AI总结 研究VLA模型中本体感知应用问题,提出ThinkProprio方法,将本体感知离散化为视觉语言模型(VLM)词汇令牌,与指令共同作用在VLM计算前选视觉补丁,贡献是提升性能、降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11960 2026-07-07 cs.LG cs.AI cs.CL 版本更新

R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning

R$^2$PO:用于大语言模型推理的解耦展开与推理策略

Jingchu Wang, Bingbing Xu, Yige Yuan, Dan Zhang, Bin Xie, Xiaoqian Sun, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国家大学)

AI总结 研究指出强化学习方法中训练轨迹与推理响应策略耦合的问题,提出R$^2$PO解耦二者,在训练时多样化展开,保持推理生成不变,实验表明其性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏