arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1990 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1990 篇

2603.01494 2026-03-03 cs.SE cs.AI cs.CR cs.LG 62%

Inference-Time Safety For Code LLMs Via Retrieval-Augmented Revision

通过检索增强的修订实现代码LLM的推理时安全性

Manisha Mukherjee, Vincent J. Hellendoorn

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 通过检索增强的修订机制提升代码LLM的推理时安全性,提高生成代码的安全性并减少漏洞。

Comments Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI: Interpretability, Robustness, and Safety Across Modalities

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23556 2026-03-02 cs.LG cs.AI cs.DC cs.MA cs.PF 62%

Rudder: Steering Prefetching in Distributed GNN Training using LLM Agents

Rudder: 在分布式GNN训练中利用LLM代理进行转向预取

Aishwarya Sarkar, Sayan Ghosh, Nathan Tallent, Aman Chadha, Tanya Roosta, Ali Jannesari

机构 * Iowa State University(爱荷华州立大学) Pacific Northwest National Laboratory(太平洋西北国家实验室) Amazon GenAI(亚马逊生成人工智能) University of California, Berkeley(加州大学伯克利分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Rudder利用LLM代理的生成式AI能力,通过自适应预取减少分布式GNN训练中的通信开销,提升训练性能达91%。

Comments Accepted to the 40th ACM International Conference on Supercomputing (ICS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13359 2026-02-27 cs.AI cs.CL 62%

Cost-of-Pass: An Economic Framework for Evaluating Language Models

Cost-of-Pass:语言模型生产力评估的经济框架

Mehmet Hamza Erol, Batu El, Mirac Suzgun, Mert Yuksekgonul, James Zou

机构 * Stanford University(斯坦福大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种经济框架,用于评估语言模型的生产力,通过结合准确性和成本,揭示了不同模型在不同任务中的成本效益,并探讨了创新对成本效率的影响。

Comments Code is available at: https://github.com/mhamzaerol/Cost-of-Pass

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18292 2026-02-26 cs.LG cs.AI 62%

Decoding as Optimisation on the Probability Simplex: From Top-K to Top-P (Nucleus) to Best-of-K Samplers

解码作为概率单纯形上的优化:从Top-K到Top-P(核)到Best-of-K采样器

Xiaotong Ji, Rasul Tutunov, Matthieu Zimmer, Haitham Bou-Ammar

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于概率单纯形优化的解码框架,统一了Top-K、Top-P等采样方法,并引入Best-of-K采样器提升多样本流程性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05154 2026-02-26 cs.CL cs.AI cs.IR 62%

Resisting Contextual Interference in RAG via Parametric-Knowledge Reinforcement

通过参数知识强化来抵御RAG中的上下文干扰

Chenyu Lin, Yilin Wen, Du Su, Hexiang Tan, Fei Sun, Muhan Chen, Chenfu Bao, Zhonghou Lyu

机构 * Baidu Inc.(百度公司) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Knowledgeable-R1通过参数知识强化提升RAG在知识冲突和一般场景中的鲁棒性与推理准确性,反事实场景中表现优于现有基线。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25860 2026-02-23 cs.AI cs.CL cs.HC 62%

Through the Judge's Eyes: Inferred Thinking Traces Improve Reliability of LLM Raters

通过裁判之眼:推断的思考轨迹提升LLM评分器的可靠性

Xingjian Zhang, Tianhong Gao, Suliang Jin, Tianhao Wang, Teng Ye, Eytan Adar, Qiaozhu Mei

机构 * University of Michigan(密歇根大学) University of California, San Diego(加州大学圣地亚哥分校) University of Minnesota(明尼苏达大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过人与LLM协作框架推断思考轨迹,提升LLM评分器的可靠性及人类与LLM之间的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14556 2026-02-23 cs.AI cs.ET cs.LG cs.RO 62%

LLM-Enabled In-Context Learning for Data Collection Scheduling in UAV-assisted Sensor Networks

基于大语言模型的上下文学习用于无人机辅助传感器网络中的数据采集调度

Yousef Emami, Hao Zhou, SeyedSina Nabavirazani, Luis Almeida

机构 * Real-Time and Embedded Computing Systems Research Centre (CISTER)(实时与嵌入式计算系统研究中心(CISTER)) Faculdade de Engenharia da Universidade do Porto(葡萄牙波尔图大学工程学院) School of Computer Science, McGill University(麦吉尔大学计算机科学学院) Knight Foundation School of Computing and Information Sciences, Florida International University(国际大学计算与信息科学学院(Knight基金会))

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于大语言模型的上下文学习数据采集调度系统,用于解决无人机辅助传感器网络中的紧急调度问题,通过自然语言任务描述和安全验证机制提升调度效率和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16833 2026-02-20 cs.LG cs.AI 62%

VAM: Verbalized Action Masking for Controllable Exploration in RL Post-Training -- A Chess Case Study

VAM:在RL后训练中可控探索的可言行动屏蔽——国际象棋案例研究

Zhicheng Zhang, Ziyan Wang, Yali Du, Fei Fang

机构 * Carnegie Mellon University(卡内基梅隆大学) King's College London(国王学院伦敦)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 VAM通过可言化动作屏蔽提升LLM后训练强化学习的探索效率,在国际象棋中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16787 2026-02-20 cs.LG cs.CL 62%

Better Think Thrice: Learning to Reason Causally with Double Counterfactual Consistency

三思而后行:通过双重反事实一致性学习因果推理

Victoria Lin, Xinnuo Xu, Rachel Lawrence, Risa Ueno, Amit Sharma, Javier Gonzalez, Niranjani Prasad

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Research Cambridge(微软研究院剑桥分部) Microsoft Research India(微软研究院印度分部)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出双重反事实一致性方法,用于评估和提升大型语言模型的因果推理能力,无需标注数据,通过因果干预和反事实预测验证模型能力,并在多种任务中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20802 2026-02-17 cs.LG cs.AI 62%

Reinforcement Learning via Self-Distillation

通过自我蒸馏进行强化学习

Jonas Hübotter, Frederike Lübeck, Lejs Behric, Anton Baumann, Marco Bagatella, Daniel Marta, Ido Hakimi, Idan Shenfeld, Thomas Kleine Buening, Carlos Guestrin, Andreas Krause

机构 * ETH Zurich(苏黎世联邦理工学院) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) MIT(麻省理工学院) Stanford(斯坦福大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 通过自我蒸馏策略优化(SDPO)提升强化学习在可验证环境中的样本效率和准确性,利用自身反馈改进策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00499 2026-02-17 cs.LG cs.AI stat.ML 62%

ESPO: Entropy Importance Sampling Policy Optimization

ESPO:熵重要性采样策略优化

Yuepeng Sheng, Yuwei Huang, Shuman Liu, Anxiang Zeng, Haibo Zhang

机构 * LLM Team, Shopee Pte. Ltd.(Shopee 股份有限公司大语言模型团队)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ESPO通过结合细粒度更新与稳定训练,解决梯度利用率不足问题,提升大语言模型在复杂推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12153 2026-02-13 cs.CL cs.AI 62%

dVoting: Fast Voting for dLLMs

dVoting: dLLMs的快速投票

Sicheng Feng, Zigeng Chen, Xinyin Ma, Gongfan Fang, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 dVoting通过快速投票技术提升dLLMs推理能力,无需训练,有效提高多个基准测试的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05188 2026-02-12 cs.CL cs.AI 62%

Fixing the Broken Compass: Diagnosing and Improving Inference-Time Reward Modeling

修复破碎的指南针:诊断并改进推理时间奖励建模

Jiachun Li, Pengfei Cao, Zhuoran Jin, Yubo Chen, Jiexin Xu, Huaijun Li, Xiaojian Jiang, Kang Liu, Jun Zhao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所认知与决策智能复杂系统重点实验室) China Merchants Bank(中国 Merchants 银行)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CRISP算法,通过聚类和逐步前缀优化,提升LLM在推理任务中的性能,实现5%的准确率提升。

Comments 38 pages, 30 figures, Accpeted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10030 2026-02-11 cs.CL cs.AI 62%

Inference-Aware Prompt Optimization for Aligning Black-Box Large Language Models

面向推理的提示优化以对齐黑盒大语言模型

Saaduddin Mahmud, Mason Nakamura, Kyle Hollins Wray, Shlomo Zilberstein

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出IAPO框架,通过联合优化提示和推理规模,提升黑盒大语言模型对齐效果。

Comments Accepted to AAAI 2026. Extended 17-page version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22129 2026-02-06 cs.SE cs.AI cs.LG 62%

SWE-Replay: Efficient Test-Time Scaling for Software Engineering Agents

SWE-Replay:面向软件工程代理的高效测试时间扩展

Yifeng Ding, Lingming Zhang

机构 * Siebel School of Computing(计算科学系) Data Science, University of Illinois Urbana-Champaign, USA(数据科学,伊利诺伊大学厄巴纳-香槟分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 SWE-Replay通过重用历史轨迹和动态选择探索或利用策略,实现了高效且可推广的软件工程代理测试时间扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03053 2026-02-04 cs.AI cs.CL cs.MA 62%

MAS-ProVe: Understanding the Process Verification of Multi-Agent Systems

MAS-ProVe: 理解多智能体系统的进程验证

Vishal Venkataramani, Haizhou Shi, Zixuan Ke, Austin Xu, Xiaoxiao He, Yingbo Zhou, Semih Yavuz, Hao Wang, Shafiq Joty

机构 * Rutgers University(罗杰斯大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MAS-ProVe研究多智能体系统进程验证的有效性,发现LLM作为法官表现优于奖励方法,但验证过程仍面临上下文长度与性能的权衡问题。

Comments Preprint; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07182 2026-02-04 cs.LG cs.AI 62%

PRPO: Aligning Process Reward with Outcome Reward in Policy Optimization

PRPO:在策略优化中对过程奖励与结果奖励的对齐

Ruiyi Ding, Yongxuan Lv, Xianhui Meng, Jiahe Song, Chao Wang, Chen Jiang, Yuan Cheng

机构 * Shanghai University(上海大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学) Artificial Intelligence Incubation and Innovation Institute, Fudan University(复旦大学人工智能孵化与创新研究院) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 PRPO通过结合结果可靠性与过程级指导,在无批评者框架中提升策略优化效率,实现对过程奖励与结果奖励的对齐,从而提高模型在多步推理任务中的性能。

Comments 8 pages, 2 figures Code is available at: https://github.com/SchumiDing/srpocode

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18793 2026-02-04 cs.AI cs.LG 62%

NEZHA: A Zero-sacrifice and Hyperspeed Decoding Architecture for Generative Recommendations

NEZHA:一种零牺牲和超高速解码架构用于生成推荐

Yejing Wang, Shengyu Zhou, Jinyu Lu, Ziwei Liu, Langming Liu, Maolin Wang, Wenlin Zhang, Feng Li, Wenbo Su, Pengjie Wang, Jian Xu, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Alibaba Group(阿里巴巴集团)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 NEZHA 提出了一种无需牺牲推荐质量的超高速解码架构,通过集成灵活的自回归草稿头和高效验证器,提升生成推荐系统的性能和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01613 2026-02-03 cs.LG cs.AI 62%

A Practical Tensor-Network Compression Pipeline for Production-Scale Large Language Models

一种用于生产级大语言模型的实用张量网络压缩管道

Sergii Kozyrev, Davyd Maiboroda

机构 * Minima AI, Inc.(Minima AI 公司)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 Minima是一种用于大语言模型的实用张量网络压缩管道,通过结构压缩和自定义内核提升推理效率和吞吐量。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20169 2026-02-03 cs.LG cs.CL stat.ML 62%

Learning to Reason in LLMs by Expectation Maximization

通过期望最大化学习大语言模型的推理能力

Junghyun Lee, Branislav Kveton, Anup Rao, Subhojyoti Mukherjee, Ryan A. Rossi, Sunav Choudhary, Alexa Siu

机构 * kaist-ai(韩国科学技术院人工智能学院) adobe(Adobe研究)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于奖励的过滤期望最大化方法,通过不同采样方案提升大语言模型的推理能力,实验表明PPS在任务表现上优于其他方案。

Comments 27 pages, 15 figures, 5 tables (ver2: major revision, including new experiments, reorganization, etc)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17768 2026-02-02 cs.LG cs.AI cs.DC 62%

LLM-42: Enabling Determinism in LLM Inference with Verified Speculation

LLM-42: 通过验证推测实现LLM推理的确定性

Raja Gond, Aditya K Kamath, Ramachandran Ramjee, Ashish Panwar

机构 * Microsoft Research(微软研究院) University of Washington(华盛顿大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 LLM-42通过验证推测方法,在LLM推理中实现确定性,利用形状一致的减少和轻量级验证-回滚循环,减少确定性需求的开销。

Comments https://github.com/microsoft/llm-42

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19225 2026-01-29 cs.CL cs.AI 62%

RPO-RAG: Aligning Small LLMs with Relation-aware Preference Optimization for Knowledge Graph Question Answering

RPO-RAG: 通过关系感知的偏好优化对齐小型LLM以实现知识图谱问答

Kaehyun Um, KyuHwan Yeom, Haerim Yang, Minyoung Choi, Hyeongjun Yang, Kyong-Ho Lee

机构 * Yonsei University(延世大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 RPO-RAG通过关系感知的偏好优化和以答案为中心的提示设计,提升小型LLM在知识图谱问答中的推理能力,实现性能提升。

Comments Accepted at The Web Conference (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15482 2026-01-23 cs.LG cs.AI 62%

Martingale Foresight Sampling: A Principled Approach to Inference-Time LLM Decoding

鞅前瞻性采样:一种推断时间LLM解码的原理性方法

Huayu Li, ZhengXiao He, Siyuan Tian, Jinghao Wen, Ao Li

机构 * University of Arizona(亚利桑那大学) Microsoft Research Asia(微软亚洲研究院) Villanova University(维拉诺瓦大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出鞅前瞻性采样,通过概率论原理改进LLM解码,提升推理准确性和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08864 2026-01-22 cs.LG cs.AI cs.CR 62%

The Good, the Bad and the Ugly: Meta-Analysis of Watermarks, Transferable Attacks and Adversarial Defenses

好坏与丑:水印、可转移攻击和对抗防御的元分析

Grzegorz Głuch, Berkant Turan, Sai Ganesh Nagarajan, Sebastian Pokutta

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文通过元分析探讨了水印、可转移攻击和对抗防御之间的权衡,证明了三者中至少存在其一,并利用全同态加密构建了可转移攻击的实例。

Comments 47 pages, 3 figures, 4 tables, preliminary version published in ICML 2024 (Workshop on Theoretical Foundations of Foundation Models) and , see https://openreview.net/pdf?id=WMaFRiggwV

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11000 2026-01-19 cs.CL cs.AI 62%

When Personalization Misleads: Understanding and Mitigating Hallucinations in Personalized LLMs

当个性化误导:理解并缓解个性化大语言模型中的幻觉现象

Zhongxiang Sun, Yi Zhan, Chenglei Shen, Weijie Yu, Xiao Zhang, Ming He, Jun Xu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学首都人工智能学院) AI Lab at Lenovo Research(联想研究院人工智能实验室) School of Artificial Intelligence and Data Science, University of International Business and Economics(国际商务与经济大学人工智能与数据科学学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FPPS方法,通过轻量级推理时间策略缓解个性化大语言模型中的事实性幻觉问题,并引入PFQABench基准评估事实性和个性化问答性能。

Comments 20 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25063 2026-01-19 cs.LG cs.CL 62%

Many Minds from One Model: Bayesian-Inspired Transformers for Population Diversity

一模多样:基于贝叶斯思想的变压器用于群体多样性

Diji Yang, Yi Zhang

机构 * University of California Santa Cruz(加州大学圣克ruz分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 B-Trans通过在归一化层中引入随机性,实现从单一预训练模型中采样出多样且连贯的变压器实例,提升响应多样性与任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08302 2026-01-14 cs.CL cs.AI 62%

Enhancing Sentiment Classification and Irony Detection in Large Language Models through Advanced Prompt Engineering Techniques

通过高级提示工程技术增强大型语言模型的情感分类和讽刺检测

Marvin Schmitt, Anne Schwerk, Sebastian Lempert

机构 * IU International University of Applied Sciences(国际应用科学大学)

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文通过高级提示工程技术提升大型语言模型在情感分类和讽刺检测中的性能,发现不同提示策略对不同模型和任务效果显著。

Comments 21 pages, 4 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26167 2026-01-14 cs.AI cs.CL 62%

ToolRM: Towards Agentic Tool-Use Reward Modeling

ToolRM: 向代理工具使用奖励建模迈进

Renhao Li, Jianhong Tu, Yang Su, Yantao Liu, Fei Huang, Hamid Alinejad-Rokny, Derek F. Wong, Junyang Lin, Min Yang

机构 * University of Macau(澳门大学) Qwen Team, Alibaba Inc.(阿里云Qwen团队) UNSW Sydney(新南威尔士大学悉尼分校) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 测试时计算 :self-correction(abstract);分类 cs.CL、cs.AI

AI总结 ToolRM通过构建高质量偏好数据集和基准,提升代理AI在工具调用任务中的表现和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15793 2026-01-14 cs.CL cs.LG 62%

Format as a Prior: Quantifying and Analyzing Bias in LLMs for Heterogeneous Data

以格式为先:量化和分析LLM在异构数据中的偏见

Jiacheng Liu, Mayi Xu, Qiankun Pi, Wenli Li, Ming Zhong, Yuanyuan Zhu, Mengchi Liu, Tieyun Qian

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文通过三阶段分析,揭示了LLM在处理异构数据时的格式偏见问题,提出通过数据预处理、推理干预和平衡训练语料库来减少偏见的方法。

Comments Accepted by AAAI 2026, camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23027 2026-01-13 cs.LG cs.CL 62%

Towards Stable and Effective Reinforcement Learning for Mixture-of-Experts

面向混合专家架构的稳定且有效的强化学习

Di Zhang, Xun Wu, Shaohan Huang, Lingjie Jiang, Yaru Hao, Li Dong, Zewen Chi, Zhifang Sui, Furu Wei

机构 * Microsoft Research(微软研究院) Peking University(北京大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种路由感知方法,通过优化重要性采样权重提升混合专家架构的强化学习稳定性与性能。

Comments Added additional experiments, improved analysis, and fixed minor issues

详情

展开后加载摘要…

URL PDF HTML 收藏