arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1990 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1990 篇

2604.16453 2026-04-21 cs.LG cs.AI stat.ML 62%

Sampling for Quality: Training-Free Reward-Guided LLM Decoding via Sequential Monte Carlo

采样以保证质量:通过序列蒙特卡洛方法实现无训练奖励引导的大语言模型解码

Jelena Markovic-Voronov, Wenhui Zhu, Bo Long, Zhipeng Wang, Suyash Gupta, Kayhan Behdin, Bee-Chung Chen, Deepak Agarwal

机构 * LinkedIn

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于概率框架的奖励引导解码方法,通过结合模型转移概率和前缀依赖的奖励势能,改进传统解码方法的序列级质量优化。实验表明,该方法在代码生成和数学推理任务中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15621 2026-04-20 cs.IR cs.AI cs.CL 62%

Rethinking the Necessity of Adaptive Retrieval-Augmented Generation through the Lens of Adaptive Listwise Ranking

重新审视通过适应性列表排序视角的适应性检索增强生成的必要性

Jun Feng, Jiahui Tang, Zhicheng He, Hang Lv, Hongchao Gu, Hao Wang, Xuezhi Yang, Shuai Fang

机构 * Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过适应性列表排序视角重新审视适应性检索增强生成的必要性,提出AdaRankLLM框架,通过零样本提示和段落dropout机制验证适应性排序的必要性,并通过两阶段渐进蒸馏提升小模型的精确排序与适应过滤能力。

Comments 7pages, 2figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12262 2026-04-15 cs.CL cs.AI 62%

CascadeDebate: Multi-Agent Deliberation for Cost-Aware LLM Cascades

级联辩论:面向成本感知的LLM级联的多智能体辩论

Raeyoung Chang, Dongwook Kwon, Jisoo Lee, Nikhil Verma

机构 * Sogang University(首尔大学) Kwangwoon University(匡明大学) Seoul National University(首尔国立大学) LG Electronics, Toronto AI Lab(LG电子,多伦多人工智能实验室)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CascadeDebate,通过在每个层级的升级边界插入多智能体辩论,解决单模型层级在模糊查询中易引发升级的问题,提升准确性和成本效率。

Comments 12 pages, 6 figures, 4 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11104 2026-04-14 cs.AI cs.IR cs.LG cs.NE 62%

Frugal Knowledge Graph Construction with Local LLMs: A Zero-Shot Pipeline, Self-Consistency and Wisdom of Artificial Crowds

基于本地LLM的节约知识图谱构建:零样本流水线、自一致性与人工群体智慧

Pierre Jourlin

机构 * Avignon Université, Laboratoire d’Informatique d’Avignon (LIA)(阿维尼翁大学,阿维尼翁计算机科学实验室(LIA))

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种多模型零样本流水线,用于知识图谱构建与利用,通过本地推理在消费级硬件上执行。研究了自一致性与人工群体智慧在多跳推理中的应用,展示了系统在零样本条件下的性能提升及碳足迹。

Comments Source code and raw results available: https://github.com/jourlin/synsynth (licence Hypocratic)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02535 2026-04-10 cs.CL cs.AI 62%

ModeX: Evaluator-Free Best-of-N Selection for Open-Ended Generation

ModeX:无需评估器的开放生成最佳-N选择

Hyeong Kyu Choi, Sharon Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ModeX提出一种无需外部评估器的最佳-N选择方法,通过识别主导语义共识的模态输出,提升开放生成任务的鲁棒性与效率。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13993 2026-04-10 cs.CL cs.AI 62%

Chunks as Arms: Multi-Armed Bandit-Guided Sampling for Long-Context LLM Preference Optimization

片段作为手臂:多臂老虎机引导的长上下文LLM偏好优化采样

Shaohua Duan, Pengcheng Huang, Xinze Li, Zhenghao Liu, Xiaoyuan Yi, Yukun Yan, Shuo Wang, Yu Gu, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Microsoft Research Asia, China(微软亚洲研究院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学计算机科学与技术系及人工智能研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LongMab框架,利用多臂老虎机策略从长上下文中选择最有信息量的片段,生成高质量多样化的响应,用于直接偏好优化训练,提升长上下文推理能力。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06013 2026-04-08 cs.AI cs.CL 62%

Epistemic Blinding: An Inference-Time Protocol for Auditing Prior Contamination in LLM-Assisted Analysis

知识盲区:一种用于审计LLM辅助分析中先验污染的推理时协议

Michael Cuccarese

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种在代理系统中用于审计LLM辅助分析中先验污染的推理时协议,通过替换实体标识符以匿名代码并比较输出与未盲对照组,以恢复审计性。

Comments code and LLM skill at: https://github.com/mcuccarese/epistemic-blinding 7 pages 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05250 2026-04-08 cs.LG cs.CL 62%

DualDiffusion: A Speculative Decoding Strategy for Masked Diffusion Models

DualDiffusion: 一种用于掩码扩散模型的推测解码策略

Satyam Goyal, Kushal Patel, Tanush Mittal, Arjun Laxman

机构 * University of Michigan(密歇根大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG

AI总结 DualDiffusion结合高效近似模型与准确验证模型,通过多步轻量级生成后单步验证,实现生成步骤与准确性之间的更优帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04987 2026-04-08 cs.LG cs.AI math.OC stat.ML 62%

Cactus: Accelerating Auto-Regressive Decoding with Constrained Acceptance Speculative Sampling

Cactus:通过受约束的接受推测采样加速自动回归解码

Yongchang Hao, Lili Mou

机构 * Dept. Computing Science & Alberta Machine Intelligence Institute (Amii), University of Alberta(阿尔伯塔大学计算机科学系与阿尔伯塔机器智能研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能讲席)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Cactus方法,通过受约束优化框架,在保证与验证器分布可控差异的同时提升接受率,有效解决传统推测采样在分布匹配上的限制问题。

Comments Camera-ready version. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03556 2026-04-07 cs.CV cs.AI cs.CL 62%

Focus Matters: Phase-Aware Suppression for Hallucination in Vision-Language Models

重点至关重要:面向视觉语言模型中幻觉的相位感知抑制

Sohyeon Kim, Sang Yeon Yoon, Kyeongbo Kong

机构 * Pusan National University(釜山大学) Pukyong National University(釜庆大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种轻量级干预方法,在视觉编码器的聚焦阶段选择性抑制低关注的token,通过单次前向传递统计信息和DPP保留多样视觉线索,减少幻觉的同时保持caption质量,且推理延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00356 2026-04-02 cs.AI cs.CL 62%

Signals: Trajectory Sampling and Triage for Agentic Interactions

信号:代理互动的轨迹采样与优先级排序

Shuguang Chen, Adil Hafeez, Salman Paracha

机构 * DigitalOcean Holdings, Inc.(DigitalOcean控股公司)

专题命中 测试时计算 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于信号的轻量框架,用于高效筛选代理交互轨迹,通过计算低成本信号提升采样效率,实验证明其在不同任务中均能有效提升信息量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00072 2026-04-02 cs.LG cs.AI stat.ML 62%

Empirical Validation of the Classification-Verification Dichotomy for AI Safety Gates

对AI安全闸门中分类-验证二元对立的实证验证

Arsenios Scrivens

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究通过实证表明,基于分类器的安全闸门在AI系统经过数百次迭代后无法维持可靠监管,且结构上无法实现。

Comments 21 pages, 9 figures. Companion theory paper: doi:10.5281/zenodo.19237451

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27403 2026-03-31 cs.LG cs.AI 62%

Conditional Factuality Controlled LLMs with Generalization Certificates via Conformal Sampling

基于符合采样的通用化证书的条件事实性控制大语言模型

Kai Ye, Qingtao Pan, Shuo Li

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出条件事实性控制框架CFC,通过增强分位数回归定义连续特征条件接受阈值,实现条件覆盖保证,并在理论和实验上证明其高效性与稳定性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25063 2026-03-27 cs.HC cs.AI cs.GR cs.LG 62%

TopoPilot: Reliable Conversational Workflow Automation for Topological Data Analysis and Visualization

TopoPilot:拓扑数据分析和可视化可靠对话工作流自动化

Nathaniel Gorski, Shusen Liu, Bei Wang

机构 * University of Utah(犹他大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 TopoPilot通过双代理架构和系统性防护机制,实现复杂科学可视化工作流的可靠自动化,其在1000次多轮对话中成功率达99%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23512 2026-03-26 cs.CL cs.AI cs.IR 62%

S-Path-RAG: Semantic-Aware Shortest-Path Retrieval Augmented Generation for Multi-Hop Knowledge Graph Question Answering

S-Path-RAG:基于语义的最短路径检索增强生成用于多跳知识图谱问答

Rong Fu, Yemin Wang, Tianxiang Xu, Yongtai Liu, Weizhi Tang, Wangyu Wu, Xiaowen Ma, Simon Fong

机构 * University of Macau(澳门大学) Xiamen University(厦门大学) Peking University(北京大学) Hanyang University(翰阳大学) University of Liverpool(利物浦大学) Zhejiang University(浙江大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 S-Path-RAG通过混合加权k最短路径、束搜索和约束随机游走策略,实现语义感知的多跳知识图谱问答,提升检索效率与生成准确性。

Journal ref WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22386 2026-03-25 cs.AI cs.CL 62%

From Static Templates to Dynamic Runtime Graphs: A Survey of Workflow Optimization for LLM Agents

从静态模板到动态运行时图:LLM代理工作流优化的综述

Ling Yue, Kushal Raj Bhandari, Ching-Yun Ko, Dhaval Patel, Shuxin Lin, Nianjun Zhou, Jianxi Gao, Pin-Yu Chen, Shaowu Pan

机构 * Department of Computer Science, Rensselaer Polytechnic Institute(伦斯勒理工学院计算机科学系) IBM Research(IBM研究院) Department of Mechanical, Aerospace, and Nuclear Engineering, Rensselaer Polytechnic Institute(伦斯勒理工学院机械、航空航天与核工程系)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了LLM代理工作流优化方法,区分静态与动态方法,探讨结构确定时间、优化部分及评估信号,提出结构感知评估视角以提升可比性和可复现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18620 2026-03-20 cs.CL cs.AI 62%

Learning to Self-Evolve

学习自我进化

Xiaoyin Chen, Canwen Xu, Yite Wang, Boyi Liu, Zhewei Yao, Yuxiong He

机构 * Mila – Quebec AI Institute(魁北克AI研究院) University of Montreal(蒙特利尔大学) Snowflake(Snowflake公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LSE框架,通过强化学习训练大语言模型在测试时自我改进上下文,实验显示其在文本到SQL生成和通用问答任务中优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18101 2026-03-20 cs.CV cs.AI cs.LG 62%

Training-Only Heterogeneous Image-Patch-Text Graph Supervision for Advancing Few-Shot Learning Adapters

仅训练异构图像-补丁-文本图监督以推进少样本学习适配器

Mohammed Rahman Sherif Khan Mohammad, Ardhendu Behera, Sandip Pradhan, Swagat Kumar, Amr Ahmed

机构 * Edge Hill University(埃德希尔大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种仅训练的异构图监督方法,通过多尺度视觉补丁和文本提示构建统一图,利用模态感知图变压器进行跨模态推理,并通过节点过滤提取高保真类特征,从而提升少样本学习性能。

Comments Accepted at The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17811 2026-03-19 cs.LG cs.AI 62%

Dropout Robustness and Cognitive Profiling of Transformer Models via Stochastic Inference

通过随机推断分析变换器模型的丢弃鲁棒性与认知分析

Antônio Junior Alves Caiado, Michael Hahsler

机构 * Lyle School of Engineering, Southern Methodist University, Dallas, TX, USA(莱尔工程学院,南方 Methodist 大学,德克萨斯州达拉斯)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过随机推断分析19种变换器模型的丢弃鲁棒性,揭示其在不确定性应用中的可靠性差异,提出认知分解框架以指导模型选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15724 2026-03-18 cs.LG cs.AI 62%

Meta-TTRL: A Metacognitive Framework for Self-Improving Test-Time Reinforcement Learning in Unified Multimodal Models

Meta-TTRL:一种用于统一多模态模型中自改进测试时间强化学习的元认知框架

Lit Sin Tan, Junzhe Chen, Xiaolong Fu, Lichen Ma, Junshi Huang, Jianzhong Shi, Yan Li, Lijie Wen

机构 * Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Meta-TTRL通过元认知信号实现测试时间参数优化,提升统一多模态模型的自改进能力,在文本到图像生成任务中取得显著成果。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22629 2026-03-18 cs.CL cs.AI 62%

Time-Annealed Perturbation Sampling: Diverse Generation for Diffusion Language Models

时间退火扰动采样:扩散语言模型的多样化生成

Jingxuan Wu, Zhenglin Wan, Xingrui Yu, Yuzhe Yang, Yiqiao Huang, Ivor Tsang, Yang You

机构 * The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) National University of Singapore(新加坡国立大学) CFAR, Agency for Science, Technology and Research(科技研究局CFAR) University of California, Santa Barbara(加州大学圣芭芭拉分校) Harvard University(哈佛大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出时间退火扰动采样方法,通过在扩散过程中早期鼓励语义分支并逐步减少扰动,提升生成多样性,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08412 2026-03-10 cs.CL cs.AI 62%

Aligning to Illusions: Choice Blindness in Human and AI Feedback

对幻觉的对齐:人类和AI反馈中的选择盲区

Wenbin Wu

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示RLHF中偏好构建的问题,显示人类和AI反馈中的选择盲区受上下文影响,导致奖励信号失真。

Comments 16 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06797 2026-03-10 cs.AI cs.LG 62%

Best-of-Tails: Bridging Optimism and Pessimism in Inference-Time Alignment

最佳尾部:在推理时间对齐中弥合乐观与悲观

Hsiang Hsu, Eric Lei, Chun-Fu Chen

机构 * JPMorganChase Global Technology Applied Research(摩根大通全球技术应用研究)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出BoT框架,通过Tsallis分歧作为正则化器,在推理时间对齐中平衡乐观与悲观,提升对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06612 2026-03-10 cs.LG cs.AI 62%

Consensus is Not Verification: Why Crowd Wisdom Strategies Fail for LLM Truthfulness

共识并非验证:为何众智策略在LLM诚实性上失效

Yegor Denisov-Blanch, Joshua Kazdan, Jessica Chudnovsky, Rylan Schaeffer, Sheng Guan, Soji Adeshina, Sanmi Koyejo

机构 * stanford(斯坦福大学) amazon(亚马逊)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究发现,扩展计算量无法提升LLM在无验证领域的诚实性,因模型错误高度相关,聚合方法反而放大误解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17908 2026-03-10 cs.CV cs.AI cs.LG 62%

ReDepth Anything: Test-Time Depth Refinement via Self-Supervised Re-lighting

ReDepth Anything: 通过自监督重照明进行测试时深度细化

Ananta R. Bhattarai, Helge Rhodin

机构 * Bielefeld University(比勒菲尔德大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ReDepth Anything通过自监督重照明技术,在测试时提升深度估计的准确性和真实感,优于现有方法并达到最新水平。

Comments Accepted at CVPR 2026 (Findings). Project Page: https://anantarb.github.io/redepth Code: https://github.com/anantarb/Re-Depth-Anything

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06317 2026-03-09 cs.LG cs.AI 62%

From Entropy to Calibrated Uncertainty: Training Language Models to Reason About Uncertainty

从熵到校准的不确定性:训练语言模型以推理不确定性

Azza Jenane, Nassim Walha, Lukas Kuhn, Florian Buettner

机构 * German Cancer Research Center (DKFZ)(德国癌症研究中心(DKFZ)) German Cancer Consortium (DKTK)(德国癌症联盟(DKTK)) Goethe University Frankfurt, Germany(法兰克福歌德大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种三阶段流程,通过训练语言模型以在测试时高效推断校准的不确定性,提升模型在高风险领域的可靠性与泛化能力。

Comments 4 pages, submitted to AISTATS Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11629 2026-03-09 cs.LG cs.AI 62%

Reasoned Safety Alignment: Ensuring Jailbreak Defense via Answer-Then-Check

理性安全对齐:通过答案后检查确保对抗攻击防御

Chentao Cao, Xiaojun Xu, Bo Han, Hang Li

机构 * TMLR Group, Department of Computer Science, Hong Kong Baptist University(TMLR小组,计算机科学系,香港 Baptist大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出答案后检查方法,通过推理增强模型对抗攻击防御能力,实验表明其在安全性和效率上的优势。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04893 2026-03-06 cs.CL cs.AI 62%

Free Lunch for Pass@$k$? Low Cost Diverse Sampling for Diffusion Language Models

免费午餐吗?低成本的多样化采样用于扩散语言模型

Sean Lamont, Christian Walder, Paul Montague, Amir Dezfouli, Michael Norrish

机构 * Australian National University(澳大利亚国立大学) Defence Science and Technology Group(国防科学与技术集团) Google DeepMind(谷歌DeepMind) BIMLOGIQ

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种低成本方法,通过修改中间样本以增强扩散语言模型的生成多样性,从而提升Pass@$k$任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04772 2026-03-06 cs.CL cs.AI 62%

TSEmbed: Unlocking Task Scaling in Universal Multimodal Embeddings

TSEmbed: 解锁通用多模态嵌入中的任务扩展

Yebo Wu, Feng Liu, Ziwei Xie, Zhiyuan Liu, Changwang Zhang, Jun Wang, Li Li

机构 * State Key Laboratory of IOTSC, University of Macau(物联网科学与技术国家重点实验室,澳门大学) OPPO Research Institute(OPPO研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 TSEmbed通过融合MoE与LoRA,结合专家感知负采样策略,提升通用多模态嵌入的任务扩展能力,并在基准和工业数据集上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05612 2026-03-04 cs.LG cs.AI 62%

Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle

Shuffle-R1: 通过数据导向的动态洗牌提升多模态大语言模型的强化学习框架

Linghao Zhu, Yiran Guan, Dingkang Liang, Jianzhong Ju, Zhenbo Luo, Bin Qin, Jian Luan, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) MiLM Plus, Xiaomi Inc.(MiLM Plus,小米公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Shuffle-R1通过动态洗牌和轨迹采样提升多模态大语言模型的强化学习效率,实现更高效的训练效果。

Comments This paper has been accepted by ICLR 2026. Conference link: https://iclr.cc/virtual/2026/poster/10007559 OpenReview link: https://openreview.net/forum?id=mYP33u1QBK Project page at: https://xenozlh.github.io/Shuffle-R1/

Journal ref The Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏