arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-28 至 2026-05-28 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 14 篇

2602.05897 2026-05-28 cs.CL 87%

Stop Rewarding Hallucinated Steps: Faithfulness-Aware Step-Level Reinforcement Learning for Small Reasoning Models

停止奖励幻觉步骤:面向小型推理模型的忠实感知步骤级强化学习

Shuo Nie, Hexuan Deng, Chao Wang, Ruiyu Fang, Xuebo Liu, Shuangyong Song, Yu Li, Min Zhang, Xuelong Li

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院) Institute of Artificial Intelligence (TeleAI), China Telecom Corp Ltd(中国电信人工智能研究院) College of Integrated Circuits, Zhejiang University, Hangzhou, Zhejiang, China(浙江大学集成电路学院) Zhongguancun Academy, Beijing, China(中关村学院)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 针对小型推理模型在中间推理步骤中容易产生忠实性幻觉的问题,提出忠实感知步骤级强化学习(FaithRL),通过过程奖励模型提供步骤级监督和隐式截断重采样策略,减少幻觉并提高推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28805 2026-05-28 cs.CL cs.AI cs.CV cs.LG 85%

OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration

OmniVerifier-M1: 具有显式结构化重校准的多模态元验证器

Xinchen Zhang, Bowei Liu, Jiale Liu, Chufan Shi, Yizhen Zhang, Junhong Liu, Youliang Zhang, Zhiheng Li, Yujiu Yang, Ling Yang

机构 * Tsinghua University(清华大学) Pennsylvania State University(宾夕法尼亚州立大学) University of Southern California(南加州大学) Microcyto Princeton University(普林斯顿大学)

专题命中 测试时计算 :verifier(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出OmniVerifier-M1,通过符号化元验证(如边界框)和解耦强化学习,实现多模态大模型的可靠细粒度验证与动态区域级自校正。

Comments ICML 2026. Project: https://github.com/Cominclip/OmniVerifier

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28295 2026-05-28 cs.AI cs.CL cs.LG 75%

Where Rollouts Begin: Low-Load, High-Leverage First-Token Diversification for RLVR

Rollouts 的起点:面向 RLVR 的低负载、高杠杆的首 token 多样化

Soeun Kim, Albert No

机构 * Department of Artificial Intelligence, Yonsei University(延世大学人工智能系)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出 REFT 方法,通过在推理标记后的第一个 token 处进行均匀采样多样化,以低开销显著提升 RLVR 中 rollout 的多样性,从而改善推理模型的 Pass@k 性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22735 2026-05-28 cs.CL 70%

Explanation Generation for Contradiction Reconciliation with LLMs

面向矛盾调和的大语言模型解释生成

Jason Chan, Zhixue Zhao, Robert Gaizauskas

机构 * University of Sheffield, UK(谢菲尔德大学)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.CL

AI总结 提出矛盾调和解释生成任务,通过改造NLI数据集和设计质量指标,评估18个LLM在该任务上的表现,发现模型能力有限且增大模型规模时“思考”收益递减。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27858 2026-05-28 cs.CL cs.AI cs.LG 67%

DecomposeRL: Learning to Ask Useful, Informative, and Diverse Questions for Semi-Supervised, Traceable Claim Verification

DecomposeRL: 学习提出有用、信息丰富且多样的问题以进行半监督、可追踪的声明验证

Shubhashis Roy Dipta, Ankur Padia, Francis Ferraro

机构 * Department of Computer Science and Electrical Engineering(计算机科学与电气工程系)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出DecomposeRL框架,通过GRPO和多面奖励集成将声明分解为可追踪的子问题,在完全监督和半监督设置下实现高精度,且模型规模小4倍仍匹配大模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12015 2026-05-28 cs.CR cs.AI cs.CL cs.LG cs.MA 67%

SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces

SkillSafetyBench:在技能面攻击表面下评估智能体安全性

Chang Jin, An Wang, Zeming Wei, Kai Wang, Biaojie Zeng, Qiaosheng Zhang, Chao Yang, Jingjing Qu, Xia Hu, Xingcheng Xu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) East China Normal University(华东师范大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SkillSafetyBench基准,通过155个对抗案例评估大语言模型智能体在技能、本地工件和执行环境文件等非用户攻击下的安全失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11170 2026-05-28 cs.LG cs.AI cs.CL 67%

EAGer: Entropy-Aware GEneRation for Adaptive Inference-Time Scaling

EAGer: 基于熵感知的自适应推理时缩放生成方法

Daniel Scalena, Leonidas Zotos, Elisabetta Fersini, Malvina Nissim, Ahmet Üstün

机构 * University of Groningen(格罗宁根大学) University of Milan - Bicocca(米兰-比科卡大学) Cohere Labs(Cohere实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种无需训练的生成方法EAGer,利用逐词熵分布动态分配计算资源,在复杂推理任务中提升性能并减少冗余计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28561 2026-05-28 cs.CL cs.LG 62%

Soft-SVeRL: Self-Verified Reinforcement Learning with Soft Rewards

Soft-SVeRL: 基于软奖励的自验证强化学习

Saurabh Dash, Pierre Clavier, John Dang, Matthias Galle, Marzieh Fadaee, Ahmet Üstün, Beyza Ermis

机构 * Cohere Labs(Cohere实验室)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG

AI总结 针对部分可验证任务,提出基于检查表分解的软奖励框架Soft-RLVR及其自验证变体Soft-SVeRL,通过密集部分信用信号提升强化学习训练效果,并解决自验证中的奖励膨胀问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28142 2026-05-28 cs.LG cs.CL 62%

Self-Consistency via Marginal Sharpening

通过边际锐化实现自一致性

Aleksei Arzhantsev, Otmane Sakhi, Nicolas Chopin

机构 * Criteo AI Lab(Criteo AI实验室) CREST IP Paris(巴黎CREST研究所) ENSAE, Institut Polytechnique de Paris(巴黎理工学院ENSAE)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出一种自回归并行采样算法,通过锐化答案边际分布而非完整输出分布,在数学和编程基准上优于标准功率采样且速度更快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25252 2026-05-28 cs.LG cs.AI 62%

Quantifying Empirical Compute-Supervision Tradeoffs in RLVR

量化 RLVR 中计算与监督的实证权衡

Ryo Mitsuhashi, Patrick Chen, Isabelle Tseng, Jasin Cekinmez, Addison J. Wu

机构 * Princeton University(普林斯顿大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 通过 GSM8K 上的 GRPO 实验,研究验证器噪声对 RLVR 的影响,发现计算扩展无法弥补监督噪声,且假阴性比假阳性危害更大。

Comments Workshop on Combining Theory and Benchmarks @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02329 2026-05-28 cs.CL cs.AI 62%

SelfJudge: Faster Speculative Decoding via Self-Supervised Judge Verification

SelfJudge: 通过自监督验证器加速推测解码

Kanghoon Yoon, Minsub Kim, Sungjae Lee, Joonhyung Lee, Sunghyeon Woo, Yeonjun In, Se Jung Kwon, Chanyoung Park, Dongsoo Lee

机构 * Efficient AI Large Language Model(大型语言模型) Speculative Decoding(推测解码)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出SelfJudge方法,利用目标模型的自监督训练验证器,通过评估令牌替换后响应的语义保持性来加速推测解码,实现更优的推理-准确率权衡。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28338 2026-05-28 cs.AI 57%

SafeMed-R1: Clinician-Audited Safety and Ethics Alignment for Medical Large Language Models

SafeMed-R1: 临床医生审计的安全与伦理对齐用于医疗大语言模型

Chao Ding, Mouxiao Bian, Tianbin Li, Minjia Yuan, Yidong Jiang, Yankai Jiang, Jinru Ding, Jiayuan Chen, Zhuangzhi Gao, Pengcheng Chen, Zhao He, Rongzhao Zhang, Meiling Liu, Luyi Jiang, Jie Xu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Joint Laboratory of Biomedical Artificial Intelligence(生物医学人工智能联合实验室) Shanghai Institute of Infectious Disease and Biosecurity(上海传染病与生物安全研究院) Shanghai Health Development Research Center (Shanghai Medical Information Center)(上海健康发展战略研究中心(上海医疗信息中心)) University of Washington(华盛顿大学) Department of Eye and Vision Sciences, University of Liverpool(利物浦大学眼科与视觉科学系) Liverpool Centre for Cardiovascular Science, University of Liverpool(利物浦大学心血管科学中心) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 提出SafeMed-R1模型,通过可追溯的临床信任信号管道和红队压力测试实现安全与伦理对齐,在临床基准上达到79.6%的宏平均准确率,并将不安全输出减少约3-5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28022 2026-05-28 cs.CL cs.SE 57%

Beyond pass@k: Redundancy-Aware RLVR for Multi-Sample Code Generation

超越 pass@k:面向多样本代码生成的冗余感知 RLVR

Le Bronnec Florian, Alexandre Verine, Rio Yokota, Benjamin Negrevergne

机构 * RIKEN Center for Computational Science(日本计算科学中心)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 针对代码生成中重复采样评估的冗余问题,提出基于 JPlag 相似度的反冗余奖励增强 RLVR,在有限预算下提升可执行正确性。

Comments Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27955 2026-05-28 cs.PL cs.CL 57%

Skill-as-Pseudocode: Refactoring Skill Libraries to Pseudocode for LLM Agents

技能即伪代码:将技能库重构为面向LLM智能体的伪代码

Xinze Li, Yuhang Zang, Yixin Cao, Aixin Sun

机构 * Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 提出Skill-as-Pseudocode (SaP)方法,自动将Markdown技能库转换为带类型伪代码,通过确定性质量检查解决LLM智能体在检索技能时产生的混淆循环问题,在ALFWorld任务上显著优于基线。

Comments Preprint. Code: https://github.com/InternLM/Skill-as-Pseudocode

详情

展开后加载摘要…

URL PDF HTML 收藏