arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1990 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1990 篇

2605.18374 2026-05-19 cs.LG cs.AI 62%

Beyond Inference-Time Search: Reinforcement Learning Synthesizes Reusable Solvers

超越推理时间搜索:强化学习合成可重用求解器

Soheyl Massoudi, Gabriel Apaza, Milad Habibi, Mark Fuge

机构 * ETH Zürich(苏黎世联邦理工学院) University of Maryland(马里兰大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了强化学习能否将组合优化的推理成本转移到代码LLM的权重中,从而合成可重用的求解器。通过Synergistic Dependency Selection问题,研究发现强化学习能有效生成约束感知的模拟退火模板,并在多个领域展示出更高的效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17295 2026-05-19 cs.LG cs.CL 62%

DISA: Offline Importance Sampling for Distribution-Matching LLM-RL

DISA: 分布匹配强化学习中的离线重要性采样

Shaobo Wang, Yujie Chen, Yafeng Sun, Wenjie Qiu, Zhihui Xie, Sihang Li, Yucheng Li, Huiqiang Jiang, Xingzhang Ren, Xuming Hu, Dayiheng Liu, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Qwen Team, Alibaba Group(阿里集团Qwen团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学) The University of Hong Kong(香港大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出DISA方法,通过离线重要性采样解决分布匹配强化学习中的校准问题,分离了分区函数估计与策略学习,提高了策略多样性并在多个基准测试中表现出色。

Comments 21 pages, 7 figures, 7 tables. Abstract shortened to respect the arXiv limit of 1920 characters. Please see the PDF for the full abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16787 2026-05-19 cs.LG cs.CL 62%

The Unlearnability Phenomenon in RLVR for Language Models

在语言模型中RLVR的不可学习现象

Yulin Chen, He He, Chen Zhao

机构 * New York University(纽约大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了RLVR在提升大语言模型推理能力中的学习动态,发现即使存在正确回放,某些难例仍无法学习,揭示了当前RL方法在推理任务中的根本限制。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08401 2026-05-18 cs.CL cs.AI 62%

AIPO: Learning to Reason from Active Interaction

AIPO: 通过主动交互学习推理

Junnan Liu, Linhao Luo, Thuy-Trang Vu, Gholamreza Haffari

机构 * Department of Data Science and AI, Faculty of Information Technology, Monash University, Australia(数据科学与人工智能系,信息科技学院,墨尔本大学,澳大利亚)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 AIPO通过主动多智能体交互提升大语言模型推理能力,引入三个协作代理解决推理瓶颈,改进探索效率并扩展能力边界。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14621 2026-05-15 cs.CV cs.AI cs.CL 62%

Do We Really Need External Tools to Mitigate Hallucinations? SIRA: Shared-Prefix Internal Reconstruction of Attribution

我们真的需要外部工具来缓解幻觉吗?SIRA:共享前缀内部重构归因

Tian Qin, Junzhe Chen, Yuqing Shi, Tianshu Zhang, Qiang Ju, Lijie Wen

机构 * Tsinghua University(清华大学) The University of Sydney(悉尼大学) Stanford University(斯坦福大学) Baichuan AI(百川AI)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 SIRA通过内部构建对比参考减少视觉语言模型的幻觉,无需外部工具或额外计算,保持描述覆盖并降低开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14037 2026-05-15 cs.LG cs.CL 62%

Self-Pruned Key-Value Attention: Learning When to Write by Predicting Future Utility

自修剪键值注意机制:通过预测未来效用学习何时写作

Gergely Szilvasy, Manuel Faysse, Maria Lomeli, Matthijs Douze, Pierre-Emmanuel Mazaré, Loïc Cabannes, Wen-tau Yih, Hervé Jégou

机构 * Meta FAIR

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.LG

AI总结 本文提出自修剪键值注意机制,通过预测未来效用减少长序列的KV缓存大小,提升内存使用和解码速度,同时保持验证损失和下游任务性能。

Comments 28 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04692 2026-05-14 cs.CL cs.AI cs.CV 62%

Is a Picture Worth a Thousand Words? Adaptive Multimodal Fact-Checking with Visual Evidence Necessity

图片胜过千言吗?基于视觉证据必要性的自适应多模态事实核查

Jaeyoon Jung, Yejun Yoon, Kunwoo Park

机构 * School of AI Convergence, Soongsil University(顺斯利大学人工智能融合学院) MAUM AI Inc.(MAUM人工智能公司) Department of Intelligent Semiconductors, Soongsil University(顺斯利大学智能半导体系)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 本文挑战了多模态证据普遍提升性能的假设,提出AMuFC框架,通过分析和验证器模型自适应使用视觉证据,提升事实核查准确性。

Comments preprint, 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12446 2026-05-13 cs.LG cs.CL 62%

ORCE: Order-Aware Alignment of Verbalized Confidence in Large Language Models

ORCE:面向大型语言模型中明确自信度的顺序感知对齐

Chen Li, Xiaoling Hu, Songzhu Zheng, Jiawei Zhou, Chao Chen

机构 * Stony Brook University(石溪大学) Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院) Morgan Stanley(摩根大通)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种解耦且顺序感知的明确自信度校准框架,通过分离自信度估计与答案生成过程,提升校准和失败预测性能,同时保持答案准确性。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03206 2026-05-13 cs.AI cs.CL 62%

Coevolutionary Continuous Discrete Diffusion: Make Your Diffusion Language Model a Latent Reasoner

连续离散扩散:使你的扩散语言模型成为潜在推理器

Cai Zhou, Chenxiao Yang, Yi Hu, Chenyu Wang, Chubin Zhang, Muhan Zhang, Lester Mackey, Tommi Jaakkola, Stephen Bates, Dinghuai Zhang

机构 * Massachusetts Institute of Technology(麻省理工学院) Microsoft Research(微软研究院) Toyota Technological Institute at Chicago(丰田技术研究所(芝加哥)) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CCDD模型,结合连续和离散空间,提升扩散语言模型的表达能力和训练效果,通过联合多模态扩散过程实现高质量的生成与推理。

Comments 29 pages. Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09739 2026-05-12 cs.CL cs.AI 62%

The Silent Vote: Improving Zero-Shot LLM Reliability by Aggregating Semantic Neighborhoods

沉默投票:通过聚合语义邻域提高零样本LLM可靠性

Sanket Badhe, Priyanka Tiwari, Deep Shah

机构 * Google(谷歌)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Semantic Softmax方法,通过聚合目标标签的语义邻域得分,解决零样本分类中的Renormalization Bias问题,提升模型校准性和准确性。

Comments Accepted at GEM Workshop @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09188 2026-05-12 cs.LG cs.AI 62%

DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation

DARE: 基于共进化难度估计的难度自适应强化学习

Yang Zhou, Can Jin, Zihan Dong, Zhepeng Wang, Yanting Yang, Shiyu Zhao, Lei Li, Runxue Bao, Yaochen Xie, Dimitris N. Metaxas

机构 * Rutgers University(罗杰斯大学) Amazon(亚马逊) Washington University(华盛顿大学) Google(谷歌)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DARE通过自归一化重要性采样和对称Beta分布实现政策与难度估计的共进化,提升训练效率和推理效率,使模型在易任务中生成更简洁响应,在难任务中提高正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08658 2026-05-12 cs.LG cs.AI cs.SE 62%

Sketch-and-Verify: Structured Inference-Time Scaling via Program Sketching

Sketch-and-Verify: 通过程序草图实现推理时间扩展

Shan Jiang, Zijian Yi, Chenguang Zhu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SKETCHVERIFY方法,通过程序草图生成多样化候选方案,验证后选择最优,提升模型性能,同时探讨K与M的权衡关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26326 2026-05-12 cs.LG cs.CL stat.ML 62%

Addressing Performance Saturation for LLM RL via Precise Entropy Curve Control

通过精确熵曲线控制解决LLM RL中的性能饱和问题

Bolian Li, Yifan Wang, Yi Ding, Anamika Lochab, Ananth Grama, Ruqi Zhang

机构 * Purdue University(普渡大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Entrocraft方法,通过偏差优势分布实现用户定制的熵调度,解决LLM RL中的性能饱和问题,提升泛化能力、输出多样性及长期训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17693 2026-05-12 cs.LG cs.AI cs.MA 62%

COSAC: Counterfactual Credit Assignment in Sequential Cooperative Teams

COSAC:在顺序合作团队中的反事实信用分配

Shripad Deshmukh, Jayakumar Subramanian, Raghavendra Addanki, Nikos Vlassis

机构 * Adobe Research(Adobe研究)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 COSAC提出一种无批评者策略梯度方法,通过单个岭回归分解团队奖励,计算每个代理的反事实优势,实现低方差和可控的信用分配,适用于顺序合作团队。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08427 2026-05-12 cs.AI cs.GT cs.LG 62%

The Attacker in the Mirror: Breaking Self-Consistency in Safety via Anchored Bipolicy Self-Play

镜中的攻击者:通过锚定双策略自我博弈打破安全性中的自我一致性

Gabriele La Malfa, Emanuele La Malfa, Saar Cohen, Jie M. Zhang, Michael Luck, Michael Wooldridge, Elizabeth Black

机构 * Department of Informatics, King’s College London(伦敦国王学院信息学院) Department of Computer Science, University of Oxford(牛津大学计算机科学系) University of Sussex(Sussex大学) Institute for Decentralized AI(去中心化人工智能研究所)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出锚定双策略自我博弈方法,通过训练角色特定的LoRA适配器提升安全性与参数效率,实验证明在安全基准测试中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08313 2026-05-12 cs.CR cs.AI cs.LG 62%

Seed Hijacking of LLM Sampling and Quantum Random Number Defense

LLM采样中的种子劫持与量子随机数防御

Ziyang You, Xiaoke Yang, Zhanling Fan, Feng Guo, Xiaogen Zhou, Xuxing Lu

机构 * School of Electronic, Electrical and Physics, Fujian University of Technology(福建工程学院电子、电气与物理系) School of Humanities, Fujian University of Technology(福建工程学院人文学院) Department of Investigation, Fujian Police College(福建警察学院调查系) Institute of Applied Physics and Materials Engineering, University of Macau(澳门大学应用物理与材料工程研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SeedHijack攻击,通过操控PRNG输出实现指定token注入,提出基于量子随机数生成器的防御方案,解决LLM采样层的关键漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08177 2026-05-12 cs.LG cs.AI 62%

Echo-LoRA: Parameter-Efficient Fine-Tuning via Cross-Layer Representation Injection

Echo-LoRA:通过跨层表示注入实现参数高效微调

Yihang Peng, Peng Jin, Jie Gong, Xingyuan Chen, Lingjiao Xu, Ning Su, Yan Ran

机构 * School of Computer Science and Software Engineering, Southwest Petroleum University(西南石油大学计算机科学与软件工程学院) School of Electronic Information and Artificial Intelligence, Leshan Normal University(乐山师范学院电子信息与人工智能学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Echo-LoRA通过跨层表示注入提升参数高效微调效果,在八个常识推理基准上超越LoRA基线,减少训练与推理间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05873 2026-05-08 stat.ML cs.AI cs.LG math.ST stat.ME stat.TH 62%

CITE: Anytime-Valid Statistical Inference in LLM Self-Consistency

CITE: 在大语言模型自我一致性中实现任意时间有效的统计推断

Hirofumi Ota, Naoto Iwase, Yuki Ichihara, Junpei Komiyama, Masaaki Imaizumi

机构 * Komaba Institute for Science, Graduate School of Arts and Sciences, The University of Tokyo(东京大学艺术科学研究生院Komaba研究所) Nagoya University(名古屋大学) NARA Institute of Science and Technology (NAIST) / Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(NAIST科学与技术研究所 / 摩洛哥本·泽德人工智能大学) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI) / RIKEN AIP(摩洛哥本·泽德人工智能大学 / RIKEN AIP) Graduate School of Arts and Sciences, The University of Tokyo / RIKEN AIP / Kyoto University(东京大学艺术科学研究生院 / RIKEN AIP / 京都大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CITE算法,通过交并检验与E过程实现任意时间有效的模型响应分布唯一模式认证,无需预先知道可能答案集,并在扩散尾设置中提升认证效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03379 2026-05-08 cs.LG cs.CL 62%

Two Calls, Two Moments, and the Vote-Accuracy Curve of Repeated LLM Inference

两次调用、两次矩与重复LLM推理的投票准确性曲线

Yi Liu

机构 * York University(约克大学)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.LG

AI总结 研究重复LLM推理的二元正确性层,在条件独立同分布调用下,通过两次调用确定第二矩和相同示例正确性相关性,从而为固定多数投票预算提供分布无关的两调用区间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00751 2026-05-08 cs.AI cs.CL 62%

Self-Consistency Is Losing Its Edge: Diminishing Returns and Rising Costs in Modern LLMs

自一致性正在失去优势:现代大语言模型中的边际效益递减与成本上升

Chiyan Loo

机构 * Chiyan Loo

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究指出,随着模型增强,自一致性技术变得低效且可能降低性能,通过实验显示增加推理路径数量带来的准确率提升有限,而成本却显著增加,建议仅在单次可靠度不足的问题上使用多路径采样。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23629 2026-05-08 cs.AI cond-mat.dis-nn cond-mat.stat-mech cs.LG physics.soc-ph 62%

Emergent Slow Thinking in LLMs as Inverse Tree Freezing

大语言模型中涌现的慢思考作为逆树冻结

Sihan Hu, Xiansheng Cai, Yuan Huang, Zhiyuan Yao, Linfeng Zhang, Pan Zhang, Youjin Deng, Kun Chen

机构 * Hefei National Laboratory, University of Science and Technology of China(中国科学技术大学合肥微尺度物质科学国家实验室) Hefei National Laboratory for Physical Sciences at the Microscale and Department of Modern Physics, University of Science and Technology of China(中国科学技术大学合肥微尺度物质科学国家实验室和现代物理系) Institute of Theoretical Physics, Chinese Academy of Sciences(中国科学院理论物理研究所) School of Fundamental Physics and Mathematical Sciences, Hangzhou Institute for Advanced Study, UCAS(杭州高等研究院基础物理与数学科学学院) DP Technology(DP技术) Lanzhou Center for Theoretical Physics, Key Laboratory of Theoretical Physics of Gansu Province, Key Laboratory of Quantum Theory and Applications of MoE, Gansu Provincial Research Center for Basic Disciplines of Quantum Physics, Lanzhou University(兰州理论物理中心、甘肃省理论物理重点实验室、教育部量子理论与应用重点实验室、甘肃省量子物理基础学科省重点实验室、兰州大学) AI for Science Institute, Beijing(北京人工智能科学研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过统计物理视角揭示大语言模型中慢思考的涌现机制,提出逆树冻结结构,并提出Annealed-RLVR方法提升模型性能。

Comments 34 pages, 17 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27233 2026-05-01 cs.AI cs.LG cs.MA 62%

Reinforced Agent: Inference-Time Feedback for Tool-Calling Agents

强化代理:推理时间的工具调用反馈

Anh Ta, Junjie Zhu, Shahin Shayandeh

机构 * Apple(苹果公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出在推理时引入反馈机制,通过分离执行与审查任务,提升工具调用代理的实时纠错能力,并通过帮助性与危害性指标评估审查模型效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08049 2026-04-30 cs.CL cs.AI 62%

A Survey of Process Reward Models: From Outcome Signals to Process Supervisions for Large Language Models

对过程奖励模型的调查:从结果信号到大语言模型的过程监督

Congmin Zheng, Jiachen Zhu, Zhuoying Ou, Yuxiang Chen, Kangning Zhang, Rong Shan, Zeyu Zheng, Mengyue Yang, Jianghao Lin, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University College London(伦敦大学学院) Carnegie Mellon University(卡内基梅隆大学) University of Bristol(布里斯托大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了过程奖励模型,探讨了如何生成过程数据、构建PRMs及在测试时扩展和强化学习中的应用,涵盖数学、代码、文本、多模态推理、机器人和智能体等领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06019 2026-04-27 cs.CL cs.LG 62%

Multi-Token Prediction via Self-Distillation

通过自蒸馏实现多token预测

John Kirchenbauer, Abhimanyu Hans, Brian Bartoldson, Micah Goldblum, Ashwinee Panda, Tom Goldstein

机构 * University of Maryland(马里兰大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) Columbia University(哥伦比亚大学) TogetherAI

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过自蒸馏将预训练的自回归语言模型转换为快速独立的多token预测模型,无需额外辅助模型或复杂管道,实现更快的解码速度和更高的准确性。

Comments 9 pages and 5 figures in the main body

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19787 2026-04-23 cs.CL cs.AI cs.CY 62%

LLM Agents Predict Social Media Reactions but Do Not Outperform Text Classifiers: Benchmarking Simulation Accuracy Using 120K+ Personas of 1511 Humans

LLM代理预测社交媒体反应但不优于文本分类器:使用120,000多个1511人的人设进行基准测试

Ljubisa Bojic, Alexander Felfernig, Bojana Dinic, Velibor Ilic, Achim Rettinger, Vera Mevorah, Damian Trilling

机构 * Institute for Artificial Intelligence Research and Development of Serbia(塞尔维亚人工智能研究与开发研究所) University of Belgrade, Institute for Philosophy and Social Theory, Digital Society Lab(贝尔格莱德大学,哲学与社会理论研究所,数字社会实验室) Complexity Science Hub, Vienna, Austria(维也纳复杂科学中心) Graz University of Technology, Graz, Austria(技术大学格拉茨,格拉茨,奥地利) University of Novi Sad, Faculty of Philosophy, Novi Sad, Serbia(诺维萨德大学,哲学学院,诺维萨德,塞尔维亚) University of Trier, Trier, Germany(特里尔大学,特里尔,德国) Vrije University Amsterdam, Amsterdam, Netherlands(阿姆斯特丹自由大学,阿姆斯特丹,荷兰)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究LLM代理预测人类社交媒体反应的准确性,发现其表现不如传统文本分类器,揭示了零样本代理在模拟极化动态中的潜力及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08899 2026-04-22 cs.CL cs.LG 62%

ConFu: Contemplate the Future for Better Speculative Sampling

ConFu:为更好的推测采样展望未来

Zongyue Qin, Raghavv Goel, Mukul Gagrani, Risheek Garrepalli, Mingu Lee, Yizhou Sun

机构 * University of California Los Angeles, United States(美国加州大学洛杉矶分校) Qualcomm AI Research, United States(高通人工智能研究)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 ConFu提出一种新的推测解码框架,通过引入展望令牌和软提示,使草案模型能利用目标模型的未来信号,提升生成速度和接受率。

Comments v3: Added stress test with long drafts (DL=12, top-k=1) and tail-acceptance (survival) analysis. Earlier versions added Qwen3-4B results and ablations

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11199 2026-04-22 cs.CL cs.LG 62%

When and What to Ask: AskBench and Rubric-Guided RLVR for LLM Clarification

何时以及为何提问:AskBench与基于规则的强化学习与验证器(RLVR)用于LLM澄清

Jiale Zhao, Ke Fang, Lu Cheng

机构 * University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG

AI总结 本文研究如何评估和改进LLM在缺乏关键信息或包含误导信息时的澄清能力,提出AskBench交互基准和基于规则的强化学习与验证器(RLVR)方法,提升准确性和交互效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18327 2026-04-21 cs.AI cs.CL 62%

PARM: Pipeline-Adapted Reward Model

PARM:流水线适应的奖励模型

Xingyu Fan, Wei Shao, Jiacheng Liu, Linqi Song, Pheng Ann Heng

机构 * Graduate Student Member, IEEE(IEEE研究生会员) Member, IEEE(IEEE会员) Senior Member, IEEE(IEEE高级会员)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对多阶段LLM流水线中奖励指导不足的问题,提出PARM模型,通过整合奖励模型到 formulation 和 solution 阶段,提升代码生成质量与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19880 2026-04-21 cs.LG cs.AI 62%

What If Consensus Lies? Selective-Complementary Reinforcement Learning at Test Time

如果共识是谎言呢?测试时的选择性互补强化学习

Dong Yan, Jian Liang, Yanbo Wang, Shuo Lu, Ran He, Tieniu Tan

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SCRL框架,通过选择性正伪标签和熵门控负伪标签减少标签噪声影响,提升测试时强化学习的鲁棒性和泛化能力。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16881 2026-04-21 cs.CL cs.AI 62%

Incentivizing Parametric Knowledge via Reinforcement Learning with Verifiable Rewards for Cross-Cultural Entity Translation

通过可验证奖励的强化学习激励参数知识用于跨文化实体翻译

Jiang Zhou, Xiaohu Zhao, Xinwei Wu, Tianyu Dong, Hao Wang, Yangyang Liu, Heng Liu, Linlong Xu, Longyue Wang, Weihua Luo, Deyi Xiong

机构 * TJUNLP Lab, Tianjin University, China(天津大学TJUNLP实验室) Alibaba Group, China(阿里巴巴集团)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EA-RLVR框架,通过可验证奖励信号优化跨文化实体翻译,提升模型在实体翻译准确性和领域外泛化能力,实验表明在7k样本训练下模型性能显著提升。

Comments 23 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏