arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-25 至 2026-05-25 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 8 篇

2602.12579 2026-05-25 cs.LG cs.AI 88%

VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction

VI-CuRL: 通过置信度引导的方差缩减稳定与验证器无关的强化学习推理

Xin-Qiang Cai, Masashi Sugiyama

机构 * RIKEN AIP(日本理化学研究所高级研究所) The University of Tokyo(东京大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.AI、cs.LG

AI总结 提出VI-CuRL框架,利用模型内在置信度构建课程学习,在不依赖外部验证器的情况下通过降低动作和问题方差稳定训练,理论保证渐近无偏性,在数学和通用推理基准上超越依赖/不依赖验证器的基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23493 2026-05-25 cs.AI 70%

EDGE-OPD: Internalizing Privileged Context with Evidence Guided On-Policy Distillation

EDGE-OPD:通过证据引导的在线策略蒸馏内化特权上下文

Aristotelis Lazaridis, Dylan Bates, Aman Sharma, Brian King, Vincent Lu, Jack FitzGerald

机构 * EdgeRunner AI

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 针对在线策略自蒸馏中特权信息导致模型行为偏移的问题,提出EDGE-OPD方法,通过引导展开和证据掩码实现目标行为的高效迁移与通用能力保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03715 2026-05-25 cs.LG cs.AI 62%

R$^3$L: Reflect-then-Retry Reinforcement Learning with Language-Guided Exploration, Pivotal Credit, and Positive Amplification

R$^3$L: 反思-重试强化学习与语言引导探索、关键信用和正向放大

Weijie Shi, Yanxi Chen, Zexi Li, Xuchen Pan, Yuchang Sun, Jiajie Xu, Xiaofang Zhou, Yaliang Li

机构 * Tongyi Lab(通义实验室) Soochow University(苏州大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出R$^3$L框架,通过反思-重试机制合成高质量轨迹,结合关键信用分配和正向放大,解决强化学习在LLM推理和智能体任务中的探索与利用难题,在多个任务上取得5%到52%的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23574 2026-05-25 cs.LG cs.SE 57%

Push Your Agent: Measuring and Enforcing Quantitative Goal Persistence in Long-Horizon LLM Agents

推动你的智能体:在长周期LLM智能体中测量和强制实现定量目标持续性

Yuandao Cai, Yuzhang Zhu, Liyou Gao, Wensheng Tang, Shengchao Qin

机构 * Independent Researcher(独立研究者) Xidian University(西安电子科技大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 提出PushBench基准,通过状态追踪检索控制器和积压追踪工作单元控制器,测量和提升长周期语言智能体在定量目标持续性(QGP)上的表现,防止重复提交和虚假完成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23562 2026-05-25 cs.MA cs.AI 57%

ARMS: Automatic Reward Shaping for Sparse-Reward Multi-Agent Reinforcement Learning

ARMS: 稀疏奖励多智能体强化学习的自动奖励塑形

Elie Abboud, Oren Gal

机构 * Department of Marine Technologies(海洋技术系)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 提出ARMS框架,通过自监督轨迹排序学习稠密塑形信号,并基于条件最优反应推理证明其保持纳什均衡,从而解决多智能体强化学习中的稀疏奖励问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23344 2026-05-25 cs.CV cs.AI 57%

CHASD: Language Increment-Calibrated Contrastive Decoding against Hallucination in LVLMs

CHASD:面向LVLMs中幻觉的语言增量校准对比解码

Xiaoyi Huang, Kejia Zhang, Zhiming Luo

机构 * Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能学院) Department of Artificial Intelligence, Xiamen University(厦门大学人工智能系)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 提出CHASD框架,通过不确定性驱动的置信门控和注意力引导的局部扰动,在推理时按需校准对比解码,减少对象幻觉并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23069 2026-05-25 cs.CL 57%

DFKI-MLT at SemEval-2026 TASK 7: Steering Multilingual Models Towards Cultural Knowledge

DFKI-MLT 在 SemEval-2026 任务 7 中:将多语言模型引导至文化知识

Yusser Al Ghussin, Daniil Gurgurov, Yasser Hamidullah, Josef van Genabith, Cristina España-Bonet, Simon Ostermann

机构 * German Research Center for Artificial Intelligence (DFKI GmbH)(德国人工智能研究中心(DFKI GmbH)) Saarland Informatics Campus(萨尔布吕肯信息学校区) Barcelona Supercomputing Center (BSC-CNS)(巴塞罗那超级计算中心(BSC-CNS))

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出使用从并行 FLORES 数据中提取的语言向量进行激活引导,在推理时调整多语言模型以提升文化知识,并在 SemEval-2026 任务 7 的 MCQ 赛道上取得 86.96% 准确率,排名第 7。

Comments Accepted to The 20th International Workshop on Semantic Evaluation at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07399 2026-05-25 cs.AI cs.CV 57%

VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation

VGAS: 价值引导的动作块选择用于少样本视觉-语言-动作适应

Changhua Xu, En Yu, Junyu Xuan, Jie Lu

机构 * Australian Artificial Intelligence Institute (AAII)(澳大利亚人工智能研究所)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 提出VGAS框架,通过生成-选择范式和价值引导的动作块选择,解决少样本VLA适应中的几何歧义问题,提升成功率和鲁棒性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏