arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-01 至 2026-05-01 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 7 篇

2604.26954 2026-05-01 cs.CY cs.AI 79%

The Impact of LLM Self-Consistency and Reasoning Effort on Automated Scoring Accuracy and Cost

大型语言模型自我一致性与推理努力对自动化评分准确性和成本的影响

Scott Frohn

机构 * Khan Academy(可汗学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 研究探讨了LLM自我一致性和推理努力对自动化评分准确性和成本的影响,发现策略性模型选择和推理设置比集成更有效,且推理努力与评分准确性呈正相关。

Comments 14 pages, 10 tables, 2 figures. Presented at the 2026 National Council on Measurement in Education (NCME) Annual Meeting, April 11, 2026, Los Angeles, CA

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12272 2026-05-01 cs.LG cs.AI cs.CL 67%

Learning to Reason at the Frontier of Learnability

在可学习性前沿的学习推理

Thomas Foster, Anya Sims, Johannes Forkel, Mattie Fellows, Jakob Foerster

机构 * DeepSeek-R1 Tulu OpenAI

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过可学习性采样方法优化大语言模型强化学习阶段,提升训练效率和效果,针对高变异性问题进行课程学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21016 2026-05-01 cs.CL cs.AI cs.LG 67%

Mitigating Selection Bias in Large Language Models via Permutation-Aware GRPO

通过排列感知GRPO缓解大语言模型中的选择偏差

Jinquan Zheng, Jia Yuan, Jiacheng Yao, Chenyang Gu, Pujun Zheng, Guoxiu He

机构 * School of Economics and Management, East China Normal University(东华大学经济管理学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PA-GRPO方法,通过强制排列一致的语义推理来缓解大语言模型中的选择偏差,实验显示其在七个基准测试中表现优异,有效减少偏差同时保持高性能。

Comments Accepted to ACL 2026 Main Conference. 19 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27233 2026-05-01 cs.AI cs.LG cs.MA 62%

Reinforced Agent: Inference-Time Feedback for Tool-Calling Agents

强化代理:推理时间的工具调用反馈

Anh Ta, Junjie Zhu, Shahin Shayandeh

机构 * Apple(苹果公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出在推理时引入反馈机制,通过分离执行与审查任务,提升工具调用代理的实时纠错能力,并通过帮助性与危害性指标评估审查模型效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27955 2026-05-01 cs.AI cs.CV 57%

GUI Agents with Reinforcement Learning: Toward Digital Inhabitants

具有强化学习的图形用户界面代理:迈向数字居民

Junan Hu, Jian Liu, Jingxiang Lai, Jiarui Hu, Yiwei Sheng, Shuang Chen, Jian Li, Dazhao Du, Song Guo

机构 * Shandong University(山东大学) The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University(香港大学) Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了强化学习与GUI代理的结合,提出分类体系及趋势分析,旨在指导下一代鲁棒GUI自动化及基础设施发展。

Comments Project Page: https://github.com/Steve2457/Awesome-RL-GUI-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19606 2026-05-01 cs.AI cs.MA 57%

AblateCell: A Reproduce-then-Ablate Agent for Virtual Cell Repositories

AblateCell: 一个用于虚拟细胞库的可重现后消去代理

Xue Xia, Chengkai Yao, Mingyu Tsoi, Xinjie Mao, Wenxuan Huang, Jiaqi Wei, Hao Wu, Cheng Tan, Lang Yu, Yuejin Yang, Mengdi Liu, Siqi Sun, Zhangyang Gao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of California San Diego(加州大学圣地亚哥分校) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 AblateCell通过可重现后消去方法解决AI虚拟细胞性能归因问题,实现高准确度的代码库验证与属性归因。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26974 2026-05-01 cs.CR cs.ET 50%

C8s: A Confidential Kubernetes Architecture

C8s:一种保密的Kubernetes架构

Amean Asad, Patrick McClurg, João Andrade

专题命中 测试时计算 :verifier(abstract)

AI总结 C8s为Kubernetes提供加密保密性,完整性和可验证性保障,利用硬件可信执行环境实现可信边界,使数据所有者、计算提供者和终端用户获得传统部署无法实现的保障。

Comments 47 pages, 21 figures. Whitepaper from Confidential.ai

详情

展开后加载摘要…

URL PDF HTML 收藏