arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-20 至 2026-04-20 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 8 篇

2604.16004 2026-04-20 cs.CL cs.AI 89%

AgentV-RL: Scaling Reward Modeling with Agentic Verifier

AgentV-RL: 通过代理验证器扩展奖励建模

Jiazheng Zhang, Ziche Fu, Zhiheng Xi, Wenqing Jing, Mingxu Chai, Wei He, Guoqiang Zhang, Chenghao Fan, Chenxin An, Wenxiang Chen, Zhicheng Liu, Haojie Pan, Dingwei Zhu, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Huazhong University of Science and Technology(华中科技大学) The University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

专题命中 测试时计算 :verifier(title,summary_cn);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Agentic Verifier框架,通过多轮工具增强的反思过程提升奖励建模效果,实验显示其在并行和顺序TTS任务中表现优异,4B变体超越现有最优ORMs 25.2%。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15726 2026-04-20 cs.AI 87%

LLM Reasoning Is Latent, Not the Chain of Thought

大语言模型的推理是潜在的,而非思维链

Wenshuo Wang

机构 * School of Future Technology, South China University of Technology, China(未来技术学院,华南理工大学,中国)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出大语言模型推理应研究为潜在状态轨迹形成而非表面思维链。研究指出,推理对象的定义影响了忠实性、可解释性、推理基准和推理时干预的主张。通过分离三个混淆因素,提出三种假设,发现当前证据更支持潜在状态轨迹作为默认假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15972 2026-04-20 cs.AI cs.CL cs.MA 81%

Weak-Link Optimization for Multi-Agent Reasoning and Collaboration

多智能体推理与协作中的弱链接优化

Haoyu Bian, Chaoning Zhang, Jiaquan Zhang, Xingyao Li, Yuanfang Guo, Wei Dong, Yang Yang

机构 * University of Electronic Science and Technology of China(电子科技大学) Beihang University(北航) Xi'an University of Architecture and Technology(西安建筑科技大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出WORC框架,通过识别并强化性能瓶颈智能体,提升多智能体系统的稳定性和泛化能力。

Comments 13 pages, 4 figures. Submitted to CAAI Transactions on Intelligence Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15614 2026-04-20 cs.LG 79%

Flexible Empowerment at Reasoning with Extended Best-of-N Sampling

灵活的推理赋能与扩展的Best-of-N采样

Taisuke Kobayashi

机构 * National Institute of Informatics and The Graduate University for Advanced Studies, SOKENDAI Japan(日本信息处理研究所和高级研究大学研究院(SOKENDAI))

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出一种结合赋能的推理方法,通过扩展Best-of-N采样解决探索-利用困境,改进了传统奖励函数中延迟学习的问题。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16027 2026-04-20 cs.CL cs.AI cs.LG 75%

Where does output diversity collapse in post-training?

在微调后输出多样性为何会崩溃?

Constantinos Karouzos, Xingwei Tan, Nikolaos Aletras

机构 * School of Computer Science University of Sheffield(计算机科学学院 伦敦大学谢菲尔德分校)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了微调后输出多样性的崩溃原因,发现数据组成和训练方法共同影响多样性,揭示多样性崩溃发生在训练阶段而非推理阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15369 2026-04-20 cs.CR 67%

An Agentic Workflow for Detecting Personally Identifiable Information in Crash Narratives

一种用于检测事故叙述中个人可识别信息的代理工作流

Junyi Ma, Pei Li, Rui Gan, Kai Cheng, Steven T. Parker, Bin Ran

专题命中 测试时计算 :reasoning(abstract);verifier(abstract)

AI总结 本文提出一种本地部署的代理工作流,利用大语言模型检测事故叙述中的个人可识别信息,通过混合提取器和验证器提升检测精度与召回率,实现隐私保护的可扩展数据处理。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15621 2026-04-20 cs.IR cs.AI cs.CL 62%

Rethinking the Necessity of Adaptive Retrieval-Augmented Generation through the Lens of Adaptive Listwise Ranking

重新审视通过适应性列表排序视角的适应性检索增强生成的必要性

Jun Feng, Jiahui Tang, Zhicheng He, Hang Lv, Hongchao Gu, Hao Wang, Xuezhi Yang, Shuai Fang

机构 * Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过适应性列表排序视角重新审视适应性检索增强生成的必要性,提出AdaRankLLM框架,通过零样本提示和段落dropout机制验证适应性排序的必要性,并通过两阶段渐进蒸馏提升小模型的精确排序与适应过滤能力。

Comments 7pages, 2figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16116 2026-04-20 cs.ET cs.AI cs.CY 57%

The Relic Condition: When Published Scholarship Becomes Material for Its Own Replacement

遗物条件:当已发表的学术成果成为自身替代的原材料

Lin Deng, Chang-bo Liu

机构 * University of New South Wales(新南威尔士大学) Independent Researcher(独立研究者)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了通过提取学者的推理系统并将其转化为大语言模型的约束,测试学者机器人在学术功能中的表现,揭示了出版系统如何使推理架构成为可替代的原材料。

详情

展开后加载摘要…

URL PDF HTML 收藏