arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-23 至 2026-04-23 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 5 篇

2604.20755 2026-04-23 cs.AI cs.LG 84%

V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization

V-tableR1:基于过程监督的多模态表格推理与批评引导的策略优化

Yubo Jiang, Yitong An, Xin Yang, Abudukelimu Wuerkaixi, Xuxin Cheng, Fengying Xie, Zhiguo Jiang, Cao Liu, Ke Zeng, Haopeng Zhang

机构 * School of Astronautics Beihang University(北航航天学院) Longcat Interaction Team Meituan(美团长猫交互团队) Tianmushan Laboratory Beihang University(北航天门实验室)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 V-tableR1通过过程监督强化学习框架,利用表格的确定性网格结构,提升多模态大语言模型的推理能力,通过批评引导策略优化方法,实现更严谨的逻辑推导,取得开放源代码模型在复杂表格基准上的最佳性能。

Comments 15 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20389 2026-04-23 cs.CR cs.AI 70%

CyberCertBench: Evaluating LLMs in Cybersecurity Certification Knowledge

CyberCertBench: 评估大语言模型在网络安全认证知识中的表现

Gustav Keppler, Ghada Elbez, Veit Hagenmeyer

专题命中 测试时计算 :verifier(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出CyberCertBench,通过行业认证试题评估大语言模型的网络安全知识,验证了前沿模型在通用知识上的表现,但其在特定厂商标准问题上的准确性下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13818 2026-04-23 cs.LG cs.AI cs.CL 67%

Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning

并非所有回放都有效:在大语言模型强化学习中的回放下采样

Yixuan Even Xu, Yash Savani, Fei Fang, J. Zico Kolter

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PODS方法,通过下采样回放来减少策略更新成本,提升学习效率。

Comments 19 pages, 10 figures, TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19787 2026-04-23 cs.CL cs.AI cs.CY 62%

LLM Agents Predict Social Media Reactions but Do Not Outperform Text Classifiers: Benchmarking Simulation Accuracy Using 120K+ Personas of 1511 Humans

LLM代理预测社交媒体反应但不优于文本分类器:使用120,000多个1511人的人设进行基准测试

Ljubisa Bojic, Alexander Felfernig, Bojana Dinic, Velibor Ilic, Achim Rettinger, Vera Mevorah, Damian Trilling

机构 * Institute for Artificial Intelligence Research and Development of Serbia(塞尔维亚人工智能研究与开发研究所) University of Belgrade, Institute for Philosophy and Social Theory, Digital Society Lab(贝尔格莱德大学,哲学与社会理论研究所,数字社会实验室) Complexity Science Hub, Vienna, Austria(维也纳复杂科学中心) Graz University of Technology, Graz, Austria(技术大学格拉茨,格拉茨,奥地利) University of Novi Sad, Faculty of Philosophy, Novi Sad, Serbia(诺维萨德大学,哲学学院,诺维萨德,塞尔维亚) University of Trier, Trier, Germany(特里尔大学,特里尔,德国) Vrije University Amsterdam, Amsterdam, Netherlands(阿姆斯特丹自由大学,阿姆斯特丹,荷兰)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究LLM代理预测人类社交媒体反应的准确性,发现其表现不如传统文本分类器,揭示了零样本代理在模拟极化动态中的潜力及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15146 2026-04-23 cs.CL 57%

Beyond Majority Voting: Towards Fine-grained and More Reliable Reward Signal for Test-Time Reinforcement Learning

超越多数投票:面向细粒度和更可靠的测试时间强化学习奖励信号

Weiqin Wang, Yile Wang, Kehao Chen, Hui Huang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出SCOPE框架,通过结合模型置信度和动态子组划分,解决测试时间强化学习中多数投票策略导致的确认偏误和稀疏奖励问题,提升大语言模型推理能力。

Comments Accepted to ACL 2025 Main Conference. 15 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏