arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-21 至 2026-05-21 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 8 篇

2602.08028 2026-05-21 cs.CL cs.AI 84%

Diverge to Induce Prompting: Multi-Rationale Induction for Zero-Shot Reasoning

偏离以诱导提示:多理性诱导用于零样本推理

Po-Chun Chen, Hen-Hsen Huang, Hsin-Hsi Chen

机构 * Department of Computer Science and Information Engineering, National Taiwan University, Taiwan(国家台湾大学计算机科学与信息工程系) Institute of Information Science, Academia Sinica, Taiwan(学术院信息科学研究所) AI Research Center (AINTU), National Taiwan University, Taiwan(国家台湾大学人工智能研究中心(AINTU))

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出DIP框架,通过生成多个多样化的高层理由并诱导最终计划,以提升零样本推理的准确性,克服了传统链式思考提示中推理路径不稳定的问题。

Comments Accepted to Findings of IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19376 2026-05-21 cs.AI 79%

Generative Recursive Reasoning

生成性递归推理

Junyeob Baek, Mingyu Jo, Minsu Kim, Mengye Ren, Yoshua Bengio, Sungjin Ahn

机构 * KAIST(韩国科学技术院) Mila – Québec AI Institute(魁北克人工智能研究所) New York University(纽约大学) Université de Montréal(蒙特利尔大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Gram框架,通过将递归潜在推理转化为概率多轨迹计算,解决了传统递归推理模型的确定性问题,实现了条件推理和无条件生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20473 2026-05-21 cs.SE cs.AI cs.LG 62%

Code Generation by Differential Test Time Scaling

通过微分测试时间缩放进行代码生成

Yifeng He, Ethan Wang, Jicheng Wang, Xuanxin Ouyang, Hao Chen

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DiffCodeGen,一种基于覆盖引导的微分分析的代码生成方法,通过生成多样化的代码候选并利用覆盖引导模糊测试来合成输入,无需现有测试用例或大语言模型,从而提高效率和可扩展性。

Comments 16 main text, 21 pages with references

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24957 2026-05-21 cs.LG cs.AI 62%

Compute Aligned Training: Optimizing for Test Time Inference

计算对齐训练:优化测试时间推断

Adam Ousherovitch, Ambuj Tewari

机构 * Department of Statistics(统计学系) University of Michigan(密歇根大学)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 本文提出计算对齐训练方法,通过将训练目标与测试时间策略对齐,提升大语言模型在测试时的推断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11060 2026-05-21 cs.SE cs.AI 57%

Code Researcher: Deep Research Agent for Large Systems Code and Commit History

Code Researcher: 用于大型系统代码和提交历史的深度研究代理

Ramneet Singh, Sathvik Joel, Abhav Mehrotra, Nalin Wadhwa, Ramakrishna B Bairi, Aditya Kanade, Nagarajan Natarajan

机构 * Microsoft Research(微软研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Code Researcher,一种用于大型系统代码和提交历史的深度研究代理,通过多步骤推理和全局上下文收集,有效解决系统代码崩溃修复问题,显著优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11675 2026-05-21 cs.AI 57%

Epistemic Regret Minimization: Label-Free Causal Critique Beyond Outcome Reward

知识悔恨最小化:超越结果奖励的无标签因果批评

Edward Y. Chang, Longling Geng

机构 * Stanford University(斯坦福大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种名为知识悔恨最小化(ERM)的框架,通过评估模型推理轨迹的因果结构而非答案本身,来改进因果批评,从而在没有正确答案的情况下进行无标签操作,并在多个前沿LLM上实验表明,ERM在因果批评任务中表现优于传统方法。

Comments 43 pages, 22 tables, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19893 2026-05-21 cs.OS 50%

SSV: Sparse Speculative Verification for Efficient LLM Inference

SSV:用于高效LLM推理的稀疏推测验证

Zhibin Wang, Ziyu Zhong, Nuo Shen, Yuhang Zhou, Rong Gu, Sheng Zhong

专题命中 测试时计算 :verifier(abstract)

AI总结 本文提出SSV框架,通过结合重叠感知的分组查询执行、基于刷新/重用的NSA内核融合和基于性能配置文件的提示自适应调度,提升跨查询重用率,减少所选索引和分支融合开销,并在用户指定的精度类别下选择有效的草稿验证策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20312 2026-05-21 cs.CR cs.LO cs.MA 50%

Pramana: A Protocol-Layer Treatment of Claim Verification in Autonomous Agent Networks

Pramana:自主代理网络中声明验证的协议层处理

Ravi Kiran Kadaboina

专题命中 测试时计算 :verifier(abstract)

AI总结 本文提出Pramana协议层,通过定义缺失的线缆格式,为自主代理网络中的声明验证提供结构化方法,结合经典印度认识论中的四种知识类型,确保验证过程的确定性和可追溯性。

Comments 23 pages, 4 figures, 5 tables, 42 references

详情

展开后加载摘要…

URL PDF HTML 收藏