arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-20 至 2026-08-20 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 4 篇

2608.19009 2026-08-20 cs.CL 新提交 79%

Grading the Graders: Verification Autonomy Levels (L0-L5) for LLM Reasoning

评估评估者:面向大语言模型推理的验证自主等级(L0-L5)

Yajie Yin

专题命中 测试时计算 :reasoning(title);verifier(abstract);分类 cs.CL

AI总结 该研究提出验证自主等级(VAL)元标准,解决验证领域的等级概念混淆,明确不同验证方案的完备性边界,相关代码与评估材料已公开。

Comments Code and data: this https URL (https://github.com/1549080929-debug/math_agent) Keywords: LLM verification; verification autonomy; completeness; ground truth; trustworthy AI Writing and implementation assisted by an AI language model; all experiments, data, and research decisions are the author's own

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18884 2026-08-20 cs.AI 新提交 57%

Training-Free Inference-Time Self-Reflection and Cost-Bounded Early Stopping for Large Language Models

面向大语言模型的无训练推理时自我反思与成本受限早停机制

Wei Yu, Suxing Liu, Minjie Yu, Jiahao Wang, Zhijian Zheng, Haocheng Deng, Bing Li

机构 * School of Digital Arts, Jiangxi Arts & Ceramics Technology Institute(江西工艺美术职业技术学院数字艺术学院) School of Computing, Universiti Sains Malaysia(马来西亚理科大学计算机学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出无训练的推理时协议EvoResearcher,通过成本受限的自我反思实现大语言模型早停,在多个推理基准上验证其成本受限自我验证的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18580 2026-08-20 cs.AI cs.PL 新提交 57%

FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis

FACET:在终端任务合成中保留源意图与可执行状态

Kou Shi, Zun Wang, Qisheng Su, Shiting Huang, Ziao Zhang, Zhen Fang, Qingnan Ren, Jin Liu, Yu Zeng, Yiming Zhao, Lin Chen, Zehui Chen, Feng Zhao

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 FACET是保留源意图与可执行状态的终端任务合成框架,可生成高质量任务并提升Terminal-Bench 2.1上的智能体微调性能,为任务合成提供关键原则。

Comments this https URL (https://stokou.github.io/FACET-Terminal/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28147 2026-08-20 cs.CR 版本更新 50%

Agent Harness Distillation: Inference-Time Harness Extraction and Exploitation in Autonomous Multi-Agent Systems

智能体调控蒸馏:自主多智能体系统中的推理时调控提取与利用

Yu Cui, Wuli Yang, Yirui Shi, Junhao Xia, Hui Jiang, Lei Gao, Chenfu Bao

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出AHD框架,将AMAS推理时调控提取形式化为新安全问题,实验证实其可提取调控致IP泄露,还提出对应欺骗防御,揭示AMAS新安全威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏