arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-08 至 2026-06-08 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 4 篇

2604.17433 2026-06-08 cs.CL cs.AI cs.LG 版本更新 92%

Self-Consistency from Only Two Samples: CoT-PoT Ensembling for Efficient LLM Reasoning

仅需两个样本的自一致性:CoT-PoT集成实现高效LLM推理

Raman Saparkhan, Majd Hawasly, Md Rizwan Parvez, Mohammad Raza

机构 * Carnegie Mellon University Qatar(卡内基梅隆大学(卡塔尔)) Qatar Computing Research Institute(卡塔尔计算研究院)

专题命中 测试时计算 :CoT(title,title_cn);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种混合集成方法,结合思维链与程序化推理两种模式,通过仅需两个样本即可实现自一致性,将采样量减少9.3倍,并在78.6%的任务上达到最优。

Comments 9 pages, 3 figures; accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25638 2026-06-08 cs.CL cs.LG 版本更新 62%

Reinforcement Learning from Denoising Feedback

基于去噪反馈的强化学习

Qi He, Huan Chen, Ya Guo, Huijia Zhu, Yi R. Fung, Baojian Zhou

机构 * Fudan University(复旦大学) Ant Group(蚂蚁集团) Hong Kong University of Science and Technology(香港科技大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出RLDF方法,利用去噪反馈进行策略损失估计,通过优化中间噪声状态到裁剪干净状态并结合加权时间步采样,在扩散语言模型上提升性能和泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06915 2026-06-08 cs.CL cs.LG 版本更新 62%

A Dynamic Self-Evolving Extraction System

一种动态自演化抽取系统

Moin Amin-Naseri, Hannah Kim, Estevam Hruschka

机构 * Megagon Labs(Megagon实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出DySECT系统,通过LLM抽取三元组构建知识库,结合概率知识和图推理丰富知识,再反馈优化抽取器,形成闭环持续提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11208 2026-06-08 stat.ML cs.LG 版本更新 57%

Predictable Compression Failures: Order Sensitivity and Information Budgeting for Evidence-Grounded Binary Adjudication

可预测的压缩失败:基于证据的二元裁决的顺序敏感性与信息预算

Leon Chlon, Ahmed Karim, Maggie Chlon, MarcAntonio Awada

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 研究证据顺序对基于Transformer的二元裁决模型的影响,提出QMV界和EDFL定律,通过信息充分率门控实现低幻觉率下的答案/弃权决策。

详情

展开后加载摘要…

URL PDF HTML 收藏