arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-07 至 2026-08-07 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 12 篇

2608.05643 2026-08-07 cs.AI cs.CL 新提交 91%

Refining Over Resampling: Test-Time Self-Correction for LLM Reasoning

过重采样优化:大语言模型推理的测试时自校正

Ahsan Bilal, Muhammad Ahmed Mohsin, Muhammad Umer, Lena Trigg, Ali Subhan, Muhammad Ali, Dean F. Hougen

机构 * University of Oklahoma(俄克拉荷马大学) Stanford University(斯坦福大学) Universitat Pompeu Fabra(庞培法布拉大学) Air University(空军大学)

专题命中 测试时计算 :reasoning(title,abstract);self-correction(title,abstract);test-time compute(abstract);verifier(abstract)

AI总结 本文提出无验证器的广度-深度优化框架,通过迭代自我批判与校正优化采样的 LLM 推理轨迹,在多个数学推理数据集及多款开放权重模型上,较基线方法实现了推理准确率的显著提升。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17852 2026-08-07 cs.LG stat.ML 版本更新 86%

Transformers with RL or SFT Provably Learn Sparse Boolean Functions, But Differently

带RL或SFT的Transformer可证明学习稀疏布尔函数,但方式不同

Bochen Lyu, Yiyang Jia, Xiaohao Cai, Zhanxing Zhu

机构 * School of Electronics and Computer Science, University of Southampton, United Kingdom(南安普顿大学电子与计算机科学学院,英国) Independent Researcher(独立研究员)

专题命中 测试时计算 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 本文通过统一分析RL(过程奖励)和SFT微调Transformer学习可递归分解的k-稀疏布尔函数的动态,证明两者都能学习k-PARITY、k-AND、k-OR等函数,但RL同时学习整个CoT链,而SFT逐步学习。

Comments ICML 2026 final version. 50 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06861 2026-08-07 cs.AI cs.CL cs.LG 版本更新 82%

Test-Time Scaling in Reasoning Models Is Not Effective for Knowledge-Intensive Tasks Yet

推理模型在知识密集型任务中的测试时间扩展效果有限

James Xu Zhao, Bryan Hooi, See-Kiong Ng

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现测试时间扩展在知识密集型任务中效果有限,主要因模型回答意愿和确认偏见导致幻觉增加,且无法提升真实答案的信息量。

Comments COLM 2026. 10+27 pages, 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05810 2026-08-07 cs.AI cs.CL 新提交 79%

When Self-Evolution Backfires: Pre-Commit Gating against Skill Contamination in LLM Agents

当自进化适得其反:针对LLM智能体中技能污染的预提交门控机制

Linfang Shang, Ming Xu, Yiding Sun, Tianle Xia, Lingxiang Hu, Lan Xu, Ning Zheng

专题命中 测试时计算 :verifier(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究发现LLM智能体自进化会出现技能污染导致性能下降的不可逆问题,提出VaG预提交门控机制,可提升性能并实现技能池跨模型迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05604 2026-08-07 cs.CL cs.AI 新提交 62%

SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries

SkillZip:用于可扩展智能体技能库的保留契约的图压缩方法

Xingyu Tan, Xiaoyang Wang, Qing Liu, Xiwei Xu, Xin Yuan, Liming Zhu, Wenjie Zhang

机构 * UNSW(新南威尔士大学) CSIRO(联邦科学与工业研究组织)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 SkillZip是一种执行感知的过程抽象框架,通过对节级图进行保留契约的压缩,解决了智能体技能库的可扩展问题,在基准测试中优于基线,实现了高压缩率和稳健检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05188 2026-08-07 cs.CL cs.AI 新提交 62%

Position: It's Time to Optimize LLMs for Self-Consistency

立场:是时候针对自一致性优化大型语言模型(LLMs)了

Itamar Pres, Belinda Z. Li, Laura Ruis, Zifan Carl Guo, Keya Hu, Mehul Damani, Isha Puri, Ekdeep Singh Lubana, Jacob Andreas

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出自一致性框架,指出LM的缺陷源于单输出对独立评估的假设,可通过一致性优化解决,为开发通用一致性LLM提供思路。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026), Position Paper Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14265 2026-08-07 cs.CL cs.LG 版本更新 62%

STATe-of-Thoughts: Structured Action Templates for Tree-of-Thoughts

STATe-of-Thoughts:用于树状思维的结构化动作模板

Zachary Bamberger, Till R. Saenger, Gilad Morad, Ofra Amir, Brandon M. Stewart, Amir Feder

机构 * Technion(以色列理工学院) Princeton University(普林斯顿大学) Independent(独立作者) Hebrew University(希伯来大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 STATe通过结构化动作模板提升文本生成的多样性和可控性,通过显式动作序列捕捉可解释特征,增强生成质量与可解释性。

Comments Accepted to COLM 2026. Version 3. 11 pages main, 85 pages total, 23 tables, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14158 2026-08-07 cs.HC cs.LG 版本更新 57%

Clinician input steers AI toward accurate and harmful recommendations

临床输入引导前沿AI模型做出准确和有害的决策

Ivan Lopez, Selin S. Everett, Bryan J. Bunning, April S. Liang, Dong Han Yao, Shivam C. Vedak, Kameron C. Black, Sophie Ostmeier, Stephen P. Ma, Emily Alsentzer, Jonathan H. Chen, Akshay S. Chaudhari, Eric Horvitz

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 研究评估了临床输入如何影响AI模型在诊断生成和下一步建议中的表现,发现专家上下文显著提升诊断准确性,而对抗性上下文导致诊断退化,且模型在多轮对话中表现出不同的特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06065 2026-08-07 cs.CV 新提交 50%

The Next Screenshot Knows: Gated Hindsight Distillation for Mobile GUI Agents

下一张截图知晓:面向移动GUI智能体的门控事后蒸馏(Gated Hindsight Distillation)

Weiwei Li, Junzhuo Liu, Tong Chu, Hengfu Yu, Wen Li

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文针对移动GUI智能体训练中丢失动作依据的问题,提出门控事后蒸馏方法,利用下一张截图作为特权信息,在AndroidWorld等基准上相比GRPO提升了任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05592 2026-08-07 cs.CV 新提交 50%

Beyond Frame Selection: Rethinking Long-Video Understanding with MLLMs

超越帧选择:用多模态大语言模型重新思考长视频理解

Ziling Huang, Shin'ichi Satoh

机构 * National Institute of Informatics(信息学研究所)

专题命中 测试时计算 :reasoning(abstract)

AI总结 针对 MLLMs 长视频理解的帧选择策略难以兼顾全局与局部信息的问题,提出 VideoRouter 模型,通过时间层次结构和验证引导路由器协调全局与局部推理,在 VideoMME 数据集上实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05302 2026-08-07 cs.IR 新提交 50%

Cross-platform epistemic verification for improving factual reliability in AI-generated news summarization

用于提升AI生成新闻摘要事实可靠性的跨平台认知验证

Zhuo Xie, Haoze Ni

专题命中 测试时计算 :verifier(abstract)

AI总结 本研究提出多源证据共识验证(MECV)框架,通过多异构来源证据聚合与多LLM陪审团机制修正AI生成新闻摘要的幻觉,在SummEdits基准上提升了事实一致性,为可信AI与自动化新闻研究提供了新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21642 2026-08-07 cs.CR 版本更新 50%

CARE: Pre-Execution Command Verification for Shell-Executing LLM Agents

CARE:用于执行 shell 的语言模型代理的执行前命令验证

Yu Liu, Wenxiao Zhang, Zhiwei Yang, Zhongyi Zhang, Hanqi Feng, Xinyu Wang, Peng Qiu, Yanbing Liu, Barnabas Poczos, Jin B. Hong

专题命中 测试时计算 :verifier(abstract)

AI总结 研究 LLM 代理执行 shell 命令时的调度风险,提出 CARE 验证器,通过规范化命令、推导证据并结合 LLM 判断,实现命令级调解,降低调度边界风险,平衡良性恢复、误报负担、延迟和危害降低之间的关系。

Comments Accepted by ISSRE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏