arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-16 至 2026-03-16 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 6 篇

2509.09677 2026-03-16 cs.AI 70%

The Illusion of Diminishing Returns: Measuring Long Horizon Execution in LLMs

持续扩展的幻觉回报:衡量LLM的长周期执行

Akshit Sinha, Arvindh Arun, Shashwat Goel, Steffen Staab, Jonas Geiping

机构 * University of Cambridge(剑桥大学) Institute for AI, University of Stuttgart(斯图加特大学人工智能研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所) University of Southampton(南安普顿大学) Tübingen AI Center(图宾根人工智能中心)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI

AI总结 本文通过分析LLM在长周期任务中的执行能力,揭示了持续扩展LLM并非必然导致回报递减,而是执行能力的提升能显著改善长周期任务表现。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12724 2026-03-16 cs.LG 70%

SciDesignBench: Benchmarking and Improving Language Models for Scientific Inverse Design

SciDesignBench: 科学逆向设计的语言模型基准测试与改进

David van Dijk, Ivan Vrkic

机构 * CellType Inc.(CellType公司)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.LG

AI总结 本文提出SciDesignBench,通过520个模拟器支撑任务评估语言模型在科学逆向设计中的表现,发现模拟反馈对不同设计周期有不同影响,并引入RLSF训练方法提升模型性能。

Comments 35 pages, 19 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23863 2026-03-16 cs.CL 70%

SPELL: Self-Play Reinforcement Learning for Evolving Long-Context Language Models

SPELL: 自我扮演强化学习用于进化长上下文语言模型

Ziyi Yang, Weizhou Shen, Chenliang Li, Ruijun Chen, Fanqi Wan, Ming Yan, Xiaojun Quan, Fei Huang

机构 * Sun Yat-sen University(中山大学) Tongyi Lab, Alibaba Group(阿里云实验室) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 本文提出SPELL框架,通过自我扮演问答和验证角色实现长上下文推理的无监督优化,实验显示其在多个基准上优于传统微调方法。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25084 2026-03-16 cs.CL cs.AI cs.IR cs.LG 67%

Scaling Generalist Data-Analytic Agents

放大通用数据分析代理

Shuofei Qiao, Yanqiu Zhao, Zhisong Qiu, Xiaobin Wang, Jintian Zhang, Zhao Bin, Ningyu Zhang, Yong Jiang, Pengjun Xie, Fei Huang, Huajun Chen

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DataMind,通过细粒度任务分类和递归易难任务组合机制,解决开源数据分析代理的数据不足、训练策略不当和代码多轮滚动不稳定问题,构建出性能优异的DataMind-14B和DataMind-7B代理。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04096 2026-03-16 cs.LG 57%

CORE: Context-Robust Remasking for Diffusion Language Models

CORE: 用于扩散语言模型的上下文鲁棒重掩码

Kevin Zhai, Sabbir Mollah, Zhenyi Wang, Mubarak Shah

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 CORE通过上下文鲁棒重掩码方法改进扩散模型解码,通过检测上下文敏感性token提升生成稳定性,在推理阶段实现高效修正,优于现有基线方法。

Comments Project Page: https://ucf-crcv.github.io/core/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02224 2026-03-16 cs.CL 57%

From XAI to Stories: A Factorial Study of LLM-Generated Explanation Quality

从XAI到故事:对LLM生成解释质量的因子研究

Fabian Lukassen, Jan Herrmann, Christoph Weisser, Benjamin Saefken, Thomas Kneib

机构 * University of Göttingen(哥廷根大学) BASF SE(巴斯夫股份有限公司) TU Clausthal(Clausthal 技术大学) Hochschule Bielefeld(比勒菲尔德应用科学大学)

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL

AI总结 本文通过因子研究探讨了预测模型选择、XAI方法、LLM选择和提示策略对LLM生成解释质量的影响,发现LLM选择主导其他因素,且零次提示在成本上具有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏