arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-14 至 2026-08-14 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 8 篇

2608.13179 2026-08-14 cs.AI 新提交 79%

Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents

学习幅度而非方向:面向多轮多步骤大语言模型智能体的验证器约束信用分配

Zechuan Wang, Siyuan Lu, Hongxuan Zhang, Linjian Mo, Chenyi Zhuang, Leilei Gan

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI

AI总结 该研究提出CrEST分层信用分配框架,保留RL的验证器约束上限并结合自我教师的密集token级信号,在BFCL V3和WildToolBench上优于基线,可简化教师在策略优化中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12700 2026-08-14 cs.LG cs.AR cs.DC 新提交 79%

A Contract-Grade Verifier for LLM-Generated GPU Kernels, and a Native Blackwell Backward for the Gated-Linear-Recurrence Family

面向大语言模型生成的GPU内核的契约级验证器,以及门控线性循环(GDN)族的原生Blackward反向传播算法

Rishi Shah, Rishav Shrestha

机构 * E3A Healthcare(E3A医疗公司)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.LG

AI总结 本文提出契约级GPU内核验证器,发现公开系统接受的2638个机器生成内核中39.5%存在无法修复的错误,还构建了GDN族的原生Blackwell反向传播算法,指出现有内核生成正确性信号被高估。

Comments 17 pages, 3 figures. Also archived at doi:10.5281/zenodo.21563213

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05466 2026-08-14 cs.AI cs.LG 版本更新 62%

Recursive Synthesis for Long-Horizon Terminal Tasks

长视界终端任务的递归合成

Zhongzhi Li, Yucheng Shi, Zongxia Li, Ruhan Wang, Anhao Li, Zixun Huang, Junyao Yang, Lei Ke, Ninghao Liu, Haitao Mi, Leowei Liang

机构 * Tencent HY LLM Frontier(腾讯HY大模型前沿团队) University of Georgia(佐治亚大学) University of Maryland, College Park(马里兰大学帕克分校) University of Pennsylvania(宾夕法尼亚大学) University of Minnesota, Twin Cities(明尼苏达大学双城分校) Indiana University(印第安纳大学) National University of Singapore(新加坡国立大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RST递归合成框架,低成本规模化生成3.7万余个长视界终端任务,经微调或PPO优化后,多款Qwen模型在多个终端基准任务上性能显著提升,且递归过程无明显上限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05678 2026-08-14 cs.CL cs.AI 版本更新 62%

Gradual Code-Switching as Inference-Time Cross-Lingual Representational Alignment for LLMs

渐进式代码切换作为大语言模型推理时的跨语言表征对齐

Haneul Yoo, Jiho Jin, Kyunghyun Cho, Alice Oh

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型跨语言性能不均衡问题,提出推理时的代码切换上下文学习机制,经多模型、多语言、多数据集验证,可显著提升目标及未见语言任务性能,尤其在低资源场景表现突出。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13076 2026-08-14 cs.AI 新提交 57%

SPADE: Speculative Decoding for Precise and Low Cost Distributed Edge Cloud Inference

SPADE:用于精确且低成本分布式边缘云推理的推测解码

Divya Jyoti Bajpai, Kishan Kumar Upadhyay, Manjesh Kumar Hanawal

机构 * IIT Bombay(印度理工学院孟买分校)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 SPADE是一种集成推测解码的分布式边缘云推理框架,通过边缘草稿模型与云端验证模型的协作,减少76%云端模型调用且不损失准确率,降低了LLM部署的成本与推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12898 2026-08-14 cs.CV cs.AI 新提交 57%

NaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents

NaviDC-OCR:面向数字文档与相机拍摄文档的解析导航

Peng Cai, Zhaofan Zou, Shifa Liu, Yikun Wang, Jiawei Tang, Kaicheng Yang, Meng Tong, Zhongjiang He, Hao Sun

机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 针对现有文档解析方法的两大挑战,本文提出NaviDC-OCR框架,通过形变感知学习、自适应采样及内容-结构解耦学习策略,在多基准测试中取得最优性能并获ICDAR 2026相关挑战第一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12679 2026-08-14 cs.AI cs.NE 新提交 57%

Beyond the Best Guess: Improving LLM Solution Coverage with Evolution Strategies

超越最佳猜测:用进化策略提升大语言模型的解决方案覆盖率

Conor F. Hayes, Elliot Meyerson, Kajetan Schweighofer, Roberto Dailey, Babak Hodjat, Risto Miikkulainen, Xin Qiu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Cognizant AI Lab(高知特人工智能实验室)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.AI

AI总结 该研究针对LLM后训练中RL导致pass@k受限、解决方案覆盖率不足的问题,采用进化策略(ES)方法,提升了pass@k与解决方案覆盖率,在数学基准上取得更好结果,为相关领域后训练提供了更好基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12629 2026-08-14 cs.LG 新提交 57%

CAKE: Compiler-Agent Co-Design for Frontier Kernel Evolution

CAKE:面向前沿核函数演进的编译器-智能体协同设计

Zihao Ye, Yingyi Huang, Hongyi Jin, Bohan Hou, Junru Shao, Zhongming Yu, Jinqi Chen, Meghan Cowan, Shiyi Cao, Shanli Xing, Hanfeng Chen, Vinod Grover, Tianqi Chen, Luis Ceze

机构 * Carnegie Mellon University(卡内基梅隆大学) NVIDIA(英伟达公司)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 本文提出CAKE编译器-智能体协同设计方案,通过硬件显式IR实现GPU核函数演进,在Flash-KMeans等基准测试中性能优于CUDA/PTX,相关成果已提交上游PR。

详情

展开后加载摘要…

URL PDF HTML 收藏