arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-26 至 2026-05-26 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 15 篇

2510.26418 2026-05-26 cs.AI 85%

Chain-of-Thought Hijacking

思维链劫持

Jianli Zhao, Tingchen Fu, Rylan Schaeffer, Mrinank Sharma, Fazl Barez

机构 * Independent(独立) University of Oxford(牛津大学) Stanford University(斯坦福大学) Anthropic Martian Core

专题命中 测试时计算 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 提出思维链劫持攻击,通过诱导大型推理模型进行长时间良性推理来削弱其拒绝有害请求的能力,实现高成功率越狱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12576 2026-05-26 cs.CL cs.AI 84%

Coupled Variational Reinforcement Learning for Language Model General Reasoning

耦合变分强化学习用于语言模型通用推理

Xueru Wen, Jie Lou, Yanjiang Liu, Hongyu Lin, Ben He, Xianpei Han, Le Sun, Yaojie Lu, Debing Zhang

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出CoVRL方法,通过混合采样策略耦合先验和后验分布,将变分推理与强化学习结合,以解决无验证器强化学习中探索效率低和推理轨迹与答案不一致的问题,在数学和通用推理基准上提升性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25133 2026-05-26 cs.AI cs.CL 81%

Trust but Verify: Prover-Verifier Deliberation for Selective LLM Prediction

信任但验证:面向选择性LLM预测的证明者-验证者审议

João Sedoc, Baotong Zhang, Dean Foster

机构 * New York University(纽约大学)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.CL、cs.AI

AI总结 提出基于交互式证明理论的证明者-验证者审议协议,通过结构化置信度判定实现选择性预测,在GPQA Diamond上取得约30个百分点的高置信度精确率差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24989 2026-05-26 cs.LG cs.AI cs.IR 81%

Selective Test-Time Compute Scaling for Click-Through Rate Prediction via Uncertainty-Triggered Feature Path Exploration

基于不确定性触发的特征路径探索的点击率预测选择性测试时计算扩展

Moyu Zhang, Yun Chen, Yujun Jin, Jinxin Hu, Yu Zhang, Xiaoyi Zeng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.AI、cs.LG

AI总结 针对点击率预测中训练数据稀疏导致的不确定性,提出无需训练、模型无关的UTTSI框架,通过双信号估计器区分认知不确定性和偶然模糊性,对不确定实例进行自适应特征过滤和随机特征路径探索,在保持最坏延迟不变的情况下实现平均约2.8倍基础模型开销,实验和在线A/B测试均取得显著提升。

Comments 12 pages, 4 Figures, 3 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24998 2026-05-26 cs.CL 79%

Better, Faster: Harnessing Self-Improvement in Large Reasoning Models

更好、更快:利用大型推理模型的自我改进

Qihuang Zhong, Liang Ding, Juhua Liu, Bo Du, Leszek Rutkowski, Dacheng Tao

机构 * Nanyang Technological University, Singapore(新加坡南洋理工大学) Alibaba Group, China(中国阿里巴巴集团) School of Computer Science, Wuhan University, China(武汉大学计算机学院) AGH University of Science and Technology, Poland(波兰AGH科学与技术大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 针对自我改进训练中数据不平衡和过度思考问题,提出HSIR方法,通过验证后退出采样和内在多样性评分提升推理性能与效率。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11657 2026-05-26 cs.CL 77%

Scaling Natural-Language Graph-Based Test Time Compute for Automated Theorem Proving

扩展基于自然语言图结构的测试时计算用于自动定理证明

Vincent Li, Tim Knappe, Yule Fu, Kevin Han, Kevin Zhu

机构 * Boston University Provadis School of International Management \& Technology Duke University Algoverse AI Research

专题命中 测试时计算 :reasoning(abstract);logical reasoning(abstract);test-time compute(abstract);分类 cs.CL

AI总结 提出KG-prover框架,利用从权威数学文本挖掘的知识图谱增强通用大语言模型,通过扩展图结构的测试时计算显著提升自动定理证明性能。

Comments Accepted to ICML AI4Math Workshop 2025, NAACL SRW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24447 2026-05-26 cs.SE 67%

Beyond AI Delegation: A Prompt Pattern Framework for Productive Struggle and Evaluative Judgement in Secure Coding Education

超越AI委托:安全编码教育中生产性挣扎与评价性判断的提示模式框架

Philipp Haindl, Oliver Eigner, Peter Kieseberg

专题命中 测试时计算 :reasoning(abstract);verifier(abstract)

AI总结 本文通过设计科学研究,从计算机科学文献中综合并调整了九种提示工程模式,映射到生产性挣扎和评价性判断两个教学构念,为安全编码课程设计了一个框架,使教师能够精细控制学生与AI的互动,保留学生的推理角色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18797 2026-05-26 cs.LG cs.AI 62%

Simply Stabilizing the Loop via Fully Looped Transformer

通过全循环Transformer简单稳定循环

Rao Fu, Zixuan Yang, Jiankun Zhang, Jing Ma, Hechang Chen, Yu Li, Yi Chang

机构 * Hong Kong Baptist University(香港 Baptist 大学) Jilin University(吉林大学)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 针对循环Transformer在迭代次数增加时出现的训练不稳定性,提出全循环Transformer,通过全循环架构和注意力注入两种无参数修改,稳定训练至12次循环,下游任务性能提升最高13.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05688 2026-05-26 cs.LG cs.AI 62%

vAttention: Verified Sparse Attention

vAttention: 验证的稀疏注意力

Aditya Desai, Kumar Krishna Agrawal, Shuo Yang, Alejandro Cuadron, Luis Gaspar Schroeder, Matei Zaharia, Joseph E. Gonzalez, Ion Stoica

机构 * Electrical Engineering and Computer Sciences, University of California, Berkeley(加州大学伯克利分校电气工程与计算机科学系)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出vAttention,通过统一top-k和随机采样,实现首个具有用户指定(ε, δ)近似精度保证的实用稀疏注意力机制,显著提升质量-效率权衡。

Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24564 2026-05-26 cs.AI cs.CE cs.LG 62%

Summoning the Oracle to Slay It: Mitigating Look-Ahead Bias in Financial Backtesting with Large Language Models

召唤神谕以屠之:利用大语言模型缓解金融回测中的前瞻偏差

Weixian Waylon Li, Mengyu Wang, Tiejun Ma

机构 * University of Edinburgh(爱丁堡大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出FinCAD方法,通过对抗性偏差发现和实体日期自适应规则,在不重新训练的情况下抑制大语言模型对历史结果的记忆,从而缓解金融回测中的参数化前瞻偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24517 2026-05-26 cs.LG cs.CL 62%

ECHO: Terminal Agents Learn World Models for Free

ECHO: 终端代理免费学习世界模型

Vaishnavi Shrivastava, Piero Kauffmann, Ahmed Awadallah, Dimitris Papailiopoulos

机构 * Microsoft Research(微软研究院)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG

AI总结 提出ECHO混合目标,通过预测环境观测令牌将终端反馈转化为密集监督信号,显著提升CLI代理在TerminalBench-2.0上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23954 2026-05-26 cs.CL cs.AI cs.SD 62%

EchoDistill:Alignment Noisy-to-Clean Self-Distillation for Robust Audio LLMs

EchoDistill:面向鲁棒音频大语言模型的噪声到干净自蒸馏对齐

Liang Lin, Chunxi Luo, Kaiwen Luo, Jie Zhang, Jin Wang, Yuanhe Zhang, Cai Yuchen, Qiankun Li, Gongli Xi, Zhenhong Zhou, Kun Wang, Junhao Dong

机构 * NTU(国立台湾大学) SHU(上海大学) ICT, CAS(中国科学院信息科技研究院) HDU(华中科技大学) BUPT(北京邮电大学) USTC(中国科学技术大学) SKL-NST, BUPT(北京邮电大学国家智能计算研究中心)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出EchoDistill框架,通过冻结的干净音频教师模型指导噪声学生模型进行组相对策略优化,实现噪声到干净的自蒸馏对齐,提升音频大语言模型在复杂噪声下的语义可靠性和任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26106 2026-05-26 cs.LG 57%

Looped Diffusion Language Models

循环扩散语言模型

Sanghyun Lee, Chunsan Hong, Seungryong Kim, Jonghyun Lee, Jongho Park, Dongmin Park

机构 * KAIST(韩国科学技术院) KRAFTON(KRAFTON公司) University of California, Berkeley(加州大学伯克利分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 提出LoopMDM,通过选择性循环早期-中间Transformer层,在训练时实现深度缩放效果而不增加参数,在推理时通过调整循环次数灵活扩展计算量,从而提升掩码扩散模型的训练效率和性能。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25988 2026-05-26 cs.CL 57%

What Makes a Medical Checker Trainable? Diagnosing Signal Collapse and Reward Hacking in Checker-Guided RAG for Biomedical QA

什么使医学检查器可训练?诊断生物医学问答中检查器引导的RAG中的信号崩溃和奖励黑客

Yuelyu Ji, Min Gu Kwak, Hang Zhang, Xizhi Wu, Chenyu Li, Yanshan Wan

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 本文通过比较四种NLI检查器作为GRPO训练的医学RAG代理的过程奖励,诊断了信号崩溃和奖励黑客现象,发现检查器的输出分布而非保留准确率决定了其是否提供可训练梯度,并提出了验证器作为奖励系统的边界条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25244 2026-05-26 cs.CL 57%

Inference Time Optimization with Confidence Dynamics

基于置信度动态的推理时优化

Yu Wang, Minghao Liu, Jiayun Wang, Jinrui Huang, Ankit Shah, Wei Wei

机构 * Center for Advanced AI, Accenture(Accenture高级人工智能中心)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文通过观察推理轨迹中置信度的动态变化,发现正确轨迹置信度上升而错误轨迹下降,据此提出置信度动态增益投票方法,显著提升大语言模型推理性能。

Comments Published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏