arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-05 至 2026-08-05 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 8 篇

2511.21214 2026-08-05 cs.CL cs.AI 版本更新 81%

Self-Guided Adaptive Safety Alignment: Synthesizing and Internalizing Guidelines in Reasoning Models

自引导防御:通过合成指南实现推理模型的自适应安全对齐

Yuhang Wang, Yanxu Zhu, Jiaming Zhang, Dongyuan Lu, Jitao Sang

机构 * Beijing Key Lab of Traffic Data Analysis and Mining(北京交通大数据分析与挖掘重点实验室) Beijing Jiaotong University(北京交通大学) School of Information Technology and Management(信息科技与管理学院) University of International Business and Economics(国际经济贸易大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SGASA框架,通过合成指南实现推理模型的自适应安全对齐,提升对抗性提示防御能力并减少对良性请求的拒绝。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03077 2026-08-05 cs.CL 新提交 77%

PAMT: Process-Aligned Reinforcement Learning for Multi-Domain Machine Translation

PAMT:面向多领域机器翻译的过程对齐强化学习

Yongshi Ye, Biao Fu, Chongxuan Huang, Yidong Chen, Xiaodong Shi

专题命中 测试时计算 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 针对多领域机器翻译中显式推理的偏差问题,提出过程对齐强化学习框架PAMT,结合长思维链监督与多维度奖励机制,在多种场景下表现优于基线模型。

Comments 23 pages, 10 figures, and 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01463 2026-08-05 cs.AI cs.MA 版本更新 74%

Where Reasoning Diverges: Localized Multi-Agent Debate for Multi-Hop Question Answering

推理分歧之处:本地化多智能体辩论

Weijun Gao, Xiang Ding, Haoyang Liu, Tiancheng Xing

机构 * The Chinese University of Hong Kong(香港中文大学) Nagoya University(名古屋大学) Institute of Science Tokyo(东京科学大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 测试时计算 :reasoning(title);分类 cs.AI

AI总结 针对多智能体辩论冗余交换完整推理轨迹的问题,提出LMAD协议,通过定位冲突并限制辩论范围,在十个骨干模型上实现宏平均评判准确率提升7.20个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03204 2026-08-05 cs.CL cs.AI 新提交 62%

Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach

测试时对齐大型视觉语言模型:一种轨迹引导的结构化采样方法

Tianbao Jiang, Weicong Ni, Gerard de Melo, Linlin Wang

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对现有视觉语言模型测试时对齐方法资源密集、训练与推理分布不匹配的问题,提出轨迹引导结构化采样的测试时对齐方法,在多模态推理数据集上提升准确率且推理开销可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03961 2026-08-05 cs.AI 新提交 57%

Interpretable Adaptive Sampling for LLM Test-Time Scaling

面向大语言模型测试时缩放的可解释自适应采样

Mobina Kashaniyan, Ali Jannesari

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对LLM测试时推理的固定计算预算不灵活、不可解释的问题,提出带轻量级模糊控制器的自适应采样方法,在问答和数学任务上提升性能并减少平均采样数,为高效测试时推理提供实用方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02843 2026-08-05 cs.CR cs.AI 新提交 57%

MutMem: Cryptographically Authorized Mutation in Persistent Agent Memory

MutMem:持久智能体内存中的密码学授权突变

Walid Saidi

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本研究针对持久智能体内存的授权与防篡改问题,提出HOM-AIMOS中的MutMem协议,经实验验证其在多个基准任务中表现良好,可有效抵御中毒攻击。

Comments https://github.com/wallidsaydi-creator/HOM-AIMOS. 32 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02642 2026-08-05 physics.chem-ph cs.AI 新提交 57%

MDArena: Evaluating Coding Agents on Realistic Molecular Dynamics Workflows

MDArena:面向真实分子动力学工作流的编码智能体评估基准

Nithishwer Mouroug Anand, Wei-Tse Hsu, Kyle Vaccaro, Eden James Gage, Jonathan David Colburn, Linda Xi Phan, Minjoon Seo, Kevin Guan, Philip C. Biggin

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 MDArena基准评估了6种编码智能体在真实分子动力学任务上的表现,发现其在精细科学工作流细节上存在不足,为追踪其可靠性进展提供了平台。

Comments 17 pages including appendices, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03534 2026-08-05 cs.CR 新提交 50%

A Challenge-Nonce Freshness Gap in Project Veraison's TPM Reference Schemes, Found by Appraising Application-Layer Action Evidence End-to-End

通过端到端评估应用层行动证据发现Project Veraison的TPM参考方案中存在的挑战随机数新鲜度缺口

Anton Sokolov

专题命中 测试时计算 :verifier(abstract)

AI总结 本文发现Project Veraison的TPM参考方案存在挑战随机数新鲜度缺口,通过端到端测试验证修复方案,使重放Quote的评估结果变为否定,提升了RATS架构的安全性。

Comments 18 pages, 3 figures. Responsible disclosure: veraison/services#427, fixed in PR #432. Artifact and data: doi:10.5281/zenodo.20998730

详情

展开后加载摘要…

URL PDF HTML 收藏