arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-06 至 2026-08-06 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 7 篇

2608.04962 2026-08-06 cs.LG cs.CL 新提交 84%

SpecRoll: Fast-Slow Verifier-Feedback Adaptation for Speculative Reinforcement Learning Rollouts

SpecRoll:用于投机强化学习rollout的快慢校验器反馈自适应方法

Nhat Minh Pham, Duy Tung Doan, Thi Duyen Ngo, Vinh Van Nguyen, Khac-Hoai Nam Bui

机构 * VNU University of Engineering and Technology(越南国家大学河内理工大学) Viettel AI(越南电信人工智能公司)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.LG

AI总结 SpecRoll是一种投机强化学习rollout引擎,通过快慢双时间尺度自适应结合相关校验机制,在5个1.5B-14B模型和3个数学推理数据集上,相比普通GRPO和FastGRPO实现了生成与端到端速度的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05124 2026-08-06 cs.CL cs.AI cs.IT cs.LG eess.SP math.IT 新提交 82%

Chained Recursive Language Models for Multi-Iteration Reasoning

用于多轮迭代推理的链式递归语言模型

Purbesh Mitra, Sennur Ulukus

机构 * University of Maryland(马里兰大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM长上下文推理易传播早期错误的问题,提出Chained RLM推理架构,通过分阶段管理上下文提升多轮迭代推理准确率,验证其相比直接LLM回答的性能增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04611 2026-08-06 cs.SE cs.AI 新提交 79%

The Order Is the Guarantee: Verifier-Budgeted Code Deletion with Static-First Learned Proposals

顺序是保障:基于静态优先学习提议的验证者预算代码删除

Ruitong Li, Binjie Guo, Aisheng Mo, Guowei Su, Han Wang, Jie Li, Ru Zhang

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI

AI总结 该研究针对验证者预算有限时的AI代码删除问题,提出DELSCOUT调度方法,结合静态与学习候选排序,提升已验证删除覆盖率并控制验证器调用,明确了模型、顺序与执行的分工。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04552 2026-08-06 cs.CL cs.LG 新提交 62%

Relational Response Fields: A General Theory of Black-Box LLM Response Consistency and Recovery

关系响应场:黑盒大语言模型响应一致性与恢复的通用理论

Song Zichen

机构 * Sungkyunkwan University(成均馆大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出关系响应场(RRF)理论,定义黑盒大语言模型响应恢复的内在难度γₖ(D,A),推导稀疏修复算法,通过实验验证其在响应一致性与恢复中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14294 2026-08-06 cs.CV cs.AI cs.LG cs.RO 版本更新 62%

Seeking Physics in Diffusion Noise

在扩散噪声中寻求物理规律

Chujun Tang, Lei Zhong, Fangqiang Ding

机构 * Brown University(布朗大学) University of Edinburgh(爱丁堡大学) MIT(麻省理工学院)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究通过分析预训练扩散变换器的中间去噪表示,发现物理合理与不合理视频在中层特征空间部分可分离,提出渐进轨迹选择策略提升物理一致性并降低推理成本。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04066 2026-08-06 cs.AI 新提交 57%

The LLM Proposes, the Executive Disposes: A Self-Verifying Agent Instrument that Dissociates Commitment Drift from Binding Drift in Long-Horizon Agents

大模型提出方案,执行体处理:一种自验证智能体工具,可将长程智能体中的承诺漂移与绑定漂移分离

Mohsen Arjmandi

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本研究提出一种自验证智能体工具,可分离长程智能体的承诺漂移与绑定漂移,通过实验揭示消融承诺机制会提升目标放弃率,且贡献了可量化漂移分解的智能体验证方法论。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21343 2026-08-06 cs.CV 版本更新 50%

Latent Denoising Improves Visual Alignment in Large Multimodal Models

潜在去噪提升大多模态模型的视觉对齐

Dhruv Parikh, Jacob Fein-Ashley, Rajgopal Kannan, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM ARL Army Research Office(DEVCOM ARL陆军研究办公室)

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出通过潜在去噪框架改进大多模态模型的内部视觉特征对齐和多模态理解,采用掩码和高斯噪声混合腐蚀视觉token,并利用解码器恢复教师特征,提升模型在分布偏移下的鲁棒性。

Comments ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏