arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-25 至 2026-06-25 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 4 篇

2602.01472 2026-06-25 cs.CL 版本更新 85%

ConPress: Learning Efficient Reasoning from Multi-Question Contextual Pressure

ConPress: 从多问题上下文压力中学习高效推理

Jie Deng, Shining Liang, Jun Li, Hongzhi Li, Yutao Xie

机构 * University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) Microsoft, Beijing, China(微软) Tongji University, Shanghai, China(同济大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 提出ConPress方法,利用多问题提示诱导大推理模型自压缩推理链,通过自监督微调减少推理token使用,在保持精度的同时显著降低开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25161 2026-06-25 cs.AI 新提交 70%

TRUSTMEM: Learning Trustworthy Memory Consolidation for LLM Agents with Long-Term Memory

TRUSTMEM:学习具有长期记忆的LLM智能体的可信记忆巩固

Tianyu Yang, Sudipta Paul, Vijay Srinivasan, Vivek Kulkarni, Srinivas Chappidi

机构 * AI Center-Mountain View, Samsung Electronics(三星电子山景城AI中心) University of Notre Dame(圣母大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 提出TrustMem框架,通过记忆转换验证器评估更新过程,并利用偏好强化学习优化记忆更新行为,显著提升记忆效用和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25013 2026-06-25 cs.LG cs.AI cs.CL 新提交 67%

Do Thinking Tokens Help with Safety?

思考令牌有助于安全性吗?

Narutatsu Ri, Abhishek Panigrahi, Sanjeev Arora

机构 * Princeton Language and Intelligence(普林斯顿语言与智能)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现前沿推理模型的安全性行为并非真正基于思考,早期令牌即可预测拒绝/顺从结果,思考过程更像前缀补全而非审慎修订。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25091 2026-06-25 cs.DC 新提交 50%

Speculation at a Distance: Where Edge-Cloud Speculative Decoding Actually Pays Off

远距离推测:边缘-云推测解码何时真正有效

Yuan Lyu, Bharath Irukulapati, Jaya Prakash Champati

专题命中 测试时计算 :verifier(abstract)

AI总结 本文通过闭式不等式分析分布式推测解码(DSD)在广域网边缘-云通信下的延迟收益,指出其仅在低RTT场景下优于共置SD,并发现多租户容量是DSD的主要优势。

详情

展开后加载摘要…

URL PDF HTML 收藏