arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-24 至 2026-07-24 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 6 篇

2606.14502 2026-07-24 cs.AI 版本更新 70%

From Chatbot to Digital Colleague: The Paradigm Shift Toward Persistent Autonomous AI

从聊天机器人到数字同事:向持久自主人工智能的范式转变

Yongheng Zhang, Ziang Liu, Jiaxuan Zhu, Shuai Wang, Xiangqi Chen, Haojing Huang, Jiayi Kuang, Siyu Chen, Ao Shen, Hao Wu, Qiufeng Wang, Qian-Wen Zhang, Junnan Dong, Wenhao Jiang, Ying Shen, Hai-Tao Zheng, Yinghui Li, Di Yin, Xing Sun, Philip S. Yu

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出LLM从聊天机器人向数字同事的范式转变,通过认知核心(思考型LLM)和工具增强任务执行(OpenClaw工作站系统)两个维度,实现持久工作、状态持久化、可重用技能和自改进能力。

Comments The paper is available on the project website: https://from-chatbot-to-digital-colleague.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20852 2026-07-24 cs.AI 新提交 57%

Code Monitor Red Teaming for Public-Test-Passing Code

用于通过公开测试的代码的代码监控红队

Junchi Liao, Jiawen Deng, Fuji Ren

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 研究公开测试通过后代码隐藏错误监控问题,引入代码监控红队协议并实例化为代码监控基准。通过大量实验发现弱验证器虽能改进但仍易漏错,对抗性压力影响验证效果,GLM - 5.1验证器缩小部分差距,揭示了验证器故障与证据限制的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20527 2026-07-24 cs.AI 新提交 57%

Evaluating and Guarding Citation Faithfulness in Agentic Scientific Synthesis

评估和保障智能科学合成中的引用忠实性

Taewan Goo, Junsik Kim, Kyulhee Han, GwonYul Jo, Jong-Soo Kim, Tae-Hyung Kim

机构 * Seoul National University(首尔国立大学) BioNexus(生物 Nexus)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 研究智能语言模型系统引用答案检查的可靠性问题,提出黄金锚定评估协议和可部署防护措施,能验证验证者、测量重新归因,为无支撑引用设限,经多模型和管道验证后作为单GPU工具包发布。

Comments 20 pages, 5 figures. Includes supplementary material (Appendices S1-S6). Open single-GPU reproducibility kit included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20506 2026-07-24 cs.AI 新提交 57%

Optimizing Hypergraph-Based RAG: Toward Better Fact Extraction and Chunk Retrieval

优化基于超图的RAG:迈向更好的事实提取和块检索

Houda Khrouf, Pedro Fillastre, Sebastiao Correia

机构 * Qlik(思略特)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 研究旨在优化基于超图的RAG,以解决事实提取和块检索问题。方法是采用自一致性提示改进提取,运用个性化PageRank算法增强块检索,贡献在于提升了相关任务的性能。

Comments APIA 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20481 2026-07-24 cs.AI 新提交 57%

Routing Without Training: Controllable-Ratio LLM Offloading via Reliability Gating

无需训练的路由:通过可靠性门控实现可控比例的大语言模型卸载

Evan Chen, Shiqiang Wang, Kevin S Chan, Su Wang, Christopher Brinton

机构 * Purdue University(普渡大学) University of Exeter(埃克塞特大学) Army Research Laboratory(陆军研究实验室) Princeton University(普林斯顿大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 研究在资源受限下本地-云端协作部署大语言模型的问题,提出无需训练的CARGO路由框架,通过提示多样化采样等方法估计一致性并控制不确定性,在多任务和模型上表现出色,证明可从本地模型内在行为实现有效协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20439 2026-07-24 cs.CL 新提交 57%

AsymVerify at SemEval-2026 Task 6: Asymmetric Confidence-Gated Verification for Political Evasion Detection

SemEval-2026任务6中的AsymVerify:用于政治逃避检测的非对称置信门控验证

Sebastien Kawada

机构 * Kaons 𝑲 ∗

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 研究针对政治逃避检测难题,提出AsymVerify系统用于SemEval-2026任务6的三元分类。核心方法是对问答对分类后对低置信预测进行非对称验证,主要贡献是取得高排名,在不同数据集上提升宏F1分数,且降低推理成本。

Comments Accepted to SemEval-2026 Task 6 (CLARITY) at ACL 2026. Team AsymVerify placed 2nd of 41 teams on the official Subtask 1 leaderboard. Task: https://konstantinosftw.github.io/CLARITY-SemEval-2026/. Code: https://github.com/kaons-research/AsymVerify-ACL. Website: https://kaons.com/

详情

展开后加载摘要…

URL PDF HTML 收藏