arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-03 至 2026-08-03 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 6 篇

2607.29549 2026-08-03 cs.AI 新提交 79%

AMTFV: Agentic Mathematical Tool-Flow Verification for LLM Self-Correction

AMTFV:面向LLM自校正的智能体数学工具流验证

Rui Zou, Yutao Zhu, Mengqi Wei, Ji-Rong Wen

专题命中 数学推理 :self-correction(title);reasoning(abstract);分类 cs.AI

AI总结 本研究针对LLM数学答案验证难题,提出AMTFV方法,通过MTF接口解耦验证建模与执行,在5个数学推理数据集上较基线提升最高8.3个百分点,验证复杂度越高增益越显著。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06382 2026-08-03 stat.ML cs.AI cs.CL cs.GT cs.LG 67%

On the Fundamental Impossibility of Hallucination Control in Large Language Models

Michał P. Karpowicz

机构 * Samsung AI Center(三星人工智能中心)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Mathematics debugged, added examples and illustrations, corrected claims, and re-edited, typos removed

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14917 2026-08-03 cs.CL cs.HC cs.LG 62%

Self-reflecting Large Language Models: A Hegelian Dialectical Approach

Sara Abdali, Michael Solodko, Can Goksen, Saeed Amizadeh, Julie E. Maybee, Kazuhito Koishida, Pashmina Cameron

机构 * Microsoft Applied Sciences Group (ASG)(微软应用科学组) Department of Philosophy, Lehman College, City University of New York(哲学系,莱曼学院,新 York 城市大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28657 2026-08-03 cs.AI 新提交 57%

TAPR: Enhancing LLM Performance with a Task-Aware Prompt Rewriter

TAPR:利用任务感知提示重写器提升大语言模型性能

Oliver Savolainen, Emanuele Bastianelli, Hosein Azarbonyad

机构 * University of Amsterdam(阿姆斯特丹大学) Elsevier(爱思唯尔)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出TAPR模型,采用带GRPO的强化学习训练,可将用户提示优化为任务适配的提示,经微调Phi-4-mini-instruct后,在多任务基准测试中提升了大语言模型的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23802 2026-08-03 cs.AI 版本更新 57%

From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement

从可验证奖励强化学习到自验证奖励强化学习:任务转换为开放式语言模型自我改进带来自验证奖励

Qinsi Wang, Jing Shi, Huazheng Wang, Kun Wan, Yiran Wu, Bo Liu, Qingyun Wu, Hai Helen Li, Yiran Chen, Handong Zhao, Wentian Zhao

机构 * Duke University(杜克大学) Adobe Inc.(奥多比公司) Oregon State University(俄勒冈州立大学) Pennsylvania State University(宾夕法尼亚州立大学) National University of Singapore(新加坡国立大学) Amazon(亚马逊)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对开放式LLM自我改进中奖励验证问题,提出基于任务转换的RLSVR方法,通过SpyRL实例化,在文本摘要等任务实验中,该方法在不可验证任务上优于现有方法,在可验证推理任务上有提升,扩展了基于RLVR的自我改进。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18622 2026-08-03 cs.CR cs.AI 版本更新 57%

CPInj: Uncovering Prompt Injection Risks in Textual Collaborative Prompt Optimization

CPInj:揭示文本协作式提示优化中的提示注入风险

Xinting Liao, Behnoosh Zamanlooy, Masoumeh Shafieinejad, David B. Emerson, Ruinan Jin, Deval Pandya, Xiaoxiao Li

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) McMaster University(麦斯特大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究文本协作式提示优化(TCPO)中提示注入风险,提出协作式提示注入攻击CPInj,用恶意指令污染全局提示,降低下游任务性能,现有防御方法无效;还提出防御导向聚合方法APAgg,实验表明TCPO存在关键漏洞,攻击有待更强大防御。

Comments Accepted by COLM 2026 and AI4GOOD workshop

详情

展开后加载摘要…

URL PDF HTML 收藏