arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-27 至 2026-04-27 共收录 3 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 3 篇

2604.22062 2026-04-27 cs.CL 83%

Incentivizing Neuro-symbolic Language-based Reasoning in VLMs via Reinforcement Learning

通过强化学习激励基于神经符号语言的视觉语言推理

Karthic Palaniappan

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文基于Qwen3-VL-2B-Instruct模型,通过强化学习提升视觉语言模型的神经符号语言推理能力,在数学、科学和常识问题上准确率提升3.33%,推理令牌减少75%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03963 2026-04-27 cs.AI 79%

Can Large Language Models Adequately Perform Symbolic Reasoning Over Time Series?

大型语言模型能否在时间序列上进行充分的符号推理?

Zewen Liu, Juntong Ni, Xianfeng Tang, Max S. Y. Lau, Qi He, Wenpeng Yin, Wei Jin

机构 * Emory University(埃默里大学) Amazon(亚马逊) Microsoft(微软) Penn State University(宾夕法尼亚州立大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出SymbolBench基准,评估大型语言模型在时间序列上的符号推理能力,结合遗传编程构建闭环系统,揭示模型在科学发现中的优势与局限。

Comments camera_ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12979 2026-04-27 cs.CL 70%

The Bitter Lesson of Diffusion Language Models for Agentic Workflows: A Comprehensive Reality Check

扩散语言模型在代理工作流中的苦涩教训:全面的现实检验

Qingyu Lu, Liang Ding, Kanjian Zhang, Jinxia Zhang, Dacheng Tao

机构 * Southeast University(东南大学) Alibaba(阿里巴巴) Southeast University Shenzhen Research Institute(东南大学深圳研究院) College of Computing and Data Science at Nanyang Technological University(南洋理工大学计算机与数据科学学院)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 本文评估了扩散语言模型在代理任务中的表现,发现其在长期规划和工具调用任务中存在系统性失败,提出需整合因果推理机制以提升代理能力。

Comments ACL 2026 - Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏