arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-05 至 2026-06-05 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 6 篇

2606.05702 2026-06-05 cs.AI cs.CV 88%

Seeing Time: Benchmarking Chronological Reasoning and Shortcut Biases in Vision-Language Models

Seeing Time: 视觉-语言模型中的时间顺序推理与捷径偏差基准测试

Haoyu Zhou, Qing Qing, Caichong Li, Qixin Zhang, Yongcheng Jing, Ziqi Xu, Juncheng Hu, Xikun Zhang, Renqiang Luo

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computing Technologies, RMIT University(皇家墨尔本理工学院计算技术学院)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一个新基准,通过三个专门数据集评估视觉-语言模型在图像内和跨图像的时间顺序推理能力,并揭示模型常利用颜色等表面线索而非真正时间特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05228 2026-06-05 cs.SE cs.PL 80%

Where Do Large Language Models Fail on Competitive Programming? A Taxonomy of Failures by Algorithm Type and Difficulty Rating

大型语言模型在竞赛编程中哪里失败?基于算法类型和难度评级的失败分类

Ayush Kumar Jha, Shalini Jha

专题命中 逻辑推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 通过系统实证研究,发现链式思维推理会显著降低GPT-4o的通过率并增加Claude的编译错误,且错误答案主导了两种模型的失败模式。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05929 2026-06-05 cs.CY 67%

Securing the Sandbox: A Rootless Containerized Framework for Process-Oriented Monitoring in Computer Graphics Education

保护沙箱:计算机图形学教育中面向过程监控的无根容器化框架

Germán Arroyo, Luis López, Juan Carlos Torres

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)

AI总结 提出VISMATIC框架,通过无根容器隔离和API级用户交互追踪,在计算机科学教育中实现过程监控的同时保障基础设施安全。

Comments 13 pages, 7 figures. Source code: https://github.com/german-arroyo-moreno/VISMATIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05804 2026-06-05 cs.CL 57%

Can LLMs Be Constrained to the Past? Improving Knowledge Cutoff through Recall-Based Prompting

LLMs 能否被约束到过去?通过基于回忆的提示改进知识截止

Michiro Asai, Ailiang Lin, Yu Kishimoto, Takao Obi, Satoshi Kosugi, Kotaro Funakoshi, Manabu Okumura

机构 * Institute of Science Tokyo(东京科学研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 提出两种基于回忆的提示策略(Self-Recall 和 Question-Recall)来改进大语言模型在知识截止约束下的表现,在反事实问题上尤其有效,并构建了多截止历史事件基准(MHEB)进行鲁棒性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05201 2026-06-05 cs.LG 57%

State commitment learning: training language models to distinguish computation from memory

状态承诺学习:训练语言模型区分计算与记忆

Fei Ding, Yongkang Zhang, Runhao Liu, Yuhao Liao, Zijian Zeng, Huiming Yang

机构 * Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 提出状态承诺学习目标及反事实擦除强化学习(CERL)方法,通过训练模型区分应保留的持久状态与可丢弃的临时计算,减少推理对隐藏思维的依赖,在数学、长链逻辑、科学问答和多轮工具使用任务中保持准确率的同时降低依赖。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05250 2026-06-05 cs.SE 50%

Towards Persistent Case-Based Memory for Autonomous Data Science: A CBR-Augmented R&D-Agent with a Locally Deployable Small Language Model

面向自主数据科学的持久化案例记忆:一种CBR增强的R&D-Agent与本地可部署的小语言模型

Felix Stocker

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出一种CBR增强的R&D-Agent,通过持久化案例库和小语言模型Gemma 4 31B Dense,在Kaggle竞赛中实现方向性精度提升和方差降低。

Comments 14 pages, 8 figures, 8 tables; preprint, not submitted to any venue; code available at https://github.com/stofe94/cbr-rd-agent

详情

展开后加载摘要…

URL PDF HTML 收藏