arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-19 至 2026-06-19 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 7 篇

2602.22495 2026-06-19 cs.LG cs.AI 版本更新 84%

Reinforcement-aware Knowledge Distillation for LLM Reasoning

面向LLM推理的强化学习感知知识蒸馏

Zhaoyang Zhang, Shuli Jiang, Yantao Shen, Yuting Zhang, Dhananjay Ram, Shuo Yang, Zhuowen Tu, Wei Xia, Stefano Soatto

机构 * Meta Guo et al. Lin et al. Xu et al. Shao et al. Schulman et al. Xie et al.

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 提出RL感知蒸馏(RLAD),通过信任区域比率蒸馏(TRRD)在强化学习后训练中实现选择性模仿,解决分布不匹配和目标干扰问题,在逻辑推理和数学基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20227 2026-06-19 cs.AI cs.SE 新提交 79%

QMFOL: Benchmarking Large Language Model Reasoning via Quantifiable Monadic First-Order Logic Test Case Generation

QMFOL:通过可量化的一元一阶逻辑测试用例生成来基准测试大语言模型推理

Xinyi Zheng, Ling Shi, Tianlong Yu, Yongxin Zhao, Lorenz Goette, Kailong Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学) Hubei University(湖北大学) East China Normal University(华东师范大学) National University of Singapore(新加坡国立大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出QMFOL框架,通过可控制复杂度的合取/析取模式生成一元一阶逻辑推理任务,并构建包含2880个实例的基准QMFOLBench,评估显示逻辑复杂度增加导致性能下降和计算开销上升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24435 2026-06-19 cs.AI 79%

Human-Level Reasoning: A Comparative Study of Large Language Models on Logical and Abstract Reasoning

人类级推理:大型语言模型在逻辑与抽象推理上的比较研究

Benjamin Grando Moreira

机构 * Universidade Federal de Santa Catarina(联邦圣卡塔琳娜大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过八个定制推理问题比较了多个LLM在逻辑和抽象推理能力上的表现,揭示了模型在推理任务上的差异及不足。

Comments 12 pages

Journal ref Proceedings of the 2026 Computer on the Beach

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19464 2026-06-19 cs.AI cs.MA 新提交 70%

Deontic Policies for Runtime Governance of Agentic AI Systems

面向自主AI系统运行时治理的道义策略

Anupam Joshi, Tim Finin, Karuna Pande Joshi, Lalana Kagal

机构 * CSEE Department UMBC Baltimore, MD, USA Center for AI UMBC Baltimore, MD, USA Information Systems Department UMBC Baltimore, MD, USA CSAIL MIT Cambridge, MA, USA

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 针对大语言模型驱动的自主AI系统在安全、隐私和合规方面的治理挑战,提出AgenticRei框架,利用基于Rei的道义策略语言(OWL表示)在运行时通过逻辑引擎强制执行义务、豁免、冲突解决等治理约束,并兼容A2AS等标准。

Comments 10 pages, 1 figure. To be published in the 2026 IEEE Symposium on Agentic Services which is part of the IEEE Conference on Web Services

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20093 2026-06-19 cs.CL 新提交 57%

Self-Preference Is Weak or Absent in Verifiable Instruction-Following Revision: A Four-Model Test Under Genuine Authorship

自我偏好在可验证的指令遵循修订中弱或不存在:基于真正作者身份的四模型测试

William Guey, Pierrick Bougault

机构 * Department of Industrial Engineering, Tsinghua University(清华大学工业工程系)

专题命中 逻辑推理 :verifier(abstract);分类 cs.CL

AI总结 通过IFEval验证器测试四类中端模型在指令遵循修订中的自我偏好,发现作者拒绝已验证正确编辑的比例与新鲜模型无显著差异,表明自我偏好弱或不存在。

Comments 7 pages, 3 tables. Code and data: https://github.com/williamguey/self-preference-revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18272 2026-06-19 cs.NI cs.AI cs.SY eess.SY 新提交 57%

Mitigating Anchoring Bias in LLM-Based Agents for Energy-Efficient 6G Autonomous Networks

缓解基于LLM的智能体在节能6G自主网络中的锚定偏差

Hatim Chergui, Claudia Carballo González, Farhad Rezazadeh, Merouane Debbah

机构 * i2CAT Foundation(i2CAT基金会) Universitat Politècnica de Catalunya(政治技术大学) Research Institute for Digital Future(数字未来研究院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 提出一种基于截断三参数威布尔分布的随机锚定策略,缓解LLM智能体在6G网络切片中的锚定偏差,结合CVaR数字孪生保障SLA尾延迟,实现高达25%的节能。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17128 2026-06-19 cs.AR 新提交 50%

Shift-Left High-Level Synthesis Verification via Knowledge-Augmented LLM Agent

通过知识增强的LLM智能体实现左移高层次综合验证

Zhihan Xiao, Hongbing Lang, Zhe Zhao, Luke Ztz Hu, Songping Mai

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出一种知识增强的智能体驱动左移验证框架,通过双层级一致性检查、符号执行和HLS验证知识图谱,在综合前自动验证C与HLS-C的功能一致性,覆盖率达98.26%。

详情

展开后加载摘要…

URL PDF HTML 收藏