arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-13 至 2026-04-13 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 8 篇

2602.02188 2026-04-13 cs.AI 79%

Reasoning in a Combinatorial and Constrained World: Benchmarking LLMs on Natural-Language Combinatorial Optimization

在组合与约束世界中的推理:在自然语言组合优化上对LLM的基准测试

Xia Jiang, Jing Chen, Cong Zhang, Jie Gao, Chengpeng Hu, Chenhao Zhang, Yaoxin Wu, Yingqian Zhang

机构 * Eindhoven University of Technology(埃因霍温理工大学) Brandenburg University of Technology(勃兰登堡工业大学) Nanyang Technological University(南洋理工大学) Delft University of Technology(代尔夫特理工大学) Southeast University(东南大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出NLCO基准测试,评估LLM在组合优化中的推理能力,涵盖43个问题,通过四层分类体系进行细粒度评估,发现随着问题规模增大,LLM的性能下降,尤其是在图结构问题和瓶颈目标上表现较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08863 2026-04-13 cs.AI 70%

Hidden in Plain Sight: Visual-to-Symbolic Analytical Solution Inference from Field Visualizations

隐于 plain sight:从场可视化中推断视觉到符号的解析解

Pengze Li, Jiaquan Zhang, Yunbo Long, Xinping Liu, Zhou wenjie, Encheng Su, Zihang Zeng, Jiaqi Liu, Jiyao Liu, Junchi Yu, Lihao Liu, Philip Torr, Shixiang Tang, Aoran Wang, Xi Chen

机构 * Fudan University, China(复旦大学) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室) University of Cambridge, UK(剑桥大学) Nankai University, China(南开大学) University of Oxford, UK(牛津大学)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文研究了从二维线性稳态场的可视化中推断视觉到符号的解析解,提出ViSA-R2模型并发布ViSA-Bench基准,通过结构模式识别和物理学家路径验证,实现高精度符号表达推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17788 2026-04-13 cs.AI cs.CL cs.LG cs.MA 67%

Bayesian Social Deduction with Graph-Informed Language Models

基于图信息的语言模型的贝叶斯社会推断

Shahab Rahimirad, Guven Gergerli, Lucia Romero, Angela Qian, Matthew Lyle Olson, Simon Stepputtis, Joseph Campbell

机构 * Purdue University(普渡大学) Oracle(甲骨文公司) Virginia Tech(弗吉尼亚理工大学) Intel Labs(英特尔实验室)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种混合推理框架,通过外部化信念推断到结构化概率模型,结合语言模型进行理解和交互,在Agent-Agent游戏中实现与大模型相当的性能,并首次在受控研究中击败人类玩家。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09189 2026-04-13 cs.CL cs.AI cs.LG 67%

Do LLMs Follow Their Own Rules? A Reflexive Audit of Self-Stated Safety Policies

大语言模型是否遵循自身规则?对自我声明安全政策的反思审计

Avni Mittal

机构 * Microsoft(微软)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SNCA框架,通过提取模型自述安全规则并形式化为类型谓词,评估模型行为一致性,发现模型在安全政策与行为间存在系统性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08905 2026-04-13 cs.AI cs.LG 62%

StaRPO: Stability-Augmented Reinforcement Policy Optimization

StaRPO:稳定性增强的强化策略优化

Jinghan Zhang, Fengran Mo, Tharindu Cyril Weerasooriya, Ruimin Dai, Xiaoyan Han, Yanjie Fu, Dakuo Wang, Kunpeng Liu

机构 * Clemson University(克莱姆森大学) Université de Montréal(蒙特利尔大学) Accenture (United States)(埃森哲(美国)) Arizona State University(亚利桑那州立大学) Northeastern University(东北大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 StaRPO通过引入推理稳定性指标提升强化学习在复杂推理任务中的表现,通过ACF和PE指标增强逻辑稳定性和响应准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09308 2026-04-13 cs.AI 57%

Constraint-Aware Corrective Memory for Language-Based Drug Discovery Agents

基于约束的纠正记忆:用于基于语言的药物发现代理

Maochen Sun, Youzhi Zhang, Gaofeng Meng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文提出CACM框架,通过精确的集合级诊断和简洁的记忆写回机制,提升语言基药物发现代理的可靠性,实验表明其在目标级成功率提升36.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09075 2026-04-13 cs.CL 57%

Hierarchical Alignment: Enforcing Hierarchical Instruction-Following in LLMs through Logical Consistency

层级对齐:通过逻辑一致性在LLM中强制执行层级指令遵循

Shu Yang, Zihao Zhou, Di Wang, Wenda Li

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) University of Liverpool(利物浦大学) University of Edinburgh(爱丁堡大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出NSHA方法,通过显式建模和执行指令优先级,解决LLM在多指令环境下保持一致性与安全性的挑战,提升任务性能和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08762 2026-04-13 cs.CV cs.AI 57%

InstrAct: Towards Action-Centric Understanding in Instructional Videos

InstrAct:迈向指令视频中的动作中心理解

Zhuoyi Yang, Jiapeng Yu, Reuben Tan, Boyang Li, Huijuan Xu

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Microsoft Research(微软研究院) Nanyang Technological University(南洋理工大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出InstrAction框架,通过数据驱动策略和辅助目标提升指令视频中动作识别与建模,建立InstrAct基准测试集,优于现有视频基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏