arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-07 至 2026-04-07 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 6 篇

2603.21286 2026-04-07 cs.HC 89%

When the Chain Breaks: Interactive Diagnosis of LLM Chain-of-Thought Reasoning Errors

当链条断裂时:LLM推理错误的交互诊断

Shiwei Chen, Niruthikka Sritharan, Xiaolin Wen, Chenxi Zhang, Xingbo Wang, Yong Wang

专题命中 代码与定理证明 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract)

AI总结 本文提出ReasonDiag系统,通过结合外部事实核查与符号逻辑验证,帮助用户高效识别和诊断LLM推理链条中的错误步骤及根本原因。

Comments Accepted to EuroVis 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04500 2026-04-07 cs.CV 78%

Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward

Saliency-R1: 通过显著图对齐奖励增强可解释性和忠实的视觉-语言推理

Shizhan Gong, Minda Hu, Qiyuan Zhang, Chen Ma, Qi Dou

机构 * The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学)

专题命中 代码与定理证明 :reasoning(title,abstract)

AI总结 Saliency-R1通过显著图对齐奖励提升视觉-语言模型的推理可解释性和忠实性,利用显著图技术高效突出关键图像区域,结合GRPO优化策略增强模型对相关区域的关注,实验显示提升推理忠实性和任务性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04876 2026-04-07 cs.AI 57%

Incompleteness of AI Safety Verification via Kolmogorov Complexity

通过克利福德复杂性验证AI安全的不完全性

Munawar Hasan

机构 * Michigan Technological University(密歇根理工大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 本文通过克利福德复杂性分析AI安全验证的固有限制,证明任何固定验证器都无法认证复杂度超过阈值的真正合规实例,揭示了验证方法的内在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04103 2026-04-07 cs.AI 57%

Compliance-by-Construction Argument Graphs: Using Generative AI to Produce Evidence-Linked Formal Arguments for Certification-Grade Accountability

基于构造的合规性论证图:利用生成式AI生成证据关联的正式论证以实现认证级问责

Mahyar T. Moghaddam

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种结合生成式AI与结构化正式论证表示的合规性架构,通过类型化论证图、检索增强生成、推理验证内核和溯源账本,确保论证的可验证性和可追溯性,防止不支持的主张进入决策记录。

Comments Accepted at FACCT 2026, IoT CPS Week

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16978 2026-04-07 cs.MA 56%

Lark: Biologically Inspired Neuroevolution for Multi-Stakeholder LLM Agents

Lark:生物启发的多利益相关者大语言模型代理神经进化

Rikhil Tanugula, Dheeraj Chintapalli, Sunkalp Chandra

专题命中 代码与定理证明 :reasoning(abstract,comments)

AI总结 Lark通过结合大语言模型推理与进化型多智能体系统,解决冗余与利益相关者权衡问题,采用四机制提升策略生成效率与透明度,实验显示其在30轮评估中表现优异且成本可控。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: NeurIPS 2025 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03872 2026-04-07 cs.LO cs.MA 50%

Strategies in Sabotage Games: Temporal and Epistemic Perspectives

博弈策略:时间与认知视角

Nina Gierasimczuk, Katrine B. P. Thoft

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文从时间视角用ATL$^\ast$分析Sabotage游戏,并探讨其认知扩展中的玩家不确定性,为动态图的时间属性推理提供新框架。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏