arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-09 至 2026-04-09 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 7 篇

2604.06799 2026-04-09 cs.CL cs.CY 79%

Beyond Accuracy: Diagnosing Algebraic Reasoning Failures in LLMs Across Nine Complexity Dimensions

超越准确性:在九个复杂性维度上诊断大语言模型的代数推理失败

Parth Patil, Dhruv Kumar, Yash Sinha, Murari Mandal

机构 * Department of Computer Science & Information Systems BITS Pilani(比拉理工学院皮拉尼校区计算机科学与信息系统系) School of Computer Engineering, KIIT Bhubaneshwar(KIIT布巴内斯瓦尔分校计算机工程学院)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出一个九维代数复杂性框架,通过独立调整每个复杂性因素来诊断大语言模型的代数推理失败,发现工作内存是主要瓶颈,识别出五个关键维度以全面评估模型能力。

Comments Under Review as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12088 2026-04-09 cs.AI cs.CL cs.LG 67%

One Life to Learn: Inferring Symbolic World Models for Stochastic Environments from Unguided Exploration

一次生命学习:从无指导探索中推断随机环境的符号世界模型

Zaid Khan, Archiki Prasad, Elias Stengel-Eskin, Jaemin Cho, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) Allen Institute for AI(艾伦人工智能研究所) Johns Hopkins University(约翰霍普金斯大学)

专题命中 逻辑推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出OneLife框架,通过条件激活的程序法则在概率编程框架中推断随机环境的动态,实现从无指导探索中学习复杂环境的动力学,优于基线方法。

Comments Accepted to ICLR 2026. Project page: https://onelife-worldmodel.github.io/; 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07007 2026-04-09 cs.MA cs.AI cs.CY 57%

AgentCity: Constitutional Governance for Autonomous Agent Economies via Separation of Power

AgentCity:通过权力分离实现自主代理经济的宪法治理

Anbang Ruan, Xing Zhang

机构 * NetX Foundation(NetX 基金会)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文提出通过权力分离模型,在区块链上实现自主代理经济的宪法治理,通过智能合约、确定性软件和人类裁决三者分离,解决代理社会逻辑垄断问题,实现人类意图与集体行为的对齐。

Comments 111 pages, 11 figures, 19 tables, 67 references. Pre-registered experimental design

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06633 2026-04-09 cs.CR cs.CL cs.SE 57%

Argus: Reorchestrating Static Analysis via a Multi-Agent Ensemble for Full-Chain Security Vulnerability Detection

Argus:通过多智能体集合重新编排静态分析以实现全链路安全漏洞检测

Zi Liang, Qipeng Xie, Jun He, Bohuan Xue, Weizheng Wang, Yuandao Cai, Fei Luo, Boxian Zhang, Haibo Hu, Kaishun Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) HKUST(香港科技大学) SF Express(顺丰速运) Great Bay University(大湾区大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 Argus通过多智能体框架提升静态分析效率,结合RAG和ReAct技术减少漏洞误报,发现更多真实漏洞并降低运营成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06629 2026-04-09 cs.MA cs.AI cs.RO 57%

Logical Robots: Declarative Multi-Agent Programming in Logica

逻辑机器人:逻辑编程中的多智能体编程

Evgeny Skvortsov, Yilin Xia, Ojaswa Garg, Shawn Bowers, Bertram Ludäscher

机构 * Google LLC(谷歌公司) University of Illinois(伊利诺伊大学) Gonzaga University(贡扎加大学)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 Logical Robots通过逻辑编程语言Logica实现多智能体仿真平台,将观察映射到动作输出,实现低层反应控制与高层规划的结合。

Comments International Conference on Autonomous Agents and Multiagent Systems (AAMAS), May 25-29, 2026. Paphos, Cyprus

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06722 2026-04-09 cs.CY cs.RO 50%

Infrastructure First: Enabling Embodied AI for Science in the Global South

基础设施优先:为全球南方科学赋能具身AI

Shaoshan Liu, Jie Tang, Marwa S. Hassan, Mohamed H. Sharkawy, Moustafa M. G. Fouda, Tiewei Shang, Zixin Wang

机构 * Shenzhen Institute of Artificial Intelligence and Robotics for Society (AIRS)(深圳市人工智能与机器人研究院(AIRS)) South China University of Technology(华南理工大学) National Research Centre (NRC)(国家研究中心(NRC)) British University in Egypt (BUE)(埃及英国大学(BUE)) National Institute of Clean-and-Low-Carbon Energy(国家清洁低碳能源研究所)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文探讨了通过具身AI赋能科学的基础设施优先方法,强调在人力、电力和网络受限的全球南方地区,通过可靠边缘计算、能效硬件和开放标准等基础设施提升科学能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06506 2026-04-09 cs.CR cs.SE 50%

Guiding Symbolic Execution with Static Analysis and LLMs for Vulnerability Discovery

通过静态分析和LLMs引导符号执行以发现漏洞

Md Shafiuzzaman, Achintya Desai, Wenbo Guo, Tevfik Bultan

专题命中 逻辑推理 :reasoning(abstract)

AI总结 SAILOR结合静态分析与LLM合成自动构建符号执行Harness,通过三个阶段发现内存安全漏洞,实验表明其在大规模代码库中显著提升漏洞检测效率。

详情

展开后加载摘要…

URL PDF HTML 收藏