arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-31 至 2026-03-31 共收录 158 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 5 篇

2601.06853 2026-03-31 cs.CL cs.LG 86%

†DAGGER: Distractor-Aware Graph Generation for Executable Reasoning in Math Problems

†DAGGER:面向数学问题可执行推理的干扰意识图生成

Zabir Al Nazi, Shubhashis Roy Dipta, Sudipta Kar

机构 * University of California, Riverside(加州大学河滨分校) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Oracle Health AI(甲骨文健康AI)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

AI总结 本文提出†DAGGER,通过将数学问题解决转化为可执行计算图生成,提升在低资源和噪声环境下的推理鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27008 2026-03-31 cs.CL 83%

RASPRef: Retrieval-Augmented Self-Supervised Prompt Refinement for Large Reasoning Models

RASPRef: 用于大型推理模型的检索增强自监督提示精炼

Rahul Soni

机构 * Independent Researcher(独立研究员)

专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

AI总结 RASPRef通过检索相关示例和推理轨迹,利用多样本一致性、验证反馈和模型生成的批评信号,迭代优化提示,提升推理任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28052 2026-03-31 cs.AI 70%

Meta-Harness: End-to-End Optimization of Model Harnesses

Meta-Harness:端到端优化模型Harness

Yoonho Lee, Roshen Nair, Qizheng Zhang, Kangwook Lee, Omar Khattab, Chelsea Finn

机构 * Stanford(斯坦福大学) KRAFTON MIT(麻省理工学院)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

AI总结 本文提出Meta-Harness,通过自动搜索优化模型Harness代码,提升文本分类、数学推理和编程任务性能,减少上下文token使用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11382 2026-03-31 cs.AI cs.ET cs.LG quant-ph 62%

Detecting Intrinsic and Instrumental Self-Preservation in Autonomous Agents: The Unified Continuation-Interest Protocol

检测自主代理中的内在与工具性自我保存:统一的延续-兴趣协议

Christopher Altman

专题命中 数学推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出统一延续-兴趣协议(UCIP)以区分AI系统中内在与工具性自我保存,通过量子玻尔兹曼机分析轨迹结构,实现高准确率的自我保存类型检测。

Comments 22 pages, 7 figures. v4 adds reference to the Continuation Observatory website as a live test laboratory in the replication/code availability and conclusion sections; no new experiments; empirical results and core conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02343 2026-03-31 cs.LG cs.AI 62%

MicroMix: Efficient Mixed-Precision Quantization with Microscaling Formats for Large Language Models

MicroMix:基于微缩格式的高效混合精度量化用于大语言模型

Wenyuan Liu, Haoqian Meng, Yilun Luo, Yafei Zhao, Peng Zhang, Xindian Ma

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 MicroMix通过引入微缩格式实现大语言模型的高效混合精度量化,平衡精度与效率,实现接近FP16的性能,且在多个任务中保持无损准确性。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2603.25810 2026-03-31 cs.PL cs.LG 79%

ExVerus: Verus Proof Repair via Counterexample Reasoning

ExVerus:通过反例推理进行证明修复

Jun Yang, Yuechun Sun, Yi Wu, Rodrigo Caridad, Yongwei Yuan, Jianan Yao, Shan Lu, Kexin Pei

机构 * The University of Chicago(芝加哥大学) Purdue University(普渡大学) The University of Toronto(多伦多大学) Microsoft Research(微软研究院)

专题命中 代码与定理证明 :reasoning(title);verifier(abstract);分类 cs.LG

AI总结 ExVerus利用反例推理指导LLM生成更准确的证明,通过自动生成和验证反例来提高证明的鲁棒性和效率。

Comments 31 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 15 篇

2502.12616 2026-03-31 cs.CL 89%

Improving Chain-of-Thought Reasoning via Quasi-Symbolic Abstractions

通过准符号抽象改进链式推理

Leonardo Ranaldi, Marco Valentino, Andrè Freitas

机构 * Idiap Research Institute(Idiap 研究所) School of Informatics, University of Edinburgh(爱丁堡大学信息学院) School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) National Biomarker Centre (NBC), CRUK Manchester Institute(英国癌症研究中心曼彻斯特研究所国家生物标志物中心)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(title);CoT(abstract);logical reasoning(abstract)

AI总结 本文提出QuaSAR方法,通过准符号解释引导LLM在更高抽象层面推理,提升小模型的推理能力,实验显示在自然语言和符号推理任务中准确率提升8%。

Journal ref 2025.acl-long.843

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04880 2026-03-31 quant-ph cs.AI cs.LG 88%

Symbolic Analysis of Grover Search Algorithm via Chain-of-Thought Reasoning and Quantum-Native Tokenization

通过链式推理和量子原生标记化对Grover搜索算法进行符号分析

Min Chen, Jinglei Cheng, Pingzhi Li, Haoran Wang, Tianlong Chen, Junyu Liu

机构 * Department of Computer Science, The University of Pittsburgh(匹兹堡大学计算机科学系) Department of Computer Science, The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校计算机科学系)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.AI、cs.LG

AI总结 本文探讨LLM通过符号分析解读量子电路的可行性,提出GroverGPT+模型,利用链式推理和量子原生标记化分析Grover算法,实现对oracle和标记状态的识别,并建立符号分析基准。

Comments 33 pages, 14 figures

Journal ref npj Quantum Information 12, 48 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22712 2026-03-31 cs.CL 85%

Beg to Differ: Understanding Reasoning-Answer Misalignment Across Languages

从分歧开始:理解跨语言推理-答案不一致现象

Anaelia Ovalle, Candace Ross, Sebastian Ruder, Adina Williams, Karen Ullrich, Mark Ibrahim, Levent Sagun

机构 * FAIR, Meta(Meta 人工智能基础研究团队) Meta Superintelligence Labs(Meta 超级智能实验室)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 研究探讨了多语言模型推理与答案的一致性问题,发现非拉丁文字推理痕迹与结论的不一致程度是拉丁文字的两倍,提出基于人工标注的错误分类方法,揭示了证据错误和逻辑推理错误是主要问题。

Comments Accepted to 2025 EMNLP Multilingual Representation Learning Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10063 2026-03-31 cs.CL cs.AI 81%

CLMN: Concept based Language Models via Neural Symbolic Reasoning

基于神经符号推理的概念语言模型:CLMN

Yibo Yang

机构 * College of Science, The Hong Kong University of Science and Technology(香港科技大学理学院)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 CLMN通过神经符号推理方法,在保持性能的同时提升NLP的可解释性,通过连续嵌入和模糊逻辑推理学习概念交互规则,提升医疗和金融等领域的文本处理效果。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28558 2026-03-31 cs.AI 79%

T-Norm Operators for EU AI Act Compliance Classification: An Empirical Comparison of Lukasiewicz, Product, and Gödel Semantics in a Neuro-Symbolic Reasoning System

T-范数运算符用于欧盟人工智能法案合规分类:在神经符号推理系统中对Lukasiewicz、Product和Gödel语义的实证比较

Adam Laabs

机构 * TriStiX S.L.(TriStiX公司)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究比较了三种T-范数运算符在神经符号推理系统中的表现,发现Gödel运算符在准确性与召回率上表现最佳,但存在少量误报,而Product和Lukasiewicz运算符在零误报情况下表现较弱。

Comments 11 pages, 8 tables, open-source code and dataset at https://github.com/TriStiX-LS/LggT-core

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27204 2026-03-31 cs.CR cs.SE 78%

"Elementary, My Dear Watson." Detecting Malicious Skills via Neuro-Symbolic Reasoning across Heterogeneous Artifacts

我的爱,华生。通过神经符号推理跨异构工件检测恶意技能

Shenao Wang, Junjie He, Yanjie Zhao, Yayi Wang, Kan Yu, Haoyu Wang

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本文提出MalSkills框架,通过符号解析与LLM语义分析提取异构工件中的安全敏感操作,构建技能依赖图并进行神经符号推理,实现恶意技能检测,实验表明其在F1得分上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27583 2026-03-31 cs.RO cs.SY eess.SY 75%

LLM-Enabled Low-Altitude UAV Natural Language Navigation via Signal Temporal Logic Specification Translation and Repair

基于大语言模型的低空无人机自然语言导航:通过信号时序逻辑规范翻译与修复

Yuqi Ping, Huahao Ding, Tianhao Liang, Longyu Zhou, Guangyu Lei, Xinglin Chen, Junwei Wu, Jieyu Zhou, Tingting Zhang

机构 * Guangdong Provincial Key Laboratory of Space-Aerial Networking and Intelligent Sensing, Harbin Institute of Technology, Shenzhen(广东省空天网络与智能感知重点实验室,哈尔滨工业大学(深圳)) Peng Cheng Laboratory (PCL), Shenzhen(鹏城实验室) Information Systems Technology and Design, Singapore University of Technology and Design(新加坡科技设计大学信息系统技术与设计系) School of Computer Science and Engineering, Central South University, Changsha(中南大学计算机科学与工程学院)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出一种统一框架,通过将自然语言指令转换为信号时序逻辑规范并利用混合整数线性规划生成轨迹,提升低空无人机在复杂环境中的安全导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28082 2026-03-31 cs.CV cs.MA 67%

LogiStory: A Logic-Aware Framework for Multi-Image Story Visualization

LogiStory: 一个多图像故事可视化逻辑感知框架

Chutian Meng, Fan Ma, Chi Zhang, Jiaxu Miao, Yi Yang, Yueting Zhuang

专题命中 逻辑推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出LogiStory框架,通过显式建模视觉逻辑提升多图像故事可视化中的叙事逻辑与视觉质量,引入多智能体系统和LogicTale基准测试集进行评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13191 2026-03-31 cs.CV cs.AI cs.CL 62%

CoPE-VideoLM: Leveraging Codec Primitives For Efficient Video Language Modeling

CoPE-VideoLM:利用编解码器原语实现高效的视频语言建模

Sayan Deb Sarkar, Rémi Pautrat, Ondrej Miksik, Marc Pollefeys, Iro Armeni, Mahdi Rad, Mihai Dusmanu

机构 * Microsoft Spatial AI Lab(微软空间人工智能实验室) Stanford University(斯坦福大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CoPE-VideoLM,通过利用视频编解码器原语(如运动矢量和残差)减少计算开销,提升视频语言模型的效率和性能。

Comments Project Page: https://microsoft.github.io/CoPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28038 2026-03-31 cs.AI cs.LG 62%

Beyond the Answer: Decoding the Behavior of LLMs as Scientific Reasoners

超越答案:解码LLM作为科学推理者的行为

Rohan Pandey, Eric Ye, Michael Li

机构 * University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过定制遗传Pareto算法优化提示,研究提示对科学推理行为的影响,揭示模型特定的局部逻辑,并探讨其可迁移性和脆弱性。

Comments Accepted at the Post-AGI Science and Society Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27626 2026-03-31 cs.CL cs.AI 62%

Umwelt Engineering: Designing the Cognitive Worlds of Linguistic Agents

环境工程:设计语言代理的认知世界

Rodney Jehu-Appiah

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Umwelt工程作为代理设计栈的第三层,通过两个实验探讨改变推理媒介对认知的影响,发现约束语言模型在伦理推理和分类任务中表现更优,且通过认知重构和多样化机制提升性能。

Comments 24 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27076 2026-03-31 cs.AI 57%

When Verification Hurts: Asymmetric Effects of Multi-Agent Feedback in Logic Proof Tutoring

当验证带来伤害:多智能体反馈在逻辑证明辅导中的不对称效应

Tahreem Yasir, Sutapa Dey Tithi, Benyamin Tabarsi, Dmitri Droujkov, Sam Gilson Yasitha Rajapaksha, Xiaoyi Tian, Arun Ramesh, DongKuan, Xu, Tiffany Barnes

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了逻辑证明辅导中多智能体反馈的分层影响,提出一个基于知识图谱的基准测试,揭示了验证在反馈可靠性不同时对学习效果的不对称影响,并指出复杂度天花板限制了模型性能。

Comments 21 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08492 2026-03-31 cs.AI 57%

Autonomous Issue Resolver: Towards Zero-Touch Code Maintenance

自主问题解决者:迈向零接触代码维护

Aliaksei Kaliutau

机构 * Imperial College London(伦敦帝国理工学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于数据转换图的新型方法,通过数据状态节点和函数边的拓扑结构,解决传统代码属性图的控制流逻辑缺陷,实现数据完整性导航与控制流逻辑的统一,提升代码修复效率。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07240 2026-03-31 eess.SY cs.MA cs.SY 50%

Continuous-Time Control Synthesis for Multiple Quadrotors under Signal Temporal Logic Specifications

多四旋翼在信号时间逻辑规范下的连续时间控制合成

Yating Yuan, Yu Liu

专题命中 逻辑推理 :planning(abstract)

AI总结 本文提出双阶段框架,基于几何控制进行Lyapunov分析并设计多维增益,结合混合整数凸优化生成满足多智能体STL任务的轨迹,提升系统鲁棒性和暂态性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02028 2026-03-31 cs.CV cs.CR 50%

See No Evil: Adversarial Attacks Against Linguistic-Visual Association in Referring Multi-Object Tracking Systems

见无所见:对抗性攻击针对参考多目标跟踪系统中的语言-视觉关联

Halima Bouzidi, Haoyu Liu, Mohammad Abdullah Al Faruque

机构 * University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文研究了参考多目标跟踪系统在设计逻辑上的安全问题,揭示了语言-视觉关联和目标匹配组件的对抗性漏洞,并提出VEIL框架以破坏其统一的参考匹配机制。

Comments Accepted to the NeurIPS 2025 Workshop on Reliable ML from Unreliable Data

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 32 篇

2603.28116 2026-03-31 cs.RO cs.CV 87%

$AutoDrive\text{-}P^3$: Unified Chain of Perception-Prediction-Planning Thought via Reinforcement Fine-Tuning

$AutoDrive\text{-}P^3$:通过强化微调实现感知-预测-规划统一链式推理

Yuqi Ye, Zijian Zhang, Junhong Lin, Shangkun Sun, Changhao Peng, Wei Gao

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出$AutoDrive\text{-}P^3$框架,通过结构化推理整合感知、预测和规划,引入$P^3\text{-}CoT$数据集和$P^3\text{-}GRPO$算法,实现端到端自动驾驶的高效决策与安全规划。

Comments Accepted at ICLR 2026 (International Conference on Learning Representations)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00059 2026-03-31 cs.LG cs.AI 84%

TextBFGS: A Case-Based Reasoning Approach to Code Optimization via Error-Operator Retrieval

TextBFGS:通过错误-操作符检索的基于案例的推理代码优化方法

Zizheng Zhang, Yuyang Liao, Chen Chen, Jian He, Dun Wu, Qianjin Yu, Yanqin Gao, Jin Yang, Kailai Zhang, Eng Siong Chng, Xionghu Zhong

机构 * Zhongxing Telecom Equipment (ZTE)(中兴通讯股份有限公司) China Mobile(中国移动) Nanyang Technological University (NTU)(南洋理工大学) Hunan University(湖南大学)

专题命中 规划推理 :reasoning(title,abstract);self-correction(abstract);分类 cs.AI、cs.LG

AI总结 TextBFGS采用基于案例的推理方法,通过检索历史错误-操作符修正轨迹来优化代码生成,相比无状态方法更高效,显著提升了代码优化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03707 2026-03-31 cs.CL 83%

OmniRAG-Agent: Agentic Omnimodal Reasoning for Low-Resource Long Audio-Video Question Answering

OmniRAG-Agent:面向低资源长音频视频的代理多模态推理

Yifan Zhu, Xinyu Mu, Tao Feng, Zhonghong Ou, Yuning Gong, Haoran Luo

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL

AI总结 本文提出OmniRAG-Agent,通过构建图像音频检索增强生成模块和代理循环,解决低资源长音频视频问答中的高成本编码、弱细粒度检索等问题,实验表明其在低资源环境下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28596 2026-03-31 cs.HC cs.AI cs.CL 81%

Moving Beyond Review: Applying Language Models to Planning and Translation in Reflection

超越评审:将语言模型应用于反思中的规划与翻译

Seyed Parsa Neshaei, Richard Lee Davis, Tanja Käser

机构 * EPFL(瑞士联邦理工学院洛桑) KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用语言模型支持反思写作的规划与翻译阶段,通过实验发现AI支持能提升反思深度和结构质量,但效果在延迟测试中减弱。

Comments Accepted at AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05658 2026-03-31 cs.CL cs.AI 81%

Multilingual Medical Reasoning for Question Answering with Large Language Models

多语言医疗推理用于问答的大型语言模型

Pietro Ferrazzi, Aitor Soroa, Rodrigo Agerri

机构 * HiTZ Center - Ixa, University of the Basque Country EHU(HiTZ中心 - Ixa,巴斯克大学EHU)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于维基百科医疗知识生成多语言推理轨迹的方法,通过检索增强生成技术生成英文、意大利语和西班牙语的50万条轨迹,提升医疗问答性能,达到8B参数模型的最新水平。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26685 2026-03-31 cs.RO cs.AI cs.CV cs.LG 81%

Contextual Graph Representations for Task-Driven 3D Perception and Planning

基于任务驱动的3D感知与规划的上下文图表示

Christopher Agia

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了现有具身AI环境在机器人任务规划与3D场景图交集中的适用性,构建了评估现有经典规划器的基准,并探索图神经网络在规划领域关系结构不变性中的应用。

Comments University of Toronto Undergraduate Thesis, 2021. 85 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28651 2026-03-31 cs.AI 79%

Not Search, But Scan: Benchmarking MLLMs on Scan-Oriented Academic Paper Reasoning

不是搜索,而是扫描:在面向学术论文推理的扫描任务上基准测试大语言模型

Rongjin Li, Zichen Tang, Xianghe Wang, Xinyi Hu, Zhengyu Wang, Zhengyu Lu, Yiling Huang, Jiayuan Chen, Weisheng Tan, Jiacheng Liu, Zhongjun Yang, Haihong E

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出ScholScan基准,通过扫描式任务评估大语言模型在学术论文推理中的能力,发现检索增强生成方法在扫描任务上无显著提升,揭示了当前模型在该任务上的系统性缺陷。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12360 2026-03-31 cs.CV cs.CL 79%

VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding

VideoARM:基于分层记忆的代理推理用于长视频理解

Yufei Yin, Qianke Meng, Minghao Chen, Jiajun Ding, Zhenwei Shao, Zhou Yu

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 VideoARM通过自适应代理推理和分层记忆结构,有效降低长视频理解的token消耗,优于现有方法DVD。

Comments Accepted to CVPR 2026, code available at https://milvlg.github.io/videoarm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26993 2026-03-31 cs.MA cs.LG math.OC stat.ML 79%

On the Reliability Limits of LLM-Based Multi-Agent Planning

基于大语言模型的多智能体规划的可靠性极限

Ruicheng Ao, Siyang Gao, David Simchi-Levi

机构 * MIT(麻省理工学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 本文研究了基于大语言模型的多智能体规划的可靠性极限,通过建模为有限无环决策网络,展示了在无新外部信号时,分布式网络在决策理论上被集中贝叶斯决策者主导,并分析了通信和信息压缩带来的损失。

Comments Technical note

详情

展开后加载摘要…

URL PDF HTML 收藏