arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-22 至 2026-07-22 共收录 111 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 8 篇

2508.05282 2026-07-22 cs.CL 89%

Not All Errors Are Created Equal: ASCoT Addresses Late-Stage Fragility in Efficient LLM Reasoning

并非所有错误都是同等重要:ASCoT解决高效大语言模型推理中的晚期脆弱性

Dongxu Zhang, Yujun Wu, Yiding Sun, Jinnan Yang, Ning Yang, Jihua Zhu, Miao Xin, Baoliang Tian

机构 * Xi’an Jiaotong University(西安交通大学) Peking University(北京大学) Institute of Automation, CASIA(中国科学院自动化研究所) Bytedance(字节跳动)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);self-correction(abstract)

AI总结 ASCoT通过自适应校正机制提升大语言模型推理效率与可靠性,减少计算资源消耗的同时保持高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04843 2026-07-22 cs.AI 版本更新 83%

Fluid Reasoning Representations

推理模型中的流体表示

Dmitrii Kharlapenko, Terry Jingchen Zhang, Arth Singh, Alessandro Stolfo, Arthur Conmy, Mrinmaya Sachan, Zhijing Jin

机构 * ETH Zurich(苏黎世联邦理工学院) University of Toronto(多伦多大学)

专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 研究揭示了推理模型通过上下文细化令牌表示提升抽象问题解决能力的机制,提出流体推理表示概念。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18438 2026-07-22 cs.CL cs.AI cs.LG 新提交 82%

Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains

Relay-Bench:评估大语言模型在多领域推理链上的表现

Liam Swayne

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Relay-Bench是用于评估大语言模型在多领域推理链能力的基准测试,测试集含复合问题,涵盖多领域,模型使用无限制,鼓励利用工具,领先模型GPT-5.5(xHigh)得分43.3%,问题由两到十三个子问题组成,无需多模态输入输出。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18979 2026-07-22 cs.AI 新提交 79%

Fishing Out Free Riders: Shapley-Based Reward Attribution for Parallel Reasoning via Reinforcement Learning

揪出搭便车者:基于夏普利值的强化学习并行推理奖励归因

Wentao Zhang, Haoyu Zhang, Xinke Jiang, Yuxuan Cheng, Yuhan Pan, Miao Li, Zhipeng Qiao, Tao Feng, Zhen Tao, Dengji Zhao

机构 * ShanghaiTech University(上海科技大学) City University of Hong Kong(香港城市大学) Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Zhejiang University(浙江大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究大型语言模型多步推理中并行推理路径贡献难区分问题,提出基于夏普利值的强化学习框架并行夏普利值方法,通过量化边际贡献等实现按比例分配奖励,实验证明其优于基线且能改进多路径推理。

Comments 19 pages, 4 figures, 8 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18915 2026-07-22 cs.CL 新提交 79%

Reasoning Error from Known Fact: Step-Level Self-Consistency Group Relative Policy Optimization for LLM

已知事实导致的推理错误:针对大语言模型的步骤级自一致性组相对策略优化

Xiaomeng Hu, Jiaqi Hu, Hao Chen, Qi Zhang, Zhanming Shen, Wentao Ye, Junbo Zhao

机构 * Zhejiang University(浙江大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 针对大语言模型推理中因上下文干扰产生事实错误的问题,提出步骤级自一致性组相对策略优化(SSC - GRPO),通过计算自一致性分数分配步骤级奖励,在数学推理基准和幻觉排行榜上取得领先,为检测和减轻幻觉提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18266 2026-07-22 cs.AI 新提交 79%

Structured Synthetic Reasoning Data for Arithmetic Fine-Tuning of Small Language Models

用于小型语言模型算术微调的结构化合成推理数据

Jake O'Grady, Effirul Ramlan

机构 * University of Galway(戈尔韦大学) School of Computer Science(计算机科学学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究小型语言模型多步算术推理困难问题,通过生成结构化合成推理数据并结合LoRA在消费硬件上微调Qwen3模型,提高了模型在GSM8K等基准测试上的准确率和迁移效果,证明低成本合成数据设计可改善小型语言模型算术适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19313 2026-07-22 cs.LG cs.AI 新提交 62%

Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information

脱离上下文的广义信赖域策略优化算法:利用特权信息学习解决难题

Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou, Jalaj Bhandari, Kavosh Asadi, Daniel Jiang, Aditya Modi

机构 * Meta AI Columbia University(哥伦比亚大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究利用特权信息解决强化学习难题,提出脱离上下文的广义信赖域策略优化算法(OC - GRPO),通过引导展开和重要性校正目标避免训练不匹配,在标准数学推理基准上比普通GRPO有显著提升且成本低。

Comments 24 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18260 2026-07-22 cs.AI 新提交 57%

FindStatBench: Evaluating Large Language Models on Combinatorial Code Synthesis

FindStatBench:在组合代码合成上评估大语言模型

Soham Dan

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 介绍用于评估大语言模型组合代码合成能力的FindStatBench基准,涵盖多种合成任务,通过特定方式评分并评估11个系统,发现开源闭源系统准确率趋同、示例可能有害、存在输出预算问题等,揭示统计合成与映射合成的差异及相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 5 篇

2607.18443 2026-07-22 cs.CL 新提交 79%

Computational models of pragmatic reasoning with flexible generation of meaning and expression alternatives

具有灵活生成意义和表达替代方案的语用推理计算模型

Polina Tsvilodub, Fausto Carcassi, Michael Franke

机构 * University of Tübingen(图宾根大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL

AI总结 研究提出SAGE框架,结合认知模型与语言模型,将语用过程分解为提议者、评估者和选择器模块。通过三个案例研究评估,该模型取得高精度且常超基线,不过组件分析有不对称性,还探讨了神经符号模型在语用语言使用中的前景与局限。

Comments 27 pages main text, 9 figures; 25 pages supplementary materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03245 2026-07-22 cs.AR cs.AI cs.SE 版本更新 79%

FVRuleLearner: Operator-Level Reasoning Tree (Op-Tree)-Based Rules Learning for Formal Verification

FVRuleLearner:基于操作级推理树(OP-Tree)的规则学习用于形式验证

Lily Jiaxin Wan, Chia-Tung Ho, Yunsheng Bai, Cunxi Yu, Ghaith Bany Hamad, Deming Chen, Haoxing Ren

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NVIDIA(英伟达) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出FVRuleLearner,通过操作级推理树模型,提升形式验证中SVA操作符选择的准确性和效率,显著提高语法和功能正确性。

Comments Accepted to IEEE VTS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18575 2026-07-22 cs.CR 新提交 67%

RECEIPT: Deterministic, Reward-Hacking-Resistant Verification for White-Box Agentic XSS Discovery

RECEIPT:用于白盒代理式XSS发现的确定性、抗奖励攻击验证

Muxi Lyu, Karen Shieh, Yiwei Hou, Hao Wang, Koushik Sen, David Wagner

专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract)

AI总结 研究针对白盒代理式XSS发现中编码代理声明不可信的问题,提出RECEIPT验证框架,通过环境隔离等手段使发现可信,经实验评估,在预算内发现多个未知漏洞,相比其他方式能确认更多真实利用且无假阳性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18727 2026-07-22 cs.PL cs.AR 新提交 50%

Formal Verification of an Out-of-Order Multiprocessor against an In-Order Weak-Memory ISA

针对顺序弱内存ISA的乱序多处理器形式验证

Janggun Lee, Jeehoon Kang

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 研究针对顺序弱内存ISA的乱序多处理器验证问题,核心方法是设计核心规范并分两步证明,主要贡献是首次实现此类形式验证,借助核心规范简化证明,且利用LLM代理自动编写证明。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18319 2026-07-22 physics.soc-ph 新提交 50%

Mapping the Narrow Corridor with Large Language Models

用大语言模型绘制狭窄走廊

Ebrahim M Songhori

专题命中 代码与定理证明 :chain-of-thought(abstract)

AI总结 研究探讨大语言模型能否将国家历史在二维空间路径的框架付诸实践,引入可重现流程,制作12国轨迹图集并比较四个模型,评估与专家指数的一致性及模型间一致性,还讨论了大语言模型注释器和人类专家偏差差异。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 10 篇

2509.25699 2026-07-22 cs.CV 版本更新 94%

AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning

AIM-CoT:基于主动信息的多模态链式推理用于视觉-语言推理

Xiping Li, Jianghong Ma

机构 * The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 逻辑推理 :CoT(title,title_cn);reasoning(title,abstract);chain-of-thought(title,abstract)

AI总结 本文提出AIM-CoT框架,通过上下文增强注意力图生成、主动视觉探测和动态注意力转移触发,改进视觉语言模型的证据选择与插入触发,提升视觉-语言推理性能。

Comments Accepted by ACL 2026 Main Conference. 30 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01848 2026-07-22 cs.CV 版本更新 78%

Semantic Richness or Geometric Reasoning? The Fragility of VLM's Visual Invariance

语义丰富性还是几何推理?VLM视觉不变性的脆弱性

Jason Qiu, Zachary Meurer, Xavier Thomas, Deepti Ghadiyaram

机构 * Boston University(波士顿大学)

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 研究揭示VLM在基本几何变换下的脆弱性,指出其在空间不变性与等变性上的不足,影响物体识别的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12982 2026-07-22 cs.AI cs.MA cs.SC 版本更新 77%

FormalAnalyticGeo: A Neural-Symbolic Based Framework for Multimodal Analytic Geometry Problem Generation

形式分析几何:一种基于神经符号的多模态解析几何问题生成框架

Ruoran Xu, Wending Gao, Qiufeng Wang

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 逻辑推理 :reasoning(abstract);math reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 研究解析几何问题生成,提出基于神经符号的FormalAnalyticGeo框架,利用CDL及四个大语言模型组件,无需人工注释自动生成问题,形成闭环,生成的AnalyticGeo7K数据集问题误差小,框架和数据集将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18249 2026-07-22 q-bio.QM cs.AI 新提交 74%

MechAInistic: An LLM-guided Multi-Agent System for Reasoning over Genome-Scale Constraint-Based Metabolic Models

MechAInistic:一种由大语言模型引导的多智能体系统,用于基于基因组规模的约束代谢模型进行推理

Josh Loecker, Narayna Puraja, William Bryan, Bhanwar Lal Puniya, Ahmed Abdeen Hamed, Tomáš Helikar

专题命中 逻辑推理 :reasoning(title);分类 cs.AI

AI总结 研究旨在降低基于约束的代谢建模使用门槛,开发了MechAInistic多智能体系统,借助大语言模型,围绕特定模式将自然语言问题转化为可执行工作流程,通过两个免疫细胞代谢模型用例验证,能生成可追溯的治疗假设。

Comments 23 pages, 6 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18366 2026-07-22 cs.AI cs.CL cs.CY 新提交 62%

Operational Hallucination and Safety Drift in AI Agents

人工智能代理中的操作幻觉与安全漂移

Shasha Yu, Fiona Carroll, Barry L. Bentley

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究大型语言模型在多轮执行中引发的可靠性风险,通过多轮评估量化安全漂移和操作幻觉现象,分析其根源,提出行动感知监督层,该层能拦截违规行为且无良性误报,提升了代理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18265 2026-07-22 cs.AI cs.CL 新提交 62%

State Compression in Two-Agent LLM Relays: A Closed-World Study of Constraint Preservation

双智能体语言模型中继中的状态压缩:约束保留的封闭世界研究

Anantha Sharma, Sheeba Elizabeth John, Kaarthik Senthil Kumar, Saratsuhas Vijayababu

专题命中 逻辑推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 研究双智能体LLM中继中交接压缩问题,比较无压缩、叙述性总结、JSON提取、基于嵌入的修剪四种交接条件,发现交接表示影响下游可行性,JSON提取可行性准确率最高达0.96,结构化可审计表示利于约束检查。

Comments 8 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18715 2026-07-22 cs.AI 新提交 57%

DWM: Separating World Effects from Actions in Latent World Models

DWM:在潜在世界模型中分离世界效应与动作

Yi-Ge Zhang, Tianqi Du, Qi Zhang, Yisen Wang

机构 * Peking University(北京大学)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 研究在潜在世界模型中分离世界效应与动作的问题,提出DWM框架,通过辅助世界头和正交性约束实现预测转换的显式加法分解,在构建的W变体基准测试中取得更好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18548 2026-07-22 cs.AI cs.MA cs.SY eess.SY 新提交 57%

Engineering Trustworthy Agentic AI for Critical Systems

为关键系统设计可靠的智能体人工智能

Omar Al-Refai, Ibrahim Shahbaz, Adam Ali Husseinat, Michael Mandulak, Jaewon Kim, Eman Hammad

机构 * Texas A&M University(德克萨斯A&M大学) Innovations in Systems Trust and Resilience (iSTAR) Laboratory(系统信任与弹性创新(iSTAR)实验室) Texas A&M Institute of Data Science - Security, Privacy and Resilience for Trusted AI (SPARTA) Thematic Lab.(德克萨斯A&M大学数据科学研究所 - 可信人工智能的安全、隐私与弹性(SPARTA)主题实验室) Texas A&M Global Cyber Research Institute (GCRI)(德克萨斯A&M大学全球网络研究所)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 研究针对关键工程领域智能体人工智能,将可靠性作为首要工程属性,采用围绕五个维度的可靠性模型及保证工作流程,综述相关架构、机制等,经多领域检验,指出其可靠性是单一问题并勾勒跨域保证框架路径。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18580 2026-07-22 cs.RO 新提交 50%

STeP: Signal Temporal Logic for Precise Specifications for Action Generation with Vision Language Models

STeP:用于视觉语言模型动作生成精确规范的信号时序逻辑

Kasra Torshizi, Anukriti Singh, Sidharth Mathur, Khuzema Habib, Leo Du, Pratap Tokekar

机构 * University of Maryland(马里兰大学)

专题命中 逻辑推理 :planning(abstract)

AI总结 针对视觉语言动作模型缺乏可解释性及难以遵循精确自然语言指令的问题,提出用信号时序逻辑(STL)连接高级语言理解与低级机器人执行的分层框架,经实验验证该框架能提高语言条件下机器人规划的精度、可靠性和可解释性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14516 2026-07-22 cs.DC 版本更新 50%

Efficient Multi-round LLM Inference over Disaggregated Serving

高效多轮LLM推理的解耦服务

Wenhao He, Youhe Jiang, Penghao Zhao, Quanqing Xu, Eiko Yoneki, Bin Cui, Fangcheng Fu

专题命中 逻辑推理 :planning(abstract)

AI总结 AMPD通过自适应协调预填充和解码工作负载,提升多轮LLM推理的服务级别目标达成率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 27 篇

2607.14512 2026-07-22 cs.AI cs.CL cs.LG 版本更新 85%

RetroAgent: Harnessing LLMs to Search Over Structured Memory for Agentic Retrosynthesis Planning

RetroAgent:利用大语言模型在结构化记忆中进行搜索以实现智能逆合成规划

Yanqiao Zhu, Jingru Gan, Xiaoqi Sun, Fang Sun, Yidan Shi, Md Mofijul Islam, Chao Shang, Wenhao Gao, Connor W. Coley, Yizhou Sun, Wei Wang

机构 * UCLA(加利福尼亚大学洛杉矶分校) MIT(麻省理工学院) Amazon(亚马逊公司) UPenn(宾夕法尼亚大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究多步逆合成规划难题,提出RetroAgent智能体,通过结合结构化记忆桥接符号搜索与神经推理,利用记忆和化学工具观察搜索状态,实验证明其在分布内和分布外基准测试中性能强且泛化能力好。

Comments To appear at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18840 2026-07-22 cs.RO 新提交 82%

WorldScape Policy 2.0: Empowering Steerable World Action Modeling with Reasoning-Augmented Memory

WorldScape Policy 2.0:通过推理增强记忆实现可控的世界行动建模

Haisheng Su, Zongdai Liu, Xin Jin, Haoxuan Dou, Chengming Hu, Baorun Li, Zhanwang Liu, Ruiyan Xu, Jianjie Fang, Xin Zhang, Zhenjie Yang, Xue Yang, Chen Gao, Junchi Yan, Yong Li, Wei Wu

专题命中 规划推理 :reasoning(title,abstract);planning(abstract)

AI总结 研究针对现有世界行动模型的局限,提出WorldScape Policy 2.0,用推理增强记忆,构建相关数据集,实现从高级指令自主规划及基于细粒度文本等的可控执行,在模拟和现实平台实验中展现出在多方面的卓越能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18264 2026-07-22 cs.AI cs.CL cs.LG 新提交 82%

MUX: Continuous Reasoning via Multiplexed Tokens

MUX:通过复用令牌进行连续推理

Ayhan Suleymanzade, Halil Alperen Gozeten, Michael Bronstein, İsmail İlkan Ceylan, Jinwoo Kim

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究提出MUX方法,将离散推理提炼为连续复用令牌,通过位置相关加权实现无损复用,防止潜在坍缩,能在需搜索问题中并行探索,在多语言模型评估中优于基线,证明无损叠加是实现高效潜在连续推理的充分条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18806 2026-07-22 cs.AI cs.CL cs.MA 新提交 81%

AI Tour Meeting: Group Travel Planning by LLM Agents

人工智能旅游会议:基于大语言模型代理的团体旅行规划

Daisuke Kikuta

机构 * NTT, Inc.(日本电报电话公司)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出基于大语言模型代理的团体旅行规划框架AI Tour Meeting,通过自然语言讨论找满足约束和偏好的行程,提供相关配置接口实现灵活编排,可作模拟工具,还展示了系统验证等结果以证明其效用。

Comments The code is available at https://github.com/ntt-dkiku/ai-tour-meeting

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18589 2026-07-22 cs.LG cs.AI 新提交 81%

Planning as Emergent Behavior in Reinforcement Learning with Relational Hidden States

关系隐藏状态强化学习中作为涌现行为的规划

Armin Sommer

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究无模型强化学习中规划作为涌现行为的现象,发现神经架构的隐藏状态结构是决定因素,关系隐藏状态网络能获规划机制,恢复环境转移结构并改进策略,解释了涌现规划现象并引发相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18530 2026-07-22 cs.LG cs.AI 新提交 81%

Censoring-Aware In-Context Learning for Generalized Supplier Lead Time Estimation in Supply Chain Planning

供应链规划中广义供应商提前期估计的审查感知上下文学习

Christopher Wang, Sebastien Ouellet, Behrouz Haji Soleimani, Ali Etemad

机构 * Queen’s University(女王大学) Kinaxis Inc.(Kinaxis公司)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究供应链规划中供应商提前期预测问题,提出审查感知上下文学习模型LeadTime-ICL,结合Transformer与条件归一化流头,经预训练可适应新数据集,在多数据集上评估表现优异,为工业规划提供准确低成本预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29932 2026-07-22 cs.AI 版本更新 80%

SAGA: Scene-Aware, Goal-Evolving Agents for Long-Horizon Strategy Game Planning

SAGA: 场景感知、目标演化的长时域CivRealm策略规划智能体

Tianyu Jin, Shuo Chen, Yida Wang, Liuyu Xiang, Yingzhuo Liu, Yexin Li, Peipei Li, Zhaofeng He

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 针对长时域策略游戏中场景盲视、上下文溢出和跨游戏学习浅层化问题,提出SAGA多智能体框架,通过地图语义场景图、工具增强规划器和双时域反馈循环,在FreeCiv中取得最高文明评分并降低输出令牌27%。

Comments 18 pages, 4 figures. Code https://github.com/Kazecloudk/SAGA-Scene-Aware-Goal-Evolving-Agents-for-Long-Horizon-Strategy-Game-Planning

详情

展开后加载摘要…

URL PDF HTML 收藏