arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-18 至 2026-08-18 共收录 221 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 13 篇

2608.14771 2026-08-18 cs.AI cs.CL cs.LG cs.LO cs.PL cs.SC math.OC 新提交 69%

From Errors to Proofs: Minimal-Core-Guided Repair for Neuro-Symbolic Constraint Solving

从错误到证明:最小核心引导的神经符号约束求解修复

Dipankar Sarkar

专题命中 逻辑推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG;reasoning(comments)

AI总结 该研究提出最小核心引导的修复方法,将语言模型生成的不可满足程序的错误消息替换为最小不可满足核心,在77个问题的基准上使弱模型编造不可行问题解的比例从79%降至7%,核心价值是提供证书并拒绝编造解。

Comments 7 pages, 2 figures. Accepted at the IJCAI-ECAI 2026 Workshop on Logic and Symbolic Reasoning (LogiSymb), poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10723 2026-08-18 cs.CV cs.AI cs.LG cs.MA 版本更新 62%

AgentMV: A State-Guided Multi-Agent Framework for Budget-Aware Music Video Generation

AllocMV:通过结构化持久状态实现音乐视频生成的最优资源分配

Huimin Wang, Chang Xia, Leilei Ouyang, Yongqi Kang, Yu Fu, Yuqi Ouyang

机构 * College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 AllocMV提出了一种分层框架,将音乐视频合成建模为多重选择背包问题,通过动态规划优化资源分配,确保跨镜头一致性并降低生成成本。

Comments ECCV 2026 AI4VA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15041 2026-08-18 cs.AI 新提交 57%

LLM-Based Hierarchical Coordinated Control with Continuation-Aware Policy Learning

基于大语言模型的分层协调控制与感知延续性的策略学习

Changhong He, Jinda Gao, Xinkuan Liu, Le Zhang, Xizi Luo, Yu Mei

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 针对复杂工程系统多单元协调难题,提出基于LLM的分层框架,结合感知延续性的GRPO,在多匝道交通控制和VPP能源管理中,性能优于多种对比方法。

Comments 30 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14585 2026-08-18 cs.AI 新提交 57%

Euclid-Omni: A Unified Neuro-Symbolic Framework for Plane Geometry

Euclid-Omni:面向平面几何的统一神经符号框架

Zhaoyu Li, Hangrui Bi, Youyuan Zhang, Wenjie Ma, Zenan Li, Zhaolei Zhang, Xujie Si, Kaiyu Yang

机构 * Apodex University of Toronto(多伦多大学) UC Berkeley(加州大学伯克利分校) ETH Zürich(苏黎世联邦理工学院) Meta FAIR

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Euclid-Omni统一神经符号框架,结合形式几何系统与LLMs、VLMs,核心为符号几何求解器Euclidea,生成合成数据训练模型,在竞赛级几何问题上性能优异且成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10813 2026-08-18 cs.AI cs.GT 版本更新 57%

The Fragility of Strategic Thinking in Large Language Models

大型语言模型战略思维的脆弱性

Enric Junque de Fortuny, Veronica Roberta Cappelli

机构 * IESE(IESE商学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究开发框架拆解博弈中信念形成等环节,发现前沿LLMs的战略思维存在但具脆弱性,随复杂性提升会出现逻辑转变与启发式规则,警示其作为战略主体应用需谨慎。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16326 2026-08-18 cs.MA 新提交 50%

KC-BFPRL: Knowledge-Guided Multi-UAV Collaboration for Grassland Restoration via Bilevel Formerpointer-Based Reinforcement Learning

KC-BFPRL:基于知识引导的多无人机草原修复协作方法——通过 bilevel Formerpointer 强化学习实现

Dongbin Jiao, Xianyi Wang, Yuchen Yuan, Weibo Yang, Peng Yang, Peng Zhao, Zhanhuan Shang, Shi Yan

专题命中 逻辑推理 :planning(abstract)

AI总结 KC-BFPRL 是一种知识引导的 bilevel Formerpointer 强化学习框架,可解决多无人机草原修复的 RAMP 问题,性能优于现有方法,适用于大规模自动化生态修复。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划推理 47 篇

2608.15600 2026-08-18 cs.AI 新提交 83%

VARM-Bench: Benchmarking Verifiable Structured Reasoning in Chinese Abusive Speech Moderation

VARM-Bench:中文辱骂内容审核中可验证的结构化推理基准测试

Mingyu Yuan, Shengtao Wen, Lingbing Guo, Zhen Bi, Xiang Chen

机构 * NUAA(南京航空航天大学)

专题命中 规划推理 :reasoning(title);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 针对中文辱骂内容审核缺乏可验证决策依据的问题,提出VARM-Bench基准,通过确定性协议评估模型,发现标签级性能可能掩盖记录错误,提供可审计的评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22983 2026-08-18 cs.RO 版本更新 82%

Embodied Robot Manipulation in the Era of Foundation Models: Planning and Learning Perspectives

基础模型时代中的具身机器人操作:规划与学习视角

Shuanghao Bai, Wenxuan Song, Jiayi Chen, Yuheng Ji, Zhide Zhong, Jin Yang, Han Zhao, Wanqi Zhou, Zhe Li, Pengxiang Ding, Cheng Chi, Chang Xu, Xiaolong Zheng, Donglin Wang, Haoang Li, Shanghang Zhang, Badong Chen

机构 * Xi’an Jiaotong Univeristy(西安交通大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Chinese Academy of Sciences(中国科学院) Westlake University(西湖大学) Zhejiang University(浙江大学) University of Sydney(悉尼大学) BAAI(百度人工智能研究院) Peking University(北京大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 本文探讨了基础模型时代机器人操作的规划与学习方法,分析了高层推理与低层控制的统一框架,并提出了未来研究方向。

Comments This work is a re-architected core derived from the full survey ( arXiv:2510.10903 (https://arxiv.org/abs/2510.10903) ), refined to highlight the most central themes and representative studies

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28850 2026-08-18 cs.LG q-fin.CP 版本更新 81%

Representation Signatures and Risk-Feedback Alignment in LLM Trading Agents

表示签名与LLM交易智能体中的风险反馈对齐

Weicheng Xue

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 规划推理 :CoT(abstract,abstract_cn);reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 通过TradeArena测试平台研究LLM交易智能体在金融决策中的行为对齐与表示动态,发现故障前表示签名(规划嵌入漂移、流形有效秩收缩)并验证风险反馈作为外部对齐信号的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11399 2026-08-18 cs.CV cs.CL 版本更新 79%

Lost in Adaptation: Layer-Selective Recovery of Temporal Reasoning in Video-Language Models

层次间推理:通过层选择性融合恢复视频-语言模型中的时间推理

Zihang Fu, Haonan Wang, Jian Kang, Kenji Kawaguchi, Jiaying Wu

机构 * National University of Singapore(新加坡国立大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出MERIT框架,通过层选择性融合提升视频-语言模型的时间推理能力,同时保持时间感知能力,优于全模型融合和随机层选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15491 2026-08-18 cs.SE 新提交 78%

HxAgent: Iterative Agent Planning for End-to-End Web Application Testing

HxAgent:用于端到端Web应用测试的迭代智能体规划方法

Tu Nguyen, Duy Cao, Viet Nguyen, Phu Nguyen, Vy Le, Nguyen TK Nguyen, Tien N. Nguyen, Vu Nguyen

专题命中 规划推理 :planning(title,abstract)

AI总结 HxAgent是一种基于LLM的迭代规划智能体,通过主动修正策略结合多类信息优化Web测试,在MiniWoB++、350项Web任务及OnlineMind2Web数据集上均优于WALT模型,表现优异。

Comments Under review for a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15191 2026-08-18 cs.IR 新提交 78%

When Deep Research Agents Stagnate: Enhancing Reasoning with Retrieval-Aware Agent Control

当深度研究智能体停滞时:用检索感知智能体控制器增强推理能力

Heydar Soudani, Elizabeth Lingg, Faegheh Hasibi, Navid Rekabsaz

专题命中 规划推理 :reasoning(title,abstract)

AI总结 该研究针对深度研究智能体的推理停滞问题,提出检索感知智能体控制器(RAAC),经实验验证可减少搜索调用次数、提升智能体的召回率与准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15118 2026-08-18 cs.DC 新提交 78%

Collective Communication for Distributed LLM Systems: Planning, Runtime Adaptation, and Computation Coordination

分布式大语言模型系统的集体通信:规划、运行时适配与计算协调

Xuebin Song (1, 2), Menghao Zhang (1, 2), Yuezheng Liu (1), Jinyi Xia (1), Shucan Yang (1), Xiaohe Hu (3), Chunming Hu (1), Mingwei Xu (2) ((1) School of Software, Beihang University, Beijing, China, (2) State Key Laboratory of Internet Architecture, Tsinghua University, Beijing, China, (3) Infrawaves, Beijing, China)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出以集体为中心的分类法,将分布式LLM系统集体通信进展分为规划、执行适配、计算通信协调三层,探讨相关开放挑战与未来机遇。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25056 2026-08-18 cs.RO 版本更新 78%

Hybrid Artificial Potential Fields and Spatio-Temporal Transformers for Real-Time AUV Path Planning

用于实时 AUV 路径规划的混合人工势场与时空变压器

Khadija Rais, Abdelmadjid Benmachiche, Imene Soualmia

机构 * Echahid Cheikh Larbi Tebessi University(艾哈西德·谢赫·拉尔比·泰贝西大学) Chadli Bendjedid University(查德利·本杰迪德大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 研究 AUV 在复杂水下环境的路径规划,比较 13 种算法,提出混合人工势场与时空变压器的方法。该方法性能平衡,平均路径短、碰撞率低、计算高效,优于其他算法,为实时 AUV 导航提供强大解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02917 2026-08-18 cs.RO 版本更新 78%

Language-Guided Generation for Personalized Inspection Planning

语言引导的个性化巡检规划生成

Xingpeng Sun, Zherong Pan, Xifeng Gao, Kui Wu, Aniket Bera

机构 * Faculty of Electrical Engineering, Mathematics and Computer Science, University of Twente(代尔夫特理工大学电子工程、数学和计算机科学学院) Department of Electrical Engineering, Wright State University(电气工程系,怀特州立大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 该研究提出一种无训练的VLM引导方法,针对已知场景高效生成符合文本指令的巡检轨迹,可应用于多领域,经多环境验证效果良好。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02148 2026-08-18 cs.IR cs.CL cs.CV 版本更新 77%

Douyin Multimodal Embedding Model Technical Report

抖音多模态嵌入模型技术报告

Haonan Chen, Chu Li, Zhicheng Wang, Yuanwei Liu, Yuanjiang Wang, Shaohua Jiang, Zhicheng Dou

专题命中 规划推理 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 针对现有多模态嵌入模型难以兼顾效率与细粒度区分的问题,提出分两阶段训练的DME模型,在MMEB-v2数据集及抖音生产场景中均取得优异效果。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16663 2026-08-18 cs.DB cs.AI 新提交 74%

Bounded Semantic Planning and Deterministic Compilation for Reliable Enterprise Text-to-SQL

用于可靠企业级文本到SQL的有界语义规划与确定性编译

Yi Ai

专题命中 规划推理 :planning(title);分类 cs.AI

AI总结 提出语义路径编译(SPC)系统,在ACME保险基准测试中,其文本到SQL任务正确率达97.4%,显著优于基线系统,且鲁棒性更强。

Comments 10 sections, 2 figures, 6 tables. Preprint. Code and research artifacts are described in the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16806 2026-08-18 cs.RO cs.AI 新提交 70%

When State Becomes an Attack Surface: State-Semantic Injection in LLM-Driven Embodied Agents

当状态成为攻击面:大语言模型驱动的具身智能体中的状态语义注入

Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao, Chi Guo, Keyan Guo, Hongxin Hu

机构 * Wuhan University(武汉大学) University at Buffalo(布法罗大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 该文聚焦LLM驱动的具身智能体,梳理其技术演进与现有模型,指出其需结合多类信息完成任务落地后执行,为后续状态语义注入攻击研究奠定基础。

Comments submitted to USENIX Security 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15703 2026-08-18 cs.AI 新提交 70%

HyMem: Hierarchical Context Management for Long-Horizon Agents via Information Isolation

HyMem:基于信息隔离的长程智能体分层上下文管理

XinQi Wang, Jinwei Xiao, Sijia Cui, Hongming Zhang, Yanna Wang, Qingyang Zhang, Bo Xu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Nanjing Artificial Intelligence Research of IA(IA南京人工智能研究院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 针对LLM智能体长程任务上下文杂乱导致推理性能下降的问题,提出分层上下文管理框架HyMem,通过功能分层隔离推理与规划,在GAIA、Browsecomp-plus数据集上取得优于基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14587 2026-08-18 cs.AI 新提交 70%

An Agentic Framework Using Rules and LLMs for Embedding and Annotating Descriptive Document Layouts: A Plant Science Use Case

一种结合规则与大语言模型(LLM)的智能体框架,用于描述性文档布局的嵌入与标注:植物科学应用案例

Nicolas Turenne, Youcef Sklab, Eric Chenin, Jean-Daniel Zucker

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本研究提出结合规则与LLM的智能体框架,用于植物性状提取,在三个区域植物数据集上实现高效标注,提升了性状覆盖度与标注量,验证了其稳健性与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14586 2026-08-18 cs.DC cs.AI 新提交 70%

Efficient Block-Layer Parallel Inference for Vision-Language-Action on Hybrid Architectures

面向混合架构的视觉-语言-动作(VLA)高效块级并行推理

Haibo HU, Lianming Huang, Qiao Li, Nan Guan, Chun Jason Xue

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 该研究针对VLA模型部署于车载平台的延迟与内存压力问题,提出混合CPU-GPU推理框架,通过块级划分实现资源调度,在Bench2Drive数据集及实车部署中均取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17006 2026-08-18 cs.AI 版本更新 70%

Budget-Aware Tool Use Enables Effective Agent Scaling

预算感知的工具使用实现有效的代理扩展

Tengxiao Liu, Zifeng Wang, Jin Miao, I-Hung Hsu, Jun Yan, Jiefeng Chen, Rujun Han, Fangyuan Xu, Yanfei Chen, Ke Jiang, Samira Daruki, Yi Liang, William Yang Wang, Tomas Pfister, Chen-Yu Lee

机构 * Google Cloud AI Research(谷歌云人工智能研究) Google DeepMind(谷歌DeepMind) New York University(纽约大学) UC Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本研究提出BATS框架,通过预算感知机制提升工具增强代理的扩展效率,实现更优的成本-性能平衡。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16794 2026-08-18 cs.RO cs.AI cs.CL 新提交 62%

Neurosymbolic Embodied Agents

神经符号具身智能体

Mohammad Albinhassan, Yuming Feng, Alessandra Russo, Pranava Madhyastha

机构 * Imperial College London(帝国理工学院) Johns Hopkins University(约翰斯·霍普金斯大学) City, University of London(伦敦城市大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出一种神经符号具身智能体,将长周期家庭任务分解为视觉探索与符号规划,在VirtualHome、ALFWorld基准测试中表现优异,约束与搜索结合可大幅提升任务解决率,且无需专门训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15459 2026-08-18 cs.LG cs.AI 新提交 62%

Not All Attention Is Equal: A Quantitative Survey of the EEI Trade-off

并非所有注意力都平等:EEI权衡的定量综述

Aditya Singh

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本综述围绕注意力机制的效率-表达性-可解释性权衡,定量对比21种方法,梳理其多领域发展脉络,分析研究缺口并指明未来方向,支持粗粒度层级对比。

Comments 53 pages, 8 figures, 16 tables. Code and analysis artifacts: this https URL (https://github.com/Nixon-H/not-all-attention-is-equal)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15424 2026-08-18 cs.MA cs.AI cs.LG 新提交 62%

ETHOS: Towards a Modular Ethics Framework for Clinical Multi-Agent Systems

ETHOS:面向临床多智能体系统的模块化伦理框架

Rakesh Sharma, Sydney Pugh, Cameron Beeche, Pankhuri Singhal, Rachel Wu, Margaret Eby, Jeffrey Duda, James Gee, Kyra O'Brien, Hersh Sagreiya, Marina Serper, Victoria Gershuni, Angela Bradbury, Anurag Verma, Eric Eaton, Kevin B. Johnson, Walter Witschey

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ETHOS是可与现有临床多智能体系统集成的模块化伦理框架,通过分层治理提升决策可靠性,将AI伦理原则转化为可部署的安全保障。

Comments Preprint of an article submitted for consideration in Pacific Symposium on Biocomputing \textcopyright\ 2027 World Scientific Publishing Company. \url{ this https URL (https://psb.stanford.edu/) }

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14660 2026-08-18 cs.LG cs.AI cs.CY 新提交 62%

Ring-based Spatial Transformer: Learning Non-linear Spatial Interactions between Building Distribution and Pedestrian Flow

基于环的空间Transformer:学习建筑分布与行人流量之间的非线性空间相互作用

Shun Nakayama, Takahiro Kanamori, Wanglin Yan

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出基于环的SpatialTransformer模型,利用东京100个火车站的环缓冲区数据学习建筑分布与行人流量的非线性空间相互作用,其预测准确率优于GWR,挑战了紧凑城市假设,为城市规划提供了新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06008 2026-08-18 cs.AI cs.CL 版本更新 62%

PolyWorkBench: Benchmarking LLM Agents for Cross-Lingual Long-Horizon Workflows

PolyWorkBench:多语言长视野语言模型智能体基准测试

Hongliang Li, Yijin Liu, Zhiwei Zhang, Zihe Liu, Xinyue Lou, Jinan Xu, Fandong Meng, Kaiyu Huang

机构 * Beijing Jiaotong University(北京交通大学) Weixin AI, Tencent Inc(腾讯微云人工智能实验室)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 研究多语言长视野工作流程中LLM智能体的表现,提出PolyWorkBench基准测试及结合多种评估方式的混合框架,发现最先进LLM智能体在多语言设置中性能降,强调联合建模语言变化和程序决策对智能体评估的重要性。

Comments 17 Pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25459 2026-08-18 cs.CL cs.LG 版本更新 62%

SimulRAG: Simulator-based RAG for Grounding LLMs in Long-form Scientific QA

SimulRAG:基于模拟器的检索增强生成(RAG)框架,用于将大型语言模型(LLMs)落地到长篇科学问答任务中

Haozhou Xu, Dongxia Wu, Matteo Chinazzi, Ruijia Niu, Rose Yu, Yi-An Ma

机构 * University of California San Diego(加州大学圣迭戈分校) Stanford University(斯坦福大学) Northeastern University(东北大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.LG

AI总结 针对LLMs在长篇科学问答中易幻觉的问题,本文提出SimulRAG框架,引入UE+SBA机制,发布相关基准,实验表明其信息量与事实性较基线分别提升30.4%、16.3%

Comments Haozhou Xu and Dongxia Wu are co-first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16710 2026-08-18 cs.LG 新提交 57%

The Ethical Decision Head: Operationalizing Normative Ethics in Autonomous Vehicles via Reinforcement Learning from Human Feedback

伦理决策头:基于人类反馈的强化学习在自动驾驶中实现规范伦理

Thomas Mbrice, Ammar Ali, Sami Mian, Khai Hern Low, Eric Chen, Arshia Aghajani, Wolf Schäfer, Amin Shirangi

机构 * Stony Brook University(石溪大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出伦理决策头(EDH)框架,结合PPO与人类偏好奖励模型,在CARLA仿真中训练自动驾驶智能体,发现人类对自动驾驶伦理的理论规定与实践奖励存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16447 2026-08-18 cs.AI cs.RO 新提交 57%

HaReCAP: Habitual-action Grounding for Recursive Large Language Model Agents

HaReCAP:面向递归大语言模型智能体的习惯性动作 grounding 方法

Shen Liu, Zhenguo Xu, Shaopu Wang, Yike Gao, Chunlei Wang

机构 * North China Institute of Computer System Engineering(华北计算机系统工程研究所) University of Science and Technology of China(中国科学技术大学) China Information Security Research Institute Co., Ltd.(中国信息安全研究院有限公司)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 HaReCAP 是针对 ReCAP 的低侵入性扩展,通过编译叶子反射规则减少长视距具身任务中 LLM 的重复调用,在 Robotouille 和 ALFWorld 上显著降低了 token 消耗。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏