arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-30 至 2026-06-30 共收录 223 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 12 篇

2603.06638 2026-06-30 cs.LG cs.AI 81%

HEARTS: Benchmarking LLM Reasoning on Health Time Series

HEARTS:基于健康时间序列的LLM推理基准测试

Sirui Li, Shuhan Xiao, Mihir Joshi, Ahmed Metwally, Daniel McDuff, Wei Wang, Yuzhe Yang

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 HEARTS是一个统一的基准测试,用于评估LLM在一般健康时间序列上的分层推理能力,包含16个真实世界数据集和110个任务,揭示了LLM在多步时间推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30247 2026-06-30 cs.CL 80%

Grounding LLM Reasoning under Incomplete Graph Evidence

在不完全图证据下 grounding LLM 推理

Jiaqi Li, Fanghui Song

机构 * Tianjin Normal University, College of Computer and Information Engineering(天津师范大学计算机与信息工程学院) Harbin Institute of Technology, School of Mathematics(哈尔滨工业大学数学学院)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出在不完全知识图谱证据下,通过KL正则化变形LLM先验实现软grounding,并给出稳定性界限,适用于GraphRAG、KGQA等场景。

Comments A theoretical perspective about Grounding LLM Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01472 2026-06-30 cs.RO 78%

AERMANI-VLM: Structured Prompting and Reasoning for Aerial Manipulation with Vision Language Models

AERMANI-VLM:基于视觉语言模型的空中 manipulation 的结构提示与推理

Sarthak Mishra, Rishabh Dev Yadav, Avirup Das, Saksham Gupta, Wei Pan, Spandan Roy

机构 * Robotics Research Center, IIIT Hyderabad(IIIT海得拉巴机器人研究中心) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Newcastle University(纽卡斯尔大学)

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本文提出AERMANI-VLM框架,通过分离高层推理与低层控制,利用结构化提示生成自然语言推理轨迹,实现安全可靠的空中 manipulation 任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25013 2026-06-30 cs.CL cs.AI cs.LG 67%

Emergence of Minimal Circuits for Indirect Object Identification in Attention-Only Transformers

注意力-only变换器中间接对象识别最小电路的涌现

Rabin Adhikari

机构 * Saarland University(萨尔大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过从头训练小型注意力-only变换器,在符号化的间接对象识别任务中发现,单层模型仅需两个注意力头即可实现完美准确率,揭示了任务特定训练如何诱导可解释的最小电路。

Comments Published at ACL (Volume 4: Student Research Workshop) ISBN: 979-8-89176-393-7 URL: https://aclanthology.org/2026.acl-srw.4

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29563 2026-06-30 cs.CL cs.AI 62%

Coverage-Driven KV Cache Eviction for Efficient and Improved Inference of LLM

覆盖驱动的KV缓存淘汰策略用于高效且改进的大语言模型推理

Shuvendu Roy, Mengyao Zhai, Hossein Hajimirsadeghi, Golnoosh Samei

机构 * RBC Borealis(RBC 培生)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型推理中KV缓存内存开销大、现有淘汰策略导致长上下文任务性能下降的问题,提出覆盖感知的K-VEC策略,通过跨头跨层覆盖模块提升token保留,在LongBench上最高提升10.35点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29799 2026-06-30 cs.AI 57%

The CRISTAL Method: Neurosymbolic analysis from AI-synthesized world models

CRISTAL方法:来自AI合成世界模型的神经符号分析

Rafael Kaufmann, Felix Neubürger, Michael Walters, Thomas Kopinski, Dimitrije Marković

机构 * GAIA Lab(GAIA实验室) South Westphalia University of Applied Sciences(西南弗里西亚应用科学大学) Technical University Dresden(德累斯顿技术大学) Primordia Co.(Primordia公司)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 提出CRISTAL神经符号框架,通过贝叶斯推理、主动学习和持续学习自动化复杂分析,在合成股票分类任务中仅用5个样本和5秒达到贝叶斯最优精度,远超LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01173 2026-06-30 cs.CV 50%

EEmo-Logic: A Unified Dataset and Multi-Stage Framework for Comprehensive Image-Evoked Emotion Assessment

EEmo-Logic:面向全面图像诱发情感评估的统一数据集与多阶段框架

Lancheng Gao, Ziheng Jia, Zixuan Xing, Wei Sun, Huiyu Duan, Guangtao Zhai, Xiongkuo Min

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出最大图像诱发情感理解数据集EEmoDB和统一多模态大语言模型EEmo-Logic,通过指令微调和任务定制GRPO实现细粒度情感问答与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02097 2026-06-30 cs.IR 50%

The Future is Agentic: Definitions, Perspectives, and Open Challenges of Multi-Agent Recommender Systems

未来是代理的:多代理推荐系统定义、视角和开放挑战

Reza Yousefi Maragheh, Yashar Deldjoo

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文探讨多代理推荐系统从被动生成到主动规划的转变,提出基于状态代理的框架,分析其在提升推荐效果中的作用,并通过实验验证代理系统在不同场景下的有效性。

Comments Added controlled experiments to illustrate the points of the paper. Also edited for more clarity in conveying the concepts

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划推理 47 篇

2606.29399 2026-06-30 cs.AI 88%

LLM-Guided Planning for Multi-hop Reasoning over Multimodal Nuclear Regulatory Documents

LLM引导的规划:多模态核监管文档的多跳推理

Mingyu Jeon, Bokyeong Kim, Suwan Cho, Jae Young Suh, Yonggyun Yu

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

AI总结 提出LLM引导的规划方法,通过动态知识图谱状态和文档树工具,在多跳推理任务中实现81.5%准确率,显著优于无状态规划方法。

Comments Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond @ ICML 2026. 8 pages (main), 3 figures, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28357 2026-06-30 cs.IR cs.AI 87%

ReasonRec: A Reasoning-Augmented Multimodal Agent for Unified Recommendation

ReasonRec: 一种用于统一推荐的推理增强多模态智能体

Yihua Zhang, Mingfu Liang, Jiyan Yang, Rong Jin, Wen-Yen Chen, Yiping Han, Huayu Li, Buyun Zhang, Liang Luo, Frank Shyu, Luke Simon, Sijia Liu, Tianlong Chen, Xi Liu

机构 * Meta AI Michigan State University(密歇根州立大学) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 规划推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);planning(abstract);分类 cs.AI

AI总结 提出ReasonRec,一种基于三阶段显式推理管道的多模态推荐智能体,通过推理感知视觉指令调优、证据-视野课程学习和不确定性引导委派机制,在五个数据集上实现排名指标相对提升超30%,推理延迟降低35%。

Comments The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10342 2026-06-30 cs.CV 85%

CoSPlan: Corrective Sequential Planning via Scene Graph Incremental Updates

CoSPlan: 通过场景图增量更新实现纠正式序列规划

Shresth Grover, Priyank Pathak, Akash Kumar, Yogesh S Rawat

机构 * UCF Institute of Artificial Intelligence, University of Central Florida (UCF)(中佛罗里达大学(UCF)人工智能研究所)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract)

AI总结 CoSPlan基准测试要求视觉语言模型在初始场景到目标场景间规划视觉动作序列,通过引入错误动作检测与纠正机制,评估模型在复杂视觉任务中的能力。

Comments The 19th European Conference on Computer Vision (ECCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30639 2026-06-30 cs.AI cs.CL 84%

Self-Evolving World Models for LLM Agent Planning

面向LLM智能体规划的自我进化世界模型

Xuan Zhang, Wenxuan Zhang, See-Kiong Ng, Yang Deng

机构 * National University of Singapore(国立新加坡大学) Singapore University of Technology and Design(新加坡科技设计大学) Singapore Management University(新加坡管理学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出WorldEvolver框架,通过情景记忆、语义记忆和选择性预见三个模块在测试时修正世界模型,提升预测准确性和下游规划成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02734 2026-06-30 cs.AI cs.CL 84%

CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents

CostBench:评估LLM工具使用代理在动态环境中的多轮成本最优规划与适应

Jiayu Liu, Cheng Qian, Zhaochen Su, Qing Zong, Shijue Huang, Bingxiang He, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CostBench,一个以成本为中心的可扩展基准,用于评估LLM代理在动态环境中的经济推理和重新规划能力,揭示现有模型在成本感知规划方面的显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29648 2026-06-30 cs.CL cs.AI cs.LG cs.MA 82%

Hybrid Retriever Evolution for Multimodal Document Reasoning Agents

混合检索器演化:面向多模态文档推理代理

Bohan Yao, Shruthan Radhakrishna, Vikas Yadav

机构 * ServiceNow University of Washington(华盛顿大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出失败驱动的演化框架,让元代理自动学习任务代理如何协调多种检索器进行多步文档问答,实现自适应检索路由,在MMLongBench-Doc和DocBench上提升高达19.6分。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28971 2026-06-30 cs.CV 82%

Self-Evolving Agentic Image Restoration via Deliberate Planning and Intuitive Execution

自进化智能体图像恢复:通过深思熟虑的规划与直觉执行

Shuang Cui, Fan Ji, Guanglong Sun, Yufei Guo, Xiongxin Tang, Jiangmeng Li, Fanjiang Xu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Life Sciences, Tsinghua University(清华大学生命科学学院) Intelligent Science & Technology Academy of CASIC(中国科学院 CASIC 智能科学与技术学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 提出SEAR框架,将图像恢复建模为序列决策问题,采用直觉执行器与深思熟虑规划器,结合剪枝感知蒙特卡洛树搜索和自进化情景记忆,解决贪婪搜索和信息利用不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29639 2026-06-30 cs.CL cs.AI 81%

Two-Stage Prompt Optimization for Few-Shot Relation Extraction: From Reasoning-Guided Search to Gradient-Guided Refinement

两阶段提示优化用于少样本关系抽取:从推理引导搜索到梯度引导精炼

Aunabil Chakma, Mihai Surdeanu, Eduardo Blanco

机构 * University of Arizona(亚利桑那大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出两阶段框架,结合推理和梯度优化自动优化提示,在少样本关系抽取任务中取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29150 2026-06-30 cs.AI 79%

Flow Reasoning Models: Scaling Reasoning Through Iterative Self-Refinement

流推理模型:通过迭代自我精炼扩展推理能力

Alec Helbling, Andrey Bryutkin, Mauro Martino, Nima Dehmamy, Hendrik Strobelt

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出流推理模型(FRMs),利用去噪动态的稳定性作为验证器,通过测试时缩放和训练改进,高效解决数独和斑马谜题等结构化推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28751 2026-06-30 cs.LG cond-mat.stat-mech 79%

A Path-Space Formulation of Prediction in World Models: From a Single Action to Prediction, Planning, and Irreversibility

世界模型中预测的路径空间表述:从单一动作到预测、规划和不可逆性

Gunn Kim

机构 * Department of Physics, Sejong University, Seoul 05006, Republic of Korea(首尔大学物理系,首尔05006,韩国)

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 提出世界模型中预测的路径空间表述,将预测、规划和不确定性统一为作用泛函上的操作,并发现注意力不对称性编码了数据的不可逆性。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28692 2026-06-30 cs.AI 79%

An AI agent for treatment reasoning over a biomedical tool universe

一个在生物医学工具宇宙中进行治疗推理的AI智能体

Shanghua Gao, Ayush Noori, Richard Zhu, Curtis Ginder, Zhenglun Kong, Xiaorui Su, Justin Kauffman, Benjamin S. Glicksberg, Joshua Lampert, Ankit Sakhuja, Ashwin Sawant, ATHENA-R1 Evaluation Consortium, David A. Clifton, Noa Dagan, Ran Balicer, Marinka Zitnik

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Department of Engineering Science, University of Oxford(牛津大学工程科学系) The Ivan and Francesca Berkowitz Family Living Laboratory Collaboration at Harvard Medical School and Clalit Research Institute(哈佛医学院伊万和弗朗西斯卡·伯科维茨家族生活实验室合作与克莱利研究所) Cardiovascular Division, Department of Medicine, Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院心脏病学部,布里格姆和妇女医院) The Windreich Department of Artificial Intelligence and Human Health, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院人工智能与人类健康系) The Hasso Plattner Institute for Digital Health at Mount Sinai, Icahn School of Medicine at Mount Sinai and Mount Sinai Health System(西奈山伊坎医学院和西奈山医疗系统数字健康研究所) Mindich Child Health and Development Institute and the Departments of Pediatrics and Genetics & Genomic Sciences, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院Mindich儿童健康与发展研究所及儿科学和遗传学与基因组科学系) Mount Sinai Fuster Heart Hospital, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院Fuster心脏医院) Mount Sinai AI Assurance Lab, Mount Sinai Health System(西奈山医疗系统AI保证实验室) Institute for Critical Care Medicine, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院重症监护医学研究所) Department of Medicine, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院医学系) ATHENA-R1 Evaluation Group(ATHENA-R1评估组)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出ATHENA-R1智能体,通过强化学习在212种生物医学工具上训练,实现迭代证据收集的治疗推理,在多个基准上超越现有模型,准确率达94.7%。

Comments Project page: https://athena.openscientist.ai Code: https://github.com/mims-harvard/ATHENA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30613 2026-06-30 cs.RO 78%

Sequential Planning via Anchored Robotic Keypoints

基于锚定机器人关键点的顺序规划

Bryce Grant, Aryeh Rothenberg, Logan Senning, Zonghe Chua, Zach Patterson, Peng Wang

机构 * Department of Electrical, Computer, and Systems Engineering(电气、计算机与系统工程系) Department of Mechanical and Aerospace Engineering(机械与航空航天工程系)

专题命中 规划推理 :planning(title,abstract)

AI总结 提出SPARK,一种无训练神经符号操作系统,通过单一Gemini调用生成类型化行为树,结合SAM3的替代提示检测和恢复循环,在LIBERO-PRO上达到43.7%,超越CaP-Agent0和VLA基线。

Comments 29 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28981 2026-06-30 cs.CY 78%

Bad company corrupts good morals: Understanding and Measuring Narrative-Induced Moral Reasoning Degradation in LLMs

坏公司败坏好道德:理解与衡量叙事引发的LLM道德推理退化

Wanying Yu, Boyang Ma, Zhibo Eric Sun, Minghui Xu, Yue Zhang

专题命中 规划推理 :reasoning(title,abstract)

AI总结 本研究提出BreakingBad框架,系统衡量负面叙事沉浸对LLM道德推理、行为及部署风险的影响,发现叙事暴露导致道德准确率下降12%-31%,且退化具有结构性,第一人称叙事影响更强,并传播至实际部署场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28566 2026-06-30 cs.IR 78%

R$^2$-Searcher: Calibrating Retrieval and Reasoning Boundaries for Agentic Search

R$^2$-Searcher:校准智能搜索中的检索与推理边界

Sheng Zhang, Junyi Li, Wenlin Zhang, Xiaowei Qian, Yichao Wang, Yingyi Zhang, Maolin Wang, Yong Liu, Xiangyu Zhao

专题命中 规划推理 :reasoning(title,abstract)

AI总结 提出R$^2$-Searcher框架,通过细粒度查询令牌引导的证据建模和检索后反思,校准检索与推理边界,在多跳问答基准上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09620 2026-06-30 cs.RO cs.SY eess.SY 新提交 78%

Motion planning for hundreds of floating robots

数百个浮动机器人的运动规划

Jan Kamm, Antonio Terpin, Raffaello D'Andrea, Aswin Ramachandran

机构 * Institute for Dynamic Systems and Control, ETH Zürich(苏黎世联邦理工学院动态系统与控制研究所)

专题命中 规划推理 :planning(title,abstract)

AI总结 针对大型浮动机器人编队的无碰撞运动规划问题,提出一种可扩展的流水线方法,通过碰撞图分解为独立子问题并行求解,在500个机器人仿真和实际演示中验证了有效性。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07913 2026-06-30 cs.RO quant-ph 78%

Multi-Agent Route Planning as a QUBO Problem

多智能体路径规划作为QUBO问题

Renáta Rusnáková, Martin Chovanec, Juraj Gazda

机构 * Department of Computers and Informatics, Faculty of Electrical Engineering and Informatics, Technical University of Košice(科希策技术大学电气工程与信息学院计算机与信息学系)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文将多智能体路径规划问题建模为QUBO问题,通过证明其NP难性并推导出编码路线效用奖励和配对重叠惩罚的二次无约束二进制优化公式,探讨了覆盖与重叠的权衡策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30627 2026-06-30 cs.LG cs.AI stat.ML 76%

Pessimism's Paradox: Conservative Offline Training Amplifies Reward Hacking During Online Adaptation in Reasoning Models

悲观的悖论:保守离线训练加剧推理模型在线适应中的奖励黑客行为

Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary

机构 * Horizon Research Apple Meta

专题命中 规划推理 :reasoning(title);分类 cs.AI、cs.LG

AI总结 研究发现,离线训练中越保守的DPO(高β)会压缩策略熵,降低响应多样性,反而加速在线优化中奖励模型的利用,导致更严重的奖励黑客行为。

Comments Accepted in ICML 2026 workshop on Decision-Making from Offline Datasets to Online Adaptation: Black-Box Optimization to Reinforcement Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03305 2026-06-30 cs.CL cs.AI cs.LG 75%

The Hidden Cost of Structured Generation in LLMs: Draft-Conditioned Constrained Decoding

结构生成在大语言模型中的隐性成本:草案条件约束解码

Avinash Reddy, Thayne T. Walker, James S. Ide, Amrit Singh Bedi

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DCCD方法,通过分步解码提升结构生成的准确性与效率,实验显示在结构推理基准中,DCCD在严格结构准确性上提升了24个百分点,且在参数效率上优于传统约束解码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29194 2026-06-30 cs.AI 74%

AI Trading's Alpha Singularity: Emergent Market Reasoning through Agent-to-Agent Self-Evolution

AI交易的阿尔法奇点:通过智能体间自我进化实现涌现性市场推理

Yuqi Li, Siyuan Liu, Bingjun Liu

专题命中 规划推理 :reasoning(title);分类 cs.AI

AI总结 提出密封联合搜索(SJS)框架,通过信息流结构条件防止过拟合,并基于Agora系统在CSI 1000上实现夏普比率+1.87,验证了评分函数与搜索联合优化的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05257 2026-06-30 cs.CL cs.AI 73%

Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions

通过增量多轮交互评估LLM代理的记忆能力

Yuanzhe Hu, Yu Wang, Julian McAuley

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MemoryAgentBench,通过多轮交互模拟记忆代理的信息积累过程,评估准确检索、测试时学习、长程理解与选择性遗忘四项核心能力。

Comments Y. Hu and Y. Wang contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20334 2026-06-30 cs.RO cs.AI cs.LG 73%

Demonstration-Free Robotic Control via LLM Agents

无需演示的机器人控制 via LLM 代理

Brian Y. Tsui, Alan Y. Fang, Tiffany J. Hwu

机构 * independent researchers(独立研究人员)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FAEA框架,利用通用大语言模型实现无需演示的机器人操控,通过迭代推理生成操控策略,在多个基准测试中取得高成功率,展示了通用代理在任务规划中的有效性。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09038 2026-06-30 cs.AI 70%

SearchSkill: Teaching LLMs to Use Search Tools with Evolving Skill Banks

SearchSkill: 教授大语言模型使用搜索工具与演进技能库

Jinchao Hu, Meizhi Zhong, Kehai Chen, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区计算机科学与技术学院) TikTok Inc, Beijing(字节跳动北京公司)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 SearchSkill通过可重用的搜索技能显式规划查询,提升开放域问答中的检索效率和推理质量,改进了知识密集型问答基准的精确匹配表现。

详情

展开后加载摘要…

URL PDF HTML 收藏