Knowledge-Centric Self-Improvement
以知识为中心的自我改进
机构 * Caltech(加州理工学院)
专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 研究以知识为中心的自我改进范式,通过简单协议让智能体尝试任务后为知识库贡献见解并提炼知识,提高了解决率、降低成本,且知识可转移,表明进步可由持久知识驱动。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
以知识为中心的自我改进
机构 * Caltech(加州理工学院)
专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 研究以知识为中心的自我改进范式,通过简单协议让智能体尝试任务后为知识库贡献见解并提炼知识,提高了解决率、降低成本,且知识可转移,表明进步可由持久知识驱动。
迈向可靠的人工智能辅助模拟设计:用于逐次逼近寄存器型模数转换器生成的模板约束大语言模型智能体
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 规划决策 :planning(abstract);agentic(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 研究针对大语言模型在模拟电子设计自动化应用的瓶颈,提出端到端多步骤的ATLAS框架,利用专家知识结合模板约束生成,能生成成功通过仿真验证的SAR ADC,为集成LLMs到可靠模拟设计方法奠定基础。
一种基于混合采样的具有博弈论引导的自主赛车轨迹规划器
机构 * Professorship of Autonomous Vehicle Systems, TUM School of Engineering and Design, Technical University of Munich(慕尼黑工业大学工程与设计学院自动驾驶车辆系统教授组) ; Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑机器人与机器智能研究所)
专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract)
AI总结 针对自主赛车在多智能体场景下的规划问题,提出将博弈论推理集成到基于采样的运动规划器的混合架构,利用离线学习势函数和在线梯度优化生成交互参考路径,在模拟环境中验证该方法能诱导防御行为且无计算负担。
Comments Accepted to IEEE ITSC 2026
StructAgent:利用统一因果结构驾驭长时程数字智能体
机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校) ; Aether AI Lab(以太人工智能实验室)
专题命中 规划决策 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 研究针对长时程任务中智能体任务进展难解释、验证和恢复的问题,提出StructAgent框架,通过统一因果结构维护任务进展并规范工作流程,实验证明其能提升多种模型性能且具有通用性。
因果DS:数据科学智能体中的因果推理基准测试
机构 * Department of Statistics University of Michigan(统计学系密歇根大学)
专题命中 规划决策 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 介绍用于评估数据科学智能体因果推理的CausalDS基准,由含观测数据的结构因果模型和合成自然语言故事构成场景,导出跨越Pearl三个层级的任务,联合评估符号因果推理、数据科学等多方面能力。
Comments 55 pages, 10 figures
ChartWalker: 跨图表RAG任务的基准测试
专题命中 规划决策 :agent(abstract,abstract_cn);agentic(abstract)
AI总结 提出ChartWalker框架,通过层次化知识图谱和结构感知采样生成跨图表RAG基准,揭示现有方法性能差距。
MedRLM:用于长上下文临床推理、传感器引导筛查、证据支持决策及社区到三级转诊优化的递归多模态健康智能
机构 * School of Information, Computer ; Communication Technology Sirindhorn International Institute of Technology, Thammasat University Pathum Thani, Thailand 1
专题命中 规划决策 :planning(abstract);workflow(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出MedRLM递归多模态健康智能框架,通过递归检查、分解、检索、验证和合成患者信息,协调多个专业代理并引入临床证据图记忆,实现长上下文临床推理和传感器引导筛查。
Comments 9 pages, 3 figures, 3 tables, 1 Algorithm, 29 equations
InternVideo3: 用多模态上下文推理代理化基础模型
机构 * Shanghai Innovation Institute(上海创新研究院) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanjing University(南京大学)
专题命中 规划决策 :agent(abstract);tool use(abstract);agentic(abstract)
AI总结 提出InternVideo3框架,通过多模态上下文推理(MCR)和高效KV缓存压缩方法M^2LA,增强长视频理解与迭代交互能力,在多个基准上取得强性能。
先组织再检索:面向高效智能体的层次化记忆导航
机构 * Duke University(杜克大学) ; Snowflake AI Research(Snowflake AI研究)
专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出HORMA框架,通过构建文件系统式的层次化记忆结构并利用强化学习训练的轻量级导航代理,实现高效检索,在长时任务中提升性能并降低令牌消耗。
VoLo: 面向开放词汇长时程操控的物理编排器
机构 * NVIDIA(英伟达) ; University of Michigan(密歇根大学)
专题命中 规划决策 :agent(abstract);AI agent(abstract);planning(abstract)
AI总结 提出VoLoAgent,利用VLM将VLA/WAM作为可中断工具进行物理编排,实现开放词汇长时程操控,并在新基准RoboVoLo上显著优于现有系统。
通过知识图谱基础增强小型语言模型推理
机构 * Institute of Informatics and Telecommunications, National Center for Scientific Research “Demokritos(信息与电信研究所,国家科学研究中心“德谟克利特”)
专题命中 规划决策 :agentic(abstract,comments);agent(abstract);分类 cs.AI、cs.LG
AI总结 研究利用神经符号智能框架增强小型语言模型推理能力,通过特定工具调用转变模型,在两种场景下评估,发现虽提示提升性能,但受提取瓶颈等限制,还存在“干扰效应”,刻画了挑战并提供迭代验证路线图。
Comments Presented at the 2nd Causal Neuro-symbolic Artificial Intelligence (Causal NeSy): Toward Agentic LLMs with Neuro-Symbolic and Graph Based Reasoning Workshop @ ESWC2026
使用基于图的工具改进小语言模型中的分子性质预测
机构 * Institute of Informatics and Telecommunications, National Center for Scientific Research “Demokritos(信息与电信研究所,国家科学研究中心“德谟克利特”)
专题命中 规划决策 :agentic(abstract,comments);tool use(abstract);分类 cs.AI、cs.LG
AI总结 研究针对小语言模型在分子性质预测时的结构盲目性问题,提出模块化上下文增强提示框架,通过GNN专家模型和提取子图来辅助预测,在MUTAG和Tox21数据集上实验表明该方法能显著提升预测准确性,验证了基序相关性,但与专门GNN模型仍有差距。
Comments Presented at the 2nd Causal Neuro-symbolic Artificial Intelligence (Causal NeSy): Toward Agentic LLMs with Neuro-Symbolic and Graph Based Reasoning Workshop @ ESWC2026
用于可靠企业级文本到SQL的有界语义规划与确定性编译
专题命中 规划决策 :planning(title);分类 cs.AI
AI总结 提出语义路径编译(SPC)系统,在ACME保险基准测试中,其文本到SQL任务正确率达97.4%,显著优于基线系统,且鲁棒性更强。
Comments 10 sections, 2 figures, 6 tables. Preprint. Code and research artifacts are described in the manuscript
InFactPlanner:可持续地理分布式大语言模型(LLM)数据中心规划
专题命中 规划决策 :planning(title);分类 cs.AI
AI总结 InFactPlanner是用于LLM推理的可持续地理分布式数据中心部署假设分析的决策支持框架,可通过多维度建模分析得出可持续性与延迟最优选择存在差异等结论。
Comments Author copy of paper published at 34th International Symposium on the Modeling, Analysis, and Simulation of Computer and Telecommunication System (MASCOTS2026)
MERA:面向大规模智能体系统的技能适配型模型演化与路由
机构 * Gradient ; Soochow University(苏州大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Shanghai Jiao Tong University(上海交通大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 规划决策 :agentic(title);分类 cs.LG
AI总结 MERA以单模型调用为适应单元,通过多轮适配提升小模型能力,结合带验证器回退的成本校准路由,在HumanEval+MBPP、TAU-2等数据集上实现小模型性能提升与成本降低。
Comments Preliminary version in CAIS RL-Eval
SkillReason:面向隐式用户请求的推理增强型智能体技能检索
专题命中 规划决策 :agent(title);分类 cs.AI
AI总结 针对隐式用户请求的技能检索难题,提出两阶段框架SkillReason,结合推理增强训练,在SkillReason-Bench等三个基准上取得最优性能,缩小任务目标与技能能力的语义差距。
分层自改进:一种面向任务特定可进化智能体控制框架的方法
机构 * HKUST(香港科技大学)
专题命中 规划决策 :agent(title);分类 cs.AI
AI总结 本研究提出HSI框架,使冻结LLM的任务特定控制框架可进化,在中等难度任务上取得性能提升,超出模型能力时无增益,为改进冻结LLM智能体提供可行方向。
用于视觉-语言-动作模型长程规划的显式语言记忆
机构 * Fudan University(复旦大学)
专题命中 规划决策 :planning(title);分类 cs.AI
AI总结 该研究针对视觉-语言-动作模型长程规划的挑战,提出带显式语言记忆模块的分层架构,经仿真与实机实验验证,可提升复杂长程任务的成功率、鲁棒性与决策可解释性。
Comments 11 pages, 4 figures
PCSD:智能体强化学习中自蒸馏的持久一致性
专题命中 规划决策 :agentic(title);分类 cs.AI
AI总结 该研究针对智能体强化学习中奖励稀疏问题,提出PCSD方法,通过持久一致性推导蒸馏权重,结合GRPO优化,在ALFWorld等基准上取得优于GRPO、SDAR的性能。
ConnectED:面向越南教学课程规划与学生学习的课程对齐AI系统
专题命中 规划决策 :planning(title);分类 cs.AI
AI总结 该研究提出以人为本的AI系统ConnectED,基于VietEduQwen构建,支持越南教育完整教学生命周期,经评估其准确率优于基准模型,可缩短教师备课时间且获师生高满意度。
CodeSpec:面向智能体长周期功能开发的双可执行规范
专题命中 规划决策 :agentic(title);分类 cs.SE
AI总结 提出CodeSpec双可执行规范方法,通过配对子需求语义与仓库架构构建可靠功能链,在FeatureBench上优于基线,提升了长周期功能开发的设计与实现一致性及性能。
GuideSkill:面向基于指南的临床推理的可执行大语言模型智能体技能演化框架
专题命中 规划决策 :agent(title);分类 cs.AI
AI总结 本文提出与模型无关的GuideSkill框架,通过可执行技能结合指南流程与病例诊断模式,在多基准和骨干模型上显著提升临床推理性能,技能可靠且实用。
审计大语言模型智能体动作选择中的溯源敏感性
专题命中 规划决策 :agent(title);分类 cs.AI
AI总结 研究大语言模型智能体动作选择中的溯源敏感性,引入针对特定目标的授权审计,通过改变命题源权威等测试行为,发现可信和不可信变体在部分案例中产生不同动作,模型对线索有反应但不可信证据仍影响行动。
PlanE:基于抽取式大语言模型的数据、调优和推理的元规划
机构 * Ant Group(蚂蚁集团) ; School of Information Science and Engineering, East China University of Science and Technology(华东理工大学信息科学与工程学院)
专题命中 规划决策 :planning(title);分类 cs.AI
AI总结 针对大语言模型特定任务能力提升中数据标注成本高及缺乏优化方法的问题,提出PlanE框架,含数据分解等,引入DTI规划器,实验验证了该框架及规划器在不同场景下的有效性和通用性。
S3:通过约束分层强化学习中粗粒度动力学的不确定性进行稳定子目标选择
机构 * University of Massachusetts, Lowell(马萨诸塞大学洛厄尔分校)
专题命中 规划决策 :agent(abstract,comments);planning(abstract);分类 cs.LG;autonomous agent(comments)
AI总结 研究分层强化学习中高层智能体子目标选择问题,提出用粗粒度动力学提供动力学感知内在动机,通过最小化预测不确定性稳定高层策略,经实验验证该方法在非平稳长期环境中表现优于现有方法。
Comments Manuscript accepted to the Eighteenth Workshop on Adaptive and Learning Agents (ALA), at the 25th International Conference of Autonomous Agents and Multi Agent Systems 2026
TRACE:可审计的智能体承诺的操作推理模式
机构 * Stanford University(斯坦福大学) ; Quadrivium AI(四元数人工智能)
专题命中 规划决策 :agentic(title);分类 cs.AI
AI总结 本文提出TRACE模式用于记录推理轨迹,通过字段和测试应对推理不在语言模型中的问题,给出参考程序和操作规范,借助记录-消费者契约形成操作接口,通过示例展示应用,贡献了模式及其契约。
Comments 46 pages, 18 tables, 4 figures
FORGE:通过关键点轨迹推理实现功能工具使用的泛化
机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 规划决策 :tool-use(title);分类 cs.AI
AI总结 研究针对机器人功能工具使用泛化问题,提出FORGE两阶段策略,通过关键点轨迹推理解耦功能推理与动作执行,在七工具击打基准测试中,对未见工具表现优于现有方法,平均成功率显著提升。
Comments 15 pages, 8 figures, 6 tables
先思考再检索:通过战略规划与自我批评实现鲁棒的零样本组合图像检索
机构 * Department of Artificial Intelligence, Korea University(高丽大学人工智能系)
专题命中 规划决策 :planning(title);分类 cs.AI
AI总结 提出PEC-CIR框架,通过规划器-执行器-批评家多阶段推理流水线构建查询,在零样本组合图像检索中减少生成错误,提升检索精度。
上下文感知强化学习用于智能体与多模态大语言模型
机构 * Princeton University(普林斯顿大学) ; UC Davis(加州大学戴维斯分校)
专题命中 规划决策 :agentic(title);分类 cs.CL
AI总结 提出ContextRL方法,通过间接辅助目标(上下文选择奖励)增强大模型在长上下文和多模态任务中的细粒度推理能力,在5个长程基准和12个视觉问答基准上分别提升+2.2%和+1.8%。
Comments 29 pages, 9 figures
AGORA: 审议与治理门能否吸收公交规划中的参与偏差?
机构 * Department of Civil and Environmental Engineering and Laboratory for Information & Decision Systems, Massachusetts Institute of Technology(土木与环境工程系和信息与决策系统实验室,麻省理工学院) ; Institute for Data, Systems, and Society, Massachusetts Institute of Technology(数据、系统与社会研究所,麻省理工学院)
专题命中 规划决策 :planning(title);分类 cs.LG
AI总结 提出AGORA框架,通过固定网络、需求和求解器,系统变化会议组成、结构化审议和治理门,发现审议是参与影响结果的关键机制,治理门可压缩跨剖面方差,将参与偏差从不可控输入重构为过程设计问题。