Maestro Order: A Model-Agnostic Orchestration Harness
Maestro Order: 一种模型无关的编排框架
专题命中 规划推理 :verifier(abstract);分类 cs.AI
AI总结 提出Maestro Order框架,通过分解、集成、验证和递归四种原语组合模型,并利用预算感知控制器分配计算资源,将不可靠的求解器转化为可靠的问题解决系统,显著提升可靠性。
Comments 10 pages, 4 figures
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
Maestro Order: 一种模型无关的编排框架
专题命中 规划推理 :verifier(abstract);分类 cs.AI
AI总结 提出Maestro Order框架,通过分解、集成、验证和递归四种原语组合模型,并利用预算感知控制器分配计算资源,将不可靠的求解器转化为可靠的问题解决系统,显著提升可靠性。
Comments 10 pages, 4 figures
通过走廊网络的去中心化自主交通管理
机构 * Department of Aeronautics and Astronautics(航空航天系) ; Massachusetts Institute of Technology(麻省理工学院) ; University of Maryland(马里兰大学)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 针对高密度自主航空交通,提出基于多智能体强化学习的去中心化走廊网络交通流管理方法,零样本迁移至复杂网络,无需集中协调或重训练。
Comments Presented at the Second US-Europe Air Transportation Research and Development Symposium (ATRDS2026)
基于自我对弈强化学习的Generals.io超人类AI
机构 * Department of Applied Mathematics, Charles University(查尔斯大学应用数学系) ; Department of Computer Science, Faculty of Electrical Engineering, Czech Technical University in Prague(捷克理工大学电气工程学院计算机科学系) ; EquiLibre Technologies, Inc.(EquiLibre Technologies公司)
专题命中 规划推理 :planning(abstract);分类 cs.LG
AI总结 通过自研JAX模拟器(单GPU每秒千万帧,提速万倍)和自对弈策略梯度训练视觉Transformer,在实时策略游戏Generals.io中达到超人类水平,1v1排行榜第一,对顶级人类玩家胜率199-70。
谓词重要性估计与解耦理由-分数蒸馏用于实体对齐
机构 * SungKyunKwan University(成均馆大学) ; NAVER
专题命中 规划推理 :reasoning(abstract);分类 cs.CL
AI总结 提出谓词重要性估计和解耦理由-分数蒸馏两个模块,通过谓词感知嵌入和蒸馏小语言模型提升知识图谱实体对齐性能,并利用分数与理由的不一致实现人机协同验证。
Comments 12 pages, 10 figures
CodeTeam: 一个基于LLM的多智能体框架用于仓库级代码生成
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; School of Computer Science, Nanjing University of Science and Technology(南京理工大学计算机学院) ; School of Computer Science, Central China Normal University(中央财经大学计算机学院) ; School of Computing Technologies, RMIT University(皇家墨尔本理工学院计算技术学院) ; M3S Research Group, SEIS Unit, University of Oulu(奥卢大学M3S研究组,SEIS单元)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 提出CodeTeam框架,通过分离规划、决策和实现阶段,结合多智能体协作与依赖感知调度,解决仓库级代码生成中的长程规划与跨文件一致性问题,在SketchEval和NL2Repo-Bench上取得显著提升。
Comments 36 pages, 5 images, 9 tables, Manuscript submitted to a Journal (2026)
何时规划,何时精炼:噪声水平作为扩散语言模型的粒度轴
机构 * Washington State University(华盛顿州立大学)
专题命中 规划推理 :planning(abstract);分类 cs.CL
AI总结 提出噪声依赖粒度控制(NDGC)方法,通过噪声水平调节训练和推理的粒度,实现从粗到细的去噪,无需显式规划器或层次结构,提升生成质量。
智能体行为挖掘:业务流程中的生成式AI智能体治理
机构 * SAP ; Umeå University(于默奥大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 针对生成式AI智能体在业务流程中的不可见自主性风险,提出智能体行为挖掘方法,通过事件数据模型将智能体活动转化为标准流程日志,实现决策可观测与可追溯,并验证其实用性。
Comments Accepted at BPM conference 2026 management main track
Zhinong AI:面向小农生产的AI赋能农业决策支持平台的设计科学研究
机构 * University of Sanya(三亚大学) ; Hebei International Studies University(河北国际关系学院)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 本文通过设计科学研究,提出了一个集成信息推送、问答、诊断、日历管理等功能的小农决策支持平台,并构建了分层架构、闭环流程、评估指标和治理框架,为AI农业原型转化为可测试、负责任的基础设施提供了结构化研究框架。
无理解的校准:诊断微调大语言模型在系统软件漏洞检测中的局限性
机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 提出CWE-Trace框架,通过834个Linux内核样本和两个诊断指标(DFI和HDD)评估LLM漏洞检测能力,发现数据污染无实质帮助,微调仅改变输出阈值而非决策策略,模型缺乏真正的安全推理能力。
Lagrange: 一种面向通用端到端驾驶的开放词汇、基于能量的稀疏框架
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 提出Lagrange框架,利用掩码潜在场和视觉语言模型实现开放词汇、稀疏计算,通过拉格朗日动作最小化确保运动学约束,在nuScenes和CODA基准上验证了鲁棒性和可解释性。
通过多智能体虚拟博弈增强大语言模型的决策能力
机构 * National University of Singapore(新加坡国立大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL
AI总结 针对多智能体系统中决策任务因立场纠缠而难以分解的问题,提出基于虚拟博弈的多智能体虚拟博弈(MAFP)范式,通过迭代最佳响应实现均衡求解,提升决策质量和鲁棒性。
Comments 18 pages, 8 figures
用户作为印迹:将每用户记忆内化为局部参数编辑
机构 * Pine AI
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 提出User as Engram方法,将用户事实存储为Engram模型的哈希键控记忆表中的局部编辑,推理技能共享一个适配器,实现高精度间接推理且内存占用极小。
迈向振动医学:一种用于临床决策支持的自演化多智能体框架
机构 * Medical AI Lab, The First Hospital of Hebei Medical University(河北医科大学第一医院医学人工智能实验室) ; Hebei Provincial Engineering Research Center for AI-Based Cancer Treatment Decision-Making, The First Hospital of Hebei Medical University(河北省人工智能癌症治疗决策工程研究中心,河北医科大学第一医院) ; State Key Laboratory of Neurology and Oncology Drug Development(神经与肿瘤药物研发国家重点实验室) ; School of Computing, University of Georgia(佐治亚大学计算学院) ; Department of Radiation Oncology, National Cancer Center/National Clinical Research Center for Cancer/Cancer Hospital and Shenzhen Hospital, Chinese Academy of Medical Sciences and Peking Union Medical College(中国医学科学院北京协和医学院国家癌症中心/国家肿瘤临床医学研究中心/肿瘤医院深圳医院放射治疗科) ; Department of Radiation Oncology, Mayo Clinic(梅奥诊所放射肿瘤科) ; College of Mechanical and Power Engineering, China Three Gorges University(三峡大学机械与动力工程学院) ; Department of Radiation Oncology, Guangzhou Concord Cancer Center(广州康华肿瘤中心放射治疗科) ; Gastrointestinal Disease Diagnosis and Treatment Center, The First Hospital of Hebei Medical University(河北医科大学第一医院胃肠疾病诊疗中心) ; Department of General Surgery, The First Hospital of Hebei Medical University(河北医科大学第一医院普通外科)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 提出VIBEMed多智能体框架,通过自演化机制和架构级安全沙箱,从交互历史中动态学习,实现个性化临床决策支持。
LoHoSearch: 超越人类难度上限的长时域搜索代理基准测试
机构 * Meituan(美团)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL
AI总结 提出LoHoSearch基准,基于700万维基实体知识图谱自动构建544个复杂问题,评估显示最强模型仅34.74%准确率,远超人类难度上限。
不动点推理器:稳定且自适应的深度循环Transformer
机构 * ELLIS Institute Tübingen, Max Planck Institute for Intelligent Systems, Tübingen AI Center(ELLIS研究所蒂宾根,马克斯·普朗克智能系统研究所,蒂宾根人工智能中心) ; ETH Zurich(苏黎世联邦理工学院) ; Swiss Institute of Bioinformatics(瑞士生物信息学研究所) ; Université Paris Cité(巴黎西岱大学) ; Liquid AI
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 针对循环架构中深度导致的信号传播问题,提出基于预层归一化和残差缩放的FPRM模型,利用不动点收敛作为端到端停止机制,在Sudoku、Maze等推理基准上自适应计算并有效提升性能。
Comments Code available at https://github.com/nilskiKonjIzDunava/fprm
上下文感知与关系感知的图检索增强生成统一框架
机构 * Zhejiang University(浙江大学) ; Nanyang Technological University(南洋理工大学) ; Finvolution Group(信也科技集团)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 提出HyGRAG分层图RAG框架,通过构建融合上下文与关系的摘要、跨层级检索及动态更新,将多跳推理准确率提升9.7%。
Comments Accepted at The ACM Web Conference 2026 (WWW '26)
MagicSim: 可执行具身交互的统一基础设施
机构 * Northwestern University(西北大学) ; Peking University(北京大学) ; University of California, Berkeley(加州大学伯克利分校) ; ShanghaiTech University(上海科技大学)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 提出MagicSim,一个基于确定性批处理运行时和共享MDP的具身交互基础设施,通过YAML规范解耦内容、放置、行为和智能体暴露,统一世界构建、执行、评估和自动生成轨迹。
基于Transformer的可行且最优末端接近翻滚目标的空间机械臂热启动方法
机构 * Stanford University(斯坦福大学)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 针对空间机械臂末端接近翻滚目标的实时轨迹生成问题,提出基于因果Transformer的热启动方法,通过分解规划并热启动姿态-力矩分配阶段,在300个测试场景中减少28%迭代次数和23%运行时间,同时保持控制成本分布。
Comments 8 pages, 4 figures
从盾牌到靶心:针对基于LLM的智能体护栏的拒绝服务攻击
机构 * National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 本文揭示基于LLM的护栏易受拒绝服务攻击,通过束搜索优化框架和机制感知结构变异生成恶意负载,导致令牌放大13-63倍、延迟放大148倍,威胁系统可用性。
上下文感知强化学习用于智能体与多模态大语言模型
机构 * Princeton University(普林斯顿大学) ; UC Davis(加州大学戴维斯分校)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL
AI总结 提出ContextRL方法,通过间接辅助目标(上下文选择奖励)增强大模型在长上下文和多模态任务中的细粒度推理能力,在5个长程基准和12个视觉问答基准上分别提升+2.2%和+1.8%。
Comments 29 pages, 9 figures
医疗世界模型:表示医疗状态、建模临床动态与指导干预策略
机构 * College of Computer Science, Zhejiang University(浙江大学计算机科学与技术学院) ; School of Medicine, Zhejiang University(浙江大学医学院) ; Department of Biomedical Informatics, Harvard University(哈佛大学生物医学信息学系)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 本文提出医疗世界模型框架,通过构建患者状态、建模临床动态和支持干预决策,推动医疗AI从静态诊断向动态模拟演进。
良性多智能体系统中的错误信息传播
机构 * University of Göttingen, Germany(德国哥廷根大学) ; LKA NRW, Germany(德国北莱茵-威斯特法伦州警署) ; Shared last authorship(共同通讯作者)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL
AI总结 研究在良性多智能体系统中,基于意图的错误信息如何通过智能体交互传播,并发现多智能体辩论相比单智能体提示能减少性能下降,鲁棒性取决于群体组成和决策协议。
Comments 20 pages, 8 figures, 1 table
用户即代码:面向个性化智能体的可执行记忆
机构 * Pine AI
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 提出可执行记忆范式User as Code,将用户模型转化为可运行的Python代码,通过两阶段流水线实现精确聚合与规则执行,在长对话基准上达到78.8%召回率,聚合问题准确率99%,并能主动触发安全警报。
LLM 编码智能体能否推理时间序列?
机构 * Institute of Formal and Applied Linguistics, Faculty of Mathematics and Physics, Charles University(查尔斯大学数学与物理学院形式与应用语言学研究所)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL
AI总结 研究 LLM 编码智能体在时间序列分析中的能力,发现代码访问可提升性能达 10%,但仍有 22-34% 错误,并分析了推理差距。
Comments 17 pages, 7 figures
引导艺术治疗的情感动态:通过分层引导的LLM智能体实现可控叙事脚本生成
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 提出EC-Script框架,通过分层控制情感轨迹生成叙事脚本,实现情感轨迹规划、场景驱动和局部情感调节,显著优于基线方法。
你的轨迹位移在长尾场景中安全吗?
机构 * Shanghai Qi Zhi Institute(上海期智研究院) ; Tsinghua University(清华大学) ; Tongji University(同济大学)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 提出FluidTest评估框架,通过成对WebUI协议、32种语义威胁分类和三元验证系统,检测规划轨迹相对于专家参考的额外威胁,实验发现SOTA规划器仍存在大量安全相关失败。
Comments 20 pages, 15 figures
医学图像分割综述:挑战、基准与未来展望
机构 * School of Control and Computer Engineering, North China Electric Power University(华北电力大学控制与计算机工程学院) ; SPIC Digital Technology Co., Ltd(国家电投数字科技有限公司) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Department 6 of Health Care, Second Medical Center, People’s Liberation Army General Hospital(中国人民解放军总医院第二医学中心健康医学科六病区)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 本文系统综述了基于U-Net、Transformer和SAM架构的医学图像分割方法,分析主要挑战,旨在指导未来研究并推动临床转化。
Comments 12 pages,3 figures,1 table. All related resources are available at https://github.com/andrew-pengyu/Awsome_MedSeg/tree/main
双基础模型的相互蒸馏用于半监督PET/CT分割
机构 * Central South University(中南大学) ; Hangzhou Dianzi University(杭州电子科技大学) ; Communication University of Zhejiang(浙江传媒学院) ; Northeastern University(东北大学)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 提出MuDuo框架,利用SAM-Med3D和SegAnyPET分别从CT和PET中蒸馏知识到轻量学生网络,实现半监督器官分割,仅用5个标注样本在AutoPET数据集上达到最优性能。
Comments MICCAI 2026
FactCheck: 基于多智能体协作的可行性感知长期动作预测
机构 * The Hong Kong Polytechnic University(香港理工大学) ; China Mobile(中国移动)
专题命中 规划推理 :verifier(abstract);分类 cs.AI
AI总结 提出FactCheck多智能体框架,通过闭环“观察-规划-验证”机制,结合历史动作图验证可行性,在EPIC-Kitchens-55和EGTEA Gaze+上超越现有方法。
面向无人机自主性的选择性代理恢复与持久任务运行时
机构 * Department of Electrical and Electronic Engineering, Korea University(高丽大学电气与电子工程系)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 提出持久任务运行时(PMR)框架,通过选择性调用外部代理推理器实现无人机恢复,引入学习型调用认知价值(learned-CVI)门控机制,在Gazebo/PX4基准测试中将硬/模糊场景成功率从5.0%提升至95.0%,同时减少16.7%的远程调用和29.2%的令牌消耗。
Comments 17 pages, 2 figures. Preprint