Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance
评估残差:长时序评估在匹配短任务性能之外的补充作用
机构 * Tencent(腾讯)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 该论文提出时序残差概念,指出长时序基准需将全任务成功与短阶段基线预测比较,以解释长任务失败的原因。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
评估残差:长时序评估在匹配短任务性能之外的补充作用
机构 * Tencent(腾讯)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 该论文提出时序残差概念,指出长时序基准需将全任务成功与短阶段基线预测比较,以解释长任务失败的原因。
卫星观测揭示海上风电场集群的远距离近地面尾流特征
专题命中 规划决策 :planning(abstract);workflow(abstract)
AI总结 该研究利用7122幅Sentinel-1A/B SAR图像,揭示海上风电场近地面尾流可超100公里、平均降速0.990 m/s,还观测到跨国界尾流相互作用,为尾流特征提供大规模观测表征。
SCOPE:基于耦合策略的端到端协调供应链运营
机构 * Dingdong(叮咚)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 SCOPE是将供应链实体建模为token的复合策略模型,在生鲜零售补货数据上验证了其比分阶段优化及传统基线更优的端到端供应链决策效果。
QQWorld:用于世界模型正则化的分位数-分位数匹配
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对潜在世界模型正则化中EP目标函数对尾部样本校正梯度不足的问题,提出QQWorld方法,通过分位数-分位数匹配目标函数及跨批次QQ技术,提升了LeWM在四个控制环境中的规划成功率与高斯对齐效果。
TAPO:面向大语言模型智能体的过渡感知策略优化
机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) ; Pengcheng Laboratory(鹏城实验室)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出TAPO框架,通过策略优化与过渡监督交替训练,增强LLM智能体对环境过渡的敏感性,作为轻量即插即用模块,在WebShop和ALFWorld实验中提升任务性能。
Comments 16 pages, 5 figures
面向大动作空间的在线策略与离线策略学习
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本论文针对大动作空间交互式系统的策略学习挑战,提出meTS、dTS、sDM等结构化贝叶斯方法,解决在线与离线策略学习的关键问题并提供理论保证。
Comments PhD Thesis, 241 pages
SLAI T-Rex:在升腾超级集群上对DeepSeek-V4系列进行全参数训练后优化
专题命中 规划决策 :workflow(abstract);分类 cs.AI、cs.CL
AI总结 研究针对万亿参数规模MoE模型全参数训练后优化的系统挑战,在升腾NPU超级集群上以DeepSeek-V4为目标工作负载开发分层优化框架,建立CPT和SFT工作流程,提升模型性能,推动复杂推理前沿模型系统发展。
Comments 73 pages, 22 figures, 20 tables
REFINE-DP:通过强化学习实现人形机器人的动态-操作协调政策微调
机构 * The Institute for Robotics and Intelligent Machines(机器人与智能机械研究所)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出REFINE-DP框架,通过联合优化扩散政策高层规划器和基于强化学习的低层动态-操作控制器,提升人形机器人在复杂环境中的任务成功率与执行稳定性。
感知自身老化的机器:面向硬件感知自主智能的框架
机构 * Newcastle University Singapore(新加坡纽卡斯尔大学) ; Qingdao University of Technology(青岛理工大学) ; Amrita Vishwa Vidyapeetham(阿姆里塔维什瓦维迪亚皮塔姆大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 针对自主系统硬件老化引发的任务失败问题,提出将硬件健康融入决策的 AAAI 框架,通过三大支柱实现系统自适应,提升弹性并延长寿命,适用于太空、医疗等关键环境。
Comments 1 figure, 8 pages
大型语言模型能否执行父订单?
专题命中 规划决策 :planning(abstract);分类 cs.CL
AI总结 该研究针对算法交易的父订单执行问题,提出分层框架PACE,基于深交所数据验证其性能优于现有方法,表明LLMs可辅助人类交易者执行决策。
超越改写:书籍级组织提升训练中合成教科书数据的质量
机构 * Peking University(北京大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 本研究提出可扩展的合成教科书数据流程,发现书籍级组织可提升语言模型训练中期的下游性能,在Llama3-8B上也验证了该设计维度的有效性。
Comments 31 pages, 3 figures, 11 tables
基于特权自蒸馏的对比强化策略优化
专题命中 规划决策 :agentic(abstract);分类 cs.LG
AI总结 该研究针对在线策略自蒸馏的暴露偏差问题,提出CRPO方法,通过对比学习与分组对比保留优化信号,在13个推理基准上提升了训练稳定性与泛化性。
RoboBRIDGE:一种将策略桥接至鲁棒现实世界机器人智能体的模块化框架
机构 * Sungkyunkwan University(成均馆大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI
AI总结 该研究针对视觉-语言-动作模型部署为机器人智能体的缺陷,提出 RoboBRIDGE 模块化框架,通过五大协同模块结合预训练 VLAs 构建鲁棒智能体,在多基准和现实场景中性能优于现有方案。
Comments Accepted to IROS 2026. 8 pages, 6 figures
SAFViT:用于基于视觉Transformer的细胞核分割与分类的空间注意力融合门控
机构 * School of Computer Science, University of Leeds(利兹大学计算机学院)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 本研究针对数字病理学中细胞分割与分类的冗余信息问题,提出SAF门控模块替换CellViT的传统跳跃连接,在PanNuke和MoNuSeg数据集上使mPQ达0.471,死亡类F1分数提升14.5个百分点。
Arm2Air:用于三维中继组网的跨 embodiments 骨架迁移
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 Arm2Air 实现跨 embodiments 骨架迁移,高效优化无人机中继部署,在规划速度、中继性能及数据效率上均优于基线方法,为异构 embodied 任务结构先验迁移提供新方案。
Comments 9 pages, 4 figures
卡尔曼与课程学习结合:面向自适应RL微调的高效动态提示选择
机构 * Beihang University(北京航空航天大学) ; Zhongguancun Academy(中关村学院) ; Nanyang Technological University(南洋理工大学) ; Communication University of China(中国传媒大学)
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 本文提出KGPS方法,将提示选择转化为动态状态估计问题,适配RL训练动态,在多推理基准和RL算法上较基线提升准确率与rollout效率,在在线提示选择中达最优。
好的排序器,差的目标:表达性策略搜索下的双线性对比评判器
机构 * Stanford University(斯坦福大学) ; Sesame AI(芝麻AI公司)
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 该研究发现双线性对比评判器的排序能力与其优化安全性不匹配,其存在范数漂移等问题,在多任务中无法可靠排序动作,需结合价值校准标量用于动作选择。
DenoiseRL:引导推理模型从噪声前缀中恢复
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 规划决策 :agentic(abstract);分类 cs.AI
AI总结 提出DenoiseRL框架,通过强化学习从弱模型的错误推理中学习,无需外部监督或强教师模型,提升推理性能和训练效率。
Comments 17 pages, 5 figures
AfriEconQA:基于世界银行报告的非洲经济分析基准数据集
机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)
专题命中 规划决策 :agentic(abstract);分类 cs.CL
AI总结 AfriEconQA是一个基于世界银行报告的非洲经济分析基准数据集,旨在测试信息检索和RAG系统在处理复杂经济查询时的性能。
Comments Dataset Explorer: https://afrieconqa.pages.dev/
运用心智理论在社会学习与非社会学习之间进行仲裁
专题命中 规划决策 :agent(abstract)
AI总结 该研究提出理性心智化模型,通过推理智能体目标与行动信息性权衡社会、非社会学习的效用,用新游戏验证其可定量捕捉人类学习策略的权衡,揭示选择性社会学习受心智理论指导以实现效用最大化。
Comments 35 pages, includes supplementary information
从理解到行动:面向生成式推荐的反馈驱动策略发现
专题命中 规划决策 :agent(abstract)
AI总结 该研究针对生成式推荐的“理解-行动差距”,提出反馈驱动智能体框架,经蒸馏迁移至轻量模型实现无LLM在线推理,在基准测试与在线A/B测试中均取得推荐效果提升。
分支扩展:面向串联系统的基于 prognostics 的更换策略
专题命中 规划决策 :planning(abstract)
AI总结 该研究提出一种混合规划方法,用于推导串联系统的基于 prognostics 的预测性维护策略,该策略参数少、效率高且抗过拟合能力强,在预防性更换和订购场景中性能可媲美优化基准策略。
基于多层网络的跨行业人类运动可预测性研究
专题命中 规划决策 :planning(abstract)
AI总结 本研究基于多层网络,用10种模型探究跨行业人类运动可预测性,明确关键特征,发现非线性模型表现最优、周度运动更易预测,为人类运动建模提供实用进展。
Comments 16 pages, 9 figures
大规模层次结构端到端概率层次预测:基于概率自上而下方法
专题命中 规划决策 :planning(abstract)
AI总结 提出e2eTD方法,仅预测少量聚合序列,通过概率自上而下采样传播到底层,实现大规模层次时间序列的快速、可扩展概率一致预测,在M5和Favorita数据集上取得最优加权缩放分位数损失。
Comments 32 pages, 7 figures
劳动力之后是什么资本?预测人机时代的人才ROI转型
专题命中 规划决策 :planning(abstract)
AI总结 针对AI增强打破劳动时间与贡献的会计关联,本文构建从时间到产出的人才ROI预测框架,核心定理为ROI反转,并利用韩国52小时工作制案例验证了前期压力信号,预测产出型企业在2032年TFP增长领先1.5-2.0个百分点。
Comments 86 pages, 6 figures
世界动作模型是否比视觉语言动作模型表现更好?一项鲁棒性研究
机构 * Huawei Technologies(华为技术有限公司) ; University of Toronto(多伦多大学)
专题命中 规划决策 :planning(abstract)
AI总结 本文比较了最新状态的VLA策略和最近发布的WAMs,在不同视觉和语言扰动下评估其性能,发现WAMs在鲁棒性上表现更强,而VLA需要大量训练数据和多样化学习目标。
链上削峰
专题命中 规划决策 :planning(abstract)
AI总结 研究链上削峰策略,通过调度交易至低拥堵时段以降低Gas费用,揭示交易可延迟性和Gas强度对费用管理的影响。
Comments 8 pages
一种针对无模型统一抓取放置推理的鲁棒放置性度量
机构 * Anonymous Authors(匿名作者) ; Benno Wingender(伯恩诺·温格德尔) ; Nils Dengler(尼尔·登格尔) ; Rohit Menon(罗希特·梅农) ; Sicong Pan(斯冰·潘) ; Maren Bennewitz(马伦·本内维茨)
专题命中 规划决策 :planning(abstract)
AI总结 本文提出一种鲁棒的概率放置性度量,通过联合评估稳定性、抓取性和空隙,实现无模型的统一抓取放置推理,并在仿真和真实机器人实验中验证其有效性。
Comments IROS 2026
多代理公共交通模型中的高效投资
专题命中 规划决策 :agent(abstract)
AI总结 本文研究了多代理公共交通模型中的资源投资问题,发现近似最优解计算为NP完全,并提出多项式时间算法解决部分情况。
不完全信任下的最优税收
专题命中 规划决策 :agent(abstract)
AI总结 该研究在拉姆齐框架中引入公民对政府的信任因素,发现信任阈值决定最优税收政策,低信任时最优为零税收,高信任时按信任调整公共资金边际价值确定税率,为低信任环境的税收设计提供思路。
Comments This paper has been incorporated into and superseded by the substantially revised and expanded paper "Government Reputation and Fiscal Capacity," arXiv:2509.03087