QQWorld: Quantile-Quantile Matching for World Model Regularization
QQWorld:用于世界模型正则化的分位数-分位数匹配
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对潜在世界模型正则化中EP目标函数对尾部样本校正梯度不足的问题,提出QQWorld方法,通过分位数-分位数匹配目标函数及跨批次QQ技术,提升了LeWM在四个控制环境中的规划成功率与高斯对齐效果。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
QQWorld:用于世界模型正则化的分位数-分位数匹配
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对潜在世界模型正则化中EP目标函数对尾部样本校正梯度不足的问题,提出QQWorld方法,通过分位数-分位数匹配目标函数及跨批次QQ技术,提升了LeWM在四个控制环境中的规划成功率与高斯对齐效果。
TAPO:面向大语言模型智能体的过渡感知策略优化
机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) ; Pengcheng Laboratory(鹏城实验室)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出TAPO框架,通过策略优化与过渡监督交替训练,增强LLM智能体对环境过渡的敏感性,作为轻量即插即用模块,在WebShop和ALFWorld实验中提升任务性能。
Comments 16 pages, 5 figures
面向大动作空间的在线策略与离线策略学习
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本论文针对大动作空间交互式系统的策略学习挑战,提出meTS、dTS、sDM等结构化贝叶斯方法,解决在线与离线策略学习的关键问题并提供理论保证。
Comments PhD Thesis, 241 pages
短思考、智能延迟、行动与循环:面向边缘大语言模型智能体的校准推理与感知不确定性的延迟机制
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出TSDS框架,结合收敛探测器与困惑度延迟规则,经LTT流程校准后,可在边缘LLM智能体上减少43%-73%的思考计算量,同时保证奖励与云端调用率,在多类基准任务上表现优异。
使用和评估生成式人工智能工具以支持系统文献综述的初步指南
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.SE
AI总结 研究探讨如何用GenAI支持系统文献综述,通过快速审查、思想实验等方法,识别评估GenAI用于SLRs的问题及过程要点,形成GUEST建议,助研究人员利用GenAI开展可靠综述与评估研究,强调其需人工监督及能提供成本效益帮助。
Comments 58 pages, 2 figures, 11 tables
大语言模型作为预测规划器:时间序列基础模型的免训练文本条件设定
机构 * Deakin University(迪肯大学) ; Applied Artificial Intelligence Initiative(应用人工智能倡议)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 研究文本条件时间序列预测问题,核心方法是将预测设为TSFM生成轨迹上的规划问题,以冻结TSFM为模拟器、LLM为策略和价值函数,实例化\rc{}框架,主要贡献是通过实验证明该框架能带来持续改进。
从孤立任务到结构化能力:大语言模型的多层分类法
机构 * Fudan University(复旦大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL
AI总结 该研究提出大语言模型多层分类法,含14个能力领域和91个子技能,以人类认知科学为指导。通过筛选和映射相关论文,分析研究关注情况,揭示领域及子技能分布,此分类法有助于大语言模型研究组织、评估等多方面工作。
Comments 34 pages, 5 figures, 20 tables
基于大语言模型的工业健康智能的工业令牌化:一种用于工业证据集成的联邦架构
机构 * Mingyang Smart Energy Co., Ltd.(明阳智慧能源集团股份有限公司)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究工业健康管理中异构信息源集成问题,提出工业令牌化概念及联邦架构,将特定源分析输出转为工业令牌,以实现跨源推理。给出基于振动诊断输出等的端到端诊断令牌路径,定位工业令牌化为语义接口。
Comments 10 pages, 1 figure
THOR:用于多跳问答的θ-γ分层振荡推理框架
机构 * Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) ; School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学生命科学与医学部生物医学工程学院)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL
AI总结 针对多跳问答中注意力衰减和错误积累问题,提出受大脑启发的θ-γ分层振荡推理框架THOR,经实验验证,该框架能提高答案准确性和鲁棒性,减轻相关限制。
使用先进人工智能/机器学习模型的时间序列网络利用率关键绩效指标预测
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 研究针对数据密集型应用等导致的网络性能问题,通过评估季节性分解等多种模型,利用通用接口数据集在MAPE等指标上进行基准测试,给出模型准确性与计算效率权衡的见解,助相关人员选最佳预测模型。
用于个性化乳腺癌预测的可信隐私保护多模态联邦学习
机构 * NTU(南洋理工大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 研究探讨联邦学习能否兼顾四个关键支柱,支持乳腺癌患者肿瘤进展预测模型开发。通过多模态数据评估联邦学习框架,与集中式模型比较性能,并研究相关策略,结果助于理解隐私保护多模态预测建模可行性及支持未来应用。
Comments 26 pages, 12 figures
基于GNN的模型中用于空间可迁移性的引导式网络无关特征初始化
机构 * Technical University of Munich(慕尼黑工业大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 研究针对交通分配问题中GNN模型空间泛化差的问题,提出网络无关初始化层GUIDED,通过在虚拟链路注入需求标量属性标准化输入空间。实验表明其能提升模型性能、鲁棒性及参数效率,减少训练时间,为相关空间问题提供通用蓝图。
ABot-World-0:在单台桌面GPU上进行无限交互式世界展开
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG
AI总结 介绍ABot-World-0这一用于实时长视野闭环交互的动作条件视频世界模型,利用多源数据学习世界动态。通过多种技术提炼模型,设计控制界面与部署堆栈,在单台桌面GPU上实现高效视频流传输,实验验证其有竞争力的可控性和世界演变能力。
智能多无人机在综合陆地与非陆地网络中的导航:一种分层大语言模型方法
专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG
AI总结 针对高速无人机在三维空中高速公路部署中面临的协调问题,提出分层大语言模型驱动控制框架,利用云端大语言模型管理全局负载平衡,边缘大语言模型转化局部观测为子目标,引导深度强化学习控制器执行轨迹,降低碰撞率并提高系统吞吐量。
Comments This paper has been accepted by IEEE GLOBECOM 2026
一个学生,多个教师:通过软提示特权上下文进行多任务在线策略蒸馏
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Johns Hopkins University(约翰霍普金斯大学) ; Nanyang Technological University(南洋理工大学)
专题命中 规划决策 :tool use(abstract);分类 cs.CL、cs.LG
AI总结 研究提出一种多任务在线策略蒸馏方法,教师与学生仅通过可学习软提示区分,在骨干冻结时训练特定任务教师。单任务变体训练参数少且效果好,多任务变体保持通用能力基准同时实现最佳总体平均水平。
Comments 10 pages, 5 figures
O-VAD:通过以对象为中心的跟踪和推理进行工业视频异常检测
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) ; Griffith University(格里菲斯大学)
专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 针对工业视频异常检测,现有基于VLM的方法在工业场景中性能不佳的问题,提出无训练的智能框架O-VAD,通过跟踪对象时空动态和推理状态轨迹来检测异常,在多数据集实验中优于多种方法且能提供可解释报告。
Comments Accepted to ECCV 2026
DeLIVeR:通过强化知识图谱探索进行基于信息的真实性识别的分解学习
机构 * University of Louisville(路易斯维尔大学) ; Denison University(丹尼森大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL
AI总结 针对大语言模型自动事实核查难题,DeLIVeR框架将证据检索设为强化探索任务,利用规划器大语言模型分解声明获问题集遍历知识图谱找证据,经GRPO优化策略,实验表明其显著优于基线,有效弥合推理差距,提供检测路径。
Comments Accepted to 7th International Conference on Deep Learning Theory and Applications (DeLTA 2026)
TAPAS:自主系统的吞吐量自适应感知
机构 * University of Turku(图尔库大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG
AI总结 针对自主系统感知模块吞吐量需求随场景变化的问题,提出基于强化学习的吞吐量自适应感知策略TAPAS,能在异构移动/边缘平台智能分配资源,在KITTI和nuScenes数据集上评估,吞吐量满足率高且节能效果显著。
Comments 15 Pages, 20 Figures, Accepted at ACM/IEEE International Conference on Codesign of Embedded Systems at Embedded Systems Week (ESWEEK-CODES), 2026
AIGB-R1:通过分层规划器-执行器优化实现自我进化的生成式自动出价
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) ; Alibaba Group(阿里巴巴集团)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 研究针对AIGB范式在自动出价中存在的问题,提出AIGB-R1框架,利用大语言模型推理能力,通过分层规划器与执行器模块、经验驱动循环、两阶段训练及新优化方法,经实验验证该框架在自动出价任务中的有效性。
他们看到了什么?通过视觉-语言-动作模型的视角解读复杂道路场景以实现安全可靠的自动驾驶学习
机构 * Birla Institute of Technology and Science, Pilani(贝拉理工科学学院皮拉尼分校) ; University of California, Merced(加州大学默塞德分校)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 研究自动驾驶模型内部逻辑不透明问题,提出反事实消融框架CVAA,通过移除摄像头图像中物体创建反事实集评估模型响应差异,应用于阿尔帕马约1轨迹预测器,分析物体因果影响,还通过可解释性技术深入理解模型,创建可解释驾驶系统巩固人机信任。
从世界反馈中学习:为何模型不确定性在基于模型的强化学习中无法作为风险信号
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 研究探讨 RLxF 中学习信号应源于世界反馈,在安全模型控制中实例化并提炼原则。通过实验表明基于动力学的不确定性惩罚会增加碰撞率,用世界反馈信号可降低碰撞率,提取原则并指出其适用于多种相关方法。
Comments Accepted at the ICML 2026 Workshop on Reinforcement Learning from X Feedback (RLxF). 14 pages
RouteCost:一种受生产启发的多阶段框架,用于电子商务中的预订单运输成本估计
机构 * Northeastern University(东北大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 研究电子商务中预订单运输成本估计问题,提出受生产启发的多阶段框架RouteCost,将其分解为多步骤,通过路线加权期望公式汇总成本估计,在大量订单等数据上提高了预测质量和校准,保留了路线级可解释性。
从可行性到合意性:用于个性化设备端行程生成的计划、学习、适应(PLA)框架
机构 * Tech LLC(529科技有限责任公司) ; University of Virginia(弗吉尼亚大学) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 研究针对个性化设备端行程生成问题,提出PLA框架,分计划、学习、适应三阶段,通过构建规划器集合、拟合奖励模型及进行局部优化来生成行程,实验表明该框架在可行性和胜率上表现出色,还提升了生产部署中的行程完成率并降低延迟。
递归工具自我改进
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究在模型-工具协同进化中,通过递归工具自我改进(RHI)优化用户构建工具,以提高执行轨迹质量和智能体性能。RHI将工具表示为提示级规范,经成对反馈迭代改进,在多任务中提升了低推理能力智能体性能,降低推理成本。
Comments This work addresses the first half of the model-harness coevolution loop
利用激光雷达衍生地形智能的卫星地面站选址可解释地理空间人工智能
机构 * U.S. Geological Survey(美国地质调查局)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 研究利用激光雷达衍生地形智能预测卫星地面站选址的代表性杂波高度,提出可解释机器学习框架,用多种数据训练,选LightGBM,模型误差降低超60%,评估相关标准,SHAP识别关键预测因子,证明开放数据可改善杂波建模。
Comments Accepted at the 2026 IEEE 22nd International Conference on Automation Science and Engineering (IEEE CASE 2026)
诱导情绪会影响大语言模型在序列决策中的行为吗?
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Texas A&M University(德州农工大学) ; National University of Singapore(新加坡国立大学) ; UCLA(加州大学洛杉矶分校) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Mass General Hospital(麻省总医院) ; Harvard Medical School(哈佛医学院)
专题命中 规划决策 :autonomous agent(abstract);分类 cs.AI、cs.CL
AI总结 研究探讨诱导情绪对大语言模型在序列决策中行为的影响,采用爱荷华赌博任务结合情绪诱导程序,发现诱导情绪平均不显著影响其决策动态,但愤怒有条件地影响决策,揭示了与人类行为的差异,为相关研究提供工具。
PFAdapter:用于个性化联邦多模态大语言模型的分层LoRA分解
机构 * College of Future Information Technology, Fudan University(复旦大学未来信息技术学院) ; Division of Natural and Applied Sciences, Duke Kunshan University(昆山杜克大学自然科学与应用科学部) ; Department of Electrical and Computer Engineering, The University of British Columbia(英属哥伦比亚大学电气与计算机工程系) ; Ant Group(蚂蚁集团) ; College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) ; School of Data Science and Engineering, East China Normal University(华东师范大学数据科学与工程学院) ; College of Intelligent Robotics and Advanced Manufacturing, Fudan University & Fysics AI(复旦大学智能机器人与先进制造学院及复肆智能科技(上海)有限公司) ; Xiaomi EV, Xiaomi Campus(小米汽车、小米园区) ; Information and Communications Technology Cluster, Singapore Institute of Technology (SIT)(新加坡理工学院信息通信技术集群) ; College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) ; School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院)
专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG
AI总结 针对分布式网络中联邦微调平衡全局知识与局部适应的挑战,提出PFAdapter框架,用分层LoRA分解将适配器参数分离,通过正交正则化和选择性聚合协议减少通信成本,实验证明该框架在多数据集上性能优于基线,为智能AI部署提供有效方案。
Comments submitted to IEEE TCCN
自担风险:在认知不对称下大语言模型在语用合作方面存在困难
机构 * Situated Grounding and Natural Language (SIGNAL) Lab(情境基础与自然语言(SIGNAL)实验室)
专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 研究大语言模型在多方协作任务部分信息条件下的语用推理能力,形式化协作认知不对称概念,评估其作为说话者和倾听者合作能力,发现虽有一定语用能力但信息不完整时仍有挑战,部分失败模式与格赖斯准则违反有关。
通过置信度校准和增量推理实现特定任务的多模态问答代理,用于QANTA 2026
机构 * Department of Computer Science ; Engineering, Chittagong University of Engineering \& Technology, Chattogram, Bangladesh
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL
AI总结 针对QANTA 2026共享挑战,开发特定任务双代理架构,抢答代理用带置信度校准的模型及数值推理策略,加分代理用多种推理整合信息,强调仅托管环境下的高效推理与校准,系统取得高分,证明轻量级策略在资源受限问答中性能强。
Comments 10 pages, 1 figure. Accepted at the EMM-QA 2026 Workshop, ICML 2026 (Non-Archival). Rank #1 overall system in the QANTA 2026 Challenge
Jet-Long:使用动态双焦点旋转位置编码的高效长上下文扩展
机构 * NVIDIA(英伟达)
专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG
AI总结 研究针对现代语言模型长上下文应用中零样本上下文扩展问题,提出Jet-Long方法,通过动态双焦点RoPE及相关技术,在推理时开销小,在多种模型和基准测试中表现优异,还能推广到其他架构且超参数弹性强。
Comments added discussion of AdaGroPE and LaMPE (Findings of ACL 2026) with clarified contribution