Training Fast Robot Policies with Slow Foundation Models
用慢速基础模型训练快速机器人策略
专题命中 规划决策 :planning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出VGRS方法,通过利用慢速基础模型训练快速机器人策略,结合LLM生成奖励与视觉分析诊断,提升机器人在复杂任务中的表现和部署效率。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
用慢速基础模型训练快速机器人策略
专题命中 规划决策 :planning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出VGRS方法,通过利用慢速基础模型训练快速机器人策略,结合LLM生成奖励与视觉分析诊断,提升机器人在复杂任务中的表现和部署效率。
SafeStep:为体弱或痴呆老年人提供的人工智能旅行辅助
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 针对体弱或痴呆老人出行难题,SafeStep利用旅行图表示,结合大语言模型与Anticip8行为预测引擎,生成个性化失败场景并提出干预措施。经实验和实地研究评估,结合两者的方法性能可靠,虽界面可用性待改进,但能提升旅行信心与安全感,还可拓展应用于其他领域。
基于分层动作分块的离线强化学习
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 研究离线目标条件强化学习中扩展到长期任务的挑战,提出HiQC算法,结合高级潜在规划与低级动作分块,实现无偏k步价值备份,理论证明其价值误差界限更紧,实证表明在OGBench套件中性能最佳。
Comments RLC/RLJ 2026
视角潜在因素作为主动推理智能体中因果涌现的架构条件
机构 * Active Inference Institute(主动推理研究所)
专题命中 规划决策 :agent(abstract);分类 cs.LG
AI总结 研究主动推理智能体中无奖励预测组织与信息理论特征的关系,通过特定架构智能体在无奖励环境切换协议中测试,确定\(g\)为与\(\Phi_r\)相关时间组织的架构位置,反对将\(\Phi_r\)作为学习整合直接指标。
归因市场:计划任务与执行行动之间分数信用分配的费雪市场公式
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 研究计划任务与执行行动间分数信用分配问题,构建准线性费雪市场,通过市场工具得出相关定理,扩展市场考虑任务进度折扣,解决算法收敛问题,提出基准发现问题,用熵正则化泛化及规则解决,报告参数并讨论局限,关联相关算法。
Comments 35 pages, 3 figures. Companion technical report with extended treatment of dynamic/forward-looking markets and reinforcement-learning extensions available separately
通过近端策略优化进行近似量子态制备
专题命中 规划决策 :agent(abstract);分类 cs.LG
AI总结 该研究针对近似量子态制备这一难题,利用基于近端策略优化的深度强化学习,让智能体识别目标状态的最佳近似并减少门的使用,经2至5个量子比特实验,框架能实现10⁻¹⁴的近似误差。
PRO-LONG:程序化内存实现长程推理
机构 * Duke University(杜克大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI
AI总结 针对长程任务中LLM智能体的挑战,提出PRO-LONG框架,通过程序化内存管理上下文,保留交互日志并利用编码智能体进展高效搜索历史,在ARC-AGI-3上有显著提升,减少令牌使用并达到高准确率。
一种用于机器人的智能云边缘多模态交互系统
机构 * Hainan University(海南大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 针对复杂环境下资源受限机器人的交互问题,提出云边缘多模态交互框架,集成增强YOLO手势检测器与LLM、VLM智能体,改进手势检测方法,经实验验证该系统在手势检测精度、任务成功率及用户满意度方面表现良好,证明了方法的可行性。
随心所欲驾驶:基于强化学习的多头部扩散个性化驾驶
机构 * School of Information Technology, Monash University Malaysia(墨尔本大学马来西亚分校信息科技学院) ; Southwest University, China(西南大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 研究旨在解决自动驾驶规划器忽视人类驾驶行为多样性及难以理解用户意图的问题。提出基于强化学习的多策略框架,集成多头部扩散规划器与语义理解,采用两阶段训练范式。实验表明该方法在nuPlan基准测试中性能良好,能满足实时规划并对齐用户意图。
Comments Has been submitted to AAAI 2026
抓取、交接、旋转:通过组合扩散和基于能量的优化实现双手物体重新定向
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 规划决策 :planning(abstract)
AI总结 研究双手物体重新定向问题,提出基于组合扩散和能量的BiCompoDiff框架,联合优化多方面任务,结合预训练模型与能量模型,通过梯度引导和采样优化抓取姿态,实验表明其成功率和轨迹平滑度优于基线,实现有效模拟到现实转移。
Comments IROS 2026
HGeo-TopoMap:利用分层几何先验增强拓扑映射
机构 * Zhejiang University of Science and Technology(浙江科技学院) ; Hunan University(湖南大学) ; Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)
专题命中 规划决策 :planning(abstract)
AI总结 针对现实环境中心线检测难题,提出HGeo-TopoMap,利用显式先验地图和隐式空间关系,设计几何自适应和一致性学习模块增强拓扑映射,在OpenLane-V2数据集上评估,提高了精度与鲁棒性,优于基线方法。
Comments The source code and model weights will be made publicly available at https://github.com/lynn-yu/HGeo-TopoMap
RL-MACRO:一种用于多模态自适应机器人开颅手术的控制论闭环智能框架
机构 * Dalian University of Technology(大连理工大学) ; Second Hospital of Dalian Medical University(大连医科大学附属第二医院) ; The University of Tokyo(东京大学)
专题命中 规划决策 :planning(abstract)
AI总结 研究针对自主机器人开颅手术面临的挑战,提出RL-MACRO框架,通过多模态感知、自适应决策和机器人执行实现闭环控制,利用CNN-LSTM观测器重建温度,经IQL策略和双头执行器优化行为,实验验证了该框架在骨切割方面的有效性。
用于机器人开颅手术的受人类启发框架:集成多模态融合与自适应轨迹调整
机构 * Dalian University of Technology(大连理工大学) ; The University of Tokyo(东京大学)
专题命中 规划决策 :planning(abstract)
AI总结 该研究针对机器人开颅手术问题,提出受人类启发的闭环框架,集成术前规划与术中执行。采用自适应双轮廓融合算法生成轨迹,利用多模态网络融合信号实现突破检测,通过原位投影策略调整轨迹,实验验证该框架能实现安全自主且高效闭环控制的开颅手术。
FSB-Net:用于非增强CT中脑卒病变分割的频率-空间边界网络
专题命中 规划决策 :planning(abstract)
AI总结 研究旨在解决非增强CT中脑卒病变分割难题。提出FSB-Net,利用频域分析,含小波边界检测头、频率-空间交叉注意力模块和频谱边界损失。在公共数据集上评估,性能优于多种方法,达当前最佳。
Flint:一种语义驱动的数据可视化中间语言
专题命中 规划决策 :AI agent(abstract)
AI总结 Flint是一种语义驱动的数据可视化中间语言,通过分层数据语义模型,让作者从简洁规范创建高质量可视化,能生成并优化与库无关的配置,转化为多目标语法的可执行规范,简化创作过程且不损视觉质量。
盖亚近红外光谱仪的径向速度和大气参数计算
专题命中 规划决策 :planning(abstract)
AI总结 研究为盖亚近红外光谱仪确定最佳波长区域,通过生成合成光谱、交叉相关分析等方法,找到K波段1926 - 1968纳米窗口及另一区域,能精确测量径向速度和大气参数,有助于绘制银河系尘埃遮蔽区域。
Comments This version includes minor edits from the proofs. Accepted for publication in A&A. 14 pages, 12 figures, 1 table
GS-Agent:通过生成式模拟创建4D物理世界
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Genesis AI(创世纪人工智能公司)
专题命中 多智能体 :agent(title,title_cn);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 研究旨在从自然语言描述创建4D物理世界。核心方法是提出GS-Agent这一端到端多智能体框架,分解任务并让多智能体与物理引擎协作。主要贡献是能有效转换自然语言为物理合理的4D世界,实现相机和灯光控制,为新范式奠基。
智能设计师:用于结构感知室内布局生成的渐进式多智能体协作
机构 * Guangdong University of Technology(广东工业大学) ; South China University of Technology(华南理工大学)
专题命中 多智能体 :agent(title,abstract);agentic(title,abstract);multi-agent(title,abstract)
AI总结 针对室内布局生成难题,提出智能设计师这一渐进式多智能体框架,将布局生成视为迭代约束验证决策过程,通过渐进共识机制协调三个智能体,经实验验证其显著优于现有方法,提升了结构遵循和功能设计连贯性。
Comments TPAMI 2026
ExecuGraph:一种用于通过大语言模型进行可靠后端代码合成的多智能体、基于执行的框架
机构 * Department of Computer Science and Engineering (AI & ML), Kakatiya Institute of Technology and Science(卡凯蒂亚理工学院计算机科学与工程系(人工智能与机器学习)) ; Department of Computer Science and Engineering, Kakatiya Institute of Technology and Science(卡凯蒂亚理工学院计算机科学与工程系) ; Boston University(波士顿大学)
专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);workflow(abstract);分类 cs.AI、cs.SE
AI总结 研究针对大语言模型后端代码合成可靠性问题,提出ExecuGraph多智能体框架,将执行验证置于核心,通过六个智能体和有向工作流协调,在多数据集评估中对比单智能体基线,验证方法有效性且能控制测量各因素贡献。
Comments Submitted to Data Science and Management
pAI-Econ-claude:用于人工智能辅助经济理论发展的门控人在回路多智能体架构
机构 * China Agricultural University(中国农业大学) ; University of Cambridge(剑桥大学)
专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);workflow(abstract);分类 cs.AI
AI总结 研究针对经济学等领域中基于大语言模型智能体输出缺乏正确性信号的可靠性问题,提出pAI-Econ-claude门控人在回路多智能体架构,经实验评估,该架构能提高可审计性,证明不可逆人类判断分配比纯智能体自主性更具信息性。
多智能体系统的工作负载感知缓存
专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);agentic(abstract);分类 cs.AI
AI总结 研究多智能体系统缓存问题,提出结合重新计算成本、DAG 依赖计数和智能体调用频率的工作负载感知逐出策略,经多基准测试评估,该策略能大幅降低延迟,接近无界缓存性能,且与其他优化方法互补。
Comments 11 pages, 6 figures
SAGE:用于异构多智能体导航的社会感知生成引擎
机构 * Guohao School, Tongji University(同济大学国豪书院) ; Shanghai Research Institute for Intelligent Autonomous Systems(上海智能无人系统科学中心) ; Tongji University(同济大学) ; Western University(西安大略大学) ; Aeromind Technology Co., Ltd.(深圳智元科技有限公司) ; University at Buffalo-SUNY(纽约州立大学布法罗分校)
专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);planning(abstract)
AI总结 针对开放人机环境中异构多智能体导航问题,提出SAGE,通过有向异构图和异构图变换器编码交互,扩散生成模块建模轨迹,无训练安全-社会能量引导机制优化轨迹,实验验证其有效性及可扩展性。
Comments 16 pages, 5 figures, and 14 tables. Includes supplementary experimental details
使用多智能体强化学习解决空中走廊降级监视下的冲突
机构 * College of Aeronautics and Engineering(航空与工程学院) ; Center for Advanced Air Mobility(先进空中交通中心)
专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG
AI总结 研究针对空中走廊降级监视下的冲突解决问题,开发基于深度Q网络的多智能体强化学习框架,为两类飞机训练策略,经模拟评估策略效果,揭示安全与走廊容量权衡,支持相关冲突解决策略评估。
自主拓扑变异:具有能力、状态和影子不变量的多智能体大语言模型系统的安全运行时重组
机构 * Toga Networks (Huawei)(托加网络(华为))
专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI
AI总结 研究多智能体大语言模型系统运行时无自我重组机制的问题,提出自主拓扑变异(ATM)机制,结合遥测驱动过载检测与安全不变量,经实验验证可提升任务成功率、减少隐私内存暴露并降低延迟,且相关内容已开源。
Comments 9 pages, 5 tables. Code and benchmark harness available at https://github.com/sidikbro/jiuwen_atm
OPTScientist:用于Transformer预训练的类型化优化器程序的多智能体发现
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Zhongguancun Academy(中关村科学院)
专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI
AI总结 研究针对深度学习优化器设计难题,提出OPTScientist多智能体框架,在类型化DSL中结合进化搜索与第二阶段机制,发现RS-MR优化器改进Transformer预训练,为自动优化器科学提供新路径。
具有世界状态寄存器的流式多智能体自回归扩散模型
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) ; Adobe Research(Adobe研究院)
专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract)
AI总结 研究多智能体交互世界模型共享状态维护难题,提出WorldWeaver模型,利用跨智能体世界状态寄存器及混合变压器设计,经双智能体我的世界视频生成实验验证,该模型能提升逻辑一致性与生成质量。
Comments Project page: https://vail-ucla.github.io/worldweaver/
AINTMA:用于自主测试管理的智能AI架构,具备生成式智能、安全云通信和自适应质量分析
机构 * International Business Machines (IBM)(国际商业机器公司(IBM)) ; Global Atlantic Financial(全球大西洋金融公司) ; Docusign(DocuSign公司) ; Salesforce Inc(Salesforce公司) ; The Home Depot(家得宝公司)
专题命中 多智能体 :agentic(title,abstract);agent(abstract);AI agent(abstract);multi-agent(abstract)
AI总结 研究针对现代软件质量保证需求,提出AINTMA多智能体AI系统。通过六个专门智能体及安全通信框架协调,结合生成式智能等技术。经实验评估,该系统在测试优先级、周期时间、缺陷逃逸率等方面表现出色,推进了云环境下软件质量管理。
Comments 11 pages, 2 figures, 4 tables, Submitted to AICCONS (AIP Conference Proceedings format)
面向复制包质量评估的智能体方法
专题命中 多智能体 :agentic(title,abstract);agent(abstract);planning(abstract);multi-agent(abstract)
AI总结 提出一种多智能体方法,将开放科学指南转化为机器可验证标准,自动检查复制包质量并生成改进报告,初步评估显示高一致性和正确性。
相同危险目标,相反建议:直接暴露与多智能体调解
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 多智能体 :agent(title);multi-agent(title);workflow(abstract);分类 cs.AI
AI总结 研究通过测试发现,语言模型直接面对危险目标和经智能体转换传递指令时表现不同,存在行为反向转变及组合安全漏洞,高性能模型可用于特定自动化工作流程的用户端组件,却未明确其内部机制。
Comments 21 pages; welcome comments
HarnessX: 一个可组合、自适应且可演化的智能体框架铸造厂
机构 * Darwin Agent Team(达尔文智能体团队)
专题命中 多智能体 :agent(title,abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 提出HarnessX,通过替换代数组合框架原语、基于AEGIS多智能体演化引擎自适应调整,并利用轨迹反馈闭环优化,在五个基准上平均提升14.5%性能。