arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-10 至 2026-04-10 共收录 45 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 45 篇

2512.08296 2026-04-10 cs.AI 87%

Towards a Science of Scaling Agent Systems

迈向代理系统的科学:扩展性研究

Yubin Kim, Ken Gu, Chanwoo Park, Chunjong Park, Samuel Schmidgall, A. Ali Heydari, Yao Yan, Zhihan Zhang, Yuchen Zhuang, Yun Liu, Mark Malhotra, Paul Pu Liang, Hae Won Park, Yuzhe Yang, Xuhai Xu, Yilun Du, Shwetak Patel, Tim Althoff, Daniel McDuff, Xin Liu

机构 * Google Research(谷歌研究院) Massachusetts Institute of Technology(麻省理工学院) Google DeepMind(谷歌DeepMind)

专题命中 规划决策 :agent(title,abstract);planning(abstract);agentic(abstract);multi-agent(abstract)

AI总结 本文通过260种配置评估六种代理基准,探讨代理系统在扩展维度上的性能变化规律,揭示协调、模型能力与任务结构之间的关系,发现协作成功取决于协调与任务结构的匹配程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07645 2026-04-10 cs.AI 85%

PRIME: Training Free Proactive Reasoning via Iterative Memory Evolution for User-Centric Agent

PRIME:通过迭代记忆进化实现无梯度的前瞻性推理以构建以用户为中心的智能体

Prince Zizhuang Wang, Shuli Jiang

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划决策 :agent(title,abstract);tool-use(abstract);agentic(abstract);分类 cs.AI

AI总结 PRIME通过迭代记忆进化框架,实现无梯度学习,使智能体在多轮人机交互中高效学习用户意图,提升任务执行效率和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07687 2026-04-10 cs.LG cs.AI 84%

Joint Task Offloading, Inference Optimization and UAV Trajectory Planning for Generative AI Empowered Intelligent Transportation Digital Twin

生成式人工智能赋能的智能交通数字孪生中的联合任务卸载、推断优化与无人机轨迹规划

Xiaohuan Li, Junchuan Fan, Bingqi Zhang, Rong Yu, Xumin Huang, Qian Chen

机构 * Guangxi University Key Laboratory of Intelligent Networking and Scenario System (School of Information and Communication, Guilin University of Electronic Technology)(广西大学智能组网与场景系统重点实验室(桂林电子科技大学信息与通信学院)) Research Institute of Highway Ministry of Transport(交通运输部公路科学研究院) School of Automation, Guangdong University of Technology(广东工业大学自动化学院) School of Architecture and Transportation Engineering, Guilin University of Electronic Technology(桂林电子科技大学建筑与交通工程学院)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种联合优化方法,通过无人机任务卸载、推断优化和轨迹规划提升生成式人工智能赋能的智能交通数字孪生的精度与延迟平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07774 2026-04-10 cs.RO cs.CV 82%

RoboAgent: Chaining Basic Capabilities for Embodied Task Planning

RoboAgent: 通过基本能力串联实现具身任务规划

Peiran Xu, Jiaqi Zheng, Yadong Mu

机构 * Peking University(北京大学) XYZ Embodied AI(XYZ具身智能)

专题命中 规划决策 :planning(title,abstract);agent(abstract)

AI总结 本文提出RoboAgent,通过串联基本能力实现具身任务规划,利用单个VLM构建能力驱动的规划框架,结合多阶段训练方法提升规划效果。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13126 2026-04-10 cs.AI cs.CL 81%

Iterative Formalization and Planning in Partially Observable Environments

迭代形式化与在部分可观测环境中的规划

Liancheng Gong, Wang Zhu, Jesse Thomason, Li Zhang

机构 * Drexel University(德雷塞尔大学) University of Southern California(南加州大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出PDDLego框架,通过将环境和目标分解为完全可观测的片段,实现迭代形式化、规划、扩展和优化,提升在部分可观测环境中的规划成功率和鲁棒性。

Comments In Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07944 2026-04-10 cs.RO cs.AI cs.SY eess.SY 79%

On-Policy Distillation of Language Models for Autonomous Vehicle Motion Planning

语言模型在自动驾驶运动规划中的在线策略蒸馏

Amirhossein Afsharrad, Amirhesam Abedsoltan, Ahmadreza Moradipari, Sanjay Lall

机构 * Stanford University(斯坦福大学) University of California, San Diego(加州大学圣地亚哥分校) University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文研究如何将大模型的运动规划知识迁移到小模型,提出在线通用知识蒸馏方法,在nuScenes基准测试中表现优于强化学习基线,模型规模缩小5倍仍保持高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07857 2026-04-10 eess.SY cs.AI cs.SY 79%

Networking-Aware Energy Efficiency in Agentic AI Inference: A Survey

面向网络的代理AI推理能效:综述

Xiaojing Chen, Haiqi Yu, Wei Ni, Dusit Niyato, Ruichen Zhang, Xin Wang, Shunqing Zhang, Shugong Xu

机构 * Shanghai University(上海大学) Nanyang Technological University(南洋理工大学) Edith Cowan University(埃迪斯科文大学) Fudan University(复旦大学) Xi'an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 本文综述了代理AI推理中网络感知能效问题,探讨了计算与通信能耗的统一分类,提出跨层协同设计策略,并指出联邦绿色学习、6G代理AI等开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17209 2026-04-10 cs.RO cs.AI 79%

LiloDriver: A Lifelong Learning Framework for Closed-loop Motion Planning in Long-tail Autonomous Driving Scenarios

LiloDriver:一种面向长尾自动驾驶场景闭环运动规划的终身学习框架

Huaiyuan Yao, Pengfei Li, Bu Jin, Yupeng Zheng, An Liu, Lisen Mu, Qing Su, Qian Zhang, Yilun Chen, Peng Li

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Horizon Robotics(地平线机器人)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 LiloDriver通过结合大语言模型与记忆增强的规划生成系统,实现了在长尾自动驾驶场景中闭环运动规划的持续适应,优于传统规则和学习方法。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00941 2026-04-10 eess.SY cs.SY 78%

Traffic-Aware Microgrid Planning for Dynamic Wireless Electric Vehicle Charging Roadways

面向动态无线电动汽车充电道路的交通感知微电网规划

Dipanjan Ghose, Junjie Qin, S Sivaranjani

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出一种交通感知微电网规划框架,用于动态无线充电道路,通过整合交通行为与电动汽车能耗,降低系统成本。

Comments This version provides the updated formulation referenced in the withdrawal of the previous one

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07966 2026-04-10 cs.CV 78%

Lighting-grounded Video Generation with Renderer-based Agent Reasoning

基于渲染的视频生成与基于代理的推理

Ziqi Cai, Taoyu Yang, Zheng Chang, Si Li, Han Jiang, Shuchen Weng, Boxin Shi

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(北京大学计算机学院国家视觉技术工程研究中心) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) OpenBayes Information Technology Co., Ltd.(北京开贝信息技术有限公司) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)

专题命中 规划决策 :agent(title,abstract)

AI总结 本文提出LiVER框架,通过显式3D场景属性条件生成可控视频,结合轻量条件模块和渐进训练策略,实现高保真和精确控制,适用于图像到视频和视频到视频的合成。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23322 2026-04-10 cs.CV 78%

Mitigating Visual Context Degradation in Large Multimodal Models: A Training-Free Decoupled Agentic Framework

缓解大多模态模型中的视觉上下文退化:一种无需训练的解耦代理框架

Hongrui Jia, Chaoya Jiang, Shikun Zhang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心) Shandong University(山东大学)

专题命中 规划决策 :agentic(title,abstract)

AI总结 本文提出无需训练的解耦代理框架DRP,通过让LLM作为策略推理者与LMM作为观察者解耦,有效缓解多模态推理中的视觉退化问题,实验表明其在MathVision基准上准确率优于GPT-4o。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07479 2026-04-10 math.OC cs.GT cs.SY econ.TH eess.SY 75%

Linearly Solvable Continuous-Time General-Sum Stochastic Differential Games

可线性求解的连续时间一般和随机微分博弈

Monika Tomar, Takashi Tanaka

专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 本文提出了一类可线性求解的连续时间有限参与者随机一般和微分博弈,通过精确的线性PDE系统求解。利用交叉对数似然比构建分布规划博弈,解决多智能体空间冲突问题,通过广义多元Cole-Hopf变换将非线性HJB方程转化为线性偏微分方程,实现高效的反馈纳什均衡策略计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08203 2026-04-10 cs.CV cs.AI 74%

MedVR: Annotation-Free Medical Visual Reasoning via Agentic Reinforcement Learning

MedVR:通过代理强化学习实现无标注的医学视觉推理

Zheng Jiang, Heng Guo, Chengyu Fang, Changchen Xiao, Xinyang Hu, Lifeng Sun, Minfeng Xu

机构 * Tsinghua University(清华大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Key Laboratory of Pervasive Computing, Ministry of Education(教育部普适计算重点实验室) Zhejiang University(浙江大学)

专题命中 规划决策 :agentic(title);分类 cs.AI

AI总结 MedVR通过代理强化学习实现无标注的医学视觉推理,利用熵引导的视觉重定位和基于共识的信用分配机制,在多个公开医学VQA基准上取得最佳性能,提升医疗AI的鲁棒性和透明度。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08605 2026-04-10 cs.CL cs.CY cs.HC cs.MA cs.MM 74%

Mina: A Multilingual LLM-Powered Legal Assistant Agent for Bangladesh for Empowering Access to Justice

Mina:一种多语言大语言模型驱动的法律助理代理,用于孟加拉国,以促进获得正义

Azmine Toushik Wasi, Wahid Faisal, Mst Rafia Islam, Md Rizwan Parvez

专题命中 规划决策 :agent(title);分类 cs.CL

AI总结 Mina通过多语言嵌入和基于RAG的工具链框架,为孟加拉国提供多语言法律助理服务,实现法律文书、引文和通俗解释的生成,经评估在法律考试中表现优异,成本显著降低。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08401 2026-04-10 cs.AI cs.CL 73%

Verify Before You Commit: Towards Faithful Reasoning in LLM Agents via Self-Auditing

在提交前验证:通过自我审计实现LLM代理中的忠实推理

Wenhao Yuan, Chenchen Lin, Jian Chen, Jinfeng Xu, Xuehe Wang, Edith Cheuk Han Ngai

机构 * The University of Hong Kong(香港大学) Sun Yat-sen University(中山大学)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出SAVeR框架,通过在行动承诺前验证内部信念状态,提升LLM代理的推理忠实性,实验表明其在保持任务性能的同时提升了推理可靠性。

Comments Accepted by ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08065 2026-04-10 cs.LG 70%

Multimodal Latent Reasoning via Predictive Embeddings

通过预测嵌入进行多模态潜在推理

Ashutosh Adhikari, Mirella Lapata

专题命中 规划决策 :tool use(abstract);tool-use(abstract);分类 cs.LG

AI总结 本文提出Pearl框架,通过学习专家工具使用轨迹在潜在空间中进行多模态推理,无需显式调用工具,优于传统重建方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21354 2026-04-10 cs.LG cs.DC 70%

The Workload-Router-Pool Architecture for LLM Inference Optimization: A Vision Paper from the vLLM Semantic Router Project

面向LLM推理优化的负载-路由-池架构:来自vLLM语义路由项目的愿景论文

Huamin Chen, Xunzhuo Liu, Bowei He, Fuyuan Lyu, Yankai Chen, Xue Liu, Yuhan Liu, Junchen Jiang

机构 * McGill University(麦吉尔大学) University of Chicago(芝加哥大学)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.LG

AI总结 本文提出Workload-Router-Pool架构,通过负载、路由、池三个维度优化LLM推理,结合路由策略与负载特征,解决多任务、多模态、多代理场景下的推理效率与安全性问题。

Comments Vision Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08509 2026-04-10 cs.CV cs.RO 67%

Visually-grounded Humanoid Agents

基于视觉的人形代理

Hang Ye, Xiaoxuan Ma, Fan Lu, Wayne Wu, Kwan-Yee Lin, Yizhou Wang

机构 * Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Tongji University(同济大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of Michigan(密歇根大学)

专题命中 规划决策 :agent(abstract);planning(abstract)

AI总结 本文提出基于视觉的人形代理,通过两层架构实现自主行为,解决数字人主动行为在新环境中的问题,提升任务成功率和减少碰撞。

Comments Project page: https://alvinyh.github.io/VGHuman/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06618 2026-04-10 cs.CR 67%

PoC-Adapt: Semantic-Aware Automated Vulnerability Reproduction with LLM Multi-Agents and Reinforcement Learning-Driven Adaptive Policy

PoC-Adapt: 基于语义的自动漏洞重现与LLM多智能体及强化学习驱动的自适应策略

Phan The Duy, Khoa Ngo-Khanh, Nguyen Huu Quyen, Van-Hau Pham

专题命中 规划决策 :agent(abstract);multi-agent(abstract)

AI总结 本文提出PoC-Adapt框架,通过语义运行时验证和自适应策略学习,提升漏洞重现的可靠性并降低生成成本,实验表明其在CWE-Bench-Java和PrimeVul基准上验证可靠性和效率提升显著。

Comments 16 pages, abstracted and meta updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01804 2026-04-10 cs.CL cs.AI cs.LG 67%

$\texttt{SEM-CTRL}$: Semantically Controlled Decoding

SEM-CTRL:语义控制解码

Mohammad Albinhassan, Pranava Madhyastha, Alessandra Russo

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出SEM-CTRL,通过集成基于答案集语法的约束,使LLM在不微调的情况下保证输出的语法和语义正确性,实验显示其在多种任务中优于现有模型。

Comments Published in Transactions on Machine Learning Research (TMLR), 03/2026

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06925 2026-04-10 cs.MM 67%

LungCURE: Benchmarking Multimodal Real-World Clinical Reasoning for Precision Lung Cancer Diagnosis and Treatment

LungCURE:多模态真实世界临床推理基准测试用于精准肺癌诊断与治疗

Fangyu Hao, Jiayu Yang, Yifan Zhu, Zijun Yu, Qicen Wu, Wang Yunlong, Jiawei Li, Yulin Liu, Xu Zeng, Guanting Chen, Shihao Li, Zhonghong Ou, Meina Song, Mengyang Sun, Haoran Luo, Yu Shi, Yingyi Wang

专题命中 规划决策 :agent(abstract);multi-agent(abstract)

AI总结 本文提出LungCURE基准测试,通过1000个真实世界病例评估多模态模型在肺癌TNM分期、治疗推荐和临床决策支持中的性能,并引入LCAgent框架提升模型在复杂医疗场景中的推理能力。

Comments 20 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08369 2026-04-10 cs.AI cs.CL cs.MA 62%

Don't Overthink It: Inter-Rollout Action Agreement as a Free Adaptive-Compute Signal for LLM Agents

不要过度思考:跨回合动作一致性作为LLM代理的自由自适应计算信号

Khushal Sethi

机构 * Stanford University(斯坦福大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 TrACE通过测量跨回合动作一致性,实现LLM代理的自适应计算分配,无需训练或外部验证,在多步序列决策任务中提升效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07752 2026-04-10 cs.SE cs.AI 62%

MIMIC-Py: An Extensible Tool for Personality-Driven Automated Game Testing with Large Language Models

MIMIC-Py:一种基于人格驱动的大型语言模型自动游戏测试工具

Yifei Chen, Sarra Habchi, Lili Wei

机构 * Electrical and Computer Engineering, McGill University(麦吉尔大学电气与计算机工程系)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.SE

AI总结 MIMIC-Py通过模块化架构实现人格驱动LLM代理的可重用性和扩展性,支持多种交互机制,降低新游戏环境部署难度。

Comments 10 pages, Accepted by FSE Companion '26, July 5--9, 2026, Montreal, QC, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07426 2026-04-10 cs.LG cs.AI 62%

GIRL: Generative Imagination Reinforcement Learning via Information-Theoretic Hallucination Control

GIRL:通过信息论幻觉控制实现生成性想象强化学习

Prakul Sunil Hiremath

机构 * Department of Computer Science and Engineering, Visvesvaraya Technological University (VTU), Belagavi, India(维斯瓦拉亚科技大学计算机科学与工程系,贝拉加维,印度) Aliens on Earth (AoE) Autonomous Research Group, Belagavi, India(地球外星人自主研究组,贝拉加维,印度)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 GIRL通过引入跨模态锚定信号和不确定性适应信任区域瓶颈,解决模型误差累积导致的轨迹漂移问题,提升长周期任务的样本效率和回报性能。

Comments 20 pages, 2 figures, 7 tables; reinforcement learning, world models

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07415 2026-04-10 cs.IR cs.AI cs.CL 62%

SubSearch: Intermediate Rewards for Unsupervised Guided Reasoning in Complex Retrieval

SubSearch:复杂检索中无监督引导推理的中间奖励

Roxana Petcu, Evangelos Kanoulas, Maarten de Rijke

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 SubSearch通过引入内部奖励信号,提升复杂检索中推理的鲁棒性,无需外部监督,实现更高效的多步推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17732 2026-04-10 cs.CV cs.AI cs.LG 62%

RQR3D: Reparametrizing the regression targets for BEV-based 3D object detection

RQR3D:基于鸟瞰图的3D目标检测的回归目标重新参数化

Ozsel Kilinc, Cem Tarhan

机构 * Amazon Lab 126(亚马逊126实验室) Togg/Trutek AI Team(Togg/Trutek人工智能团队)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RQR3D方法,通过重新参数化回归目标将旋转目标检测转化为关键点回归任务,实现高效且准确的3D目标检测,适用于自动驾驶场景。

Comments To appear in proceedings of CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04500 2026-04-10 cs.AI cs.RO 61%

"Don't Do That!": Guiding Embodied Systems through Large Language Model-based Constraint Generation

别这样做!

Amin Seffo, Aladin Djuhera, Masataro Asai, Holger Boche

机构 * Technical University Munich(慕尼黑工业大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 规划决策 :planning(abstract);分类 cs.AI;agentic(comments)

AI总结 本文提出STPR框架,利用LLM将自然语言中的约束转化为可执行Python代码,解决复杂约束的翻译问题,并在仿真环境中验证其高效性和兼容性。

Comments ICLR 2026 Workshop -- Agentic AI in the Wild: From Hallucinations to Reliable Autonomy

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08232 2026-04-10 cs.AI 57%

HiRO-Nav: Hybrid ReasOning Enables Efficient Embodied Navigation

HiRO-Nav:混合推理实现高效具身导航

He Zhao, Yijun Yang, Zichuan Lin, Deheng Ye, Chunyan Miao

机构 * Nanyang Technological University(南洋理工大学) Tencent(腾讯) Independent Researcher(独立研究员)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 HiRO-Nav通过混合推理策略,在导航任务中根据动作熵动态决定是否进行推理,提升决策质量并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08036 2026-04-10 cs.LG cs.RO 57%

PriPG-RL: Privileged Planner-Guided Reinforcement Learning for Partially Observable Systems with Anytime-Feasible MPC

PriPG-RL:特权规划器引导的强化学习用于部分可观测系统的任何时间可行MPC

Mohsen Amiri, Mohsen Amiri, Ali Beikmohammadi, Sindri Magnuśson, Mehdi Hosseinzadeh

机构 * Stockholm University(斯德哥尔摩大学) Washington State University(华盛顿州立大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 本文提出PriPG-RL方法,通过在训练期间独有的特权规划器代理,解决部分可观测系统的强化学习策略训练问题。方法结合了任何时间可行的MPC算法和P2P-SAC算法,提升样本效率和最终策略性能。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08033 2026-04-10 cs.AI cs.MA cs.NI 57%

IoT-Brain: Grounding LLMs for Semantic-Spatial Sensor Scheduling

IoT-Brain:为语义-空间传感器调度 grounding LLMs

Zhaomeng Zhou, Lan Zhang, Junyang Wang, Mu Yuan, Junda Lin, Jinke Song

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出IoT-Brain系统,通过引入空间轨迹图(STG)解决LLM在语义-空间传感器调度中的表示、推理和优化缺陷,提升任务成功率37.6%并显著降低资源消耗。

Comments To appear in ACM MobiCom 2026; 13 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏