arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-02 至 2026-06-02 共收录 432 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 144 篇

2510.00615 2026-06-02 cs.AI cs.CL 73%

ACON: Optimizing Context Compression for Long-horizon LLM Agents

ACON:面向长周期LLM智能体的上下文压缩优化

Minki Kang, Wei-Ning Chen, Dongge Han, Huseyin A. Inan, Lukas Wutschitz, Yanzhi Chen, Robert Sim, Saravan Rajmohan

机构 * University of Washington(华盛顿大学)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出ACON框架,通过自然语言空间优化压缩策略,在不微调模型的情况下减少峰值token使用量26-54%并提升任务成功率,同时可蒸馏至小模型。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02304 2026-06-02 cs.CL 70%

Unified Context Evolution for LLM Agents

统一上下文演化:面向LLM智能体

Zixuan Zhu, Yitong Hu, Yong Dai, Junfeng Fang, Chunyang Jiang, Senkang Hu, Yuzhi Zhao

专题命中 规划决策 :agent(abstract);workflow(abstract);分类 cs.CL

AI总结 提出统一上下文演化(UCE)框架,通过将智能体经验外部化为四种类型的可演化上下文单元(ECU),实现跨任务的知识积累与动态调度,在ALFWorld和WebShop上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01041 2026-06-02 cs.CL 70%

ExpWeaver: LLM Agents Learn from Experience via Latent RAG

ExpWeaver: LLM智能体通过潜在RAG从经验中学习

Tao Feng, Tianyang Luo, Jingjun Xu, Zhigang Hua, Yan Xie, Shuang Yang, Ge Liu, Jiaxuan You

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.CL

AI总结 提出ExpWeaver框架,利用潜在检索增强生成(无独立RAG模块)使LLM智能体从经验中学习,通过隐藏状态编码经验、潜在空间检索和交叉注意力聚合,在13个任务中12个达到最优,token效率高且跨域泛化强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12109 2026-06-02 cs.AI 70%

On Information Self-Locking in Reinforcement Learning for Active Reasoning of LLM agents

强化学习中信息自锁现象及其在LLM智能体主动推理中的应用

Deyu Zou, Yongqiang Chen, Fan Feng, Mufei Li, Pan Li, Yu Gong, James Cheng

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 针对LLM智能体在主动推理中因强化学习导致的信息自锁问题,提出基于优势重加权的方法AREW,通过方向性批评重新分配轨迹信用,显著提升智能体性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02433 2026-06-02 cs.IR cs.AI cs.CL cs.LG cs.MA 67%

ODTQA-FoRe: An Open-Domain Tabular Question Answering Dataset for Future Data Forecasting and Reasoning

ODTQA-FoRe:面向未来数据预测与推理的开放域表格问答数据集

Zhensheng Wang, Xiaole Liu, Wenmian Yang, Kun Zhou, Yiquan Zhang, Weijia Jia

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Institute of Artificial Intelligence and Future Networks, Beijing Normal University(北京师范大学人工智能与未来网络研究院) Faculty of Arts and Sciences, Beijing Normal University(北京师范大学文理学院) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出开放域表格问答的未来预测与推理任务,并构建首个覆盖时间序列预测和基于预测推理的数据集,通过基于LLM代理的TimeFore框架(检索器、预测器、分析器)解决历史数据检索、预测限制和响应标准化挑战。

Comments This paper has been accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02059 2026-06-02 stat.ME 67%

ICCDesign: An R Package for the Design and Analysis of ICC-Based Reliability Studies with Continuous Responses

ICCDesign: 用于连续响应基于ICC的可靠性研究设计与分析的R包

Ziyu Liu, Ruilin Ma, Yundan Zhang, Chenge Gao

专题命中 规划决策 :planning(abstract);workflow(abstract)

AI总结 本文介绍ICCDesign R包,它整合了基于ICC的可靠性研究中的点估计、置信区间、假设检验、样本量规划和可靠性评估功能,并提供交互式Shiny应用。

Comments 22 pages, 3 tables, R package

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01565 2026-06-02 cs.RO cs.CV 67%

Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation

层级语义增强导航:面向视觉语言导航的最优传输与图驱动推理

Xiang Fang, Wanlong Fang, Changshuo Wang

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(新加坡南洋理工大学交叉学科研究生项目) University College London(伦敦大学学院)

专题命中 规划决策 :autonomous agent(abstract);planning(abstract)

AI总结 提出层级语义增强导航框架,通过动态层级语义场景图、基于最优传输的拓扑规划器与图感知强化学习策略,解决连续环境中的视觉语言导航难题,实现最优性能。

Comments Published in NeurIPS 2025, address some typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01147 2026-06-02 cs.CG 67%

On Fréchet Traveling Salesmen Problems

关于Fréchet旅行商问题

Omrit Filtser, Tzalik Maimon, Michal Moiseev

专题命中 规划决策 :agent(abstract);planning(abstract)

AI总结 研究在给定点集上构造两条曲线,使得它们之间的Fréchet距离最小,并提出了离散Fréchet距离下的近线性算法,证明了连续Fréchet距离下问题的NP难性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01089 2026-06-02 cond-mat.mtrl-sci 67%

A literature-grounded scientific reasoning framework for defect-engineered TiO$_{2}$ photocatalysts

缺陷工程TiO$_{2}$光催化剂的一个基于文献的科学推理框架

F. J. Dominguez-Gutierrez, E. Wierzbicka

专题命中 规划决策 :agent(abstract);AI agent(abstract)

AI总结 针对缺陷工程TiO$_2$光催化剂文献异质性问题,提出一个结合文献数据、机理规则和检索增强推理的LLM辅助科学推理框架,用于推荐最优缺陷工程条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00828 2026-06-02 cs.CV 67%

RoboStressBench: Benchmarking VLM Robustness to Physical Visual Stress in Embodied Scenes

RoboStressBench: 在具身场景中基准测试VLM对物理视觉压力的鲁棒性

Leyi Wu, Yifan Zhao, Jinjie Zhang, Suzeyu Chen, Wosong Chen, Zhifei Chen, Tianshuo Xu, Qingchun He, Hongxin Hu, Haojian Huang, Yangkai Wei, Wenqian Li, Yinchuan Li, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 规划决策 :planning(abstract);agentic(abstract)

AI总结 本文提出RoboStressBench,从逆图形学角度将视觉压力分解为材质、视角、光照和几何四个物理维度,系统评估VLM在真实物理压力下的鲁棒性,并引入压力感知求解器提升高压力场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00825 2026-06-02 cs.CV cs.ET cs.HC cs.MA 67%

SuperMemory-VQA: An Egocentric Visual Question-Answering Benchmark for Long-Horizon Memory

SuperMemory-VQA:面向长期记忆的自我中心视觉问答基准

Samiul Alam, Shakhrul Iman Siam, Michael J. Proulx, James Fort, Richard Newcombe, Hyo Jin Kim, Mi Zhang

机构 * The Ohio State University(俄亥俄州立大学) Meta Project(Meta项目)

专题命中 规划决策 :AI agent(abstract);agentic(abstract)

AI总结 提出SuperMemory-VQA数据集,包含52.9小时AI眼镜录制的日常活动及4853个多选问答对,用于评估AI助手在长期记忆任务上的表现,发现现有系统可靠性不足。

Comments 34 pages, 21 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27458 2026-06-02 cs.CV cs.AI cs.CL cs.LG 67%

Generic Interpretation Approach for Transformer Models Incorporating Heterogenous Attention Structures

融合异质注意力结构的Transformer模型通用解释方法

Yongjin Cui, Xiaohui Fan, Huajun Chen

机构 * Zhejiang University(浙江大学)

专题命中 规划决策 :agent(abstract_cn);分类 cs.AI、cs.CL、cs.LG

AI总结 针对Transformer中异质注意力结构(如共注意力)带来的多源信息融合挑战,提出一种通用解释方法,并通过实验分析范式对代表性模型进行语义和逻辑解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11477 2026-06-02 cs.CY 67%

rt2gtfs: A scalable framework for correcting public transport timetables using real-time data for accessibility analysis

rt2gtfs: 一种利用实时数据校正公共交通时刻表以进行可达性分析的可扩展框架

Zihao Chen, Federico Botta

专题命中 规划决策 :planning(abstract);workflow(abstract)

AI总结 提出 rt2gtfs 开源 Python 包,通过高频车辆位置数据重建经验时刻表,支持可配置、可扩展的工作流,用于可达性分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04069 2026-06-02 cs.CV cs.RO 67%

SpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RL

SpaceTools: 通过双交互强化学习实现工具增强的空间推理

Siyi Chen, Mikaela Angelina Uy, Chan Hee Song, Faisal Ladhak, Adithyavairavan Murali, Qing Qu, Stan Birchfield, Valts Blukis, Jonathan Tremblay

机构 * NVIDIA University of Michigan(密歇根大学)

专题命中 规划决策 :tool-use(abstract);agentic(abstract)

AI总结 提出双交互强化学习(DIRL)框架,通过两阶段训练让视觉语言模型学会协调多种工具(如深度估计、分割、姿态估计)进行精确空间推理,在多个基准上达到最优性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02120 2026-06-02 cs.CV cs.AI cs.LG 62%

Understanding-Enhanced Model Collaboration for Long-Tailed Egocentric Mistake Detection

理解增强的模型协作用于长尾自我中心错误检测

Boyu Han, Qianqian Xu, Shilong Bao, Zhiyong Yang, Ruochen Cui, Qingming Huang

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) School of Computer Science and Tech., University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Information Engineering, CAS(信息工程研究所,中国科学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 规划决策 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出理解增强的模型协作方法(UE-MCM),结合粗粒度视频理解与细粒度动作推理,通过双分支模型和自适应融合门检测自我中心视频中的错误,并优化长尾分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02011 2026-06-02 cs.AI cs.LG 62%

Extreme Low-Bit Inference in Reasoning Models: Failure Modes and Targeted Recovery

推理模型中的极端低位推理:失败模式与针对性恢复

Ekaterina Alimaskina, Darya Rudas, Denis Shveykin, Gleb Molodtsov, Pavel Vasiliev, Aleksandr Beznosikov

机构 * University of Washington(华盛顿大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对大型推理模型在2位量化推理中因生成不稳定导致总token数膨胀而无法实现端到端加速的问题,提出轻量级FP16规划和循环救援两种控制方法,显著恢复模型精度并保持实际速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01281 2026-06-02 cs.LG cs.AI 62%

RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning

RLVR 无需无效样本:面向 LLM 推理的群体优先级离策略优化

Yixiu Mao, Yun Qu, Qi Wang, Heming Zou, Xiangyang Ji

机构 * Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对强化学习中无效样本导致学习信号不足的问题,提出群体优先级离策略优化(POPO),通过优先级群体重放和解耦重要性采样,在不增加额外采样开销的情况下提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01182 2026-06-02 cs.CL cs.AI 62%

CA-BED: Conversation-Aware Bayesian Experimental Design

CA-BED:对话感知的贝叶斯实验设计

Daniel Arnould, Rashad Aziz, Zixuan Kang, Tanav Changal, Kevin Zhu, Sunishchal Dev, Gabriel Grand, Shreyas Sunil Kulkarni

机构 * University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) University of Toronto(多伦多大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 提出对话感知的贝叶斯实验设计(CA-BED),一种推理时概率对话规划框架,通过结合贝叶斯实验设计与LLM似然估计,在多个对话轮次中优化问题选择,在结构化实体推断基准上平均成功率提升21.8%,仅增加1.8轮对话。

Comments Reliable Autonomy Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01099 2026-06-02 cs.CL cs.AI 62%

MiCU: End-to-End Smart Home Command Understanding with Large Language Model

MiCU: 基于大语言模型的端到端智能家居指令理解

Haowei Han, Kexin Hu, Weiwei Cai, Debiao Zhang, Bin Qin, Yuxiang Wang, Jiawei Jiang, Xiao Yan, Bo Du

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Xiaomi Corporation(小米公司) Institute for Math & AI, Wuhan University(武汉大学数学与人工智能研究院)

专题命中 规划决策 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 提出MiCU,一种利用课程学习、强化学习和令牌压缩技术的领域特定大语言模型,用于解决智能家居中模糊指令理解问题,平均准确率提升20.01%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01039 2026-06-02 cs.LG cs.AI 62%

OPD+: Rethinking the Advantage Design for On-Policy Distillation

OPD+: 重新思考在线策略蒸馏中的优势设计

Hanyang Zhao, Haoxian Chen, Han Lin, Genta Indra Winata, David Yao, Wenpin Tang

机构 * Columbia University(哥伦比亚大学) Amazon(亚马逊) Meta Capital One

专题命中 规划决策 :tool-use(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OPD+,通过修正在线策略蒸馏中因停止梯度操作导致的奖励目标偏差,并支持多种f-散度,在数学推理和工具使用基准上提升了性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00880 2026-06-02 cs.LG cs.AI 62%

Task diversity produces systematic transfer but inhibits continual reinforcement learning

任务多样性产生系统性迁移但抑制持续强化学习

Purab Seth, Neil Shah, Kunal Jha, Samuel J. Gershman, Max Kleiman-Weiner, Wilka Carvalho

机构 * MIT(麻省理工学院) University of California, Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学) Harvard University(哈佛大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 通过引入GPU加速的持续强化学习领域Banyan,研究任务多样性(地图布局、交互对象、子目标层次结构)对智能体在分布变化下持续学习能力的影响,发现多样性促进局部迁移但导致长期任务性能停滞和遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00561 2026-06-02 cs.LG cs.AI 62%

Interpretable Policy Distillation for Power Grid Topology Control

可解释的策略蒸馏用于电网拓扑控制

Aleksandra Dmitruka, Karlis Freivalds

机构 * University of Latvia, Faculty of Exact Sciences and Technology(拉脱维亚大学,精确科学与技术学院)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出一种将深度强化学习策略蒸馏为轻量级决策树/随机森林的方法,在保持性能的同时提升可解释性,并揭示表征偏移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00095 2026-06-02 cs.CV cs.AI cs.CL cs.RO 62%

Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation

弥合2D-3D鸿沟:面向视觉语言导航的分层语义几何地图

Kailing Li, Tianwen Qian, Lijin Yang, Yuqian Fu, Jingyu Gong, Xiaoling Wang, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Bosch Corporate Research(博世企业研究) King Abdullah University of Science and Technology(卡布斯大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 提出分层语义几何地图(HSGM),将3D几何信息转化为VLM可理解的结构化表示,结合VLM高层语义规划与经典路径规划,实现零样本视觉语言导航,在R2R-CE和RxR-CE基准上达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12652 2026-06-02 cs.LG cs.AI 62%

Multi-Rollout On-Policy Distillation via Peer Successes and Failures

基于同伴成功与失败的多轨迹在线策略蒸馏

Weichen Yu, Xiaomin Li, Yizhou Zhao, Xiaoze Liu, Ruowang Zhang, Haixin Wang, Yinyi Luo, Chen Henry Wu, Gaurav Mittal, Matt Fredrikson, Yu Hu

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软) Purdue University(普渡大学)

专题命中 规划决策 :tool-use(abstract);分类 cs.AI、cs.LG

AI总结 提出多轨迹在线策略蒸馏(MOPD),利用学生模型的本地轨迹组构造更丰富的教师信号,通过同伴成功与失败条件化提升蒸馏效果。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02650 2026-06-02 cs.LG cs.AI cs.RO 62%

Improving Diffusion Planners by Self-Supervised Action Gating with Energies

通过自监督动作能量门控改进扩散规划器

Yuan Lu, Dongqi Han, Yansen Wang, Dongsheng Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出SAGE方法,利用潜在一致性信号在推理时重新排序轨迹,惩罚动态不一致的计划,从而提升扩散规划器的性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08236 2026-06-02 cs.CV cs.AI cs.CL 62%

When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning

何时想象以及想象多少:基于世界模型的自适应测试时缩放用于视觉空间推理

Shoubin Yu, Yue Zhang, Zun Wang, Jaehong Yoon, Huaxiu Yao, Mingyu Ding, Mohit Bansal

机构 * University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) Nanyang Technological University(南洋理工大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 本文提出自适应测试时框架AVIC/AVIC-R,通过世界模型选择性调用和缩放视觉想象,在空间推理中平衡准确性与效率,超越GPT-4o等基线。

Comments the first two authors are equally contributed. Project page: https://adaptive-visual-tts.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01962 2026-06-02 cs.LG cs.AI 62%

Zero-Shot Off-Policy Learning

零样本离策略学习

Arip Asadulaev, Maksim Bobrin, Salem Lahlou, Dmitry Dylov, Fakhri Karray, Martin Takac

机构 * Arip Asadulaev(阿里普·阿萨杜拉耶夫) Maksim Bobrin(马克西姆·博布林) Salem Lahlou(萨勒姆·拉洛) Dmitry Dylov(德米特里·达里夫) Fakhri Karray(法赫里·卡里) Martin Takac(马尔 tin 塔卡)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文通过发现后继度量与平稳密度比的理论联系,提出一种零样本离策略学习算法,能够实时推断最优重要性采样比率并进行平稳分布修正,实现无需额外训练即可适应新任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06093 2026-06-02 cs.DB cond-mat.mtrl-sci cs.AI cs.CL 62%

Language-Native Materials Processing Design by Lightly Structured Text Database and Reasoning Large Language Model

基于轻结构化文本数据库和推理大语言模型的自然语言材料加工设计

Yuze Liu, Zhaoyuan Zhang, Xiangsheng Zeng, Yihe Zhang, Leping Yu, Liu Yang, Lejia Wang, Xi Yu

机构 * State Key Laboratory of Advanced Materials for Intelligent Sensing, Key Laboratory of Organic Integrated Circuit, Ministry of Education & Tianjin Key Laboratory of Molecular Optoelectronic Sciences, Department of Chemistry, School of Science, Tianjin University(智能传感先进材料国家重点实验室、有机集成电路重点实验室、教育部、天津分子光电子科学重点实验室、化学系、天津大学) Language Intelligence Technology Co., Ltd.(语言智能技术有限公司) College of Intelligence and Computing, Tianjin University(智能与计算学院、天津大学) School of Materials and Chemical Engineering, Ningbo University of Technology(材料与化学工程学院、宁波工业大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 将材料合成规划重构为文本推理问题,通过轻结构化知识基底结合检索增强生成与经验增强推理,在氮化硼纳米片剥离中三轮迭代获得高质量协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18333 2026-06-02 cs.RO cs.AI cs.LG 62%

Reinforcement Learning Position Control of a Quadrotor Using Soft Actor-Critic (SAC)

基于软演员-评论家(SAC)的四旋翼强化学习位置控制

Youssef Mahran, Zeyad Gamal, Ayman El-Badawy

机构 * Mechatronics Engineering Department(机械电子工程系) The German University in Cairo(埃及德国大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于强化学习的四旋翼推力矢量控制架构,使用软演员-评论家算法训练,相比传统RPM控制器训练更快、路径跟踪更平滑准确。

Comments This is the Author Accepted Manuscript version of a paper accepted for publication. The final published version is available via IEEE Xplore

Journal ref 2024 IEEE 6th Novel Intelligent and Leading Emerging Sciences Conference (NILES)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13356 2026-06-02 cs.RO cs.AI cs.LG 62%

Control of a Twin Rotor using Twin Delayed Deep Deterministic Policy Gradient (TD3)

使用双延迟深度确定性策略梯度(TD3)控制双旋翼系统

Zeyad Gamal, Youssef Mahran, Ayman El-Badawy

机构 * Mechatronics Engineering Department(机械电子工程系) The German University in Cairo(埃及德国大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出基于TD3算法的强化学习框架,用于控制双旋翼气动系统在俯仰和方位角上的稳定与轨迹跟踪,仿真和实验验证了其优于传统PID控制器的抗干扰能力。

Comments This is the Author Accepted Manuscript version of a paper accepted for publication. The final published version is available via IEEE Xplore

Journal ref 2024 28th IEEE International Conference on System Theory, Control and Computing (ICSTCC)

详情

展开后加载摘要…

URL PDF HTML 收藏