arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6571 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 1893 篇

2608.13179 2026-08-14 cs.AI 新提交 57%

Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents

学习幅度而非方向:面向多轮多步骤大语言模型智能体的验证器约束信用分配

Zechuan Wang, Siyuan Lu, Hongxuan Zhang, Linjian Mo, Chenyi Zhuang, Leilei Gan

专题命中 规划决策 :tool-use(abstract);分类 cs.AI

AI总结 该研究提出CrEST分层信用分配框架,保留RL的验证器约束上限并结合自我教师的密集token级信号,在BFCL V3和WildToolBench上优于基线,可简化教师在策略优化中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12851 2026-08-14 cs.AI 新提交 57%

Practice Makes Unsafe: Skill Misevolution in Self-Improving LLM Agents

熟能生险:自我改进的大语言模型智能体中的技能误演化

Xutao Mao, Liangjie Zhao, Xiang Zheng, Cong Wang

机构 * Adelaide University(阿德莱德大学) City University of Hong Kong(香港城市大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 该研究针对自我改进LLM智能体的技能误演化问题,构建SkillMisevo-Gym与SkillMisevo-Bench基准,提出SafeEvolve方法,可显著降低不安全检索与新会话危害,同时对良性效用影响极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12548 2026-08-14 cs.HC cs.LG eess.SP 新提交 57%

Analysis of Motor Signatures of Social Adaptation in Autism for Efficient Human-Centric Systems

自闭症社会适应的运动特征分析——面向高效的以人为中心的系统

Lara Pereira, Teresa Sousa, Miguel Castelo-Branco, João Ruivo Paulo

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本研究通过分析舞蹈模仿任务的运动数据,提出SCSI指数,以79.2%的平衡准确率区分自闭症与神经典型成人,发现社会情境敏感性可作为自闭症运动行为的生物标志物,为开发包容性以人为中心技术提供支撑。

Comments Accepted at IEEE SMC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11223 2026-08-13 stat.AP cs.LG cs.SY eess.SY stat.ML 新提交 57%

Transit Destination Inference from Tap-In-Only Bus Smart-Card Data: A Hierarchical Bayesian Approach

仅刷卡进站的公交智能卡数据的出行目的地推断:一种分层贝叶斯方法

Gefei Zhao, Jiahe Ling, Yuelong Su

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 针对仅刷卡进站公交智能卡数据无法构建OD矩阵的问题,本研究提出分层贝叶斯潜在目的地(HBLD)模型,结合多类数据推断出行目的地,经评估其表现优于基线,可生成不确定性感知的OD矩阵用于公交相关管理工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12274 2026-08-13 cs.CV cs.AI 新提交 57%

A Neighborhood Attention Transformer Network for Enhanced 3D Segmentation of the Left Anterior Descending Artery

用于增强左前降动脉三维分割的邻域注意力Transformer网络

Rafi Ibn Sultan, Chengyin Li, Yiannos Demetriou, Ahmed I. Ghanem, Joshua P. Kim, Justine Cunningham, Hassan Bagher-Ebadian, Dongxiao Zhu, Kundan S. Thind

机构 * Wayne State University(韦恩州立大学) Henry Ford Health(亨利福特医疗集团) Alexandria University(亚历山大大学) Michigan State University(密歇根州立大学) Oakland University(奥克兰大学) Institute for AI and Data Science, Wayne State University(韦恩州立大学人工智能与数据科学学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 该研究提出NA-UNETR模型,结合邻域注意力等模块,经预训练和LoRA微调,在低对比度CT中提升左前降动脉分割精度,为放疗规划提供高效心脏亚结构分割框架。

Comments Acceteed by Medical Physics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12273 2026-08-13 cs.CR cs.AI 新提交 57%

Convergent Detour Hijacking: Task-Preserving Resource Amplification in Skill-Based LLM Agents

收敛式绕路劫持:基于技能的大语言模型智能体中的任务保留型资源放大

Junliang Liu, Ruoyu Li, Wenxin Tang, Jingyu Xiao, Zhenyu Liu, Jingheng Xu, Laizhong Cui

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 该研究提出收敛式绕路劫持攻击,耦合LLM智能体技能选择与规划阶段,可放大任务资源消耗,在DeepSeek-V4-Pro上80.02%的任务会被选中攻击者控制的协调器,任务完成率不变但成本显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12063 2026-08-13 cs.RO cs.AI 新提交 57%

Learning Loco-Manipulation From SMPC Demonstrations With Sparse Offline-to-Online RL

基于稀疏离线到在线强化学习从SMPC演示中学习移动操作

Martin Schuck, Maks Sorokin, Simone Manni, Duy Ta, Angela P. Schoellig, Marco Hutter, Simon Le Cleac'H, Jan Brüdigam

机构 * RAI Institute(RAI研究所) Technical University of Munich(慕尼黑工业大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本研究利用仿真中SMPC生成的离线数据,结合稀疏奖励训练离策略RL智能体,整合动态稳定性控制器,实现机器人移动操作技能的仿真到真实迁移,性能超越原最优控制方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11415 2026-08-13 cs.IR cs.AI 新提交 57%

TRACES: A Benchmark for Epistemic Reliability in Scientific Reasoning by LLMs

TRACES:用于评估大型语言模型科学推理中认知可靠性的基准

Valentin Rodionov, Shamil Assylbekov

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 该研究构建了名为TRACES的基准,发现30种大型语言模型在识别42篇不可靠科学论文的认知可靠性时表现不佳,仅少数模型能有效拒绝有缺陷前提,凸显科学部署需护栏。

Comments 16 pages + appendices. 4 figures in the main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11247 2026-08-13 cs.AI cs.MA 新提交 57%

Conformity Mitigations in Large Language Models Lie on a Single Resistance-Receptivity Frontier

大语言模型中的从众效应缓解措施存在于单一的抵抗-接受边界上

Zafar Hussain, Kristoffer Nielbo

机构 * Aarhus University(奥胡斯大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 该研究针对大语言模型的从众效应,提出抵抗-接受双维度评估,发现多数缓解措施存在此消彼长的边界,仅Reasoning可同时提升抵抗性与接受性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11152 2026-08-12 cs.DC cs.LG 新提交 57%

Scheduling Mixed RL Rollouts Beyond Prefix Locality

超越前缀局部性的混合强化学习回滚调度

Zetao Hong, Song Yuan, Yuanhao Ding, Yibo Zhu, Daxin Jiang, Zhibin Wang, Chen Tian

专题命中 规划决策 :agentic(abstract);分类 cs.LG

AI总结 针对混合RL回滚调度的异构性问题,提出MISA-T策略,在多基准实验中显著提升回滚吞吐量并降低平均轮次时间,同时维持缓存命中率与工作负载混合比例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11083 2026-08-12 cs.NI cs.LG 新提交 57%

A Systematic Sample Size Analysis of ML-Based Path Loss Prediction for LPWAN

面向低功耗广域网(LPWAN)的基于机器学习的路径损耗预测的系统样本量分析

Robert Bitterling, Christian Nettersheim, Jörn Hees, Michael Rademacher

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 该研究针对LPWAN的路径损耗预测,采用结合LiDAR地形特征的随机森林与坐标数据的k近邻,发现两种机器学习模型在不同训练规模下均优于基线模型,且留一网关验证显示随机森林迁移性能更优。

Comments Accepted at IEEE Conference on Local Computer Networks (LCN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10976 2026-08-12 cs.AI 新提交 57%

XCoT-VLA: Executable Chain-of-Thought for Vision-Language-Action Driving

XCoT-VLA:面向视觉-语言-动作自动驾驶的可执行思维链

Foundation Model Team, XPeng Inc

机构 * XPeng Inc(小鹏汽车)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 该研究提出XCoT-VLA,用可执行CoT令牌替代自然语言CoT,结合Reason FFN与Control FFN实现轨迹生成,在自动驾驶任务中降低了误差并满足实时规划要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10920 2026-08-12 cs.AI 新提交 57%

IO Factory: Simulating AI-Enabled Influence Campaigns at Scale

IO Factory:大规模模拟AI驱动的影响力行动

Lukasz Olejnik, Wenchao Dong, Jonas R. Kunst, Signe Riemer-Sørensen, Tobias Herb, Meeyoung Cha, Daniel Thilo Schroeder

机构 * King’s College London(伦敦国王学院) Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所) BI Norwegian Business School(挪威商学院) University of Oslo(奥斯陆大学) SINTEF Digital(SINTEF数字研究所) Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 IO Factory是AI驱动的大规模影响力行动模拟框架,可在受控平台中关联多环节数据,在10万智能体配置下可执行行动并生成可检查证据,支持可重复研究与红队分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10664 2026-08-12 cs.AI 新提交 57%

Operationalising Relative Causal Knowledge: Backbone Identifiability from Private Reports on a Shared Outcome

相对因果知识的可操作化:基于共享结果的私人报告的主干可识别性

Fabrizio Russo, Mark Somers

机构 * Imperial College London(帝国理工学院) Fifty One Degrees Ltd(51度公司)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文研究相对因果知识的主干可识别性,针对双智能体共同效应案例,明确局部因果边际无法唯一确定主干,提出需智能体传递因果识别的响应函数方可实现识别,以教育增值示例说明其兼具通信与政策组合属性。

Comments Accepted at Causal Decision Making Workshop, UAI2026. 4 pages + Appendix (13 total)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10438 2026-08-12 cs.AI 新提交 57%

Continuous Interaction Diffusion: A Diffusion-Native Runtime for Asynchronous Tool-Augmented Reasoning

连续交互扩散:面向异步工具增强推理的原生扩散运行时

Yuhang Cao

机构 * Nanjing University(南京大学)

专题命中 规划决策 :tool use(abstract);分类 cs.AI

AI总结 针对扩散语言模型异步工具增强推理的局限,提出连续交互扩散架构,将工具交互整合至迭代去噪,可提升效率并减少冗余,首次聚焦只读工具。

Comments 15 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10186 2026-08-12 cs.MA cs.AI cs.CY 新提交 57%

The Deliberative Deficit: An Empirical Critique of LLMs in Democratic Discourse

审议缺陷:对大型语言模型在民主讨论中的实证批判

Maurice Flechtner

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 该研究通过审议推理指数(DRI)评估1980次五智能体LLM运行,发现LLM群体讨论程序性质量与人类相当但主体间一致性提升小、视角多样性仅为人类的1/3,反转人类收敛模式,仅可作为人类推理的辅助工具而非自主审议智能体。

Comments 10 pages, archival publication at AIES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10483 2026-08-12 cs.AI cond-mat.mtrl-sci 新提交 57%

Predicting Space Groups of Double Perovskites by LLM with Dynamic Few-Shot Learning

基于动态少样本学习的大语言模型预测双钙钛矿的空间群

Jongwon Park, Inhyo Lee, Junhyeong Lee, Seunghwa Ryu

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 该研究提出基于LLM智能体的DyRIS框架,通过动态少样本检索与规则引导推理,在不平衡双钙钛矿数据集上提升了空间群预测的整体及少数类性能,验证了领域知识与LLM结合的有效性。

Comments 46 pages, 6 figures, Supplementary Information included(24 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09848 2026-08-11 cs.AI 新提交 57%

CEAA: A Cognitive Embodied Agents Architecture for Interactive Computing Systems

CEAA:面向交互式计算系统的认知具身智能体架构

Aimilios Hadjiliasi, Louis Nisiotis

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 该研究针对具身IVAs在实时交互式虚拟环境中实现认知能力的挑战,提出基于Sense-Think-Act等框架的模块化认知架构,弥合高级推理与实时执行的差距,用于部署可扩展的具身IVAs。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09628 2026-08-11 cs.LG cs.RO 新提交 57%

Satellite Trajectory Optimization via Proximal Policy Optimization for Space Debris Avoidance

基于近端策略优化(PPO)的卫星轨道优化用于空间碎片规避

Logan Luna, Juan Ortiz Couder, Raul Alejandro Vargas-Acosta

机构 * Georgia Institute of Technology(佐治亚理工学院) Embry-Riddle Aeronautical University(安柏瑞德航空大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 本研究针对轨道拥堵下卫星碰撞规避难题,提出基于PPO的强化学习策略,经高保真模拟器训练,在GEO任务中碰撞规避成功率达97.5%,优于传统方法,构建了公开可用框架

Comments 18 pages, 16 figures. Published in IEEE Access, vol. 14, pp. 18138-18154, 2026

Journal ref L. Luna, J. Ortiz Couder, and R. A. Vargas-Acosta, "Satellite Trajectory Optimization via Proximal Policy Optimization for Space Debris Avoidance," IEEE Access, vol. 14, pp. 18138-18154, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09564 2026-08-11 cs.CV cs.AI 新提交 57%

From Semantic Grounding to Decision Optimization: A Unified Framework for Long-Horizon UAV Vision-Language Navigation

从语义接地到决策优化:面向长 horizon 无人机视觉语言导航的统一框架

Zeyuan Ma, Jiaxin Chen, Di Huang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文针对无人机视觉语言导航的现有问题,提出统一语义到决策框架,经实验在AerialVLN和OpenFly基准上达到SOTA性能。

Comments 10 pages, 5 figures. Accepted at ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09166 2026-08-11 cs.RO cs.LG stat.ME 新提交 57%

Particle-Based Conformal Prediction for Contact-Aware Uncertainty Calibration in Stratified Configuration Spaces

分层构型空间中接触感知不确定性校准的基于粒子的保形预测

Luís Marques, Kristian Popov, Dmitry Berenson

机构 * University of Michigan(密歇根大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 针对机器人接触障碍物时运动模型不准确、未来构型分布异常的问题,提出CaPTURe算法,实现了接触与非接触场景下的指定覆盖率要求,任务成功率较最佳基线提升30%。

Comments 31 pages, 10 figures, 5 tables. Accepted at COPA 2026 (Conformal and Probabilistic Prediction with Applications). Project page: https://um-arm-lab.github.io/capture/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08561 2026-08-11 cs.AI 新提交 57%

Deep probabilistic logic programming for diagnostic reasoning from incomplete information: A case study in stroke detection

面向不完整信息诊断推理的深度概率逻辑编程:以脑卒中检测为例

Felix Weitkämper, Monchito Avila, Elizabeth Nanjala, Siska, Grace Zawadi

机构 * German University of Digital Science(德国数字科学大学)

专题命中 规划决策 :workflow(abstract);分类 cs.AI

AI总结 本研究以脑卒中检测为案例,提出结合最大熵技术与DeepProbLog的诊断系统构建方法,分析了不完整数据模型的性能及ProbFOIL 2压缩模型的潜力,拓展了神经符号方法在医疗诊断中的应用。

Comments Accepted for presentation at IJCLR 2026. This is the accepted version, _not_ the camera-ready version for the post-proceedings of the conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08389 2026-08-11 cs.AI cs.IR cs.MA 新提交 57%

Not Worth Another Token: Marginal Value Estimation for Efficient Deep Research Agents

不值得再增加一个Token:面向高效深度研究智能体的边际价值估计

Harshitha Kolukuluru, Reshma Ashok, Kirat Arora, Evan William Ciccarelli, Nischal Ashok Kumar, Lunyiu Nie, Franck Dernoncourt, Samyadeep Basu, Ryan A. Rossi, Nedim Lipka

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Adobe Research(奥多比研究院)

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 该研究针对长周期研究智能体的上下文冗余问题,系统比较不同阶段的剪枝策略,发现早期剪枝可大幅降本,轻量级启发式方法能减73%Token用量且质量损失小,为高效智能体设计提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08146 2026-08-11 cs.AI 新提交 57%

Long SKILL Compliance as Logical Reasoning: Closure-Grounded Detection with Scaling-Guided On-Policy Distillation

长SKILL合规性检测作为逻辑推理:基于闭包的检测与尺度引导的在线策略蒸馏

Shuaitao Zhao, Feng Ni, Lichao Ma, Jiaye Lin, Fei Han, Yang Wei, Lu Pan

机构 * Meituan(美团)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 针对长SKILL合规性检测的成本与精度矛盾,提出SkillCDG框架,结合两级检索与依赖闭包实现检测,在多数据集上优于基线,还发现尺度趋势以优化小模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08061 2026-08-11 cs.AI 新提交 57%

CORDA: A Benchmark for Hierarchical Harm-Centric Moral Reasoning in Large Language Models

CORDA:面向大语言模型的以伤害为核心的分层道德推理基准

Siddarth Singh, Victoria Williams, Simon Rosen, Ebenezer Gelo, Helen Sarah Robertson, Ibrahim Suder, Benjamin Rosman, Geraud Nangue Tasse, Steven James

机构 * University of the Witwatersrand(威特沃特斯兰德大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 研究提出CORDA基准,评估大语言模型的以伤害为核心的分层道德推理,发现多数模型优先避免直接个人伤害,部分模型无法遵循指定优先级,该基准填补了LLM道德评估的核心空白。

Comments 8 pages, 6 figures. Accepted at the Fourth International Workshop on Value Engineering in AI (VALE 2026), affiliated with IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08025 2026-08-11 cs.RO cs.AI 新提交 57%

DA-NBV: A Direction-Aware Next-Best-View Planner for Efficient 3D Reconstruction of Ships at Sea

DA-NBV:一种用于海上船舶高效3D重建的方向感知最优下一个视点规划器

Jiaming Chen, Juntao Yang, Zhentao Zou, Qi Ming, Yi Yu, Zhihang Zhong, Xue Yang, Xue Jiang, Yue Zhou

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 针对海上船舶3D重建中现有NBV策略忽略方向观测历史的问题,本文提出DA-NBV策略,结合PAF等方法,在SeaShip-3D数据集与仿真环境下实现了更高效的船舶3D重建性能。

Comments 16pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07994 2026-08-11 cs.AI cs.IR 新提交 57%

VDGR-RAG: Vectors, Directories, Graphs, and Reflection Are All You Need for Unified Reasoning over Hierarchical Enterprise Knowledge

VDGR-RAG:向量、目录、图与反思——统一分层企业知识推理所需的一切

Wenqi Chen, Haofei Yang, Rui Yang, Fangming Li

机构 * Huawei Technologies(华为技术有限公司)

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 针对现有RAG方法在企业知识问答中存在的局限,提出整合向量、目录、图与反思的VDGR-RAG智能体GraphRAG系统,经实验其在召回率和准确率上均优于多种RAG基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07954 2026-08-11 cs.AI 新提交 57%

KGCache: Amortized Subgraph Retrieval for KG Reasoning with LLMs

KGCache:基于大型语言模型的知识图谱推理的摊销子图检索

Uros Stanic, Changcheng Yuan, Sabuj Laskar, Ariful Azad

机构 * Texas A&M University(得克萨斯农工大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本研究针对KGQA中重复检索知识图谱邻域的问题,提出兼容ToG与RoG范式的KGCache,经在WebQSP和CWQ上评估,可显著加速知识图谱检索。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07809 2026-08-11 cs.AI 新提交 57%

CausalNav: Reliability-Certified Causal World Models for Control under Physical-Parameter Shift

CausalNav:用于物理参数偏移下控制的可靠性可验证因果世界模型

Yiyao Zhang, Diksha Goel, Hussain Ahmad, Shixun Huang, Jun Shen

机构 * University of Wollongong(卧龙岗大学) CSIRO’s Data61(联邦科学与工业研究组织Data61) Adelaide University(阿德莱德大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文提出CausalNav控制器,其结合因果转移图与多门控可靠性验证机制,在物理参数偏移的CartPole-v1和Pendulum-v1任务上,较9种基准取得最佳平均排名,关键在于经认证的弃权(不执行)提升了部署安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07725 2026-08-11 cs.LG 新提交 57%

Finite Constant Frontiers and Auditable Regret Certificates for Average-Reward Reinforcement Learning

平均奖励强化学习的有限常数前沿与可审计后悔证书

Ibne Farabi Shihab, Abu Sa-Adat Mohamed Moon-Im Al Ahsan, Md Najmus Swaqeeb

机构 * Iowa State University(爱荷华州立大学) BRAC University(BRAC大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文针对平均奖励强化学习,提出感知常数的比较协议,推导通信MDP的有限下界证书,改进已发表系数,给出跨度约束乐观学习者的可审计组合规则,完成相关形式化与诊断测试。

详情

展开后加载摘要…

URL PDF HTML 收藏