arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-23 至 2026-07-23 共收录 40 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 40 篇

2510.05592 2026-07-23 cs.AI cs.CL cs.LG cs.MA 版本更新 91%

In-the-Flow Agentic System Optimization for Effective Planning and Tool Use

用于有效规划和工具使用的流内智能体系统优化

Zhuofeng Li, Haoxiang Zhang, Seungju Han, Sheng Liu, Jianwen Xie, Yu Zhang, Yejin Choi, James Zou, Pan Lu

机构 * Stanford University(斯坦福大学) Texas A&M University(德克萨斯农工大学) UC San Diego(圣地亚哥大学) Lambda Website(Lambda网站)

专题命中 规划决策 :planning(title,abstract);agentic(title,abstract);tool use(title);分类 cs.AI、cs.CL、cs.LG

AI总结 研究针对大语言模型中工具增强方法的不足,提出可训练的流内智能体框架AgentFlow及Flow-GRPO训练方法,通过协调模块优化规划器,在多基准测试中表现优异,展现流内优化优势。

Comments 47 pages, 12 figures. ICLR 2026 Oral. Project website: https://agentflow.stanford.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19913 2026-07-23 cs.AI cs.CL cs.CR 新提交 84%

JANUS: Foreseeing Latent Risk for Long-Horizon Agent Safety

JANUS:预见长期智能体安全中的潜在风险

Yuan Xiong, Linji Hao, Shizhu He, Yequan Wang, Lijun Li

专题命中 规划决策 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 研究长期智能体安全潜在风险,提出JANUS框架,通过多智能体模拟合成轨迹,经预测与裁决耦合任务学习共享策略,用CoAA-RL联合优化,所产生的Vanguard模型提升了智能体安全防护及任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19595 2026-07-23 cs.CR cs.CL 新提交 83%

Twin Agent: Context Residual Compression for Privilege Separated Agents

孪生智能体:用于特权分离智能体的上下文残差压缩

Zhanhao Hu, Dennis Jacob, Xiao Huang, Zhaorun Chen, Bo Li, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校) University of Chicago(芝加哥大学) University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划决策 :agent(title,abstract);tool use(abstract);分类 cs.CL

AI总结 针对大语言模型智能体易受安全风险问题,提出孪生智能体模式,由探索和安全智能体组成,通过探索智能体传递紧凑提示,减少信息需求,在保持高任务效用的同时防止提示注入攻击,优于其他基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19650 2026-07-23 cs.RO cs.MA 新提交 82%

Remote ID Spoofing-Aware Trajectory Planning for Small Unmanned Aerial Systems

小型无人机系统的远程ID欺骗感知轨迹规划

Jeremiah Webb, Bryce Bjorkman, Abel Diaz Gonzalez, Austin Coursey, Noah Dahle, Kailani Lemieux Mack, Filippos Fotiadis, Gautam Biswas, Bryan C. Ward, Abenezer Taye

专题命中 规划决策 :planning(title,abstract);agent(abstract)

AI总结 针对小型无人机在RID位置欺骗攻击下的轨迹规划问题,提出分散式欺骗感知框架,利用物理层观测评估广播可信度,检测定位欺骗代理,集成到规划器中,仿真显示可减少近空中碰撞事件且保持计算效率。

Comments 9 pages, 3 figures, to be published in IEEE DASC 2026 Conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03648 2026-07-23 cs.AI 版本更新 79%

Agent-Based Modeling of Low-Emission Fertilizer Adoption for Dairy Farm Decarbonisation using Empirical Farm Data

基于代理模型的爱尔兰奶牛场低排放肥料采用情况模拟及脱碳研究

Surya Jayakumar, Kieran Sullivan, John McLaughlin, Christine OMeara, Indrakshi Dey

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 本研究针对奶牛场脱碳问题,提出基于代理模型框架,利用经验数据模拟氮管理和低排放肥料采用情况,计算相关指标并量化不确定性,模型预测准确率高且通过验证,还建立了探索性政策框架。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20289 2026-07-23 cs.RO cs.AI 新提交 79%

Courteous Anticipation: Improving Long-Lived Task Planning in Persistent Shared Environments

礼貌预期:改善持久共享环境中的长期任务规划

Md Ridwan Hossain Talukder, Roshan Dhakal, Elizabeth Phillips, Gregory J. Stein

机构 * George Mason University(乔治梅森大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 研究共享持久环境中机器人任务规划问题,提出礼貌预期规划方法,基于模型规划器联合最小化即时成本与预期未来成本,经独立估计器估计,在家庭和餐厅环境实验中相比其他规划降低了任务序列总成本。

Comments 9 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09988 2026-07-23 cs.IR cs.AI 版本更新 79%

An LLM-powered Agentic Recommendation System for Connected TV Content Discovery

一种用于智能电视内容发现的由大语言模型驱动的智能推荐系统

Lei Shi, Di Wang, Harry Tran, Helsing Xu, Yuchen Lu, Dhara Ghodasara, Wilson Chaney, Xueting Liao, Jerry Yu, Huayu Ding, Reza Mirghaderi, David Fan, Qi Guo, Chongguang He, Warren Wang, Warren Deng, Mingze Gao, Shike Mei, Shuo Tang, Zhe Zhang, Jianming He, Abhishek Kumar, Haotian Wu, Hamed Firooz, Li Li

机构 * Meta

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 针对推荐系统整合上下文信号的挑战,提出用于智能电视内容发现的大语言模型驱动的智能推荐系统,利用其推理能力处理多样信号,采用智能架构协调组件,克服大语言模型用于推荐的实际限制。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20050 2026-07-23 econ.GN cs.AI cs.GT q-fin.EC 版本更新 79%

Information Aggregation with AI Agents

利用AI代理的信息聚合

Spyros Galanis

机构 * Department of Economics, University of Durham(杜伦大学经济学系)

专题命中 规划决策 :AI agent(title,abstract);分类 cs.AI

AI总结 研究通过交易和观察价格波动,探讨大型语言模型能否聚合分散的私人信息,发现信息聚合在信息结构复杂时显著下降,且更智能的AI代理在聚合和盈利方面表现更好。

Comments 62 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02694 2026-07-23 cs.CV cs.AI 版本更新 79%

DocShield: Towards AI Document Safety via Evidence-Grounded Agentic Reasoning

DocShield:通过证据导向的智能代理推理实现AI文档安全

Fanwei Zeng, Changtao Miao, Jing Huang, Zhiya Tan, Shutao Gong, Xiaoming Yu, Yang Wang, Weibin Yao, Joey Tianyi Zhou, Jianshu Li, Ying Yan

机构 * Ant Group(蚂蚁集团) Nanyang Technological University(南洋理工大学) CFAR and IHPC, Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局(A*STAR)计算与先进机器人中心及高性能计算研究所)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出DocShield框架,通过视觉-逻辑联合推理解决文档伪造检测问题,采用CCT机制和多任务奖励优化,提升检测准确性和解释性,实验显示其在多个基准测试中表现优异。

Comments 10 pages, 4 figures, 5 tables. Preprint. arXiv admin note: text overlap with arXiv:2512.21482

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19971 2026-07-23 cs.RO cs.CV 新提交 78%

Unified Prediction and Planning via Conflict-Aware Disjoint Parameter Training

通过冲突感知不相交参数训练实现统一预测与规划

Taewon Seo, Seonae Jeon, Giwon Lee, Kuk-Jin Yoon, Daehee Park

机构 * DGIST(韩国科学技术院大邱庆北校区) KAIST(韩国科学技术院)

专题命中 规划决策 :planning(title,abstract)

AI总结 研究社交机器人在拥挤环境中统一预测与规划问题,提出基于模型合并的不相交参数训练框架DPT,通过分布式参数学习减轻技能冲突,稀疏合并提升性能,在标准基准测试中验证其在机器人导航上通用且有效。

Comments Accepted at ECCV 2026. 38 pages, 14 figures. Project page: https://dpt2026.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19633 2026-07-23 cs.RO 新提交 78%

LENS: LLM-guided Environment Simplification for Planning and Control in Clutter

LENS:用于杂乱环境中规划与控制的大语言模型引导的环境简化

Aileen Liao, Rachel Holladay, Dinesh Jayaraman, Michael Posa

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 针对现实世界多物体杂乱环境处理难题,提出LENS方法,通过大语言模型引导自动生成特定场景和任务的自适应更新抽象,经实验验证其能改进多种模型在高度杂乱操纵场景中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19194 2026-07-23 cs.RO cs.CV 版本更新 78%

Cognitive Dual-Process Planning for Autonomous Driving with Structured Scene Knowledge and Verifiable Reasoning-Action Consistency

基于结构化场景知识和可验证推理-行动一致性的自动驾驶认知双过程规划

Zhongyao Yang, Haoyu Li, Yu Yan, Zhuangxuan Yu, Jiangfeng Nan, Jinrui Nan

机构 * School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院) National Engineering Research Center of Electric Vehicles, Beijing Institute of Technology(北京理工大学电动车辆国家工程研究中心) School of Mechanical Engineering, Southeast University(东南大学机械工程学院)

专题命中 规划决策 :planning(title,abstract)

AI总结 研究自动驾驶高级规划问题,提出认知双过程规划框架,用S-CoT模式表示场景知识,通过自动数据引擎、视觉仲裁器及验证器实现自适应推理和规则验证,提升规划准确性、逻辑一致性并降低延迟,明确性能下降条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13626 2026-07-23 eess.SY cs.RO cs.SY 版本更新 78%

Unifying Decision-Making and Trajectory-Planning in Unsignalized Intersections Using Time-Varying Potential Fields

使用时变势场统一无信号交叉口自动驾驶车辆的决策与轨迹规划

David Costa, Francesco Cerrito, Massimo Canale, Carlo Novara

机构 * Dipartimento di Elettronica e Telecomunicazioni, Politecnico di Torino(电子工程与电信学院,托斯卡纳理工学院) Dipartimento di Automatica e Informatica, Politecnico di Torino(自动化与信息学院,托斯卡纳理工学院)

专题命中 规划决策 :planning(title,abstract)

AI总结 针对无信号交叉口自动驾驶车辆,提出用有限时域最优控制问题结合时变人工势场的新框架统一决策与轨迹规划,利用短视运动预测等考虑潜在碰撞,仿真验证了该方法可生成可行安全参考轨迹。

Comments Published in the "2026 34th Mediterranean Conference on Control and Automation (MED)". v2 adds the final IEEE citation and DOI; technical content unchanged

Journal ref 2026 34th Mediterranean Conference on Control and Automation (MED), Ancona, Italy, 2026, pp. 251-256

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29196 2026-07-23 stat.AP 78%

Coating Breakdown Prediction for Ships and Inspection Planning

船舶涂层破损预测与检查规划

Huy Truong-Ba, Michael E. Cholette, Geoffrey Will, Marc Hartmann

专题命中 规划决策 :planning(title,abstract)

AI总结 采用幂律非齐次泊松过程(PL-NHPP)和分层贝叶斯方法,解决数据稀缺下船舶涂层缺陷预测问题,并优化检查规划以降低生命周期成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19592 2026-07-23 cs.AI cs.CL cs.LG cs.MA 新提交 75%

Knowledge-Centric Self-Improvement

以知识为中心的自我改进

Xuefei Julie Wang, Lauren Hyoseo Yoon, Chengrui Qu, Amanda Zichang Wang, Atharva Sehgal, Eric Mazumdar, Yisong Yue

机构 * Caltech(加州理工学院)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究以知识为中心的自我改进范式,通过简单协议让智能体尝试任务后为知识库贡献见解并提炼知识,提高了解决率、降低成本,且知识可转移,表明进步可由持久知识驱动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20268 2026-07-23 cs.AI cs.CL 新提交 73%

PoTRE: Test-Time Reasoning inspired by Cognitive Heterogeneity

PoTRE:受认知异质性启发的测试时推理

Anmol Kankariya, Sercan Ö. Arık

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 研究针对大语言模型复杂推理难题,提出PoTRE异构框架,将推理解耦为四个智能体,经任务自适应聚合层协调,在三个前沿基准测试中评估,在HLE上达最优准确率,以相似或更少令牌提升推理性能。

Comments Accepted at Transactions on Machine Learning Research (TMLR 2026)

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19031 2026-07-23 cs.RO 版本更新 71%

Congestion-Aware Robot Tour Planning in Crowded Environments

拥挤环境中的拥塞感知机器人巡视规划

Stefano Bernagozzi, Charlie Street, Masoumeh Mansouri, Lorenzo Natale

机构 * Istituto Italiano di Tecnologia(意大利理工学院) Università di Genova(热那亚大学) University of Birmingham(伯明翰大学)

专题命中 规划决策 :planning(title)

AI总结 提出一种基于概率的巡视规划器,通过学习人流预测模型并在线构建马尔可夫决策过程,在拥挤环境中高效规划机器人路径,减少拥塞影响。

Comments Accepted to IEEE IROS 2026

Journal ref IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11338 2026-07-23 cs.AI 版本更新 70%

AutoVSR: Automatic Visual-to-Symbolic Reasoning for Symbolic Expression Generation from Circuit Schematic

AutoVSR:用于从电路原理图生成符号表达式的自动视觉到符号推理

Zhe Xiao, Longfei Li, Xu He, Haoying Wu, Zixing Zhang, Mingyu Liu

机构 * Hunan University, Changsha, China(湖南大学) Wuhan University of Technology, Wuhan, China(武汉理工大学) Huazhong University of Science and Technology, Wuhan, China(华中科技大学)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 研究旨在解决从电路原理图生成符号表达式的难题,提出AutoVSR框架,利用视觉语言模型,通过重建电路图为可执行中间表示并借助符号求解器推理,引入两项创新提升准确率,在任务中表现优于其他方法,还降低了推理成本和提高了计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31119 2026-07-23 cs.RO cs.LG 版本更新 70%

Don't Fool Me Twice: Adapting to Adversity in the Wild with Experience-Driven Reasoning

不要愚弄我两次:通过经验驱动推理在野外适应逆境

Navin Sriram Ravie, Andrew Jong, Krrish Jain, John Liu, Omar Alama, Bijo Sebastian, Sebastian Scherer

机构 * Department of Engineering Design, Indian Institute of Technology, Madras(印度理工学院工程设计系,马德拉斯) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.LG

AI总结 提出一种持续学习框架,使移动机器人能够在线从干扰中学习,通过语义将异常行为归因于原因,从而更好地预测和规划未来。

Comments Accepted at 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28390 2026-07-23 cs.AI 版本更新 70%

You Live More Than Once: Towards Hierarchical Skill Meta-Evolving

你活不止一次:迈向分层技能元进化

Xujun Li, Kehan Zheng, Mingyuan Zhao, Yize Geng, Jinfeng Zhou, Qi Zhu, Fei Mi, Lifeng Shang, Minlie Huang, Hongning Wang

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Huawei Foundation Model Department(华为基础模型部门)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出HiSME,一种轻量级分层技能元进化方法,通过从智能体任务执行轨迹中学习元技能,联合优化技能和技能进化策略,以持续提升部署的智能体系统在不同下游场景中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20061 2026-07-23 cs.RO 新提交 67%

ReferTrack: Referring Then Tracking for Embodied Visual Tracking

ReferTrack:用于具身视觉跟踪的先指认后跟踪

Hanjing Ye, Tianle Zeng, Jiazhao Zhang, Shaoan Wang, Zibo Zhang, Weisi Situ, Yuchen Zhou, Yonggen Ling, Hong Zhang

机构 * SUSTech(南方科技大学) Tencent Robotics X(腾讯机器人X实验室) Peking University(北京大学) Futian Laboratory(福田实验室)

专题命中 规划决策 :agent(abstract);planning(abstract)

AI总结 研究针对具身视觉跟踪问题,提出ReferTrack先指认后跟踪范式,用单个摄像头,先选目标再解码跟踪航点,通过滑动窗口队列保留运动线索,经数据集协同训练增强识别,在EVT - Bench上达先进单视图性能并验证了迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19974 2026-07-23 cs.LG cs.AI 新提交 62%

Time Series Network Utilization KPI Forecasting Using Advanced AI/ML Models

使用先进人工智能/机器学习模型的时间序列网络利用率关键绩效指标预测

Niraj Gadhe, Kirti Bhardwaj, Moulik Jain, Shubhi Sharma, Vinay Saini

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对数据密集型应用等导致的网络性能问题,通过评估季节性分解等多种模型,利用通用接口数据集在MAPE等指标上进行基准测试,给出模型准确性与计算效率权衡的见解,助相关人员选最佳预测模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19532 2026-07-23 cs.LG cs.AI 新提交 62%

Trustworthy Privacy-Preserving Multimodal Federated Learning for Personalised Breast Cancer Prediction

用于个性化乳腺癌预测的可信隐私保护多模态联邦学习

Ruth Amey, Muhammad Arifur Rahman, Taha Osman, Nicholas Shopland, Andy Burton, Mufti Mahmud, David J. Brown

机构 * NTU(南洋理工大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨联邦学习能否兼顾四个关键支柱,支持乳腺癌患者肿瘤进展预测模型开发。通过多模态数据评估联邦学习框架,与集中式模型比较性能,并研究相关策略,结果助于理解隐私保护多模态预测建模可行性及支持未来应用。

Comments 26 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28282 2026-07-23 cs.LG cs.AI cs.DC 版本更新 62%

Pre-Deployment Complexity Estimation for Federated Perception Systems

联邦感知系统部署前复杂度估计

KMA Solaiman, Shafkat Islam, Ruy de Oliveira, Bharat Bhargava

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Purdue University Northwest(普渡大学西北校区) Purdue University(普渡大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种无需分类器的预部署框架,用于估计联邦学习在分布式环境中的学习复杂度,通过联合建模数据固有属性和环境特征,实验表明该指标与联邦学习性能及通信成本密切相关。

Comments Accepted and presented at Edge AI Research Symposium 2026 (EdgeAI2026), San Diego, CA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20011 2026-07-23 eess.SP cs.AI 新提交 57%

Drift-Aware RL-based Wavelet Denoising for Network-Traffic Anomaly Detection

基于漂移感知强化学习的小波去噪用于网络流量异常检测

Priyalakshmi Sheela, Indrakshi Dey

机构 * Walton Institute, Department of Computing, South East Technological University(沃顿研究所,计算系,东南技术大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 研究针对网络流量监测受噪声和漂移影响问题,提出基于漂移感知强化学习的小波去噪框架,通过特定判断和选择机制优化异常检测及容量估计,以任务效用为奖励并与多种方法对比基准测试。

Comments Submitted to IEEE Transactions on Wireless Communications. This version has not yet undergone peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19744 2026-07-23 stat.AP cs.LG 新提交 57%

Domain-Adapted Power Curve for Cross-Farm Applications

用于跨农场应用的域适应功率曲线

Ahmadreza Chokhachian, V. Roshan Joseph, Yu Ding

机构 * H. Milton Stewart School of Industrial and Systems Engineering(H. Milton Stewart工业与系统工程学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 研究如何将基于运营风电场数据训练的功率曲线模型转移到新农场,提出基于域适应的迁移学习方法,实验表明该方法在跨农场功率预测上显著优于其他方法。

Comments Submitted to Renewable Energy

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19935 2026-07-23 cs.AI 新提交 57%

MOF-Sleuth: Tool-Grounded Reward Alignment for Explainable Fine-Grained MOF CIF Auditing

MOF-Sleuth:用于可解释细粒度MOF CIF审核的工具基础奖励对齐

Yu Liu, Zhiwei Yang, Diandian Guo, Kun Peng, Fangfang Yuan, Cong Cao, Chaozhuo Li, Zhiyuan Ma, Yanbing Liu, Guobin Zhao

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 研究针对MOF数据库CIF输入错误影响下游结果及人工检查的问题,提出MOF-Sleuth,通过强化引导CIF审核代理的两个模块,利用奖励引导强化学习将工具测量转化为监督,提升检测、归因及解释质量,在多基准测试中性能领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19919 2026-07-23 cs.RO cs.LG 新提交 57%

Diffusion ReRoll: Revisable Denoising for Robotic Sequential Prediction

扩散重滚动:用于机器人序列预测的可修正去噪

Seonsoo Kim, Seongil Hong, Jun-Gill Kang

机构 * Agency for Defense Development(国防发展局)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 研究提出扩散重滚动框架用于机器人序列预测,能选择性重新去噪局部稳定区域,实现跨视野迭代修正。通过与其他方法对比评估,在多任务基准测试中取得更好性能,支持结构化重新去噪是可修正机器人序列生成的有效机制。

Comments Project Page: https://seonsoo-p1.github.io/DiffusionReRoll/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19914 2026-07-23 cs.AI 新提交 57%

Long-Term Sequential Decision Making under Risk

风险下的长期序列决策

Irmaan, Mirzanejad, Nadjet Bourdache, Abdel-Illah Mouaddib

机构 * Université de Caen Normandie, ENSICAEN, CNRS, Normandie Univ, GREYC UMR 6072(卡昂诺曼底大学、法国国立民用航空学院、法国国家科学研究中心、诺曼底大学、GREYC实验室(法国国家科学研究中心6072联合研究单位))

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 研究风险下有限期MDP规划,提出ERQDP方法,无需枚举和采样,通过精确DP解决秩分位数替代问题,能精确评估候选策略,在测试基准中表现良好,可返回认证解或残差差距,支持多种行为。

Comments Accpeted in Forty-Second Annual Conference on Uncertainty in Artificial Intelligence (UAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19854 2026-07-23 cs.LG stat.ML 新提交 57%

Asymptotically Optimal Regret for Reinforcement Learning without Horizon Dependence

无时间范围依赖的强化学习的渐近最优遗憾值

Runlong Zhou, Zihan Zhang, Maryam Fazel, Simon S. Du

机构 * University of Washington(华盛顿大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 研究有限时间范围齐次表格马尔可夫决策过程的无时间范围遗憾值最小化,提出新算法,证明遗憾值上界\( \tilde O(\sqrt{SAK}+S^8A^3) \),渐近最优且消除\( \log H \)依赖,改进先前结果。

Comments 78 pages

详情

展开后加载摘要…

URL PDF HTML 收藏