arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-12 至 2026-08-12 共收录 61 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 61 篇

2608.10357 2026-08-12 cs.LG cs.AI 新提交 88%

Efficient Reinforcement Learning for Long-Horizon Tool-Use Agentic Tasks

面向长周期工具使用智能体任务的高效强化学习

Zelei Cheng, Amritansh Mishra, Sambit Sahu, William Campbell

机构 * Capital One(第一资本金融公司) AI Foundations(人工智能基础部门)

专题命中 规划决策 :tool-use(title,abstract);agentic(title);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出 SINKFLEX-RL 模块化训练系统,通过整合环境接口等技术,在 Tau2Bench 测试中提升验证奖励并降低注意力路径显存占用,实现长周期工具使用智能体的高效 RL 训练。

Comments Published at the COLM 2026 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10330 2026-08-12 cs.AI 新提交 88%

Hierarchical Compositionality for An Assistive AI Agent

面向辅助AI智能体的分层组合性

Tianyi Fu, Mohan Sridharan

机构 * University of Edinburgh(爱丁堡大学)

专题命中 规划决策 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 本文针对辅助AI智能体的歧义问题,提出嵌入分层组合性原则的架构,结合语义兼容性等模型推理实现歧义消除,实验表明其性能优于当前最优数据驱动基线,可适配特定用户画像。

Comments 25 pages, 9 figures, 4 tables. Project page: https://tianyi-fu.github.io/HCAA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10157 2026-08-12 cs.AI 新提交 85%

SBCO: Self-Supervised, Verifier-Grounded Harness Optimization For Planning Agents

SBCO:面向规划智能体的自监督、验证器驱动的工具链优化器

Vivek Kulkarni, Sudipta Paul, Aounon Kumar, Nicholas Tzou, Srinivas Chappidi

专题命中 规划决策 :planning(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本研究针对规划任务提出SBCO,一种自监督的验证器驱动工具链优化器,其性能优于或相当的定制基线,且计算成本仅为其1/4至1/5.5。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18401 2026-08-12 cs.CL 版本更新 85%

CAPO: Critic-Guided Action-Aligned Policy Optimization for Advancing LLM Agent Capabilities

StepPO: 面向智能体强化学习的步骤对齐策略优化

Daoyu Wang, Qingchuan Li, Mingyue Cheng, Jie Ouyang, Shuo Yu, Chunli Liu, Shijin Wang, Qi Liu, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 规划决策 :agent(title,abstract);agentic(abstract,abstract_cn);分类 cs.CL

AI总结 提出StepPO,一种步骤级策略优化方法,通过将智能体强化学习从token级MDP重构为步骤级MDP并引入步骤级信用分配,以解决现有算法在智能体决策粒度上的不匹配问题,在多跳问答等任务上优于多种RL算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10628 2026-08-12 cs.CV cs.CL cs.LG 新提交 84%

InSight-doc: Agentic Visual Perception for Long-Document Understanding

InSight-doc:面向长文档理解的智能体视觉感知框架

Kaican Li, Weiyan Xie, Lewei Yao, Jiannan Wu, Lanqing Hong, Yongxiang Huang, Nevin L. Zhang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Huawei(华为)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出智能体视觉感知框架InSight-doc,通过自适应选择放大高分辨率区域处理长文档,经SFT+RL训练后在文档VQA任务中显著提升准确率、降低幻觉与推理延迟,相关资源已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09790 2026-08-12 cs.AI cs.MA cs.SI 版本更新 83%

CARD: Controlled Agentic Reddit Discussions for Credit Card Simulation

CARD:用于信用卡模拟的受控智能体Reddit讨论框架

Yaoning Yu, Kai-Min Chang, Ye Yu, Yi-Chia Wang, Haojing Luo, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) U.S. Bank(美国银行) Stanford University(斯坦福大学)

专题命中 规划决策 :agentic(title,abstract_cn);planning(abstract);分类 cs.AI

AI总结 本研究提出CARD框架,通过规划器、生成器与校准循环,结合多维度控制项生成逼真信用卡讨论线程,经多指标评估,其效果优于多种LLM模拟基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09096 2026-08-12 cs.CL 版本更新 83%

Evo-Bench: Can Language Models Improve Agent Harness?

Evo-Bench:语言模型能否改进智能体框架?

Lisheng Huang, Chen Yang, Hao Zhou, Huatong Song, Zongchao Chen, Ran Le, Yang Song, Wayne Xin Zhao, Tao Zhang

专题命中 规划决策 :agent(title,abstract);autonomous agent(abstract);分类 cs.CL

AI总结 本研究推出首个智能体框架进化基准Evo-Bench,评估语言模型的自主框架优化能力,发现其在通用、搜索任务中优于人工框架,在办公任务中表现不佳,且合成框架可迁移提升各类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03031 2026-08-12 cs.AI 版本更新 83%

CastFSR: A Fast--Slow--Reflect Agentic Reasoning Framework for Context-Aware Time Series Forecasting

CastFSR:用于上下文感知时间序列预测的快慢反思智能体推理框架

Xiaoyu Tao, Mingyue Cheng, Bokai Pan, Chuang Jiang, Huanjian Zhang, Tian Gao, Yaguo Liu, Qi Liu, Enhong Chen

专题命中 规划决策 :agentic(title,abstract);workflow(abstract);分类 cs.AI

AI总结 本研究提出CastFSR智能体框架,将上下文感知时间序列预测建模为快慢反思工作流,通过实验证明其在公共数据集上的表现优于代表性基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24850 2026-08-12 cs.IR cs.LG 版本更新 83%

SearchArt: Training Long-Horizon Search Agent with Scalable Synthetic and Verified Task

SearchArt:使用可扩展的合成和经过验证的任务训练长视野搜索代理

Lang Mei, Xiaohan Yu, Chong Chen, Liyan Liu, Xiangnan Chen, Jinchao Ma, Chao Feng, Li Huang, Siyu Mo, Sichen Kang, Yunkun Xu, Zhihan Yang, Zhujun Xue, Jingren Zhang, Qing He, Yingdi Huang, Hao Jiang, Ziao Ma, Zewei Pan, Minhao Sun, Zhuo Tao, Jinzhao Xiao, Gangtao Xin, Huanyao Zhang, Wenjian Zhang, Jiangshan Zhang, Guojie Zhu, Fangzhou Zou, Jiaxin Mao, Wentao Zhang

专题命中 规划决策 :agent(title);tool-use(abstract);planning(abstract);分类 cs.LG

AI总结 针对训练长视野搜索代理的挑战,SearchArt提出通过验证驱动任务合成及多阶段训练管道的框架,构建大规模数据集并验证数据可靠性,经此训练的代理在多基准测试中表现出色,参数少却成绩优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10108 2026-08-12 cs.AI 新提交 79%

MESA:Task-Adaptive Multi-Structure Evidence Selection for Long-Horizon Agent Memory

MESA:面向长视野智能体记忆的任务自适应多结构证据选择

Beidi Zhao, Yaoqi Chen, Yuru Feng, Menghao Li, Qianxi Zhang, Baotong Lu, Jianan Lu, Zhirui Wang, Xinjiang Wang, Shusen Xu, Zengzhong Li, Xiaoxiao Li, Qi Chen

机构 * Microsoft Research Asia(微软亚洲研究院)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 MESA是面向长视野智能体记忆的多结构证据选择框架,通过自适应选择融合互补记忆结构,在AMA-Bench上性能优于基线且减少了证据标记使用量。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06869 2026-08-12 cs.CV cs.CL 版本更新 79%

DAEP: Difficulty-Aware Evidence Planning for Medical Video Corpus Temporal Answer Grounding

DAEP:面向医学视频语料时序答案 grounding 的难度感知证据规划

Tianjian He, Yujie Liu, Zhiping Huang, Changbo Xu

机构 * TikTok, ByteDance(字节跳动TikTok) Beijing Institute of Graphic Communication(北京印刷学院) Lingnan University(岭南大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.CL

AI总结 BIGC团队提出DAEP方案,通过多模态证据排名与难度感知规划,在NLPCC 2026共享任务中以0.2728的平均得分获第一名,提升了医学视频时序答案定位的性能。

Comments 12 pages, 2 figures, 5 tables, accepted by NLPCC 2026 Shared Task Track 3

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06772 2026-08-12 cs.AI cs.HC hep-ph hep-th 版本更新 79%

When Does Critique Improve AI-Assisted Theoretical Physics? SCALAR: Structured Critic--Actor Loop for Agentic Reasoning

当批评如何提升AI辅助理论物理?SCALAR:用于代理推理的结构化批评-代理循环

Vasilis Niarchos, Constantinos Papageorgakis, Alexander G. Stapleton, Sokratis Trifinopoulos

机构 * Department of Physics, CCTP ITCP, University of Crete, 71303, Greece Centre for Theoretical Physics, Department of Physics Astronomy, Queen Mary University of London, London E1 4NS, United Kingdom Theoretical Physics Department, CERN, Geneva, Switzerland

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 本文研究了研究人员与代理交互对AI辅助理论物理研究的影响,通过SCALAR框架评估不同交互结构对科学发现的促进作用。

Comments V2. Expanded experiments. Accepted at ICML 2026 Workshop (AI4Physics); 18 pages; 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07042 2026-08-12 cs.AI 版本更新 79%

Planning Task Shielding: Detecting and Repairing Flaws in Planning Tasks through Turning them Unsolvable

计划任务防护:通过使其不可解来检测和修复计划任务中的缺陷

Alberto Pozanco, Pietro Totis, Marianela Morales, Daniel Borrajo

机构 * J.P. Morgan AI Research(摩根大通人工智能研究)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出计划任务防护方法,通过最小修改使计划任务不可解来检测和修复缺陷,验证了算法在不同规模任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12231 2026-08-12 cs.LG 版本更新 79%

Temporal Straightening for Latent Planning

时间拉直用于隐式规划

Ying Wang, Oumayma Bounou, Gaoyue Zhou, Randall Balestriero, Tim G. J. Rudner, Yann LeCun, Mengye Ren

机构 * New York University(纽约大学) Brown University(布朗大学) University of Toronto(多伦多大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 受人类视觉处理中感知拉直假说启发,提出时间拉直方法,通过曲率正则化联合学习JEPA世界模型的编码器和预测器,改善隐式规划中的表示学习,使梯度规划更稳定并提高目标到达任务成功率。

Comments ICML2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10366 2026-08-12 cs.AI cs.CL 新提交 79%

DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?

DSAgentBench:智能体能否在真实计算机环境中自动化端到端数据科学工作流?

Mizanur Rahman, Mohammed Saidul Islam, Ridwan Mahbub, Md Tahmid Rahman Laskar, Shafiq Joty, Enamul Hoque Prince

机构 * York University(约克大学) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce AI研究院)

专题命中 规划决策 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 DSAgentBench是首个评估智能体在真实计算机环境中自动化完整数据科学工作流的基准,含275项任务,实验显示现有智能体与实际需求存在显著能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11175 2026-08-12 cs.RO cs.SY eess.SY 新提交 78%

Risk-Aware Kinodynamic Motion Planning Under Uncertainty For Safe Navigation on Planetary Environments

行星环境安全导航下考虑不确定性的风险感知动力学运动规划

Sachin Sunil Kelkar, Tanmay Dokania, Yashwanth Kumar Nakka

机构 * Daniel Guggenheim School of Aerospace Engineering(丹尼尔·古根海姆航空航天工程学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划决策 :planning(title,abstract)

AI总结 针对自主空间探索中环境交互与感知系统的不确定性导致的安全规划问题,提出结合AO-RRT采样规划与序列凸规划的风险感知动力学运动规划方法,可将轨迹风险降低约97%。

Comments 3 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10618 2026-08-12 cs.RO 新提交 78%

Toward the Cognitive--Physical Limits of Embodied Intelligence through a World-Model-Centric Autonomous Racing Agent

通过以世界模型为中心的自主智能体探索具身智能的认知-物理极限

Zitong Shan, Baichuan Lou, Yanxin Zhou, Shuge Wu, Xianqi He, Bolin Zhao, Sheng Zhao, Zhouheng Li, Chee Kiong Ong, King Ho Holden Li, Chen Lv

机构 * K2 Holding, L.L.C(K2控股有限责任公司)

专题命中 规划决策 :agent(title,abstract)

AI总结 该研究提出以世界模型为中心的自主赛车智能体,结合实车与模拟实验,探索具身智能的认知-物理极限,提升了交互成功率与泛化能力,为安全部署提供边界感知方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10220 2026-08-12 cs.RO 新提交 78%

Whole-Body Planning for Humanoids Navigating Confined Spaces via Self-Collision Avoidance References

人形机器人在受限空间中通过自碰撞规避实现全身规划的参考方案

Carlos Gonzalez, Luis Sentis

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出三阶段全身规划框架,结合可微分自碰撞规避与可达性约束,在Unitree G1人形机器人上实现Cr<1.5的受限空间导航,生成复杂接触轨迹并训练出鲁棒在线跟踪策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10990 2026-08-12 math.AT 新提交 78%

On the Sequential topological complexity of directed (parametrized) motion planning algorithms

关于定向(参数化)运动规划算法的序列拓扑复杂性

Navnath Daundkar, Abhishek Sarkar, Ankur Sarkar

专题命中 规划决策 :planning(title,abstract)

AI总结 该研究引入定向(参数化)拓扑复杂性的序列类似物,构建其基础理论并确立基本性质,计算发现同一基础空间上不同定向结构的该不变量取值不同。

Comments 23 pages. Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10309 2026-08-12 physics.flu-dyn cs.RO 新提交 78%

Wind-Informed Rapid Flight-Planning in Complex Urban Topologies via Machine Learning and Experimental Validation

基于机器学习与实验验证的复杂城市拓扑下风感知快速飞行规划

Peter I. Renn, Alejandro A. Stefan-Zavala, Julian Humml, Sabera Talukder, Aysha AlMazrouei, Kresna Aji, Debashisha Mishra, Emanuele Panizio, Jennifer Simonjan, Yisong Yue, Morteza Gharib

专题命中 规划决策 :planning(title,abstract)

AI总结 本研究提出一种新型风感知飞行规划框架,通过学习代理模型快速预测城市流场,经风洞实验验证可减少飞行器非期望位移、提升稳定性,为先进空中机动提供安全方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09975 2026-08-12 physics.ao-ph 新提交 78%

A black-box-model-enhanced interaction method for water-wave scattering by large group of arbitrary-shaped ice floes in Arctic route planning

北极航线规划中大量任意形状浮冰水波散射的黑箱模型增强交互方法

Chongwei Zhang, Hongli Yang, Peng Wu, Peng Lu, Dezhi Ning

专题命中 规划决策 :planning(title,abstract)

AI总结 本研究提出WCD黑箱模型构建DTM,开发EI方法高效预测北极航线中大量任意形状浮冰的水波场,结合动态规划优化航线,可使船舶平均波幅降至入射波幅约一半,计算效率极高。

Comments 31 pages, 37 figures; submitted to Cold Regions Science and Technology on March 22, 2025; received first revision request on March 18, 2026; submitted first revision on April 7, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09816 2026-08-12 cs.RO 版本更新 78%

Hierarchical Fast-Slow ReAct Agent for Zero-Shot Object-Goal Navigation

用于零样本物体目标导航的分层快慢ReAct智能体

Zhaochen Lan, Zhi Yang, Yuxiang Fu, Mengxiang Lin

专题命中 规划决策 :agent(title,abstract)

AI总结 该研究针对零样本物体目标导航,提出分层快慢ReAct智能体,结合价值图控制器与坐标锚定记忆及VLM,在HM3D、MP3D验证集上取得零样本方法最高成功率,远前沿审议可提升性能。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08323 2026-08-12 cs.RO cs.SY eess.SY 版本更新 78%

MPPI Planning with Gaussian-Based Human Cost Function for Social Navigation

基于高斯人类代价函数的MPPI规划用于社交导航

Chinmay Mundane

机构 * VJTI(维杰拉吉·鲁勒学院(VJTI))

专题命中 规划决策 :planning(title,abstract)

AI总结 该研究针对普通MPPI规划低估动态场景风险的问题,提出PGIF方法,结合高斯排斥场实现0%碰撞率,同时保持实时规划性能,适用于社交导航。

Comments Will appear in Springer's Proceedings in Advanced Robotics series

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01027 2026-08-12 cs.RO 版本更新 78%

Sampling-Based Visibility Task Planning

基于采样的可视性任务规划

Stav Ashur, Avishai Sintov

机构 * School of Mechanical Engineering, Tel-Aviv University(特拉维夫大学机械工程学院)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文针对视觉传感器等可视性设备,提出VisPRM和VisRRT两种新型采样TAMP算法,经仿真与物理实验验证,其成功率和运行效率优于RRT、PRM等适配算法。

Comments Accepted to IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14506 2026-08-12 econ.EM 版本更新 78%

Enhancing Rolling Horizon Production Planning Through Stochastic Optimization Evaluated by Means of Simulation

通过仿真评估的随机优化方法增强滚动时域生产计划

Manuel Schlenkrich, Wolfgang Seiringer, Klaus Altendorfer, Sophie N. Parragh

专题命中 规划决策 :planning(title,abstract)

AI总结 该研究将场景随机规划融入滚动时域框架,经仿真对比发现,无缓冲高拥堵环境中随机优化比MRP降本最多68%,引入安全库存后确定性优化占优,为生产计划管理提供了见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10494 2026-08-12 cs.AI cs.MA 新提交 77%

GeoForge: Non-Parametric Self-Evolving Agents for Earth-Observation Reasoning

GeoForge:用于对地观测推理的非参数自进化智能体

Xin Xiao, Jiang Zhong, Junnan Zhu, Yingchao Feng, Peijin Wang, Yidan Zhang, Kaiwen Wei

专题命中 规划决策 :tool-use(abstract);planning(abstract);workflow(abstract);分类 cs.AI

AI总结 GeoForge是一种无需训练的自进化框架,通过结构化非参数执行状态及多记忆机制提升EO智能体的规划与推理能力,可改善任务准确率、工具轨迹质量并减少推理错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10333 2026-08-12 cs.LG 新提交 74%

MERA: Model Evolution and Routing with Skill Adaptation for Agentic Systems at Scale

MERA:面向大规模智能体系统的技能适配型模型演化与路由

Yuhang Yao, Zeyu Wang, Wanyi Chen, Tongyun Yang, Yuhang Han, Jie Xiao, Chengke Bao, Tianyi Zhao, Lynn Ai, Eric Yang, Tianyu Shi

机构 * Gradient Soochow University(苏州大学) Carnegie Mellon University(卡内基梅隆大学) Shanghai Jiao Tong University(上海交通大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 规划决策 :agentic(title);分类 cs.LG

AI总结 MERA以单模型调用为适应单元,通过多轮适配提升小模型能力,结合带验证器回退的成本校准路由,在HumanEval+MBPP、TAU-2等数据集上实现小模型性能提升与成本降低。

Comments Preliminary version in CAIS RL-Eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16057 2026-08-12 cs.CL cs.AI 版本更新 73%

Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning

跨商业学科的前沿人工智能性能:基于案例的知识工作和分析推理基准

Ajay Patel, Kartik Hosanagar, Ramayya Krishnan, Chris Callison-Burch, Karim Lakhani

机构 * The Wharton School, University of Pennsylvania(宾夕法尼亚大学沃顿商学院) Carnegie Mellon University(卡内基梅隆大学) Harvard Business School, Harvard University(哈佛大学哈佛商学院)

专题命中 规划决策 :tool-use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究针对人工智能在白领分析性知识工作衡量上的差距,利用顶尖商学院案例教学法构建BusinessCaseBench基准,发现前沿AI模型在此基准上得分高且能力提升快,为商学院及相关职业角色带来启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23146 2026-08-12 cs.LG cs.AI 版本更新 73%

Infra-Bayesian Reinforcement Learning Agents Outperform Classical RL For Worst-Case Robustness

Infra-Bayesian 强化学习智能体在最坏情况鲁棒性上优于经典强化学习

Manish Aryal, Faiyaz Azam, Agnivo Banerjee, Syed Mahir Ahamed, Sai Sidhanth Manoharan Jayanthi, Allegra Laro, Clément Legentilhomme, Andrew Lin, Florian Lorkowski, Marina Pérez del Valle, Radman Rakhshandehroo, Patric Rommel, Emanuel Ruzak, Nathan Theng, Paul Yushin Rapoport

机构 * Purdue University(普渡大学) Carnegie Mellon University(卡内基梅隆大学) WorldQuant University(WorldQuant大学) UC Berkeley(加州大学伯克利分校) Aix-Marseille University(阿维尼翁-马赛大学) MIT(麻省理工学院) University of Zurich(苏黎世大学) University of British Columbia(不列颠哥伦比亚大学) University of Stuttgart(斯图加特大学) University of Buenos Aires(布宜诺斯艾利斯大学) California State University, Fresno(弗雷斯诺加州州立大学) University of Chicago(芝加哥大学)

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 针对经典强化学习在模型误设和策略依赖不确定性下的失败,提出 Infra-Bayesian 框架,通过区分概率不确定性和 Knightian 不确定性并采用最坏情况决策,在有限状态无状态决策问题中实现更低的最坏情况遗憾。

Comments RLC 2026: Accepted to Finding the Frame Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24188 2026-08-12 cs.CL cs.LG 版本更新 73%

MT-PingEval: Evaluating Multi-Turn Collaboration with Private Information Games

MT-PingEval:通过私人信息游戏评估多轮协作

Jacob Eisenstein, Fantine Huot, Adam Fisch, Jonathan Berant, Mirella Lapata

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.CL、cs.LG

AI总结 MT-PingEval通过私人信息游戏评估语言模型在多轮协作中的表现,发现其在规划和执行多轮对话方面存在显著缺陷,并强调了提高对话连贯性和信息管理的重要性。

Comments CoLM camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏