arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6571 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 1893 篇

2608.09748 2026-08-11 cs.DC cs.AI cs.LG cs.LO cs.SY eess.SY 新提交 62%

Defining Decentralization: An Ontological Perspective

去中心化的定义:一种本体论视角

Jakub Kacper Szeląg, Aydin Abadi, Mohammad Naseri

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对计算机领域缺乏通用去中心化定义的问题,提出基于图的本体框架,区分去中心化与分布性,引入两个新指标并实现浏览器工具,为联邦学习等系统提供一致的去中心化评估基础。

Comments 27 pages, 6 figures, preparing for submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09638 2026-08-11 cs.AI cs.CL cs.CY cs.GT 新提交 62%

Avalon-ToM-Bench: Evaluating Fine-Grained Theory of Mind via Asymmetric Game Mechanics

Avalon-ToM-Bench:通过非对称游戏机制评估细粒度心理理论

Yen-Shan Chen, Yu Chian Duan, Chih-En Kuo, Jian-Bin Wu, Yun-Nung Chen

机构 * National Taiwan University(台湾大学) CyCraft AI Lab(CyCraft人工智能实验室)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Avalon-ToM-Bench基准,基于阿瓦隆游戏机制评估大语言模型的细粒度心理理论,发现模型ToM能力不足源于推理策略而非知识或表征,推理训练比测试时思维链增益更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07418 2026-08-10 cs.AI cs.CL 新提交 62%

ResidencyRL: Reinforcement Learning in Simulated Clinical Environments

ResidencyRL:在模拟临床环境中开展的强化学习

Valentin Liévin, Samuel Schmidgall, Tim Strother, Alex Bijamov, Akshay Goel, Anil Palepu, Chunjong Park, Vahid Balazadeh, Min Woo Sun, Marius Guerard, Justin Chen, Dave Steiner, Vikram Dhillon, Ibrahim Azar, Akhil Mehta, Nicholas Spetsieris, Shilpan Shah, Maen Abdelrahim, Amit Dahiya, Yun Liu, Katherine Chou, Yossi Matias, Avinatan Hassidim, Dale R. Webster, Quoc V. Le, Raia Hadsell, Joelle Barral, Carey Radebaugh, Aleksandra Faust, Shekoofeh Azizi, Mike Schaekermann, Po-Hsuan Cameron Chen, Tao Tu, David Racz, Lin Yang

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究院) Houston Methodist Hospital(休斯顿卫理公会医院) Trinity Health Group(三一健康集团) Stanford Oncology Partners(斯坦福肿瘤学伙伴) St. Luke Hospital(圣卢克医院)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出 ResidencyRL,通过多轮强化学习训练临床 AI 智能体,在模拟临床环境中提升诊断准确性、降低漏报率,且能力可迁移至多个医学基准测试,为临床 AI 发展提供了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07317 2026-08-10 cs.SE cs.AI 新提交 62%

Towards Assurance Closure in AI-Native Large-Scale Agile Software Development

面向AI原生大规模敏捷软件开发中的保证闭合

Ricardo Britto

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.SE

AI总结 针对AI原生大规模敏捷软件开发中保证推理机器可操作的缺口,提出基于共享语义保证层的高层架构及六项对应能力,以实现保证闭合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07077 2026-08-10 cs.AI cs.LG 新提交 62%

Transformers Struggle to Use Their Emergent World Models: Revisiting the Tower of Hanoi, and the Illusion of Thinking

Transformer难以利用其涌现的世界模型:重新审视汉诺塔与思维的错觉

Devin Pereira, Willem Zuidema

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究发现,Qwen3.6-27B等大型推理模型虽能编码汉诺塔的谢尔宾斯基世界模型,但因表示衰减导致圆环数超3时失败,注入提示词时间表示可部分恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07037 2026-08-10 cs.LG cs.AI 新提交 62%

Accounting Graph Transformer for Short-History Multi-KPI Forecasting in Small Businesses

用于小企业短历史多KPI预测的会计图变换器

Shrutendra Harsola, Vignesh Subrahmaniam

机构 * Foresight-AI, Intuit(富睿特远见人工智能实验室,Intuit公司)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出Accounting Graph Transformer模型,针对小企业短历史数据完成13项财务KPI的12个月联合预测,在多组测试集上均优于LightGBM等基准模型,为企业财务分析提供集成预测层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06735 2026-08-10 cs.AI cs.CL 新提交 62%

IB-RL: Isolated Bilateral Reinforcement Learning for Strategic Dialogue Agents

IB-RL:用于策略性对话智能体的孤立双边强化学习

Senhao Wang, Chenghao Cai, Haitao Hu, Mingxing Huang, Xingguang Wang, Wenhao Li, Zecheng Lin

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对现有RL训练范式的静态对应智能体不匹配问题,提出IB-RL方法,在Vehicle TeleSales和Deal-or-NoDeal任务上较单边RL基线显著提升了策略对未见过对应智能体的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05806 2026-08-07 cs.CL cs.AI 新提交 62%

Hierarchical Latent Prediction for Language Models

语言模型的分层隐式预测

Chang Shi, Tim Pearce, Manan Tomar, Siddhartha Sen, John Langford

机构 * University of Texas at Austin(得克萨斯大学奥斯汀分校) Microsoft Research(微软研究院)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 该研究针对语言模型下一个token预测的误差累积问题,提出分层隐式预测方法,在编码、多步推理基准及推测解码上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05446 2026-08-07 cs.LG cs.CL 新提交 62%

EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents

EvoHarness-RL:为长视野大语言模型智能体学习自进化运行时管控器

Xuying Ning, Dongqi Fu, Tianxin Wei, Hanqing Zeng, Yuanchen Bei, Bingxuan Li, Zihao Li, Qifan Wang, Xiang Shen, Yifan Wu, Jiayi Liu, Hong Li, Yinglong Xia, Xiangjun Fan, Hanghang Tong, Jingrui He

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta AI

专题命中 规划决策 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出 EvoHarness-RL 方法,通过学习管控器策略解决长视野 LLM 智能体的外部状态管理问题,在 ALFWorld 上达到 96.9% 的任务成功率,验证了可训练管控器策略的有效性。

Comments Accepted to LLA@COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05313 2026-08-07 cs.RO cs.AI cs.HC cs.LG 新提交 62%

Failing Gracefully: Mitigating Impact of Inevitable Robot Failures

优雅降级:缓解机器人不可避免故障的影响

Duc M. Nguyen, Saad A. Ghani, Andrew Marshall, Allison Andreyev, Gregory J. Stein, Xuesu Xiao

机构 * George Mason University(乔治梅森大学) RobotiXX Lab(RobotiXX实验室)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对家庭服务机器人不可避免的故障,本文提出一种评估故障影响概率与严重程度的安全公式,结合FailBench模拟框架,为开发更安全的机器人运动规划及学习策略提供基础。

Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04964 2026-08-06 cs.AI cs.LG 新提交 62%

WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models

WorldCycle:用于长时序视频世界模型的自验证强化学习

Bohai Gu, Yueyang Yuan, Taiyi Wu, Dazhao Du, Jian Liu, Xiaoyi Pang, Jie Zhang, Xiaocheng Lu, Haobin Zhong, Xiaotong Zhao, Alan Zhao, Song Guo

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对交互式视频世界模型的误差累积问题,提出自验证RL框架WorldCycle,利用可逆动作循环实现无标注监督,在CycleBench基准上大幅降低状态返回漂移并提升复合动作准确率。

Comments https://nevsnev.github.io/Worldcycle/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04037 2026-08-06 cs.CL cs.AI cs.GR cs.HC 新提交 62%

Reconstructing Persistent Worlds from Narratives for Narrative-Grounded Interactive Experiences

从叙事中重建持久世界以实现基于叙事的交互体验

Yi-Chun Chen

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出从叙事中重建显式持久世界的核心方法,开发原型实现可游玩环境,为AI辅助游戏创作等提供语义基础,验证了其可行性与应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04007 2026-08-05 cs.CL cs.AI 新提交 62%

TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning

TurnSight:面向工具集成推理的回合级事后自蒸馏方法

Changle Qu, Sunhao Dai, Hengyi Cai, Yuqi Zhou, Xinran Chen, Simon, Jun Xu

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对工具集成推理中现有方法缺乏细粒度监督的问题,提出TurnSight框架,通过回合级事后自蒸馏生成可靠监督信号,在三个基准上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03087 2026-08-05 cs.LG cs.AI 新提交 62%

SynEnergy: Anomaly Semantic-Guided Diffusion for Synthetic Energy Data Generation

SynEnergy:面向合成能源数据生成的异常语义引导扩散模型

Lin Jiang, Dahai Yu, Ravikumar Gelli, Guang Wang

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SynEnergy,一种两阶段扩散框架,通过HG-ASL提取异常语义、AS-Diff生成数据,在四个真实能源数据集上较11种基线提升异常保留与下游质量,可扩展至城市级场景。

Comments 24 pages, 44 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02826 2026-08-05 quant-ph cs.AI cs.LG stat.ML 新提交 62%

Improved Quantum Algorithms for Reinforcement Learning Under a Generative Model

生成模型下强化学习的改进量子算法

Joao F. Doriguello

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对两类马尔可夫决策过程,提出结合值迭代与量子子例程的新型量子强化学习算法,其查询复杂度优于现有成果,接近量子下界。

Comments 22 pages. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02343 2026-08-04 cs.AI cs.LG 新提交 62%

Hard Constraints, Smooth Gradients: Learning Feasible Inventory Policies via Differentiable Projection

硬约束、平滑梯度:通过可微投影学习可行库存策略

Patrick Helm, Jan-Niklas Doerr, Joren Gijsbrechts, Stefan Minner

机构 * TUM School of Management, Technical University of Munich(慕尼黑工业大学TUM管理学院) Esade, Ramon Llull University(拉蒙·柳利大学ESADE商学院) Munich Data Science Institute (MDSI), Technical University of Munich(慕尼黑工业大学慕尼黑数据科学研究所)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出嵌入可微凸优化模块的DRL策略,以处理序列决策中的硬约束,在库存规划等场景中实现了优于基准方法的成本降低与最优性表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02267 2026-08-04 cs.AI cs.LG 新提交 62%

Self-Certification of Representation Adequacy: Sequential Certification at Minimum Task Loss

表示充分性的自认证:最小任务损失下的序列认证

Zijie Huang

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文针对智能体历史压缩表示的混叠风险,提出四层自认证理论,构建序列认证策略并证明其成本渐近匹配下界,为表示充分性的认证提供了理论框架。

Comments 108 pages, 3 figures. Full proofs and appendices included. Independent researcher

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01604 2026-08-04 cs.AI cs.SE 新提交 62%

Post-Training on Office Work Improves Software Engineering: A Behavioral Account of Cross-Domain Transfer

在办公工作上进行后训练可提升软件工程能力:跨域迁移的行为视角

Logan Ritchie, Sushant Mehta, Liudas Panavas, Edwin Chen

机构 * Surge AI

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究通过在办公工作流程的长程多工具智能体任务上后训练Qwen3.5-122B-A10B,发现模型在无相关训练的软件工程基准SWE-Bench Pro上性能提升,证实长程后训练可跨域强化目标导向执行行为。

Comments 20 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01328 2026-08-04 cs.CL cs.AI cs.CV 新提交 62%

LongChart VQA: A Comprehensive Benchmark for MLLMs with Complex Multi-Chart Reasoning

LongChart VQA:面向具备复杂多图表推理能力的多模态大语言模型的综合基准

Ziyan Xiao, Yinghao Zhu, Wenting Zhang, Heaju Kim, Lequan Yu

机构 * The University of Hong Kong(香港大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 LongChart VQA是面向具备复杂多图表推理能力的MLLMs的综合基准,该基准含平均6.5张图像与31.2个问题,评估10个SOTA MLLMs发现其准确率随计算复杂性提升下降,为多图表推理研究指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00175 2026-08-04 cs.LG cs.AI 新提交 62%

Inference-Time Policy Alignment for Fair Reinforcement Learning

用于公平强化学习的推理时策略对齐

Umer Siddique, Peilang Li, Conor Wallace, Yongcan Cao

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出乘法策略塑造框架,在不更新预训练RL策略参数的情况下,于推理时提升公平性,同时保留核心任务性能,适用于各类深度RL智能体。

Comments Accepted at the Reinforcement Learning Conference (RLC) 2026. 13 pages main + appendix, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29617 2026-08-03 cs.LG cs.AI stat.ML 新提交 62%

When Does On-Policy Interaction Help? Representational Tradeoffs in Value-Based Imitation Learning

基于值函数的模仿学习中,何时在线交互是有帮助的?表示权衡研究

Luca Viano, Antoine Moulin, Audrey Huang, Volkan Cevher, Philip Amortila, Dylan J. Foster

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文针对基于值函数的模仿学习,提出交互式在线算法OVI,发现专家交互可降低学习者的表示要求,且OVI在多数场景下性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28488 2026-07-31 cs.AI cs.LG 新提交 62%

SCOPE: Supply-Chain Operations through Coupled Policies for End-to-End Coordination

SCOPE:基于耦合策略的端到端协调供应链运营

Yunhao Liang, Xianqi Cao, Pujun Zhang, Yuan Qu, Yongzhi Qi, Ningxuan Kang, Max Z. J. Shen

机构 * Dingdong(叮咚)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 SCOPE是将供应链实体建模为token的复合策略模型,在生鲜零售补货数据上验证了其比分阶段优化及传统基线更优的端到端供应链决策效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28415 2026-07-31 cs.LG cs.AI cs.CV cs.MM cs.RO 新提交 62%

QQWorld: Quantile-Quantile Matching for World Model Regularization

QQWorld:用于世界模型正则化的分位数-分位数匹配

Zhoushun Yu, Xiaoyu Hu, Xiangyu Xu

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对潜在世界模型正则化中EP目标函数对尾部样本校正梯度不足的问题,提出QQWorld方法,通过分位数-分位数匹配目标函数及跨批次QQ技术,提升了LeWM在四个控制环境中的规划成功率与高斯对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27973 2026-07-31 cs.LG cs.AI 新提交 62%

TAPO: Transition-Aware Policy Optimization for LLM Agents

TAPO:面向大语言模型智能体的过渡感知策略优化

Cong Li, Peixi Peng, Yisen Zhao, Xinyu Hu, Shudong Liu, Zhan Su, Zhuojian Li

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Pengcheng Laboratory(鹏城实验室)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出TAPO框架,通过策略优化与过渡监督交替训练,增强LLM智能体对环境过渡的敏感性,作为轻量即插即用模块,在WebShop和ALFWorld实验中提升任务性能。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28408 2026-07-31 cs.LG cs.AI math.ST stat.ML stat.TH 新提交 62%

On-Policy and Off-Policy Learning for Large Action Spaces

面向大动作空间的在线策略与离线策略学习

Imad Aouali

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本论文针对大动作空间交互式系统的策略学习挑战,提出meTS、dTS、sDM等结构化贝叶斯方法,解决在线与离线策略学习的关键问题并提供理论保证。

Comments PhD Thesis, 241 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26865 2026-07-30 stat.ML cs.AI cs.IT cs.LG math.IT 新提交 62%

Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents

短思考、智能延迟、行动与循环:面向边缘大语言模型智能体的校准推理与感知不确定性的延迟机制

Amirmohammad Farzaneh, Osvaldo Simeone

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出TSDS框架,结合收敛探测器与困惑度延迟规则,经LTT流程校准后,可在边缘LLM智能体上减少43%-73%的思考计算量,同时保证奖励与云端调用率,在多类基准任务上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24991 2026-07-29 cs.SE cs.AI 新提交 62%

Preliminary Guidelines for Using and Evaluating GenAI Tools to Support Systematic Literature Reviews

使用和评估生成式人工智能工具以支持系统文献综述的初步指南

Barbara Kitchenham, Sebastián Pizard, Lech Madeyski, Ronnie de Souza Santos, Martin Shepperd, David Budgen

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.SE

AI总结 研究探讨如何用GenAI支持系统文献综述,通过快速审查、思想实验等方法,识别评估GenAI用于SLRs的问题及过程要点,形成GUEST建议,助研究人员利用GenAI开展可靠综述与评估研究,强调其需人工监督及能提供成本效益帮助。

Comments 58 pages, 2 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24892 2026-07-29 cs.LG cs.AI 新提交 62%

LLM as Forecasting Planner: Training-Free Text Conditioning for Time-Series Foundation Models

大语言模型作为预测规划器:时间序列基础模型的免训练文本条件设定

Huu Hiep Nguyen, Dung Nguyen, Minh Hoang Nguyen, Dai Do, Hung Le

机构 * Deakin University(迪肯大学) Applied Artificial Intelligence Initiative(应用人工智能倡议)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究文本条件时间序列预测问题,核心方法是将预测设为TSFM生成轨迹上的规划问题,以冻结TSFM为模拟器、LLM为策略和价值函数,实例化\rc{}框架,主要贡献是通过实验证明该框架能带来持续改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22182 2026-07-27 cs.CL cs.AI 新提交 62%

From Isolated Tasks to Structured Capabilities: A Multilayer Taxonomy for Large Language Models

从孤立任务到结构化能力:大语言模型的多层分类法

Shixin Fang, Jiachen Wo, Wenjuan Qin, Sihang Jiang, Yanghua Xiao

机构 * Fudan University(复旦大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出大语言模型多层分类法,含14个能力领域和91个子技能,以人类认知科学为指导。通过筛选和映射相关论文,分析研究关注情况,揭示领域及子技能分布,此分类法有助于大语言模型研究组织、评估等多方面工作。

Comments 34 pages, 5 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22153 2026-07-27 cs.AI cs.LG 新提交 62%

Industrial Tokenization for LLM-Based Health Intelligence: A Federated Architecture for Industrial Evidence Integration

基于大语言模型的工业健康智能的工业令牌化:一种用于工业证据集成的联邦架构

Deshui Li, Xiao-Ming Yuan, Zishun Wang

机构 * Mingyang Smart Energy Co., Ltd.(明阳智慧能源集团股份有限公司)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究工业健康管理中异构信息源集成问题,提出工业令牌化概念及联邦架构,将特定源分析输出转为工业令牌,以实现跨源推理。给出基于振动诊断输出等的端到端诊断令牌路径,定位工业令牌化为语义接口。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏