arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6674 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 1921 篇

2606.26590 2026-06-26 cs.LG cs.CR 新提交 57%

Empirical Software Engineering TerraProbe: A Layered-Oracle Framework for Detecting Deceptive Fixes in LLM-Assisted Terraform

实证软件工程 TerraProbe: 用于检测LLM辅助Terraform中欺骗性修复的分层Oracle框架

Manar Alsaid, Chimdumebi Nebolisa, Faris Abbas

机构 * East Texas A&M University(东德克萨斯农工大学) Texas Woman’s University(德克萨斯女子大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出TerraProbe五层Oracle框架,评估LLM辅助Terraform安全修复,发现71.4%的真实修复为欺骗性修复,并建立四维欺骗性修复分类法。

Comments 34 pages, 12 figures, 14 tables. Journal-first manuscript submitted to Empirical Software Engineering. Primary classification: cs.SE; cross-list: cs.CR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26400 2026-06-26 cs.AI cs.SY eess.SY 新提交 57%

When Agents Meet Electric Bus Fleet Operations: Pricing Behavior, Trade-offs, and Policy Implications in an Aggregator Framework

当智能体遇上电动公交车队运营:聚合框架中的定价行为、权衡与政策启示

Jônatas Augusto Manzolli, Ali Eslami, Luis Miranda-Moreno, Jiangbo Yu

机构 * Department of Civil Engineering, McGill University(麦吉尔大学土木工程系) INESC Coimbra, University of Coimbra(科英布拉大学INESC Coimbra研究所)

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 提出一种智能体聚合框架,将优化调度模型与监督智能体结合,协调电动公交车队的充电、V2G及运营决策,揭示利润导向定价可能损害公交运营商利益,需透明协调与价值共享规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26333 2026-06-26 cs.LG 新提交 57%

Mesh-RL: Coupled subgrid reinforcement learning

Mesh-RL:耦合子网格强化学习

Behnam Gheshlaghi, Bahador Rashidi, Shahin Atakishiyev

机构 * University of Alberta(阿尔伯塔大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出Mesh-RL框架,通过有限元启发的空间域分解和边界一致时序差分更新,加速稀疏奖励环境中的长程信用分配,提升收敛速度与学习稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26217 2026-06-26 cs.LG cs.CV cs.RO 新提交 57%

Fast LeWorldModel

快速LeWorldModel

Yuntian Gao, Xiangyu Xu

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出Fast-LeWM,通过动作前缀并行预测未来潜在状态,替代LeWM的自回归滚动,降低规划时间并减少潜在误差累积。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25098 2026-06-25 cs.DC cs.AI cs.PF cs.SY eess.SY 新提交 57%

Power-Flexible AI Data Centers: A New Paradigm for Grid-Responsive Compute

灵活功率的AI数据中心:一种电网响应式计算的新范式

Chris Williams, Philip Colangelo, Ayse Coskun, Ethan Levine, Andy Neale, Ciaran Roberts, Shayan Sengupta, Nikhil Shirolkar, Varun Sivaram, Sarah Soares, Ethan Tiao, Scott Underwood, Daniel Wilson, Frank Sharp, Luke Wainwright, Harry Petty, Scott Wallace, Brandon Records

机构 * Emerald AI Electric Power Research Institute (EPRI)(电力研究研究院) National Grid(国家电网) NVIDIA Oracle

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出将GPU集群作为电网交互式资产,通过软件编排实现负载快速削减、持续降载和碳感知运行,同时保持优先级任务服务水平,并实现跨地理集群的性能感知负载迁移。

Comments 14 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24893 2026-06-25 cs.CL 新提交 57%

AgentOdyssey: Open-Ended Long-Horizon Text Game Generation for Test-Time Continual Learning Agents

AgentOdyssey:面向测试时持续学习智能体的开放式长程文本游戏生成

Zheyuan Zhang, Zehao Wen, Alvin Zhang, Andrew Wang, Jianwen Xie, Daniel Khashabi, Tianmin Shu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 提出AgentOdyssey框架,通过程序化生成开放式文本游戏,评估智能体在测试时持续学习的关键能力,包括探索、知识获取、记忆和长程规划。

Comments Project page: https://agentodyssey.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24991 2026-06-25 eess.SY cs.LG cs.SY math.OC 新提交 57%

Solving Markov Decision Processes with Future Information via MPC

通过MPC求解具有未来信息的马尔可夫决策过程

Shambhuraj Sawant, Akhil S Anand, Dirk Reinhardt, Sebastien Gros

机构 * Norwegian University of Science and Technology(挪威科学技术大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出一种参数化模型预测控制(MPC)方法,可精确表示具有未来信息的MDP的最优价值函数和策略,并通过强化学习学习参数,在点质量赛车任务中验证有效性。

Comments 6 pages, accepted to IFAC World Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25362 2026-06-25 math.OC cs.LG 新提交 57%

Learning Optimization Proxies for Sequential Contextual Stochastic Programs: An Order Fulfillment Application

学习序列上下文随机程序的优化代理:订单履行应用

Tinghan Ye, Shuaicheng Tong, Changkun Guan, Beste Basciftci, Pascal Van Hentenryck

机构 * H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(佐治亚理工学院工业与系统工程系) Tippie College of Business, University of Iowa(爱荷华大学蒂普皮商学院)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 针对需要亚秒级响应的序列上下文随机程序,提出一种场景嵌入神经网络代理,通过离线训练和在线解码器保证可行性,在订单履行中实现2800倍加速和3.3%成本改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24039 2026-06-25 cs.RO cs.LG cs.SY eess.SY math.OC 新提交 57%

TurboMPC: Fast, Scalable, and Differentiable Model Predictive Control on the GPU

TurboMPC:GPU上快速、可扩展且可微分的模型预测控制

Gabriel Bravo-Palacios, Jianghan Zhang, Zachary Pestrikov, Brian Plancher, Thomas Lew

机构 * Dartmouth College(达特茅斯学院) Toyota Research Institute(丰田研究所)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出TurboMPC,一种完全运行在GPU上的可微分MPC求解器,通过SQP、ADMM内求解器、隐式微分和JAX-CUDA协同设计,在约束规划、人形模仿学习和强化学习中实现高达15倍和58倍的加速,并在实车最小时间竞赛中通过贝叶斯优化调参显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24483 2026-06-24 eess.SP cs.AI 新提交 57%

Adaptive Machine Learning Framework for UAV Trajectory Optimization in O-RAN

面向O-RAN的无人机轨迹优化自适应机器学习框架

Chenrui Sun, Swarna Bindu Chetty, Gianluca Fontanesi, Mahnaz Arvaneh, Walid Saad, Hamed Ahmadi

机构 * school of Physics, Engineering and Technology, University of York(物理、工程与技术学院,约克大学) Radio Systems Research, Nokia Bell Labs(诺基亚贝尔实验室无线电系统研究部) School of Electrical and Electronic Engineering, University of Sheffield(电子与电气工程学院,谢菲尔德大学) Bradley Department of Electrical and Computer Engineering, Virginia Tech(布拉德利电气与计算机工程系,弗吉尼亚理工学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出一种集成增强持续迁移学习的无人机轨迹优化框架,通过模型选择机制从预训练库中迁移知识,减少适应时间,仿真表明收敛时间减少44%-56%。

Comments 16 pages, 12 figures, IEEE Transactions on Vehicular Technology

Journal ref 2026 IEEE Transactions on Vehicular Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24616 2026-06-24 cs.AI cs.PF econ.GN q-fin.EC 新提交 57%

AI Tokenomics: The Economics of Tokens, Computation, and Pricing in Foundation Models

AI Tokenomics:基础模型中的代币、计算与定价经济学

Quanyan Zhu

机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院)

专题命中 规划决策 :workflow(abstract);分类 cs.AI

AI总结 本文提出AI代币经济学框架,研究代币在AI系统中的生成、消耗、定价、分配与优化,揭示代币支出与经济价值的区别,并指出开放研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24311 2026-06-24 cs.AI 新提交 57%

LemonHarness Technical Report

LemonHarness 技术报告

Kailong Ren, Fubo Sun, Jiachen Liu, Liu Yang, Zimo Yin, Jiaying Li, Congli Yin, Ming He, Yu Huo, Jiawei Liu, Zeping Chen, Yubin Huangfu, Ronghua Li, Yixuan Wu, Xing Su, Yanzhi Xu, Likang Wu, Hongke Zhao, Lei Zhang, Xiaohui Geng, Jianping Fan

机构 * Tianjin University(天津大学) Anhui University(安徽大学) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 针对长周期智能体因工作空间状态变化难以追踪的问题,提出LemonHarness框架,通过显式执行边界、可复用规则知识库和时感知执行机制,在Terminal-Bench 2.0上实现86.52%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24160 2026-06-24 cs.AI 新提交 57%

An Introduction to Causal Reinforcement Learning

因果强化学习导论

Elias Bareinboim, Junzhe Zhang, Sanghack Lee

机构 * Columbia University(哥伦比亚大学) Graduate School of Data Science(数据科学研究生院)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文提出将因果推断与强化学习统一在结构因果模型框架下,引入广义策略学习、模仿学习和反事实学习等新任务,形成因果强化学习(CRL)领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24124 2026-06-24 cs.AI 新提交 57%

VeryTrace: Verifying Reasoning Traces through Compilable Formalism and Structured Verification

VeryTrace: 通过可编译形式化与结构化验证验证推理轨迹

Ninghan Zhong, Ahmet Ege Tanriverdi, Kaan Kale, Sriram Vishwanath

机构 * School of Electrical and Computer Engineering, Georgia Institute of Technology, USA(佐治亚理工学院电子与计算机工程学院) Department of Electrical and Computer Engineering, Bogazici University, Turkey(博亚奇大学电子与计算机工程系)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出VeryTrace框架,将自然语言推理轨迹形式化为可编译的领域特定语言(DSL),结合确定性检查与LLM审计进行混合验证,实现步骤级错误定位与修复,在数学、机器人规划、亲属推理任务上提升准确率。

Comments Accepted at LM4Plan Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23444 2026-06-24 cs.RO cs.LG 新提交 57%

SkyJEPA: Learning Long-Horizon World Models for Zero-Shot Sim-to-Real Control of Quadrotors

SkyJEPA:用于四旋翼飞行器零样本仿真到现实控制的长时域世界模型学习

Pratyaksh Rao, Wancong Zhang, Randall Balestriero, Yann LeCun, Giuseppe Loianno

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出基于JEPA的潜空间动力学模型,结合物理启发探测器实现长时域预测,并集成采样最优控制实现实时控制,通过自动化数据生成实现零样本仿真到现实迁移。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23500 2026-06-23 cs.DC cs.LG 新提交 57%

Development and Design of FLKit: A Structured Onboarding Toolkit for Federated Learning in Health and Life Sciences

FLKit的设计与开发:面向健康与生命科学中联邦学习的结构化入门工具包

Ashkan Pirmani, Ilse Vermeulen, Goran Vinterhalter, Lotte Geys, Axel Faes, Muhammad Quamber Ali, Nishkala Sattanathan, Geert Vandeweyer, Yves Moreau, Liesbet M. Peeters

机构 * STADIUS, Department of Electrical Engineering (ESAT), KU Leuven(STADIUS部门,电气工程系(ESAT),鲁汶大学) Biomedical Research Institute (BIOMED), Hasselt University(生物医学研究所(BIOMED),哈塞尔特大学) Data Science Institute (DSI), Hasselt University(数据科学研究所(DSI),哈塞尔特大学) Department of Medical Genetics, University of Antwerp(医学遗传学系,安特卫普大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出FLKit,一个面向多学科团队的联邦学习入门工具包,通过角色感知入口、生命周期阶段和FAIR对齐模板,降低健康与生命科学领域联邦学习的实践门槛。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23301 2026-06-23 cs.AI 新提交 57%

EHR-Complex: Benchmarking Medical Agents for Complex Clinical Reasoning

EHR-Complex:面向复杂临床推理的医疗智能体基准测试

Yitong Qiao, Lei Liu, Yue Shen, Jian Wang, Jinjie Gu, Zhixuan Chu, Kui Ren

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出EHR-Complex基准,基于MIMIC-IV构建约5.2万项交互式临床数据库推理任务,评估智能体在复杂SQL和代码执行中的表现,揭示主要失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22936 2026-06-23 cs.AI 新提交 57%

When Agents Commit Too Soon: Diagnosing Premature Commitment in LLM Agents

当智能体过早承诺:诊断LLM智能体中的过早承诺问题

Aman Mehta

机构 * Snowflake AI Research

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文提出表征承诺作为跨运行隐藏状态收敛的指标,用于诊断长程LLM智能体过早承诺问题,并在多个模型和数据集上验证其预测轨迹一致性的能力。

Comments 22 pages, 16 figures Primary: cs.AI Secondary: cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22798 2026-06-23 cs.CL 新提交 57%

Does the Same Token Mean the Same State? MoE Routing as Signal for Reasoning Control

相同的 Token 是否意味着相同的状态?MoE 路由作为推理控制的信号

Kang Chen, Minshen Yu, Junjie Nian, Yaoning Wang, Yixin Cao, Yugang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 规划决策 :agentic(abstract);分类 cs.CL

AI总结 研究发现稀疏 MoE 语言模型中相同 token 的路由状态因上下文而异,基于此提出 RAD 方法,通过路由一致性选择输出,无需解析答案字符串,在数学、GPQA 和代码任务上表现与多数投票相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22528 2026-06-23 cs.AI 新提交 57%

Governance Decay: How Context Compaction Silently Erases Safety Constraints in Long-Horizon LLM Agents

治理衰减:上下文压缩如何悄然消除长周期LLM智能体中的安全约束

Shiyang Chen

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 研究发现LLM智能体的上下文压缩机制会无意中移除安全约束,导致违规行为;提出ConstraintRot基准和Constraint Pinning缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22509 2026-06-23 cs.AI 新提交 57%

Imagine to Ensure Safety in Hierarchical Reinforcement Learning

想象以确保分层强化学习的安全性

Gregory Gorbov, Artem Latyshev, Aleksandr I. Panov

机构 * Cognitive AI Systems Lab(认知人工智能系统实验室) Moscow Independent Research Institute of Artificial Intelligence(莫斯科独立人工智能研究所) FRC Computer Science RAS(俄罗斯科学院联邦研究中心计算机科学研究所)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出结合可学习世界模型与高低层策略的分层方法,通过高层生成安全子目标、低层利用想象滚动减少不安全行为,在长时域任务中显著优于现有安全强化学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21868 2026-06-23 cs.LG 新提交 57%

WiSP: A Working-Set View of Mixture-of-Experts Serving on Extremely Low-Resource Hardware

WiSP:极低资源硬件上混合专家模型服务的工作集视角

Jiamu Zhang, Liang Wu, Mayank Darbari, Liangjie Hong

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构、匿名城市、匿名地区、匿名国家)

专题命中 规划决策 :workflow(abstract);分类 cs.LG

AI总结 针对低资源GPU上MoE模型因专家层CPU卸载导致稀疏性优势丧失的问题,提出工作集分页(WiSP)和边际价值工作集分配(MV-WSA),实现专家与KV缓存间VRAM动态分配,解码吞吐量提升至1.95倍。

Comments 18 pages, 6 figures, 9 tables. Preprint, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21836 2026-06-23 cs.AR cs.AI 新提交 57%

AgentDSE: Reasoning-Augmented Architectural Design Space Exploration

AgentDSE:推理增强的架构设计空间探索

Chenyu Wang, Jiahe Caroline Shi, David Kong, Duane S. Boning, Zishen Wan, Yilun Du, Vijay Janapa Reddi

机构 * Harvard University(哈佛大学) Massachusetts Institute of Technology(麻省理工学院) Columbia University(哥伦比亚大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出AgentDSE,利用大语言模型编码代理自动进行架构推理,在DNN加速器映射、软硬件协同设计和CPU缓存层次优化中,以少两个数量级的评估次数达到竞争或更优的设计质量。

Comments Accepted to the Machine Learning for Architecture and Systems Workshop (MLArchSys), co-located with ISCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21734 2026-06-23 cs.CV cs.AI 新提交 57%

HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning

HPP:通过解耦感知与推理的分层程序化探测用于长视频理解

Awais Rauf, Ahmed Hasssan, Greg Slabaugh

机构 * Queen’s University Belfast(贝尔法斯特女王大学) AMD(AMD公司) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出HPP框架,通过将长视频理解重构为分层视频的迭代程序化探索,解耦语义感知与高阶时序推理,在LongVideoBench等基准上取得显著提升。

Comments Project page: https://awaisrauf.com/HPP

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21616 2026-06-23 cs.CL 新提交 57%

LLM and Human Modes of Representation

LLM与人类的表征模式

Shalom Lappin

机构 * Shalom Lappin

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 研究比较大型语言模型(LLM)与人类在语言知识和现实推理中的表征差异,发现LLM在语言任务上表现优异但处理方式不同,且在推理任务中学习与泛化效率低于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21422 2026-06-23 cs.LG 新提交 57%

Federated Temporal Attention Intelligence for Cyber-Resilient IoMT: Lightweight Digital Twins and PPO-Driven Honeypot Deception

面向网络韧性医疗物联网的联邦时序注意力智能:轻量级数字孪生与PPO驱动的蜜罐欺骗

Syed Zeeshan Haider, Anwar Shah, Muneeb Arif, Hamza Iftikhar, Waqas Ali

机构 * FAST National University of Computer and Emerging Sciences(FAST国立计算机与新兴科学大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 提出LDT-FRL框架,结合时序注意力编码器、轻量级LSTM数字孪生、联邦PPO智能体和蜜罐层,在资源受限的IoMT设备上实现隐私保护的网络攻击检测与响应,在CICDDoS 2019和TON-IoT数据集上分别达到99.66%和99.95%的测试准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21321 2026-06-23 cs.LG 新提交 57%

Objective-Behavior Alignment: Diagnostics for MORL Policy Selection

目标-行为对齐:多目标强化学习策略选择的诊断方法

Antonio Mone, Zuzanna Osika, Florian Felten, Pradeep K. Murukannaiah, Mark Fuge, Frans A. Oliehoek, Luciano Cavalcante Siebert

机构 * Delft University of Technology(代尔夫特理工大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 规划决策 :workflow(abstract);分类 cs.LG

AI总结 提出一种诊断工作流,自动揭示帕累托前沿上仅靠目标值无法体现的行为差异,通过定量和可视化工具辅助策略选择,在简单网格和连续控制基准上验证有效性。

Comments 22 pages, 41 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21306 2026-06-23 cs.AI 新提交 57%

Towards Dys-XAI: Influence-Based Explanations for Dysarthria Severity Assessment

迈向 Dys-XAI:基于影响的构音障碍严重程度评估解释

Xiaoliang Wu, Qiyang Sun, Yupei Li, Erfan Loweimi, Jennifer Williams, Zhengjun Yue

机构 * University of Southampton(南安普顿大学) Imperial College London(帝国理工学院) University of Edinburgh(爱丁堡大学) King's College London(伦敦国王学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出基于影响的实例级可解释性框架,通过支持性和竞争性训练样本解释构音障碍严重程度评估的深度学习模型决策,并通过删除实验验证解释有效性。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20978 2026-06-23 cs.AI cs.HC 新提交 57%

How Should Agents Read Demonstrations? Hierarchical Structure Beats Flat Action Logs

智能体应如何阅读演示?层级结构优于扁平动作日志

Honjar Xing, Jefferson Lin, Henry Lieberman

机构 * MIT Computer Science and Artificial Intelligence Laboratory (CSAIL)(麻省理工学院计算机科学与人工智能实验室(CSAIL))

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文提出将演示中的动作序列组织为带标签的层级子目标,在85个Web自动化任务中,层级结构将模糊描述任务的通过率从76.7%提升至90.7%,而扁平结构改进不显著,消融实验表明子目标分组是唯一驱动因素。

Comments Accepted at the 5th Deep Learning for Code (DL4C) Workshop, ICML 2026. 8 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20900 2026-06-23 cs.CL 新提交 57%

Storyline Trees: Hierarchical Representations for Long-Form Narratives

故事线树:长篇叙事的层次化表示

Litu Ou, Mirella Lapata

机构 * School of Informatics University of Edinburgh(信息学院爱丁堡大学)

专题命中 规划决策 :agentic(abstract);分类 cs.CL

AI总结 提出故事线树,通过自顶向下和自底向上过程构建叙事层次结构,实现自适应检索,在长上下文叙事问答中优于强基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏