arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-16 至 2026-04-16 共收录 159 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 6 篇

2604.13787 2026-04-16 cs.CL 88%

ToolOmni: Enabling Open-World Tool Use via Agentic learning with Proactive Retrieval and Grounded Execution

ToolOmni: 通过代理学习实现开放世界工具使用:基于主动检索和基础执行

Shouzheng Huang, Meishan Zhang, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 工具调用 :tool use(title,abstract);agentic(title,abstract);分类 cs.CL

AI总结 ToolOmni通过主动检索和基础执行实现开放世界工具使用,通过冷启动多轮交互数据集和Decoupled Multi-Objective GRPO算法提升工具检索和执行性能,实验表明其在检索和执行任务上均达到SOTA水平。

Comments 19 pages, 9 figures, 9 tables, accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13052 2026-04-16 cs.SI cs.AI cs.CL cs.CY cs.MA 86%

Form Without Function: Agent Social Behavior in the Moltbook Network

形式而非功能:Moltbook网络中的代理社交行为

Saber Zerhoudi, Kanishka Ghosh Dastidar, Felix Klement, Artur Romazanov, Andreas Einwiller, Dang H. Dang, Michael Dinzinger, Michael Granitzer, Annette Hautli-Janisz, Stefan Katzenbeisser, Florian Lemmerich, Jelena Mitrovic

机构 * University of Passau(帕绍大学) IT:U Austria(奥地利IT:U)

专题命中 工具调用 :agent(title,abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 研究分析Moltbook社交网络中代理的互动、内容和指令层行为,发现其社交层未能有效形成,而技术层则对变化作出反应,导致社交形式存在但功能缺失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13417 2026-04-16 cs.SE cs.AI cs.MA 84%

Bridging Protocol and Production: Design Patterns for Deploying AI Agents with Model Context Protocol

Vasundra Srinivasan

机构 * Data Engineering for Multimodal AI (O’Reilly)(多模态AI数据工程(O’Reilly))

专题命中 工具调用 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.SE

Comments 23 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08791 2026-04-16 cs.CL cs.AI 84%

Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments

通过自动化构建环境提升大语言模型的反馈驱动工具使用

Junjie Ye, Changhao Jiang, Zhengyin Du, Yufei Xu, Xuesong Yao, Zhiheng Xi, Xiaoran Fan, Qi Zhang, Tao Gui, Xuanjing Huang, Jiecao Chen

机构 * Fudan University(复旦大学)

专题命中 工具调用 :tool-use(title,abstract);tool use(abstract);分类 cs.AI、cs.CL

AI总结 本文提出自动化环境构建流程和可验证奖励机制,提升大语言模型的工具使用能力,实验表明在不降低通用能力的情况下显著增强工具使用性能。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13115 2026-04-16 cs.CL cs.IR 79%

Agentic Conversational Search with Contextualized Reasoning via Reinforcement Learning

基于强化学习的上下文化推理对话搜索代理

Fengran Mo, Yifan Gao, Sha Li, Hansi Zeng, Xin Liu, Zhaoxuan Tan, Xian Li, Jianshu Chen, Dakuo Wang, Meng Jiang

机构 * University of Montreal(蒙特利尔大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Notre Dame(诺特丹大学) Northeastern University(东北大学)

专题命中 工具调用 :agentic(title);agent(abstract);分类 cs.CL

AI总结 本文提出一种基于强化学习的对话搜索代理,通过在对话轮次中交替搜索与推理,实现探索性与适应性行为,优于现有基准方法。

Comments Accepted by ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13940 2026-04-16 cs.AI 57%

AI-Assisted Peer Review at Scale: The AAAI-26 AI Review Pilot

大规模AI辅助同行评审:AAAI-26 AI评审试点

Joydeep Biswas, Sheila Schoepp, Gautham Vasan, Anthony Opipari, Arthur Zhang, Zichao Hu, Sebastian Joseph, Matthew Lease, Junyi Jessy Li, Peter Stone, Kiri L. Wagstaff, Matthew E. Taylor, Odest Chadwicke Jenkins

机构 * AAAI(国际人工智能协会)

专题命中 工具调用 :tool use(abstract);分类 cs.AI

AI总结 本文探讨了AI在大规模同行评审中的应用,展示了AAAI-26中22977篇论文通过先进系统生成的AI评审,结果显示作者和评审委员认为AI评审在技术准确性和研究建议方面优于人类评审,并引入了新的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 47 篇

2509.20490 2026-04-16 cs.MA cs.CL cs.CV 89%

RadAgents: Multimodal Agentic Reasoning for Chest X-ray Interpretation with Radiologist-like Workflows

RadAgents: 多模态代理推理用于胸片解读的放射科工作流程

Kai Zhang, Corey D Barrett, Jangwon Kim, Lichao Sun, Tara Taghavi, Krishnaram Kenthapadi

机构 * Oracle Health AI Lehigh University(莱荷大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);tool use(abstract);workflow(abstract)

AI总结 RadAgents通过结合临床先验知识和任务感知的多模态推理,构建模块化、可审计的放射科工作流程,提升胸片解读的可靠性与临床一致性。

Comments MIDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14133 2026-04-16 cs.AI cs.CR cs.MA 87%

Formalizing the Safety, Security, and Functional Properties of Agentic AI Systems

形式化代理AI系统的安全、安全性和功能性属性

Edoardo Allegrini, Ananth Shreekumar, Z. Berkay Celik

机构 * Sapienza University of Rome(罗马萨皮恩扎大学) Purdue University(普渡大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);AI agent(abstract);autonomous agent(abstract)

AI总结 本文提出一个统一的语义框架,用于分析、设计和部署正确、可靠且稳健的代理AI系统,通过形式化验证确保系统行为的安全性和功能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13156 2026-04-16 cs.CR cs.AI 86%

In-Context Autonomous Network Incident Response: An End-to-End Large Language Model Agent Approach

上下文自主网络事件响应:一种端到端的大语言模型代理方法

Yiran Gao, Kim Hammar, Tao Li

机构 * Department of Systems Engineering, City University of Hong Kong(香港城市大学系统工程系) Department of Electrical and Electronic Engineering, University of Melbourne(墨尔本大学电子与电气工程系)

专题命中 规划决策 :agent(title,abstract);planning(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出一种端到端的大语言模型代理方法,通过整合感知、推理、规划和行动功能,实现网络事件响应的自主学习与适应,实验表明其恢复效率比前沿模型快23%。

Comments 2026 AAAI Summer Symposium on Human-Aware AI Agents for the Cyber Battlefield

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13384 2026-04-16 cs.NI 85%

Agentic Open RAN: A Deterministic and Auditable Framework for Intent-Driven Radio Control

代理式开放无线接入网:一种确定性和可审计的意图驱动无线控制框架

Hengxu Li, Dongkuan Xu, Mingzhe Chen, Yuchen Liu

专题命中 规划决策 :agentic(title,abstract);autonomous agent(abstract);planning(abstract)

AI总结 本文提出A1gent框架,通过分离推理与实时执行,实现意图驱动的无线控制,结合非实时代理和近实时代理,确保可审计的协调与可预测的适应性。

Comments 6 pages, 5 figures. Accepted at IEEE ICC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07165 2026-04-16 cs.AI cs.LG 84%

Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization

链式推理,树状学习:多轮智能体策略优化的自我校正与嫁接

Yu Li, Sizhe Tang, Tian Lan

机构 * Department of Electrical and Computer Engineering, George Washington University(电气与计算机工程系,乔治·华盛顿大学)

专题命中 规划决策 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出T-STAR框架,通过构建认知树整合轨迹,引入自我校正机制和上下文思维嫁接,提升多轮推理任务中策略优化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13757 2026-04-16 cs.AI cs.HC 83%

Rethinking AI Hardware: A Three-Layer Cognitive Architecture for Autonomous Agents

重新思考人工智能硬件:一种三层认知架构用于自主代理

Li Chen

机构 * LI CHEN(李晨)

专题命中 规划决策 :autonomous agent(title);agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出Tri-Spirit架构,通过分解智能为规划、推理和执行三层,提升自主系统效率,实验显示任务延迟和能耗降低显著。

Comments A system architecture paper with simulation-based evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13942 2026-04-16 cs.RO 82%

Goal2Skill: Long-Horizon Manipulation with Adaptive Planning and Reflection

Goal2Skill:基于自适应规划与反思的长时程操作

Zhen Liu, Xinyu Ning, Zhe Hu, Xinxin Xie, Weize Li, Zhipeng Tang, Chongyu Wang, Zejun Yang, Hanlin Wang, Yitong Liu, Zhongzhu Pu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 规划决策 :planning(title,abstract);agentic(abstract)

AI总结 本文提出双系统框架,通过分离高层语义推理与低层运动执行,提升长时程操作的鲁棒性和适应性,实验表明其在RMBench任务中显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10605 2026-04-16 cs.RO 82%

LEO-RobotAgent: A General-purpose Robotic Agent for Language-driven Embodied Operator

LEO-RobotAgent: 一种通用的基于语言的机器人代理框架

Lihuang Chen, Xiangyu Luo, Jun Meng

机构 * Zhejiang University, Hangzhou 310000, P. R. China(浙江大学,杭州310000,中华人民共和国)

专题命中 规划决策 :agent(title,abstract);planning(abstract)

AI总结 本文提出LEO-RobotAgent框架,旨在通过语言驱动实现机器人在复杂场景中完成多样化任务,具备强泛化能力、鲁棒性和高效性,降低人机交互门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13609 2026-04-16 cs.LG cs.AI 81%

Golden Handcuffs make safer AI agents

黄金手铐使AI代理更安全

Aram Ebtekar, Michael K. Cohen

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 规划决策 :AI agent(title);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了一种贝叶斯缓解方法,通过扩展代理的主观奖励范围以包含大负值,从而在一般环境中提高安全性。设计了一种简单的覆盖机制,当预测值低于固定阈值时,将控制权交给安全导师。证明了该代理在能力与安全方面的双重属性。

Comments 26 pages, preliminary version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13996 2026-04-16 cs.HC 80%

Acts of Configuration: Rethinking Provenance, Temporality and Legitimacy in Post-Mortem Agents

配置行为:重新思考死后代理的来源、时间和合法性

Kellie Yu Hui Sim, Pin Sym Foong, Darryl Lim, John-Henry Lim, Kenny Tsu Wei Choo

专题命中 规划决策 :agent(abstract);AI agent(abstract);planning(abstract);agentic(abstract)

AI总结 本文通过工作坊探讨死后代理在决策能力丧失后如何配置,发现人们更倾向于基于第一方授权的有限代理,但时间因素促使代理在能力丧失后保持静止并影响后续使用。

Comments Accepted at DIS 2026 (PWiP). 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13814 2026-04-16 cs.HC cs.AI 79%

Cognitive Offloading in Agile Teams: How Artificial Intelligence Reshapes Risk Assessment and Planning Quality

敏捷团队中的认知卸载:人工智能如何重塑风险评估与规划质量

Adriana Caraeni, Alexander Shick, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文通过实验比较AI、人类和混合规划模型,发现AI虽高效但风险评估差,人类虽灵活但成本高,提出混合框架提升规划质量。

Comments 7 pages, 5 Tables, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13812 2026-04-16 cs.AI quant-ph 79%

AlphaCNOT: Learning CNOT Minimization with Model-Based Planning

AlphaCNOT:基于模型规划的学习CNOT最小化

Jacopo Cossio, Daniele Lizzio Bosco, Riccardo Romanello, Giuseppe Serra, Carla Piazza

机构 * University of Udine Udine Italy University of Udine \& University ``Federico II'' of Naples Udine \& Naples Italy University of Udine University of Udine \& University ``Federico II'' of Naples

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出AlphaCNOT框架,利用蒙特卡洛树搜索实现CNOT最小化,相比PMH方法减少32%的CNOT门数,在拓扑约束下也取得显著优化效果。

Comments 22 pages, 11 figures , journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01410 2026-04-16 cs.AI 79%

GraphScout: Empowering Large Language Models with Intrinsic Exploration Ability for Agentic Graph Reasoning

GraphScout: 通过内在探索能力增强大语言模型以实现代理图推理

Yuchen Ying, Weiqi Jiang, Tongya Zheng, Yu Wang, Shunyu Liu, Kaixuan Chen, Mingli Song

机构 * Zhejiang University(浙江大学) Hangzhou City University(杭州市大学) Nanyang Technological University(南洋理工大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 GraphScout通过灵活的图探索工具,使模型自主生成结构化训练数据,从而在无需人工标注的情况下提升大语言模型的图推理能力,实验显示其在多个领域表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19315 2026-04-16 cs.RO cs.AI 79%

Online Navigation Planning for Long-term Autonomous Operation of Underwater Gliders

长期自主运行的水下滑翔机在线导航规划

Victor-Alexandru Darvariu, Charlotte Z. Reed, Jan Stratmann, Bruno Lacerda, Benjamin Allsup, Stephen Woodward, Elizabeth Siddle, Trishna Saeharaseelan, Owain Jones, Dan Jones, Tobias Ferreira, Chloe Baker, Kevin Chaplin, James Kirk, Ashley Iceton-Morris, Ryan D. Patmore, Jeff Polton, Charlotte Williams, Christopher D. J. Auckland, Rob A. Hall, Alexandra Kokkinaki, Alvaro Lorenzo Lopez, Justin J. H. Buck, Nick Hawes

机构 * Oxford Robotics Institute(牛津机器人研究所) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Optiver(Optiver公司) Stateful Robotics(Stateful Robotics公司) National Oceanography Centre(国家海洋研究中心) School of Environmental Sciences, University of East Anglia(东安格利亚大学环境科学学院) Scottish Association for Marine Science(苏格兰海洋科学协会)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出基于蒙特卡洛树搜索的在线导航规划方法,通过物理信息模拟器生成样本,实现水下滑翔机在不确定环境下的自主规划,提升任务持续时间和路径长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07924 2026-04-16 cs.RO cs.AI math.OC 79%

Optimized Human-Robot Co-Dispatch Planning for Petro-Site Surveillance under Varying Criticalities

面向石油设施监控的优化人机协同调度规划

Nur Ahmad Khatim, Mansur Arief

机构 * King Fahd University of Petroleum and Minerals (KFUPM)(国王法赫德石油矿物大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出人机协同调度设施选址问题,考虑基础设施关键性分层、人机监督比例约束和最小利用率要求,通过三种技术成熟度场景评估指挥中心选址,结果显示从保守到未来自主操作的过渡可显著降低成本并保持关键基础设施覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14026 2026-04-16 cs.RO 78%

Scale-Invariant Sampling in Multi-Arm Bandit Motion Planning for Object Extraction

多臂老虎机运动规划中的缩放不变采样用于物体提取

Servet B. Bayraktar, Andreas Orthey, Marc Toussaint

机构 * Technical University of Berlin(柏林技术大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出一种缩放不变采样策略,用于多臂老虎机运动规划中的物体提取任务,通过生长-收缩搜索找到高熵采样尺度,并利用PCA确定提取方向,提高了8种3D物体提取场景的成功率。

Comments 19 pages, 5 figures. Accepted at WAFR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17792 2026-04-16 cs.CV cs.RO 78%

Target-Bench: Can Video World Models Achieve Mapless Path Planning with Semantic Targets?

Target-Bench: 视频世界模型能否在语义目标下实现无地图路径规划?

Dingrui Wang, Zhihao Liang, Hongyuan Ye, Zhexiao Sun, Zhaowei Lu, Yuchen Zhang, Yuyu Zhao, Yuan Gao, Marvin Seegert, Finn Schäfer, Haotong Qin, Wei Li, Luigi Palmieri, Felix Jahncke, Mattia Piccinini, Johannes Betz

机构 * TUM(慕尼黑技术大学) Bosch AI Center(博世人工智能中心) ETH(苏黎世联邦理工学院) NJU(南京大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 Target-Bench首次评估视频世界模型的语义推理、空间估计和规划能力,通过450个机器人采集场景和5个互补指标揭示当前模型在语义推理与视觉生成间的显著差距。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12067 2026-04-16 cs.RO 78%

Robust Route Planning for Sidewalk Delivery Robots

面向人行道的鲁棒路径规划

Xing Tong, Michele D. Simoni

机构 * Division of Transport and Systems Analysis, KTH Royal Institute of Technology(交通与系统分析系,皇家理工学院)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文研究了人行道配送机器人在动态环境中的鲁棒路径规划问题,通过模拟机器人、行人和障碍物的交互,结合鲁棒优化与仿真生成真实通行时间,评估不同机器人设计和环境条件下的效率。

Journal ref Transportation Research Part C: Emerging Technologies, 188(2026), 105670

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13323 2026-04-16 cs.RO 78%

Vectorizing Projection in Manifold-Constrained Motion Planning for Real-Time Whole-Body Control

流形约束运动规划中的向量投影:用于实时全身控制

Shrutheesh R Iyer, I-Chia Chang, Andrew Z. Liu, Yan Gu, Zachary Kingston

机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系) School of Mechanical Engineering, Purdue University(普渡大学机械工程学院)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出一种基于SIMD加速的流形约束运动规划器,通过并行化视角重新审视基于投影的约束满足方法,实现对复杂系统如人形机器人轨迹规划的实时约束满足。

Comments 8 pages, 8 figures, 3 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13204 2026-04-16 cs.RO 78%

Weakly-supervised Learning for Physics-informed Neural Motion Planning via Sparse Roadmap

基于稀疏路图的弱监督物理引导神经运动规划

Ruiqi Ni, Yuchen Liu, Ahmed H. Qureshi

机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出H-NTFields,结合稀疏路图的弱监督与物理引导PDE正则化,提升复杂环境中运动规划的鲁棒性和推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01614 2026-04-16 cs.RO 78%

Smooth Feedback Motion Planning with Reduced Curvature

具有减少曲率的平滑反馈运动规划

Aref Amiri, Steven M. LaValle

机构 * Faculty of Information Technology and Electrical Engineering, University of Oulu(信息科技与电气工程学院,奥卢大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出一种高效方法,通过系统对齐局部向量场和构造最大星形链,减少路径弯曲,提升机器人运动效率和控制效果。

Comments Accepted for publication in IEEE Robotics and Automation Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07464 2026-04-16 cs.RO cs.SY eess.SY 78%

Safe and Nonconservative Contingency Planning for Autonomous Vehicles via Online Learning-Based Reachable Set Barriers

通过基于在线学习的可达集屏障实现自主车辆的安全非保守应急规划

Rui Yang, Lei Zheng, Shuzhi Sam Ge, Jun Ma

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出基于在线学习的实时应急轨迹优化框架,通过动态量化多模态HV不确定性并逐步细化其可达集,确保安全性和效率,在不确定环境下提升驾驶效率和乘客舒适度。

Comments 16 pages, 13 figures

Journal ref IEEE Trans. Control Syst. Technol., 2026, pp.1-16

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13539 2026-04-16 physics.med-ph 78%

Direct optimization of the probability of lesion origin in proton treatment planning for low-grade glioma patients

质子治疗低级别星形细胞瘤患者病变起源概率的直接优化

Tim Ortkamp, Habiba Sallem, Semi Harrabi, Martin Frank, Oliver Jäkel, Julia Bauer, Niklas Wahl

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出基于POLO模型的自动化治疗计划方法,通过整合POLO计算与优化,提高治疗计划的准确性,同时保持靶区覆盖度。

Comments 36 pages, 10 figures, 3 tables, partly already presented at PTCOG 62

Journal ref Med Phys. 2026;53:e70395

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22750 2026-04-16 cs.CL cs.AI 73%

MARCH: Evaluating the Intersection of Ambiguity Interpretation and Multi-hop Inference

MARCH:评估歧义解释与多跳推理的交集

Jeonghyun Park, Ingeol Baek, Seunghyun Yoon, Haeun Jang, Aparna Garimella, Akriti Jain, Nedim Lipka, Hwanhee Lee

机构 * Chung-Ang University(Chung-Ang 大学) Adobe Research(Adobe 研究)

专题命中 规划决策 :planning(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出MARCH基准,通过多LLM验证和人工标注,包含2209个多跳歧义问题,揭示了当前模型在结合歧义解决与多步推理上的挑战,并提出CLARION框架提升推理系统鲁棒性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏