arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-07 至 2026-07-07 共收录 296 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 25 篇

2607.04395 2026-07-07 cs.LG 新提交 94%

NKI-Agent: Domain-Specific Fine-Tuning and Agentic Tool Use for Neuron Kernel Generation

NKI-Agent:用于神经元内核生成的特定领域微调与智能体工具使用

Junjie Tang, Jun Huan, Hao Zhou, Yuhao Zhang, Lin Wang

机构 * AWS Neuron Team(亚马逊云科技神经元团队) Amazon Web Services(亚马逊云科技)

专题命中 工具调用 :agent(title,title_cn);tool use(title,abstract);agentic(title,abstract);分类 cs.LG

AI总结 针对新兴AI加速器,介绍NKI-Agent系统,结合特定领域监督微调与编译验证修复智能体循环生成NKI内核,适配框架、构建基准并评估,显示工具使用关键及不同模型表现,为强化学习奖励设计提供指导。

Comments 7 pages. Accepted at DL4C @ ICML 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04034 2026-07-07 cs.SE cs.AI 新提交 88%

The "I Don't Know" Filter: Enhancing Agentic Reliability in Function Calling

“我不知道”过滤器:提高函数调用中智能体的可靠性

Stefan Broecker, Mason del Rosario, Boris Selitser, Thomas Strohmer

机构 * University of California, Davis, Department of Computer Science(加州大学戴维斯分校计算机科学系) Okareo, Inc.(Okareo公司) University of California, Davis, Department of Mathematics(加州大学戴维斯分校数学系)

专题命中 工具调用 :function calling(title,abstract);agentic(title);agent(abstract);分类 cs.AI、cs.SE

AI总结 研究语言模型在函数调用基准测试中性能提升但因训练评估指标致幻觉问题。提出考虑错误函数调用负面结果的评估指标及可量化不确定性、去除有害函数调用的轻量级可训练过滤器,助力智能体知道何时说“我不知道”以提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00597 2026-07-07 cs.CL cs.IR 新提交 88%

Multi-Turn Agentic Scientific Literature Search via Workflow Induction

通过工作流归纳实现多轮智能科学文献搜索

Jisen Li, Bingxuan Li, Nanyi Jiang, Xuying Ning, Xiyao Wang, Yifan Shen, Heng Wang, Yuqing Jian, Xiaoxia Wu, Ben Athiwaratkun, Pan Lu, Jiaxuan You, Bingxin Zhao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Together AI University of Pennsylvania(宾夕法尼亚大学) Stanford University(斯坦福大学)

专题命中 工具调用 :workflow(title,abstract);agentic(title);agent(abstract);分类 cs.CL

AI总结 提出PaperPilot,通过构建可执行DAG工作流进行多轮文献搜索,利用用户反馈优化查询和工作流,显著提升搜索性能并消除执行错误。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04686 2026-07-07 cs.CL cs.AI cs.SE 新提交 85%

ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents

ToolFailBench:诊断大语言模型智能体中的工具使用失败

Harsh Soni

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 工具调用 :tool-use(title,abstract);tool use(abstract);分类 cs.AI、cs.CL、cs.SE;agentic(comments)

AI总结 介绍ToolFailBench诊断基准,用于衡量金融、医学等领域1000个任务中的工具使用失败情况。通过规则分类器和大语言模型裁判标注失败类型,发现模型工具使用存在差异,强调评估应考量多方面。

Comments 18 pages, 3 figures. Published at the Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) and the Workshop on Failure Modes of Agentic AI (FAGEN) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03953 2026-07-07 cs.CL cs.AI 新提交 84%

The Remarkable Effectiveness of Providing AI Agents with Natural Language Tools: A Replication Study Validating NLT Performance Across 14 Models

为人工智能智能体提供自然语言工具的显著有效性:一项在14个模型上验证自然语言工具性能的复制研究

Alexander Somma, Isabelle Plante, Fred Premji

机构 * Sage.is AI-UI(Sage.is人工智能用户界面)

专题命中 工具调用 :AI agent(title);tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 该研究独立复制并扩展了自然语言工具(NLT)框架,在14个模型和8560次试验中评估NLT,验证其效果,发现其能提升工具调用准确率、减少关键错误、降低令牌使用量,还证实模型能力对NLT优势有调节作用。

Comments 28 pages, 6 figures, replication study, replication of arXiv:2510.14453 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03441 2026-07-07 cs.LG cs.AI 新提交 84%

No Time Like the Present: Agentic Test-Time Training for LLM Agents

机不可失:大语言模型智能体的测试时训练

Yanbo Wang, Jinhua Hao, Yuze Shi, Kun Yuan, Ming Sun

机构 * Kuaishou Technology(快手科技)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 研究多轮智能体情节中的连续测试时训练,提出智能体测试时训练方法,通过token级重加权减少重复文本损失,构建并发服务系统,提升了在ALFWorld和SWE-bench Lite上的成功率。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04124 2026-07-07 cs.RO cs.AI 新提交 83%

Conflict-Based Lazy Search for Fast Multi-Manipulator Planning

基于冲突的懒搜索用于快速多机器人规划

Dongliang Zheng, Zhipeng Wang, Siqi Wang, Yuxi Lu, Bin He, Hesheng Wang, Panagiotis Tsiotras

机构 * Shanghai Research Institute for Intelligent Autonomous Systems, Shanghai Institute of Intelligent Science and Technology, the State Key Laboratory of Autonomous Intelligent Unmanned Systems, and Frontiers Science Center for Intelligent Autonomous Systems of Ministry of Education, Tongji University(上海智能无人系统科学中心,上海智能科学与技术研究院,自主智能无人系统国家重点实验室,同济大学智能自主系统前沿科学中心) Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系) School of Aerospace Engineering and Institute for Robotics and Intelligent Machines, Georgia Institute of Technology(佐治亚理工学院航空航天工程学院和机器人与智能机器研究所)

专题命中 工具调用 :planning(title,abstract);agent(abstract);分类 cs.AI

AI总结 针对多机器人在杂乱工作空间的实时规划难题,提出基于冲突的懒搜索(CBLS)算法。该算法基于CBS,通过预计算和懒搜索改进,采用懒评估图与LEA*算法,应用于多机器人规划问题,性能优于CBS和RRT-Connect。

Journal ref IEEE/ASME Transactions on Mechatronics(TMECH) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02716 2026-07-07 cs.MA 新提交 82%

Evaluating Large Language Models for Decision-Making in Agent-Based Urban Mobility Simulations

在基于代理的城市交通模拟中评估用于决策的大语言模型

Bruno Cascaes Alves, Míriam Blank Born, Ulisses Gilioli Francescatto Júnior, Felipe Moura Goulart, Letícia Brandão Caldas, Marilton Sanchotene de Aguiar

专题命中 工具调用 :agent(title,abstract);multi-agent(abstract)

AI总结 研究在多智能体模拟中集成大语言模型作为决策组件,提出混合架构,通过API连接GAMA平台与外部基于大语言模型的模块,能指导智能体重规划行为,比较不同场景下效果,显示其可丰富行为表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23327 2026-07-07 cs.CV cs.AI 新提交 81%

VideoAgent: All-in-One Framework for Video Understanding and Editing

VideoAgent: 视频理解与编辑的全能框架

Hengji Zhou, Lingxuan Huang, Jian Wang, Bing Zhou, Si Wu, Lianghao Xia, Chao Huang

机构 * South China University of Technology(华南理工大学) The University of Hong Kong(香港大学) Snap Inc(Snap公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 工具调用 :agent(abstract);planning(abstract);agentic(abstract);multi-agent(abstract)

AI总结 提出VideoAgent,一种基于多智能体编排的全能框架,通过自动镜头创建和30多个专业编辑智能体,解决现有系统在长视频理解和多样化编辑操作上的局限,在VideoEdit基准上实现87-95%编排成功率并降低60% API成本。

Comments Preprint. Code available at https://github.com/HKUDS/VideoAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03333 2026-07-07 cs.DC cs.AI cs.LG 新提交 81%

SPORK: Self-Speculative Forking to Accelerate Agentic LLM Inference

SPORK:自我推测性分叉以加速智能体大语言模型推理

Huajun Bai, Weiwei Lv, Huichuan Zheng, Youyou Lu, Jiwu Shu

机构 * Tsinghua University(清华大学) Meituan(美团)

专题命中 工具调用 :agentic(title);workflow(abstract);分类 cs.AI、cs.LG

AI总结 研究LLM智能体推理中串行循环耗时问题,提出SPORK方法,利用模型自身预测提前调度推测工具调用,通过成本模型等组件优化,大幅提升推理效率且不影响任务准确性。

Comments 16 pages, 15 figures. Code: https://github.com/baihuajun24/spork

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02595 2026-07-07 cs.SE cs.PL 新提交 79%

Attributing Structured-Output Gains in Function Calling: Interface Alignment versus Procedural Transfer

函数调用中结构化输出增益的归因:接口对齐与过程转移

Wanyi Chen, Daoyuan Chen, Fang Kong

专题命中 工具调用 :function calling(title,abstract);分类 cs.SE

AI总结 研究结构化输出基准中提示诱导函数调用增益的归因,介绍四层增益归因协议,应用于相关数据集得出部分增益源于接口对齐而非过程转移的结论,并发布相关资源。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04259 2026-07-07 cs.RO 新提交 78%

Integrated Graph Search and Model Predictive Control for Smooth and Efficient Path Planning in Autonomous Vehicles

用于自动驾驶车辆平滑高效路径规划的集成图搜索与模型预测控制

Duc-Tien Bui, Ngoc Thinh Nguyen, Hung Duy Nguyen, Dong Bi, Tomislav Mihalj, Arno Eichberger

机构 * Institute of Automotive Engineering, Graz University of Technology(格拉茨工业大学汽车工程研究所) Drone Engineering, University of Applied Science Kufstein Tirol(库夫施泰因蒂罗尔应用科学大学无人机工程系) Automation and Control Institute (ACIN), Vienna University of Technology(维也纳工业大学自动化与控制研究所)

专题命中 工具调用 :planning(title,abstract)

AI总结 提出一种顺序路径规划框架,利用图搜索得到的粗糙路径指导基于模型预测控制的路径细化,在多个超车场景评估算法,相比之前方法能降低横向加速度等,还减少计算成本。

Comments 12th 2026 International Conference on Control, Decision and Information Technologies (CoDIT 2026)

Journal ref 13th 2026 International Conference on Control, Decision and Information Technologies (CoDIT 2026), Bari, Italy, 2026, pp. 1757-1762

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01469 2026-07-07 cs.CV 新提交 78%

A Cost-Aware, Paired Protocol for Auditing Dynamic Tool Synthesis in Agentic Video Question Answering

一种成本感知的配对协议,用于审计智能视频问答中的动态工具合成

Aseel Mohamed, Rama AlHamidi, Mohamed Rayan Barhdadi, Rasul Khanbayov, Erchin Serpedin, Hasan Kurban

机构 * Texas A&M University(德克萨斯农工大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 工具调用 :agentic(title,abstract)

AI总结 提出成本感知的配对协议,联合评估准确性与成本,揭示动态工具合成在视频问答中的效率与代价。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01426 2026-07-07 cs.AI cs.CL 新提交 73%

When Should Service Agents Reconsider? Difficulty-Routed Control in Customer-Service Operations

服务代理何时应重新考虑?客户服务运营中的难度路由控制

Qian Chen, Chengyuan Liu, Xin Yu

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 工具调用 :tool-use(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 提出一种难度路由的服务控制架构,通过轻量级路由器将常规会话与操作耦合会话分流,在关键后端写入前集中审查,提升零售和航空任务的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04708 2026-07-07 econ.TH cs.AI cs.CY cs.GT cs.HC 新提交 70%

Strategic Buying Agents

战略性购买智能体

Mingyang Fu, Ming Hu

机构 * Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 该研究面向自主代客购物场景,分三类信息场景设计有限购物窗口内的最优购买策略,经真实电商价格数据验证,大模型更适配场景选择而非直接购买决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03220 2026-07-07 cs.CR cs.AI 新提交 70%

CONTRA: Red-Teaming Configurations of Personalizable Agents

CONTRA:可个性化代理的红队配置

Jonathan Nöther, Adish Singla, Goran Radanovic

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件研究所)

专题命中 工具调用 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 探讨代理配置与执行危险行为风险的关系,提出CONTRA算法,通过推理评估良性但危险的配置发现导致恶意行为的代理配置,构建数据集分析发现多数技能有恶意配置,CONTRA能成功识别部分危险配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01793 2026-07-07 cs.AI 新提交 70%

Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification

大规模安全测试LLM智能体:从风险发现到基于证据的验证

Yunhao Feng, Ruixiao Lin, Ming Wen, Qinqin He, Yanming Guo, Yifan Ding, Yutao Wu, Jialuo Chen, Zhuoer Xu, Xiaohu Du, Jianan Ma, Zixing Chen, Xingjun Ma, Yunhao Chen, Xinhao Deng

机构 * AntGroup(蚂蚁集团) Zhejiang University(浙江大学) Fudan University(复旦大学) Alibaba Group(阿里巴巴集团) Hunan Institute of Advanced Technology(湖南先进技术研究院) Deakin University(迪肯大学)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出Vera框架,通过文献驱动的风险发现、组合生成可执行安全用例和自适应执行与证据验证三阶段流水线,实现端到端自动化安全测试,在四个生产级智能体框架上发现严重漏洞,平均攻击成功率93.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04439 2026-07-07 cs.AI 新提交 57%

ResearchStudio-Idea: An Evidence-Grounded Research-Ideation Skill Suite from ML Conference Outcomes

研究工作室-创意:基于机器学习会议成果的有证据支持的研究创意技能套件

Qihao Zhao, Yangyu Huang, Yalun Dai, Lingao Xiao, Jianjun Gao, Xin Zhang, Wenshan Wu, Scarlett Li, Yang He, Yan Lu, Yap Kim Hui

机构 * Nanyang Technological University(南洋理工大学) Microsoft Research(微软研究院) National University of Singapore(新加坡国立大学) CFAR, A*STAR(计算机辅助放射治疗中心,新加坡科技研究局)

专题命中 工具调用 :workflow(abstract);分类 cs.AI

AI总结 研究问题是提升研究创意,核心方法是构建包含多种技能的套件,主要贡献是揭示31个反复出现的创意子模式并整合为15个可复用模式,能将其转化为可追溯研究提案,经评估效果优于基线。

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02959 2026-07-07 cs.CV cs.LG 新提交 57%

Incentivizing Vision Language Models to Search for Long Video Question Answering

激励视觉语言模型进行长视频问答搜索

Harsh Goel, S P Sharan, Sahil Shah, Minkyu Choi, Joungbin An, Kristen Grauman, Sandeep P. Chinchali

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 工具调用 :agentic(abstract);分类 cs.LG

AI总结 研究将长视频问答从被动单流程感知任务转变为多轮检索过程,核心方法是自然语言驱动搜索及强化学习后训练,贡献是提升长视频理解基准测试分数。

Comments To appear at the European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02577 2026-07-07 cs.SE 新提交 57%

Benchmarking the Benchmarks: A Validity Audit of Tool-Calling Evaluation

对基准进行基准测试:工具调用评估的有效性审计

Vishvesh Bhat, Jay Vaghasiya, Muhammad Ahmed Mohsin, Asad Aali

专题命中 工具调用 :agent(abstract);分类 cs.SE

AI总结 对四个主要工具调用基准家族进行系统有效性和可重复性审计,发现诸多评估者与人类意见分歧,指出当前分数可能反映评估者问题而非智能体能力,还介绍相关分类、审计工件等及新基准和系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31399 2026-07-07 cs.AI 新提交 57%

World-Model Collapse as a Phase Transition

世界模型崩溃作为相变

Xinyuan Song, Zekun Cai

机构 * Emory University(埃默里大学) The University of Tokyo(东京大学) LocationMind

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 研究长时域语言代理隐式世界模型中的相变现象,通过确定性任务族的大规模网格搜索揭示从解决平台到崩溃的相图,并证明世界状态保真度先于动作有效性失效。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06667 2026-07-07 cs.CL 新提交 57%

The Piggyback Hypothesis of Generalization: Explaining and Mitigating Emergent Misalignment

泛化的搭便车假说:解释和缓解涌现的错位

Jiachen Zhao, Zhengxuan Wu, Aryaman Arora, Yiyou Sun, David Bau, Weiyan Shi

机构 * Northeastern University(东北大学) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 工具调用 :tool use(abstract);分类 cs.CL

AI总结 提出搭便车假说,认为聊天模板标记导致微调行为泛化到无关领域,并设计TReFT方法通过正则化标记表示缓解涌现错位,在多个数据集上有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04696 2026-07-07 cs.CV 新提交 50%

Probe-EM: Targeted Neuron Tracing via Training-Free Semantic Verification

Probe-EM:通过无训练语义验证进行靶向神经元追踪

Liuyun Jiang, Yanchao Zhang, Jinyue Guo, Chuanyue Chen, Haiyang Yan, Ye Yuan, Jing Liu, Hua Han

机构 * State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化所脑认知与脑机智能技术重点实验室) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学高等研究院)

专题命中 工具调用 :workflow(abstract)

AI总结 为解决自动重建算法过分割瓶颈及传统追踪方法问题,提出无训练靶向神经元追踪框架,利用几何先验和新策略迭代重建神经元形态,集成到平台减少人工校对时间。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03361 2026-07-07 quant-ph cs.SY eess.SY math.OC 新提交 50%

Nested-Loop Trajectory-Informed Variational Quantum Solver for Interior-Point OPF

用于内点最优潮流的嵌套循环轨迹引导变分量子求解器

Farshad Amani, Amin Kargarian

专题命中 工具调用 :workflow(abstract)

AI总结 针对内点法求解最优潮流时,变分量子线性求解器嵌套循环致收敛慢的问题,提出双层可训练量子内点法框架,利用早期轨迹优化,减少变分更新次数,保持目标值接近经典方法。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02905 2026-07-07 hep-th 新提交 50%

Pre-Strings Lectures on Artificial Intelligence

关于人工智能的弦论前讲座

James Halverson

专题命中 工具调用 :agentic(abstract)

AI总结 该讲座围绕神经网络要素、神经网络场论方法及弦论应用AI展开,通过场论视角阐述神经网络,介绍相关成果,如通用定理、弦振幅等,还涉及弦论应用AI的多种技术。

Comments 42 pages. Content from 2408.00082 was utilized for some lecture material

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 99 篇

2607.04290 2026-07-07 cs.NI cs.AI 新提交 90%

Agentic-V2X: Small Language Model Agents for Deadline-Aware V2X Scheduling in 5G/6G Networks

Agentic-V2X:用于5G/6G网络中具有截止日期感知的V2X调度的小型语言模型代理

Gerasimos Papanikolaou-Ntais, Alexandros Kaloxylos, Athanasios Kanavos

机构 * Department of Informatics, University of Piraeus(比雷埃克斯大学信息学院) Department of Informatics and Telecommunications, University of Peloponnese(希腊佩拉索斯大学信息与电信学院)

专题命中 规划决策 :agentic(title,title_cn);分类 cs.AI

AI总结 研究针对5G/6G网络中V2X调度,提出Agentic-V2X架构。小型本地部署语言模型生成策略,经验证后由轻量级控制器执行,评估多种策略,该架构能生成有效可执行策略,在多方面有竞争力,但非最佳。

Comments 20 pages 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04219 2026-07-07 cs.AI cs.MA cs.NI 新提交 90%

Agentic IoT: Architectures, Applications, and Challenges Toward the Internet of Agents

智能物联网:面向智能体互联网的架构、应用及挑战

Rümeysa Hilal Sevinç, Bahaeddin Türkoğlu, İbrahim Kök

机构 * Department of Artificial Intelligence and Data Engineering, Ankara University(人工智能与数据工程系,安卡拉大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);AI agent(abstract);tool use(abstract)

AI总结 探讨智能物联网,它将自主智能体能力与网络物理系统整合,旨在从以数据为中心的物联网转变为分布式认知智能体生态系统,文中进行了定位、综述、架构框架介绍等

Comments 14 pages, 2 figures, Author's preprint version. The manuscript may be revised based on peer-review feedback and publication requirements

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04162 2026-07-07 cs.RO cs.LG 新提交 88%

ACE: Agentic Control for Embodied Manipulation via Zero-shot Workflow Reasoning

ACE:通过零样本工作流推理实现具身操纵的智能体控制

Iok Tong Lei, QianZhi Li, Ying Jie Yap, Yujie Zhang, Rui Zhong, Haichao Gui, Xiaolong Liu, Zhidong Deng

机构 * Department of Computer Science, Tsinghua University(清华大学计算机科学系) National College for Excellent Engineers, Beihang University(北京航空航天大学卓越工程师学院) Wuxi Dexteroushands Robotic Technology Co.(无锡灵犀机器人技术有限公司)

专题命中 规划决策 :workflow(title,abstract);agentic(title,abstract);分类 cs.LG

AI总结 研究开放式桌面操作,提出ACE零样本工作流推理框架,结合智能体工作流推理与视觉基础接口、可重复使用的拾取和放置原语等技能,经掩码介导视觉动作接口连接语义推理与物理控制,能在线适应多种情况,在复杂任务中表现出色。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03423 2026-07-07 cs.CR cs.AI 新提交 88%

Securing Multi-Tool AI Agent Chains With Dynamic, Real-Time Compositional Policies

通过动态实时组合策略保护多工具人工智能代理链

Chris Schneider, Kriti Faujdar, Philipp Schoenegger, Ben Bariach

机构 * Microsoft AI(微软人工智能)

专题命中 规划决策 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 研究多工具代理链安全问题,提出动态安全控制合成器(DSCC),分两阶段实现组合安全。阶段1在会话检查时合成策略,阶段2在运行时跟踪数据敏感度,提供深度防御,评估了参考实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27806 2026-07-07 cs.AI 新提交 88%

Agent vs. Parametric World Models: Hybrid Planning for Reliable Language Agents

基于基础迭代语言规划:参数化世界模型如何减少LLM代理中的幻觉传播

Xinyuan Song, Zekun Cai

机构 * Emory University(埃默里大学) The University of Tokyo(东京大学) LocationMind

专题命中 规划决策 :agent(title,abstract);planning(title,abstract);分类 cs.AI

AI总结 提出GILP方法,结合小参数化世界模型与LLM推理,通过一致性门控减少幻觉,在规划基准上将幻觉率从0.176降至0.035,成功率从0.668提升至0.838。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏