arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-07 至 2026-07-07 共收录 442 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 35 篇

2607.04395 2026-07-07 cs.LG 新提交 94%

NKI-Agent: Domain-Specific Fine-Tuning and Agentic Tool Use for Neuron Kernel Generation

NKI-Agent:用于神经元内核生成的特定领域微调与智能体工具使用

Junjie Tang, Jun Huan, Hao Zhou, Yuhao Zhang, Lin Wang

机构 * AWS Neuron Team(亚马逊云科技神经元团队) Amazon Web Services(亚马逊云科技)

专题命中 工具调用 :agent(title,title_cn);tool use(title,abstract);agentic(title,abstract);分类 cs.LG

AI总结 针对新兴AI加速器,介绍NKI-Agent系统,结合特定领域监督微调与编译验证修复智能体循环生成NKI内核,适配框架、构建基准并评估,显示工具使用关键及不同模型表现,为强化学习奖励设计提供指导。

Comments 7 pages. Accepted at DL4C @ ICML 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06890 2026-07-07 cs.AI cs.MA 版本更新 90%

Beyond the Black Box: Interpretability of Agentic AI Tool Use

超越黑箱:代理AI工具使用的可解释性

Hariom Tatsat, Ariye Shater

机构 * Quantitative Analytics, Barclays(巴克莱证券量化分析部)

专题命中 工具调用 :tool use(title);agentic(title);agent(abstract);AI agent(abstract)

AI总结 本文提出了一种基于稀疏自编码器(SAEs)和线性探针的机制可解释性工具包,旨在提升代理AI在长周期任务中对工具调用的可观测性和可解释性,通过分析模型内部状态来识别工具决策的关键特征,从而揭示代理失败的深层原因。

Comments 12 pages, 4 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04034 2026-07-07 cs.SE cs.AI 新提交 88%

The "I Don't Know" Filter: Enhancing Agentic Reliability in Function Calling

“我不知道”过滤器:提高函数调用中智能体的可靠性

Stefan Broecker, Mason del Rosario, Boris Selitser, Thomas Strohmer

机构 * University of California, Davis, Department of Computer Science(加州大学戴维斯分校计算机科学系) Okareo, Inc.(Okareo公司) University of California, Davis, Department of Mathematics(加州大学戴维斯分校数学系)

专题命中 工具调用 :function calling(title,abstract);agentic(title);agent(abstract);分类 cs.AI、cs.SE

AI总结 研究语言模型在函数调用基准测试中性能提升但因训练评估指标致幻觉问题。提出考虑错误函数调用负面结果的评估指标及可量化不确定性、去除有害函数调用的轻量级可训练过滤器,助力智能体知道何时说“我不知道”以提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00597 2026-07-07 cs.CL cs.IR 新提交 88%

Multi-Turn Agentic Scientific Literature Search via Workflow Induction

通过工作流归纳实现多轮智能科学文献搜索

Jisen Li, Bingxuan Li, Nanyi Jiang, Xuying Ning, Xiyao Wang, Yifan Shen, Heng Wang, Yuqing Jian, Xiaoxia Wu, Ben Athiwaratkun, Pan Lu, Jiaxuan You, Bingxin Zhao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Together AI University of Pennsylvania(宾夕法尼亚大学) Stanford University(斯坦福大学)

专题命中 工具调用 :workflow(title,abstract);agentic(title);agent(abstract);分类 cs.CL

AI总结 提出PaperPilot,通过构建可执行DAG工作流进行多轮文献搜索,利用用户反馈优化查询和工作流,显著提升搜索性能并消除执行错误。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24115 2026-07-07 cs.LG 版本更新 85%

Agentic AI-RAN: Enabling Intent-Driven, Explainable and Self-Evolving Open RAN Intelligence

智能体人工智能-RAN:实现意图驱动、可解释和自我进化的开放式RAN智能

Zhizhou He, Yang Luo, Xinkai Liu, Mahdi Boloursaz Mashhadi, Mohammad Shojafar, Merouane Debbah, Rahim Tafazolli

机构 * G/6GIC, Institute for Communication Systems (ICS), University of Surrey(5G/6G研究所,通信系统研究所(ICS),萨里大学) G Research Center, Khalifa University(6G研究中心,卡利法大学)

专题命中 工具调用 :agentic(title,abstract);tool use(abstract);planning(abstract);分类 cs.LG

AI总结 探讨如何将智能体控制器引入开放式RAN,介绍相关架构,对比传统ML/RL xApps,围绕网络切片生命周期等任务分类,引入智能体原语并展示其在多小区O-RAN模拟中提升性能,还讨论了安全等挑战。

Comments 11 pages, 4 figures. Accepted at IEEE Network Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04686 2026-07-07 cs.CL cs.AI cs.SE 新提交 85%

ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents

ToolFailBench:诊断大语言模型智能体中的工具使用失败

Harsh Soni

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 工具调用 :tool-use(title,abstract);tool use(abstract);分类 cs.AI、cs.CL、cs.SE;agentic(comments)

AI总结 介绍ToolFailBench诊断基准,用于衡量金融、医学等领域1000个任务中的工具使用失败情况。通过规则分类器和大语言模型裁判标注失败类型,发现模型工具使用存在差异,强调评估应考量多方面。

Comments 18 pages, 3 figures. Published at the Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) and the Workshop on Failure Modes of Agentic AI (FAGEN) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03953 2026-07-07 cs.CL cs.AI 新提交 84%

The Remarkable Effectiveness of Providing AI Agents with Natural Language Tools: A Replication Study Validating NLT Performance Across 14 Models

为人工智能智能体提供自然语言工具的显著有效性:一项在14个模型上验证自然语言工具性能的复制研究

Alexander Somma, Isabelle Plante, Fred Premji

机构 * Sage.is AI-UI(Sage.is人工智能用户界面)

专题命中 工具调用 :AI agent(title);tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 该研究独立复制并扩展了自然语言工具(NLT)框架,在14个模型和8560次试验中评估NLT,验证其效果,发现其能提升工具调用准确率、减少关键错误、降低令牌使用量,还证实模型能力对NLT优势有调节作用。

Comments 28 pages, 6 figures, replication study, replication of arXiv:2510.14453 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03441 2026-07-07 cs.LG cs.AI 新提交 84%

No Time Like the Present: Agentic Test-Time Training for LLM Agents

机不可失:大语言模型智能体的测试时训练

Yanbo Wang, Jinhua Hao, Yuze Shi, Kun Yuan, Ming Sun

机构 * Kuaishou Technology(快手科技)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 研究多轮智能体情节中的连续测试时训练,提出智能体测试时训练方法,通过token级重加权减少重复文本损失,构建并发服务系统,提升了在ALFWorld和SWE-bench Lite上的成功率。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14192 2026-07-07 cs.AI cs.CL 版本更新 84%

Toward Efficient Agents: Memory, Tool learning, and Planning

迈向高效智能体:记忆、工具学习与规划

Xiaofang Yang, Lijun Li, Heng Zhou, Tong Zhu, Xiaoye Qu, Yuchen Fan, Qianshan Wei, Rui Ye, Li Kang, Yiran Qin, Daizong Liu, Qi Li, Ning Ding, Siheng Chen, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Hong Kong Polytechnic University(香港理工大学) Wuhan University(武汉大学) Tsinghua University(清华大学)

专题命中 工具调用 :planning(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究将大语言模型扩展到智能体系统中的效率问题,从记忆、工具学习和规划三个核心组件考虑成本,回顾多种方法并详细讨论,以两种方式刻画效率,还探讨关键挑战与未来方向。

Comments 63 pages, 244 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04124 2026-07-07 cs.RO cs.AI 新提交 83%

Conflict-Based Lazy Search for Fast Multi-Manipulator Planning

基于冲突的懒搜索用于快速多机器人规划

Dongliang Zheng, Zhipeng Wang, Siqi Wang, Yuxi Lu, Bin He, Hesheng Wang, Panagiotis Tsiotras

机构 * Shanghai Research Institute for Intelligent Autonomous Systems, Shanghai Institute of Intelligent Science and Technology, the State Key Laboratory of Autonomous Intelligent Unmanned Systems, and Frontiers Science Center for Intelligent Autonomous Systems of Ministry of Education, Tongji University(上海智能无人系统科学中心,上海智能科学与技术研究院,自主智能无人系统国家重点实验室,同济大学智能自主系统前沿科学中心) Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系) School of Aerospace Engineering and Institute for Robotics and Intelligent Machines, Georgia Institute of Technology(佐治亚理工学院航空航天工程学院和机器人与智能机器研究所)

专题命中 工具调用 :planning(title,abstract);agent(abstract);分类 cs.AI

AI总结 针对多机器人在杂乱工作空间的实时规划难题,提出基于冲突的懒搜索(CBLS)算法。该算法基于CBS,通过预计算和懒搜索改进,采用懒评估图与LEA*算法,应用于多机器人规划问题,性能优于CBS和RRT-Connect。

Journal ref IEEE/ASME Transactions on Mechatronics(TMECH) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16870 2026-07-07 cs.CR cs.AI cs.OS 版本更新 83%

Governed MCP: Kernel-Level Tool Governance for AI Agents via Logit-Based Safety Primitives

受控MCP:通过基于logit的安全原语实现AI代理的内核级工具治理

Daeyeon Son

机构 * Independent Researcher(独立研究者)

专题命中 工具调用 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出 Governed MCP,一种基于logit的安全原语的内核级工具治理网关,通过六层管道对MCP工具调用进行安全检查,提升AI代理的安全性。

Comments 14 pages, 6 tables. Companion paper to arXiv:2604.11943 (ProbeLogits)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02716 2026-07-07 cs.MA 新提交 82%

Evaluating Large Language Models for Decision-Making in Agent-Based Urban Mobility Simulations

在基于代理的城市交通模拟中评估用于决策的大语言模型

Bruno Cascaes Alves, Míriam Blank Born, Ulisses Gilioli Francescatto Júnior, Felipe Moura Goulart, Letícia Brandão Caldas, Marilton Sanchotene de Aguiar

专题命中 工具调用 :agent(title,abstract);multi-agent(abstract)

AI总结 研究在多智能体模拟中集成大语言模型作为决策组件,提出混合架构,通过API连接GAMA平台与外部基于大语言模型的模块,能指导智能体重规划行为,比较不同场景下效果,显示其可丰富行为表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23327 2026-07-07 cs.CV cs.AI 新提交 81%

VideoAgent: All-in-One Framework for Video Understanding and Editing

VideoAgent: 视频理解与编辑的全能框架

Hengji Zhou, Lingxuan Huang, Jian Wang, Bing Zhou, Si Wu, Lianghao Xia, Chao Huang

机构 * South China University of Technology(华南理工大学) The University of Hong Kong(香港大学) Snap Inc(Snap公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 工具调用 :agent(abstract);planning(abstract);agentic(abstract);multi-agent(abstract)

AI总结 提出VideoAgent,一种基于多智能体编排的全能框架,通过自动镜头创建和30多个专业编辑智能体,解决现有系统在长视频理解和多样化编辑操作上的局限,在VideoEdit基准上实现87-95%编排成功率并降低60% API成本。

Comments Preprint. Code available at https://github.com/HKUDS/VideoAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03333 2026-07-07 cs.DC cs.AI cs.LG 新提交 81%

SPORK: Self-Speculative Forking to Accelerate Agentic LLM Inference

SPORK:自我推测性分叉以加速智能体大语言模型推理

Huajun Bai, Weiwei Lv, Huichuan Zheng, Youyou Lu, Jiwu Shu

机构 * Tsinghua University(清华大学) Meituan(美团)

专题命中 工具调用 :agentic(title);workflow(abstract);分类 cs.AI、cs.LG

AI总结 研究LLM智能体推理中串行循环耗时问题,提出SPORK方法,利用模型自身预测提前调度推测工具调用,通过成本模型等组件优化,大幅提升推理效率且不影响任务准确性。

Comments 16 pages, 15 figures. Code: https://github.com/baihuajun24/spork

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05409 2026-07-07 cs.AI cs.CL 版本更新 81%

Agentic Retrieval-Augmented Generation for Financial Document Question Answering

代理检索增强生成用于财务文档问答

Yang Shu, Yingmin Liu, Zequn Xie

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出FinAgent-RAG框架,通过迭代检索-推理循环和自我验证,提升金融文档问答的精度。引入对比金融检索器、程序化思维模块和自适应策略路由,实验表明在三个基准数据集上均取得显著效果,准确率提升5.62-9.32个百分点。

Comments This paper is withdrawn due to significant methodological errors in the experimental design that fundamentally affect the validity of the results. The errors are not correctable within the current framework, and the conclusions can no longer be supported. We apologize for any inconvenience caused to readers

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02595 2026-07-07 cs.SE cs.PL 新提交 79%

Attributing Structured-Output Gains in Function Calling: Interface Alignment versus Procedural Transfer

函数调用中结构化输出增益的归因:接口对齐与过程转移

Wanyi Chen, Daoyuan Chen, Fang Kong

专题命中 工具调用 :function calling(title,abstract);分类 cs.SE

AI总结 研究结构化输出基准中提示诱导函数调用增益的归因,介绍四层增益归因协议,应用于相关数据集得出部分增益源于接口对齐而非过程转移的结论,并发布相关资源。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04259 2026-07-07 cs.RO 新提交 78%

Integrated Graph Search and Model Predictive Control for Smooth and Efficient Path Planning in Autonomous Vehicles

用于自动驾驶车辆平滑高效路径规划的集成图搜索与模型预测控制

Duc-Tien Bui, Ngoc Thinh Nguyen, Hung Duy Nguyen, Dong Bi, Tomislav Mihalj, Arno Eichberger

机构 * Institute of Automotive Engineering, Graz University of Technology(格拉茨工业大学汽车工程研究所) Drone Engineering, University of Applied Science Kufstein Tirol(库夫施泰因蒂罗尔应用科学大学无人机工程系) Automation and Control Institute (ACIN), Vienna University of Technology(维也纳工业大学自动化与控制研究所)

专题命中 工具调用 :planning(title,abstract)

AI总结 提出一种顺序路径规划框架,利用图搜索得到的粗糙路径指导基于模型预测控制的路径细化,在多个超车场景评估算法,相比之前方法能降低横向加速度等,还减少计算成本。

Comments 12th 2026 International Conference on Control, Decision and Information Technologies (CoDIT 2026)

Journal ref 13th 2026 International Conference on Control, Decision and Information Technologies (CoDIT 2026), Bari, Italy, 2026, pp. 1757-1762

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01469 2026-07-07 cs.CV 新提交 78%

A Cost-Aware, Paired Protocol for Auditing Dynamic Tool Synthesis in Agentic Video Question Answering

一种成本感知的配对协议,用于审计智能视频问答中的动态工具合成

Aseel Mohamed, Rama AlHamidi, Mohamed Rayan Barhdadi, Rasul Khanbayov, Erchin Serpedin, Hasan Kurban

机构 * Texas A&M University(德克萨斯农工大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 工具调用 :agentic(title,abstract)

AI总结 提出成本感知的配对协议,联合评估准确性与成本,揭示动态工具合成在视频问答中的效率与代价。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01426 2026-07-07 cs.AI cs.CL 新提交 73%

When Should Service Agents Reconsider? Difficulty-Routed Control in Customer-Service Operations

服务代理何时应重新考虑?客户服务运营中的难度路由控制

Qian Chen, Chengyuan Liu, Xin Yu

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 工具调用 :tool-use(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 提出一种难度路由的服务控制架构,通过轻量级路由器将常规会话与操作耦合会话分流,在关键后端写入前集中审查,提升零售和航空任务的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04708 2026-07-07 econ.TH cs.AI cs.CY cs.GT cs.HC 新提交 70%

Strategic Buying Agents

战略性购买智能体

Mingyang Fu, Ming Hu

机构 * Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 该研究面向自主代客购物场景,分三类信息场景设计有限购物窗口内的最优购买策略,经真实电商价格数据验证,大模型更适配场景选择而非直接购买决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03220 2026-07-07 cs.CR cs.AI 新提交 70%

CONTRA: Red-Teaming Configurations of Personalizable Agents

CONTRA:可个性化代理的红队配置

Jonathan Nöther, Adish Singla, Goran Radanovic

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件研究所)

专题命中 工具调用 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 探讨代理配置与执行危险行为风险的关系,提出CONTRA算法,通过推理评估良性但危险的配置发现导致恶意行为的代理配置,构建数据集分析发现多数技能有恶意配置,CONTRA能成功识别部分危险配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01793 2026-07-07 cs.AI 新提交 70%

Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification

大规模安全测试LLM智能体:从风险发现到基于证据的验证

Yunhao Feng, Ruixiao Lin, Ming Wen, Qinqin He, Yanming Guo, Yifan Ding, Yutao Wu, Jialuo Chen, Zhuoer Xu, Xiaohu Du, Jianan Ma, Zixing Chen, Xingjun Ma, Yunhao Chen, Xinhao Deng

机构 * AntGroup(蚂蚁集团) Zhejiang University(浙江大学) Fudan University(复旦大学) Alibaba Group(阿里巴巴集团) Hunan Institute of Advanced Technology(湖南先进技术研究院) Deakin University(迪肯大学)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出Vera框架,通过文献驱动的风险发现、组合生成可执行安全用例和自适应执行与证据验证三阶段流水线,实现端到端自动化安全测试,在四个生产级智能体框架上发现严重漏洞,平均攻击成功率93.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30450 2026-07-07 cs.NE cs.MA 67%

Minimal MMAO: A Resource-Closed-Loop Framework for Adaptive Metaheuristic Search

最小 MMAO:一种用于自适应元启发式搜索的资源闭环框架

Jinliang Xu, Liping Ma

专题命中 工具调用 :agent(abstract);multi-agent(abstract)

AI总结 提出基于内源性资源循环的自适应元启发式方法MMAO,通过共享代谢控制器统一调控搜索强度、探索-利用平衡和生命周期更替,在连续和离散域中验证了其跨域稳定性和精简设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04439 2026-07-07 cs.AI 新提交 57%

ResearchStudio-Idea: An Evidence-Grounded Research-Ideation Skill Suite from ML Conference Outcomes

研究工作室-创意:基于机器学习会议成果的有证据支持的研究创意技能套件

Qihao Zhao, Yangyu Huang, Yalun Dai, Lingao Xiao, Jianjun Gao, Xin Zhang, Wenshan Wu, Scarlett Li, Yang He, Yan Lu, Yap Kim Hui

机构 * Nanyang Technological University(南洋理工大学) Microsoft Research(微软研究院) National University of Singapore(新加坡国立大学) CFAR, A*STAR(计算机辅助放射治疗中心,新加坡科技研究局)

专题命中 工具调用 :workflow(abstract);分类 cs.AI

AI总结 研究问题是提升研究创意,核心方法是构建包含多种技能的套件,主要贡献是揭示31个反复出现的创意子模式并整合为15个可复用模式,能将其转化为可追溯研究提案,经评估效果优于基线。

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02959 2026-07-07 cs.CV cs.LG 新提交 57%

Incentivizing Vision Language Models to Search for Long Video Question Answering

激励视觉语言模型进行长视频问答搜索

Harsh Goel, S P Sharan, Sahil Shah, Minkyu Choi, Joungbin An, Kristen Grauman, Sandeep P. Chinchali

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 工具调用 :agentic(abstract);分类 cs.LG

AI总结 研究将长视频问答从被动单流程感知任务转变为多轮检索过程,核心方法是自然语言驱动搜索及强化学习后训练,贡献是提升长视频理解基准测试分数。

Comments To appear at the European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02577 2026-07-07 cs.SE 新提交 57%

Benchmarking the Benchmarks: A Validity Audit of Tool-Calling Evaluation

对基准进行基准测试:工具调用评估的有效性审计

Vishvesh Bhat, Jay Vaghasiya, Muhammad Ahmed Mohsin, Asad Aali

专题命中 工具调用 :agent(abstract);分类 cs.SE

AI总结 对四个主要工具调用基准家族进行系统有效性和可重复性审计,发现诸多评估者与人类意见分歧,指出当前分数可能反映评估者问题而非智能体能力,还介绍相关分类、审计工件等及新基准和系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31399 2026-07-07 cs.AI 新提交 57%

World-Model Collapse as a Phase Transition

世界模型崩溃作为相变

Xinyuan Song, Zekun Cai

机构 * Emory University(埃默里大学) The University of Tokyo(东京大学) LocationMind

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 研究长时域语言代理隐式世界模型中的相变现象,通过确定性任务族的大规模网格搜索揭示从解决平台到崩溃的相图,并证明世界状态保真度先于动作有效性失效。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06667 2026-07-07 cs.CL 新提交 57%

The Piggyback Hypothesis of Generalization: Explaining and Mitigating Emergent Misalignment

泛化的搭便车假说:解释和缓解涌现的错位

Jiachen Zhao, Zhengxuan Wu, Aryaman Arora, Yiyou Sun, David Bau, Weiyan Shi

机构 * Northeastern University(东北大学) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 工具调用 :tool use(abstract);分类 cs.CL

AI总结 提出搭便车假说,认为聊天模板标记导致微调行为泛化到无关领域,并设计TReFT方法通过正则化标记表示缓解涌现错位,在多个数据集上有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22056 2026-07-07 cs.LG cs.NI eess.SP 版本更新 57%

Learning Coverage- and Power-Optimal Transmitter Placement from City Maps: A Comparative Study of Direct and Indirect Neural Approaches

从建筑地图学习覆盖和功率最优的发射机布置:直接和间接神经方法的比较研究

Çağkan Yapar

机构 * TU Berlin(柏林技术大学)

专题命中 工具调用 :planning(abstract);分类 cs.LG

AI总结 本文研究了在固定学习传播模型下单发射机设置的最优布置问题,通过比较直接和间接神经方法,展示了如何在大规模数据集中高效评估覆盖和功率最优的发射机位置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16809 2026-07-07 cs.RO cs.AI 版本更新 57%

CABTO: Context-Aware Behavior Tree Grounding for Robot Manipulation

CABTO:面向机器人操作的上下文感知行为树接地

Yishuai Cai, Xinglin Chen, Yunxin Mao, Kun Hu, Yaodong Yang, Yuanpei Chen, Wenjing Yang, Ji Wang, Minglong Li

机构 * National University of Defense Technology(国防科技大学) PsiBot Peking University(北京大学) PKU-Psibot Lab(北京大学-PsiBot实验室)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 本文提出CABTO框架,通过预训练大模型和上下文反馈,自动构建完整且一致的行为树系统,解决机器人操作中行为树接地的复杂性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏