s3: You Don't Need That Much Data to Train a Search Agent via RL
机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon(亚马逊公司)
专题命中 工具调用 :agent(title);分类 cs.AI、cs.CL
Comments EMNLP 2025 camera-ready
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon(亚马逊公司)
专题命中 工具调用 :agent(title);分类 cs.AI、cs.CL
Comments EMNLP 2025 camera-ready
机构 * Imperial College London(伦敦帝国学院)
专题命中 工具调用 :tool use(title);分类 cs.AI、cs.CL
Comments NAACL 2025 Findings
机构 * Ant Group, China(蚂蚁集团) ; School of Computer Science and Technology, Xi’an Jiaotong University, China(西安交通大学计算机科学与技术学院) ; School of Distance Education, Xi’an Jiaotong University, China(西安交通大学继续教育学院)
专题命中 工具调用 :tool use(title);分类 cs.CL、cs.LG
Comments 20 pages, 12 figures
机构 * Zhejiang University(浙江大学) ; OPPO Research Institute(OPPO研究院)
专题命中 工具调用 :tool use(title);分类 cs.AI、cs.CL
机构 * Univ. Grenoble Alpes, CNRS, Grenoble INP, LIG EPFL(格勒诺布尔阿尔卑斯大学、国家科学研究中心、格勒诺布尔INP、LIG EPFL)
专题命中 工具调用 :agentic(title);分类 cs.AI、cs.CL
Comments 25 pages, 3 figures
机构 * University of Luxembourg(卢森堡大学) ; Luxembourg Institute of Science and Technology(卢森堡科学与技术研究所) ; Department of Information and Computer Science(信息与计算机科学系) ; BGL BNP PARIBAS ; Interdisciplinary Research Center for Intelligent Manufacturing and Robotics(智能制造与机器人跨学科研究中心)
专题命中 工具调用 :function calling(title);分类 cs.CL、cs.SE
Journal ref The 29th International Conference on Evaluation and Assessment in Software Engineering (EASE 2025)
专题命中 工具调用 :agent(title);分类 cs.AI、cs.CL
Comments Under review
专题命中 工具调用 :agent(title);分类 cs.AI、cs.CL
Comments Published on NeurIPS 2023
专题命中 工具调用 :agent(abstract,comments);multi-agent(abstract,comments);分类 cs.AI、cs.LG
Comments Accepted by IEEE International Symposium on Multi-Robot & Multi-Agent Systems (MRS) 2023
专题命中 工具调用 :planning(title);分类 cs.AI、cs.LG
专题命中 工具调用 :agent(title);分类 cs.AI、cs.LG
专题命中 工具调用 :agent(title);分类 cs.AI、cs.LG
Comments Accepted by MICCAI 2022
专题命中 工具调用 :planning(title);分类 cs.AI、cs.LG
Comments 7 pages
Journal ref AAAI-21 Technical Tracks Vol. 35, No. 13, 2021, 11888-11894
专题命中 工具调用 :agent(title);分类 cs.AI、cs.LG
Comments Poster presentation at RL in Games Workshop, AAAI 2020
专题命中 工具调用 :agent(title);分类 cs.AI、cs.CL
Journal ref Proceedings of the 2018 EMNLP Workshop SCAI: The 2nd International Workshop on Search-Oriented Conversational AI, pages 59-66, Brussels, Belgium, October 2018
专题命中 工具调用 :planning(title);分类 cs.AI、cs.LG
Comments 4 pages, 1 figure
探索性、交流性和可部署性:用于开放世界移动操作的视觉驱动具身智能体
专题命中 工具调用 :agent(abstract);tool-use(abstract);agentic(abstract)
AI总结 研究针对具身智能体现实部署难题,提出REAL框架,通过建立一致环境API、设计任务组合优化性能,引入REAL - Bench评估。实验显示其智能体在交互式任务中表现出色,在物理机器人上也实现高成功率,弥合现实差距。
Comments Accepted to ECCV 2026. 57 pages. Code available at https://github.com/InternRobotics/REAL
FedAgentKE:异构智能体的联邦语义知识演化
专题命中 工具调用 :agent(abstract);tool use(abstract);workflow(abstract)
AI总结 研究异构智能体孤立运行问题,提出 FedAgentKE 框架,通过语义知识蒸馏、聚合和Adapt实现联邦语义知识演化,实验验证其在跨框架和跨任务设置下能改进智能体协作,为未来协作智能体生态系统发展提供潜力。
Comments 9 pages (including appendix)
给定增量的埃塔:用边际工具效用定义大语言模型工具效率
机构 * Foam(泡沫)
专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 研究提出用于评估LLM智能体轨迹中工具调用率的工具效率及边际工具效用指标,用LLM-as-a-Judge确定边际工具效用符号,区别于间接测效率的 prior work,直接测效率,为LLM评估研究及相关工程做贡献。
低延迟系统中的工具制作与自我进化大语言模型智能体
机构 * Amazon(亚马逊)
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG、cs.SE
AI总结 研究如何解决生产LLM智能体因重复生成代码浪费延迟和可靠性的问题,提出用智能工具制作管道取代推理时编码循环,部署该方法使系统更快、更可靠、易操作,降低延迟和错误率,提高可审计性。
Comments Preprint
SkillFuzz: 面向开放技能市场中隐式意图发现的技能组合模糊测试
机构 * School of Computer Science and Informatics, University of Liverpool(利物浦大学计算机科学与信息学学院) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 工具调用 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 提出SkillFuzz,首个无需执行的模糊测试方法,通过提取结构化技能契约并利用契约引导的蒙特卡洛树搜索,在开放技能市场中高效发现因技能组合导致的隐式意图,验证了80%以上高风险组合。
Comments Under Review
Object Aligner: 一种可配置的图结构JSON模式相似度评分,应用于LLM提示优化
机构 * Artificial Intelligence Center, Faculty of Electrical Engineering, Czech Technical University in Prague(捷克理工大学电气工程学院人工智能中心)
专题命中 工具调用 :planning(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出Object Aligner,一种基于递归树对齐和引用对齐的JSON相似度评分方法,通过Weisfeiler-Leman颜色细化近似图同构,用于LLM输出评估和提示优化。
Comments 28 pages, This is a submitted version of a manuscript under review at IEEE Access; it has not been peer reviewed
DuplexSLA: 一种具备同步语音、语言和动作的全双工语音语言模型
专题命中 工具调用 :tool use(abstract);planning(abstract);agentic(abstract)
AI总结 本研究提出DuplexSLA,一种全双工语音语言模型,通过共享160ms时间线解码助理音频和结构化动作流,实现了同步语音、语言和动作的处理,解决了现有全双工模型在对话中规划和工具调用方面的不足。
你应该使用你的大语言模型进行探索还是利用?
机构 * UC Berkeley(伯克利大学) ; Microsoft Research(微软研究院)
专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 研究当前大语言模型在探索-利用权衡中的决策能力,通过分离探索和利用任务评估其表现,发现推理模型在利用任务上最有潜力但成本高,非推理模型通过工具使用和上下文总结可提升中等难度任务性能,但在所有任务中均不如简单线性回归,然而LLM在具有语义的大动作空间探索中有帮助。
Comments Accepted to UAI 2026
对Vibe研究的前瞻性展望
专题命中 工具调用 :agent(abstract);tool use(abstract);multi-agent(abstract)
AI总结 本文探讨了Vibe研究范式,结合人类指导与AI代理,提出多智能体架构、记忆、工具使用等方法,分析其技术限制与社会影响,为负责任的采用提供路线图。
AirSimAG:一种高保真空地协同机器人仿真平台
机构 * School of Aeronautic Science and Engineering, Beihang University(北京航空航天大学航空科学与工程学院) ; Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) ; Institution of Unmanned System, Beihang University(北京航空航天大学无人系统研究院)
专题命中 工具调用 :agent(abstract);planning(abstract);multi-agent(abstract)
AI总结 本文提出AirSimAG,一种高保真的空地协同机器人仿真平台,支持多智能体同步仿真和异构传感控制接口,通过多个代表性任务验证其在多智能体协调和跨模态数据一致性方面的有效性。
SAGE:面向异构数据检索的结构感知图扩展
专题命中 工具调用 :agent(abstract);planning(abstract);agentic(abstract)
AI总结 SAGE通过构建结构感知的图扩展框架,在异构数据检索中提升召回率,采用混合检索与代理策略实现多模态证据链检索。
无需缩放:用于细粒度多模态感知的区域到图像蒸馏
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; Zhongguancun Academy(中关村学院) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出区域到图像蒸馏方法,通过训练时间内化代理缩放能力,提升细粒度多模态感知性能。
PaperSearchQA: 基于强化学习与验证奖励的学习科学论文搜索与推理
机构 * Stanford University(斯坦福大学) ; Chan Zuckerberg Biohub Network(查纳·泽克拜尔生物枢纽网络) ; KTH Royal Institute of Technology(皇家理工学院)
专题命中 工具调用 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 PaperSearchQA通过训练搜索代理在科学论文中进行搜索与推理,提升技术问答能力,为未来的人工智能科学家系统奠定基础。
Comments EACL 2026
探索通用型自主多模态代理用于病理报告生成
专题命中 工具调用 :agent(abstract);tool use(abstract);agentic(abstract)
AI总结 研究探索通用型自主多模态代理在病理报告生成中的应用,发现其在无额外信息时诊断准确率较低,但提供形态学描述时表现更佳,但仍不及人类专家。
Comments 6 pages, 1 figure, accepted paper for BVM 2026
Journal ref BVM 2026, https://bvm-conf.org