SMARTCAL: An Approach to Self-Aware Tool-Use Evaluation and Calibration
专题命中 工具调用 :tool-use(title,abstract);分类 cs.AI、cs.LG、cs.SE
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 工具调用 :tool-use(title,abstract);分类 cs.AI、cs.LG、cs.SE
专题命中 工具调用 :agent(title,abstract);AI agent(abstract)
Comments ACMMM 2024 MMGR WORKSHOP
专题命中 工具调用 :tool use(title);tool-use(abstract);分类 cs.AI、cs.CL、cs.LG
Comments ACL 2024 main
专题命中 工具调用 :tool use(title,abstract);分类 cs.AI、cs.CL、cs.LG
Comments Accepted by IEEE 7th International Conference on Multimedia Information Processing and Retrieval (MIPR), 2024
专题命中 工具调用 :AI agent(title);agent(abstract);分类 cs.AI、cs.CL、cs.LG
Comments 12 pages, 6 figures, comments and suggestions are welcome
专题命中 工具调用 :autonomous agent(title,abstract);agent(abstract)
专题命中 工具调用 :planning(title,abstract);agent(abstract)
Comments 2021 International Conference on Unmanned Aircraft Systems (ICUAS)
Journal ref 2021 International Conference on Unmanned Aircraft Systems (ICUAS)
专题命中 工具调用 :agent(title,abstract);planning(abstract)
Comments The most recent version of this article can be viewed at https://doi.org/10.1007/s10846-022-01570-y
Journal ref published in Journal of Intelligent & Robotic Systems (2022)
专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
专题命中 工具调用 :agent(title,abstract);autonomous agent(abstract)
Comments Local spin correction procedure was used to compensate real device errors; comparison with variational approach was added
专题命中 工具调用 :planning(title,abstract);agent(abstract)
Comments Internship Report
从RAG到智能体RAG:面向可靠的伊斯兰问答
机构 * Qatar Computing Research Institute, HBKU, Qatar(卡塔尔计算研究中心,HBKU,卡塔尔) ; College of Humanities and Social Sciences, HBKU, Qatar(人文与社会科学学院,HBKU,卡塔尔) ; Arab Center for Research and Policy Studies, Qatar(阿拉伯研究中心与政策研究所,卡塔尔) ; College of Islamic Studies, HBKU, Qatar(伊斯兰研究学院,HBKU,卡塔尔) ; College of Public Policy, HBKU, Qatar(公共政策学院,HBKU,卡塔尔)
专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.CL
AI总结 针对LLM在伊斯兰问答中的幻觉与弃权问题,构建双语基准IslamicFaithQA,并提出基于结构化工具调用的智能体RAG框架,显著提升正确性与鲁棒性。
Comments Islamic Question Answering; Faithful Question Answering; Retrieval-Augmented Generation; Agentic RAG; Large Language Models
软件委托合约:衡量AI编码代理工作中的可审查性
机构 * Independent Researcher(独立研究员)
专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 研究通过显式委托合约提升AI编码代理工作可审查性,实验发现合约虽不改善任务正确性,但显著提高证据充分性和降低审查歧义。
Comments 11 pages; empirical pilot study with 64 coding-agent runs and 192 blinded reviews
RF-Agent: 通过语言代理树搜索实现自动奖励函数设计
机构 * Beihang University(北航大学)
专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.LG
AI总结 RF-Agent通过语言代理树搜索实现自动奖励函数设计,利用蒙特卡洛树搜索和LLMs的上下文推理能力,提升低层控制任务的奖励函数设计效率和效果。
Comments 39 pages, 9 tables, 11 figures, Project page see https://github.com/deng-ai-lab/RF-Agent
SpatialCLI:先借助空间工具进行推理,再脱离工具进行推理
专题命中 工具调用 :agentic(abstract,abstract_cn);tool use(abstract);tool-use(abstract);分类 cs.AI
AI总结 本研究提出SpatialCLI框架,通过三个阶段让视觉语言模型先借助专用空间工具推理,再内化感知能力,在MindCube上大幅提升了Qwen3-VL-8B-Instruct的性能,表现优于对比模型。
CRAFT:学习模式,执行计划
机构 * Amazon Advertising Foundations(亚马逊广告基金会) ; Amazon Web Services Agentic AI(亚马逊网络服务代理人工智能)
专题命中 工具调用 :agent(abstract);tool-use(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 研究企业编码代理将自然语言分析请求转换为可执行代码时的问题,提出两阶段训练后方法 CRAFT,先进行模式剥离的 PLAN 监督微调,再用执行形状的强化学习,评估显示其在多方面有提升并减少负担。
VideoAgent: 视频理解与编辑的全能框架
机构 * South China University of Technology(华南理工大学) ; The University of Hong Kong(香港大学) ; Snap Inc(Snap公司) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
专题命中 工具调用 :agent(abstract);planning(abstract);agentic(abstract);multi-agent(abstract)
AI总结 提出VideoAgent,一种基于多智能体编排的全能框架,通过自动镜头创建和30多个专业编辑智能体,解决现有系统在长视频理解和多样化编辑操作上的局限,在VideoEdit基准上实现87-95%编排成功率并降低60% API成本。
Comments Preprint. Code available at https://github.com/HKUDS/VideoAgent
Evoflux: 紧凑型智能体的可执行工具工作流的推理时演化
机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) ; IBM Research(IBM研究院)
专题命中 工具调用 :agent(abstract);tool use(abstract);workflow(abstract);function calling(abstract)
AI总结 提出Evoflux,一种推理时演化搜索方法,通过结构化编辑和执行反馈修复紧凑语言模型的工具工作流,将执行可行性从3%提升至17-24%,优于SFT和ReAct。
Comments Code is available at https://github.com/IBM/Evoflux
面向视觉原生多模态深度搜索智能体的在策略数据演化
机构 * Hong Kong University of Science and Technology(香港理工大学) ; Renmin University of China(中国人民大学) ; The Chinese University of Hong Kong(香港中文大学) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; University of Edinburgh(爱丁堡大学)
专题命中 工具调用 :agent(abstract);tool use(abstract);tool-use(abstract);workflow(abstract)
AI总结 提出在策略数据演化(ODE)框架,通过图像库引用协议和闭环数据生成器,解决多模态深度搜索中视觉证据不可复用和训练数据静态问题,在8个基准上显著提升性能。
分布式AGI安全
机构 * Google DeepMind(谷歌DeepMind)
专题命中 工具调用 :agent(abstract);AI agent(abstract);tool-use(abstract);agentic(abstract)
AI总结 本文提出了一种分布式的AGI安全框架,旨在通过设计和实现虚拟代理沙盒经济来应对群体代理协调带来的安全风险,强调市场机制、可审计性和监管的重要性。
实验中的代理,代理中的实验:一种面向人工智能增强型实验科学的设计语法
机构 * Guanghua School of Management, Peking University(北京大学光华管理学院) ; Xi'an Jiaotong University(西安交通大学) ; Cheung Kong Graduate School of Business(长江商学院)
专题命中 工具调用 :agent(abstract);workflow(abstract);agentic(abstract);multi-agent(abstract)
AI总结 本文提出SEED框架,用于表示实验条件为类型化的代理-流程图,以支持实验设计的自动化生成和评估,通过在医疗分诊任务中的实验证明其有效性,并讨论了新颖性、可重复性等治理问题。
通过技能程序 harnessing LLM agents
机构 * New York University(纽约大学) ; Salesforce AI Research(Salesforce人工智能研究)
专题命中 工具调用 :agent(summary_cn,abstract);分类 cs.AI
AI总结 本文提出 HASP 框架,通过将技能转化为可执行程序函数(PFs)来提升 LLM agent 在复杂任务中的表现,其核心方法是通过 PFs 在失败状态时介入并修正行动,主要贡献是通过模块化设计实现推理、训练和自改进的多场景应用。
Comments 40 pages, 7 figures
PHMForge:通过MCP原生、算法基础的工具评估LLM代理在工业预测维护中的表现
机构 * Columbia University(哥伦比亚大学) ; Georgia Institute of Technology(佐治亚理工学院) ; IBM, New York(IBM,纽约)
专题命中 工具调用 :agent(abstract);tool use(abstract);planning(abstract);agentic(abstract)
AI总结 PHMForge通过MCP原生工具评估LLM代理在工业预测维护中的可靠性,揭示了静态检索在预测计算中的局限性,展示了不同框架和模型的表现差异。
Comments 23 pages, 3 figures
GitHub Actions CI/CD 工作流中 AI 机器人足迹的可靠性
专题命中 工具调用 :agent(abstract);AI agent(abstract);workflow(abstract);agentic(abstract)
AI总结 研究分析了AI机器人在GitHub Actions CI/CD工作流中的可靠性,发现不同AI机器人成功率差异显著,且高频的AI PR可能影响工作流可靠性。
Comments 5 pages, 3 figures. Submitted to the 23rd International Conference on Mining Software Repositories (MSR 2026) Mining Challenge
强化学习是否扩展大语言模型代理的能力边界?一种PASS@(k,T)分析
机构 * Fudan University(复旦大学) ; Chinese University of Hong Kong(香港中文大学) ; University of Waterloo(滑铁卢大学)
专题命中 工具调用 :agent(abstract);tool use(abstract);tool-use(abstract);agentic(abstract)
AI总结 本文通过PASS@(k,T)指标分析强化学习在代理工具使用中的能力扩展,发现其在复杂任务中确实扩大了能力边界,而静态推理中则趋于收敛。
刻画大规模语言模型在多请求工作流中的性能-能耗权衡
机构 * Dalhousie University(达尔豪斯大学)
专题命中 工具调用 :agent(abstract);workflow(abstract);agentic(abstract);multi-agent(abstract)
AI总结 本文研究了多请求工作流中大规模语言模型的性能与能耗权衡,通过四个代表性工作负载分析关键能耗参数对延迟、吞吐量和组件能耗的影响,揭示了批处理大小、GPU供电限制和引擎优化对能耗的差异影响。
通过端到端强化学习训练多图像视觉代理
机构 * MeiTuan(美团) ; University of Science and Technology of China(中国科学技术大学)
专题命中 工具调用 :agent(abstract);tool use(abstract);tool-use(abstract);multi-agent(abstract)
AI总结 本文提出IMAgent,通过端到端强化学习训练视觉代理,解决多图像问答任务中的输入限制问题,通过设计视觉反思和验证工具提升模型注意力,首次从注意力角度揭示工具使用对性能的影响。
Tendem:一种混合AI+人类平台
机构 * Toloka Team(Toloka团队)
专题命中 工具调用 :agent(abstract);AI agent(abstract);tool-use(abstract);agentic(abstract)
AI总结 Tendem通过结合AI与人类专家,实现了在复杂任务中高质量、高效率的输出,同时保持与纯人力执行相当的成本。
突破检索障碍:为LLM系统设计的野外间接提示注入
专题命中 工具调用 :agent(abstract);workflow(abstract);agentic(abstract);multi-agent(abstract)
AI总结 本研究提出了一种高效且低成本的黑盒攻击算法,通过分解恶意内容为触发片段和攻击片段,实现了对LLM系统的间接提示注入攻击,揭示了检索过程中存在的关键安全漏洞。
VIGIL:一种用于自愈代理的反射性运行时
机构 * Christopher Cruz
专题命中 工具调用 :agent(abstract);tool use(abstract);planning(abstract);agentic(abstract)
AI总结 VIGIL是一种反射性运行时,通过自我诊断和修复机制提升代理系统的可靠性和自我维护能力。