arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-12 至 2026-05-12 共收录 33 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 33 篇

2605.10555 2026-05-12 cs.AI 92%

Agent-First Tool API: A Semantic Interface Paradigm for Enterprise AI Agent Systems

代理优先工具API:面向企业AI代理系统的语义接口范式

Kai Pan

机构 * A2A Lab(A2A实验室)

专题命中 工具调用 :agent(title,summary_cn);AI agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出Agent-First Tool API范式,通过六动词语义协议、标准化工具合同和双层治理管道,解决传统API与自主代理需求的五大匹配问题,实验证明其在任务成功率、人工干预和自主纠错方面显著优于传统CRUD方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20036 2026-05-12 cs.CL cs.SE 88%

ToolScope: Enhancing LLM Agent Tool Use through Tool Merging and Context-Aware Filtering

ToolScope: 通过工具合并和上下文感知过滤增强LLM代理的工具使用

Marianne Menglin Liu, Daniel Garcia, Fjona Parllaku, Vikas Upadhyay, Syed Fahad Allam Shah, Dan Roth

机构 * Oracle AI

专题命中 工具调用 :tool use(title,abstract);agent(title);tool-use(abstract);分类 cs.CL、cs.SE

AI总结 ToolScope通过自动校正的工具合并和上下文感知检索提升LLM代理的工具选择准确性,实验表明在三个顶级LLM和开源基准上提升了8.38%至38.6%的准确率。

Comments ACL Main Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23806 2026-05-12 cs.SE cs.AI 88%

Willful Disobedience: Automatically Detecting Failures in Agentic Traces

有意违背:自动检测代理轨迹中的故障

Reshabh K Sharma, Shraddha Barke, Benjamin Zorn

机构 * University of Washington(华盛顿大学) Microsoft Research(微软研究院)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);AI agent(abstract);workflow(abstract)

AI总结 本文提出AgentPex工具,通过提取规则自动评估代理轨迹,发现传统仅关注结果的评估方法无法检测到关键流程故障,如错误的工作流路由、不安全的工具使用或违反提示规则的情况。

Comments Accepted at ACM CAIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10848 2026-05-12 cs.IR cs.AI cs.CL 86%

Rethinking Agentic Search with Pi-Serini: Is Lexical Retrieval Sufficient?

重新思考Pi-Serini中的代理搜索:词汇检索是否足够?

Tz-Huan Hsu, Jheng-Hong Yang, Jimmy Lin

机构 * University of Waterloo(滑铁卢大学) Stencilzeit University of Waterloo(斯泰尔齐特大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 本文探讨了在代理循环中,随着LLM能力提升,词汇检索是否足够。通过结合BM25与前沿LLM,引入Pi-Serini搜索代理,展示其在BrowseComp-Plus上优于现有检索代理的性能。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10165 2026-05-12 cs.CL cs.AI cs.CV cs.LG 85%

OpenClaw-RL: Train Any Agent Simply by Talking

OpenClaw-RL: 通过对话简单训练任何智能体

Yinjie Wang, Xuyang Chen, Xiaolong Jin, Mengdi Wang, Ling Yang

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 OpenClaw-RL通过基础设施和方法创新,利用下一步状态信号在线优化智能体。该框架统一了指令和评估信号,通过重叠引导提示选择和对数概率差裁剪稳定蒸馏,适用于个人和通用智能体。

Comments Code: https://github.com/Gen-Verse/OpenClaw-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09734 2026-05-12 cs.SE cs.AI cs.MA 84%

Trajectory Supervision for Continual Tool-Use Learning in LLMs

在大语言模型中为持续工具使用学习提供轨迹监督

Vishnu Vardhan Reddy, Sagnik Chatterjee, Soumik Bhatta

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校)

专题命中 工具调用 :tool-use(title,abstract);tool use(abstract);分类 cs.AI、cs.SE

AI总结 研究通过对比保留工具使用轨迹与去除中间API轨迹的方法,发现保留轨迹能提升API调用准确率,但需更多训练token。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26805 2026-05-12 cs.AI cs.MA 83%

Bian Que: An Agentic Framework with Flexible Skill Arrangement for Online System Operations

Bian Que: 一个具有灵活技能安排的代理框架,用于在线系统运维

Bochao Liu, Zhipeng Qian, Yang Zhao, Xinyuan Jiang, Zihan Liang, Yufei Ma, Junpeng Zhuang, Ben Chen, Shuo Yang, Hongen Wan, Yao Wu, Chenyi Lei, Xiao Liang

机构 * Kuaishou Technology(快手科技)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 Bian Que通过统一运维范式和灵活技能安排,提高了在线系统运维效率,减少了警报量,提高了根因分析准确率,缩短了故障解决时间。

Comments HomePage: https://benchen4395.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23273 2026-05-12 cs.CL 83%

UPA: Unsupervised Prompt Agent via Tree-Based Search and Selection

UPA:基于树状搜索与选择的无监督提示代理

Siran Peng, Weisong Zhao, Tianyu Fu, Chenxu Zhao, Tianshuo Zhang, Haoyuan Zhang, Xiangyu Zhu, Minghui Wu, Zhen Lei

机构 * MAIS, CASIA(中国科学院自动化研究所) SAI, UCAS(中国科学技术大学人工智能学院) Mininglamp Technology(Mininglamp技术公司) IIE, CAS(中国科学院信息研究所) SCSE, FIE, M.U.S.T(慕斯科技大学信息工程系)

专题命中 工具调用 :agent(title,abstract);planning(abstract);分类 cs.CL

AI总结 本文提出UPA,一种无需真实奖励信号的无监督提示代理,通过树状结构搜索和基于Bradley-Terry-Luce模型的两阶段框架实现高效提示优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09055 2026-05-12 cs.RO cs.AI cs.MA 83%

Octopus Protocol: One-Shot Hardware Discovery and Control for AI Agents via Infrastructure-as-Prompts

Octopus Protocol:通过基础设施即提示实现AI代理的一次性硬件发现与控制

Quilee Simeon, Justin M. Wei, Yile Fan

机构 * MIT(麻省理工学院)

专题命中 工具调用 :AI agent(title);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 Octopus Protocol通过五阶段流程实现硬件发现与控制,利用语言模型API生成MCP协议服务器,使AI代理能自主完成硬件集成与闭环视觉-运动控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10362 2026-05-12 cs.CV 82%

CellDX AI Autopilot: Agent-Guided Training and Deployment of Pathology Classifiers

CellDX AI Autopilot:基于代理的训练与部署病理分类器

Alexey Pchelnikov, Aleksei Pchelnikov

机构 * HistAI

专题命中 工具调用 :agent(title,abstract);AI agent(abstract)

AI总结 CellDX AI Autopilot通过自然语言交互让非ML背景的病理学家和ML专家高效训练、评估和部署病理分类器,利用预构建的32000+病例和66000张H&E染色全切片图像数据集,结合多实例学习框架和迭代双变量超参数搜索,实现端到端自动化模型训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01532 2026-05-12 cs.AI 81%

PHMForge: Evaluating LLM Agents on Industrial Prognostics through MCP-Native, Algorithm-Grounded Tools

PHMForge:通过MCP原生、算法基础的工具评估LLM代理在工业预测维护中的表现

Tianjun Feng, Yunfeng Chen, Chun-Yi Tsai, Yihan Sun, Ayan Das, Kaoutar El Maghraoui, Shuxin Lin, Dhaval Patel

机构 * Columbia University(哥伦比亚大学) Georgia Institute of Technology(佐治亚理工学院) IBM, New York(IBM,纽约)

专题命中 工具调用 :agent(abstract);tool use(abstract);planning(abstract);agentic(abstract)

AI总结 PHMForge通过MCP原生工具评估LLM代理在工业预测维护中的可靠性,揭示了静态检索在预测计算中的局限性,展示了不同框架和模型的表现差异。

Comments 23 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14345 2026-05-12 cs.LG cs.AI stat.ML 81%

PAC-MCTS: Bias-Aware Pruning for Robust LLM-Guided Search and Planning

PAC-MCTS:具有偏见意识的剪枝用于稳健的LLM引导搜索与规划

Tianhao Qian

机构 * School of Mathematics, Southeast University(东南大学数学学院)

专题命中 工具调用 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出PAC-MCTS框架,通过动态调整置信区间来应对LLM引导下的偏见问题,实验表明其在Blocksworld和ALFWorld任务中显著提升了鲁棒性和搜索效率。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08563 2026-05-12 cs.AI 79%

Why Retrying Fails: Context Contamination in LLM Agent Pipelines

为何重试失效:LLM代理流水线中的上下文污染

Zhanfu Yang

机构 * Department of Computer Science, Rutgers University(罗格斯大学计算机科学系)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 本文研究LLM代理在多步骤工具增强任务中重试失败的上下文污染问题,提出上下文污染重试模型(CCRM),推导了五个核心结果,包括成功概率公式、重试开销定理、预算分配定理等,并通过实验证明模型的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04712 2026-05-12 cs.CV cs.AI eess.IV 77%

SAR-RAG: ATR Visual Question Answering by Semantic Search, Retrieval, and MLLM Generation

SAR-RAG:通过语义搜索、检索和MLLM生成实现目标识别的视觉问答

David F. Ramirez, Tim Overman, Kristen Jaskie, Joe Marvin, Andreas Spanias

机构 * SenSIP Center, School of ECEE, Arizona State University(SenSIP中心,电子与计算机工程学院,亚利桑那州立大学) Prime Solutions Group Inc(Prime Solutions Group公司)

专题命中 工具调用 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出SAR-RAG方法,结合多模态大语言模型和语义嵌入向量数据库,通过语义搜索和检索提升SAR图像目标识别的准确性,通过分类和回归指标验证效果。

Comments Accepted to 2026 SPIE Defense + Security, Automatic Target Recognition XXXVI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08904 2026-05-12 cs.AI 77%

OPT-BENCH: Evaluating the Iterative Self-Optimization of LLM Agents in Large-Scale Search Spaces

OPT-BENCH:评估大搜索空间中LLM代理的迭代自我优化

Xiaozhe Li, Jixuan Chen, Xinyu Fang, Shengyuan Ding, Haodong Duan, Qingwen Liu, Kai Chen

机构 * Tongji University(同济大学) Shanghai AI Lab(上海人工智能实验室) Fudan University(复旦大学) Zhejiang University(浙江大学) University of California San Diego(加州大学圣地亚哥分校)

专题命中 工具调用 :agent(abstract,abstract_cn);tool use(abstract);分类 cs.AI

AI总结 OPT-BENCH通过结合20个机器学习任务和10个经典NP难问题,评估LLM代理在大规模搜索空间中通过内在自我反思而非机械工具应用进行适应的能力,揭示更强模型在反馈利用上的优势及基础能力的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07177 2026-05-12 cs.LG cs.AI 73%

HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents

HyperEyes: 双粒度效率感知强化学习用于并行多模态搜索代理

Guankai Li, Jiabin Chen, Yi Xu, Xichen Zhang, Yuan Lu

机构 * Xiaohongshu Inc.(小红书公司) University of Cambridge(剑桥大学)

专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.LG

AI总结 HyperEyes通过双粒度效率感知强化学习,实现并行多模态搜索代理,提升搜索效率与准确性,其在六个基准测试中超越现有开源代理。

Comments Code & Data: https://github.com/DeepExperience/HyperEyes

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10172 2026-05-12 cs.CV cs.CL 70%

V-ABS: Action-Observer Driven Beam Search for Dynamic Visual Reasoning

V-ABS:基于动作-观察者的动态视觉推理束搜索

Zhiwei Ning, Xuanang Gao, Jiaxi Cao, Gengming Zhang, Shengnan Ma, Wenwen Tong, Hanming Deng, Jie Yang, Wei Liu

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Institute of Image Processing and Pattern Recognition, Shanghai Jiao Tong University(上海交通大学图像处理与模式识别研究所) SenseTime Research(商汤科技研究院) Institute of Medical Robotics, Shanghai Jiao Tong University(上海交通大学医学机器人研究所)

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.CL

AI总结 本文提出V-ABS框架,通过思考-行动-观察循环和熵适应加权算法,缓解IAO偏差,提升多模态模型在复杂视觉推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11790 2026-05-12 cs.CR cs.AI 70%

ClawGuard: A Runtime Security Framework for Tool-Augmented LLM Agents Against Indirect Prompt Injection

ClawGuard:一种用于对抗间接提示注入的工具增强LLM代理运行时安全框架

Wei Zhao, Zhe Li, Peixin Zhang, Jun Sun

机构 * Singapore Management University(新加坡国立管理学院)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 ClawGuard通过在工具调用边界实施用户确认规则集,有效阻止间接提示注入攻击,无需修改模型或基础设施,实验显示其在多个基准测试中均能提供可靠保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09932 2026-05-12 cs.CL 70%

FocuSFT: Bilevel Optimization for Dilution-Aware Long-Context Fine-Tuning

FocuSFT:基于稀释意识的长上下文微调的双层优化

Zehua Pei, Hui-Ling Zhen, Xianzhi Yu, Sinno Jialin Pan, Mingxuan Yuan, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.CL

AI总结 FocuSFT通过双层优化框架解决长上下文微调中注意力稀释问题,提升模型在长上下文下的准确性和表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19914 2026-05-12 cs.CL cs.AI cs.SE 67%

Simulating Complex Multi-Turn Tool Calling Interactions in Stateless Execution Environments

在无状态执行环境中模拟复杂多轮工具调用交互

Maxwell Crouse, Ibrahim Abdelaziz, Kshitij Fadnis, Siva Sankalp Patel, Kinjal Basu, Chulaka Gunasekara, Sadhana Kumaravel, Asim Munawar, Pavan Kapanipathi

机构 * IBM Research AI(IBM人工智能研究院)

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本文提出DiGiT-TC方法,用于生成无状态环境下多轮工具调用对话,通过新颖的生成模式隐式表示工具调用,验证了在有状态问题设置中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07027 2026-05-12 cs.AI cs.CL cs.LG cs.NE physics.chem-ph 67%

LLM-Augmented Chemical Synthesis and Design Decision Programs

基于大语言模型的化学合成与设计决策程序

Haorui Wang, Jeff Guo, Lingkai Kong, Rampi Ramprasad, Philippe Schwaller, Yuanqi Du, Chao Zhang

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院洛桑校区) National Centre of Competence in Research (NCCR) Catalysis(催化领域竞争力研究国立中心) Harvard University(哈佛大学) Cornell University(康奈尔大学)

专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出利用大语言模型增强的 retrosynthesis 规划方法,通过高效编码反应路径和新的路线搜索策略,提升多步合成规划与可合成分子设计能力。

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09168 2026-05-12 cs.AI cs.LG 62%

CIVeX: Causal Intervention Verification for Language Agents

CIVeX:语言代理的因果干预验证

Fabio Rovai

机构 * The Tesseract Academy(泰塞克特学院)

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.LG

AI总结 CIVeX通过结构因果查询验证语言代理的干预行动,解决因果效应识别问题,实验显示其在对抗性混淆下具有高准确性和可靠性。

Comments 16 pages, 3 figures. Includes Causal-ToolBench, IHDP, ZOZO Open Bandit, and LaLonde NSW evaluations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08887 2026-05-12 cs.AI cs.CL 62%

Ace-Skill: Bootstrapping Multimodal Agents with Prioritized and Clustered Evolution

Ace-Skill:通过优先级和聚类进化提升多模态智能体

Feng Xiong, Zengbin Wang, Yong Wang, Xuecai Hu, Jinghan He, Liang Lin, Yuan Liu, Xiangxiang Chu

机构 * AMAP, Alibaba Group(阿里集团AMAP) CASIA BNU(北华大学)

专题命中 工具调用 :tool-use(abstract);分类 cs.AI、cs.CL

AI总结 Ace-Skill通过优先级采样和聚类组织优化多模态智能体的自我进化过程,提升信息获取效率和知识检索可靠性,实现自我强化的良性循环,提升多模态工具使用任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08368 2026-05-12 cs.AI cond-mat.stat-mech cs.LG 62%

On Distinguishing Capability Elicitation from Capability Creation in Post-Training: A Free-Energy Perspective

在训练后区分能力激发与能力创造:从自由能视角出发

Yuhao Li, Shengchao Liu

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.LG

AI总结 本文从自由能视角出发,区分训练后的能力激发与能力创造,通过引入可及支持的概念,探讨训练过程对行为概率和可达行为空间的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15599 2026-05-12 cs.AI 57%

Autonomous Business System via Neuro-symbolic AI

通过神经符号AI实现自主业务系统

Cecil Pang, Hiroki Sayama

机构 * School of Systems Science and Industrial Engineering, Binghamton University, State University of New York(宾夕法尼亚州立大学布林顿分校系统科学与工业工程学院) AI Engineering, USA TODAY Co., Inc.(USA TODAY公司人工智能工程部) Binghamton Center of Complex Systems, Binghamton University, State University of New York(宾夕法尼亚州立大学布林顿复杂系统中心) Waseda Innovation Lab, Waseda University(早稻田大学创新实验室)

专题命中 工具调用 :AI agent(abstract);分类 cs.AI

AI总结 本文提出自主业务系统AUTOBUS,结合大语言模型、谓词逻辑编程和企业数据,构建神经符号架构以执行端到端业务任务,通过人机协作提升业务处理的确定性和适应性。

Comments IEEE SysCon 2026

Journal ref 2026 IEEE International Systems Conference (SysCon), Halifax, NS, Canada, 2026, pp. 1-8

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14137 2026-05-12 cs.LG 57%

Learning to Learn the Macroscopic Fundamental Diagram using Physics-Informed and meta Machine Learning techniques

通过物理信息和元机器学习技术学习宏观基本图

Amalie Roark, Serio Agriesti, Francisco Camara Pereira, Guido Cantelmo

机构 * Technical University of Denmark(丹麦技术大学)

专题命中 工具调用 :tool use(abstract);分类 cs.LG

AI总结 本文提出利用元学习技术解决宏观基本图估计数据稀缺问题,通过多城市数据建模提升不同城市交通流预测性能。

Comments Version accepted for publication in Transportation Research Part C (before proof-reading)

Journal ref Learning to learn the macroscopic fundamental diagram using physics-informed and model agnostic machine learning. Transportation Research Part C: Emerging Technologies, 2026, 189, 105707

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10020 2026-05-12 cs.LG 57%

TrajDLM: Topology-Aware Block Diffusion Language Model for Trajectory Generation

TrajDLM:基于块扩散语言模型的拓扑感知轨迹生成框架

Wilson Wongso, Lihuan Li, Arian Prabowo, Xiachong Lin, Baiyu Chen, Hao Xue, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 工具调用 :planning(abstract);分类 cs.LG

AI总结 TrajDLM结合块扩散模型与拓扑感知嵌入,实现高效且真实的轨迹生成,优于现有方法,在速度和细粒度相似性上表现优异,并在跨领域迁移中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09934 2026-05-12 cs.CL 57%

TRACER: Verifiable Generative Provenance for Multimodal Tool-Using Agents

TRACER:多模态工具使用代理的可验证生成溯源

Bihui Yu, Caijun Jia, Jing Chi, Xiaohan Liu, Yining Wang, He Bai, Yuchen Liu, Jingxuan Wei, Junnan Zhu

机构 * Shenyang Institute of Computing Technology, Chinese Academy of Sciences(中国科学院沈阳计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(教育部计算电力网络与信息安全重点实验室,山东计算机科学中心(济南国家超算中心),齐鲁工业大学(山东省科学院))

专题命中 工具调用 :tool use(abstract);分类 cs.CL

AI总结 TRACER通过生成带结构溯源记录的答案句子,解决多模态工具使用代理中缺乏的 claim-level 依赖结构问题,提升工具使用可验证性和优化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08762 2026-05-12 cs.SD cs.LG 57%

Omni-DeepSearch: A Benchmark for Audio-Driven Omni-Modal Deep Search

Omni-DeepSearch:一种基于音频的多模态深度搜索基准

Tao Yu, yiming ding, Shenghua Chai, Minghui Zhang, Zhongtian Luo, Xinming Wang, Xinlong Chen, Zhaolu Kang, Junhao Gong, Yuxuan Zhou, Haopeng Jin, Zhiqing Cui, Jiabing Yang, YiFan Zhang, Hongzhu Yi, Zheqi He, Xi Yang, Yan Huang, Liang Wang

机构 * CASIA UCAS BAAI Peking University(北京大学) Tsinghua University(清华大学)

专题命中 工具调用 :tool-use(abstract);分类 cs.LG

AI总结 本文提出Omni-DeepSearch基准,用于评估基于音频的多模态深度搜索能力,通过多跳推理生成客观答案,结果显示该任务极具挑战性。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08467 2026-05-12 cs.LG 57%

CUDAHercules: Benchmarking Hardware-Aware Expert-level CUDA Optimization for LLMs

CUDAHercules:用于LLM的硬件感知专家级CUDA优化基准测试

Shiyang Li, Zijian Zhang, Guangyan Sun, Yuebo Luo, Winson Chen, Yanzhi Wang, Mingyi Hong, Caiwen Ding

机构 * University of Minnesota(明尼苏达大学) Northeastern University(东北大学)

专题命中 工具调用 :tool use(abstract);分类 cs.LG

AI总结 CUDAHercules基准测试评估生成CUDA代码与人类专家级优化的差距,揭示自动化CUDA编程在硬件感知和优化策略上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏