arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-18 至 2026-03-18 共收录 10 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 10 篇

2603.16839 2026-03-18 cs.AI 85%

Learning to Present: Inverse Specification Rewards for Agentic Slide Generation

学习呈现:用于代理幻灯片生成的逆规范奖励

Karthik Ragunath Ananda Kumar, Subrahmanyam Arunachalam

机构 * Tavus Inc.(Tavus公司) University of Texas at Dallas(德克萨斯大学达拉斯分校) Texas A&M University(德克萨斯农工大学)

专题命中 工具调用 :agentic(title,abstract);tool use(abstract);tool-use(abstract);分类 cs.AI

AI总结 本文提出一个兼容OpenEnv的强化学习环境,通过工具使用训练LLM代理生成专业HTML幻灯片,引入多组件奖励系统,包括结构验证、渲染质量评估、LLM审美评分、内容质量指标和逆规范奖励,实验显示细调模型在质量与工具使用合规性上表现优异。

Comments 12 pages, 11 figures, 13 tables, 26 references. Code: https://github.com/pushing-the-frontier/slide-forge-llm Dataset: https://huggingface.co/datasets/KarthikRagunathAnandaKumar/sliderl-multi-turn-rollouts

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17325 2026-03-18 cs.LG cs.AI cs.CL 85%

Generalizable End-to-End Tool-Use RL with Synthetic CodeGym

通用端到端工具使用强化学习与合成CodeGym

Weihua Du, Hailei Gong, Zhan Ling, Kang Liu, Lingfeng Shen, Xuesong Yao, Yufei Xu, Dingyuan Shi, Yiming Yang, Jiecao Chen

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

专题命中 工具调用 :tool-use(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出CodeGym框架,通过合成多样化的多轮工具使用环境,提升LLM代理在不同任务配置下的泛化能力,实验显示Qwen2.5-32B-Instruct在OOD基准测试中准确率提升8.7个百分点。

Comments 24 pages. Accepted to ICLR 2026. Project repository: https://github.com/StigLidu/CodeGym

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16335 2026-03-18 cs.LG cs.CL 79%

Behavioral Steering in a 35B MoE Language Model via SAE-Decoded Probe Vectors: One Agency Axis, Not Five Traits

通过SAE解码探测向量在35B MoE语言模型中实现行为操控:一个代理轴,而非五个特质

Jia Qing Yap

机构 * Independent Researcher(独立研究员)

专题命中 工具调用 :agent(abstract);tool-use(abstract);agentic(abstract);分类 cs.CL、cs.LG

AI总结 研究通过训练九个稀疏自编码器识别并操控五个代理行为特质,发现所有向量主要调节单一主导代理轴,仅在工具使用等次要方面产生影响。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15916 2026-03-18 cs.LG cs.AI 73%

Auto Researching, not hyperparameter tuning: Convergence Analysis of 10,000 Experiments

自主研究而非超参数调优:10000次实验的收敛分析

Xiaoyi Li

专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析10469次实验,发现架构选择对性能影响显著,超参数调整影响较小,展示了LLM在自主设计ML实验中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16664 2026-03-18 cs.CV cs.AI 70%

Kestrel: Grounding Self-Refinement for LVLM Hallucination Mitigation

Kestrel: 为降低LVLM幻觉而引入自反思

Jiawei Mao, Hardy Chen, Haoqin Tu, Yuhan Wang, Letian Zhang, Zeyu Zheng, Huaxiu Yao, Zirui Wang, Cihang Xie, Yuyin Zhou

机构 * UC Santa Cruz(加州大学圣克ruz分校) UC Berkeley(加州大学伯克利分校) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Apple(苹果公司)

专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 Kestrel提出一种无需训练的框架,通过显式视觉 grounding 与证据验证自反思机制减少LVLM幻觉,实验显示在POPE和MME-Hallucination基准上性能提升,同时提供透明的验证轨迹。

Comments 16 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05413 2026-03-18 cs.SD 67%

Building Enterprise Realtime Voice Agents from Scratch: A Technical Tutorial

从零构建企业级实时语音代理:技术教程

Jielin Qiu, Zixiang Chen, Liangwei Yang, Ming Zhu, Zhiwei Liu, Juntao Tan, Wenting Zhao, Rithesh Murthy, Roshan Ram, Akshara Prabhakar, Shelby Heinecke, Caiming Xiong, Silvio Savarese, Huan Wang

机构 * Salesforce AI Research(Salesforce AI研究院)

专题命中 工具调用 :agent(abstract);function calling(abstract)

AI总结 本文介绍如何从零构建企业级实时语音代理,通过Deepgram、vLLM和ElevenLabs实现端到端流程,展示最佳实践与代码实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15653 2026-03-18 cs.CL cs.AI cs.LG 67%

Recursive Language Models Meet Uncertainty: The Surprising Effectiveness of Self-Reflective Program Search for Long Context

递归语言模型与不确定性:自我反思程序搜索在长上下文中的意外效果

Keivan Alizadeh, Parshin Shojaee, Minsik Cho, Mehrdad Farajtabar

机构 * Apple(苹果公司)

专题命中 工具调用 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出SRLM框架,通过引入不确定性感知的自我反思,提升长上下文处理能力,实验显示其在多种任务中优于现有基线,且无需递归机制。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16715 2026-03-18 cs.LG cond-mat.mtrl-sci 57%

Novelty-Driven Target-Space Discovery in Automated Electron and Scanning Probe Microscopy

基于新颖性的目标空间发现:自动化电子显微镜与扫描探针显微镜中的发现方法

Utkarsh Pratiush, Kamyar Barakati, Boris N. Slautin, Catherine C. Bodinger, Christopher D. Lowe, Brandi M. Cossairt, Sergei V. Kalinin

机构 * Department of Materials Science and Engineering, University of Tennessee, Knoxville(田纳西大学材料科学与工程系) Department of Chemistry, University of Washington, Seattle(华盛顿大学化学系) Pacific Northwest National Laboratory, Richland(太平洋西北国家实验室)

专题命中 工具调用 :workflow(abstract);分类 cs.LG

AI总结 本文提出了一种基于新颖性的深度核学习框架,用于在自动化电子显微镜和扫描探针显微镜中主动探索目标空间,通过学习结构-性质关系来发现新的响应区域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15298 2026-03-18 cs.SE cs.HC 57%

The Impact of AI-Assisted Development on Software Security: A Study of Gemini and Developer Experience

AI辅助开发对软件安全的影响:对Gemini和开发者经验的研究

Nadine Jost, Benjamin Berens, Manuel Karl, Stefan Albert Horstmann, Martin Johns, Alena Naiakshina

专题命中 工具调用 :tool use(abstract);分类 cs.SE

AI总结 研究探讨AI工具Gemini对代码安全的影响,发现编程经验显著提升安全性,无法完全被AI替代。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04439 2026-03-18 cs.LG 57%

RETRO SYNFLOW: Discrete Flow Matching for Accurate and Diverse Single-Step Retrosynthesis

RETRO SYNFLOW:用于准确且多样单步逆合成的离散流匹配

Robin Yadav, Qi Yan, Guy Wolf, Avishek Joey Bose, Renjie Liao

专题命中 工具调用 :planning(abstract);分类 cs.LG

AI总结 本文提出RETRO SYNFLOW框架,通过离散流匹配在目标分子与反应物间建立马尔可夫桥,提升单步逆合成的准确性和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏