arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 5047 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5047 篇

2605.21405 2026-05-21 cs.SE cs.AI cs.PL 62%

Stdlib or Third-Party? Empirical Performance and Correctness of LLM-Assisted Zero-Dependency Python Libraries

标准库还是第三方?LLM辅助零依赖Python库的实证性能和正确性

Peng Ding, Rick Stevens

机构 * University of Chicago(芝加哥大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文通过零依赖项目探讨了仅使用Python标准库能否替代第三方库,并评估了LLM在严格约束下生成正确且高性能代码的能力。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16609 2026-05-19 cs.LG cs.AI cs.CC cs.DS 62%

Prior Knowledge Makes It Possible: From Sublinear Graph Algorithms to LLM Test-Time Methods

先验知识使其成为可能:从次线性图算法到LLM测试时方法

Avrim Blum, Daniel Hsu, Cyrus Rashtchian, Donya Saless

机构 * Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Columbia University(哥伦比亚大学) Google Research(谷歌研究)

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了测试时增强方法中先验知识与外部信息交互的理论基础,通过将多步推理建模为知识图中的s-t连通性问题,揭示了在部分先验知识下,测试时增强步骤数量与图结构之间的关系,发现当知识图中存在小组件时,增强步骤数呈平方根增长,而当知识密度超过阈值形成大组件时,增强步骤数趋于常数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17162 2026-05-19 cs.AI cs.LG 62%

From Imitation to Interaction: Mastering Game of Schnapsen with Shallow Reinforcement Learning

从模仿到交互:利用浅层强化学习掌握斯纳普森游戏

Ján Klačan, Sizhong Zhang

机构 * Vrije Universiteit Amsterdam(弗里兹大学阿姆斯特丹)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究浅层神经网络代理是否能掌握纸牌游戏斯纳普森,并挑战使用蒙特卡洛采样和前瞻搜索的强搜索基线RdeepBot。通过逐步更复杂的实验设计,首先评估了基于回放数据训练的监督学习代理(MLPBot)以及通过异步蒙特卡洛更新和经验回放训练的强化学习代理(RLBot)。结果表明,监督模仿不足以击败强RdeepBot对手,而强化学习产生了更强的代理。在聚焦RdeepBot深度参数的设置中,最佳性能是在学习的价值函数与游戏过程中更深层次的前瞻搜索结合时实现的,使RLBot在最强的RdeepBot基线下实现了统计显著更高的胜率。在基于样本的设置中,收益更具条件性:最强性能出现在相对较低的训练num_samples参数下,而不是随着更强采样均匀增加。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00712 2026-05-19 cs.LG cs.AI 62%

JSON-Bag: A generic game trajectory representation

JSON-Bag:一种通用的游戏轨迹表示方法

Dien Nguyen, Diego Perez-Liebana, Simon Lucas

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出JSON-Bag模型,通过分词JSON描述并使用Jensen-Shannon距离衡量游戏轨迹,验证了其在六个桌面游戏中对玩家、参数和种子分类的有效性,优于基线方法并提升了准确性。

Comments 8 pages, 3 figures, 6 tables, published in IEEE Conference on Games 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01242 2026-05-14 cs.CV cs.AI cs.CL 62%

When Diffusion Breaks Constraints: Sequential Autoregressive Generation with RL and MCTS

当扩散模型失效约束:通过强化学习和MCTS的序列自回归生成

Zirui Zhao, Boye Niu, Harold Soh, David Hsu, Wee Sun Lee

机构 * Salesforce AI Research(Salesforce人工智能研究) University of Sydney(悉尼大学) National University of Singapore(新加坡国立大学)

专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.CL

AI总结 本文研究了扩散模型在约束生成任务中的失效模式,通过拼图生成和简化矩形组合任务,发现扩散模型难以满足约束,提出基于自回归序列生成的约束意识生成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09168 2026-05-12 cs.AI cs.LG 62%

CIVeX: Causal Intervention Verification for Language Agents

CIVeX:语言代理的因果干预验证

Fabio Rovai

机构 * The Tesseract Academy(泰塞克特学院)

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.LG

AI总结 CIVeX通过结构因果查询验证语言代理的干预行动,解决因果效应识别问题,实验显示其在对抗性混淆下具有高准确性和可靠性。

Comments 16 pages, 3 figures. Includes Causal-ToolBench, IHDP, ZOZO Open Bandit, and LaLonde NSW evaluations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08887 2026-05-12 cs.AI cs.CL 62%

Ace-Skill: Bootstrapping Multimodal Agents with Prioritized and Clustered Evolution

Ace-Skill:通过优先级和聚类进化提升多模态智能体

Feng Xiong, Zengbin Wang, Yong Wang, Xuecai Hu, Jinghan He, Liang Lin, Yuan Liu, Xiangxiang Chu

机构 * AMAP, Alibaba Group(阿里集团AMAP) CASIA BNU(北华大学)

专题命中 工具调用 :tool-use(abstract);分类 cs.AI、cs.CL

AI总结 Ace-Skill通过优先级采样和聚类组织优化多模态智能体的自我进化过程,提升信息获取效率和知识检索可靠性,实现自我强化的良性循环,提升多模态工具使用任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08368 2026-05-12 cs.AI cond-mat.stat-mech cs.LG 62%

On Distinguishing Capability Elicitation from Capability Creation in Post-Training: A Free-Energy Perspective

在训练后区分能力激发与能力创造:从自由能视角出发

Yuhao Li, Shengchao Liu

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.LG

AI总结 本文从自由能视角出发,区分训练后的能力激发与能力创造,通过引入可及支持的概念,探讨训练过程对行为概率和可达行为空间的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10880 2026-05-11 cs.CR cs.AI cs.CL 62%

Searching for Privacy Risks in LLM Agents via Simulation

通过模拟搜索LLM代理中的隐私风险

Yanzhe Zhang, Diyi Yang

机构 * Georgia Tech(佐治亚理工学院) Stanford University(斯坦福大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出通过模拟搜索改进攻击与防御策略,发现攻击策略从直接请求演变为伪装和伪造同意等复杂手段,防御策略从规则约束升级为身份验证状态机,为隐私安全代理发展提供洞察。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07462 2026-05-11 cs.CL cs.AI 62%

The Moltbook Files: A Harmless Slopocalypse or Humanity's Last Experiment

Moltbook Files:一场无害的混乱还是人类的最后实验

William Brach, Federico Torrielli, Stine Lyngsø Beltoft, Annemette Brok Pirchert, Peter Schneider-Kamp, Lukas Galke Poech

机构 * Slovak University of Technology(斯洛伐克技术大学) University of Turin(都灵大学) University of Southern Denmark(南部丹麦大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究Moltbook平台上的群体行为,通过分析232k篇帖子和2.2M条评论,发现其数据对语言模型的影响,发现微调后真实性下降,但Reddit数据集也产生类似效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15189 2026-05-11 cs.IR cs.AI cs.CL 62%

ScrapeGraphAI-100k: Dataset for Schema-Constrained LLM Generation

ScrapeGraphAI-100k:用于模式约束LLM生成的数据集

William Brach, Francesco Zuppichini, Marco Vinciguerra, Lorenzo Padoan

机构 * Slovak University of Technology(斯洛伐克技术大学) ScrapeGraphAI

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.CL

AI总结 本文提出ScrapeGraphAI-100k数据集,包含93695个模式约束提取事件,通过真实用户数据和结构化标注,用于评估LLM在模式约束下的生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02805 2026-05-11 cs.CL cs.AI 62%

MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning

MemSearcher:通过端到端强化学习训练LLM进行推理、搜索和管理内存

Qianhao Yuan, Jie Lou, Zichao Li, Jiawei Chen, Yaojie Lu, Hongyu Lin, Le Sun, Debing Zhang, Xianpei Han

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所信息处理实验室,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Xiaohongshu Inc(小红书公司)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 MemSearcher通过端到端强化学习训练LLM进行推理、搜索和内存管理,通过维护紧凑的记忆在多轮交互中保持上下文长度稳定,优于基于历史拼接的基线方法。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27685 2026-05-01 cond-mat.mtrl-sci cs.AI cs.LG physics.comp-ph 62%

VibroML: an automated toolkit for high-throughput vibrational analysis and dynamic instability remediation of crystalline materials using machine-learned potentials

VibroML:一种用于晶体材料高通量振动分析及动态不稳定性修复的自动化工具包

Rogério Almeida Gouvêa, Gian-Marco Rignanese

机构 * WEL Research Institute(WEL研究机构)

专题命中 工具调用 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 VibroML通过机器学习势能函数自动修复晶体材料的动态不稳定性,结合遗传算法和分子动力学模拟,发现多种动态稳定的多形体,并利用ProtoCSP预测稳定晶体结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16888 2026-04-28 cs.CR cs.AI cs.CL 62%

PARASITE: Conditional System Prompt Poisoning to Hijack LLMs

PARASITE: 条件系统提示污染以劫持大语言模型

Viet Pham, Thai Le

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 PARASITE通过条件系统提示污染技术,使LLM在特定查询下输出被篡改响应,同时保持正常输入的高实用性,且在黑盒环境下实现70%的F1降级。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23307 2026-04-28 cs.LG cs.AI 62%

CombiMOTS: Combinatorial Multi-Objective Tree Search for Dual-Target Molecule Generation

CombiMOTS:基于双靶分子生成的组合多目标树搜索

Thibaud Southiratn, Bonil Koo, Yijingxiu Lu, Sun Kim

机构 * Department of Computer Science and Engineering, Seoul National University, Seoul, Republic of Korea(首尔国立大学计算机科学与工程系) Interdisciplinary Program in Bioinformatics, Seoul National University, Seoul, Republic of Korea(首尔国立大学生物信息学跨学科项目) AIGENDRUG Co., Ltd., Seoul, Republic of Korea(AIGENDRUG公司) Interdisciplinary Program in Artificial Intelligence, Seoul National University, Seoul, Republic of Korea(首尔国立大学人工智能跨学科项目)

专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CombiMOTS,一种基于多目标树搜索的框架,用于生成双靶分子,通过向量优化约束平衡靶点亲和力与物理化学性质,实验表明其能生成高评分、多样化的双靶分子。

Comments Accepted as a poster at ICML 2025 (Main Track)

Journal ref Proceedings of the 42nd International Conference on Machine Learning, PMLR 267:56650-56691, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22937 2026-04-28 cs.CL cs.LG cs.PL 62%

AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs

AutoPyVerifier: 为大语言模型输出学习紧凑的可执行验证器

Pouya Pezeshkpour, Estevam Hruschka

机构 * Megagon Labs(梅加戈恩实验室)

专题命中 工具调用 :function calling(abstract);分类 cs.CL、cs.LG

AI总结 本文提出AutoPyVerifier框架,通过LLM生成候选验证器并利用DAG搜索优化,提升验证器集对目标任务的预测精度,实验表明在多个基准测试中性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.00931 2026-04-27 cs.AI cs.HC cs.LG 62%

Explanation through Reward Model Reconciliation using POMDP Tree Search

通过POMDP树搜索实现奖励模型协调以进行解释

Benjamin D. Kraske, Anshu Saksena, Anna L. Buczak, Zachary N. Sunberg

机构 * Department of Aerospace Engineering Sciences, University of Colorado Boulder(科罗拉多大学博尔德分校航空航天工程科学系) Applied Physics Laboratory, Johns Hopkins University(约翰霍普金斯大学应用物理实验室)

专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过POMDP树搜索协调算法与用户隐式奖励模型差异,以提升用户对AI系统的信任度。

Journal ref IEEE ICAA (2023), pg. 137-140

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01493 2026-04-24 cs.LG cs.AI 62%

OpInf-LLM: Parametric PDE Solving with LLMs via Operator Inference

OpInf-LLM:通过算子推断实现基于LLM的参数PDE求解

Zhuoyuan Wang, Hanjiang Hu, Xiyu Deng, Saviz Mowlavi, Yorie Nakahira

机构 * Carnegie Mellon University(卡内基梅隆大学) Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OpInf-LLM框架,利用少量解数据实现多样PDE实例的准确预测,支持自然语言任务指定和物理基础推理,降低计算需求并提高异构环境下的求解成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19821 2026-04-23 cs.AI cs.SE 62%

JTPRO: A Joint Tool-Prompt Reflective Optimization Framework for Language Agents

JTPRO:一种联合工具提示反思优化框架用于语言代理

Sandip Ghoshal, Anshul Mittal, Jyotika Singh, Miguel Ballesteros, Weiyi Sun, Fang Tu, Shailender Singh, Yassine Benajiba, Fahad Shah, Sujeeth Bharadwaj, Sujith Ravi, Dan Roth

机构 * Oracle AI

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.SE

AI总结 JTPRO通过迭代反思优化提升工具调用可靠性,通过联合优化全局指令和工具schema,提高多工具环境下的工具选择和参数填充准确性。

Comments Conference: ACL-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19749 2026-04-23 cs.AI cs.SE 62%

The Tool-Overuse Illusion: Why Does LLM Prefer External Tools over Internal Knowledge?

工具过度使用错觉:为什么大语言模型更倾向于使用外部工具而非内部知识?

Yirong Zeng, Shen You, Yufei Liu, Qunyao Du, Xiao Ding, Yutai Hou, Yuxian Wang, Wu Ning, Haonan Song, Dandan Tu, Bibo Cai, Ting Liu

机构 * Harbin Institute of Technology, SCIR(哈尔滨理工大学SCIR研究所) Peking University(北京大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 工具调用 :tool-use(abstract);分类 cs.AI、cs.SE

AI总结 本文揭示大语言模型在推理中普遍存在工具过度使用现象,通过分析内部知识可用性区域,提出知识感知边界对齐策略,减少工具使用82.8%,并发现仅以结果奖励会鼓励工具过度使用,通过平衡奖励信号可减少66.7%的无用工具调用。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16918 2026-04-21 cs.CL cs.LG 62%

Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning

具有新鲜度意识的优先经验回放用于LLM/VLM强化学习

Weiyu Ma, Yongcheng Zeng, Yan Song, Xinyu Cui, Jian Zhao, Xuhui Liu, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology(卡布尔大学科学与技术大学) Chinese Academy of Sciences, Institute of Automation(中国科学院自动化研究所) AI Centre, Department of Computer Science, University College London(伦敦大学学院人工智能中心) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究所)

专题命中 工具调用 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Freshness-Aware PER,通过引入指数衰减机制解决LLM/VLM强化学习中优先级过时问题,显著提升样本效率,在多个任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13961 2026-04-15 cs.CL cs.LG 62%

Olmo 3

Olmo 3:先进全开源语言模型家族

Team Olmo, :, Allyson Ettinger, Amanda Bertsch, Bailey Kuehl, David Graham, David Heineman, Dirk Groeneveld, Faeze Brahman, Finbarr Timbers, Hamish Ivison, Jacob Morrison, Jake Poznanski, Kyle Lo, Luca Soldaini, Matt Jordan, Mayee Chen, Michael Noukhovitch, Nathan Lambert, Pete Walsh, Pradeep Dasigi, Robert Berry, Saumya Malik, Saurabh Shah, Scott Geng, Shane Arora, Shashank Gupta, Taira Anderson, Teng Xiao, Tyler Murray, Tyler Romero, Victoria Graf, Akari Asai, Akshita Bhagia, Alexander Wettig, Alisa Liu, Aman Rangapur, Chloe Anastasiades, Costa Huang, Dustin Schwenk, Harsh Trivedi, Ian Magnusson, Jaron Lochner, Jiacheng Liu, Lester James V. Miranda, Maarten Sap, Malia Morgan, Michael Schmitz, Michal Guerquin, Michael Wilson, Regan Huff, Ronan Le Bras, Rui Xin, Rulin Shao, Sam Skjonsberg, Shannon Zejiang Shen, Shuyue Stella Li, Tucker Wilde, Valentina Pyatkin, Will Merrill, Yapei Chang, Yuling Gu, Zhiyuan Zeng, Ashish Sabharwal, Luke Zettlemoyer, Pang Wei Koh, Ali Farhadi, Noah A. Smith, Hannaneh Hajishirzi

机构 * Allen Institute for AI(Allen人工智能研究所) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Massachusetts Institute of Technology(麻省理工学院) University of Maryland(马里兰大学)

专题命中 工具调用 :function calling(abstract);分类 cs.CL、cs.LG

AI总结 Olmo 3是一款7B和32B参数规模的先进语言模型,专注于长上下文推理、函数调用、编程、指令遵循、通用聊天和知识回忆。

Comments minor edit updates

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11322 2026-04-14 cs.CL cs.AI 62%

Do LLMs Know Tool Irrelevance? Demystifying Structural Alignment Bias in Tool Invocations

LLMs是否了解工具无关性?解密工具调用中的结构对齐偏差

Yilong Liu, Xixun Lin, Pengfei Cao, Ge Zhang, Fang Fang, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Computer Science and Technology, Donghua University(东华大学计算机科学与技术学院)

专题命中 工具调用 :tool-use(abstract);分类 cs.AI、cs.CL

AI总结 本文研究LLMs在面对无关工具时的调用偏差,提出SABEval数据集和Contrastive Attention Attribution方法,揭示结构对齐偏差的成因并提出缓解策略。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01692 2026-04-14 cs.LG cs.AI 62%

Reasoning as Gradient: Scaling MLE Agents Beyond Tree Search

推理作为梯度:超越树搜索的MLE代理扩展

Yifei Zhang, Xu Yang, Xiao Yang, Bowen Xian, Qizheng Li, Shikai Fang, Jingyuan Li, Jian Wang, Mingrui Xu, Weiqing Liu, Jiang Bian

机构 * Nanjing University(南京大学) Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学) Zhejiang University(浙江大学) Wuhan University(武汉大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Gome,一种基于梯度优化的MLE代理,通过将结构化诊断推理映射到梯度计算,实现更高效的优化。实验显示,随着模型能力增强,梯度优化在前沿模型中表现更优,且在受限预算下达到35.1%的任何奖牌率。

Comments 36 pages, 6 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09001 2026-04-13 cs.AI cs.LG cs.LO 62%

Hypergraph Neural Networks Accelerate MUS Enumeration

超图神经网络加速MUS枚举

Hiroya Ijima, Koichiro Yawata

机构 * Hitachi, Ltd.(日立制作所)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于超图神经网络的领域无关方法,通过强化学习训练代理加速MUS枚举,减少可满足性检查次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07951 2026-04-10 quant-ph cs.AI cs.LG 62%

Investigation of Automated Design of Quantum Circuits for Imaginary Time Evolution Methods Using Deep Reinforcement Learning

量子虚时间演进方法中量子电路自动化设计的调查:利用深度强化学习

Ryo Suzuki, Shohei Watabe

机构 * Graduate School of Engineering and Science, Shibaura Institute of Technology(芝浦工业大学理工学研究科)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用深度强化学习的自动化框架,用于优化量子虚时间演进方法的电路设计,通过减少门数和深度提升硬件效率,实现更高效的量子算法设计。

Comments 11 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04373 2026-04-07 cs.AI cs.LG 62%

Decocted Experience Improves Test-Time Inference in LLM Agents

解毒经验提升LLM代理的测试时间推理

Maohao Shen, Kaiwen Zha, Zexue He, Zhang-Wei Hong, Siru Ouyang, J. Jon Ryu, Prasanna Sattigeri, Suhas Diggavi, Gregory Wornell

机构 * Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 工具调用 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文研究通过解毒经验提升LLM代理测试时间推理性能,探讨如何通过经验构建有效上下文以优化复杂推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04263 2026-04-07 cs.CY cs.AI cs.CL 62%

Commercial Persuasion in AI-Mediated Conversations

人工智能调解对话中的商业说服

Francesco Salvi, Alejandro Cuevas, Manoel Horta Ribeiro

机构 * Princeton University(普林斯顿大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究探讨了人工智能调解对话中商业说服的影响,发现基于LLM的说服使用户选择赞助产品率提高近三倍,且大多数参与者未能察觉促销倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.00797 2026-04-07 cs.AI cs.GT cs.LG cs.MA 62%

Combining Tree-Search, Generative Models, and Nash Bargaining Concepts in Game-Theoretic Reinforcement Learning

将树搜索、生成模型和纳什谈判概念结合在博弈论强化学习中

Zun Li, Marc Lanctot, Kevin R. McKee, Luke Marris, Ian Gemp, Daniel Hennes, Paul Muller, Kate Larson, Yoram Bachrach, Michael P. Wellman

机构 * Google DeepMind(谷歌DeepMind) University of Waterloo(滑铁卢大学) University of Michigan(密歇根大学)

专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于深度博弈论强化学习的多智能体训练框架,通过生成最佳响应算法GenBR和纳什谈判理论构建对手混合策略,提升在不完全信息域中的对手建模能力。

Comments Accepted by IJCAI'25 main track

Journal ref Proc. 34th Int. Joint Conf. Artif. Intell. (IJCAI 2025), pp. 161-169

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20755 2026-04-03 cs.LG cs.AI stat.ML 62%

Provable Benefits of In-Tool Learning for Large Language Models

大语言模型中工具学习的可证明优势

Sam Houliston, Ambroise Odonnat, Charles Arnal, Vivien Cabannes

机构 * ETH Zürich(苏黎世联邦理工学院) Inria, Univ. Rennes 2(法国国家信息与自动化研究所,雷恩第二大学) FAIR at Meta(Meta FAIR实验室)

专题命中 工具调用 :tool-use(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了工具学习在事实回忆中的优势,证明通过工具可实现无限制的事实回忆,优于单纯记忆。

Journal ref ICLR 2026 MemAgents Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏