arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 93044 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5059 篇

2508.05614 2026-05-29 cs.CL cs.AI 62%

GroundAct: Can LLM Agents Ground Actions in Environmental States?

GroundAct:LLM智能体能否在环境状态中实现动作落地?

Zixuan Wang, Dingming Li, Hongxing Li, Yanrui Miao, Shuo Chen, Yuchen Yan, Wenqi Zhang, Yongliang Shen, Weiming Lu, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学)

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出GroundAct基准,通过1500个场景和16592个任务实例评估15个LLM,发现动作落地能力是多维挑战,不能仅通过模型规模解决。

Comments Project Page: https://zju-real.github.io/OmniEmbodied Code: https://github.com/ZJU-REAL/OmniEmbodied

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22511 2026-05-27 cs.AI cs.CL cs.IR 62%

Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning

Search-E1: 自蒸馏驱动搜索增强推理中的自我进化

Zihan Liang, Yufei Ma, Ben Chen, Zhipeng Qian, Xuxin Zhang, Huangyu Dai, Lingtao Mao

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出Search-E1方法,通过交替使用普通GRPO和在线策略自蒸馏(OPSD),让搜索增强智能体无需外部监督或复杂模块即可自我进化,在七个QA基准上以3B模型超越所有开源基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25832 2026-05-26 cs.RO cs.AI cs.CL cs.CV 62%

When Search Becomes Memory: Turning Robot Design Trials into Transferable Skills

当搜索成为记忆:将机器人设计试验转化为可迁移技能

Yunfei Wang, Xiaohao Xu, Yang Li, Xiaonan Huang

机构 * University of Michigan(密歇根大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出Auto-Robotist,一种自进化LLM代理,通过将形态搜索轨迹提炼为自然语言技能库,实现可迁移的机器人设计知识,在EvoGym任务中提升冷启动搜索并跨设计空间迁移技能。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25749 2026-05-26 cs.IR cs.AI cs.LG 62%

DeGRe: Dense-supervised Generative Reranking for Recommendation

DeGRe: 密集监督的生成式重排序用于推荐

Chaotian Song, Jingyao Zhang, Chenghao Chen, Zisen Sang, Dehai Zhao, Guodong Cao, Boxi Wu, Deng Cai, Jia Jia

机构 * College of Software, Zhejiang University Hangzhou China Rajax Network Technology, Taobao Shangou of Alibaba Hangzhou China Rajax Network Technology, Taobao Shangou of Alibaba Beijing China State Key Lab of CAD\&CG, Zhejiang University Hangzhou China Rajax Network Technology, Taobao Shangou of Alibaba Shanghai China College of Software, Zhejiang University Rajax Network Technology, Taobao Shangou of Alibaba State Key Lab of CAD\&CG, Zhejiang University

专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出DeGRe框架,通过离线探索中的密集监督信号(Lookahead Evaluator)指导在线生成器(Online Generator)进行单步贪婪解码,解决重排序中的启发式标签偏差和信用分配问题。

Comments Accepted to KDD 2026 (ADS Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23655 2026-05-25 cs.CV cs.AI cs.LG cs.MM 62%

CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception

CVSearch:赋予多模态大语言模型认知视觉搜索能力以感知高分辨率图像

Liupeng Li, Haoqian Kang, Zhenyu Lu, Jinpeng Wang, Bin Chen, Ke Chen, Yaowei Wang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究院)

专题命中 工具调用 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出CVSearch,一种无需训练的自适应框架,通过评估-搜索工作流动态调度视觉搜索策略,解决高分辨率图像感知中覆盖与效率的权衡问题。

Comments Accepted by ICML 2026. 22 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22880 2026-05-25 cs.CL cs.AI cs.CY 62%

How Far Will They Go? Red-Teaming Online Influence with Large Language Models

它们会走多远?使用大型语言模型对在线影响力进行红队测试

Daniel C. Ruiz, Anna Serbina, Ashwin Rao, Emilio Ferrara, Luca Luceri

机构 * Information Sciences Institute University of Southern California(信息科学研究所 乌德穆尔特国立大学)

专题命中 工具调用 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一个红队测试框架,通过测量大型语言模型在争议话题上的政治观点表达范围(Overton Window),并量化简单自然语言越狱如何扩展该范围,发现开源LLM在政治表达上存在系统性不对称,且越狱效果因模型系列而异。

Comments 30 pages, 8 figures, submitted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22733 2026-05-22 cs.AI cs.SE 62%

HarnessAPI: A Skill-First Framework for Unified Streaming APIs and MCP Tools

HarnessAPI: 一种以技能为中心的统一流式API和MCP工具框架

Edwin Jose

机构 * Department of Computer Science(计算机科学系)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出HarnessAPI,一种以技能为中心的框架,通过将类型化的技能文件夹作为单一真相源,消除了流式API和MCP工具之间的重复代码,减少了74%的框架层面的样板代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21405 2026-05-21 cs.SE cs.AI cs.PL 62%

Stdlib or Third-Party? Empirical Performance and Correctness of LLM-Assisted Zero-Dependency Python Libraries

标准库还是第三方?LLM辅助零依赖Python库的实证性能和正确性

Peng Ding, Rick Stevens

机构 * University of Chicago(芝加哥大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文通过零依赖项目探讨了仅使用Python标准库能否替代第三方库,并评估了LLM在严格约束下生成正确且高性能代码的能力。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16609 2026-05-19 cs.LG cs.AI cs.CC cs.DS 62%

Prior Knowledge Makes It Possible: From Sublinear Graph Algorithms to LLM Test-Time Methods

先验知识使其成为可能:从次线性图算法到LLM测试时方法

Avrim Blum, Daniel Hsu, Cyrus Rashtchian, Donya Saless

机构 * Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Columbia University(哥伦比亚大学) Google Research(谷歌研究)

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了测试时增强方法中先验知识与外部信息交互的理论基础,通过将多步推理建模为知识图中的s-t连通性问题,揭示了在部分先验知识下,测试时增强步骤数量与图结构之间的关系,发现当知识图中存在小组件时,增强步骤数呈平方根增长,而当知识密度超过阈值形成大组件时,增强步骤数趋于常数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17162 2026-05-19 cs.AI cs.LG 62%

From Imitation to Interaction: Mastering Game of Schnapsen with Shallow Reinforcement Learning

从模仿到交互:利用浅层强化学习掌握斯纳普森游戏

Ján Klačan, Sizhong Zhang

机构 * Vrije Universiteit Amsterdam(弗里兹大学阿姆斯特丹)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究浅层神经网络代理是否能掌握纸牌游戏斯纳普森,并挑战使用蒙特卡洛采样和前瞻搜索的强搜索基线RdeepBot。通过逐步更复杂的实验设计,首先评估了基于回放数据训练的监督学习代理(MLPBot)以及通过异步蒙特卡洛更新和经验回放训练的强化学习代理(RLBot)。结果表明,监督模仿不足以击败强RdeepBot对手,而强化学习产生了更强的代理。在聚焦RdeepBot深度参数的设置中,最佳性能是在学习的价值函数与游戏过程中更深层次的前瞻搜索结合时实现的,使RLBot在最强的RdeepBot基线下实现了统计显著更高的胜率。在基于样本的设置中,收益更具条件性:最强性能出现在相对较低的训练num_samples参数下,而不是随着更强采样均匀增加。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00712 2026-05-19 cs.LG cs.AI 62%

JSON-Bag: A generic game trajectory representation

JSON-Bag:一种通用的游戏轨迹表示方法

Dien Nguyen, Diego Perez-Liebana, Simon Lucas

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出JSON-Bag模型,通过分词JSON描述并使用Jensen-Shannon距离衡量游戏轨迹,验证了其在六个桌面游戏中对玩家、参数和种子分类的有效性,优于基线方法并提升了准确性。

Comments 8 pages, 3 figures, 6 tables, published in IEEE Conference on Games 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01242 2026-05-14 cs.CV cs.AI cs.CL 62%

When Diffusion Breaks Constraints: Sequential Autoregressive Generation with RL and MCTS

当扩散模型失效约束:通过强化学习和MCTS的序列自回归生成

Zirui Zhao, Boye Niu, Harold Soh, David Hsu, Wee Sun Lee

机构 * Salesforce AI Research(Salesforce人工智能研究) University of Sydney(悉尼大学) National University of Singapore(新加坡国立大学)

专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.CL

AI总结 本文研究了扩散模型在约束生成任务中的失效模式,通过拼图生成和简化矩形组合任务,发现扩散模型难以满足约束,提出基于自回归序列生成的约束意识生成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09168 2026-05-12 cs.AI cs.LG 62%

CIVeX: Causal Intervention Verification for Language Agents

CIVeX:语言代理的因果干预验证

Fabio Rovai

机构 * The Tesseract Academy(泰塞克特学院)

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.LG

AI总结 CIVeX通过结构因果查询验证语言代理的干预行动,解决因果效应识别问题,实验显示其在对抗性混淆下具有高准确性和可靠性。

Comments 16 pages, 3 figures. Includes Causal-ToolBench, IHDP, ZOZO Open Bandit, and LaLonde NSW evaluations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08887 2026-05-12 cs.AI cs.CL 62%

Ace-Skill: Bootstrapping Multimodal Agents with Prioritized and Clustered Evolution

Ace-Skill:通过优先级和聚类进化提升多模态智能体

Feng Xiong, Zengbin Wang, Yong Wang, Xuecai Hu, Jinghan He, Liang Lin, Yuan Liu, Xiangxiang Chu

机构 * AMAP, Alibaba Group(阿里集团AMAP) CASIA BNU(北华大学)

专题命中 工具调用 :tool-use(abstract);分类 cs.AI、cs.CL

AI总结 Ace-Skill通过优先级采样和聚类组织优化多模态智能体的自我进化过程,提升信息获取效率和知识检索可靠性,实现自我强化的良性循环,提升多模态工具使用任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08368 2026-05-12 cs.AI cond-mat.stat-mech cs.LG 62%

On Distinguishing Capability Elicitation from Capability Creation in Post-Training: A Free-Energy Perspective

在训练后区分能力激发与能力创造:从自由能视角出发

Yuhao Li, Shengchao Liu

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.LG

AI总结 本文从自由能视角出发,区分训练后的能力激发与能力创造,通过引入可及支持的概念,探讨训练过程对行为概率和可达行为空间的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10880 2026-05-11 cs.CR cs.AI cs.CL 62%

Searching for Privacy Risks in LLM Agents via Simulation

通过模拟搜索LLM代理中的隐私风险

Yanzhe Zhang, Diyi Yang

机构 * Georgia Tech(佐治亚理工学院) Stanford University(斯坦福大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出通过模拟搜索改进攻击与防御策略,发现攻击策略从直接请求演变为伪装和伪造同意等复杂手段,防御策略从规则约束升级为身份验证状态机,为隐私安全代理发展提供洞察。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07462 2026-05-11 cs.CL cs.AI 62%

The Moltbook Files: A Harmless Slopocalypse or Humanity's Last Experiment

Moltbook Files:一场无害的混乱还是人类的最后实验

William Brach, Federico Torrielli, Stine Lyngsø Beltoft, Annemette Brok Pirchert, Peter Schneider-Kamp, Lukas Galke Poech

机构 * Slovak University of Technology(斯洛伐克技术大学) University of Turin(都灵大学) University of Southern Denmark(南部丹麦大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究Moltbook平台上的群体行为,通过分析232k篇帖子和2.2M条评论,发现其数据对语言模型的影响,发现微调后真实性下降,但Reddit数据集也产生类似效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15189 2026-05-11 cs.IR cs.AI cs.CL 62%

ScrapeGraphAI-100k: Dataset for Schema-Constrained LLM Generation

ScrapeGraphAI-100k:用于模式约束LLM生成的数据集

William Brach, Francesco Zuppichini, Marco Vinciguerra, Lorenzo Padoan

机构 * Slovak University of Technology(斯洛伐克技术大学) ScrapeGraphAI

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.CL

AI总结 本文提出ScrapeGraphAI-100k数据集,包含93695个模式约束提取事件,通过真实用户数据和结构化标注,用于评估LLM在模式约束下的生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02805 2026-05-11 cs.CL cs.AI 62%

MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning

MemSearcher:通过端到端强化学习训练LLM进行推理、搜索和管理内存

Qianhao Yuan, Jie Lou, Zichao Li, Jiawei Chen, Yaojie Lu, Hongyu Lin, Le Sun, Debing Zhang, Xianpei Han

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所信息处理实验室,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Xiaohongshu Inc(小红书公司)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 MemSearcher通过端到端强化学习训练LLM进行推理、搜索和内存管理,通过维护紧凑的记忆在多轮交互中保持上下文长度稳定,优于基于历史拼接的基线方法。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27685 2026-05-01 cond-mat.mtrl-sci cs.AI cs.LG physics.comp-ph 62%

VibroML: an automated toolkit for high-throughput vibrational analysis and dynamic instability remediation of crystalline materials using machine-learned potentials

VibroML:一种用于晶体材料高通量振动分析及动态不稳定性修复的自动化工具包

Rogério Almeida Gouvêa, Gian-Marco Rignanese

机构 * WEL Research Institute(WEL研究机构)

专题命中 工具调用 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 VibroML通过机器学习势能函数自动修复晶体材料的动态不稳定性,结合遗传算法和分子动力学模拟,发现多种动态稳定的多形体,并利用ProtoCSP预测稳定晶体结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16888 2026-04-28 cs.CR cs.AI cs.CL 62%

PARASITE: Conditional System Prompt Poisoning to Hijack LLMs

PARASITE: 条件系统提示污染以劫持大语言模型

Viet Pham, Thai Le

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 PARASITE通过条件系统提示污染技术,使LLM在特定查询下输出被篡改响应,同时保持正常输入的高实用性,且在黑盒环境下实现70%的F1降级。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23307 2026-04-28 cs.LG cs.AI 62%

CombiMOTS: Combinatorial Multi-Objective Tree Search for Dual-Target Molecule Generation

CombiMOTS:基于双靶分子生成的组合多目标树搜索

Thibaud Southiratn, Bonil Koo, Yijingxiu Lu, Sun Kim

机构 * Department of Computer Science and Engineering, Seoul National University, Seoul, Republic of Korea(首尔国立大学计算机科学与工程系) Interdisciplinary Program in Bioinformatics, Seoul National University, Seoul, Republic of Korea(首尔国立大学生物信息学跨学科项目) AIGENDRUG Co., Ltd., Seoul, Republic of Korea(AIGENDRUG公司) Interdisciplinary Program in Artificial Intelligence, Seoul National University, Seoul, Republic of Korea(首尔国立大学人工智能跨学科项目)

专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CombiMOTS,一种基于多目标树搜索的框架,用于生成双靶分子,通过向量优化约束平衡靶点亲和力与物理化学性质,实验表明其能生成高评分、多样化的双靶分子。

Comments Accepted as a poster at ICML 2025 (Main Track)

Journal ref Proceedings of the 42nd International Conference on Machine Learning, PMLR 267:56650-56691, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22937 2026-04-28 cs.CL cs.LG cs.PL 62%

AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs

AutoPyVerifier: 为大语言模型输出学习紧凑的可执行验证器

Pouya Pezeshkpour, Estevam Hruschka

机构 * Megagon Labs(梅加戈恩实验室)

专题命中 工具调用 :function calling(abstract);分类 cs.CL、cs.LG

AI总结 本文提出AutoPyVerifier框架,通过LLM生成候选验证器并利用DAG搜索优化,提升验证器集对目标任务的预测精度,实验表明在多个基准测试中性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.00931 2026-04-27 cs.AI cs.HC cs.LG 62%

Explanation through Reward Model Reconciliation using POMDP Tree Search

通过POMDP树搜索实现奖励模型协调以进行解释

Benjamin D. Kraske, Anshu Saksena, Anna L. Buczak, Zachary N. Sunberg

机构 * Department of Aerospace Engineering Sciences, University of Colorado Boulder(科罗拉多大学博尔德分校航空航天工程科学系) Applied Physics Laboratory, Johns Hopkins University(约翰霍普金斯大学应用物理实验室)

专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过POMDP树搜索协调算法与用户隐式奖励模型差异,以提升用户对AI系统的信任度。

Journal ref IEEE ICAA (2023), pg. 137-140

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01493 2026-04-24 cs.LG cs.AI 62%

OpInf-LLM: Parametric PDE Solving with LLMs via Operator Inference

OpInf-LLM:通过算子推断实现基于LLM的参数PDE求解

Zhuoyuan Wang, Hanjiang Hu, Xiyu Deng, Saviz Mowlavi, Yorie Nakahira

机构 * Carnegie Mellon University(卡内基梅隆大学) Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OpInf-LLM框架,利用少量解数据实现多样PDE实例的准确预测,支持自然语言任务指定和物理基础推理,降低计算需求并提高异构环境下的求解成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19821 2026-04-23 cs.AI cs.SE 62%

JTPRO: A Joint Tool-Prompt Reflective Optimization Framework for Language Agents

JTPRO:一种联合工具提示反思优化框架用于语言代理

Sandip Ghoshal, Anshul Mittal, Jyotika Singh, Miguel Ballesteros, Weiyi Sun, Fang Tu, Shailender Singh, Yassine Benajiba, Fahad Shah, Sujeeth Bharadwaj, Sujith Ravi, Dan Roth

机构 * Oracle AI

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.SE

AI总结 JTPRO通过迭代反思优化提升工具调用可靠性,通过联合优化全局指令和工具schema,提高多工具环境下的工具选择和参数填充准确性。

Comments Conference: ACL-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19749 2026-04-23 cs.AI cs.SE 62%

The Tool-Overuse Illusion: Why Does LLM Prefer External Tools over Internal Knowledge?

工具过度使用错觉:为什么大语言模型更倾向于使用外部工具而非内部知识?

Yirong Zeng, Shen You, Yufei Liu, Qunyao Du, Xiao Ding, Yutai Hou, Yuxian Wang, Wu Ning, Haonan Song, Dandan Tu, Bibo Cai, Ting Liu

机构 * Harbin Institute of Technology, SCIR(哈尔滨理工大学SCIR研究所) Peking University(北京大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 工具调用 :tool-use(abstract);分类 cs.AI、cs.SE

AI总结 本文揭示大语言模型在推理中普遍存在工具过度使用现象,通过分析内部知识可用性区域,提出知识感知边界对齐策略,减少工具使用82.8%,并发现仅以结果奖励会鼓励工具过度使用,通过平衡奖励信号可减少66.7%的无用工具调用。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16918 2026-04-21 cs.CL cs.LG 62%

Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning

具有新鲜度意识的优先经验回放用于LLM/VLM强化学习

Weiyu Ma, Yongcheng Zeng, Yan Song, Xinyu Cui, Jian Zhao, Xuhui Liu, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology(卡布尔大学科学与技术大学) Chinese Academy of Sciences, Institute of Automation(中国科学院自动化研究所) AI Centre, Department of Computer Science, University College London(伦敦大学学院人工智能中心) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究所)

专题命中 工具调用 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Freshness-Aware PER,通过引入指数衰减机制解决LLM/VLM强化学习中优先级过时问题,显著提升样本效率,在多个任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13961 2026-04-15 cs.CL cs.LG 62%

Olmo 3

Olmo 3:先进全开源语言模型家族

Team Olmo, :, Allyson Ettinger, Amanda Bertsch, Bailey Kuehl, David Graham, David Heineman, Dirk Groeneveld, Faeze Brahman, Finbarr Timbers, Hamish Ivison, Jacob Morrison, Jake Poznanski, Kyle Lo, Luca Soldaini, Matt Jordan, Mayee Chen, Michael Noukhovitch, Nathan Lambert, Pete Walsh, Pradeep Dasigi, Robert Berry, Saumya Malik, Saurabh Shah, Scott Geng, Shane Arora, Shashank Gupta, Taira Anderson, Teng Xiao, Tyler Murray, Tyler Romero, Victoria Graf, Akari Asai, Akshita Bhagia, Alexander Wettig, Alisa Liu, Aman Rangapur, Chloe Anastasiades, Costa Huang, Dustin Schwenk, Harsh Trivedi, Ian Magnusson, Jaron Lochner, Jiacheng Liu, Lester James V. Miranda, Maarten Sap, Malia Morgan, Michael Schmitz, Michal Guerquin, Michael Wilson, Regan Huff, Ronan Le Bras, Rui Xin, Rulin Shao, Sam Skjonsberg, Shannon Zejiang Shen, Shuyue Stella Li, Tucker Wilde, Valentina Pyatkin, Will Merrill, Yapei Chang, Yuling Gu, Zhiyuan Zeng, Ashish Sabharwal, Luke Zettlemoyer, Pang Wei Koh, Ali Farhadi, Noah A. Smith, Hannaneh Hajishirzi

机构 * Allen Institute for AI(Allen人工智能研究所) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Massachusetts Institute of Technology(麻省理工学院) University of Maryland(马里兰大学)

专题命中 工具调用 :function calling(abstract);分类 cs.CL、cs.LG

AI总结 Olmo 3是一款7B和32B参数规模的先进语言模型,专注于长上下文推理、函数调用、编程、指令遵循、通用聊天和知识回忆。

Comments minor edit updates

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11322 2026-04-14 cs.CL cs.AI 62%

Do LLMs Know Tool Irrelevance? Demystifying Structural Alignment Bias in Tool Invocations

LLMs是否了解工具无关性?解密工具调用中的结构对齐偏差

Yilong Liu, Xixun Lin, Pengfei Cao, Ge Zhang, Fang Fang, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Computer Science and Technology, Donghua University(东华大学计算机科学与技术学院)

专题命中 工具调用 :tool-use(abstract);分类 cs.AI、cs.CL

AI总结 本文研究LLMs在面对无关工具时的调用偏差,提出SABEval数据集和Contrastive Attention Attribution方法,揭示结构对齐偏差的成因并提出缓解策略。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏