arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 5059 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5059 篇

2606.04271 2026-06-04 cs.CV cs.AI 57%

StandardE2E: A Unified Framework for End-to-End Autonomous Driving Datasets

StandardE2E:端到端自动驾驶数据集的统一框架

Stepan Konev

机构 * University of Cambridge(剑桥大学)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 提出StandardE2E框架,通过统一数据模式、多数据集联合加载和简化新数据集添加流程,解决端到端自动驾驶数据集格式不兼容问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03318 2026-06-04 cs.CL 57%

Beyond Ideal Instruction: A Comprehensive Framework for Evaluating LLMs in Realistic Interactions

超越理想指令:现实交互中评估大语言模型的综合框架

Xuan Yang, Hao Xu, Tingfeng Hui, Hongsheng Xin, Kaike Zhang, Chunxiao Liu, Ning Miao

机构 * Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Hong Kong Institute of AI for Science, City University of Hong Kong(香港城市大学人工智能科学研究院) Li Auto Inc.(Li汽车公司) Beijing University of Posts and Telecommunications(北京邮电大学) Independent Researcher(独立研究员)

专题命中 工具调用 :tool-use(abstract);分类 cs.CL

AI总结 提出RUT-Bench基准,通过高保真模拟理想与非理想用户行为,评估大语言模型在现实工具调用场景中的表现,发现所有测试模型成功率低于40%且面对复杂非理想输入时性能显著下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.00727 2026-06-04 cs.RO cs.AI cs.SY eess.SY 57%

Closed-loop Bayesian Semantic Data Fusion for Collaborative Human-Autonomy Target Search

闭环贝叶斯语义数据融合用于协同人机目标搜索

Luke Burks, Ian Loefgren, Luke Barbier, Jeremy Muesing, Jamison McGinley, Sousheel Vunnam, Nisar Ahmed

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 本文提出一种闭环贝叶斯语义数据融合方法,通过CPOMDP规划生成最优轨迹,结合不完美传感器数据和人类提供的语义观察,提升动态目标搜索效率。

Comments Final version accepted and submitted to 2018 FUSION Conference (Cambridge, UK, July 2018)

详情

展开后加载摘要…

URL PDF HTML 收藏
1612.00221 2026-06-04 econ.GN cs.LG nlin.AO q-fin.EC 57%

The Coconut Model with Heterogeneous Strategies and Learning

带有异质策略和学习的椰子模型

Sven Banisch, Eckehard Olbrich

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 本文基于Diamond搜索均衡模型开发了基于代理的版本,探讨了异质适应性和适应性预期对非均衡轨迹的影响,并展示了系统收敛到原系统固定点的稳定性。

Comments Accepted for publication in the Journal of Artificial Societies and Social Simulation (JASSS)

详情

展开后加载摘要…

URL PDF HTML 收藏
1512.06789 2026-06-04 stat.ML cs.AI cs.SY eess.SY math.OC 57%

Information-Theoretic Bounded Rationality

信息论有界理性

Pedro A. Ortega, Daniel A. Braun, Justin Dyer, Kee-Eung Kim, Naftali Tishby

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 本文基于信息论提出有界理性的理论,通过自由能函数描述决策,具备控制解空间、精确蒙特卡洛规划及捕捉模型不确定性的特性,并扩展至序列决策。

Comments 47 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03804 2026-06-03 cs.LG 57%

Easy-to-Use Shielding for Reinforcement Learning

易于使用的强化学习屏蔽技术

Stefan Pranger, Bettina Könighofer

机构 * Institute of Information Security, Graz University of Technology(信息安全研究所,格拉茨技术大学)

专题命中 工具调用 :workflow(abstract);分类 cs.LG

AI总结 提出tempestpy库,将形式化屏蔽合成集成到Gymnasium API中,降低强化学习安全探索的门槛,并扩展了随机多人博弈的屏蔽算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03054 2026-06-03 cs.AI 57%

ToolGate: Token-Efficient Pre-Call Control for Tool-Augmented Vision-Language Agents

ToolGate: 面向工具增强视觉语言智能体的令牌高效预调用控制

Anjie Liu, Yan Song, Zhixun Chen, Ziqin Gong, Zhongwei Yu, Jun Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University College London(伦敦大学学院) AI Lab, The Yangtze River Delta(长江三角洲人工智能实验室)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 针对工具增强视觉语言智能体中工具调用成本高且不必要的问题,提出轻量级外部控制器ToolGate,通过轨迹文本和结构特征预测执行/跳过决策,在降低令牌成本的同时保持或提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24253 2026-06-03 cs.CV cs.AI cs.IR 57%

CRISP -- Clustering-Based Redundancy-Reduced Instance Sampling for Pathology Case Representation and Retrieval

CRISP -- 基于聚类的冗余减少实例采样用于病理病例表示与检索

Zahra Rahimi Afzal, Wataru Uegami, Saghir Alfasly, Wenchao Han, Saba Yasir, Judy C. Boughey, Matthew P. Goetz, Krishna R. Kalari, H. R. Tizhoosh

机构 * Kimia Lab, Department of Artificial Intelligence & Informatics, Mayo Clinic, Rochester, MN, USA(Kimia实验室,人工智能与信息学系,梅奥诊所,罗切斯特,明尼苏达州,美国) DICE Lab, Department of Electrical and Computer Engineering, University of Illinois Chicago, IL, USA(DICE实验室,电气与计算机工程系,伊利诺伊大学芝加哥分校,伊利诺伊州,美国) MD Kimia Lab, Department of Artificial Intelligence & Informatics, Mayo Clinic, Rochester, MN, USA(MD Kimia实验室,人工智能与信息学系,梅奥诊所,罗切斯特,明尼苏达州,美国) PhD Kimia Lab, Department of Artificial Intelligence & Informatics, Mayo Clinic, Rochester, MN, USA(PhD Kimia实验室,人工智能与信息学系,梅奥诊所,罗切斯特,明尼苏达州,美国) Division of Computational Pathology and Informatics, Mayo Clinic, Rochester, MN, USA(计算病理学与信息学部,梅奥诊所,罗切斯特,明尼苏达州,美国) Department of Laboratory Medicine and Pathology, Mayo Clinic, Rochester, MN, USA(实验室医学与病理学系,梅奥诊所,罗切斯特,明尼苏达州,美国) Department of Breast and Melanoma Surgical Oncology, Comprehensive Cancer Center, Mayo Clinic, Rochester, MN, USA(乳腺和黑色素瘤外科肿瘤学系,综合癌症中心,梅奥诊所,罗切斯特,明尼苏达州,美国) Department of Oncology, Comprehensive Cancer Center, Mayo Clinic, Rochester, MN, USA(肿瘤学系,综合癌症中心,梅奥诊所,罗切斯特,明尼苏达州,美国) PhD H.R. Tizhoosh

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 提出CRISP无监督框架,通过聚类和冗余减少采样整合病例内多张全切片图像,构建紧凑代表性补丁集用于病例级检索,在乳腺癌数据集上匹配或超越现有标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10387 2026-06-03 cs.DB cs.AI 57%

Test-Time Optimization of Physical Query Plans with LLMs

基于LLM的物理查询计划测试时优化

Mehmet Hamza Erol, Xiangpeng Hao, Federico Bianchi, Ciro Greco, Jacopo Tagliabue, James Zou

机构 * Stanford University(斯坦福大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) TogetherAI Bauplan

专题命中 工具调用 :workflow(abstract);分类 cs.AI

AI总结 提出DBPlanBench框架,利用LLM在测试时通过语义推理和进化搜索优化物理查询计划,在OLAP查询中实现1.05-1.12倍中位数加速,并支持小规模到大规模的迁移。

Comments Code is available at: https://github.com/BauplanLabs/DBPLANBENCH

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02418 2026-06-02 quant-ph cs.AI 57%

Evolutionary Discovery of Bivariate Bicycle Codes with LLM-Guided Search

基于LLM引导搜索的双变量自行车码的进化发现

Juan Cruz-Benito, Andrew W. Cross, David Kremer, Ismael Faro

机构 * IBM Research(IBM研究院) IBM T. J. Watson Research Center(IBM T.J. 巴特勒研究中心)

专题命中 工具调用 :workflow(abstract);分类 cs.AI

AI总结 提出一种LLM引导的进化工作流,通过变异生成双变量自行车码和扰动变体的Python程序,在约1650次迭代中筛选约2×10^5个候选码,发现了465个不同候选码,包括非CSS扰动码和CSS码,展示了LLM引导的程序进化在结构化量子码发现中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01425 2026-06-02 cs.LG 57%

Learning-based Directed Graph Abstraction of Combinatorial Spaces for Order-Preserving Search in Mixed-Combinatorial Nonlinear Optimization

基于学习的组合空间有向图抽象用于混合组合非线性优化中的保序搜索

Gishnu Madhu, Feng Liu, Souma Chowdhury

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Department of Mechanical and Aerospace Engineering(机械与航空航天工程系)

专题命中 工具调用 :planning(abstract);分类 cs.LG

AI总结 提出一种基于图神经网络的有向图抽象方法,将组合空间映射为有向图,以改进混合组合非线性规划问题的搜索效率。

Comments Accepted for presentation at 2026, ASME IDETC

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01188 2026-06-02 cs.HC cs.AI 57%

pcbGPT: Automatic PCB Schematic Synthesis from Natural Language Requirements

pcbGPT: 从自然语言需求自动合成PCB原理图

Tobias King, Steven Kehrberg, Michael Beigl, Tobias Röddiger

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Bosch Sensortec GmbH(博世传感器技术有限公司)

专题命中 工具调用 :workflow(abstract);分类 cs.AI

AI总结 提出pcbGPT系统,通过工具增强合成、组件库搜索、数据表知识、执行检查、结构语义验证和交互式工作流,从自然语言规格自动生成可编辑的KiCad原理图,在20个嵌入式任务上达到pass@1为0.90。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00315 2026-06-02 cs.AI cond-mat.mtrl-sci 57%

Coupling Language Models with Physics-based Simulation for Synthesis of Inorganic Materials

将语言模型与基于物理的模拟相结合用于无机材料的合成

Edward W. Staley, Tom Arbaugh, Michael Pekala, Alexander New, Christopher D. Stiles, Nam Q. Le, Gregory Bassen, Wyatt Bunstine, Tyrel McQueen

机构 * Johns Hopkins Applied Physics Laboratory(约翰霍普金斯应用物理实验室) Johns Hopkins University(约翰霍普金斯大学)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 提出一种结合热力学数据库与简化动力学模型的混合框架,评估大语言模型在无机材料合成规划中的表现,以铌氧体系为例证明其能生成更可行的合成策略。

Comments Accepted to the AI for Accelerated Materials Design (AI4Mat) Workshop at Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30961 2026-06-01 cs.CL 57%

EvoGens: A Population-Based Heuristic Search Framework for Scientific Idea Generation

EvoGens:一种基于种群的启发式搜索框架用于科学思想生成

Xu Li, Hanzhe Tu, Xinyi Li, Kuncheng Zhao, Xun Han, Zhonghui Liu

机构 * Southwest Petroleum University(西南石油大学) Sichuan Police College(四川警察学院)

专题命中 工具调用 :planning(abstract);分类 cs.CL

AI总结 针对现有LLM方法生成科学思想时语义趋同、多样性和新颖性不足的问题,提出EvoGens框架,通过进化搜索(变异、交叉、选择)增强思想探索,显著提升新颖性和多样性。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30563 2026-06-01 cs.AI 57%

Transforming and Encoding FTS for SAT Solving: What Helps, What Hurts (Extended Version)

转换与编码FTS以用于SAT求解:什么有帮助,什么有损害(扩展版)

João Filipe, Álvaro Torralba, Gregor Behnke

机构 * University of Amsterdam, Institute for Logic Language and Computation(阿姆斯特丹大学,逻辑语言与计算研究所) Aalborg University(奥尔堡大学)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 研究如何将因子化任务编码为SAT问题,提出多种编码策略,并分析并行性和任务转换对SAT规划器性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27881 2026-06-01 cs.CL 57%

Retrieval, Reward, and Training Protocols: What Matters in Training Search Agents?

检索、奖励与训练协议:训练搜索代理的关键因素是什么?

Yibo Zhao, Zichen Ding, Jiayi Wu, Zun Wang, Xiang Li

机构 * School of Data Science and Engineering, East China Normal University(东华大学数据科学与工程学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 工具调用 :agent(abstract);分类 cs.CL

AI总结 本文通过控制实验,系统研究了检索语料库、奖励设计和训练协议三个维度对搜索代理训练的影响,发现纠正语料覆盖问题比算法差异更有效,简单的基于结果的奖励方法在多数设置下表现优异,并提出了实用训练指南。

Comments 18pages, 4 figures, and 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23278 2026-06-01 cs.CL stat.ML 57%

When Is Next-Token Prediction Useful? Marginalization, Ergodicity, Mixture Identifiability, Local Sufficiency, RAG, Tools, and Programming

下一个词预测何时有用?边缘化、遍历性、混合可识别性、局部充分性、RAG、工具与编程

Francesco Corielli

专题命中 工具调用 :tool use(abstract);分类 cs.CL

AI总结 本文通过区分完整条件语言过程、边缘文本过程和模型诱导分布,论证了下一个词预测的有效性依赖于强假设(平稳性、代表性、遍历性)以及观察前缀对潜在上下文的充分性,并解释了RAG和工具使用作为条件充分性机制的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29675 2026-05-29 cs.HC cs.AI cs.IR 57%

From Prompts to Context: An Ontology-Driven Framework for Human-Generative AI Collaboration

从提示到上下文:一种面向人类-生成式AI协作的本体驱动框架

Ngoc Luyen Le, Marie-Hélène Abel, Bertrand Laforge

机构 * Gamaizer Université de technologie de Compiègne, CNRS, Heudiasyc(法国图尔学院、CNRS、Heudiasyc) Sorbonne Université, CNRS UMR 7585, LPMHE(索邦大学、CNRS UMR 7585、LPMHE)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出一种基于本体(CCAI)的框架,通过结构化建模任务、角色、资源和约束,将提示-响应交互转化为可查询的协作轨迹,以提升信息密集型工作流中的可追溯性和问责性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29270 2026-05-29 cs.AI 57%

Indexing the Unreadable: LLM-Native Recursive Construction and Search of Service Taxonomies

索引不可读之物:基于LLM原生的服务分类法递归构建与搜索

Wei Zheng, Yang Yan, Yiyang Shao, Jinyang Li, Zeze Chang, Yukuang Jia, Qiming Mao, Chihyung Wang, Jingbin Zhou

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 针对LLM在服务发现中因上下文窗口限制和长输入中间信息丢失问题,提出LLM原生的渐进式披露方案A2X,通过自动构建层次化服务分类法并在查询时逐层遍历,显著提升检索准确率并降低token消耗。

Comments Preprint. 8 pages main paper + appendix; 2 figures. Under submission to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29174 2026-05-29 cs.AI cs.CR 57%

Paper Agents, Paper Gains: An Empirical Analysis of DeFi Investment Agents

Paper Agents, Paper Gains: DeFi投资代理的实证分析

Jay Yu, Amy Zhao, Danning Sui

机构 * Pantera Capital(Pantera资本) Stanford University(斯坦福大学) IC3 Ava Labs(Ava实验室)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 通过分析1900多个AI加密项目、10个代表性代理和11个Solana代理金库,发现当前DeFi投资代理仍处于早期阶段,存在自主执行证据不足、代币持有者集体亏损、估值与基本面脱节等问题,并提出成熟度框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13519 2026-05-29 cs.CL 57%

ToolSpec: Accelerating Tool Calling via Schema-Aware and Retrieval-Augmented Speculative Decoding

ToolSpec: 通过模式感知与检索增强的推测解码加速工具调用

Heming Xia, Yongqi Li, Cunxiao Du, Mingbo Song, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Peking University(北京大学)

专题命中 工具调用 :tool use(abstract);分类 cs.CL

AI总结 针对工具调用延迟问题,提出一种基于模式感知和检索增强的推测解码方法ToolSpec,利用预定义工具模式生成准确草稿,并通过有限状态机交替填充确定性模式令牌和推测生成可变字段,同时检索历史调用复用草稿,实现最高4.2倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28814 2026-05-28 cs.CL 57%

Self-Improving Language Models with Bidirectional Evolutionary Search

具有双向进化搜索的自我改进语言模型

Guowei Xu, Zhenting Qi, Huangyuan Su, Weirui Ye, Himabindu Lakkaraju, Sham M. Kakade, Yilun Du

机构 * Harvard University(哈佛大学) MIT(麻省理工学院)

专题命中 工具调用 :agentic(abstract);分类 cs.CL

AI总结 提出双向进化搜索(BES)框架,通过前向候选进化与后向目标分解相结合,克服了传统搜索方法中稀疏验证信号和自回归扩展的局限,在训练后和推理时均显著提升语言模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28354 2026-05-28 cs.AI 57%

Plan Before Search: Search Agents Need Plan

搜索前先规划:搜索智能体需要规划

Zhipeng Qian, Zihan Liang, Yufei Ma, Ben Chen, Huangyu Dai, Jiayi Ji, Chenyi Lei, Wenwu Ou, Xiaoshuai Sun, Qibin Hou

机构 * Kuaishou Technology(快手科技) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学) VCIP, CS, Nankai University(南开大学VCIP实验室)

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 提出Plan方法,通过将问题分解为有序子问题再进行检索,并引入自举训练范式,无需外部强模型蒸馏即可在多跳QA中激活规划能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28168 2026-05-28 cs.AI 57%

OccuReward: LLM-Guided Occupant-Centric Reward Shaping for Demographic Equity in Grid-Interactive Buildings

OccuReward: 面向电网交互建筑中人口公平性的LLM引导的以 occupant 为中心的奖励塑造

Shadmehr Zaregarizi, Khashayar Yavari

机构 * Politecnico di Torino(都灵理工大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出OccuReward框架,利用大语言模型迭代塑造奖励函数,通过舒适公平指数(CEI)反馈,在CityLearn v2中提升不同人口群体的舒适公平性,同时降低能耗成本。

Comments 4 pages, 2 figures. Accepted at OccuSys 2026, co-located with ACM Sustainability Week 2026. Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27716 2026-05-28 cs.SE 57%

LLM Based Web Accessibility Repair: An Empirical Study of Detection, Remediation, and Cost

基于LLM的网页可访问性修复:检测、修复与成本的实证研究

Oluwatoyosi Oyelayo, Ghada Abushaqra, Parham Asadi, Durjoy Dey, Diego Elias Costa

专题命中 工具调用 :agent(abstract);分类 cs.SE

AI总结 本文通过实证研究评估基于大语言模型的智能体(Kimi K2.5)在网页可访问性自动检测与修复中的性能,发现其检测能力与规则工具相当但可靠性不足,修复在语法有效性上表现优异但完全修复率低,且迭代优化增加成本而无益,提出混合方法的需求。

Comments 12 pages, 6 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27610 2026-05-28 cs.IR cs.AI cs.HC 57%

Eliot: Interactively $\underline{E}$xploring Fast-Changing Scientific $\underline{Li}$terature Trends with $\underline{O}$nline Da$\underline{t}$a and Learning

Eliot: 通过在线数据和学习交互式探索快速变化的科学文献趋势

Bernardo A. Denkvitts, Nitin Gupta, Biplav Srivastava

机构 * University of South Carolina(南卡罗来纳大学)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 提出Eliot系统,通过查询时聚类和时间可视化,帮助研究人员可追溯地探索快速变化的科学文献趋势。

Comments Under-review at CIKM Applied Research 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12586 2026-05-28 cs.AI 57%

Can I Have Your Order? Monte-Carlo Tree Search for Slot Filling Ordering in Diffusion Language Models

能给我你的订单吗?扩散语言模型中插槽填充顺序的蒙特卡洛树搜索

Joshua Ong Jun Leang, Yu Zhao, Mihaela Cătălina Stoian, Wenda Li, Shay B. Cohen, Eleonora Giunchiglia

机构 * Imperial College London(帝国理工学院伦敦分校) University of Edinburgh(爱丁堡大学)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 针对掩码扩散模型(MDM)中计划-填充解码对插槽填充顺序敏感的问题,提出McDiffuSE框架,利用蒙特卡洛树搜索(MCTS)优化生成顺序,平均性能提升3.2%,在MBPP和MATH500上分别提升19.5%和4.9%。

Comments 8 pages, ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27333 2026-05-27 cs.CL 57%

FinHarness: An Inline Lifecycle Safety Harness for Finance LLM Agents

FinHarness:面向金融LLM代理的内联生命周期安全约束框架

Haoxuan Jia, Yang Liu, Bin Chong, Yingguang Yang, Yancheng Chen, Jiayu Liang, Qian Li, Hanning Lu, Kefu Xu, Hao Zheng, Chongyang Zhang, Hao Peng, Philip S. Yu

机构 * Peking University(北京大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学) Soochow University(苏州大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Leeds(利兹大学) Fullive Innovation (Beijing) AI Technology Co., Ltd.(全维创新(北京)人工智能科技有限公司) Beihang University(北京航空航天大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 工具调用 :agent(abstract);分类 cs.CL

AI总结 针对金融LLM代理在阻止提示诱导的未授权操作与批准合法多步骤业务流程之间的冲突,提出FinHarness内联安全约束框架,通过查询监控、工具监控和级联模块实现逐步骤风险评估与自适应验证,显著降低攻击成功率并保持良性批准率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25988 2026-05-26 cs.CL 57%

What Makes a Medical Checker Trainable? Diagnosing Signal Collapse and Reward Hacking in Checker-Guided RAG for Biomedical QA

什么使医学检查器可训练?诊断生物医学问答中检查器引导的RAG中的信号崩溃和奖励黑客

Yuelyu Ji, Min Gu Kwak, Hang Zhang, Xizhi Wu, Chenyu Li, Yanshan Wan

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 工具调用 :agent(abstract);分类 cs.CL

AI总结 本文通过比较四种NLI检查器作为GRPO训练的医学RAG代理的过程奖励,诊断了信号崩溃和奖励黑客现象,发现检查器的输出分布而非保留准确率决定了其是否提供可训练梯度,并提出了验证器作为奖励系统的边界条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19113 2026-05-26 cs.AI 57%

Hybrid Deep Searcher: Scalable Parallel and Sequential Search Reasoning

混合深度搜索器:可扩展的并行与顺序搜索推理

Dayoon Ko, Jihyuk Kim, Haeju Park, Sohyeon Kim, Dahyun Lee, Yongrae Jo, Gunhee Kim, Moontae Lee, Kyungjae Lee

机构 * Seoul National University(首尔国立大学) LG AI Research(LG AI研究) University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Seoul(首尔大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出混合搜索策略HybridDeepSearcher,通过并行查询扩展与显式证据聚合结合顺序推理,在多个基准上显著提升性能并实现测试时搜索扩展。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏