arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 5047 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5047 篇

2604.11790 2026-05-12 cs.CR cs.AI 70%

ClawGuard: A Runtime Security Framework for Tool-Augmented LLM Agents Against Indirect Prompt Injection

ClawGuard:一种用于对抗间接提示注入的工具增强LLM代理运行时安全框架

Wei Zhao, Zhe Li, Peixin Zhang, Jun Sun

机构 * Singapore Management University(新加坡国立管理学院)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 ClawGuard通过在工具调用边界实施用户确认规则集,有效阻止间接提示注入攻击,无需修改模型或基础设施,实验显示其在多个基准测试中均能提供可靠保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09932 2026-05-12 cs.CL 70%

FocuSFT: Bilevel Optimization for Dilution-Aware Long-Context Fine-Tuning

FocuSFT:基于稀释意识的长上下文微调的双层优化

Zehua Pei, Hui-Ling Zhen, Xianzhi Yu, Sinno Jialin Pan, Mingxuan Yuan, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.CL

AI总结 FocuSFT通过双层优化框架解决长上下文微调中注意力稀释问题,提升模型在长上下文下的准确性和表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04323 2026-05-11 cs.LG cs.DB 70%

LUCAS-MEGA: A Large-Scale Multimodal Dataset for Representation Learning in Soil-Environment Systems

LUCAS-MEGA:一个大规模多模态数据集,用于土壤-环境系统的表示学习

Kuangdai Leng, Simon Jeffery, Panos Panagos, Tarje Nissen-Meyer

机构 * Earth Rover Program(Earth Rover项目) Centre for Crop and Environmental Science(作物与环境科学中心) European Commission Joint Research Centre(欧盟联合研究中心) Department of Mathematics and Statistics & Center for Environmental Intelligence(数学与统计系及环境智能中心)

专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 LUCAS-MEGA通过系统数据融合构建了大规模多模态数据集,用于提升土壤-环境系统的表示学习能力,通过SoilFuser管道标准化数据并生成统一特征空间,预训练SoilFormer模型实现了稳定的训练和预测性能。

Comments 27 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20146 2026-04-23 cs.IR cs.CL 70%

SAKE: Self-aware Knowledge Exploitation-Exploration for Grounded Multimodal Named Entity Recognition

SAKE: 为基于地面的多模态命名实体识别的自我意识知识利用-探索

Jielong Tang, Xujie Yuan, Jiayang Liu, Jianxing Yu, Xiao Dong, Lin Chen, Yunlai Teng, Shimin Di, Jian Yin

机构 * Sun Yat-sen University(中山大学) Shandong Normal University(山东师范大学) University of the Chinese Academy of Sciences(中国科学院大学) Southeast University(东南大学)

专题命中 工具调用 :tool-use(abstract);agentic(abstract);分类 cs.CL

AI总结 针对开放世界社交媒体平台中长尾、快速演变和未见实体的挑战,SAKE提出一种端到端代理框架,通过自我意识推理和自适应搜索工具调用,结合内部知识利用和外部知识探索,提升多模态命名实体识别的精度与鲁棒性。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20144 2026-04-23 cs.CL 70%

Trajectory2Task: Training Robust Tool-Calling Agents with Synthesized Yet Verifiable Data for Complex User Intents

轨迹到任务:通过合成且可验证的数据训练鲁棒的工具调用代理以应对复杂用户意图

Ziyi Wang, Yuxuan Lu, Yimeng Zhang, Pei Chen, Ziwei Dong, Jing Huang, Jiri Gesi, Xianfeng Tang, Chen Luo, Qun Liu, Yisi Sang, Hanqing Lu, Manling Li, Jin Lai, Dakuo Wang

机构 * Northeastern University(东北大学) Amazon(亚马逊) Northwestern University(西北大学)

专题命中 工具调用 :tool use(abstract);tool-use(abstract);分类 cs.CL

AI总结 本文提出Trajectory2Task方法,通过合成可验证数据提升工具调用代理在复杂用户意图下的鲁棒性,通过多轮探索生成有效工具调用轨迹,并转换为可验证任务,最终在七种先进LLM上验证了改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18976 2026-04-22 cs.CL 70%

STAR-Teaming: A Strategy-Response Multiplex Network Approach to Automated LLM Red Teaming

STAR-Teaming:一种基于策略-响应多plex网络的自动化LLM红队方法

MinJae Jung, YongTaek Lim, Chaeyun Kim, Junghwan Kim, Kihyun Kim, Minwoo Kim

机构 * DATUMO INC(DATUMO公司)

专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出STAR-Teaming,一种基于多plex网络的自动化红队方法,通过网络驱动优化生成有效攻击策略,提升LLM策略漏洞的可解释性并降低计算成本。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15690 2026-04-21 cs.AI stat.AP 70%

From Passive Metric to Active Signal: The Evolving Role of Uncertainty Quantification in Large Language Models

从被动度量到主动信号:不确定性量化在大语言模型中的演变角色

Jiaxin Zhang, Wendi Cui, Zhuohang Li, Lifu Huang, Bradley Malin, Caiming Xiong, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce AI研究院) Intuit(Intuit公司) Vanderbilt University(范德比大学) University of California, Davis(加州大学戴维斯分校) Vanderbilt University Medical Center(范德比大学医学中心)

专题命中 工具调用 :autonomous agent(abstract);tool use(abstract);分类 cs.AI

AI总结 本文探讨大语言模型中不确定性量化从被动诊断指标到主动控制信号的演变,分析其在高级推理、自主代理和强化学习中的应用及贡献。

Comments This paper has been accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15597 2026-04-20 cs.CL cs.HC 70%

LLMs Corrupt Your Documents When You Delegate

当您委托时,大型语言模型会破坏您的文档

Philippe Laban, Tobias Schnabel, Jennifer Neville

机构 * Microsoft Research(微软研究院)

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.CL

AI总结 研究发现,当前LLM在委托工作中会破坏文档,即使前沿模型也平均破坏25%的内容,文档大小和交互长度加剧了这一问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20633 2026-04-20 cs.AI 70%

Seed1.8 Model Card: Towards Generalized Real-World Agency

Seed1.8 模型卡:迈向通用的现实世界代理

Bytedance Seed

机构 * Bytedance Seed(字节跳动Seed)

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 Seed1.8 模型旨在实现通用的现实世界代理能力,支持多轮交互、工具使用和多步骤执行,同时保持大语言模型和视觉语言性能,并提供统一的代理接口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07043 2026-04-20 cs.LG 70%

COMPASS: Benchmarking Constrained Optimization in LLM Agents

COMPASS:评估LLM代理在约束优化中的表现

Tian Qin, Felix Bai, Ting-Yao Hu, Raviteja Vemulapalli, Hema Swetha Koppula, Zhiyang Xu, Bowen Jin, Mert Cemri, Jiarui Lu, Zirui Wang, Meng Cao

机构 * Harvard University(哈佛大学) Apple(苹果公司) Virginia Tech(弗吉尼亚理工学院) UIUC(伊利诺伊大学香槟分校) UC Berkeley(加州大学伯克利分校)

专题命中 工具调用 :tool use(abstract);planning(abstract);分类 cs.LG

AI总结 COMPASS基准测试评估LLM代理在真实旅行规划中的约束优化能力,揭示当前模型在可行性与最优性之间存在显著差距,表明搜索空间探索不足是核心限制,编码代理提供潜在解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14475 2026-04-17 cs.AI 70%

Evo-MedAgent: Beyond One-Shot Diagnosis with Agents That Remember, Reflect, and Improve

Evo-MedAgent:超越单次诊断的具有记忆、反思和改进能力的代理

Weixiang Shen, Bailiang Jian, Jun Li, Che Liu, Johannes Moll, Xiaobin Hu, Daniel Rueckert, Hongwei Bran Li, Jiazhen Pan

机构 * Technical University of Munich(慕尼黑技术大学) TUM University Hospital(TUM大学医院) LMU Munich(慕尼黑大学) National University of Singapore(新加坡国立大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Imperial College London(伦敦帝国理工学院)

专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 Evo-MedAgent通过引入自我进化记忆模块,使医疗代理在测试时实现跨案例学习,提升多选题准确率,无需额外训练,适用于任何冻结模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14448 2026-04-17 cs.CL 70%

MARCA: A Checklist-Based Benchmark for Multilingual Web Search

MARCA:基于检查表的多语言网络搜索基准

Thales Sales Almeida, Giovana Kerche Bonás, Ramon Pires, Celio Larcher, Hugo Abonizio, Marcos Piau, Roseval Malaquias Junior, Rodrigo Nogueira, Thiago Laitz

机构 * Maritaca AI Jusbrasil

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.CL

AI总结 MARCA是一个双语(英语和葡萄牙语)基准,用于评估LLM在基于网络的信息检索中的能力,通过手动编写的多实体问题和检查表式评分标准,评估答案的完整性和正确性,并发现任务分解框架能提升覆盖范围,模型在英语到葡萄牙语的迁移中存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24284 2026-04-17 cs.AI 70%

MCP-Flow: Facilitating LLM Agents to Master Real-World, Diverse and Scaling MCP Tools

MCP-Flow:帮助LLM代理掌握现实世界、多样且可扩展的MCP工具

Wenhao Wang, Peizhi Niu, Zhao Xu, Zhaoyu Chen, Jian Du, Yaxin Du, Xianghe Pang, Keduan Huang, Yanfeng Wang, Qiang Yan, Siheng Chen

机构 * TikTok Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) University of Illinois at Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 MCP-Flow通过自动化流程提升LLM在现实世界MCP环境中的能力,通过大规模服务器发现、数据合成和模型训练,生成高质量指令-功能调用对和轨迹,推动代理任务性能提升。

Comments ACL 2026 Main, Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06148 2026-04-08 cs.CR cs.AI cs.MA 70%

Who Governs the Machine? A Machine Identity Governance Taxonomy (MIGT) for AI Systems Operating Across Enterprise and Geopolitical Boundaries

谁掌控机器?面向跨企业与地缘政治边界的AI系统机器身份治理分类(MIGT)

Andrew Kurtz, Klaudia Krawiecka

专题命中 工具调用 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出AI身份风险分类(AIRT)和机器身份治理分类(MIGT),解决AI系统中机器身份治理的空白,涵盖37个风险子类,同时应对技术、合规和跨司法管辖区协调的缺口。

Comments 75 pages (excl. references), 2 tables. Addresses policy makers, regulators, and practitioners at the intersection of AI governance, cybersecurity, and geopolitical risk

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04651 2026-04-07 cs.AI 70%

Search, Do not Guess: Teaching Small Language Models to Be Effective Search Agents

搜索,不要猜测:教小语言模型成为有效的搜索代理

Yizhou Liu, Qi Sun, Yulin Chen, Siyue Zhang, Chen Zhao

机构 * New York University(纽约大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nanyang Technological University(南洋理工大学)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文通过评估复杂多跳推理任务,发现小语言模型(SLMs)虽参数较少,但检索工具使用更少且易产生幻觉。提出轻量级微调方法\policy,使SLMs能可靠检索并生成基于证据的答案,提升Bamboogle和HotpotQA性能17.3和15.3分,达到LLM水平。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03173 2026-04-06 cs.CL 70%

Detecting and Correcting Reference Hallucinations in Commercial LLMs and Deep Research Agents

检测和纠正商业大语言模型和深度研究代理中的参考幻觉

Delip Rao, Eric Wong, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 工具调用 :tool-use(abstract);agentic(abstract);分类 cs.CL

AI总结 研究通过评估10种模型和代理在DRBench和ExpertQA上的引用URL可靠性,发现3-13%的URL存在幻觉,5-18%无法解析。提出urlhealth工具可有效减少非解析URL,验证引用URL的有效性与可纠正性。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29378 2026-04-01 cs.SE 70%

How and Why Agents Can Identify Bug-Introducing Commits

代理如何以及为何能够识别引入缺陷的提交

Niklas Risse, Marcel Böhme

专题命中 工具调用 :workflow(abstract);agentic(abstract);分类 cs.SE

AI总结 本文探讨了基于LLM的代理如何通过搜索候选提交提升识别引入缺陷提交的性能,提出了一种简单的代理工作流程,并揭示了代理在搜索中的有效性及对缺陷检测的潜在影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15994 2026-03-25 cs.CR cs.AI 70%

MCP Security Bench (MSB): Benchmarking Attacks Against Model Context Protocol in LLM Agents

MCP安全基准(MSB):针对LLM代理中模型上下文协议的攻击评估

Dongsen Zhang, Zekun Li, Xu Luo, Xuannan Liu, Peipei Li, Wenjun Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 工具调用 :tool-use(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出MSB,首个端到端评估套件,系统评估LLM代理在MCP全流程中的抗攻击能力,包含12种攻击类型及性能指标NRP,评估九种主流LLM代理在10个领域405种工具上的表现。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21475 2026-03-20 cs.AI 70%

MMSearch-Plus: Benchmarking Provenance-Aware Search for Multimodal Browsing Agents

MMSearch-Plus:面向多模态浏览代理的溯源感知基准测试

Xijia Tao, Yihua Teng, Xinxing Su, Xinyu Fu, Jihao Wu, Chaofan Tao, Ziru Liu, Haoli Bai, Rui Liu, Lingpeng Kong

机构 * The University of Hong Kong (HKU)(香港大学) Huawei Inc(华为公司)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 MMSearch-Plus是一个包含311个任务的基准测试,通过迭代图像-文本检索和交叉验证在噪声下强制多模态理解,提供模型无关的代理框架和集中标记模块,提升多步推理的鲁棒性。

Comments Project Page: https://mmsearch-plus.github.io

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16289 2026-03-19 cs.CV cs.AI 70%

VisBrowse-Bench: Benchmarking Visual-Native Search for Multimodal Browsing Agents

VisBrowse-Bench:多模态浏览代理的视觉原生搜索基准测试

Zhengbo Zhang, Jinbo Su, Zhaowen Zhou, Changtao Miao, Yuhan Hong, Qimeng Wu, Yumeng Liu, Feier Wu, Yihe Tian, Yuhao Liang, Zitong Shan, Wanke Xia, Yi-Fan Zhang, Bo Zhang, Zhe Li, Shiming Xiang, Ying Yan

机构 * CASIA Ant Digital Technologies Ant Group(蚂蚁集团数字技术部) RUC(清华大学) FZU(福建师范大学) THU(清华大学) USTB(北京科技大学) PKU(北京大学)

专题命中 工具调用 :agent(abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出VisBrowse-Bench,用于评估多模态浏览代理的视觉推理能力,通过文本-图像检索和联合推理进行多模态证据交叉验证,验证了不同模型在搜索过程中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16664 2026-03-18 cs.CV cs.AI 70%

Kestrel: Grounding Self-Refinement for LVLM Hallucination Mitigation

Kestrel: 为降低LVLM幻觉而引入自反思

Jiawei Mao, Hardy Chen, Haoqin Tu, Yuhan Wang, Letian Zhang, Zeyu Zheng, Huaxiu Yao, Zirui Wang, Cihang Xie, Yuyin Zhou

机构 * UC Santa Cruz(加州大学圣克ruz分校) UC Berkeley(加州大学伯克利分校) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Apple(苹果公司)

专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 Kestrel提出一种无需训练的框架,通过显式视觉 grounding 与证据验证自反思机制减少LVLM幻觉,实验显示在POPE和MME-Hallucination基准上性能提升,同时提供透明的验证轨迹。

Comments 16 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12618 2026-03-16 cs.LG 70%

Human-AI Collaborative Autonomous Experimentation With Proxy Modeling for Comparative Observation

人机协作自主实验与代理建模用于比较观察

Arpan Biswas, Hiroshi Funakubo, Yongtao Liu

专题命中 工具调用 :agent(abstract);AI agent(abstract);分类 cs.LG

AI总结 本文提出代理建模贝叶斯优化方法,通过人机协作提升材料空间探索效率,结合人类判断与AI代理实现更精确的实验优化。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10285 2026-03-12 cs.HC cs.AI cs.CY cs.DL cs.ET 70%

Conversational AI-Enhanced Exploration System to Query Large-Scale Digitised Collections of Natural History Museums

对话式AI增强的探索系统用于查询自然历史博物馆大规模数字化收藏

Yiyuan Wang, Andrew Johnston, Zoë Sadokierski, Rhiannon Stephens, Shane T. Ahyong

机构 * School of Computer Science, University of Technology Sydney(技术科技大学计算机科学学院) School of Design, University of Technology Sydney(技术科技大学设计学院) Australian Museum Research Institute, Australian Museum(澳大利亚博物馆研究 institute, 澳大利亚博物馆) Australian Museum(澳大利亚博物馆)

专题命中 工具调用 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出利用对话式AI查询自然历史博物馆大规模数字化收藏的系统,通过交互式地图和自然语言代理实现高效的数据检索与探索。

Comments 25 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10955 2026-03-12 cs.CR cs.AI 70%

Beyond Max Tokens: Stealthy Resource Amplification via Tool Calling Chains in LLM Agents

超越最大令牌:通过工具调用链实现隐秘的资源放大

Kaiyu Zhou, Yongsen Zheng, Yicheng He, Meng Xue, Xueluan Gong, Yuji Wang, Xuanye Zhang, Kwok-Yan Lam

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) University of Illinois Urbana-Champaign, United States(伊利诺伊大学厄巴纳-香槟分校,美国) The Hong Kong University of Science and Technology, Hong Kong(香港科学与技术大学,香港) Shanghai Jiao Tong University, China(上海交通大学,中国)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出了一种基于工具调用链的隐秘DoS攻击,通过多轮交互显著提升LLM的资源消耗,挑战现有安全防护机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09723 2026-03-12 cs.HC cs.CL 70%

AgentA/B: Automated and Scalable Web A/BTesting with Interactive LLM Agents

AgentA/B: 基于交互式LLM代理的自动化和可扩展的网页A/B测试

Yuxuan Lu, Ting-Yao Hsu, Hansu Gu, Limeng Cui, Yaochen Xie, William Headden, Bingsheng Yao, Akash Veeragouni, Jiapeng Liu, Sreyashi Nag, Jessie Wang, Dakuo Wang

机构 * Northeastern University(东北大学) Pennsylvania State University(宾夕法尼亚州立大学) Amazon USA(亚马逊美国)

专题命中 工具调用 :agent(abstract);autonomous agent(abstract);分类 cs.CL

AI总结 AgentA/B通过交互式LLM代理实现自动化和可扩展的网页A/B测试,模拟用户行为以评估网页设计效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07891 2026-03-10 cs.AI 70%

A Lightweight Traffic Map for Efficient Anytime LaCAM*

一种轻量级交通图用于高效任何时间LaCAM*

Bojie Shen, Yue Zhang, Zhe Chen, Daniel Harabor

机构 * Monash University, Faculty of Information Technology(莫纳什大学信息科技学院)

专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于动态轻量级交通图的改进方法,用于提升LaCAM*在多智能体路径寻找中的解决方案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05511 2026-03-09 cs.HC cs.AI cs.GR cs.RO 70%

An Embodied Companion for Visual Storytelling

具身化伴侣:视觉叙事中的交互伙伴

Patrick Tresset, Markus Wulfmeier

机构 * Goldsmiths, University of London(伦敦大学金史密斯学院) DeepMind(深度Mind)

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 Companion通过结合绘图机器人与大语言模型,实现人机协同创作,推动视觉叙事的创新与美学探索。

Comments 35 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18541 2026-02-24 cs.SE 70%

LAPIS: Lightweight API Specification for Intelligent Systems

LAPIS:轻量级智能系统API规范

Daniel Garcia

专题命中 工具调用 :agent(abstract);autonomous agent(abstract);分类 cs.SE

AI总结 LAPIS是一种为LLM优化的轻量级API规范格式,通过减少token使用并保留语义信息,提升智能系统对API的处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14089 2026-02-17 cs.DB cs.AI 70%

TabTracer: Monte Carlo Tree Search for Complex Table Reasoning with Large Language Models

TabTracer:基于大语言模型的复杂表格推理的蒙特卡洛树搜索

Zhizhao Luo, Zhaojing Luo, Meihui Zhang, Rui Mao

机构 * Beijing Institute of Technology, Zhuhai(北京理工大学(珠海)) Beijing Institute of Technology(北京理工大学) Shenzhen University(深圳大学)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 TabTracer通过多步工具调用和显式状态跟踪,提升复杂表格推理的准确率并降低token成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08941 2026-02-10 cs.HC cs.AI 70%

pixelLOG: Logging of Online Gameplay for Cognitive Research

pixelLOG:用于认知研究的在线游戏日志记录

Zeyu Lu, Dennis L. Barbour

专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 pixelLOG是一种用于认知研究的高性能数据收集框架,通过混合方法跟踪多人游戏中的行为,实现高分辨率分析。

Comments 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏