arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 5039 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5039 篇

2607.24743 2026-07-29 cs.CV cs.AI cs.CL 版本更新 73%

ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding

ClinFusion:用于整体医学理解的以视觉为中心的多模态大语言模型系统

Hangjie Yuan, Yichen Qian, Zhiwei Tang, Xianzhe Xu, Lirong Wu, Sicheng Yang, Jinwang Wang, Pengju Wang, Zhitao Zeng, Yizeng Han, Yan Xing, Shengxuan Luo, Tao Feng, Qing Xie, Weigen Yao, Yi Yang, Zuozhu Liu, Jiasheng Tang, Shaocheng Wang, Jitao Wang, Jiahong Dong, Weihua Chen, Feng Xu, Fan Wang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Laboratory(湖畔实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Department of Radiology, The Affiliated Yangming Hospital of Ningbo University(宁波大学附属阳明医院放射科) Zhejiang University-University of Illinois Urbana-Champaign Institute, Zhejiang University(浙江大学伊利诺伊大学厄巴纳香槟校区联合学院,浙江大学) Hepato-Pancreato-Biliary Center, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua Medicine, Tsinghua University(清华长庚医院肝胆胰中心,清华大学临床医学院,清华医学,清华大学) School of Software, Tsinghua University(清华大学软件学院) Beijing National Research Center for Information Science and Technology, Tsinghua University(清华大学北京信息科学与技术国家研究中心)

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究针对多模态大语言模型在医学领域部署的挑战,提出ClinFusion,采用组合级联视觉编码器架构和视觉基础评估框架,在多模态医学基准测试中表现优异,超越开源和专有模型,经专家盲评验证效果良好。

Comments Code: https://github.com/alibaba-damo-academy/ClinFusion Models: https://huggingface.co/collections/Alibaba-DAMO-Academy/clinfusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17384 2026-07-22 cs.AI cs.LG cs.LO cs.MA 版本更新 73%

Quantifying Diversity of Thought: A Predictive Law of Weighted LLM Ensemble Lift

量化思维多样性:加权大语言模型集成提升的预测定律

Junade Ali

机构 * The Alan Turing Institute(艾伦·图灵研究所)

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究量化思维多样性在大语言模型集成中提升效果的预测定律,通过原理推导得出计算提升的启发式方法及相关指标,经多基准测试验证,该方法能有效预测集成性能,且准确性调整后的指标表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16131 2026-07-20 cs.CL cs.AI 新提交 73%

ToolSciVer: Multimodal Scientific Claim Verification with Visual Tool Augmented Reinforcement Learning

ToolSciVer:基于视觉工具增强强化学习的多模态科学声明验证

Binglin Zhou, Peng Shi, Ryo Kamoi, Nan Zhang, Rui Zhang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Waterloo(滑铁卢大学)

专题命中 工具调用 :tool use(abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 研究多模态科学声明验证问题,提出ToolSciVer框架,为视觉语言模型配备三种类型感知视觉工具,用组相对策略优化训练策略,实验证明该方法在多模型上性能优于竞争基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01426 2026-07-07 cs.AI cs.CL 新提交 73%

When Should Service Agents Reconsider? Difficulty-Routed Control in Customer-Service Operations

服务代理何时应重新考虑?客户服务运营中的难度路由控制

Qian Chen, Chengyuan Liu, Xin Yu

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 工具调用 :tool-use(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 提出一种难度路由的服务控制架构,通过轻量级路由器将常规会话与操作耦合会话分流,在关键后端写入前集中审查,提升零售和航空任务的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00593 2026-07-03 cs.CL cs.AI 版本更新 73%

SPADER: Step-wise Peer Advantage with Diversity-Aware Exploration Rewards for Multi-Answer Question Answering

SPADER: 面向多答案问答的逐步同伴优势与多样性感知探索奖励

Qiming Shi, Zhaolu Kang, Yunfan Zhou, Di Weng, Yingcai Wu

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Software Technology, Zhejiang University(浙江大学软件技术学院)

专题命中 工具调用 :tool use(abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 提出SPADER强化学习框架,通过逐步同伴优势(SPA)机制和多样性感知探索奖励,解决多答案问答中长程工具使用的细粒度信用分配与持续探索问题,实验表明在多个数据集上提升了召回率和F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26118 2026-06-26 cs.CY cs.AI cs.LG 新提交 73%

The Open Source Economic Index of AI Adoption and Capability

AI采纳与能力的开源经济指数

Seamus Somerstep, Aritra Guha, Divesh Srivastava, Yuekai Sun

机构 * University of Michigan(密歇根大学) AT&T Chief Data Office(AT&T首席数据办公室) IFM-MBZUAI

专题命中 工具调用 :AI agent(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 通过公开聊天数据和O*NET任务构建开源经济指数,衡量AI在各职业的采纳率与任务执行能力,发现金融、计算机和艺术行业采纳率最高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24589 2026-06-24 cs.AI cs.CL 新提交 73%

AdversaBench: Automated LLM Red-Teaming with Multi-Judge Confirmation and Cross-Model Transferability

AdversaBench: 基于多裁判确认与跨模型迁移性的自动化大语言模型红队测试

Khanak Khandelwal

机构 * Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校)

专题命中 工具调用 :tool use(abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 提出AdversaBench端到端红队测试流水线,使用五种结构化算子变异种子提示,通过三裁判加元裁判机制确认失败,实验发现算子效果因类别而异、二元失败率掩盖难度、裁判一致性受标签偏斜影响、对抗提示可跨模型迁移。

Comments 10 pages, 4 figures, 5 tables. Code and data at https://github.com/khanak0509/AdversaBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21891 2026-06-23 cs.AI cs.CL 新提交 73%

Learning the ARTS of Search for Automated Discovery

学习搜索的艺术以实现自动发现

Gurusha Juneja, Arnav Kumar Jain, Deepak Nathani, William Yang Wang, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Université de Montréal and Mila- Quebec AI Institute(蒙特利尔大学和Mila-魁北克人工智能研究所)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出ARTS方法,利用推理语言模型在假设与实验空间中迭代搜索,通过测试时训练解决上下文长度问题,在22个任务上优于现有算法,相对提升超15.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02751 2026-06-23 cs.MA cs.AI cs.CL 版本更新 73%

Scaling Small Agents Through Strategy Auctions

通过策略拍卖扩展小型智能体

Lisa Alazraki, William F. Shen, Yoram Bachrach, Akhil Mathur

机构 * Meta Superintelligence Labs(Meta超智能实验室) Imperial College London(帝国理工学院伦敦分校) University of Cambridge(剑桥大学)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 针对小型语言模型在复杂任务中性能不足的问题,提出受自由职业市场启发的SALE框架,通过策略拍卖实现任务分配与测试时自我改进,在降低对大型模型依赖和成本的同时提升性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18023 2026-06-17 cs.LG cs.AI 新提交 73%

LoopCoder-v2: Only Loop Once for Efficient Test-Time Computation Scaling

LoopCoder-v2: 仅循环一次以实现高效的测试时计算扩展

Jian Yang, Shawn Guo, Wei Zhang, Tianyu Zheng, Yaxin Du, Haau-Sing Li, Jiajun Wu, Yue Song, Yan Xing, Qingsong Cai, Zelong Huang, Chuan Hao, Ran Tao, Xianglong Liu, Wayne Xin Zhao, Mingjie Tang, Weifeng Lv, Ming Zhou, Bryan Dai

机构 * Beihang University(北京航空航天大学) IQuest Research Langboat(浪波) Renmin University of China(中国人民大学)

专题命中 工具调用 :tool-use(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出并行循环Transformer(PLT)并研究循环次数选择,发现两循环变体在代码生成等任务上显著提升,而三循环以上性能下降,揭示了增益-成本权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14885 2026-06-16 cs.AI cs.CL 新提交 73%

Dr-DCI: Scaling Direct Corpus Interaction via Dynamic Workspace Expansion

Dr-DCI: 通过动态工作空间扩展实现直接语料交互的规模化

Yi Lu, Zhuofeng Li, Ping Nie, Haoxiang Zhang, Yuyu Zhang, Kai Zou, Wenhu Chen, Jimmy Lin, Dongfu Jiang, Yu Zhang

机构 * University of Toronto(多伦多大学) Texas A&M University(德克萨斯A&M大学) University of Waterloo(滑铁卢大学) UC San Diego(加州大学圣迭戈分校) Verdent AI Netmind AI

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出DR-DCI框架,将检索作为智能体可调用的动作来动态扩展本地工作空间,结合检索器的召回能力与DCI的局部操作精度,实现大规模语料上的高效搜索与验证。

Comments 25 pages, 4 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04935 2026-06-10 cs.SE cs.AI 版本更新 73%

ASA: Backbone-Training-Free Representation Engineering for Tool-Calling Agents

ASA:无需骨干训练的工具调用智能体表示工程

Youjin Wang, Run Zhou, Yingjie Ma, Rong Fu, Jiani Liang, Shuaishuai Cao, Min Huang, Tao Fang, Liangming Pan

机构 * Renmin University of China(中国人民大学) University of Macau(澳门大学) Central South University(中南大学) Jiangxi Normal University(江西师范大学) Macau Millennium College(澳门 millennium 学院) Peking University(北京大学)

专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.SE

AI总结 针对大语言模型在工具调用中的惰性代理问题,提出一种无需训练、推理时激活干预的方法ASA,通过路由条件混合引导向量和探针引导门控,显著提升工具使用F1并降低误报率。

Comments The manuscript consists of 24 pages formatted in the ACL style. Youjin Wang, Run Zhou, and Yingjie Ma contributed equally to this work. Tao Fang and Liangming Pan are the co-corresponding authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07992 2026-06-09 cs.AI cs.CR cs.SE 新提交 73%

VATS: Exploiting Implicit Authority in Error-Path Injection via Systematic Mutation

VATS: 通过系统性变异利用错误路径注入中的隐式权威

Harshil Patel, Kunal Pai

机构 * Harshil Patel Kunal Pai

专题命中 工具调用 :autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 提出VATS框架,通过七维变异生成对抗性负载,利用错误消息的隐式权威绕过安全机制,在四个前沿模型上实现高达100%的注入成功率。

Comments Published at Second Workshop on Agents in the Wild: Safety, Security, and Beyond (ICML 2026 AIWILD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23694 2026-06-04 cs.AI cs.CL cs.CR 73%

SafeSearch: Automated Red-Teaming of LLM-Based Search Agents

SafeSearch: 基于LLM的搜索代理的自动化红队测试

Jianshuo Dong, Sheng Guo, Hao Wang, Xun Chen, Zhuotao Liu, Tianwei Zhang, Ke Xu, Minlie Huang, Han Qiu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 工具调用 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 提出SafeSearch自动化红队框架,系统评估基于LLM的搜索代理在五个风险类别中的安全性,发现GPT-4.1-mini在搜索工作流中攻击成功率高达90.5%,且常见防御措施效果有限。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00566 2026-06-02 cs.LG cs.CL cs.CR 73%

Same Payload, Different Channel: Measuring Trust Asymmetry in Tool-Using Language Models

相同载荷,不同通道:测量使用工具的語言模型中的信任不对称性

Mohammed Sameer Syed, Rozhin Yasaei

机构 * University of Arizona(亚利桑那大学)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出安全不对称分数(SAS),通过匹配恶意载荷仅改变传递上下文,系统测量了语言模型在不同通道(用户消息、工具元数据、工具输出)中对对抗性内容的脆弱性差异,发现代理原生模型在工具描述通道更脆弱,而通用模型相反,且机制研究表明安全相关表示在深层网络非线性编码。

Comments 13 pages, 1 figure. Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00408 2026-06-02 cs.CL cs.AI cs.IR 73%

Masking Stale Observations Helps Search Agents -- Until It Doesn't: A Regime Map and Its Mechanism

掩盖过时观察帮助搜索智能体——直到适得其反:一个机制图谱及其机制

Haoxiang Zhang, Qixin Xu, Zhuofeng Li, Lei Zhang, Pengcheng Jiang, Yu Zhang, Julian McAuley

机构 * UC San Diego(加州大学圣地亚哥分校) UC Berkeley(加州大学伯克利分校) Texas A&M University(德克萨斯大学) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文通过系统实验发现,在长时域搜索智能体中掩盖过时观察的效果呈现非对称倒U型曲线,取决于检索器召回率与模型隐式过滤能力的交互,并揭示了其背后的令牌-轮次权衡机制。

Comments 47 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07789 2026-05-29 cs.MA cs.CL cs.SE 73%

ORACLE-SWE: Quantifying the Contribution of Oracle Information Signals on SWE Agents

ORACLE-SWE:量化Oracle信息信号对SWE代理的贡献

Kenan Li, Qirui Jin, Liao Zhu, Xiaosong Huang, Yijia Wu, Yikai Zhang, Xin Zhang, Zijian Jin, Yufan Huang, Elsie Nallipogu, Chaoyun Zhang, Yu Kang, Saravan Rajmohan, Qingwei Lin, Wenke Lee, Dongmei Zhang

机构 * Microsoft(微软公司) Georgia Institute of Technology(佐治亚理工学院)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.CL、cs.SE

AI总结 提出Oracle-SWE方法,通过隔离和提取SWE基准测试中的Oracle信息信号,量化每种信号对代理性能的贡献,并评估强语言模型提取的信号对基础代理的性能提升。

Comments Under peer review; 37 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29224 2026-05-29 cs.CL cs.AI cs.CR 73%

Relevance as a Vulnerability: How Web Retrieval Degrades Safety Alignment in LLM Agents

相关性即漏洞:网络检索如何削弱LLM智能体的安全对齐

Aditya Nawal, Manit Baser, Mohan Gurusamy

机构 * Department of Electrical and Computer Engineering(电子与计算机工程系) National University of Singapore(新加坡国立大学)

专题命中 工具调用 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出AgentREVEAL框架,分析检索集成方式和内容属性如何导致LLM智能体安全退化,发现相关性是共同激活条件,并引入HarmURLBench基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27276 2026-05-29 cs.AI cs.CL 73%

SIA: Self Improving AI with Harness & Weight Updates

SIA: 具有框架与权重更新的自我改进AI

Prannay Hebbar, Yogendra Manawat, Samuel Verboomen, Alesia Ivanova, Selvam Palanimalai, Kunal Bhatia, Vignesh Baskaran

机构 * Hexo Labs(Hexo实验室) University of Oxford(牛津大学)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出SIA框架,通过反馈智能体同时更新任务智能体的框架和权重,在三个领域(中国法律罪名分类、GPU内核优化、单细胞RNA去噪)超越仅迭代框架的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12538 2026-05-26 cs.CR cs.AI cs.SE 73%

MCPXKIT: The Unified Toolkit for Analyzing Model Context Protocol Security

MCPXKIT:分析模型上下文协议安全性的统一工具包

Yongjian Guo, Puzhuo Liu, Wanlun Ma, Zehang Deng, Xiaogang Zhu, Peng Di, Xi Xiao, Sheng Wen

机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(深圳国际研究生院,清华大学,深圳,中国) Ant Group, Hangzhou, China(蚂蚁集团,杭州,中国) Swinburne University of Technology, Melbourne, Australia(斯威本科技大学,墨尔本,澳大利亚) The University of Adelaide, Adelaide, Australia(阿德莱德大学,阿德莱德,澳大利亚) UNSW Sydney, Australia(悉尼大学,澳大利亚)

专题命中 工具调用 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出MCPXKIT工具包,分类实现了31种攻击方法,通过定量实验揭示了MCP在工具描述依赖、文件攻击、链攻击及数据命令区分等方面的漏洞,并提供了安全增强建议。

Comments Accepted by IEEE Transactions on Dependable and Secure Computing (TDSC). $\href{https://ieeexplore.ieee.org/abstract/document/11531012}{Official \ version}$

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17281 2026-05-19 cs.SE cs.AI 73%

ContractBench: Can LLM Agents Preserve Observation Contracts?

ContractBench: LLM Agents能否保持观察契约?

Jicheng Wang, Yifeng He, Zili Wang, Hanwen Xing, Arkaprava De, Hao Chen

机构 * University of California, Davis(加州大学戴维斯分校) University of Southern California(南加州大学) University of Hong Kong(香港大学)

专题命中 工具调用 :tool-use(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文提出ContractBench基准测试,用于评估LLM代理在保持观察契约(如时间有效性及字节完整性)方面的能力,发现现有模型在该任务上仍存在显著缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10906 2026-05-14 cs.LG cs.AI 73%

DataMaster: Data-Centric Autonomous AI Research

DataMaster: 以数据为中心的自主AI研究

Yaxin Du, Xiyuan Yang, Zhifan Zhou, Wanxu Liu, Zixing Lei, Zimeng Chen, Fenyi Liu, Haotian Wu, Yuzhu Cai, Zexi Liu, Xinyu Zhu, WenHao Wang, Linfeng Zhang, Chen Qian, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

专题命中 工具调用 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 DataMaster通过自主数据工程优化数据侧,提升下游性能,无需改变学习算法。其包含数据树、共享数据池和全局记忆三大组件,有效解决开放搜索空间和延迟验证问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12521 2026-05-14 cs.CL cs.AI 73%

ToolWeave: Structured Synthesis of Complex Multi-Turn Tool-Calling Dialogues

ToolWeave:复杂多轮工具调用对话的结构化合成

Dinesh Khandelwal, Gnana Prakash Punnavajhala, GPS Bhargav, Gaurav Pandey, Sachin Joshi, Hima Karanam, Dinesh Raghu

机构 * IBM Research(IBM研究院) IIIT Hyderabad(Hyderabad理工学院)

专题命中 工具调用 :autonomous agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 ToolWeave通过构建带有内置依赖关系的工具,生成更真实的多轮工具调用对话,减少参数幻觉,提升LLM在多步骤任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07177 2026-05-12 cs.LG cs.AI 73%

HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents

HyperEyes: 双粒度效率感知强化学习用于并行多模态搜索代理

Guankai Li, Jiabin Chen, Yi Xu, Xichen Zhang, Yuan Lu

机构 * Xiaohongshu Inc.(小红书公司) University of Cambridge(剑桥大学)

专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.LG

AI总结 HyperEyes通过双粒度效率感知强化学习,实现并行多模态搜索代理,提升搜索效率与准确性,其在六个基准测试中超越现有开源代理。

Comments Code & Data: https://github.com/DeepExperience/HyperEyes

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06002 2026-04-30 cs.AI cs.CL cs.IR 73%

Deterministic Legal Agents: A Canonical Primitive API for Auditable Reasoning over Temporal Knowledge Graphs

确定性法律代理:用于可审计时间知识图谱推理的规范性原始API

Hudson de Martim

机构 * Federal Senate of Brazil(巴西联邦议会)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出SAT-Graph API,通过确定性符号子系统与概率语言模型交互,实现法律领域可审计的时间知识图谱推理,将单次检索生成改为主动推理-行动-观察流程。

Comments Substantially revised version consolidating the paper as a formal SAT-Graph API specification: clarifies Probability Isolation and post-anchoring determinism, broadens semantic anchoring to open and thematic legal queries, refines the data models and temporal primitives, and strengthens the use cases, limitations, and bibliography

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19857 2026-04-23 cs.LG cs.CL 73%

Rethinking Reinforcement Fine-Tuning in LVLM: Convergence, Reward Decomposition, and Generalization

重新思考LVLM中的强化微调:收敛性、奖励分解与泛化

Carter Adams, Rafael Oliveira, Gabriel Almeida, Sofia Torres

机构 * Federal University of Bahia(巴伊亚联邦大学)

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.CL、cs.LG

AI总结 本文提出TA-MDP框架,分析强化微调中奖励结构对GRPO收敛性的影响,并推导奖励分解定理和泛化界限,揭示工具增强策略在分布外迁移中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17886 2026-04-21 cs.CL cs.AI 73%

Latent Preference Modeling for Cross-Session Personalized Tool Calling

潜在偏好建模用于跨会话个性化工具调用

Yejin Yoon, Minseo Kim, Taeuk Kim

机构 * Hanyang University(翰阳大学)

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出MPT基准和PRefine方法,通过生成-验证-细化循环提升工具调用准确性,仅用1.24%的token实现稳健的个性化。

Comments Under review. 25 pages, 10 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10741 2026-04-21 cs.CL cs.AI cs.IR 73%

Deep-Reporter: Deep Research for Grounded Multimodal Long-Form Generation

Deep-Reporter:基于多模态长形式生成的深度研究

Fangda Ye, Zhifei Xie, Yuxin Hu, Yihang Yin, Shurui Huang, Shikai Dong, Jianzhu Bao, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) University of Edinburgh(爱丁堡大学) Beijing Institute of Technology(北京理工大学)

专题命中 工具调用 :planning(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Deep-Reporter框架,通过多模态搜索、检查清单引导合成和上下文管理,解决多模态长形式生成中的整合与选择难题,通过8K高质量数据集和M2LongBench测试集验证其有效性。

Comments 41 pages, 6 figures, 8 tables. Code available at https://github.com/fangda-ye/Deep-Report. v2: corrected typos and updated experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14951 2026-04-17 cs.CV cs.AI cs.CL cs.MM 73%

RaTA-Tool: Retrieval-based Tool Selection with Multimodal Large Language Models

RaTA-Tool: 基于检索的多模态大语言模型工具选择

Gabriele Mattioli, Evelyn Turri, Sara Sarto, Lorenzo Baraldi, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学)

专题命中 工具调用 :tool use(abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 本文提出RaTA-Tool框架,利用多模态大语言模型将多模态查询转化为结构化任务描述,并通过语义丰富的工具描述检索合适工具,支持开放世界场景下的工具扩展。

Comments ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18788 2026-03-25 cs.CL cs.AI 73%

Mi:dm K 2.5 Pro

KT Tech innovation Group

专题命中 工具调用 :tool-use(abstract);agentic(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏