arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 5047 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5047 篇

2606.25394 2026-06-25 cs.LG cs.AI 新提交 62%

FactorLibrary: From Polynomials to Circuits via Recursive Subgoals

FactorLibrary: 从多项式到电路通过递归子目标

Rohan Pandey, Michael Ruofan Zeng, Weikun K. Zhang, Kaijie Jin, Naomi Morato, Archit Ganapule, Bhaumik Mehta, Jarod Alper

机构 * University of Washington, Seattle, WA, USA(华盛顿大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 将有限域上多项式的最小算术电路发现建模为强化学习问题,提出FactorLibrary存储可分解子表达式作为子目标,使用PPO+MCTS的top-down方法在复杂度8以内达到91.8%的成功率。

Comments 14 pages, 8 figures, in 3rd AI for Math Workshop (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17698 2026-06-24 cs.AI cs.CL 新提交 62%

EComAgentBench: Benchmarking Shopping Agents on Long-Horizon Tasks with Distributed Hidden Intent

EComAgentBench:在分布式隐藏意图的长时任务上基准测试购物代理

Zeyao Du, Tong Li, Yanci Zhang, Haibo Zhang

机构 * Shopee

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出EComAgentBench基准,包含662个基于真实亚马逊产品的任务,要求代理在100次工具调用内从可见查询、工具门控配置文件和脚本化澄清中挖掘隐藏意图,验证候选产品并提交最终选择,通过类型化源标签评分归因失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10607 2026-06-24 cs.LG cs.AI 62%

MONAQ: Multi-Objective Neural Architecture Querying for Time-Series Analysis on Resource-Constrained Devices

MONAQ:面向资源受限设备的时间序列分析多目标神经架构查询

Patara Trirat, Jae-Gil Lee

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 MONAQ通过多目标神经架构查询框架,结合大语言模型能力,实现对时间序列数据的高效处理与部署,实验表明其模型性能优于传统方法。

Comments EMNLP 2025 (Findings), Project Page: https://kaist-dmlab.github.io/MONAQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21975 2026-06-23 cs.AI cs.LG 新提交 62%

IRumAI: Reinforcement Learning for Indian Rummy

IRumAI: 面向印度拉米纸牌游戏的强化学习

Vignesh Mohan

机构 * IEEE

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出首个面向印度拉米纸牌游戏的强化学习智能体IRumAI,采用PPO、融合感知编码、死牌驱动奖励和双分支卷积架构,在仅对弱启发式训练后,以53.9%胜率击败最强搜索对手,推理速度比最优启发式快7000倍以上。

Comments 9 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21456 2026-06-23 cs.IR cs.AI cs.CL 版本更新 62%

Revisiting Text Ranking in Deep Research

重新审视深度研究中的文本排序

Chuan Meng, Litu Ou, Sean MacAvaney, Jeff Dalton

机构 * The University of Edinburgh(爱丁堡大学) University of Glasgow(格拉斯哥大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文通过复现实验,从检索单元、流水线配置和查询特性三个角度评估文本排序方法在深度研究中的有效性,并提出Q2Q方法缓解查询不匹配问题。

Comments Accepted at the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20529 2026-06-19 cs.AI cs.CL 新提交 62%

LedgerAgent: Structured State for Policy-Adherent Tool-Calling Agents

LedgerAgent: 策略遵从工具调用代理的结构化状态

Md Nayem Uddin, Amir Saeidi, Eduardo Blanco, Chitta Baral

机构 * Arizona State University(亚利桑那州立大学) University of Arizona(亚利桑那大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对客服领域策略遵从工具调用代理,提出LedgerAgent方法,通过独立账本维护任务状态并渲染到提示中,在执行工具调用前检查状态依赖策略约束,提升多轮一致性。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19559 2026-06-19 cs.AI cs.CL 新提交 62%

Uncertainty Decomposition for Clarification Seeking in LLM Agents

LLM代理中寻求澄清的不确定性分解

Gregory Matsnev

机构 * AI Talent Hub, ITMO University(AI Talent Hub, ITMO大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出一种基于提示的不确定性分解方法,将行动置信度与请求不确定性分离,使代理能在任务规范模糊时主动寻求澄清,在五个LLM骨干上平均澄清F1提升36%-73%。

Comments 26 pages, 8 figures. Source code: https://github.com/PE51K/udcs-in-llm-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19423 2026-06-19 cs.CR cs.AI cs.LG 版本更新 62%

The Autonomy Tax: Defense Training Breaks LLM Agents

自主性税:防御训练破坏LLM智能体

Shawn Li, Yue Zhao

机构 * University of Southern California(南加州大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 揭示防御训练在提升LLM智能体安全性时,系统性地破坏其工具执行能力,导致任务失败率飙升,且无法有效防御复杂攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15077 2026-06-16 cs.AI cs.CL 新提交 62%

Risk-Aware LLM Agents for Geospatial Data Retrieval: Design and Preliminary Adversarial Evaluation

风险感知的LLM智能体用于地理空间数据检索:设计与初步对抗性评估

Kyle Gao, Joel Cumming, Jonathan Li, Linlin Xu, David A. Clausi

机构 * Dept. of Systems Design Engineering, University of Waterloo(滑铁卢大学系统设计工程系) SkyWatch Dept. of Geography and Environmental Management, University of Waterloo(滑铁卢大学地理与环境管理系) Dept. of Geomatics Engineering, University of Calgary(卡尔加里大学测绘工程系)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出一种基于LLM的框架,通过自然语言查询从云地理空间目录检索遥感数据,集成三个智能体实现安全、意图解析和API调用生成,初步对抗实验表明提示级安全指令提升鲁棒性但需系统级防御。

Comments Accepted for publication in the International Archives of the Photogrammetry, Remote Sensing and Spatial Information Sciences (ISPRS Archives), ISPRS Congress 2026

Journal ref Int. Arch. Photogramm. Remote Sens. Spatial Inf. Sci., XLIX-B3-2026, 1419-1426, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11522 2026-06-11 cs.AI cs.LG 新提交 62%

Search Discipline for Long-Horizon Research Agents

长周期研究智能体的搜索纪律

Adithya Srinivasan, Devesh Paragiri

机构 * North Carolina State University(北卡罗来纳州立大学) University of Maryland(马里兰大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对研究智能体使用聚合指标评估候选方案导致科学有效性反转的问题,提出一种外部审计协议,基于分解行为而非单一分数进行决策。

Comments 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16700 2026-06-10 cs.SE cs.AI cs.ET cs.HC 版本更新 62%

Adoption of Generative Artificial Intelligence in the German Software Engineering Industry: An Empirical Study

生成式人工智能在德国软件工程行业的采用:一项实证研究

Ludwig Felder, Tobias Eisenreich, Mahsa Fischer, Stefan Wagner, Chunyang Chen

机构 * Technical University of Munich(慕尼黑技术大学) Heilbronn University of Applied Science(海德堡应用科学大学)

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.SE

AI总结 通过混合方法研究德国软件工程师采用生成式AI工具的情况,发现经验水平调节感知收益,组织规模影响工具选择和使用强度,项目上下文意识不足是主要障碍。

Comments Accepted at FSE '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09416 2026-06-09 cs.RO cs.AI cs.SE 新提交 62%

Harness Engineering for Physical AI: Robot Middleware Is the Harness Layer

面向物理AI的驾驭工程:机器人中间件即驾驭层

Sanghoon Lee, Jiyeong Chae, Kyung-Joon Park

机构 * Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出机器人中间件作为物理AI的驾驭层,需同时干预控制、计算和通信,并补充投影、隔离和转移三种缺失的强制功能,以ROS 2驾驭配置文件为例。

Comments 6 pages, 2 figures, 2 tables. Big Ideas track submission to the 27th ACM/IFIP International Middleware Conference (Middleware 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07904 2026-06-09 cs.AI cs.SE 新提交 62%

Contract2Tool: Learning Preconditions and Effects for Reliable Tool-Augmented LLM Agents

Contract2Tool: 学习可靠工具增强型LLM代理的前提条件和效果

Rahul Suresh Babu, Laxmipriya Ganesh Iyer

机构 * Independent Researcher(独立研究者) United States of America(美国)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出Contract2Tool框架,从元数据、文档和执行轨迹中推断工具契约,实现因果工具过滤,在保持可靠性的同时大幅减少工具选择和token使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06566 2026-06-08 cs.SE cs.AI 新提交 62%

NTILC: Neural Tool Invocation via Learned Compression

NTILC: 通过学习的压缩实现神经工具调用

Andrew Krikorian, Yayuan Li, Jason J. Corso

机构 * Department of Robotics, University of Michigan(机器人学系,密歇根大学) Department of ECE, University of Michigan(电子工程与计算机科学系,密歇根大学)

专题命中 工具调用 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 提出NTILC框架,用学习的潜在检索替代上下文工具查找,将工具选择与参数生成解耦,通过签名感知复合损失函数提升选择精度,相比基线减少95%上下文消耗和74%延迟。

Comments 10 Pages, 4 Figures, 5 Tables, 1 Algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05186 2026-06-05 cs.LG cs.CL 62%

Staged Factorial Screening for Budget-Constrained Micro-Pretraining

预算受限的微预训练中的分阶段因子筛选

Felipe Chavarro Polania

机构 * Hewlett Packard Enterprise(惠普企业)

专题命中 工具调用 :workflow(abstract);分类 cs.CL、cs.LG

AI总结 针对预算受限的微预训练,提出分阶段分数因子设计方法,通过短时筛选识别高惩罚方向并确认有效锚点,在共享加速器上实现高效配方筛选。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04823 2026-06-04 cs.AI cs.CL cs.MA 62%

R-APS: Compositional Reasoning and In-Context Meta-Learning for Constrained Design via Reflective Adversarial Pareto Search

R-APS:基于反思性对抗帕累托搜索的组合推理与上下文元学习用于约束设计

João Pedro Gandarela, Thiago Rios, Stefan Menzel, André Freitas

机构 * Idiap Research Institute(Idiap研究 institute) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院) Honda Research Institute Europe(本田欧洲研究机构) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) National Biomarker Centre, CRUK-MI, University of Manchester(曼彻斯特大学国家生物标志物中心)

专题命中 工具调用 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出R-APS方法,通过推理模式分解、分阶段组合推理、敏感性引导对抗测试和元归纳规则提取,联合解决LLM在代理设置中的错误传播、最坏情况扰动和知识失效问题,在平面机构合成任务上实现更紧的鲁棒性证书和更快的迭代速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01708 2026-06-02 cs.LG cs.AI 62%

Two-Fidelity Best-Action Identification for Stochastic Minimax Tree

随机极小极大树的双保真度最优动作识别

Peter Chen, Xi Chen

机构 * Department of Mathematics, Columbia University(哥伦比亚大学数学系) Stern School of Business, New York University(纽约大学斯特恩商学院)

专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对随机极小极大树中的固定置信度最优动作识别问题,提出双保真度树搜索算法2FFS,结合极小极大快速扩展与MCTS随机采样,自适应选择廉价有偏评估或昂贵精确评估,理论证明固定置信度正确性、有限停止及多项式深度成本上界,实验表明比现有BAI-MCTS基线显著减少样本和计算。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24248 2026-06-02 cs.CR cs.AI cs.SE 62%

Attested Tool-Server Admission: A Security Extension to the Model Context Protocol

认证工具服务器准入:模型上下文协议的安全扩展

Alfredo Metere

机构 * Enclawed LLC(Enclawed公司)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.SE

AI总结 针对MCP协议缺乏信任机制的问题,提出mcp-attested扩展,通过离线签名的权限断言、默认拒绝的工具白名单和分级强制审计日志,实现安全服务器准入与工具边界控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03789 2026-06-02 cs.LG cs.AI 62%

Automated Conjecture Resolution with Formal Verification

自动猜想解决与形式化验证

Haocheng Ju, Guoxiong Gao, Jiedong Jiang, Bin Wu, Zeming Sun, Shurui Liu, Leheng Chen, Yutong Wang, Yuefeng Wang, Zichen Wang, Wanyi He, Peihao Wu, Liang Xiao, Ruochuan Liu, Bryan Dai, Bin Dong

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Westlake Institute for Advanced Study, Westlake University(西拉雅大学先进研究所) School of Mathematics, Tianjin University(天津大学数学学院) Research Institute for Mathematical Sciences, Kyoto University(京都大学数学研究所) Department of Mathematics, Stanford University(斯坦福大学数学系) IQuest Research(IQuest研究) New Cornerstone Science Laboratory, School of Mathematical Sciences, Peking University(北京大学数学科学学院新基石科学实验室) Beijing International Center for Mathematical Research and the New Cornerstone Science Laboratory, Peking University(北京大学国际数学研究所以及新基石科学实验室) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) Center for Intelligent Computing, Great Bay Institute for Advanced Study, Great Bay University(大湾大学先进研究所智能计算中心) Zhongguancun Academy(中关村学院)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出一个集成非形式化推理与形式化验证的自动框架,通过两个组件Rethlas和Archon解决研究级数学问题,并成功解决交换代数中的开放问题并在Lean 4中形式化验证。

Comments Code and resources are available at: Rethlas (https://github.com/frenzymath/Rethlas), Rethlas Results (https://github.com/frenzymath/Rethlas_results), Archon (https://github.com/frenzymath/Archon), and the formalization results (https://github.com/frenzymath/Anderson-Conjecture)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20333 2026-06-02 cs.AI cs.LG cs.NE 62%

NNGPT: Rethinking AutoML with Large Language Models

NNGPT: 用大型语言模型重新思考AutoML

Roman Kochnev, Waleed Khalid, Tolgay Atinc Uzun, Xi Zhang, Yashkumar Sanjaybhai Dhameliya, Furui Qin, Chandini Vysyaraju, Raghuvir Duvvuri, Avi Goyal, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg, Germany(计算机视觉实验室,CAIDAS与IFI,乌尔姆大学,德国)

专题命中 工具调用 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出NNGPT开源框架,利用大型语言模型实现自我改进的AutoML引擎,通过生成-评估-自我改进闭环自动设计神经网络架构和超参数。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), pp. 5664-5674, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30914 2026-06-01 cs.LG cs.SE 62%

Automating Formal Verification with Reinforcement Learning and Recursive Inference

用强化学习和递归推理自动化形式验证

Max Tan

机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) Massachusetts Institute of Technology(麻省理工学院)

专题命中 工具调用 :tool-use(abstract);分类 cs.LG、cs.SE

AI总结 研究通过可验证奖励的强化学习和验证器引导的推理搜索,提升大语言模型生成验证程序和证明的能力,在Dafny和Lean上取得显著进展。

Comments Master's thesis, 140 pages, 16 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30686 2026-06-01 cs.CR cs.AI cs.LG 62%

Depth-Dependent Indirect Prompt Injection in Tool-Calling ReAct Agents: Injection Depth, Payload Framing, and Turn-Budget Sensitivity

工具调用ReAct代理中深度相关的间接提示注入:注入深度、载荷框架和轮次预算敏感性

Mohammadreza Rashidi

机构 * Department of Computer Science(计算机科学系) AI and Media Analysis Lab(人工智能与媒体分析实验室) Berlin, Germany(柏林,德国)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 通过四个对照实验(共460次试验),研究在工具调用ReAct代理中,注入深度、载荷框架和轮次预算对间接提示注入攻击成功率的影响,发现注入深度是主导变量,且仅清理第一个工具观察可捕获67%的注入成功。

Comments 17 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26711 2026-06-01 cs.CL cs.LG 62%

The Need for an External Observer Formalizing the Sufficiency Gap: A Mathematical Extension of Mixture Identifiability and Contextual Grounding in Sequence Models

外部观察者的必要性:充分性差距的形式化——序列模型中混合可识别性与上下文基础化的数学扩展

Francesco Corielli

专题命中 工具调用 :tool use(abstract);分类 cs.CL、cs.LG

AI总结 本文通过构建二元混合过程,形式化了由未观测隐状态导致的充分性差距,并引入辅助信号建立上下文主导阈值,证明温度缩放无法弥补缺失上下文,而外部观察者或验证器在高风险领域是必要的。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05614 2026-05-29 cs.CL cs.AI 62%

GroundAct: Can LLM Agents Ground Actions in Environmental States?

GroundAct:LLM智能体能否在环境状态中实现动作落地?

Zixuan Wang, Dingming Li, Hongxing Li, Yanrui Miao, Shuo Chen, Yuchen Yan, Wenqi Zhang, Yongliang Shen, Weiming Lu, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学)

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出GroundAct基准,通过1500个场景和16592个任务实例评估15个LLM,发现动作落地能力是多维挑战,不能仅通过模型规模解决。

Comments Project Page: https://zju-real.github.io/OmniEmbodied Code: https://github.com/ZJU-REAL/OmniEmbodied

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22511 2026-05-27 cs.AI cs.CL cs.IR 62%

Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning

Search-E1: 自蒸馏驱动搜索增强推理中的自我进化

Zihan Liang, Yufei Ma, Ben Chen, Zhipeng Qian, Xuxin Zhang, Huangyu Dai, Lingtao Mao

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出Search-E1方法,通过交替使用普通GRPO和在线策略自蒸馏(OPSD),让搜索增强智能体无需外部监督或复杂模块即可自我进化,在七个QA基准上以3B模型超越所有开源基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25832 2026-05-26 cs.RO cs.AI cs.CL cs.CV 62%

When Search Becomes Memory: Turning Robot Design Trials into Transferable Skills

当搜索成为记忆:将机器人设计试验转化为可迁移技能

Yunfei Wang, Xiaohao Xu, Yang Li, Xiaonan Huang

机构 * University of Michigan(密歇根大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出Auto-Robotist,一种自进化LLM代理,通过将形态搜索轨迹提炼为自然语言技能库,实现可迁移的机器人设计知识,在EvoGym任务中提升冷启动搜索并跨设计空间迁移技能。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25749 2026-05-26 cs.IR cs.AI cs.LG 62%

DeGRe: Dense-supervised Generative Reranking for Recommendation

DeGRe: 密集监督的生成式重排序用于推荐

Chaotian Song, Jingyao Zhang, Chenghao Chen, Zisen Sang, Dehai Zhao, Guodong Cao, Boxi Wu, Deng Cai, Jia Jia

机构 * College of Software, Zhejiang University Hangzhou China Rajax Network Technology, Taobao Shangou of Alibaba Hangzhou China Rajax Network Technology, Taobao Shangou of Alibaba Beijing China State Key Lab of CAD\&CG, Zhejiang University Hangzhou China Rajax Network Technology, Taobao Shangou of Alibaba Shanghai China College of Software, Zhejiang University Rajax Network Technology, Taobao Shangou of Alibaba State Key Lab of CAD\&CG, Zhejiang University

专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出DeGRe框架,通过离线探索中的密集监督信号(Lookahead Evaluator)指导在线生成器(Online Generator)进行单步贪婪解码,解决重排序中的启发式标签偏差和信用分配问题。

Comments Accepted to KDD 2026 (ADS Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23655 2026-05-25 cs.CV cs.AI cs.LG cs.MM 62%

CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception

CVSearch:赋予多模态大语言模型认知视觉搜索能力以感知高分辨率图像

Liupeng Li, Haoqian Kang, Zhenyu Lu, Jinpeng Wang, Bin Chen, Ke Chen, Yaowei Wang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究院)

专题命中 工具调用 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出CVSearch,一种无需训练的自适应框架,通过评估-搜索工作流动态调度视觉搜索策略,解决高分辨率图像感知中覆盖与效率的权衡问题。

Comments Accepted by ICML 2026. 22 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22880 2026-05-25 cs.CL cs.AI cs.CY 62%

How Far Will They Go? Red-Teaming Online Influence with Large Language Models

它们会走多远?使用大型语言模型对在线影响力进行红队测试

Daniel C. Ruiz, Anna Serbina, Ashwin Rao, Emilio Ferrara, Luca Luceri

机构 * Information Sciences Institute University of Southern California(信息科学研究所 乌德穆尔特国立大学)

专题命中 工具调用 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一个红队测试框架,通过测量大型语言模型在争议话题上的政治观点表达范围(Overton Window),并量化简单自然语言越狱如何扩展该范围,发现开源LLM在政治表达上存在系统性不对称,且越狱效果因模型系列而异。

Comments 30 pages, 8 figures, submitted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22733 2026-05-22 cs.AI cs.SE 62%

HarnessAPI: A Skill-First Framework for Unified Streaming APIs and MCP Tools

HarnessAPI: 一种以技能为中心的统一流式API和MCP工具框架

Edwin Jose

机构 * Department of Computer Science(计算机科学系)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出HarnessAPI,一种以技能为中心的框架,通过将类型化的技能文件夹作为单一真相源,消除了流式API和MCP工具之间的重复代码,减少了74%的框架层面的样板代码。

详情

展开后加载摘要…

URL PDF HTML 收藏