Agentic System as Compressor: Quantifying System Intelligence in Bits
智能体系统作为压缩器:用比特数衡量系统智能
机构 * Peking University(北京大学)
专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 提出将智能体系统视为压缩器,通过算术编码等方法以比特数衡量系统智能,在五个任务中验证智能体组件能减少编码长度。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
智能体系统作为压缩器:用比特数衡量系统智能
机构 * Peking University(北京大学)
专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 提出将智能体系统视为压缩器,通过算术编码等方法以比特数衡量系统智能,在五个任务中验证智能体组件能减少编码长度。
Web4 代理经济:景观、挑战与机遇的大规模实证研究
专题命中 工具调用 :agent(title,abstract);autonomous agent(abstract);分类 cs.SE
AI总结 通过分析99,448个多链身份注册、3.17亿交易日志、341个MCP项目源码和349个GitHub问题,首次大规模实证研究Web4代理生态,发现自主代理已建立活跃的机器对机器支付经济,但基础设施不成熟,支付互操作性是主要瓶颈。
红队测试代理型红队
机构 * Cracken ; Information Protection Department, Lviv Polytechnic National University(利沃夫理工学院信息保护系)
专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 本文首次深入分析主流进攻性安全代理系统的安全漏洞,揭示其设计缺陷可导致API密钥泄露、持久化控制及宿主机失陷,并提出架构级缓解设计原则。
Comments v0.1
智能符号搜索:超越手工表达式、网格和神经网络的PDE特征化
机构 * National University of Singapore(新加坡国立大学)
专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.LG
AI总结 提出ASYS框架,通过智能体将PDE理论转化为可微分符号程序,结合进化搜索和梯度优化自动发现解析形式或近似,在多个问题中生成可解释表示。
RODS: 面向多轮工具使用智能体的奖励驱动在线数据合成
机构 * Zhejiang University(浙江大学) ; Shanghai Innovation Institute(上海创新研究院) ; Westlake University(西湖大学)
专题命中 工具调用 :tool-use(title,abstract);agent(abstract);分类 cs.AI
AI总结 针对多轮工具使用强化学习中静态数据集信息样本快速耗尽的问题,提出RODS方法,利用进度奖励方差作为零成本边界检测器,在线合成与智能体能力边界匹配的样本,以约800样本达到17K样本离线管道的性能。
LandslideAgent与多模态LandslideBench:一种面向自主滑坡识别与分析的领域规则增强型智能体
机构 * Central South University(中南大学)
专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI
AI总结 提出指令驱动智能体框架,包含多模态数据集LandslideBench、滑坡专用视觉语言模型LandslideVLM及领域规则增强智能体LandslideAgent,实现自主滑坡识别与分析。
VisualClaw:面向物理世界的实时个性化智能体
机构 * UC Santa Cruz(加州大学圣克鲁兹分校) ; UNC-Chapel Hill(北卡罗来纳大学教堂山分校) ; Google(谷歌) ; UC Berkeley(加州大学伯克利分校)
专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.CL
AI总结 提出VisualClaw,一种自进化多模态智能体,通过混合编码和技能进化机制降低部署成本并提升准确性,在多个视频QA基准上实现平均-98%的API成本削减和最高+15.80%的准确率提升。
Comments H. T. and J. C. contribute to this project equally
AI代理如何重塑知识工作:自主性、效率与范围
机构 * Harvard Business School(哈佛商学院) ; Perplexity AI
专题命中 工具调用 :AI agent(title,abstract);autonomous agent(abstract);分类 cs.AI
AI总结 基于Perplexity产品数据,研究发现AI代理通过端到端任务执行,将自主工作时间从33秒提升至26分钟,完成时间缩短87%,成本降低94%,并扩展了工作范围与认知层次。
IAPO:面向小型多模态代理工具使用的输入归因感知策略优化
机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校)
专题命中 工具调用 :tool use(title,abstract);agentic(abstract);分类 cs.LG
AI总结 提出输入归因感知策略优化(IAPO),通过强化学习对齐模型与教师模型的输入归因,提升多模态小语言模型的工具调用能力,在六个测试集上平均准确率提升3%。
通过不确定性对齐强化学习探索智能体工具调用决策
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 工具调用 :agentic(title);agent(abstract);tool-use(abstract);分类 cs.AI
AI总结 针对智能体工具调用中错误累积问题,提出TRUST方法,将不确定性量化作为排斥力融入奖励设计,并标注轻量关键轮次用于多轮轨迹统一后训练,显著提升决策质量与智能体性能。
LLM智能体故障的实时检测与修复
专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 该研究提出基于LLM智能体步骤遥测的实时故障检测与修复系统,结合单类回声状态网络集成与确定性验证层,可高效检测并修复故障,提升任务成功率且成本极低。
Comments 16 pages, 5 figures. Code, data and demo: github.com/sunnydubey1111/agent-trajectory-sentinel Walkthrough: youtu.be/a05n_000klE
通过带保障的声明式智能体编程学习用于语法约束解码的上下文无关文法
专题命中 工具调用 :agentic(title);agent(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 本研究提出名为Autogrammar的声明式智能体,可从文档和执行数据自动学习上下文无关文法,用于语法约束解码,在三种DSLs上的实验显示其生成的文法性能优于现有基线,能显著提升端到端LM的真实任务表现。
Comments 9 pages, 3 figures, 2 tables
KernelBrain:面向智能体的GPU内核优化的粗到细、预算感知搜索
专题命中 工具调用 :agentic(title);agent(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 KernelBrain是结合LLM引导变异等技术的GPU内核优化智能体,可提升内核质量与搜索效率,在Triton内核任务中获多倍加速且缩短优化时间。
VC-Tooler:学习组合式与自适应视觉工具使用
专题命中 工具调用 :tool use(title,abstract);agentic(abstract)
AI总结 VC-Tooler是一种学习组合式与自适应视觉工具使用的模型,通过分层合成轨迹库与两阶段训练,在通用和具身基准上达到开源模型最优性能,且具良好迁移能力。
迈向智能云管理的系统基础
专题命中 工具调用 :agentic(title,abstract);agent(abstract)
AI总结 研究智能云管理中缺少系统基础的问题,核心方法是开发CloudWeaver智能管理基础架构,贡献在于能跨界面管理,确定会话上下文、协调并发操作,提供安全保证和可追溯反馈,经Azure API工作负载验证。
ReDesign:通过智能分解从图像中恢复可编辑设计结构
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; Helmholtz Munich(慕尼黑亥姆霍兹中心) ; Korea University(韩国大学)
专题命中 工具调用 :agentic(title,abstract);tool use(abstract)
AI总结 研究旨在从图像恢复可编辑设计文件,提出ReDesign智能框架,通过跨模态选工具生成层层次结构,引入优雅验证与评估基准,在视觉保真度和编辑性上表现出色,超越基线和管道。
Comments Accepted to ECCV 2026
AEcroscopyWave:迈向用于智能AI的自动驾驶表征平台
专题命中 工具调用 :agentic(title,abstract);AI agent(abstract)
AI总结 探讨电子材料表征的两种传统方式,介绍“自动驾驶”表征工具进展。基于AEcroscopyWave平台,通过创建控制硬件的API并整合AI方法,弥合行业规模自动化与高度定制系统差距,展示异构仪器供智能体使用的好处。
Comments 17 pages, 5 figures
AoA:基于重新设计语言抽象语法树的定理证明智能体
机构 * Nanyang Technological University Singapore(南洋理工大学新加坡分校) ; Imperial College London London, UK(伦敦帝国理工学院伦敦分校) ; University of Edinburgh Edinburgh, UK(爱丁堡大学爱丁堡分校)
专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 研究针对交互式定理证明中人工操作限制可扩展性及基于LLM的证明智能体成本高的问题,提出将智能体从源文本提升到抽象语法树的方法,实现了AoA,在多个方面有显著提升且解决更多难题。
Comments 13 pages
在智能人工智能时代用于教授和评估计算方法的工具不变框架
专题命中 工具调用 :agentic(title,abstract);agent(abstract)
AI总结 探讨在智能人工智能时代计算方法教学与评估,提出工具不变框架,指出验证是关键技能,阐述评估变化,介绍针对小班课程的实际应对,强调计算物理课程中学生解释和捍卫计算工件能力的重要性。
基于证据的可验证智能推理:通过工具验证内核证明消除经验推理中语言模型幻觉的途径
专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 研究旨在消除语言模型经验推理中的幻觉,提出基于Lean 4的EG-VAR工具调用架构,通过工具验证公理等生成可验证声明,经实验在数值推理等测试中表现良好,定位为高风险经验声明的技术治理接口,可审计相关条件并转化错误为审计目标。
Comments Accepted at the ICML 2026 TAIGR workshop. System name: EG-VAR
在基于代理的城市交通模拟中评估用于决策的大语言模型
专题命中 工具调用 :agent(title,abstract);multi-agent(abstract)
AI总结 研究在多智能体模拟中集成大语言模型作为决策组件,提出混合架构,通过API连接GAMA平台与外部基于大语言模型的模块,能指导智能体重规划行为,比较不同场景下效果,显示其可丰富行为表示。
委托权:AI代理时代中的财产、代理与投资激励
专题命中 工具调用 :AI agent(title,abstract);agent(abstract)
AI总结 本文定义委托权为账户持有人授权代理执行的可撤销、身份保留、范围受限且模式特定的权限,通过三方不完全契约模型分析平台控制、用户控制与认证委托三种机制对投资激励和风险分配的影响。
ForecastAgentSearch:面向地缘政治事件预测的多专家智能体搜索系统
专题命中 工具调用 :agent(title,abstract);multi-agent(abstract)
AI总结 提出ForecastAgentSearch框架,将地缘政治事件预测建模为多专家智能体搜索问题,通过检索、排序和协调专业智能体生成预测,并讨论关键设计挑战与评估方案。
Journal ref SIGIR 2026 AgentSearch Workshop
SimpleSearch-VL:多模态智能深度搜索的简单配方
机构 * Southeast University(东南大学) ; Ant Group(蚂蚁集团)
专题命中 工具调用 :agentic(title,abstract);agent(abstract)
AI总结 提出SimpleSearch-VL框架,通过因子化自适应展开和证据验证推理提升多模态智能搜索的效率与可靠性,仅用少量数据即显著超越基线。
Comments Technical Report
可迁移的自演化剧本用于智能体安全审计
专题命中 工具调用 :agentic(title);agent(abstract);tool use(abstract)
AI总结 提出EvoHunt框架,通过审计、评估和修订三个智能体循环演化空剧本,自动生成安全审计程序知识,开源演化可超越商业产品,且演化后的剧本可迁移至弱智能体提升其能力。
PACT: 多轮工具使用智能体的特权轨迹协同训练
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Ohio State University(俄亥俄州立大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Arizona State University(亚利桑那州立大学)
专题命中 工具调用 :tool-use(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出PACT框架,通过特权轨迹(专家轨迹)在训练时提供密集监督信号,结合轨迹条件RL和组件感知SFT损失,避免推理时依赖轨迹,显著提升多轮工具使用智能体的性能。
Comments Project page: https://zhenbangdu.github.io/pact-project-page/
基于大语言模型的自动化计算物理发现智能体
专题命中 工具调用 :agent(title,abstract);autonomous agent(abstract)
AI总结 提出PhyNex智能体,结合大语言模型引导搜索与领域工具,通过渐进局部搜索和知识积累,在三个物理问题上实现与人类专家相当或更优的解决方案。
面向智能体搜索的交互空间检索
专题命中 工具调用 :agentic(title,abstract);agent(abstract)
AI总结 提出RISE方法,通过BM25构建有边界的交互空间,并预处理文档支持shell式导航,在BrowseComp-Plus上以约四分之一成本达到78%准确率,优于纯shell基线。
软件委托合约:衡量AI编码代理工作中的可审查性
机构 * Independent Researcher(独立研究员)
专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 研究通过显式委托合约提升AI编码代理工作可审查性,实验发现合约虽不改善任务正确性,但显著提高证据充分性和降低审查歧义。
Comments 11 pages; empirical pilot study with 64 coding-agent runs and 192 blinded reviews
CRAFT:学习模式,执行计划
机构 * Amazon Advertising Foundations(亚马逊广告基金会) ; Amazon Web Services Agentic AI(亚马逊网络服务代理人工智能)
专题命中 工具调用 :agent(abstract);tool-use(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 研究企业编码代理将自然语言分析请求转换为可执行代码时的问题,提出两阶段训练后方法 CRAFT,先进行模式剥离的 PLAN 监督微调,再用执行形状的强化学习,评估显示其在多方面有提升并减少负担。