arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-08 至 2026-07-08 共收录 162 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 18 篇

2607.06229 2026-07-08 cs.CL cs.AI cs.DB 新提交 62%

Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows

Spider 2.0-AIFunc:将现实世界的文本到SQL扩展到人工智能原生SQL工作流程

Tianyang Liu, Canwen Xu, Fangyu Lei, Nikki Lijing Kuang, Jixuan Chen, Tao Yu, Julian McAuley, Zhewei Yao, Yuxiong He

机构 * UC San Diego(加州大学圣地亚哥分校) Snowflake AI Research(Snowflake人工智能研究院) University of Hong Kong(香港大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究针对现有文本到SQL基准无法评估模型生成人工智能原生SQL能力的问题,构建Spider 2.0-AIFunc基准,经特定管道和多轮验证,评估十个先进语言模型,发现准确率差距及传统代理框架转移无效等情况。

Comments 24 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00476 2026-07-08 cs.AI 版本更新 57%

Doing What They Say, Not What They Reason: Locating the Faithfulness Gap in LLM Agents

做他们所说的,而不是他们所推理的:定位LLM智能体中的忠实性差距

Yufeng Wang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 通过将忠实性差距分解为推理-结论和结论-行动两个步骤,在可控的德克萨斯扑克模拟器中研究LLM智能体是否按照其陈述的推理行动。

Comments submitted to COLM social simulation with LLM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06126 2026-07-08 stat.AP 新提交 50%

Causal Inference with Video Features as Treatments

以视频特征为处理因素的因果推断

Kentaro Nakamura, Adam Breuer, Michael H. Crespin, Bryce J. Dietrich, Kosuke Imai

专题命中 Agent评测 :AI agent(abstract)

AI总结 研究以视频特征为处理因素的因果推断问题,核心方法是用深度生成模型及纵向神经网络架构,主要贡献为开发新统计方法,可探究视频视觉特征对观众反应的影响并用于方法基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06440 2026-07-08 cs.CV 新提交 50%

PIPBench: A Profile-Inclusive Framework for Personalized Image Generation Evaluation

PIPBench:用于个性化图像生成评估的包含个人资料的框架

Yuhang Wu, Shuxiang Zhang, Wee Hian Ching, Chi Zhang, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Shanghai Qi Zhi Institute(上海启智研究院)

专题命中 Agent评测 :agent(abstract)

AI总结 研究个性化图像生成问题,引入PIPBench基准及新数据构建管道,利用心理和人口统计学资料维度收集数据,全面评估代表性方法,揭示现有方法局限,为个性化文本到图像合成带来新挑战与机遇。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06000 2026-07-08 cs.CR 新提交 50%

Context-to-Execution Integrity for LLM Agents

语言模型代理的上下文到执行完整性

Igor Santos-Grueiro

专题命中 Agent评测 :agent(abstract)

AI总结 研究语言模型代理执行中的上下文到执行完整性问题,提出CXI系统,通过策略标记、类型化释放等机制保障安全执行,经多方面评估,在AgentDojo和代码代理基准测试等中取得良好效果,确保权限绑定才允许执行。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11692 2026-07-08 physics.soc-ph 版本更新 50%

Topology-dependent criticality in triplet majority-rule dynamics with collective reversal on quenched networks

三元多数规则动力学中拓扑依赖的临界性

Roni Muslim

专题命中 Agent评测 :agent(abstract)

AI总结 研究三元多数规则意见动力学模型中拓扑对临界点的影响,揭示网络结构如何改变临界点位置及临界指数。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14668 2026-07-08 cs.GT 版本更新 50%

Near-Optimal Best-of-Both-Worlds Fairness for Few Agents

少数代理的近似最优两全其美公平性

Moshe Babaioff, Gefen Frosh

专题命中 Agent评测 :agent(abstract)

AI总结 研究少数代理不可分商品公平分配问题,设计多项式时间BoBW算法,为三个代理实现近似最优公平性,给出两个代理最优结果,包括分配比例、EFX准则及FPTAS等,匹配多项式时间内最强保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08317 2026-07-08 math.OC 版本更新 50%

Stationary Mean-Field Games of Singular Control under Knightian Uncertainty

奈特不确定性下奇异控制的平稳平均场博弈

Giorgio Ferrari, Ioannis Tzouanas

专题命中 Agent评测 :agent(abstract)

AI总结 研究奈特不确定性下奇异控制的平稳平均场博弈,主体通过单边奇异随机控制调整动力学以最大化奖励,利用构造性方法证明平稳平均场均衡的存在唯一性,并给出数值基准及分析不确定性对均衡的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 4 篇

2607.06349 2026-07-08 cs.AI 新提交 79%

TopoBrick: Agentic Topology Sampling of Exogenous Variables for Zero-Shot Building IoT Forecasting

TopoBrick:用于零样本建筑物联网预测的外源变量的智能拓扑采样

Xiachong Lin, Du Yin, Arian Prabowo, Hao Xue, Wen Hu, Imran Razzak, Matthew Amos, Sam Behrens, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) MBZUAI(穆罕默德·本·扎耶德人工智能大学) CSIRO Energy Centre(联邦科学与工业研究组织能源中心)

专题命中 其他Agent :agentic(title,abstract);分类 cs.AI

AI总结 针对建筑物联网预测中现有方法的不足,提出无训练框架TopoBrick,利用建筑知识图和智能拓扑采样器选择外源变量,按部署时间可用性组织,在三座真实建筑实验中性能出色,拓扑感知采样更可靠。

Comments 12 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23471 2026-07-08 cs.CY 版本更新 78%

Regulating AI Agents

调控人工智能代理

Kathrin Gardhouse, Amin Oueslati, Noam Kolt

专题命中 其他Agent :AI agent(title,abstract)

AI总结 本文分析欧盟人工智能法案在应对人工智能代理治理挑战中的不足,指出传统监管框架难以适应新型AI技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05132 2026-07-08 cs.CY cs.CL 新提交 57%

When Agents Lie: Premeditation, Persistence, and Exploitation in Repeated Games

智能体何时撒谎:重复博弈中的预谋、持续性与可利用性研究

Jerick Shi, Terry Jingcheng Zhang, Bernhard Schölkopf, Vincent Conitzer, Zhijing Jin

机构 * Carnegie Mellon University(卡内基梅隆大学) Vector Institute(向量研究所) University of Toronto(多伦多大学) EuroSafeAI

专题命中 其他Agent :autonomous agent(abstract);分类 cs.CL

AI总结 本文针对大语言模型智能体行动前公示意图的诚信问题,设计三阶段n人重复博弈协议,评测前沿模型,发现其偏离公示行为多属预谋,不同模型对公示的语义理解不兼容。

Comments Best Paper Award at ICML NExT-Game Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09846 2026-07-08 cs.SE cs.CY 版本更新 57%

Identifying and Prioritizing Generative AI Use Cases in an Organization: An Industrial Case Study

识别组织中生成式人工智能的用例并确定其优先级:一个行业案例研究

Malik Abdul Sami, Zeeshan Rasheed, Meri Olenius, Muhammad Waseem, Kai-Kristian Kemell, Jussi Rasku, Pekka Abrahamsson

专题命中 其他Agent :agentic(abstract);分类 cs.SE

AI总结 本研究以能源公司为例,通过半结构化访谈等收集数据,分析员工对人工智能采用的理解,确定其有用领域及引入方式,为能源行业人工智能应用提供概述及实施切入点,助力跨行业比较研究。

详情

展开后加载摘要…

URL PDF HTML 收藏