arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-02 至 2026-07-02 共收录 25 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 25 篇

2607.00939 2026-07-02 cs.SE quant-ph 新提交 85%

Leveraging LLM-Based Agentic Systems to Generate Quantum Applications for Test Optimization

利用基于LLM的代理系统生成量子应用以优化测试

Ming Tao, Yuechen Li, Tao Yue, Man Zhang, Aitor Arrieta Marcos

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 提出QPipe,一种基于大语言模型的多代理架构,自动将自然语言需求转化为可执行的量子应用工作流,在测试优化问题上实现高编译率和执行率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00345 2026-07-02 cs.SE 新提交 83%

Registry-Governed Agent Lifecycle:Completing EDDOps with Evaluation-DrivenRegistration, Promotion, and Retirement on AWS AgentCore

注册表治理的智能体生命周期:通过评估驱动的注册、晋升和退役在 AWS AgentCore 上完善 EDDOps

Richard Kang, Vincent Wang

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 提出 EDDOps 在 AWS Bedrock AgentCore 上的实践实例,通过成本-性能框架和注册表治理,将模型选择从基准排名转化为受治理的经济决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11103 2026-07-02 cs.AI cs.CL cs.SE 版本更新 82%

GameDevBench: Evaluating Agentic Capabilities Through Game Development

GameDevBench: 通过游戏开发评估智能体能力

Wayne Chi, Yixiong Fang, Arnav Yayavaram, Siddharth Yayavaram, Seth Karten, Qiuhong Anna Wei, Runkun Chen, Alexander Wang, Valerie Chen, Ameet Talwalkar, Chris Donahue

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 提出GameDevBench基准,包含333个游戏开发任务,评估智能体在多模态软件开发中的能力,发现最佳智能体仅解决53.8%任务,并引入视觉反馈机制提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01136 2026-07-02 cs.SE cs.AI 新提交 81%

Skills Are Not Islands: Measuring Dependency and Risk in Agent Skill Supply Chains

技能并非孤岛:衡量智能体技能供应链中的依赖性与风险

Changguo Jia, Tianqi Zhao, Runzhi He, Minghui Zhou

机构 * Peking University(北京大学) Zhongguancun Laboratory(中关村实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 提出智能体技能供应链(ASSC)概念,设计SkillDepAnalyzer工具从自然语言中提取依赖关系,在超143万技能上揭示四种结构模式和安全风险,建议类型化依赖清单和风险预警审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00304 2026-07-02 cs.LG cs.AI cs.CL 新提交 78%

Mapping the Evaluation Frontier: An Empirical Survey of the Bias-Reliability Tradeoff Across Eleven Evaluator-Agent Conditions

映射评估前沿:跨11种评估器-智能体条件的偏差-可靠性权衡的实证调查

Zewen Liu

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL、cs.LG

AI总结 通过扩展至11种评估条件,实证验证了LLM评估系统中评估器耦合、策略多样性与小样本测量可靠性之间的权衡,并发布了标准化基准数据集。

Comments 5 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12243 2026-07-02 cs.CL cs.AI 版本更新 73%

Continuous Knowledge Metabolism: Generating Scientific Hypotheses from Evolving Literature

连续知识代谢:从演进文献中生成科学假设

Jinkai Tao, Yubo Wang, Xiaoyu Liu, Menglin Yang

机构 * Tsingyuai(清华院)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 本文提出CKM框架,通过滑动时间窗口处理文献并动态更新知识库,提出CKM-Lite和CKM-Full两种变体,揭示了增量处理在预测和效率上的优势,以及知识变化对假设生成的影响。

Comments ICML 2026 AI4Research Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00627 2026-07-02 cs.AI 新提交 70%

AGI Maze as a Benchmark Framework for World-Modeling Agents

AGI Maze:作为世界建模智能体的基准框架

Alexey Potapov

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出AGI Maze框架,通过部分可观测网格迷宫任务评估LLM构建世界状态表示的能力,发现标准LLM在推理时无法内部表示迷宫,即使借助工作记忆也难以可靠求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30863 2026-07-02 cs.AI 新提交 70%

Beyond expert users: agents should help users construct preferences, not just elicit them

超越专家用户:智能体应帮助用户构建偏好,而不仅仅是引出偏好

Irena Saracay, Ludwig Schmidt, Carlos Guestrin

机构 * Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出用户通常不具备完整偏好,智能体应通过示例或解释帮助用户学习领域知识以构建偏好,并基于信息经济学引入CoPref模型,在推荐系统中通过CoShop基准测试发现现有智能体表现不佳。

Comments Update URLs

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00926 2026-07-02 cs.LG cs.AI 新提交 62%

Human-Machine Collaboration on Generative Meta-Learning: Model and Algorithm

人类与机器在生成式元学习中的协作:模型与算法

Midhun Parakkal Unni, Samuel Kaski

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院) Centre for Machine intelligence, University of Sheffield(谢菲尔德大学机器智能中心) ELLIS Institute Finland(芬兰ELLIS研究所) Department of Computer Science, Aalto University(阿尔托大学计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出生成式元学习与人类反馈框架,通过专家直觉引导数据合成,利用条件神经ODE和强化学习迭代优化生成轨迹,理论证明分布对齐降低泛化误差,实验验证在分布偏移下提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00733 2026-07-02 cs.LG cs.AI 新提交 62%

LLM-Guided ODE Discovery and Parameter Inference from Small-Cohort Aggregate Data

LLM引导的ODE发现与小群体聚合数据的参数推断

Hanning Yang, Meropi Karakioulaki, Lennart Purucker, Tim Litwin, Cristina Has, Moritz Hess

机构 * Institute of Medical Biometry and Statistics, Faculty of Medicine and Medical Center, University of Freiburg(弗莱堡大学医学中心与医学院医学统计与生物统计研究所) Department of Dermatology, Medical Faculty and Medical Center, University of Freiburg(弗莱堡大学医学中心与医学院皮肤科) Prior Labs, University of Freiburg(弗莱堡大学Prior实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出AgentODE框架,利用LLM提出候选ODE结构,并通过工具增强的推理代理仅基于群体级汇总统计量迭代优化参数分布,实现从稀疏、噪声数据中发现可解释的ODE结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01034 2026-07-02 cs.CL cs.AI cs.HC 新提交 62%

Behavior-Adaptive Conversational Agents: Toward a Fluid Personality Framework

行为自适应对话代理:迈向流动人格框架

Hasibur Rahman, Smit Desai

机构 * Northeastern University(东北大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出流动人格框架,根据任务上下文、用户目标和情境紧迫性,动态调整代理的隐喻角色和人格表达强度,以提升用户信任和体验。

Comments Presented at Bridging AI and Behavior Change, a Bridge Program organized at the AAAI Conference on Artificial Intelligence 2026 (AAAI-2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31522 2026-07-02 cs.CL cs.AI 新提交 62%

FinPersona-Bench: A Benchmark for Longitudinal Psychometric Stability of Autonomous Financial Agents

FinPersona-Bench: 自主金融代理纵向心理测量稳定性的基准

Muhammad Usman Safder, Ayesha Gull, Rania Elbadry, Fan Zhang, Yankai Chen, Xueqing Peng, Xue, Liu, Preslav Nakov, Zhuohan Xie

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) The University of Tokyo(东京大学) McGill University(麦吉尔大学) The Fin AI(Fin AI公司) Kyoto University(京都大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出FinPersona-Bench基准,通过合成市场分离价格与价值,评估LLM金融代理在长期部署中指令显著性衰减现象,发现指令重固化的效果因代理类型和市场环境而异。

Comments 29 pages, includes figures and tables; formalizes Mandate Salience Decay and introduces FinPersona-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13715 2026-07-02 cs.AI cs.CL cs.MA 新提交 62%

WorkBench Revisited: Workplace Agents Two Years On

WorkBench 再探:两年后的工作场所智能体

Olly Styles, Sam Miller

机构 * Independent researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文重新评估2024至2026年间WorkBench基准上智能体的进展,发现前沿模型在能力和安全性上均有显著提升,但开放权重模型降低了高性能门槛。

Comments 8 pages, 3 figures. Follow-up to arXiv:2405.00823

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14354 2026-07-02 cs.LG cs.AI cs.RO 版本更新 62%

Deconfounded Lifelong Learning for Autonomous Driving via Dynamic Knowledge Spaces

通过动态知识空间实现自动驾驶的去混淆终身学习

Jiayuan Du, Yuebing Song, Yiming Zhao, Xianghui Pan, Jiawei Lian, Yuchu Lu, Liuyi Wang, Chengju Liu, Qijun Chen

机构 * Tongji University(同济大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DeLL框架,结合DPMM与因果推理的front-door调整机制,构建动态知识空间以解决自动驾驶中的灾难性遗忘和知识迁移问题,并引入进化轨迹解码器提升规划能力。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14232 2026-07-02 cs.LG cs.AI cs.CV 版本更新 62%

KAGE-Bench: Fast Known-Axis Visual Generalization Evaluation for Reinforcement Learning

KAGE-Bench:面向强化学习的已知轴视觉泛化快速评估

Egor Cherepanov, Daniil Zelezetsky, Alexey K. Kovalev, Aleksandr I. Panov

机构 * AXXX, Moscow, Russia(AXXX,莫斯科,俄罗斯) MIRAI, Moscow, Russia(MIRAI,莫斯科,俄罗斯)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出KAGE-Bench基准,通过解耦视觉轴独立评估像素策略在视觉分布偏移下的泛化能力,发现背景和光度偏移严重影响性能,而智能体外观偏移影响较小。

Comments 41 pages, 47 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00512 2026-07-02 cs.LG stat.ML 新提交 57%

From Structural Equation Modelling to Double Machine Learning: Robustness Analysis for Survey-Based Research

从结构方程模型到双机器学习:基于调查研究的鲁棒性分析

Ka Ching Chan, Qiana Liu, Sanjib Tiwari, Ranga Chimhundu

机构 * School of Business, Law, Humanities and Pathways(商学院、法律、人文与路径学院)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 提出一个分阶段鲁棒性分析框架,结合SEM、OLS和双机器学习,通过FinTech数字客户亲密调查模型验证,识别稳定与需谨慎解释的关系,并提供可复现模板。

Comments 21 pages, 1 figure, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00436 2026-07-02 cs.AI 新提交 57%

PHREEQC-MCQ-200: A Diagnostic Benchmark for Tool-Augmented Scientific Simulator Agents

PHREEQC-MCQ-200:用于工具增强型科学模拟智能体的诊断基准

Ke Zhang, Sahchit Chundur, Mohammad Javad Qomi, Maziar Raissi

机构 * University of California, Riverside(加州大学河滨分校) University of California, Irvine(加州大学尔湾分校)

专题命中 Agent评测 :tool use(abstract);分类 cs.AI

AI总结 提出PHREEQC-MCQ-200基准,评估工具增强型智能体在地球化学模拟中的表现,发现模拟器访问显著提升准确率但存在非单调性,输出访问协议影响性能。

Comments 30 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08625 2026-07-02 cs.CL 新提交 57%

From Holistic Evaluation to Structured Criteria: Rubrics Across the Evolving LLM Landscape

从整体评估到结构化标准:大语言模型演变中的评分准则

Hao Chen, Ziyu Han, Yukun Yan, Qingfu Zhu, Maosong Sun, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心) Department of Computer Science and Technology, Institute for AI(计算机科学与技术系,人工智能研究院)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.CL

AI总结 本文提出评分准则作为统一框架,通过分解整体判断为可验证维度、提供过程级反馈和动态涌现自模型行为三个层次,连接人类意图与机器行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17156 2026-07-02 cs.LG cs.RO 57%

Path Following and Stabilisation of a Bicycle Model using a Reinforcement Learning Approach

使用强化学习方法对自行车模型进行路径跟随与稳定化

Sebastian Weyrer, Peter Manzl, A. L. Schwab, Johannes Gerstmayr

机构 * Department of Mechatronics, University of Innsbruck(因斯布鲁克大学机电工程系) Department of Biomechanical Engineering, Delft University of Technology(代尔夫特理工大学生物力学工程系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出一种基于强化学习的路径跟随与稳定化方法,通过虚拟自行车模型在复杂路径上实现稳定控制,采用PD控制器将转向角度转换为转向力矩,通过课程学习策略优化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01159 2026-07-02 cs.GT cs.DM cs.DS 新提交 50%

Online Fair Division Meets Reordering Buffers

在线公平分配遇上重排序缓冲区

Georgios Amanatidis, Giulio Giaconi, Evangelos Markakis, Nicos Protopapas

专题命中 Agent评测 :agent(abstract)

AI总结 研究在线公平分配不可分割混合物品问题,通过引入有限大小的缓冲区,在个性化k-值实例中实现每个时间步EF1且大多数时间步EF的分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00258 2026-07-02 cs.SI 新提交 50%

Joint Effects of Recommender Systems and Network Structure on the Visibility of Content and Creators

推荐系统与网络结构对内容和创作者可见性的联合影响

Virginia Morini, Valentina Pansanella, Luca Pappalardo, Dino Pedreschi, Giulio Rossetti

专题命中 Agent评测 :agent(abstract)

AI总结 通过基于代理的模拟,研究推荐逻辑(流行度与协同过滤)和网络拓扑如何共同塑造社交媒体中内容和创作者的可见性分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00175 2026-07-02 cs.GT 新提交 50%

Knowing Who, Not How Much: Learning-Augmented Mechanisms for Consumer Utility Maximization

知道谁,而非多少:面向消费者效用最大化的学习增强机制

Kira Goldner, Divyarthi Mohan, Thodoris Tsilivis

专题命中 Agent评测 :agent(abstract)

AI总结 研究在线随机顺序模型中战略代理的消费者效用最大化问题,通过识别最高价值代理的身份预测,设计了一个确定性的真实机制,在预测正确时实现常数近似最优解,在预测错误时仍保证常数近似最优可实施解。

Comments Accepted at the Forty-third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01059 2026-07-02 cs.GT cs.DS math.CO 新提交 50%

Fair Allocation under Conflict Constraints via Strong Colorability

冲突约束下的公平分配问题:基于强可着色性

Ishay Haviv

专题命中 Agent评测 :agent(abstract)

AI总结 研究冲突约束下公平分配问题,引入强色数层次结构,证明SD-EF1、EF1和EF[1,1]公平分配的存在性与算法条件,给出最大度相关的最优界限。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31037 2026-07-02 cs.RO 新提交 50%

Labimus: A Simulation and Benchmark for Humanoid Dexterous Manipulation in Chemical Laboratory

Labimus: 化学实验室中类人灵巧操作的仿真与基准

Yuhan Wu, Zhao Jin, Tao Li, Yuheng Zhang, Zhichao Wang, Shuo Wang, Jun Jiang, Xiaobo Li, Yanyong Zhang, Jian Tang, Zhengping Che, Yan Xia

机构 * University of Science and Technology of China(中国科学技术大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 Agent评测 :workflow(abstract)

AI总结 提出Labimus,首个针对有机化学实验室中类人灵巧操作的基准,通过真实到仿真建模重建30多个功能资产,定义原子操作和称重流程,揭示任务完成与实验精度之间的差距。

Comments Project page: https://labimus.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11214 2026-07-02 cs.GT 版本更新 50%

Algorithmic Fair Contracts

算法公平合同

Matteo Castiglioni, Junjie Chen, Yingkai Li

专题命中 Agent评测 :agent(abstract)

AI总结 研究委托-代理中公平合同的设计,证明无嫉妒合同存在但优化收入是NP难的,并给出常数任务或常数代理下的可计算情形及公平代价分析。

Comments some improvements

详情

展开后加载摘要…

URL PDF HTML 收藏