arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-02 至 2026-07-02 共收录 162 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 25 篇

2603.14354 2026-07-02 cs.LG cs.AI cs.RO 版本更新 62%

Deconfounded Lifelong Learning for Autonomous Driving via Dynamic Knowledge Spaces

通过动态知识空间实现自动驾驶的去混淆终身学习

Jiayuan Du, Yuebing Song, Yiming Zhao, Xianghui Pan, Jiawei Lian, Yuchu Lu, Liuyi Wang, Chengju Liu, Qijun Chen

机构 * Tongji University(同济大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DeLL框架,结合DPMM与因果推理的front-door调整机制,构建动态知识空间以解决自动驾驶中的灾难性遗忘和知识迁移问题,并引入进化轨迹解码器提升规划能力。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14232 2026-07-02 cs.LG cs.AI cs.CV 版本更新 62%

KAGE-Bench: Fast Known-Axis Visual Generalization Evaluation for Reinforcement Learning

KAGE-Bench:面向强化学习的已知轴视觉泛化快速评估

Egor Cherepanov, Daniil Zelezetsky, Alexey K. Kovalev, Aleksandr I. Panov

机构 * AXXX, Moscow, Russia(AXXX,莫斯科,俄罗斯) MIRAI, Moscow, Russia(MIRAI,莫斯科,俄罗斯)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出KAGE-Bench基准,通过解耦视觉轴独立评估像素策略在视觉分布偏移下的泛化能力,发现背景和光度偏移严重影响性能,而智能体外观偏移影响较小。

Comments 41 pages, 47 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00512 2026-07-02 cs.LG stat.ML 新提交 57%

From Structural Equation Modelling to Double Machine Learning: Robustness Analysis for Survey-Based Research

从结构方程模型到双机器学习:基于调查研究的鲁棒性分析

Ka Ching Chan, Qiana Liu, Sanjib Tiwari, Ranga Chimhundu

机构 * School of Business, Law, Humanities and Pathways(商学院、法律、人文与路径学院)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 提出一个分阶段鲁棒性分析框架,结合SEM、OLS和双机器学习,通过FinTech数字客户亲密调查模型验证,识别稳定与需谨慎解释的关系,并提供可复现模板。

Comments 21 pages, 1 figure, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00436 2026-07-02 cs.AI 新提交 57%

PHREEQC-MCQ-200: A Diagnostic Benchmark for Tool-Augmented Scientific Simulator Agents

PHREEQC-MCQ-200:用于工具增强型科学模拟智能体的诊断基准

Ke Zhang, Sahchit Chundur, Mohammad Javad Qomi, Maziar Raissi

机构 * University of California, Riverside(加州大学河滨分校) University of California, Irvine(加州大学尔湾分校)

专题命中 Agent评测 :tool use(abstract);分类 cs.AI

AI总结 提出PHREEQC-MCQ-200基准,评估工具增强型智能体在地球化学模拟中的表现,发现模拟器访问显著提升准确率但存在非单调性,输出访问协议影响性能。

Comments 30 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08625 2026-07-02 cs.CL 新提交 57%

From Holistic Evaluation to Structured Criteria: Rubrics Across the Evolving LLM Landscape

从整体评估到结构化标准:大语言模型演变中的评分准则

Hao Chen, Ziyu Han, Yukun Yan, Qingfu Zhu, Maosong Sun, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心) Department of Computer Science and Technology, Institute for AI(计算机科学与技术系,人工智能研究院)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.CL

AI总结 本文提出评分准则作为统一框架,通过分解整体判断为可验证维度、提供过程级反馈和动态涌现自模型行为三个层次,连接人类意图与机器行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17156 2026-07-02 cs.LG cs.RO 57%

Path Following and Stabilisation of a Bicycle Model using a Reinforcement Learning Approach

使用强化学习方法对自行车模型进行路径跟随与稳定化

Sebastian Weyrer, Peter Manzl, A. L. Schwab, Johannes Gerstmayr

机构 * Department of Mechatronics, University of Innsbruck(因斯布鲁克大学机电工程系) Department of Biomechanical Engineering, Delft University of Technology(代尔夫特理工大学生物力学工程系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出一种基于强化学习的路径跟随与稳定化方法,通过虚拟自行车模型在复杂路径上实现稳定控制,采用PD控制器将转向角度转换为转向力矩,通过课程学习策略优化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01159 2026-07-02 cs.GT cs.DM cs.DS 新提交 50%

Online Fair Division Meets Reordering Buffers

在线公平分配遇上重排序缓冲区

Georgios Amanatidis, Giulio Giaconi, Evangelos Markakis, Nicos Protopapas

专题命中 Agent评测 :agent(abstract)

AI总结 研究在线公平分配不可分割混合物品问题,通过引入有限大小的缓冲区,在个性化k-值实例中实现每个时间步EF1且大多数时间步EF的分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00258 2026-07-02 cs.SI 新提交 50%

Joint Effects of Recommender Systems and Network Structure on the Visibility of Content and Creators

推荐系统与网络结构对内容和创作者可见性的联合影响

Virginia Morini, Valentina Pansanella, Luca Pappalardo, Dino Pedreschi, Giulio Rossetti

专题命中 Agent评测 :agent(abstract)

AI总结 通过基于代理的模拟,研究推荐逻辑(流行度与协同过滤)和网络拓扑如何共同塑造社交媒体中内容和创作者的可见性分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00175 2026-07-02 cs.GT 新提交 50%

Knowing Who, Not How Much: Learning-Augmented Mechanisms for Consumer Utility Maximization

知道谁,而非多少:面向消费者效用最大化的学习增强机制

Kira Goldner, Divyarthi Mohan, Thodoris Tsilivis

专题命中 Agent评测 :agent(abstract)

AI总结 研究在线随机顺序模型中战略代理的消费者效用最大化问题,通过识别最高价值代理的身份预测,设计了一个确定性的真实机制,在预测正确时实现常数近似最优解,在预测错误时仍保证常数近似最优可实施解。

Comments Accepted at the Forty-third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01059 2026-07-02 cs.GT cs.DS math.CO 新提交 50%

Fair Allocation under Conflict Constraints via Strong Colorability

冲突约束下的公平分配问题:基于强可着色性

Ishay Haviv

专题命中 Agent评测 :agent(abstract)

AI总结 研究冲突约束下公平分配问题,引入强色数层次结构,证明SD-EF1、EF1和EF[1,1]公平分配的存在性与算法条件,给出最大度相关的最优界限。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31037 2026-07-02 cs.RO 新提交 50%

Labimus: A Simulation and Benchmark for Humanoid Dexterous Manipulation in Chemical Laboratory

Labimus: 化学实验室中类人灵巧操作的仿真与基准

Yuhan Wu, Zhao Jin, Tao Li, Yuheng Zhang, Zhichao Wang, Shuo Wang, Jun Jiang, Xiaobo Li, Yanyong Zhang, Jian Tang, Zhengping Che, Yan Xia

机构 * University of Science and Technology of China(中国科学技术大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 Agent评测 :workflow(abstract)

AI总结 提出Labimus,首个针对有机化学实验室中类人灵巧操作的基准,通过真实到仿真建模重建30多个功能资产,定义原子操作和称重流程,揭示任务完成与实验精度之间的差距。

Comments Project page: https://labimus.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11214 2026-07-02 cs.GT 版本更新 50%

Algorithmic Fair Contracts

算法公平合同

Matteo Castiglioni, Junjie Chen, Yingkai Li

专题命中 Agent评测 :agent(abstract)

AI总结 研究委托-代理中公平合同的设计,证明无嫉妒合同存在但优化收入是NP难的,并给出常数任务或常数代理下的可计算情形及公平代价分析。

Comments some improvements

详情

展开后加载摘要…

URL PDF HTML 收藏