arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-20 至 2026-07-20 共收录 17 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 17 篇

2607.15901 2026-07-20 cs.AI 新提交 83%

DSWorld: A Data Science World Model for Efficient Autonomous Agents

DSWorld:用于高效自主智能体的数据科学世界模型

Zherui Yang, Fan Liu, Hao Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 Agent评测 :autonomous agent(title);agent(abstract);workflow(abstract);分类 cs.AI

AI总结 研究自主数据科学智能体依赖试错流程效率低的问题,提出数据科学世界模型概念及DSWorld框架,含多种技术。构建数据集并引入优化策略,实验显示其加速智能体训练和推理,在转换预测任务上超基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15545 2026-07-20 cs.MA cs.AI cs.CL 新提交 81%

CoWeaver: A Bi-directional, Learnable and Explainable Matching Engine for Mixed Human-Agent Science Collaboration

CoWeaver:用于混合人机科学协作的双向、可学习且可解释的匹配引擎

Jiayao Gu, Kexin Chu, Peidong Liu, Yue Yang, Lynn Ai, Qi Zhang, Ling Yang, Tianyu Shi

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 研究针对基于大语言模型的智能体在科学协作中存在的问题,提出CoWeaver算法,通过填补能力差距匹配人员,经两阶段排名筛选,结合探索与贪婪策略,在匹配质量和效率上优于基线,能促进人机科学协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24009 2026-07-20 cs.CR cs.AI cs.CL cs.LG 版本更新 80%

Jailbreak Foundry: From Papers to Runnable Attacks for Reproducible Benchmarking

Jailbreak Foundry: 从论文到可运行攻击的可重复基准测试

Zhicheng Fang, Jingjie Zheng, Chenxu Fu, Wei Xu

机构 * Shanghai Qi Zhi Institute(上海启智研究院) Tsinghua University(清华大学) University of Melbourne(墨尔本大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 JAILBREAK FOUNDRY通过多代理工作流将论文转换为可执行模块,实现可重复基准测试的标准化评估和自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04419 2026-07-20 cs.AI 版本更新 79%

Agent Step Value: Auditing Evaluator-Channel Reversals in Black-Box Agent Traces

智能体步骤值:使用基于状态的语言模型评估器进行状态转换测量

Andrew Zhang, Chengzhan Li

机构 * KTH Royal Institute of Technology(皇家理工学院) University of Electronic Science and Technology of China(电子科技大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究提出智能体步骤值(ASV)框架,通过状态转换测量评估智能体动作,能定位最终答案分数等遗漏的关键信息,还介绍了具体方法及工具,并用实验验证其有效性。

Comments adds source-contract intervention and two-wave retry study; re-acquires cube and extends bridge cohort to n=98 to 100

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15696 2026-07-20 cs.IR 新提交 71%

PCTD: Preference-Guided Counterfactual Task Decomposition for Agent Tool Retrieval

PCTD:用于智能体工具检索的偏好引导反事实任务分解

Chu Zhao, Lei Tang, Minghang Li, Jianzhe Zhao, Guibing Guo, Zhengzong Chen, Yuanyuan Zhao, Fei Huang

专题命中 Agent评测 :agent(title)

AI总结 研究针对任务分解中因直接用检索指标作奖励易致奖励作弊及削弱域外泛化能力的问题,提出偏好引导反事实任务分解框架PCTD,通过反事实和偏好奖励改进,构建基准MTDTool,实验证明其在多方面超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16062 2026-07-20 cs.LG cs.AI 新提交 62%

When Model Merging Rivals Joint Multi-Task Reinforcement Learning: A Task-Vector Geometry Analysis

当模型合并与联合多任务强化学习相抗衡时:任务向量几何分析

S. Aaron McClendon

机构 * Aimpoint Digital Labs(Aimpoint数字实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究在强化学习中模型合并能否替代联合多任务训练,通过训练Qwen3 - 8B专家并合并,与联合训练模型对比,发现任务向量几何结构中方向和支持解耦,合并效果与联合训练相当,还发布了代码和统计数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22854 2026-07-20 cs.LG cs.AI math.OC quant-ph stat.ML 版本更新 62%

A Bit of Freedom Goes a Long Way: Classical and Quantum Algorithms for Reinforcement Learning under a Generative Model

一点自由大有可为:生成模型下强化学习的经典与量子算法

Andris Ambainis, Joao F. Doriguello, Debbie Lim

机构 * Center for Quantum Computer Science, Faculty of Computing(量子计算机科学中心,计算学院) University of Latvia(拉脱维亚大学) HUN-REN Alfréd Rényi Institute of Mathematics(匈牙利-中国阿尔弗雷德·雷尼数学研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出学习有限和无限时域MDP的经典与量子在线算法,基于混合模型,能避免一些强化学习范式,直接计算使用最优策略,量子算法突破经典界限,在不同设置下有更好遗憾界及参数依赖性改进。

Comments 31 pages. v3: main text completely restructured and simplified, results for compact spaces have been dropped (to be included elsewhere), fixed a bug on optimal policies for finite-horizon MDPs which weakened a bit one result, expanded the new RL model by including a tunable budget parameter, new results on infinite-horizon discounted MDPs, improved regrets overall

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15883 2026-07-20 cs.HC cs.AI 新提交 57%

Perceived AGI: Believability as Dimensional Completeness, Not Capability

感知通用人工智能:可信度取决于维度完整性,而非能力

Sebastian Cochinescu

机构 * University of Bucharest(布加勒斯特大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨大语言模型在对话中缺乏思维存在感的问题,提出可信度取决于维度完整性的假设,定义了时间、真相、熵和爱四个维度及相关行为立场,识别出行为层,还陈述了可证伪预测,为感知通用人工智能提供概念框架。

Comments 12 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15641 2026-07-20 cs.RO cs.AI 新提交 57%

IMBench: A Benchmark for Intuitive Robotic Manipulation

IMBench:直观机器人操作的基准测试

Anurag Maurya, Sukhvansh Jain, Prajwal Avhad, Gautham Balachandran, Ziyi Zhou, Atharva Kshirsagar, Satyam Singh, Bowen Li. Rishabh Mukund, Ritul Singh, Jatin Vira, Suvonil Chatterjee, Devesh K. Jha

专题命中 Agent评测 :tool use(abstract);分类 cs.AI

AI总结 IMBench旨在评估直观机器人操作这一综合能力,其任务含物理结构推断与动作序列生成。通过35个任务等进行实验,发现视觉语言模型和视觉 - 语言 - 动作模型的不足,为评估和发展物理智能提供基准。

Comments Accepted to SemRob Workshop, RSS 2026. Project Website: https://imbench.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15613 2026-07-20 cs.GT 新提交 56%

Fair Allocation of Divisible Goods under Non-Linear Valuations

非线性估值下可分物品的公平分配

Haris Aziz, Zixu He, Xinhang Lu, Kaiyang Zhou

专题命中 Agent评测 :agent(abstract);autonomous agent(comments)

AI总结 研究非线性估值下可分物品的公平分配问题,针对最大最小份额保证设计算法,给出\(\frac{1}{2n - 1}\)-MMS分配,证明对MMS的近似比例几乎是紧的;还研究无嫉妒性,证明其检查存在性对\(n\)个主体和至少三种物品是NP难的,对单个物品给出多项式时间算法。

Comments Appears in the 24th International Conference on Autonomous Agents and Multiagent Systems (AAMAS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15963 2026-07-20 cs.HC 新提交 50%

A Human-Centric Evaluation of a Retrieval-Augmented Generation System for Explaining Quebec Insurance Contracts

以用户为中心对用于解释魁北克保险合同的检索增强生成系统的评估

David Beauchemin, Richard Khoury

专题命中 Agent评测 :agent(abstract)

AI总结 研究针对在线保险销售中消费者面临的‘建议差距’问题,对用于解释魁北克汽车保险合同的检索增强生成系统进行以用户为中心的评估,通过用户研究得出系统被视为‘认知均衡器’,但也有局限性,凸显人在回路框架在高风险消费金融中实施AI的重要性。

Comments Accepter to HCII 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15782 2026-07-20 cs.CR cs.AR 新提交 50%

Vogls: a Fast Interactive Full-timing Simulator for Pre-silicon Power Side-Channel Analysis

Vogls:用于硅前功率侧信道分析的快速交互式全时序模拟器

Gijs Burghoorn, Ileana Buhan, Lejla Batina

专题命中 Agent评测 :workflow(abstract)

AI总结 研究针对侧信道分析中现有模拟器不足的问题,提出Vogls模拟器。它结合编译代码性能、全时序仿真及细粒度控制,有Python接口和高效跟踪收集工作流程,在案例研究中能在多抽象级别成功恢复密钥。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15862 2026-07-20 math.OC 新提交 50%

PriEco-DRL: Joint Optimization of Electric-Bus Eco-Driving and Transit-Priority Adaptive Signals via Deep Reinforcement Learning

PriEco-DRL:基于深度强化学习的电动公交生态驾驶与公交优先自适应信号联合优化

Dingshan Sun, Ang Li, Chaopeng Tan, Zicheng Su, Wanjing Ma, Marco Rinaldi

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出PriEco-DRL框架,运用深度强化学习将电动公交生态驾驶与公交优先自适应信号控制相结合,采用优先级加权最大压力控制器及结构化奖励,经集中训练和分散执行,实验表明其能降低电动公交能耗,实现能量-时间权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14438 2026-07-20 cs.GT 版本更新 50%

Compensation Design

补偿设计

Ioannis Anagnostides, Kshipra Bhawalkar, Christopher Liaw, Aranyak Mehta, Renato Paes Leme, Yifeng Teng, Grigoris Velegkas, Weiqiang Zheng

专题命中 Agent评测 :agent(abstract)

AI总结 研究分散环境中补偿设计问题,提出简单无视成本且匿名的边际贡献支付规则,证明其在大市场情形下能保证纯纳什均衡存在且PoA至多为\(2 + o_{\lambda}(1)\),还扩展到粗相关均衡等多种情况并给出相应结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03676 2026-07-20 physics.soc-ph cond-mat.stat-mech 版本更新 50%

Entropy Geometry and Condensation in Wealth Allocation

熵几何与财富分配中的凝结现象

Korak Biswas

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种基于统计框架的财富分配模型,揭示了财富凝结现象的形成机制及开放系统中财富分配的动态平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03829 2026-07-20 physics.acc-ph hep-ex 版本更新 50%

First Experimental Demonstration of Reinforcement Learning-Based Tuning on the PSI Injector 2 Cyclotron

基于强化学习的PSI注入器2回旋加速器调谐的首次实验演示

M. Haj Tahar, W. Joho, E. Solodko, M. Bocchio, S. Marquie, M. Busch, A. Barchetti, J. Grillenberger, J. Snuverink, M. Schneider

专题命中 Agent评测 :agent(abstract)

AI总结 研究针对高功率质子回旋加速器束流调谐难题,开发基于机器学习的调谐框架,结合强化学习算法、实时诊断控制及加速器物理启发调整,经12天测试,实现多运行点调谐及策略泛化,是高功率回旋加速器强化学习辅助调谐的首次演示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16495 2026-07-20 eess.SP 版本更新 50%

Performance Evaluation of High Power Microwave Systems Against UAVs A Probabilistic Antenna Propagation Framework with Sensitivity Analysis

高功率微波系统对无人机的性能评估:具有灵敏度分析的概率天线传播框架

Muhammad Khalil, Ke Wang, Jinho Choi

专题命中 Agent评测 :planning(abstract)

AI总结 研究高功率微波系统对无人机性能,提出含随机目标运动等因素的概率框架,耦合多种模型得出相关统计量,分析各因素影响,预测不同目标效能概率,支持系统规模确定、权衡分析及任务规划。

Comments 9

详情

展开后加载摘要…

URL PDF HTML 收藏