arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-10 至 2026-07-10 共收录 17 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 17 篇

2607.08495 2026-07-10 cs.CY cs.AI 新提交 85%

The Context Access Divide: Interaction-Level Architecture as a Complementary Dimension of Agentic Inequality

上下文访问鸿沟:交互级架构作为智能不平等的补充维度

Masahiro Fujita

机构 * Faculty of Sociology, Kansai University(京都产业大学社会科学学部)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究智能不平等中未被关注的个体交互层面的上下文访问鸿沟,提出上下文性作为补充维度,用概率模型形式化CAD,分析其在相关架构中的技术基础及对知识工作分层和平台治理的影响。

Comments 19 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08177 2026-07-10 cs.AI cs.MA 新提交 83%

ASMR: Agentic Schema Generation for Ship Maintenance Report Writing

ASMR:用于船舶维护报告撰写的智能模式生成

Sohrab Namazi Nia, Amogh Dalal, Ning Sa, Peter Ly, Marti Zentmaier, Tomek Strzalkowski, Jay Miller, Rishi Singh, Senjuti Basu Roy

机构 * New Jersey Institute of Technology(新泽西理工学院) Rensselaer Polytechnic Institute(伦斯勒理工学院) Boston Fusion Corporation(波士顿融合公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究船舶维护报告自动模式生成问题,提出ASMR框架,由字段生成智能体和结构优化智能体组成,可生成紧凑且信息丰富的模式,指导撰写更优报告,展现该方法前景及相关交叉领域挑战。

Comments Accepted at the DASHSys 2026 workshop (Systems for Data-centric Agents with Human-in-the-loop), co-located with VLDB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08124 2026-07-10 cs.SE cs.LG 新提交 82%

TTHE: Test-Time Harness Evolution

测试时工具演化

Jun Nie, Yonggang Zhang, Jun Song, Qianshu Cai, Dahai Yu, Yike Guo, Xinmei Tian, Bo Han

机构 * Hong Kong Baptist University(香港 Baptist 大学) University of Science and Technology of China(中国科学技术大学) Hong Kong Generative AI Research & Development Center, The Hong Kong University of Science and Technology(香港生成式人工智能研究与开发中心,香港科技大学) TCL Corporate Research (HK) Co., Ltd(TCL 企业研究(香港)有限公司)

专题命中 Agent评测 :agent(abstract);tool-use(abstract);workflow(abstract);agentic(abstract)

AI总结 研究LLM智能体测试时工具优化问题,提出TTHE方法,通过维护候选工具种群,基于执行轨迹推理优化,无需黄金标签或特定任务监督,在多任务实验中改进基线工具,将测试时适应重塑为程序演化并确定代理可靠性挑战。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26962 2026-07-10 cs.CY cs.AI cs.CL 版本更新 81%

DeepTutor: Towards Agentic Personalized Tutoring

DeepTutor:迈向代理式个性化辅导

Bingxi Zhao, Jiahao Zhang, Xubin Ren, Zirui Guo, Tianzhe Chu, Yi Ma, Chao Huang

机构 * The University of Hong Kong(香港大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 DeepTutor通过结合引用基础问题辅导与难度校准的问题生成,提出一个统一的开放源码框架,利用静态知识和动态学习者记忆实现个性化适应,并在五个领域大学课程中评估个性化教学效果。

Comments Tech Report, work in progress. Code available at https://github.com/HKUDS/DeepTutor

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08319 2026-07-10 cs.DB cs.AI 新提交 79%

GitLake: Git-for-data for the agentic lakehouse

GitLake:面向智能数据湖的数据版Git

Weiming Sheng, Jinlang Wang, Manuel Barros, Aldrin Montana, Jacopo Tagliabue, Luca Bigon

机构 * Columbia University(哥伦比亚大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Carnegie Mellon University(卡内基梅隆大学) Bauplan Labs(Bauplan实验室)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 研究面向智能体的数据湖的Git设计,核心方法是将单表快照提升为全湖操作,贡献是实现智能体与人类协作,管道原子性输出,还分享了生产经验和正确性见解。

Comments Pre-print of the paper accepted at DASHSys, VLDB 2026, Boston, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07859 2026-07-10 cs.AI cs.HC cs.LG 新提交 76%

Feedback Manipulation Regularization: Enabling Offline Agent Alignment for Imitation Learning

反馈操纵正则化:实现用于模仿学习的离线智能体对齐

Benjamin Poole, Minwoo Lee

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

AI总结 研究聚焦强化学习智能体行为与人类价值观对齐。提出反馈操纵正则化算法,利用评估反馈校正模仿学习策略。通过改编安全体育馆环境测试,该方法能提升适应性、减少对齐错误,在有限数据下也保持稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02615 2026-07-10 cs.CR cs.AI cs.SE 新提交 76%

TAG: A Lightweight Framework for Test-Driven Agentic Artifact Generation

代理创建,我们验证:用于代理工件生成的轻量级框架

Yaniv Melamed, Yoni Zukerman, Michal Shechter, Miri Weissler, Ashwin Patil, Hani Neuvirth-Telem

机构 * Microsoft(微软)

专题命中 Agent评测 :agentic(title);分类 cs.AI、cs.SE

AI总结 研究如何用大语言模型生成结构化工件并使其可靠用于生产部署。核心方法是基于“LLMs生成,我们验证”原则构建轻量级框架,贡献是提出含三关键属性的框架并在安全领域验证,还可用于其他工件生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03378 2026-07-10 cs.CR cs.SE 版本更新 70%

ARGUS: Defending LLM Agents Against Context-Aware Prompt Injection

ARGUS:防御大语言模型智能体免受上下文感知提示注入攻击

Shihao Weng, Yang Feng, Jinrui Zhang, Xiaofei Xie, Jiongchi Yu, Jia Liu

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.SE

AI总结 研究针对LLM智能体的上下文感知提示注入攻击,提出AgentLure基准测试及ARGUS因果溯源审计器,通过构建溯源图等验证行动因果依据,在AgentLure上降低攻击成功率,提升安全-效用权衡表现。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08373 2026-07-10 cs.LG cs.AI 新提交 62%

Self-Adaptive Anomaly Detection with Reinforcement Learning and Human Feedback in Connected Vehicles

基于强化学习和人工反馈的车联网自适应异常检测

Matthias Weiß, Athreya Hosahalli Prakash, Maurice Artelt, Falk Dettinger, Nasser Jazdi, Michael Weyrich

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文针对车联网运行中行为监测的挑战,提出集成强化学习、统计监测和人工反馈的在线异常检测框架,通过自注意力选择检测器、多检测器集成及人工再训练机制,在测试平台上实现持续自适应且避免灾难性遗忘。

Comments Accepted at the 30th IEEE International Conference on Emerging Technologies and Factory Automation (ETFA 2026), Special Session SS10: Evaluation Methods for Autonomous Cyber-Physical Systems' Behavior. 8 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07985 2026-07-10 cs.CL cs.AI cs.SD eess.AS 新提交 62%

A Reliability Assessment of LALM Audio Judges for Full-Duplex Voice Agents

全双工语音智能体的LALM音频评判的可靠性评估

A. Sayyad, J. Emmons, S. Jones, T. Lin, H. Krishnan

机构 * Salesforce Applied AI Research(Salesforce应用人工智能研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究评估Gemini模型作为全双工语音智能体音频评判的可靠性,以Gemini 2.5 Flash为基准与人类评分者对比,测试多个维度,发现其在一些维度表现良好,不同模型有差异,确定部署需谨慎领域,为LALM部署提供实证依据。

Comments 28 pages total (12 main body, 1 reference, 15 appendix). In main body: 2 diagrams, 3 table, 2 charts

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26076 2026-07-10 cs.CL 版本更新 61%

IMProofBench: Benchmarking AI on Research-Level Mathematical Proof Generation

IMProofBench:在研究级数学证明生成上对人工智能进行基准测试

Johannes Schmitt, Gergely Bérczi, Jasper Dekoninck, Jeremy Feusi, Tim Gehrunger, Raphael Appenzeller, Pieter Belmans, Alessio Bottini, Jim Bryan, João Camarneiro, Ana Cannas da Silva, Niklas Canova, Ana-Maria Castravet, Timo de Wolff, Claudio Fontanari, Filippo Gaia, Baran Hashemi, Daniel Holmes, David Holmes, Aitor Iribar Lopez, Victor Jaeck, Martina Jørgensen, Steven Kelk, Martijn Kool, Stefan Kuhlmann, Adam Kurpisz, Johannes Lengler, Chiara Meroni, Ingmar Metzler, Martin Möller, Samuel Muñoz-Echániz, David Muñoz-Lahoz, Robert Nowak, Georg Oberdieck, Daniel Platt, Dylan Possamaï, Gabriel Ribeiro, Aluna Rizzoli, Daria Sakhanda, Raúl Sánchez Galán, Zheming Sun, Diaaeldin Taha, Josef Teichmann, Richard P. Thomas, Henk van der Pol, Michel van Garrel, Charles Vial, Ignacio Barros, Benjamin Doerr, Peter Grünwald, Henry Liu, David Martins, Aleksandar Mijatović, Sergej Monavari, Marc Roth, Patrick Schnider, Yannik Schuler, Pim Spelier, Yuuji Tanaka, Ronald van Luijk

机构 * ETH Zurich(苏黎世联邦理工学院) Aarhus University(奥胡斯大学)

专题命中 Agent评测 :agentic(abstract,comments);分类 cs.CL

AI总结 针对大语言模型数学能力评估,引入IMProofBench基准测试,由专家开发77个经同行评审问题,涵盖详细证明及子问题,模拟现实研究环境,结果显示当前LLMs能解决不少研究级问题,该基准测试将持续发展。

Comments v2: benchmark expanded from 39 to 77 problems; evaluation extended to 14 models including GPT-5.4, Gemini 3.1 Pro, and Claude Opus 4.6; new analyses (IRT-based score aggregation, inter-rater reliability, tool/token usage, non-agentic ablation); contributor author list updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08768 2026-07-10 cs.CL 新提交 57%

UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks

UniClawBench:面向实际任务中主动智能体的通用基准测试

Zhekai Chen, Chengqi Duan, Kaiyue Sun, Bohao Li, Yuqing Wang, Manyuan Zhang, Xihui Liu

机构 * HKU MMLab(香港大学多媒体实验室) Meituan(美团)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 针对现有基准测试难以评估主动智能体的问题,提出UniClawBench,基于五项基础模型能力设计400个双语现实任务,采用实时评估和闭环评估策略,通过多模型框架对比展示基础模型能力和框架设计对性能的影响,还公开了基准测试和代码。

Comments Project Page: https://uniclawbench.github.io | GitHub Repo: https://github.com/HKU-MMLab/UniClawBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02871 2026-07-10 cs.AI 版本更新 57%

SimRPD: Optimizing Recruitment Proactive Dialogue Agents through Simulator-Based Data Evaluation and Selection

SimRPD:通过基于模拟器的数据评估和选择优化招聘主动对话代理

Zhiyong Cao, Dunqiang Liu, Qi Dai, Haojun Xu, Huai Yuen Khor, Hao Wang, Huan He, Yafei Liu, Ke Ma, Ruqian Shi, Sicheng Zhou, Sijia Yao

机构 * Zhaopin Limited(智聘有限公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Automation,Beijing Institute of Technology(北京理工大学自动化学院) Central University of Finance and Economics(中央财经大学) Beihang University(北航) Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对招聘主动对话代理训练数据稀缺问题,提出SimRPD框架。通过高保真用户模拟器合成数据,基于意图链的评估框架选数据,在所选数据集上训练代理。实验证明该框架优于现有策略,有工业部署价值和其他场景适用性。

Comments Published in the ACL 2026 Industry Track. Oral presentation

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 6: Industry Track), 2026, pp. 1359-1377

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.04203 2026-07-10 cs.LG cs.CV 版本更新 57%

Computation, Condensation, and the Incompleteness Between Them: A Coupled Foundation of Intelligence

计算、凝聚及其之间的不完备性:智能的耦合基础

Xin Li

机构 * Department of Computer Science, University at Albany, SUNY(计算机科学系,阿尔巴尼大学,SUNY)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 该研究探讨计算理论与智能所回答问题的差异,指出智能需计算与记忆两个算子耦合,证明单独算子不完备,确定耦合代价是关键操作不可判定且有误差下限,认为耦合是普遍法则并给出其可证伪核心与范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02704 2026-07-10 cs.GT cs.LG 版本更新 57%

Calibrated Stackelberg Games: Learning Optimal Commitments Against Calibrated Agents

校准的斯塔克尔伯格博弈:学习针对校准代理的最优承诺

Nika Haghtalab, Chara Podimata, Kunhe Yang

机构 * University of California, Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究校准斯塔克尔伯格博弈,将标准框架推广,其中代理依校准预测行动。虽信息减少,但委托人最优效用有界。针对校准挑战,开发新校准概念及算法,包括基于最佳响应区域的松弛,及代理自适应校准算法,助委托人更快收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08751 2026-07-10 cs.RO 新提交 50%

DexVerse: A Modular Benchmark for Multi-Task, Multi-Embodiment Dexterous Manipulation

DexVerse:用于多任务、多实体灵巧操作的模块化基准测试

Yunchao Yao, Zhuxiu Xu, Tianqi Zhang, Zixian Liu, Sikai Li, Zhenyu Wei, Feng Chen, Dihong Huang, Kechang Wan, Chenyang Ma, Shuqi Zhao, Shenghua Gao, Masayoshi Tomizuka, Yi Ma, Mingyu Ding

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) The University of Hong Kong(香港大学) UC Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :tool use(abstract)

AI总结 DexVerse是用于多任务、多实体灵巧操作的模块化基准测试,含100个任务,支持多种机器人手臂和手,可扩展且提供视觉变化等。通过对多种方法的基准测试,揭示任务泛化和视觉运动鲁棒性挑战,为通用灵巧操作提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21858 2026-07-10 math.OC 版本更新 50%

When to Match: A Cost-Balancing Principle for Dynamic Markets

何时匹配:动态市场的成本平衡原则

Jie Liu, Hailun Zhang, Jiheng Zhang

专题命中 Agent评测 :agent(abstract)

AI总结 研究动态市场中平台何时匹配的问题,提出成本平衡(CB)规则,在无需预测的情况下,能根据等待成本与当前匹配成本比例决定匹配时机,相比行业标准有成本和延迟优势,是简单高效且最坏情况最优策略。

详情

展开后加载摘要…

URL PDF HTML 收藏