arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1095 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1095 篇

2607.05125 2026-07-07 cs.SE cs.AI 新提交 62%

Three-Phase Evaluation of AI-Assisted Software Development Life Cycle

AI辅助软件开发生命周期的三阶段评估

Joshua Strubel, Professor Carrie Russell, Carson Crockett, Jason Ferraro, Nathan Londhe, Uzayr Syed, Jacob Viehe

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 该研究探究AI自主水平对软件开发的影响,通过三阶段对照实验对比不同AI工具辅助模式,发现更高AI自主度可降开发成本、提合规性、减认知负荷,专用架构工具表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03100 2026-07-07 cs.SE cs.AI 新提交 62%

Flow-A11y: Flow-Aware Accessibility Testing

Flow-A11y:基于流程感知的无障碍性测试

Nasr Eddine Fliti, Leisan Kokorina, Florian Tambon, Michael Papadakis

机构 * University of Luxembourg(卢森堡大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究现代网页应用因交互流程产生的无障碍性问题,提出Flow-A11y系统,通过在真实浏览器执行流程、记录运行时跟踪等方法,贡献为提高测试准确性及实现动态WCAG标准自动化评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02975 2026-07-07 cs.AI cs.CL 新提交 62%

Evaluating Generative Agents with Actions Grounded in Socially Distributed Task Environments using Incognita

使用Incognita评估基于社会分布式任务环境中行动的生成智能体

Dan C. Hsu, Luke Lu

机构 * RedMind Research(RedMind研究)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究结合现有基准和社会模拟环境要求的评估设置,定义社会分布式任务环境,介绍Incognita框架,以之评估三个生成智能体模型,发现其在奖励和行为上有进展但可靠性仍低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02731 2026-07-07 cs.SE cs.AI 新提交 62%

SMOCS: A Streaming Framework for Simplified Deployment, Monitoring, and Optimization of ML Systems in Production

SMOCS:用于在生产中简化机器学习系统部署、监控和优化的流框架

Armen Kasparian, Kishansingh Rajput, Malachi Schram, John Vennekate

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究针对机器学习模型在运行环境部署维护的挑战,提出基于Kafka的SMOCS框架,通过分层抽象、三线程代理架构和配置驱动部署模型应对,可简化流程,且平台无关、容错、可扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02599 2026-07-07 cs.SE cs.AI cs.LO 新提交 62%

AgentLTL: A Trace-Verification Framework for Measuring, Enforcing, and Training Procedural Compliance in Tool-Using LLM Agents

AgentLTL:一种用于测量、执行和训练使用工具的语言模型代理程序合规性的跟踪验证框架

Laïla Elkoussy, Julien Perez

机构 * EPITA Bpifrance

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 介绍基于一阶线性时态逻辑的AgentLTL语言,用于表达代理跟踪的程序规则,产生确定性无评判的合规分数,此框架可用于约束和微调,提升模型合规性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03193 2026-07-07 quant-ph cs.AI cs.LG 新提交 62%

Self-Specializing Vision-Language Transmon Chip Calibration in a Physics-Grounded Environment

在物理基础环境中自专业化的视觉语言跨导芯片校准

Animesh Tripathy, Aswanth Krishnan

机构 * QpiAI India Pvt. Ltd(QpiAI印度私人有限公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究视觉语言智能体能否在无权重更新下校准超导跨导芯片。通过设计物理模拟环境、视觉语言智能体及无梯度在线自适应方法,在预算压力下提升芯片保真度,诊断硬件故障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16933 2026-07-07 cs.LG cs.AI 新提交 62%

A Unified Causal-Origin Taxonomy of Distributional Shifts in Reinforcement Learning

强化学习中分布偏移的统一因果起源分类法

Ardianto Wibowo, Paulo E Santos, Amer Baghdadi, Matthew Stephenson, Karl Sammut, Jean-Philippe Diguet

机构 * IMT Atlantique(IMT大西洋) Flinders University(弗林德斯大学) IRL Crossing Priori Analytica CNRS(法国国家科学研究中心)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出一种统一因果起源分类法,将强化学习中的分布偏移按因果来源(内部/外部)和时间边界(显式/隐式/混合)分类,统一了分布内/外泛化与非平稳性分析。

Comments The paper is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01457 2026-07-03 cs.CL cs.AI 新提交 62%

Grounded Optimization: A Layered Engineering Framework for Reducing LLM Hallucination in Automated Personal Document Rewriting

接地优化:一种减少自动个人文档重写中LLM幻觉的分层工程框架

Shashank Indukuri, Adarsh Agrawal

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出五层接地优化框架,通过时间验证、污染检测、结构不变性、提示接地和评估器,将简历重写中的幻觉率降至0.04-0.24。

Comments 13 pages, 1 figure. Equal contribution by both authors. Code and data: https://github.com/shashank-indukuri/grounded-optimization

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00926 2026-07-02 cs.LG cs.AI 新提交 62%

Human-Machine Collaboration on Generative Meta-Learning: Model and Algorithm

人类与机器在生成式元学习中的协作:模型与算法

Midhun Parakkal Unni, Samuel Kaski

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院) Centre for Machine intelligence, University of Sheffield(谢菲尔德大学机器智能中心) ELLIS Institute Finland(芬兰ELLIS研究所) Department of Computer Science, Aalto University(阿尔托大学计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出生成式元学习与人类反馈框架,通过专家直觉引导数据合成,利用条件神经ODE和强化学习迭代优化生成轨迹,理论证明分布对齐降低泛化误差,实验验证在分布偏移下提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00733 2026-07-02 cs.LG cs.AI 新提交 62%

LLM-Guided ODE Discovery and Parameter Inference from Small-Cohort Aggregate Data

LLM引导的ODE发现与小群体聚合数据的参数推断

Hanning Yang, Meropi Karakioulaki, Lennart Purucker, Tim Litwin, Cristina Has, Moritz Hess

机构 * Institute of Medical Biometry and Statistics, Faculty of Medicine and Medical Center, University of Freiburg(弗莱堡大学医学中心与医学院医学统计与生物统计研究所) Department of Dermatology, Medical Faculty and Medical Center, University of Freiburg(弗莱堡大学医学中心与医学院皮肤科) Prior Labs, University of Freiburg(弗莱堡大学Prior实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出AgentODE框架,利用LLM提出候选ODE结构,并通过工具增强的推理代理仅基于群体级汇总统计量迭代优化参数分布,实现从稀疏、噪声数据中发现可解释的ODE结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01034 2026-07-02 cs.CL cs.AI cs.HC 新提交 62%

Behavior-Adaptive Conversational Agents: Toward a Fluid Personality Framework

行为自适应对话代理:迈向流动人格框架

Hasibur Rahman, Smit Desai

机构 * Northeastern University(东北大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出流动人格框架,根据任务上下文、用户目标和情境紧迫性,动态调整代理的隐喻角色和人格表达强度,以提升用户信任和体验。

Comments Presented at Bridging AI and Behavior Change, a Bridge Program organized at the AAAI Conference on Artificial Intelligence 2026 (AAAI-2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31522 2026-07-02 cs.CL cs.AI 新提交 62%

FinPersona-Bench: A Benchmark for Longitudinal Psychometric Stability of Autonomous Financial Agents

FinPersona-Bench: 自主金融代理纵向心理测量稳定性的基准

Muhammad Usman Safder, Ayesha Gull, Rania Elbadry, Fan Zhang, Yankai Chen, Xueqing Peng, Xue, Liu, Preslav Nakov, Zhuohan Xie

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) The University of Tokyo(东京大学) McGill University(麦吉尔大学) The Fin AI(Fin AI公司) Kyoto University(京都大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出FinPersona-Bench基准,通过合成市场分离价格与价值,评估LLM金融代理在长期部署中指令显著性衰减现象,发现指令重固化的效果因代理类型和市场环境而异。

Comments 29 pages, includes figures and tables; formalizes Mandate Salience Decay and introduces FinPersona-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13715 2026-07-02 cs.AI cs.CL cs.MA 新提交 62%

WorkBench Revisited: Workplace Agents Two Years On

WorkBench 再探:两年后的工作场所智能体

Olly Styles, Sam Miller

机构 * Independent researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文重新评估2024至2026年间WorkBench基准上智能体的进展,发现前沿模型在能力和安全性上均有显著提升,但开放权重模型降低了高性能门槛。

Comments 8 pages, 3 figures. Follow-up to arXiv:2405.00823

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31002 2026-07-01 cs.AI cs.CL cs.LO 新提交 62%

Beyond Compilation: Evaluating Faithful Natural-Language-to-Lean Statement Formalization

超越编译:评估从自然语言到Lean的忠实语句形式化

Ke Zhang, Patricio Gallardo Candela, Sudhir Murthy, Yi Xie, Zhi Wang, Maziar Raissi

机构 * University of California, Riverside(加州大学河滨分校) University of Arizona(亚利桑那大学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出忠实语句形式化评估方法,结合Lean编译、跨模型语义判断和人类专家校准,发现编译通过但语义不忠实的29.0%差距,并分解形式化流程中的关键干预因素。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27406 2026-06-29 cs.SE cs.AI 新提交 62%

Towards Evaluation of Implicit Software World Models in Coding LLMs

面向编码大语言模型中隐式软件世界模型的评估

Egor Bogomolov, Yaroslav Zharov

机构 * JetBrains Research(JetBrains研究)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.SE

AI总结 本文通过预测执行资源(峰值内存、墙钟时间、分析器输出)扩展软件世界模型评估,发现前沿模型表现有限,表明对软件执行理解不足。

Comments Accepted to DL4Code workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26350 2026-06-26 cs.AI cs.LG 新提交 62%

OpenFinGym: A Verifiable Multi-Task Gym Environment for Evaluating Quant Agents

OpenFinGym: 一个可验证的多任务Gym环境,用于评估量化智能体

Kaicheng Zhang, Wen Ge, Lei Jiang, Weixin Yang, Jordan Langham-Lopez, Jialin Yu, Lukasz Szpruch, Hao Ni

机构 * University of Edinburgh(爱丁堡大学) University College London(伦敦大学学院) Alan Turing Institute(艾伦·图灵研究所) University of Oxford(牛津大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出OpenFinGym统一环境,覆盖预测、市场生成、实时交易和欺诈检测等量化金融任务,支持自动化任务构建、容器化验证和延迟解析,以全面评估LLM智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26406 2026-06-26 cs.LG cs.AI math-ph math.MP 新提交 62%

Beyond Feedforward Networks: Reentry Neural Systems as the Fundamental Basis of Subjecthood and Intrinsic Safety of Next-Generation AGI

超越前馈网络:作为下一代通用人工智能主体性与内在安全基础的再入神经系统

A. S. Ushakov, Yu. N. Berdinsk

机构 * Saint Petersburg State University(圣彼得堡国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出基于闭环再入循环(D<->I循环)的安全AGI架构蓝图,通过结构循环和自持放大数学保证自我模型、自我保存和未编程目标导向行为的涌现,并引入多项式时间可计算的S度量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23993 2026-06-25 cs.LG cs.AI hep-ex 新提交 62%

Learning to Trigger: Reinforcement Learning at the Large Hadron Collider

学习触发:大型强子对撞机的强化学习

Zixin Ding, Shaghayegh Emami, Giovanna Salvi, Cecilia Tosciri, Abhijith Gandrakota, Jennifer Ngadiuba, Nhan Tran, Christian Herwig, David W. Miller, Yuxin Chen

机构 * University of Chicago(芝加哥大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) Fermi National Accelerator Laboratory(费米国家加速器实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对大型强子对撞机实时触发系统在带宽、延迟和存储约束下的阈值调优问题,提出基于强化学习的在线阈值控制方法,在模拟和真实数据上分别提升48%和56%的容忍时间比例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24381 2026-06-24 cs.CL cs.AI 新提交 62%

On the Stability of Prompt Ranking in Large Language Model Evaluation

论大语言模型评估中提示排序的稳定性

Shaoshuai Du, Penghao Liang, Yixian Shen, Chuanqi Shi, Hang Zhang, Lun Wang

机构 * University of Amsterdam(阿姆斯特丹大学) Northeastern University(东北大学) University of California San Diego(加州大学圣迭戈分校) Duke University(杜克大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 研究提示排序在常见评估变化下的稳定性,发现顶级提示常变导致选择不可靠,提出基于置信下限的稳定性感知选择策略以提高鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23654 2026-06-23 cs.CL cs.SE 新提交 62%

EnterpriseClawBench: Benchmarking Agents from Real Workplace Sessions

EnterpriseClawBench: 从真实工作会话中基准测试智能体

Jincheng Zhong, Weizhi Wang, Che Jiang, Kai Tian, Zhenzhao Yuan, Junlin Yang, Dianqiao Lei, Kaiyan Zhang

机构 * Horizon Research, Frontis.AI(地平线研究,Frontis.AI)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.SE

AI总结 提出EnterpriseClawBench,从真实企业工作会话构建852个可复现任务,评估智能体在文件读取、工具调用和工件交付方面的能力,最佳配置得分仅0.663。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23217 2026-06-23 cs.CL cs.AI 新提交 62%

MuPPET: A Benchmark for Contextual Privacy of LLM Assistants in Multi-Party Conversations

MuPPET:多轮对话中LLM助手上下文隐私的基准测试

Elena Sofia Ruzzetti, Cornelius Emde, Sangdoo Yun, Seong Joon Oh, Martin Gubri

机构 * Parameter Lab(参数实验室) University of Rome Tor Vergata(罗马第二大学) University of Oxford(牛津大学) NAVER AI Lab(NAVER AI实验室) KAIST AI(韩国科学技术院人工智能研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出MuPPET基准,评估多用户对话中LLM代理的隐私泄露风险,发现模型在多用户场景下泄露更严重,现有防御措施效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22977 2026-06-23 cs.CL cs.AI 新提交 62%

StatABench: Dataset and Framework for Evaluating Statistical Analysis Capabilities of LLMs

StatABench:评估大语言模型统计分析能力的数据集与框架

Youxin Zhu, Yixuan Ding, Peng Lai, Longyue Wang, Bingyi Jing, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) Alibaba Group(阿里巴巴集团) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Hong Kong(香港大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出StatABench基准,包含404道封闭题和30道开放建模任务,评估LLM在统计分析上的能力,实验显示最佳模型仅达68.6%准确率,揭示工具推理和建模决策等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22906 2026-06-23 cs.SE cs.AI 新提交 62%

From Fragments to Paths: Task-Level Context Recovery for Large Industrial Codebases

从片段到路径:大型工业代码库的任务级上下文恢复

Jiawei He, Weisong Sun, Mengyu Shi, Jie Jia, Tong Bian, Xikai Yang, Dong Sun

机构 * AMAP, Alibaba Group(阿里集团AMAP) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) University of Cambridge(剑桥大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出DeepDiscovery方法,通过两阶段定位-推理框架在预算约束下恢复任务级上下文,显著提升大型工业代码库的文件检索和下游软件工程任务性能。

Comments 12 pages, 3figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22769 2026-06-23 cs.LG cs.AI 新提交 62%

Noise is Signal: Density-Based Outliers as Leading Indicators of Occupational Emergence in Labor Market Text

噪声即信号:基于密度的异常值作为劳动力市场文本中职业涌现的领先指标

Shreyash Rawat

机构 * Independent Researcher(独立研究员)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出涌现-密度反转假设,证明低密度异常值预示新职业涌现,通过时序分析验证并改进涌现职业评分,预测准确率从F1=0.61提升至0.74。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22207 2026-06-23 cs.CL cs.AI 新提交 62%

Lexical Consensus: Grounded Word Learning and Shared Meaning in Artificial Agents

词汇共识:人工智能体中的具身词汇学习与共享意义

Patricio M. Vera

机构 * Neurocreaciones

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出词汇共识框架,利用冻结的DINOv2视觉嵌入和卡罗尔式无意义词,研究智能体如何从结构化感知中获取、稳定和使用新词汇意义,发现感知距离主导词汇习得梯度。

Comments 41 pages, 12 figures, 9 tables. Code and experiment artifacts available at https://github.com/patriciomvera/lexical-consensus

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21820 2026-06-23 cs.SI cs.AI cs.CL 新提交 62%

Generating Public Health Responses using Survey-Augmented Large Language Models

使用调查增强的大语言模型生成公共卫生响应

Leonardo Marciaga, Thuyen Pham, Julia Rezvani, Alina Hyk, Chunyang Liao, Konstantinos Mitsopoulos, Raffaele Vardavas

机构 * Hawk.illinoistech.edu(伊利诺伊理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究利用大语言模型生成合成调查数据,以模拟真实人群在流行病中的健康决策行为,发现合成数据能复现人口统计和信念分布,但难以捕捉因素间的协变关系,不能替代真实调查。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20708 2026-06-23 cs.AI cs.CL cs.HC 新提交 62%

Simulated Customers Never Walk Away: Decision Fidelity of LLM User Simulators Measured Against Real Purchase Outcomes

模拟客户永不离开:LLM用户模拟器与实际购买结果的决策保真度

Liang Chen

机构 * Chinese relationship-matchmaking service(中国婚恋服务平台)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出决策保真度概念,通过对比LLM模拟器与真实客户在销售对话中的决策状态,发现模拟器高估非购买者的参与度,低估其拒绝意愿,导致系统偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20376 2026-06-23 cs.LG cs.AI 新提交 62%

CRAX: Fast Safe Reinforcement Learning Benchmarking

CRAX:快速安全强化学习基准测试

Tristan Tomilin, Mourad Boustani, Mickey Beurskens, Thiago D. Simão

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出基于JAX加速的安全RL基准CRAX,利用MJX物理引擎实现高达100倍加速,包含6个环境套件和3个智能体任务,评估6种方法揭示性能与安全权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19721 2026-06-19 cs.LG cs.AI 新提交 62%

OnDeFog: Online Decision Transformer under Frame Dropping

OnDeFog:帧丢失下的在线决策变压器

Daiki Yotsufuji, Kenta Nishihara, Shoma Shimizu, Kento Uchida, Shinichi Shirakawa

机构 * Yokohama National University(横滨国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对帧丢失导致性能下降的问题,提出OnDeFog,将DeFog机制与在线决策变压器结合,通过直接环境交互学习策略,在高丢帧率环境下优于ODT,在低奖励数据集上优于DeFog。

Comments Accepted to PRICAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18782 2026-06-18 cs.CL cs.AI 新提交 62%

RedactionBench

RedactionBench:基于上下文完整性的隐私保护基准测试

Sean Brynjólfsson, Shashvat Jayakrishnan, Esha Sali, Diptanshu Purwar, Madhav Aggarwal

机构 * A10 Networks, Inc.(A10网络公司)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 RedactionBench通过200个跨11个领域的文档,评估红actions的上下文隐私问题,提出R-Score指标,揭示红actions的主观性,推动隐私保护系统的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏