arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-07 至 2026-07-07 共收录 442 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 91 篇

2607.03821 2026-07-07 cs.CR cs.AI 新提交 83%

DualView: Preventing Indirect Prompt Injection in Personal AI Agents

双视图:防止个人人工智能代理中的间接提示注入

Juhee Kim, Woohyuk Choi, Taehyun Kang, Youngmin Kim, Byoungyoung Lee

机构 * Seoul National University(首尔国立大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究个人人工智能代理面临的间接提示注入攻击问题,提出双视图方法,通过扩展不可信数据跟踪到用户环境,部署为插件,有效阻止攻击并保持实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03233 2026-07-07 cs.CR cs.AI cs.IR cs.SI 新提交 83%

Agentic and Generative AI for Open-Source Intelligence and Cyber Investigations: Taxonomy, Evaluation, Challenges, and Future Directions

用于开源情报和网络调查的智能与生成式人工智能:分类法、评估、挑战及未来方向

Eduardo Almeida Palmieri, Mohamed Chahine Ghanem, Dipo Dunsin, Zubair Baig, Ed de Quincey, Kim-Kwang Raymond Choo

机构 * School of Computer Science and Mathematics, Keele University(基尔大学计算机科学与数学学院) Cybersecurity Institute, University of Liverpool(利物浦大学网络安全研究所) Department of Applied Computing IICL, University of Wales Trinity Saint David(威尔士特里尼达大学应用计算系) Deakin Cyber Research and Innovation Hub, Deakin University(德金大学网络安全研究与创新中心) Department of Information Systems and Cyber Security, The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校信息系与网络安全系)

专题命中 Agent评测 :agentic(title,abstract);tool use(abstract);分类 cs.AI

AI总结 研究指出公开数字信息增长使人工开源情报分析不足,大语言模型等成解决方案但评估框架滞后。通过综述74项研究,明确智能人工智能类别,找出幻觉验证差距,映射研究到情报生命周期并给出研究议程。

Comments 36 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05336 2026-07-07 cs.AI 版本更新 83%

TRACE: Capability-Targeted Agentic Training

TRACE: 面向能力的代理训练

Hangoo Kang, Tarun Suresh, Jon Saad-Falcon, Azalia Mirhoseini

机构 * Stanford University(斯坦福大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 TRACE通过对比成功与失败轨迹自动识别能力缺失,合成针对性训练环境并利用RL训练适配器,提升代理在不同环境中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04424 2026-07-07 cs.CL 版本更新 83%

Gavel: Agent Meets Checklist for Evaluating LLMs on Long-Context Legal Summarization

Gavel: 智能体结合检查表评估LLM长上下文法律摘要

Yao Dou, Benjamin Mamut, Wei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 提出Gavel框架,通过参考评估和免参考智能体评估12个前沿LLM在多文档法律摘要中的表现,发现模型易遗漏关键信息而非幻觉,且性能随案件长度增加而下降。

Comments webpage at https://yao-dou.github.io/gavel/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05318 2026-07-07 cs.MA cs.CR 新提交 82%

PiSAs: Benchmarking Contextual Integrity in Multi-User Agentic Systems

PiSAs:多用户智能体系统中情境完整性的基准测试

Shubham Gupta, Nazanin Mohammadi Sepahvand, Abhinav Kumar, Cem Subakan, Spandana Gella, Pierre-André Noël, Perouz Taslakian, Eugene Bagdasarian, Valentina Zantedeschi

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 研究多用户智能体系统新隐私风险,引入PiSAs基准,用双重情境完整性注释评估无意泄露,可跨组件和接口测量跨用户数据泄露,发现模型判断影响结果,强调隐私保护策略需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04331 2026-07-07 cs.RO cs.CV 新提交 82%

Agent-driven Long-tail Simulation for Autonomous Driving

用于自动驾驶的智能体驱动长尾模拟

Junru Gu, Lijin Yang, Jianing Huang, Shu Liu, Zhongzhan Huang, Hang Zhao

机构 * IIIS, Tsinghua University(清华大学交叉信息研究院) Bosch Research(博世研究院)

专题命中 Agent评测 :agent(title,abstract);planning(abstract)

AI总结 针对现有自动驾驶模拟器局限性,提出智能体驱动模拟框架,通过结构化动作接口由大语言模型控制道路参与者,还引入SemanticPlan基准测试,结果表明长尾场景仍具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20659 2026-07-07 cs.AI cs.LG cs.SE 新提交 82%

Skill Coverage: A Test Adequacy Metric for Agent Skills

技能覆盖率:一种用于智能体技能的测试充分性度量

Boyin Tan, Xiaowei Huang, Youcheng Sun

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Liverpool(利物浦大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 提出技能覆盖率度量,通过提取技能文档中的行为约束并评估智能体轨迹是否提供足够证据来测试技能,发现现有基准仅覆盖39.90%-43.98%的约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03015 2026-07-07 cs.AI 新提交 81%

Beyond Forecasting: The Belief-to-Trade Layer in Prediction-Market Agents

超越预测:预测市场代理中的信念到交易层

Yishu Wang, Yuxuan Wang, Jiaqi Deng, Hanyang Tang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 Agent评测 :agent(summary_cn,abstract);分类 cs.AI

AI总结 以预测未来事件为通用人工智能测试平台,提出Raven-Agent这一预测市场自主交易代理,在存档决策集的控制重放中表现出色。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20216 2026-07-07 cs.AI cs.CE cs.CV cs.LG cs.RO 81%

CostNav: A Navigation Benchmark for Real-World Economic-Cost Evaluation of Physical AI Agents

CostNav:一个用于现实世界经济成本评估的物理AI代理导航基准

Haebin Seong, Sungmin Kim, Yongjun Cho, Myunchul Joe, Geunwoo Kim, Yubeen Park, Sunhoo Kim, Samwoo Seong, Yoonshik Kim, Suhwan Choi, Jaeyoon Jung, Jiyong Youn, Jinmyung Kwak, Sunghee Ahn, Jaemin Lee, Younggil Do, Seungyeop Yi, Woojin Cheong, Minhyeok Oh, Minchan Kim, Seongjae Kang, Youngjae Yu, Yunsung Lee

机构 * KAIST(韩国国立科学技术院) University of California, Irvine(加州大学 Irvine 分校) Seoul National University(首尔国立大学)

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI、cs.LG

AI总结 CostNav引入了一个经济导航基准,通过结合物理模拟和行业数据,评估AI代理的经济可行性,发现高任务成功率并不保证经济性,CANVAS在非零SLA合规性下表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04329 2026-07-07 cs.AI 新提交 79%

HAS-Bench: Evaluating LLM-Based Human-Agent Systems under Configurable Human Participation

HAS-Bench:在可配置人类参与下评估基于大语言模型的人机系统

Yaozu Wu, Wei-Chieh Huang, Jizhou Guo, Dongyuan Li, Renhe Jiang, Henry Peng Zou, Chunyu Miao, Shanghao Li, Weizhi Zhang, WeiWei Ye, Yankai Chen, Meng Zhang, Xue Liu, Philip S. Yu

机构 * The University of Tokyo(东京大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) MBZUAI McGill University(麦吉尔大学) Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 介绍基于图的HAS-Framework框架,在此基础上HAS-Bench在多方面可配置人类参与下评估人机系统,测量任务结果与协作行为,实验表明人类参与可提升任务完成等,但收益取决于参与方式等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03048 2026-07-07 cs.SE 新提交 79%

Compression, structure, and executor capability: a controlled real-cost decomposition of language-model agent skill optimisation

压缩、结构与执行能力:语言模型智能体技能优化的可控实际成本分解

Xiaonan Xu, Wenjing Wu

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 研究通过对多种条件下的技能交付进行可控分解,分离出无技能执行、原始技能等因素,对比质量(任务级验证通过率)和成本(解决阶段令牌成本),发现执行能力是主导因素,无优化表示比原始技能更优。

Comments 18 pages, 3 figures, 5 tables. Data and reproduction script: https://doi.org/10.5281/zenodo.21148499

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19073 2026-07-07 cs.CV 新提交 78%

Taming I2V models for Image HOI Editing: A Cognitive Benchmark and Agentic Self-Correcting Framework

驯服I2V模型用于图像HOI编辑:认知基准与智能体自校正框架

Jiayi Gao, Qingchao Chen, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University, Beijing, China(王轩计算机技术研究所,北京大学,北京,中国) National Institute of Health Data Science, Peking University, Beijing, China(国家健康数据科学研究院,北京大学,北京,中国)

专题命中 Agent评测 :agentic(title,abstract)

AI总结 提出HOI-Edit基准和SCPE框架,利用I2V模型的时间生成能力进行动态人-物交互编辑,通过自校正提示迭代优化,实现与SOTA竞争的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05363 2026-07-07 cs.AI 新提交 77%

SovereignPA-Bench: Evaluating User-Owned Personal Agents under Evolving Intent, Platform Mediation, and Consent Constraints

SovereignPA-Bench:在演化意图、平台中介与同意约束下评估用户自有个人智能体

Dylan Zongmin Liu

机构 * Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);tool use(abstract);tool-use(abstract);分类 cs.AI

AI总结 针对现有基准未考量个人智能体用户主权保护的问题,提出可执行基准SovereignPA-Bench,从多维度评估智能体主权能力,验证全主权框架可显著降低隐私泄露等风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07591 2026-07-07 cs.LG cs.AI cs.CL 版本更新 75%

ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research

ResearchClawBench: 端到端自主科学研究基准

Wanghan Xu, Shuo Li, Tianlin Ye, Qinglong Cao, Yixin Chen, Hengjian Gao, Yiheng Wang, Qi Li, Kun Li, Sheng Xu, Shengdu Chai, Fangchen Yu, Xiangyu Zhao, Zhangrui Zhao, Weijie Ma, Zijie Guo, Koutian Wu, Haoyu Zhou, Haoxiang Yin, Lixue Cheng, Chaofan Hu, Haoxuan Li, Lu Mi, Xuxuan Xie, Yifan Zhou, Ruizhe Chen, Zhiwang Zhou, Xingjian Guo, Yuhao Zhou, Xuming He, Shengyuan Xu, Xinyu Gu, Jiamin Wu, Mianxin Liu, Chunfeng Song, Fenghua Ling, Dongzhan Zhou, Shixiang Tang, Yuqiang Li, Mao Su, Peng Ye, Siqi Sun, Bin Wang, Xue Yang, Zhenfei Yin, Tianfan Fu, Guangtao Zhai, Wanli Ouyang, Bo Zhang, Lei Bai, Wenlong Zhang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出ResearchClawBench基准,包含10个领域40个任务,通过多模态评分标准评估自主科研能力,最强智能体仅得21.5分,揭示当前系统在实验协议、证据匹配和科学核心方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29596 2026-07-07 cs.SI cs.LG 版本更新 74%

Boundary Degree as a Node-level Feature for Epidemic Scenario Identification in Agent-based Cascade Simulations

边界度作为基于智能体的级联模拟中流行病场景识别的节点级特征

Amro Alabsi Aljundi, Galen Harrison, Jiangzhuo Chen, Abhijin Adiga, Anil Kumar Vullikanti, Madhav V. Marathe

机构 * Biocomplexity Institute(生物复杂性研究所)

专题命中 Agent评测 :agent(title);分类 cs.LG

AI总结 提出边界度作为节点级级联特征,通过消融实验证明其单独提升场景识别准确率19%,并理论证明无边界或边信息时某些场景不可区分。

Comments 28 pages, 10 figures, preliminary version; not final

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.00889 2026-07-07 econ.TH 版本更新 71%

Mr.Keynes and the... Complexity! A suggested model for the General Theory

凯恩斯先生与……复杂性!《通论》的一个建议模型

Alessio Emanuele Biondo

专题命中 Agent评测 :agent(title)

AI总结 提出凯恩斯《就业、利息和货币通论》的数学模型,核心方法是依据原文,主要贡献是表明流动性偏好、资本边际效率和边际消费倾向决定既定利率下的总收益与就业水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05055 2026-07-07 cs.AI 新提交 70%

Toward Trustworthy Large Language Model Agents in Healthcare

迈向医疗保健领域值得信赖的大语言模型智能体

Hadi Hasan, Safaa Salman, Adam Tai Abou Dargham, Ammar Mohanna, Ali Chehab

专题命中 Agent评测 :agent(abstract);function calling(abstract);分类 cs.AI

AI总结 针对医疗预约调度瓶颈,提出CareConnect智能体,利用大语言模型函数调用等技术,协调工具支持预约操作,设安全护栏。经评估有高任务完成率、安全合规性及成本效益,能自动化复杂医疗工作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03162 2026-07-07 cs.AI cs.HC 新提交 70%

APeB: Benchmarking Personalization Ability of Large Language Model Agents

APeB:大型语言模型智能体个性化能力基准测试

Garry Yang, Zizhe Chen, Xinru Chen, Yongqiang Chen, Jianxiang Wang, Deyu Zou, Linyi Ding, Jialiang Wu, Yunzhong He, Yu Gong, James Cheng, Huaixiao Tou

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance(字节跳动)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 研究大型语言模型智能体在处理原始、未明确查询时的个性化问题,通过引入个性化产品搜索测试平台构建基准测试,评估发现模型处理明确查询较好,但早期查询有困难,简单方法能提升性能。

Comments NA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03025 2026-07-07 cs.AI cs.MA 新提交 70%

Human-Centric Reflective Architecture for Human-AI Collaborative Decision-Making

用于人类与人工智能协作决策的以人类为中心的反思架构

Andreas Kouridakis, Dimitrios Patiniotis Spyropoulos, George Vouros

机构 * University of Piraeus(比雷埃夫斯大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究人类与人工智能协作决策问题,将其建模为随机博弈,提出以人类为中心的反思架构,整合人类校准模型与强化学习智能体,提升决策有效性并给出高质量建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24107 2026-07-07 cs.CV cs.AI 新提交 70%

DramaDirector: Geometry-Guided Short Drama Generation

DramaDirector: 几何引导的短剧生成

Hengji Zhou, Sijie Liu, Jianrun Chen, Xingchen Zou, Lianghao Xia, Liqiang Nie

机构 * South China University of Technology(华南理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出几何引导框架DramaDirector,通过检索真实短剧的深度-姿态参考,结合模式约束SFT和GRPO训练规划器,实现从情节到多镜头短剧的生成,在忠实度、一致性和可控性上优于基线。

Comments 20 pages, 17 figures, 6 tables. Code is available at https://github.com/iLearn-Lab/DramaDirector

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28893 2026-07-07 cs.SE cs.CR 70%

Towards Demystifying and Repairing LLM-in-the-Loop Vulnerabilities

迈向揭示与修复LLM-in-the-Loop漏洞

Yujie Ma, Jialin Rong, Chenxi Yang, Lili Quan, Jin Wen, Xiaofei Xie, Yongqiang Lyu, Qiang Hu

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.SE

AI总结 通过构建首个LLM-in-the-loop漏洞数据集LLMCVE,分析发现LLM常作为目标或传播向量而非根因,并评估现有修复方法,揭示此类漏洞修复更具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23433 2026-07-07 cs.AI 版本更新 70%

Mecha-nudges for Machines

机器人的微调:为机器设计的提示

Giulio Frey, Kawin Ethayarajh

机构 * University of Chicago(芝加哥大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究探讨了机器学习代理在互联网上的决策影响,通过结合经济学和计算机科学框架,发现机器学习模型在环境中自动调整信息呈现,从而提升预测能力,但对人类影响有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07202 2026-07-07 cs.DC cs.AI cs.MA cs.NI 版本更新 70%

Resilient by Design -- Active Inference for Distributed Continuum Intelligence

设计弹性——分布式连续体智能的主动推理

Praveen Kumar Donta, Alfreds Lapkovskis, Enzo Mingozzi, Schahram Dustdar

机构 * Department of Computer Systems and Sciences, Stockholm University(斯德哥尔摩大学计算机系统与科学系) Department of Information Engineering, University of Pisa(比萨大学信息工程系) Distributed Systems Group, TU Wien(维也纳技术大学分布式系统组)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 针对分布式计算连续体中设备故障问题,引入概率主动推理弹性代理,通过构建因果故障图、利用马尔可夫毯和自由能原理识别故障并主动推理修复,经理论验证其可靠有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04688 2026-07-07 cs.LG cs.AI cs.CE cs.CL 新提交 67%

URSA: Chemistry-Aware Benchmark for Utilitarian Retrosynthesis Assessment

URSA:用于功利性逆合成评估的化学感知基准测试

Bogdan Zagribelnyy, Ivan Ilin, Nikita Bondarev, Anton Morgunov, Arkadii Lin, Maksim Kuznetsov, Rim Shayakhmetov, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov

机构 * Insilico Medicine AI Limited(Insilico Medicine AI有限公司) Independent researcher(独立研究者) Insilico Medicine Canada Inc.(Insilico Medicine加拿大公司) Insilico Medicine Hong Kong Ltd.(Insilico Medicine香港有限公司)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究针对药物发现中合成规划任务,介绍URSA评估框架,能从形式和化学合理性角度评估合成路线,全面评估传统及基于大语言模型的逆合成解决方案,发现大语言模型在解决合成规划任务上不如专业模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04542 2026-07-07 cs.LG cs.AI cs.SE 新提交 67%

Auto: The AGI Compiler

自动:通用人工智能编译器

Jaber Jaber, Osama Jaber

机构 * RightNow AI(即时人工智能)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 研究提出通用人工智能编译器Auto,通过记录智能体行为,提取确定性部分转化为程序或专家,生成带保障的认知二进制文件。在基准测试中表现良好,还量化了失败模式,强调校准和参考保真度对正确性的决定作用。

Comments 10 pages, 4 figures, 3 tables, 1 algorithm. Code: https://github.com/RightNow-AI/auto

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27366 2026-07-07 cs.AI cs.CL cs.LG cs.MA 版本更新 67%

MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation

MUSE-Autoskill: 通过技能创建、记忆、管理和评估实现自我进化智能体

Huawei Lin, Peng Li, Jie Song, Fuxin Jiang, Tieying Zhang

机构 * ByteDance Inc.(字节跳动公司) Rochester Institute of Technology(罗切斯特理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出MUSE-Autoskill框架,通过统一的技能生命周期(创建、记忆、管理、评估和优化)使LLM智能体持续提升任务解决能力,实验表明生命周期管理的技能可提高任务成功率、效率、复用性和跨智能体迁移。

Comments 30 pages, 9 figures, 15 tables, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00392 2026-07-07 cs.SE cs.AI 版本更新 66%

Beyond Task Completion: A Verification-vs.-Conformance Gap in Tool-Evolving Agents

EvolveTool-Bench:评估LLM生成的工具库作为软件 artifact 的质量

Alibek Kaliyev, Artem Maryanskyy

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Uber Technologies(优步科技公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE;agentic(comments)

AI总结 本文提出EvolveTool-Bench,通过评估LLM生成的工具库在软件工程流程中的质量,揭示任务完成率之外的软件质量风险,强调需将工具库视为首要软件 artifact。

Comments 11 pages, 4 figures; accepted at KDD 2026 Workshop on Agentic AI Evaluation and Trustworthiness

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05155 2026-07-07 cs.CL cs.LG 新提交 62%

EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments

EdgeBench:揭示从真实环境中学习的缩放定律

Deyao Zhu, Xin Zhou, Shengling Qin, Xuekai Zhu, Hangliang Ding, Shu Zhong, Zixin Wen, Zhonglin Xie, Chenhui Gou, Linxuan Ren, Yueyang Wang, Junfeng Zhong, Rui Liu, Tian Gao, Yangguang Lin, Jingyuan Zhang, Maojia Song, Xuan Qi, Jinhong Wu, Chenyang Zhang, Yinzhu Piao, Ziru Niu, Hongbin Lin, Lingxiang Meng, Peng Tang, Chengyao Tang, Shanyu Wu, Huanyu Zheng, Yu Liu, Liya Zhu, He Wang, Ming Ding, Ziyu Wan, Hao Liu, Sibo Wang, Haotian Zhu, Xintian Zhang, Nan Chai, Yipeng Liu, Panhao Lai, Sihang Yuan, Zixin Su, Ge Zhang, Wangchunshu Zhou, Yantao Du, Wenhao Huang, Guang Shi

机构 * ByteDance(字节跳动)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出含134项长周期真实任务的EdgeBench平台,通过分析大量智能体交互数据,发现环境学习性能符合对数S型缩放定律,为智能体现实经验学习研究提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05125 2026-07-07 cs.SE cs.AI 新提交 62%

Three-Phase Evaluation of AI-Assisted Software Development Life Cycle

AI辅助软件开发生命周期的三阶段评估

Joshua Strubel, Professor Carrie Russell, Carson Crockett, Jason Ferraro, Nathan Londhe, Uzayr Syed, Jacob Viehe

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 该研究探究AI自主水平对软件开发的影响,通过三阶段对照实验对比不同AI工具辅助模式,发现更高AI自主度可降开发成本、提合规性、减认知负荷,专用架构工具表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03100 2026-07-07 cs.SE cs.AI 新提交 62%

Flow-A11y: Flow-Aware Accessibility Testing

Flow-A11y:基于流程感知的无障碍性测试

Nasr Eddine Fliti, Leisan Kokorina, Florian Tambon, Michael Papadakis

机构 * University of Luxembourg(卢森堡大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究现代网页应用因交互流程产生的无障碍性问题,提出Flow-A11y系统,通过在真实浏览器执行流程、记录运行时跟踪等方法,贡献为提高测试准确性及实现动态WCAG标准自动化评估。

详情

展开后加载摘要…

URL PDF HTML 收藏