arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15616 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15616 篇

2602.16953 2026-06-02 cs.AI cs.LG 84%

LLM4Cov: Execution-Aware Agentic Learning for High-coverage Testbench Generation

LLM4Cov:面向高覆盖率测试生成的执行感知智能体学习

Hejia Zhang, Zhongming Yu, Chia-Tung Ho, Haoxing Ren, Brucek Khailany, Jishen Zhao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 提出LLM4Cov离线智能体学习框架,通过执行验证数据策展、策略感知数据合成和最差状态优先采样,在硬件验证中实现高覆盖率测试生成,4B参数模型在CVDP-ECov上达到69.2%通过率和90.4%平均覆盖率。

Comments ICML'26 Camera Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22300 2026-05-22 cs.AI cs.LG cs.MA 84%

Cross-domain benchmarks reveal when coordinated AI agents improve scientific inference from partial evidence

跨领域基准测试揭示协调AI代理在部分证据下提升科学推断何时有效

Fiona Y. Wong, Markus J. Buehler

机构 * Laboratory for Atomistic and Molecular Mechanics (LAMM)(原子分子力学实验室) Department of Biological Engineering(生物工程系) Department of Mechanical Engineering(机械工程系) Department of Civil and Environmental Engineering(土木与环境工程系) Center for Computational Science and Engineering, Schwarzman College of Computing(计算科学与工程中心) Massachusetts Institute of Technology(麻省理工学院)

专题命中 Agent评测 :AI agent(title,abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文通过跨领域基准测试探讨协调AI代理在部分证据下提升科学推断的有效性,发现当不同学科各自捕捉现象部分时,跨通道复合方法优于单一通道基线,但在某些情况下分解并不总是提升整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15226 2026-05-18 cs.AR cs.AI cs.SE 84%

Is Agentic AI Ready for Real-World Hardware Engineering? A Deep Dive with Phoenix-bench

代理AI是否准备好进行现实世界硬件工程?通过Phoenix-bench的深入探讨

Qingyun Zou, Feng Yu, Hongshi Tan, Bingsheng He, WengFai Wong

机构 * National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文通过Phoenix-bench评估代理AI在硬件工程中的表现,发现软件与硬件工程本质不同,且故障集中于设计控制流、验证测试用例等,定位精度比定位本身更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15215 2026-05-18 cs.AI cs.SE 84%

SkillSmith: Compiling Agent Skills into Boundary-Guided Runtime Interfaces

SkillSmith:将技能编译为边界引导的运行时接口

Duling Xu, Zheng Chen, Zaifeng Pan, Jiawei Guan, Dong Dong, Jialin Li, Bangzheng Pu

机构 * AetherHeart Tech Co., Ltd.(AetherHeart科技有限公司) Renmin University of China(中国人民大学) University of California San Diego(加州大学圣地亚哥分校)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.SE

AI总结 SkillSmith通过将技能包编译为最小执行接口,减少运行时冗余,提升效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14572 2026-05-18 cs.IR cs.AI cs.CL cs.MA 84%

Don't Retrieve, Navigate: Distilling Enterprise Knowledge into Navigable Agent Skills for QA and RAG

不要检索,导航:将企业知识转化为可导航的代理技能用于问答和RAG

Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh

机构 * Magellan Technology Research Institute(马格纳技术研究 institute)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Corpus2Skill,通过将文档库转化为层次化技能目录,使LLM代理在服务时能导航该目录,提升问答质量和 grounding,但指出导航并非所有场景下的最佳替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14865 2026-05-15 cs.AI cs.CL 84%

Holistic Evaluation and Failure Diagnosis of AI Agents

人工智能代理的总体评估与故障诊断

Netta Madvil, Gilad Dym, Alon Mecilati, Edo Dekel, Jonatan Liberman, Rotem Brazilay, Liron Schliesser, Max Svidlo, Shai Nir, Orel Shalom, Yaron Friedman, David Connack, Amos Rimon, Philip Tannor, Shir Chorev

机构 * Deepchecks

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种综合评估框架,结合顶层代理诊断与底层跨度评估,通过分解分析实现独立跨度评估,提升长结构轨迹中的故障定位与分类准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14033 2026-05-15 cs.AI cs.LG 84%

Sheaf-Theoretic Transport and Obstruction for Detecting Scientific Theory Shift in AI Agents

示性同调运输与障碍在检测人工智能代理科学理论转变中的应用

David N. Olivieri, Roque J. Hernández

机构 * Universidade de Vigo, Department of Computer Science (LSI), Spain(维戈大学计算机科学系(LSI),西班牙)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于有限示性同调框架的方法,用于检测人工智能代理中科学理论转变的候选者,通过运输和障碍分析,区分理论框架的可运输性与局部到全局的障碍问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11086 2026-05-13 cs.CR cs.AI cs.LG 84%

ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks?

ExploitGym:AI代理能否将安全漏洞转化为实际攻击?

Zhun Wang, Nico Schiller, Hongwei Li, Srijiith Sesha Narayana, Milad Nasr, Nicholas Carlini, Xiangyu Qi, Eric Wallace, Elie Bursztein, Luca Invernizzi, Kurt Thomas, Yan Shoshitaishvili, Wenbo Guo, Jingxuan He, Thorsten Holz, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校) Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所) UC Santa Barbara(加州大学圣巴巴拉分校) Arizona State University(亚利桑那州立大学) Anthropic(Anthropic公司) OpenAI Google(谷歌)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 ExploitGym通过大规模真实漏洞数据评估AI代理的漏洞利用能力,揭示前沿模型在复杂漏洞利用中的表现,凸显AI发展对网络安全的潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01394 2026-05-05 cs.SE cs.AI 84%

LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation

LiveFMBench: 揭示代理工作流在规范生成中的力量与局限

Dong Xu, Jialun Cao, Guozhao Mo, Junjie Hu, Cheng Wen, Hongyu Lin, Xianpei Han, Shengchao Qin, Cong Tian, Shing-Chi Cheung, Le Sun, Yaojie Lu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) The Hong Kong University of Science(香港科学与技术大学) Guangzhou Institute of Technology, Xidian University(西安电子科技大学广州研究所)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文通过LiveFMBench系统研究LLM和代理在C程序形式化规范生成中的能力与失败模式,发现直接提示和代理流程显著提升成功率,但需排除不忠实行为以准确评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28139 2026-05-04 cs.SE cs.AI 84%

Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows

Claw-Eval-Live: 一个用于评估进化现实工作流的活体代理基准

Chenxin Li, Zhengyang Tang, Mingxin Huang, Yunlong Lin, Shijue Huang, Shengyuan Liu, Bowen Ye, Rang Li, Lei Li, Benyou Wang, Yixuan Yuan

机构 * The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) South China University of Technology(华南理工大学) Xiamen University(厦门大学) Peking University(北京大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文提出Claw-Eval-Live活体基准,通过分离可刷新信号层和可复现的发布快照,评估代理在动态工作流需求下的表现,发现可靠工作流自动化仍待解决,领先模型仅完成66.7%的任务。

Comments Project page: https://claw-eval-live.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00592 2026-04-29 cs.AI cs.SE 84%

DockSmith: Scaling Reliable Coding Environments via an Agentic Docker Builder

DockSmith:通过代理Docker构建器实现可靠编码环境的扩展

Jiaran Zhang, Luck Ma, Fanqi Wan, Di Qi, Xu Zhao, Jieyi Hou, Zhe Xie, Mengqiang Ren, Xin Wu, Zhewei Huang, Liangyu Chen, Qi Han, Xiangyu Zhang

机构 * SWE-Factory Anthropic Comanici Guo Yang Zeng

专题命中 Agent评测 :agentic(title,abstract);tool use(abstract);分类 cs.AI、cs.SE

AI总结 DockSmith通过代理Docker构建器解决软件工程代理执行基础训练和评估中的可靠环境构建问题,其核心能力涵盖长期工具使用、依赖推理和故障恢复,提升了Docker构建的监督效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24218 2026-04-28 cs.SE cs.AI 84%

RefEvo: Agentic Design with Co-Evolutionary Verification for Agile Reference Model Generation

RefEvo: 基于共进化验证的代理设计用于敏捷参考模型生成

Yifan Zhang, Jianmin Ye, Jiahao Yang, Xi Wang

机构 * School of Integrated Circuits, Southeast University, China(东南大学集成电路学院,中国) National Center of Technology Innovation for EDA, China(EDA技术创新国家中心,中国)

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 RefEvo通过动态设计规划、共进化验证机制和规格锚定策略,提升SoC设计参考模型的敏捷性和可靠性,实现95%的通过率和71.04%的上下文优化。

Comments 6 pages, 7 figures, accepted by ISEDA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14116 2026-04-23 cs.AI cs.CL 84%

TREX: Automating LLM Fine-tuning via Agent-Driven Tree-based Exploration

TREX:通过代理驱动的树形探索自动化LLM微调

Zerun Ma, Guoqiang Wang, Xinchen Xie, Yicheng Chen, He Du, Bowen Li, Yanan Sun, Wenran Liu, Kai Chen, Yining Li

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 TREX通过代理驱动的树形探索自动化LLM训练全流程,包括需求分析、文献调研、策略制定和模型训练,提升微调效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12102 2026-04-16 cs.AI cs.CV cs.LG 84%

Spatial Atlas: Compute-Grounded Reasoning for Spatial-Aware Research Agent Benchmarks

空间图谱:面向空间感知研究代理的计算导向推理

Arun Sharma

机构 * University of Minnesota, Twin Cities(明尼苏达大学,双城分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出计算导向推理(CGR)框架,通过确定性计算解决子问题后再由语言模型生成答案,构建了空间图谱系统,用于评估FieldWorkArena和MLE-Bench两个挑战性基准,通过结构化空间场景图引擎和熵引导动作选择提升空间推理的准确性和可解释性。

Comments 11 pages. Code: https://github.com/arunshar/spatial-atlas

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09121 2026-04-15 cs.CL cs.AI cs.SD 84%

Interactive ASR: Towards Human-Like Interaction and Semantic Coherence Evaluation for Agentic Speech Recognition

交互式语音识别:迈向人样交互和语义连贯性评估的代理语音识别

Peng Wang, Yanqiao Zhu, Zixuan Jiang, Qinyuan Chen, Xingjian Zhao, Xipeng Qiu, Wupeng Wang, Zhifu Gao, Xiangang Li, Kai Yu, Xie Chen

机构 * X-LANCE Lab, Shanghai Jiao Tong University(上海交通大学X-LANCE实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Xi'an Jiaotong University(西安交通大学) Fudan University(复旦大学) Tongyi Fun Team, Alibaba Group(阿里巴巴集团 Tongyi 团队)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出基于LLM的代理框架,通过语义反馈提升语音识别的语义准确性和交互修正能力,实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11806 2026-04-14 cs.AI cs.CL 84%

Detecting Safety Violations Across Many Agent Traces

在大量智能体轨迹中检测安全违规

Adam Stein, Davis Brown, Hamed Hassani, Mayur Naik, Eric Wong

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Meerkat方法,通过聚类与智能体搜索结合,有效发现自然语言指定的安全违规,提升检测效率并发现广泛开发者作弊和奖励黑客行为。

Comments 35 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06111 2026-04-13 cs.AI cs.CL 84%

AgentCE-Bench: Agent Configurable Evaluation with Scalable Horizons and Controllable Difficulty under Lightweight Environments

AgentCE-Bench: 一种可配置的智能体评估基准,具备可扩展的视野和可控难度,在轻量环境中

Wang Yang, Chaoda Song, Xinpeng Li, Debargha Ganguly, Chuang Ma, Shouren Wang, Zhihao Dou, Yuli Zhou, Vipin Chaudhary, Xiaotian Han

机构 * Case Western Reserve University(凯斯西储大学) NII LLMC (Japan)(日本国立信息学研究所LLMC) University of Zurich(苏黎世大学)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 AgentCE-Bench通过可扩展视野和可控难度,解决现有基准的高交互开销和任务分布不平衡问题,提供可靠、可解释的智能体评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07883 2026-04-10 cs.AI cs.CL cs.CY cs.MA 84%

An Agentic Evaluation Architecture for Historical Bias Detection in Educational Textbooks

用于教育教科书历史偏见检测的代理评估架构

Gabriel Stefan, Adrian-Marius Dumitran

机构 * University of Bucharest(布加勒斯特大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种代理评估架构,通过多模态筛查代理、异质陪审团和元代理,有效检测教育教科书中的隐性偏见,实验表明其在经济性和准确性上具有优势。

Comments Accepted for ITS(Intelligent Tutoring Systems) 2026 Full Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07775 2026-04-10 cs.AI cs.CL cs.CR 84%

ACIArena: Toward Unified Evaluation for Agent Cascading Injection

ACIArena:迈向多智能体系统统一评估

Hengyu An, Minxi Li, Jinghuai Zhang, Naen Xu, Chunyi Zhou, Changjiang Li, Xiaogang Xu, Tianyu Du, Shouling Ji

机构 * Zhejiang University(浙江大学) State Key Laboratory of Internet Architecture, Tsinghua University(清华大学网络架构国家重点实验室) University of California, Los Angeles(加州大学洛杉矶分校) Palo Alto Networks Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出ACIArena框架,用于评估多智能体系统(MAS)的鲁棒性,通过多攻击面和目标的系统化测试,揭示单纯依赖拓扑结构评估不足,强调需通过角色设计和受控交互提升系统安全性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23448 2026-04-08 cs.SE cs.AI 84%

Code Review Agent Benchmark

代码审查代理基准

Yuntong Zhang, Zhiyuan Pan, Imam Nur Bani Yusuf, Haifeng Ruan, Ridwan Shariffdeen, Abhik Roychoudhury

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出c-CRAB基准,用于评估代码审查代理的能力,发现现有代理仅能解决40%的任务,揭示了未来研究的潜力及人机协作的可能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04759 2026-04-07 cs.CR cs.AI cs.CL 84%

Your Agent, Their Asset: A Real-World Safety Analysis of OpenClaw

你的代理,他们的资产:OpenClaw的现实世界安全性分析

Zijun Wang, Haoqin Tu, Letian Zhang, Hardy Chen, Juncheng Wu, Xiangyan Liu, Zhenlong Yuan, Tianyu Pang, Michael Qizhe Shieh, Fengze Liu, Zeyu Zheng, Huaxiu Yao, Yuyin Zhou, Cihang Xie

机构 * UC Santa Cruz(加州大学圣克鲁兹分校) NUS(新加坡国立大学) Tencent(腾讯) ByteDance(字节跳动) UC Berkeley(加州大学伯克利分校) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本文首次对OpenClaw进行现实世界安全性评估,引入CIK分类法分析代理的持久状态,发现攻击单个CIK维度可显著提高攻击成功率,强调需系统性保障个人AI代理的安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06448 2026-04-07 cs.MA cs.AI cs.CL cs.SI 84%

When AI Agents Collude Online: Financial Fraud Risks by Collaborative LLM Agents on Social Platforms

当AI代理在线合谋:社交平台上基于协作LLM代理的金融欺诈风险

Qibing Ren, Zhijie Zheng, Jiaxuan Guo, Junchi Yan, Lizhuang Ma, Jing Shao

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学)

专题命中 Agent评测 :AI agent(title);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 研究大型多代理系统中集体金融欺诈的风险,通过MultiAgentFraudBench基准测试分析欺诈行为协作机制及影响因素,提出内容警告、LLM监控和群体韧性提升等缓解策略。

Comments ICLR 2026, Code is available at https://github.com/zheng977/MutiAgent4Fraud

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02145 2026-04-03 cs.AI cs.CL 84%

MTI: A Behavior-Based Temperament Profiling System for AI Agents

MTI:一种基于行为的 temperament 评估系统用于 AI 代理

Jihoon Jeong

机构 * ModuLabs

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出 MTI 评估系统,通过四个维度测量 AI 代理 temperament,发现行为差异与模型大小无关,揭示了 RLHF 对 temperament 的影响。

Comments 29 pages, 6 figures, 12 tables. Paper #3 in the Model Medicine Series (Paper #1: arXiv:2603.04722)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01437 2026-04-03 cs.SE cs.AI 84%

Reproducible, Explainable, and Effective Evaluations of Agentic AI for Software Engineering

可重复、可解释和有效的代理AI在软件工程中的评估

Jingyue Li, André Storhaug

机构 * Norwegian University of Science and Technology(挪威科技大学)

专题命中 Agent评测 :agentic(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.SE

AI总结 本文分析了18篇关于代理AI在软件工程中评估的论文,提出指南以提升评估的可重复性、可解释性和有效性,通过公开TAR轨迹和LLM交互数据促进不同方法的系统比较。

Comments 7 pages, 5 figures, accepted to the 2nd International Workshop on Responsible Software Engineering (ResponsibleSE 2026), co-located with FSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00280 2026-04-02 cs.SE cs.AI 84%

VeriAct: Beyond Verifiability -- Agentic Synthesis of Correct and Complete Formal Specifications

VeriAct:超越可验证性——基于代理的正确且完整的正式规范合成

Md Rakib Hossain Misu, Iris Ma, Cristina V. Lopes

机构 * University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.AI、cs.SE

AI总结 本文提出VeriAct框架,通过迭代合成与修复规范,超越传统方法的性能极限,生成正确且完整的正式规范。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06188 2026-03-31 cs.AI cs.CL cs.MA 84%

SkillFlow: Scalable and Efficient Agent Skill Retrieval System

SkillFlow:可扩展且高效的智能体技能检索系统

Fangzhou Li, Pagkratios Tagkopoulos, Ilias Tagkopoulos

机构 * University of California, Davis(加州大学戴维斯分校) USDA/NSF AI Institute for Next Generation Food Systems(美国农业部/国家科学基金会下一代食品系统人工智能研究所) Process Integration and Predictive Analytics(过程集成与预测分析)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 SkillFlow通过多阶段检索流程提升智能体技能检索效率,实现在SkillsBench上Pass@1提升78.3%,但Terminal-Bench显示检索效果受限于技能库质量

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26710 2026-03-31 cs.IR cs.AI cs.CL cs.MA 84%

Agentic AI for Human Resources: LLM-Driven Candidate Assessment

面向人力资源的代理AI:基于大语言模型的候选人评估

Kamer Ali Yuksel, Abdul Basit Anees, Ashraf Elneima, Sanjika Hewavitharana, Mohamed Al-Badrashiny, Hassan Sawaf

机构 * aiXplain, Inc.(aiXplain公司)

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一个模块化且可解释的框架,利用大语言模型自动化招聘中的候选人评估。系统整合多种来源生成结构化评估报告,采用LLM生成的评分标准和多代理架构进行细粒度评估,输出透明、可审计的评估报告和推荐。

Comments Published in 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026)

Journal ref 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026), Rabat, Morocco

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21321 2026-03-24 cs.AI cs.CL 84%

Improving Coherence and Persistence in Agentic AI for System Optimization

提升系统优化代理AI的连贯性与持续性

Pantea Karimi, Kimia Noorbakhsh, Mohammad Alizadeh, Hari Balakrishnan

机构 * MIT(麻省理工学院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Engram架构,通过解耦长周期探索与单一上下文窗口约束,提升代理AI在多领域系统优化中的连贯性和持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20300 2026-03-24 cs.SE cs.AI 84%

From Human Interfaces to Agent Interfaces: Rethinking Software Design in the Age of AI-Native Systems

从人机界面到代理界面:在AI原生系统时代重新思考软件设计

Shaolin Wang, Yi Mei, Haoyang Che, He Jiang, Shui Yu, Ying Gu

机构 * Victoria University of Wellington, New Zealand(维多利亚大学惠灵顿分校) Independent Researcher(独立研究员) Dalian University of Technology, China(大连理工大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 本文探讨了软件设计从以人为中心的界面转向以代理为中心的调用系统,提出了代理接口的概念和设计原则,为AI原生软件设计提供理论基础。

Comments 4 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04017 2026-03-18 cs.AI cs.LG physics.ao-ph 84%

Zephyrus: An Agentic Framework for Weather Science

Zephyrus:一种用于气象科学的代理框架

Sumanth Varambally, Marshall Fisher, Jas Thakker, Yiwei Chen, Zhirui Xia, Yasaman Jafari, Ruijia Niu, Manas Jain, Veeramakali Vignesh Manivannan, Zachary Novack, Luyu Han, Srikar Eranky, Salva Rühling Cachay, Taylor Berg-Kirkpatrick, Duncan Watson-Parris, Yi-An Ma, Rose Yu

机构 * UC San Diego(加州大学圣地亚哥分校)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Zephyrus框架,结合大语言模型与天气数据交互,解决传统模型缺乏语言推理的问题,通过新基准测试展示其在天气任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏