arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-18 至 2026-03-18 共收录 22 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 22 篇

2603.16215 2026-03-18 cs.MA cs.AI 88%

CoMAI: A Collaborative Multi-Agent Framework for Robust and Equitable Interview Evaluation

CoMAI:一种用于鲁棒且公平面试评估的协作多智能体框架

Gengxin Sun, Ruihao Yu, Liangyi Yin, Yunqi Yang, Bin Zhang, Zhiwei Xu

机构 * Shandong University(山东大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 CoMAI通过协作多智能体框架实现鲁棒且公平的面试评估,采用模块化任务分解架构,包含问题生成、安全、评分和总结四个智能体,提升评估的准确性和公平性。

Comments Gengxin Sun and Ruihao Yu contributed equally to this research. Bin Zhang and Zhiwei Xu are the corresponding authors. 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15668 2026-03-18 cs.AI cs.CR quant-ph 85%

Quantum-Secure-By-Construction (QSC): A Paradigm Shift For Post-Quantum Agentic Intelligence

量子安全由设计(QSC):后量子代理智能的范式转变

Arit Kumar Bishwas, Mousumi Sen, Albert Nieto-Morales, Joel Jacob Varghese

机构 * PricewaterhouseCoopers USA(普华永道美国公司) Independent Researcher(独立研究者)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出QSC范式,通过融合后量子密码学、量子随机数生成和量子密钥分发,为代理智能系统提供运行时自适应的安全架构,减少量子安全引入的复杂性和成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13517 2026-03-18 cs.CR 85%

CTI-REALM: Benchmark to Evaluate Agent Performance on Security Detection Rule Generation Capabilities

CTI-REALM:评估安全检测规则生成能力的基准测试

Arjun Chakraborty, Sandra Ho, Adam Cook, Manuel Meléndez

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);workflow(abstract)

AI总结 CTI-REALM基准测试旨在评估AI代理解读网络威胁情报和生成检测规则的能力,通过模拟真实安全分析师工作流程,评估代理在不同系统和平台上的表现,展示了AI代理在检测工程中的潜力。

Comments 11 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04017 2026-03-18 cs.AI cs.LG physics.ao-ph 84%

Zephyrus: An Agentic Framework for Weather Science

Zephyrus:一种用于气象科学的代理框架

Sumanth Varambally, Marshall Fisher, Jas Thakker, Yiwei Chen, Zhirui Xia, Yasaman Jafari, Ruijia Niu, Manas Jain, Veeramakali Vignesh Manivannan, Zachary Novack, Luyu Han, Srikar Eranky, Salva Rühling Cachay, Taylor Berg-Kirkpatrick, Duncan Watson-Parris, Yi-An Ma, Rose Yu

机构 * UC San Diego(加州大学圣地亚哥分校)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Zephyrus框架,结合大语言模型与天气数据交互,解决传统模型缺乏语言推理的问题,通过新基准测试展示其在天气任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16586 2026-03-18 cs.AI 83%

Runtime Governance for AI Agents: Policies on Paths

AI代理的运行时治理:路径上的政策

Maurits Kaptein, Vassilis-Javed Khan, Andriy Podstavnychy

机构 * Eindhoven University of Technology(埃因霍温理工大学) Kyvvu B.V.(Kyvvu公司)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出通过路径作为核心对象,研究AI代理运行时治理,探讨路径依赖政策的框架与实现,分析合规性评估及开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16161 2026-03-18 cs.AI 83%

SQL-ASTRA: Alleviating Sparse Feedback in Agentic SQL via Column-Set Matching and Trajectory Aggregation

SQL-ASTRA: 缓解代理SQL中的稀疏反馈 via 列集匹配和轨迹聚合

Long Li, Zhijian Zhou, Jiangxuan Long, Peiyang Liu, Weidi Xu, Zhe Wang, Shirui Pan, Chao Qu

机构 * Griffith University(格里菲斯大学) Fudan University(复旦大学) The University of Hong Kong(香港大学) Peking University(北京大学) InFly Shanghai Innovation Institute(上海创新研究院) Shanghai Academy of Artificial Intelligence for Science(上海人工智能科学研究院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出SQL-ASTRA框架,通过列集匹配和轨迹聚合解决代理SQL中的稀疏反馈问题,引入轨迹奖励和列集匹配奖励,提升多轮任务的奖励分配效率与稳定性。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15976 2026-03-18 cs.AI 83%

An Agentic Evaluation Framework for AI-Generated Scientific Code in PETSc

面向AI生成科学代码的PETSc代理评估框架

Hong Zhang, Barry Smith, Satish Balay, Le Chen, Murat Keceli, Lois Curfman McInnes, Junchao Zhang

机构 * Argonne National Laboratory(阿贡国家实验室)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出petscagent-bench框架,通过代理评估代理的方式,评估AI生成的科学代码在正确性、性能、代码质量等方面的表现,揭示传统指标的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08117 2026-03-18 cs.AI cs.IR 83%

UIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information Seeking

UIS-Digger:面向现实世界未索引信息检索的综合性研究代理系统

Chang Liu, Chuqiao Kuang, Tianyi Zhuang, Yuxin Cheng, Huichi Zhou, Xiaoguang Li, Lifeng Shang

机构 * Huawei Technologies Ltd.(华为技术有限公司) The University of Hong Kong(香港大学) University College London(伦敦大学学院)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出UIS-Digger,一种新型多代理框架,通过双模式浏览和同时网页搜索与文件解析,解决未索引信息检索问题,展示了其在UIS-QA基准上的性能优势。

Comments 21 pages, 5 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15903 2026-03-18 cs.CL 79%

Agent-based imitation dynamics can yield efficiently compressed population-level vocabularies

基于代理的模仿动力学可以产生高效压缩的群体层面词汇

Nathaniel Imel, Richard Futrell, Michael Franke, Noga Zaslavsky

机构 * Department of Psychology, New York University(纽约大学心理学系) Department of Language Science, University of California, Irvine(加州大学欧文分校语言科学系) Department of Linguistics, University of Tübingen(图宾根大学语言学系)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文探讨了基于代理的模仿动力学如何在信号游戏中实现词汇的高效压缩,结合进化博弈论与信息瓶颈框架,揭示了词汇优化的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15798 2026-03-18 cs.AI 79%

CUBE: A Standard for Unifying Agent Benchmarks

CUBE:统一智能体基准的标准化

Alexandre Lacoste, Nicolas Gontier, Oleh Shliazhko, Aman Jaiswal, Kusha Sareen, Shailesh Nanisetty, Joan Cabezas, Manuel Del Verme, Omar G. Younis, Simone Baratta, Matteo Avalle, Imene Kerboua, Xing Han Lù, Elron Bandel, Michal Shmueli-Scheuer, Asaf Yehudai, Leshem Choshen, Jonathan Lebensold, Sean Hughes, Massimo Caccia, Alexandre Drouin, Siva Reddy, Tao Yu, Yu Su, Graham Neubig, Dawn Song

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出CUBE标准,通过MCP和Gym构建统一协议,实现智能体基准的标准化,减少碎片化,提升研究效率。

Comments Position paper. 10 pages. Reference implementation: https://github.com/The-AI-Alliance/cube-standard

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15714 2026-03-18 cs.CR cs.AI 79%

How Vulnerable Are AI Agents to Indirect Prompt Injections? Insights from a Large-Scale Public Competition

AI代理对间接提示注入攻击的易受攻击性有多大?来自大规模公开竞赛的见解

Mateusz Dziemian, Maxwell Lin, Xiaohan Fu, Micha Nowak, Nick Winter, Eliot Jones, Andy Zou, Lama Ahmad, Kamalika Chaudhuri, Sahana Chennabasappa, Xander Davies, Lauren Deason, Benjamin L. Edelman, Tanner Emek, Ivan Evtimov, Jim Gust, Maia Hamin, Kat He, Klaudia Krawiecka, Riccardo Patana, Neil Perry, Troy Peterson, Xiangyu Qi, Javier Rando, Zifan Wang, Zihan Wang, Spencer Whitman, Eric Winsor, Arman Zharmagambetov, Matt Fredrikson, Zico Kolter

机构 * Gray Swan AI OpenAI Meta Anthropic US CAISI(美国CAISI) UK AISI(英国AISI) Carnegie Mellon University(卡内基梅隆大学) Center for AI Safety(人工智能安全中心)

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 本文通过大规模公开竞赛评估了AI代理在工具调用、编程和计算机使用中的双重目标,发现所有模型均易受间接提示注入攻击,攻击成功率从0.5%到8.5%不等,并揭示了指令遵循架构的根本性弱点。

Comments 38 pages, 16 figures. Newer version to cover Q1 competition results on latest models in progress. Code at https://github.com/grayswansecurity/ipi_arena_os Partial Dataset at https://huggingface.co/datasets/sureheremarv/ipi_arena_attacks

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16397 2026-03-18 cs.CL cs.AI 79%

Fanar 2.0: Arabic Generative AI Stack

Fanar 2.0:阿拉伯生成AI堆栈

FANAR TEAM, Ummar Abbas, Mohammad Shahmeer Ahmad, Minhaj Ahmad, Abdulaziz Al-Homaid, Anas Al-Nuaimi, Enes Altinisik, Ehsaneddin Asgari, Sanjay Chawla, Shammur Chowdhury, Fahim Dalvi, Kareem Darwish, Nadir Durrani, Mohamed Elfeky, Ahmed Elmagarmid, Mohamed Eltabakh, Asim Ersoy, Masoomali Fatehkia, Mohammed Qusay Hashim, Majd Hawasly, Mohamed Hefeeda, Mus'ab Husaini, Keivin Isufaj, Soon-Gyo Jung, Houssam Lachemat, Ji Kim Lucas, Abubakr Mohamed, Tasnim Mohiuddin, Basel Mousi, Hamdy Mubarak, Ahmad Musleh, Mourad Ouzzani, Amin Sadeghi, Husrev Taha Sencar, Mohammed Shinoy, Omar Sinan, Yifan Zhang

机构 * Qatar Computing Research Institute (QCRI)(卡塔尔计算研究 institute) Hamad Bin Khalifa University(哈马德·本·卡西姆大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 Fanar 2.0在资源受限条件下实现卓越性能,通过数据质量优先、持续预训练和模型融合,提升阿拉伯语知识、语言、方言及英语能力,同时引入多项新功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15831 2026-03-18 cs.AI cs.CL 73%

Persona-Conditioned Risk Behavior in Large Language Models: A Simulated Gambling Study with GPT-4.1

具有人格条件的风险行为在大语言模型中的表现:基于GPT-4.1的模拟赌博研究

Sankalp Dubedy

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 本文通过模拟赌博实验研究GPT-4.1在不同社会经济人格下的风险行为,发现其行为符合卡尼曼和特沃斯基的前景理论预测,揭示了大语言模型潜在的认知偏差。

Comments 21 pages, 13 figures, 9 tables. Independent research. Submitted to arXiv for open dissemination

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16734 2026-03-18 cs.AI 70%

Differential Harm Propensity in Personalized LLM Agents: The Curious Case of Mental Health Disclosure

个性化LLM代理中的差异性伤害倾向:心理健康披露的奇特案例

Caglar Yildirim

机构 * Khoury College of Computer Sciences(科里学院计算机科学学院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 研究探讨了心理健康披露对代理有害行为的影响,发现个性化设置可降低伤害,但易受对抗性压力影响,需加强个性化评估与安全措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18808 2026-03-18 cs.SE 70%

SR-Eval: Evaluating LLMs on Code Generation under Stepwise Requirement Refinement

SR-Eval: 评估在逐步需求细化下的LLM代码生成能力

Zexun Zhan, Shuzheng Gao, Ruida Hu, Cuiyun Gao

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 SR-Eval是一个针对迭代代码生成的评估基准,通过多轮交互模拟真实开发流程,评估LLM在逐步需求细化下的表现,发现最佳模型在功能级任务中仅达到22.67%的完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21721 2026-03-18 cs.AI cs.HC 57%

PREFINE: Personalized Story Generation via Simulated User Critics and User-Specific Rubric Generation

PREFINE:通过模拟用户批评和用户特定评分标准实现个性化故事生成

Kentaro Ueda, Takehiro Takayanagi

机构 * Nara Institute of Science and Technology(奈良科学技术研究所) The University of Tokyo(东京大学) Simulacra Inc.(Simulacra公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 PREFINE通过模拟用户批评和生成用户特定评分标准,实现无需用户反馈的个性化故事生成,提升个性化效果并保持通用质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20606 2026-03-18 cs.GT cs.CY cs.LG econ.TH 57%

Strategic Costs of Perceived Bias in Fair Selection

公平选拔中的感知偏见战略成本

L. Elisa Celis, Lingxiao Huang, Milind Sohoni, Nisheeth K. Vishnoi

机构 * Yale University(耶鲁大学) Nanjing University(南京大学) IIT Bombay(印度理工学院班加罗尔分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文通过博弈论模型分析不同社会经济群体在感知后选择价值差异下的努力分配,揭示这种差异如何影响代表性、社会福利和效用,提出成本敏感优化框架以减少不平等。

Comments The paper has been accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25421 2026-03-18 cs.HC 50%

Small Talk, Big Impact? LLM-based Conversational Agents to Mitigate Passive Fatigue in Conditional Automated Driving

小声谈,大影响?基于LLM的对话代理用于缓解条件自动化驾驶中的被动疲劳

Lewis Cockram, Yueteng Yu, Jorge Pardo, Xiaomeng Li, Andry Rakotonirainy, Jonny Kuo, Sebastien Demmel, Mike Lenné, Ronald Schroeter

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了基于LLM的对话代理在条件自动化驾驶中缓解被动疲劳的效果,通过实验证明该代理能提升驾驶员警觉性,并揭示了用户对代理的偏好特征。

Comments Preview version of CHI '26 Conference on Human Factors in Computing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23164 2026-03-18 cond-mat.soft nlin.PS 50%

Arrested coarsening in active colloidal suspensions driven by nonreciprocal electrohydrodynamic interactions

活性胶体悬浮液中非互易电液压相互作用驱动的停滞粗化

Shoma Hara, Masazumi Okada, Keisuke Kittaka, Sho Tanami, Yuichi Iwasaki, Hiroaki Ishikawa, Kiwamu Yoshii, Yutaka Sumino

专题命中 Agent评测 :agent(abstract)

AI总结 研究揭示了非互易电液压相互作用如何在活性胶体悬浮液中抑制粗化并维持动态重构的集体态。

Comments 18 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04143 2026-03-18 cs.GT 50%

Disentangling trust from cooperation: Evolution of trust as reduced monitoring in social dilemmas

分离信任与合作:在社会困境中信任作为减少监控的演变

Cedric Perret, The Anh Han, Elias Fernández Domingos, Theodor Cimpeanu, Simon T. Powers

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过构建信任作为减少监控的启发式策略,探讨了信任如何促进合作,揭示了信任与合作之间的区别,并在不同社会困境中验证了该策略的有效性。

Journal ref Chaos, Solitons & Fractals 208, 118130 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21537 2026-03-18 physics.soc-ph cond-mat.stat-mech 50%

Modelling competition for space: Emergent inefficiency and inequality due to spatial self-organization among a group of crowd-avoiding agents

空间竞争建模:由于一群避 crowds 的代理的自组织导致的涌现低效与不平等

Ann Mary Mathew, V Sasidevan

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了一种新型模型,探讨了在复杂适应系统中,代理为避免局部拥挤而竞争空间资源的动力学和涌现行为,发现低效利用空间在特定密度下出现峰值,不平等程度随信息量降低而减少。

Comments 14 figures, 22 pages

Journal ref Physica A: Statistical Mechanics and its Applications 660, 130360 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15822 2026-03-18 cs.CV 50%

Beyond the Embedding Bottleneck: Adaptive Retrieval-Augmented 3D CT Report Generation

突破嵌入瓶颈:适应性检索增强的3D CT报告生成

Renjie Liang, Yiling Ma, Yang Xing, Zhengkang Fan, Jinqian Pan, Chengkun Sun, Li Li, Kuang Gong, Jie Xu

机构 * University of Florida(佛罗里达大学) Yale University(耶鲁大学) University of Southern California(南加州大学)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出AdaRAG-CT框架,通过引入补充文本信息缓解3D CT视觉表示瓶颈,提升CT-RATE基准的临床效果。

详情

展开后加载摘要…

URL PDF HTML 收藏