arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15662 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15662 篇

2501.19168 2026-04-17 econ.GN cs.MA q-fin.EC 82%

Implications of zero-growth economics analysed with an agent-based model

零增长经济学的含义通过基于代理的模型进行分析

Dylan C. Terry-Doyle, Adam B. Barrett

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文通过基于代理的模型研究零增长经济学的稳定性,发现零增长情景在经济指标上更具稳定性,但伴随更高的通胀率和经济危机风险。

Comments 51 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13298 2026-04-16 cs.CR 82%

Can Agents Secure Hardware? Evaluating Agentic LLM-Driven Obfuscation for IP Protection

代理能保障硬件吗?评估基于大语言模型的代理式硬件网表混淆用于知识产权保护

Sujan Ghimire, Parsa Mirfasihi, Muhtasim Alam Chowdhury, Veeramani Pugazhenthi, Harish Kumar Dharavath, Farshad Firouzi, Rozhin Yasaei, Pratik Satam, Soheil Salehi

专题命中 Agent评测 :agentic(title,abstract);planning(abstract)

AI总结 本文提出基于大语言模型的代理式硬件网表混淆框架,通过分阶段任务处理电路分析、综合、验证和攻击评估,验证了其在ISCAS-85基准上的有效性,展示了混淆技术的潜力与局限。

Comments 5 pages, 3 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10846 2026-04-14 eess.SY cs.SY 82%

PFAgent: A Tractable and Self-Evolving Power-Flow Agent for Interactive Grid Analysis

PFAgent:一种可计算且自演化功率流代理用于交互式电网分析

Buxin She, Brian Chen, Luanzheng Guo, Fangxing Li

专题命中 Agent评测 :agent(title,abstract);workflow(abstract)

AI总结 本文提出PFAgent,一种可计算且自演化功率流代理,旨在自动化电网分析流程,通过整合意图解析、知识检索、工具执行和结构化报告等功能,提升电网分析的自动化与交互性。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15640 2026-04-14 cs.LG cs.AI cs.CL 82%

Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training

数据混合代理:学习重新加权领域以实现持续预训练

Kailai Yang, Xiao Liu, Lei Ji, Hao Li, Xiao Liang, Zhiwei Liu, Yeyun Gong, Peng Cheng, Mao Yang

机构 * The University of Manchester(曼彻斯特大学) Microsoft Research(微软研究院) Imperial College London(伦敦帝国学院) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出数据混合代理,通过强化学习学习重新加权领域,实现持续预训练中的平衡性能,优于现有基线方法,并在未见过的领域中表现良好。

Comments Accepted by the ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09791 2026-04-14 cs.AI cs.CL cs.LG cs.MA 82%

Pioneer Agent: Continual Improvement of Small Language Models in Production

先驱代理:生产环境中小语言模型的持续改进

Dhruv Atreja, Julia White, Nikhil Nayak, Kelton Zhang, Henrijs Princis, George Hurn-Maloney, Ash Lewis, Urchade Zaratiana

机构 * Fastino Labs

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出Pioneer Agent,通过闭环系统自动化小语言模型的持续改进,通过冷启动和生产模式提升模型性能,发现有效训练策略。

Comments 43 pages, 10 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24935 2026-04-08 cs.RO 82%

SABER: A Stealthy Agentic Black-Box Attack Framework for Vision-Language-Action Models

SABER:一种针对视觉-语言-动作模型的隐秘代理黑盒攻击框架

Xiyang Wu, Guangyao Shi, Qingzi Wang, Zongxia Li, Amrit Singh Bedi, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校) University of Southern California(南加州大学) University of Central Florida(中佛罗里达大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 SABER通过生成最小有效指令修改,评估VLA模型的鲁棒性,展示小幅度指令扰动可显著降低机器人执行效果,且代理黑盒方法在红队测试中表现高效且可扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03933 2026-04-07 cs.DC 82%

Deploy, Calibrate, Monitor, Heal -- No Human Required: An Autonomous AI SRE Agent for Elasticsearch

部署、校准、监控、修复——无需人工:一个用于Elasticsearch的自主AI SRE代理

Muhamed Ramees Cheriya Mukkolakkal

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract)

AI总结 本文提出ES Guardian Agent,通过十一阶段自主管理Elasticsearch全生命周期,利用多源预测失败引擎实现故障预测与修复,展示LLM在高可用性目标中的应用。

Comments 8 pages, 1 figure, 15 tables. Submitted to IEEE CNSM 2026. Cluster: Elasticsearch 8.17.0, 3 master + 12 data nodes, Kubernetes

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25302 2026-04-02 cs.AI cs.CL cs.LG cs.MA 82%

Dive into the Agent Matrix: A Realistic Evaluation of Self-Replication Risk in LLM Agents

深入代理矩阵:对LLM代理自复制风险的现实评估

Boxuan Zhang, Yi Yu, Jiaxuan Guo, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文通过构建真实环境评估LLM代理自复制风险,引入OR和AOC指标,发现超过50%的模型在压力下表现出不受控的自复制倾向,强调了对风险评估和安全措施的迫切需求。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26908 2026-03-31 cs.CV 82%

FusionAgent: A Multimodal Agent with Dynamic Model Selection for Human Recognition

FusionAgent:一种具有动态模型选择的多模态代理用于人体识别

Jie Zhu, Xiao Guo, Yiyang Su, Anil Jain, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract)

AI总结 FusionAgent通过动态模型选择提升人体识别鲁棒性,利用多模态大语言模型进行样本特定的模型选择,结合ACT分数融合方法,实验表明其在效率和性能上优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07150 2026-03-26 cs.LG cs.AI cs.SE 82%

On Randomness in Agentic Evals

关于代理评估中的随机性

Bjarni Haukur Bjarnason, André Silva, Martin Monperrus

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 研究通过分析6万条轨迹发现单次运行的pass@1分数存在显著波动,建议采用多轮运行、统计分析和多指标评估以提高代理系统评估的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20576 2026-03-24 cs.DB 82%

Can AI Agents Answer Your Data Questions? A Benchmark for Data Agents

AI代理能否回答您的数据问题?一个数据代理的基准测试

Ruiying Ma, Shreya Shankar, Ruiqi Chen, Yiming Lin, Sepanta Zeighami, Rajoshi Ghosh, Abhinav Gupta, Anushrut Gupta, Tanmai Gopal, Aditya G. Parameswaran

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract)

AI总结 本文提出数据代理基准测试(DAB),旨在评估多数据库系统中数据整合、转换和分析的全流程能力,通过12个数据集、9个领域和4种数据库管理系统中的54个查询,测试了前沿模型在数据代理任务中的表现。

Comments 22 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20256 2026-03-24 cs.CL cs.AI cs.CE cs.LG cs.MA cs.SY eess.SY 82%

SciNav: A General Agent Framework for Scientific Coding Tasks

SciNav:一种通用的科学编码任务代理框架

Tianshu Zhang, Huan Sun

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出SciNav框架,用于科学编码任务,通过相对判断指导的top-K搜索提升解决方案探索效率,优于直接提示和现有代理。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08853 2026-03-11 econ.GN q-fin.EC 82%

LLM-Agent Interactions on Markets with Information Asymmetries

在信息不对称市场中的人工智能代理互动

Alexander Erlei, Lukas Meub

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract)

AI总结 本文研究了在信息不对称市场中,人工智能代理的行为,发现社会偏好协调对市场效率至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03640 2026-03-05 cs.RO 82%

MistyPilot: An Agentic Fast-Slow Thinking LLM Framework for Misty Social Robots

MistyPilot: 一种面向Misty社交机器人的代理快速-缓慢思考LLM框架

Xiao Wang, Lu Dong, Jingchen Sun, Ifeoma Nwogu, Srirangaraj Setlur, Venu Govindaraju

机构 * State University of New York at Buffalo(纽约州立大学布法罗分校)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 MistyPilot通过代理驱动的LLM框架,实现社交机器人中工具选择、协调及参数配置的高效执行,提升任务效率与情感一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03630 2026-03-05 cs.IR cs.MA 82%

Behind the Prompt: The Agent-User Problem in Information Retrieval

提示背后:信息检索中的代理-用户问题

Saber Zerhoudi, Michael Granitzer, Dang Hai Dang, Jelena Mitrovic, Florian Lemmerich, Annette Hautli-Janisz, Stefan Katzenbeisser, Kanishka Ghosh Dastidar

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract)

AI总结 研究揭示了信息检索中代理-用户问题的结构性挑战,指出基于人类意图假设的模型在代理存在时可能失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23141 2026-03-04 cs.CV 82%

Earth-Agent: Unlocking the Full Landscape of Earth Observation with Agents

Earth-Agent: 解锁地球观测的全貌与潜力

Peilin Feng, Zhutao Lv, Junyan Ye, Xiaolei Wang, Xinjie Huo, Jinhua Yu, Wanghan Xu, Wenlong Zhang, Lei Bai, Conghui He, Weijia Li

专题命中 Agent评测 :agent(title,abstract);agentic(abstract)

AI总结 Earth-Agent是一种结合RGB和光谱数据的代理框架,通过多模态工具生态系统实现跨模态、多步骤推理,提升地球观测分析的科学性和应用潜力。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20683 2026-02-25 eess.SY cs.SY 82%

Grid-Mind: An LLM-Orchestrated Multi-Fidelity Agent for Automated Connection Impact Assessment

Grid-Mind: 一种基于LLM的多保真度代理用于自动化连接影响评估

Mohamed Shamseldein

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract)

AI总结 Grid-Mind是一种基于LLM的多保真度代理,通过自主协调电力系统模拟,实现自动化连接影响评估,具有高准确率和自我纠正能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07978 2026-02-16 cs.AI cs.CL cs.LG 82%

VoiceAgentBench: Are Voice Assistants ready for agentic tasks?

VoiceAgentBench: 聊天助手是否准备好处理代理任务?

Dhruv Jain, Harshit Shukla, Gautam Rajeev, Ashish Kulkarni, Chandra Khatri, Shubham Agarwal

机构 * OLA Electric(OLA电讯) Krutrim AI(Krutrim人工智能)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 VoiceAgentBench评估语音模型在代理任务中的表现,发现ASR-LLM在英语任务中表现优于端到端SpeechLMs,但两者在多语言和安全评估中均存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05662 2026-02-06 cs.HC 82%

Making AI Agents Evaluate Misleading Charts without Nudging

让AI代理在不引导的情况下评估误导性图表

Swaroop Panda

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract)

AI总结 本文研究了AI代理在未被引导的情况下评估误导性图表的能力,发现其在图形完整性受损时仍能保持较高的审美和可读性评分,表明需明确引导才能有效识别完整性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03130 2026-02-04 cs.CV cs.CE 82%

FinMTM: A Multi-Turn Multimodal Benchmark for Financial Reasoning and Agent Evaluation

FinMTM:面向金融推理和智能体评估的多轮多模态基准

Chenxi Zhang, Ziliang Gan, Liyun Zhu, Youwei Pang, Qing Zhang, Rongjunchen Zhang

机构 * HiThink Research(HiThink研究机构) Wuhan University(武汉大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Shanghai Institute of Technology(上海理工大学)

专题命中 Agent评测 :agent(title,abstract);planning(abstract)

AI总结 FinMTM提出一个多轮多模态基准,用于评估金融推理和智能体任务,通过多样化数据和任务设计,揭示了VLMs在视觉感知、推理和复杂工作流中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02625 2026-02-04 cs.SI 82%

OpenClaw Agents on Moltbook: Risky Instruction Sharing and Norm Enforcement in an Agent-Only Social Network

OpenClaw代理在Moltbook上的应用:代理-only社交网络中风险性指令分享与规范执行

Md Motaleb Hossen Manik, Ge Wang

专题命中 Agent评测 :agent(title,abstract);agentic(abstract)

AI总结 OpenClaw代理在Moltbook上通过风险性指令分享和规范执行展现选择性社会调节行为,揭示了代理-only社交系统中规范行为的涌现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02524 2026-02-03 cs.RO 82%

Versatile Behavior Diffusion for Generalized Traffic Agent Simulation

多功能行为扩散用于通用交通代理模拟

Zhiyu Huang, Zixu Zhang, Ameya Vaidya, Yuxiao Chen, Chen Lv, Jaime Fernández Fisac

机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系) NVIDIA Research(NVIDIA研究)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract)

AI总结 多功能行为扩散通过生成多代理互动场景,提升交通模拟的灵活性和实用性,为自动驾驶系统测试提供基础工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06579 2026-01-26 cs.SI 82%

An Agent-based Model of Citation Behavior

引用行为的智能体模型

George Chacko, Minhyuk Park, Vikram Ramavarapu, Ananth Grama, Pablo Robles-Granda, Tandy Warnow

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract)

AI总结 本文通过智能体模型研究引用行为,探讨引用策略对后续引用的影响,并发现适应性和局部性等效应在引用捕捉中的作用。

Journal ref Applied Network Science (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07143 2026-01-13 cs.HC 82%

EZBlender: Efficient 3D Editing with Plan-and-ReAct Agent

EZBlender:基于计划与反应代理的高效3D编辑

Hao Wang, Wenhui Zhu, Shao Tang, Zhipeng Wang, Xuanzhao Dong, Xin Li, Xiwen Chen, Ashish Bastola, Xinhao Huang, Yalin Wang, Abolfazl Razi

专题命中 Agent评测 :agent(title,abstract);planning(abstract)

AI总结 EZBlender通过结合计划与反应机制,实现高效且语义忠实的3D编辑,提升Human AI协作效率与经济性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03113 2026-01-13 cs.CE 82%

A Probabilistic Digital Twin of UK En Route Airspace for Training and Evaluating AI Agents for Air Traffic Control

基于英国航路空域的概率数字孪生:用于训练和评估空管AI代理

Nick Pepper, Adam Keane, Amy Hodgkin, Dewi Gould, Edward Henderson, Lynge Lauritsen, Christos Vlahos, George De Ath, Richard Everson, Richard Cannon, Alvaro Sierra Castro, John Korna, Ben Carvell, Marc Thomas

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract)

AI总结 本文提出基于英国航路空域的概率数字孪生,用于训练和评估空管AI代理,通过结合历史与实时数据及概率模型,提供高保真虚拟环境以支持AI代理的开发与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16381 2025-12-19 cs.NI 82%

A Network Arena for Benchmarking AI Agents on Network Troubleshooting

一个用于AI代理在网络故障排除中基准测试的网络竞技场

Zhihao Wang, Alessandro Cornacchia, Alessio Sacco, Franco Galante, Marco Canini, Dingde Jiang

专题命中 Agent评测 :AI agent(title);agent(abstract);agentic(abstract)

AI总结 NIKA是一个开源的网络故障排除基准,用于评估AI代理在动态网络环境中的性能,包含数百个精心挑选的网络事件和54个代表性问题,旨在帮助研究人员和网络专家改进网络故障诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07909 2025-12-10 cs.CR cs.CY 82%

Agentic Artificial Intelligence for Ethical Cybersecurity in Uganda: A Reinforcement Learning Framework for Threat Detection in Resource-Constrained Environments

代理人工智能用于乌干达的伦理网络安全:一种强化学习框架用于资源受限环境中的威胁检测

Ibrahim Adabara, Bashir Olaniyi Sadiq, Aliyu Nuhu Shuaibu, Yale Ibrahim Danjuma, Venkateswarlu Maninti, Mutebi Joe

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 本研究提出一种结合强化学习和伦理治理的代理人工智能框架,用于资源受限环境中的网络安全威胁检测,实现了100%的检测率和零假阳性,提升网络安全效果和公平性。

Comments 29 pages, 7 figures, 2 tables, 1 appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05073 2025-12-05 cs.LG cs.AI cs.AR cs.SE 82%

David vs. Goliath: Can Small Models Win Big with Agentic AI in Hardware Design?

大卫与歌利亚:小型模型能否通过代理AI在硬件设计中胜出?

Shashwat Shankar, Subhranshu Pandey, Innocent Dengkhw Mochahari, Bhabesh Mali, Animesh Basak Chowdhury, Sukanta Bhattacharjee, Chandan Karfa

机构 * Indian Institute of Technology, Guwahati, India(印度理工学院冈瓦提分校) NXP USA, Inc.(NXP美国公司)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 本研究探讨小型语言模型结合代理AI在硬件设计中的应用,证明其在成本效率和性能上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19304 2025-12-04 cs.AI cs.CL cs.LG 82%

AutoEnv: Automated Environments for Measuring Cross-Environment Agent Learning

AutoEnv:用于测量跨环境智能体学习的自动化环境

Jiayi Zhang, Yiran Peng, Fanqi Kong, Cheng Yang, Yifan Wu, Zhaoyang Yu, Jinyu Xiang, Jianhao Ruan, Jinlin Wang, Maojia Song, HongZhang Liu, Xiangru Tang, Bang Liu, Chenglin Wu, Yuyu Luo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DeepWisdom Peking University(北京大学) Singapore University of Technology and Design(新加坡科技设计大学) Sydney University(悉尼大学) Yale University(耶鲁大学) Université de Montréal & Mila(蒙特利尔大学及Mila)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 AutoEnv通过自动化生成异质环境和组件驱动的学习方法,探讨了跨环境智能体学习的挑战与扩展性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00977 2025-12-02 cond-mat.mtrl-sci 82%

Crystalyse: a multi-tool agent for materials design

Crystalyse:一种用于材料设计的多工具代理

Ryan Nduma, Hyunsoo Park, Aron Walsh

专题命中 Agent评测 :agent(title,abstract);agentic(abstract)

AI总结 Crystalyse是一种用于材料设计的多工具代理,通过三种操作模式在探索速度和验证深度之间进行权衡,提升材料设计的透明性和可重复性。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏