arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2601.10599 2026-01-21 cs.CY 75%

Institutional AI: A Governance Framework for Distributional AGI Safety

机构AI:分布式AGI安全的治理框架

Federico Pierucci, Marcello Galisai, Marcantonio Syrnikov Bracale, Matteo Prandi, Piercosma Bisconti, Francesco Giarrusso, Olga Sorokoletova, Vincenzo Suriani, Daniele Nardi

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract)

AI总结 机构AI通过治理框架解决分布式AGI安全问题,将对齐视为治理机制设计问题,通过运行时监控、激励塑造和规范执行来约束代理行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10194 2026-01-16 quant-ph physics.chem-ph 75%

Autonomous Quantum Simulation through Large Language Model Agents

通过大语言模型代理实现自主量子模拟

Weitang Li, Jiajun Ren, Lixue Cheng, Cunxi Gong

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract)

AI总结 本文提出利用大语言模型代理实现自主量子模拟,通过上下文学习和多代理架构提升模拟效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03286 2026-01-08 cs.CV cs.AI cs.CL cs.LG 75%

HyperCLOVA X 32B Think

NAVER Cloud HyperCLOVA X Team

机构 * NAVER Cloud HyperCLOVA X Team(NAVER云HyperCLOVA X团队)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03860 2026-01-06 cs.CL cs.AI cs.LG 75%

Hallucination to Truth: A Review of Fact-Checking and Factuality Evaluation in Large Language Models

幻觉与事实:大型语言模型中事实核查与事实性评估的综述

Subhey Sadi Rahman, Md. Adnanul Islam, Md. Mahbub Alam, Musarrat Zeba, Md. Abdur Rahman, Sadia Sultana Chowa, Mohaimenul Azam Khan Raiaan, Sami Azam

机构 * Department of Computer Science and Engineering, United International University, Dhaka 1212, Bangladesh(乌姆特国际大学计算机科学与工程系) Department of Computer Science and Engineering, Daffodil International University, Dhaka-1341, Bangladesh(达芙尼国际大学计算机科学与工程系) Faculty of Science and Technology, Charles Darwin University, Casuarina, NT 0909, Australia(查尔斯·达尔文大学科学与技术学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文综述了大型语言模型中事实核查与事实性评估的关键挑战及方法,强调了提升事实准确性的重要性。

Journal ref Artif. Intell. Rev. (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16402 2025-12-08 cs.AI cs.CL cs.CV cs.LG cs.RO 75%

IS-Bench: Evaluating Interactive Safety of VLM-Driven Embodied Agents in Daily Household Tasks

IS-Bench:评估由视觉语言模型驱动的具身智能体在日常家务任务中的交互安全性

Xiaoya Lu, Zeren Chen, Xuhao Hu, Yijin Zhou, Weichen Zhang, Dongrui Liu, Lu Sheng, Jing Shao

机构 * Xiaoya Lu 1, 2(某大学) Zeren Chen 2, 3(某大学) Xuhao Hu 2, 4(某大学) Yijin Zhou 2(某大学) Weichen Zhang 2(某大学) Dongrui Liu 2(某大学) Lu Sheng 3(某研究所) Jing Shao 2(某研究所)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 IS-Bench通过多模态基准评估视觉语言模型驱动的具身智能体在日常家务任务中的交互安全性,揭示现有智能体缺乏安全意识的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02445 2025-12-03 cs.LG cs.AI cs.CL 75%

When Refusals Fail: Unstable Safety Mechanisms in Long-Context LLM Agents

当拒绝失效时:长上下文LLM代理中的不稳定安全机制

Tsimur Hadeliya, Mohammad Ali Jauhar, Nidhi Sakpal, Diogo Cruz

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究发现长上下文LLM代理在性能和拒绝率上存在不稳定安全问题,揭示了评估长多步骤任务代理安全性的挑战。

Comments 12 pages, 11 figures. Accepted at AAAI 2026 TrustAgent Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10445 2025-12-02 cs.AI cs.CL cs.CV cs.LG 75%

RealWebAssist: A Benchmark for Long-Horizon Web Assistance with Real-World Users

RealWebAssist: 一个用于长周期网页协助的基准测试

Suyu Ye, Haojun Shi, Darren Shih, Hyokun Yun, Tanya Roosta, Tianmin Shu

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 RealWebAssist是一个评估长周期网页协助中连续指令遵循能力的新基准测试,旨在解决现实世界中用户指令模糊性和动态性带来的挑战。

Comments Project Website: https://scai.cs.jhu.edu/projects/RealWebAssist/ Code: https://github.com/SCAI-JHU/RealWebAssist

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26536 2025-11-26 cs.CL cs.AI cs.CV cs.LG cs.RO 75%

OceanGym: A Benchmark Environment for Underwater Embodied Agents

OceanGym: 一个用于水下具身智能体的基准环境

Yida Xue, Mingjun Mao, Xiangyuan Ru, Yuqi Zhu, Baochang Ren, Shuofei Qiao, Mengru Wang, Shumin Deng, Xinyu An, Ningyu Zhang, Ying Chen, Huajun Chen

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 OceanGym通过多模态大语言模型构建首个水下具身智能体基准,揭示水下环境感知与规划的挑战,推动水下自主系统发展。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19334 2025-11-25 cs.CY 75%

Normative active inference: A numerical proof of principle for a computational and economic legal analytic approach to AI governance

规范性主动推断:一种计算和经济法律分析方法用于AI治理的数值原理证明

Axel Constant, Mahault Albarracin, Karl J. Friston

专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract)

AI总结 本文提出通过设计监管实现合法且规范敏感的AI行为,利用主动推断框架模拟自动驾驶场景,展示法律规范对AI代理决策的影响。

Comments 19 pages, 6 figures, 1 box

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19002 2025-11-18 cs.CV cs.AI cs.CL cs.LG 75%

VIR-Bench: Evaluating Geospatial and Temporal Understanding of MLLMs via Travel Video Itinerary Reconstruction

Hao Wang, Eiki Murata, Lingfang Zhang, Ayako Sato, So Fukuda, Ziqi Yin, Wentao Hu, Keisuke Nakao, Yusuke Nakamura, Sebastian Zwirner, Yi-Chia Chen, Hiroyuki Otomo, Hiroki Ouchi, Daisuke Kawahara

机构 * Waseda University(早稻田大学) CyberAgent, Inc.(CyberAgent公司) AI Shift, Inc.(AI Shift公司) Nara Institute of Science and Technology(奈良研究所)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25694 2025-10-30 cs.SE cs.AI cs.CL 75%

Process-Level Trajectory Evaluation for Environment Configuration in Software Engineering Agents

Jiayi Kuang, Yinghui Li, Xin Zhang, Yangning Li, Di Yin, Xing Sun, Ying Shen, Philip S. Yu

机构 * Youtu-LLM Team, Tencent Youtu Lab(腾讯优设实验室) Sun Yat-sen University(中山大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18170 2025-10-22 cs.AI cs.ET cs.LG cs.SE math.OC 75%

AgentChangeBench: A Multi-Dimensional Evaluation Framework for Goal-Shift Robustness in Conversational AI

Manik Rana, Calissa Man, Anotida Expected Msiiwa, Jeffrey Paine, Kevin Zhu, Sunishchal Dev, Vasu Sharma, Ahan M R

机构 * Algoverse Microsoft

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.AI、cs.LG、cs.SE

Comments Accepted to 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Multi-Turn Interactions in Large Language Models

Journal ref Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17132 2025-10-21 cs.LG cs.AI cs.CL 75%

Do LLMs Recognize Your Latent Preferences? A Benchmark for Latent Information Discovery in Personalized Interaction

Ioannis Tsaknakis, Bingqing Song, Shuyu Gan, Dongyeop Kang, Alfredo Garcia, Gaowen Liu, Charles Fleming, Mingyi Hong

机构 * University of Minnesota(明尼苏达大学) Texas A&M University(德克萨斯农工大学) CISCO Research(思科研究)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14697 2025-10-21 cs.CR cs.RO 75%

AGENTSAFE: Benchmarking the Safety of Embodied Agents on Hazardous Instructions

Zonghao Ying, Le Wang, Yisong Xiao, Jiakai Wang, Yuqing Ma, Jinyang Guo, Zhenfei Yin, Mingchuan Zhang, Aishan Liu, Xianglong Liu

机构 * SKLCCSE, Beihang University(北京航空航天大学智能科学与技术研究中心) Zhongguancun Laboratory(中关村实验室) The University of Sydney(悉尼大学) Henan University of Science(河南科技大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);workflow(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07841 2025-10-10 cs.LG cs.AI cs.CL 75%

Self-Improving LLM Agents at Test-Time

Emre Can Acikgoz, Cheng Qian, Heng Ji, Dilek Hakkani-Tür, Gokhan Tur

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01645 2025-10-03 cs.CR cs.AI cs.CL cs.LG 75%

Position: Privacy Is Not Just Memorization!

Niloofar Mireshghallah, Tianshi Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Northeastern University(东北大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG

Comments 27 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24995 2025-09-30 cs.RO cs.SY eess.SY 75%

Path Diffuser: Diffusion Model for Data-Driven Traffic Simulator

Da Saem Lee, Akash Karthikeyan, Yash Vardhan Pant, Sebastian Fischmeister

机构 * Department of Electrical and Computer Engineering, University of Waterloo(电气与计算机工程系,滑铁卢大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15757 2025-08-22 cs.AI cs.CL cs.LG cs.MA 75%

Language-Guided Tuning: Enhancing Numeric Optimization with Textual Feedback

Yuxing Lu, Yucheng Hu, Nan Sun, Xukai Zhao

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

Comments 9 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20883 2025-08-08 cs.SE cs.AI cs.LG 75%

Complex Model Transformations by Reinforcement Learning with Uncertain Human Guidance

Kyanna Dagenais, Istvan David

机构 * McMaster University(麦斯特大学) McMaster Centre for Software Certification(麦斯特软件认证中心)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG、cs.SE

Comments Accepted for ACM/IEEE MODELS'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21547 2025-07-30 math.OC cs.RO cs.SY eess.SY 75%

Decentralized Modeling of Vehicular Maneuvers and Interactions at Urban Junctions

Saeed Rahmani, Simeon C. Calvert, Bart van Arem

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract)

Comments Manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22419 2025-07-02 cs.AI cs.CL cs.LG 75%

The Automated LLM Speedrunning Benchmark: Reproducing NanoGPT Improvements

Bingchen Zhao, Despoina Magka, Minqi Jiang, Xian Li, Roberta Raileanu, Tatiana Shavrina, Jean-Christophe Gagnon-Audet, Kelvin Niu, Shagun Sodhani, Michael Shvartsman, Andrei Lupu, Alisia Lupidi, Edan Toledo, Karen Hambardzumyan, Martin Josifoski, Thomas Foster, Lucia Cipolina-Kun, Abhishek Charnalia, Derek Dunfield, Alexander H. Miller, Oisin Mac Aodha, Jakob Foerster, Yoram Bachrach

机构 * Meta University of Edinburgh(爱丁堡大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12266 2025-06-17 cs.CL cs.AI cs.HC cs.LG 75%

The Behavior Gap: Evaluating Zero-shot LLM Agents in Complex Task-Oriented Dialogs

Avinash Baidya, Kamalika Das, Xiang Gao

机构 * Intuit AI Research(Intuit AI研究院)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

Comments ACL 2025; 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09469 2025-06-12 cs.CV 75%

Optimizing Cooperative Multi-Object Tracking using Graph Signal Processing

Maria Damanaki, Nikos Piperigkos, Alexandros Gkillas, Aris S. Lalos

机构 * Industrial Systems Institute, Athena Research Center, Patras Science Park, Greece(工业系统研究所,阿提卡研究中心,帕特拉斯科学公园,希腊) AviSense.AI, Patras Science Park, Greece(AviSense.AI,帕特拉斯科学公园,希腊) Dpt. of Informatics & Telecom., University of Ioannina, Arta, Greece(信息与电信系,伊奥安妮亚大学,阿塔,希腊)

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract)

Comments 2025 IEEE International Conference on Multimedia and Expo Workshops, 3DMM - 3D Multimedia Analytics, Search and Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04089 2025-06-05 cs.LG cs.AI cs.CL cs.RO 75%

AmbiK: Dataset of Ambiguous Tasks in Kitchen Environment

Anastasiia Ivanova, Eva Bakaeva, Zoya Volovikova, Alexey K. Kovalev, Aleksandr I. Panov

机构 * LMU(慕尼黑大学) MIPT(莫斯科 Institute of Physics and Technology) AIRI(空气研究所)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

Comments ACL 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08367 2025-06-04 cs.AI cs.CL cs.CV cs.LG 75%

MCU: An Evaluation Framework for Open-Ended Game Agents

Xinyue Zheng, Haowei Lin, Kaichen He, Zihao Wang, Zilong Zheng, Yitao Liang

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

Journal ref ICML 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14251 2025-05-29 cs.LG cs.AI cs.CL 75%

Natural Language Reinforcement Learning

Xidong Feng, Bo Liu, Yan Song, Haotian Fu, Ziyu Wan, Girish A. Koushik, Zhiyuan Hu, Mengyue Yang, Ying Wen, Jun Wang

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07266 2025-05-13 cs.RO 75%

BETTY Dataset: A Multi-modal Dataset for Full-Stack Autonomy

Micah Nye, Ayoub Raji, Andrew Saba, Eidan Erlich, Robert Exley, Aragya Goyal, Alexander Matros, Ritesh Misra, Matthew Sivaprakasam, Marko Bertogna, Deva Ramanan, Sebastian Scherer

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Waterloo(滑铁卢大学) University of Pittsburgh(匹兹堡大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract)

Comments 8 pages. 5 figures. ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09024 2025-04-21 cs.LG cs.AI cs.CL 75%

AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents

Maksym Andriushchenko, Alexandra Souly, Mateusz Dziemian, Derek Duenas, Maxwell Lin, Justin Wang, Dan Hendrycks, Andy Zou, Zico Kolter, Matt Fredrikson, Eric Winsor, Jerome Wynne, Yarin Gal, Xander Davies

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

Comments Accepted at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04485 2025-04-08 cs.CV 75%

Building LLM Agents by Incorporating Insights from Computer Systems

Yapeng Mi, Zhi Gao, Xiaojian Ma, Qing Li

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);agentic(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12784 2025-04-08 cs.AI cs.CL cs.LG 75%

JudgeBench: A Benchmark for Evaluating LLM-based Judges

Sijun Tan, Siyuan Zhuang, Kyle Montgomery, William Y. Tang, Alejandro Cuadron, Chenguang Wang, Raluca Ada Popa, Ion Stoica

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

Comments Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏