arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2507.04889 2025-07-08 cs.LG 74%

Fine-tuning on simulated data outperforms prompting for agent tone of voice

Ingo Marquardt, Philippe Brule

机构 * Restack

专题命中 Agent评测 :agent(title);分类 cs.LG

Comments 22 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18867 2025-06-27 cs.CV cs.AI 74%

UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent

Jianke Zhang, Yanjiang Guo, Yucheng Hu, Xiaoyu Chen, Xiang Zhu, Jianyu Chen

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University,Beijing, China(信息科学交叉研究所,清华大学,北京,中国) Shanghai Qi Zhi Institute, Shanghai, China(上海启智研究院,上海,中国)

专题命中 Agent评测 :agent(title);分类 cs.AI

Comments Accepted to ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15699 2025-06-23 cs.AI 74%

Advancing Embodied Agent Security: From Safety Benchmarks to Input Moderation

Ning Wang, Zihan Yan, Weiyang Li, Chuan Ma, He Chen, Tao Xiang

机构 * College of computer science, Chongqing University(重庆大学计算机学院) Department of Information Engineering, The Chinese University of Hong Kong(香港中文大学信息工程系)

专题命中 Agent评测 :agent(title);分类 cs.AI

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14302 2025-06-18 cs.CL 74%

Expectation Confirmation Preference Optimization for Multi-Turn Conversational Recommendation Agent

Xueyang Feng, Jingsen Zhang, Jiakai Tang, Wei Li, Guohao Cai, Xu Chen, Quanyu Dai, Yue Zhu, Zhenhua Dong

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学北京校区人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程研究中心,教育部) Huawei Noah’s Ark Lab, China(华为诺亚方舟实验室)

专题命中 Agent评测 :agent(title);分类 cs.CL

Comments Accepted to Findings of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02306 2025-05-20 cs.AI 74%

SafeMate: A Modular RAG-Based Agent for Context-Aware Emergency Guidance

Junfeng Jiao, Jihyung Park, Yiming Xu, Kristen Sussman, Lucy Atkinson

机构 * Urban Information Lab, University of Texas at Austin(德克萨斯大学奥斯汀分校城市信息实验室) Department of Computer Science, University of Texas at Austin(德克萨斯大学奥斯汀分校计算机科学系) Department of Advertising, Texas State University(德克萨斯州立大学广告系) Department of Advertising and Public Relations, University of Texas at Austin(德克萨斯大学奥斯汀分校广告与公共关系系)

专题命中 Agent评测 :agent(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14112 2025-04-22 cs.HC cs.AI cs.CY 74%

Longitudinal Study on Social and Emotional Use of AI Conversational Agent

Mohit Chandra, Javier Hernandez, Gonzalo Ramos, Mahsa Ershadi, Ananya Bhattacharjee, Judith Amores, Ebele Okoli, Ann Paradiso, Shahed Warreth, Jina Suh

机构 * Georgia Institute of Technology USA(佐治亚理工学院) Microsoft Research USA(微软研究院(美国)) Microsoft USA(微软(美国)) University of Toronto Canada(多伦多大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

Comments 16 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13364 2025-04-15 cs.CY cs.AI 74%

Reconciling Different Theories of Learning with an Agent-based Model of Procedural Learning

Sina Rismanchian, Shayan Doroudi

专题命中 Agent评测 :agent(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04698 2025-04-08 cs.CL 74%

scAgent: Universal Single-Cell Annotation via a LLM Agent

Yuren Mao, Yu Mi, Peigen Liu, Mengfei Zhang, Hanqing Liu, Yunjun Gao

专题命中 Agent评测 :agent(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18308 2025-02-26 cs.CL 74%

RefuteBench 2.0 -- Agentic Benchmark for Dynamic Evaluation of LLM Responses to Refutation Instruction

Jianhao Yan, Yun Luo, Yue Zhang

专题命中 Agent评测 :agentic(title);分类 cs.CL

Comments Work on progess

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05898 2024-11-12 cs.CV cs.AI cs.RO 74%

Integrating Object Detection Modality into Visual Language Model for Enhanced Autonomous Driving Agent

Linfeng He, Yiming Sun, Sihao Wu, Jiaxu Liu, Xiaowei Huang

专题命中 Agent评测 :agent(title);分类 cs.AI

Comments accepted by SafeGenAI workshop of NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17860 2024-11-05 cs.CL 74%

Illuminating Blind Spots of Language Models with Targeted Agent-in-the-Loop Synthetic Data

Philip Lippmann, Matthijs T. J. Spaan, Jie Yang

专题命中 Agent评测 :agent(title);分类 cs.CL

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18792 2024-10-28 cs.CY cs.CL 74%

An LLM Agent for Automatic Geospatial Data Analysis

Yuxing Chen, Weijie Wang, Sylvain Lobry, Camille Kurtz

专题命中 Agent评测 :agent(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10278 2024-10-15 cs.CL 74%

Machine Translation Evaluation Benchmark for Wu Chinese: Workflow and Analysis

Hongjian Yu, Yiming Shi, Zherui Zhou, Christopher Haberland

专题命中 Agent评测 :workflow(title);分类 cs.CL

Comments EMNLP WMT 24 Open Language Data Initiative Shared Task

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20267 2024-10-08 cs.CL 74%

Auto-Arena: Automating LLM Evaluations with Agent Peer Battles and Committee Discussions

Ruochen Zhao, Wenxuan Zhang, Yew Ken Chia, Weiwen Xu, Deli Zhao, Lidong Bing

专题命中 Agent评测 :agent(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13803 2024-10-08 cs.HC cs.CL 74%

"I Like Sunnie More Than I Expected!": Exploring User Expectation and Perception of an Anthropomorphic LLM-based Conversational Agent for Well-Being Support

Siyi Wu, Julie Y. A. Cachia, Feixue Han, Bingsheng Yao, Tianyi Xie, Xuan Zhao, Dakuo Wang

专题命中 Agent评测 :agent(title);分类 cs.CL

Comments In Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14156 2024-08-28 cs.GT cs.LG cs.MA 74%

Tractable Equilibrium Computation in Markov Games through Risk Aversion

Eric Mazumdar, Kishan Panaganti, Laixi Shi

专题命中 Agent评测 :agent(abstract,comments);multi-agent(abstract,comments);分类 cs.LG

Comments preprint of multi-agent RL with risk-averse equilibria

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04210 2024-08-13 cs.AI cs.RO 74%

Task Success is not Enough: Investigating the Use of Video-Language Models as Behavior Critics for Catching Undesirable Agent Behaviors

Lin Guan, Yifan Zhou, Denis Liu, Yantian Zha, Heni Ben Amor, Subbarao Kambhampati

专题命中 Agent评测 :agent(title);分类 cs.AI

Comments Published as a conference paper at COLM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11977 2024-07-18 cs.HC cs.AI cs.CY 74%

Building Better AI Agents: A Provocation on the Utilisation of Persona in LLM-based Conversational Agents

Guangzhi Sun, Xiao Zhan, Jose Such

专题命中 Agent评测 :AI agent(title);分类 cs.AI

Comments Accepted by The international ACM Conversational User Interfaces (CUI) conference 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08355 2024-05-15 cs.CL 74%

Seal-Tools: Self-Instruct Tool Learning Dataset for Agent Tuning and Detailed Benchmark

Mengsong Wu, Tong Zhu, Han Han, Chuanyuan Tan, Xiang Zhang, Wenliang Chen

专题命中 Agent评测 :agent(title);分类 cs.CL

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05285 2024-05-10 cs.HC cs.AI 74%

Generative AI as a metacognitive agent: A comparative mixed-method study with human participants on ICF-mimicking exam performance

Jelena Pavlovic, Jugoslav Krstic, Luka Mitrovic, Djordje Babic, Adrijana Milosavljevic, Milena Nikolic, Tijana Karaklic, Tijana Mitrovic

专题命中 Agent评测 :agent(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07428 2024-04-12 cs.RO cs.LG 74%

AdaDemo: Data-Efficient Demonstration Expansion for Generalist Robotic Agent

Tongzhou Mu, Yijie Guo, Jie Xu, Ankit Goyal, Hao Su, Dieter Fox, Animesh Garg

专题命中 Agent评测 :agent(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01275 2024-01-10 cs.CL 74%

CharacterEval: A Chinese Benchmark for Role-Playing Conversational Agent Evaluation

Quan Tu, Shilong Fan, Zihang Tian, Rui Yan

专题命中 Agent评测 :agent(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08832 2023-11-16 cs.HC cs.AI 74%

Exploring Links between Conversational Agent Design Challenges and Interdisciplinary Collaboration

Malak Sadek, Céline Mougenot

专题命中 Agent评测 :agent(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00168 2023-07-04 cs.LG cs.GT 74%

U-Calibration: Forecasting for an Unknown Agent

Robert Kleinberg, Renato Paes Leme, Jon Schneider, Yifeng Teng

专题命中 Agent评测 :agent(title);分类 cs.LG

Comments Accepted for presentation at the Conference on Learning Theory (COLT) 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11519 2023-05-22 econ.GN cs.AI q-fin.EC 74%

Artificial intelligence moral agent as Adam Smith's impartial spectator

Nikodem Tomczak

专题命中 Agent评测 :agent(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.12021 2023-01-18 cs.CL 74%

Neural Generation Meets Real People: Building a Social, Informative Open-Domain Dialogue Agent

Ethan A. Chi, Ashwin Paranjape, Abigail See, Caleb Chiam, Trenton Chang, Kathleen Kenealy, Swee Kiat Lim, Amelia Hardy, Chetanya Rastogi, Haojun Li, Alexander Iyabor, Yutong He, Hari Sowrirajan, Peng Qi, Kaushik Ram Sadagopan, Nguyet Minh Phu, Dilara Soylu, Jillian Tang, Avanika Narayan, Giovanni Campagna, Christopher D. Manning

专题命中 Agent评测 :agent(title);分类 cs.CL

Comments SIGDIAL '22

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.03398 2022-12-15 eess.AS cs.CL cs.SD 74%

Analysis and Utilization of Entrainment on Acoustic and Emotion Features in User-agent Dialogue

Daxin Tan, Nikos Kargas, David McHardy, Constantinos Papayiannis, Antonio Bonafonte, Marek Strelec, Jonas Rohnke, Agis Oikonomou Filandras, Trevor Wood

专题命中 Agent评测 :agent(title);分类 cs.CL

Comments This version has been removed by arXiv administrators because the submitter did not have the right to assign a license at the time of submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.16023 2022-11-30 cs.LG cs.MA cs.SI 74%

Novelty Detection for Election Fraud: A Case Study with Agent-Based Simulation Data

Khurram Yamin, Nima Jadali, Dima Nazzal, Yao Xie

专题命中 Agent评测 :agent(title);分类 cs.LG

Comments 7 pages, 2 figures, to be published in the 2023 AAAI AI for Credible Elections Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.08197 2022-10-18 cs.LG q-fin.MF 74%

DyFEn: Agent-Based Fee Setting in Payment Channel Networks

Kiana Asgari, Aida Afshar Mohammadian, Mojtaba Tefagh

专题命中 Agent评测 :agent(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.04909 2022-06-13 cs.AI 74%

ABCDE: An Agent-Based Cognitive Development Environment

Jieyi Ye, Jiafei Duan, Samson Yu, Bihan Wen, Cheston Tan

专题命中 Agent评测 :agent(title);分类 cs.AI

Comments Accepted to CVPRW 2022,Embodied AI Workshop (Extended Abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏