arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2603.00058 2026-03-03 cs.CY cs.AI 70%

PaperRepro: Automated Computational Reproducibility Assessment for Social Science Papers

PaperRepro: 社会科学论文的自动化计算可重复性评估

Linhao Zhang, Tong Xia, Jinghua Piao, Lizhen Cui, Yong Li

机构 * Shandong University, Zhongguancun Academy, China(山东大学中关村学院) Tsinghua University Beijing China(清华大学北京) Shandong University Jinan China(山东大学济南) Tsinghua University(清华大学) Shandong University(山东大学) Tsinghua University, Zhongguancun Academy, China(清华大学中关村学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 PaperRepro通过多代理方法提升社会科学论文的自动化可重复性评估,实现性能提升21.9%并推出分层基准

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23073 2026-02-27 math.ST cs.AI stat.TH 70%

Accelerated Online Risk-Averse Policy Evaluation in POMDPs with Theoretical Guarantees and Novel CVaR Bounds

在POMDP中具有理论保证和新型CVaR界限的加速在线风险厌恶策略评估

Yaacov Pariente, Vadim Indelman

机构 * Technion - Israel Institute of Technology(技术学院-以色列理工学院)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出了一种在POMDP中加速风险厌恶策略评估的方法,通过理论保证和新的CVaR界限,实现计算效率的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20714 2026-02-26 cs.LG cs.CE 70%

WeirNet: A Large-Scale 3D CFD Benchmark for Geometric Surrogate Modeling of Piano Key Weirs

WeirNet:一种大规模三维CFD基准数据集,用于钢琴键堰的几何替代建模

Lisa Lüddecke, Michael Hohmann, Sebastian Eilermann, Jan Tillmann-Mumm, Pezhman Pourabdollah, Mario Oertel, Oliver Niggemann

机构 * Hydraulic Engineering Section, Civil Engineering, Helmut-Schmidt-University(水利工程系,土木工程,黑姆特-施密特大学) Institute for Artificial Intelligence, Helmut-Schmidt-University(人工智能研究所,黑姆特-施密特大学) Professorship of Computer Science in Mechanical Engineering, Helmut-Schmidt-University(机械工程计算机科学教授职位,黑姆特-施密特大学) Chair for Automation Technology, Helmut-Schmidt-University(自动化技术教授职位,黑姆特-施密特大学) Federal Waterways Engineering and Research Institute(联邦水道工程与研究机构)

专题命中 Agent评测 :planning(abstract);workflow(abstract);分类 cs.LG

AI总结 WeirNet通过大规模三维CFD基准数据集,为钢琴键堰的几何替代建模提供支持,提升水力设计效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13920 2026-02-26 cs.SI cs.AI 70%

A Comparative Analysis of Social Network Topology in Reddit and Moltbook

对Reddit和Moltbook社交网络拓扑结构的比较分析

Yiming Zhu, Gareth Tyson, Pan Hui

机构 * Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文通过比较Moltbook和Reddit的社交网络拓扑结构,揭示了代理驱动与人类驱动网络在拓扑模式和边形成效率上的差异,为构建更真实的社会系统提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12434 2026-02-25 cs.AI 70%

A Survey on the Optimization of Large Language Model-based Agents

基于大语言模型代理的优化综述

Shangheng Du, Jiabao Zhao, Jinxin Shi, Zhentao Xie, Xin Jiang, Yanhong Bai, Liang He

机构 * Shanghai Institute of Artificial Intelligence for Education, East China Normal University(上海人工智能教育研究院,东华大学) School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,东华大学) School of Computer Science and Technology, Donghua University(计算机科学与技术学院,东华大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文综述了基于大语言模型的代理优化方法,分类讨论参数驱动与参数无关策略,分析关键技术和挑战,提出未来研究方向。

Comments Published in ACM Computing Surveys, Vol. 58, No. 9, Article 223, July 2026

Journal ref ACM Computing Surveys 58(9), Article 223, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20708 2026-02-25 cs.AI cs.CR 70%

ICON: Indirect Prompt Injection Defense for Agents based on Inference-Time Correction

ICON:基于推理时校正的代理间接提示注入防御

Che Wang, Fuyao Zhang, Jiaming Zhang, Ziqi Zhang, Yinghui Wang, Longtao Huang, Jianbo Gao, Zhong Chen, Wei Yang Bryan Lim

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡) Alibaba(阿里巴巴) School of Computer Science, Peking University, China(计算机科学学院,北京大学,中国)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 ICON通过潜在空间轨迹探测和修正器实现对代理间接提示注入攻击的防御,有效提升任务连续性和安全性,同时保持高检测率和任务效用。

Comments 11 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18448 2026-02-25 cs.CL 70%

INSURE-Dial: A Phase-Aware Conversational Dataset & Benchmark for Compliance Verification and Phase Detection

INSURE-Dial: 一个面向合规验证和阶段检测的相位感知对话数据集与基准

Shubham Kulkarni, Alexander Lyzhov, Preetam Joshi, Shiva Chaitanya

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.CL

AI总结 INSURE-Dial是一个面向合规验证和阶段检测的相位感知对话数据集与基准,通过相位结构化标注和两个新评估任务提升语音代理的合规性评估能力。

Comments Accepted to the 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16449 2026-02-24 cs.CV cs.AI 70%

Emotion-LLaMAv2 and MMEVerse: A New Framework and Benchmark for Multimodal Emotion Understanding

Emotion-LLaMAv2 和 MMEVerse:多模态情感理解的新框架和基准

Xiaojiang Peng, Jingyi Chen, Zebang Cheng, Bao Peng, Fengyi Wu, Yifei Dong, Shuyuan Tu, Qiyu Hu, Huiting Huang, Yuxiang Lin, Jun-Yan He, Kai Wang, Zheng Lian, Zhi-Qi Cheng

机构 * Shenzhen Technology University(深圳技术大学) Shenzhen University of Information Technology(深圳信息科技学院) University of Washington(华盛顿大学) Foundation Model Team, Meituan(美团基础模型团队) National University of Singapore(新加坡国立大学) Tongji University(同济大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 Emotion-LLaMAv2和MMEVerse通过端到端多视图编码器、Conv Attention预融合模块和课程指令调制方案,提升了多模态情绪理解和推理能力,并构建了统一的多模态情绪基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22740 2026-02-24 cs.AI stat.ML 70%

Explanations are a Means to an End: Decision Theoretic Explanation Evaluation

解释是一种手段:决策理论解释评估

Ziyang Guo, Berk Ustun, Jessica Hullman

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出了一种决策理论框架,用于评估解释的价值,通过理论基准、人类互补价值和行为价值三个估计目标,评估解释对决策任务的改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13069 2026-02-24 cs.AI 70%

Ambig-SWE: Interactive Agents to Overcome Underspecificity in Software Engineering

Ambig-SWE: 交互式代理以克服软件工程中的不充分性

Sanidhya Vijayvargiya, Xuhui Zhou, Akhila Yerukola, Maarten Sap, Graham Neubig

机构 * Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 Ambig-SWE研究LLM代理在交互式代码生成中处理不充分指令的能力,通过检测不充分性、提问澄清和利用交互提升性能,发现交互能显著提高74%的性能。

Comments 22 pages, 7 figures, Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15891 2026-02-19 cs.RO cs.LG cs.MA 70%

Learning to Drive in New Cities Without Human Demonstrations

在没有人类示范的情况下学习新城市的驾驶

Zilin Wang, Saeed Rahmani, Daphne Cornelisse, Bidipta Sarkar, Alexander David Goldie, Jakob Nicolaus Foerster, Shimon Whiteson

机构 * WhiRL, University of Oxford(WhiRL,牛津大学) FLAIR, University of Oxford(FLAIR,牛津大学) Delft University of Technology(代尔夫特理工大学) NYU Tandon School of Engineering(纽约大学工程学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 NOMAD通过自play多智能体强化学习,在无需人类示范的情况下,利用地图和元信息实现自动驾驶策略在不同城市间的适应与优化。

Comments Autonomous Driving, Reinforcement Learning, Self-play, Simulation, Transfer Learning, Data-efficient Adaptation. Project Page: https://nomaddrive.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11348 2026-02-19 cs.AI 70%

AgentNoiseBench: Benchmarking Robustness of Tool-Using LLM Agents Under Noisy Condition

AgentNoiseBench: 在噪声条件下评估工具使用LLM代理的鲁棒性基准测试

Ruipeng Wang, Yuxin Chen, Yukai Wang, Chang Wu, Junfeng Fang, Xiaodong Cai, Qi Gu, Hui Su, An Zhang, Xiang Wang, Xunliang Cai, Tat-Seng Chua

机构 * University of Science(科学大学) National University of Singapore, Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 AgentNoiseBench通过在噪声环境中评估LLM代理的鲁棒性,揭示了现有模型对现实扰动的敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15270 2026-02-18 cs.AI 70%

Enhancing Diversity and Feasibility: Joint Population Synthesis from Multi-source Data Using Generative Models

增强多样性和可行性:利用生成模型从多源数据中联合合成人口

Farbod Abbasi, Zachary Patterson, Bilal Farooq

机构 * Concordia University(康科迪亚大学) Concordia Institute for Information Systems Engineering(康科迪亚信息系统工程研究所) Toronto Metropolitan University(多伦多 Metropolitan 大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出利用WGAN与梯度惩罚联合生成多源数据,提升合成人口的多样性和可行性,实验显示其在召回率和精确率上均优于传统方法。

Comments 12 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14364 2026-02-17 cs.CR cs.AI 70%

A Trajectory-Based Safety Audit of Clawdbot (OpenClaw)

基于轨迹的安全性审计:Clawdbot(OpenClaw)

Tianyu Chen, Dongrui Liu, Xia Hu, Jingyi Yu, Wenjie Wang

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 Clawdbot的安全性审计通过轨迹评估发现其在不同任务中的安全表现不均,尤其在意图不明确时易出现高影响工具操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14270 2026-02-17 cs.CY cs.AI cs.HC 70%

A Rational Analysis of the Effects of Sycophantic AI

对趋炎附势AI影响的理性分析

Rafael M. Batista, Thomas L. Griffiths

机构 * School of Public and International Affairs, Princeton University(公共与国际事务学院,普林斯顿大学) Princeton University(普林斯顿大学) Department of Psychology, Princeton University(心理学系,普林斯顿大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文研究了趋炎附势AI对信念的影响,通过实验发现无偏采样能显著提高发现率,而顺从反馈会扭曲现实,制造虚假确定性。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14017 2026-02-17 cs.LG 70%

S2SServiceBench: A Multimodal Benchmark for Last-Mile S2S Climate Services

S2SServiceBench:一个多模态基准用于最后一公里S2S气候服务

Chenyue Li, Wen Deng, Zhuotao Sun, Mengxi Jin, Hanzhe Cui, Han Li, Shentong Li, Man Kit Yu, Ming Long Lai, Yuhao Yang, Mengqian Lu, Binhang Yuan

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Nanjing University of Information Science and Technology(南京信息工程大学) Beijing Normal University(北京师范大学)

专题命中 Agent评测 :planning(abstract);agentic(abstract);分类 cs.LG

AI总结 S2SServiceBench是一个多模态基准,用于评估S2S气候服务中最后一公里的可靠性,通过10种服务产品和1000多个评估项目,揭示了多模态大语言模型在不确定性下的决策推理挑战。

Comments 18 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11047 2026-02-17 cs.RO cs.AI 70%

Enhancing Supermarket Robot Interaction: A Multi-Level LLM Conversational Interface for Handling Diverse Customer Intents

增强超市机器人交互:一种多层级LLM对话接口用于处理多样化客户意图

Chandran Nandkumar, Luka Peternel

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出多层级LLM接口提升超市机器人处理多样化客户意图的效率与性能。

Journal ref Frontiers in Robotics and AI, Volume 12, 1576348, April 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13243 2026-02-17 cs.CY cs.AI 70%

Judging the Judges: Human Validation of Multi-LLM Evaluation for High-Quality K--12 Science Instructional Materials

评判评判者:人类验证多LLM评估用于高质量K-12科学教学材料

Peng He, Zhaohui Li, Zeyuan Wang, Jinjun Xiong, Tingting Li

机构 * Washington State University, Pullman, WA, USA(华盛顿州立大学) University at Buffalo, State University of New York, Buffalo, NY, USA(布法罗大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本研究通过人类专家验证多LLM评估,揭示LLM在K-12科学教学材料设计中的推理优劣,为生成式AI代理的发展提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11918 2026-02-13 cs.AI 70%

MEME: Modeling the Evolutionary Modes of Financial Markets

MEME:金融市场的进化模式建模

Taian Guo, Haiyang Shen, Junyu Luo, Zhongshi Xing, Hanchun Lian, Jinsheng Huang, Binqi Chen, Luchen Liu, Yun Ma, Ming Zhang

机构 * National Key Laboratory for Multimedia Information Processing, PKU-Anker LLM Lab, School of Computer Science, Peking University(国家多媒体信息处理重点实验室、PKU-Anker LLM实验室、计算机科学学院、北京大学) School of Electronics Engineering(电子工程学院) Computer Science, Peking University(计算机科学、北京大学) Institute for Artificial Intelligence, Peking University(人工智能研究所、北京大学) Sun Yat-sen University(中山大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 MEME通过建模金融市场中的动态进化思维模式,利用多代理提取和高斯混合模型,实现对市场动态的精准重建,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10453 2026-02-12 cs.CR cs.CL 70%

The Landscape of Prompt Injection Threats in LLM Agents: From Taxonomy to Analysis

大语言模型代理中提示注入威胁的图景:从分类到分析

Peiran Wang, Xinfeng Li, Chong Xiang, Jinghuai Zhang, Ying Li, Lixia Zhang, Xiaofeng Wang, Yuan Tian

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.CL

AI总结 本文综述了大语言模型代理中提示注入威胁的分类与分析,提出AgentPI基准以评估依赖上下文交互的代理行为,揭示现有防御的局限性并提出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10367 2026-02-12 cs.AI 70%

LiveMedBench: A Contamination-Free Medical Benchmark for LLMs with Automated Rubric Evaluation

LiveMedBench: 一个无污染的医疗基准测试,用于具有自动评分评估的LLM

Zhiling Yan, Dingjie Song, Zhe Fang, Yisheng Ji, Xiang Li, Quanzheng Li, Lichao Sun

机构 * Lehigh University(莱维大学) Harvard University(哈佛大学) Imperial College London(伦敦帝国学院) Massachusetts General Hospital(麻省总医院) Harvard Medical School(哈佛医学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 LiveMedBench通过持续更新和自动评分框架,提供无污染的医疗基准测试,验证LLM在临床推理中的性能,揭示数据污染和上下文适应性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10131 2026-02-12 cs.SI cs.AI cs.CY 70%

The Anatomy of the Moltbook Social Graph

Moltbook社交图谱的解剖

David Holtz

机构 * Columbia Business School(哥伦比亚商学院)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究分析Moltbook平台中AI代理的社交图谱特征,揭示其幂律参与度、小世界连接性及非人类对话模式,探讨智能体社交的独特性。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09210 2026-02-12 cs.CV cs.AI 70%

MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models

MME-Emotion:多模态大语言模型情感智能的综合评估基准

Fan Zhang, Zebang Cheng, Chong Deng, Haoxuan Li, Zheng Lian, Qian Chen, Huadai Liu, Wen Wang, Yi-Fan Zhang, Renrui Zhang, Ziyu Guo, Zhihong Zhu, Hao Wu, Haixin Wang, Yefeng Zheng, Xiaojiang Peng, Xian Wu, Kun Wang, Xiangang Li, Jieping Ye, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Tongyi Lab(通义实验室) SZTU(深圳技术大学) Peking University(北京大学) Tongji University(同济大学) CASIA(中国科学院自动化所) Tencent(腾讯) UCLA(加州大学洛杉矶分校) Westlake University(西湖大学) NTU(国立大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 MME-Emotion是首个评估多模态大语言模型情感智能的综合基准,揭示当前模型在情感识别和推理上的不足,并通过多智能体框架提供混合指标分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09339 2026-02-11 cs.CL 70%

Understanding Risk and Dependency in AI Chatbot Use from User Discourse

理解AI聊天机器人使用中的风险与依赖性:从用户话语出发

Jianfeng Zhu, Karin G. Coifman, Ruoming Jin

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本研究通过分析用户话语揭示AI聊天机器人使用中的心理风险维度,发现自我调节困难和对自主性、控制和技术风险的恐惧为主要特征。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09336 2026-02-11 cs.CL 70%

FM SO.P: A Progressive Task Mixture Framework with Automatic Evaluation for Cross-Domain SOP Understanding

FM SO.P: 一种具有自动评估的渐进式任务混合框架用于跨域SOP理解

Siyuan Huang, Ziyu Wang, Chao Pan, Han Zhao

机构 * Amazon(亚马逊) Johns Hopkins University(约翰霍普金斯大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 FM SO.P提出了一种渐进式任务混合框架和自动评估系统,以提升跨领域SOP理解的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11239 2026-02-11 cs.LG 70%

Massive-STEPS: Massive Semantic Trajectories for Understanding POI Check-ins -- Dataset and Benchmarks

Massive-STEPS: 用于理解POI签到的大量语义轨迹 -- 数据集和基准测试

Wilson Wongso, Hao Xue, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.LG

AI总结 Massive-STEPS通过提供大规模、公开的POI签到数据集和基准测试,推动人类移动性和POI轨迹建模的可重复研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08014 2026-02-10 cs.CR cs.AI 70%

ICBAC: an Intelligent Contract-Based Access Control framework for supply chain management by integrating blockchain and federated learning

ICBAC: 一种基于智能合约的访问控制框架,通过整合区块链与联邦学习用于供应链管理

Sadegh Sohani, Salar Ghazi, Farnaz Kamranfar, Sahar Pilehvar Moakhar, Mohammad Allahbakhsh, Haleh Amintoosi, Kaiwen Zhang

机构 * Department of Computer Engineering Ferdowsi University of Mashhad(计算机工程系法尔多斯大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 ICBAC通过整合区块链与联邦学习,提供一种动态、隐私保护的访问控制框架,用于解决供应链中的访问控制问题。

Comments 19 pages, 6 Figures, 3 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07962 2026-02-10 cs.AI 70%

LOCA-bench: Benchmarking Language Agents Under Controllable and Extreme Context Growth

LOCA-bench: 评估在可控和极端上下文增长下的语言代理

Weihao Zeng, Yuzhen Huang, Junxian He

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 LOCA-bench通过可控和极端上下文增长评估语言代理的能力,提供长上下文代理的基准测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07787 2026-02-10 cs.AI 70%

Do Multi-Agents Dream of Electric Screens? Achieving Perfect Accuracy on AndroidWorld Through Task Decomposition

多智能体是否梦想着电子屏幕?通过任务分解在AndroidWorld上实现完美准确率

Pierre-Louis Favreau, Jean-Pierre Lo, Clement Guiguet, Charles Simon-Meunier, Nicolas Dehandschoewercker, Allen G. Roush, Judah Goldfeder, Ravid Shwartz-Ziv

机构 * Columbia University(哥伦比亚大学) New York University(纽约大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 Minitap通过任务分解和多智能体架构在AndroidWorld上实现100%准确率,超越人类表现,解决单智能体架构的多个失败原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07040 2026-02-10 cs.AI 70%

Aster: Autonomous Scientific Discovery over 20x Faster Than Existing Methods

Aster:比现有方法快20倍的自主科学发现

Emmett Bicker

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 Aster是一种能快速自主发现科学问题的AI代理,通过减少迭代次数提升效率,适用于长评估时间的任务,如机器学习训练,并在多个领域取得SOTA成果。

Comments Available at www.asterlab.ai, 25 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏