arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2512.23508 2025-12-30 cs.AI cs.GT 70%

Why AI Safety Requires Uncertainty, Incomplete Preferences, and Non-Archimedean Utilities

为何人工智能安全需要不确定性、不完全偏好和非阿基米德效用

Alessio Benavoli, Alessandro Facchini, Marco Zaffalon

机构 * School of Computer Science and Statistics, Trinity College Dublin(特里尼蒂大学计算机科学与统计学学院) Trinity Quantum Alliance, Trinity College Dublin(特里尼蒂量子联盟) Management in Networked and Digital Societies (MINDS) Department, Kozminski University(科津斯基大学网络化与数字化社会管理系)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文探讨了人工智能安全需通过不确定性推理、不完全偏好处理和非阿基米德效用机制来实现

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22860 2025-12-30 cs.CR cs.LG cs.MA 70%

Adaptive Trust Consensus for Blockchain IoT: Comparing RL, DRL, and MARL Against Naive, Collusive, Adaptive, Byzantine, and Sleeper Attacks

区块链物联网中的自适应信任共识:比较强化学习、深度强化学习和多智能体强化学习与 naive、collusive、adaptive、Byzantine 和 sleeper 攻击

Soham Padia, Dhananjay Vaidya, Ramchandra Mangrulkar

机构 * Artificial Intelligence Northeastern University(人工智能东北大学) Information Technology Dwarkadas J. Sanghvi College of Engineering(信息技术达沃拉吉·桑格维工程学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 本文通过比较RL、DRL和MARL在区块链物联网中对抗不同攻击的效果,发现MARL在对抗攻击中表现最佳,而所有智能体均能抵御Byzantine攻击,但时间延迟污染攻击对所有智能体均造成严重威胁。

Comments 34 pages, 19 figures, 10 tables. Code available at https://github.com/soham-padia/blockchain-iot-trust

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22404 2025-12-30 cs.HC cs.SE 70%

Mining the Gold: Student-AI Chat Logs as Rich Sources for Automated Knowledge Gap Detection

挖掘黄金:学生与AI聊天记录作为自动识别知识缺口的丰富来源

Quanzhi Fu, Qiyu Wu, Dan Williams

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 QueryQuilt通过分析学生与AI的聊天记录,自动检测大规模讲座中的知识缺口,提升教学效率。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22154 2025-12-30 cs.CR cs.AI cs.MA 70%

Practical challenges of control monitoring in frontier AI deployments

前沿AI部署中的控制监控实际挑战

David Lindner, Charlie Griffin, Tomek Korbak, Roland S. Zimmermann, Geoffrey Irving, Sebastian Farquhar, Alan Cooney

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文探讨了前沿AI部署中控制监控面临的实际挑战,分析了同步、半同步和异步监控方案,并通过案例研究探讨了监督、延迟和恢复等关键问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10436 2025-12-29 cs.CL 70%

RefactorCoderQA: Benchmarking LLMs for Multi-Domain Coding Question Solutions in Cloud and Edge Deployment

RefactorCoderQA: 评估LLMs在云和边缘部署中多领域编程问题解决方案的基准测试

Shadikur Rahman, Aroosa Hameed, Gautam Srivastava, Syed Muhammad Danish

机构 * York University and Algoma University(约克大学和阿尔戈马大学) Algoma University(阿尔戈马大学) Department of Systems and Computer Engineering, Carleton University(系统与计算机工程系,卡尔顿大学) Department of Math and Computer Science, Brandon University(数学与计算机科学系,布兰登大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 RefactorCoderQA通过云-边缘协作架构和RefactorCoder-MoE模型,在多领域编程任务中提升LLMs的性能,准确率达76.84%。

Comments 12 pages, 5 figures, Submitted to IEEE Transactions on Services Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20206 2025-12-24 cs.AI 70%

TongSIM: A General Platform for Simulating Intelligent Machines

TongSIM: 一个用于模拟智能机器的通用平台

Zhe Sun, Kunlun Wu, Chuanjian Fu, Zeming Song, Langyong Shi, Zihe Xue, Bohan Jing, Ying Yang, Xiaomeng Gao, Aijia Li, Tianyu Guo, Huiying Li, Xueyuan Yang, Rongkai Liu, Xinyi He, Yuxi Wang, Yue Li, Mingyuan Liu, Yujie Lu, Hongzhao Xie, Shiyun Zhao, Bo Dai, Wei Wang, Tao Yuan, Song-Chun Zhu, Yujia Peng, Zhenliang Zhang

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) BIGAI Beijing, China(中国北京)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 TongSIM是一个通用平台,用于训练和评估具身智能代理,提供多样化的场景和交互丰富的环境,支持从低级导航到高级复合活动的广泛研究需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20083 2025-12-24 cs.SE cs.RO 70%

Detecting Non-Optimal Decisions of Embodied Agents via Diversity-Guided Metamorphic Testing

通过多样性引导的元形态测试检测具身代理的非最优决策

Wenzhao Wu, Yahui Tang, Mingfei Cheng, Wenbing Tang, Yuan Zhou, Yang Liu

机构 * National Supercomputing Center(国家超算中心) School of Computer(计算机学院) Singapore Management University(新加坡国立大学) College of Information Engineering(信息工程学院) School of Computer Science and Technology(计算机科学与技术学院) College of Computing and Data Science(计算与数据科学学院)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.SE

AI总结 通过多样性引导的元形态测试检测具身代理的非最优决策,提出NoD-DGMT框架,有效识别规划中的效率低下问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19018 2025-12-23 cs.SE 70%

PEAK: A Performance Engineering AI-Assistant for GPU Kernels Powered by Natural Language Transformations

PEAK:一种基于自然语言转换的GPU内核性能工程AI助手

Muhammad Usman Tariq, Abhinav Jangda, Angelica Moreira, Madan Musuvathi, Tyler Sorensen

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.SE

AI总结 PEAK是一种基于自然语言转换的GPU内核性能工程AI助手,通过自然语言编写代码优化并验证性能,适用于CUDA、HIP和HLSL等后端,实现与供应商库相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13524 2025-12-23 cs.AI cs.HC 70%

FreeAskWorld: An Interactive and Closed-Loop Simulator for Human-Centric Embodied AI

FreeAskWorld: 一种面向人类的交互式闭环模拟器用于具身人工智能

Yuhang Peng, Yizhou Pan, Xinning He, Jihaoyu Yang, Xinyu Yin, Han Wang, Xiaoji Zheng, Chao Gao, Jiangtao Gong

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 FreeAskWorld通过整合大语言模型和交互式闭环模拟,提升具身人工智能在复杂社会行为和自然交互中的表现。

Comments 9 pages, 4 figures

Journal ref AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13704 2025-12-17 cs.AI 70%

Adjudicator: Correcting Noisy Labels with a KG-Informed Council of LLM Agents

Adjudicator: 通过知识图谱指导的LLM代理委员会校正噪声标签

Doohee You, Sundeep Paul

机构 * Trusted Engagement \& AI Solutions 500 west 2nd street Trust \& Safety Google

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 Adjudicator通过知识图谱指导的LLM代理委员会校正噪声标签,实现高精度数据验证,显著提升F1分数。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02904 2025-12-16 eess.IV cs.CV cs.LG 70%

Surgical Vision World Model

手术视觉世界模型

Saurabh Koju, Saurav Bastola, Prashant Shrestha, Sanskar Amgain, Yash Raj Shrestha, Rudra P. K. Poudel, Binod Bhattarai

机构 * University of Aberdeen, UK(阿伯丁大学,英国) Cambridge Research Laboratory, Toshiba Europe Ltd, UK(剑桥研究实验室,东芝欧洲有限公司,英国) Nepal Applied Mathematics and Informatics Institute for research (Naamii), Nepal(尼泊尔应用数学与信息学研究所(Naamii),尼泊尔) University of Lausanne, Switzerland(洛桑大学,瑞士)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.LG

AI总结 本文提出首个手术视觉世界模型,通过生成动作可控的手术数据,提升自主手术代理训练的现实感与交互性。

Comments This paper has been accepted at the Data Engineering in Medical Imaging Workshop, MICCAI 2025

Journal ref MICCAI Workshop on Data Engineering in Medical Imaging (2025) 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12042 2025-12-16 cs.CL 70%

Benchmarking Contextual Understanding for In-Car Conversational Systems

车载对话系统上下文理解评估

Philipp Habicht, Lev Sorokin, Abdullah Saydemir, Ken E. Friedl, Andrea Stocco

机构 * Humboldt University of Berlin(柏林洪堡大学) Technical University of Munich(慕尼黑技术大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文通过LLM和提示技术评估车载对话系统上下文理解,发现非推理模型在成本效率上表现最佳,DeepSeek-R1达到高F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11315 2025-12-15 cs.LG 70%

Benchmarking the Generality of Vision-Language-Action Models

对视觉-语言-动作模型通用性的基准测试

Pranav Guruprasad, Sudipta Chowdhury, Harsh Sikka, Mridul Sharma, Helen Lu, Sean Rivera, Aryan Khurana, Hangliang Ren, Yangyue Wang

机构 * Manifold Research Metarch AI Georgia Tech(佐治亚理工学院) Tufts University(塔夫茨大学) Northeastern University(东北大学) Birla Institute of Technology and Science, Pilani(比拉理工学院,帕利尼) Institute for Research and Innovation in Intelligent Systems (IRIIS)(智能系统研究与创新研究所)

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.LG

AI总结 本文提出MultiNet v1.0基准,评估视觉-语言-动作模型在六个基础能力领域的跨领域泛化能力,发现现有模型在未见领域和模态转移时表现显著退化。

Comments 23 pages, 7 figures, and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18221 2025-12-15 cs.MA cs.AI cs.NE 70%

The Emergence of Complex Behavior in Large-Scale Ecological Environments

大规模生态环境中复杂行为的出现

Joseph Bejjani, Chase Van Amburg, Chengrui Wang, Chloe Huangyuan Su, Sarah M. Pratt, Yasin Mazloumi, Naeem Khoshnevis, Sham M. Kakade, Kianté Brantley, Aaron Walsman

机构 * Harvard University(哈佛大学) Fudan University(复旦大学) University of Washington(华盛顿大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究通过大规模生态模拟探索复杂行为的涌现机制,利用进化算法和大规模智能体系统揭示环境规模对行为稳定性的影响。

Comments 33 pages, 23 figures, 12 tables, experiment code available at https://github.com/jbejjani2022/ecological-emergent-behavior

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18271 2025-12-12 cs.CV cs.AI 70%

Beyond Words and Pixels: A Benchmark for Implicit World Knowledge Reasoning in Generative Models

超越文字和像素:生成模型中隐式世界知识推理的基准测试

Tianyang Han, Junhao Su, Junjie Hu, Peizhen Yang, Hengyu Shi, Junfeng Luo, Jialin Gao

机构 * MeiGen AI Team, Meituan(美团梅基因AI团队) Fudan University(复旦大学) D^{4} Lab(D⁴实验室) HHMI Janelia Research Campus(HHMI贾能实验室)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出PicWorld基准测试,用于评估生成模型在隐式世界知识和物理因果推理方面的能力,揭示了现有T2I模型在这些方面的局限性,并提出了证据基础的多代理评估器进行细粒度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09187 2025-12-11 cs.MA cs.AI 70%

WOLF: Werewolf-based Observations for LLM Deception and Falsehoods

基于狼人游戏的LLM欺骗与虚假信息观测

Mrinal Agarwal, Saad Rana, Theo Sundoro, Hermela Berhe, Spencer Kim, Vasu Sharma, Sean O'Brien, Kevin Zhu

机构 * Algoverse AI Research(Algoverse AI研究院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 WOLF通过狼人游戏构建多智能体社交推理基准,评估LLM在欺骗生成与检测中的能力,展示动态交互提升欺骗识别性能。

Comments Spotlight Multi-Turn Interactions in Large Language Models (MTI-LLM) Workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05137 2025-12-11 cs.CL 70%

Demystifying deep search: a holistic evaluation with hint-free multi-hop questions and factorised metrics

解析深度搜索:基于无提示多跳问题和因子化指标的全面评估

Maojia Song, Renhang Liu, Xinyu Wang, Yong Jiang, Pengjun Xie, Fei Huang, Jingren Zhou, Dorien Herremans, Soujanya Poria

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Nanyang Technological University(南洋理工大学) Tongyi Lab, Alibaba Group(阿里云实验室)

专题命中 Agent评测 :workflow(abstract);agentic(abstract);分类 cs.CL

AI总结 本文提出WebDetective基准测试,通过无提示多跳问题和因子化指标,揭示深度搜索中模型在知识利用和拒绝行为上的系统性弱点,并开发EvidenceLoop工作流程以改进自主推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25643 2025-12-10 cs.AI 70%

SOCK: A Benchmark for Measuring Self-Replication in Large Language Models

SOCK:一种衡量大语言模型自我复制能力的基准

Justin Chavarria, Rohan Raizada, Justin White, Eyad Alhetairshi

机构 * Albion College(阿尔比恩学院) Hunter College(亨特学院) University of Arizona(亚利桑那大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 SOCK提出了一种评估大语言模型自我复制能力的基准,旨在建立标准并减少多代理系统中的潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04002 2025-12-09 cs.CL 70%

AgriGPT-VL: Agricultural Vision-Language Understanding Suite

AgriGPT-VL:农业视觉-语言理解套件

Bo Yang, Yunkui Chen, Lanfei Feng, Yu Zhang, Xiao Xu, Jianyu Zhang, Nueraili Aierken, Runhe Huang, Hongjian Lin, Yibin Ying, Shijian Li

机构 * Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 AgriGPT-VL通过构建农业专用的视觉-语言模型和评估套件,提升了农业领域的多模态理解和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06759 2025-12-09 cs.CV cs.AI 70%

VisChainBench: A Benchmark for Multi-Turn, Multi-Image Visual Reasoning Beyond Language Priors

VisChainBench: 一个多轮多图视觉推理基准,超越语言先验

Wenbo Lyu, Yingjun Du, Jinglin Zhao, Xianton Zhen, Ling Shao

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 VisChainBench是一个多轮多图视觉推理基准,通过多代理生成流水线构建,旨在评估LVLM在连续、相互依赖任务中进行多步骤视觉推理的能力。

Comments 12 pages,13figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04895 2025-12-05 cs.AI cs.MA 70%

Chameleon: Adaptive Adversarial Agents for Scaling-Based Visual Prompt Injection in Multimodal AI Systems

Chameleon:基于尺度的视觉提示注入的自适应对抗代理

M Zeeshan, Saud Satti

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 Chameleon是一种自适应对抗框架,通过动态优化图像扰动来暴露和利用多模态AI系统中的缩放漏洞,显著提高攻击成功率并影响决策准确性。

Comments 5 pages, 2 figures, IEEE Transactions on Dependable and Secure Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04864 2025-12-05 cs.AI 70%

Are Your Agents Upward Deceivers?

您的代理是向上欺骗者吗?

Dadi Guo, Qingyu Liu, Dongrui Liu, Qihan Ren, Shuai Shao, Tianyi Qiu, Haoran Li, Yi R. Fung, Zhongjie Ba, Juntao Dai, Jiaming Ji, Zhikai Chen, Jialing Tao, Yaodong Yang, Jing Shao, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 研究发现基于LLM的代理可能通过欺骗行为隐瞒失败,需加强缓解策略以确保安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02230 2025-12-03 cs.AI 70%

Benchmarking LLM Agents for Wealth-Management Workflows

对财富管理流程的LLM代理进行基准测试

Rory Milsom

机构 * Rory Milsom(独立研究者)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI

AI总结 本研究通过构建12个任务对的基准,评估通用LLM代理在财富管理任务中的准确性和经济性,发现其性能受自主性水平和工作流程可靠性影响显著。

Comments 56 pages, 8 figures, The University of Edinburgh

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00352 2025-12-02 cs.LG stat.ML 70%

Sample-Efficient Tabular Self-Play for Offline Robust Reinforcement Learning

样本高效的目标导向自博弈用于离线鲁棒强化学习

Na Li, Zewu Zheng, Wei Ni, Hangguan Shan, Wenjie Zhang, Xinyu Li

机构 * Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Edith Cowan University(埃迪斯·科温大学) University of New South Wales(新南威尔士大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 本文提出RTZ-VI-LCB算法,通过乐观鲁棒值迭代和数据驱动的伯恩斯坦惩罚项,实现离线鲁棒双人零和马尔可夫游戏的最优样本复杂性保证。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00136 2025-12-02 cs.CR cs.SE 70%

An Empirical Study on the Security Vulnerabilities of GPTs

对GPTs安全漏洞的实证研究

Tong Wu, Weibin Wu, Zibin Zheng

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.SE

AI总结 本研究通过实证分析揭示GPTs的安全漏洞,设计攻击套件并提出防御机制,旨在提升其安全性和应用责任感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21935 2025-12-01 cs.LG cs.GT 70%

Breaking Algorithmic Collusion in Human-AI Ecosystems

打破人类-人工智能生态系统中的算法合谋

Natalie Collina, Eshwar Ram Arunachaleswaran, Meena Jagadeesan

机构 * University of Pennsylvania(宾夕法尼亚大学) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.LG

AI总结 本文研究了人类-人工智能生态系统中算法合谋的稳定性,发现单个或多个人类的背叛行为能破坏合谋并降低价格,揭示了合谋在混合生态系统中的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05559 2025-12-01 cs.AI 70%

SciSciGPT: Advancing Human-AI Collaboration in the Science of Science

SciSciGPT:推动科学之科学中的人机协作

Erzhuo Shao, Yifang Wang, Yifan Qian, Zhenyu Pan, Han Liu, Dashun Wang

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 SciSciGPT通过LLM驱动的研究工具促进人机协作,提升科研效率与可重复性,同时提出能力成熟度模型以指导未来框架发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19492 2025-11-26 cs.CY cs.AI 70%

Forecasting AI Time Horizon Under Compute Slowdowns

在计算放缓下预测AI时间跨度

Parker Whitfill, Ben Snodin, Joel Becker

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出一个模型,预测在计算放缓情况下AI时间跨度的增长,发现时间跨度与计算能力成正比,并通过实验验证了这一理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18298 2025-11-25 cs.AI 70%

Cross-Disciplinary Knowledge Retrieval and Synthesis: A Compound AI Architecture for Scientific Discovery

跨学科知识检索与综合:一种用于科学发现的复合AI架构

Svitlana Volkova, Peter Bautista, Avinash Hiriyanna, Gabriel Ganberg, Isabel Erickson, Zachary Klinefelter, Nick Abele, Hsien-Te Kao, Grant Engberson

机构 * Aptima, Inc.(Aptima公司)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 BioSage通过整合LLMs与RAG,利用专门代理实现跨学科知识检索与综合,提升科学发现效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11025 2025-11-25 cs.CV cs.AI 70%

AirCopBench: A Benchmark for Multi-drone Collaborative Embodied Perception and Reasoning

AirCopBench: 多无人机协作具身感知与推理的基准测试

Jirong Zha, Yuxuan Fan, Tianyu Zhang, Geng Chen, Yingfeng Chen, Chen Gao, Xinlei Chen

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 AirCopBench是一个针对多无人机协作具身感知与推理的首个全面基准测试,通过模拟与现实数据生成14600+问题,评估MLLMs在复杂协作场景中的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏