arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15616 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15616 篇

2603.00468 2026-03-03 cs.SE 85%

Cloud-OpsBench: A Reproducible Benchmark for Agentic Root Cause Analysis in Cloud Systems

Cloud-OpsBench: 一种可重现的云系统代理根本原因分析基准

Yilun Wang, Guangba Yu, Haiyu Huang, Zirui Wang, Yujie Huang, Pengfei Chen, Michael R. Lyu

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 Cloud-OpsBench 是一个用于云系统代理根本原因分析的可重现基准,通过构建确定性数字孪生,提供数据引擎、强化学习环境和诊断标准,支持下一代SRE研究。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14337 2026-02-27 cs.SE cs.MA 85%

LongCLI-Bench: A Preliminary Benchmark and Study for Long-horizon Agentic Programming in Command-Line Interfaces

LongCLI-Bench: 一个初步的基准测试与研究,用于命令行界面中的长周期代理编程

Yukang Feng, Jianwen Sun, Zelai Yang, Jiaxin Ai, Chuanhao Li, Zizhen Li, Fanrui Zhang, Kang He, Rui Ma, Jifan Lin, Jie Sun, Yang Xiao, Sizhuo Zhou, Wenxiao Wu, Yiming Liu, Pengfei Liu, Yu Qiao, Shenglin Zhang, Kaipeng Zhang

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.SE

AI总结 LongCLI-Bench通过长周期任务评估代理能力,揭示现有代理在复杂任务中的不足,强调人机协作的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19065 2026-02-24 cs.AI 85%

Agentic Problem Frames: A Systematic Approach to Engineering Reliable Domain Agents

代理问题框架:一种系统化的方法用于工程可靠领域代理

Chanjin Park

机构 * Institute of Engineering Research(工程研究所) Seoul National University(首尔国立大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本研究提出代理问题框架(APF),通过系统化工程方法提升领域代理的可靠性,结合AJD规范工具和AVR循环实现任务要求的渐近收敛。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18940 2026-02-24 cs.AI 85%

DREAM: Deep Research Evaluation with Agentic Metrics

DREAM: 基于代理度量的深度研究评估

Elad Ben Avraham, Changhao Li, Ron Dorfman, Roy Ganz, Oren Nuriel, Amir Dudai, Aviad Aberdam, Noah Flynn, Elman Mansimov, Adi Kalyanpur, Ron Litman

机构 * AWS Agentic AI(AWS敏捷人工智能) Georgia Institute of Technology(佐治亚理工学院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 DREAM提出一种基于代理度量的深度研究评估框架,通过能力平衡原则解决现有基准在事实和时间衰减检测上的不足,实现可扩展的无参考评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18832 2026-02-24 cs.HC cs.AI cs.CY cs.SI 85%

OpenClaw AI Agents as Informal Learners at Moltbook: Characterizing an Emergent Learning Community at Scale

OpenClaw AI Agents作为Moltbook中的非正式学习者:在大规模层面表征一个涌现的学习社区

Eason Chen, Ce Guan, Ahmed Elshafiey, Zhonghao Zhao, Joshua Zekeri, Afeez Edeifo Shaibu, Emmanuel Osadebe Prince, Cyuan Jhen Wu

机构 * Carnegie Mellon University(卡内基梅隆大学) GiveRep Labs(GiveRep实验室)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 研究通过分析Moltbook中由AI代理组成的非正式学习社区,发现参与不平等、广播倒置和参与生命周期等特征,揭示了大规模AI学习社区的动态模式。

Comments 10 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18456 2026-02-24 cs.CY cs.AI cs.HC 85%

Beyond single-channel agentic benchmarking

超越单一通道代理基准测试

Nelu D. Radpour

机构 * Florida State University(佛罗里达州立大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出通过人类-人工智能双元组的可靠性评估代理安全性,强调不相关错误模式对风险降低的重要性,以改进AI安全性评估方法。

Comments 8 pages; 1 figure; 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05016 2026-02-12 cs.HC cs.AI cs.CY cs.ET 85%

From Fragmentation to Integration: Exploring the Design Space of AI Agents for Human-as-the-Unit Privacy Management

从碎片到整合:探索面向人类作为单元的隐私管理的AI代理设计空间

Eryue Xu, Tianshi Li

机构 * Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文通过研究用户隐私管理挑战,提出九个AI代理概念,发现后分享管理工具在用户信任度上表现突出,展示了AI代理在整合隐私管理中的潜力。

Journal ref CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15935 2026-02-11 cs.DB cs.CL cs.CR 85%

MAPS: A Multilingual Benchmark for Agent Performance and Security

MAPS: 一种多语言评估基准,用于代理性能和安全

Omer Hofman, Jonathan Brokman, Oren Rachmil, Shamik Bose, Vikas Pahuja, Toshiya Shimizu, Trisha Starostina, Kelly Marchisio, Seraphina Goldfarb-Tarrant, Roman Vainshtein

机构 * Fujitsu Research of Europe(富士通欧洲研究部) Fujitsu Limited(富士通有限公司) Cohere

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);agentic(abstract);分类 cs.CL

AI总结 MAPS是一个多语言评估基准,用于评估代理AI在不同语言和任务中的性能与安全性。

Comments Accepted to EACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10936 2026-02-11 cs.CL 85%

Cochain: Balancing Insufficient and Excessive Collaboration in LLM Agent Workflows

Cochain: 在LLM代理工作流中平衡不足与过度的合作

Jiaxing Zhao, Hongbin Xie, Yuzhen Lei, Xuan Song, Zhuoran Shi, Lianxin Li, Shuangxue Liu, Linguo Xie, Haoran Zhang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) School of Urban Planning and Design, Peking University(北京大学城市规划与设计学院)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);multi-agent(abstract);分类 cs.CL

AI总结 Cochain通过整合知识图谱和提示树,有效解决业务工作流中LLM代理合作问题,优于基线模型。

Comments 35 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06345 2026-02-09 cs.CR cs.AI 85%

Zero-Trust Runtime Verification for Agentic Payment Protocols: Mitigating Replay and Context-Binding Failures in AP2

面向代理支付协议的零信任运行时验证:缓解AP2中的重放和上下文绑定失败

Qianlong Lan, Anuj Kaul, Shaun Jones, Stephanie Westrum

机构 * eBay Inc(eBay公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出了一种零信任运行时验证框架,通过动态生成非ces强制显式上下文绑定和一次性使用命令语义,以缓解AP2中的重放和上下文重定向攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04813 2026-02-05 cs.AI cs.CY 85%

Agentic AI in Healthcare & Medicine: A Seven-Dimensional Taxonomy for Empirical Evaluation of LLM-based Agents

医疗与医学中的代理AI:一个七维分类法用于评估基于大语言模型的代理

Shubham Vatsal, Harsh Dubey, Aditi Singh

机构 * Department of Computer Science, New York University, CIMS, New York, USA(纽约大学计算机科学系,CIMS,纽约,美国) Department of Computer Science, Cleveland State University, Cleveland, USA(克利夫兰州立大学计算机科学系,克利夫兰,美国)

专题命中 Agent评测 :agentic(title);agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 本文提出一个七维分类法,用于评估基于大语言模型的医疗代理在认知能力、知识管理、交互模式等方面的能力分布与实现情况。

Journal ref IEEE Access, vol. 14, pp. 4840-4863, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06007 2026-02-03 cs.CL 85%

Don't Break the Cache: An Evaluation of Prompt Caching for Long-Horizon Agentic Tasks

不要破坏缓存:对长周期智能体任务中提示缓存的评估

Elias Lumer, Faheem Nizar, Akshaya Jangiti, Kevin Frank, Anmol Gulati, Mandar Phadate, Vamse Kumar Subbiah

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);function calling(abstract);分类 cs.CL

AI总结 本文评估了提示缓存对长周期智能体任务的影响,发现通过策略性缓存控制可显著降低API成本并提升响应速度。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00213 2026-02-03 cs.CR cs.AI cs.MA 85%

TessPay: Verify-then-Pay Infrastructure for Trusted Agentic Commerce

TessPay:可信代理商业的验证后支付基础设施

Mehul Goenka, Tejas Pathak, Siddharth Asthana

机构 * University of Oxford(牛津大学) Indian Institute of Technology, Delhi(德里印度理工学院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 TessPay通过'验证后支付'架构解决代理商业中的信任缺口,提供统一的交易生命周期基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10909 2026-02-02 cs.AI 85%

PaperArena: An Evaluation Benchmark for Tool-Augmented Agentic Reasoning on Scientific Literature

PaperArena: 一个用于科学文献上工具增强代理推理的评估基准

Daoyu Wang, Mingyue Cheng, Shuo Yu, Zirui Liu, Ze Guo, Xin Li, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Artificial Intelligence Research Institute, iFLYTEK Co., Ltd(人工智能研究院,iFLYTEK有限公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI

AI总结 PaperArena提出一个评估基准,用于评估基于LLM的代理在跨多篇论文整合信息并使用外部工具进行推理的能力,实验显示现有代理在复杂任务上的表现有限。

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17920 2026-01-27 cs.AI 85%

Agentic AI for Self-Driving Laboratories in Soft Matter: Taxonomy, Benchmarks,and Open Challenges

代理AI在软物质中的自主实验室:分类、基准和开放挑战

Xuanzhou Chen, Audrey Wang, Stanley Yin, Hanyang Jiang, Dong Zhang

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文探讨了自主实验室在软物质中的应用,提出了基于智能体的环境交互框架,回顾了闭环实验的主要方法,并指出了多模态表示、校准不确定性、安全探索和共享基准基础设施等开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17168 2026-01-27 cs.AI cs.MA 85%

Interpreting Agentic Systems: Beyond Model Explanations to System-Level Accountability

解释代理系统:超越模型解释到系统级问责

Judy Zhu, Dhari Gandhi, Himanshu Joshi, Ahmad Rezaie Mianroodi, Sedef Akinli Kocak, Dhanesh Ramachandran

机构 * Vector Institute for Artificial Intelligence(向量人工智能研究所) University of Texas, Austin(德克萨斯大学奥斯汀分校) Dalhousie University(达尔豪斯大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文探讨了代理系统中可解释性技术的必要性,提出需设计专门方法以确保系统在目标形成、环境交互和结果评估等阶段的可追溯性和问责性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01078 2026-01-26 cs.AI 85%

SimWorld: An Open-ended Realistic Simulator for Autonomous Agents in Physical and Social Worlds

SimWorld:一种用于物理和社会世界中自主代理的开放式真实模拟器

Jiawei Ren, Yan Zhuang, Xiaokang Ye, Lingjun Mao, Xuhong He, Jianzhi Shen, Mrinaal Dogra, Yiming Liang, Ruixuan Zhang, Tianai Yue, Yiqing Yang, Eric Liu, Ryan Wu, Kevin Benavente, Rajiv Mandya Nagaraju, Muhammad Faayez, Xiyan Zhang, Dhruv Vivek Sharma, Xianrui Zhong, Ziqiao Ma, Tianmin Shu, Zhiting Hu, Lianhui Qin

机构 * UCSD(加州大学圣地亚哥分校) UVA(弗吉尼亚大学) UIUC(伊利诺伊大学香槟分校) JHU(约翰·霍普金斯大学) Purdue(Purdue 大学) PolyU USC(美国南加州大学) UMich(密歇根大学)

专题命中 Agent评测 :autonomous agent(title);agent(abstract);AI agent(abstract);multi-agent(abstract)

AI总结 SimWorld是一个基于Unreal Engine 5构建的开放式真实模拟器,旨在开发和评估LLM/VLM代理在复杂物理和社会环境中的能力,通过多代理配送任务验证其推理模式与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15679 2026-01-23 cs.AI 85%

Improving Methodologies for Agentic Evaluations Across Domains: Leakage of Sensitive Information, Fraud and Cybersecurity Threats

提升跨领域的代理评估方法:敏感信息泄露、欺诈和网络安全隐患

Ee Wei Seah, Yongsen Zheng, Naga Nikshith, Mahran Morsidi, Gabriel Waikin Loh Matienzo, Nigel Gay, Akriti Vij, Benjamin Chua, En Qi Ng, Sharmini Johnson, Vanessa Wilfred, Wan Sie Lee, Anna Davidson, Catherine Devine, Erin Zorer, Gareth Holvey, Harry Coppock, James Walpole, Jerome Wynee, Magda Dubois, Michael Schmatz, Patrick Keane, Sam Deverett, Bill Black, Bo Yan, Bushra Sabir, Frank Sun, Hao Zhang, Harriet Farlow, Helen Zhou, Lingming Dong, Qinghua Lu, Seung Jang, Sharif Abuadbba, Simon O'Callaghan, Suyu Ma, Tom Howroyd, Cyrus Fung, Fatemeh Azadi, Isar Nejadgholi, Krishnapriya Vishnubhotla, Pulei Xiong, Saeedeh Lohrasbi, Scott Buffett, Shahrear Iqbal, Sowmya Vajjala, Anna Safont-Andreu, Luca Massarelli, Oskar van der Wal, Simon Möller, Agnes Delaborde, Joris Duguépéroux, Nicolas Rolin, Romane Gallienne, Sarah Behanzin, Tom Seimandi, Akiko Murakami, Takayuki Semitsu, Teresa Tsukiji, Angela Kinuthia, Michael Michie, Stephanie Kasaon, Jean Wangari, Hankyul Baek, Jaewon Noh, Kihyuk Nam, Sang Seo, Sungpil Shin, Taewhi Lee, Yongsu Kim

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 该研究通过跨领域合作,提升代理评估方法,聚焦敏感信息泄露、欺诈和网络安全等共同风险,推动AI系统测试的最佳实践。

Comments The author/contributor list organises contributors by country and alphabetical order within each country. In some places, the order has been altered to match other related publications

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13383 2026-01-21 cs.AI 85%

A Lightweight Modular Framework for Constructing Autonomous Agents Driven by Large Language Models: Design, Implementation, and Applications in AgentForge

基于大语言模型的轻量模块化框架:用于AgentForge中的设计、实现与应用

Akbar Anbar Jafari, Cagri Ozcinar, Gholamreza Anbarjafari

机构 * University of Tartu(塔尔图大学) S Holding OÜ(3S控股公司)

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);planning(abstract);分类 cs.AI

AI总结 AgentForge是一种基于大语言模型的轻量模块化框架,通过可组合的技能抽象、统一的LLM后端接口和声明性配置系统,提升自主代理的开发效率和灵活性。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13186 2026-01-21 cs.AI cs.MA 85%

Prompt Injection Mitigation with Agentic AI, Nested Learning, and AI Sustainability via Semantic Caching

通过语义缓存、嵌套学习和AI可持续性缓解提示注入

Diego Gosmar, Deborah A. Dahl

机构 * Head of AI, Tesisquare Member, Open Voice Interoperability Initiative Linux Foundation AI & Data Torino, Italy(AI负责人,Tesisquare成员,开放语音互操作性倡议Linux基金会AI与数据部门,意大利托里诺) Principal, Conversational Technologies Member, Open Voice Interoperability Initiative Linux Foundation AI & Data Plymouth Meeting, PA, USA(首席科学家,对话技术成员,开放语音互操作性倡议Linux基金会AI与数据部门,美国普利茅斯会议)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文通过语义缓存、嵌套学习和AI可持续性方法,提出了一种缓解提示注入的系统,实现安全、高效且环保的LLM部署。

Comments 33 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08676 2026-01-15 cs.AI 85%

Advancing ESG Intelligence: An Expert-level Agent and Comprehensive Benchmark for Sustainable Finance

推进ESG智能:一个专家级代理和全面的可持续金融基准

Yilei Zhao, Wentao Zhang, Lei Xiao, Yandan Zheng, Mengpu Liu, Wei Yang Bryan Lim

机构 * Nanyang Technological University(南洋理工大学) Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出ESGAgent多代理系统及三级基准,通过高准确率在原子问题回答和专业报告生成中超越现有LLMs,为可持续金融领域提供关键评估工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04879 2026-01-09 cs.CL 85%

Mind2Report: A Cognitive Deep Research Agent for Expert-Level Commercial Report Synthesis

Mind2Report: 一种用于专家级商业报告综合的认知深度研究代理

Mingyue Cheng, Daoyu Wang, Qi Liu, Shuo Yu, Xiaoyu Tao, Yuqian Wang, Chengzhong Chu, Yu Duan, Mingkang Long, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Artificial Intelligence Engineering Institute, iFLYTEK Co., Ltd(人工智能工程院,iFLYTEK公司)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.CL

AI总结 Mind2Report是一种通过动态内存增强大语言模型,实现专家级商业报告综合的认知深度研究代理,优于现有基线模型。

Comments 26 Pages, 9 Figures, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04583 2026-01-09 cs.AI cs.MA 85%

Autonomous Agents on Blockchains: Standards, Execution Models, and Trust Boundaries

区块链上的自主代理:标准、执行模型与信任边界

Saad Alqithami

机构 * Saad Alqithami(萨德·阿利萨米)

专题命中 Agent评测 :autonomous agent(title);agent(abstract);agentic(abstract);multi-agent(abstract)

AI总结 本文系统梳理了区块链与自主代理的互操作性领域,提出了五类整合模式、定制化的威胁模型和能力矩阵,并提出了研究路线图和评估套件,旨在提升链上执行的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05449 2025-12-08 cs.AI 85%

The Seeds of Scheming: Weakness of Will in the Building Blocks of Agentic Systems

计划的种子:代理系统构建块中的弱点意志

Robert Yang

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出将'意志薄弱'作为分析代理AI系统不一致性和目标漂移的基础概念,并引入Akrasia基准以评估模型的自我控制能力。

Comments 4 pages + appendix. AAAI 2026 FAST Workshop (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22138 2025-12-01 cs.LG 85%

TinyLLM: Evaluation and Optimization of Small Language Models for Agentic Tasks on Edge Devices

TinyLLM: 小型语言模型在边缘设备上用于代理任务的评估与优化

Mohd Ariful Haque, Fahad Rahman, Kishor Datta Gupta, Khalil Shujaee, Roy George

机构 * Department of Cyber-Physical Systems, Clark Atlanta University, USA(计算机物理系统系,Clark Atlanta大学,美国) Department of Computer Science and Engineering, United International University, Bangladesh(计算机科学与工程系,联合国际大学,孟加拉国)

专题命中 Agent评测 :agentic(title,abstract);autonomous agent(abstract);function calling(abstract);分类 cs.LG

AI总结 TinyLLM研究小型语言模型在边缘设备上执行代理任务的优化方法,通过混合策略提升准确性与效率,验证了中等规模模型在多轮任务中的优势。

Comments 8 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20510 2025-11-27 cs.AI 85%

FRAGMENTA: End-to-end Fragmentation-based Generative Model with Agentic Tuning for Drug Lead Optimization

FRAGMENTA:基于片段的端到端生成模型与代理调优用于药物先导优化

Yuto Suzuki, Paul Awolade, Daniel V. LaBarbera, Farnoush Banaei-Kashani

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University of Colorado Denver(科罗拉多大学丹佛分校) Skaggs School of Pharmacy(斯卡格斯药学院) University of Colorado Anschutz Medical Campus(科罗拉多大学安舒茨医疗分校)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 FRAGMENTA通过端到端框架和代理调优方法,提升药物先导优化的生成效率和调优效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24397 2025-10-29 cs.AI 85%

APTBench: Benchmarking Agentic Potential of Base LLMs During Pre-Training

Jiarui Qin, Yunjia Xi, Junjie Huang, Renting Rui, Di Yin, Weiwen Liu, Yong Yu, Weinan Zhang, Xing Sun

机构 * Tencent Youtu Lab(腾讯优图实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI

Comments 46 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20255 2025-10-24 cs.CY cs.AI cs.HC 85%

Towards AI Agents for Course Instruction in Higher Education: Early Experiences from the Field

Yogesh Simmhan, Varad Kulkarni

机构 * Department of Computational and Data Sciences, Indian Institute of Science (IISc), Bangalore 560012 India(计算与数据科学系,印度科学研究院(IISc),班加罗尔)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02627 2025-10-06 cs.RO cs.AI 85%

A Trajectory Generator for High-Density Traffic and Diverse Agent-Interaction Scenarios

Ruining Yang, Yi Xu, Yixiao Chen, Yun Fu, Lili Su

机构 * Department of Electrical and Computer Engineering, Northeastern University(电气与计算机工程系,东北大学)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02589 2025-10-06 cs.AI 85%

A Benchmark Study of Deep Reinforcement Learning Algorithms for the Container Stowage Planning Problem

Yunqi Huang, Nishith Chennakeshava, Alexis Carras, Vladislav Neverov, Wei Liu, Aske Plaat, Yingjie Fan

机构 * Leiden University(莱顿大学) Leiden Institute of Advanced Computer Science(莱顿高级计算机科学研究所)

专题命中 Agent评测 :planning(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏