arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-19 至 2026-05-19 共收录 77 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 77 篇

2604.21937 2026-05-19 cs.AI cs.MA 91%

MolClaw: An Autonomous Agent with Hierarchical Skills for Drug Molecule Evaluation, Screening, and Optimization

MolClaw:一种具有分层技能的自主代理,用于药物分子评估、筛选和优化

Lisheng Zhang, Lilong Wang, Xiangyu Sun, Wei Tang, Haoyang Su, Yuehui Qian, Qikui Yang, Qingsong Li, Zhenyu Tang, Haoran Sun, Yingnan Han, Yankai Jiang, Wenjie Lou, Bowen Zhou, Xiaosong Wang, Lei Bai, Zhengwei Xie

机构 * Peking University Health Science Center, Peking University, Beijing, China(北京大学北京医院科学中心,北京大学,北京,中国) Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) Academy for Advanced Interdisciplinary Studies, Peking University, Beijing, China(北京大学先进跨学科研究学院,北京大学,北京,中国)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title,abstract);AI agent(abstract);planning(abstract)

AI总结 MolClaw通过分层技能架构整合30余种领域资源,实现药物分子评估、筛选和优化的自动化,其在复杂工作流中的表现优于现有AI代理。

Comments 28 pages, 8 figures. Code and data will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17475 2026-05-19 cs.SE 90%

Event-B Agent: Towards LLM Agent for Formal Model Synthesis and Repair

Event-B Agent:迈向LLM代理的正式模型综合与修复

Hongshu Wang, Xinyue Zuo, Yuhan Sun, Qin Li, Yamine Ait Ameur, Jin Song Dong

专题命中 Agent评测 :agent(title,title_cn);分类 cs.SE

AI总结 本文提出Event-B Agent,一种基于LLM的正式模型综合与修复框架,通过自然语言要求构建初始模型并迭代修复和优化,提升模型质量。

Comments accepted by FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17634 2026-05-19 cs.CR cs.CL cs.CY 89%

AI Agents May Always Fall for Prompt Injections

AI Agents May Always Fall for Prompt Injections

Sahar Abdelnabi, Eugene Bagdasarian

机构 * ELLIS Institute Tübingen & MPI-IS & Tübingen AI Center(图宾根ELLIS研究所及MPI-IS与图宾根人工智能中心) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 Agent评测 :AI agent(title,title_cn);agent(abstract);autonomous agent(abstract);分类 cs.CL

AI总结 本文基于上下文完整性理论重新审视提示注入问题,揭示了现有防御机制的不足,并提出了一种新的评估框架来设计更安全的自主代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18548 2026-05-19 cs.CL cs.AI 88%

STT-Arena: A More Realistic Environment for Tool-Using with Spatio-Temporal Dynamics

STT-Arena:一种更现实的工具使用环境,包含时空动态

Tingfeng Hui, Hao Xu, Pengyu Zhu, Hongsheng Xin, Kun Zhan, Sen Su, Chunxiao Liu, Ning Miao

机构 * Hong Kong Institute of AI for Science, City University of Hong Kong(香港人工智能科学研究院,香港城市大学) Department of Data Science, City University of Hong Kong(数据科学系,香港城市大学) Beijing University of Posts and Telecommunications(北京邮电大学) Li Auto Inc.(李汽有限公司) Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(summary_cn,abstract);tool-use(abstract,abstract_cn);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出STT-Arena基准测试,旨在评估大型语言模型在面对时空动态变化时的适应性规划能力,发现现有模型在处理此类动态问题时存在显著不足,并提出改进方法STT-Agent-4B以提升性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16821 2026-05-19 cs.AI 87%

Multi-Paradigm Agent Interaction in Practice:A Systematic Analysis of Generator-Evaluator, ReAct Loop,and Adversarial Evaluation in the buddyMe Framework

多范式代理交互实践:buddyMe框架中生成器-评估器、ReAct循环和对抗性评估的系统分析

Xiaohua Wang, Chao Han, Kai Yu, XiaoLiang Xu, Liang Wang

机构 * BuddyMe Research Team(buddyMe研究团队) CHARMMIRAEL Biotech Co., Ltd(CHARMMIRAEL生物技术有限公司)

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);planning(abstract);multi-agent(abstract)

AI总结 本文通过系统分析buddyMe框架中生成器-评估器、ReAct循环和对抗性评估三种代理交互范式,揭示了在实际应用中多范式代理系统的设计挑战与优化策略。

Comments 11 pages, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09817 2026-05-19 cs.SE cs.CR 87%

Evaluating Tool Cloning in Agentic-AI Ecosystems

评估代理AI生态系统中的工具克隆

Taein Kim, David Jiang, Yuepeng Hu, Yuqi Jia, Neil Gong

专题命中 Agent评测 :agentic(title,abstract);agent(abstract,abstract_cn);tool-use(abstract);分类 cs.SE

AI总结 研究通过大规模测量分析代理AI生态系统中工具克隆现象,发现高相似性区域普遍存在,60%的高Jaccard候选和85%的高ssdeep候选被验证为克隆,揭示工具克隆对生态系统多样性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17380 2026-05-19 cs.AI cs.CR cs.LG 86%

ADR: An Agentic Detection System for Enterprise Agentic AI Security

ADR:一种用于企业代理AI安全的代理检测系统

Chenning Li, Pan Hu, Justin Xu, Baris Ozbas, Olivia Liu, Caroline Van, Manxue Li, Wei Zhou, Mohammad Alizadeh, Pengyu Zhang, KK Sriramadhesikan, Ming Zhang

机构 * Uber

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ADR系统,一种大规模、经过生产验证的企业框架,用于安全地管理通过模型上下文协议(MCP)运行的AI代理。该系统解决了三个关键问题:观测有限、鲁棒性不足和检测成本高,并通过三个组件实现了这些目标:ADR传感器、ADR探索器和ADR检测器。

Comments Accepted at MLSys 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18144 2026-05-19 cs.AI 85%

Evidence-Grounded Frontier Mapping and Agentic Hypothesis Generation in Nanomedicine

基于证据的前沿映射与代理假设生成在纳米医学中

Christiaan G. A. Viviers, Koen de Bruin, Mirre M. Trines, Ayla M. Hokke, Roy van der Meel, Avi Schroeder, Twan Lammers, Willem J. M. Mulder, Fons van der Sommen

机构 * ARIA Lab, Signal Processing Systems, Department of Electrical Engineering, Eindhoven University of Technology(ARIA实验室,信号处理系统,电气工程系,埃因霍温理工大学) Laboratory of Chemical Biology, Department of Biomedical Engineering, Eindhoven University of Technology(化学生物学实验室,生物医学工程系,埃因霍温理工大学) The Louis Family Laboratory for Targeted Drug Delivery and Personalized Medicine Technologies, Department of Chemical Engineering, Technion - Israel Institute of Technology(定向药物输送与个性化医学技术实验室,化学工程系,技术离子-以色列理工学院) Department of Nanomedicine and Theranostics, Institute for Experimental Molecular Imaging (ExMI), RWTH Aachen University Hospital(纳米医学与诊疗学系,实验分子成像研究所(ExMI),亚琛工业大学医院) Department of Internal Medicine and Radboud Center for Infectious Diseases (RCI), Radboud University Medical Center(内科学系和Radboud感染疾病中心(RCI),Radboud大学医学中心)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI

AI总结 该研究提出了一种结合文章嵌入、相似性图分析、稀疏前沿提取、结构化证据包检索和审计过的大型语言模型(LLM)工作流的系统pArticleMap,用于支持纳米医学研究方向的选择和假设生成,通过生成和评分基于引用的假设,实现了证据导向的研究辅助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16436 2026-05-19 cs.CR cs.AI 85%

The End of Trust: How Agentic AI Breaks Security Assumptions

信任的终结:如何代理AI打破安全假设

Osama Zafar, Alexander Nemecek, Erman Ayday

机构 * Dept. of Computer and Data Sciences(计算机与数据科学系) Case Western Reserve University(凯斯西储大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 代理AI打破了传统安全假设,允许高保真的定制欺骗在大众市场层面实现。本文提出'无限冒充者'攻击模型,并探讨从验证行为转向评估行动的安全范式转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04202 2026-05-19 cs.LG cs.AI cs.CL 85%

ClawArena: Benchmarking AI Agents in Evolving Information Environments

ClawArena:在演化的信息环境中评估AI代理的基准测试

Haonian Ji, Kaiwen Xiong, Siwei Han, Peng Xia, Shi Qiu, Yiyang Zhou, Jiaqi Liu, Jinlong Li, Bingzhou Li, Zeyu Zheng, Cihang Xie, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳州立大学夏洛特分校) University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 ClawArena评估AI代理在信息环境动态变化中的能力,通过多源冲突推理、动态信念更新和隐式个性化三个挑战,测试代理在多通道会话、工作区文件和阶段更新中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07347 2026-05-19 stat.ML cs.LG math.PR 83%

Throughput-Optimal Scheduling Algorithms for LLM Inference and AI Agents

面向LLM推理和AI代理的吞吐量最优调度算法

J. G. Dai, Tianze Deng, Yueying Li, Tianyi Peng

机构 * School of Operations Research and Information Engineering, Cornell University(Cornell大学运筹学与信息工程学院) Operations Management, Booth School of Business, University of Chicago(芝加哥大学博斯商学院运营管理系) Decision, Risk and Operations, Columbia Business School, Columbia University(哥伦比亚大学哥伦比亚商学院决策、风险与运营系)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.LG

AI总结 本文从排队论角度研究了LLM推理系统的吞吐量优化问题,证明了工作保持调度算法在DAG和Fork-Join路由拓扑中能实现最大吞吐量,并揭示了批量处理网络中K-FCFS调度的流极限框架,评估了Orca和Sarathi-Serve的吞吐量最优性,同时指出批量大小限制和循环路由拓扑对吞吐量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14271 2026-05-19 cs.CL cs.CY 83%

Auditing Agent Harness Safety

审查代理安全

Chengzhi Liu, Yichen Guo, Yepeng Liu, Yuzhe Yang, Qianqi Yan, Xuandong Zhao, Wenyue Hua, Sheng Liu, Sharon Li, Yuheng Bu, Xin Eric Wang

机构 * UCB(加州大学伯克利分校) WISC(威斯康星大学) STANFORD(斯坦福大学) MSR1(微软研究院)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出HarnessAudit框架,用于审查执行轨迹中的边界合规性、执行保真度和系统稳定性,揭示多代理Harness中的安全风险,并通过HarnessAudit-Bench验证了安全风险与轨迹长度、领域和代理角色的关系。

Comments 11 Pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23986 2026-05-19 cs.AI 83%

TusoAI: Agentic Optimization for Scientific Methods

TusoAI: 科学方法的代理优化

Alistair Turcan, Kexin Huang, Lei Li, Martin Jinye Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) Phylo

专题命中 Agent评测 :agentic(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 TusoAI通过整合领域知识和迭代优化,提升科学任务中计算方法的性能,优于现有专家方法和科学AI代理,在单细胞RNA测序数据去噪和卫星地球监测等任务中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16282 2026-05-19 cs.CY cs.AI 83%

Taxonomy and Consistency Analysis of Safety Benchmarks for AI Agents

AI代理安全基准的分类与一致性分析

Miles Q. Li, Benjamin C. M. Fung, Boyang Li, Heba Ismail, Farkhund Iqbal

机构 * McGill University(麦吉尔大学) Kean University(凯恩大学) Zayed University(扎耶德大学)

专题命中 Agent评测 :AI agent(title);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文分析了AI代理安全基准的分类与一致性问题,揭示了方法学选择对安全结论的影响,指出基准选择可能导致矛盾的安全结论,且指标碎片化限制了比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05739 2026-05-19 cs.LG cs.AI cs.CL q-fin.CP 82%

Multi-Dimensional Behavioral Evaluation of Agentic Stock Prediction Systems Using Large Language Model Judges with Closed-Loop Reinforcement Learning Feedback

基于大语言模型判官的多维行为评估:用于代理股票预测系统的闭环强化学习反馈

Mohammad Al Ridhawi, Mahtab Haj Ali, Hussein Al Osman

机构 * School of Electrical Engineering and Computer Science(电气工程与计算机科学学院)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出一种多维行为评估方法,通过大语言模型判官评估代理系统决策过程,利用闭环强化学习反馈提升预测性能,验证了方法在股票预测中的有效性。

Comments 17 pages, 5 figures, 14 tables. Manuscript submitted to Applied Artificial Intelligence (Taylor and Francis)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17169 2026-05-19 cs.AI cs.CL cs.MA 81%

Responsible Agentic AI Requires Explicit Provenance

负责任的代理AI需要明确的来源

Jinwei Hu, Xinmiao Huang, Qisong He, Youcheng Sun, Yi Dong, Xiaowei Huang

机构 * School of Computer Science and Informatics, University of Liverpool(利兹大学计算机科学与信息学学院) Department of Computer Science, Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学计算机科学系)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本文探讨了代理AI中责任归属的问题,指出需要在整个代理生命周期中明确来源,以使责任可计算和可执行,提出了通过因果归因函数和责任张量来形式化所需信息,并通过初步实验验证了在线估计和干预的可能性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12824 2026-05-19 cs.MA cs.AI cs.CL cs.CY 81%

Mechanism Plausibility in Generative Agent-Based Modeling

生成基于代理的建模中的机制合理性

Patrick Zhao, David Huu Pham, Nicholas Vincent

机构 * Simon Fraser University(西蒙弗雷泽大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出机制合理性量表,区分生成充分性与机制合理性,探讨生成式代理模型的生成能力与解释能力。

Comments Accepted at ACM FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09415 2026-05-19 econ.TH math.OC 80%

Contracting a crowd of heterogeneous agents

对异质群体的合同设计

Guillermo Alonso Alvarez, Erhan Bayraktar, Ibrahim Ekren

专题命中 Agent评测 :agent(summary_cn,abstract)

AI总结 本文研究了大规模异质群体的最优合同设计问题,通过线性二次框架分析有限群体和连续极限问题,得到显式的最优合同和均衡努力,并证明了连续合同可以基于大样本评估以获得近似合同,从而在多 agent 交互场景中提供可扩展的近似方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02039 2026-05-19 cs.AI cs.CL cs.DB cs.LG 80%

Hunt Instead of Wait: Evaluating Deep Data Research on Large Language Models

在大型语言模型上进行深度数据研究:评估深度数据研究

Wei Liu, Peijie Yu, Michele Orini, Yali Du, Yulan He

专题命中 Agent评测 :agentic(abstract,abstract_cn);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出深度数据研究(DDR)任务和DDR-Bench基准,评估大型语言模型的探索智能,发现有效探索需要内在策略而非单纯扩展。

Comments 14 pages, 7 tables, 8 figures, accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17856 2026-05-19 cs.AI 79%

KISS - Knowledge Infrastructure for Scientific Simulation: A Scaffolding for Agentic Earth Science

KISS - 地球科学的科学模拟知识基础设施:一种智能体的支架

Ziwei Li, Liujun Zhu, Yuchen Liu, Yichen Zhao, Birk Li, Ruiqi Wu, Junliang Jin, Jianyun Zhang

机构 * State Key Laboratory of Water Disaster Prevention, Hohai University, Nanjing(水利灾害预防国家重点实验室,河海大学,南京) Yangtze Institute for Conservation and Development, Hohai University, Nanjing(长江保护与发展研究院,河海大学,南京) Department of Bioresource Engineering, McGill University, Sainte-Anne-de-Bellevue, Quebec, Canada(生物资源工程系,麦吉尔大学,圣安妮-德-贝尔贝夫,魁北克,加拿大) Ottawa Research and Development Centre, Agriculture & Agri-Food Canada, Ottawa, Ontario, K1A 0C6, Canada(渥太华研发中心,加拿大农业与食品部,渥太华,安大略,K1A 0C6,加拿大) College of Water Conservancy and Hydropower Engineering, Hohai University, Nanjing(水利水电工程学院,河海大学,南京) Meta Platforms Inc.(Meta平台公司) Nanjing Hydraulic Research Institute, Nanjing(南京水利研究院)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文提出KISS,一种用于科学模拟的知识基础设施,通过将专业知识外化为经过验证的建模操作符、分阶段的领域协议和诊断恢复机制,使智能体能够生成物理合理且可验证的端到端模拟,从而降低非专业用户与过程模拟之间的接入门槛,并促进建模社区的整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17790 2026-05-19 cs.AI 79%

STRIDE: A Self-Reflective Agent Framework for Reliable Automatic Equation Discovery

STRIDE:一种用于可靠自动方程发现的自反思代理框架

Jiarui Su, Songjun Tu, Bei Sun, Xiaojun Liang

机构 * Central South University(中南大学) Pengcheng Laboratory(鹏城实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出STRIDE框架,通过协调数据感知生成、混合拟合评估、批评-执行器修复和多样性保持语义记忆,提升自动方程发现的可靠性,实验表明其在多个LLM基础上提升了准确性、OOD鲁棒性和结构恢复能力。

Comments 23 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12297 2026-05-19 q-bio.TO q-bio.QM 78%

A stochastic agent-based model for simulating tumor-immune dynamics and evaluating therapeutic strategies

一种随机代理模型用于模拟肿瘤-免疫动态并评估治疗策略

Yuhong Zhang, Chenghang Li, Boya Wang, Jinzhi Lei

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出一种随机代理模型,整合细胞异质性、空间细胞间相互作用和药物抗性进化,用于模拟肿瘤生长和免疫反应,并评估不同治疗策略的效果。

Comments 26 pages, 13 figures

Journal ref MBE, 2026, 23(5):1402-1436

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15377 2026-05-19 cs.AI 77%

Ensemble Monitoring for AI Control: Diverse Signals Outweigh More Compute

为AI控制的集束监控:多样信号胜过更多计算

Eugene Koran, Yejun Yun, Samantha Tetef, Benjamin Arnav, Pablo Bernabeu-Pérez

机构 * Yale University(耶鲁大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文研究了通过结合多种监控信号来提高AI行为检测的性能,发现多样性的监控集合比单一或同质的监控集合更有效,且细调的监控方法在检测能力上更具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17044 2026-05-19 cs.AI 77%

PersonaArena: Dynamic Simulation for Evaluating and Enhancing Persona-Level Role-Playing in Large Language Models

PersonaArena: 用于评估和提升大语言模型层面角色扮演的动态模拟

Wenlong Shi, Jianxun Lian, Mingqi Wu, Haiming Qin, Mingyang Zhou, Xing Xie, Naipeng Chao, Hao Liao

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Microsoft Research Asia(微软亚洲研究院) Microsoft Gaming(微软游戏) Provincial Key Laboratory of Intelligent Communication and Digital Society Governance, Shenzhen University(深圳大学省级智能通信与数字社会治理重点实验室)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出PersonaArena框架,通过动态模拟评估和提升大语言模型在角色扮演层面的能力,利用用户生成的社会内容构建细致的个性库,并在模拟社交环境中进行多轮上下文丰富的交互,通过多代理辩论裁判实现全面公正的评估。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16909 2026-05-19 cs.AI 77%

TOBench: A Task-Oriented Omni-Modal Benchmark for Real-World Tool-Using Agents

TOBench:面向真实世界工具使用代理的任务导向多模态基准

Zhiqiang Liu, Wenhui Dong, Yilang Tan, Yuwen Qu, Haochen Yin, Chenyang Si

机构 * Nanjing University(南京大学) Huazhong University of Science and Technology(华中科技大学) Southwest Jiaotong University(西南交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 Agent评测 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出TOBench,一个面向真实世界工具使用代理的多模态基准,通过闭环多模态验证设计,评估和推动下一代多模态工具使用代理的发展。

Comments Github: https://github.com/Pi3AI/TOBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07191 2026-05-19 cs.RO cs.LG stat.ME 77%

Curb Your Attention: Causal Attention Gating for Robust Trajectory Prediction in Autonomous Driving

抑制注意力:因果注意力门控用于自动驾驶中的鲁棒轨迹预测

Ehsan Ahmadi, Ray Mercurius, Soheil Alizadeh, Kasra Rezaee, Amir Rasouli

机构 * University of Alberta(阿尔伯塔大学) Noah’s Ark Laboratory, Huawei Technologies Canada(华为加拿大诺亚实验室) Cornell University(康奈尔大学)

专题命中 Agent评测 :agent(summary_cn,abstract);分类 cs.LG

AI总结 本文提出CRiTIC模型,通过因果发现网络识别agent间因果关系,并引入因果注意力门控机制提升轨迹预测的鲁棒性和泛化能力,实验表明模型在对抗非因果扰动时鲁棒性提升54%。

Comments Accepted ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16616 2026-05-19 cs.LG 77%

MLReplicate: Benchmarking Autonomous Research Systems for Machine Learning Reproducibility

MLReplicate:用于机器学习可重复性自主研究系统的基准测试

Sasi Kiran Gaddipati, Diyana Muhammed, Farhana Keya, Gollam Rabby, Sören Auer

机构 * TIB—Leibniz Information Centre for Science and Technology(蒂宾根-莱比锡信息科学与技术研究中心) L3S Research Center, Leibniz University Hannover(莱比锡大学汉诺威分校L3S研究中心)

专题命中 Agent评测 :agent(abstract,abstract_cn);workflow(abstract);分类 cs.LG

AI总结 本文提出MLReplicate基准测试,评估自主研究系统在机器学习可重复性方面的性能,发现计算规模并非决定性因素,且系统间存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02262 2026-05-19 cs.SE cs.AI cs.CL 75%

OmniCode: A Benchmark for Evaluating Software Engineering Agents

OmniCode: 一个评估软件工程代理的基准

Atharv Sonwane, Eng-Shen Tu, Wei-Chung Lu, Claas Beger, Carter Larsen, Debjit Dhar, Simon Alford, Rachel Chen, Ronit Pattanayak, Tuan Anh Dang, Guohao Chen, Gloria Geng, Kevin Ellis, Saikat Dutta

机构 * Cornell University(康奈尔大学) Independent contributor(独立贡献者) UC Santa Barbara(加州大学圣巴巴拉分校) Jadavpur University(贾瓦伊普尔大学) New York University(纽约大学)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE

AI总结 本文提出OmniCode,一个涵盖更广泛任务类别的软件工程基准,旨在评估软件代理在不同软件开发方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17079 2026-05-19 cs.CL cs.AI cs.CY 73%

Can LLMs Think Like Consumers? Benchmarking Crowd-Level Reaction Reconstruction with ConsumerSimBench

LLMs能否像消费者一样思考?通过ConsumerSimBench进行大众级反应重建的基准测试

Tianyu Wang, Jiajun Li, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出ConsumerSimBench基准,通过1553个真实中国社交媒体话题和23122个原子化、规则审核过的标准,评估LLM在模拟消费者反应方面的能力,揭示了前沿模型在预测高语境中文消费者讨论中实际关心内容方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18621 2026-05-19 cs.CV cs.AI 70%

CrossView Suite: Harnessing Cross-view Spatial Intelligence of MLLMs with Dataset, Model and Benchmark

CrossView Suite: 利用数据集、模型和基准 harnessing MLLMs 的跨视图空间智能

Wei Wang, Yuqian Yuan, Tianwei Lin, Wenqiao Zhang, Siliang Tang, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 该研究提出CrossView Suite,通过开发CrossViewSet、CrossViewBench和CrossViewer三个组件,解决跨视图推理中的数据稀缺、评估不足和对齐机制缺失问题,提升多视图空间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏