arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6764 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 多智能体 1124 篇

2606.15008 2026-06-16 cs.CR 新提交 75%

Security Engineering of OpenClaw: Analyzing Attack Surface Expansion and Trust-Boundary Violations

OpenClaw的安全工程:分析攻击面扩展与信任边界违反

Saeid Jamshidi, Arghavan Moradi Dakhel, Kawser Wazed Nafi, Foutse Khomh

专题命中 多智能体 :agent(abstract);agentic(abstract);multi-agent(abstract)

AI总结 本文分析多智能体LLM系统OpenClaw中攻击面扩展与信任边界违反,发现输出聚合导致妥协概率从0.24升至0.86,防御控制可显著降低风险但影响效用与延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10192 2026-06-10 math.OC cs.SY eess.SY 新提交 75%

Submodular Optimization with Applications to Decision and Control

子模优化及其在决策与控制中的应用

Shamak Dutta, Bahman Gharesifard, Stephen L. Smith

专题命中 多智能体 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 本文综述子模集函数的理论、算法及其在决策与控制中的应用,重点介绍基于贪心算法的近似保证和曲率、子模比等结构性质,并涵盖传感器调度、多智能体协调等应用场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08529 2026-06-09 cs.AI cs.CL cs.LG 新提交 75%

Scaffold Effects on GAIA: A Controlled Comparison

脚手架对GAIA的影响:一项受控比较

Jason Starace

机构 * Independent Researcher(独立研究员)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 通过受控实验比较三种脚手架(ReAct、多智能体设计、规划-执行)对五个模型在GAIA验证集上的影响,发现脚手架选择可导致准确率差异高达28个百分点,且模型能力越强对脚手架依赖性不一定越低。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07810 2026-06-09 cs.CL cs.AI cs.LG 新提交 75%

SLMJury: Can Small Language Models Judge as Well as Large Ones?

SLMJury:小型语言模型能否像大型模型一样进行评判?

Anish Laddha, Nitesh Pradhan, Gaurav Srivastava

机构 * LNMIIT Virginia Tech(弗吉尼亚理工大学)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出SLMJury框架,评估小型语言模型作为评判者的能力,发现领域依赖的过度思考效应、领域泛化差异、闭端与开端评判能力分离,以及多智能体辩论降低准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12363 2026-08-14 econ.GN cs.AI cs.CY cs.LG cs.MA cs.SY eess.SY q-fin.EC 新提交 73%

EU-ETS under attack? The impact of carbon price suppression on the decarbonization of the power sector

欧盟碳排放交易体系面临冲击?碳价抑制对电力部门脱碳的影响

Javier Gonzalez-Ruiz, Carlos Rodriguez-Pardo, Alice Di Bella, Paolo Mastropietro, Jose Pablo Chavez-Avila, Massimo Tavoni

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文以意大利2026年《Decreto Bollette》法案为案例,采用MARLEY框架评估碳价抑制对电力部门脱碳的影响,发现该政策短期降本但长期减排效果差,仅在高绿色投资支持下可避免排放上升,却需采用与干预初衷矛盾的混合市场范式。

Comments 58 pages, 12 figures, 12 tables. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11624 2026-08-13 cs.CL cs.AI 新提交 73%

Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs

学习说服暴露了大语言模型(LLMs)放弃正确信念的难易程度

Nimet Beyza Bozdag, Emre Can Acikgoz, Gokhan Tur, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 研究发现优化后的对抗性说服策略可轻易让LLMs放弃正确信念,攻击成功率高且可迁移,凸显多智能体决策系统需将说服鲁棒性作为安全标准

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10526 2026-08-12 cs.LG cs.AI 新提交 73%

Coordinating the Unknown Lipschitz Constant in Multiplayer Bandits

协调多人老虎机中的未知利普希茨常数

Ricardo Parada, Chenzhang Zhao, William Chang

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 针对连续动作空间中利普希茨常数未知的协作多智能体老虎机问题,设计适配三种信息结构的算法,证明共享奖励或可观测动作可免费达成离散化一致性,否则通过抖动量化估计值达成且不增加悔的主阶成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09861 2026-08-11 cs.AI cs.CL cs.CV 新提交 73%

Towards Expert-level Medical AI for Real-time Video Consultations

面向专家级的实时视频问诊医疗AI

Mahvish Nagda, Jihyeon Lee, Matthew Thompson, Chunjong Park, Tim Strother, Valentin Liévin, Roma Ruparel, Akshay Goel, Teya Bergamaschi, Suhana Bedi, Meet Shah, Pavel Dubov, Liviu Panait, Toshiyuki Fukuzawa, Sam Schmidgall, Craig Schiff, Joseph Xu, Aliya Rysbek, Yana Lunts, Jan Freyberg, Rebecca Hemengway, Sunny Virmani, David Racz, Carey Radebaugh, Joëlle Barral, Kavi Goel, Dale R. Webster, Katherine Chou, Avinatan Hassidim, Yossi Matias, James Manyika, Gregory Wayne, Tao Tu, Yun Liu, Ethan Goh, Christina Chen, Ryutaro Tanno, Po-Hsuan Cameron Chen, Mike Schaekermann, Anil Palepu

机构 * Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究开发了基于Gemini的多智能体系统AMIE(视频版),在随机OSCE研究中其临床问诊表现与初级保健医生相当或更优,为专家级实时视频问诊医疗AI的发展奠定了重要基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08100 2026-08-11 cs.CR cs.AI cs.LG 新提交 73%

Defending Retrieval-Augmented Intrusion Detection Against Knowledge Poisoning and Prompt Injection

防御检索增强型入侵检测系统免受知识投毒与提示注入攻击

Kaysarul Anas Apurba, Md. Hasibul Hasan, Mahedee Zaman Moon, Sk. Md. Mizanur Rahman, Atsuo Inomata

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RAG-IDS三层多智能体入侵检测框架,通过软信任评分、LECC和提示净化的检索边界防御,可在知识投毒与提示注入攻击下恢复分类质量,在CIC-UNSW-NB15数据集上表现出良好的防御效果。

Comments 14 pages with Appnedix, 11 figures. Submitted to IEEE CIC 2026, Research Track (double-blind review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07688 2026-08-11 cs.AI cs.CL cs.CR cs.HC cs.MA 新提交 73%

IntelliAudit: Using Large Language Models to Evaluate Audit Controls

IntelliAudit:使用大语言模型评估审计控制

Allison Wilson, Sina Moradi Sabet, Diar Shakimov, Panteha Shahrivar, Mohammad Reza Bagheri, Dean Konenkamp, Mohammad A. Tayebi

机构 * Coca-Cola(可口可乐公司) Telus(德达斯电信公司)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出基于检索的多智能体系统IntelliAudit,用于辅助IT审计证据评估,在ISO/IEC 27001上的评估显示其可支持审计工作,需作为决策支持工具使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07642 2026-08-11 cs.AI cs.LG cs.MA 新提交 73%

Contextual Value Alignment via Multilayer Combinatorial Fusion

基于多层组合融合的上下文价值对齐

Yuanhong Wu, Djallel Bouneffouf, D. Frank Hsu

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出MCF-CVA框架,通过多层组合融合及EAR算法,结合多道德智能体的认知多样性缓解冲突冗余,在标准指标上优于单智能体等基线,提升LLM的上下文价值对齐能力。

Comments 12 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04524 2026-08-06 cs.CL cs.LG 新提交 73%

ODRA: Synthesizing Cognitive Behavioral Therapy Sessions with Structured Chain-Of-Thought and Dynamic Patient Resistance

ODRA:结合结构化思维链与动态患者阻抗的认知行为治疗会话合成

Javier Rodriguez-Juan, Hiba Arnaout, Jose Garcia-Rodriguez, David Tomás, Iryna Gurevych

机构 * University of Alicante(阿利坎特大学) Technische Universität Darmstadt(达姆施塔特工业大学) Hessian Center for AI (hessian.AI)(黑森人工智能中心)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出ODRA框架,结合结构化思维链与动态患者阻抗建模合成CBT会话,解决现有方法的顺从性问题,其生成的会话及微调数据集可提升下游治疗性能。

Comments 39 pages, 23 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02641 2026-08-05 cs.SE cs.AI 新提交 73%

IR2Solve: Structured Intermediate Representations for Cost-Efficient Optimization Autoformulation

IR2Solve:面向成本高效优化自动建模的结构化中间表示

Penglin Zhu, Linhai Zhang, Jungang Xu, Xinchi Wei, Xiuqi Wu

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 IR2Solve以结构化中间表示为核心构建优化自动建模流水线,仅用1次LLM语义调用,在保证目标函数正确性的同时大幅降低推理成本,性能优于Chain-of-Experts和SAC-Opt等系统。

Comments 17 pages, 3 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01193 2026-08-04 cs.AI cs.CY cs.GT cs.LG cs.MA 新提交 73%

Humans Are More Diverse: Frontier LLMs Show Extreme Policies in Idealised AI Development Races

人类更多样化:前沿大语言模型(LLM)在理想化AI开发竞赛中表现出极端策略

Phu Hoa Pham, Duy Minh Dao Sy, Trung Kiet Huynh, Phu Quy Nguyen Lam, Chi Nguyen Tran, Minh Trung Le, Phong Hao Le, Dinh Nam Nguyen, Thien Ky Nguyen Dong, Elias Fernandez Domingos, Le Hong Trang, The Anh Han

机构 * Ho Chi Minh City University of Science(胡志明市科学大学) Vietnam National University Ho Chi Minh City (VNU-HCM)(越南国家大学胡志明市分校) Ho Chi Minh City University of Technology (HCMUT)(胡志明市技术大学(HCMUT))

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究通过多智能体博弈实验对比前沿LLM与人类在AI开发竞赛中的策略,发现LLM行动具模型特异性,需有效性检查才能判定其策略性与安全意识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01133 2026-08-04 cs.LG cs.AI 新提交 73%

Policy Optimality Measurement for Multi-Vehicle Decision-Making: From Extrinsic Indicators to Intrinsic Quality

多智能体决策的策略最优性测量:从外在指标到内在质量

Ye Han, Lijun Zhang, Dejian Meng

机构 * School of Automotive Studies, Tongji University(同济大学汽车学院)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对自动驾驶多智能体强化学习策略的黑箱评估问题,提出基于MCTS的信息论诊断框架,构建策略最优性评分以精准暴露策略缺陷,为内在多智能体策略质量提供严格基准标准。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28176 2026-07-31 cs.SE cs.AI 新提交 73%

Integrating AI into Requirements Quality Learning in Software Engineering Education: A TPACK-Guided Empirical Study

将人工智能融入软件工程教育中的需求质量学习:一项基于TPACK的实证研究

Hansika Ekanayake Mudiyanselage, Rohan Jai Dharmaraj, Malik Abdul Sami, Zheying Zhang

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究针对软件工程教育中AI融入需求质量学习的需求,基于TPACK框架将多智能体AI工具融入硕士级RE作业,通过混合方法验证了其在提升学生需求质量认知等方面的作用,为相关AI融入设计提供了指导。

Comments 11 pages, 6 figures, 3 tables, presented in the 38th CSEE&T in Florence, Italy, from July 20-22, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26220 2026-07-30 cs.SE cs.AI 新提交 73%

Model-Driven Requirements Configuration with Three-Valued Uncertainty Scoring

基于三值不确定性评分的模型驱动需求配置

Ahmed Ibrahim

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出神经符号多智能体架构结合三值评分框架,消除LLM生成需求的结构不一致性,在37个项目愿景中实现94.6%的结构一致性消除,为LLM在需求工程中的安全部署提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25140 2026-07-29 cs.AI cs.CL cs.GR cs.MA 新提交 73%

How Affect Propagates among LLM Agents: Emergent Emotional Contagion in Crowd Simulation

情感如何在大语言模型智能体之间传播:人群模拟中的涌现情感传染

Funda Durupinar

机构 * University of Massachusetts(马萨诸塞大学)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 研究多智能体人群模拟中情感传播,通过感知 - 评估 - 表达循环及借鉴相关模型构建架构,在多场景评估,揭示情感传染动态,包括警报扩散、个性影响等,还发现评估步骤动态依赖后端。

Comments 31 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25108 2026-07-29 cs.CV cs.AI cs.LG eess.IV 新提交 73%

OPERA: Offline Policy-guided Expert Routing and Adaptation for Universal Biomedical Image Analysis

OPERA:用于通用生物医学图像分析的离线策略引导专家路由与适应

Zihan Li, Feiyang Liu, Dandan Shan, Ruibo Wang, Qingqi Hong

机构 * University of Washington(华盛顿大学) Delft University of Technology(代尔夫特理工大学) Xiamen University(厦门大学)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 研究针对生物医学图像分析中分布变化阻碍模型部署的问题,提出OPERA多智能体集成框架,通过离线策略学习专家权重分配,结合多种机制协调智能体,经多数据集评估,有效提升性能与校准质量,为可部署生物医学AI提供实用路径。

Comments Accepted by ACM MM 2026. 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21488 2026-07-24 cs.LG cs.AI cs.MA cs.RO 新提交 73%

Compact Latent Coordination for Autonomous Vehicles at Unsignalized Intersections

无信号交叉口自动驾驶车辆的紧凑潜在协调

Gil Lifshits, Igal Bilik, Gilad Katz

机构 * Ben-Gurion University of the Negev(内盖夫本古里安大学)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 针对无信号交叉口自动驾驶车辆协调难题提出MAPS分层DRL架构,主智能体生成编码全局策略的原型计划,工作智能体结合局部观测执行控制。实验表明MAPS能实现无碰撞导航、减少行驶时间,且原型计划泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17531 2026-07-21 cs.CL cs.AI 新提交 73%

Oracle Gap and Signal Fidelity: A Fixed-Pool Diagnostic for Test-Time Collaboration

预言机差距与信号保真度:一种用于测试时协作的固定池诊断方法

Jie Hu

机构 * Research Institute of China Telecom(中国电信研究院)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 研究测试时协作收益不均衡问题,将固定候选池选择器或验证器净收益分解为可测量因素,通过实验表明收益受预言机差距和信号保真度限制,框架可在协作前进行预部署诊断,估计相关指标。

Comments 13 pages, 2 figures, 8 tables. Code: https://github.com/AmGarfield/OracleGap

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17266 2026-07-21 cs.CL cs.AI 新提交 73%

Debate-on-Graph: Reliable and Adaptive Reasoning of Large Language Model on Uncertain Knowledge Graph

图上辩论:大语言模型在不确定知识图谱上的可靠且自适应推理

Peiji Yu, Xin Chen, Tianxing Wu

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University)(教育部新一代人工智能技术及其跨学科应用重点实验室(东南大学))

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 研究大语言模型在不确定知识图谱上问答时的问题,提出Debate-on-Graph框架,设计启发式搜索算法提取子图并引入多智能体辩论机制,经实验验证该框架能实现可靠且自适应推理,性能优于现有方法。

Comments 18 pages, Accepted by ECML-PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16388 2026-07-21 cs.MA cs.AI cs.SE 新提交 73%

Automated Hardware Validation Test Plan Generation for Large Scale AI Datacenter Platforms Using a Generative AI Multi-Agents Architecture

使用生成式人工智能多智能体架构为大规模人工智能数据中心平台生成自动化硬件验证测试计划

Mohammed-Khalil Ghali, Saurabh Kulkarni, Prathamesh Kulkarni, Rohan Kulkarni, Sangwon Yoon, Daehan Won

机构 * School of Systems Science and Industrial Engineering, Binghamton University, State University of New York(系统科学与工业工程学院,宾夕法尼亚州立大学布林茅尔分校) Meta Platforms, Inc.(Meta平台公司)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 针对大规模人工智能数据中心平台硬件验证测试计划手动编写的问题,提出基于生成式人工智能多智能体架构,依据自愈验证文档和物料清单自动生成测试计划,提高了覆盖范围、编写效率和可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16262 2026-07-21 cs.LG cs.AI 新提交 73%

Autonomous mechanistic discovery of colorectal cancer vulnerabilities via multi-scale AI swarms

通过多尺度人工智能群体自主进行结直肠癌脆弱性的机制发现

Christopher Baker, Tianyu Ren, Karen Rafferty, Hui Wang, Simon McDade

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 研究旨在解决自动化科学发现中语言模型与生物物理的认知差距。通过多尺度自主发现引擎Octopus,结合大语言模型群体和算法物理引擎,针对结直肠癌转录组进行无监督扫描,发现IGF2是5-氟尿嘧啶耐药脆弱性,建立了可验证的生物医学发现范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12723 2026-07-15 cs.CR cs.AI cs.SE 新提交 73%

Bulkhead: Automated Semantic Detection and Remediation of Container Escape Vulnerabilities

舱壁:容器逃逸漏洞的自动语义检测与修复

Qiyuan Fan, Zhi Li, Junjie Li, XiaoFeng Wang, Bin Yuan, Deqing Zou

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 研究容器逃逸漏洞,提出舱壁框架,集成大语言模型与形式化方法,利用多智能体系统通过多维知识模式识别修复漏洞,检测管道找漏洞并生成利用程序,补丁管道验证确保修复正确。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12216 2026-07-15 cs.CL cs.AI cs.MA 新提交 73%

RCWT: Measuring Task-Budget Displacement from Coordination Content in LLM Calls

RCWT:从大语言模型调用中的协调内容测量任务预算位移

Brenda Lelis, Rodrigo Cabral-Carvalho

机构 * CloudWalk, Inc.(云从科技集团股份有限公司)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 研究多智能体和内存增强大语言模型中协调内容占用任务预算的问题,提出RCWT测量协议,通过改变协调内容等控制变量进行实验,发现模型表现受影响,该测试是上下文分配预算测量原语,但非多智能体收益等完整理论。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07729 2026-07-10 cs.MA cs.AI cs.CL 新提交 73%

Collective Intelligence with Foundation Models

基于基础模型的集体智能

J. de Curtò, I. de Zarzà

机构 * Department of Computer Applications in Science \& Engineering, BARCELONA Supercomputing Center, 08034 Barcelona, Spain Escuela Técnica Superior de Ingeniería (ICAI), Universidad Pontificia Comillas, 28015 Madrid, Spain Human Centered AI, Data \& Software, LUXEMBOURG Institute of Science

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 研究如何将多个基础模型协调成合作推理系统,提出多智能体框架,含求解器、批评和聚合智能体及评分模块。通过消融研究比较四种配置,发现模型异质性是性能提升关键,能提高逐步准确率、降低方差,还讨论了相关原则、方法及对应用人工智能的影响。

Comments Accepted as a book chapter in "Advances in Global Applied Artificial Intelligence" (G. A. Tsihrintzis, M. Virvou, N. G. Bourbakis, L. C. Jain, Eds.), authenticated version will be published in Springer series: Learning and Analytics in Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02802 2026-07-07 cs.CL cs.AI 新提交 73%

Seduced by the Narrative: Assessing Rule Adherence in Semi-Open Textual Sandboxes

被叙事诱惑:评估半开放文本沙盒中的规则遵守情况

Weiying Chen, Junlong Shen, Zhanyuan Guo, Xiaoou Zhou

机构 * University of Alberta(阿尔伯塔大学) Qilu University of Technology(齐鲁工业大学) N-Dice Association(N-Dice协会)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 研究在半开放文本游戏环境中,当用户意图与系统规则冲突时大语言模型的规则遵守问题。基于桌面角色扮演游戏机制构建多智能体对抗基准CoC-Seduce,用前沿模型生成样本,对20个目标裁决器进行基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30911 2026-07-02 cs.AI cs.LG cs.MA 新提交 73%

Why Solve It Twice? Hierarchical Accumulation of Skills for Transfer-Efficient ML Engineering

为何解决两次?面向迁移高效机器学习工程的层次化技能积累

Yongbin Kim, Yashar Talebirad, Osmar R. Zaiane

机构 * Department of Computing Science, University of Alberta(阿尔伯塔大学计算机科学系) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所)

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 提出HASTE层次化多智能体系统,通过三级范围(全局、领域、竞赛特定)组织跨竞赛知识,在MLE-Bench Lite基准上实现77.3%奖牌率,冷启动相比热启动减少52%迭代次数。

Comments 19 pages. Accepted to the 5th Workshop on Deep Learning for Code (DL4C), ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27909 2026-06-29 cs.CL cs.AI cs.GT cs.MA 新提交 73%

Triadic Werewolf: A Jester Role for Multi-Hop Theory of Mind in LLMs

三狼人杀:大型语言模型中多跳心智理论的丑角角色

Avni Mittal

专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 通过引入第三阵营“丑角”(Jester),将狼人杀游戏扩展为三方博弈,测试LLM的多跳心智理论能力。实验表明,模型常做出自毁行为,而自我学习能帮助部分模型学会微妙策略。

详情

展开后加载摘要…

URL PDF HTML 收藏