Reward-Free Evolving Agents via Pairwise Validator
通过成对验证器实现无奖励进化智能体
专题命中 多智能体 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 研究提出用成对验证器取代标量奖励设计,集成到三个自我进化引擎中,有自适应焦点和软Elo两种变体。该方法在多智能体和两种工件基质上多数设置下达到或超全奖励基线,无需标记成本,是替代每步奖励设计的有效方案。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
通过成对验证器实现无奖励进化智能体
专题命中 多智能体 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 研究提出用成对验证器取代标量奖励设计,集成到三个自我进化引擎中,有自适应焦点和软Elo两种变体。该方法在多智能体和两种工件基质上多数设置下达到或超全奖励基线,无需标记成本,是替代每步奖励设计的有效方案。
语言模型智能体之间的潜在通信:通道、对齐方式及文本的局限性
机构 * Constructor University(康斯坦丁大学)
专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.CL
AI总结 研究大语言模型智能体间潜在通信,构建三个通信通道,通过稀疏自编码器分析信息损失,经实验发现文本通信会丢失信息,潜在通道在跨语言概念任务上与文本通道匹配但未超,得出丢失特征多编码表面形式的结论,还指出明确潜在通信优势需更深入任务及分析框架。
协作多自主水下航行器系统的面向任务感知与隐蔽传输
机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机科学学院) ; School of Cyber Engineering, Xidian University(西安电子科技大学网络空间安全学院) ; Harbin Engineering University(哈尔滨工程大学) ; Department of Informatics and Telecommunications, National and Kapodistrian University of Athens(雅典国立卡波迪斯特里亚大学信息与电信系) ; KU 6G Research Center, Department of Computer and Information Engineering, Khalifa University(哈利法大学KU 6G研究中心计算机与信息工程系) ; CentraleSupelec, University Paris-Saclay(巴黎萨克雷大学中央理工学院) ; School of Electrical and Electronics Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院)
专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.LG
AI总结 针对水下隐蔽协作任务中AUV信息获取与通信问题,提出SVR-MARL框架,利用实际信息刻画信息效用,在通信和隐蔽约束下学习协作策略,通过案例研究证明其能提高协作效率、降低通信与暴露风险。
当机器人加入团队:机器人的采用与开源软件项目的制度架构
专题命中 多智能体 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 研究开源软件中机器人加入团队的问题,通过检查多个GitHub项目,衡量相关能力和结果,发现采用机器人后有更多协作等变化,虽非因果效应,但结果符合特定解释,即机器人可成社区社会基础设施一部分。
根因分析在实际遥测数据上能走多远?
专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 研究生产微服务故障根因分析难题,提出结构化多智能体RCA管道,性能超现有方法。引入反向推理智能体和自动规则挖掘管道,发现故障证据多,瓶颈在智能体推理能力,模型推理和领域知识是主要限制,进步需模型改进。
从简单奖励中揭示复杂的集体行为
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; WINDY Lab, School of Engineering, Westlake University(西湖大学工程学院风语实验室) ; Shanghai AI Laboratory(上海人工智能实验室) ; Max Planck Institute of Animal Behavior(马克斯·普朗克动物行为研究所) ; Department of Computer and Information Science, University of Konstanz(康斯坦茨大学计算机与信息科学系) ; Centre for the Advanced Study of Collective Behaviour, University of Konstanz(康斯坦茨大学集体行为高级研究中心) ; Department of Biology, University of Konstanz(康斯坦茨大学生物系)
专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 研究多智能体强化学习中简单奖励与复杂集体行为的关系,提出两阶段EEC解释框架及智能体响应图,通过合作与竞争两个任务验证,揭示了MARL策略背后隐藏的几何结构。
Comments Accepted by IROS 2026
CityBehavEx:一个可扩展且经过实证验证的基于大语言模型的城市模拟平台
机构 * UTFPR(巴拉那联邦理工大学) ; Inria(法国国家信息与自动化研究所) ; University of Toronto(多伦多大学)
专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.CL
AI总结 CityBehavEx平台针对基于大语言模型的城市模拟器扩展成本高和验证薄弱问题,结合人类出行模型与交叉编码器,实现大规模模拟,能生成更贴合现实的出行模式,还允许用户进行多种操作及验证。
Comments 10 pages, 3 figures
用于湍流减阻的闭环壁面控制器的无梯度学习
专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.LG
AI总结 研究湍流减阻的闭环壁面控制问题,采用进化策略(ES)在大型湍流通道上直接优化循环闭环控制器,ES控制器减阻约26%,超基于梯度的多智能体控制器及经典对立控制,且与二者在缓冲层轨迹不同、驱动相关对象有别。
在隐藏信息社交推理游戏中审计基于信念的大语言模型智能体
机构 * University of Melbourne(墨尔本大学)
专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 研究在9人狼人杀环境中评估大语言模型智能体的难题,构建可审计框架,通过1080场游戏实验发现主动信念条件下好人方结果更好,虽未明确信念内容作用机制,但框架有使效应可测等贡献,将外部信念定位为可审计认知基线。
Comments 29 pages, 8 figures, 3 tables. Preprint
全球导航卫星系统(GNSS)退化情况下学习到的小型无人机分离策略的运行时安全过滤
专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.LG
AI总结 研究在GNSS退化时小型无人机分离策略的运行时安全过滤问题,对比动作过滤和观测过滤两种方法,发现动作过滤安全改进小,观测过滤能减少近90%的空中碰撞且更稳健,表明保留策略决策权限更优。
Comments Accepted for publication at the 2026 IEEE/AIAA Digital Avionics Systems Conference (DASC). 9 pages, 8 figures
博弈论均衡与无政府价格的悖论
机构 * Google Deepmind(谷歌DeepMind)
专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.LG
AI总结 研究博弈论均衡与无政府价格的悖论,指出将多智能体学习简化为静态均衡和黑箱后悔分析存在问题,通过分析内部纳什均衡、拥堵博弈等情况揭示相关不足,并研究非原子极限下的均衡变化,强调需重新评估基于动态的最坏情况均衡框架。
WCog-VLA:用于端到端自动驾驶的双级世界认知视觉-语言-行动模型
机构 * Tongji University(同济大学) ; Nanyang Technological University(南洋理工大学)
专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 针对现有视觉-语言-行动模型在自动驾驶中存在的局限,提出双级世界认知的WCog-VLA框架,语义层统一认知推理,生成层引入新模型加速推理,构建数据集,实验证明该模型在NAVSIM基准测试中达到最优分数。
Comments 20 pages, 7 figures
重新思考大语言模型的代码性能基准测试
专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.SE
AI总结 研究重新审视大语言模型代码性能基准测试,发现现有测试存在局限。提出基于LLM的多智能体框架生成性能导向测试,能更好暴露运行时差异,在原始测试无显著差异的任务中,该框架生成的测试有显著改进,优于当前最优技术。
CARLA-GS:用于自动驾驶极端情况合成的解耦表示、推理和物理模拟
机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)
专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 研究自动驾驶极端情况合成问题,提出CARLA-GS模块化管道,解耦视觉表示、语义推理和物理执行并保持跨模块耦合,能从实际驾驶数据生成可编辑场景,经多智能体大语言模型推理等步骤,实现可控生成及逼真、时空一致的视频。
Video2Reaction:将视频映射到自然环境中的观众反应分布
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Dolby Laboratories(杜比实验室)
专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.LG
AI总结 研究旨在通过Video2Reaction数据集实现视频到观众反应分布预测,开发仅用开源语言模型的两阶段多智能体管道,建立基准,发现预训练模型零样本失败,微调可提升性能,但任务仍具挑战。
前沿语言模型智能体经济中的信息限制与吸引子动力学:一项预注册测试
机构 * Independent Researcher(独立研究者)
专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 该研究对前沿语言模型智能体小型经济体进行预注册实验,测试耦合多智能体系统的两个预测。通过实验验证了比例投注耦合经济体中一些信息论相关定律,同时发现残差缩放测试结果否定了平滑平均场模型假设,还发布了相关代码等资料。
Comments 15 pages. Preprint. Zenodo: https://doi.org/10.5281/zenodo.21185866. Companion synthesis: arXiv:2606.12502
通过基于大语言模型的智能体进行多阶段推理来检测导致漏洞的提交
专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.SE
AI总结 研究旨在检测导致漏洞的提交,提出基于大语言模型的多智能体框架VIC - RAGENT,利用多个专业智能体提供互补视角,通过多阶段推理过程完善候选漏洞,实验表明其性能优于基线,为VIC检测提供实用方案。
用于智能电网分布式稳定性控制的联邦物理基础强化学习
专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.LG
AI总结 研究智能电网暂态稳定性控制问题,提出FedPPO-PG框架,将其转化为协作多智能体强化学习问题,通过物理基础邻域、引导策略初始化和集中评论家等方法,在模拟中取得良好效果,减少稳定时间、降低控制功率且满足实时要求。
Comments Accepted at IEEE SmartGridComm 2026. This is the accepted manuscript version. The final published version will appear in IEEE Xplore
整合利他与公平偏好可在序列社会困境中促成高级相互合作
机构 * The University of Tokyo(东京大学)
专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 在多智能体强化学习中,诱导分布式智能体合作困难,尤其在社会困境中。本文设计整合利他与公平偏好的效用函数,在序列社会困境博弈中对比实验,表明该方法能成功实现相互合作,还探讨了偏好对智能体行为的影响。
大语言模型智能体的社交网络
机构 * Department of Computer Science(计算机科学系) ; Emory University(埃默里大学) ; School of Computer Science(计算机科学学院) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.LG
AI总结 研究大语言模型智能体群体中集体信念形成问题,介绍SNLA框架,该框架考虑智能体实际影响力,理论与实证验证窄注意力导致羊群效应,宽注意力在特定条件下恢复群体智慧行为。
AI原生游戏:综述与路线图
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Zhongguancun Academy(中关村学院) ; Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究所) ; School of Computer Science, McGill University, Montreal, Quebec, Canada(麦吉尔大学计算机科学学院) ; Game AI Research Group, Queen Mary University of London, London, United Kingdom(伦敦女王学院游戏人工智能研究组)
专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 本文定义AI原生游戏为运行时生成式AI构成核心循环的游戏,提出G/N分类法分析53个实例,指出核心设计问题是将语义开放性组织为稳定游戏玩法,并给出路线图。
平均场强化学习
机构 * Department of Operations Research and Financial Engineering & Program in Applied and Computational Mathematics, Princeton NJ 08544, USA(普林斯顿大学运筹学与金融工程系及应用与计算数学项目) ; Shanghai Frontiers Science Center of Artificial Intelligence and Deep Learning(上海人工智能与深度学习前沿科学中心;纽约大学上海数学科学研究院(NYU-ECNU);纽约大学上海) ; NYU-ECNU Institute of Mathematical Sciences at NYU Shanghai ; NYU Shanghai, 567 West Yangsi Road, Shanghai, 200126, People’s Republic of China
专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.LG
AI总结 通过平均场交互和共同噪声的大群体随机控制视角,介绍平均场强化学习,建立代表性智能体学习问题的概率、数学和控制理论框架,并分析表格Q学习和策略梯度方法。
ClawArena-Team: 语言模型智能体中子智能体编排与动态工作流的基准测试
机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) ; University of California, Berkeley(加州大学伯克利分校) ; University of California, Santa Cruz(加州大学圣克鲁兹分校)
专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 提出ClawArena-Team基准,通过41个多轮多模态多目录场景,评估单个LLM作为管理者编排子智能体的能力,发现管理瓶颈在于权限授予而非感知,且成本与质量解耦。
Comments 24 pages, 10 figures, website: https://www.clawarena.cc/
具有双边信息不对称的情境赌博机监督博弈
机构 * Stanford Graduate School of Business(斯坦福商学院)
专题命中 多智能体 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 研究AI代理运行时人类监督中的双边信息不对称问题,提出情境赌博机团队博弈模型,刻画了团队最优与短视规则之间的可避免伤害差距,并分析了动态学习与信号传递机制。
更好理解,理解更好
专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 提出一种比较认知逻辑,通过层级索引理解模态和比较连接词,建模不同智能体对命题的理解程度差异,并给出语义框架和完备性结果。
Comments In Proceedings AiML 2026, arXiv:2606.29444
Journal ref EPTCS 447, 2026, pp. 750-769
CSTrader: 社区驱动虚拟资产市场中基于语言的交易测试平台
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 提出CSTrader多智能体框架,通过集成异构信号、技术分析、流动性、事件和反转情绪等智能体,在CS2皮肤市场实现语言到交易的映射,在波动期取得7.58%累计收益并控制风险。
AI辅助研究中的校准转向:证据许可主张的概念与方法论框架
机构 * School of Life Science and Technology, Institute of Science Tokyo(东京科学大学生命科学与技术学院) ; Department of Computational Biology and Medical Sciences, Graduate School of Frontier Sciences, The University of Tokyo(东京大学前沿科学研究生院计算生物学与医学科学系)
专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.LG
AI总结 提出AI辅助研究中证据许可主张的概念与方法论框架,通过五个算子描述研究过程,强调校准作为管理科学断言权的机制,并区分不同语义类型。
Comments 42 pages, 4 figures. Companion code and synthetic simulation artifacts: https://github.com/Li-Hongmin/calibration-turn-ai-assisted-research
基于结构化自回归建模的长期交通仿真
机构 * The University of Hong Kong(香港大学)
专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 提出RosettaSim框架,利用大规模序列模型的归纳偏置和统计先验,通过结构化自回归流建模场景拓扑、智能体状态和生成意图,实现短期准确与长期稳定仿真;并引入基于检索的交通评估(RTE)解决长期评估难题。
Comments ECCV 2026 Accepted
DDIAgents: 机制条件上下文流用于药物相互作用预测
机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) ; Institute of Biomedical Engineering, University of Oxford(牛津大学生物医学工程研究所) ; Division of Emerging Interdisciplinary Areas, Hong Kong University of Science and Technology(香港科技大学新兴跨学科领域学部)
专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 提出DDIAgents多智能体框架,通过动态知识编排预测药物相互作用,减少无关信息并生成可解释推理,性能优于现有方法。
真相还是诡辩?LoFa:大语言模型对逻辑谬误鲁棒性的基准测试
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; South China University of Technology(华南理工大学)
专题命中 多智能体 :agent(abstract);multi-agent(abstract);分类 cs.CL
AI总结 提出LoFa基准,通过多智能体管道生成事实与谬误配对,结合多轮辩论框架评估LLM对逻辑谬误的鲁棒性,并设计LFR@k指标量化抵抗能力。
Comments Accepted to ACL 2026 Main. 33 pages (9 pages main text)