arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3024 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 3024 篇

2604.26340 2026-04-30 cs.LG 57%

Adaptive and Fine-grained Module-wise Expert Pruning for Efficient LoRA-MoE Fine-Tuning

自适应和细粒度模块级专家剪枝用于高效的LoRA-MoE微调

Weihang Li, Jianchun Liu, Hongli Xu

机构 * School of Computer Science and Technology, University of Science and Technology of China, China(计算机科学与技术学院,中国科学技术大学) Suzhou Institute for Advanced Research, University of Science and Technology of China, China(苏州先进研究院,中国科学技术大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出DMEP框架,通过动态模块级专家剪枝优化LoRA-MoE微调,减少冗余参数并提升训练效率,实验表明在多个推理基准上参数减少35%-43%,训练吞吐量提升约10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03467 2026-04-30 cs.AI cs.HC 57%

The Dual Role of Abstracting over the Irrelevant in Symbolic Explanations: Cognitive Effort vs. Understanding

抽象在符号解释中的双重作用:认知努力与理解

Zeynep G. Saribatur, Johannes Langer, Ute Schmid

机构 * Institute of Logic and Computation, TU Wien(逻辑与计算研究所,维也纳技术大学) Cognitive Systems, University of Bamberg(认知系统,巴姆伯格大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨形式抽象(去除与聚类)对人类推理表现和认知努力的影响,发现聚类提升理解,去除降低认知负担,支持抽象增强人中心符号解释的假设。

Comments To appear in the Proceedings of the 48th Annual Meeting of the Cognitive Science Society (CogSci 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25684 2026-04-29 cs.AI 57%

Think Before You Act -- A Neurocognitive Governance Model for Autonomous AI Agents

在行动前思考--一种用于自主AI代理的神经认知治理模型

Eranga Bandara, Ross Gore, Asanga Gunaratna, Sachini Rajapakse, Isurunima Kularathna, Ravi Mukkamala, Sachin Shetty, Xueping Liang, Amin Hass, Tharaka Hewa, Abdul Rahman, Christopher K. Rhea, Anita H. Clayton, Preston Samuel, Atmaram Yarlagadda

机构 * Old Dominion University(老奥德纳大学) AI Motion Labs(AI运动实验室) Department of Psychiatry and Neurobehavioral Sciences(精神病学与神经行为科学系) University of Virginia School of Medicine(弗吉尼亚大学医学院) Florida International University(佛罗里达国际大学) Accenture Technology Labs(埃森哲技术实验室) Center for Wireless Communications(无线通信中心) University of Oulu(奥卢大学) Blanchfield Army Community Hospital(布莱恩菲尔德陆军社区医院) McDonald Army Health Center(麦克唐纳陆军健康中心)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种神经认知治理框架,通过将人类自我治理过程映射到LLM驱动的代理推理中,实现95%的合规准确率和零人工监督升级,展示嵌入治理的代理推理能产生更一致、可解释和可审计的合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24429 2026-04-28 cs.CL 57%

A Multi-Dimensional Audit of Politically Aligned Large Language Models

对政治倾向大型语言模型的多维审计

Lisa Korver, Mohamed Mostagir, Sherief Reda

机构 * Brown University(布朗大学) University of Michigan(密歇根大学) Ross School of Business(罗斯商学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于哈贝马斯沟通行动理论的多维框架,评估政治倾向语言模型在有效性、公平性、真实性及说服力四方面的表现,揭示大模型在政治角色扮演中更有效但更偏颇的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21282 2026-04-24 cs.CR cs.LG cs.SE 57%

Strategic Heterogeneous Multi-Agent Architecture for Cost-Effective Code Vulnerability Detection

战略异构多智能体架构用于高效代码漏洞检测

Zhaohui Geoffrey Wang

机构 * University of Southern California(南加州大学)

专题命中 逻辑推理 :verifier(abstract);分类 cs.LG

AI总结 本文提出一种基于博弈论的异构多智能体架构,结合云上大语言模型专家与本地轻量验证器,通过三重专家并行分析与对抗验证,实现高效且高精度的代码漏洞检测,实验显示其在精度和召回率上均优于现有方法。

Comments 11 pages, 5 figures. Accepted at the AAMAS 2026 Workshop on Software Engineering (SE Workshop). This version corresponds to the preprint of the workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15468 2026-04-24 cs.SE cs.AI 57%

The Semi-Executable Stack: Agentic Software Engineering and the Expanding Scope of SE

半可执行堆栈:智能软件工程与SE范围的扩展

Robert Feldt, Per Lenberg, Julian Frattini, Dhasarathy Parthasarathy

机构 * Chalmers University of Technology(挑战者技术大学) Volvo Group(沃尔沃集团)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了软件工程领域因AI系统发展而扩展的范围,提出半可执行堆栈模型以分析可执行代码与非可执行 artifacts 的结合,通过三个案例研究重新定义工程目标,提供保留与净化的决策框架。

Comments This paper is the write-up of Robert Feldt's keynote "Agentic Software Engineering Will Eat the World: AI-Based Systems as the New Operating System of Society'' given at the Agentic Engineering 2026 workshop, Rio de Janeiro, Brazil, April 14, 2026. April 23 upload fixed the reference list to be more complete, and added a few additional citations; text essentially unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20136 2026-04-23 cs.CV cs.AI 57%

IMPACT-CYCLE: A Contract-Based Multi-Agent System for Claim-Level Supervisory Correction of Long-Video Semantic Memory

IMPACT-CYCLE:一种基于合同的多智能体系统,用于长视频语义记忆的层次级监督修正

Weitong Kong, Di Wen, Kunyu Peng, David Schneider, Zeyun Zhong, Alexander Jaus, Zdravko Marinov, Jiale Wei, Ruiping Liu, Junwei Zheng, Yufan Chen, Lei Qi, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) INSAIT ETH Zurich(苏黎世联邦理工学院) Technical University of Munich(慕尼黑技术大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出IMPACT-CYCLE,通过多智能体系统实现长视频语义记忆的层次级监督修正,提升下游推理性能并降低人工仲裁成本。

Comments 7 pages, 2 figures, code are available at https://github.com/MKong17/IMPACT_CYCLE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20719 2026-04-23 cs.SD cs.AI cs.MM eess.AS 57%

ONOTE: Benchmarking Omnimodal Notation Processing for Expert-level Music Intelligence

ONOTE:面向专家级音乐智能的多模态记谱处理基准测试

Menghe Ma, Siqing Wei, Yuecheng Xing, Yaheng Wang, Fanhong Meng, Peijun Han, Luu Anh Tuan, Haoran Luo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ONOTE基准测试,通过确定性流程消除记谱系统偏差,揭示多模态模型在感知准确性和音乐理论理解间的根本分歧。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10386 2026-04-23 cs.LG 57%

Colorful Talks with Graphs: Human-Interpretable Graph Encodings for Large Language Models

图的丰富多彩对话:用于大语言模型的人类可解释图编码

Angelo Zangari, Peyman Baghershahi, Sourav Medya

机构 * University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出一种将图结构直接注入自然语言提示的编码策略,通过将图结构转换为人类可理解的颜色标记,提升大语言模型处理图任务的能力,实验显示在合成和真实数据集上均取得显著改进。

Comments Accepted to ACL Findings 2026 22 pages, 18 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18913 2026-04-22 cs.CL 57%

LogosKG: Hardware-Optimized Scalable and Interpretable Knowledge Graph Retrieval

LogosKG:硬件优化的可扩展且可解释的知识图谱检索

He Cheng, Yifu Wu, Saksham Khatwani, Maya Kruse, Dmitriy Dligach, Timothy A. Miller, Majid Afshar, Yanjun Gao

机构 * LARK Lab, University of Colorado Anschutz(洛克拉克实验室,科罗拉多大学安施图茨分校) University of Colorado Boulder(科罗拉多大学波德分校) Loyola University Chicago(芝加哥洛克拉克大学) Harvard Medical School(哈佛医学院) Boston Children’s Hospital(波士顿儿童医院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 LogosKG通过符号知识图谱和硬件高效操作实现大规模知识图谱的多跳检索,提升效率与可解释性,展示出在生物医学知识与大语言模型推理对齐分析中的应用价值。

Comments Accepted to the ACL 2026 Main Conference. 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18616 2026-04-22 cs.DC cs.AI cs.PL 57%

ARGUS: Agentic GPU Optimization Guided by Data-Flow Invariants

ARGUS:通过数据流不变量指导的代理GPU优化

Haohui Mai, Xiaoyan Guo, Xiangyun Ding, Daifeng Li, Qiuchu Yu, Chenzhun Guo, Cong Wang, Jiacheng Zhao, Christos Kozyrakis, Binhang Yuan

机构 * CausalFlow Inc.(CausalFlow公司) HKUST(香港科技大学) Tsinghua University(清华大学) Stanford University(斯坦福大学) UCAS UC Riverside(UC河滨分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 ARGUS通过数据流不变量指导代理生成高效GPU内核,解决传统代理在关键计算任务中的性能不足问题,实现接近人工优化的性能和广泛的任务泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17988 2026-04-21 cs.CL 57%

Employing General-Purpose and Biomedical Large Language Models with Advanced Prompt Engineering for Pharmacoepidemiologic Study Design

利用通用和生物医药大语言模型与先进提示工程进行药事流行病学研究设计

Xinyao Zhang, Nicole Sonne Heckmann, Manuela Del Castillo Suero, Francesco Paolo Speca, Maurizio Sessa

机构 * Department of Drug Design and Pharmacology, University of Copenhagen(哥本哈根大学药物设计与药理学系)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文比较通用和生物医药大语言模型在药事流行病学研究设计中的表现,发现通用模型在相关性和逻辑性上表现更优,但提示策略对模型性能影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11182 2026-04-21 cs.CL 57%

MetaMem: Evolving Meta-Memory for Knowledge Utilization through Self-Reflective Symbolic Optimization

MetaMem: 通过自反思符号优化实现元记忆的进化以促进知识利用

Haidong Xin, Xinze Li, Zhenghao Liu, Yukun Yan, Shuo Wang, Cheng Yang, Yu Gu, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) School of Computer Science, Beijing University of Posts and Telecommunications, Beijing, China(北京邮电大学计算机学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MetaMem框架,通过自反思符号优化增强记忆系统,帮助LLM更有效地利用记忆知识。实验表明,MetaMem在多个任务中显著优于基线模型,提升超过3.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15736 2026-04-20 cs.CV cs.CL 57%

RefereeBench: Are Video MLLMs Ready to be Multi-Sport Referees

RefereeBench: 视频多模态大语言模型是否准备好成为多项目裁判

Yichen Xu, Yuanhang Liu, Chuhan Wang, Zihan Zhao, jinghan luo, Jianzhe Ma, Wenxuan Wang, Qin Jin

机构 * Renmin University of China(中国人民大学) Sichuan University(四川大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出RefereeBench,首个评估多模态大语言模型作为自动体育裁判的基准,通过11项运动925个视频和6475对问答,评估犯规存在、分类、推理、实体感知和时间定位能力,发现当前模型在规则应用和时间定位上表现不足。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03236 2026-04-17 cs.AI 57%

MAGMA: A Multi-Graph based Agentic Memory Architecture for AI Agents

MAGMA:一种基于多图的代理记忆架构用于AI代理

Dongming Jiang, Yi Li, Guanpeng Li, Bingzhe Li

机构 * Department of Computer Science, The University of Texas at Dallas(德克萨斯大学达拉斯分校计算机科学系) Department of Electrical and Computer Engineering, University of Florida(佛罗里达大学电气与计算机工程系)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 MAGMA通过多图结构实现记忆表示,提升长时序推理任务的性能,提供透明推理路径和细粒度检索控制。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08046 2026-04-16 cs.CL 57%

Guaranteeing Knowledge Integration with Joint Decoding for Retrieval-Augmented Generation

通过联合解码实现知识整合的检索增强生成

Zhengyi Zhao, Shubo Zhang, Zezhong Wang, Yuxi Zhang, Huimin Wang, Yutian Zhao, Yefeng Zheng, Binyang Li, Kam-Fai Wong, Xian Wu

机构 * The Chinese University of Hong Kong(香港中文大学) University of International Relations(国际关系大学) Tencent Jarvis Lab(腾讯Jarvis实验室) Westlake University(西湖大学) Ministry of Education Key Laboratory of High Confidence Software Technologies, CUHK(教育部高可信软件技术重点实验室,香港中文大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出GuarantRAG框架,通过分离推理与证据整合,提升检索增强生成的准确性和事实性,实验显示在五个问答基准上准确率提升12.1%,幻觉减少16.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13346 2026-04-16 cs.CL 57%

AgentSPEX: An Agent SPecification and EXecution Language

AgentSPEX:一种代理规范与执行语言

Pengcheng Wang, Jerry Huang, Jiarui Yao, Rui Pan, Peizhi Niu, Yaowenqi Liu, Ruida Wang, Renhao Lu, Yuwei Guo, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Baylor College of Medicine(贝勒医学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出AgentSPEX,一种用于定义LLM代理工作流的显式控制流和模块化结构的语言,支持类型步骤、分支、循环、并行执行和显式状态管理,并提供可定制的代理框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06921 2026-04-16 cs.CR cs.AI 57%

Neuro-Symbolic AI for Cybersecurity: State of the Art, Challenges, and Opportunities

神经符号AI在网络安全中的应用:现状、挑战与机遇

Safayat Bin Hakim, Muhammad Adil, Alvaro Velasquez, Shouhuai Xu, Houbing Herbert Song

机构 * Department of Information Systems, University of Maryland, Baltimore County(信息系统系,马里兰大学巴尔的摩分校) Department of Computer Science and Engineering, University at Buffalo(计算机科学与工程系,布法罗大学) Department of Computer Science, University of Colorado Boulder(计算机科学系,科罗拉多大学博尔德分校) Laboratory for Cybersecurity Dynamics, Department of Computer Science, University of Colorado Colorado Springs(网络安全动力实验室,科罗拉多大学科罗拉多斯普林斯分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文综述了神经符号AI在网络安全中的应用,分析了103篇文献,指出多智能体和结构化集成架构在复杂场景中表现更优,因果推理能提升防御能力,知识引导学习提高效率和可解释性,但评估标准化和人机协作仍是挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19378 2026-04-16 cs.CL 57%

TableMaster: A Recipe to Advance Table Understanding with Language Models

TableMaster: 一种提升语言模型表格理解能力的方案

Lang Cao, Hanbing Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出TableMaster方案,通过提取表格内容并增强语义上下文,结合自适应推理方法,提升语言模型对表格数据的理解能力,实验表明其在WikiTQ数据集上准确率达78.13%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04850 2026-04-15 physics.chem-ph cs.AI cs.MA 57%

El Agente Quntur: A research collaborator agent for quantum chemistry

El Agente Quntur:一种用于量子化学研究的协作代理

Juan B. Pérez-Sánchez, Yunheng Zou, Jorge A. Campos-Gonzalez-Angulo, Marcel Müller, Ignacio Gustin, Andrew Wang, Han Hao, Tsz Wai Ko, Changhyeok Choi, Eric S. Isbrandt, Mohammad Ghazi Vakili, Hanyong Xu, Chris Crebolder, Varinia Bernales, Alán Aspuru-Guzik

机构 * University of Toronto(多伦多大学) Vector Institute for Artificial Intelligence(向量人工智能研究所) Canadian Institute for Advanced Research (CIFAR)(加拿大高级研究 institute) NVIDIA Institute of Medical Science(医学科学研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出El Agente Quntur,一种多代理AI系统,旨在通过推理驱动决策和指导深度研究,提升量子化学计算工具的可访问性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16771 2026-04-14 cs.SE cs.LG 57%

Enabling Global, Human-Centered Explanations for LLMs:From Tokens to Interpretable Code and Test Generation

使大语言模型具备全球、以人为本的解释能力:从token到可解释的代码和测试生成

Dipin Khati, Daniel Rodriguez-Cardenas, David N. Palacio, Alejandro Velasco, Michele Tufano, Denys Poshyvanyk

机构 * Microsoft(微软) Google(谷歌)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出code rationales框架,通过将token级解释映射到高层编程类别,实现大语言模型代码生成的全局可解释性,验证了其在减少解释不确定性方面的有效性。

Comments Accepted to ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09308 2026-04-13 cs.AI 57%

Constraint-Aware Corrective Memory for Language-Based Drug Discovery Agents

基于约束的纠正记忆:用于基于语言的药物发现代理

Maochen Sun, Youzhi Zhang, Gaofeng Meng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文提出CACM框架,通过精确的集合级诊断和简洁的记忆写回机制,提升语言基药物发现代理的可靠性,实验表明其在目标级成功率提升36.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09075 2026-04-13 cs.CL 57%

Hierarchical Alignment: Enforcing Hierarchical Instruction-Following in LLMs through Logical Consistency

层级对齐:通过逻辑一致性在LLM中强制执行层级指令遵循

Shu Yang, Zihao Zhou, Di Wang, Wenda Li

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) University of Liverpool(利物浦大学) University of Edinburgh(爱丁堡大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出NSHA方法,通过显式建模和执行指令优先级,解决LLM在多指令环境下保持一致性与安全性的挑战,提升任务性能和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08762 2026-04-13 cs.CV cs.AI 57%

InstrAct: Towards Action-Centric Understanding in Instructional Videos

InstrAct:迈向指令视频中的动作中心理解

Zhuoyi Yang, Jiapeng Yu, Reuben Tan, Boyang Li, Huijuan Xu

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Microsoft Research(微软研究院) Nanyang Technological University(南洋理工大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出InstrAction框架,通过数据驱动策略和辅助目标提升指令视频中动作识别与建模,建立InstrAct基准测试集,优于现有视频基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08245 2026-04-10 cs.AI 57%

From Phenomenological Fitting to Endogenous Deduction: A Paradigm Leap via Meta-Principle Physics Architecture

从现象拟合到内生推导:通过元原理物理架构实现范式跃迁

Helong Hu, HongDan Pan, ShuiQing Hu

机构 * Guangdong Ocean University(广东海洋大学) Maoming Administrative Service Center(茂名市行政服务中心) China Pacific Insurance (Group) Co., Ltd. Foshan Branch(中国太平洋保险(集团)股份有限公司佛山分公司)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过元原理物理架构将现象拟合与内生推导结合,提升物理推理、数学任务和逻辑任务性能,同时降低验证困惑度,展现原理嵌入设计的鲁棒性和可解释性。

Comments 23 pages, 4 figures, 11 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16750 2026-04-10 cs.LG 57%

Interpretable Clinical Classification with Kolmogorov-Arnold Networks

可解释的临床分类与科拉莫戈罗夫-阿诺德网络

Alejandro Almodóvar, Patricia A. Apellániz, Alba Garrido, Fernando Fernández-Salvador, Santiago Zazo, Juan Parras

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出基于科拉莫戈罗夫-阿诺德网络的可解释性临床分类方法,通过Logistic KAN和KAAM模型在多个公开数据集上验证了其在预测性能和临床透明度上的优势。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07752 2026-04-10 cs.SE cs.AI 57%

MIMIC-Py: An Extensible Tool for Personality-Driven Automated Game Testing with Large Language Models

MIMIC-Py:一种基于人格驱动的大型语言模型自动游戏测试工具

Yifei Chen, Sarra Habchi, Lili Wei

机构 * Electrical and Computer Engineering, McGill University(麦吉尔大学电气与计算机工程系)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 MIMIC-Py通过模块化架构实现人格驱动LLM代理的可重用性和扩展性,支持多种交互机制,降低新游戏环境部署难度。

Comments 10 pages, Accepted by FSE Companion '26, July 5--9, 2026, Montreal, QC, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07007 2026-04-09 cs.MA cs.AI cs.CY 57%

AgentCity: Constitutional Governance for Autonomous Agent Economies via Separation of Power

AgentCity:通过权力分离实现自主代理经济的宪法治理

Anbang Ruan, Xing Zhang

机构 * NetX Foundation(NetX 基金会)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文提出通过权力分离模型,在区块链上实现自主代理经济的宪法治理,通过智能合约、确定性软件和人类裁决三者分离,解决代理社会逻辑垄断问题,实现人类意图与集体行为的对齐。

Comments 111 pages, 11 figures, 19 tables, 67 references. Pre-registered experimental design

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06633 2026-04-09 cs.CR cs.CL cs.SE 57%

Argus: Reorchestrating Static Analysis via a Multi-Agent Ensemble for Full-Chain Security Vulnerability Detection

Argus:通过多智能体集合重新编排静态分析以实现全链路安全漏洞检测

Zi Liang, Qipeng Xie, Jun He, Bohuan Xue, Weizheng Wang, Yuandao Cai, Fei Luo, Boxian Zhang, Haibo Hu, Kaishun Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) HKUST(香港科技大学) SF Express(顺丰速运) Great Bay University(大湾区大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 Argus通过多智能体框架提升静态分析效率,结合RAG和ReAct技术减少漏洞误报,发现更多真实漏洞并降低运营成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06629 2026-04-09 cs.MA cs.AI cs.RO 57%

Logical Robots: Declarative Multi-Agent Programming in Logica

逻辑机器人:逻辑编程中的多智能体编程

Evgeny Skvortsov, Yilin Xia, Ojaswa Garg, Shawn Bowers, Bertram Ludäscher

机构 * Google LLC(谷歌公司) University of Illinois(伊利诺伊大学) Gonzaga University(贡扎加大学)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 Logical Robots通过逻辑编程语言Logica实现多智能体仿真平台,将观察映射到动作输出,实现低层反应控制与高层规划的结合。

Comments International Conference on Autonomous Agents and Multiagent Systems (AAMAS), May 25-29, 2026. Paphos, Cyprus

详情

展开后加载摘要…

URL PDF HTML 收藏