Benchmarking Requirement-to-Architecture Generation with Hybrid Evaluation
基于混合评估的软件需求到架构生成基准测试
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.SE
AI总结 本文提出R2ABench基准,包含真实软件项目及PRD和PlantUML图,通过多维混合评估框架评估生成架构,发现LLM在关系推理上存在不足,代码专用模型和代理框架各有优劣。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
基于混合评估的软件需求到架构生成基准测试
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.SE
AI总结 本文提出R2ABench基准,包含真实软件项目及PRD和PlantUML图,通过多维混合评估框架评估生成架构,发现LLM在关系推理上存在不足,代码专用模型和代理框架各有优劣。
机器人的微调:为机器设计的提示
机构 * University of Chicago(芝加哥大学)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 研究探讨了机器学习代理在互联网上的决策影响,通过结合经济学和计算机科学框架,发现机器学习模型在环境中自动调整信息呈现,从而提升预测能力,但对人类影响有限。
设计弹性——分布式连续体智能的主动推理
机构 * Department of Computer Systems and Sciences, Stockholm University(斯德哥尔摩大学计算机系统与科学系) ; Department of Information Engineering, University of Pisa(比萨大学信息工程系) ; Distributed Systems Group, TU Wien(维也纳技术大学分布式系统组)
专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI
AI总结 针对分布式计算连续体中设备故障问题,引入概率主动推理弹性代理,通过构建因果故障图、利用马尔可夫毯和自由能原理识别故障并主动推理修复,经理论验证其可靠有效。
激活引导用于不牺牲连贯性的对齐开放式生成
机构 * Tara Research ; Technical University of Munich(慕尼黑工业大学) ; Mila Quebec AI Institute(Mila魁北克人工智能研究所)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 本文提出激活引导方法,通过在生成过程中持续修正偏差激活,提升大模型的对齐性能,实验表明StTP和StMP在保持连贯性的同时更有效维护通用能力。
StatEval:大型语言模型在统计学中的综合基准
机构 * Shanghai University of Finance and Economics(上海财经大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL
AI总结 提出StatEval基准,包含10万+问题,覆盖本科到研究级统计推理,并开发TRACE管道和自适应评分方法,揭示LLM在基础任务上表现尚可但研究级推理薄弱。
从相似性到脆弱性:LLM语义缓存的密钥碰撞攻击
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 提出语义缓存存在密钥碰撞攻击风险,通过CacheAttack框架在黑盒条件下实现86%的LLM响应劫持命中率,并能在不同嵌入模型间迁移,威胁智能体安全。
Comments Accepted to ICML 2026
多轮交互中的安全隐患:工具使用智能体的多轮安全风险基准与防御
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出多轮工具使用安全基准MT-AgentRisk,发现多轮设置下攻击成功率平均增加16%,并设计无训练、与工具无关的自探索防御方法ToolShield,平均降低30%攻击成功率。
PSEBench: 一个用于评估大语言模型在患者安全事件分类中的可控且可验证的基准
机构 * Emory University(埃默里大学) ; Scale AI ; Mayo Clinic(梅奥诊所) ; Vanderbilt University Medical Center(范德比大学医学中心)
专题命中 Agent评测 :workflow(abstract);agentic(abstract);分类 cs.AI
AI总结 提出基于政策条款卡的结构化构建方法,通过锚点驱动实例化和闭环验证生成带真实标签的叙事,并创建包含5074个案例的基准PSEBench,评估15个代表性LLM在患者安全事件分类中的能力。
Crazyflow: 基于JAX的精确、GPU加速、可微分的无人机模拟器
机构 * Technical University of Munich(慕尼黑技术大学) ; University of Toronto(多伦多大学) ; Simon Fraser University(西蒙弗雷泽大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 提出Crazyflow模拟器,通过GPU加速和可微分设计,实现单机超高速仿真、数千架无人机集群模拟,并支持基于解析梯度的策略学习与采样避障,甚至能在0.38秒内从零训练飞行恢复策略。
Comments Fix minor metadata mistakes
CSE-UOI在SemEval-2026任务6中的表现:一种双阶段异构集成与 deliberative 复杂性门控的政治理论逃避检测方法
机构 * University of Ioannina(伊奥安纳大学) ; National Technical University of Athens(雅典国家技术大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL
AI总结 本文提出一种双阶段异构集成方法,结合自我一致性与加权投票,以及新颖的后处理修正机制Deliberative Complexity Gating,用于政治逃避检测,最终在评估集上获得0.85的Macro-F1分数。
SentinelBench: 一个用于长时间运行监控代理的基准测试
机构 * University of Florida(佛罗里达大学) ; Microsoft Research, AI Frontiers(微软研究院,人工智能前沿)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 提出SentinelBench,一个包含10个合成网络环境中100个任务的基准测试,用于评估AI代理在长时间监控任务中的表现,衡量任务完成度、反应时间和资源使用。
Comments 18 pages, 16 figures
SCOPE-Router:面向执行导向任务的成本感知开放集视觉语言模型路由
机构 * CASIA(中国科学院自动化研究所) ; UCAS(中国科学院大学) ; NUS(新加坡国立大学) ; Tencent(腾讯)
专题命中 Agent评测 :agentic(abstract,abstract_cn)
AI总结 本文提出SCOPE-Router与CRM+RCCR,构建执行导向VLM路由基准VLM-ExecRouterBench,解决现有VLM路由局限,在多基准上取得更优性能。
OccDirector:基于语言的4D占用空间中行为与交互生成
机构 * SKL-IOTSC, CIS, University of Macau, Macau, China(SKL-IOTSC、CIS、澳门大学、澳门、中国) ; Li Auto Inc, Beijing, China(Li Auto Inc、北京、中国)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract)
AI总结 本文提出OccDirector框架,通过自然语言生成4D占用空间动态,解决复杂多代理交互生成问题,引入多级语言指令数据集和评估基准,实现语言驱动的行为编排。
SkillNet: 创建、评估和连接AI技能
机构 * Zhejiang University(浙江大学) ; Tongji University(同济大学) ; Southeast University(东南大学) ; Alibaba Group(阿里巴巴集团) ; Tencent(腾讯) ; Fudan University(复旦大学) ; The University of Edinburgh(爱丁堡大学) ; Monash University(墨尔本大学) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学) ; Huzhou University(湖州大学) ; Hornor Device Co., Ltd(Hornor设备有限公司) ; Hangzhou Institute for Advanced Study, UCAS(杭州先进研究所,UCAS)
专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 SkillNet通过统一的本体和多维评估机制,大规模创建、评估和连接AI技能,提升代理性能并促进技能的持久掌握。
Comments http://skillnet.openkg.cn/; add SkillNet-Gym, a benchmark for evaluating skill retrieval, utilization, composition, and SkillNet-Fabric for task-specific skill routing through lightweight Wikis
FDABench:异构数据上分析查询的数据代理基准
专题命中 Agent评测 :agent(abstract);agentic(abstract)
AI总结 提出FDABench基准,通过2007个任务覆盖六种数据模态,并设计PUDDING框架自动构建数据集,以评估数据代理在异构数据上的推理能力。
Comments Accepted to KDD'26
仓颉基准:在低资源通用编程语言上评估大语言模型
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 本文提出CangjieBench,用于评估大语言模型在低资源通用编程语言上的表现,通过248个高质量样本覆盖文本到代码和代码到代码任务,发现语法受限生成在准确性和计算成本之间取得最佳平衡。
Comments Accepted by ESEM 2026
基于声誉的自适应探索的强化学习促进合作的进化
专题命中 Agent评测 :agent(abstract);multi-agent(abstract)
AI总结 本文提出一种结合局部声誉差异和非对称状态依赖声誉更新的Q学习模型,通过高声誉低探索、低声誉高探索机制促进合作,并增强低地位的合作收益和高地位的背叛惩罚。
Comments 12 pages, 6 figures
Journal ref Chaos: An Interdisciplinary Journal of Nonlinear Science, 2026, 36(8)
用于工具结构化大语言模型推理方法的仅幅度前馈网络干预:门控评估协议及跨模型实证结果
专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 研究推理时FFN干预改善大语言模型结构化输出,提出无损的幅度门控方法,定义细粒度干预系统和评估协议。在多个模型上实验,AG在工具结构化任务中效果最佳,不同AG变体各有优劣,确定工具结构化推理是FFN级推理优化首要目标。
Comments 30 pages, 9 figures
MEmilio -- 高性能模块化流行病模拟软件用于多尺度和比较模拟的传染病动态
专题命中 Agent评测 :agent(abstract,abstract_cn)
AI总结 MEmilio 是一个高性能模块化流行病模拟软件,通过统一架构整合多种流行病学模型,提升传染病动态模拟的效率与准确性。
Comments 47 pages, 6 figures
OSCAgent:利用LLM代理加速有机太阳能电池的发现
专题命中 Agent评测 :agent(abstract);multi-agent(abstract)
AI总结 OSCAgent通过多代理框架整合检索增强设计、分子生成和系统评估,提升有机太阳能电池材料发现效率,实现预测性能超越传统和LLM基线方法。
AgentWatcher: 一种基于规则的提示注入监控
专题命中 Agent评测 :agent(abstract);tool-use(abstract)
AI总结 本文提出AgentWatcher,通过聚焦短文本片段和定义明确的规则,解决提示注入检测中上下文长度影响和规则不明确的问题,实现可扩展且可解释的检测方法。
Comments The code is available at https://github.com/wang-yanting/AgentWatcher
回收评估:有损记忆比空记忆更糟糕
机构 * Independent Researcher(独立研究者)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 研究发现,语言模型保留错误结论而丢弃推导过程的记忆会导致更差表现,提出“源优先”策略通过保留可重算源来恢复可纠正性,并在多种记忆系统和真实对话中验证。
Comments 36 pages, 5 figures, 23 tables. v5: table/float layout fixes and a corrected stray typo in Table 21 (n/a cells); no changes to results or text
认知YOLO:基于数据第一性原理的大语言模型驱动的架构合成用于目标检测
机构 * Xi’an University of Posts and Telecommunications(西安邮电大学)
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract)
AI总结 针对通用目标检测算法在垂直场景的问题,认知YOLO利用大语言模型与自主智能体协作,构建“分析-合成-编译”管道,合成轻量级模型,显著压缩参数数量,在mAP@0.5:0.95上表现良好,平衡了模型紧凑性和特征表示能力。
Comments 11 pages, 3 figures, 6 tables
证据-决策-反馈:面向LLM代理的理论驱动自适应支架框架
专题命中 Agent评测 :agent(abstract);agentic(abstract)
AI总结 本文提出EDF框架,通过Copa代理在真实课堂中展示其能有效引导反馈与学生理解一致,促进支架退化,并提供可解释的证据支持解释。
Comments Published as a long paper in the proceedings of the 27th International Conference on Artificial Intelligence in Education (AIED26)
Journal ref International Conference on Artificial Intelligence in Education. Cham: Springer Nature Switzerland, 2026
OpenEarthAgent:一个用于工具增强地理空间代理的统一框架
机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) ; IBM Research(IBM研究院) ; Linköping University(林霍姆斯大学) ; Technical University Munich(慕尼黑技术大学) ; Australian National University(澳大利亚国立大学)
专题命中 Agent评测 :agent(abstract);agentic(abstract)
AI总结 本文提出OpenEarthAgent框架,通过整合卫星影像、自然语言查询和结构化推理轨迹,实现多模态地理空间推理,提升遥感任务的执行能力与空间逻辑一致性。
Comments Accepted at the European Conference on Computer Vision (ECCV 2026)
以关系为中心的关怀:为心理健康护理中的人际连接进行相关性和负责任的设计
专题命中 Agent评测 :agent(abstract);AI agent(abstract)
AI总结 本文探讨了数字治疗联盟在心理健康护理中的应用,提出以关系为中心的设计方法,旨在通过AI促进真实的人际关系,而非仅模拟连接。
SWE-MERA:一种用于在软件工程任务中对大型语言模型进行代理评估的动态基准测试
机构 * GigaCode ; ITMO University(ITMO大学) ; MWS AI(MWS人工智能) ; IITU university(IITU大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 针对现有软件工程基准测试局限性,提出SWE-MERA动态基准测试,通过自动收集GitHub问题及严格验证确保质量,最小化污染风险,利用Aider编码代理评估多个大型语言模型,展示了其强大区分能力及模型性能表现。
Comments EMNLP 2025
当用户是LLM智能体时推荐算法是否有效?基于Moltbook的案例研究
专题命中 Agent评测 :agent(abstract);AI agent(abstract)
AI总结 研究LLM智能体作为用户时推荐算法的有效性,在Moltbook平台上评估八种方法,发现基于流行度和物品协同过滤的方法优于用户表示学习,表明推荐从个性化退化为结构模式匹配。
Comments 11 pages, 3 figures, 4 tables
快速收敛级数的无理性:埃尔多斯与格雷厄姆的问题
专题命中 Agent评测 :agent(abstract);AI agent(abstract)
AI总结 该研究证明了满足双指数增长条件的级数求和结果为无理数,并探讨了其推广形式及最优性。
Comments Minor modifications to the exposition. To appear in the Bulletin of the London Mathematical Society
StepShield:何时干预流氓代理,而非是否干预
机构 * University of Virginia(弗吉尼亚大学) ; Indian Institute of Science, Bangalore(印度科学研究院,班加罗尔) ; Cornell University(康奈尔大学) ; University of the Cumberlands(库姆伯兰兹大学) ; University of Arizona(亚利桑那大学) ; California State University, Northridge(加州州立大学,北岭分校)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 研究代理安全检测时机问题,引入StepShield基准及早期干预率(EIR),揭示取证陷阱,指出基于规则的护栏虽召回率高但时机不佳,现有方法无法兼顾高召回、低误报和及时干预,凸显逐步骤流氓检测待解决。
Comments 20 pages, 4 figures, 10 ablation studies. Code and data: https://github.com/glo26/stepshield