TGMS: An Agent-Native Bi-Temporal Graph Management System
TGMS:一种原生代理双时态图管理系统
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究针对时态图问题中LLM代理常失败的情况,提出双时态属性图管理系统TGMS,将13个运算符作为代理工具,LLM规划调用,系统计算,能分离有效时间与事务时间,在基准测试中表现优异,开源代码等。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
TGMS:一种原生代理双时态图管理系统
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究针对时态图问题中LLM代理常失败的情况,提出双时态属性图管理系统TGMS,将13个运算符作为代理工具,LLM规划调用,系统计算,能分离有效时间与事务时间,在基准测试中表现优异,开源代码等。
探索语音、个性与性别在人机交互中的相互作用
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究探讨用户能否通过语音识别人工代理的外向性,并分析感知个性与用户-代理同步性之间的关系,发现女性语音在区分外向性上更有效,而男性语音则不一致。
Journal ref https://www.frontiersin.org/articles/10.3389/fcomp.2026.1855830
最小化智能体 - 环境模型中的复制与信息提取
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究在无明确指导或奖励下从数据提取信息的问题,通过对分类规则施加简单性偏差,利用统计力学工具刻画自发学习相变,扩展到智能体群体后发现交互可重塑学习相边界,开辟仅通过标签交换的分散学习途径。
通过具有代理执行的自适应任务重构使图像编辑更易于实现
机构 * Nanjing University(南京大学) ; Beijing Institute of Technology(北京理工大学) ; College of Artificial Intelligence, China University of Petroleum (Beijing)(中国石油大学(北京)人工智能学院) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Fudan University(复旦大学)
专题命中 Agent评测 :agentic(title);agent(abstract)
AI总结 本文提出通过自适应任务重构框架提升图像编辑性能,通过代理分析和反馈优化任务描述,改进编辑效果,尤其在复杂案例中表现显著。
Comments 9pages
关于双智能体一般并发博弈框架中实际权力和α权力的表示定理
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文针对双智能体一般并发博弈框架,证明了实际权力和α权力的八种类型分别可由八类邻域框架表示,推广了已有结果,并指出双智能体实际权力刻画无法推广到任意有限智能体集合。
生成式机器智能中的因果幻象均衡
专题命中 Agent评测 :agentic(title);agent(abstract)
AI总结 针对生成式机器智能中语义表征与物理现实脱钩的问题,提出风险敏感平均场型因果幻象均衡(CME),证明其存在性并揭示内生强化主导时非因果状态的稳定分岔。
Comments 10 pages, 1 figure. References double-checked manually
SkillAxe: 通过评估引导的自我精炼提升LLM编写的智能体技能
专题命中 Agent评测 :agent(title,abstract)
AI总结 提出SkillAxe框架,通过无监督评估引导LLM自我诊断和精炼技能,在SkillsBench上提升通过率28%,缩小与人类技能的差距47-67%。
Comments 9 pages, under review
SecureVibeBench: 通过重建引入漏洞的场景来基准测试AI代理的安全振动编码
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 Agent评测 :AI agent(title);分类 cs.AI、cs.CL、cs.SE
AI总结 本文提出SecureVibeBench,一个包含105个C/C++安全编码任务的基准测试,旨在评估AI代理在真实场景中生成安全代码的能力,发现现有方法在评估人类与AI代理对比时的不足。
Comments ACL 2026 Main Conference. Our code and data are on https://github.com/iCSawyer/SecureVibeBench
GroupEnvoy: 代表外群体发言以促进群体间关系的对话代理
专题命中 Agent评测 :agent(title,abstract)
AI总结 提出基于群体间接触理论的文本对话代理GroupEnvoy,通过在内群体讨论中代表外群体视角,并评估其相比被动暴露在减少焦虑、提升观点采择等方面的效果。
Comments 18 pages, 5 figures, accepted to ACM CUI 2026
自然语言处理:从分词到RLHF的全面实用指南
机构 * KAZAN (VOLGA REGION) FEDERAL UNIVERSITY INSTITUTE OF COMPUTATIONAL MATHEMATICS AND INFORMATION TECHNOLOGIES(卡赞(伏尔加地区)联邦大学计算数学与信息科技学院)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.CL
AI总结 本文系统指导现代NLP全流程,涵盖分词、向量化、大语言模型微调、检索增强生成及人类反馈强化学习,强调低资源语言处理与开源模型应用。
Comments 136 pages, 12 practical works, preprint. Textbook for senior undergraduates and graduate students. Original contributions on low-resource languages (Tajik, Tatar and other). Companion repository available
用于评估和加固LLM系统指令对抗编码攻击的自动化框架
机构 * Keysight Technologies
专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI
AI总结 本文提出自动化框架评估LLM系统指令在对抗编码攻击时的保密性,通过四个模型和46条指令测试发现结构化序列化攻击成功率高,提出基于Chain-of-Thought的缓解策略。
Comments An earlier version of this manuscript will appear in the proceedings of IEEE Cyber-AI 2026 Conference. Project source code is available at https://github.com/Keysight/LLM-EncodeGuard
SREGym:面向AI SRE代理的实时基准测试平台,具有高保真的故障场景
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Toronto(多伦多大学)
专题命中 Agent评测 :agentic(abstract,abstract_cn);AI agent(abstract);分类 cs.AI
AI总结 SREGym通过模拟真实云原生系统栈中的高保真故障场景,为AI SRE代理提供实时基准测试环境,包含90个真实挑战性SRE问题,评估前沿代理能力差异显著,可达40%。
筛选噪声:LLM代理在漏洞假阳性过滤中的比较研究
专题命中 Agent评测 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.SE
AI总结 本文比较了三种先进的LLM代理框架在漏洞假阳性过滤中的性能,展示了LLM代理在减少SAST噪声方面的有效性,但指出其效果依赖于模型和漏洞类型,且存在计算成本差异。
Comments To appear in Proceedings of the 35th ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026)
QwenPaw-数据:为自主企业数据分析搭建事实、方法与执行的桥梁
机构 * Alibaba Group(阿里巴巴集团)
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI
AI总结 研究针对企业数据分析在开放环境的特性,提出QwenPaw-Data系统,通过整合异构资产、转化自然语言请求为工作流,架构含三个协作子系统,实验证明该系统提升了数据访问和分析质量,为企业数据智能体提供基础。
库漂移:在自我演化的LLM技能库中诊断和修复一种无声的失败模式
机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) ; HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰技术中心,中国)
专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE;agentic(comments)
AI总结 本文研究了自我演化的LLM技能库中的一种无声失败模式——库漂移,通过可重复触发实验、细粒度诊断和验证修复方法,揭示了技能积累无序导致检索退化、假阳性注入和性能停滞的问题,并提出了一种经过验证的修复方案,显著提升了技能库的性能。
Comments Accepted to the ICML 2026 Workshop on Failure Modes in Agentic AI (FAGEN@ICML 2026), Seoul, South Korea. https://github.com/amazon-science/Self-Evolving-Agents-Ratchet
谁获得奖励 & 谁受到责备?面向多LLM智能体的评估对齐训练信号
机构 * Argonne National Laboratory(阿贡国家实验室) ; University of Chicago(芝加哥大学)
专题命中 Agent评测 :agent(abstract,comments);multi-agent(abstract);分类 cs.AI、cs.CL;planning(comments)
AI总结 提出一个理论框架,结合合作博弈归因与过程奖励建模,将系统级评估转化为智能体信用和消息级信号,用于多LLM智能体训练。
Comments Accepted at the NeurIPS 2025 Workshop on Bridging Language, Agent, and World Models for Reasoning and Planning (LAW 2025)
评估自主编程代理中的计划合规性
机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) ; IBM(IBM公司)
专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE
AI总结 本文系统分析了编程代理在执行任务时对计划的遵循情况,通过16991条轨迹评估不同计划变体的影响,发现计划提醒能提高任务成功率,但不恰当的计划补充可能降低性能。
面向AI安全评估的对抗语用学:指令冲突、嵌入命令与策略模糊性基准
机构 * Humber Polytechnic(汉博理工学院) ; University of Toronto(多伦多大学)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 提出对抗语用学基准和标注协议,通过语言学控制的分类法评估模型在指令冲突、嵌入命令等场景下的行为,为安全评估提供实证和方法论工具。
Comments 32-page main paper plus 13-page supplement; 6 figures and 17 tables total; code and data artifact available at the linked repository
Nautilus:从一个提示到即插即用的机器人学习
机构 * TU Darmstadt(图宾根大学) ; KIT(卡尔斯鲁厄理工学院) ; FZI(弗劳恩霍夫研究所) ; Robotics Institute Germany(德国机器人研究所) ; Honda Research Institute Europe(本田欧洲研究院)
专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract)
AI总结 Nautilus通过单个提示生成可复现、评估、微调和部署的机器人学习工作流程,提供即插即用的代理技能集和统一接口,减少跨家族验证的工程负担。
超越黑盒混淆:白盒监测器的机制分析与防御
机构 * University of Oxford(牛津大学)
专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.LG
AI总结 研究针对大语言模型白盒监测器可被规避且缺乏防御措施的问题,通过红队实验揭示几何转移和协方差操纵两种逃避策略,引入SafetyNet集成方法,在多模型家族实验中取得高AUROC分数,为稳健潜在空间监测提供了实证和起点。
ResearchClawBench: 端到端自主科学研究基准
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出ResearchClawBench基准,包含10个领域40个任务,通过多模态评分标准评估自主科研能力,最强智能体仅得21.5分,揭示当前系统在实验协议、证据匹配和科学核心方面的不足。
LiveClawBench: 在复杂真实世界助理任务上评估大语言模型代理的基准测试
机构 * Samsung Research(三星研究院) ; HKUST (Guangzhou)(香港科技大学(广州)) ; Peking University(北京大学) ; City University of Hong Kong(香港城市大学)
专题命中 Agent评测 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出LiveClawBench基准,通过三轴复杂性框架评估LLM代理在真实世界助理任务中的表现,涵盖环境复杂性、认知需求和运行时适应性,为未来扩展提供基础。
TWICE:通过事件驱动代理建模个性化用户行为的时间演化
专题命中 Agent评测 :agent(abstract);planning(abstract);workflow(abstract)
AI总结 提出TWICE框架,结合结构化用户画像、事件驱动记忆模块和两阶段工作流,利用LLM模拟用户行为的时间演化,在Twitter数据集上优于基线。
GrowthHacker: 使用代码修改型LLM代理的自动离线策略评估优化
机构 * Michigan Technological University, Houghton(密歇根技术大学) ; Birmingham City University(伯明翰城市大学) ; University of British Columbia, Kelowna(不列颠哥伦比亚大学, 肯洛纳)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG、cs.SE
AI总结 提出GrowthHacker基准,利用LLM代理自动迭代修改代码以优化离线策略评估(OPE)实现,在Open Bandit Pipeline和Scope-RL上评估多种框架,证明基于LLM的代理可作为自动增长黑客持续改进OPE系统。
Comments Accepted for publication in ACM Transactions on Software Engineering and Methodology (TOSEM), 2026
VESTA: 基于统计工具代理的视觉探索
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; New York University(纽约大学)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出VESTA框架,通过动态增长的工具集指导数据变换、假设驱动可视化和统计检验,提升视觉语言模型在复杂统计建模任务上的性能。
单循环智能体自摘要下的AI安全护栏存续性
专题命中 Agent评测 :agentic(title);分类 cs.AI
AI总结 本研究探究单循环智能体自摘要中安全规则的丢失机制,发现仅检查规则文本存在性的审计不可靠,需结合外部真实值检测,还指出仅靠LLM评判标签会反转评估结论。
DRBENCHER:你的智能体能识别实体、检索其属性并进行数学运算吗?
机构 * IBM Research(IBM研究院)
专题命中 Agent评测 :agent(title);分类 cs.AI
AI总结 DRBENCHER通过综合评估浏览与计算能力,揭示了现有基准测试的不足,其四维标准确保了问题的可验证性、复杂性、难度和多样性,展示了智能体在动态数据环境下的性能限制。
领域感知智能体技能检索
专题命中 Agent评测 :agent(title);分类 cs.LG
AI总结 本研究针对终身学习智能体技能检索瓶颈,提出领域感知的技能表示方法,通过保留技能的多字段结构计算相似度,在 SkillRet 和 SRA-Bench 基准上取得优于拼接基线的检索效果,且优势随技能库规模增大而提升。
EduPanel:用于教学视频的三智能体大语言模型评判器——可靠性、互补性和人类信任校准
机构 * National Taiwan University(国立台湾大学) ; NTU Artificial Intelligence Center of Research Excellence(NTU人工智能卓越研究中心)
专题命中 Agent评测 :agent(title);分类 cs.AI
AI总结 针对教学视频教学质量评估需求,提出基于评分标准、以学习者为条件的EduPanel大语言模型评判器,通过专门智能体分解评估,经多项分析实现高可靠性,能辅助教育评估,提高评分准确性且让专家可检测不可靠输出。
Comments 19 pages
PAIR:面向多轮代理优化的前缀感知内部奖励模型
机构 * KAIST(韩国科学技术院) ; Yonsei University(延世大学)
专题命中 Agent评测 :agent(title);分类 cs.AI
AI总结 本文提出PAIR模型,通过结合冻结的隐藏状态探针和轻量级注意力头部,解决多轮任务中内部正确性探针的可靠性问题,从而在不依赖外部模型调用或地面真实依赖的情况下,为GRPO训练提供密集的步骤级奖励信号。
Comments Under Review