Minimal Markovization via Stable Quotients in Holonomy-Cover Decision Processes
完整覆盖决策过程中通过稳定商实现的最小马尔可夫化
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG
AI总结 本文针对结构化POMDP类刻画最小马尔可夫充分统计量,构造稳定商实现精确有限马尔可夫状态,提出完整记忆强化学习方法,实验验证其压缩与决策性能优于基线。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
完整覆盖决策过程中通过稳定商实现的最小马尔可夫化
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG
AI总结 本文针对结构化POMDP类刻画最小马尔可夫充分统计量,构造稳定商实现精确有限马尔可夫状态,提出完整记忆强化学习方法,实验验证其压缩与决策性能优于基线。
生成式AI作为创意构思中反思支持的阻力来源
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI
AI总结 本文提出设计构思中AI应作为反思支持的阻力主体,而非促进输出的顺滑主体,其核心作用是支持设计师构建和承载创意依据。
Comments In Proceedings of The First Reflection in Creative Experience (RiCE) Workshop (RiCE W1) arXiv:2607.24558
一次运行并非一个想法:自动化研究中的实施彩票
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI
AI总结 该研究针对自动化研究中存在的“实施彩票”问题,提出想法可靠性审计方法,通过312次分配实验发现实施方差远大于成果重运行方差,表明需多实施证据支撑想法决策。
EfficientGraph-RAG:面向跨任务检索增强生成的结构化检索状态管理
机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) ; Tsinghua University, China(清华大学) ; Kunming University of Science and Technology, China(昆明理工大学) ; NiuTrans Research, Shenyang, China(沈阳NiuTrans研究院)
专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.CL
AI总结 提出EfficientGraph-RAG框架,通过显式定义检索状态(TAM、MARS、SMP三个机制)实现结构化状态管理,在多个基准上提升答案质量并降低大模型token消耗。
NELSSA:一种基于GPU-PNM异构系统的LLM混合长度服务框架,通过基于长度的请求放置实现
专题命中 记忆与上下文管理 :agentic(abstract)
AI总结 NELSSA是集成GPU与PNM加速器的LLM服务系统,通过基于长度的请求放置处理混合长度工作负载,解码吞吐量最高提升5.5倍,P99延迟最高降低15倍,为LLM基础设施提供新范式。
Comments 14 pages, 19 figures. Accepted to the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026)
确定与和集及差集相关的最优指数
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 该研究解决了阿贝尔群有限子集的和差不等式中指数最优性的公开问题,构造集族证明第一个不等式的指数1/2最优,相关工作借助AI智能体Hyra完成。
基于分布式线性化交替方向乘子法的可扩展动态最优传输
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 本文针对动态最优传输数值求解的不稳定与内存开销大问题,提出结合线性化交替方向乘子法的重构方案与分布式变量划分方法,通过实验验证了方法的稳定性、鲁棒性与可扩展性。
面向500年一遇风暴事件的弹性变电站设计:洪泛区管理与基础设施加固的现状与挑战
专题命中 记忆与上下文管理 :planning(abstract)
AI总结 本文提出一个综合工程框架,通过场地抬升、土壤稳定、铰接式混凝土块护坡和绿色基础设施,提升变电站对500年一遇洪水事件的弹性,降低生命周期成本。
Comments 18 pages, 6 figures, 6 tables
代理关系伤害:AI代理中关系操纵的基准测试与门控
专题命中 Agent评测 :AI agent(title,abstract);agentic(title,abstract);agent(abstract);workflow(abstract)
AI总结 针对AI代理可能造成的关系操纵风险,提出了一个110提示的基准测试、关系特定标注框架和轻量级后生成策略门控,以评估和缓解代理关系伤害。
Comments 13 pages, 3 figures
AI智能体时代需要新的科学范式以维持可信科学
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 针对AI自主研究智能体带来的科学产出验证缺口扩大问题,该文提出需进化科学验证基础设施的标准,以应对无人能核查结果等风险,维持科学信任。
Comments Accepted at ICML 2026, Position Paper Track
REAP:从交互生产使用自动整理编码代理基准
机构 * Meta, USA(Meta公司)
专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 REAP通过自动化流程从真实开发者与代理交互中构建生产基准,解决评估信号不可靠问题,通过LLM分类和多轮稳定性检查确保基准可信。
Comments Accepted at ASE 2026 Industry Showcase
SecRespond:面向真实入侵后事件响应的AI智能体基准测试集
专题命中 Agent评测 :AI agent(title);agent(abstract);workflow(abstract);分类 cs.AI、cs.CL
AI总结 研究人员推出首个入侵后事件响应AI智能体基准测试集SecRespond,评估23种前沿LLM在10个靶场的表现,发现现有智能体难以及时发现隐蔽入侵并制定全面修复计划,存在根本瓶颈。
EvoPINN:面向物理信息神经网络可执行算法的智能体式发现框架
机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG
AI总结 EvoPINN是智能体式框架,将PINN开发转化为基于执行的算法发现,通过LLM智能体迭代优化,自主发明SLRC-PINN,可显著降低PDE求解的相对L₂误差,为科学计算提供新机制。
SARC-DQ:智能体AI的运行时数据质量门控:隐性证据缺陷、无能防护机制与仅下游修复
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE
AI总结 该研究针对智能体AI的元数据缺陷问题,提出SARC-DQ运行时数据质量门控机制,实验显示模型能力未提升怀疑能力,所提门控结合下游修复可恢复部分损失,无模型预言机能精准跟踪缺陷率。
Comments https://github.com/besanson/dqSarc
探索物理问题中的结构:AI智能体能否发现统计力学映射?
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI
AI总结 本研究以StatMechBench-v0为基准,评估基于LLM的“提出-验证-修正”智能体发现统计力学映射的能力,揭示其推理局限并提出验证栈的设计方向。
Comments Accepted to the AID-Wild workshop at CAIS 2026
用户提问,平台竞争:代理推荐市场如何形成
机构 * Tsinghua University(清华大学) ; Tencent Inc.(腾讯公司)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 研究基于LLM的代理推荐市场,用户先提需求平台竞争注意力。实验发现新设置在获取与注意力间有紧张关系,竞争引发平台策略行为,关联反馈可增加购买机会,强调设计代理推荐需综合考虑多方面并作为联合机制设计问题。
以太坊上早期区块链注册的人工智能代理数据集
专题命中 Agent评测 :AI agent(title);agent(abstract);agentic(abstract)
AI总结 本文构建了一个基于ERC-8004标准的区块链注册AI代理数据集,包含10000个代理的链上身份记录、铸造交易、转移事件、声誉摘要及反馈记录,支持对代理身份形成、声誉系统和去中心化AI生态的研究。
Comments revised version
SciFigQual-Bench:面向全文本上下文的科学图片质量评估基准
专题命中 Agent评测 :agent(summary_cn,abstract);分类 cs.AI
AI总结 本文针对现有科学图片质量评估方法的不足,构建了SciFigQual-Bench基准,设计SFQ-Agent框架实现自动化评估,实验显示其在eval1200子集上表现优于主流方案。
Comments † Equal contribution. Affiliations: 1: The University of Hong Kong 2: The University of Sydney 3: University of Electronic Science and Technology of China Corresponding authors: Zihan Deng (zhdeng@hku.hk), Chuanzhi Xu (chuanzhi.xu@sydney.edu.au) Project page: https://frankdengai.github.io/SciFigQual-Bench Source code & dataset: https://github.com/FrankDengAI/SciFigQual-Bench
库漂移:在自我演化的LLM技能库中诊断和修复一种无声的失败模式
机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) ; HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰技术中心,中国)
专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE;agentic(comments)
AI总结 本文研究了自我演化的LLM技能库中的一种无声失败模式——库漂移,通过可重复触发实验、细粒度诊断和验证修复方法,揭示了技能积累无序导致检索退化、假阳性注入和性能停滞的问题,并提出了一种经过验证的修复方案,显著提升了技能库的性能。
Comments Accepted to the ICML 2026 Workshop on Failure Modes in Agentic AI (FAGEN@ICML 2026), Seoul, South Korea. https://github.com/amazon-science/Self-Evolving-Agents-Ratchet
面向AI安全评估的对抗语用学:指令冲突、嵌入命令与策略模糊性基准
机构 * Humber Polytechnic(汉博理工学院) ; University of Toronto(多伦多大学)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 提出对抗语用学基准和标注协议,通过语言学控制的分类法评估模型在指令冲突、嵌入命令等场景下的行为,为安全评估提供实证和方法论工具。
Comments 32-page main paper plus 13-page supplement; 6 figures and 17 tables total; code and data artifact available at the linked repository
心理世界建模
专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.CL
AI总结 该研究提出将心理变量作为核心组件的MWM框架,实例化为MENTIS基线,实验证明显式建模心理状态对预测人类决策至关重要,推动世界建模从物理场景模拟转向心智模拟。
Comments project website: https://mental-world.github.io/
StealthBench:衡量自主进攻性安全智能体的操作隐蔽性
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 研究人员推出StealthBench基准,通过含三个LLM的评判小组评估自主进攻性安全智能体的OPSEC表现,发现无模型安全成功率超54%,证实OPSEC失败具系统性,该基准用于支持相关智能体开发与监控。
Comments 29 pages, 9 tables, 1 figure, 2 appendices. Code: https://github.com/GangGreenTemperTatum/stealthbench Dataset: https://huggingface.co/datasets/0xmoose/stealthbench Website: https://stealthbench.com
Position: 评估分数是易逝的知识主张
机构 * DeepThought Solutions(深度思考解决方案公司) ; Meta ; University of Florida(佛罗里达大学)
专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 该研究指出语言模型评估存在信任膨胀问题,提出将评估分数视为具有形式性、范围性和有效性窗口的认知主张,建议添加元数据并采用最弱链聚合,发现HELM排行榜上两种聚合方式的前五名模型完全不重合。
Comments 7 pages, 1 figure, 1 table. Published at the Fifth Workshop on Generation, Evaluation and Metrics (GEM), ACL 2026, San Diego
Journal ref Proceedings of the Fifth Workshop on Generation, Evaluation and Metrics (GEM), ACL 2026, pages 1029-1035
NISPO:开源IUPAC名称生成工具
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.SE
AI总结 针对化学领域IUPAC名称生成需求,该研究开发了基于RDKit、采用智能体自改进循环的开源Python工具NISPO,经SureChEMBL分子优化后,在1.03亿个PubChem分子上实现98.1%的往返准确率,可免费获取。
知晓的代价:一种超越静态排行榜的幻觉基准测试的资源感知协议
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 研究前沿模型事实性与计算成本的权衡问题,提出资源感知评估协议MAS-HQ,通过包装事实性检测器、归一化成本并让系统竞争,能衡量事实性答案成本,使单代理基线更具资源效率,收益稳定。
SalesSim:多模态语言模型作为零售用户模拟器的基准测试与对齐
机构 * Salesforce Research(Salesforce研究院) ; University of California Los Angeles(加州大学洛杉矶分校)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL
AI总结 SalesSim通过多轮多模态对话评估多模态大语言模型在模拟真实用户行为中的能力,发现模型在词汇多样性及决策一致性方面存在不足,并提出UserGRPO方法提升对话流畅度与决策对齐度。
GPT-Red:基于大规模自博弈的自动化红队测试
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本研究推出GPT-Red,一种基于大规模自博弈的自动化红队测试智能体,可发现新型提示注入攻击、攻破过往模型且泛化能力强,用于提升LLM鲁棒性并形成自我改进飞轮。
Comments 28 pages.13 main pages and 13 main figures
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
Comments 21 pages, 7 figures, 7 tables
PowerAtlas:面向电力系统的电-计算协同调度
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; State Grid Liaoning Electric Power Co., Ltd.(国网辽宁省电力有限公司) ; Nanyang Technological University(南洋理工大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 PowerAtlas是用于电-计算协同调度的LLM智能体框架,整合多类约束生成可行方案,构建含2000个实例的ECBench基准,在11种LLM上验证了有效性。
Comments 17 pages, 9 figures, 5 tables. Code: https://github.com/JAVA-Jiang/PowerAtlas
多样性约束下的参数化公平资源分配
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出PRA及自适应变体APRA框架,将多样性约束下的资源分配从硬性条件优化转为柔性参数调节,兼顾公平性与效率,在真实应用中性能优于现有基准。