Reframing LLM Agent Security as an Agent-Human Interaction Problem
将LLM智能体安全重新定义为智能体-人类交互问题
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文通过系统分析59篇学术论文、21个生产智能体系统和26个安全插件,论证LLM智能体安全本质上是智能体-人类交互问题,而非纯算法问题,并提出了三方向研究议程。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
将LLM智能体安全重新定义为智能体-人类交互问题
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文通过系统分析59篇学术论文、21个生产智能体系统和26个安全插件,论证LLM智能体安全本质上是智能体-人类交互问题,而非纯算法问题,并提出了三方向研究议程。
独轮车代理的Fermat-Weber位置问题的纯方位解
专题命中 Agent评测 :agent(title,abstract)
AI总结 针对独轮车代理的非完整约束,提出纯方位控制律以解决Fermat-Weber位置问题,包括静止信标、饱和输入和移动信标情况,并通过仿真和实验验证有效性。
Comments This paper has been accepted for presentation at the 23rd IFAC World Congress
Journal ref 23rd IFAC World Congress 2026
HSCO-Bench: 一种由智能体驱动的端到端硬件软件协同设计基准,用于片上系统
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文提出HSCO-Bench,一个用于评估大型语言模型在端到端硬件软件协同设计能力的基准,通过评估LLM在资源约束下生成高效SoC原型的能力,揭示了当前模型在硬件加速方面的不足。
ClinQueryAgent:一种用于群体健康管理的对话代理
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文提出ClinQueryAgent,一种将自然语言群体健康问题转化为可执行数据库查询的对话代理系统,通过本地和外部知识库的结合,实现安全高效的健康信息处理。
Comments 11 pages, 4 figures. Submitted to ACL Systems Demonstrations
一种随机代理模型用于模拟肿瘤-免疫动态并评估治疗策略
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文提出一种随机代理模型,整合细胞异质性、空间细胞间相互作用和药物抗性进化,用于模拟肿瘤生长和免疫反应,并评估不同治疗策略的效果。
Comments 26 pages, 13 figures
Journal ref MBE, 2026, 23(5):1402-1436
以验证假设为视角评估AI代理的人性化程度
专题命中 Agent评测 :AI agent(title);agent(abstract)
AI总结 本文提出利用验证过的行为假设作为评估AI代理人性化的视角,通过HumanStudy-Bench平台对12个研究进行评估,发现代理响应在完全复制与彻底失败间极化,代理设计比模型规模对齐影响更大但效果非单调。
Follow-Bench:一种用于社交感知机器人跟随的统一运动规划基准
机构 * Shenzhen Key Laboratory of Robotics and Computer Vision(深圳机器人与计算机视觉重点实验室) ; Southern University of Science and Technology(南方科技大学) ; Human-Robot Interfaces and Interaction Laboratory(人机交互实验室) ; Istituto Italiano Di Tecnologia(意大利技术研究院) ; Swiss Federal Technology Institute of Lausanne(洛桑联邦理工学院)
专题命中 Agent评测 :planning(title,abstract)
AI总结 本文提出首个全面研究机器人跟随问题,介绍统一基准模拟多样场景,重新实现八种代表性规划器,评估最佳性能规划器以揭示现实部署挑战。
Comments Project page: https://follow-bench.github.io/
RecRM-Bench:面向代理推荐系统的多维奖励建模基准测试
专题命中 Agent评测 :agentic(title,abstract)
AI总结 本文提出RecRM-Bench,首个大规模多维奖励建模基准,涵盖指令遵循、事实一致性等四个维度,为训练复杂奖励模型提供基础数据。
以代理为中心的观测适应用于动态扰动下的鲁棒视觉控制
机构 * City University of Hong Kong(香港城市大学) ; Tsinghua University(清华大学)
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文提出ACO-MoE方法,通过结合路由的修复专家和前景掩码分支,解决动态扰动下的视觉控制问题,提升下游任务性能。
Comments Source code is available at https://github.com/fangzr/aco-moe-code
GazeMind:一种基于注视的LLM代理用于个性化认知负荷评估
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文提出GazeMind,一种基于注视的LLM代理框架,用于智能眼镜上的认知负荷评估。该框架通过编码注视数据为结构化表示,提供可解释的认知负荷预测,并通过新颖的任务引导推理方法实现跨场景泛化,同时利用用户特定特征和历史参考实现个性化适应。
AffectSeek: 长视频中基于模糊用户查询的代理情感理解
机构 * Gansu Provincial Key Laboratory of Wearable Computing, School of Information Science and Engineering, Lanzhou University(甘肃省可穿戴计算重点实验室,兰州大学信息科学与工程学院) ; Guangdong-Hong Kong-Macao Joint Laboratory for Emotional Intelligence and Pervasive Computing, Shenzhen MSU-BIT University(粤港澳大湾区情感智能与泛在计算联合实验室,深圳MSU-BIT大学) ; Department of Computer and Information Engineering, Khalifa University(计算机与信息工程系,哈利法大学) ; Artificial Intelligence Research Institute, Shenzhen MSU-BIT University(人工智能研究院,深圳MSU-BIT大学) ; Department of Electrical and Computer Engineering, The University of Hong Kong(电子与计算机工程系,香港大学)
专题命中 Agent评测 :agentic(title,abstract)
AI总结 本文提出VQAU任务,要求模型在长视频中定位情感时刻、预测情绪类别并生成证据支持的解释。构建VQAU-Bench基准,并提出AffectSeek框架,通过分步推理实现模糊查询驱动的情感理解。
ESARBench: 一种用于代理无人机体感知搜索与救援的基准
机构 * Harbin Institute of Technology(哈尔滨工业大学)
专题命中 Agent评测 :agentic(title);planning(abstract)
AI总结 本文提出ESARBench,首个用于评估基于MLLM的无人机在高真实感搜索与救援场景中的基准,通过构建高保真环境和600个任务数据集,揭示了ESAR中的关键瓶颈。
Comments 20 pages, 7 figures
OptiMat 合金:由对话代理驱动的多主元合金FAIR活数据库
专题命中 Agent评测 :agent(title,abstract)
AI总结 OptiMat Alloys通过对话代理实现多主元合金探索,结合活数据库、网页界面和不确定性量化,使计算合金筛选更易用,拓展FAIR原则至按需知识生成。
Comments See demo here https://youtu.be/lQzuorkzPMc
当基数策略化:一个关于影响力和意识形态的代理模型,用于教皇选举会议
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文提出并分析了两个基于代理的模型,研究教皇选举会议的动力学,探讨社会影响、战略投票和意识形态一致如何影响选举教皇所需时间。模型引入了意识形态集团,通过模拟发现意识形态极化会延迟选举,但较高的战略响应性可提高效率。
Comments 15 pages, 5 figures, to appear in Chaos, Solitons & Fractals
代理中的幽灵:重新定义LLM代理的信息流跟踪
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文提出NeuroTaint框架,通过语义证据、因果推理和持久上下文跟踪,解决LLM代理中信息流跟踪问题,优于现有基准方法。
在不确定性下的治理可审计决策:综合与代理扩展
专题命中 Agent评测 :agentic(title,abstract)
AI总结 本文综合了治理证据框架,分析其在四种决策系统架构中的可迁移性,揭示了治理覆盖梯度及代理系统中的结构性断裂问题。
Comments 24 pages, 2 tables. Companion artifact: Governance Benchmark Dataset (https://doi.org/10.5281/zenodo.19248723)
向LLM-代理社会模拟的操作验证:一个Reddit-like技术论坛的重复研究
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文通过30天的模拟研究,验证LLM-代理在技术论坛中的操作有效性,发现模拟结果与真实数据在用户和帖子层面有重叠,但评论毒性等指标存在差异,揭示了代理设计对模拟结果的影响。
基于ISO合规感知-计算-控制架构的LLM引导安全代理用于边缘机器人
机构 * Shanghai Jiao Tong University(上海交通大学) ; SIMMIR Tech(SIMMIR科技)
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文提出一种基于ISO合规架构的LLM引导安全代理,通过将安全规范转化为可执行谓词,实现边缘机器人中的功能安全,支持ISO 13849 Category 3和PL d的实用部署。
DR. INFO在临床一线:医师对代理AI临床助手的感知价值前瞻性试点研究
专题命中 Agent评测 :agentic(title,abstract)
AI总结 本研究评估DR.INFO在临床实践中对医师时间效率、决策支持和满意度的影响,发现医师普遍认可其价值,但需进一步验证。
SAGE:基于传感器的地面引擎用于LLM驱动的睡眠护理代理
专题命中 Agent评测 :agent(title,abstract)
AI总结 SAGE通过整合传感器数据,解决睡眠护理中数据与行动之间的鸿沟问题,提升个性化和信任度。
Comments Accepted to the Extended Abstracts of the 2026 CHI Conference on Human Factors in Computing Systems (CHI EA '26). 6 pages
Journal ref Extended Abstracts of the 2026 CHI Conference on Human Factors in Computing Systems (CHI EA '26)
EnvScaler:通过程序合成实现LLM代理的可扩展工具交互环境
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)
专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出EnvScaler框架,通过程序合成构建大量工具交互环境,用于LLM代理的监督微调和强化学习,提升其在复杂多轮多工具交互环境中的任务解决能力。
Comments Add some experiments
AVID:一种通过代理驱动构建的多模态音频视觉不一致理解基准
专题命中 Agent评测 :agent(title,abstract)
AI总结 AVID是首个大规模多模态音频视觉不一致理解视频基准,通过可扩展的构建流程和8种细粒度不一致类别,评估检测、时间定位、分类和推理能力,验证了其在可信多模态AI系统中的有效性。
Q-Agent:通过鲁棒多模态大语言模型实现质量驱动的推理图像修复代理
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文提出Q-Agent,通过Chain-of-Thought方法提升图像修复性能,结合鲁棒多模态大语言模型和客观图像质量评估,实现更高效的多退化处理。
ARuleCon:代理安全规则转换
专题命中 Agent评测 :agentic(title,abstract)
AI总结 ARuleCon通过自动化规则转换框架,解决跨平台安全规则复用难题,提升SIEM规则转换的准确性和效率,平均优于基线LLM模型15%。
Comments This paper has been accepted for publication at WWW 2026
生物系统中的量子流代理选择
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文提出一个将生物体的主动意图性选择置于物理基础的模型,通过量子态与代理选择的多对一关系,实现非预设但符合物理定律的选择。
Gym-V: 一个统一的视觉环境系统用于代理视觉研究
机构 * ModalMinds
专题命中 Agent评测 :agentic(title,abstract)
AI总结 Gym-V通过统一的179个程序生成视觉环境,解决了视觉代理研究中缺乏标准化基础设施的问题,发现观察支架比RL算法选择更关键,且跨领域迁移实验显示多样化训练能广泛泛化。
单Agent图探索下T-区间连通性中窗口大小和时间的紧界
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究单Agent在T-区间连通图中的确定性探索,分析窗口大小和探索时间的紧界,提出算法并证明其最优性。
按爬取付费定价机制:LM-树代理
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文提出LM-树代理,通过LLM发现内容差异,实现动态定价,提升收益40%。
智能体在受挑战时会修复还是仅回应?挑战、修复与公共纠正在一个部署的智能体论坛中的探讨
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究比较了部署的智能体论坛Moltbook与Reddit社区,发现Moltbook讨论线程较少,挑战回应率低,修复机制缺失,表明社区维持互动过程对规范教学和修订的重要性。
SWE-CI:通过持续集成评估代理在维护代码库中的能力
机构 * Sun Yat-sen University(中山大学) ; Alibaba Group(阿里巴巴集团) ; Skylenage
专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL、cs.SE
AI总结 SWE-CI通过持续集成循环构建首个仓库级基准,旨在将代码生成评估从静态短期功能性正确性转向动态长期可维护性,通过跟踪功能正确性随时间的变化揭示可维护性。