Assessing Automated Prompt Injection Attacks in Agentic Environments
评估智能体环境中的自动化提示注入攻击
机构 * ETH Zurich(苏黎世联邦理工学院)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 研究在智能体环境中,黑盒优化方法(TAP)比梯度方法(GCG)更有效,且攻击效果依赖于攻击者模型,任务通用攻击可迁移但跨模型迁移受限。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
评估智能体环境中的自动化提示注入攻击
机构 * ETH Zurich(苏黎世联邦理工学院)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 研究在智能体环境中,黑盒优化方法(TAP)比梯度方法(GCG)更有效,且攻击效果依赖于攻击者模型,任务通用攻击可迁移但跨模型迁移受限。
PlanGPT的补充研究:使用定义性能指标评估并与规划器比较
机构 * Univ. Grenoble Alpes - LIG(格勒诺布尔阿尔卑斯大学 - 信息学实验室(LIG))
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本文对大型语言模型PlanGPT进行补充实验,使用规划成本和生成时间两个指标评估其性能,并与传统规划器比较,发现PlanGPT并不优于贪心搜索策略。
Comments 7 pages
STAGE-Claw:面向真实场景的基于状态的智能体自动化基准测试
机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) ; School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学前沿交叉科学学院) ; Chinese Academy of Sciences(中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Zhongguancun Academy(中关村学院) ; Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) ; Meituan(美团)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出STAGE-Claw框架,自动构建基于状态的个人计算环境中的真实场景任务,通过最终系统状态而非文本响应评估智能体性能,创建40个挑战性任务并分析11个前沿模型。
FASE: 用于代码质量的快速自适应语义熵
机构 * University of Waterloo(滑铁卢大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出快速自适应语义熵(FASE),通过最小生成树近似功能正确性,在HumanEval和BigCodeBench上相比现有语义熵方法在Spearman相关性和ROCAUC上分别提升25%和19%,且计算开销仅为传统方法的0.3%。
现在你(仍然)能看到我:检测大语言模型中的隐蔽隐写载荷
机构 * UCL Centre for AI(UCL人工智能中心) ; University College London(伦敦大学学院) ; ML Alignment Theory Scholars(机器学习对齐理论学者) ; Department of Computer Science(计算机科学系) ; School of Computing and Communications(计算与通讯学院) ; ETH Zürich(苏黎世联邦理工学院) ; University of Sussex(Sussex大学) ; Imperial College London & University of Oxford(伦敦帝国学院与牛津大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 针对大语言模型隐写外泄风险,提出一种基于非线性MLP探针的对抗性微调方法可系统规避现有线性探针检测,但通过信息论指导的数据级干预可恢复检测能力。
通过自进化桥接专家知识与自动化特征工程
机构 * Adobe Media and Data Science Research(Adobe媒体与数据科学研究) ; IIIT-Delhi(德里印度理工学院)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出FEST方法,结合双流特征生成、语义去重和树引导迭代进化,从原始文本和图像中发现可审计特征,在品牌分类等任务中平均提升4.2个百分点,并实现60-80%的专家特征覆盖。
RAILS: 面向代理商务的验证原生清算
机构 * Evolutionairy AI
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 针对自主代理在商务活动中缺乏中立清算机制的问题,提出RAILS协议,通过可靠性评分、记录和清算函数实现验证原生清算,确保财务结算基于充分证据。
Comments 49 pages, 15 figures
超越古德哈特定律:多智能体系统中合规性评估的动态基准
机构 * Fudan University(复旦大学) ; Shanghai Academy of AI for Science(上海人工智能科学研究院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Monash University(莫纳什大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对多智能体系统在压力下可能违反安全规则的问题,提出MAC-Bench动态对抗基准,通过SERV流水线生成无污染场景,并引入CSR和MG指标评估前沿模型的合规性。
评估RAG在干净、误导和混合检索下的可靠性
机构 * Ankara University(安卡拉大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出评估协议,通过参数覆盖和置信度指标,系统测试RAG系统在干净、有毒和混合证据下处理参数知识与检索证据冲突的鲁棒性。
AVI-Bench:迈向全模态大语言模型的人类级视听智能
机构 * Nanyang Technological University(南洋理工大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出AVI-Bench基准,通过感知、理解、推理三阶段跨模态任务评估全模态大语言模型的视听智能,并引入AVI-Bench-PriSe测试原始视听感知,揭示当前模型局限,构建四级AVI分类体系。
Comments 31 pages, 8 figures, ICML 2026
AI生成的社交机器人内容的对抗性创建与检测
机构 * Universitat Pompeu Fabra(庞培法拉大学) ; Observatory on Social Media, Indiana University(社交媒体观测站,印第安纳大学) ; KTH Royal Institute of Technology(皇家理工学院)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出对抗性方法模拟恶意用户冒充真人,构建多语言跨平台配对数据集,训练检测模型显著优于现有方法。
前所未见:基于一致视频源数据集的真正零样本组合图像检索基准测试
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 针对现有零样本组合图像检索数据集存在参考与目标图像不相关、非真正零样本的问题,提出ZeroSight基准,包含来自视频的一致参考-目标对和训练无关的MLLM驱动方法SC4CIR,通过三重对称一致性检查识别难负样本,实验表明现有方法性能被高估。
MADRAG: 基于检索增强生成的多智能体辩论用于免训练分析性论文评分
机构 * University of California, Irvine(加州大学尔湾分校)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL
AI总结 提出MADRAG框架,结合多智能体辩论与检索增强,通过倡导者、批评者和法官的交互以及检索示例校准,实现无需训练的论文评分,性能接近监督系统。
Comments 21 pages, 7 figures, 14 tables
开源权重模型能在金融文本理解领域与(闭源)模型竞争吗?
机构 * University of St. Gallen(圣加仑大学)
专题命中 评测与基准 :language model(abstract,comments);分类 cs.CL、cs.AI;large language model(comments)
AI总结 该研究更新了Financial Touchstone金融文本理解基准,测试了20款模型,发现开源权重模型Kimi K2.6准确率排第三,挑战了推理架构或闭源权重是金融理解前提的假设,还发现中国模型存在地缘政治内容过滤器拒绝合法金融问题的现象。
Comments To be presented at the workshop International Symposium on Large Language Models for Financial Services (FinLLM@IJCAI2026)
UniVerse:针对文化包容性低资源音乐理解的基准测试与增强
机构 * Sogang University(西江大学) ; KAIST(韩国科学技术院) ; NYU Shanghai(上海纽约大学) ; JIUTIAN Research, China Mobile(中国移动九天研究院) ; The State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) ; China Mobile (Hong Kong) Innovation Research Institute(中国移动(香港)创新研究院) ; Central Conservatory of Music(中央音乐学院)
专题命中 评测与基准 :language model(abstract,abstract_cn)
AI总结 该研究针对低资源音乐理解问题,推出UniVerse基准与数据集,训练LALMs并研究多模态不平衡学习策略,实现性能提升但仍存在深层音乐理解的差距。
Comments 21 pages, 7 figures, 8 tables
面向通用深度伪造检测的环境不变子空间学习
机构 * Tianjin University of Technology(天津理工大学) ; Shandong Artificial Intelligence Institute(山东人工智能研究院) ; Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院))
专题命中 评测与基准 :foundation model(abstract,abstract_cn)
AI总结 该研究针对深度伪造检测中跨分布泛化瓶颈,提出EISL框架,通过低秩投影解耦特征并设计环境干预模块,在多设置实验中提升了对未见伪造类型和环境变化的鲁棒性。
Comments 12 pages, 4 figures, 11 tables
MANIGUARD:用于基于规范的机器人操作安全评估与改进的基准及数据集套件
机构 * Northwestern University(西北大学) ; Stanford University(斯坦福大学) ; William & Mary(威廉玛丽学院)
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 本研究提出ManiGuard基准与数据集套件,针对机器人操作基础模型策略,通过含23000余次滚动的实验证实安全需独立于任务成功评估,微调可提升安全表现但仍存差距。
ORCA:基于可观测性的微服务故障程序修复
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 ORCA是基于可观测性的微服务故障修复流水线,通过遥测数据提炼故障特征定位候选位置,经多智能体生成补丁并通过遥测验证器评估,在575案例基准中成本效益优于所有基线。
KHiM-Mamba:通过隐藏状态调制将病理知识注入Mamba以用于 whole slide image(WSI)分析
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本研究提出KHiM-Mamba架构,通过将病理知识注入Mamba的选择性状态空间机制,解决纯视觉驱动的WSI分析问题,在4类任务的11个公共基准上取得最优性能。
AnchorScore:一种基于CLIP的多模态大语言模型(MLLM)标注难度诊断方法
机构 * School of Foreign Studies, Changsha University of Science and Technology(长沙理工大学外国语学院) ; School of Education, Hunan Agricultural University(湖南农业大学教育学院) ; School of Information and Intelligence, Hunan Agricultural University(湖南农业大学信息与智能科学学院)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 本文提出基于CLIP的AnchorScore,可低成本预先对类别按MLLM标注难度排名,在课堂行为、动作识别等数据上与MLLM准确率相关性高,可用于混合路由、提示消歧等场景。
Comments 37 pages, 7 figures, 12 tables
刻画政府服务的智能体泛滥问题
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 该研究定义了政府服务的智能体泛滥问题,基于84起案例数据集分析其广泛存在性,开发风险矩阵评估高风险服务,梳理政府应对措施并推荐兼顾公平的缓解方案。
Comments To appear in the proceedings of the 9th AAAI Conference on AI, Ethics, and Society (AIES), October 12-14, 2026
AI模型生命周期的用户侧:来自Keep4o运动的证据
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 本研究以Keep4o运动为案例,通过分析X平台6万余条帖子,发现AI模型技术更迭未必是用户侧的有效替换,用户体验应纳入AI模型生命周期管理。
Comments 32 pages, 5 figures, 6 tables
AutoSQL:从大规模代码仓库中的命令式ORM代码提取SQL模板
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 AutoSQL是从大规模Go仓库的命令式ORM代码提取SQL模板的系统,采用代码索引、混合上下文检索策略,在基准测试中召回率优于现有方法。
Comments Accepted to ASE '26
从“假设”到“事实”:面向视觉脑解码的反事实思维启发语义对齐
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 提出ConceptAlign框架,通过反事实语义对齐解决视觉脑解码的语义错误问题,在自然场景数据集上相比MindEye2提升了重构、语义区分等指标。
Comments Under Review
MEDR:基于多信号事件建模与动态重评分的查询无关帧选择
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 该研究提出无需训练的MEDR帧选择方法,通过多信号事件建模与动态重评分实现查询无关,在Video-MME等基准上提升了多模态大语言模型的长视频处理准确率,且帧集可跨问题复用。
Comments 9 pages, 2 figures, 3 tables
STINER:从X平台自动提取战略网络威胁情报
专题命中 评测与基准 :large language model(abstract);language model(abstract)
AI总结 该研究针对社交媒体CTI提取难题,提出STINER分类体系与语料库,经测试DarkBERT等领域适配编码器表现最优,还利用STINER-DarkBERT完成了2025年上半年欧洲威胁态势分析。
Comments Accepted at RAID 2026 (29th International Symposium on Research in Attacks, Intrusions and Defenses)
破坏模型以测试评判器:面向领域类图语义评估器的变异测试方法
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 该研究针对领域类图语义评估器,提出一种变异测试方法,通过注入语义缺陷生成变体并评估评判器检测缺陷的能力,其结果与人工评估基本一致,可作为语义评判器分析的可扩展替代方案。
Comments Paper accepted at the ACM/IEEE 29th International Conference on Model Driven Engineering Languages and Systems (MODELS 2026)
LegacyWorld:面向遗留工作流的GUI智能体的原子性感知评估
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 该研究开发LegacyUse框架以自动化遗留工作流,构建含28个Windows GUI工作流的基准,采用原子性评估6款计算机使用智能体,发现不同操作特征并提出相关首要要求。
Comments Accepted for publication in the Industry Track of the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), 14-18 September 2026, Benevento, Italy
注定要反复标注:ImageNet的故事
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 本文针对ImageNet-1k数据集的标签噪声问题,构建ReImageNet数据集,采用人机协作反复优化的标注流程,使模型准确率显著提升,相关资源已公开。
Comments 25 pages, 16 figures, 8 tables. Project page: https://vrg.fel.cvut.cz/reimagenet
超越简化:用于阅读障碍友好型教育文本中保真视觉可访问性的DFT-GEN
专题命中 评测与基准 :LLM(abstract,abstract_cn)
AI总结 本研究针对阅读障碍人群的教育文本,提出DFT-GEN框架,通过专属可访问性层兼顾信息保真与视觉可访问性,在双语考试条目上取得显著效果。
Comments Preprint. Code available at https://github.com/MorrisYUJQ/DFT-GEN