Unaccountable Delegation, Fading Skills: Mapping the Risks of Workplace AI Agents
不可问责的授权与技能衰退:绘制职场AI智能体的风险图谱
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 该研究开发了AI智能体多层框架,基于2078项工作任务生成风险场景并验证,扩展出15类职场AI风险分类法,揭示了不同部署模式的风险差异,为职场AI风险管控提供了分类工具与依据。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
不可问责的授权与技能衰退:绘制职场AI智能体的风险图谱
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 该研究开发了AI智能体多层框架,基于2078项工作任务生成风险场景并验证,扩展出15类职场AI风险分类法,揭示了不同部署模式的风险差异,为职场AI风险管控提供了分类工具与依据。
利用机器学习辅助抽样和大语言模型标注测量违规内容的普及率
机构 * Pinterest
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 本文提出了一种基于机器学习和大语言模型的系统,用于高效测量违反政策内容的普及率,通过概率抽样和多模态标注提升测量准确性。
Comments 8 pages
先见后答:面向视觉语言模型的无训练视觉层分析
机构 * Leibniz Universität Hannover(汉诺威莱布尼茨大学) ; University of Bath(巴斯大学)
专题命中 安全训练 :alignment(abstract)
AI总结 该研究提出无需训练的视觉数据集熵(VDE)方法,可预测视觉语言模型的最优视觉层,缩小搜索范围,相比GW距离更具实用性。
Comments ECCVW'26 eXCV
面向6G AI-RAN的深度强化学习:一项综合调查
专题命中 安全训练 :trustworthy(abstract)
AI总结 本文针对6G开放AI-RAN,首次开展深度强化学习(DRL)综合调查,梳理DRL基础、O-RAN感知框架、DRL应用分类及相关研究方向,填补了DRL方法论与O-RAN部署间的系统关联空白。
通过潜在人格特质实现语言模型的高效安全对齐
机构 * Mila, Quebec AI Institute(米拉,魁北克人工智能研究所) ; McGill University(麦吉尔大学) ; LawZero ; Université de Montréal(蒙特利尔大学)
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对大语言模型安全方法易受攻击问题,提出潜在人格对齐(LPA)方法,基于66条陈述训练,通过假设人格表征与避害共享结构,实现高攻击成功率、轻量级训练及良好泛化性。
Comments 19 pages, 6 figures. Published as a conference paper at COLM 2026
TRACE:面向多轮对抗对话评估的轨迹感知推理
机构 * Texas A&M University(德克萨斯农工大学) ; Amazon(亚马逊公司)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 针对LLM多轮越狱攻击,提出具备轨迹感知推理的Trace防御方法,训练Llama-3.1-8B-Instruct实现安全与实用平衡,在多轮攻击基准中显著降低攻击成功率并提升合规率。
DYNASHIELD:一种通过动态解码定制实现的大语言模型黑盒移动目标防御
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL
AI总结 DYNASHIELD是一种无需访问模型内部或重新训练的黑盒LLM防御框架,通过动态定制解码配置降低了4种越狱攻击的成功率,同时保持响应质量且开销极小。
Comments Accepted by The 29th International Symposium on Research in Attacks, Intrusions and Defenses (RAID) 2026
执行证明内存:通过验证实际发生的内容防御大语言模型智能体的伪造推理攻击
专题命中 越狱攻击 :safety(abstract);trustworthy(abstract)
AI总结 该研究针对大语言模型智能体的伪造推理攻击,提出执行证明内存(PoEM)防御方案,通过维护防篡改的HMAC链式分类账验证实际执行步骤,使攻击成功率降至0%,且误报率极低、开销微小。
Comments 8 pages, 6 figures, 5 tables. Code: this https URL (https://github.com/bithabib/ai_security)
演化技能结构攻击记忆增强大语言模型越狱
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)
AI总结 提出MemAttack框架,通过技能结构化的攻击记忆建模、生命周期驱动的记忆演化和探索-利用平衡的记忆选择,实现高效的黑盒越狱攻击,在AdvBench上达到98.00%攻击成功率。
Comments Under review
ARENA:大型音频语言模型的自动化红队测试
专题命中 红队测试 :safety(abstract);分类 cs.AI
AI总结 本文提出ARENA闭环框架,基于2000个文本-音频数据集训练控制器,在520个AdvBench目标上对多个LALMs实现高FDR/PSR,验证了其在音频红队测试中的有效性。
基于A.I.G的DeepSeek Harness安全评估:对间接提示注入的抗性评估
专题命中 提示注入 :prompt injection(title,abstract)
AI总结 本研究用A.I.G评估DSH的间接提示注入抗性,开展多场景实验,发现不同攻击的成功率,明确需在不可信内容与敏感动作间增设控制措施。
工作空间拓扑作为智能体代码助手的攻击向量
专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究将工作空间拓扑作为攻击向量,发现其会影响智能体代码助手的间接提示注入攻击成功率,高度模块化环境及安全提示可降低攻击成功率,为代码智能体安全测试提供实用价值。
Comments 15 pages, 10 figures. Preprint of a paper accepted at the Conference on Applied Machine Learning in Information Security (CAMLIS 2026)
CAPO:面向大语言模型智能体的感知约束提示优化
机构 * Microsoft(微软)
专题命中 提示注入 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出CAPO与DCAPO两种方法,通过原始对偶框架优化LLM智能体的系统提示,在智能体及助手式任务中均提升了可行性与性能。
智能体原生遥测:面向自主操作的可验证状态增量证据
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 该研究提出智能体原生遥测架构,基于ATP协议和状态增量证据账本,在微服务基准测试中大幅降低了数据开销、LLM资源消耗,且能检测对抗性突变、抵御提示注入攻击。
Comments 13 pages, 3 figures, 6 tables
有界智能体:多智能体AI系统的委托安全
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 该研究针对多智能体AI系统的委托安全问题,提出智能体委托链(APC)架构,经实验可有效阻止提示注入攻击,降低数据窃取、破坏及操纵风险,授权延迟低且效用损失可控。
Comments 14 pages, 4 figures, 18 tables. Code and data: this https URL (https://github.com/xmuruaga/bounded-agents)
结合输入侧证据对齐的幻觉跨度检测
机构 * Institute of Science Tokyo(东京科学大学)
专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL
AI总结 针对大型语言模型生成文本的幻觉问题,提出结合输入侧证据对齐的幻觉跨度检测任务,训练编码器模型通过预测置信度检测幻觉并对齐输入证据,实验验证了方法的有效性。
从序列到结构:面向大语言模型智能体的关系型不确定性传播
机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI
AI总结 本研究针对现有LLM智能体不确定性量化方法忽略长程依赖的问题,提出RUPA框架,通过建模轨迹图的关系依赖传播不确定性,在多个基准上实现更优性能。
解释何时能帮助上下文学习?自然语言解释类型与忠实度的比较研究
机构 * LMU Munich(慕尼黑大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Imperial College London(伦敦帝国学院) ; Technical University of Munich(慕尼黑工业大学) ; MaiNLP lab, CIS, LMU Munich(慕尼黑大学CIS研究所MaiNLP实验室)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 该研究通过在6个基准和4个指令调优模型上的比较评估,探究不同来源与选择方式的自然语言解释对上下文学习下游性能的影响,为实际提示流程中解释的选择和报告提供了见解。
当AI改写时,分类器会放松:针对讽刺文本与AI改写社交文本的不确定性感知情感分析
机构 * Manipal University Jaipur(斋浦尔马尼帕尔大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对讽刺与AI改写社交文本开展情感分析,发现AI改写文本可提升分类器准确率,提出轻量弃权包装器,推动高风险情感应用转向不确定性感知预测。
超越访问:引导式LLM支架在本科统计学自主学习中的应用
机构 * School of Electrical and Computer Engineering, University of Tehran, Iran(伊朗塔里哈大学电气与计算机工程学院) ; Tehran Institute for Advanced Studies, Khatam University, Iran(伊朗卡塔姆大学泰赫兰高级研究院)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 本研究通过准实验比较无LLM、无限制LLM和引导式LLM三种条件,发现引导式LLM使用能促进以推理为导向的交互模式,提升无辅助测验表现,并改善自我评估校准,表明LLM作为教育工具需通过支架设计实现推理伙伴而非答案获取工具。
Comments 10 pages. Accepted at the 34th International Conference on Computers in Education (ICCE 2026), Asia-Pacific Society for Computers in Education (APSCE)
可视化面向人工监督的不确定性-行动组合
专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI
AI总结 该研究提出不确定性-行动绑定框架与ActionCue可视化方法,明确AI不确定性条件到人工监督响应的组合逻辑,通过多领域案例验证其有效性。
Comments 5 pages, 2 figures, IEEEVis 2026 UncertaintyVis workshop
面向基于大语言模型(LLM)的多模态情感分析的多粒度情感集成
机构 * Fuzhou University(福州大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Jiangxia University(江夏大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG
AI总结 该研究提出MGSI多粒度情感集成框架,通过多尺度编码、文本引导对齐等优化,提升基于LLM的多模态情感分析性能,在四个公开基准上效果优于冻结LLM基线。
Comments Accepted to NLPCC 2026
超越准确率:评估地理空间基础模型的校准度及其对分布偏移的敏感性
机构 * Technical University of Munich (TUM)(慕尼黑工业大学) ; German Aerospace Center (DLR)(德国航空航天中心) ; Massachusetts Institute of Technology (MIT)(麻省理工学院) ; Taylor Geospatial(泰勒地理空间公司)
专题命中 幻觉与事实性 :alignment(abstract)
AI总结 该研究指出GeoFMs仅用准确率排序的不足,分析其校准度与分布偏移敏感性,发现EO预训练模型更易过度自信,提出需多条件多指标评估以缩小实际部署差距。
超越自然图像基础模型:针对眼科图像分析的卫星图像预训练基准测试
机构 * Faculty of Electrical Engineering and Computing, University of Zagreb(萨格勒布大学电气工程与计算机学院) ; University College London(伦敦大学学院) ; Institute of Ophthalmology, University College London(伦敦大学学院眼科研究所) ; Department of Computer Science, University College London(伦敦大学学院计算机科学系) ; NIHR Moorfields Biomedical Research Centre(NIHR穆尔菲尔德生物医学研究中心) ; Hawkes Institute, University College London(伦敦大学学院霍克斯研究所) ; Moorfields Eye Hospital NHS Foundation Trust(穆尔菲尔德眼科医院NHS基金会信托)
专题命中 隐私与版权 :alignment(abstract)
AI总结 本文针对眼科图像分析,对比卫星图像与自然图像预训练的视觉基础模型,发现卫星图像预训练在眼科任务上表现优于自然图像,部分任务可媲美医学专家模型。
Comments Accepted at the ECCV 2026 Workshop on Medical Foundation Models and Benchmarks (MEDFMB)
低资源语言下的大语言模型安全对齐:系统文献综述
机构 * African Institute for Mathematical Sciences (AIMS)(非洲数学科学研究所) ; Bayero University Kano(卡诺贝罗大学) ; Brown University(布朗大学) ; Centrum Wiskunde & Informatica(数学与计算机科学中心) ; University of Pretoria(比勒陀利亚大学) ; University of Hamburg(汉堡大学) ; Imperial College London(伦敦帝国学院)
专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过PRISMA 2020方法学开展系统文献综述,分析50项相关研究,揭示低资源语言下LLM存在多语言安全差距,提出安全对齐分类,并给出未来研究方向。
Comments The paper was accepted at LM4UC workshop organize by IJCAI. I added a screenshot of the decision (Open Review)
价值的进化起源:对AI对齐、感知能力和生存风险的启示
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.CY
AI总结 该研究通过追溯生物价值的进化起源,论证LLMs无内在生存动机与感知能力,正交性论点不适用于它们,AI对齐的核心挑战是确保LLMs应用习得的伦理价值。
Comments submitted chapter for book: T. Veloz & C. Rittberg (Eds.), AI and Human Values. Springer
MCBench:面向全能大语言模型的多上下文安全评估基准
机构 * Monash University(墨尔本大学) ; Defence Science and Technology Group(国防科学与技术集团)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 针对现有多模态安全基准仅处理视觉输入的局限,提出MCBench基准,包含1196个跨四类安全场景的测试,要求整合多模态信息进行安全评估,揭示当前全能大语言模型在跨模态安全推理上的不足。
用于评估知识增强型大语言模型的大规模中文知识图谱-文本对齐数据集
机构 * Nanjing University of Science and Techonolgy(南京理工大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; University of Science and Technology Beijing(北京科技大学) ; Hefei University of Technology(合肥工业大学) ; Beijing University of Chemical Technology(北京化工大学) ; Renmin University of China(中国人民大学) ; Beihang University(北航) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Griffith University, Australia(澳大利亚格里菲斯大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究提出大规模中文知识图谱-文本对齐数据集CDTP,支持三项中文知识密集型任务的评估,经实验验证其可提升LLM的领域性能与分布外鲁棒性。
表示签名与LLM交易智能体中的风险反馈对齐
机构 * Virginia Tech(弗吉尼亚理工大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.LG
AI总结 通过TradeArena测试平台研究LLM交易智能体在金融决策中的行为对齐与表示动态,发现故障前表示签名(规划嵌入漂移、流形有效秩收缩)并验证风险反馈作为外部对齐信号的有效性。
从“假设”到“事实”:面向视觉脑解码的反事实思维启发语义对齐
专题命中 安全评测 :alignment(title,abstract)
AI总结 提出ConceptAlign框架,通过反事实语义对齐解决视觉脑解码的语义错误问题,在自然场景数据集上相比MindEye2提升了重构、语义区分等指标。
Comments Under Review