Learning Latent Reasoning Traces for Scalar Reward Models End-to-End
学习标量奖励模型的端到端潜在推理轨迹
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL
AI总结 针对奖励模型范式不匹配问题,提出LatentRM框架,将推理轨迹作为潜在变量端到端优化,在多任务上优于各类基准奖励模型。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
学习标量奖励模型的端到端潜在推理轨迹
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL
AI总结 针对奖励模型范式不匹配问题,提出LatentRM框架,将推理轨迹作为潜在变量端到端优化,在多任务上优于各类基准奖励模型。
ConnectED:面向越南教学课程规划与学生学习的课程对齐AI系统
专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.AI
AI总结 该研究提出以人为本的AI系统ConnectED,基于VietEduQwen构建,支持越南教育完整教学生命周期,经评估其准确率优于基准模型,可缩短教师备课时间且获师生高满意度。
工具规格很重要:揭示和缓解AI智能体中的安全风险
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Beihang University(北京航空航天大学) ; Tsinghua University(清华大学)
专题命中 安全训练 :safety(title,abstract);prompt injection(abstract);分类 cs.AI
AI总结 本研究发现模式格式工具规格是AI智能体安全下降的主因,提出SafeKeep防护措施,可提升有害请求弃权率、降低攻击成功率,性能优于现有防护且保留任务处理能力。
不要混合奖励,要混合策略:多奖励强化学习的策略分解与优化
机构 * Fundation Model Research Center, CASIA(中国科学院自动化研究所基础模型研究中心) ; School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) ; College of Automotive and Energy Engineering (CAEE), Tongji University(同济大学汽车与能源工程学院)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本研究针对多奖励RL的对齐税问题,提出PRISM框架,通过策略分解优化正、负策略,在三类任务上优于基线并具备推理可控性。
将大型语言模型中的知识蒸馏为用于自主网络操作的轻量级强化学习智能体
机构 * Royal Military College of Canada(加拿大皇家军事学院) ; Defence Research and Development Canada(加拿大国防研究与发展部) ; Polytechnique Montreal(蒙特利尔理工学院)
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 该研究针对自主网络操作中强化学习智能体训练不稳定的问题,通过提示工程证明80亿参数网络安全LLM性能优于基线RL智能体,再经在线策略蒸馏将其防御知识迁移至仅64910参数的轻量级RL智能体,为前沿网络安全模型的实用化提供了可行方案。
现实世界临床护理中的推理:为何大型语言模型(LLM)尚不适合自主临床决策支持
机构 * Atman Labs(阿特曼实验室) ; Oxford University Hospitals(牛津大学医院) ; University of Oxford(牛津大学) ; NIHR Oxford Biomedical Research Centre(英国国立卫生研究院牛津生物医学研究中心) ; Imperial College London(伦敦帝国理工学院) ; Technical University of Munich(慕尼黑工业大学) ; Massachusetts General Hospital(麻省总医院) ; Mass General Brigham(麻省总医院布里格姆医疗系统) ; Harvard Medical School(哈佛医学院) ; Barts Health NHS Trust(巴特保健国民保健信托基金会) ; the University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文指出,尽管LLM在医学考试和部分病例推理上表现出色,但因存在信息收集缺陷等问题,尚不适合用于无医生参与的自主临床分诊。
Comments 3 figures
基于因子化转移效应的潜在动作在智能体模糊性下的研究
机构 * Brown University(布朗大学)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 针对多物体或干扰场景中动作源模糊问题,提出观测转移因子化(OTF)方法,将转移分解为稀疏的观测转移基元,并构建OTF-LAM模型,在逆向前向动力学框架下抽象出动作潜变量,实现零样本迁移和下游策略学习。
Comments Project Page: https://hazel-heejeong-nam.github.io/LAM/
从C到地道Rust:Theseus之船智能体翻译
专题命中 安全训练 :safety(abstract)
AI总结 本文提出一种智能体AI驱动的结构化C到Rust迁移工作流,先生成语义保留的非地道Rust基线,再逐步重写为地道Rust,经12.5千行代码的iodine验证可实现可靠迁移。
ScopeJudge:用于进攻性安全代理的成本感知预执行门控
专题命中 安全训练 :safety(abstract)
AI总结 研究进攻性安全代理中预执行门控,引入ScopeJudge数据集,含4897个工具调用。评估八个法官模型在五种转录策略下表现,发现静态策略不足,推荐成本敏感和召回优先操作点,以支持自主安全代理的实时监控和可扩展监督。
Comments 22 pages, 4 figures, 4 tables, 1 link to code, 1 link to dataset
通过基于运动约束的动作预测来引导无人机群
专题命中 安全训练 :safety(abstract)
AI总结 本文提出了一种基于动态窗口方法的三维引导控制律,通过预测自主无人机群的行为来提高引导效率,考虑了运动约束下的可行运动候选生成和评估。
耦合策略下约束多智能体强化学习的分布式原始对偶算法
专题命中 安全训练 :safety(abstract)
AI总结 研究耦合环境下的约束多智能体强化学习,针对现有方法不足,提出智能体采用依赖邻居状态和参数的耦合策略及分布式可扩展原始对偶算法,证明算法收敛性,仿真验证其优于现有算法。
CPInj:揭示文本协作式提示优化中的提示注入风险
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; McMaster University(麦斯特大学)
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI
AI总结 研究文本协作式提示优化(TCPO)中提示注入风险,提出协作式提示注入攻击CPInj,用恶意指令污染全局提示,降低下游任务性能,现有防御方法无效;还提出防御导向聚合方法APAgg,实验表明TCPO存在关键漏洞,攻击有待更强大防御。
Comments Accepted by COLM 2026 and AI4GOOD workshop
利用感知能力:针对多模态大语言模型智能体的隐蔽并发音频提示注入攻击
专题命中 提示注入 :prompt injection(title,abstract)
AI总结 该研究针对多模态LLM智能体提出隐蔽并发音频提示注入攻击,构建首个相关基准并评估多款智能体,还提出CADV防御机制,经实验验证攻击有效且防御可靠。
Comments 19 pages, 8 figures, The code is publicly available at https://github.com/Limax666/AudioAgentSecurity
编译AI:基于LLM的工作流自动化确定性代码生成
机构 * XY.AI Labs, Palo Alto, CA(XY.AI实验室,帕洛阿尔托) ; Stanford University School of Medicine, Stanford, CA(斯坦福大学医学院,斯坦福) ; Cornell University, Department of Computer Science, Ithaca, NY(康奈尔大学计算机科学系,伊萨卡) ; Brigham and Women’s Hospital / Harvard Medical School, Boston, MA(布莱根妇女医院/哈佛医学院,波士顿)
专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI
AI总结 本文研究编译AI,一种大语言模型在编译阶段生成可执行代码,随后工作流确定性执行的范式。重点探讨其在高风险企业工作流中的应用,尤其在医疗领域,强调可靠性与可审计性。
Comments 14 pages, 2 figures, 3 tables
基于验证感知架构的大语言模型辅助情报、监视与侦察集群任务级运行时保障
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 研究大语言模型辅助的ISR集群任务级运行时保障问题,提出三层组合式运行时验证框架,将任务策略分解,通过验证感知架构聚合判定并融合代数,能检测个体合规但集群违规情况,模拟任务验证了其有效性。
论用于思维链忠实性的引导向量的泛化性
机构 * University of Virginia(弗吉尼亚大学) ; University of Delaware(特拉华大学) ; Poseidon Research(波塞冬研究院)
专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 该研究针对三个模型探究提升思维链忠实性的引导向量的泛化性,发现其效果主要由评估设置决定,且仅对最大型模型有效,引导可减少未被确认的提示使用。
TerraNova:人类世的基础模型
机构 * Politecnico di Milano(米兰理工大学) ; RFF-CMCC European Institute on Economics and the Environment (EIEE)(RFF-CMCC欧洲经济与环境研究所) ; Euro-Mediterranean Center on Climate Change (CMCC)(欧洲地中海气候变化中心)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG
AI总结 TerraNova是适配原生几何的基础模型,融合地球物理与社会数据,可重建密集场、适配未见变量,兼具地理空间编码能力与国家层面功能。
Comments 32 pages, 16 figures. Supplementary Information (full methodological specification, ablation programme, extended results, computational cost; 157 pages) available at the project page: https://carlosrodriguezpardo.es/projects/TerraNova/
Think2Go:基于大语言模型推理的生成式下一个兴趣点(POI)推荐
专题命中 幻觉与事实性 :alignment(abstract)
AI总结 Think2Go框架统一SFT与RL推理,通过优势加权机制校准策略优化,解决现有POI推荐模型的意图捕捉不足问题,提升推荐性能与稳健性。
Comments Accepted by KDD 2026 Research Track Cycle 1 (Oral presentation)
当安全成为漏洞:利用LLM对齐同质性进行可转移阻塞在RAG中
专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);prompt injection(abstract)
AI总结 TabooRAG通过利用LLM对齐同质性,在黑盒环境下实现跨模型的可转移阻塞攻击,针对安全对齐机制提出新型攻击框架。
Comments Expanded the scale of the experimental evaluation
EvalSafetyGap:LLM评估-安全失败的混合调查与概念框架
机构 * Erciyes University(埃里切耶大学) ; Abdullah Gül University(阿卜杜勒拉赫曼·古尔大学)
专题命中 安全评测 :safety(title,abstract);alignment(abstract,comments);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对LLM评估与AI安全中基准分数与潜在属性不一致的测量问题,提出混合调查与概念框架,并通过十模型审计揭示能力与鲁棒性关联不显著、安全差距主要由治理因素驱动。
Comments 74 pages, 2 figures, 4 tables. Hybrid systematic survey and conceptual framework on LLM evaluation and AI-safety failures, synthesizing 373 primary studies (2018-2026). Introduces the EvalSafetyGap framework (Instability Decomposition, Alignment Trilemma) and reports an exploratory ten-model audit. Submitted as a review/survey article; not currently under consideration elsewhere
安全,还是仅仅是能力?智能体安全基准的有效性审计
专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.AI
AI总结 该研究审计了R-Judge等四个智能体安全基准的有效性,发现其排名分歧源于小样本偏差,能力与对齐错误安全负相关,AgentHarm与越狱安全的关联为收敛效度而非通用安全,强调安全主张需明确关键要素。
对齐是局部的:用户侧说服下GUI智能体的配对诊断
专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract)
AI总结 本文通过配对诊断发现GUI智能体的提示级对齐是局部现象,一行防护栏可大幅降低单次ASR,但四轮升级链会使其防护效果下降,静态单轮ASR高估了实际部署的鲁棒性。
模式0:面向路侧计算单元辅助安全通信的新型3GPP V2X资源分配类别
专题命中 安全评测 :safety(title,abstract)
AI总结 针对现有3GPP V2X资源分配框架中基站与车辆UE二元分类的结构性缺陷,提出以路侧计算单元(RCU)为核心实体的新模式0,通过集成感知、通信与计算能力,实现高密度交通场景下的低延迟安全通信,并利用MAPPO仿真验证了其性能优势。
Comments v4: substantial restructure; new sections on institutional authority, escalation security, and pool sizing; title revised; references expanded to 34. 44 pages, 7 figures, 4 tables
超越组件测试:验证智能体AI系统
机构 * University of Messina(墨西拿大学)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI
AI总结 该综述综合257篇相关文献,构建五维分类法分析智能体AI系统验证问题,指出现有方法的缺口,提出面向生命周期的研究议程,主张需在上下文中验证智能体轨迹以实现可信部署。
Comments 61 pages, 3 figures, to be submitted to Springer Artificial Intelligence Review
基准并非单一整体:面向大语言模型评估的样本级审计与编排
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出样本级审计的元评估框架,标注五大基准的内部异质性,可编排复合基准子集实现模型能力针对性评估,为基准重组提供原则性方法。
LLMs 是否坚持其价值观?MANTA:一个用于动物福利推理的多轮对抗性基准
机构 * SPAR ; Compassion Aligned Machine Learning(同情对齐机器学习) ; NUS(新加坡大学) ; Mila(Mila研究所) ; ERA Cambridge(剑桥ERA)
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG
AI总结 提出 MANTA 基准,通过多轮对抗性对话评估大语言模型在动物福利推理中的价值观稳定性和道德敏感性,发现单轮基准无法捕捉的排名变化和物种-压力交互效应。
苏格拉底测试的理论基础:动态、多模态、对话式考试
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 本文提出苏格拉底测试的理论基础,整合多类教育评估原则与分类学,量化最近发展区并设计非补偿性加法评分架构,以解决传统评估的缺陷并提升测量可靠性。
Comments 21 pages, 1 figure, submitted to Computers and Education: Artificial Intelligence
老年人认知障碍检测与管理的技术进展:趋势、挑战与未来方向
机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) ; T-Systems ICT India Pvt. Ltd.(德国电信系统印度信息通信技术私人有限公司)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 本文综合老年人认知障碍检测与管理的技术进展,提出跨学科分类法等成果,指出现有模型多依赖小数据集,展望了可信多模态纵向验证系统的发展前景。
GRU、LSTM与Transformer编码器在自动驾驶系统分类中的敏感性分析
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文研究GRU、LSTM、Transformer编码器对Level 2级自动驾驶系统的分类性能,提出含5类损坏的鲁棒性评估框架,发现时间抖动会大幅降低三类模型的宏F1。
Comments 7 pages, 6 figures, under review Milcom 2026
DRIP-R:零售领域决策与推理在现实政策模糊性下的基准测试
机构 * Interdisciplinary Transformation University Austria(跨学科转型大学奥地利) ; Amazon Berlin(亚马逊柏林)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 DRIP-R基准测试通过现实零售政策模糊性构建无唯一正确解决方案的场景,评估LLM在模糊政策下的决策与推理能力,揭示其固有的系统性挑战。
Comments 10 pages