Learning Latent Reasoning Traces for Scalar Reward Models End-to-End
学习标量奖励模型的端到端潜在推理轨迹
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL
AI总结 针对奖励模型范式不匹配问题,提出LatentRM框架,将推理轨迹作为潜在变量端到端优化,在多任务上优于各类基准奖励模型。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
学习标量奖励模型的端到端潜在推理轨迹
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL
AI总结 针对奖励模型范式不匹配问题,提出LatentRM框架,将推理轨迹作为潜在变量端到端优化,在多任务上优于各类基准奖励模型。
ConnectED:面向越南教学课程规划与学生学习的课程对齐AI系统
专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.AI
AI总结 该研究提出以人为本的AI系统ConnectED,基于VietEduQwen构建,支持越南教育完整教学生命周期,经评估其准确率优于基准模型,可缩短教师备课时间且获师生高满意度。
工具规格很重要:揭示和缓解AI智能体中的安全风险
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Beihang University(北京航空航天大学) ; Tsinghua University(清华大学)
专题命中 安全训练 :safety(title,abstract);prompt injection(abstract);分类 cs.AI
AI总结 本研究发现模式格式工具规格是AI智能体安全下降的主因,提出SafeKeep防护措施,可提升有害请求弃权率、降低攻击成功率,性能优于现有防护且保留任务处理能力。
不要混合奖励,要混合策略:多奖励强化学习的策略分解与优化
机构 * Fundation Model Research Center, CASIA(中国科学院自动化研究所基础模型研究中心) ; School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) ; College of Automotive and Energy Engineering (CAEE), Tongji University(同济大学汽车与能源工程学院)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本研究针对多奖励RL的对齐税问题,提出PRISM框架,通过策略分解优化正、负策略,在三类任务上优于基线并具备推理可控性。
将大型语言模型中的知识蒸馏为用于自主网络操作的轻量级强化学习智能体
机构 * Royal Military College of Canada(加拿大皇家军事学院) ; Defence Research and Development Canada(加拿大国防研究与发展部) ; Polytechnique Montreal(蒙特利尔理工学院)
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 该研究针对自主网络操作中强化学习智能体训练不稳定的问题,通过提示工程证明80亿参数网络安全LLM性能优于基线RL智能体,再经在线策略蒸馏将其防御知识迁移至仅64910参数的轻量级RL智能体,为前沿网络安全模型的实用化提供了可行方案。
现实世界临床护理中的推理:为何大型语言模型(LLM)尚不适合自主临床决策支持
机构 * Atman Labs(阿特曼实验室) ; Oxford University Hospitals(牛津大学医院) ; University of Oxford(牛津大学) ; NIHR Oxford Biomedical Research Centre(英国国立卫生研究院牛津生物医学研究中心) ; Imperial College London(伦敦帝国理工学院) ; Technical University of Munich(慕尼黑工业大学) ; Massachusetts General Hospital(麻省总医院) ; Mass General Brigham(麻省总医院布里格姆医疗系统) ; Harvard Medical School(哈佛医学院) ; Barts Health NHS Trust(巴特保健国民保健信托基金会) ; the University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文指出,尽管LLM在医学考试和部分病例推理上表现出色,但因存在信息收集缺陷等问题,尚不适合用于无医生参与的自主临床分诊。
Comments 3 figures
从C到地道Rust:Theseus之船智能体翻译
专题命中 安全训练 :safety(abstract)
AI总结 本文提出一种智能体AI驱动的结构化C到Rust迁移工作流,先生成语义保留的非地道Rust基线,再逐步重写为地道Rust,经12.5千行代码的iodine验证可实现可靠迁移。
论用于思维链忠实性的引导向量的泛化性
机构 * University of Virginia(弗吉尼亚大学) ; University of Delaware(特拉华大学) ; Poseidon Research(波塞冬研究院)
专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 该研究针对三个模型探究提升思维链忠实性的引导向量的泛化性,发现其效果主要由评估设置决定,且仅对最大型模型有效,引导可减少未被确认的提示使用。
TerraNova:人类世的基础模型
机构 * Politecnico di Milano(米兰理工大学) ; RFF-CMCC European Institute on Economics and the Environment (EIEE)(RFF-CMCC欧洲经济与环境研究所) ; Euro-Mediterranean Center on Climate Change (CMCC)(欧洲地中海气候变化中心)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG
AI总结 TerraNova是适配原生几何的基础模型,融合地球物理与社会数据,可重建密集场、适配未见变量,兼具地理空间编码能力与国家层面功能。
Comments 32 pages, 16 figures. Supplementary Information (full methodological specification, ablation programme, extended results, computational cost; 157 pages) available at the project page: https://carlosrodriguezpardo.es/projects/TerraNova/
Think2Go:基于大语言模型推理的生成式下一个兴趣点(POI)推荐
专题命中 幻觉与事实性 :alignment(abstract)
AI总结 Think2Go框架统一SFT与RL推理,通过优势加权机制校准策略优化,解决现有POI推荐模型的意图捕捉不足问题,提升推荐性能与稳健性。
Comments Accepted by KDD 2026 Research Track Cycle 1 (Oral presentation)
安全,还是仅仅是能力?智能体安全基准的有效性审计
专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.AI
AI总结 该研究审计了R-Judge等四个智能体安全基准的有效性,发现其排名分歧源于小样本偏差,能力与对齐错误安全负相关,AgentHarm与越狱安全的关联为收敛效度而非通用安全,强调安全主张需明确关键要素。
对齐是局部的:用户侧说服下GUI智能体的配对诊断
专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract)
AI总结 本文通过配对诊断发现GUI智能体的提示级对齐是局部现象,一行防护栏可大幅降低单次ASR,但四轮升级链会使其防护效果下降,静态单轮ASR高估了实际部署的鲁棒性。
超越组件测试:验证智能体AI系统
机构 * University of Messina(墨西拿大学)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI
AI总结 该综述综合257篇相关文献,构建五维分类法分析智能体AI系统验证问题,指出现有方法的缺口,提出面向生命周期的研究议程,主张需在上下文中验证智能体轨迹以实现可信部署。
Comments 61 pages, 3 figures, to be submitted to Springer Artificial Intelligence Review
基准并非单一整体:面向大语言模型评估的样本级审计与编排
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出样本级审计的元评估框架,标注五大基准的内部异质性,可编排复合基准子集实现模型能力针对性评估,为基准重组提供原则性方法。
苏格拉底测试的理论基础:动态、多模态、对话式考试
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 本文提出苏格拉底测试的理论基础,整合多类教育评估原则与分类学,量化最近发展区并设计非补偿性加法评分架构,以解决传统评估的缺陷并提升测量可靠性。
Comments 21 pages, 1 figure, submitted to Computers and Education: Artificial Intelligence
老年人认知障碍检测与管理的技术进展:趋势、挑战与未来方向
机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) ; T-Systems ICT India Pvt. Ltd.(德国电信系统印度信息通信技术私人有限公司)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 本文综合老年人认知障碍检测与管理的技术进展,提出跨学科分类法等成果,指出现有模型多依赖小数据集,展望了可信多模态纵向验证系统的发展前景。
GRU、LSTM与Transformer编码器在自动驾驶系统分类中的敏感性分析
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文研究GRU、LSTM、Transformer编码器对Level 2级自动驾驶系统的分类性能,提出含5类损坏的鲁棒性评估框架,发现时间抖动会大幅降低三类模型的宏F1。
Comments 7 pages, 6 figures, under review Milcom 2026
用于红外视觉语言模型定向语义攻击的QR结构化热触发装置
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本研究提出QR-STT框架,作为隐蔽黑盒攻击手段,可定向操控IR-VLMs的语义对齐,其扰动还能跨任务迁移,凸显了对该类攻击进行鲁棒性评估的必要性。
ModelEquivBench:LLM生成优化模型的多关系验证评估系统
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 该研究提出多关系评估系统ModelEquivBench,将其用于评估GPT-5.4等三个LLM生成的优化模型,发现不同模型在特征不同阶段失败,无法简化为单一准确率分数。
Comments 9 pages, 2 figures, 3 tables
IyawoBench v2.0:尼日利亚基层医疗中大型语言模型临床分诊的扩展诊断评估
专题命中 安全评测 :safety(abstract);分类 cs.CY
AI总结 IyawoBench v2.0评估尼日利亚基层医疗的大型语言模型临床分诊,提出含三类失效模式的框架及新指标,发现前沿模型存缺陷,最优模型随部署场景变化,为中低收入国家临床AI选择提供基准。
更快但不同:加速多模态扩散语言模型中的内容漂移诊断与控制
机构 * School of Mathematics and Statistics, Beijing Institute of Technology(北京理工大学数学与统计学院) ; Zhejiang University(浙江大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 该研究针对加速多模态扩散语言模型的内容漂移问题,通过实验诊断出漂移源于过期状态,提出缩短KV缓存刷新区间的控制方法,在1.3倍加速时实现近乎完全一致,且未发现事实错误差异。
Comments 9 pages, 4 figures, 6 tables. Preprint
基准测试并非验证:金融大语言模型应用的系统级视角
机构 * Prometeia S.p.A.(普罗米特亚公司)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 该研究指出金融大语言模型不能仅靠基准测试验证,提出需从系统全栈进行多层验证,还讨论了LLM-as-a-judge的应用与控制措施,强调要研究系统感知基准等相关方向。
大型语言模型(LLMs)的财务推理是否可信?针对长期财务报表的现实测试
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 该研究针对LLMs的财务推理可信度,构建含对抗陷阱的FinIndices基准测试,发现其存在知识与结构瓶颈,监督微调可部分恢复结构化逻辑。
Comments The FinIndices dataset is publicly available at https://huggingface.co/datasets/User158072/Finindice
智能体AI中的OpenClaw与Ollama:迈向完全自主且可扩展的AI智能体系统
机构 * University of the Peloponnese(伯罗奔尼撒大学) ; Cornell University(康奈尔大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 该研究提出智能体AI的分层架构,分析OpenClaw与Ollama组成的全栈系统,验证系统集成可提升智能体能力,指出相关挑战并提供路线图,所有资源公开以支持研究。
FairFund-Bench:评估大语言模型资源分配中的分配偏差
机构 * University of Toronto(多伦多大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 FairFund-Bench基准通过调整审计格式等特征,发现LLM资源分配的偏差受审计类型影响,且因果框架效应强于人口统计效应,可用于评估LLM的分配偏差。
Comments 19 pages, 7 figures. Code and data: https://github.com/martinlukk/fairfund-bench
采用异构压缩客户端的联邦基础模型微调
机构 * The Hong Kong Polytechnic University(香港理工大学) ; OceanBase, Ant Group(蚂蚁集团OceanBase) ; School of Management, Xi’an Jiaotong University(西安交通大学管理学院) ; School of Mathematics and Statistics, Xidian University(西安电子科技大学数学与统计学院) ; School of Computer Science, Wuhan University(武汉大学计算机学院) ; School of Computer Science, China University of Geosciences(中国地质大学计算机学院)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 针对基础模型联邦学习的资源不对称问题,提出FedSLM框架,通过SVD分解等技术实现异构压缩客户端的联邦微调,实验显示其在多基准上优于现有基线且客户端内存需求更低。
培养智能体工程师:AI时代的课程、协作与持续学习
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 针对AI时代软件与系统工程的转型需求,本文提出ACCEL框架,构建智能体工程师的教育架构,明确核心能力与实施路径,识别风险并主张开展系统性教育变革。
ParaASR:面向快速长上下文基于大语言模型的语音识别的多令牌预测
机构 * StepFun(阶跃星辰) ; NTU(南洋理工大学) ; PKU(北京大学) ; UNSW(新南威尔士大学) ; SJTU(上海交通大学) ; USTC(中国科学技术大学)
专题命中 AI治理与伦理 :safety(abstract)
AI总结 ParaASR是一款基于大语言模型的ASR系统,通过多令牌预测技术,在保持低错误率、低延迟的同时,支持32K长上下文及30分钟音频的快速转录,兼顾识别质量、速度与上下文长度。
Comments 14 pages, 3 figures, 4 tables
裁决式字幕生成:用于严格零样本图像字幕生成的多智能体对齐评分与共识蒸馏束仲裁
机构 * AI Platform OneNexus, OneMount(OneMount AI平台OneNexus) ; School of Electronic Engineering, Soongsil University(崇实大学电子工程学院) ; MoAdata(MoAdata公司) ; University of Economics Ho Chi Minh City (UEH)(胡志明市经济大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究提出裁决式字幕生成多智能体框架,通过多阶段对齐评分与共识蒸馏重排序,在不微调IFCap的情况下,显著提升COCO等数据集的零样本图像字幕生成性能,且可跨数据集迁移。
持久卷积:用于AI对齐测试和语义空间表征的拓扑框架
专题命中 其他安全 :alignment(title,abstract);分类 cs.LG
AI总结 本研究开发了一种基于拓扑的多模态对齐测试,以提升不透明AI模型部署、选择与比较的可解释性,助力AI对齐测试与语义空间表征。
Comments Code available at github.com/tylerashoff/persiscope (PyPI: persiscope)