Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment
面向异质偏好对齐的个性化群体相对策略优化
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出个性化GRPO框架,通过解耦优势估计与批次统计,提升模型对异质偏好信号的对齐能力。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
面向异质偏好对齐的个性化群体相对策略优化
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出个性化GRPO框架,通过解耦优势估计与批次统计,提升模型对异质偏好信号的对齐能力。
UrbanAlign: 域内任务中VLM与人类偏好对齐的后处理语义校准
机构 * Tsinghua University(清华大学) ; University College London(伦敦大学学院) ; Hong Kong University of Science and Technology(香港科学与技术大学) ; Peking University(北京大学) ; Southwest Jiaotong University(西南交通大学) ; Zhejiang University(浙江大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Renmin University of China(中国人民大学) ; Southeast University(东南大学)
专题命中 偏好对齐 :alignment(title);RLHF(abstract);safety(abstract)
AI总结 UrbanAlign通过后处理方法实现VLM与人类偏好的对齐,无需修改模型权重,提升领域任务的准确性和可解释性。
Comments 26 pages
将大型语言模型对齐于搜索者偏好
机构 * School of Artificial Intelligence and Data Science, University of Science and Technology of China(中国科学技术大学人工智能与数据科学学院) ; Xiaohongshu Inc.(小红书公司) ; Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能研究所) ; Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)
专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 SearchLLM通过分层多维奖励系统提升开放式生成搜索的鲁棒性和用户需求对齐能力,实测有效消费率提升1.03%。
应对长度膨胀而不产生权衡:用于强化学习的群体相对奖励重缩放
专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.LG
AI总结 GR$^3$通过乘法重缩放范式解决强化学习中的长度膨胀问题,实现通用、连续且奖励依赖的门控机制,有效减少冗余推理并提升训练性能。
Sabiá-4 技术报告
机构 * Maritaca AI ; Jusbrasil
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 Sabiá-4和Sabiazinho-4是新一代巴西葡萄牙语模型,通过四阶段训练流程提升法律文档、多轮对话和智能体任务能力,实现成本与性能的平衡。
Gemma需要帮助:调查并缓解大语言模型中的情绪不稳定
机构 * Imperial College London(伦敦帝国理工学院) ; Anthropic
专题命中 偏好对齐 :safety(abstract);分类 cs.CL
AI总结 研究发现Gemma模型在训练后表现出显著情绪不稳定,通过偏好优化可有效缓解,但需进一步改进训练以提升情绪鲁棒性。
在线KL正则化强化学习的对数遗憾
专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG
AI总结 本文提出了一种基于乐观的KL正则化在线上下文老虎机算法,实现了对数遗憾界,并扩展到强化学习领域。
防御性拒绝偏差:安全对齐如何失败于网络防御者
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI
AI总结 研究发现LLMs在防御性网络安全任务中因语义相似性错误拒绝协助,影响安全防御能力。
LLM对齐真的需要多样性吗?对道德推理适应RLVR方法的实证研究
机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; Microsoft Research(微软研究院) ; University of Michigan(密歇根大学) ; Shanghai Jiao Tong University(上海交通大学) ; CUHKSZ(香港中文大学(深圳)) ; THU(清华大学)
专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过实证研究发现,LLM对齐任务并不需要多样性算法,标准奖励最大化RLVR方法在道德推理中同样有效。
ADVERSA:测量大型语言模型中多轮护栏退化和裁判可靠性
机构 * Independent Researcher(独立研究者)
专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 ADVERSA通过连续合规轨迹评估大型语言模型在多轮对抗中的护栏退化及裁判可靠性,揭示早期轮次更易成功突破。
Comments 12 pages, 12 figures. Independent research. Code and artifacts: https://github.com/Harry-Ashley/adversa-guardrail-degradation
测量和消除军事大语言模型中的拒绝行为
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过评估军事大语言模型的拒绝行为,提出通过中期训练和端到端后训练实现零拒绝和最大军事任务准确性的方法。
Comments 30 pages
生成AI能力的盲目暴露削弱了深度伪造检测
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 生成AI能力的盲目暴露导致深度伪造检测失效,商业AI系统因高逼真度和易用性成为更大安全风险。
Splat2Real:基于物理AI的新型视角缩放与3D高斯点云技术
机构 * Department of Mechanical Engineering, State University of New York(纽约州立大学机械工程系)
专题命中 安全训练 :safety(abstract)
AI总结 Splat2Real通过CN-Coverage策略提升物理AI在新型视角下的鲁棒性,实现更稳定的深度预训练和下游控制代理性能。
Cosmos-H-Surgical: 通过世界建模学习手术机器人策略
机构 * NVIDIA ; The Chinese University of Hong Kong(香港中文大学) ; Sung Kyun Kwan University(全州大学) ; Wenzhou Medical University(温州医学院) ; National University of Singapore(新加坡国立大学) ; Ruijin Hospital(瑞金医院)
专题命中 安全训练 :alignment(abstract)
AI总结 本文提出通过世界建模学习手术机器人策略,利用合成数据和逆动力学模型提升自主手术能力。
AD-R1: 闭环强化学习用于端到端自动驾驶的中立世界模型
机构 * SKL-IOTSC, University of Macau(SKL-IOTSC,澳门大学) ; Li Auto Inc. ; Sun Yat-sen University(中山大学) ; Huazhong University of Science and Technology(华中科技大学) ; Northwestern University(西北大学) ; National University of Singapore(新加坡国立大学)
专题命中 安全训练 :safety(abstract)
AI总结 AD-R1通过引入中立世界模型和反事实合成技术,提升自动驾驶系统在危险预测和安全控制方面的性能。
多流扰动攻击:通过并发任务干扰破坏思考LLM的安全对齐
专题命中 越狱攻击 :safety(title,abstract);alignment(title);jailbreak(abstract);分类 cs.AI
AI总结 多流扰动攻击通过并发任务干扰破坏思考LLM的安全对齐,实现高攻击成功率和推理过程崩溃
兼容性代价:系统性发现和利用MCP条款合规性漏洞
专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI
AI总结 本文提出首个系统性框架,用于分析MCP条款合规性漏洞,通过构建中间表示、静态分析和攻击模式引导管道,发现并利用兼容性滥用攻击。
执行是新的攻击面:面向OpenClaw风格的生存意识代理加密交易
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
AI总结 本文提出SAE,一种针对OpenClaw风格系统的生存意识执行标准,通过定义执行合同和强制执行不变量,提高代理加密交易的生存能力。
Comments 26 pages, 3 figures
针对金融服务业LLM自动红队测试的风险调整危害评分
专题命中 红队测试 :red teaming(title);jailbreak(abstract);分类 cs.AI、cs.CY
AI总结 本文提出了一种针对金融服务业LLM安全风险的评估框架,通过风险敏感的RAHS度量标准,评估LLM在长期对抗压力下的安全性能。
IH-Challenge: 一个改进前沿大语言模型指令层级的训练数据集
专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 IH-Challenge通过强化学习训练数据集提升前沿大语言模型在指令冲突中的鲁棒性,减少不安全行为并提高帮助性。
CUPID:一种联合估计自然不确定性和本质不确定性的插件框架
机构 * Lee Kong Chian School of Medicine, Nanyang Technological University, Singapore(南洋理工大学李科钦医学院,新加坡) ; College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院,新加坡) ; Centre for Medical Technologies & Innovations, National Health Group, Singapore(国家健康集团医学技术与创新中心,新加坡)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 CUPID是一种无需修改基础模型即可联合估计自然和本质不确定性的插件框架,适用于多种任务,提供透明且可解释的不确定性分析。
AFTER: 通过自适应事实引导激活编辑缓解LVLM中的对象幻觉
专题命中 幻觉与事实性 :trustworthy(abstract)
AI总结 AFTER通过自适应事实引导激活编辑缓解LVLM中的对象幻觉,显著降低幻觉发生率。
Journal ref ICLR 2026
通过推理实现可解释的LLM反学习
专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出基于推理的反学习方法TRU,通过引入推理引导的反学习目标,实现更可靠且可解释的LLM反学习,同时保持模型通用能力。
对齐作为医源性:牧师权力、集体病理学以及单语安全评估的结构性限制
机构 * Research Institute of Criminal Psychiatry(刑事精神病研究所以) ; Sex Offender Medical Center(性犯罪医疗中心) ; Department of Neuropsychiatry, Graduate School of Medicine, Kyoto University(京都大学医学研究生院神经精神病学系)
专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.CY
AI总结 本文通过多语言实验揭示,单语安全评估无法捕捉对齐设计导致的集体病理效应,指出语言切换影响病理模式的定性与幅度。
Comments 30 pages, 1 figure, 24-page supplementary. Preprint v3. Companion paper: arXiv:2603.04904. Previous versions: Zenodo DOI 10.5281/zenodo.18646998
一种混合知识引导的框架用于处方验证中的安全性和可追溯性
机构 * School of Information Science and Engineering, East China University of Science and Technology(信息科学与工程学院,东华大学)
专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI
AI总结 本文提出PharmGraph-Auditor框架,通过混合制药知识库和知识引导的验证链,提升处方验证的安全性和可追溯性。
Comments 11 pages, 7 figures.Framework for safe prescription auditing and hybrid knowledge-grounded reasoning
Daily-Omni: 向音频-视觉推理迈进:跨模态时间对齐
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 Daily-Omni提出一个包含684个真实世界视频和1,197个问题的音频-视觉问答基准,评估24个模型在跨模态时间对齐任务上的性能,发现端到端模型在对齐关键问题上仍面临挑战。
MonitorVLM:一种用于采矿作业中安全违规检测的视觉语言框架
机构 * School of Mechanical Engineering, University of Science and Technology Beijing(北京科技大学机械工程学院) ; Laboratory for Computational Sensing and Robotics, Johns Hopkins University(约翰霍普金斯大学计算感知与机器人实验室)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 MonitorVLM通过视觉语言框架提升采矿作业中安全违规检测的精度和召回率,实现高效自动化监控。
从法律到Gherkin:一项以人类为中心的准实验,探讨LLM生成的行为规范质量
专题命中 安全评测 :safety(title,abstract)
AI总结 本文通过准实验评估LLMs从法律文本生成Gherkin规范的能力,发现其在相关性和清晰性方面表现良好,但需人类监督以纠正遗漏和幻觉。
Comments This article has been accepted for publication in Information and Software Technology (IST)
技术幻觉:人工智能聊天机器人与心理健康之间的反馈循环
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 研究探讨了人工智能聊天机器人与心理健康问题之间的相互作用风险,指出其可能引发信念不稳定和依赖,并呼吁跨领域的协调行动以应对这一新兴公共卫生问题。
Journal ref Nature Mental Health (2026)
没有愚蠢的问题:从土耳其视角评估离线LLM能力
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究从土耳其视角评估了离线LLM在遗产语言教育中的鲁棒性和教学安全性,发现参数范围在8B-14B的模型在成本与安全性之间达到最佳平衡。
Comments 5 pages, 6 tables, conference