arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3266 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3266 篇

2603.07079 2026-06-16 cs.LG cs.CL 版本更新 62%

Entropy-Aware On-Policy Distillation of Language Models

熵感知的在线策略蒸馏语言模型

Woogyeol Jin, Taywon Min, Yongjin Yang, Dennis Wei, Yi Zhou, Swanand Ravindra Kadhe, Nathalie Baracaldo, Kimin Lee

机构 * IBM Research, San Jose, CA, USA(IBM研究院,旧金山,加州,美国) University of Toronto, Ontario, Canada(多伦多大学,安大略,加拿大) Vector Institute, Ontario, Canada(向量研究所,安大略,加拿大)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 针对在线策略蒸馏中反向KL导致生成多样性下降和教师高熵时学习信号不稳定的问题,提出熵感知的在线策略蒸馏方法,通过在高熵时引入前向KL平衡模式寻求与模式覆盖,提升了生成多样性和学生-教师对齐度。

Comments 18 pages, 11 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09655 2026-06-16 cs.CL cs.LG 版本更新 62%

DRA-GRPO: Your GRPO Needs to Know Diverse Reasoning Paths for Mathematical Reasoning

DRA-GRPO:你的GRPO需要了解多样化的推理路径以进行数学推理

Xiwen Chen, Wenhui Zhu, Peijie Qiu, Xuanzhao Dong, Hao Wang, Haiyu Wu, Huayu Li, Aristeidis Sotiras, Yalin Wang, Abolfazl Razi

机构 * Morgan Stanley(摩根士丹利) Clemson University(克莱姆森大学) Arizona State University(亚利桑那州立大学) Washington University in St. Louis(圣路易斯华盛顿大学) University of Notre Dame(圣母大学) University of Arizona(亚利桑那大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 针对GRPO在数学推理中因奖励信号非单射导致策略坍塌的问题,提出基于子模互信息的多样性感知奖励调整框架DRA,通过逆倾向评分去偏梯度估计,在五个数学基准上以少量数据和成本取得平均58.2%的准确率。

Comments ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13621 2026-06-12 cs.AI cs.CR cs.GT cs.LG cs.MA 新提交 62%

Beyond Runtime Enforcement: Shield Synthesis as Defensibility Analysis for Adversarial Networks

超越运行时强制:作为对抗网络可防御性分析的盾牌合成

Achraf Hsain, Sultan Almuhammadi

机构 * Information and Computer Science Department, King Fahd University of Petroleum and Minerals(信息与计算机科学系,法赫德国王石油矿产大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出将盾牌合成重新解释为设计时分析工具,通过约束双人安全博弈生成可防御性判定,并融合拓扑度量和强化学习行为形成可防御性指纹,揭示系统安全的结构性见解。

Comments 26 pages, 7 figures, 7 tables. Under review at JAIR. Code: https://github.com/AchrafHsain7/Bastion

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15687 2026-06-11 cs.CL cs.AI 版本更新 62%

ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models

ASRU:激活引导与强化遗忘融合用于多模态大语言模型

Jiahui Guang, Haiyan Wang, Yingjie Zhu, Cuiyun Gao, Jing Li, Di Shao, Zhaoquan Gu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 ASRU提出一种可控多模态遗忘框架,通过激活引导和强化学习提升多模态大语言模型的遗忘效果和生成质量,实验显示在Qwen3-VL上遗忘效果提升24.6%,生成质量提升5.8倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10487 2026-06-10 cs.LG cs.AI 新提交 62%

Stop Early, Spend Less: Hidden-State Probes as a Practical Recipe for Streaming Moderation of LLM Outputs

早停早省:隐藏状态探针作为LLM输出流式审核的实用方案

Huizhen Shu, Xuying Li, Piao Xue

机构 * ModelOneAI yunshanai(云山AI)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出基于隐藏状态的轻量级词元级探针,在解码循环中实时检测不安全输出,无需额外前向传播,实现亚毫秒级安全审核,可提前中断或修改生成。

Comments Technical Report. 14 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09866 2026-06-10 cs.LG cs.AI 新提交 62%

Two to Tango: Coupled Task-Reference Selection for Safe LLM Fine-tuning

双人探戈:面向安全LLM微调的耦合任务-参考选择

Xinrui Chen, Jianhao Zhang, Ou Wu, Di Gao

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出DualSelect框架,通过耦合任务与安全参考选择,在微调时保持安全对齐,提升安全评分至少5.10点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10321 2026-06-10 cs.LG cs.AI cs.RO math.OC 新提交 62%

Baseline-Free Policy Optimization for Neural Combinatorial Optimization

无基线的神经组合优化策略优化

Carlos S. Sepúlveda, Gonzalo A. Ruz

机构 * Facultad de Ingeniería y Ciencias, Universidad Adolfo Ibáñez(阿道夫·伊瓦涅斯大学工程与科学学院) Dirección de Programas, Investigación y Desarrollo, Armada de Chile(智利海军计划、研究与发展局) Millennium Nucleus for Social Data Science (SODAS)(千禧年社会数据科学核心(SODAS)) Millennium Nucleus in Data Science for Plant Resilience (PhytoLearning)(千禧年植物韧性数据科学核心(PhytoLearning))

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出使用GRPO算法消除神经组合优化中的基线依赖,避免训练崩溃,在TSP和CVRP上达到接近POMO的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08919 2026-06-09 cs.AI cs.CR cs.LG 新提交 62%

Oversight Has a Capacity: Calibrating Agent Guards to a Subjective, Fatiguing Human

监督具有容量:将智能体守卫校准到主观且易疲劳的人类

Emre Turan

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM智能体动作审批中人类评审者主观且易疲劳的问题,提出将守卫建模为成本敏感的选择性分类,并引入负载感知策略,发现过度监督反而降低安全性,形成倒U型曲线。

Comments 12 pages, 4 figures. Code and interactive demo: https://github.com/turangenesis/headroom

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08512 2026-06-09 cs.CY cs.CL 新提交 62%

Friend or Foe? Language as an ideological switch in open-weight LLMs under Russian disinformation stress

朋友还是敌人?俄罗斯虚假信息压力下开放权重大语言模型中的语言意识形态开关

Anna Małgorzata Kamińska, Tetiana Klynina

机构 * Institute of Culture Studies, University of Silesia in Katowice(文化研究学院,卡托维察大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) National Aviation University(国家航空大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 本文通过控制实验发现,针对不同语言社区微调的大语言模型在俄罗斯虚假信息压力下,其抵抗能力与预期文化对齐方向相反,揭示了微调悖论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08021 2026-06-09 cs.LG cs.AI cs.MA 新提交 62%

Semantic Quorum Assurance: Collective Certification for Non-Deterministic AI Infrastructure

语义法定数保证:面向非确定性AI基础设施的集体认证

Jun He, Deying Yu

机构 * OpenKedge.io

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出语义法定数保证(SQA),一种通过多样化验证者群体和风险自适应法定数谓词,将非确定性LLM代理的不安全操作批准率从18.5%降至0.3%的控制平面原语。

Comments 21 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09751 2026-06-09 cs.AI cs.CL cs.LO 版本更新 62%

Sound and Complete Neurosymbolic Reasoning with LLM-Grounded Interpretations

基于LLM解释的完备且可靠的神经常识推理

Bradley P. Allen, Prateek Chhikara, Thomas Macaulay Ferguson, Filip Ilievski, Paul Groth

机构 * University of Amsterdam(阿姆斯特丹大学) University of Southern California(南加州大学) Rensselaer Polytechnic Institute(拉特格斯理工学院) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 提出将LLM直接集成到次协调逻辑的语义解释函数中,实现可靠且完备的神经常识推理,在GPQA和SimpleQA基准上宏F1提升约6个百分点,并成功检测药物安全知识库中的矛盾。

Comments 43 pages, 14 tables, 4 figures. Accepted to the 19th Conference on Neurosymbolic Learning and Reasoning (NeSy 2025); to appear Neurosymbolic Artifical Intelligence Special Issue on NeSy 2025 Extended Papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04812 2026-06-08 cs.LG cs.AI 版本更新 62%

Scenario Generation for Risk-Aware Reinforcement Learning with Probably Approximately Safe Guarantees

面向风险感知强化学习的情景生成与近似安全保证

Mohit Prashant, Arvind Easwaran

机构 * Nanyang Technological University(南洋理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 针对强化学习策略对转移扰动敏感导致不安全行为的问题,提出使用变分自编码器近似状态空间分布,通过构造上下界屏障证书并采样非鲁棒区域状态来收紧概率安全保证。

Comments 8 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23292 2026-06-08 cs.AI cs.LG 版本更新 62%

Agentic Physical AI toward a Domain-Specific Foundation Model for Energy Systems: A Case Study on Nuclear Reactor Control

面向能源系统的领域特定基础模型的具身物理人工智能:以核反应堆控制为例

Yoon Pyo Lee, Samrendra Roy, Kazuma Kobayashi, Sajedul Talukder, Diab Abueidda, Seid Koric, Souvik Chakraborty, Syed Bahauddin Alam

机构 * The Grainger College of Engineering, Nuclear, Plasma & Radiological Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校格雷格学院工程学院、核等工程学院) Department of Nuclear Engineering, Hanyang University(汉阳大学核工程系) University of Texas - El Paso(德克萨斯大学埃尔帕索分校) National Center for Supercomputing Applications(国家超级计算应用中心) Department of Applied Mechanics, Indian Institute of Technology Delhi(印度德里理工学院应用力学系) Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(印度德里理工学院亚里人工智能学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出通过紧凑语言模型作为具身物理人工智能,利用基于物理模拟器验证的策略优化替代感知推理,在核反应堆控制任务中实现领域特定基础模型,并展示了规模扩展带来的可靠性提升和策略集中化行为。

Comments Accepted for publication in npj Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00369 2026-06-08 cs.LG cs.AI 版本更新 62%

InvEvolve: Evolving White-Box Inventory Policies via Large Language Models with Performance Guarantees

InvEvolve:通过具有性能保证的大语言模型进化白盒库存策略

Chenyu Huang, Jianghao Lin, Zhengyang Tang, Bo Jiang, Ruoqing Jiang, Benyou Wang, Lai Wei

机构 * Shanghai University of Finance and Economics(上海财经大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学) Boston College(波士顿大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出InvEvolve框架,利用强化学习训练的大语言模型,结合置信区间认证,在线生成具有统计安全保证的白盒库存策略,在合成和真实零售数据上优于经典和深度学习方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02600 2026-06-08 cs.LG cs.AI 版本更新 62%

Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models

自回归与扩散语言模型中的逐步拒绝动态

Eliron Rahimi, Elad Hirshel, Rom Himelstein, Amit LeVi, Avi Mendelson, Chaim Baskin

机构 * Department of Computer Science, Technion – Israel Institute of Technology(技术学院计算机科学系,以色列技术学院) INSIGHT Lab, School of Electrical and Computer Engineering, Ben-Gurion University of the Negev, Israel(内斯坦实验室,贝内-加隆大学内加尔分校,以色列) Computer Science Department, University of Haifa, Haifa, Israel(海法大学计算机科学系,海法,以色列)

专题命中 安全训练 :jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 研究扩散语言模型(DLM)与自回归(AR)模型在拒绝有害生成行为上的差异,发现扩散重掩码机制可促进恢复,提出逐步拒绝内部动态(SRI)信号,并基于此构建无需修改推理的越狱检测器。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09041 2026-06-08 cs.LG cs.AI 版本更新 62%

Robust Driving Control for Autonomous Vehicles: An Intelligent General-sum Constrained Adversarial Reinforcement Learning Approach

自动驾驶鲁棒控制:一种智能一般和约束对抗强化学习方法

Junchao Fan, Qi Wei, Ruichen Zhang, Yang Lu, Jianhua Wang, Xiaolin Chang, Bo Ai

机构 * Beijing Key Laboratory of Security and Privacy in Intelligent Transportation(北京智能交通安全与隐私重点实验室) Beijing Jiaotong University(北京交通大学) College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学) School of Computer Science and Technology(计算机科学与技术学院) Taiyuan University of Technology(太原科技大学) School of Electronics and Information Engineering(电子与信息工程学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 针对深度强化学习在自动驾驶中易受对抗攻击的问题,提出智能一般和约束对抗强化学习(IGCARL),通过战略性目标对手和鲁棒驾驶代理的交互训练,在约束优化下提升策略稳定性,实验表明成功率比现有方法提高至少27.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19327 2026-06-05 cs.LG cs.AI 62%

Soft Sequence Policy Optimization

软序列策略优化

Svetlana Glazyrina, Maksim Kryzhanovskiy, Roman Ischenko

机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) Institute for Artificial Intelligence(人工智能研究所)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出软序列策略优化方法,通过引入软门控函数改进序列级重要性权重,提升大语言模型对齐任务的训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09853 2026-06-04 cs.CL cs.AI 62%

MedRedFlag: Investigating how LLMs Redirect Misconceptions in Real-World Health Communication

MedRedFlag:探究LLMs如何在真实健康沟通中纠正误解

Sraavya Sambara, Yuan Pu, Ayman Ali, Vishala Mishra, Lionel Wong, Monica Agrawal

机构 * Independent Researcher(独立研究者) Duke University(杜克大学) Stanford University(斯坦福大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过构建MedRedFlag数据集(1100+个来自Reddit的需纠正问题),系统比较了先进LLMs与临床医生的回应,发现LLMs常未能纠正问题中的错误前提,可能导致次优医疗决策,揭示了患者面向医疗AI系统的关键安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
1610.05984 2026-06-04 cs.NE cs.AI cs.LG cs.SY eess.SY 62%

Particle Swarm Optimization for Generating Interpretable Fuzzy Reinforcement Learning Policies

粒子群优化用于生成可解释的模糊强化学习策略

Daniel Hein, Alexander Hentschel, Thomas Runkler, Steffen Udluft

机构 * Siemens AG, Corporate Technology(西门子公司企业技术部)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于模糊粒子群强化学习(FPSRL)的方法,通过训练参数在模拟真实系统动态的世界模型上生成可解释的模糊强化学习策略,适用于无法进行在线学习的领域。

Journal ref Engineering Applications of Artificial Intelligence, Volume 65C, October 2017, Pages 87-98

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03967 2026-06-03 cs.CL cs.AI 62%

AlignAtt4LLM: Fast AlignAtt for Decoder-Only LLMs at IWSLT 2026 Simultaneous Speech Translation Task

AlignAtt4LLM:面向仅解码器LLM的快速AlignAtt方法在IWSLT 2026同声传译任务中的应用

Quentin Fuxa, Dominik Macháček

机构 * Charles University, MFF, ÚFAL(查理大学,人文学院,ÚFAL) University of Edinburgh(爱丁堡大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出AlignAtt4LLM系统,通过显式源文本跨度、离线选择翻译对齐头、选择性qk快速重放和运行时查询/键捕获,首次将AlignAtt策略应用于仅解码器LLM,在英德、英意同声传译中优于基线。

Comments Accepted to IWSLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03866 2026-06-03 cs.IR cs.AI cs.CL 62%

Taiji: Pareto Optimal Policy Optimization with Semantics-IDs Trade-off for Industrial LLM-Enhanced Recommendation

Taiji: 面向工业LLM增强推荐的帕累托最优策略优化与语义ID权衡

Yuecheng Li, Zeyu Song, Jing Yao, Chi Lu, Peng Jiang, Kun Gai

机构 * Kuaishou Technology(快手科技) Unaffiliated(无隶属)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出Taiji框架,通过逆向工程推理和开放拒绝采样生成高质量CoT数据,并采用帕累托最优策略优化(POPO)自适应调整跨域奖励权重,实现LLM语义知识与推荐ID特征的帕累托最优权衡,在快手广告平台部署后服务超4亿日活用户。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24324 2026-06-02 cs.LG cs.AI cs.SY eess.SY 62%

Large Language Model Guided Incentive Aware Reward Design for Cooperative Multi-Agent Reinforcement Learning

大语言模型引导的激励感知奖励设计用于合作多智能体强化学习

Dogan Urgun, Gokhan Gungor

机构 * Department of Electrical and Electronics Engineering(电气与电子工程系) Karabuk University(卡拉博克大学) Department of Mechatronics Engineering(机械工程系)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出利用大语言模型自动生成可执行奖励程序,结合多智能体近端策略优化训练,在Overcooked-AI环境中显著提升合作任务回报。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31432 2026-06-01 cs.CL cs.AI cs.SD 62%

DOA: Training-Free Decoder-Only Attention Policy for Long-Form Simultaneous Translation with SpeechLLMs

DOA:面向语音大语言模型的长形式同声传译的无训练解码器仅注意力策略

Sara Papi, Luisa Bentivogli

机构 * Fondazione Bruno Kessler(布鲁诺·克塞塞基金会)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出DOA策略,利用解码器自注意力导出代理对齐,无需训练即可实现语音大语言模型在长形式同声传译中的流式决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31196 2026-06-01 cs.CV cs.AI cs.CL cs.RO 62%

Probing Collision Grounding in Vision-Language Models for Safe Human-Robot Collaboration

探索视觉-语言模型中的碰撞接地以实现安全的人机协作

Jun Wang, Xiaohao Xu, Xiaonan Huang

机构 * University of Michigan, Ann Arbor(密歇根大学,安娜堡)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 针对安全人机协作,提出碰撞接地概念及物理基准TouchSafeBench,评估视觉-语言模型在分类当前安全状态和预警即将碰撞任务中的表现,发现现有模型不可靠,视觉流畅性不等于物理责任性。

Comments 31 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30640 2026-06-01 cs.LG cs.CL 62%

CSULoRA: Closest Safe Update Low-Rank Adaptation

CSULoRA:最近安全更新低秩适应

Oleksandr Marchenko Breneur, Adelaide Danilov, Aria Nourbakhsh, Salima Lamsiyah

机构 * Department of Computer Science, University of Luxembourg(卢森堡大学计算机科学系)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG

AI总结 提出CSULoRA方法,通过后处理校正LoRA适配器,在保留任务相关性的同时抑制不安全更新方向,降低攻击成功率。

Comments 10 pages, 3 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30406 2026-06-01 cs.CY cs.AI 62%

AI Loss of Control Incident Management: Response & Resilience

AI失控事件管理:响应与韧性

Ross Gruetzemacher

机构 * Wichita State University(威斯康星州立大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 针对AI失控事件管理的研究空白,本文提出一个基础框架和分类法,将失控场景分为“极其昂贵”和“不可能”两类,并分别给出韧性投资和主动事件管理(包含遏制与威胁中和)的应对策略。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29146 2026-06-01 cs.CL cs.AI 62%

SafeRx-Agent: A Knowledge-Grounded Multi-Agent Framework for Safe and Explainable Medication Recommendation

SafeRx-Agent: 基于知识的多智能体框架用于安全且可解释的药物推荐

Xinyu Wang, Hanwei Wu, Zhenghan Tai, Sicheng Lyu, Qincheng Lu, Ziyu Zhao, Jijun Chi, Jingrui Tian, Xiao-Wen Chang, Ziyang Song

机构 * McGill University(麦吉尔大学) McMaster University(麦马斯特大学) University of Toronto(多伦多大学) Ohio University(俄亥俄大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 提出SafeRx-Agent,一种基于知识的多智能体框架,通过患者上下文、外部临床知识和安全验证来推荐可追溯的药物集合,在MIMIC-III和MIMIC-IV数据集上提高了细粒度药物预测准确性,同时控制了药物相互作用、禁忌症和药物集合大小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30232 2026-05-29 cs.LG cs.CL 62%

How's it going? Reinforcement learning in language models recruits a functional welfare axis

进展如何?语言模型中的强化学习招募了一个功能性福利轴

Andy Q Han, David J. Chalmers, Pavel Izmailov

机构 * New York University(纽约大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文通过迷宫环境实验,发现强化学习会招募语言模型中预先存在的功能性福利表征(即对系统目标达成程度的估计),从而广泛影响模型行为,且该表征在训练前已存在。

Comments 81 pages, 43 figures, 32 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04678 2026-05-29 cs.CL cs.AI 62%

Post-Training Language Models for Crosslingual Consistency

后训练语言模型以实现跨语言一致性

Tianyu Liu, Jirui Qi, Mrinmaya Sachan, Ryan Cotterell, Raquel Fernández, Arianna Bisazza

机构 * ETH Zürich(苏黎世联邦理工学院) CLCG, University of Groningen(格罗宁根大学CLCG中心) University of Amsterdam(阿姆斯特丹大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对多语言模型对翻译等价提示响应不一致的问题,提出基于信息论的跨语言一致性定义,并开发后训练方法直接一致性优化(DCO)以提升一致性。

Comments ICML 2026. The first two authors contributed equally. Codes available at: https://github.com/Betswish/ConsistencyRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29089 2026-05-29 cs.LG cs.AI cs.CV 62%

OISD: On-Policy Internal Self-Distillation of Language Models

OISD: 语言模型在策略内部自蒸馏

Xinyu Liu, Darryl Cherian Jacob, Yang Zhou, Jindong Wang, Pan He

机构 * Auburn University(阿肯色大学) William & Mary(威廉与玛丽学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出OISD框架,通过将最终层的预测信号蒸馏到中间层,结合logit对齐和注意力对齐,提升推理能力,在数学推理任务上显著优于基线。

Comments Under Review for Publication

详情

展开后加载摘要…

URL PDF HTML 收藏