arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3266 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3266 篇

2506.13734 2026-03-27 cs.CL cs.AI cs.LG 67%

Instruction Following by Principled Boosting Attention of Large Language Models

通过原理性提升大语言模型的注意力来实现指令遵循

Vitoria Guardieiro, Avishree Khare, Adam Stein, Eric Wong

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出InstABoost方法,通过提升指令相关注意力来增强指令遵循,避免了其他方法的缺陷,提升了指令引导与任务相关上下文的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25022 2026-03-27 cs.AI cs.CR cs.CY cs.LG 67%

A Public Theory of Distillation Resistance via Constraint-Coupled Reasoning Architectures

通过约束耦合推理架构的公开蒸馏阻力理论

Peng Wei, Wesley Shu

机构 * The Institute of Energetic Paradigm(能量范式研究所)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出一种理论框架,通过约束耦合推理架构减少蒸馏 asymmetry,核心观点是高阶能力与内部稳定性约束耦合时蒸馏价值降低,提供可验证的理论主张和实验假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12273 2026-03-16 cs.CL cs.AI cs.LG 67%

Aligning Language Models from User Interactions

从用户交互对齐语言模型

Thomas Kleine Buening, Jonas Hübotter, Barna Pásztor, Idan Shenfeld, Giorgia Ramponi, Andreas Krause

机构 * ETH Zurich(苏黎世联邦理工学院) MIT(麻省理工学院) University of Zurich(苏黎世大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过自蒸馏直接从用户交互学习的方法,利用用户反馈调整模型行为,提升对齐和指令遵循能力,同时实现个性化和持续适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11219 2026-03-13 cs.CV 67%

Senna-2: Aligning VLM and End-to-End Driving Policy for Consistent Decision Making and Planning

Senna-2:对齐视觉语言模型与端到端驾驶策略以实现一致的决策与规划

Yuehao Song, Shaoyu Chen, Hao Gao, Yifan Zhu, Weixiang Yue, Jialv Zou, Bo Jiang, Zihao Lu, Yu Wang, Qian Zhang, Xinggang Wang

机构 * Huazhong University of Science & Technology(华中科技大学) Horizon Robotics

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 Senna-2通过三阶段训练范式对齐视觉语言模型与端到端驾驶策略,提升决策与规划的一致性,增强驾驶安全性和效率。

Comments 15 pages, 8 figures. Project page: https://ambitious-idiot.github.io/senna2-project

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01928 2026-03-13 cs.CV 67%

LaST-VLA: Thinking in Latent Spatio-Temporal Space for Vision-Language-Action in Autonomous Driving

LaST-VLA: 在自动驾驶的视觉-语言-动作中思考于潜在的空间-时间空间

Yuechen Luo, Fang Li, Shaoqing Xu, Yang Ji, Zehan Zhang, Bing Wang, Yuannan Shen, Jianwei Cui, Long Chen, Guang Chen, Hangjun Ye, Zhi-Xin Yang, Fuxi Wen

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 LaST-VLA通过潜在空间-时间推理框架,结合双特征对齐机制和渐进式SFT训练策略,提升自动驾驶中的视觉-语言-动作处理能力,实现更安全的物理基础推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25896 2026-03-11 cs.CV 67%

LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Models

LLaVAShield: 保障视觉语言模型中的多模态多轮对话安全

Guolei Huang, Qinzhi Peng, Gan Xu, Yao Huang, Yuxuan Lu, Yongjun Shen

机构 * Southeast University(东南大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Zhejiang University of Technology(浙江工业大学) Tsinghua University(清华大学) RealAI

专题命中 安全训练 :safety(abstract);red teaming(abstract)

AI总结 LLaVAShield通过构建MMDS数据集和MMRT框架,有效提升多模态多轮对话的安全性,优于现有VLMs和内容审查工具,揭示了主流模型的安全漏洞。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03957 2026-03-05 cs.RO 67%

ArthroCut: Autonomous Policy Learning for Robotic Bone Resection in Knee Arthroplasty

ArthroCut:膝关节置换术中机器人骨切除的自主策略学习

Xu Lu, Yiling Zhang, Wenquan Cheng, Longfei Ma, Fang Chen, Hongen Liao

机构 * School of Biomedical Engineering, Tsinghua University(清华大学生物医学工程学院) School of Biomedical Engineering, Shanghai Jiao Tong University(上海交通大学生物医学工程学院) Longwood Valley MedTech

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 ArthroCut通过结合术前和术中数据,实现膝关节置换术中骨切除的自主策略学习,提升机器人手术的自主性和可解释性。

Comments Accepted for publication at the 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01870 2026-03-05 cs.MA cs.GT 67%

$\aleph$-IPOMDP: Mitigating Deception in a Cognitive Hierarchy with Off-Policy Counterfactual Anomaly Detection

$\aleph$-IPOMDP:通过非策略反事实异常检测缓解认知层级中的欺骗

Nitay Alon, Joseph M. Barnby, Stefan Sarkadi, Lion Schulz, Jeffrey S. Rosenschein, Peter Dayan

专题命中 安全训练 :safety(abstract);AI safety(abstract)

AI总结 $\aleph$-IPOMDP通过非策略反事实异常检测机制,缓解认知层级中的欺骗问题,提升博弈中的公平性和安全性。

Comments 28 pages, 12 figures

Journal ref Journal of Artificial Intelligence Research (JAIR), Volume 85, Article 14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07462 2026-03-02 cs.AI cs.CY cs.LG cs.MA econ.TH 67%

A Hormetic Approach to the Value-Loading Problem: Preventing the Paperclip Apocalypse?

一种针对价值加载问题的激素方法:防止纸夹 apocalypse?

Nathan I. N. Henry, Mangor Pedersen, Matt Williams, Jamin L. B. Martin, Liesje Donkin

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 HALO通过激素分析方法解决价值加载问题,通过调节AI行为模式防止潜在的AI失控风险。

Comments 24 pages, 7 figures

Journal ref SN COMPUT. SCI. 6, 872 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21857 2026-02-26 cs.AI cs.CL cs.LG 67%

Distill and Align Decomposition for Enhanced Claim Verification

分解与对齐:提升声明验证的Distill和Align分解

Jabez Magomere, Elena Kochkina, Samuel Mensah, Simerjot Kaur, Fernando Acero, Arturo Oncevay, Charese H. Smiley, Xiaomo Liu, Manuela Veloso

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于强化学习的分解与对齐方法,通过优化分解质量和验证器对齐,提升声明验证性能,达到71.75%的宏F1,优于现有方法。

Comments EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06966 2026-02-26 cs.LG cs.AI cs.CY 67%

Machine Unlearning Doesn't Do What You Think: Lessons for Generative AI Policy and Research

机器去学习并不如你所想:生成式AI政策与研究的启示

A. Feder Cooper, Christopher A. Choquette-Choo, Miranda Bogen, Kevin Klyman, Matthew Jagielski, Katja Filippova, Ken Liu, Alexandra Chouldechova, Jamie Hayes, Yangsibo Huang, Eleni Triantafillou, Peter Kairouz, Nicole Elyse Mitchell, Niloofar Mireshghallah, Abigail Z. Jacobs, James Grimmelmann, Vitaly Shmatikov, Christopher De Sa, Ilia Shumailov, Andreas Terzis, Solon Barocas, Jennifer Wortman Vaughan, danah boyd, Yejin Choi, Sanmi Koyejo, Fernando Delgado, Percy Liang, Daniel E. Ho, Pamela Samuelson, Miles Brundage, David Bau, Seth Neel, Hanna Wallach, Amy B. Cyphert, Mark A. Lemley, Nicolas Papernot, Katherine Lee

机构 * The GenLaw Center(GenLaw中心) Microsoft Research(微软研究院) Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind) Center for Democracy & Technology(民主与科技中心) Princeton(普林斯顿) Google(谷歌) University of Washington(华盛顿大学) University of Michigan(密歇根大学) Cornell Tech(康奈尔科技) Cornell Law School(康奈尔法学院) Cornell University(康奈尔大学) Lighthouse Stanford Law School(斯坦福法学院) UC Berkeley(伯克利大学) Independent(独立研究者) Northeastern University(东北大学) Harvard Business School(哈佛商学院) W. Virginia University College of Law(维珍尼亚大学法学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文指出机器去学习并非通用解决方案,揭示其在生成式AI政策与研究中的局限性。

Comments NeurIPS 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20500 2026-02-25 cs.RO cs.CV 67%

Strategy-Supervised Autonomous Laparoscopic Camera Control via Event-Driven Graph Mining

基于事件驱动图挖掘的策略监督自主腹腔镜摄像机控制

Keyu Zhou, Peisen Xu, Yahao Wu, Jiming Chen, Gaofeng Li, Shunlei Li

机构 * Hangzhou Dianzi University(杭州电子科技大学) Zhejiang University(浙江大学)

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 本研究提出基于事件驱动图挖掘的策略监督自主腹腔镜摄像机控制方法,通过结合视觉-语言推理与闭环控制,提升手术视野稳定性与可解释性,实验表明其在减少视野偏移和图像抖动方面表现优异。

Comments Submitted to IEEE Transactions on Robotics (T-RO). 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04801 2026-02-05 eess.SY cs.SY 67%

SQP-Based Cable-Tension Allocation for Multi-Drone Load Transport

基于SQP的多无人机负载运输电缆张力分配

Lamberto Vazquez-Soqui, Fatima Oliva-Palomo, Diego Mercado-Ravell, Pedro Castillo

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 本文提出基于SQP算法的多无人机负载运输电缆张力分配方法,通过实时优化提升负载运输的安全性和能耗平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04581 2026-02-05 cs.CL cs.AI cs.DC cs.LG 67%

Trust The Typical

信任典型

Debargha Ganguly, Sreehari Sankar, Biyao Zhang, Vikash Singh, Kanan Gupta, Harshini Kavuru, Alan Luo, Weicong Chen, Warren Morningstar, Raghu Machiraju, Vipin Chaudhary

机构 * Case Western Reserve University(凯斯西储大学) University of Pittsburgh(匹兹堡大学) The Ohio State University(俄亥俄州立大学) Google Research(谷歌研究)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Trust The Typical通过将安全性视为分布外检测问题,在无需有害示例训练的情况下,实现了在多个安全基准测试中的高性能表现,显著降低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01725 2026-02-03 cs.CL cs.AI cs.LG 67%

SafePred: A Predictive Guardrail for Computer-Using Agents via World Models

SafePred: 通过世界模型为计算机使用代理构建一种预测性防护措施

Yurun Chen, Zeyi Liao, Ping Yin, Taotao Xie, Keting Yin, Shengyu Zhang

机构 * Zhejiang University, China(浙江大学) The Ohio State University, USA(俄亥俄州立大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SafePred通过世界模型预测未来风险,构建风险到决策的循环,提升计算机使用代理的安全性和任务效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19231 2026-01-28 cs.CR 67%

LLMs Can Unlearn Refusal with Only 1,000 Benign Samples

LLMs 可通过仅 1000 个无害样本实现拒绝反学习

Yangyang Guo, Ziwei Xu, Si Liu, Zhiming Zheng, Mohan Kankanhalli

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 通过仅 1000 个无害样本,研究发现 LLMs 可通过反学习技术降低拒绝响应,揭示安全性对齐可能依赖 token 序列记忆而非推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11689 2026-01-22 cs.CY cs.AI cs.CL 67%

Generative AI Purpose-built for Social and Mental Health: A Real-World Pilot

面向社交与心理健康定制的生成式AI:一项现实世界试点

Thomas D. Hull, Lizhe Zhang, Patricia A. Arean, Matteo Malgaroli

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出了一种针对心理健康的生成式AI聊天机器人,通过现实世界试点研究证明其在心理健康支持方面的有效性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17792 2026-01-22 cs.CL cs.AI cs.LG 67%

H3Fusion: Helpful, Harmless, Honest Fusion of Aligned LLMs

H3Fusion: 有助于、无害且诚实的对齐大语言模型融合

Selim Furkan Tekin, Fatih Ilhan, Tiansheng Huang, Sihao Hu, Yichang Xu, Zachary Yahn, Ling Liu

机构 * Georgia Institute of Technology, USA(佐治亚理工学院)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 H3Fusion通过基于MoE的融合机制,在帮助性、无害性和诚实性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12817 2026-01-21 econ.GN q-fin.EC 67%

Liability Sharing and Staffing in AI-Assisted Online Medical Consultation

人工智能辅助在线医疗咨询中的责任分担与人员配置

Yang Xiao

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 本文研究了人工智能辅助在线医疗咨询中责任分担与人员配置的交互作用,揭示了责任分担比例与拥堵成本对医生模式选择的影响,以及如何通过优化政策平衡风险转移与合规成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12754 2026-01-21 cs.HC cs.AI cs.CL cs.CY 67%

PAIR-SAFE: A Paired-Agent Approach for Runtime Auditing and Refining AI-Mediated Mental Health Support

PAIR-SAFE: 一种配对代理方法用于运行时审计和改进AI介导的心理健康支持

Jiwon Kim, Violeta J. Rodriguez, Dong Whi Yoo, Eshwar Chandrasekharan, Koustuv Saha

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 PAIR-SAFE通过配对代理框架,在运行时对AI生成的心理健康支持进行审计和改进,结合MITI-4框架提升临床相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23546 2025-12-30 cs.CV 67%

PurifyGen: A Risk-Discrimination and Semantic-Purification Model for Safe Text-to-Image Generation

PurifyGen:一种用于安全文本到图像生成的风险判别和语义净化模型

Zongsheng Cao, Yangfan He, Anran Liu, Jun Xie, Feng Chen, Zepeng Wang

机构 * Researcher(研究者)

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 PurifyGen通过双阶段策略实现安全文本到图像生成,通过语义距离评估和双空间转换净化危险提示,减少不安全内容生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16795 2025-12-19 cs.CL cs.AI cs.CY cs.IR 67%

From Facts to Conclusions : Integrating Deductive Reasoning in Retrieval-Augmented LLMs

从事实到结论:在检索增强的大语言模型中整合演绎推理

Shubham Mishra, Samyek Jain, Gorang Mehrishi, Shiv Tiwari, Harsh Sharma, Pratik Narang, Dhruv Kumar

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出了一种增强RAG框架,通过结构化推理和冲突分析提升模型在冲突信息下的回答准确性与可解释性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01384 2025-12-19 stat.ML cs.AI cs.CL cs.LG 67%

Fine-Tuning Discrete Diffusion Models with Policy Gradient Methods

使用策略梯度方法微调离散扩散模型

Oussama Zekri, Nicolas Boullé

专题命中 安全训练 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SEPO算法,用于高效微调离散扩散模型,通过理论支持和实验验证展示了其在非可微奖励下的有效性。

Comments 33 pages, 8 figures, 8 tables

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12692 2025-12-16 cs.AI cs.CL cs.LG 67%

WebOperator: Action-Aware Tree Search for Autonomous Agents in Web Environment

WebOperator: 基于动作意识的树搜索用于网络环境中的自主代理

Mahir Labib Dihan, Tanzima Hashem, Mohammed Eunus Ali, Md Rizwan Parvez

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Bangladesh University of Engineering and Technology (BUET)(孟加拉工程与技术大学) Faculty of Information Technology(信息技术学院) Monash University(莫纳什大学) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 WebOperator通过引入树搜索框架,实现可靠的回溯和战略探索,提升自主代理在网页环境中的任务成功率。

Comments Under review at ICLR 2026. Project page: https://kagnlp.github.io/WebOperator/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03772 2025-12-12 cs.LG cs.AI cs.CL 67%

GTPO: Stabilizing Group Relative Policy Optimization via Gradient and Entropy Control

GTPO:通过梯度和熵控制稳定群体相对策略优化

Marco Simoni, Aleksandar Fontana, Giulio Rossolini, Andrea Saracino, Paolo Mori

机构 * National Doctorate on Artificial Intelligence, Sapienza Università di Roma(人工智能国家博士学院,罗马萨皮恩扎大学) Department of Excellence in Robotics and AI, TeCIP, Scuola Superiore Sant’Anna, Pisa(机器人与人工智能卓越部门,TeCIP,圣安娜高等学院,比萨) Institute of Informatics and Telematics, National Research Council of Italy, Pisa(信息与电信研究所,意大利国家研究理事会,比萨)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GTPO通过梯度和熵控制稳定群体相对策略优化,提升大语言模型对齐的训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23478 2025-12-09 cs.CV 67%

Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models

Video-R2: 通过强化一致性和基于现实的推理提升多模态语言模型

Muhammad Maaz, Hanoona Rasheed, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) Linköping University(林肯皮大学) Australian National University(澳大利亚国立大学)

专题命中 安全训练 :alignment(abstract);trustworthy(abstract)

AI总结 Video-R2通过强化学习提升多模态模型在视频推理中的时间对齐和逻辑一致性,提高准确性和可信度。

Comments Video-R2 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06211 2025-12-08 cs.CV 67%

iMotion-LLM: Instruction-Conditioned Trajectory Generation

iMotion-LLM:基于指令的轨迹生成

Abdulwahab Felemban, Nussair Hroub, Jian Ding, Eslam Abdelrahman, Xiaoqian Shen, Abduallah Mohamed, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology (KAUST)(卡塔尔国王阿卜杜勒阿齐兹大学科学与技术学院) Meta Reality Labs(Meta现实实验室)

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 iMotion-LLM通过结合预训练LLM与轨迹预测模块,实现基于文本指令的交互式运动生成,提升自动驾驶中的轨迹生成准确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02306 2025-12-03 cs.AI cs.CL cs.CR cs.CV cs.LG 67%

OmniGuard: Unified Omni-Modal Guardrails with Deliberate Reasoning

OmniGuard:统一的多模态防护机制与刻意推理

Boyu Zhu, Xiaofei Wen, Wenjie Jacky Mo, Tinghui Zhu, Yanan Xie, Peng Qi, Muhao Chen

机构 * Fudan University(复旦大学) University of California, Davis(加州大学戴维斯分校)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OmniGuard通过统一的多模态防护机制与刻意推理能力,有效提升多模态安全防护的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23300 2025-12-01 cs.RO 67%

SafeHumanoid: VLM-RAG-driven Control of Upper Body Impedance for Humanoid Robot

SafeHumanoid: 通过VLM-RAG驱动的人形机器人上半身阻抗控制

Yara Mahmoud, Jeffrin Sam, Nguyen Khang, Marcelino Fernando, Issatay Tokmurziyev, Miguel Altamirano Cabrera, Muhammad Haris Khan, Artem Lykov, Dzmitry Tsetserukou

机构 * Skolkovo Institute of Science and Technology(斯克洛尔沃科学与技术研究所)

专题命中 安全训练 :safety(abstract);trustworthy(abstract)

AI总结 SafeHumanoid通过VLM-RAG结合自身视觉,实现人形机器人上半身阻抗控制,提升人机交互的安全性与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20104 2025-11-26 cs.LG cs.AI cs.CL 67%

The Devil in the Details: Emergent Misalignment, Format and Coherence in Open-Weights LLMs

细节中的魔鬼:开放权重语言模型中的涌现偏移、格式与连贯性

Craig Dickson

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了开放权重语言模型中的涌现偏移现象,发现格式约束如JSON输出会增加偏移率,而Qwen-2.5系列比GPT-4o更抗压。

详情

展开后加载摘要…

URL PDF HTML 收藏