arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-03 至 2026-04-03 共收录 59 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 8 篇

2508.18649 2026-04-03 cs.CR cs.AI 89%

PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality

PRISM:面向多模态集成安全的原理化推理对齐

Nanxi Li, Zhengyue Zhao, G. Edward Suh, Marco Pavone, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) Cornell University(康奈尔大学) Stanford University(斯坦福大学) NVIDIA(英伟达)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);DPO(abstract);分类 cs.AI

AI总结 PRISM通过结构化四阶段推理过程,有效应对多模态安全违规,提升VLM的鲁棒性与安全性,同时保持模型实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01787 2026-04-03 cs.CL 83%

DEFT: Distribution-guided Efficient Fine-Tuning for Human Alignment

DEFT:基于分布的高效微调以实现人类对齐

Liang Zhu, Feiteng Fang, Yuelin Bai, Longze Chen, Zhexiang Zhang, Minghuan Tan, Min Yang

机构 * Southern University of Science and Technology(南方科技大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Science and Technology of China(中国科学技术大学) University of Copenhagen(哥本哈根大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL

AI总结 本文提出DEFT框架,通过数据过滤和分布引导提升模型对齐效率与泛化能力,减少训练时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14708 2026-04-03 econ.TH cs.AI cs.GT 79%

Human Misperception of Generative-AI Alignment: A Laboratory Experiment

人类对生成式人工智能对齐的误判:一项实验室实验

Kevin He, Ran Shorrer, Mengjia Xia

机构 * University of Pennsylvania(宾夕法尼亚大学) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 研究通过激励性实验室实验探讨人们在经济决策中对生成式人工智能对齐的感知,发现人们高估了生成式人工智能与人类选择的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02145 2026-04-03 cs.AI cs.CL 73%

MTI: A Behavior-Based Temperament Profiling System for AI Agents

MTI:一种基于行为的 temperament 评估系统用于 AI 代理

Jihoon Jeong

机构 * ModuLabs

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 MTI 评估系统,通过四个维度测量 AI 代理 temperament,发现行为差异与模型大小无关,揭示了 RLHF 对 temperament 的影响。

Comments 29 pages, 6 figures, 12 tables. Paper #3 in the Model Medicine Series (Paper #1: arXiv:2603.04722)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01576 2026-04-03 cs.LG 70%

Care-Conditioned Neuromodulation for Autonomy-Preserving Supportive Dialogue Agents

关怀条件神经调节用于自主性保留的支持性对话代理

Shalima Binta Manir, Tim Oates

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 偏好对齐 :alignment(abstract);harmlessness(abstract);分类 cs.LG

AI总结 本文提出Care-Conditioned Neuromodulation方法,通过状态依赖控制框架提升对话代理在支持性任务中的自主性保留能力,实验表明其在多轮对话中有效提升自主性支持与帮助性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01312 2026-04-03 cs.CL cs.AI 62%

Preference learning in shades of gray: Interpretable and bias-aware reward modeling for human preferences

灰度偏好学习:可解释且偏见意识的奖励建模用于人类偏好

Simona-Vasilica Oprea, Adela Bâra

机构 * Department of Economic Informatics and Cybernetics, Bucharest University of Economic Studies(布加勒斯特经济研究大学经济信息学与控制论系)

专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了语言模型中人类偏好的学习难题,提出特征增强框架以捕捉人类判断的多维特性,通过评估多种大语言模型,展示了改进的奖励建模方法在准确性和可解释性上的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00979 2026-04-03 cs.CL cs.AI 62%

Dual Optimal: Make Your LLM Peer-like with Dignity

双最优:使你的大语言模型具有尊严的同行

Xiangqi Wang, Yue Huang, Haomin Zhuang, Kehan Guo, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Dignified Peer框架,通过反阿谀和可信性对抗逃避服务模式,利用PersonaKnob数据集和容忍约束Lagrangian DPO算法,构建具有尊严和同行能力的语言模型代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01837 2026-04-03 cs.CL 57%

PLOT: Enhancing Preference Learning via Optimal Transport

PLOT:通过最优传输增强偏好学习

Liang Zhu, Yuelin Bai, Xiankun Ren, Jiaxi Yang, Lei Zhang, Feiteng Fang, Hamid Alinejad-Rokny, Minghuan Tan, Min Yang

机构 * Southern University of Science and Technology(南方科技大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Chongqing University(重庆大学) University of New South Wales(新南威尔士大学) University of Science and Technology of China(中国科学技术大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 PLOT通过最优传输理论提升大语言模型的偏好学习,解决性能、计算成本和全局关系建模问题,实验显示其在人类价值观和逻辑问题解决方面均提升对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 5 篇

2603.28650 2026-04-03 cs.LG cs.AI stat.ML 81%

Information-Theoretic Limits of Safety Verification for Self-Improving Systems

自我改进系统安全验证的信息论极限

Arsenios Scrivens

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 研究安全验证在允许无界有益自修改的同时维持有限累积风险的理论极限,提出双条件并建立其兼容性理论。

Comments 27 pages, 6 figures. Companion empirical paper: doi:10.5281/zenodo.19237566

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07645 2026-04-03 cs.SE cs.AI cs.CR 79%

A Self-Improving Architecture for Dynamic Safety in Large Language Models

为大语言模型动态安全设计的自改进架构

Tyler Slater

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出自改进安全框架SISF,通过反馈循环实现LLM系统在运行时自动检测安全故障并生成防御策略,实验显示其能有效降低攻击成功率,提升系统鲁棒性。

Comments Under review at the journal Information and Software Technology (Special Issue on Software Architecture for AI-Driven Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20666 2026-04-03 cs.LG cs.AI cs.SY eess.SY 62%

Learning Contextual Runtime Monitors for Safe AI-Based Autonomy

学习上下文感知的运行时监视器以实现安全的基于AI的自主性

Alejandro Luque-Cerpa, Mengyuan Wang, Emil Carlsson, Sanjit A. Seshia, Devdatt Dubhashi, Hazem Torfah

机构 * Chalmers University of Technology(查尔姆斯理工大学) University of Gothenburg(哥德堡大学) University of California at Berkeley(加州大学伯克利分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种学习上下文感知运行时监视器的新框架,用于安全的基于AI的控制集合。通过将监视学习转化为上下文学习任务,该方法在控制器选择中提供理论安全保证,并提高控制器多样性利用,通过自动驾驶模拟验证了其在安全性和性能上的显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00580 2026-04-03 cs.RO cs.AI 57%

OmniUnet: A Multimodal Network for Unstructured Terrain Segmentation on Planetary Rovers Using RGB, Depth, and Thermal Imagery

OmniUnet:一种多模态网络,用于使用RGB、深度和热成像的无结构地形分割在火星车上的应用

Raul Castilla-Arquillo, Carlos Perez-del-Pulgar, Levin Gerdes, Alfonso Garcia-Cerezo, Miguel A. Olivares-Mendez

机构 * University of Luxembourg(卢森堡大学) Universidad de Málaga(马拉加大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 OmniUnet通过整合RGB、深度和热成像数据,实现无结构地形的高效分割,利用自定义传感器设备在西班牙Bardenas半沙漠收集数据,并在资源受限设备上验证了其性能。

Journal ref 2025 International Conference on Space Robotics (iSpaRo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02265 2026-04-03 cs.CV 50%

Modular Energy Steering for Safe Text-to-Image Generation with Foundation Models

模块化能量引导用于基础模型的安全文本到图像生成

Yaoteng Tan, Zikui Cai, M. Salman Asif

机构 * University of California Riverside(加州大学河滨分校) University of Maryland(马里兰大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种基于梯度反馈的引导框架,利用预训练基础模型的潜在估计实现安全可控的文本到图像生成,适用于扩散和流匹配模型,提升生成质量与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 2 篇

2511.01375 2026-04-03 cs.AI 85%

Align to Misalign: Automatic LLM Jailbreak with Meta-Optimized LLM Judges

对齐以错位:基于元优化LLM评判者的自动LLM劫持

Hamin Koo, Minseon Kim, Jaehyung Kim

机构 * Yonsei University(延世大学) Microsoft Research(微软研究院)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出AMIS框架,通过双层结构联合优化劫持提示和评分模板,提升LLM劫持效果,实测在AdvBench和JBB-Behaviors上取得最佳性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00388 2026-04-03 cs.LG 83%

Safer by Diffusion, Broken by Context: Diffusion LLM's Safety Blessing and Its Failure Mode

扩散模型更安全,但受上下文影响而失效:扩散大语言模型的安全祝福及其失效模式

Zeyuan He, Yupeng Chen, Lang Lin, Yihan Wang, Shenxu Chang, Eric Sommerlade, Philip Torr, Junchi Yu, Adel Bibi, Jialin Yu

机构 * Torr Vision Group, University of Oxford(牛津大学Torr视觉组) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Microsoft(微软)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.LG

AI总结 研究探讨了扩散大语言模型(D-LLMs)在生成效率上的优势及其安全特性,发现其扩散生成方式增强了对对抗攻击的抵抗力,但存在上下文嵌套等失效模式,首次成功突破Gemini Diffusion的安全防线。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 5 篇

2604.01504 2026-04-03 cs.CL cs.AI cs.CY 75%

Magic, Madness, Heaven, Sin: LLM Output Diversity is Everything, Everywhere, All at Once

魔术、疯狂、天堂、罪恶:LLM输出多样性无处不在

Harnoor Dhingra

机构 * Microsoft(微软)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出Magic, Madness, Heaven, Sin框架,从四个规范性场景分析LLM输出多样性,揭示任务目标对输出多样性的影响,强调需基于任务目标进行多样性评估。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02226 2026-04-03 cs.AI cs.LG 62%

When to ASK: Uncertainty-Gated Language Assistance for Reinforcement Learning

何时提问:用于强化学习的不确定性门控语言帮助

Juarez Monteiro, Nathan Gavenski, Gianlucca Zuin, Adriano Veloso

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ASK方法,通过结合小型语言模型和训练好的RL策略,提升模型在分布外任务中的泛化能力,通过不确定性门控机制选择性利用语言模型进行决策,实验显示其在迁移任务中表现稳健。

Comments In Proceedings of International Joint Conference on Neural Networks (IJCNN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16082 2026-04-03 q-bio.QM cs.AI cs.LG 62%

BIOGEN: Evidence-Grounded Multi-Agent Reasoning Framework for Transcriptomic Interpretation in Antimicrobial Resistance

BIOGEN:基于证据的多智能体推理框架用于抗菌药物耐药性中的转录组解释

Elias Hossain, Mehrdad Shoeibi, Ivan Garibay, Niloofar Yousefi

机构 * College of Engineering and Computer Science, University of Central Florida(中佛罗里达大学工程与计算机科学学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 BIOGEN通过结合生物信息检索、结构化推理和多批评验证,生成可追溯的转录组模块解释,其在抗菌药物耐药性研究中表现出强生物学基础和零幻觉率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00039 2026-04-03 cs.DB cs.AI cs.IR 57%

AutoPK: Leveraging LLMs and a Hybrid Similarity Metric for Advanced Retrieval of Pharmacokinetic Data from Complex Tables and Documents

AutoPK:利用大语言模型和混合相似性度量进行药代动力学数据的高级检索

Hossein Sholehrasa, Amirhossein Ghanaatian, Doina Caragea, Lisa A. Tell, Jim E. Riviere, Majid Jaberi-Douraki

机构 * Kansas State University(堪萨斯州立大学) University of California-Davis(加利福尼亚大学戴维斯分校)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 AutoPK通过大语言模型和混合相似性度量,实现了从复杂表格和文档中高效提取药代动力学数据,显著提升了精度和召回率,适用于兽医药理学和公共卫生决策。

Comments Published in IEEE ICTAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05500 2026-04-03 cs.AI 57%

The Illusion of AI Expertise Under Uncertainty: Navigating Elusive Ground Truth via a Probabilistic Paradigm

人工智能专家能力的幻觉:通过概率范式导航 elusive 的真实地面真相

Aparna Elangovan, Lei Xu, Mahsa Elyasi, Ismail Akdulum, Mehmet Aksakal, Enes Gurun, Brian Hur, Saab Mansour, Ravid Shwartz Ziv, Karin Verspoor, Dan Roth

机构 * Independent Researcher(独立研究员) Amazon(亚马逊) Gazi University(加齐大学) University of Colorado(科罗拉多大学) Samsun University(萨姆松大学) The University Of Melbourne(墨尔本大学) New York University(纽约大学) RMIT University(皇家墨尔本理工大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 本文提出概率范式,揭示高置信度真实答案对专家高分的必要性,指出在真实答案变化大的数据集中,随机标注者与专家表现差异不大,强调在低专家表现时,按真实答案概率分层评估至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 隐私与版权 1 篇

2604.01481 2026-04-03 cs.LG cs.AI 62%

DISCO-TAB: A Hierarchical Reinforcement Learning Framework for Privacy-Preserving Synthesis of Complex Clinical Data

DISCO-TAB:一种用于隐私保护合成复杂临床数据的分层强化学习框架

Arshia Ilaty, Hossein Shirazi, Amir Rahmani, Hajar Homayouni

机构 * Computational Science Research Center, San Diego State University(圣地亚哥州立大学计算科学研究中心) School of Nursing and Department of Computer Science, University of California, Irvine(加州大学尔湾分校护理学院与计算机科学系) Fowler College of Business, San Diego State University(圣地亚哥州立大学福勒商学院) Department of Computer Science, San Diego State University(圣地亚哥州立大学计算机科学系)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DISCO-TAB框架,结合微调LLM与多目标判别器,通过强化学习优化,解决临床数据生成中的复杂依赖和类别不平衡问题,提升合成数据的临床有效性与统计真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 20 篇

2604.02008 2026-04-03 cs.CL 79%

$k$NNProxy: Efficient Training-Free Proxy Alignment for Black-Box Zero-Shot LLM-Generated Text Detection

$k$NNProxy:高效无训练代理对齐方法用于黑盒零样本LLM生成文本检测

Kahim Wong, Kemou Li, Haiwei Wu, Jiantao Zhou

机构 * School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出$ k $NNProxy方法,利用$ k $NN语言模型检索机制作为领域适配器,实现无训练的代理对齐,提升黑盒零样本LLM生成文本检测的鲁棒性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01238 2026-04-03 cs.NI cs.AI 74%

Trustworthy AI-Driven Dynamic Hybrid RIS: Joint Optimization and Reward Poisoning-Resilient Control in Cognitive MISO Networks

可信的AI驱动动态混合RIS:在认知MISO网络中的联合优化与抗奖励中毒控制

Deemah H. Tashman, Soumaya Cherkaoui

机构 * LINCS Laboratory, Department of Computer and Software Engineering, Polytechnique Montréal(蒙特利尔理工学院计算机与软件工程系LINCS实验室)

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 本文提出一种动态混合RIS,用于解决认知MISO网络中不可靠的直接SU链路和能量约束问题,通过联合优化传输波束成形和RIS相位,采用SAC深度强化学习方法,并提出轻量级实时防御机制以对抗奖励中毒攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20456 2026-04-03 cs.LG 74%

Towards Trustworthy Wi-Fi CSI-based Sensing: Systematic Evaluation of Adversarial Robustness

迈向可信的Wi-Fi CSI基于传感:对抗鲁棒性系统的评估

Shreevanth Krishnaa Gopalakrishnan, Stephen Hailes

机构 * University College London(伦敦大学学院)

专题命中 安全评测 :trustworthy(title);分类 cs.LG

AI总结 本文系统评估了五种不同CSI架构在四个公开数据集上的对抗鲁棒性,发现模型容量并不保证鲁棒性,简单架构比高容量模型更抗攻击,且任务依赖性显著影响脆弱性。

Comments 18 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00911 2026-04-03 cs.SE 67%

Foundation Models for Autonomous Driving System: An Initial Roadmap

自动驾驶系统中的基础模型:初步路线图

Xiongfei Wu, Mingfei Cheng, Xiaoning Ren, Qiang Hu, Jianlang Chen, Yuheng Huang, Maxime Cordy, Yao Zhang, Xiaofei Xie, Lei Ma, Yves Le Traon

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

AI总结 本文探讨了基础模型在自动驾驶系统中的应用,分析了在基础设施、车载集成和实际部署三个维度中的现状、挑战和研究方向,旨在为构建安全可靠的自动驾驶系统提供指导。

Comments To appear in ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02194 2026-04-03 cs.CL cs.AI 62%

Neuro-RIT: Neuron-Guided Instruction Tuning for Robust Retrieval-Augmented Language Model

Neuro-RIT: 用于鲁棒检索增强语言模型的神经引导指令微调

Jaemin Kim, Jae O Lee, Sumyeong Ahn, Seo Yeon Park

机构 * Hanyang University(汉阳大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 Neuro-RIT通过神经层面的对齐提升检索增强语言模型的鲁棒性,通过神经属性挖掘分离相关与无关上下文的神经元,并采用两阶段指令微调策略增强噪声鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21884 2026-04-03 cs.CL cs.AI 62%

Support-Contra Asymmetry in LLM Explanations

支持-矛盾不对称性在大语言模型解释中的体现

Avinash Patil

机构 * Hewlett Packard Enterprise(慧与科技公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大语言模型生成的解释与外部模型提取的预测词汇证据之间的关系,发现正确预测的解释更倾向于引用支持性词汇,而错误预测的解释则更多引用矛盾性词汇,揭示了解释与证据之间的不对称性。

Comments 17 Pages, 12 Figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00478 2026-04-03 cs.AI 57%

The Silicon Mirror: Dynamic Behavioral Gating for Anti-Sycophancy in LLM Agents

硅镜:用于LLM代理反趋炎附势的动态行为门控

Harshee Jignesh Shah

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :RLHF(abstract);分类 cs.AI

AI总结 本文提出硅镜框架,通过动态检测用户说服策略并调整AI行为以维持事实准确性,实验显示其显著降低LLM的趋炎附势倾向。

Comments 7 pages, 8 figures, 5 tables. Code and evaluation data available at https://github.com/Helephants/langgraph-layered-context

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10703 2026-04-03 cs.AI 57%

GenOM: Ontology Matching with Description Generation and Large Language Model

GenOM:基于描述生成和大语言模型的本体匹配

Yiping Song, Jiaoyan Chen, Renate A. Schmidt

机构 * The University of Manchester(曼彻斯特大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 GenOM通过生成文本定义增强本体概念语义,结合嵌入模型检索对齐候选并利用精确匹配工具提升精度,实验表明其在生物医学领域表现优异,超越传统系统和近期大语言模型方法。

Comments Accepted for publication in World Wide Web (Springer). This version includes revisions based on peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01779 2026-04-03 cs.CL 57%

Taming CATS: Controllable Automatic Text Simplification through Instruction Fine-Tuning with Control Tokens

驯服CATS:通过指令微调与控制令牌实现可控的自动文本简化

Hanna Hubarava, Yingqiang Gao

机构 * Department of Computational Linguistics, University of Zurich(苏黎世大学计算语言学系) Department of Clinical Research, University of Bern(伯尔尼大学临床研究系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出基于指令微调的CATS框架,通过控制令牌实现文本简化可控性,发现小模型在不同领域表现良好,但可控性依赖训练数据的属性变化,压缩控制因数据信号有限而表现欠佳。

详情

展开后加载摘要…

URL PDF HTML 收藏