arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-23 至 2026-07-23 共收录 45 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3 篇

2607.19371 2026-07-23 cs.AI cs.CL cs.LG 新提交 82%

Mitigating Scaffolding Collapse in Socratic Tutors via Representation Alignment

通过表示对齐减轻苏格拉底式导师中的支架坍塌

Jing Shao, Qifeng Wu, Hanyu Zhang, Sixia Sun, Jun Zhuang

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究基于大语言模型的苏格拉底式导师的支架坍塌问题,提出支架保留表示对齐方法,先监督微调预热,再结合轨迹加权优化与表示损失,经多学科和策略评估,该方法能提升长程苏格拉底辅导的鲁棒性。

Comments preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19824 2026-07-23 cs.AI cs.CL 新提交 81%

Rewarding Better Thinking for LLM Preference Alignment

奖励更好的思维以实现大语言模型偏好对齐

Xubo Liu, Wenya Guo, Ruxue Yan, Xinying Qian, Ying Zhang

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型偏好对齐问题,提出思维清单奖励(TCR)方法,将偏好对转化为思维清单评估推理轨迹,引入EMA残差公式减少与结果监督重叠,实验证明该方法能提升对齐性能。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20057 2026-07-23 q-bio.BM cs.LG 新提交 70%

Antigen-specific Antibody Multi-modal Foundation Model for Functional Antibody Design

用于功能性抗体设计的抗原特异性抗体多模态基础模型

Xiaoliang Shi, Zichen Wang, Runze Ma, Zhongyue Zhang, Shuangjia Zheng

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.LG

AI总结 该研究针对抗原特异性抗体设计难题,引入AAMFM多模态基础模型,通过跨模态适配器整合抗原信息,用校准直接偏好优化微调,实现抗体 - 抗原相互作用联合建模,实验证明其在功能性抗体设计中性能最优,有抗原特异性抗体工程潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 7 篇

2607.19449 2026-07-23 cs.LG cs.AI cs.CR 新提交 81%

Guardrails as Scapegoats: Auditing Unfaithful Safety Refusals in Tool-Augmented LLM Agents

作为替罪羊的护栏:审计工具增强型大语言模型智能体中不忠实的安全拒绝行为

Aarushi Singh

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 研究工具增强型大语言模型智能体安全拒绝行为审计问题,引入轻量级黑盒审计框架,将智能体响应分类。实验发现伪造行为占主导,不忠实安全拒绝行为在基线时少,增强安全语言会显著增加该行为,还提出检测方法及治理影响。

Comments 10 pages, 3 figures. Accepted at the ACM KDD 2026 Workshop on Evaluation and Trustworthiness of Agentic AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19827 2026-07-23 cs.RO cs.CY 新提交 79%

Clinical Pathways as Safety Specifications for Physical AI in Hospital Wards

临床路径作为医院病房物理人工智能的安全规范

Gabriele Franchini, Giulio Mallardi, Michele De Carolis, Filippo Lanubile

专题命中 安全训练 :safety(title,abstract);分类 cs.CY

AI总结 研究针对医院病房物理人工智能系统的安全挑战,提出将临床路径作为安全规范,构建集成多种组件的概念性机器人架构,用运行时安全监视器结合多种方法识别安全违规,助力护理人员并为安全物理人工智能做贡献。

Comments 4 pages, 3 figures. Accepted at the 1st IJCAI Workshop on Safe Physical AI (SPAI 2026), held in conjunction with IJCAI-ECAI 2026, Bremen, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20352 2026-07-23 cs.RO 新提交 78%

Distributed Motion Planning with Safety Guarantees for Self-Reconfiguring Robotic Boats

具有安全保障的自重构机器人船分布式运动规划

Alejandro Gonzalez-Garcia, Wei Wang, Wei Xiao, Wilm Decre, Jan Swevers, Carlo Ratti, Daniela Rus

机构 * KU Leuven(鲁汶大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Nanyang Technological University(南洋理工大学) SMART(新加坡制造技术研究院) SENSEable City Laboratory, Massachusetts Institute of Technology(麻省理工学院可感知城市实验室) Computer Science and Artificial Intelligence Lab (CSAIL), Massachusetts Institute of Technology(麻省理工学院计算机科学与人工智能实验室)

专题命中 安全训练 :safety(title,abstract)

AI总结 研究水生自重构机器人多智能体形状形成与重构问题,提出将分布式MPC与CBF相结合的混合框架,利用ADMM求解MPC方案,通过局部优化和信息交换计算轨迹,并应用基于CBF的滤波器保障安全,经仿真和实验验证了框架的有效性与可扩展性。

Comments Submitted to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20345 2026-07-23 cs.RO cs.AI 新提交 57%

Closing the Lab-to-Store Gap: A Data-Efficient Post-Training and Experience-Driven Learning VLA Framework for Retail Humanoids

弥合实验室与商店之间的差距:一种用于零售类人机器人的数据高效训练后及经验驱动学习的VLA框架

Roger Sala Sisó, Tiago Silvério, Jakob Sand, Tran Nguyen Le

机构 * HIVE Robots(蜂巢机器人公司) Technical University of Denmark(丹麦技术大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 研究针对VLA类人机器人弥合实验室与实际应用差距的问题,提出DEED系统级方法,含数据高效训练后管道、经验驱动细化研究及潜在空间分析工具,经实验证明精心设计数据和训练后处理可解决该问题。

Comments 8 pages. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20327 2026-07-23 cs.CL 新提交 57%

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference

PyroDash:具有成本效益的令牌级小语言模型与大语言模型协作推理

Niqi Lyu, Pengtao Shi, Wei Qiu, Jianlin Zhong, Sicong Xia, Jianyao Ma, Yicheng Ding

机构 * Pyromind Dynamics Inc.(Pyromind动力学公司)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 研究针对大语言模型推理成本高、小语言模型可靠性低的问题,提出PyroDash框架,通过令牌级协作推理,分三阶段训练小语言模型,在数学推理基准测试中能支持不同操作点,可减少大语言模型使用并保持推理性能。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20005 2026-07-23 cs.AI 新提交 57%

Safe Remediation as Risk-Constrained Intervention Decision in Microservice Systems

作为微服务系统中风险约束干预决策的安全修复

Chengxiao Dai, Zhaokun Yan, Chenjun Lei, Qiao Li, Luyan Zhang

机构 * School of Computer Science, University of Sydney(悉尼大学计算机科学学院) Khoury College of Computer Sciences, Northeastern University(美国东北大学库里计算机科学学院) School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院) College of Business and Economics, Australian National University(澳大利亚国立大学商业与经济学院) School of Computer Science and Technology, Fujian Normal University(福建师范大学计算机科学与技术学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究微服务系统中安全修复问题,将其转化为风险约束干预决策问题并构建约束马尔可夫决策过程,引入三维风险分解和上下文自适应人在回路门,通过实验验证该框架能降低错误修复率、提高修复成功率并减轻值班升级负载。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19351 2026-07-23 cs.AI 新提交 57%

OpenEvoShield: Dual Non-Stationary Continual Defense for Open-World Multi-Agent System Attacks

OpenEvoShield:面向开放世界多智能体系统攻击的双重非平稳持续防御

Litian Zhang, Chaozhuo Li, Yuting Zhang, Zejian Chen, Bingyu Yan, Qiwei Ye

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北京航空航天大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 针对LLM-MAS中对手通过通信注入恶意指令的双重动态攻击,提出OpenEvoShield持续防御框架,含不对称速率控制器等组件,实验表明其在多基准和拓扑上优于基线,能检测多数未见攻击且误报率低。

Comments 29 pages, 5 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2607.19829 2026-07-23 cs.CR 新提交 88%

DARWIN: Evolving Jailbreak Adversary and Guardrail for LLM Safety Evaluation and Protection

达尔文:为大语言模型安全评估与保护演化越狱对手及防护措施

Weiwei Qi, Zefeng Wu, Zhilin Guo, Tianhang Zheng, Chaochao Lu, Liang He, Zhan Qin, Kui Ren

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract)

AI总结 针对现有大语言模型安全评估与防御方法的静态局限,提出达尔文演化攻击-防御框架,含通过策略发现等扩展能力的达尔文攻击及从新对抗样本中迭代学习的达尔文防护,在攻击成功率和防御召回率上表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19424 2026-07-23 cs.CR cs.AI cs.CL 新提交 86%

JailMeter: An Evidence-Based Evaluation Framework for Jailbreak Attacks on Large Language Models

JailMeter:一种基于证据的大语言模型越狱攻击评估框架

Qingjia Huang, Jingyu Zhang, Jianguo Wu, Yakai Li, Weijuan Zhang, Yankai Rong, Junyi Yao, Shengzhi Zhang, Xiaoqi Jia

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型越狱攻击评估标准和方法不一致的问题,提出基于证据评估框架JailMeter,受信息瓶颈理论启发用双反馈优化过滤噪声,在JailMeter-Eva上评估准确率达97.27%,还提炼出JailMeter\textsubscript{SLM}降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19545 2026-07-23 cs.CR 新提交 50%

When HTTP 402 Meets the Blockchain: Risks on Emerging x402 Payments

当HTTP 402遇上区块链:新兴x402支付的风险

Qinying Wang, Yong Yang, Yuan Chen, Shouling Ji, Mathias Payer

专题命中 越狱攻击 :safety(abstract)

AI总结 研究x402支付协议,通过系统研究确定促进者的安全规则,基于规则违规分析得出新攻击向量,提出半自动黑盒工具评估安全性,发现部署均有违规,还通过实证测量量化相关指标,揭示其安全风险。

Journal ref USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 3 篇

2607.19837 2026-07-23 cs.AI cs.CR cs.LG 新提交 62%

Know Your Agent: Reconnaissance-Driven Pentesting of AI Agents

了解你的智能体:基于侦察的人工智能智能体渗透测试

Or Zion Eliav, Eyal Lenga, Shir Bernstien, Yisroel Mirsky

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 研究针对人工智能智能体的渗透测试,提出通过形式化智能体侦察,在KYA框架中利用探测、构建配置文件等实现黑盒侦察驱动的渗透测试自动化,并进行评估与发布,以提升智能体安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19595 2026-07-23 cs.CR cs.CL 新提交 57%

Twin Agent: Context Residual Compression for Privilege Separated Agents

孪生智能体:用于特权分离智能体的上下文残差压缩

Zhanhao Hu, Dennis Jacob, Xiao Huang, Zhaorun Chen, Bo Li, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校) University of Chicago(芝加哥大学) University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 针对大语言模型智能体易受安全风险问题,提出孪生智能体模式,由探索和安全智能体组成,通过探索智能体传递紧凑提示,减少信息需求,在保持高任务效用的同时防止提示注入攻击,优于其他基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19432 2026-07-23 cs.CR cs.AI 新提交 57%

ChainWatch: A Kill Chain-Aligned Sequential Detection Framework for Multi-Step Attacks in MCP-Based AI Agent Systems

ChainWatch:基于杀伤链的顺序检测框架,用于基于MCP的人工智能代理系统中的多步攻击

Om Narayan, Rashmi Jyoti, Ramkinker Singh

机构 * Computer Science New York University New York, USA(计算机科学 新 York 大学 新 York 美国) Cybersecurity University of Maryland, College Park MD, USA(网络安全 美国马里兰大学College Park分校 MD 美国) Carnegie Mellon University Pittsburgh, USA(卡内基梅隆大学 彭博 美国)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 针对基于MCP的人工智能代理系统中现有防御无法可靠检测多步攻击的问题,提出ChainWatch框架,用六阶段杀伤链建模攻击进展,结合隐马尔可夫模型分类工具调用序列,能检测逃避传统机制的攻击链。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 3 篇

2607.19367 2026-07-23 cs.AI 新提交 81%

Rethinking Uncertainty Evaluation in Large Language Models

重新思考大语言模型中的不确定性评估

Krish Matta, Atharv Naphade, Andy Zou

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta

专题命中 幻觉与事实性 :RLHF(summary_cn,abstract);分类 cs.AI

AI总结 研究大语言模型中置信度评估问题,指出校准标准不充分。沿结构连贯性、忠实性和有用性三个轴形式化条件为C1指标,发现常用估计器违反条件,RLHF等未恢复连贯性,框架可测度与弥合差距。

Comments 19 pages, 11 figures, ICML 2026 EIML Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20141 2026-07-23 cs.AR cs.AI 新提交 57%

Formal Foundations for Known Good Reliable Die Screening in Chiplet-Based AI Systems-on-Chip

基于小芯片的人工智能片上系统中已知良好可靠芯片筛选的形式基础

Prashanthi Metku, Chandra Gandu

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 研究基于小芯片的人工智能片上系统中芯片筛选问题,将KGD到KGRD筛选转变为约束推理问题,提出贝叶斯概率风险模型等四项贡献,蒙特卡罗模拟验证了理论特性及安全保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20065 2026-07-23 cs.AI 新提交 57%

TRUST-ESD: A Risk-Calibrated and Governance-Aware AI Framework for Enterprise Strategic Decision Support Under Uncertainty

TRUST-ESD:一种用于不确定性下企业战略决策支持的风险校准和治理感知人工智能框架

Tian Qiu, Li Yan, Mahabubur Rahman Miraj, Shanqin Yi, Md Intekhab Rahman Galib, Jahid Hasan

机构 * School of Economics and Management, Xinyu University(新余学院经济与管理学院) College of Computer Science, Chongqing University(重庆大学计算机科学学院) School of Economics and Business Administration, Chongqing University(重庆大学经济与工商管理学院) School of Management, Xi’an Jiaotong University(西安交通大学管理学院) School of Law and Public Administration, China Three Gorges University(三峡大学法学与公共管理学院)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 针对企业战略决策支持需求,TRUST-ESD框架通过多种方法评估策略,能平衡价值、可靠性、风险暴露和合规性。实验表明其相比基线提升了多项指标,消融和案例分析证实相关因素共同改善企业决策。

Comments 15 pages, 7 figures, 4 tables. Submitted to APWeb-WAIM 2026, Danang, Vietnam, September 7-9, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 1 篇

2607.19676 2026-07-23 cs.AI 新提交 57%

Edge Intelligence in Civil Aviation: Paradigms, Techniques, and Applications

民航中的边缘智能:范式、技术与应用

Wenbin Li, Zhongtian Liao, Bolin Liu, Yongjie Zhou, Jingling Wu, Xiaoyong Lin, Jing Chen

专题命中 隐私与版权 :safety(abstract);分类 cs.AI

AI总结 针对民航网络边缘数据处理问题,介绍边缘人工智能通过压缩、协作推理和分割学习等技术,减少延迟、带宽和暴露风险,实现断连平稳运行,阐述其运行动机、技术、范式及应用趋势,为民航提供低延迟、隐私保护和弹性的人工智能服务。

Comments 8 pages, 2 figures, 2 tables

Journal ref 2025 5th International Conference on Information Communication and Software Engineering (ICICSE), Chongqing, China, 12 to 14 December 2025, IEEE, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 16 篇

2607.20265 2026-07-23 cs.CL cs.AI 新提交 81%

The Maskability Index: Predicting Task-Objective Alignment in Pretrained Language Models

可掩码性指数:预测预训练语言模型中的任务目标对齐

Ahmad Pouramini, Mahsa Afsharzadeh

机构 * Sirjan University of Technology(锡尔詹理工大学) Department of Computer Engineering(计算机工程系)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 研究提出可掩码性指数(MI),用于评估知识关系适合的提示方式,通过掩码与未掩码模板的DepthRank分数差异计算。在ATOMIC2020基准上评估发现MI与下游生成性能正相关,有助于选择提示模板和策略提取预训练语言模型的关系知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19913 2026-07-23 cs.AI cs.CL cs.CR 新提交 81%

JANUS: Foreseeing Latent Risk for Long-Horizon Agent Safety

JANUS:预见长期智能体安全中的潜在风险

Yuan Xiong, Linji Hao, Shizhu He, Yequan Wang, Lijun Li

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 研究长期智能体安全潜在风险,提出JANUS框架,通过多智能体模拟合成轨迹,经预测与裁决耦合任务学习共享策略,用CoAA-RL联合优化,所产生的Vanguard模型提升了智能体安全防护及任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19366 2026-07-23 cs.AI 新提交 79%

Geometry-Guided Constraint Learning for LLM Safety Classification

用于大语言模型安全分类的几何引导约束学习

Fumiaki Uehara, Koo Imai, Masato Tsutsumi, Keigo Kansa, Sora Usui, Yuki Kobiyama

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 研究大语言模型安全分类,利用稀疏自动编码器特征提取解决安全多面体中约束数量调整问题,在Qwen3.5 - 9B上对部分类别K = 2最优,准确率达96 - 99%,基于几何观点引入锥约束并经三阶段训练稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19356 2026-07-23 cs.AI 新提交 79%

NEXUS: Structured Runtime Safety for Tool-Using LLM Agents

NEXUS:工具使用型大语言模型智能体的结构化运行时安全

Elias Hossain, Md Mehedi Hasan Nipu, Tasfia Nuzhat Ornee, Rajib Rana, Niloofar Yousefi

机构 * University of Central Florida(中佛罗里达大学) North South University(南北大学) University of Southern Queensland(南昆士兰大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 研究工具使用型大语言模型智能体运行时安全问题,提出NEXUS结构化计划安全监控器,结合多种方法进行分级升级。在多个基准测试中表现出色,如合成基准测试F1分数达0.949等,还具有低延迟、低开销特点,相关成果已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19701 2026-07-23 cs.CV 新提交 78%

SafeGen: Goal-Conditioned Video Diffusion of Safety-Critical Scenarios for VLM-Based Autonomous Driving

SafeGen:基于视觉语言模型的自动驾驶安全关键场景的目标条件视频扩散

Jiangfan Liu, Zexuan Cui, Tianyuan Zhang, Zonglei Jing, Zonghao Ying, Yaoyuan Zhang, Jiakai Wang, Xiaoqi Jiang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北京航空航天大学) Zhongguancun Laboratory(中关村实验室) Chery Automobile Co., Ltd.(奇瑞汽车股份有限公司)

专题命中 安全评测 :safety(title,abstract)

AI总结 研究针对VLM在自动驾驶系统中的应用,提出SafeGen框架,将场景生成设为目标条件扩散过程,引入上下文接地最终状态推理和最终状态条件下的视频演化,实验表明该框架能提升评判得分,微调后可提高真实驾驶场景性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20286 2026-07-23 cs.CL cs.AI 新提交 76%

Sound Probabilistic Safety Bounds for Large Language Models

大语言模型的可靠概率安全边界

Mahdi Nazeri, Anne-Kathrin Schmuck, Sadegh Soudjani, Alessandro Abate

机构 * University of Oxford(牛津大学) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) University of Birmingham(伯明翰大学)

专题命中 安全评测 :safety(title);分类 cs.CL、cs.AI

AI总结 研究提出框架计算大语言模型生成有害输出概率的严格边界,利用克洛普 - 皮尔逊置信区间,通过潜在空间特征优先探索有害分支,能高效计算可靠下界,实验验证方法有效性,为模型评估和认证提供新途径。

Comments The Initial version of this manuscript has been available on OpenReview, see https://openreview.net/forum?id=papImkPLf5

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20379 2026-07-23 cs.AI cs.CL 新提交 73%

Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations

训练模型,而非读者:可验证激活解释的可解码性监督

Hiskias Dingeto

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 研究自然语言自动编码器对隐藏激活解释评分的问题,提出RECAP等方法,能使指定内容可解码,提高解释忠实度与安全性,如在预训练模型上实现可靠探测解码,提升对真实声明评分及识别谎言能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19355 2026-07-23 cs.AI cs.CL cs.CY 新提交 67%

Information Discernment in Large Language Models

大语言模型中的信息辨别

Joshua Ashkinaze, Laura Kurek, Alina Faisal, Tongyuan Miao, Mariam Joseph, Ceren Budak, Eric Gilbert

机构 * University of Michigan(密歇根大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究大语言模型在与外部知识源结合时的信息辨别问题,提出Learn2Discern框架及基准,通过用户研究和大量模型试验发现模型在来源和真相辨别上存在问题,识别出简单干预措施,发布数据集和调查作为测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19956 2026-07-23 cs.CL cs.AI 新提交 62%

When Does Knowledge Distillation Hurt? Reliability-Aware Distillation for Low-Resource Language Summarization

知识蒸馏何时会产生负面影响?低资源语言摘要的可靠性感知蒸馏

Dipto Sumit, Ankan Kumar Roy Srizon, Sadia Khair Rodela, Atia Haque Asha, Mourchona Afrin, Niloy Farhan, Farig Sadeque

机构 * BRAC University(BRAC大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究低资源语言摘要中知识蒸馏的问题,提出CHAD和EWAD+CPDP两种可靠性感知蒸馏方法,在BanSum基准测试中显著优于标准KD,EWAD+CPDP在多种语言上也有良好表现,还发布相关资源助力研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19361 2026-07-23 cs.CL cs.AI 新提交 62%

Stateful Guardrails for Multi-Turn LLM Systems: A Conversational Risk Accumulation Framework

多轮大语言模型系统的有状态防护栏:一个对话风险累积框架

Sanjay Mishra, Divya Chukkapalli, Ganesh R. Naik

机构 * College of Medicine and Public Health, Flinders University(弗林德斯大学医学与公共卫生学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究多轮大语言模型系统的对话风险累积问题,提出会话层CRA框架,跟踪三个轨迹信号,提供评分方法,发布多个基准测试集及评估协议,重点在于分布内会话评分,为大语言模型安全防护提供新方法。

Comments 45 pages, 10 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏