arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-29 至 2026-06-29 共收录 10 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 10 篇

2601.22709 2026-06-29 cs.CV cs.AI 版本更新 79%

Gated Relational Alignment via Confidence-based Distillation for Efficient VLMs

基于置信度蒸馏的门控关系对齐用于高效视觉语言模型

Yanlong Chen, Amirhossein Habibian, Luca Benini, Yawei Li

机构 * Department of Information Technology(信息科技系) Electrical Engineering, ETH Zurich, Zurich, Switzerland(电气工程,苏黎世联邦理工学院,苏黎世,瑞士) Qualcomm AI Research, Amsterdam, the Netherlands(高通人工智能研究,阿姆斯特丹,荷兰) Department of Electrical, Electronic and Information Engineering(电气、电子与信息工程系) University of Bologna, Bologna, Italy(博洛尼亚大学,博洛尼亚,意大利) School of Electrical and Electronic Engineering(电气与电子工程学院)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 提出GRACE框架,通过信息瓶颈原理统一知识蒸馏与量化感知训练,使用置信度门控解耦蒸馏、关系中心核对齐和自适应控制器,在INT4量化下实现性能超越FP16基线并接近教师模型,同时显著降低内存和提升吞吐量。

Comments Accepted to the International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27930 2026-06-29 cs.IR stat.AP 新提交 78%

An LLM-Powered Semantic Alignment Framework for Journal Recommendation

基于LLM的语义对齐框架用于期刊推荐

Yanglin Yan, Zicheng Xie, Tianchen Gao, Rui Pan, Hansheng Wang

专题命中 其他安全 :alignment(title,abstract)

AI总结 提出一种基于大语言模型的语义对齐框架,将期刊推荐转化为稿件内容与期刊范围描述之间的语义匹配问题,无需训练即可实现高效推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27731 2026-06-29 cs.CL cs.AI cs.CE cs.LG 新提交 78%

Enhancing Numerical Prediction in LLMs via Smooth MMD Alignment

通过平滑MMD对齐增强LLM中的数值预测

Zhuo Zuo, Li Yue, Wenhao Zheng, Chenpeng Wang, Xianggen Liu

机构 * College of Computer Science, Sichuan University, Chengdu, China(四川大学计算机学院,成都,中国)

专题命中 其他安全 :alignment(title);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM在数值预测任务中精度不足的问题,提出平滑最大均值差异(SMMD)方法,通过数值令牌的距离核和图平滑对齐预测分布,在数学推理等任务中显著提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27941 2026-06-29 cs.CL cs.AI cs.LG 新提交 67%

VASAE: Naming SAE Dictionary Directions with Vocabulary-Aligned Anchoring

VASAE: 使用词汇对齐锚定命名SAE字典方向

Kairui Zhang, Ziwen Yu, Zahraa S. Abdallah, Martha Lewis

机构 * Intelligent Systems Laboratory, University of Bristol(布里斯托大学智能系统实验室) University of Bristol(布里斯托大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出词汇对齐稀疏自编码器(VASAE),通过词汇对齐锚定训练SAE特征,为每个特征分配内在令牌名称,在不降低重构质量的前提下实现约90%的特征对齐。

Comments 14 pages, 7 figures. Accepted to the 2nd Workshop on Compositional Learning at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14264 2026-06-29 cs.CY cs.AI cs.CL cs.HC 版本更新 67%

Psychometric Comparability of LLM-Based Digital Twins

基于LLM的数字孪生的心理测量可比性

Yufei Zhang, Zhihao Ma

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 提出构念效度框架,评估LLM数字孪生在聚合、项目、网络和决策层面的心理测量可比性,发现其在高聚合准确性和网络结构上接近人类,但在项目级相关、启发式偏差和时变敏感性上存在差异。

Comments Also available as a preprint on OSF Preprints https://osf.io/preprints/psyarxiv/965yg_v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28217 2026-06-29 cs.LG cs.AI cs.DC cs.MA 新提交 62%

Towards Value-Constrained Credit Assignment in Fully Delegated AI Cooperatives

完全委托的AI合作社中面向价值约束的信用分配

Young Yoon, Jimin Kim, Soyeon Park

机构 * Hongik University(弘益大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出在完全委托的AI合作社中,基于异质价值约束筛选更新,利用遍历学习实现细粒度信用分配,以解决数据估值和联邦学习中的贡献归属问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27939 2026-06-29 cs.LG cs.AI q-bio.BM q-bio.GN 新提交 62%

Two-Stage Fine-Tuning for Protein Sequence Generation with Targeted Amino-Acid Composition

针对目标氨基酸组成的蛋白质序列生成的两阶段微调

Violeta Basten-Romero, Rubén Muñoz-Tafalla, Anna María Díaz-Rovira, Bertran Miquel-Oliver, Isaac Filella-Merce, Víctor Guallar

机构 * Barcelona Supercomputing Center (BSC)(巴塞罗那超级计算中心) Nostrum Biodiscovery S.L.(Nostrum生物发现有限公司) ICREA

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出两阶段微调方法,先领域自适应微调,再强化学习迭代微调,以生成符合目标氨基酸组成且保持序列质量的蛋白质序列。

Comments 17 pages, 5 figures, ICML 2026 Workshop GenBio

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26071 2026-06-29 cs.LG cs.AI 新提交 62%

Model Forensics: Investigating Whether Concerning Behavior Reflects Misalignment

模型取证:调查令人担忧的行为是否反映对齐失败

Aditya Singh, Gerson Kroiz, Senthooran Rajamanoharan, Neel Nanda

机构 * MATS

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出一个两步基线协议,通过读取思维链生成假设并编辑环境测试假设,以区分模型行为是出于恶意意图还是良性原因,并在六个环境中验证了该方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27968 2026-06-29 physics.soc-ph 新提交 50%

SimPol: Simulating polarisation in political belief networks in European countries

SimPol: 模拟欧洲国家政治信念网络中的极化现象

Isabela Burattini Freire, Hongryol Cha, Irina Epure, Sara Filippini, Karan K. H. Manjunatha, Chethan Kavaraganahalli Prasanna, Ivan Samoylenko, Niels Van Santen, Adarsh Prabhakaran, Guillermo Romero Moreno

专题命中 其他安全 :alignment(abstract)

AI总结 结合实证网络分析与基于智能体的建模,研究信念系统结构如何影响极化驱动,并揭示欧洲信念系统多样性导致的不同极化轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14271 2026-06-29 cs.CV 版本更新 50%

Let Language Constrain Geometry: Vision-Language Models as Semantic and Spatial Critics for 3D Generation

让语言约束几何:视觉-语言模型作为3D生成的语义和空间评判者

Weimin Bai, Yubo Li, Weijian Luo, Zeqiang Lai, Yequan Wang, Wenzheng Chen, He Sun

机构 * Peking University(北京大学) hi-lab, Xiaohongshu Inc.(小红书科技公司 hi-lab) MMLab, CUHK(香港中文大学 MMLab) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 其他安全 :alignment(abstract)

AI总结 提出VLM3D框架,利用视觉-语言模型作为可微分的语义和空间评判者,通过双查询评判信号改善文本到3D生成的语义对齐和几何一致性。

Comments arXiv admin note: substantial text overlap with arXiv:2509.15772

详情

展开后加载摘要…

URL PDF HTML 收藏