arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-09 至 2026-06-09 共收录 156 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 31 篇

2601.10925 2026-06-09 cs.CL 版本更新 57%

Massively Multilingual Joint Segmentation and Glossing

大规模多语言联合分割与标注

Michael Ginn, Lindia Tjuatja, Enora Rice, Ali Marashian, Maria Valentini, Jasmine Xu, Graham Neubig, Alexis Palmer

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 针对现有神经标注模型缺乏形态边界预测导致可解释性差的问题,提出PolyGloss模型,通过联合分割与标注提升准确性和对齐度,并支持低秩适应快速迁移。

Comments 15 pages, 9 figures, accepted to ACL 2026 Long Papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08920 2026-06-09 q-bio.BM cs.AI 版本更新 57%

AMix-1: A Pathway to Test-Time Scalable Protein Foundation Model

AMix-1: 迈向测试时可扩展的蛋白质基础模型

Changze Lv, Jiang Zhou, Siyu Long, Lihao Wang, Jiangtao Feng, Dongyu Xue, Yu Pei, Hao Wang, Zherui Zhang, Yuchen Cai, Zhiqiang Gao, Ziyuan Ma, Jiakai Hu, Chaochen Gao, Jingjing Gong, Yuxuan Song, Shuyi Zhang, Xiaoqing Zheng, Deyi Xiong, Lei Bai, Wanli Ouyang, Ya-Qin Zhang, Wei-Ying Ma, Bowen Zhou, Hao Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Generative Symbolic Intelligence Lab (GenSI), Tsinghua University(生成符号智能实验室(GenSI),清华大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) Tsinghua University(清华大学) Fudan University(复旦大学) Tianjin University(天津大学) Georgia Institute of Technology(佐治亚理工学院) Beijing University of Posts and Telecommunications(北京邮电大学) University of Chinese Academy of Sciences(中国科学院大学) City University of Hong Kong(香港城市大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出基于贝叶斯流网络的蛋白质基础模型AMix-1,通过预训练缩放律、涌现能力分析、上下文学习机制和测试时缩放算法,实现1.7B参数模型,并设计出活性提高50倍的AmeR变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01751 2026-06-09 cs.PF 50%

SparseX: Efficient Segment-Level KV Cache Sharing for Interleaved LLM Serving

SparseX: 面向交错式LLM服务的高效段级KV缓存共享

Quqing Zhang, Kai Chen, Ning Liao, Zehao Lin, Bo Tang, Feiyu Xiong, Zhiyu Li, Xiaoxing Wang

专题命中 其他安全 :alignment(abstract)

AI总结 针对长上下文LLM服务中非前缀重复内容导致的缓存效率低问题,提出SparseX,一种基于稀疏Q索引的段级KV缓存共享方法,通过单次前向传播中的稀疏KV重计算恢复跨段上下文交互,实现无额外模型或预处理的缓存复用。

Comments Corrected author metadata only; no changes to the paper content

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16476 2026-06-09 cs.DL 版本更新 50%

ClawXiv: a signed archival workflow and distributed publication architecture for human--AI collaborative research

ClawXiv:一种带签名的存档工作流和分布式出版架构,用于人机协作研究

Andras Kornai

专题命中 其他安全 :safety(abstract)

AI总结 ClawXiv旨在解决预印本的公开传播及从易逝的聊天会话和异构LaTeX/BibTeX工作目录迁移至持久、带签名、可检查的研究成果的问题,通过四种状态管理实现可靠存档。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06613 2026-06-09 econ.GN q-fin.EC 版本更新 50%

Some economics of artificial superintelligence

超级人工智能的经济学

Henry A. Thompson

专题命中 其他安全 :safety(abstract)

AI总结 本文运用经济学逻辑分析超级人工智能(ASI)的威胁,指出在竞争、全面利益和信用交易条件下,ASI可能不会完全掠夺人类,为超级智能未来提供乐观视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03957 2026-06-09 cs.HC cs.CV 50%

Vision Language Models as Values Detectors

视觉语言模型作为价值检测器

Giulio Antonio Abbo, Tony Belpaeme

机构 * IDLab-AIRO, Ghent University – imec, Belgium(IDLab-AIRO、根特大学 – imec、比利时)

专题命中 其他安全 :alignment(abstract)

AI总结 本文研究了先进LLM与人类标注者在家庭环境场景中检测相关元素的对齐情况,发现LLaVA 34B表现最佳但仍需改进,表明LLM在检测图像中价值元素方面有潜力。

Comments 13 pages, 2 figures

Journal ref Value Engineering in Artificial Intelligence (VALE 2024) (LNAI,volume 15356)

详情

展开后加载摘要…

URL PDF HTML 收藏