arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-01 至 2026-06-01 共收录 79 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 23 篇

2511.19923 2026-06-01 cs.CV cs.CL 57%

Distilling Counterfactual Reasoning from Language to Vision: Causal Graph Guided Post-Training for Video Understanding

从语言到视觉的反事实推理蒸馏:因果图引导的视频理解后训练

Yuefei Chen, Jiang Liu, Xiaodong Lin, Ruixiang Tang

机构 * Rutgers University(新泽西罗格斯大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 针对视觉语言模型在反事实推理上的不足,提出CounterVQA基准和CFGPT后训练方法,通过从语言模态蒸馏反事实推理能力提升视频理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31192 2026-06-01 cs.CV 50%

The Regularizing Power of Language-Training Deepfake Detectors

语言训练深度伪造检测器的正则化能力

Benedikt Hopf, Zongwei Wu, Radu Timofte

机构 * Computer Vision Lab, CAIDAS, University of Würzburg(计算机视觉实验室,CAIDAS,乌尔姆大学)

专题命中 安全评测 :alignment(abstract)

AI总结 提出利用多模态大语言模型的双编码器架构和两阶段训练,通过语言正则化缓解过拟合,提升深度伪造检测的泛化性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27367 2026-06-01 cs.CV 50%

SpatialBench: Is Your Spatial Foundation Model an All-Round Player?

SpatialBench: 你的空间基础模型是全能选手吗?

Haosong Peng, Hao Li, Jiaqi Chen, Yuhao Pan, Runmao Yao, Yalun Dai, Fushuo Huo, Fangzhou Hong, Zhaoxi Chen, Haozhao Wang, Dingwen Zhang, Ziwei Liu, Wenchao Xu

机构 * Hong Kong University of Science and Technology(香港科技大学) Nanyang Technological University(南洋理工大学) Northwestern Polytechnical University(西北工业大学) Southeast University(东南大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 安全评测 :alignment(abstract)

AI总结 提出SpatialBench基准,通过跨范式、多域、确定性采样的评估,揭示当前空间基础模型在多样化下游任务中的泛化能力不足,并引入DA-Next-5M数据集和DA-Next模型推动空间表示学习。

Comments Project Page: https://ropedia.github.io/SpatialBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20941 2026-06-01 cs.CV 50%

Decoding the Surgical Scene: A Scoping Review of Scene Graphs in Surgery

解码手术场景:手术中场景图的范围综述

Angelo Henriques, Korab Hoxha, Daniel Zapp, Peter C. Issa, Nassir Navab, M. Ali Nasseri

机构 * School of Computation, Information and Technology, Technical University of Munich(计算信息学院,慕尼黑技术大学) Klinik und Poliklinik für Augenheilkunde, TUM University Hospital(眼科诊所,TUM大学医院) Computer Aided Medical Procedures, Technical University of Munich(医学辅助程序,慕尼黑技术大学) Department of Biomedical Engineering, University of Alberta(生物医学工程系,阿尔伯塔大学)

专题命中 安全评测 :safety(abstract)

AI总结 本文通过PRISMA-ScR指导的范围综述,系统梳理了手术中场景图(SG)的研究现状,分析了52项研究,揭示了从图神经网络向基础模型和生成式AI的方法论转变,并提出了“验证三位一体”评估框架以弥合临床转化差距。

Comments Submitted and accepted to Medical Image Analysis (DOI: 10.1016/j.media.2026.104083). An interactive version of the summary tables is available at: osf.io/fruq8

Journal ref Medical Image Analysis (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 2 篇

2605.27996 2026-06-01 cs.AI 70%

Reward Bias Substitution: Single-Axis Bias Mitigations Redirect Optimization Pressure

奖励偏差替代:单轴偏差缓解措施重定向优化压力

Max Lamparth, Daniel Fein, Andreas Haupt, Marcel Hussing, Mykel J. Kochenderfer

机构 * Stanford University(斯坦福大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 AI治理与伦理 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出奖励偏差替代现象,即单轴缓解奖励模型偏差(如减少对长度、谄媚或风格的依赖)会将优化压力转移到相关代理上而非消除,并通过理论证明和实验(如GRPO训练中的长度惩罚导致过度自信)揭示了该问题,建议在评估中纳入策略诱导分布并跟踪多偏差。

Comments Improved readability (mostly appendix D)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31518 2026-06-01 cs.LG 57%

On the Relationship Between Activation Outliers and Feature Death in Sparse Autoencoders

关于稀疏自编码器中激活异常值与特征死亡之间关系的研究

Elana Simon, Etowah Adams, James Zou

机构 * Stanford University(斯坦福大学) Columbia University(哥伦比亚大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本文通过理论分析和实验验证,揭示了稀疏自编码器中维度级激活异常值导致特征死亡的机制,并提出均值中心化预处理方法有效消除该问题。

Comments Accepted to ICML 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 13 篇

2605.30632 2026-06-01 cs.HC cs.AI cs.LG 81%

Rationalize: Shared Semantic Reasoning for Human-AI Alignment

Rationalize: 人机对齐的共享语义推理

Aritra Dasgupta, Naga Datha Saikiran Battula, Avina Nakarmi, Sohom Sen, Subhodeep Ghosh, Xun Song

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 提出Rationalize角色对框架,通过共享推理空间中的互补角色对(如探索者-引导者)实现人类与AI在数据驱动意义建构中的语义对齐,并设计元素级和角色特定的对齐评估方法。

Comments Accepted by ACM CHI 2026 BiAlign Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30526 2026-06-01 cs.LG cs.CL 81%

Measuring, Localizing, and Ablating Alignment Signatures in LLMs

测量、定位和消融LLMs中的对齐特征

Aniket Anand, Janvijay Singh, Zhewei Sun, Dilek Hakkani-Tür, Nick Feamster

机构 * University of Chicago(芝加哥大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 研究通过对比人类文本、基模型和对齐模型生成,发现对齐训练引入AI风格特征,并提出PASTA方法通过消融对齐方向来降低AI检测率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31146 2026-06-01 cs.HC cs.AI 79%

From Evidence to Design: Developing an AI-Augmented UX Research Point of View for Digital Wellbeing in Emergency and Public Safety Contexts

从证据到设计:开发面向紧急与公共安全情境下数字福祉的AI增强用户体验研究视角

Olumuyiwa Ayorinde, Huseyin Dogan, Festus Adedoyin, Nan Jiang, Emmanuel Oluokun, Abiodun Adedeji, Melike Akca

机构 * School of Computing and Engineering, Bournemouth University(伯恩茅斯大学计算与工程学院)

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 本研究结合用户体验研究方法与AI支持分析,针对紧急与公共安全人员开发数字福祉干预措施的设计方向,通过文献分析识别模式并整合行为改变技术与说服性设计原则,最终产出UXR PoV金字塔、九张UXR游戏卡和利益相关者叙事。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30723 2026-06-01 cs.CL 79%

Skill is Not One-Size-Fits-All: Model-Aware Skill Alignment for LLM Agents

技能并非一刀切:面向 LLM 智能体的模型感知技能对齐

Jianxiang Yu, Jiapeng Zhu, Bochen Lin, Qier Cui, Zichen Ding, Xiang Li

机构 * East China Normal University(华东师范大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 提出 MASA 框架,通过层次化技能进化管道和轻量级条件重写器,为不同能力的 LLM 主干网络自适应调整技能,显著提升长时交互任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30635 2026-06-01 cs.LG q-bio.GN 79%

CellBRIDGE: Learning Cellular Trajectories via Interaction-Aware Alignment

CellBRIDGE:通过交互感知对齐学习细胞轨迹

Silas Ruhrberg Estévez, Nicolas Huynh, Tennison Liu, Roderik M. Kortlever, Gerard I. Evan, David L. Bentley, Mihaela van der Schaar

机构 * DAMTP, University of Cambridge(剑桥大学应用数学与理论物理系) Francis Crick Institute(弗朗西斯·克里克研究所) University of Colorado Anschutz Medical Campus(科罗拉多大学安舒茨医学校区)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 提出CellBRIDGE方法,通过将配体-受体介导的细胞间通信成本融入最优传输框架,改进了单细胞RNA测序数据中的轨迹推断和跨快照耦合。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19862 2026-06-01 cs.CV cs.LG 79%

IsoCLIP: Decomposing CLIP Projectors for Efficient Intra-modal Alignment

IsoCLIP: 分解CLIP投影器以实现高效的模态内对齐

Simone Magistri, Dipam Goswami, Marco Mistretta, Bartłomiej Twardowski, Joost van de Weijer, Andrew D. Bagdanov

机构 * Media Integration and Communication Center (MICC), University of Florence, Italy(意大利佛罗伦萨大学媒体集成与通信中心) Department of Computer Science, Universitat Autònoma de Barcelona, Spain(西班牙巴塞罗那自治大学计算机科学系) Computer Vision Center, Barcelona, Spain(西班牙巴塞罗那计算机视觉中心) IDEAS Research Institute, Warsaw, Poland(波兰华沙IDEAS研究所)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本文通过分析CLIP投影器的谱特性,发现模态间对齐子空间和各向异性方向,提出无训练方法IsoCLIP去除各向异性方向以改善模态内对齐,在模态内检索和分类任务上降低延迟并超越现有方法。

Comments Accepted at CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31556 2026-06-01 cs.CV cs.AI cs.CL cs.CY cs.HC 67%

Vision-Language Models Suppress Female Representations Under Ambiguous Input

视觉-语言模型在模糊输入下抑制女性表征

Arnau Marin-Llobet, Simon Henniger, Mahzarin R. Banaji

机构 * School of Engineering and Applied Sciences(工程与应用科学系) Department of Psychology(心理学系)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究通过引入零样本度量LALS,发现视觉-语言模型在模糊输入下内部编码与输出存在系统性解耦,女性信号在生成前被抑制,揭示了模型对性别偏见的内部处理机制。

Comments 16 pages, 12 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30930 2026-06-01 cs.HC cs.AI cs.CL cs.CY 67%

TUX: Measuring Human--AI Tacit Understanding

TUX:衡量人机默契理解

Yueshen Li, Hanyi Min, Vedant Das Swain, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) New York University(纽约大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 通过光谱放置任务和TUX指数,量化人类与LLM之间的默契理解,发现人格特征影响对齐程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25842 2026-06-01 cs.AI cs.CL 62%

MuCRASP: Multimodal Chain-of-thought Reasoning aware Structured Pruning

MuCRASP: 多模态思维链推理感知的结构化剪枝

Aritra Dutta, Somak Aditya

机构 * Indian Institute of Technology, Kharagpur(印度理工学院,哈里科普尔)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对视觉语言模型在结构化剪枝后思维链推理准确性下降的问题,提出MuCRASP框架,通过识别推理关键令牌并保持跨模态对齐,在压缩下维持推理质量。

Comments Preprint ver. 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10078 2026-06-01 cs.CL cs.AI 62%

Human Psychometric Questionnaires Mischaracterize LLM Behavior

人类心理测量问卷误判LLM行为

Woojung Song, Dongmin Choi, Yoonah Park, Jongwook Han, Eun-Ju Lee, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Department of Communication, Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学通信系人工智能交叉学科项目)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 通过比较LLM在Likert问卷和生成概率上的价值与人格特征,发现问卷存在系统性偏差,提出基于生成概率的评估方法更准确。

Comments 38 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00175 2026-06-01 cs.LG cs.AI 62%

Who Gets Credit or Blame? Attributing Accountability in Modern AI Systems

谁获得功劳或责备?在现代AI系统中分配责任

Shichang Zhang, Hongzhe Du, Jiaqi W. Ma, Himabindu Lakkaraju

机构 * Harvard University, Cambridge, MA, USA(哈佛大学) University of California, Los Angeles, Los Angeles, CA, USA(加州大学洛杉矶分校) University of Illinois Urbana-Champaign, Urbana-Champaign, IL, USA(伊利诺伊大学厄巴纳-香槟分校)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出一个归因框架,通过反事实问题量化模型开发各阶段(预训练、微调等)对最终行为的影响,并设计无需重训练的估计器,成功识别并移除多阶段任务中的虚假关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31040 2026-06-01 cs.LG 57%

UniRTL: Unifying Code and Graph for Robust RTL Representation Learning

UniRTL:统一代码和图以实现稳健的RTL表示学习

Yi Liu, Hongji Zhang, Lei Chen, Mingxuan Yuan, Qiang Xu

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong, Hong Kong SAR(计算机科学与工程系,香港中文大学,香港特别行政区) Noah's Ark Lab, Huawei, Hong Kong SAR(华为诺亚实验室,香港特别行政区)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 提出UniRTL多模态预训练框架,通过互掩码建模和分层训练策略联合利用RTL代码与控制数据流图,实现细粒度对齐,在性能预测和代码检索任务上优于现有方法。

Comments Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30666 2026-06-01 cs.CY 57%

The Tutoring Effectiveness Index: Predicting LLM Math Tutor Quality from Four Conversation Signals

辅导效果指数:从四个对话信号预测LLM数学辅导质量

Shim Jaechang, Unggi Lee

专题命中 其他安全 :alignment(abstract);分类 cs.CY

AI总结 提出无需训练和外部评判的辅导效果指数(TEI),通过四个内部推理信号选择冻结模型,将预错误场景的改进率从59.0%提升至81.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏