arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-22 至 2026-04-22 共收录 84 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 32 篇

2604.19042 2026-04-22 cs.IR 50%

STK-Adapter: Incorporating Evolving Graph and Event Chain for Temporal Knowledge Graph Extrapolation

STK-Adapter:融合演进图与事件链以实现时序知识图谱外推

Shuyuan Zhao, Wei Chen, Weijie Zhang, Xinrui Hou, Junfeng Shen, Boyan Shi, Shengnan Guo, Youfang Lin, Huaiyu Wan

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出STK-Adapter,通过融合演进图与事件链,解决时序知识图谱外推中空间-时间信息丢失和特征稀释问题,提升模型推理能力与泛化能力。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00198 2026-04-22 cs.CV 50%

Mammo-FM: Breast-specific foundational model for Integrated Mammographic Diagnosis, Prognosis, and Reporting

Mammo-FM:乳腺专用基础模型用于整合乳腺X线诊断、预后和报告

Shantanu Ghosh, Vedant Parthesh Joshi, Rayan Syed, Param Budhraja, Aya Kassem, Katelyn C. Morrison, Alex Tang, Ho Cheung Aiden Wong, Abhishek Varshney, Payel Basak, Weicheng Dai, Judy Wawira Gichoya, Hari M. Trivedi, Imon Banerjee, Shyam Visweswaran, Clare B. Poynton, Kayhan Batmanghelich

机构 * Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系) Department of Computer Science, Boston University(波士顿大学计算机科学系) Data Science, Analytics and Engineering, Arizona State University(亚利桑那州立大学数据科学与工程) Center for Regenerative Medicine, Boston University Medical Campus(波士顿大学医学校区再生医学中心) Department of Radiology, Emory University(埃默里大学放射科) Department of Radiology, Mayo Clinic(梅奥诊所放射科) Chobanian & Avedisian School of Medicine, Boston, MA, USA(波士顿大学医学学院) Department of Biomedical Informatics, University of Pittsburgh(匹兹堡大学生物医学信息学系) Department of Computer Science, Dartmouth College(达特茅斯学院计算机科学系) Human-Computer Interaction, Carnegie Mellon University(卡内基梅隆大学人机交互)

专题命中 安全评测 :alignment(abstract)

AI总结 Mammo-FM是首个针对乳腺X线的专用基础模型,基于最大且多样化的数据集预训练,用于统一的乳腺影像核心临床任务,包括癌症诊断、病理定位、结构化报告生成和癌症风险预后。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 5 篇

2604.19548 2026-04-22 cs.CL cs.AI cs.CY 82%

Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment

通过辩证对齐平息代理中的行动者-观察者不对称性

Bobo Li, Rui Wu, Zibo Ji, Meishan Zhang, Hao Fei, Min Zhang, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(国立新加坡大学) Sichuan University(四川大学) University of Minnesota Twin Cities(明尼苏达大学双城分校) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校) University of Oxford(牛津大学)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出ReTAS模型,通过辩证对齐方法减少代理中的行动者-观察者不对称性,提升故障解决能力。

Comments ACL 2026 Main Conference. Project page: https://unikcc.github.io/ReTAS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15895 2026-04-22 cs.HC 78%

Co-Constructing Alignment: A Participatory Approach to Situate AI Values

共构对齐:一种参与式方法以定位AI价值观

Anne Arzberger, Enrico Liscio, Maria Luce Lupetti, Inigo Martinez de Rituerto de Troya, Jie Yang

专题命中 AI治理与伦理 :alignment(title,abstract)

AI总结 本文通过参与式工作坊探讨用户如何参与AI价值观对齐过程,发现用户更倾向于将对齐视为一种持续的、情境化的共同实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16369 2026-04-22 cs.CY cs.AI cs.CL 67%

Why AI Readiness Is an Organizational Learning Problem, Not a Technology Purchase

为何人工智能准备性是组织学习问题,而非技术采购问题

Jeanne McClure, Gregg Gerdau

机构 * Ars Innovate Technology and Consulting(Ars Innovate技术与咨询) Matador Advisors(Matador顾问) NC State University(北卡罗来纳州立大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文指出,人工智能项目失败本质上是组织学习问题而非技术不足,提出SIO模型指导企业AI能力发展。

Comments 8 Pages 2 figures 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21080 2026-04-22 cs.CL cs.AI cs.CY 67%

InsideOut: Measuring and Mitigating Insider-Outsider Bias in Interview Script Generation

InsideOut: 评估和缓解面试脚本生成中的内部-外部偏见

Yixin Wan, Xingrun Chen, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出InsideOut基准,通过文化情境面试脚本生成任务量化LLM的内部-外部偏见,采用三种评估指标,并提出基于代理的MFA框架缓解偏见,实验表明MFA方法显著降低偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18729 2026-04-22 cs.CL 57%

Investigating Counterfactual Unfairness in LLMs towards Identities through Humor

通过幽默探讨语言模型中身份相关的反事实不公平性

Shubin Kim, Yejin Son, Junyeong Park, Keummin Ka, Seungbeen Lee, Jaeyoung Lee, Hyeju Jang, Alice Oh, Youngjae Yu

机构 * Yonsei University(延世大学) KAIST(韩国科学技术院) Seoul National University(首尔国立大学) Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文通过观察在保持其他因素不变的情况下交换说话者和被指对象,研究语言模型在幽默生成拒绝、说话者意图推断及社会影响预测中的反事实不公平性,揭示身份相关的偏见模式。

Comments Accepted to ACL 2026 Main Conference. The first two authors contributed equally. The last three authors are co-corresponding authors

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 17 篇

2604.19083 2026-04-22 cs.CR cs.AI 83%

ProjLens: Unveiling the Role of Projectors in Multimodal Model Safety

ProjLens: 揭示项目器在多模态模型安全中的作用

Kun Wang, Cheng Qian, Miao Yu, Lilan Peng, Liang Lin, Jiaming Zhang, Tianyu Zhang, Yu Cheng, Yang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Nanyang Technological University(南洋理工大学) Southwest Jiaotong University(西南交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 其他安全 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 ProjLens通过分析多模态大语言模型中的后门攻击机制,揭示了项目器在安全漏洞中的关键作用,发现后门注入参数编码于低秩子空间,并通过实验验证了激活机制的差异。

Comments 18 pages ,15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19559 2026-04-22 cs.AI cs.CL cs.LG 82%

Enhancing Construction Worker Safety in Extreme Heat: A Machine Learning Approach Utilizing Wearable Technology for Predictive Health Analytics

提升极端高温下建筑工人安全:一种利用可穿戴技术的机器学习方法用于预测健康分析

Syed Sajid Ullah, Amir Khan

专题命中 其他安全 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过开发和评估深度学习模型,利用可穿戴设备监测生理数据,提升高温环境下建筑工人的安全防护,实现高精度的健康预测与分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21931 2026-04-22 cs.LG cs.AI 81%

Does the Model Say What the Data Says? A Simple Heuristic for Model Data Alignment

模型是否说数据所说?一种简单的模型-数据对齐启发法

Henry Salgado, Meagan R. Kendall, Martine Ceberio

机构 * Department of Computer Science, The University of Texas at El Paso, El Paso, TX, USA(计算机科学系,德克萨斯理工大学埃尔帕索分校) Department of Engineering Education and Leadership, The University of Texas at El Paso, El Paso, TX, USA(工程教育与领导力系,德克萨斯理工大学埃尔帕索分校)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种计算高效的方法,评估机器学习模型是否与所学数据结构对齐。通过数据本身生成基准,结合二元分类任务中特征对结果组的分离程度,提供模型-数据对齐的可解释方法。

Journal ref International Workshop on Causality, Agents and Large Models, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17937 2026-04-22 cs.HC 78%

"Label from Somewhere": Reflexive Annotating for Situated AI Alignment

从某处获取标签:反思性标注用于情境化AI对齐

Anne Arzberger, Celine Offerman, Ujwal Gadiraju, Alessandro Bozzon, Jie Yang

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文通过反思性标注方法探讨 annotator 的社会位置如何影响标注判断,发现其能捕捉超越静态人口统计数据的元数据,并揭示标注者的位置谦逊与观点转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08014 2026-04-22 cs.CV 78%

Bridging Time and Space: Decoupled Spatio-Temporal Alignment for Video Grounding

弥合时空:解耦的时空对齐用于视频定位

Xuezhen Tu, Jingyu Wu, Fangyu Kang, Qingpeng Nong, Kaijin Zhang, Chaoyue Niu, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) ZTE Corporation(中兴通讯)

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出Bridge-STG框架,通过解耦时空定位并保持语义连贯性,解决视频定位中时空对齐和视觉token冗余问题,实验表明其在多个基准上达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19716 2026-04-22 cs.CL 74%

Discovering a Shared Logical Subspace: Steering LLM Logical Reasoning via Alignment of Natural-Language and Symbolic Views

发现共享的逻辑子空间:通过自然语言和符号视角的对齐来引导LLM逻辑推理

Feihao Fang, My T. Thai, Yuanyuan Lei

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Computer & Information Science and Engineering, University of Florida(佛罗里达大学计算机与信息科学与工程系)

专题命中 其他安全 :alignment(title);分类 cs.CL

AI总结 本文提出通过对齐自然语言和符号视角的逻辑子空间来提升LLM的多步逻辑推理能力,通过实验验证该方法在四个基准测试中提升了准确率并具备良好的泛化能力。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19172 2026-04-22 cs.AI 74%

Reasoning-Aware AIGC Detection via Alignment and Reinforcement

基于对齐与强化的学习的推理感知AIGC检测

Zhao Wang, Max Xiong, Jianxun Lian, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Duke University(杜克大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 其他安全 :alignment(title);分类 cs.AI

AI总结 本文提出REVEAL框架,通过生成可解释的推理链实现AIGC检测,采用两阶段训练策略提升准确性和逻辑一致性,实验显示其在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18943 2026-04-22 cs.AI cs.CL cs.HC cs.IR cs.LG 67%

Personalized Benchmarking: Evaluating LLMs by Individual Preferences

个性化基准测试:通过个体偏好评估LLM

Cristina Garbacea, Heran Wang, Chenhao Tan

机构 * University of Chicago(芝加哥大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出个性化LLM基准测试,通过ELO评分和Bradley-Terry系数分析115名用户对LLM的排名差异,发现个体偏好与聚合排名差异显著,强调开发个性化基准的重要性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05090 2026-04-22 cs.CL cs.LG 62%

Multilingual Language Models Encode Script Over Linguistic Structure

多语言语言模型编码脚本而非语言结构

Aastha A K Verma, Anwoy Chatterjee, Mehak Gupta, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(印度理工学院德里)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 研究揭示多语言模型通过表面形式而非语言结构组织表示,发现正字法影响显著,深层结构逐渐显现。

Comments Accepted at ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10559 2026-04-22 cs.LG cs.AI cs.RO 62%

Generative Models and Connected and Automated Vehicles: A Survey in Exploring the Intersection of Transportation and AI

生成模型与连接与自动化车辆:探索交通与人工智能交汇点的综述

Bo Shu, Yiting Zhang, Saisai Hu, Dong Shu

机构 * School of Engineering Science(工程科学学院) Shandong Xiehe University(山东谢河大学) Department of Electrical Engineering(电气工程系) Northwestern University(西北大学) Department of Computer Science(计算机科学系) Pace University(帕克大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了生成模型与连接自动化车辆在交通与AI交汇领域的应用,探讨其在预测建模、模拟精度和自动驾驶决策中的提升作用及面临的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10866 2026-04-22 stat.ML cs.LG 57%

Quantifying Data Similarity Using Cross Learning

通过交叉学习量化数据相似性

Shudong Sun, Hao Helen Zhang, Joseph C Watkins

机构 * GIDP University of Arizona(GIDP亚利桑那大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出Cross-Learning Score,通过双向泛化性能衡量数据集相似性,结合几何解释和鲁棒集成估计器,扩展至深度学习架构,验证了其在数据相似性测量和迁移评估中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19125 2026-04-22 cs.CL 57%

Do Emotions Influence Moral Judgment in Large Language Models?

情绪是否影响大语言模型的道德判断?

Mohammad Saim, Tianyu Jiang

机构 * University of Cincinnati(辛辛那提大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究通过情感诱导流程评估多组数据和LLM中道德可接受性变化,发现积极情绪提升道德可接受性,负面情绪降低,且部分情绪表现与预期相反,揭示了当前LLM与人类在道德判断上的差异。

Comments 18 pages, 14 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18913 2026-04-22 cs.CL 57%

LogosKG: Hardware-Optimized Scalable and Interpretable Knowledge Graph Retrieval

LogosKG:硬件优化的可扩展且可解释的知识图谱检索

He Cheng, Yifu Wu, Saksham Khatwani, Maya Kruse, Dmitriy Dligach, Timothy A. Miller, Majid Afshar, Yanjun Gao

机构 * LARK Lab, University of Colorado Anschutz(洛克拉克实验室,科罗拉多大学安施图茨分校) University of Colorado Boulder(科罗拉多大学波德分校) Loyola University Chicago(芝加哥洛克拉克大学) Harvard Medical School(哈佛医学院) Boston Children’s Hospital(波士顿儿童医院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 LogosKG通过符号知识图谱和硬件高效操作实现大规模知识图谱的多跳检索,提升效率与可解释性,展示出在生物医学知识与大语言模型推理对齐分析中的应用价值。

Comments Accepted to the ACL 2026 Main Conference. 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18712 2026-04-22 cs.CL 57%

Probing for Reading Times

探测阅读时间

Eleftheria Tsipidi, Samuel Kiegeland, Francesco Ignazio Re, Tianyang Xu, Mario Giulianelli, Karolina Stanczak, Ryan Cotterell

机构 * ETH Zürich(苏黎世联邦理工学院) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) University College London(伦敦大学学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文通过眼动追踪数据,利用正则化线性回归比较语言模型各层表示在预测阅读时间等指标上的表现,发现早期层表示在预测早期眼动指标上优于 surprisal,但对总阅读时间而言 surprisal 仍更优。

Comments ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19509 2026-04-22 cs.RO cs.MA 50%

Assessing VLM-Driven Semantic-Affordance Inference for Non-Humanoid Robot Morphologies

评估基于视觉语言模型的非人形机器人语义可及性推理

Jess Jones, Raul Santos-Rodriguez, Sabine Hauert

机构 * Bristol Robotics Laboratory, University of Bristol(布里斯托尔机器人实验室,布里斯托尔大学) University of Bristol(布里斯托尔大学)

专题命中 其他安全 :safety(abstract)

AI总结 本文研究了视觉语言模型在非人形机器人上的语义可及性推理能力,通过混合数据集分析发现模型在不同物体和机器人形态上表现不一,存在保守预测倾向,需结合其他方法以提高性能。

Comments AAMAS 2026 (main track), 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17797 2026-04-22 cs.CV 50%

Weakly-Supervised Referring Video Object Segmentation through Text Supervision

通过文本监督实现弱监督的指称视频对象分割

Miaojing Shi, Jun Huang, Zijie Yue, Hanli Wang

机构 * College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出WSRVOS方法,通过文本表达训练模型,利用对比学习生成正负表达,实现细粒度多模态对齐,并引入实例感知分类和伪掩码融合策略,提升视频对象分割性能。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21020 2026-04-22 cs.RO 50%

Hybrid Task and Motion Planning with Reactive Collision Handling for Multi-Robot Disassembly of Complex Products: Application to EV Batteries

混合任务与运动规划与反应碰撞处理用于多机器人复杂产品拆解:应用于电动汽车电池

Abdelaziz Shaarawy, Cansu Erdogan, Rustam Stolkin, Alireza Rastegarpanah

机构 * Extreme Robotics Laboratory, School of Metallurgy and Materials, University of Birmingham(极端机器人实验室,冶金与材料学院,伯明翰大学) Department of Applied Artificial Intelligence and Robotics, Aston University(应用人工智能与机器人学院,阿斯顿大学)

专题命中 其他安全 :safety(abstract)

AI总结 本文提出一种基于视觉的任务与运动规划框架,用于多机器人协同拆解复杂产品,通过学习型RRT规划器和混合安全层提高路径紧凑性和安全性,实验显示在电动汽车电池拆解中显著降低路径长度和扫过体积。

详情

展开后加载摘要…

URL PDF HTML 收藏