arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-23 至 2026-06-23 共收录 171 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 60 篇

2606.09013 2026-06-23 cs.CL 新提交 57%

Beyond Averages: Evaluating LLMs on Human Survey Replication at the Distributional Level

超越平均值:在分布层面评估LLM对人类调查的复现能力

Jeonghyeon Moon, Jiwon Kim, Yeheum Lah, Yoonju Han, Yuncheol Kang

机构 * Ewha Womans University(梨花女子大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本研究通过非公开的韩国方便面购买实验,在分布层面评估LLM复现人类调查响应的能力,发现均值匹配的模型可能产生更偏离人类的分布,且结构化角色和多模态输入提升对齐度,而推理提示则降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09382 2026-06-23 cs.LG 版本更新 57%

CHUCKLE -- When Humans Teach AI To Learn Emotions The Easy Way

CHUCKLE -- 当人类教AI学习情感的简便方式

Ankush Pratap Singh, Houwei Cao, Yong Liu

机构 * New York Institute of Technology, Department of Computer Science(纽约理工学院计算机科学系) New York University, Electrical and Computer Engineering Department(纽约大学电气与计算机工程系)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 CHUCKLE提出一种基于人类感知的课程学习框架,通过众包数据集中的标注者一致性和共识定义样本难度,提升LSTM和Transformer的性能,同时减少梯度更新次数,提高训练效率和模型鲁棒性。

Journal ref Proc. Interspeech 2026, Sydney, Australia, Aug. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09362 2026-06-23 cs.HC cs.AI 版本更新 57%

"I Said Things I Needed to Hear Myself": Peer Support as an Emotional, Organisational, and Sociotechnical Practice in Singapore

“我说了那些我自己需要听到的话”:新加坡的同伴支持作为情感、组织和社会技术实践

Kellie Yu Hui Sim, Kenny Tsu Wei Choo

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 通过访谈20名新加坡同伴支持者,揭示其动机、情感劳动和社会文化维度,提出文化响应式数字工具设计方向,并探讨AI如何负责任地增强同伴支持。

Comments 20 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22318 2026-06-23 q-bio.OT 新提交 50%

PROMPT: A Pre-registered Randomized Protocol for Component-Level Evaluation of Clinical AI Prompts

PROMPT:临床AI提示组件级评估的预注册随机协议

Bin Hu, Avneek Sandhu, Shahryar Wasif

专题命中 安全评测 :safety(abstract)

AI总结 提出PROMPT协议,通过预注册、随机化、匹配对照和拆解设计,在合成和医学图像任务中识别提示组件的有益、有害和无效效应,揭示整体提示评估遗漏的安全漏洞。

Comments 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23354 2026-06-23 cs.CV 新提交 50%

Faithful Grounded Visual Reasoning via Learned Proxy-Tokens

通过学习的代理令牌实现忠实的接地视觉推理

Tom Hodemon, Mohamed Chaouch, Aboubacar Tuo, Angelique Loesch

机构 * CEA-LIST(法国原子能委员会-信息与系统技术实验室)

专题命中 安全评测 :trustworthy(abstract)

AI总结 提出Composer模型,利用基于学习代理令牌的视觉接地机制,通过离散符号指针显式索引图像潜在空间,在保持答案准确性的同时将视觉接地准确率提升9.0个百分点。

Comments Accepted at ICIP 2026. Code, model and data available at: https://github.com/CEA-LIST/Composer

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22399 2026-06-23 cs.SD 新提交 50%

ATCCaps: A Call-Sign-Aware Speech Dataset for Air Traffic Control Recognition

ATCCaps: 一个面向空中交通管制识别的呼号感知语音数据集

Dongdong Li, Jianwei Song, Jianwei Wang, Zhe Wang

机构 * East China University of Science and Technology(华东理工大学)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出ATCCaps,一个基于真实无线电通话构建的呼号感知语音数据集,包含202.94小时音频和17万条话语,通过结合置信度感知的转录解析、ADS-B呼号元数据、规则过滤和LLM辅助字幕生成,支持ASR评估、呼号匹配和音频-文本检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21861 2026-06-23 cs.CV 新提交 50%

Zero-Shot Vision-Language Models for Classroom Engagement Recognition: A Benchmark Study of Prompt Sensitivity and Cross-Dataset Generalization

零样本视觉语言模型用于课堂投入度识别:提示敏感性与跨数据集泛化的基准研究

Aman Goyal, Kshama Nitin Shah, Kemmannu Vineet Venkatesh Rao

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) Magna International(麦格纳国际)

专题命中 安全评测 :safety(abstract)

AI总结 本研究系统评估五种视觉语言模型在零样本条件下识别课堂投入度的表现,发现三个主要失败模式:个体学生识别近乎随机、类别崩溃和极端提示敏感性,但场景级分类效果较好。

Comments 11 pages, 6 figures, including supplementary material. Presented as a non-archival paper at the CV4Edu Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21538 2026-06-23 physics.flu-dyn 新提交 50%

Turbulence Physics Governs a Scaling Law for the Machine-Learning Predictability Ceiling in Chaotic Flow

湍流物理支配混沌流中机器学习可预测性上限的标度律

Jiashun Guan, Haoyang Hu, Yunxiao Ren, Michael S. Triantafyllou, Dixia Fan

专题命中 安全评测 :trustworthy(abstract)

AI总结 研究揭示混沌流中机器学习预测精度随预报时长恶化的标度律,源于湍流理论而非模型缺陷,并通过钝体绕流高保真仿真验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07131 2026-06-23 cs.CR cs.SE 版本更新 50%

MalSkillBench: A Runtime-Verified Benchmark of Malicious Agent Skills

MalSkillBench: 一个运行时验证的恶意智能体技能基准

Wenbo Guo, Wei Zeng, Chengwei Liu, Xiaojun Jia, Yijia Xu, Lei Tang, Yong Fang, Yang Liu

专题命中 安全评测 :prompt injection(abstract)

AI总结 提出MalSkillBench,首个运行时验证的恶意智能体技能基准,包含3944个恶意技能,通过闭环生成-验证-反馈流水线构建,揭示代码注入与提示注入检测的不对称性,并指出联合推理任务意图、代码和指令的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 7 篇

2606.22528 2026-06-23 cs.AI 新提交 79%

Governance Decay: How Context Compaction Silently Erases Safety Constraints in Long-Horizon LLM Agents

治理衰减:上下文压缩如何悄然消除长周期LLM智能体中的安全约束

Shiyang Chen

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI

AI总结 研究发现LLM智能体的上下文压缩机制会无意中移除安全约束,导致违规行为;提出ConstraintRot基准和Constraint Pinning缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21619 2026-06-23 cs.SE cs.LG cs.PL 新提交 79%

The Alignment Problem in Constrained Code Generation

约束代码生成中的对齐问题

Matteo Biagiola, Jahrim Gabriele Cesario, Luca Di Grazia, George Zakhour, Guido Salvaneschi

机构 * University of St. Gallen(圣加尔登大学) Università della Svizzera italiana (USI)(瑞士联邦理工学院)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.LG

AI总结 研究约束解码中约束器、语言模型与目标语言之间的对齐问题,发现约束器的不完整性会扭曲模型分布,导致功能正确性下降高达97%,并提出设计约束器的定量见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15205 2026-06-23 cs.CY 版本更新 70%

A Peek Behind the Curtain: Using Step-Around Prompt Engineering to Identify Bias and Misinformation in GenAI Models

幕后窥探:使用逐步提示工程识别生成式AI模型中的偏见与虚假信息

Don Hickerson, Mike Perkins

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY

AI总结 本文探讨逐步提示工程作为对抗性提示技术,用于测试生成式AI的安全护栏和偏见缓解机制,并提出了学术伦理治理框架。

Comments v3 Substantial text changes and addition of structured framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22097 2026-06-23 cs.CL cs.AI 新提交 62%

Plurification in/of language technology -- The integration of culture in next-generation AI

语言技术中的/对语言技术的净化——下一代AI中的文化整合

Gertraud Koch, Fausto Giunchiglia

机构 * University of Hamburg(汉堡大学) University of Trento(特伦托大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨如何在自然语言处理中操作化“文化”,提出文化对齐需要多元认识论,而非仅添加“其他文化”示例,并通过技术活动五层模型分析现有方法,指出多数方法仅停留在输出或表征层面,需转向反思性多元社会技术路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20699 2026-06-23 cs.MA cs.AI cs.CY 新提交 62%

Structural Distinguishability of Static and Adaptive Policy Regimes in Agent-Based Regulatory Simulation

基于智能体的监管模拟中静态与自适应政策机制的结构可区分性

Roberto Garrone

机构 * Open University of Cyprus(塞浦路斯开放大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文通过可配置的排放监管ABM基准,比较四种政策-智能体机制,揭示自适应政策与智能体交互导致监管结论差异,提出机制可区分性评估方法。

Comments 19 pages, 4 figures, 9 tables. Simulation-based methodological study

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09354 2026-06-23 cs.HC cs.AI 版本更新 57%

"Is This Really a Human Peer Supporter?": Misalignments Between Peer Supporters and Experts in LLM-Supported Interactions

“这真的是人类同伴支持者吗?”:同伴支持者与专家在LLM支持互动中的错位

Kellie Yu Hui Sim, Roy Ka-Wei Lee, Kenny Tsu Wei Choo

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 研究通过混合方法评估LLM模拟求助者、生成建议和实时情绪可视化系统,发现同伴支持者与心理健康专家在识别求助信号和给予建议上存在关键错位,凸显标准化培训需求。

Comments Accepted at CSCW 2026. 53 pages, 12 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05985 2026-06-23 cs.CY cs.CV 版本更新 57%

Generating Fearful Images: Investigating Potential Emotional Biases in Image-Generation Models

生成恐惧图像:探究图像生成模型中的潜在情感偏差

Maneet Mehta, Cody Buntain

机构 * Yale University(耶鲁大学) University of Maryland(马里兰大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 研究生成式AI模型在图像情感表达中的偏差,发现Stable Diffusion、ChatGPT和Gemini等模型生成的图像普遍倾向于引发恐惧情绪,表明存在系统性偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 35 篇

2606.20696 2026-06-23 cs.CL cs.AI eess.AS 新提交 81%

MindAlign: Decoding Inner Speech from fMRI Signals via Multimodal Embedding Alignment under Limited Data

MindAlign: 在有限数据下通过多模态嵌入对齐从fMRI信号解码内心语言

Muxuan Liu, Ichiro Kobayashi, Satoshi Nishida

机构 * Graduate School of Humanities and Sciences Ochanomizu University(大仓山大学人文科学研究生院) Center for Information and Neural Networks Advanced ICT Research Institute National Institute of Information and Communications Technology(信息与神经网络中心先进信息通信研究机构信息通信技术研究所)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 提出MindAlign两阶段框架,通过神经-语义对齐将fMRI信号映射到多模态语义空间,再结合视觉上下文冻结多模态语言模型生成文本,在静默图像描述数据上优于基线,且语义-语言投影可跨被试泛化。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19346 2026-06-23 cs.CL cs.AI 新提交 81%

Disentangling Linguistic Relatedness from Task Alignment in Cross-Lingual Transfer

跨语言迁移中语言相关性与任务对齐的解耦

Ahmed Haj Ahmed, Ruochen Zhang, Alvin Grissom

机构 * Haverford College(哈弗福德学院) Brown University(布朗大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 通过微调大语言模型并在闪语族与非闪语族语言上评估零样本阅读理解,发现跨语言迁移主要提升任务格式对齐而非语言特定知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22992 2026-06-23 cs.CL 新提交 79%

Predicate Importance Estimation and Decoupled Rationale-Score Distillation for Entity Alignment

谓词重要性估计与解耦理由-分数蒸馏用于实体对齐

Keunha Kim, Yoonjin Jang, Hyeon-gu Lee, Sihyung Kim, Youngjoong Ko

机构 * SungKyunKwan University(成均馆大学) NAVER

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 提出谓词重要性估计和解耦理由-分数蒸馏两个模块,通过谓词感知嵌入和蒸馏小语言模型提升知识图谱实体对齐性能,并利用分数与理由的不一致实现人机协同验证。

Comments 12 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21906 2026-06-23 cs.CL 新提交 79%

Deeper is Not Always Better: Mitigating the Alignment Tax via Confident Layer Decoding

更深并非总是更好:通过置信层解码缓解对齐税

Xuanming Zhang, Sining Zhoubian, Yuxuan Chen, Tianyi Tang, An Yang, Sean Du, Chujie Zheng, Fei Huang, Dayiheng Liu, Gao Huang, Jingren Zhou

机构 * Qwen Team, Alibaba Inc.(阿里巴巴集团 Qwen 团队) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 提出Confident Decoding,一种无需训练的解码策略,通过熵引导的保守反向搜索动态选择最可靠的近最终层,以缓解对齐微调导致的最终层扰动,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21851 2026-06-23 cs.CL 新提交 79%

TALAS: Teacher-Anchored Layer Alignment with Adaptive Sharpness-Aware Minimization for Embedding Distillation

TALAS:基于教师锚定的层对齐与自适应锐度感知最小化的嵌入蒸馏

Quoc Phong Dao, Hoang Son Nguyen, Pham Khanh Chi, Linh Ngo Van, Nguyen Thi Ngoc Diep, Thien Huu Nguyen, Trung Le

机构 * Hanoi University of Science and Technology(河内科技大学) VNU University of Engineering and Technology(越南国立大学工程与技术大学) University of Oregon(俄勒冈大学) Monash University(莫纳什大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 提出TALAS框架,通过教师锚定机制仅蒸馏最终句子嵌入到学生上层,结合层对齐自蒸馏和自适应锐度感知最小化,在降低计算成本的同时提升句子嵌入蒸馏性能。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20890 2026-06-23 cs.CL cs.IR 新提交 79%

Topic-to-Timestamp Alignment by Constrained Evidence Selection

通过约束证据选择的主题到时间戳对齐

Zeynep Yılbırt, Marina Litvak, Michael Färber

机构 * TU Dresden(德累斯顿工业大学) SpeechMind GmbH(SpeechMind 公司) Shamoon College of Engineering(沙蒙工程学院) ScaDS.AI Dresden/Leipzig(ScaDS.AI 德累斯顿/莱比锡)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 针对会议记录中主题到时间戳的对齐问题,提出将时间戳预测重构为约束时间候选选择,通过检索时间戳转录块并选择最佳候选而非生成时间码,显著提升召回率和解析输出数量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21915 2026-06-23 cs.CV 新提交 78%

GTA-Net: Cooperative Game Theory for Vision-Language Alignment in Chest X-Ray Report Generation

GTA-Net:合作博弈论在胸部X光报告生成中的视觉-语言对齐

Saif ur Rehman Khan, Imad Ahmed Waqar, Sebastian Vollmer, Andreas Dengel, Muhammad Nabeel Asim

机构 * Department of Computer Science, Rhineland-Palatinate Technical University of Kaiserslautern-Landau(莱茵兰-普法尔茨凯泽斯劳滕-兰道工业大学计算机科学系) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) IntelligentX GmbH

专题命中 其他安全 :alignment(title,abstract)

AI总结 提出GTA-Net,利用合作博弈论实现图像区域与文本的显式对齐,通过二元和三元对齐器提升胸部X光报告生成的临床一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22226 2026-06-23 cs.GT cs.AI cs.IT math.IT 新提交 76%

Quantifying Theoretical AI Alignment Guarantees: Receiver-Utility Bounds in Bayesian Persuasion

量化理论上的AI对齐保证:贝叶斯说服中的接收者效用界

Eric Yachbes, Eva Tardos

机构 * Cornell University(康奈尔大学)

专题命中 其他安全 :alignment(title,comments);分类 cs.AI

AI总结 通过贝叶斯说服模型,研究AI发送者优化错位目标时,人类接收者仍能获得多少有用信息,证明接收者效用比不超过3/2,并给出紧性下界。

Comments 12 pages, EC 2026 Poster and EC 2026 Incentive-Based AI Alignment Workshop Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22769 2026-06-23 cs.LG cs.AI 新提交 73%

Noise is Signal: Density-Based Outliers as Leading Indicators of Occupational Emergence in Labor Market Text

噪声即信号:基于密度的异常值作为劳动力市场文本中职业涌现的领先指标

Shreyash Rawat

机构 * Independent Researcher(独立研究员)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出涌现-密度反转假设,证明低密度异常值预示新职业涌现,通过时序分析验证并改进涌现职业评分,预测准确率从F1=0.61提升至0.74。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23668 2026-06-23 cs.LG 新提交 70%

On the Limits of Prompt-Conditioned Language Models as General-Purpose Learners

关于提示条件语言模型作为通用学习器的局限性

David Mguni, Julian Ma, Jun Wang

机构 * Queen Mary University London(伦敦玛丽女王大学) University College London(伦敦大学学院)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文通过廉价谈话博弈模型分析提示条件语言模型,证明语言作为容量受限通道导致任务不可区分性,并因对齐约束产生不可约误差,从而否定其通过提示实现通用问题求解的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23124 2026-06-23 cs.CL cs.AI 新提交 62%

PRIDE: Privileged Information-enhanced Distillation for Empathetic Dialogue Generation

PRIDE: 特权信息增强的共情对话生成蒸馏方法

Jiaqiang Wu, Zhouan Zhu, Shangfei Wang

机构 * Anhui Robot Technology Standard Innovation Base, School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院安徽机器人技术标准创新基地)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出PRIDE方法,利用训练时可用但推理时不可用的特权信息(如心理标注或未来事件摘要),通过共情推理提示、多源注意力机制和双对齐损失,将大模型的共情推理能力蒸馏到小模型,在资源受限场景下保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22550 2026-06-23 cs.CV cs.AI cs.CL cs.MM 新提交 62%

Training-Free Semantic Correction for Autoregressive Visual Models

自回归视觉模型的免训练语义校正

Junhao Chen, Chanyu Zhu, Zheqi Lv, Keting Yin, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Shandong University(山东大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出Gazer框架,通过多模态大语言模型反馈在自回归视觉模型采样循环中进行语义诊断与校正,无需额外训练即可提升语义对齐和组合准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21977 2026-06-23 cs.CY cs.AI cs.HC 新提交 62%

Old Fictions, New Skins: Evaluating the Manipulative Capabilities of LLMs in Healthcare

旧小说,新皮肤:评估LLM在医疗保健中的操纵能力

Gathoni Ireri, Roger D. Odipo

机构 * ILINA Program(ILINA项目) Haki AI

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY

AI总结 通过随机实验发现,ChatGPT 5.2和DeepSeek V3.2在肯尼亚参与者中能显著操纵其治疗决策,成功率从44.0%升至59.5%,凸显非洲医疗AI中防范操纵的必要性。

Comments 28 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21843 2026-06-23 cs.AI cs.CL 新提交 62%

Measuring What Persists: Conditioning Mechanisms and a Geometric Framework for AI Agent Identity

测量持续存在的内容:AI智能体身份的调节机制与几何框架

Andrew Tanner

机构 * Anisotrope AI

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 提出基于√JSD度量空间和丰富范畴理论中幅度同调的几何框架,用于测量AI智能体身份结构,发现双机制调节结构:身份真空簇和安全盆地簇,并通过等边探针基线验证身份规范创造可测量的行为丰富性。

Comments 29 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏