arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 2719 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 580 篇

2606.11173 2026-06-10 cs.AI cs.LG 新提交 81%

The Role of Feedback Alignment in Self-Distillation

反馈对齐在自蒸馏中的作用

Semih Kara, Oğuzhan Ersoy

机构 * Gensyn

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过自蒸馏提升语言模型性能时,反馈与模型推理的结构对齐是关键因素,步级对齐批评比二元奖励或参考解更有效。

Comments Accepted to the ICML 2026 Workshop on RL from World Feedback (RLxF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16407 2026-08-18 cs.IR cs.LG 新提交 79%

POI Recommendation with LLM-Augmented Multi-Graph Learning and Contrastive Alignment

结合大语言模型增强多图学习与对比对齐的兴趣点推荐

Burak Tamer, Wolfram Höpken, Zehui Wang

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 该研究针对POI推荐的物品冷启动问题,提出LLM-MGCL模型,结合语义、地理与交互多图及对比学习,在Yelp数据集上显著优于基线模型,缓解了冷启动问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08077 2026-08-11 cs.AI cs.MA cs.RO 新提交 79%

Explore, Map, Remember, Decide: Are Embodied VLMs Ready for Safety-Critical Scenarios?

探索、建图、记忆、决策:具身视觉语言模型是否已准备好应对安全关键场景?

Gabriele La Malfa, Nitay Alon, Emanuele La Malfa, Reuth Mirsky, Stefan Sarkadi

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 本文扩展ToS框架为EMRD流程,评估VLMs在安全关键场景下的空间理解与决策能力,发现其决策依赖文本先验、空间推理受低光照影响,且记忆与人类认知存在根本差异,存在对齐风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04697 2026-08-06 cs.AI 新提交 79%

Traceable LLM-Generated Hazard Scenarios for Operational Safety Analysis of Aviation Systems Using ASRS Reports

基于ASRS报告的可追踪LLM生成航空系统运行安全分析危险场景

Cristian Mascia, Roberto Pietrantuono, Daniel Rodriguez, Stefano Russo

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 该研究针对航空系统运行安全分析,提出AI辅助方法结合ASRS报告,用LLM生成可追踪危险场景,通过进化溯因优化混合变体,经评估验证了模型与提示对生成场景有效性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03446 2026-08-05 cs.CL 新提交 79%

Predicting Multilingual Classification and Translation Performance of LLMs with Cross-Lingual Alignment $\unicode{x2013}$ Is English Enough?

用跨语言对齐性预测大语言模型的多语言分类与翻译性能——英语足够了吗?

Adnan Al Ali, Kathy Hämmerl, Jindřich Libovický, Alexander Fraser

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 该研究对比分析27种跨语言对齐分数变体,提出基于PMI的翻译指标,发现用英语的跨语言对齐可相当或更好预测LLMs翻译性能,为LLMs以英语为内部枢纽语言提供新证据。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03247 2026-08-05 cs.CV cs.CL 新提交 79%

CIGTSurv: Clinical Information Guided Tri-modal Survival Prediction with Local Prototype Association and Global Feature Alignment

CIGTSurv:结合局部原型关联与全局特征对齐的临床信息引导三模态生存预测

Jing Dai, Qibin Zhang, Weiwei Zhou, Mingde Xu, Jingsong Liu, Jingdong Zhang, Hongming Xu

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 本研究针对临床信息未充分利用及多模态异质性问题,提出CIGTSurv框架,结合局部原型关联与全局特征对齐机制,在五个TCGA癌症队列上取得生存预测SOTA性能。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00415 2026-08-04 cs.CV cs.AI 新提交 79%

Boosting Generalizable Depth Estimation in Endoscopy by Mixture of Lightweight Experts and Intrinsic Image Alignment

基于轻量级专家混合与本征图像对齐的内窥镜可泛化深度估计增强方法

Liangjing Shao, Beilei Cui, Yiming Huang, Changjing Liu, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出自监督框架EndoMINI,结合低秩专家混合与本征图像对齐,在多内窥镜数据集上实现了更优的可泛化深度估计性能。

Comments Accepted by MICCAI 2026 @ The Efficient Medical AI (EMA4MICCAI) Workshop (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00001 2026-08-04 cs.AI 新提交 79%

Revisiting Classic Thought Experiments to Measure Consciousness for Artificial Intelligence Safety

Peter David Fagan

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29008 2026-08-03 stat.ML cs.LG 新提交 79%

Persistent Convolution: A Topological Framework for AI Alignment Testing and Semantic Space Characterization

持久卷积:用于AI对齐测试和语义空间表征的拓扑框架

Tyler Ashoff, Jordan Rodu

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本研究开发了一种基于拓扑的多模态对齐测试,以提升不透明AI模型部署、选择与比较的可解释性,助力AI对齐测试与语义空间表征。

Comments Code available at github.com/tylerashoff/persiscope (PyPI: persiscope)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28980 2026-08-03 cs.LG 新提交 79%

Beyond Feature and Structure Alignment: Learning Transferable Propagation Knowledge for Graph Foundation Models

超越特征与结构对齐:学习图基础模型的可迁移传播知识

Yi Wang, Jitao Zhao, Di Jin, Dongxiao He

机构 * Tianjin University(天津大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 针对现有图基础模型忽略可迁移传播知识单元与传播模式异质性的局限,本文提出ProGFM,通过传播关系原型库学习跨域可迁移传播知识,在多跨域场景下实现更优泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28196 2026-07-31 cs.CL 新提交 79%

Fidelity Is Not Safety: Gently-Compressed LLMs Pass Every Data-Free Quality Guard Yet Invent Procedure Steps in Agentic Execution

保真度≠安全性:轻度压缩的大语言模型通过所有无数据质量防护,但在智能体执行中生成指令中不存在的流程步骤

I. Kennedy, T. Kennedy

专题命中 其他安全 :safety(title,abstract);分类 cs.CL

AI总结 该研究发现轻度压缩LLM虽通过困惑度、MMLU等无数据质量防护,但在智能体执行SOP时会生成指令外流程步骤,提出基于压缩误差双轴统计量的无数据筛查方法以保障智能体安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27951 2026-07-31 cs.CR cs.AI 新提交 79%

Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs

基于可复制上下文的安全防护无法为大语言模型提供可靠的安全性

Pingyu Wu, Lingyao Zhu, Weiming Zhang, Nenghai Yu

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 该研究指出基于可复制上下文的LLM安全防护存在三难困境,提出用可信凭证补充防护以预测下游使用,其结论经相关评估与程序验证具有实际意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26164 2026-07-30 cs.LG 新提交 79%

Data Fusion and Contrastive Alignment for Unconstrained IR Molecular Structure Elucidation

面向无约束红外分子结构解析的数据融合与对比对齐

Ethan J. Mick, Campbell A. Sweet, Matthias J. Young, Derek T. Anderson

机构 * University of Missouri(密苏里大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本研究针对无约束红外分子结构解析的局限性,改进Transformer并引入MoE解码器与对比对齐损失,使Top-K预测准确率提升超10个百分点,拓宽了AI在分析化学的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24782 2026-07-29 cs.AI 新提交 79%

Personalization, Personas, and Forecasting in Value Alignment

价值对齐中的个性化、角色设定与预测

James Wedgwood, Pratiksha Thaker, Neil Kale, Virginia Smith

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 研究探讨LLM行为受人类身份影响的方式,通过WVS测试不同框架的互换性,在多语言多国家问题上评估多个模型,发现提示框架是文化对齐的关键因素,不同框架效果有别,对齐增益集中在部分价值维度,制度信任等问题仍难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23944 2026-07-28 cs.AI 新提交 79%

DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models

DICA:多模态大语言模型中的双指标引导对比对齐

Hao Yang, Jin Wang, Xuejie Zhang

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型的问题,提出双指标引导对比对齐方法(DICA),通过跟踪视觉注意力熵和输出图像相关性两个指标,根据异常情况触发对比对齐,实验证明该方法能提升模型可靠性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17657 2026-07-21 cs.AI cs.CV cs.MM 新提交 79%

OrientSAM: Mitigating Camera-Centric Shortcut in Multimodal Spatial Reasoning via Orientation-Aware Spatial Alignment

OrientSAM:通过方向感知空间对齐减轻多模态空间推理中以相机为中心的捷径

Wenxiao Fan, Hang Yin, Kan Li

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 研究多模态模型空间推理中以相机为中心的问题,提出OrientSAM框架,通过方向感知令牌、傅里叶角度编码及课程学习策略注入方向信息并改善推理,构建数据管道生成监督,实验证明其在多任务中表现出色,能减轻捷径行为,实现更强大的以对象为中心的空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15810 2026-07-20 cs.LG 新提交 79%

QUADS: Stabilizing NVFP4 Reinforcement Learning for MoE via QUantization-error Alignment across Dual Sides

QUADS:通过双边量化误差对齐稳定用于专家混合模型的NVFP4强化学习

Zhengyang Zhuge, Hao Yu, Xin Wang, Zheng Li, Yizhong Cao, Dayiheng Liu, Jianwei Zhang

机构 * Alibaba Inc(阿里巴巴公司)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 研究针对MoE大语言模型RL中展开生成瓶颈,提出QUADS方法。通过训练 - 推理误差分析确定激活误差是FP4 RL不稳定主因,在训练器和展开侧分别采取措施,实现BF16精度,提升指标并提高展开吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10162 2026-07-14 eess.AS cs.CL 新提交 79%

Hearing Like Humans? Sound Symbolism and Perceptual Alignment in Speech Language Models

像人类一样听?语音语言模型中的语音象征与感知对齐

Yun-Shao Tsai, Chun-Wei Chen, Chee-En Yu, Yi-Cheng Lin, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering National Taiwan University Taipei, Taiwan Graduate Institute of Electrical Engineering National Taiwan University Taipei, Taiwan Artificial Intelligence Center of Research Excellence National Taiwan University Taipei, Taiwan

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 研究语音语言模型是否有语音象征倾向,通过真实人类语音录音对比模型与人类数据,发现模型听觉判断与人类感知对齐差,错过声学线索,开放权重模型表现不佳,弱点在语音表示方式。

Comments Submitted to SLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09126 2026-07-13 cs.CV cs.CL 新提交 79%

VTaMo: Video-Text Alignment Model for Sign Language Translation

VTaMo:用于手语翻译的视频-文本对齐模型

Junyi Hu, Zhewen He, Haomian Huang, Aoxiang Yang, Yi Fang

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) ChatSign Technology(ChatSign科技)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 研究手语翻译问题,提出VTaMo框架,通过局部、全局对齐及位置对齐对比学习实现多粒度对齐,在多个数据集实验中展现领先性能,各组件贡献互补。

Comments 18 pages, 5 figures, 8 tables. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08043 2026-07-10 cs.SE cs.AI 新提交 79%

Aleena: Alignment Agent for Research Software Engineering Collaborations

Aleena:用于研究软件工程协作的对齐代理

Kshitij Dani, Cordero Core, Landung Setiawan, Carlos Garcia Jurado Suarez, Anshul Tambay, Vani Mandava, Anant Mittal

机构 * eScience Institute(eScience研究院) University of Washington(华盛顿大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 研究软件协作中决策易失依据致相关人员心智模型不同,提出智能AI可支持对齐与跟踪。介绍开源的Aleena,以GitHub为协作平台,转化交互为结构化记录,揭示风险等,还阐述其动机、设计、原型及场景。

Comments 8 pages, 5 figures. AgenticSE @ KDD '26: Agentic Software Engineering (SE 3.0): The Rise of AI Teammates, KDD 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06522 2026-07-08 cs.AI cs.CV 新提交 79%

Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment

通过视觉动作结果推理对齐实现物理推理与任务泛化的桥梁

Han-Jun Ko, Jr-Jen Chen, Haobo Yuan, Hsin-Ying Lee, Tiancheng Shen, Ming-Hsuan Yang, Yu-Chiang Frank Wang

机构 * National Taiwan University(国立台湾大学) The University of California, Merced(加州大学默塞德分校)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 研究针对视觉语言模型在物理推理中难以泛化的问题,提出VAORA奖励设计,包括视觉对齐奖励和视觉-动作对齐奖励,通过预训练专家估计概率实现平滑密集奖励,经实验验证可有效提升模型在新任务和未见环境中的物理推理性能。

Comments ICML'26 Workshop RLxF: Reinforcement Learning from World Feedback

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04306 2026-07-07 cs.LG cs.CV 新提交 79%

SAD-LoRA: Spectral Alignment for Low-Rank Knowledge Distillation

SAD-LoRA:低秩知识蒸馏的谱对齐

Omer Tariq, Syed Muhammad Raza, Jeongbae Son

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 提出SAD-LoRA方法用于低秩知识蒸馏,从数据加权学生空间参考更新中选择权重子空间,通过可微主角度损失训练,减少子空间错位,提升对齐效果,提高秩效率。

Comments ICML'26 workshop on CoLoRAI - The 2nd Workshop on Connecting Low-rank Representations in AI, 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03135 2026-07-07 cs.SE cs.AI 新提交 79%

Detecting Architectural Drift in Safety-Critical Firmware through Runtime Trace Analysis

通过运行时跟踪分析检测安全关键固件中的架构漂移

Domenico Francesco De Angelis, Marco De Luca, Domenico Amalfitano, Pasquale Cimmino, Anna Rita Fasolino

机构 * University of Naples Federico II(那不勒斯费德里科二世大学) Micron Technology, Inc(美光技术公司) DIETI

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 研究在长寿命安全关键固件中检测架构漂移问题,核心方法是收集硬件辅助执行跟踪,经抽象比较找出差异,还基于大语言模型生成报告,贡献是经评估该方法有效。

Comments accepted at 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31310 2026-07-01 cs.CL cs.MM 新提交 79%

LOPA: Enhancing Spoken Language Assessment via Latent Ordinal Prototype Alignment

LOPA:通过潜在序数原型对齐增强口语评估

Hong-Yun Lin, Fu-An Chao, Bi-Cheng Yan, Berlin Chen

机构 * National Taiwan Normal University(国立台湾师范大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 提出LOPA正则化器,在潜在空间施加序数几何先验,结合SALR自适应提取Whisper编码器多层表示,以0.361 RMSE媲美十亿参数系统,无需LLM微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26466 2026-06-26 cs.CL 新提交 79%

Soft Token Alignment for Cross-Lingual Reasoning

跨语言推理的软令牌对齐

Jiayi He, Jungsoo Park, Wei Xu, Alan Ritter

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 提出SOLAR方法,通过软令牌对齐跨语言表示,提升多语言推理准确率,尤其对低资源语言效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22992 2026-06-23 cs.CL 新提交 79%

Predicate Importance Estimation and Decoupled Rationale-Score Distillation for Entity Alignment

谓词重要性估计与解耦理由-分数蒸馏用于实体对齐

Keunha Kim, Yoonjin Jang, Hyeon-gu Lee, Sihyung Kim, Youngjoong Ko

机构 * SungKyunKwan University(成均馆大学) NAVER

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 提出谓词重要性估计和解耦理由-分数蒸馏两个模块,通过谓词感知嵌入和蒸馏小语言模型提升知识图谱实体对齐性能,并利用分数与理由的不一致实现人机协同验证。

Comments 12 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21906 2026-06-23 cs.CL 新提交 79%

Deeper is Not Always Better: Mitigating the Alignment Tax via Confident Layer Decoding

更深并非总是更好:通过置信层解码缓解对齐税

Xuanming Zhang, Sining Zhoubian, Yuxuan Chen, Tianyi Tang, An Yang, Sean Du, Chujie Zheng, Fei Huang, Dayiheng Liu, Gao Huang, Jingren Zhou

机构 * Qwen Team, Alibaba Inc.(阿里巴巴集团 Qwen 团队) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 提出Confident Decoding,一种无需训练的解码策略,通过熵引导的保守反向搜索动态选择最可靠的近最终层,以缓解对齐微调导致的最终层扰动,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21851 2026-06-23 cs.CL 新提交 79%

TALAS: Teacher-Anchored Layer Alignment with Adaptive Sharpness-Aware Minimization for Embedding Distillation

TALAS:基于教师锚定的层对齐与自适应锐度感知最小化的嵌入蒸馏

Quoc Phong Dao, Hoang Son Nguyen, Pham Khanh Chi, Linh Ngo Van, Nguyen Thi Ngoc Diep, Thien Huu Nguyen, Trung Le

机构 * Hanoi University of Science and Technology(河内科技大学) VNU University of Engineering and Technology(越南国立大学工程与技术大学) University of Oregon(俄勒冈大学) Monash University(莫纳什大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 提出TALAS框架,通过教师锚定机制仅蒸馏最终句子嵌入到学生上层,结合层对齐自蒸馏和自适应锐度感知最小化,在降低计算成本的同时提升句子嵌入蒸馏性能。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20890 2026-06-23 cs.CL cs.IR 新提交 79%

Topic-to-Timestamp Alignment by Constrained Evidence Selection

通过约束证据选择的主题到时间戳对齐

Zeynep Yılbırt, Marina Litvak, Michael Färber

机构 * TU Dresden(德累斯顿工业大学) SpeechMind GmbH(SpeechMind 公司) Shamoon College of Engineering(沙蒙工程学院) ScaDS.AI Dresden/Leipzig(ScaDS.AI 德累斯顿/莱比锡)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 针对会议记录中主题到时间戳的对齐问题,提出将时间戳预测重构为约束时间候选选择,通过检索时间戳转录块并选择最佳候选而非生成时间码,显著提升召回率和解析输出数量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20258 2026-06-19 cs.HC cs.AI 新提交 79%

Editorial Alignment: A Participatory Approach to Engaging Editorial Expertise in LLM-mediated Knowledge Dissemination

编辑对齐:一种参与式方法,将编辑专业知识引入LLM介导的知识传播

Simon Aagaard Enni, Malthe Stavning Erslev, Karl-Emil Kjær Bilstrup, Kristoffer Laigaard Nielbo

机构 * Aarhus University(奥胡斯大学) University of Copenhagen(哥本哈根大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出“编辑对齐”作为参与式AI设计实践,通过设计工作坊让编辑参与重新对齐LLM接口至编辑标准,以维护公共知识机构的编辑职能。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏