arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-06 至 2026-04-06 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 11 篇

2604.02783 2026-04-06 cs.HC cs.AI 79%

Disrupting Cognitive Passivity: Rethinking AI-Assisted Data Literacy through Cognitive Alignment

打破认知惰性:通过认知对齐重新思考人工智能辅助的数据素养

Yongsu Ahn, Nam Wook Kim, Benjamin Bach

机构 * Boston College(波士顿学院) Inria(法国国家信息与自动化研究所) University of Edinburgh(爱丁堡大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出通过认知对齐框架,重新设计人工智能辅助的数据素养,以避免认知惰性,促进主动思考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21331 2026-04-06 cs.CV cs.AI 79%

The More, the Merrier: Contrastive Fusion for Higher-Order Multimodal Alignment

更多更好:用于高阶多模态对齐的对比融合

Stefanos Koutoupis, Michaela Areti Zervou, Konstantinos Kontras, Maarten De Vos, Panagiotis Tsakalides, Grigorios Tsagkatakis

机构 * Foundation for Research and Technology-Hellas(希腊研究与技术基金会) University of Crete(克里特大学) KU Leuven(鲁汶大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出对比融合框架,通过联合嵌入个体模态及其融合组合,捕捉高阶依赖关系,提升多模态对齐效果。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23032 2026-04-06 cs.CV cs.RO 78%

Generative Event Pretraining with Foundation Model Alignment

基于基础模型对齐的生成事件预训练

Jianwen Cao, Jiaxu Xing, Nico Messikommer, Davide Scaramuzza

机构 * Robotics and Perception Group, University of Zurich(苏黎世大学机器人感知组)

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出GEP框架,通过将互联网级图像数据集中的语义知识迁移到事件数据,并学习事件特有的时间动态,提升事件视觉基础模型在跨任务迁移学习中的性能。

Journal ref CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02459 2026-04-06 cs.LG cs.AI cs.CL 67%

On the Geometric Structure of Layer Updates in Deep Language Models

深度语言模型中层更新的几何结构研究

Jun-Sik Yoo

机构 * Institute of Basic Science, Korea University(韩国大学基础科学研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究深度语言模型中层更新的几何结构,发现层更新可分解为主导的tokenwise组件和一个几何上不同的残差部分,残差对输出扰动有显著影响。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02881 2026-04-06 cs.CL cs.AI 62%

One Model to Translate Them All? A Journey to Mount Doom for Multilingual Model Merging

一个模型来翻译它们全部?多语言模型融合的探索之旅

Baban Gain, Asif Ekbal, Trilok Nath Singh

机构 * Indian Institute of Technology Patna(印度理工学院巴特那分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了多语言机器翻译中权重空间模型融合的行为,发现融合会降低性能,尤其在目标语言差异时。通过分析内部表示发现语言特定神经元集中在嵌入层和上层Transformer块,而中间层在多语言间共享。细调使语言选择性重新分布,影响生成层的表示差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03110 2026-04-06 cs.CL 57%

Multi-Aspect Knowledge Distillation for Language Model with Low-rank Factorization

多方面知识蒸馏用于具有低秩因子化的语言模型

Zihe Liu, Yulong Mao, Jinan Xu, Xinrui Peng, Kaiyu Huang

机构 * Key Laboratory of Big Data & Artificial Intelligence in Transportation(交通大数据与人工智能重点实验室) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出多方面知识蒸馏方法,通过深入模仿自注意力和前馈模块,捕捉不同方面的丰富语言知识,实验表明其在相同存储预算下能与强基线模型竞争,并在蒸馏自回归架构模型中表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02770 2026-04-06 cs.AI 57%

Improving Role Consistency in Multi-Agent Collaboration via Quantitative Role Clarity

通过量化角色清晰度提升多智能体协作中的角色一致性

Guoling Zhou, Wenpei Han, Fengqin Yang, Li Wang, Yingcong Zhou, Zhiguo Fu

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出量化角色清晰度以提升多智能体协作中的角色一致性,通过构建角色分配矩阵和角色清晰度矩阵,利用Frobenius范数量化角色描述与行为轨迹的一致性,并在轻量微调中作为正则化项提升任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02627 2026-04-06 cs.CV cs.AI cs.MM 57%

Smart Transfer: Leveraging Vision Foundation Model for Rapid Building Damage Mapping with Post-Earthquake VHR Imagery

智能迁移:利用视觉基础模型实现地震后高分辨率影像快速建筑损坏映射

Hao Li, Liwei Zou, Wenping Yin, Gulsen Taskin, Naoto Yokoya, Danfeng Hong, Wufan Zhao

机构 * Department of Geography, National University of Singapore(新加坡国立大学地理系) Urban Governance and Design Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)城市治理与设计学域) School of Environment and Spatial Informatics, China University of Mining and Technology(中国矿业大学环境与空间信息学院) Disaster Management Institute, Istanbul Technical University(伊斯坦布尔技术大学灾害管理研究所) Department of Complexity Science and Engineering, University of Tokyo(东京大学复杂科学与工程系) School of Automation, Southeast University(东南大学自动化学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出Smart Transfer框架,利用先进视觉基础模型实现快速建筑损坏映射,通过像素聚类和距离惩罚三元组策略提升跨区域迁移性能,为灾害响应提供可扩展的自动化解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02479 2026-04-06 cs.CV cs.AI 57%

Generating Satellite Imagery Data for Wildfire Detection through Mask-Conditioned Generative AI

通过掩码条件生成式AI生成卫星图像数据用于野火检测

Valeria Martin, K. Brent Venable, Derek Morgan

机构 * Department of Intelligent Systems and Robotics, University of West Florida(西佛罗里达大学智能系统与机器人系) IHMC(人类与机器认知研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文探讨了基于地球观测扩散模型EarthSynth生成野火后Sentinel-2 RGB图像的可能性,通过不同实验配置评估生成效果,发现修补生成优于全图生成,且VLM辅助修补与手工提示效果相当。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28225 2026-04-06 cs.LG 57%

Detecting the Unexpected: AI-Driven Anomaly Detection in Smart Bridge Monitoring

发现意外:智能桥梁监控中的AI驱动异常检测

Rahul Jaiswal, Joakim Hellum, Halvor Heiberg

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出基于AI的智能桥梁监控异常检测方法,利用实时传感器数据训练简单机器学习模型,实验表明DBSCAN模型在准确检测桥梁事故方面表现优异,提升了公共安全。

Comments 6 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00961 2026-04-06 cs.LG 57%

Goal-Driven Reward by Video Diffusion Models for Reinforcement Learning

通过视频扩散模型实现目标驱动的奖励用于强化学习

Qi Wang, Mian Wu, Yuyang Zhang, Mingqi Yuan, Wenyao Zhang, Haoxiang You, Yunbo Wang, Xin Jin, Xiaokang Yang, Wenjun Zeng

机构 * Shanghai Jiao Tong University(上海交通大学) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波市空间智能与数字衍生重点实验室,东方理工高等研究院宁波数字孪生研究院,宁波) Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin(浙江省工业智能与数字孪生重点实验室) Zhongguancun Academy(中关村学院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) Department of Mechanical Engineering, Yale University(耶鲁大学机械工程系)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出利用预训练的视频扩散模型为强化学习代理提供目标驱动的奖励信号,通过视频级和帧级目标提升轨迹的连贯性和目标导向性。

Comments Accepted by CVPR 2026. Project page: https://qiwang067.github.io/genreward

详情

展开后加载摘要…

URL PDF HTML 收藏