arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-06 至 2026-04-06 共收录 54 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 23 篇

2604.03201 2026-04-06 cs.AI 57%

Coupled Control, Structured Memory, and Verifiable Action in Agentic AI (SCRAT -- Stochastic Control with Retrieval and Auditable Trajectories): A Comparative Perspective from Squirrel Locomotion and Scatter-Hoarding

耦合控制、结构化记忆与可验证行为在代理AI中的应用(SCRAT -- 随机控制与可审计轨迹:从松鼠运动与散落储藏的比较视角)

Maximiliano Armesto, Christophe Kolb

机构 * Taller Technologies

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文从松鼠生态角度探讨代理AI中控制、记忆与可验证行为的耦合机制,提出结构化记忆模型与延迟验证信号,验证三种假设以提升系统鲁棒性与可靠性。

Comments 15 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03131 2026-04-06 cs.CR cs.AI 57%

A Systematic Security Evaluation of OpenClaw and Its Variants

对OpenClaw及其变种的系统性安全评估

Yuhang Wang, Haichang Gao, Zhenxing Niu, Zhaoxiang Liu, Wenjing Zhang, Xiang Wang, Shiguo Lian

机构 * Xidian University(西安电子科技大学) Data Science & Artificial Intelligence Research Institute, China Unicom(中国联通数据科学与人工智能研究院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文系统评估了六个OpenClaw系列代理框架的安全性,发现代理系统存在显著安全漏洞,且其风险高于孤立使用的基础模型。

Comments 39 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02678 2026-04-06 stat.ME cs.AI stat.AP 57%

Eligibility-Aware Evidence Synthesis: An Agentic Framework for Clinical Trial Meta-Analysis

有资格意识的证据合成:一个用于临床试验元分析的代理框架

Yao Zhao, Zhiyue Zhang, Yanxun Xu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 EligMeta框架整合了自动化试验发现与有资格意识的元分析,通过自然语言查询生成可复现的试验选择,并基于资格对研究加权,以产生特定群体的汇总估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02539 2026-04-06 cs.IR cs.LG 57%

Synapse: Evolving Job-Person Fit with Explainable Two-phase Retrieval and LLM-guided Genetic Resume Optimization

Synapse:通过可解释的双阶段检索和LLM引导的遗传简历优化实现就业-个人匹配

Ansel Kaplan Erol, Seohee Yoon, Keenan Hom, Xisheng Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 Synapse通过双阶段检索和遗传优化提升招聘推荐系统,解决信息不平衡问题,提高推荐精度和透明度,实验显示nDCG@10提升22%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18545 2026-04-06 cs.CV cs.AI 57%

CoDA: Exploring Chain-of-Distribution Attacks and Post-Hoc Token-Space Repair for Medical Vision-Language Models

CoDA:探索链式分布攻击及事后令牌空间修复用于医疗视觉-语言模型

Xiang Chen, Fangfang Yang, Chunlei Meng, Yuxian Dong, Ang Li, Yiwei Wei, Jiahuan Long, Jiujiang Guo, Chengyin Hu

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出CoDA框架,通过构建临床合理的流程偏移,评估医疗视觉-语言模型在真实临床工作流中的可靠性,发现零样本性能显著下降,并引入事后修复策略提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13303 2026-04-06 cs.LG 57%

On the Extreme Variance of Certified Local Robustness Across Model Seeds

关于模型种子下认证局部鲁棒性极值方差的研究

Minh Le, Phuong Cao

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 研究揭示了训练种子差异导致认证鲁棒性极值方差显著,质疑了验证结果的可靠性,并呼吁增加置信区间报告和更全面的验证方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03231 2026-04-06 cs.CV 50%

CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning

CoME-VL:扩展互补多编码视觉语言学习

Ankan Deria, Komal Kumar, Xilin He, Imran Razzak, Hisham Cholakkal, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出CoME-VL框架,通过融合对比学习和自监督编码器提升视觉语言模型性能,实验显示在多个基准上优于单编码基线。

Comments 16 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02934 2026-04-06 cs.CV 50%

PolyReal: A Benchmark for Real-World Polymer Science Workflows

PolyReal:一个用于现实世界聚合物科学工作流程的基准

Wanhao Liu, Weida Wang, Jiaqing Xie, Suorong Yang, Jue Wang, Benteng Chen, Guangtao Mei, Zonglin Yang, Shufei Zhang, Yuchun Mo, Lang Cheng, Jin Zeng, Houqiang Li, Wanli Ouyang, Yuqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学) Tongji University(同济大学) The University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :safety(abstract)

AI总结 PolyReal是一个新的多模态基准,用于评估大规模语言模型在聚合物实验全流程中的能力,揭示了模型在实践任务上的不足,填补了评估空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02896 2026-04-06 cs.CV 50%

EvaNet: Towards More Efficient and Consistent Infrared and Visible Image Fusion Assessment

EvaNet:迈向更高效且一致的红外与可见图像融合评估

Chunyang Cheng, Tianyang Xu, Xiao-Jun Wu, Tao Zhou, Hui Li, Zhangyong Tang, Josef Kittler

机构 * Jiangnan University(江南大学) University of Surrey(萨里大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出EvaNet框架,通过轻量网络高效近似常用指标,结合对比学习和大语言模型感知评估,实现更一致的图像融合评估。

Comments 20 figures,accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02425 2026-04-06 cs.CR 50%

Evolution and Perspectives of the Keep IT Secure Ecosystem:A Six-Year Analysis of Cybersecurity Experts Supporting Belgian SMEs

网络安全生态系统的发展与展望:对比利时中小企业网络安全专家支持的六年分析

Christophe Ponsard, Jean-François Daune, Denis Darquennes, Malik Bouhou, Nicolas Point

专题命中 安全评测 :alignment(abstract)

AI总结 本文通过六年研究,探讨了比利时中小企业网络安全支持生态系统的发展,分析了专家网络的构建与评估,并展示了结构化评估方法对提升中小企业网络安全的作用。

Comments Preprint ICISSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 3 篇

2604.02713 2026-04-06 cs.CL 70%

Breakdowns in Conversational AI: Interactional Failures in Emotionally and Ethically Sensitive Contexts

对话AI中的崩溃:情感与伦理敏感情境中的互动失败

Jiawen Deng, Wentao Zhang, Ziyun Jiao, Fuji Ren

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 研究探讨对话代理在情感和伦理敏感行为中出现的崩溃现象,分析其对对话质量的影响,并提出维护伦理一致性和情感敏感性的设计改进。

Comments 22 pages, ACM CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02605 2026-04-06 cs.AI cs.SD 57%

Do Audio-Visual Large Language Models Really See and Hear?

音频视觉大语言模型真的能看见和听见吗?

Ramaneswaran Selvakumar, Kaousheik Jayakumar, S Sakshi, Sreyan Ghosh, Ruohan Gao, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 研究探讨了音频视觉大语言模型中音频与视觉特征的融合机制,发现当音频与视觉冲突时,最终文本生成中音频信息无法有效表露,揭示了多模态LLM在整合音频和视觉时的模态偏见。

Comments CVPR Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02499 2026-04-06 cond-mat.mtrl-sci 50%

CARBON-2D Topological Descriptor (C2DTD): An Interpretable and Physics-Informed Representation for Two-Dimensional Carbon Networks

CARBON-2D拓扑描述符(C2DTD):一种可解释且物理导向的二维碳网络表示方法

Felipe Hawthorne, Marcelo Lopes Pereira Junior, Fabiano Manoel de Andrade, Cristiano Francisco Woellner, Raphael Matozo Tromer

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文提出C2DTD,一种用于二维碳系统的物理导向结构表示方法,通过整合局部几何统计、紧凑径向结构特征和显式原始环拓扑,实现高效且可解释的预测性能,适用于小数据集和缺陷工程石墨烯的分析。

Comments 22 pages and 06 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 11 篇

2604.02783 2026-04-06 cs.HC cs.AI 79%

Disrupting Cognitive Passivity: Rethinking AI-Assisted Data Literacy through Cognitive Alignment

打破认知惰性:通过认知对齐重新思考人工智能辅助的数据素养

Yongsu Ahn, Nam Wook Kim, Benjamin Bach

机构 * Boston College(波士顿学院) Inria(法国国家信息与自动化研究所) University of Edinburgh(爱丁堡大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出通过认知对齐框架,重新设计人工智能辅助的数据素养,以避免认知惰性,促进主动思考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21331 2026-04-06 cs.CV cs.AI 79%

The More, the Merrier: Contrastive Fusion for Higher-Order Multimodal Alignment

更多更好:用于高阶多模态对齐的对比融合

Stefanos Koutoupis, Michaela Areti Zervou, Konstantinos Kontras, Maarten De Vos, Panagiotis Tsakalides, Grigorios Tsagkatakis

机构 * Foundation for Research and Technology-Hellas(希腊研究与技术基金会) University of Crete(克里特大学) KU Leuven(鲁汶大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出对比融合框架,通过联合嵌入个体模态及其融合组合,捕捉高阶依赖关系,提升多模态对齐效果。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23032 2026-04-06 cs.CV cs.RO 78%

Generative Event Pretraining with Foundation Model Alignment

基于基础模型对齐的生成事件预训练

Jianwen Cao, Jiaxu Xing, Nico Messikommer, Davide Scaramuzza

机构 * Robotics and Perception Group, University of Zurich(苏黎世大学机器人感知组)

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出GEP框架,通过将互联网级图像数据集中的语义知识迁移到事件数据,并学习事件特有的时间动态,提升事件视觉基础模型在跨任务迁移学习中的性能。

Journal ref CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02459 2026-04-06 cs.LG cs.AI cs.CL 67%

On the Geometric Structure of Layer Updates in Deep Language Models

深度语言模型中层更新的几何结构研究

Jun-Sik Yoo

机构 * Institute of Basic Science, Korea University(韩国大学基础科学研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究深度语言模型中层更新的几何结构,发现层更新可分解为主导的tokenwise组件和一个几何上不同的残差部分,残差对输出扰动有显著影响。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02881 2026-04-06 cs.CL cs.AI 62%

One Model to Translate Them All? A Journey to Mount Doom for Multilingual Model Merging

一个模型来翻译它们全部?多语言模型融合的探索之旅

Baban Gain, Asif Ekbal, Trilok Nath Singh

机构 * Indian Institute of Technology Patna(印度理工学院巴特那分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了多语言机器翻译中权重空间模型融合的行为,发现融合会降低性能,尤其在目标语言差异时。通过分析内部表示发现语言特定神经元集中在嵌入层和上层Transformer块,而中间层在多语言间共享。细调使语言选择性重新分布,影响生成层的表示差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03110 2026-04-06 cs.CL 57%

Multi-Aspect Knowledge Distillation for Language Model with Low-rank Factorization

多方面知识蒸馏用于具有低秩因子化的语言模型

Zihe Liu, Yulong Mao, Jinan Xu, Xinrui Peng, Kaiyu Huang

机构 * Key Laboratory of Big Data & Artificial Intelligence in Transportation(交通大数据与人工智能重点实验室) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出多方面知识蒸馏方法,通过深入模仿自注意力和前馈模块,捕捉不同方面的丰富语言知识,实验表明其在相同存储预算下能与强基线模型竞争,并在蒸馏自回归架构模型中表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02770 2026-04-06 cs.AI 57%

Improving Role Consistency in Multi-Agent Collaboration via Quantitative Role Clarity

通过量化角色清晰度提升多智能体协作中的角色一致性

Guoling Zhou, Wenpei Han, Fengqin Yang, Li Wang, Yingcong Zhou, Zhiguo Fu

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出量化角色清晰度以提升多智能体协作中的角色一致性,通过构建角色分配矩阵和角色清晰度矩阵,利用Frobenius范数量化角色描述与行为轨迹的一致性,并在轻量微调中作为正则化项提升任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02627 2026-04-06 cs.CV cs.AI cs.MM 57%

Smart Transfer: Leveraging Vision Foundation Model for Rapid Building Damage Mapping with Post-Earthquake VHR Imagery

智能迁移:利用视觉基础模型实现地震后高分辨率影像快速建筑损坏映射

Hao Li, Liwei Zou, Wenping Yin, Gulsen Taskin, Naoto Yokoya, Danfeng Hong, Wufan Zhao

机构 * Department of Geography, National University of Singapore(新加坡国立大学地理系) Urban Governance and Design Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)城市治理与设计学域) School of Environment and Spatial Informatics, China University of Mining and Technology(中国矿业大学环境与空间信息学院) Disaster Management Institute, Istanbul Technical University(伊斯坦布尔技术大学灾害管理研究所) Department of Complexity Science and Engineering, University of Tokyo(东京大学复杂科学与工程系) School of Automation, Southeast University(东南大学自动化学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出Smart Transfer框架,利用先进视觉基础模型实现快速建筑损坏映射,通过像素聚类和距离惩罚三元组策略提升跨区域迁移性能,为灾害响应提供可扩展的自动化解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02479 2026-04-06 cs.CV cs.AI 57%

Generating Satellite Imagery Data for Wildfire Detection through Mask-Conditioned Generative AI

通过掩码条件生成式AI生成卫星图像数据用于野火检测

Valeria Martin, K. Brent Venable, Derek Morgan

机构 * Department of Intelligent Systems and Robotics, University of West Florida(西佛罗里达大学智能系统与机器人系) IHMC(人类与机器认知研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文探讨了基于地球观测扩散模型EarthSynth生成野火后Sentinel-2 RGB图像的可能性,通过不同实验配置评估生成效果,发现修补生成优于全图生成,且VLM辅助修补与手工提示效果相当。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28225 2026-04-06 cs.LG 57%

Detecting the Unexpected: AI-Driven Anomaly Detection in Smart Bridge Monitoring

发现意外:智能桥梁监控中的AI驱动异常检测

Rahul Jaiswal, Joakim Hellum, Halvor Heiberg

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出基于AI的智能桥梁监控异常检测方法,利用实时传感器数据训练简单机器学习模型,实验表明DBSCAN模型在准确检测桥梁事故方面表现优异,提升了公共安全。

Comments 6 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00961 2026-04-06 cs.LG 57%

Goal-Driven Reward by Video Diffusion Models for Reinforcement Learning

通过视频扩散模型实现目标驱动的奖励用于强化学习

Qi Wang, Mian Wu, Yuyang Zhang, Mingqi Yuan, Wenyao Zhang, Haoxiang You, Yunbo Wang, Xin Jin, Xiaokang Yang, Wenjun Zeng

机构 * Shanghai Jiao Tong University(上海交通大学) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波市空间智能与数字衍生重点实验室,东方理工高等研究院宁波数字孪生研究院,宁波) Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin(浙江省工业智能与数字孪生重点实验室) Zhongguancun Academy(中关村学院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) Department of Mechanical Engineering, Yale University(耶鲁大学机械工程系)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出利用预训练的视频扩散模型为强化学习代理提供目标驱动的奖励信号,通过视频级和帧级目标提升轨迹的连贯性和目标导向性。

Comments Accepted by CVPR 2026. Project page: https://qiwang067.github.io/genreward

详情

展开后加载摘要…

URL PDF HTML 收藏