arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-30 至 2026-03-30 共收录 12 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 12 篇

2603.25197 2026-03-30 cs.AI cs.ET cs.HC cs.RO cs.SE 83%

The Competence Shadow: Theory and Bounds of AI Assistance in Safety Engineering

能力阴影:物理AI系统安全工程中AI辅助的理论与界限

Umair Siddique

机构 * Independent Research(独立研究)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文探讨AI在安全工程中的辅助作用,提出能力阴影理论,揭示AI辅助可能带来的系统性盲区,并强调协作设计的重要性。

Comments 8 Pages, 3 Figures, 2 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25747 2026-03-30 cs.AI 83%

BeSafe-Bench: Unveiling Behavioral Safety Risks of Situated Agents in Functional Environments

BeSafe-Bench:揭示功能环境中情境代理的行为安全风险

Yuxuan Li, Yi Lin, Peng Wang, Shiming Liu, Xuetao Wei

机构 * Southern University of Science and Technology(南方科技大学) Huawei RAMS Lab(华为RAMS实验室)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出BeSafe-Bench,通过构建功能环境和引入九类安全关键风险,评估代理在Web、Mobile、Embodied VLM和Embodied VLA等领域的行为安全风险,发现最佳性能代理在安全约束下完成任务的比例不足40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23376 2026-03-30 cs.CV cs.RO 82%

ABot-PhysWorld: Interactive World Foundation Model for Robotic Manipulation with Physics Alignment

ABot-PhysWorld:用于机器人操作的交互世界基础模型,具有物理对齐

Yuzhi Chen, Ronghan Chen, Dongjie Huo, Yandan Yang, Dekang Qi, Haoyun Liu, Tong Lin, Shuang Zeng, Junjin Xiao, Xinyuan Chang, Feng Xiong, Xing Wei, Zhiheng Ma, Mu Xu

专题命中 安全评测 :alignment(title,abstract);DPO(abstract)

AI总结 ABot-PhysWorld通过物理对齐的交互世界模型,生成物理合理且可控的视频,解决了传统方法在物理仿真中的不足,通过新框架和基准测试提升了性能。

Comments Code: https://github.com/amap-cvlab/ABot-PhysWorld.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26122 2026-03-30 cs.CV cs.AI 79%

SkinGPT-X: A Self-Evolving Collaborative Multi-Agent System for Transparent and Trustworthy Dermatological Diagnosis

SkinGPT-X: 一种自演化协作多智能体系统用于透明和可信的皮肤病诊断

Zhangtianyi Chen, Yuhao Shen, Florensia Widjaja, Yan Xu, Liyuan Sun, Zijian Wang, Hongyi Chen, Wufei Dai, Juexiao Zhou

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Department of Dermatology, Tianjin Institute of Integrative Dermatology, Tianjin Academy of Traditional Chinese Medicine Affiliated Hospital(天津中医药大学附属医院天津市中西医结合皮肤病研究所皮肤科) Department of Dermatology, Beijing AnZhen Hospital, Capital Medical University(首都医科大学附属北京安贞医院皮肤科)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 SkinGPT-X通过自演化皮肤病记忆机制,解决单一大语言模型在细粒度多类诊断和罕见皮肤病诊断中的不足,实现透明可信的皮肤病诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00262 2026-03-30 cs.CV cs.AI 79%

INSIGHT: Enhancing Autonomous Driving Safety through Vision-Language Models on Context-Aware Hazard Detection and Edge Case Evaluation

洞察:通过基于视觉-语言模型的上下文感知危险检测与边缘案例评估提升自动驾驶安全性

Dianwei Chen, Zifan Zhang, Lei Cheng, Yuchen Liu, Xianfeng Terry Yang

机构 * University of Maryland(马里兰大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出INSIGHT框架,通过多模态数据融合提升自动驾驶中危险检测和边缘案例评估的准确性和泛化能力,实验表明在BDD100K数据集上显著提高了危险预测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26378 2026-03-30 cs.LG cs.AI 62%

Generative Modeling in Protein Design: Neural Representations, Conditional Generation, and Evaluation Standards

蛋白质设计中的生成建模:神经表示、条件生成与评估标准

Senura Hansaja Wanasekara, Minh-Duong Nguyen, Xiaochen Liu, Nguyen H. Tran, Ken-Tye Yong

机构 * The University of Sydney(悉尼大学) VinUniversity

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文系统综述了蛋白质研究中的生成AI,涵盖序列、几何和多模态表示,生成架构如SE(3)等价扩散、流匹配和混合预测生成系统,以及从结构预测到蛋白质-配体相互作用的任务设置,并提出评估最佳实践和开放挑战。

Comments 20 pages, 7 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25813 2026-03-30 cs.LG cs.AI 62%

MAGNET: Autonomous Expert Model Generation via Decentralized Autoresearch and BitNet Training

MAGNET:通过去中心化自研与BitNet训练实现自主专家模型生成

Yongwan Kim, Sungchul Park

机构 * Holo Studio Co., Ltd.(Holo Studio 有限公司)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 MAGNET通过去中心化自研和BitNet训练,实现跨通用硬件的领域专家语言模型自主生成、训练与服务,核心贡献包括自研流水线、BitNet三进制训练、分布式融合与链上贡献追踪。

Comments 20 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26544 2026-03-30 cs.CL q-bio.QM 57%

Development of a European Union Time-Indexed Reference Dataset for Assessing the Performance of Signal Detection Methods in Pharmacovigilance using a Large Language Model

欧盟时间索引参考数据集的开发:利用大型语言模型评估药监信号检测方法性能

Maria Kefala, Jeffery L. Painter, Syed Tauhid Bukhari, Maurizio Sessa

机构 * Department of Drug Design and Pharmacology, University of Copenhagen(哥本哈根大学药物设计与药理学系) GSK(葛兰素史克)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文开发了欧盟时间索引参考数据集,利用大型语言模型识别药品不良反应,以评估信号检测方法的性能,填补了药监领域的时间信息缺失空白。

Comments 4 Figures and 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25870 2026-03-30 cs.CV cs.LG 57%

Speech-Synchronized Whiteboard Generation via VLM-Driven Structured Drawing Representations

通过VLM驱动的结构化绘图表示实现语音同步的白板生成

Suraj Prasad, Pinak Mahapatra

机构 * Latent Spaces IITB(印度理工学院孟买分校潜在空间实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出首个包含24对Excalidraw演示与叙述音频的白板数据集,研究基于Qwen2-VL-7B模型通过时间戳条件化实现语音同步的绘图预测,验证了模型在跨学科领域中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16629 2026-03-30 cs.CV cs.AI 57%

MLLM-based Textual Explanations for Face Comparison

基于MLLM的文本解释用于面部比较

Redwan Sony, Anil K Jain, Arun Ross

机构 * Michigan State University(密歇根州立大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文研究了MLLM在无约束面部验证任务中生成解释的可靠性,发现其解释常依赖不可验证的面部属性,并提出基于似然比的框架评估解释可信度。

Comments Accepted at 14th International Workshop on Biometrics and Forensics (IWBF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17528 2026-03-30 cs.CV 50%

MM-OVSeg:Multimodal Optical-SAR Fusion for Open-Vocabulary Segmentation in Remote Sensing

MM-OVSeg:多模态光学-合成孔径雷达融合用于遥感中的开放词汇分割

Yimin Wei, Aoran Xiao, Hongruixuan Chen, Junshi Xia, Naoto Yokoya

机构 * The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所先进智能研究中心)

专题命中 安全评测 :alignment(abstract)

AI总结 MM-OVSeg通过融合光学和SAR数据,提升恶劣天气下的开放词汇分割鲁棒性与泛化能力,采用跨模态统一过程和双编码器融合模块实现多传感器表征对齐与多模态分割。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25791 2026-03-30 cs.CV 50%

ArtHOI: Taming Foundation Models for Monocular 4D Reconstruction of Hand-Articulated-Object Interactions

ArtHOI:通过基础模型驯化实现单目4D手-物体交互重建

Zikai Wang, Zhilu Zhang, Yiqing Wang, Hui Li, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出ArtHOI框架,通过整合多基础模型先验知识,解决单目视频中手-物体交互的4D重建问题,引入自适应采样细化和多模态大语言模型引导对齐方法,构建两个新数据集并验证方法有效性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏