arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9324 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9324 篇

2502.18883 2025-03-04 cs.SE 78%

Towards More Trustworthy Deep Code Models by Enabling Out-of-Distribution Detection

Yanfu Yan, Viet Duong, Huajie Shao, Denys Poshyvanyk

专题命中 安全评测 :trustworthy(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18757 2025-02-27 cs.IR 78%

Training Large Recommendation Models via Graph-Language Token Alignment

Mingdai Yang, Zhiwei Liu, Liangwei Yang, Xiaolong Liu, Chen Wang, Hao Peng, Philip S. Yu

专题命中 安全评测 :alignment(title,abstract)

Comments 5 pages. Accepted by www'25 as short paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00809 2025-02-26 cs.LG cs.AI cs.CL 78%

Adaptive Segment-level Reward: Bridging the Gap Between Action and Reward Space in Alignment

Yanshi Li, Shaopan Xiong, Gengru Chen, Xiaoyang Li, Yijia Luo, Xingyuan Bu, Yingshui Tan, Wenbo Su, Bo Zheng

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14881 2025-02-24 cs.CR cs.CV 78%

A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations

Mang Ye, Xuankun Rong, Wenke Huang, Bo Du, Nenghai Yu, Dacheng Tao

专题命中 安全评测 :safety(title,abstract)

Comments 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02097 2025-02-23 cs.CR 78%

DomainHarvester: Harvesting Infrequently Visited Yet Trustworthy Domain Names

Daiki Chiba, Hiroki Nakano, Takashi Koide

专题命中 安全评测 :trustworthy(title,abstract)

Comments Originally presented at IEEE CCNC 2025. An extended version of this work has been published in IEEE Access: https://doi.org/10.1109/ACCESS.2025.3539882

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04076 2025-02-07 cs.CV 78%

Content-Rich AIGC Video Quality Assessment via Intricate Text Alignment and Motion-Aware Consistency

Shangkun Sun, Xiaoyu Liang, Bowen Qu, Wei Gao

专题命中 安全评测 :alignment(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15363 2025-01-28 cs.CR cs.CV 78%

AI-Driven Secure Data Sharing: A Trustworthy and Privacy-Preserving Approach

Al Amin, Kamrul Hasan, Sharif Ullah, Liang Hong

专题命中 安全评测 :trustworthy(title,abstract)

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09102 2025-01-17 cs.SI cs.AI cs.CY cs.LG 78%

Tracking the Takes and Trajectories of English-Language News Narratives across Trustworthy and Worrisome Websites

Hans W. A. Hanley, Emily Okabe, Zakir Durumeric

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.CY、cs.LG

Comments To appear at USENIX Security Symposium 2025. Keywords: Misinformation, News, Narratives, LLMs, Stance-Detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08231 2024-12-24 cs.IR 78%

DaRec: A Disentangled Alignment Framework for Large Language Model and Recommender System

Xihong Yang, Heming Jing, Zixing Zhang, Jindong Wang, Huakang Niu, Shuaiqiang Wang, Yu Lu, Junfeng Wang, Dawei Yin, Xinwang Liu, En Zhu, Defu Lian, Erxue Min

专题命中 安全评测 :alignment(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06296 2024-12-10 cs.SD eess.AS 78%

VidMusician: Video-to-Music Generation with Semantic-Rhythmic Alignment via Hierarchical Visual Features

Sifei Li, Binxin Yang, Chunji Yin, Chong Sun, Yuxin Zhang, Weiming Dong, Chen Li

专题命中 安全评测 :alignment(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04363 2024-12-06 cs.HC 78%

Challenges in Trustworthy Human Evaluation of Chatbots

Wenting Zhao, Alexander M. Rush, Tanya Goyal

专题命中 安全评测 :trustworthy(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13663 2024-12-02 cs.CL cs.AI cs.LG 78%

Model Internals-based Answer Attribution for Trustworthy Retrieval-Augmented Generation

Jirui Qi, Gabriele Sarti, Raquel Fernández, Arianna Bisazza

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by EMNLP 2024 Main Conference. Code and data released at https://github.com/Betswish/MIRAGE

Journal ref Proceedings of EMNLP (2024) 6037-6053

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17981 2024-11-28 cs.SE 78%

Engineering Trustworthy Software: A Mission for LLMs

Marco Vieira

专题命中 安全评测 :trustworthy(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15735 2024-11-26 cs.CV 78%

Test-time Alignment-Enhanced Adapter for Vision-Language Models

Baoshun Tong, Kaiyu Song, Hanjiang Lai

专题命中 安全评测 :alignment(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06099 2024-11-12 cs.HC 78%

CoPrompter: User-Centric Evaluation of LLM Instruction Alignment for Improved Prompt Engineering

Ishika Joshi, Simra Shahid, Shreeya Venneti, Manushree Vasu, Yantao Zheng, Yunyao Li, Balaji Krishnamurthy, Gromit Yeuk-Yin Chan

专题命中 安全评测 :alignment(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23207 2024-11-04 eess.SY cs.SY 78%

Enhancing Autonomous Driving Safety Analysis with Generative AI: A Comparative Study on Automated Hazard and Risk Assessment

Alireza Abbaspour, Aliasghar Arab, Yashar Mousavi

专题命中 安全评测 :safety(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23988 2024-11-01 cs.CV 78%

JEMA: A Joint Embedding Framework for Scalable Co-Learning with Multimodal Alignment

Joao Sousa, Roya Darabi, Armando Sousa, Frank Brueckner, Luís Paulo Reis, Ana Reis

专题命中 安全评测 :alignment(title,abstract)

Comments 26 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21736 2024-10-31 cs.RO 78%

Enhancing Safety and Robustness of Vision-Based Controllers via Reachability Analysis

Kaustav Chakraborty, Aryaman Gupta, Somil Bansal

专题命中 安全评测 :safety(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18927 2024-10-25 cs.CR 78%

SafeBench: A Safety Evaluation Framework for Multimodal Large Language Models

Zonghao Ying, Aishan Liu, Siyuan Liang, Lei Huang, Jinyang Guo, Wenbo Zhou, Xianglong Liu, Dacheng Tao

专题命中 安全评测 :safety(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13477 2024-10-18 cs.DC cs.CR 78%

Advocate -- Trustworthy Evidence in Cloud Systems

Sebastian Werner, Sepideh Masoudi, Fernando Castillo, Fabian Piper, Jonathan Heiss

专题命中 安全评测 :trustworthy(title,abstract)

Comments Preprint version of the paper at 6th Conference on Blockchain Research & Applications for Innovative Networks and Services (BRAINS'24)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12475 2024-10-18 cs.MA 78%

Aegis:An Advanced LLM-Based Multi-Agent for Intelligent Functional Safety Engineering

Lu Shi, Bin Qi, Jiarui Luo, Yang Zhang, Zhanzhao Liang, Zhaowei Gao, Wenke Deng, Lin Sun

专题命中 安全评测 :safety(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.14122 2024-10-18 cs.CV cs.CR 78%

SurrogatePrompt: Bypassing the Safety Filter of Text-to-Image Models via Substitution

Zhongjie Ba, Jieming Zhong, Jiachen Lei, Peng Cheng, Qinglong Wang, Zhan Qin, Zhibo Wang, Kui Ren

专题命中 安全评测 :safety(title,abstract)

Comments To appear in the the 31st ACM Conference on Computer and Communications Security (CCS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12225 2024-10-17 cs.CV 78%

Evaluating Cascaded Methods of Vision-Language Models for Zero-Shot Detection and Association of Hardhats for Increased Construction Safety

Lucas Choi, Ross Greer

专题命中 安全评测 :safety(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18878 2024-10-07 cs.CL cs.AI cs.CY cs.IR 78%

Suicide Phenotyping from Clinical Notes in Safety-Net Psychiatric Hospital Using Multi-Label Classification with Pre-Trained Language Models

Zehan Li, Yan Hu, Scott Lane, Salih Selek, Lokesh Shahani, Rodrigo Machado-Vieira, Jair Soares, Hua Xu, Hongfang Liu, Ming Huang

专题命中 安全评测 :safety(title);分类 cs.CL、cs.AI、cs.CY

Comments submitted to AMIA Informatics Summit 2025 as a conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16033 2024-09-25 cs.RO 78%

RTAGrasp: Learning Task-Oriented Grasping from Human Videos via Retrieval, Transfer, and Alignment

Wenlong Dong, Dehao Huang, Jiangshan Liu, Chao Tang, Hong Zhang

专题命中 安全评测 :alignment(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14833 2024-09-24 cs.RO 78%

SymAware: A Software Development Framework for Trustworthy Multi-Agent Systems with Situational Awareness

Ernesto Casablanca, Zengjie Zhang, Gregorio Marchesini, Sofie Haesaert, Dimos V. Dimarogonas, Sadegh Soudjani

专题命中 安全评测 :trustworthy(title,abstract)

Comments Submitted to ICRA2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21654 2024-08-01 cs.CV 78%

MTA-CLIP: Language-Guided Semantic Segmentation with Mask-Text Alignment

Anurag Das, Xinting Hu, Li Jiang, Bernt Schiele

专题命中 安全评测 :alignment(title,abstract)

Comments accepted at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19708 2024-07-26 cs.LG cs.AI cs.CL cs.HC 78%

Harmonic LLMs are Trustworthy

Nicholas S. Kersting, Mohammad Rahman, Suchismitha Vedala, Yang Wang

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI、cs.LG

Comments 15 pages, 2 figures, 16 tables; added Claude-3.0, GPT-4o, Mistral-7B, Mixtral-8x7B, and more annotation for other models

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11387 2024-07-17 cs.HC 78%

A Framework for Evaluating Appropriateness, Trustworthiness, and Safety in Mental Wellness AI Chatbots

Lucia Chen, David A. Preece, Pilleriin Sikka, James J. Gross, Ben Krause

专题命中 安全评测 :safety(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.06555 2024-07-10 cs.CL cs.AI cs.CV cs.LG 78%

Do Vision and Language Models Share Concepts? A Vector Space Alignment Study

Jiaang Li, Yova Kementchedjhieva, Constanza Fierro, Anders Søgaard

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI、cs.LG

Comments 12 pages, long paper accepted by TACL

详情

展开后加载摘要…

URL PDF HTML 收藏