arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9311 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9311 篇

2503.06232 2025-03-18 cs.CL cs.CV 79%

Integrating Chain-of-Thought for Multimodal Alignment: A Study on 3D Vision-Language Learning

Yanjun Chen, Yirong Sun, Xinghao Chen, Jian Wang, Xiaoyu Shen, Wenjie Li, Wei Zhang

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09648 2025-03-14 cs.MA cs.CY 79%

A Survey on Trustworthy LLM Agents: Threats and Countermeasures

Miao Yu, Fanci Meng, Xinyun Zhou, Shilong Wang, Junyuan Mao, Linsey Pang, Tianlong Chen, Kun Wang, Xinfeng Li, Yongfeng Zhang, Bo An, Qingsong Wen

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04875 2025-03-10 cs.CL quant-ph 79%

Architecture for a Trustworthy Quantum Chatbot

Yaiza Aragonés-Soria, Manuel Oriol

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04474 2025-03-07 cs.LG cs.CR 79%

Know Thy Judge: On the Robustness Meta-Evaluation of LLM Safety Judges

Francisco Eiras, Eliott Zemour, Eric Lin, Vaikkunth Mugunthan

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

Comments Accepted to the ICBINB Workshop at ICLR'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16806 2025-03-04 cs.CL 79%

CoT2Align: Cross-Chain of Thought Distillation via Optimal Transport Alignment for Language Models with Different Tokenizers

Anh Duc Le, Tu Vu, Nam Le Hai, Nguyen Thi Ngoc Diep, Linh Ngo Van, Trung Le, Thien Huu Nguyen

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20285 2025-02-28 cs.LG stat.ML 79%

Conformal Tail Risk Control for Large Language Model Alignment

Catherine Yu-Chi Chen, Jingyan Shen, Zhun Deng, Lihua Lei

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05930 2025-02-28 cs.CR cs.AI cs.NI 79%

Trustworthy AI-Generative Content for Intelligent Network Service: Robustness, Security, and Fairness

Siyuan Li, Xi Lin, Yaju Liu, Xiang Chen, Jianhua Li

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14141 2025-02-26 cs.RO cs.CL 79%

Coherence-Driven Multimodal Safety Dialogue with Active Learning for Embodied Agents

Sabit Hassan, Hye-Young Chung, Xiang Zhi Tan, Malihe Alikhani

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments To appear at AAMAS, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16922 2025-02-25 cs.CL 79%

Benchmarking Temporal Reasoning and Alignment Across Chinese Dynasties

Zhenglin Wang, Jialong Wu, Pengfei LI, Yong Jiang, Deyu Zhou

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11910 2025-02-24 cs.LG 79%

Adversarial Alignment for LLMs Requires Simpler, Reproducible, and More Measurable Objectives

Leo Schwinn, Yan Scholten, Tom Wollschläger, Sophie Xhonneux, Stephen Casper, Stephan Günnemann, Gauthier Gidel

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12668 2025-02-19 cs.CL 79%

Evaluation of Best-of-N Sampling Strategies for Language Model Alignment

Yuki Ichihara, Yuu Jinnai, Tetsuro Morimura, Kaito Ariu, Kenshi Abe, Mitsuki Sakamoto, Eiji Uchibe

专题命中 安全评测 :alignment(title);RLHF(abstract);分类 cs.CL

Journal ref Transactions on Machine Learning Research (TMLR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09809 2025-02-17 cs.CR cs.AI 79%

AgentGuard: Repurposing Agentic Orchestrator for Safety Evaluation of Tool Orchestration

Jizhou Chen, Samuel Lee Cong

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

Comments Project report of AgentGuard in LLM Agent MOOC Hackathon hosted by UC Berkeley in 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09624 2025-02-17 cs.AI cs.CR 79%

Efficient and Trustworthy Block Propagation for Blockchain-enabled Mobile Embodied AI Networks: A Graph Resfusion Approach

Jiawen Kang, Jiana Liao, Runquan Gao, Jinbo Wen, Huawei Huang, Maomao Zhang, Changyan Yi, Tao Zhang, Dusit Niyato, Zibin Zheng

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14662 2025-02-07 cs.LG 79%

Advantage Alignment Algorithms

Juan Agustin Duque, Milad Aghajohari, Tim Cooijmans, Razvan Ciuca, Tianyu Zhang, Gauthier Gidel, Aaron Courville

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

Comments 25 Pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17883 2025-01-31 eess.SP cs.AI 79%

Explainable and Robust Millimeter Wave Beam Alignment for AI-Native 6G Networks

Nasir Khan, Asmaa Abdallah, Abdulkadir Celik, Ahmed M. Eltawil, Sinem Coleri

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17749 2025-01-30 cs.SE cs.AI 79%

Early External Safety Testing of OpenAI's o3-mini: Insights from the Pre-Deployment Evaluation

Aitor Arrieta, Miriam Ugarte, Pablo Valle, José Antonio Parejo, Sergio Segura

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

Comments arXiv admin note: text overlap with arXiv:2501.17132

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11730 2025-01-23 cs.GT cs.LG 79%

CHG Shapley: Efficient Data Valuation and Selection towards Trustworthy Machine Learning

Huaiguang Cai

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

Comments Rejected by ICLR 2025. https://openreview.net/forum?id=uVMZgtw2pf

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07861 2025-01-15 cs.CL 79%

ReARTeR: Retrieval-Augmented Reasoning with Trustworthy Process Rewarding

Zhongxiang Sun, Qipeng Wang, Weijie Yu, Xiaoxue Zang, Kai Zheng, Jun Xu, Xiao Zhang, Song Yang, Han Li

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06741 2025-01-14 cs.CL 79%

Hierarchical Divide-and-Conquer for Fine-Grained Alignment in LLM-Based Medical Evaluation

Shunfan Zheng, Xiechi Zhang, Gerard de Melo, Xiaoling Wang, Linlin Wang

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05207 2025-01-10 cs.MA cs.LG 79%

CoDe: Communication Delay-Tolerant Multi-Agent Collaboration via Dual Alignment of Intent and Timeliness

Shoucheng Song, Youfang Lin, Sheng Han, Chang Yao, Hao Wu, Shuo Wang, Kai Lv

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

Comments AAAI 2025 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00722 2025-01-07 cs.CR cs.AI cs.DC 79%

Pathway to Secure and Trustworthy ZSM for LLMs: Attacks, Defense, and Opportunities

Sunder Ali Khowaja, Parus Khuwaja, Kapal Dev, Hussam Al Hamadi, Engin Zeydan

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19449 2024-12-30 cs.CL 79%

Feature Alignment-Based Knowledge Distillation for Efficient Compression of Large Language Models

Shuo Wang, Chihang Wang, Jia Gao, Zhen Qi, Hongye Zheng, Xiaoxuan Liao

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18842 2024-12-30 cs.CV cs.LG 79%

Context-Based Semantic-Aware Alignment for Semi-Supervised Multi-Label Learning

Heng-Bo Fan, Ming-Kun Xie, Jia-Hao Xiao, Sheng-Jun Huang

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18697 2024-12-30 cs.AI cs.MA 79%

Agents on the Bench: Large Language Model Based Multi Agent Framework for Trustworthy Digital Justice

Cong Jiang, Xiaolei Yang

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

Comments Draft version; Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18022 2024-12-25 cs.DB cs.AI 79%

Trustworthy and Efficient LLMs Meet Databases

Kyoungmin Kim, Anastasia Ailamaki

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12723 2024-12-24 cs.CR cs.AI cs.SE 79%

Python Fuzzing for Trustworthy Machine Learning Frameworks

Ilya Yegorov, Eli Kobrin, Darya Parygina, Alexey Vishnyakov, Andrey Fedotov

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

Journal ref Journal of Mathematical Sciences, 2024 Springer Nature Switzerland AG, Vol. 285, No. 2, October, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18580 2024-12-24 cs.CL cs.CR 79%

FFT: Towards Harmlessness Evaluation and Analysis for LLMs with Factuality, Fairness, Toxicity

Shiyao Cui, Zhenyu Zhang, Yilong Chen, Wenyuan Zhang, Tianyun Liu, Siqi Wang, Tingwen Liu

专题命中 安全评测 :harmlessness(title,abstract);分类 cs.CL

Comments Accepted by KDD workshop on Evaluation and Trustworthiness of Generative AI Models

Journal ref https://genai-evaluation-kdd2024.github.io/genai-evalution-kdd2024/assets/papers/GenAI_Evaluation_KDD2024_paper_5.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15861 2024-12-23 stat.ML cs.LG 79%

On Robust Cross Domain Alignment

Anish Chakrabarty, Arkaprabha Basu, Swagatam Das

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08072 2024-12-18 cs.CL 79%

I-SHEEP: Self-Alignment of LLM from Scratch through an Iterative Self-Enhancement Paradigm

Yiming Liang, Ge Zhang, Xingwei Qu, Tianyu Zheng, Jiawei Guo, Xinrun Du, Zhenzhu Yang, Jiaheng Liu, Chenghua Lin, Lei Ma, Wenhao Huang, Jiajun Zhang

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11242 2024-12-16 q-bio.GN cs.CL 79%

Bridging Sequence-Structure Alignment in RNA Foundation Models

Heng Yang, Renzhi Chen, Ke Li

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏