arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9331 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9331 篇

2503.02199 2025-03-05 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

Words or Vision: Do Vision-Language Models Have Blind Faith in Text?

Ailin Deng, Tri Cao, Zhirui Chen, Bryan Hooi

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17148 2025-03-05 cs.CL cs.AI cs.LG 67%

AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders

Zhengxuan Wu, Aryaman Arora, Atticus Geiger, Zheng Wang, Jing Huang, Dan Jurafsky, Christopher D. Manning, Christopher Potts

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15267 2025-03-05 cs.CR cs.AI cs.CL cs.LG 67%

Toxicity Detection towards Adaptability to Changing Perturbations

Hankun Kang, Jianhao Chen, Yongqi Li, Xin Miao, Mayi Xu, Ming Zhong, Yuanyuan Zhu, Tieyun Qian

专题命中 安全评测 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

Comments There are still some flaws in the uploaded content, which may cause confusion for readers. To be rigorous, we need to retract the paper for optimization and improvement

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03120 2025-02-25 cs.LG cs.AI cs.CY cs.SI 67%

At the Mahakumbh, Faith Met Tragedy: Computational Analysis of Stampede Patterns Using Machine Learning and NLP

Abhinav Pratap

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 6 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15854 2025-02-25 cs.LG cs.AI cs.CL 67%

Enhancing Domain-Specific Retrieval-Augmented Generation: Synthetic Data Generation and Evaluation using Reasoning Models

Aryan Jadon, Avinash Patil, Shashank Kumar

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 8 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14302 2025-02-21 cs.CL cs.AI cs.LG 67%

MedHallu: A Comprehensive Benchmark for Detecting Medical Hallucinations in Large Language Models

Shrey Pandit, Jiawei Xu, Junyuan Hong, Zhangyang Wang, Tianlong Chen, Kaidi Xu, Ying Ding

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Code and dataset are available at https://medhallu.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11886 2025-02-18 cs.LG cs.AI cs.CL 67%

LIMR: Less is More for RL Scaling

Xuefeng Li, Haoyang Zou, Pengfei Liu

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 6pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16746 2025-02-18 cs.LG cs.AI cs.CL 67%

The Responsible Foundation Model Development Cheatsheet: A Review of Tools & Resources

Shayne Longpre, Stella Biderman, Alon Albalak, Hailey Schoelkopf, Daniel McDuff, Sayash Kapoor, Kevin Klyman, Kyle Lo, Gabriel Ilharco, Nay San, Maribeth Rauh, Aviya Skowron, Bertie Vidgen, Laura Weidinger, Arvind Narayanan, Victor Sanh, David Adelani, Percy Liang, Rishi Bommasani, Peter Henderson, Sasha Luccioni, Yacine Jernite, Luca Soldaini

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02988 2025-02-06 cs.CL cs.AI cs.LG 67%

Training an LLM-as-a-Judge Model: Pipeline, Insights, and Practical Lessons

Renjun Hu, Yi Cheng, Libin Meng, Jiaxin Xia, Yi Zong, Xing Shi, Wei Lin

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments accepted at WWW'25 (Industrial Track), extended version

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12747 2025-02-04 cs.LG cs.AI cs.CL stat.ML 67%

ALMANACS: A Simulatability Benchmark for Language Model Explainability

Edmund Mills, Shiye Su, Stuart Russell, Scott Emmons

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Code is available at https://github.com/edmundmills/ALMANACS}{https://github.com/edmundmills/ALMANACS

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08167 2025-01-22 cs.CL cs.AI cs.CY 67%

Potential and Perils of Large Language Models as Judges of Unstructured Textual Data

Rewina Bedemariam, Natalie Perez, Sreyoshi Bhaduri, Satya Kapoor, Alex Gil, Elizabeth Conjar, Ikkei Itoku, David Theil, Aman Chadha, Naumaan Nayyar

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 11 pages, 1 appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04003 2025-01-08 cs.CV cs.RO 67%

Are VLMs Ready for Autonomous Driving? An Empirical Study from the Reliability, Data, and Metric Perspectives

Shaoyuan Xie, Lingdong Kong, Yuhao Dong, Chonghao Sima, Wenwei Zhang, Qi Alfred Chen, Ziwei Liu, Liang Pan

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

Comments Preprint; 41 pages, 32 figures, 16 tables; Project Page at https://drive-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14056 2024-12-19 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

A Review of Multimodal Explainable Artificial Intelligence: Past, Present and Future

Shilin Sun, Wenbin An, Feng Tian, Fang Nan, Qidong Liu, Jun Liu, Nazaraf Shah, Ping Chen

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04137 2024-12-06 cs.CV cs.AI cs.CL cs.LG 67%

Text Change Detection in Multilingual Documents Using Image Comparison

Doyoung Park, Naresh Reddy Yarram, Sunjin Kim, Minkyu Kim, Seongho Cho, Taehee Lee

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 15pages, 11figures 6tables, wacv2025 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03904 2024-12-06 cs.AI cs.CL cs.LG 67%

MISR: Measuring Instrumental Self-Reasoning in Frontier Models

Kai Fronsdal, David Lindner

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 10 pages, 65 page appendix, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15386 2024-11-26 cs.AI cs.CY cs.LG 67%

Inducing Human-like Biases in Moral Reasoning Language Models

Artem Karpov, Seong Hah Cho, Austin Meek, Raymond Koopmanschap, Lucy Farnik, Bogdan-Ionut Cirstea

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

Comments Accepted to the 2nd Workshop on Unifying Representations in Neural Models (UniReps) at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19262 2024-11-20 cs.CL cs.AI cs.LG 67%

Weak-to-Strong Search: Align Large Language Models via Searching over Small Language Models

Zhanhui Zhou, Zhixuan Liu, Jie Liu, Zhichen Dong, Chao Yang, Yu Qiao

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23472 2024-11-18 cs.CY cs.AI cs.LG 67%

Risk Sources and Risk Management Measures in Support of Standards for General-Purpose AI Systems

Rokas Gipiškis, Ayrton San Joaquin, Ze Shen Chin, Adrian Regenfuß, Ariel Gil, Koen Holtman

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 92 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20178 2024-11-13 cs.AI cs.CL cs.CV cs.LG 67%

LLMs Can Evolve Continually on Modality for X-Modal Reasoning

Jiazuo Yu, Haomiao Xiong, Lu Zhang, Haiwen Diao, Yunzhi Zhuge, Lanqing Hong, Dong Wang, Huchuan Lu, You He, Long Chen

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06007 2024-11-05 cs.LG cs.CL cs.CV cs.CY 67%

CARES: A Comprehensive Benchmark of Trustworthiness in Medical Vision Language Models

Peng Xia, Ze Chen, Juanxi Tian, Yangrui Gong, Ruibo Hou, Yue Xu, Zhenbang Wu, Zhiyuan Fan, Yiyang Zhou, Kangyu Zhu, Wenhao Zheng, Zhaoyang Wang, Xiao Wang, Xuchao Zhang, Chetan Bansal, Marc Niethammer, Junzhou Huang, Hongtu Zhu, Yun Li, Jimeng Sun, Zongyuan Ge, Gang Li, James Zou, Huaxiu Yao

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.CY、cs.LG

Comments NeurIPS 2024 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15657 2024-10-31 cs.AI cs.CL cs.LG 67%

M$^2$PT: Multimodal Prompt Tuning for Zero-shot Instruction Learning

Taowen Wang, Yiyang Liu, James Chenhao Liang, junhan zhao, Yiming Cui, Yuning Mao, Shaoliang Nie, Jiahao Liu, Fuli Feng, Zenglin Xu, Cheng Han, Lifu Huang, Qifan Wang, Dongfang Liu

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17210 2024-10-23 cs.CL cs.AI cs.CY 67%

Exploring Possibilities of AI-Powered Legal Assistance in Bangladesh through Large Language Modeling

Azmine Toushik Wasi, Wahid Faisal, Mst Rafia Islam, Mahathir Mohammad Bappy

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments In Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12878 2024-10-18 cs.CL cs.AI cs.LG 67%

Towards More Effective Table-to-Text Generation: Assessing In-Context Learning and Self-Evaluation with Open-Source Models

Sahar Iravani, Tim . O . F Conrad

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12865 2024-10-18 cs.CL cs.AI cs.LG 67%

ELF-Gym: Evaluating Large Language Models Generated Features for Tabular Prediction

Yanlin Zhang, Ning Li, Quan Gan, Weinan Zhang, David Wipf, Minjie Wang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11301 2024-10-17 cs.AI cs.CL cs.LG 67%

Enhancing and Assessing Instruction-Following with Fine-Grained Instruction Variants

Jiuding Yang, Weidong Guo, Kaitong Yang, Xiangyang Li, Yu Xu, Di Niu

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14622 2024-10-16 quant-ph 67%

Empirical Risk-aware Machine Learning on Trojan-Horse Detection for Trusted Quantum Key Distribution Networks

Hong-fu Chou, Thang X. Vu, Ilora Maity, Luis M. Garces-Socarras, Jorge L. Gonzalez-Rios, Juan Carlos Merlano-Duncan, Sean Longyu Ma, Symeon Chatzinotas, Bjorn Ottersten

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

Comments 20 Pages, 14 figure, Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11302 2024-10-16 cs.CV cs.AI cs.CL cs.LG 67%

Have the VLMs Lost Confidence? A Study of Sycophancy in VLMs

Shuo Li, Tao Ji, Xiaoran Fan, Linsheng Lu, Leyi Yang, Yuming Yang, Zhiheng Xi, Rui Zheng, Yuran Wang, Xiaohui Zhao, Tao Gui, Qi Zhang, Xuanjing Huang

专题命中 安全评测 :DPO(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11939 2024-10-16 cs.LG cs.AI cs.CL 67%

From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline

Tianle Li, Wei-Lin Chiang, Evan Frick, Lisa Dunlap, Tianhao Wu, Banghua Zhu, Joseph E. Gonzalez, Ion Stoica

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09652 2024-10-15 cs.CR cs.AI cs.CL cs.LG cs.NE 67%

Survival of the Safest: Towards Secure Prompt Optimization through Interleaved Multi-Objective Evolution

Ankita Sinha, Wendi Cui, Kamalika Das, Jiaxin Zhang

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2024 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17139 2024-10-15 cs.LG cs.AI cs.CL cs.IT math.IT 67%

Diff-eRank: A Novel Rank-Based Metric for Evaluating Large Language Models

Lai Wei, Zhiquan Tan, Chenghai Li, Jindong Wang, Weiran Huang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏