arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 7971 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 7971 篇

2406.05797 2025-03-19 q-bio.BM cs.AI cs.CE cs.CL cs.LG 67%

3D-MolT5: Leveraging Discrete Structural Information for Molecule-Text Modeling

Qizhi Pei, Rui Yan, Kaiyuan Gao, Jinhua Zhu, Lijun Wu

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13383 2025-03-18 cs.CV cs.AI cs.CL cs.LG 67%

Cream of the Crop: Harvesting Rich, Scalable and Transferable Multi-Modal Data for Instruction Fine-Tuning

Mengyao Lyu, Yan Li, Huasong Zhong, Wenhao Yang, Hui Chen, Jungong Han, Guiguang Ding, Zhenheng Yang

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments update comparison with sota and analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21533 2025-03-18 cs.LG cs.AI cs.CL stat.ML 67%

L3Ms -- Lagrange Large Language Models

Guneet S. Dhillon, Xingjian Shi, Yee Whye Teh, Alex Smola

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments International Conference on Learning Representations (ICLR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07453 2025-03-17 cs.LG cs.AI cs.CL math.ST stat.TH 67%

Is a Good Foundation Necessary for Efficient Reinforcement Learning? The Computational Role of the Base Model in Exploration

Dylan J. Foster, Zakaria Mhammedi, Dhruv Rohatgi

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments V2: Improved number of prompts used by Algorithm 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13485 2025-03-11 cs.CL cs.AI cs.LG 67%

Utilizing Large Language Models to Synthesize Product Desirability Datasets

John D. Hastings, Sherri Weitl-Harms, Joseph Doty, Zachary J. Myers, Warren Thompson

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 9 pages, 2 figures, 6 tables, updated author list

Journal ref 2024 IEEE International Conference on Big Data (IEEE BigData 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20684 2025-03-03 cs.CL cs.AI cs.LG 67%

JAM: Controllable and Responsible Text Generation via Causal Reasoning and Latent Vector Manipulation

Yingbing Huang, Deming Chen, Abhishek K. Umrawal

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 10 pages, 3 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06287 2025-02-25 cs.LG cs.AI cs.CL 67%

Non-Halting Queries: Exploiting Fixed Points in LLMs

Ghaith Hammouri, Kemal Derya, Berk Sunar

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15720 2025-02-25 cs.CY cs.AI cs.CR cs.LG 67%

Training AI to be Loyal

Sewoong Oh, Himanshu Tyagi, Pramod Viswanath

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 13 pages 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21236 2025-02-17 cs.LG cs.AI cs.CL 67%

Flaming-hot Initiation with Regular Execution Sampling for Large Language Models

Weizhe Chen, Zhicheng Zhang, Guanlin Liu, Renjie Zheng, Wenlei Shi, Chen Dun, Zheng Wu, Xing Jin, Lin Yan

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08482 2025-02-13 cs.CL cs.AI cs.LG 67%

Enhancing Auto-regressive Chain-of-Thought through Loop-Aligned Reasoning

Qifan Yu, Zhenyu He, Sijie Li, Xun Zhou, Jun Zhang, Jingjing Xu, Di He

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02040 2025-02-05 cs.CL cs.AI cs.LG 67%

M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference

Nikhil Bhendawade, Mahyar Najibi, Devang Naik, Irina Belousova

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08019 2025-01-15 cs.LG cs.AI cs.CY 67%

An AI-driven framework for rapid and localized optimizations of urban open spaces

Pegah Eshraghi, Arman Nikkhah Dehnavi, Maedeh Mirdamadi, Riccardo Talami, Zahra-Sadat Zomorodian

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09308 2025-01-15 cs.CL cs.AI cs.LG q-bio.NC 67%

Divergences between Language Models and Human Brains

Yuchen Zhou, Emmy Liu, Graham Neubig, Michael J. Tarr, Leila Wehbe

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03700 2025-01-10 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

OneLLM: One Framework to Align All Modalities with Language

Jiaming Han, Kaixiong Gong, Yiyuan Zhang, Jiaqi Wang, Kaipeng Zhang, Dahua Lin, Yu Qiao, Peng Gao, Xiangyu Yue

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by CVPR 2024. Code: https://github.com/csuhan/OneLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02739 2025-01-07 cs.CL cs.AI cs.LG 67%

TARDiS : Text Augmentation for Refining Diversity and Separability

Kyungmin Kim, SangHun Im, GiBaeg Kim, Heung-Seon Oh

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11303 2024-12-30 cs.LG cs.AI cs.CL 67%

TSDS: Data Selection for Task-Specific Model Finetuning

Zifan Liu, Amin Karbasi, Theodoros Rekatsinas

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 31 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14546 2024-12-24 cs.CL cs.AI cs.LG 67%

Connecting the Dots: LLMs can Infer and Verbalize Latent Structure from Disparate Training Data

Johannes Treutlein, Dami Choi, Jan Betley, Samuel Marks, Cem Anil, Roger Grosse, Owain Evans

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NeurIPS 2024. 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10893 2024-12-17 cs.CL cs.AI cs.LG 67%

BgGPT 1.0: Extending English-centric LLMs to other languages

Anton Alexandrov, Veselin Raychev, Dimitar I. Dimitrov, Ce Zhang, Martin Vechev, Kristina Toutanova

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05231 2024-12-13 cs.CY cs.CL cs.LG 67%

Evaluating GPT-4 at Grading Handwritten Solutions in Math Exams

Adriana Caraeni, Alexander Scarlatos, Andrew Lan

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.CY、cs.LG

Comments Published in LAK 2025: The 15th International Learning Analytics and Knowledge Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01708 2024-12-03 cs.CL cs.AI cs.HC cs.LG 67%

Are We There Yet? Revealing the Risks of Utilizing Large Language Models in Scholarly Peer Review

Rui Ye, Xianghe Pang, Jingyi Chai, Jiaao Chen, Zhenfei Yin, Zhen Xiang, Xiaowen Dong, Jing Shao, Siheng Chen

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 27 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17593 2024-12-03 cs.CL cs.AI cs.LG 67%

What Differentiates Educational Literature? A Multimodal Fusion Approach of Transformers and Computational Linguistics

Jordan J. Bird

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10153 2024-11-27 cs.CL cs.CY cs.LG 67%

Diagnosing Hate Speech Classification: Where Do Humans and Machines Disagree, and Why?

Xilin Yang

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14254 2024-11-22 cs.LG cs.AI cs.CY 67%

BERT-Based Approach for Automating Course Articulation Matrix Construction with Explainable AI

Natenaile Asmamaw Shiferaw, Simpenzwe Honore Leandre, Aman Sinha, Dillip Rout

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 26 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05200 2024-11-11 cs.CY cs.CL cs.HC cs.LG 67%

Toward Cultural Interpretability: A Linguistic Anthropological Framework for Describing and Evaluating Large Language Models (LLMs)

Graham M. Jones, Shai Satran, Arvind Satyanarayan

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.CY、cs.LG

Comments Accepted for publication in Big Data & Society, November 2, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00593 2024-11-07 cs.CL cs.AI cs.LG 67%

Adapting Language Models via Token Translation

Zhili Feng, Tanya Marwah, Nicolo Fusi, David Alvarez-Melis, Lester Mackey

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05241 2024-11-01 cs.CL cs.AI cs.CY cs.ET cs.GT 67%

Large Model Strategic Thinking, Small Model Efficiency: Transferring Theory of Mind in Large Language Models

Nunzio Lore, Sepehr Ilami, Babak Heydari

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20036 2024-10-29 cs.CL cs.AI cs.LG 67%

Architectural Flaw Detection in Civil Engineering Using GPT-4

Saket Kumar, Abul Ehtesham, Aditi Singh, Tala Talaei Khoei

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12841 2024-10-21 cs.CL cs.AI cs.HC cs.LG 67%

UniAutoML: A Human-Centered Framework for Unified Discriminative and Generative AutoML with Large Language Models

Jiayi Guo, Zan Chen, Yingrui Ji, Liyun Zhang, Daqin Luo, Zhigang Li, Yiqin Shen

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13086 2024-10-18 cs.CL cs.AI cs.LG 67%

Reverse-Engineering the Reader

Samuel Kiegeland, Ethan Gotlieb Wilcox, Afra Amini, David Robert Reich, Ryan Cotterell

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12242 2024-10-11 cs.CL cs.AI cs.LG 67%

Reference-based Metrics Disprove Themselves in Question Generation

Bang Nguyen, Mengxia Yu, Yun Huang, Meng Jiang

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2024 Findings - Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏