Is Reasoning All You Need? Probing Bias in the Age of Reasoning Language Models
机构 * University of Calabria, Rende, Italy(卡拉布里亚大学)
专题命中 AI治理与伦理 :safety(abstract);jailbreak(abstract);分类 cs.CL
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * University of Calabria, Rende, Italy(卡拉布里亚大学)
专题命中 AI治理与伦理 :safety(abstract);jailbreak(abstract);分类 cs.CL
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY
Comments Accepted to the ACM Conference on Fairness, Accountability, and Transparency (FAccT '25)
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY
Comments Published as a RAND commentary
Journal ref Santa Monica, CA: RAND Corporation, 2024. https://www.rand.org/pubs/perspectives/PEA3703-1.html
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL
机构 * AI Disclosures Project, Social Science Research Council Institute for Innovation and Public Purpose, University College London(AI披露项目,社会科学理事会创新与公共目的研究所,伦敦大学学院) ; AI Disclosures Project, Social Science Research Council(AI披露项目,社会科学理事会) ; O’Reilly Media(O’Reilly媒体)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI
Comments Corrected a previous error: replaced 'underrepresented in Academic AI research' with the intended phrase 'underrepresented in Corporate AI research'
专题命中 AI治理与伦理 :alignment(abstract);trustworthy(abstract);分类 cs.CY
Comments 32 pages, 6 figures. Accepted for publication in the Journal of Engineering Education (2025)
机构 * Bloomberg(彭博社) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
Comments Accepted to FAccT 2025
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY
Comments Working paper version (35 pages). Submitted to So. Ill. Law Journal; full-form citations retained for editorial review. Not peer-reviewed. Subject to revision
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY
Comments 28 table, 7 Figures, 78 pages
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
Journal ref 599(2024)128111
专题命中 AI治理与伦理 :RLHF(abstract);分类 cs.CL、cs.AI、cs.CY
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY
Comments 19 pages, 2 figures
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY
Comments 34 pages, 9 tables, 1 figure
专题命中 AI治理与伦理 :alignment(abstract);trustworthy(abstract);分类 cs.CY
Comments To appear at AIES 2024
专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.CY
Comments Whitepaper - deliverable from the KI.NRW flagship-project "Zertifizierte KI"
专题命中 AI治理与伦理 :safety(abstract);red teaming(abstract);分类 cs.CY
Comments To be presented at CSCW 2025
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY
Comments 32 pages
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CY
Comments ACM Conference on Fairness, Accountability, and Transparency (FAccT '24). Association for Computing Machinery, New York, NY, USA, 776-796
Journal ref In Proceedings of the 2024 ACM Conference on Fairness, Accountability, and Transparency (FAccT '24). Association for Computing Machinery, New York, NY, USA, 776-796
专题命中 AI治理与伦理 :safety(abstract);harmlessness(abstract);分类 cs.AI
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI
Comments Independent study, Exploring LLMs, Deploying LLMs and their Risks
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.LG
Comments Accepted to ICML'24 as a position paper
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.LG
Comments 21 pages, 15 figures
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY