Integrating Chain-of-Thought for Multimodal Alignment: A Study on 3D Vision-Language Learning
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CY
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL
专题命中 安全评测 :safety(title,abstract);分类 cs.LG
Comments Accepted to the ICBINB Workshop at ICLR'25
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL
专题命中 安全评测 :alignment(title,abstract);分类 cs.LG
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI
专题命中 安全评测 :safety(title,abstract);分类 cs.CL
Comments To appear at AAMAS, 2025
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL
Comments Preprint
专题命中 安全评测 :alignment(title,abstract);分类 cs.LG
专题命中 安全评测 :alignment(title);RLHF(abstract);分类 cs.CL
Journal ref Transactions on Machine Learning Research (TMLR), 2025
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
Comments Project report of AgentGuard in LLM Agent MOOC Hackathon hosted by UC Berkeley in 2024
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI
Comments 15 pages, 11 figures
专题命中 安全评测 :alignment(title,abstract);分类 cs.LG
Comments 25 Pages, 8 figures
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
Comments arXiv admin note: text overlap with arXiv:2501.17132
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG
Comments Rejected by ICLR 2025. https://openreview.net/forum?id=uVMZgtw2pf
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL
Comments 11 pages, 5 figures
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL
专题命中 安全评测 :alignment(title,abstract);分类 cs.LG
Comments AAAI 2025 Accepted
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI
Comments 7 pages, 4 figures
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL
Comments 4 pages
专题命中 安全评测 :alignment(title,abstract);分类 cs.LG
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI
Comments Draft version; Under review
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI
Journal ref Journal of Mathematical Sciences, 2024 Springer Nature Switzerland AG, Vol. 285, No. 2, October, 2024
专题命中 安全评测 :harmlessness(title,abstract);分类 cs.CL
Comments Accepted by KDD workshop on Evaluation and Trustworthiness of Generative AI Models
Journal ref https://genai-evaluation-kdd2024.github.io/genai-evalution-kdd2024/assets/papers/GenAI_Evaluation_KDD2024_paper_5.pdf
专题命中 安全评测 :alignment(title,abstract);分类 cs.LG
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL
Comments Accepted by AAAI 2025