arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-13 至 2026-03-13 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 3 篇

2603.01214 2026-03-13 cs.CL cs.LG 81%

Reasoning Boosts Opinion Alignment in LLMs

推理提升大语言模型中的观点一致性

Frédéric Berdoz, Yann Billeter, Yann Vonlanthen, Roger Wattenhofer

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究通过结构化推理提升大语言模型的观点一致性,验证了推理在改善观点建模中的有效性,但指出仍需进一步机制以减少偏见。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03998 2026-03-13 cs.HC cs.AI cs.CY 62%

TRACE: AI-Assisted Assessment of Collaborative Projects in Computer Science Education

TRACE:计算机科学教育中协作项目的AI辅助评估

Songmei Yu, Andrew Zagula

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 TRACE通过AI辅助分析提升计算机科学教育中协作项目评估的透明度和可扩展性。

Comments 7 pages, 3 figures. Accepted at EISTA 2025; published in the Journal of Systemics, Cybernetics and Informatics (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04916 2026-03-13 cs.SE 50%

Classifier or Prompt: A Case Study on Legal Requirements Traceability

分类器或提示:关于法律要求可追溯性的案例研究

Romina Etezadi, Sallam Abualhaija, Chetan Arora, Lionel Briand

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出Kashif和RICE_LRT两种方法,分别通过分类器和提示工程解决法律要求的可追溯性问题,实验表明Kashif在F2得分上优于基线,RICE_LRT在更复杂的GDPR文档中表现更优。

Comments 32 pages, 7 figues

详情

展开后加载摘要…

URL PDF HTML 收藏