arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-23 至 2026-03-23 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 3 篇

2509.20057 2026-03-23 cs.CL cs.AI 62%

Responsible AI Technical Report

负责任的人工智能技术报告

KT, :, Yunjin Park, Jungwon Yoon, Junhyung Moon, Myunggyo Oh, Wonhyuk Lee, Sujin Kim, Youngchol Kim, Eunmi Kim, Hyoungjun Park, Eunyoung Shin, Wonyoung Lee, Somin Lee, Minwook Ju, Minsung Noh, Dongyoung Jeong, Jeongyeop Kim, Wanjin Park, Soonmin Bae

机构 * Responsible AI Center(负责任AI中心) Tech. Innovation Group(技术创新组)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种负责任的人工智能评估方法和风险缓解技术,用于确保AI服务的安全性和可靠性,并提供实用工具来管理和缓解AI风险。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19649 2026-03-23 cs.SI cs.AI 57%

PolicySim: An LLM-Based Agent Social Simulation Sandbox for Proactive Policy Optimization

PolicySim:一种基于LLM的代理社会模拟沙盒,用于主动政策优化

Renhong Huang, Ning Tang, Jiarong Xu, Yuxuan Cao, Qingqian Tu, Sheng Guo, Bo Zheng, Huiyuan Liu, Yang Yang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) University of Nottingham(诺丁汉大学) PowerChina Huadong Engineering Corporation Limited(国家电网华东工程公司)

专题命中 AI治理与伦理 :DPO(abstract);分类 cs.AI

AI总结 本文提出PolicySim,通过用户代理模块和自适应干预模块,模拟用户行为与平台干预的双向动态,实现对干预政策的主动评估与优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05154 2026-03-23 cs.CL 57%

Can AI Truly Represent Your Voice in Deliberations? A Comprehensive Study of Large-Scale Opinion Aggregation with LLMs

AI能否真正代表您的声音进行辩论?基于大规模意见聚合的全面研究

Shenzhe Zhu, Shu Yang, Michiel A. Bakker, Alex Pentland, Jiaxin Pei

机构 * Stanford University(斯坦福大学) University of Toronto(多伦多大学) KAUST(卡塔尔大学) MIT(麻省理工学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文通过DeliberationBank数据集评估LLM在大规模辩论总结中的表现,发现其存在代表性不足和偏见问题,提出DeliberationJudge模型提升评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏