arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-24 至 2026-03-24 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 7 篇

2603.21435 2026-03-24 cs.AI econ.GN q-fin.EC 79%

Behavioural feasible set: Value alignment constraints on AI decision support

行为可行集:人工智能决策支持中的价值对齐约束

Taejin Park

机构 * Bank for International Settlements(国际清算银行)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI

AI总结 研究探讨了人工智能决策支持系统中价值对齐约束对行为可行集的影响,通过实验显示对齐显著压缩了推荐范围,并揭示了组织在选择供应商时面临的价值导向问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21340 2026-03-24 cs.AI cs.DC 77%

ARYA: A Physics-Constrained Composable & Deterministic World Model Architecture

ARYA:一种受物理约束的可组合且确定性世界模型架构

Seth Dobrin, Lukasz Chmiel

机构 * ARYA Labs(ARYA实验室)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出ARYA,一种基于五项原则的可组合、受物理约束且确定性世界模型架构,通过层级系统实现高效能与计算效率的平衡,展示其在六个基准测试中的卓越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19610 2026-03-24 cs.CV 71%

ParallelVLM: Lossless Video-LLM Acceleration with Visual Alignment Aware Parallel Speculative Decoding

ParallelVLM: 无损视频-大语言模型加速与视觉对齐感知并行推测解码

Quan Kong, Yuhao Shen, Yicheng Ji, Huan Li, Cong Wang

机构 * Zhejiang University(浙江大学)

专题命中 AI治理与伦理 :alignment(title)

AI总结 ParallelVLM通过并行化阶段和无偏验证器引导剪枝策略,有效提升视频理解任务的解码效率,实现3.36倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07775 2026-03-24 cs.CL cs.AI cs.CY 67%

Must Read: A Comprehensive Survey of Computational Persuasion

必须阅读:计算说服的全面综述

Nimet Beyza Bozdag, Shuhaib Mehri, Xiaocheng Yang, Hyeonjeong Ha, Zirui Cheng, Esin Durmus, Jiaxuan You, Heng Ji, Gokhan Tur, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文综述了计算说服的三个视角:AI作为说服者、被说服者和评判者,探讨了AI生成内容的有效性及伦理挑战。

Comments Accepted to ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20235 2026-03-24 cs.CY cs.AI cs.HC 62%

Writing literature reviews with AI: principles, hurdles and some lessons learned

用AI撰写文献综述:原则、障碍与一些经验教训

Saadi Lahlou, Annabelle Gouttebroze, Atrina Oraee, Julian Madera

机构 * London School of Economics and Political Science(伦敦政治经济学院) Paris Institute for Advanced Study(巴黎高级研究学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文通过比较不同AI辅助程度下的文献综述,揭示了AI生成内容的偏见、主流化倾向及局限性,强调了在使用AI撰写综述时需注意的防范措施。

Comments 31 pages and 193 pages of Appendices, including 6 different versions of the literature review, and complete chat with the LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20214 2026-03-24 cs.CY cs.AI cs.HC 62%

Beyond Detection: Governing GenAI in Academic Peer Review as a Sociotechnical Challenge

超越检测:将生成式人工智能在学术同行评审中的治理视为一个社会技术挑战

Tatiana Chakravorti, Pranav Narayanan Venkit, Sourojit Ghosh, Sarah Rajtmajer

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Salesforce AI Research(Salesforce AI研究) University of Washington(华盛顿大学)

专题命中 AI治理与伦理 :prompt injection(abstract);分类 cs.AI、cs.CY

AI总结 本文通过混合方法研究,探讨生成式人工智能在学术同行评审中的社会技术风险,发现核心评估应由人类承担,同时提出保留问责机制的治理建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21386 2026-03-24 cs.CV 50%

Mitigating Objectness Bias and Region-to-Text Misalignment for Open-Vocabulary Panoptic Segmentation

缓解对象性偏差和区域到文本对齐问题以实现开放词汇全景分割

Nikolay Kormushev, Josip Šarić, Matej Kristan

机构 * University of Ljubljana(卢布尔雅那大学) ETH Zurich(苏黎世联邦理工学院) University of Zagreb(扎格reb大学) Faculty of Comp. and Inf. Science(计算机与信息科学系) Dept. of Computer Science(计算机科学系) Faculty of Elec. Eng. and Computing(电子工程与计算科学系)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文提出OVRCOAT框架,通过CLIP条件对象性调整和开放词汇掩码到文本细化,解决开放词汇全景分割中的对象性偏差和区域对齐问题,提升分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏