arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-31 至 2026-03-31 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 7 篇

2603.03192 2026-03-31 cs.CV cs.CL cs.LG 84%

MoD-DPO: Towards Mitigating Cross-modal Hallucinations in Omni LLMs using Modality Decoupled Preference Optimization

MoD-DPO:通过模态解耦偏好优化缓解多模态幻觉

Ashutosh Chaubey, Jiacheng Pang, Mohammad Soleymani

机构 * University of Southern California(南加州大学)

专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出MoD-DPO框架,通过引入模态感知正则化项和语言先验去偏惩罚,提升多模态大模型的模态对齐能力,实验表明其在多模态幻觉基准测试中表现优异。

Comments CVPR 2026. Project Page: https://mod-dpo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27693 2026-03-31 cs.CV cs.AI cs.LG cs.MA cs.MM 81%

LVRPO: Language-Visual Alignment with GRPO for Multimodal Understanding and Generation

LVRPO:基于GRPO的语言-视觉对齐用于多模态理解和生成

Shentong Mo, Sukmin Yun

机构 * Department of Machine Learning, CMU, USA(卡内基梅隆大学机器学习系,美国) Department of Machine Learning, MBZUAI, UAE(穆罕默德·本·扎耶德人工智能大学机器学习系,阿联酋) Department of Artificial Intelligence, Hanyang University ERICA, South Korea(汉阳大学ERICA校区人工智能系,韩国)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出LVRPO框架,通过GRPO显式对齐语言和视觉表示,提升多模态理解和生成性能,无需辅助编码器或人工目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27868 2026-03-31 econ.TH cs.AI cs.GT 79%

A Revealed Preference Framework for AI Alignment

为AI对齐的揭示偏好框架

Elchin Suleymanov

机构 * Department of Economics, Mitch Daniels School of Business, Purdue University(普渡大学米奇·丹尼尔斯商学院经济系)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出Luca对齐模型,通过揭示偏好技术研究AI是否实现人类偏好,证明在实验室和实地设置中可识别对齐程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28123 2026-03-31 cs.CY cs.AI cs.CL 67%

Does Claude's Constitution Have a Culture?

克莱因的宪法有文化吗?

Parham Pourdavood

机构 * Independent Researcher(独立研究员)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究克莱因的宪法是否反映特定文化视角,通过评估其在跨文化调查中的表现,发现其价值观与北欧和盎格鲁国家相似,但多数项目超出所有被调查人群范围。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28197 2026-03-31 cs.AI 57%

EpiPersona: Persona Projection and Episode Coupling for Pluralistic Preference Modeling

EpiPersona:基于人格与事件耦合的多元偏好建模

Yujie Zhang, Weikang Yuan, Zhuoren Jiang, Pengwei Yan

机构 * Zhejiang University(浙江大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 EpiPersona通过显式人格-事件耦合方法,有效分离持久性人格特征与情境信号,提升大语言模型在多元偏好下的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28191 2026-03-31 cs.CL 57%

DongYuan: An LLM-Based Framework for Integrative Chinese and Western Medicine Spleen-Stomach Disorders Diagnosis

东元:一种基于大语言模型的整合中西医脾胃疾病诊断框架

Hua Li, Yingying Li, Xiaobin Feng, Xinyi Fu, Lifeng Dong, Qingfeng Yang, Yanzhe Chen, Xiaoju Feng, Zhidong Cao, Jianbin Guo, Yanru Du

机构 * Beijing Wenge Technology Co., Ltd.(北京文歌科技有限公司) Hebei Provincial Hospital of Traditional Chinese Medicine(河北省中医院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tianjin University(天津大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

AI总结 本文提出东元框架,通过构建三个中西医脾胃疾病数据集,开发核心诊断LLM和咨询导航模型,建立评估基准,显著提升中西医脾胃疾病诊断性能。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02368 2026-03-31 cs.IR 50%

NextQuill: Causal Preference Modeling for Enhancing LLM Personalization

NextQuill: 基于因果偏好建模的增强大语言模型个性化

Xiaoyan Zhao, Juntao You, Yang Zhang, Wenjie Wang, Hong Cheng, Fuli Feng, See-Kiong Ng, Tat-Seng Chua

专题命中 偏好对齐 :alignment(abstract)

AI总结 NextQuill通过因果偏好建模方法,改进大语言模型的个性化对齐,通过区分模型预测和训练数据中的真实偏好影响,提升个性化效果。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏