arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-01 至 2026-07-01 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2606.31054 2026-07-01 cs.CV cs.AI cs.CL cs.MM 新提交 89%

ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs

ADAPT: 通过偏好调优实现注意力动态对齐以增强多模态大模型的忠实性

Zhiyuan Yao, Zheren Fu, Zhixiao Zheng, Jiajun Li, Yi Tu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Ltd.(华为技术有限公司) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民网传播内容认知国家重点实验室)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大模型生成中的幻觉问题,提出ADAPT框架,通过跨注意力视觉锚点、注意力监督推理和视觉注意力引导DPO直接干预文本到图像的跨注意力动态,在多个基准上将幻觉率降低40%-60%。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06625 2026-07-01 cs.CL 版本更新 81%

FairJudge: An Adaptive, Debiased, and Consistent LLM-as-a-Judge

FairJudge: 一种自适应、去偏且一致的LLM作为评判者

Bo Yang, Lanfei Feng, Yunkui Chen, Yu Zhang, Xiao Xu, Shijian Li

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL

AI总结 针对LLM评判系统在适应性、偏见和一致性上的局限,提出FairJudge,通过可学习正则化策略和课程式SFT-DPO-GRPO训练范式,实现自适应、去偏和一致评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30887 2026-07-01 cs.CL cs.AI cs.MA 新提交 73%

Training Therapeutic Judges and Multi-Agent Systems for Human-Aligned Mental Health Support

训练治疗性评判者与多智能体系统以实现人类对齐的心理健康支持

Mizanur Rahman, Abeer Badawi, Elahe Rahimi, Laleh Seyyed-Kalantari, Frank Rudzicz, Enamul Hoque, Elham Dolatabadi

机构 * York University(约克大学) Vector Institute(向量研究所) Connected Minds Dalhousie University(达尔豪斯大学)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 提出一个框架,通过两阶段训练(TheraJudge评判者与TheraAgent多智能体系统)将治疗性响应生成转化为决策优化问题,显著提升心理健康LLM的治疗质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30851 2026-07-01 cs.CL cs.AI cs.DB 新提交 62%

Test-Time Verification for Text-to-SQL via Outcome Reward Models

基于结果奖励模型的文本到SQL测试时验证

Mattia Tritto, Giuseppe Farano, Dario Di Palma, Gaetano Rossiello, Fedelucio Narducci, Dharmashankar Subramanian, Tommaso Di Noia

机构 * Polytechnic University of Bari(巴里理工大学) IBM T.J. Watson Research Center(IBM T.J.沃森研究中心)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出结果奖励模型(ORM)作为学习型语义评分函数,用于Text-to-SQL的测试时验证,通过自动化候选生成和执行标签训练ORM,在BIRD和Spider基准上优于执行优先和多数投票方法。

Comments Accepted to the SURGeLLM Workshop at ACL 2026, San Diego, US

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31800 2026-07-01 cs.AI 新提交 57%

Evo-PI: Aligning Medical Reasoning via Evolving Principle-Guided Supervision

Evo-PI:通过演化原则引导的对齐医学推理

Xianda Zheng, Huan Gao, Meng-Fen Chiang, Michael Witbrock, Kaiqi Zhao, Shangyang Li

机构 * School of Computer Science, University of Auckland(奥克兰大学计算机科学学院) Beijing University of Posts and Telecommunications(北京邮电大学) Renyixun Health Technology Co., Ltd.(仁医讯健康科技有限公司) National Yang Ming Chiao Tung University(国立阳明交通大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 提出Evo-PI框架,将推理原则作为可演化的语言监督信号,通过协同进化循环动态调整模型推理,在医学视觉问答中提升准确率最高达24.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29805 2026-07-01 cs.CV 版本更新 50%

Clearer Sight, Fewer Lies: Oriented Pickup Preference Optimization for Multimodal Hallucination Mitigation

更清晰的视野,更少的谎言:面向多模态幻觉缓解的定向拾取偏好优化

Xin Zou, Haolin Deng, Yibo Yan, Shuliang Liu, Zhiwei Jin, Chen Chen, Haonan Lu, Xuming Hu

机构 * HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) OPPO AI Center(OPPO AI中心)

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出一种证据感知的对齐目标OPPO,通过对比不同视觉证据强度下的相同忠实响应,将视觉偏好转化为有序视觉证据对齐,以缓解多模态大模型的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏