arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-16 至 2026-03-16 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 7 篇

2505.12050 2026-03-16 cs.CL cs.AI cs.LG 85%

AdaBoN: Adaptive Best-of-N Alignment

AdaBoN: 适应性最佳N对齐

Vinod Raman, Hilal Asi, Satyen Kale

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种适应性最佳N对齐策略,通过两阶段算法高效分配推理计算资源,实验证明其在不同提示批次中优于均匀分配方法。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12565 2026-03-16 cs.SD cs.CL 79%

Speech-Worthy Alignment for Japanese SpeechLLMs via Direct Preference Optimization

通过直接偏好优化实现日语SpeechLLMs的Speech-Worthy对齐

Mengjie Zhao, Lianbo Liu, Yusuke Fujita, Hao Shi, Yuan Gao, Roman Koshkin, Yui Sudo

机构 * SB Intuitions

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出通过直接偏好优化方法,改进日语SpeechLLMs以生成适合语音合成的简洁、口语化文本,引入SpokenElyza基准测试,并在保持原有性能的同时显著提升语音质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12811 2026-03-16 cs.CV 78%

OARS: Process-Aware Online Alignment for Generative Real-World Image Super-Resolution

OARS:面向生成真实世界图像超分辨率的在线对齐

Shijie Zhao, Xuanyu Zhang, Bin Chen, Weiqi Li, Qunliang Xing, Kexin Zhang, Yan Wang, Junlin Li, Li Zhang, Jian Zhang, Tianfan Xue

机构 * ByteDance Inc.(字节跳动公司) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 OARS通过过程感知的在线对齐框架,结合COMPASS奖励模型,在线优化图像超分辨率模型,实现感知与保真度的平衡,提升真实世界图像超分辨率性能。

Comments Super-Resolution, Reinforcement Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16201 2026-03-16 cs.CV 78%

Visual Alignment of Medical Vision-Language Models for Grounded Radiology Report Generation

医学视觉-语言模型的视觉对齐以实现基于基础的放射学报告生成

Sarosij Bose, Ravi K. Rajendran, Biplob Debnath, Konstantinos Karydis, Amit K. Roy-Chowdhury, Srimat Chakradhar

机构 * NEC Laboratories America(NEC美洲实验室) University of California, Riverside(加州大学河滨分校)

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 本文提出VALOR方法,通过临床指导文本推理和自监督视觉推理解决医学报告生成中的视觉幻觉问题,提升生成质量与临床准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12595 2026-03-16 cs.LG cs.AI 62%

Swap-guided Preference Learning for Personalized Reinforcement Learning from Human Feedback

基于交换引导的偏好学习用于从人类反馈中获得个性化强化学习

Gihoon Kim, Euntai Kim

机构 * Yonsei University(延世大学) Korea Institute of Science and Technology(韩国科学技术院)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Swap-guided Preference Learning (SPL)来解决变分偏好学习中后验崩溃的问题,通过引入交换引导基础正则化、偏好逆自回归流和自适应潜在条件化来提升个性化强化学习效果。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20796 2026-03-16 econ.GN cs.AI cs.LG q-fin.EC 62%

Aligning Large Language Model Agents with Rational and Moral Preferences: A Supervised Fine-Tuning Approach

对齐大型语言模型代理的理性与道德偏好:一种监督微调方法

Wei Lu, Amit Dhanda, Daniel L. Chen, Christian B. Hansen

机构 * Zicklin School of Business, CUNY Baruch College(纽约大学法学院) Amazon(亚马逊) Toulouse School of Economics(图卢兹经济学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文通过监督微调方法对齐LLM代理的理性与道德偏好,揭示了代理在经济游戏中的系统性偏差,并展示了不同偏好结构对均衡结果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12625 2026-03-16 cs.IR cs.AI cs.CV 57%

VLM4Rec: Multimodal Semantic Representation for Recommendation with Large Vision-Language Models

VLM4Rec:基于大视觉-语言模型的多模态语义表示推荐系统

Ty Valencia, Burak Barlas, Varun Singhal, Ruchir Bhatia, Wei Yang

机构 * University of Southern California(南加州大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 VLM4Rec通过语义对齐而非直接特征融合,提升多模态推荐性能,实验显示其优于原始视觉特征和融合方法。

Comments 13 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏