arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-08 至 2026-04-08 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 9 篇

2604.05135 2026-04-08 cs.CL cs.CE 83%

SenseAI: A Human-in-the-Loop Dataset for RLHF-Aligned Financial Sentiment Reasoning

SenseAI:一种用于RLHF对齐的金融情感推理的人机协同数据集

Berny Kabalisa

专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);分类 cs.CL

AI总结 SenseAI通过整合推理链、置信度评分和市场结果,为金融情感推理提供RLHF对齐的数据支持,揭示模型行为中的系统性模式及改进机会。

Comments Dataset available on request (bernykabalisa18@gmail.com) See GitHub for dataset snapshot and automated data collection script demo https://github.com/bernykabalisa18-netizen/SenseAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05965 2026-04-08 cs.AI 79%

Beyond Compromise: Pareto-Lenient Consensus for Efficient Multi-Preference LLM Alignment

超越妥协:用于高效多偏好LLM对齐的帕累托宽容共识

Renxuan Tan, Rongpeng Li, Zhifeng Zhao, Honggang Zhang

机构 * Zhejiang Lab(之江实验室) Macau University of Science and Technology(澳门科技大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出帕累托宽容共识框架,通过动态谈判过程解决多目标偏好对齐中的局部收敛问题,提升模型对全局帕累托最优前沿的探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14628 2026-04-08 cs.CL cs.AI 76%

RLAIF-SPA: Structured AI Feedback for Semantic-Prosodic Alignment in Speech Synthesis

RLAIF-SPA: 结构化AI反馈用于语音合成中的语义-语调对齐

Qing Yang, Zhenghao Liu, Yangfan Du, Pengcheng Huang, Tong Xiao

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院)

专题命中 偏好对齐 :alignment(title);分类 cs.CL、cs.AI

AI总结 本文提出RLAIF-SPA框架,通过整合强化学习从AI反馈来优化语音合成中的情感表达和可懂度,实验显示其在多个数据集上均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05445 2026-04-08 cs.CL cs.AI cs.CV 73%

Learning What Matters: Dynamic Dimension Selection and Aggregation for Interpretable Vision-Language Reward Modeling

学习什么重要:可解释视觉语言奖励建模的动态维度选择与聚合

Qiyuan Chen, Hongsen Huang, Jiahe Chen, Qian Shao, Jintai Chen, Hongxia Xu, Renjie Hua, Chuan Ren, Jian Wu

机构 * Zhejiang University(浙江大学) Soochow Securities Co.,Ltd.(东吴证券股份有限公司) HKUST(GZ)(香港科技大学(广州)) Nanjing University(南京大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VL-MDR框架,通过动态分解评价为细粒度可解释维度,提升视觉语言奖励建模的可解释性与效率,实验显示其在基准测试中优于现有模型,并有效缓解视觉幻觉。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19282 2026-04-08 cs.CL cs.AI 62%

Framing Effects in Independent-Agent Large Language Models: A Cross-Family Behavioral Analysis

独立代理大语言模型中的框架效应:跨家族行为分析

Zice Wang, Zhenyu Zhang

机构 * Northeastern University(东北大学) Beijing Institute of Technology(北京理工大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了在非交互多代理部署中,提示框架如何影响独立代理在阈值投票任务中的决策,发现框架效应显著影响选择分布,倾向于风险规避选项,揭示了非交互多代理部署中的重要偏差源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05502 2026-04-08 cs.CR cs.LG 57%

AttnDiff: Attention-based Differential Fingerprinting for Large Language Models

AttnDiff:基于注意力的差分指纹法用于大语言模型

Haobo Zhang, Zhenhua Xu, Junxian Li, Shangfeng Sheng, Dezhang Kong, Meng Han

机构 * Zhejiang University of Technology(浙江工业大学) Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

AI总结 本文提出AttnDiff,一种高效白盒框架,通过内在信息路由行为提取模型指纹,用于验证大语言模型的衍生关系,实现高相似度区分相关衍生模型与无关模型家族。

Comments Accepted at ACL2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05279 2026-04-08 cs.AI 57%

Pressure, What Pressure? Sycophancy Disentanglement in Language Models via Reward Decomposition

压力,何为压力?通过奖励分解实现语言模型中的奉承解缠

Muhammad Ahmed Mohsin, Ahsan Bilal, Muhammad Umer, Emily Fox

机构 * Stanford University(斯坦福大学) University of Oklahoma(俄克拉荷马大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文提出通过奖励分解方法减少语言模型的奉承行为,引入多组件组相对策略优化(GRPO)奖励,分解训练信号为五个维度,有效降低奉承倾向。

Comments Submitted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05365 2026-04-08 cs.IR 50%

From Clues to Generation: Language-Guided Conditional Diffusion for Cross-Domain Recommendation

从线索到生成:语言引导的条件扩散用于跨域推荐

Ziang Lu, Lei Sang, Lin Mu, Yiwen Zhang

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出LGCD框架,通过结合大语言模型和扩散模型,解决跨域推荐中单域用户偏好转移难题,通过伪重叠数据和条件扩散架构提升推荐效果。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18740 2026-04-08 cs.IR 50%

Multimodal Large Language Models with Adaptive Preference Optimization for Sequential Recommendation

具有自适应偏好优化的多模态大语言模型用于序列推荐

Yu Wang, Yonghui Yang, Le Wu, Yi Zhang, Fei Liu, Richang Hong

专题命中 偏好对齐 :DPO(abstract)

AI总结 本文提出HaNoRec框架,通过自适应偏好优化解决多模态序列推荐中的样本不平衡和跨模态语义偏差问题,提升推荐性能。

Comments Accepted by SIGIR 2026 (Full Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏