arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3235 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3235 篇

2311.08685 2024-04-02 cs.CL cs.AI 79%

Safer-Instruct: Aligning Language Models with Automated Preference Data

Taiwei Shi, Kai Chen, Jieyu Zhao

专题命中 偏好对齐 :RLHF(abstract);safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI

Comments 16 pages. NAACL 2024 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11296 2024-02-20 cs.CL cs.AI 79%

Dissecting Human and LLM Preferences

Junlong Li, Fan Zhou, Shichao Sun, Yikai Zhang, Hai Zhao, Pengfei Liu

专题命中 偏好对齐 :alignment(abstract);safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08466 2026-07-31 cs.IR 版本更新 78%

ToolRec: Calibrated Preference Alignment for Query Recommendation in On-Device Assistants

ToolRec: 面向设备端助手的校准偏好对齐查询推荐

Zihan Luo, Lingkui Chen, Ruike Zhang, Hong Huang, Boyang Zhang, Ziniu Chen, Lizhong Wang, Chao Chen

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 提出ToolRec框架,通过构建系统工具库和双层校准机制优化点击数据,利用加权KTO对齐模型,在设备端助手查询推荐中提升点击率和相关性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02061 2026-07-29 cs.IR 版本更新 78%

Reason4Rec: Deliberative User Preference Alignment of Large Language Models for Recommendation

Reason4Rec:用于推荐的大语言模型的审慎用户偏好对齐

Yi Fang, Wenjie Wang, Yang Zhang, Fengbin Zhu, Qifan Wang, Fuli Feng, Xiangnan He

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 研究旨在开发更可靠的推荐LLMs,引入“审慎推荐”任务并提出“推理驱动的推荐器”框架,利用语言化用户反馈增强推理能力,经实验验证该框架能提升预测准确性和推理质量。

Comments Accepted to IEEE TKDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02220 2026-07-03 cs.CV 新提交 78%

DetailAnywhere: Fashion Detail Generation via Cross-Modal Feature Alignment Distillation

DetailAnywhere: 通过跨模态特征对齐蒸馏实现时尚细节生成

Zijun Li, Yimin Zhou, Jia Sun, Honglie Wang, Pengcheng Wei, Junlong Wu, Yongrui Heng, Jiyuan Wang, Huan Ouyang, Boheng Zhang, Huaiqing Wang, Dewen Fan, Qianqian Gan, Fan Yang, Tingting Gao

机构 * Kuaishou Technology(快手科技) AIM for Health Lab, Monash University(Monash大学AIM健康实验室)

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 针对在线购物中用户关注服装细节(如领口、袖口、面料纹理)的需求,提出新任务“时尚细节生成”及基准FDBench,并设计跨模态特征对齐蒸馏(CFAD)方法,结合多模态扩散Transformer和一致性奖励模型,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03216 2026-06-03 cs.CV 78%

Follow-Your-Preference++: Rethinking Preference Alignment for Image Inpainting

Follow-Your-Preference++:重新思考图像修复中的偏好对齐

Junkun Yuan, Yutao Shen, Toru Aonishi, Hideki Nakayama, Yue Ma

机构 * Zhejiang University(浙江大学) The University of Tokyo(东京大学) Tsinghua University(清华大学)

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 本文从基本原理出发,通过直接偏好优化框架和公开奖励模型构建偏好数据,系统研究了图像修复中的偏好对齐问题,发现奖励模型存在偏差但可通过集成缓解,并在标准指标、大视觉语言模型评估和人类评估上显著超越先前最先进模型。

Comments 23 pages, 14 figures. arXiv admin note: substantial text overlap with arXiv:2509.23082

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13875 2026-05-15 cs.GT 78%

Common-agency Games for Multi-Objective Test-Time Alignment

多目标测试时对齐的共同代理博弈

Baiting Chen, Tong Zhu, Rui Yu, Xiaowu Dai

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 本文提出CAGE框架,通过游戏理论实现多目标测试时对齐,无需重新训练,支持灵活的权衡和弱到强泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05000 2026-05-14 cs.LG cs.AI cs.CL 78%

Entropy Aware Reward Guidance for Diffusion Language Model Alignment

基于熵的奖励引导用于扩散语言模型对齐

Atula Tejaswi, Litu Rout, Constantine Caramanis, Sanjay Shakkottai, Sujay Sanghavi

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 偏好对齐 :alignment(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出EntRGi机制,解决离散扩散语言模型中无法通过自然输出区分的问题,通过动态插值连续token放松与采样硬token,提升奖励模型可靠性与优化精度。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11662 2026-05-13 cs.IR 78%

HSUGA: LLM-Enhanced Recommendation with Hierarchical Semantic Understanding and Group-Aware Alignment

HSUGA:基于层次语义理解与群体感知对齐的LLM增强推荐

Guorui Li, Dugang Liu, Lei Li, Xing Tang, Zhong Ming

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 HSUGA通过引入层次语义理解和群体感知对齐模块,解决LLM增强推荐中用户语义嵌入提取与利用的可靠性与适应性问题,提升推荐性能。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12811 2026-03-16 cs.CV 78%

OARS: Process-Aware Online Alignment for Generative Real-World Image Super-Resolution

OARS:面向生成真实世界图像超分辨率的在线对齐

Shijie Zhao, Xuanyu Zhang, Bin Chen, Weiqi Li, Qunliang Xing, Kexin Zhang, Yan Wang, Junlin Li, Li Zhang, Jian Zhang, Tianfan Xue

机构 * ByteDance Inc.(字节跳动公司) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 OARS通过过程感知的在线对齐框架,结合COMPASS奖励模型,在线优化图像超分辨率模型,实现感知与保真度的平衡,提升真实世界图像超分辨率性能。

Comments Super-Resolution, Reinforcement Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16201 2026-03-16 cs.CV 78%

Visual Alignment of Medical Vision-Language Models for Grounded Radiology Report Generation

医学视觉-语言模型的视觉对齐以实现基于基础的放射学报告生成

Sarosij Bose, Ravi K. Rajendran, Biplob Debnath, Konstantinos Karydis, Amit K. Roy-Chowdhury, Srimat Chakradhar

机构 * NEC Laboratories America(NEC美洲实验室) University of California, Riverside(加州大学河滨分校)

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 本文提出VALOR方法,通过临床指导文本推理和自监督视觉推理解决医学报告生成中的视觉幻觉问题,提升生成质量与临床准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19180 2026-02-24 cs.CV 78%

VLM-Guided Group Preference Alignment for Diffusion-based Human Mesh Recovery

基于扩散模型的人体网格恢复中的群体偏好对齐

Wenhao Shen, Hao Wang, Wanqi Yin, Fayao Liu, Xulei Yang, Chao Liang, Zhongang Cai, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) HKUST(GZ)(香港科技大学(广州)) SenseTime Research(商汤科技研究院) A*STAR(新加坡科技研究局)

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 本文提出了一种基于群体偏好的扩散模型微调框架,通过双内存增强的批评代理生成质量评分,提升人体网格恢复的物理合理性和图像一致性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17636 2026-02-20 cs.CV 78%

CORAL: Correspondence Alignment for Improved Virtual Try-On

CORAL: 用于改进虚拟试衣的对应对齐

Jiyoung Kim, Youngjin Shin, Siyoon Jin, Dahyun Chung, Jisu Nam, Tongmin Kim, Jongjae Park, Hyeonwoo Kang, Seungryong Kim

机构 * NC AI Co., Ltd(NC AI公司)

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 CORAL通过引入基于DiT的框架,显式对齐查询-键匹配与外部对应关系,从而提升虚拟试衣中的人-服装对应精度和细节保留能力。

Comments 32 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11753 2026-02-13 cs.HC 78%

Building Intelligent User Interfaces for Human-AI Alignment

构建智能用户界面以实现人机对齐

Danqing Shi

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 本文提出参考模型,通过分析用户界面改进人机对齐,展示两个案例研究和六个界面的初步调查,强调人机交互对对齐的促进作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10425 2026-02-12 cs.CV 78%

HII-DPO: Eliminate Hallucination via Accurate Hallucination-Inducing Counterfactual Images

HII-DPO: 通过准确的 hallucination-Inducing Counterfactual Images 消除幻觉

Yilin Yang, Zhenghui Guo, Yuke Wang, Omprakash Gnawali, Sheng Di, Chengming Zhang

机构 * University of Houston(休斯顿大学) Rice University(里士满大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 偏好对齐 :DPO(title);alignment(abstract)

AI总结 HII-DPO通过生成准确的幻觉诱导图像,有效缓解了VLMs在语言偏见下的幻觉问题,提升了模型的对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18457 2026-01-27 cs.IR 78%

Token-level Collaborative Alignment for LLM-based Generative Recommendation

基于令牌级的协同对齐用于基于大语言模型的生成推荐

Fake Lin, Binbin Hu, Zhi Zheng, Xi Zhu, Ziqi Liu, Zhiqiang Zhang, Jun Zhou, Tong Xu

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 TCA4Rec通过令牌级协同对齐框架,将协同过滤与大语言模型生成结合,提升推荐系统的准确性和可控性。

Comments 11 pages, 2 figures, 7 tables, WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22681 2026-01-01 cs.CV 78%

CritiFusion: Semantic Critique and Spectral Alignment for Faithful Text-to-Image Generation

CritiFusion: 语义批评与频谱对齐用于忠实的文本到图像生成

ZhenQi Chen, TsaiChing Ni, YuanFu Yang

机构 * National Yang Ming Chiao Tung University

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 CritiFusion通过语义批评和频谱对齐提升文本到图像生成的忠实度和细节质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10556 2025-10-20 cs.IR 78%

Self-Supervised Representation Learning with ID-Content Modality Alignment for Sequential Recommendation

Donglin Zhou, Weike Pan, Zhong Ming

专题命中 偏好对齐 :alignment(title,abstract)

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-025-50269-4}

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14096 2025-09-26 cs.CV 78%

VideoPASTA: 7K Preference Pairs That Matter for Video-LLM Alignment

Yogesh Kulkarni, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学)

专题命中 偏好对齐 :alignment(title,abstract)

Comments EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13541 2025-09-18 cs.CL cs.AI cs.LG 78%

Annotation-Efficient Language Model Alignment via Diverse and Representative Response Texts

Yuu Jinnai, Ukyo Honda

机构 * CyberAgent / Tokyo, Japan(CyberAgent)

专题命中 偏好对齐 :alignment(title);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP Findings, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20309 2025-09-08 cs.CV 78%

Instruction-Oriented Preference Alignment for Enhancing Multi-Modal Comprehension Capability of MLLMs

Zitian Wang, Yue Liao, Kang Rong, Fengyun Rao, Yibo Yang, Si Liu

机构 * Beihang University(北航大学) National University of Singapore(国立新加坡大学) King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)

专题命中 偏好对齐 :alignment(title,abstract)

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15388 2025-08-22 cs.IR 78%

TrackRec: Iterative Alternating Feedback with Chain-of-Thought via Preference Alignment for Recommendation

Yu Xia, Rui Zhong, Zeyu Song, Wei Yang, Junchen Wan, Qingpeng Cai, Chi Lu, Peng Jiang

专题命中 偏好对齐 :alignment(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10116 2025-08-15 cs.IR 78%

Bridging Modality Gaps in e-Commerce Products via Vision-Language Alignment

Yipeng Zhang, Hongju Yu, Aritra Mandal, Canran Xu, Qunzhi Zhou, Zhe Wu

专题命中 偏好对齐 :alignment(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09604 2025-06-17 cs.CL cs.AI cs.LG 78%

SelfCite: Self-Supervised Alignment for Context Attribution in Large Language Models

Yung-Sung Chuang, Benjamin Cohen-Wang, Shannon Zejiang Shen, Zhaofeng Wu, Hu Xu, Xi Victoria Lin, James Glass, Shang-Wen Li, Wen-tau Yih

机构 * Massachusetts Institute of Technology(麻省理工学院) Meta FAIR

专题命中 偏好对齐 :alignment(title);分类 cs.CL、cs.AI、cs.LG

Comments ICML 2025 main conference paper. The source code is available at https://github.com/facebookresearch/SelfCite

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20627 2025-05-28 cs.GT stat.ML 78%

Fundamental Limits of Game-Theoretic LLM Alignment: Smith Consistency and Preference Matching

Zhekun Shi, Kaizhao Liu, Qi Long, Weijie J. Su, Jiancong Xiao

专题命中 偏好对齐 :alignment(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18455 2025-03-25 cs.SE 78%

SEAlign: Alignment Training for Software Engineering Agent

Kechi Zhang, Huangzhao Zhang, Ge Li, Jinliang You, Jia Li, Yunfei Zhao, Zhi Jin

专题命中 偏好对齐 :alignment(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06769 2025-03-19 cs.SE 78%

Enhancing Trust in Language Model-Based Code Optimization through RLHF: A Research Design

Jingzhi Gong

专题命中 偏好对齐 :RLHF(title);trustworthy(abstract)

Comments Accepted by the Doctoral and Early Career Symposium (DECS) at ICSE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00591 2025-03-04 cs.CV 78%

AesthetiQ: Enhancing Graphic Layout Design via Aesthetic-Aware Preference Alignment of Multi-modal Large Language Models

Sohan Patnaik, Rishabh Jain, Balaji Krishnamurthy, Mausoom Sarkar

专题命中 偏好对齐 :alignment(title,abstract)

Comments Accepted for publication in CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01943 2025-02-12 cs.CV 78%

DAMA: Data- and Model-aware Alignment of Multi-modal LLMs

Jinda Lu, Junkang Wu, Jinghan Li, Xiaojun Jia, Shuo Wang, YiFan Zhang, Junfeng Fang, Xiang Wang, Xiangnan He

专题命中 偏好对齐 :alignment(title);DPO(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11280 2025-01-09 cs.CV 78%

ISR-DPO: Aligning Large Multimodal Models for Videos by Iterative Self-Retrospective DPO

Daechul Ahn, Yura Choi, San Kim, Youngjae Yu, Dongyeop Kang, Jonghyun Choi

专题命中 偏好对齐 :DPO(title,abstract)

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏