arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3243 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3243 篇

2607.26073 2026-07-30 cs.IR 新提交 50%

Guess Where You Go: Generative Next Point-of-Interest Recommendation in Amap

猜猜你要去哪里:高德地图中的生成式下一个兴趣点推荐

Penglong Zhai, Bowen Zheng, Jie Li, Yifang Yuan, Yue Liu, Sicong Wang, Mingyang Yin, Tingting Hu, Shuaijun Guo, Fanyi Di, Xin Li

专题命中 偏好对齐 :alignment(abstract)

AI总结 该研究提出Gwhere框架,结合SID生成与LLM生成式下一个POI推荐,经实验验证其在高德地图中可提升P-CTR和U-CTR,已部署应用且效果显著。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24353 2026-07-28 cs.CV 新提交 50%

PRISM: Prompt Refinement via Image-grounded Self-rewarding Mechanism for Text-to-Image Generation

PRISM:通过基于图像的自我奖励机制进行文本到图像生成的提示优化

Guo Tang, HongJie Luo, Tianxu Wang, Ying Zhang, Hao Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Sun Yat-sen University(中山大学) South China University of Technology(华南理工大学) Guangdong University of Technology(广东工业大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 针对文本到图像生成模型对提示制定敏感的问题,提出PRISM框架,通过基于图像的自我奖励机制,利用结构化视觉诊断和多任务监督微调等方法,提高图像质量和语义对齐,并提供可解释反馈。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08274 2026-07-28 cs.MA 版本更新 50%

Toward Human-Centered Multi-Agent Systems: Integrating Cognition, Culture, Values, and Cooperation in AI Agents

迈向以人为中心的多智能体系统:在AI智能体中整合认知、文化、价值观与合作

Safia Baloch, Rahemeen Khan

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文综述了从认知科学、文化对齐、价值学习到多智能体协调的研究,指出现有系统缺乏整合认知、文化、价值观和社会行为的统一框架,并提出了构建文化感知、价值对齐、认知基础与合作的多智能体系统的方向。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11886 2026-07-14 cs.CV 新提交 50%

Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation

读回:预训练的多模态语言模型是文本到图像生成的零样本奖励模型

Runhui Huang, Qihui Zhang, Zhe Liu, Yu Gao, Jie Wu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) ByteDance Seed(字节跳动Seed) Peking University(北京大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 研究提出SpectraReward将预训练多模态语言模型转为图像生成强化学习奖励模型,用图像条件提示对数似然作奖励,还引入Self-SpectraReward形成闭环框架。经广泛实验验证,二者能提升生成性能,表明奖励-策略对齐是关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09091 2026-07-13 cs.CV 新提交 50%

Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models

超越时间偏移:将全能语言模型(Omni-LLM)适配为生成式视听模型的无参考评估器

Yijie Qian, Juncheng Wang, Chao Xu, Huihan Wang, Yuxiang Feng, Yang Liu, Baigui Sun, Yong Liu, Shujun Wang

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学) IROOTECH TECHNOLOGY(易路泰克科技)

专题命中 偏好对齐 :alignment(abstract)

AI总结 研究针对视听生成模型跨模态同步评估难题,提出框架解决人类与自动化评估指标的矛盾。通过引入数据集、适配模型及提出优化方法,实现先进的人类偏好对齐,建立标准化基准推动评估从信号相关性到因果关系发展。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05971 2026-07-08 cs.MM cs.SD 新提交 50%

Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking

通过语义检索和时间重排实现多模态视频到音乐推荐

Seungheon Doh, Minhee Lee, Sangmoon Lee, Ben Sangbae Chon, Juhan Nam

机构 * Graduate School of Culture Technology, KAIST(韩国釜山科学技术大学文化科技研究生院) Gaudio Lab, Inc(Gaudio实验室)

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出用于视频到音乐推荐的两阶段框架VTMR,第一阶段通过全局嵌入检索语义兼容候选,第二阶段关注时间序列重排。实验显示该框架能提升推荐效果,人类偏好研究表明其在总体偏好上与商业基线相当,音乐质量优于生成基线。

Comments Accepted for publication at The Machine Learning for Audio workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01721 2026-07-03 cs.RO 新提交 50%

CoRe: Combined Rewards with Vision-Language Model Feedback for Preference-Aligned Reinforcement Learning

CoRe: 结合视觉语言模型反馈的复合奖励用于偏好对齐强化学习

Hexian Ni, Tao Lu, Yinghao Cai

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出CoRe框架,将奖励分解为基于任务知识的正式奖励和从观察中学习的残差奖励,利用视觉语言模型迭代优化奖励,实现无需人工的偏好对齐,在机器人操作任务中优于现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19100 2026-07-02 cs.CV 新提交 50%

AMALIA-VL: A Native European Portuguese Open-Source Vision and Language Model

AMALIA-VL: 一个原生欧洲葡萄牙语开源视觉与语言模型

Diogo Glória-Silva, João Cardeira, Manuel Letras da Luz, Afonso Simplício, Gonçalo Vinagre, Diogo Tavares, Rafael Ferreira, Inês Calvo, Inês Vieira, David Semedo, João Magalhães

机构 * NOVA School of Science and Technology(NOVA科学与技术学校) NOVA LINCS

专题命中 偏好对齐 :alignment(abstract)

AI总结 针对欧洲葡萄牙语缺乏开源多模态模型的问题,提出AMALIA-VL,通过三阶段训练和葡萄牙语中心数据混合,建立强基线并开源所有资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29805 2026-07-01 cs.CV 版本更新 50%

Clearer Sight, Fewer Lies: Oriented Pickup Preference Optimization for Multimodal Hallucination Mitigation

更清晰的视野,更少的谎言:面向多模态幻觉缓解的定向拾取偏好优化

Xin Zou, Haolin Deng, Yibo Yan, Shuliang Liu, Zhiwei Jin, Chen Chen, Haonan Lu, Xuming Hu

机构 * HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) OPPO AI Center(OPPO AI中心)

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出一种证据感知的对齐目标OPPO,通过对比不同视觉证据强度下的相同忠实响应,将视觉偏好转化为有序视觉证据对齐,以缓解多模态大模型的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29212 2026-06-30 cs.CV cs.HC 50%

MetaRanker: Human-in-the-loop Active Ranking for Metalens Image Quality

MetaRanker:用于超透镜图像质量的人机协同主动排序

Yujin Park, Haejun Chung, Ikbeom Jang

机构 * Hanyang University(翰阳大学) Hankuk University of Foreign Studies(韩国民法大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出MetaRanker框架,通过人机协同主动排序,以语义可解释性为指标评估超透镜图像质量,减少80%人工标注量,并实现与人类评估高度一致的排序。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02459 2026-06-30 cs.CV 50%

ReSpace: Text-Driven Autoregressive 3D Indoor Scene Synthesis and Editing

ReSpace:基于文本的自回归3D室内场景合成与编辑

Martin JJ. Bucher, Iro Armeni

机构 * Stanford University(斯坦福大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 ReSpace通过自回归方法实现文本驱动的3D室内场景合成与编辑,具备明确房间边界和资产无关部署能力,支持通过自然语言添加、移除和交换物体,实验在物体添加和完整场景合成质量上超越现有方法。

Comments 23 pages, 17 figures, 11 tables (incl. appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25661 2026-06-25 cs.CV 版本更新 50%

DRM: Diffusion-based Reward Model With Step-wise Guidance

DRM: 基于扩散的奖励模型与逐步引导

Jaxon Zhang, Binxin Yang, Hubery Yin, Chen Li, Jing Lyu

机构 * Peking University(北京大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出基于扩散的奖励模型(DRM),利用预训练扩散模型作为评估骨干,通过逐步评估能力改进强化学习对齐和推理采样,提升图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09054 2026-06-24 cs.SD cs.MM 版本更新 50%

HAFM: Hierarchical Autoregressive Foundation Model for Music Accompaniment Generation

HAFM:用于音乐伴奏生成的分层自回归基础模型

Jian Zhu, Jianwei Cui, Yunlong Xue, Shihao Chen, Yubang Zhang, Cheng Luo, Jun Sun

机构 * Zhejiang Lab(浙江实验室) University of Science and Technology of China(中国科学技术大学) Zhejiang International Studies University(浙江国际 Studies 大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出HAFM分层自回归基础模型,通过双速率分词和三阶段级联生成框架,在MUSDB18上FAD达1.71,主观偏好率51.5%,优于基线。

Comments This paper is submitted to the to National Conference on Man-Machine Speech Communication (NCMMSC, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21993 2026-06-23 cs.SE cs.CV 新提交 50%

From Driving Videos to Simulatable Scenarios

从驾驶视频到可模拟场景

Alexandre Levy, Ernest Valveny Llobet, Antonio Manuel López

机构 * Dept. Computer Science, Universitat Autònoma de Barcelona (UAB)(巴塞罗那自治大学计算机科学系) Computer Vision Center (CVC), UAB(UAB计算机视觉中心)

专题命中 偏好对齐 :safety(abstract)

AI总结 提出D-V2S框架,通过视觉语言模型和大语言模型从驾驶视频自动生成可模拟场景,实现90%语义元素保留和75%偏好率。

Comments 8 pages, 11 figures and Accepted for publication at the IEEE International Conference on Intelligent Transportation Systems (ITSC), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21596 2026-06-23 cs.CV 新提交 50%

$ϕ$-Scene: Physically Grounded Image-to-3D Scene Reconstruction

$\phi$-Scene: 物理驱动的图像到3D场景重建

Haodong Li, Lulu Shao, Haolin Lu, Yu Fu, Yen-Ru Chen, Seemandhar Jain, Manmohan Chandraker

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出$\phi$-Scene方法,将单图像3D场景重建视为拓扑驱动的物理组装过程,通过SDF优化和刚体仿真解决穿透与不稳定接触问题,在3D-Front数据集上取得最优性能。

Comments Project page: https://phi-scene.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01624 2026-06-23 cs.CV 版本更新 50%

PISCES: Annotation-free Text-to-Video Post-Training via Optimal Transport-Aligned Rewards

PISCES: 基于最优传输对齐奖励的无标注文本到视频后训练

Minh-Quan Le, Gaurav Mittal, Cheng Zhao, David Gu, Dimitris Samaras, Mei Chen

机构 * Microsoft(微软) Stony Brook University(石溪大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出PISCES算法,通过双重最优传输对齐奖励模块,无需人工标注即可提升文本生成视频的质量和语义对齐,在VBench上超越现有方法。

Comments Accepted to ICML 2026. Project page and code: https://roar-ai.github.io/pisces/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14252 2026-06-15 cs.RO 新提交 50%

Optimality-Preserving Decomposition for Scalable QAOA in Natural-Language-Guided Multi-Drone Assignment

面向自然语言引导的多无人机分配中可扩展QAOA的最优性保持分解

Junyeop Bang, Byongho Lee, Dohyun An, Hwangnam Kim

机构 * Korea University(高丽大学)

专题命中 偏好对齐 :DPO(abstract)

AI总结 提出端到端框架,集成微调大语言模型与量子-经典后端,通过约束保持图分割和动态规划合并,实现自然语言引导下多无人机任务分配的可扩展量子优化。

Comments 10 pages, 2 figures, 3 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26760 2026-06-15 cs.IR 版本更新 50%

Factorized Latent Reasoning for LLM-based Recommendation

基于分解潜在推理的LLM推荐方法

Tianqi Gao, Chengkai Huang, Zihan Wang, Cao Liu, Ke Zeng, Lina Yao

专题命中 偏好对齐 :alignment(abstract)

AI总结 针对现有潜在推理方法用单向量表示用户意图难以捕捉多面偏好的问题,提出分解潜在推理框架,通过多因子注意力模块解耦偏好因子,结合正则化与强化学习提升推荐性能与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06826 2026-06-08 cs.SE 新提交 50%

SkelDPO: A Skeleton-Guided Direct Preference Optimization Framework for Efficient Code Generation

SkelDPO: 一种骨架引导的直接偏好优化框架用于高效代码生成

Yu Yu, Chen Lyu

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出SkelDPO框架,通过骨架引导的偏好优化,在代码生成中同时优化语义正确性和执行效率,相比现有方法在Pass@1、Beyond@1和Effi@1上提升3-7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19995 2026-06-03 cs.CV 50%

CREward: A Type-Specific Creativity Reward Model

CREward:一种类型特定的创造力奖励模型

Jiyeon Han, Ali Mahdavi-Amiri, Hao Zhang, Haedong Jeong

机构 * Simon Fraser University(西蒙弗雷泽大学) Sogang University(首尔大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出首个类型特定的创造力奖励模型CREward,通过几何、材质和纹理三个轴评估创造力,并应用于创造力评估、可解释创造力及创意样本获取。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01036 2026-06-02 cs.RO 50%

Position: Good Embodied Reward Models Need Bad Behavior Data

立场:好的具身奖励模型需要不良行为数据

Ran Tian, Yilin Wu, Andrea Bajcsy

机构 * Ran Tian, Yilin Wu, Andrea Bajcsy

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文主张为获得可靠的具身奖励模型,社区必须投资于“不良”机器人数据(失败、次优、易错甚至危险行为),并通过实验证明即使少量真实不良数据也能改善与人类偏好的一致性。

Comments This position paper has been accepted by the ICML 2026 position track as a spotlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25719 2026-06-02 eess.AS 50%

Step-Audio-R1.5 Technical Report

Step-Audio-R1.5 技术报告

Yuxin Zhang, Xiangyu Tony Zhang, Daijiao Liu, Fei Tian, Yayue Deng, Jun Chen, Qingjian Lin, Haoyang Zhang, Yuxin Li, Jinglan Gong, Yechang Huang, Liang Zhao, Chengyuan Yao, Hexin Liu, Eng Siong Chng, Xuerui Yang, Gang Yu, Xiangyu Zhang, Daxin Jiang

专题命中 偏好对齐 :RLHF(abstract)

AI总结 本文提出 Step-Audio-R1.5,通过从强化学习验证奖励转向基于人类反馈的强化学习,解决了音频大语言模型在客观基准上表现优异但牺牲真实对话自然度的问题,实现了分析推理与沉浸式交互体验的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28175 2026-06-01 cs.IR 50%

Mixture-of-Experts Knowledge Graph Retrieval-Augmented Generation for Multi-Agent LLM-based Recommendation

基于混合专家知识图谱检索增强生成的多智能体LLM推荐系统

Shijie Wang, Chengyi Liu, Yujuan Ding, Shanru Lin, See-Kiong Ng, Xu Xin, Wenqi Fan

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出MixRAGRec框架,通过混合专家检索、知识偏好对齐和对比学习增强推荐,解决KG-RAG中检索粒度单一、结构信息丢失和端到端学习困难问题。

Comments Accepted by KDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21151 2026-05-29 cs.IR 50%

VOGUE: A Multimodal Dataset for Conversational Recommendation in Fashion

VOGUE:面向时尚领域对话式推荐的多模态数据集

David Guo, Minqi Sun, Yilun Jiang, Jiazhou Liang, Scott Sanner

专题命中 偏好对齐 :alignment(abstract)

AI总结 为弥补多模态对话推荐数据集的不足,构建了包含60个人类对话、2100个细粒度标注话语的VOGUE数据集,支持视觉和上下文推理评估,并揭示了多模态大语言模型在偏好推断上的系统性分布误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27103 2026-05-27 cs.IR 50%

MuChator: Enabling Active Music Discovery via Conversational Music LLMs in Douyin Music

MuChator: 通过对话式音乐大语言模型在抖音音乐中实现主动音乐发现

Jiahao Liang, Linzhi Huang, Xuannan Liu, Xukai Wang, Xuanpu Luo, Yongchun Zhu, Jingwu Chen, Feng Zhang, Xiao Yang

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出MuChator框架,通过音乐知识预训练、上下文感知指令微调和偏好对齐,使大语言模型能够理解用户用自然语言表达的情境化音乐意图,并在抖音音乐中实现主动音乐发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25486 2026-05-26 cs.IR 50%

RAG-Match: Retrieval-Augmented Knowledge Injection and Hierarchical Reasoning for Calibrated Semantic Relevance

RAG-Match:面向校准语义相关性的检索增强知识注入与分层推理

Hengjun Jiang, Liansheng Sun, Yan Jiang, Xiaojie Ke, Yongjin Wang, Xiangkun Liu, Cunxin Gu, Jian Xu, Guanjun Jiang

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出RAG-Match三阶段框架,通过知识增强预训练、分层推理对齐和偏好决策校准,提升搜索场景中细粒度语义相关性判断的准确性。

Comments 17 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15971 2026-05-26 cs.RO 50%

OHP-RL: Online Human Preference as Guidance in Reinforcement Learning for Robot Manipulation

OHP-RL:在线人类偏好作为机器人操作强化学习中的指导

Yunyang Mo, Jian Li, Qiwei Wu, Yihang Kang, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 偏好对齐 :safety(abstract)

AI总结 提出OHP-RL框架,利用人类干预作为偏好信息,通过状态依赖偏好门自适应调节策略学习,在Franka机器人接触丰富的操作任务中实现高成功率、快速收敛和低人类干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21967 2026-05-22 cs.IR 50%

Reinforced Preference Optimization for Reasoning-Augmented Recommendations

增强偏好优化用于推理增强的推荐

Jingtong Gao, Zeyu Song, Chi Lu, Xiaopeng Li, Derong Xu, Maolin Wang, Peng Jiang, Kun Gai, Qingpeng Cai, Xiangyu Zhao

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出RPORec框架,通过统一LLM的推理能力与专用推荐头,提升推荐系统的精确性,实验表明其在公开基准和大规模部署中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14936 2026-05-19 cs.CV 50%

Bridging the Intention-Expression Gap: Aligning Multi-Dimensional Preferences via Hierarchical Relevance Feedback in Text-to-Image Diffusion

弥合意图-表达鸿沟:通过层次相关反馈对齐多维偏好

Wenxi Wang, Hongbin Liu, Mingqian Li, Junyan Yuan, Junqi Zhang

机构 * Tongji University(同济大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出一种层次相关反馈驱动框架,通过在文本到图像扩散模型中对齐多维特征,解决用户意图与表达之间的鸿沟问题,提升模型对多维偏好的识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07458 2026-05-14 cs.CV 50%

SpatialReward: Bridging the Perception Gap in Online RL for Image Editing via Explicit Spatial Reasoning

SpatialReward: 通过显式空间推理弥合在线强化学习中图像编辑的感知差距

Yancheng Long, Yankai Yang, Hongyang Wei, Wei Chen, Tianke Zhang, Haonan fan, Changyi Liu, Kaiyu Jiang, Jiankang Chen, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院,清华大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出SpatialReward,通过显式空间推理提升在线强化学习中图像编辑的感知准确性,其在MMRB2和EditReward-Bench上表现优异,并在MultiEditReward-Bench上超越专用评估器。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏