How Psychological Learning Paradigms Shaped and Constrained Artificial Intelligence
心理学习范式如何塑造和制约人工智能
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.CY
AI总结 本文探讨人工智能系统在系统性组合推理中的不足,指出其根源在于心理学习理论对AI架构的限制,并提出ReSynth框架以实现结构化系统性行为。
Comments preprint journal
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
心理学习范式如何塑造和制约人工智能
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.CY
AI总结 本文探讨人工智能系统在系统性组合推理中的不足,指出其根源在于心理学习理论对AI架构的限制,并提出ReSynth框架以实现结构化系统性行为。
Comments preprint journal
通过优化分词器推动波兰语言建模:Bielik v3 7B和11B系列
机构 * SpeakLeash ; ACK Cyfronet AGH(AGH科技大学计算机中心) ; Jagiellonian University(雅盖隆大学) ; Azurro ; Enelpol
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文探讨了Bielik v3系列模型中通过优化分词器提升波兰语言建模性能的方法,包括专有词汇表、嵌入初始化、多阶段预训练和后训练对齐技术。
Comments arXiv admin note: text overlap with arXiv:2601.11579
小语言模型中的共享情感几何:跨架构研究中的表示、行为和方法学混淆
机构 * Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院) ; ModuLabs(ModuLabs实验室)
专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了十二种小语言模型在统一理解模式下的21种情绪向量几何,发现五种成熟架构在情绪几何上几乎相同,而Gemma-3 1B base则表现出极端残差流各向异性。
Comments 34 pages, 6 figures, 1 table in main text + appendix. Ongoing series on Model Medicine
分解Delta:模型实际上从偏好对中学习了什么?
机构 * Capital One(第一资本)
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨偏好对中生成器级和样本级Delta对推理性能的影响,发现提高生成器级Delta能提升跨领域推理性能,利用样本级Delta可提高训练效率。
片段作为手臂:多臂老虎机引导的长上下文LLM偏好优化采样
机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) ; Microsoft Research Asia, China(微软亚洲研究院) ; Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学计算机科学与技术系及人工智能研究院)
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI
AI总结 本文提出LongMab框架,利用多臂老虎机策略从长上下文中选择最有信息量的片段,生成高质量多样化的响应,用于直接偏好优化训练,提升长上下文推理能力。
Comments 17 pages
JoyAI-LLM Flash: 通过令牌效率推进中等规模语言模型
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI
AI总结 本文提出JoyAI-LLM Flash,一种高效的混合专家语言模型,通过平衡性能与令牌效率,在50B参数以下的范围内重新定义性能与效率的权衡。
Comments Xiaodong He is the corresponding author
独立代理大语言模型中的框架效应:跨家族行为分析
机构 * Northeastern University(东北大学) ; Beijing Institute of Technology(北京理工大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨了在非交互多代理部署中,提示框架如何影响独立代理在阈值投票任务中的决策,发现框架效应显著影响选择分布,倾向于风险规避选项,揭示了非交互多代理部署中的重要偏差源。
超越语义操控:奖励模型中的标记空间攻击
机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) ; Independent Researcher(独立研究员) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Token Mapping Perturbation Attack(TOMPA)框架,通过在标记空间中进行对抗优化,发现非语言标记模式以提升奖励模型性能,揭示了当前RLHF流程的关键漏洞。
灰度偏好学习:可解释且偏见意识的奖励建模用于人类偏好
机构 * Department of Economic Informatics and Cybernetics, Bucharest University of Economic Studies(布加勒斯特经济研究大学经济信息学与控制论系)
专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了语言模型中人类偏好的学习难题,提出特征增强框架以捕捉人类判断的多维特性,通过评估多种大语言模型,展示了改进的奖励建模方法在准确性和可解释性上的提升。
双最优:使你的大语言模型具有尊严的同行
机构 * University of Notre Dame(圣母大学)
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Dignified Peer框架,通过反阿谀和可信性对抗逃避服务模式,利用PersonaKnob数据集和容忍约束Lagrangian DPO算法,构建具有尊严和同行能力的语言模型代理。
MobileIPL: 通过迭代偏好学习增强移动代理的思维过程
机构 * Xiaomi Inc.(小米公司) ; Nanyang Technological University(南洋理工大学) ; Gaoling School of Artificial Intelligence, Renmin University of China(人民大学人工智能学院)
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI
AI总结 本文提出MobileIPL,通过迭代偏好学习构建CoaT树,结合规则奖励和反馈反向传播,提升移动代理在GUI任务中的推理能力与泛化能力。
Comments 9 pages, 8 figures, 7 tables
快速-缓慢思考RM:标量与生成奖励模型的有效整合
机构 * Fudan University(复旦大学) ; Meituan(美团)
专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.LG
AI总结 本文提出F/S-RM,结合快速和缓慢思考机制,提升奖励模型性能并降低计算成本。
在对数空间中进行锐度感知最小化以高效提升直接偏好优化
机构 * Monash University(墨尔本大学) ; Swinburne University of Technology(斯威本科技大学)
专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG
AI总结 本文提出logits-SAM方法,通过在对数空间中建模坐标动态,缓解直接偏好优化中的挤压效应,提升模型性能。
Comments Accepted at ICLR 2026
大规模高效探索
机构 * Google(谷歌) ; DeepMind(深度思维)
专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种在线学习算法,通过增量更新奖励和语言模型提升强化学习从人类反馈中的数据效率,采用小幅度正向激励、信念神经网络和信息导向探索等机制,实验表明在少于20k标签下达到200k标签的性能,预计1M标签可匹配1B标签的性能。
CHARM:通过聊天机器人竞技场分数校准奖励模型
机构 * Alibaba Group(阿里巴巴集团) ; Queen’s University Belfast(贝尔法斯特女王大学) ; University of Zurich(苏黎世大学) ; Singapore University of Technology(新加坡科技设计大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出CHARM方法,通过利用Chatbot Arena的Elo分数校准奖励模型,减少模型偏好偏差,提升奖励模型的准确性和公平性。
基于交换引导的偏好学习用于从人类反馈中获得个性化强化学习
机构 * Yonsei University(延世大学) ; Korea Institute of Science and Technology(韩国科学技术院)
专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Swap-guided Preference Learning (SPL)来解决变分偏好学习中后验崩溃的问题,通过引入交换引导基础正则化、偏好逆自回归流和自适应潜在条件化来提升个性化强化学习效果。
Comments ICLR 2026
对齐大型语言模型代理的理性与道德偏好:一种监督微调方法
机构 * Zicklin School of Business, CUNY Baruch College(纽约大学法学院) ; Amazon(亚马逊) ; Toulouse School of Economics(图卢兹经济学院)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文通过监督微调方法对齐LLM代理的理性与道德偏好,揭示了代理在经济游戏中的系统性偏差,并展示了不同偏好结构对均衡结果的影响。
应对长度膨胀而不产生权衡:用于强化学习的群体相对奖励重缩放
专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.LG
AI总结 GR$^3$通过乘法重缩放范式解决强化学习中的长度膨胀问题,实现通用、连续且奖励依赖的门控机制,有效减少冗余推理并提升训练性能。
对幻觉的对齐:人类和AI反馈中的选择盲区
专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI
AI总结 研究揭示RLHF中偏好构建的问题,显示人类和AI反馈中的选择盲区受上下文影响,导致奖励信号失真。
Comments 16 pages, 6 figures, 2 tables
代理AI的适应:训练后、记忆和技能的综述
机构 * UIUC(伊利诺伊大学香槟分校) ; Stanford(斯坦福大学) ; Princeton(普林斯顿大学) ; Harvard(哈佛大学) ; UC Berkeley(加州大学伯克利分校) ; Caltech(加州理工学院) ; UCSD(加州大学圣地亚哥分校) ; Georgia Tech(佐治亚理工学院) ; Northwestern(西北大学) ; TAMU(德克萨斯大学奥斯汀分校) ; MGH(麻省总医院) ; Keiji AI ; Unity
专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本文综述了代理AI在训练后、记忆和技能方面的适应方法,提出四范式框架,分析了代理与工具适应的技术细节及权衡,探讨了开放问题。
CoME:赋能移动专家的 informative hybrid-capabilities 推理
机构 * ruc(中国人民大学人工智能学院) ; xiaomi(小米公司) ; ntu(南洋理工大学) ; whu(武汉大学)
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI
AI总结 CoME 通过四种专家架构和渐进训练策略,实现移动代理混合能力推理的解耦增强与平衡优化。
PrefDisco:主动个性化推理的基准测试
机构 * University of Washington(华盛顿大学) ; Allen Institute for AI(人工智能联盟)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 PrefDisco提出了一种评估方法,通过心理基础的人设将静态基准转化为互动个性化任务,定义PrefAlign作为细粒度的偏好对齐度量,揭示个性化推理需要专门开发而非自然产生。
Comments 65 pages, 6 figures
解析人类对大语言模型的偏好:基于HUMAINE框架的民主意识评估
专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.AI
AI总结 HUMAINE框架通过多维、人口统计学意识的评估方法,揭示了人类对大语言模型的偏好差异,发现年龄是主要分歧轴,且不同评估维度的判别能力差异显著。
Comments Published as a conference paper at ICLR 2026. 21 pages, 11 figures. https://openreview.net/forum?id=kVaE2kYjtV
用于推理时的可控且可解释的人格滑块
机构 * Technical University of Munich, Germany(慕尼黑技术大学) ; University of Cambridge, United Kingdom(剑桥大学) ; University College Dublin, Ireland(都柏林大学)
专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种模块化框架,通过顺序自适应引导方法实现LLM推理时的可控且可解释的人格控制,通过正交化引导向量提升多维人格调节的精度和效率。
Comments 20 pages, 18 figures
超越二元偏好:基于顺序反馈的奖励建模原理框架
机构 * Stanford University(斯坦福大学) ; Amazon AGI(亚马逊人工智能研究) ; EPFL(瑞士联邦理工学院) ; Qualcomm AI Research(高通人工智能研究) ; Aktus AI
专题命中 偏好对齐 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于顺序反馈的奖励建模原理框架,通过离散顺序回归方法,学习阈值参数以捕捉偏好顺序结构,实现更有效的细粒度人类反馈利用。
EstLLM:通过持续预训练和后训练增强多语言大语言模型中的爱沙尼亚能力
机构 * Institute of Computer Science, University of Tartu(塔尔图大学计算机科学研究院) ; Department of Software Science, Tallinn University of Technology(塔林技术大学软件科学系) ; Institute of the Estonian Language, Tallinn, Estonia(爱沙尼亚语言研究院) ; School of Humanities, Tallinn University(塔林大学人文学院)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 EstLLM通过持续预训练和后训练提升多语言大语言模型中爱沙尼亚的能力,增强语言和推理表现。
代理与架构限制:为何基于优化的系统无法回应规范
专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.CY
AI总结 本文指出基于优化的系统无法回应规范,提出真正的代理性需要不可比较的边界和否定性回应机制,揭示了优化与规范治理的不兼容性及由此引发的收敛危机。
Comments About 10,600 words in all (includes ~1000 words of literature and ~2400 words of Appendices). Under journal review
解决粒度不匹配问题:用于长周期LLM代理的层次化偏好学习
机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(人工智能与数字经济广东实验室) ; Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) ; Baidu Inc.(百度公司)
专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG
AI总结 本文提出层次化偏好学习方法,通过双层课程引导解决LLM代理长周期任务中的粒度不匹配问题,提升多粒度偏好优化能力。
Comments Accepted to ICLR 2026
当数据成为算法:对偏好优化数据集的系统研究与整理
机构 * Technical University Munich(慕尼黑技术大学) ; IBM Research(IBM研究院)
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI
AI总结 本文系统研究并整理了多个开源DPO数据集,提出UltraMix混合数据集,通过Magpie框架进行精细标注,揭示偏好质量差异,并在关键基准上超越最佳单个数据集性能。
Journal ref The Fourteenth International Conference on Learning Representations (ICLR) 2026
EditReward:一种用于指令引导图像编辑的人类对齐奖励模型
机构 * University of Waterloo(滑铁卢大学) ; McGill University(麦吉尔大学) ; Independent(独立研究者)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 EditReward是一种基于人类偏好的奖励模型,通过大规模标注数据提升图像编辑任务的质量与性能,展示了在指令引导图像编辑中的卓越对齐能力。
Comments Accepted by ICLR 2026. Project Page: https://tiger-ai-lab.github.io/EditReward