arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3235 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3235 篇

2602.06337 2026-08-06 cs.CL cs.AI cs.LG 版本更新 75%

Can Post-Training Transform LLMs into Causal Reasoners?

训练后能否将大语言模型转变为因果推理者?

Junqi Chen, Sirui Chen, Chaochao Lu

机构 * Shanghai Artificial Intelligence Library(上海人工智能图书馆) Fudan University(复旦大学) Tongji University(同济大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过CauGym数据集评估了训练后方法对LLM因果推理能力的提升,发现适当训练可使小型模型在因果推理任务中超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00419 2026-08-04 cs.LG cs.AI cs.CL cs.IR 新提交 75%

Unleashing the Potential of Large Language Models: A Blueprint for Real-Time, Enterprise-Ready Deployments

释放大语言模型的潜力:面向实时、企业级部署的蓝图

Muhammad Faizan Raza, Shuo, Yang, Satish Mahadevan Srinivasan, Joanna F. DeFranco

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对实时受监管场景中大语言模型的问题,提出基于模式的LLMOps架构,整合多模块并实现四项模式化贡献,优化权衡同时支持高风险领域的可审计与回滚部署。

Comments 6 pages, 1 figure. Authors' accepted version of an article published in IEEE Computer. The version of record is available at the DOI below

Journal ref Computer, vol. 59, no. 4, pp. 195-199, April 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25091 2026-07-29 cs.AI cs.CL cs.LG math.OC stat.CO 新提交 75%

Towards Robust Reinforcement Learning for Small-Scale Language Model Agents

迈向用于小规模语言模型智能体的稳健强化学习

Md Rezwanul Haque, Md. Milon Islam, Fakhri Karray

机构 * University of Waterloo(滑铁卢大学) Khulna University of Engineering & Technology(库尔纳工程技术大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究小规模语言模型强化学习不稳定问题,识别出三种失败模式,提出容量余量假设,采用合并并重新初始化适配器技术等方法,所提系统稳定收敛,提升偏好胜率,优于指令调整基线且减少训练数据。

Comments Proceedings of the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC), Bellevue, WA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06393 2026-07-21 cs.AI cs.CL cs.LG cs.LO 75%

Conflict-Aware Fusion: Mitigating Logic Inertia in Large Language Models via Structured Cognitive Priors

冲突感知融合:通过结构化认知先验缓解大语言模型中的逻辑惯性

Qiming Bao, Xiaoxuan Fu, Michael Witbrock

机构 * Xtracta & Strong AI Lab, University of Auckland(Xtracta与强人工智能实验室,奥克兰大学) School of Humanities, China University of Political Science and Law(人文学院,中国政法大学) Strong AI Lab, University of Auckland(强人工智能实验室,奥克兰大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大语言模型在规则系统结构扰动下表现脆弱的问题,提出冲突感知融合训练流程,通过验证-演绎结构先验和符号推理奖励,在多个压力测试中实现鲁棒性饱和。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11948 2026-07-15 cs.AI cs.CL cs.LG cs.MA 新提交 75%

Ontology-Amplified Distillation and Contextuality Auditing for Sovereign Enterprise Language Models: A Combined Proof-of-Mechanism and Negative-Results Method Study

主权企业语言模型的本体增强蒸馏与上下文审查:机制验证与负面结果的组合方法研究

Thanh Luong Tuan

机构 * AgenticOS(智能操作系统)

专题命中 偏好对齐 :DPO(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对受数据驻留规则约束的金融机构需求,结合本体增强蒸馏机制验证与上下文审查方法,对Qwen3.6 - 27B学生模型进行训练及测试,结果不支持模型在多方面的优势,为企业语言模型应用提供参考。

Comments 15 pages, 2 figures. Combined proof-of-mechanism and negative-results method article consolidating ontology-amplified distillation with contextuality-audit routing for enterprise agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18037 2026-07-07 cs.LG cs.AI cs.CL 版本更新 75%

Gradient Regularization Mitigates Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards

梯度正则化减轻基于人类反馈和可验证奖励的强化学习中的奖励作弊

Johannes Ackermann, Michael Noukhovitch, Takashi Ishida, Masashi Sugiyama

机构 * The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP) Mila(蒙特利尔大学Mila)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究基于人类反馈或可验证奖励的强化学习中奖励作弊问题,提出用梯度正则化使训练偏向奖励更准确区域,理论推导并实证验证,还改进方法,结果显示其比KL惩罚表现更好。

Comments Accepted at ICML 2026, 25 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00539 2026-06-30 cs.LG cs.AI cs.CL 75%

Distributionally Robust Reinforcement Learning with Human Feedback

具有人类反馈的分布鲁棒强化学习

Debmalya Mandal, Paulius Sasnauskas, Goran Radanovic

专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种分布鲁棒的强化学习方法,通过改进奖励基强化学习和直接偏好优化,提升模型在分布变化时的鲁棒性,实验显示在非分布任务中性能显著提升。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26269 2026-06-05 cs.CL cs.AI cs.LG 75%

Calibrated Surprise: An Information-Theoretic Account of Creative Quality

校准的惊喜:一种信息论视角下的创造性质量

Bo Zou, Chao Xu

机构 * Bo Zou(邹波) Chao Xu(徐超)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种信息论框架,用于评估创造性写作的质量,通过校准的惊喜概念,结合香农互信息理论,量化了高质量文本与降质文本之间的差异。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04284 2026-06-04 cs.LG cs.AI cs.CL 75%

Sparse Mixture-of-Experts Reward Models Learn Interpretable and Specialized Experts for Personalized Preference Modeling

稀疏混合专家奖励模型学习可解释且专业化的专家用于个性化偏好建模

Yifan Wang, Jinyi Mu, Mayank Jobanputra, Yu Wang, Ji-Ung Lee, Soyoung Oh, Isabel Valera, Vera Demberg

机构 * Saarland University(萨尔兰大学) Independent Researcher(独立研究者) Bielefeld University(比勒菲尔德大学) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出稀疏混合专家奖励模型,通过稀疏路由和专家多样性训练,从二元偏好数据中学习可解释的专家模式,提升个性化偏好建模的测试时适应性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01811 2026-06-02 cs.CL cs.AI cs.LG 75%

"I've Seen How This Goes": Characterizing Diversity via Progressive Conditional Surprise

“我知道这会如何发展”:通过渐进条件惊奇度刻画多样性

Matthew Khoriaty, David Williams-King, Shi Feng

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) Stanford University(斯坦福大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种基于上下文学习的多样性度量方法 Decan(D_{Ca_n}),通过单次前向传递计算每个字节的得分,无需嵌入模型、参考语料或人工标注,在多个基准上验证了其有效性。

Comments 28 pages, 18 figures, 9 tables. Accepted to the Workshop on Generative AI, Creativity, and Human-AI Co-Creation @ ICML 2026 (non-archival). Code and data: https://github.com/AMindToThink/icl-diversity

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01009 2026-06-02 cs.CV cs.MM 75%

POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency

POVQA: 基于偏好的视频问答与数据效率的推理

Ashim Dahal, Ankit Ghimire, Saydul Akbar Murad, Nick Rahimi

机构 * University of Southern Mississippi(密西根州立大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract)

AI总结 提出POVQA方法,通过时间池化压缩视频帧、监督微调加偏好优化,在长视频问答中实现数据高效推理。

Comments Accepted in MAR at CVPR Workshop (Proceedings Track)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 11533-11542

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09692 2026-06-02 cs.LG cs.AI cs.CL 75%

ActiveUltraFeedback: Efficient Preference Data Generation using Active Learning

ActiveUltraFeedback:使用主动学习的高效偏好数据生成

Davit Melikidze, Marian Schneider, Jessica Lam, Martin Wertich, Ido Hakimi, Barna Pásztor, Andreas Krause

机构 * University of Freiburg(弗赖堡大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ActiveUltraFeedback主动学习流水线,通过不确定性估计和两种新采样方法(DRTS和DeltaUCB)动态选择最具信息量的响应对,以最少六分之一的标注数据实现与静态基线相当或更优的下游性能。

Comments 40 pages, 9 figures, 26 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30273 2026-05-29 cs.HC cs.AI cs.CL cs.CY cs.SI 75%

LLUMI: Improving LLM Writing Assistance for Mental Health Support with Online Community Feedback

LLUMI: 利用在线社区反馈改进心理健康支持中的LLM写作辅助

Jiwon Kim, Maya Ajit, Sherry Gong, Soorya Ram Shimgekar, Dong Whi Yoo, Eshwar Chandrasekharan, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)

专题命中 偏好对齐 :DPO(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 提出LLUMI框架,通过在线社区反馈(如Reddit投票)构建偏好对,结合监督微调和直接偏好优化训练开源小模型,在隐私保护下实现与GPT相当的心理健康支持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25549 2026-05-26 cs.CL cs.AI cs.LG 75%

BC Protocol: Structured Dual-Expert Dialogue for Eliciting High-Quality Chain-of-Thought Post-Training Data

BC协议:结构化双专家对话用于生成高质量思维链后训练数据

Bo Zou, Chao Xu

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大语言模型后训练中高质量专家思维链数据生产瓶颈,提出BC协议——一种结构化双专家引出方法,通过配对领域专家与知识工程师,系统外化专家隐性判断为自然语言推理链,实验证明其在推理过程自然性上具有压倒性优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18808 2026-05-20 cs.LG cs.AI cs.CL 75%

Compositional Literary Primitives in Instruction-Tuned LLMs: Cross-Architectural SAE Features for Self, Style, and Affect

在指令微调的LLM中构建组合文学原语:跨架构SAE特征用于自我、风格和情感

Joao Paulo Cavalcante Presa, Savio Salvarino Teles de Oliveira

机构 * Federal University of Goias(戈亚斯联邦大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过稀疏自编码器研究了指令微调的LLM中组合文学原语的架构,发现四种特征类别,并通过跨架构SAE特征验证了自我、风格和情感的表达能力。

Comments 36 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06049 2026-05-08 cs.CV 75%

Fusion in Your Way: Aligning Image Fusion with Heterogeneous Demands via Direct Preference Optimization

融合你的方式:通过直接偏好优化对齐图像融合与异质需求

Weijian Su, Songqian Zhang, Yuqi Han, Jian Zhuang, Yongdong Huang, Qiang Zhang

机构 * School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) Key Laboratory of Social Computing and Cognitive Intelligence (Dalian University of Technology), Ministry of Education(社会计算与认知智能重点实验室(大连理工大学),教育部) Institute of Image Processing and Understanding, North Minzu University(北华大学图像处理与理解研究所)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract)

AI总结 本文提出DPOFusion框架,通过整合PALDM和PCLDM实现任务引导和偏好适应的图像融合,解决人类和机器视觉的异质需求问题,提升融合质量和任务导向的迁移能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20531 2026-05-08 cs.DC cs.AI cs.CL cs.LG 75%

Epistemic Observability in Language Models

语言模型中的认知可观察性

Tony Mason, Vaastav Anand

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现语言模型在制造内容时自信度最高,证明这是观察问题而非能力问题,提出通过计算副产品提升检测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21718 2026-04-28 cs.CV cs.AI cs.CL cs.LG cs.MM 75%

Building a Precise Video Language with Human-AI Oversight

构建具有人机监督的精确视频语言

Zhiqiu Lin, Chancharik Mitra, Siyuan Cen, Isaac Li, Yuhan Huang, Yu Tong Tiffany Ling, Hewei Wang, Irene Pi, Shihang Zhu, Ryan Rao, George Liu, Jiaxi Li, Ruojin Li, Yili Han, Yilun Du, Deva Ramanan

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CHAI框架,通过专家与AI协作提升视频描述精度,改进开源模型并实现专业级视频生成。

Comments CVPR 2026 Highlight. Project page: https://linzhiqiu.github.io/papers/chai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23113 2026-04-28 cs.SI 75%

Reducing Detail Hallucinations in Long-Context Regulatory Understanding via Targeted Preference Optimization

通过定向偏好优化减少长上下文监管理解中的细节幻觉

Yang Liu, Bin Chong, Yuhan Lin, Chongyang Zhang, Hao Zheng, Ziyi Zhang, Jiayu Liang, Ran Ran, Qian Li, Kefu Xu

专题命中 偏好对齐 :DPO(abstract,abstract_cn);safety(abstract)

AI总结 本文提出DetailDPO框架,通过定向偏好优化减少长上下文监管文档中的细节幻觉,实验显示在不同模型和上下文长度下,DetailDPO有效降低细节错误率,跨领域迁移表现良好。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12817 2026-04-23 cs.CL cs.AI cs.CY 75%

From Noise to Signal to Selbstzweck: Reframing Human Label Variation in the Era of Post-training in NLP

从噪声到信号到自我目的:在NLP后训练时代的重新框架化人类标签变异

Shanshan Xu, Santosh T. Y. S. S, Barbara Plank

机构 * Department of Computer Science, University of Copenhagen, Denmark(丹麦哥本哈根大学计算机科学系) Faculty of Law, University of Copenhagen, Denmark(丹麦哥本哈根大学法学院) Amazon(亚马逊) LMU Munich & Munich Center for Machine Learning (MCML)(慕尼黑大学及慕尼黑机器学习中心(MCML))

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文探讨人类标签变异在NLP后训练时代的重要性,提出将其作为内在价值自我目的进行保护,以提升模型鲁棒性和社会技术安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16027 2026-04-20 cs.CL cs.AI cs.LG 75%

Where does output diversity collapse in post-training?

在微调后输出多样性为何会崩溃?

Constantinos Karouzos, Xingwei Tan, Nikolaos Aletras

机构 * School of Computer Science University of Sheffield(计算机科学学院 伦敦大学谢菲尔德分校)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了微调后输出多样性的崩溃原因,发现数据组成和训练方法共同影响多样性,揭示多样性崩溃发生在训练阶段而非推理阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04497 2026-04-07 cs.LG cs.AI cs.CL 75%

One Model for All: Multi-Objective Controllable Language Models

一个模型解决所有问题:多目标可控语言模型

Qiang He, Yucheng Yang, Tianyi Zhou, Meng Fang, Mykola Pechenizkiy, Setareh Maghsudi

机构 * Ruhr University Bochum(波鸿鲁尔大学) Eindhoven University of Technology(埃因霍温理工大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Liverpool(利物浦大学)

专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出多目标控制(MOC),通过引入多目标优化原理训练单个语言模型,使其能根据用户偏好在帕累托前沿生成个性化输出,提升模型可控性、输出质量和泛化能力。

Comments Published in Transactions on Machine Learning Research (03/2026): https://openreview.net/forum?id=qAM5PmvFYY

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13607 2026-03-30 cs.CL cs.AI cs.LG 75%

Nemotron-Cascade: Scaling Cascaded Reinforcement Learning for General-Purpose Reasoning Models

Nemotron-Cascade:基于级联强化学习的通用推理模型规模化

Boxin Wang, Chankyu Lee, Nayeon Lee, Sheng-Chieh Lin, Wenliang Dai, Yang Chen, Yangyi Chen, Zhuolin Yang, Zihan Liu, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

机构 * NVIDIA(英伟达)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出级联域强化学习(Cascade RL)方法,开发出Nemotron-Cascade模型,可在指令和深度思考模式间切换,性能不逊于纯思考模型,同时提升推理能力并保持跨领域基准性能。

Comments We publicly release the Nemotron-Cascade models and the full collection of training data at: https://huggingface.co/collections/nvidia/nemotron-cascade

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22944 2026-03-25 cs.HC 75%

From Morality Installation in LLMs to LLMs in Morality-as-a-System

从LLM中的道德安装到道德作为系统中的LLM

Gunter Bombaerts

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);safety(abstract)

AI总结 本文提出道德作为系统框架,重新定义道德行为的动态性与系统耦合问题,探讨道德属性在生命周期中的监测与跨组件一致性。

Comments 22pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03622 2026-02-04 cs.CL cs.AI cs.LG 75%

Align to Structure: Aligning Large Language Models with Structural Information

对齐结构:将大型语言模型与结构信息对齐

Zae Myung Kim, Anand Ramachandran, Farideh Tavazoee, Joo-Kyung Kim, Oleg Rokhlenko, Dongyeop Kang

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过整合语言学话语框架到强化学习中,结构对齐方法提升LLMs在长文本生成和摘要任务中的连贯性和结构组织能力。

Comments Accepted to AAAI 2026 AIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04675 2026-01-16 cs.AI cs.CL cs.LG 75%

Scalable Oversight for Superhuman AI via Recursive Self-Critiquing

通过递归自我批评实现超人类AI的可扩展监督

Xueru Wen, Jie Lou, Xinyu Lu, Junjie Yang, Yanjiang Liu, Yaojie Lu, Debing Zhang, Xing Yu

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过递归自我批评实现超人类AI的可扩展监督,探索批评的批评比直接批评更容易,并验证递归批评在AI监督中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05882 2026-01-12 cs.CL cs.AI cs.LG 75%

An Empirical Study on Preference Tuning Generalization and Diversity Under Domain Shift

关于领域转移下偏好微调泛化性和多样性的实证研究

Constantinos Karouzos, Xingwei Tan, Nikolaos Aletras

机构 * School of Computer Science University of Sheffield, UK(计算机科学学院 谢菲尔德大学)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过比较不同对齐目标和适应策略,探讨领域转移下偏好微调的泛化性和多样性,发现伪标签法能有效缓解领域转移带来的性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15745 2025-12-25 cs.LG cs.AI cs.CL 75%

LLaDA2.0: Scaling Up Diffusion Language Models to 100B

LLaDA2.0:将扩散语言模型扩展到100B参数

Tiwei Bie, Maosong Cao, Kun Chen, Lun Du, Mingliang Gong, Zhuochen Gong, Yanmei Gu, Jiaqi Hu, Zenan Huang, Zhenzhong Lan, Chengxi Li, Chongxuan Li, Jianguo Li, Zehuan Li, Huabin Liu, Lin Liu, Guoshan Lu, Xiaocheng Lu, Yuxin Ma, Jianfeng Tan, Lanning Wei, Ji-Rong Wen, Yipeng Xing, Xiaolu Zhang, Junbo Zhao, Da Zheng, Jun Zhou, Junlin Zhou, Zhanchao Zhou, Liwang Zhu, Yihong Zhuang

机构 * Ant Group(蚂蚁集团) Renmin University of China(中国人民大学) Zhejiang University(浙江大学) Westlake University(西湖大学) HongKong University of Science and Technology(香港科学与技术大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LLaDA2.0通过三阶段块级训练方案将扩散语言模型扩展至100B参数,实现高效前沿规模部署。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15432 2025-12-12 cs.AI cs.CL cs.LG 75%

SyGra: A Unified Graph-Based Framework for Scalable Generation, Quality Tagging, and Management of Synthetic Data

SyGra:一种统一的基于图的框架,用于可扩展的生成、质量标记和管理合成数据

Bidyapati Pradhan, Surajit Dasgupta, Amit Kumar Saha, Omkar Anustoop, Sriram Puttagunta, Vipul Mittal, Gopal Sarda

机构 * ServiceNow Inc.(ServiceNow公司)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SyGra提出一种统一的基于图的框架,用于可扩展生成、质量标记和管理合成数据,通过模块化管道和双阶段质量标记机制提升合成对话数据的质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13022 2025-12-01 cs.CL cs.AI cs.LG 75%

On the Role of Preference Variance in Preference Optimization

关于偏好方差在偏好优化中的作用

Jiacheng Guo, Zihao Li, Jiahao Qiu, Yue Wu, Mengdi Wang

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系) Princeton University(普林斯顿大学) AI Lab(人工智能实验室)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了偏好方差在偏好优化中的作用,发现高方差提示在训练大型语言模型时表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏