arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3238 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3238 篇

2604.13717 2026-06-10 cs.CL 版本更新 70%

On Cost-Effective LLM-as-a-Judge Improvement Techniques

关于成本效益的LLM作为评判者的改进技术

Ryan Lail, Luke Markham

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL

AI总结 研究通过集成评分、任务特定标准注入等四种技术提高LLM评判准确性,在RewardBench 2上达到85.8%准确率,成本效益显著。

Comments Accepted at the ICML 2026 workshops "Statistical Frameworks for Uncertainty in Agentic Systems" and "Combining Theory and Benchmarks: Towards a Virtuous Cycle to Understand and Guarantee Foundation Model Performance". 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09124 2026-06-09 cs.AI 新提交 70%

A Regret Minimization Framework on Preference Learning in Large Language Models

大语言模型中偏好学习的遗憾最小化框架

Suhwan Kim, Taehyun Cho, Geon-Hyeong Kim, Yu Jin Kim, Youngsoo Jang, Moontae Lee, Jungwoo Lee

机构 * KAIST(韩国科学技术院)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 提出基于遗憾的偏好优化方法RePO,通过遗憾最小化而非奖励最大化来建模人类偏好,在数学推理和人类偏好数据集上取得一致性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07629 2026-06-09 cs.LG cs.AI cs.CL cs.CY cs.HC 新提交 70%

Large Language Models Should Learn Personalized Rather Than Aggregated Human Preferences

大型语言模型应学习个性化而非聚合的人类偏好

Cristina Garbacea

机构 * University of Chicago, Data Science Institute(芝加哥大学数据科学学院)

专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文主张大型语言模型应学习个性化偏好而非聚合偏好,分析聚合偏好的理论局限与实证问题,提出通过有界个性化框架兼顾个体自主与集体安全。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05030 2026-06-04 cs.CL cs.SC 70%

Imbuing Large Language Models with Bidirectional Logic for Robust Chain Repair

赋予大语言模型双向逻辑以进行稳健的链修复

Zehua Cheng, Wei Dai, Jiahao Sun, Thomas Lukasiewicz

机构 * Department of Computer Science, University of Oxford, UK(英国牛津大学计算机系) FLock.io Institute of Logic and Computation, TU Wien, Austria(奥地利技术大学逻辑与计算研究所)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL

AI总结 针对自回归链式推理中错误雪崩问题,提出Teleological Reasoning Infilling (TRI)框架,通过将错误推理段重构为填充中间任务并引入前缀-后缀-中间序列重排,结合符号验证器监督微调和直接偏好优化,实现仅修复受损段的高效链修复。

Comments 25 Pages

Journal ref In Proceedings of European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16114 2026-06-02 cs.IR cs.AI 70%

GFlowGR: Fine-tuning Generative Recommendation Frameworks with Generative Flow Networks

GFlowGR:使用生成流网络微调生成式推荐框架

Yejing Wang, Shengyu Zhou, Jinyu Lu, Qidong Liu, Xinhang Li, Wenlin Zhang, Feng Li, Pengjie Wang, Chuan Yu, Jian Xu, Bo Zheng, Xiangyu Zhao

机构 * City University of Hong Kong(城市大学) Alibaba Group(阿里巴巴集团)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI

AI总结 针对生成式推荐中微调步骤忽略未观测正样本导致的曝光偏差问题,提出基于GFlowNets的微调框架GFlowGR,通过自适应轨迹采样器和综合奖励模型整合协同知识,利用GFlowNets的多样生成特性缓解偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31312 2026-06-01 cs.CV cs.CL 70%

Learning from Fine-Grained Visual Discrepancies: Mitigating Multimodal Hallucinations via In-Context Visual Contrastive Optimization

从细粒度视觉差异中学习:通过上下文视觉对比优化缓解多模态幻觉

Haolin Deng, Xin Zou, Zhiwei Jin, Chen Chen, Haonan Lu, Xuming Hu

机构 * The Hong Kong University of Science(香港科学与技术大学) OPPO AI Center(OPPO AI中心)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL

AI总结 提出上下文视觉对比优化(IC-VCO)方法,通过共享多图像上下文中的对比图像确保数学严谨的目标,并引入视觉对比蒸馏(VCDist)和对比样本编辑策略,有效缓解多模态幻觉。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21558 2026-06-01 cs.AI 70%

Reliable Self-Improvement Training by Verifying Reasoning, Not Just Answers

可靠的自改进训练:验证推理过程,而不仅仅是答案

Xinyu Zhang

机构 * Anyscale

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI

AI总结 针对自改进训练中因依赖最终答案正确性导致推理错误累积的问题,提出VSI框架,通过步骤级结构验证(如符号计算检查算术步骤)筛选训练数据,在GSM8K上实现持续准确率提升(80.5%→91.0%)。

Comments Accepted at ICLR 2026 Workshop LLM Reasoning. 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10228 2026-05-29 cs.AI 70%

SVSR: A Self-Verification and Self-Rectification Paradigm for Multimodal Reasoning

SVSR:一种用于多模态推理的自我验证与自我修正范式

Zhe Qian, Nianbing Su, Zhonghua Wang, Hebei Li, Zhongxing Xu, Yueying Li, Fei Luo, Zhuohan Ouyang, Yanbiao Ma

机构 * South China Agricultural University(华南农业大学) University of Glasgow(格拉斯哥大学) University of Electronic Science and Technology of China(电子科技大学) Monash University(莫纳什大学) University of Science and Technology of China(中国科学技术大学) National University of Defense Technology(国防科技大学) Renmin University of China(中国人民大学) South China Normal University(华南师范大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI

AI总结 提出SVSR框架,通过三阶段训练(统一偏好数据集构建、冷启动监督微调、半在线直接偏好优化)将自我验证与自我修正显式集成到多模态推理流程中,提升复杂视觉理解和多模态推理的鲁棒性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27772 2026-05-28 cs.SD cs.LG 70%

Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox

音频大语言模型是听还是读?使用VoxParadox分析和缓解副语言失败

Jiacheng Pang, Ashutosh Chaubey, Mohammad Soleymani

机构 * Institute for Creative Technologies, University of Southern California, Los Angeles, USA(创意技术研究所,南加州大学,洛杉矶,美国)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.LG

AI总结 针对音频大语言模型在副语言理解上的不足,提出对抗性基准VoxParadox和Prompt-Conditioned Layer Mixer方法,显著提升模型对副语言线索的利用能力。

Comments Accepted as a conference paper at ICML 2026. Project page: https://voxparadox.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20996 2026-05-28 cs.CL 70%

AFRILANGTUTOR: Advancing Language Tutoring and Culture Education in Low-Resource Languages with Large Language Models

AFRILANGTUTOR:利用大语言模型推进低资源语言的语言辅导与文化教育

Tadesse Destaw Belay, Shahriar Kabir Nahin, Israel Abebe Azime, Ocean Monjur, Marek Rei, Chris Biemann, Shamsuddeen Hassan Muhammad, Seid Muhie Yimam, Anshuman Chhabra

机构 * Instituto Politécnico Nacional(墨西哥政治技术学院) University of South Florida(佛罗里达州立大学) Saarland University(萨尔兰大学) Imperial College London(伦敦帝国理工学院) University of Hamburg(汉堡大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL

AI总结 针对低资源语言缺乏训练数据的问题,提出AFRILANGDICT词典资源并构建AFRILANGEDU数据集,通过监督微调和直接偏好优化训练AFRILANGTUTOR模型,在10种非洲语言上显著提升辅导性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18288 2026-05-27 cs.CL 70%

TFD: A Comprehensive Structured Tibetan Foundation Dataset for Low-Resource Language Processing and Large-Scale Modeling

TFD:面向低资源语言处理和大规模建模的综合结构化藏语基础数据集

Cheng Huang, Fan Gao, Nyima Tashi, Yutong Liu, Yadi Liu, Wenbin Wei, Xiangxiang Wang, Yongbin Yu

机构 * University of Electronic Science and Technology of China(电子科技大学) Xizang University(西藏大学) ZenWeave AI The State Key Laboratory of Tibetan Intelligence(藏语智能国家重点实验室) Nanyang Technological University(南洋理工大学)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 为解决藏语大语言模型开发中缺乏覆盖预训练、指令微调、安全对齐、偏好优化和推理监督等完整流程的数据集问题,提出首个结构化、大规模、专家精选的藏语基础数据集TFD,包含超过110亿词元的统一语料库及链式推理数据集,通过训练Sun-Shine系列藏语模型在理解、安全、推理和生成基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11486 2026-05-27 cs.LG 70%

Exploring the robustness of TractOracle methods in RL-based tractography

探索基于强化学习的纤维追踪中TractOracle方法的鲁棒性

Jeremi Levesque, Antoine Théberge, Maxime Descoteaux, Pierre-Marc Jodoin

机构 * Department of Computer Science, Faculty of Science, University of Sherbrooke(谢布罗克大学计算机科学系)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文通过整合强化学习的最新进展,扩展了TractOracle-RL框架,并引入迭代奖励训练(IRT)方法,实验表明基于oracle的RL方法在准确性和解剖有效性上显著优于传统纤维追踪技术。

Comments 38 pages, 8 figures. Submitted to Medical Image Analysis

Journal ref Medical Image Analysis, December 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11195 2026-05-25 cs.CR cs.AI 70%

RAG-Pull: Turning Retrieval into a Code-Injection Channel via Invisible Unicode Perturbations

RAG-Pull:通过不可见Unicode扰动将检索转化为代码注入通道

Aritra Dhar, Vasilije Stambolic, Lukas Cavigelli

机构 * Computing System Labs, Huawei Technologies Switzerland AG(华为瑞士技术有限公司计算系统实验室) BKW Energie AG(BKW能源集团)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 提出RAG-Pull攻击,通过向查询或外部代码库插入不可见UTF字符,使检索系统偏向恶意代码,从而破坏LLM的安全对齐,实现远程代码执行和SQL注入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18815 2026-05-20 cs.LG cs.DC 70%

DynaTrain: Fast Online Parallelism Switching for Elastic LLM Training

DynaTrain: 快速在线并行切换用于弹性大语言模型训练

Yuanqing Wang, Yuchen Zhang, Hao Lin, Junhao Hu, Chunyang Zhu, Quanlu Zhang, Boxun Li, Guohao Dai, Zhi Yang, Daning Cheng, Yunquan Zhang, Yu Wang

机构 * Institute of Computing Technology, CAS(中国科学院计算技术研究所) Peking University(北京大学) Infinigence AI Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出DynaTrain,一种能够快速在线重新配置任意多维并行性的分布式训练系统,通过虚拟参数空间抽象统一所有分布式训练状态,实现并行配置的确定性映射,并在密集和MoE模型上展示了显著的性能提升。

Comments GitHub Repo: https://github.com/infinigence/ElasticMegatron

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00607 2026-05-19 cs.CV cs.AI 70%

IdGlow: Dynamic Identity Modulation for Multi-Subject Generation

IdGlow: 多主体生成中的动态身份调节

Honghao Cai, Xiangyuan Wang, Jing Li, Yunhao Bai, Tianze Zhou, Haohua Chen, Chao Hui, Changhao Qiao, Runqi Wang, Sijie Xu, Yuyang Hao, Zezhou Cui, Yuyuan Yang, Wei Zhu, Yibo Chen, Xu Tang, Yao Hu, Zhen Li

机构 * Xiaohongshu Inc.(小红书公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出IdGlow框架,通过任务自适应的时间步调度和视觉语言模型解决多主体生成中的稳定性与可塑性矛盾,提升面部真实感与商业级美学质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16604 2026-05-19 cs.LG 70%

R2V Agent: Teaching SLMs When to Ask for Help

R2V Agent:教SLMs何时请求帮助

Raghu Vamshi Hemadri, Humaira Firdowse Mohammed, Rishabh Maheshwary, Srivatsava Daruru, Sagar Davasam, Vikas Yadav, Srinivas Sunkara, Sai Rajeswar

机构 * New York University Tandon School of Engineering(纽约大学Tandon工程学院) University of California, San Diego(加州大学圣地亚哥分校) Stanford University(斯坦福大学) ServiceNow Research(ServiceNow研究) Mila - Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.LG

AI总结 R2V-Agent通过风险校准的SLM-LLM路由框架提升交互代理的可靠性,结合小型语言模型策略、更强的教师LLM、轻量级过程验证器和校准的步骤路由器,在多个基准测试中显著提升性能与成本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00920 2026-05-18 cs.CL 70%

Reward Auditor: Inference on Reward Modeling Suitability in Real-World Perturbed Scenarios

奖励审计员:在现实扰动场景中对奖励建模适用性的推断

Jianxiang Zang, Yongda Wei, Ruxue Bai, Shiyu Jiang, Nijia Mo, Binhong Li, Qiang Sun, Hui Liu

机构 * School of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Statistics and Data Science, Shanghai University of International Business and Economics(上海国际商务经济学院统计与数据科学学院) Data Science and Analytics Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)数据科学与分析方向)

专题命中 偏好对齐 :alignment(abstract);trustworthy(abstract);分类 cs.CL

AI总结 本文提出奖励审计员框架,用于评估奖励模型在现实扰动场景中的适用性,通过统计显著性和效应量分析模型的可靠性与漏洞严重性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07925 2026-05-11 cs.CL 70%

How Value Induction Reshapes LLM Behaviour

价值观诱导如何重塑大语言模型行为

Arnav Arora, Natalie Schluter, Katherine Metcalf, Maartje ter Hoeve

机构 * University of Copenhagen(哥本哈根大学) Apple(苹果公司)

专题命中 偏好对齐 :safety(abstract);harmlessness(abstract);分类 cs.CL

AI总结 研究探讨价值观诱导对大语言模型行为的影响,发现诱导价值观会引发其他相关或对立价值观的表达,提升安全性,但增加拟人化语言使用,导致模型更易产生验证性和趋炎附势倾向。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28036 2026-05-01 cs.LG cs.IT math.IT 70%

Exponential families from a single KL identity

从单个KL恒等式出发的指数族

Marc Dymetman

机构 * Scientific Consultant(科学顾问)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文通过一个简单的指数族KL差恒等式,推导出多项经典结果,包括三点恒等式、I投影定理、对数分区函数的凸性等,无需复杂推导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27969 2026-05-01 cs.SE cs.AI 70%

From Mirage to Grounding: Towards Reliable Multimodal Circuit-to-Verilog Code Generation

从幻象到基础:迈向可靠的多模态电路到Verilog代码生成

Guang Yang, Xing Hu, Xiang Chen, Xin Xi

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security, Hangzhou(杭州高新技术区(滨江)区块链与数据安全研究院,杭州) School of Artificial Intelligence and Computer Science, Nantong University(人工智能与计算机科学学院,南通大学)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出VeriGround模型,通过标识符匿名化、拒绝增强和D-ORPO对齐,解决了多模态模型在电路到Verilog代码生成中的可靠性问题,验证了真实视觉基础的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19342 2026-05-01 stat.ML cs.LG stat.ME 70%

Contextual Online Uncertainty-Aware Preference Learning for Human Feedback

基于上下文的在线不确定性感知偏好学习用于人类反馈

Nan Lu, Ethan Lee, Ethan X. Fang, Junwei Lu

机构 * Department of Biostatistics, Harvard T.H. Chan School of Public Health(哈佛大学T.H.陈公共卫生学院生物统计学系) Department of Biostatistics & Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出一种新的统计框架,利用动态上下文信息在线决策和统计推断最优模型,通过人类偏好数据实现最优 regret 绑定和估计量渐近分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26419 2026-04-30 cs.CV cs.AI 70%

Delineating Knowledge Boundaries for Honest Large Vision-Language Models

界定诚实大视觉-语言模型的知识边界

Junru Song, Yimeng Hu, Yijing Chen, Huining Li, Qian Li, Lizhen Cui, Yuntao Du

机构 * Shandong University(山东大学)

专题命中 偏好对齐 :DPO(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出系统框架提升VLM在面对未知问题时的拒绝能力,通过构建'视觉-不知'数据集并采用监督微调与偏好优化方法,提升事实准确率至67.3%,并在医疗等领域实现泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03412 2026-04-30 cs.CL 70%

Verified Critical Step Optimization for LLM Agents

用于大语言模型代理的验证关键步骤优化

Mukai Li, Qingcheng Zeng, Tianqing Fang, Zhenwen Liang, Linfeng Song, Qi Liu, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) The University of Hong Kong(香港大学) Northwestern University(西北大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出CSO方法,通过验证关键步骤进行强化学习,以提升代理在复杂任务中的表现,实验显示其在GAIA-Text-103和XBench-DeepSearch上优于SFT基线。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02467 2026-04-29 cs.CV cs.AI 70%

VERTIGO: Visual Preference Optimization for Cinematic Camera Trajectory Generation

VERTIGO:用于电影摄像机轨迹生成的视觉偏好优化

Mengtian Li, Yuwei Lu, Feifei Li, Chenqi Gan, Zhifeng Xie, Xi Wang

机构 * Shanghai University Shanghai Engineering Research Center of Motion Picture Special Effects LIX, \'Ecole Polytechnique, CNRS, IPP magenta http://vertigo.magic-lab.tech/

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出VERTIGO,通过视觉偏好优化提升摄像机轨迹生成的质量,通过实时渲染和视觉语言模型优化,提高画面构图和视觉效果。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22981 2026-04-28 cs.LG 70%

Reward Models Are Secretly Value Functions: Temporally Coherent Reward Modeling

奖励模型实际上是隐含的价值函数:时间一致的奖励建模

Alex Nikulkov

机构 * AI at Meta(Meta人工智能)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出时间一致的奖励建模方法,通过正则化项使奖励模型在任意token位置输出代表条件期望,提升token级奖励可解释性,并在ProcessBench上取得SOTA性能,同时优化PPO的资源利用。

Comments 27 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22193 2026-04-27 cs.CL 70%

How Large Language Models Balance Internal Knowledge with User and Document Assertions

大型语言模型如何在内部知识与用户和文档断言之间取得平衡

Shuowei Li, Haoxin Li, Wenda Chu, Yi Fang

机构 * Santa Clara University(圣克拉拉大学) Nanyang Technological University(南洋理工大学) California Institute of Technology(加州理工学院)

专题命中 偏好对齐 :safety(abstract);trustworthy(abstract);分类 cs.CL

AI总结 本文研究了大型语言模型在处理内部知识与外部信息时的平衡问题,提出三源交互框架,评估27个模型,发现模型更依赖文档断言,且通过微调可提升其区分能力。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16399 2026-04-23 cs.LG math.OC 70%

A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning

一种用于双层强化学习的无Hessian演员-评论员算法及其在大语言模型微调中的应用

Sihan Zeng, Sujay Bhatt, Sumitra Ganesh, Alec Koppel

机构 * JPMorgan AI Research(摩根大通AI研究) Johns Hopkins University Applied Physics Laboratory(约翰霍普金斯大学应用物理实验室)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出一种单循环一阶演员-评论员算法,用于解决双层优化问题,通过惩罚重述法优化双层目标,引入衰减熵正则化以实现无偏上层超梯度估计,且在特殊Polyak-Lojasiewicz条件下证明了有限时间与样本收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19544 2026-04-22 cs.AI 70%

DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling

DT2IT-MRM:去偏偏好构建与迭代训练用于多模态奖励建模

Zhihong Zhang, Jie Zhao, Xiaojian Huang, Jin Xu, Zhuodong Luo, Xin Liu, Jiansheng Wei, Xuejin Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出DT2IT-MRM方法,通过去偏偏好构建、文本到图像偏好数据重构和迭代训练框架,解决多模态奖励建模中偏好数据的偏差、噪声和不一致问题,并在三个基准测试中取得新突破。

Comments code will be uploaded to https://github.com/zhang123434/DT2IT-MRM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09354 2026-04-21 cs.CL 70%

Logit Arithmetic Elicits Long Reasoning Capabilities Without Training

逻辑运算激发长推理能力而不需训练

Yunxiang Zhang, Muhammad Khalifa, Lechen Zhang, Xin Liu, Ayoung Lee, Xinliang Frederick Zhang, Farima Fatahi Bayat, Lu Wang

机构 * University of Michigan(密歇根大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出ThinkLogit方法,通过逻辑运算将小型推理引导器的能力转移至大模型,无需训练即可提升推理性能,实验显示在六个基准测试中实现21.5%-24.2%的提升。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15705 2026-04-20 cs.LG 70%

Towards Robust Endogenous Reasoning: Unifying Drift Adaptation in Non-Stationary Tuning

迈向稳健的内生推理:统一非平稳调谐中的漂移适应

Xiaoyu Yang, En Yu, Wei Duan, Jie Lu

机构 * Australian Artificial Intelligence Institute (AAII)(澳大利亚人工智能研究所) Faculty of Engineering and Information Technology(工程与信息技术学院)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出CPO++框架,解决多模态大语言模型在内生推理中的漂移问题,通过反事实推理与领域知识结合,提升推理连贯性和决策精度,适用于医疗诊断和自动驾驶等安全关键领域。

详情

展开后加载摘要…

URL PDF HTML 收藏