arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-10 至 2026-03-10 共收录 443 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 26 篇

2603.06604 2026-03-10 cs.LG cs.CL 86%

Know When You're Wrong: Aligning Confidence with Correctness for LLM Error Detection

知何时错误:将置信度与正确性对齐以用于LLM错误检测

Xie Xiaohu, Liu Xiaohu, Yao Benjamin

机构 * Alexa AI, Amazon, Seattle, WA, USA(Alexa AI,亚马逊,西雅图,华盛顿州)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出归一化置信度分数和自我评估框架,通过SFT提升LLM置信度可靠性,减少校准误差,提升错误检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05087 2026-03-10 cs.LG cs.AI cs.CL 80%

Mitigating Unintended Memorization with LoRA in Federated Learning for LLMs

在大语言模型联邦学习中使用LoRA缓解意外记忆

Thierry Bossy, Julien Vignoud, Tahseen Rabbani, Juan R. Troncoso Pastoriza, Martin Jaggi

机构 * Tune Insight SA EPFL(苏黎世联邦理工学院) Yale University(耶鲁大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了在大语言模型联邦学习中使用LoRA技术有效降低模型对训练数据的记忆能力,并展示了其在不同领域和隐私保护技术中的应用效果。

Journal ref Published in Transactions on Machine Learning Research (02/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06745 2026-03-10 cs.LG cs.AI 79%

Enhancing Instruction Following of LLMs via Activation Steering with Dynamic Rejection

通过动态拒绝引导增强大语言模型的指令遵循能力

Minjae Kang, Jaehyung Kim

机构 * Yonsei University(延世大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.AI、cs.LG

AI总结 DIRECTER通过动态调节引导强度和基于可能性的解码循环,提升大语言模型在复杂指令下的准确性和生成质量。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08708 2026-03-10 cs.CV 78%

FVG-PT: Adaptive Foreground View-Guided Prompt Tuning for Vision-Language Models

FVG-PT:适应性前景视图引导的提示微调用于视觉-语言模型

Haoyang Li, Liang Wang, Siyu Zhou, Jiacheng Sun, Jing Jiang, Chao Wang, Guodong Long, Yan Peng

机构 * University of Technology Sydney(悉尼技术大学) Shanghai University(上海大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 FVG-PT通过引入前景可靠性门、蒸馏补偿模块和先验校准模块,解决提示微调中前景注意力偏移问题,提升视觉-语言模型的适应性和泛化能力。

Comments 27 Pages, 9 Figures, 15 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08497 2026-03-10 cs.CV 78%

Reading $\neq$ Seeing: Diagnosing and Closing the Typography Gap in Vision-Language Models

阅读≠视觉:诊断和缩小视觉语言模型中的字形差距

Heng Zhou, Ao Yu, Li Kang, Yuchen Fan, Yutao Fan, Xiufeng Song, Hejia Geng, Yiran Qin

专题命中 指令微调 :language model(title,abstract)

AI总结 本文研究了视觉语言模型在字形识别上的不足,发现字体风格检测能力差,通过微调提升模型性能,揭示训练数据缺失问题,并提出需架构创新以改进关系性视觉推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07468 2026-03-10 cs.CV 78%

FedEU: Evidential Uncertainty-Driven Federated Fine-Tuning of Vision Foundation Models for Remote Sensing Image Segmentation

FedEU: 基于证据不确定性的联邦微调视觉基础模型用于遥感图像分割

Xiaokang Zhang, Xuran Xiong, Jianzhong Huang, Lefei Zhang

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) School of Information Science and Engineering, Wuhan University of Science and Technology(武汉科技大学信息科学与工程学院) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 FedEU通过证据不确定性驱动联邦微调,提升遥感图像分割在异构数据下的鲁棒性和泛化能力。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07122 2026-03-10 cs.LG stat.ML 77%

Combining Adam and its Inverse Counterpart to Enhance Generalization of Deep Learning Optimizers

将Adam及其逆向对应物结合以增强深度学习优化器的泛化能力

Tao Shi, Liangming Chen, Long Jin, Mengchu Zhou

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) Helen and John C. Hartmann Department of Electrical and Computer Engineering, New Jersey Institute of Technology(新泽西理工学院电气与计算机工程系)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 通过结合Adam与逆Adam,DualAdam提升了深度学习优化器的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02951 2026-03-10 cs.LG cs.CV 77%

CGL: Advancing Continual GUI Learning via Reinforcement Fine-Tuning

CGL: 通过强化微调推进连续GUI学习

Zhenquan Yao, Zitong Huang, Yihan Zeng, Jianhua Han, Hang Xu, Chun-Mei Feng, Jianwei Ma, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Noah’s Ark Lab(华为诺亚实验室) University College Dublin(都柏林大学) Peking University(北京大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.LG

AI总结 CGL通过强化微调与监督微调的协同优化,解决GUI连续学习中遗忘旧任务的问题,提出AndroidControl-CL基准验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23692 2026-03-10 cs.CL cs.CY 77%

Llama-Mob: Instruction-Tuning Llama-3-8B Excels in City-Scale Mobility Prediction

Llama-Mob:指令微调Llama-3-8B在城市级移动预测中表现优异

Peizhi Tang, Chuang Yang, Tong Xing, Xiaohang Xu, Jiayi Xu, Renhe Jiang, Kaoru Sezaki

机构 * Southern University of Science and Technology(南方科技大学) The University of Tokyo(东京大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL

AI总结 Llama-Mob通过指令微调Llama-3-8B模型,在城市级长期移动预测中表现出色,超越了现有方法,并具备良好的零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08014 2026-03-10 cs.LG cs.AI 73%

FedMomentum: Preserving LoRA Training Momentum in Federated Fine-Tuning

FedMomentum: 在联邦微调中保持LoRA训练动量

Peishen Yan, Yang Hua, Hao Wang, Jiaru Zhang, Xiaoyu Wu, Tao Song, Haibing Guan

机构 * Shanghai Jiao Tong University(上海交通大学) Queen's University Belfast(女王大学贝尔法斯特分校) Stevens Institute of Technology(史蒂文斯理工学院) Purdue University(普渡大学) Rice University(里奇大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 FedMomentum通过奇异值分解实现结构化且动量保持的LoRA聚合,提升联邦微调中的收敛速度和准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06958 2026-03-10 cs.LG cs.CL 73%

Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards

Chart-RL: 通过可验证奖励的强化学习实现通用图表理解

Xin Zhang, Xingyu Li, Rongguang Wang, Ruizhong Miao, Zheng Wang, Dan Roth, Chenyang Li

机构 * Oracle AI

专题命中 指令微调 :language model(abstract);SFT(abstract);分类 cs.CL、cs.LG

AI总结 Chart-RL通过可验证奖励的强化学习提升图表理解能力,在多个基准测试中超越监督微调,展现强大的泛化和迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06816 2026-03-10 cs.CL cs.AI q-bio.NC 73%

"Dark Triad" Model Organisms of Misalignment: Narrow Fine-Tuning Mirrors Human Antisocial Behavior

黑暗三联征模型生物:对齐偏差:狭窄微调映射人类反社会行为

Roshni Lulla, Fiona Collins, Sanaya Parekh, Thilo Hagendorff, Jonas Kaplan

机构 * Brain & Creativity Institute, University of Southern California(大脑与创造力研究所,南加州大学) Department of Psychology, University of Southern California(心理学系,南加州大学) Interchange Forum for Reflecting on Intelligent Systems, University of Stuttgart(智能系统反思交流论坛,斯图加特大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过黑暗三联征框架,研究LLM中的对齐偏差问题,通过微调诱导反社会行为,揭示LLM中潜在的人格结构。

Comments 38 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08058 2026-03-10 cs.LG 70%

Stabilized Fine-Tuning with LoRA in Federated Learning: Mitigating the Side Effect of Client Size and Rank via the Scaling Factor

在联邦学习中使用LoRA的稳定微调:通过缩放因子缓解客户端大小和秩的副作用

Jiayu Huang, Xiaohu Wu, Tiantian He, Qicheng Lao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Agency for Science, Technology and Research(科技研究局)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出SFed-LoRA,通过理论分析适配器秩与联邦聚合的相互作用,设计最优缩放因子以缓解高秩适配器在联邦学习中的梯度崩溃问题,提升稳定性和收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11954 2026-03-10 cs.AI 70%

UniCast: A Unified Framework for Instance-Conditioned Multimodal Time-Series Forecasting

UniCast: 一个实例条件多模态时间序列预测的统一框架

Sehyuk Park, Soyeon Caren Han, Eduard Hovy

机构 * The Universito of Melbourne(墨尔本大学)

专题命中 指令微调 :foundation model(abstract);prompting(abstract);分类 cs.AI

AI总结 UniCast通过实例条件提示和动态模态路由,实现多模态时间序列预测的统一框架,有效提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07240 2026-03-10 cs.CV cs.GR 67%

FabricGen: Microstructure-Aware Woven Fabric Generation

FabricGen: 基于微结构的编织材料生成

Yingjie Tang, Di Luo, Zixiong Wang, Xiaoli Ling, jian Yang, Beibei Wang

机构 * Nankai University(南开大学) Nanjing University(南京大学)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 FabricGen通过分解宏观纹理与微观编织模式,结合预训练扩散模型和专用语言模型,实现高质量编织材料的生成。

Comments 10 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07098 2026-03-10 cs.CV 67%

NuNext: Reframing Nucleus Detection as Next-Point Detection

NuNext:将核检测重新表述为下一个点检测

Zhongyi Shui, Honglin Li, Xiaozhong Ji, Ye Zhang, Zijiang Yang, Chenglu Zhu, Yuxuan Sun, Kai Yao, Conghui He, Cheng Tan

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学) University of Science and Technology Beijing(北京科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 NuNext通过多模态大语言模型直接输出核质心,采用空间感知软监督和强化微调策略提升检测性能,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06727 2026-03-10 cs.LG cs.AI 62%

Safe Transformer: An Explicit Safety Bit For Interpretable And Controllable Alignment

安全变换器:一种可解释和可控的对齐显式安全位

Jingyuan Feng, Andrew Gambardella, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 Safe Transformer通过在模型中插入显式安全位,实现安全行为的可解释和可控,通过对比训练解耦表示,提升安全性和生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06600 2026-03-10 cs.LG cs.AI 62%

FuzzingRL: Reinforcement Fuzz-Testing for Revealing VLM Failures

FuzzingRL: 用于揭示视觉语言模型故障的强化模糊测试

Jiajun Xu, Jiageng Mao, Ang Qi, Weiduo Yuan, Alexander Romanus, Helen Xia, Vitor Campagnolo Guizilini, Yue Wang

机构 * University of Southern California(南加州大学) Toyota Research Institute(丰田研究机构)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 FuzzingRL通过强化模糊测试生成挑战性问题,揭示视觉语言模型的故障点并降低其准确性。

Comments 18 pages, 4 figures. † These authors jointly supervised this work: Jiageng Mao and Yue Wang

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17908 2026-03-10 cs.CV cs.AI cs.LG 62%

ReDepth Anything: Test-Time Depth Refinement via Self-Supervised Re-lighting

ReDepth Anything: 通过自监督重照明进行测试时深度细化

Ananta R. Bhattarai, Helge Rhodin

机构 * Bielefeld University(比勒菲尔德大学)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 ReDepth Anything通过自监督重照明技术,在测试时提升深度估计的准确性和真实感,优于现有方法并达到最新水平。

Comments Accepted at CVPR 2026 (Findings). Project Page: https://anantarb.github.io/redepth Code: https://github.com/anantarb/Re-Depth-Anything

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23516 2026-03-10 cs.CR cs.LG 57%

Lap2: Revisiting Laplace DP-SGD for High Dimensions via Majorization Theory

Lap2: 通过主导理论重新审视高维下的拉普拉斯DP-SGD

Meisam Mohammady, Qin Yang, Nicholas Stout, Ayesha Samreen, Han Wang, Christopher J Quinn, Yuan Hong

机构 * Iowa State University(爱荷华州立大学) University of Connecticut(康涅狄格大学) University of Kansas(堪萨斯大学)

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 Lap2通过主导理论解决高维下拉普拉斯DP-SGD的裁剪限制,提升隐私保护下的模型性能。

Comments Accepted at IEEE CSF 2026; Corrected version; 16 pages including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14106 2026-03-10 cs.CL 57%

Stealth Fine-Tuning: Efficiently Breaking Alignment in RVLMs Using Self-Generated CoT

隐形微调:通过自动生成的CoT打破RVLMs的对齐

Le Yu, Zhengyue Zhao, Yawen Zheng, Yunhao Liu

机构 * Machine Intelligence Laboratory, Sichuan University(四川大学人工智能实验室) University of Wisconsin--Madison(威斯康星大学麦迪逊分校) Department of Automation, Tsinghua University(清华大学自动化系) Global Innovation Exchange, Tsinghua University(清华大学全球创新交流中心)

专题命中 指令微调 :language model(abstract);分类 cs.CL

AI总结 本文提出隐形微调方法,通过分段干扰和自动生成输出,有效绕过RVLMs的安全对齐防御,实现更高的ASR性能同时保持推理能力。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14438 2026-03-10 cs.LG 57%

LoRA-Ensemble: Efficient Uncertainty Modelling for Self-Attention Networks

LoRA-Ensemble:高效不确定性建模用于自注意力网络

Dominik J. Mühlematter, Michelle Halbheer, Alexander Becker, Dominik Narnhofer, Helge Aasen, Konrad Schindler, Mehmet Ozgur Turkoglu

机构 * ETH Zurich(苏黎世联邦理工学院) Agroscope(农业生态观测机构)

专题命中 指令微调 :LLM(abstract);分类 cs.LG

AI总结 LoRA-Ensemble通过低秩适应方法实现自注意力网络的高效不确定性建模,优于现有隐式集合方法并达到显式集合的准确度水平。

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20989 2026-03-10 cs.CV 50%

Cycle-Consistent Tuning for Layered Image Decomposition

循环一致性调谐用于分层图像分解

Zheng Gu, Min Lu, Zhida Sun, Dani Lischinski, Daniel Cohen-Or, Hui Huang

机构 * Shenzhen University(深圳大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学) Tel Aviv University(特拉维夫大学)

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出一种基于循环一致性调谐的图像分解框架,通过轻量级LoRA适应和双向监督提升分层分离的鲁棒性和泛化能力。

Comments Accepted to CVPR 2026. Project page: https://vcc.tech/research/2026/ImgDecom

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 17 篇

2512.16301 2026-03-10 cs.AI cs.CL 91%

Adaptation of Agentic AI: A Survey of Post-Training, Memory, and Skills

代理AI的适应:训练后、记忆和技能的综述

Pengcheng Jiang, Jiacheng Lin, Zhiyi Shi, Zifeng Wang, Luxi He, Yichen Wu, Ming Zhong, Peiyang Song, Qizheng Zhang, Heng Wang, Xueqiang Xu, Hanwen Xu, Pengrui Han, Dylan Zhang, Jiashuo Sun, Chaoqi Yang, Kun Qian, Tian Wang, Changran Hu, Manling Li, Quanzheng Li, Hao Peng, Sheng Wang, Jingbo Shang, Chao Zhang, Jiaxuan You, Liyuan Liu, Pan Lu, Yu Zhang, Heng Ji, Yejin Choi, Dawn Song, Jimeng Sun, Jiawei Han

机构 * UIUC(伊利诺伊大学香槟分校) Stanford(斯坦福大学) Princeton(普林斯顿大学) Harvard(哈佛大学) UC Berkeley(加州大学伯克利分校) Caltech(加州理工学院) UCSD(加州大学圣地亚哥分校) Georgia Tech(佐治亚理工学院) Northwestern(西北大学) TAMU(德克萨斯大学奥斯汀分校) MGH(麻省总医院) Keiji AI Unity

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文综述了代理AI在训练后、记忆和技能方面的适应方法,提出四范式框架,分析了代理与工具适应的技术细节及权衡,探讨了开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21060 2026-03-10 eess.AS 90%

Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models

测量音频对正确性的影响:面向大音频语言模型的音频贡献意识后训练

Haolin He, Xingjian Du, Renhe Sun, Zheqi Dai, Yujia Xiao, Mingru Yang, Jiayi Zhou, Xiquan Li, Zhengxi Liu, Zining Liang, Chunyat Wu, Qianhua He, Tan Lee, Xie Chen, Wei-Long Zheng, Weiqiang Wang, Mark Plumbley, Jian Liu, Qiuqiang Kong

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);foundation model(abstract);SFT(abstract)

AI总结 本文提出AudioMCQ数据集和Audio-Contribution Filtering方法,通过弱到强和混合到强的后训练范式,提升大音频语言模型的音频贡献意识和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17252 2026-03-10 cs.LG cs.AI 89%

Adaptive Batch-Wise Sample Scheduling for Direct Preference Optimization

适应性批级样本调度用于直接偏好优化

Zixuan Huang, Yikun Ban, Lean Fu, Xiaojie Li, Zhongxiang Dai, Jianxin Li, Deqing Wang

机构 * Beihang University(北京航空航天大学) Bytedance China(字节跳动中国) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出SamS算法,通过动态调度训练样本提升DPO性能,无需修改核心算法,有效提高LLM对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06743 2026-03-10 cs.LG cs.AI 86%

Stabilizing Reinforcement Learning for Diffusion Language Models

稳定扩散语言模型的强化学习

Jianyuan Zhong, Kaibo Wang, Ding Ding, Zijin Feng, Haoli Bai, Yang Xiang, Jiacheng Sun, Qiang Xu

机构 * Huawei Foundation Model Department(华为基础模型部门) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出StableDRL方法,针对扩散语言模型中的强化学习问题,通过无条件裁剪和自我归一化解决比率估计噪声导致的不稳定性,提升训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03054 2026-03-10 cs.CL 85%

PrivMedChat: End-to-End Differentially Private RLHF for Medical Dialogue Systems

PrivMedChat: 医疗对话系统的端到端差分隐私RLHF

Sudip Bhujel

机构 * Graduate Student in the Department of Computer Science, University of Kentucky(计算机科学系研究生,肯塔基大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PrivMedChat通过端到端差分隐私RLHF方法,在医疗对话系统中实现隐私保护与对齐,采用DP-SGD和DP-aware策略优化,避免临床标注成本,提供正式隐私保证。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08519 2026-03-10 cs.RO 85%

AtomVLA: Scalable Post-Training for Robotic Manipulation via Predictive Latent World Models

AtomVLA: 通过预测性潜在世界模型实现机器人操作的可扩展后训练

Xiaoquan Sun, Zetian Xu, Chen Cao, Zonghe Liu, Yihan Sun, Jingrui Pang, Ruijian Zhang, Zhen Yang, Kang Pang, Dingxin He, Mingqi Yuan, Jiayu Chen

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 AtomVLA通过预测性潜在世界模型实现机器人操作的可扩展后训练,提升长时间任务的鲁棒性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08035 2026-03-10 cs.AI cs.LG 79%

CDRRM: Contrast-Driven Rubric Generation for Reliable and Interpretable Reward Modeling

CDRRM:基于对比的评分标准生成用于可靠和可解释的奖励建模

Dengcan Liu, Fengkai Yang, Xiaohan Wang, Shurui Yan, Jiajun Chai, Jiahao Li, Yikun Ban, Zhendong Mao, Wei Lin, Guojun Yin

机构 * University of Science and Technology of China(科学技术大学) Peking University(北京大学) BeiHang University(北航大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 CDRRM通过对比驱动的评分标准生成方法,实现可靠且可解释的奖励建模,有效缓解评估偏见并提升数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏