arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-29 至 2026-06-29 共收录 235 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 31 篇

2606.28182 2026-06-29 cs.LG cs.AI cs.CV cs.RO 新提交 82%

LLawCo: Learning Laws of Cooperation for Modeling Embodied Multi-Agent Behavior

LLawCo: 学习合作法则以建模具身多智能体行为

Qinhong Zhou, Chuang Gan, Anoop Cherian

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出LLawCo框架,通过反思失败提取行为模式并推导高层合作法则,结合监督微调融入推理,提升具身多智能体在分散部分可观测环境中的合作效率与任务成功率。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04862 2026-06-29 cs.SD 版本更新 82%

Focus Then Listen: An Empirical Study of Plug-and-Play Audio Enhancer for Noise-Robust Large Audio Language Models

先聚焦后聆听:探索用于噪声鲁棒的大规模音频语言模型的即插即用音频增强器

Han Yin, Yang Xiao, Younghoo Kwon, Ting Dang, Jung-Woo Choi

机构 * University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学)

专题命中 指令微调 :language model(title,abstract);foundation model(abstract)

AI总结 提出即插即用的音频增强器FTL,通过分离语音与非语音并利用模态路由器预测目标模态,生成任务自适应增强信号,无需微调即可提升LALMs在噪声环境下的性能。

Comments Accepted by ICML 2026 Workshop (Machine Learning for Audio)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27069 2026-06-29 cs.CL 新提交 81%

Towards Explainable Adjudicative Variance: Quantifying Judicial Discretion via Gated Multi-Task Learning

迈向可解释的裁判差异:通过门控多任务学习量化司法裁量权

Stanisław Sójka, Felix Steffek, Matthias Grabmair

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL

AI总结 提出法官感知门控多任务学习架构,通过细粒度结果分类和门控融合机制区分客观事实与司法裁量,在UK就业法庭数据上以更少参数超越生成式SFT基线,实现可解释的裁判差异量化。

Comments 17 pages (8 pages main text), 5 figures, 9 tables. Accepted to the AI for Law Workshop at the 43rd International Conference on Machine Learning (ICML 2026), Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28249 2026-06-29 eess.AS cs.CL cs.SD 新提交 77%

HPRO: Hierarchical Progressive Reward Optimization via Preference Extraction for Emotional Text-to-Speech

HPRO:通过偏好提取的分层渐进奖励优化用于情感文本到语音

Sihang Nie, Xiaofen Xing, Rui Xing, Haoming Li, Ruitong Xiao, Jingyuan Xing, Baiji Liu, Xiangmin Xu

机构 * South China University of Technology, China(华南理工大学,中国) Huya Inc., China(欢丫公司,中国) Tongyi Fun Team, Alibaba Group, China(通义 Fun 团队,阿里巴巴集团,中国) Foshan University, China(佛山大学,中国)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出HPRO框架,通过HD-Emo编解码器分离内容与情感偏好,并分层对齐帧、词、句级别目标,解决信息冲突和尺度差距,提升情感表现力同时保持语言清晰度。

Comments 7 pages, 3 figures, 3 tables; Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28164 2026-06-29 cs.CV cs.LG 新提交 77%

EchoSonar-R: A Multi-View Reasoning-Enabled Model for Disease Classification and Report Generation in Echocardiography

EchoSonar-R: 一种用于超声心动图疾病分类和报告生成的多视图推理增强模型

Darya Taratynova, Ahmed Aly, Numan Saeed, Mohammad Yaqub

机构 * Division of Computing and Mathematical Sciences, Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI), Abu Dhabi, UAE(穆罕默德·本·扎耶德人工智能大学计算与数学科学系,阿布扎比,阿联酋)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.LG

AI总结 提出EchoSonar-R,一种结合时空视频编码器和结构感知心脏检测器的多视图推理视觉语言模型,通过两阶段训练(监督微调+组相对策略优化)联合实现多标签疾病分类和报告生成,在私有数据集和公共基准上分别提升宏平衡准确率17.1%和6.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27446 2026-06-29 cs.CL 新提交 77%

Causal Connections: Leveraging Multilingual Fine-Tuning for Financial QA@FinCausal 2026

因果联系:利用多语言微调进行金融问答@FinCausal 2026

Akash Kumar Gautam, Serhii Hamotskyi, Christian Hänig

机构 * Anhalt University of Applied Sciences(安哈尔特应用技术大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL

AI总结 本文通过对比编码器、编码器-解码器和仅解码器模型,发现监督微调效果最佳,GPT-4.1 Mini在英西双语微调后取得英语最高分和西班牙语第三名。

Journal ref Proceedings of the 7th Financial Narrative Processing Workshop (FNP 2026) at LREC 2026, pp. 132-138, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19266 2026-06-29 cs.CL cs.AI 版本更新 73%

FormalASR: End-to-End Spoken Chinese to Formal Text

FormalASR: 语音中文到正式文本的端到端系统

Wanyi Ning, Yinshang Guo, Haitao Qian, Jiyuan Cheng, Weiyuan Feng, Yufei Zhang

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出FormalASR,一种端到端的中文语音到正式文本转换模型,通过构建大规模的语音到正式文本数据集,并使用Qwen3-ASR进行微调,实现了比原声基线减少37.4%的CER,同时提升了ROUGE-L和BERTScore指标,提供了一个轻量级的设备端解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27974 2026-06-29 cs.CV cs.AI 新提交 70%

ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering

ProMSA: 渐进式多模态搜索智能体用于基于知识的视觉问答

ZhengXian Wu, Hangrui Xu, Kai Shi, Zhuohong Chen, Yunyao Yu, Chuanrui Zhang, Zirui Liao, Jun Yang, Zhenyu Yang, Haonan Lu, Haoqian Wang

机构 * OPPO AI Center, OPPO Inc. China(OPPO AI中心,OPPO公司) The Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 提出渐进式多模态搜索智能体ProMSA,通过迭代选择图像搜索、文本搜索或停止,在显式工具调用预算和去重机制下,结合序列级强化学习优化,提升基于知识的视觉问答的检索和端到端准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27755 2026-06-29 cs.RO cs.AI 新提交 70%

Drop-Then-Recovery: How Redundant Are Vision-Language-Action Models?

丢弃-再恢复:视觉-语言-动作模型有多冗余?

Guoheng Sun, Kaixi Feng, Shwai He, Xiaochuan Gong, Yexiao He, Ziyao Wang, Zheyu Shen, Wanghao Ye, Ramana Rao Kompella, Gaowen Liu, Ang Li

机构 * University of Maryland, College Park(马里兰大学帕克分校) Cisco Research(思科研究院)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 通过提出Drop-Then-Recovery分析协议和GateProbe敏感性指标,发现VLA模型中语言骨干高度冗余,而视觉和动作路径对移除更敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27721 2026-06-29 cs.LG 新提交 70%

Learning to Reason with Curriculum II: Compositional Generalization

课程学习推理 II:组合泛化

Nived Rajaraman, Audrey Huang, Miroslav Dudik, Robert Schapire, Dylan Foster, Akshay Krishnamurthy

机构 * Microsoft Research(微软研究院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.LG

AI总结 通过递归分解序列为子问题并组合解决方案,课程学习在模拟半自动机任务中实现了比亚直接方法更优的统计复杂度,显著降低了监督需求和参考模型覆盖条件。

Comments 82 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28077 2026-06-29 cs.CV 新提交 67%

TextDS: Parameter-Efficient Representation Alignment for Scene Text Detection under Distribution Shifts

TextDS: 分布偏移下场景文本检测的参数高效表示对齐

Boyuan Chen, Zichen Dang, Chuang Yang, Lap-Pui Chau, Yi Wang

机构 * School of Electrical Engineering, Xi’an Jiaotong University(西安交通大学电气工程学院) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电机及电子工程学系)

专题命中 指令微调 :foundation model(abstract);pretraining(abstract)

AI总结 提出TextDS框架,通过视觉基础模型、逐步LoRA适应和公共子空间融合,仅用4.9M参数实现跨域和退化条件下的鲁棒场景文本检测。

Comments Accepted by ECCV 2026. Project page: https://github.com/ZChenDang/TextDS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27939 2026-06-29 cs.LG cs.AI q-bio.BM q-bio.GN 新提交 62%

Two-Stage Fine-Tuning for Protein Sequence Generation with Targeted Amino-Acid Composition

针对目标氨基酸组成的蛋白质序列生成的两阶段微调

Violeta Basten-Romero, Rubén Muñoz-Tafalla, Anna María Díaz-Rovira, Bertran Miquel-Oliver, Isaac Filella-Merce, Víctor Guallar

机构 * Barcelona Supercomputing Center (BSC)(巴塞罗那超级计算中心) Nostrum Biodiscovery S.L.(Nostrum生物发现有限公司) ICREA

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出两阶段微调方法,先领域自适应微调,再强化学习迭代微调,以生成符合目标氨基酸组成且保持序列质量的蛋白质序列。

Comments 17 pages, 5 figures, ICML 2026 Workshop GenBio

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27793 2026-06-29 cs.CL cs.AI 新提交 62%

Position Bias Correction is Insufficient for One-Pass Attention Sorting

位置偏差校正不足以实现单遍注意力排序

Qiong Tang, Xiangkun Hu, Xiangyang Liu, Yiran Chen, Yunfan Shao

机构 * Analemma

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 针对长上下文语言模型的位置偏差问题,提出去偏单遍注意力排序方法,通过估计位置偏差曲线校正注意力分数,实验表明校正效果有限,无法替代迭代排序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00809 2026-06-29 cs.LG 版本更新 57%

Foundation vs. Specialized Models: Evaluating Catastrophic Forgetting in Continual Time Series Forecasting

基础模型 vs. 专用模型:评估持续时间序列预测中的灾难性遗忘

Nouha Karaouli, Denis Coquenet, Elisa Fromont, Martial Mermillod, Marina Reyboz

机构 * Univ. Rennes, CNRS, Inria, IRISA - UMR 6074(雷恩大学, 法国国家科学研究中心, 法国国家信息与自动化研究所, 法国信息与系统研究实验室 - UMR 6074) Univ. Grenoble Alpes, Univ. Savoie Mont Blanc, CNRS, LPNC(格勒诺布尔-阿尔卑斯大学, 萨瓦大学, 法国国家科学研究中心, 认知心理学与神经心理学实验室) Univ. Grenoble Alpes, CEA, LIST(格勒诺布尔-阿尔卑斯大学, 法国原子能委员会, 信息与系统技术实验室)

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

AI总结 研究时间序列基础模型在持续微调中的灾难性遗忘,发现微调提升新任务精度但触发遗忘,而遗忘缓解技术可缩小大小模型性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27708 2026-06-29 cs.CV 新提交 50%

ZooClaw-FashionSigLIP2: Distilled Fine-tuning for Robust Fashion Retrieval

ZooClaw-FashionSigLIP2:用于鲁棒时尚检索的蒸馏微调

Siqiao Xue, Chunxue Xu

专题命中 指令微调 :foundation model(abstract)

AI总结 提出ZooClaw-FashionSigLIP2,通过全微调加知识蒸馏和权重插值,解决基础视觉语言模型适应时尚检索时的泛化损失问题,在多个基准上超越LoRA和大模型。

Comments ZooClaw Team

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17426 2026-06-29 cs.CV 版本更新 50%

SHIFT: Motion Alignment in Video Diffusion Models with Adversarial Hybrid Fine-Tuning

SHIFT: 视频扩散模型中的运动对齐与对抗混合微调

Xi Ye, Wenjia Yang, Yangyang Xu, Xiaoyang Liu, Duo Su, Mengfei Xia, Jun Zhu

机构 * Tsinghua University(清华大学) Ant Group(蚂蚁集团) University of Chinese Academy of Science(中国科学院大学)

专题命中 指令微调 :post-training(abstract)

AI总结 针对视频扩散模型微调后运动保真度下降的问题,提出基于像素通量动力学的像素运动奖励和SHIFT框架(平滑混合微调),通过对抗优势改进收敛并缓解奖励黑客,有效解决动态度坍塌。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21970 2026-06-29 cs.RO 版本更新 50%

StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision

StereoVLA:利用立体视觉增强视觉-语言-动作模型

Shengliang Deng, Mi Yan, Yixin Zheng, Jiayi Su, Wenhao Zhang, Yitao Zeng, Xiaoguang Zhao, Heming Cui, Zhizheng Zhang, He Wang

机构 * Galbot CFCS, School of CS, Peking University(北京大学计算机学院CFCS) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) The University of Hong Kong(香港大学) Xiamen University Malaysia(厦门大学马来西亚分校) Southern University of Science and Technology(南方科技大学)

专题命中 指令微调 :foundation model(abstract)

AI总结 提出StereoVLA,首个利用大规模合成立体数据引入丰富几何线索的VLA模型,通过几何与语义联合编码和协同训练目标,在真实实验中成功率绝对提升33.4%,并展现出对近半球视角的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 12 篇

2606.27472 2026-06-29 cs.CL cs.AI cs.LG 新提交 92%

Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents

Supersede: 诊断和训练LLM智能体中的记忆更新差距

Vedant Patel

机构 * Vrin Prime Intellect Hub

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文发现LLM智能体在长对话中无法有效更新事实(如用户搬家、价格变动),导致准确率从92%降至77%,并证明该差距源于记忆维护而非理解,且无法通过扩大记忆解决;为此提出Supersede强化学习环境,通过GRPO微调将小模型在真实对话中的更新准确率从9.0%提升至16.7%。

Comments 11 pages, 4 figures, 3 tables. Code, environment, model, and dataset: https://github.com/Vrin-cloud/supersede

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27580 2026-06-29 cs.LG cs.AI 新提交 90%

Retroactive Advantage Correction: Closed-Form V-Trace Bias Correction for Delay-Aware RLHF

回溯优势修正:面向延迟感知RLHF的闭式V-Trace偏差修正

Arnav Raj

专题命中 后训练与偏好优化 :RLHF(title,title_cn);分类 cs.AI、cs.LG

AI总结 针对RLHF中奖励信号延迟的问题,提出回溯优势修正(RAC),通过非负核函数队列化延迟反馈并注入优势估计,理论证明其无偏性,在表格MDP实验中偏差降低达47.9倍。

Comments Accepted at the ICML 2026 Workshop on Reinforcement Learning from World Feedback (RLxF). Code: https://github.com/deadsmash07/rac-rlxf-code

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27578 2026-06-29 cs.LG cs.AI 新提交 90%

PEBS: Per-rater Empirical-Bayes Shrinkage for RLHF Reward-Model Calibration

PEBS: 用于RLHF奖励模型校准的每评分者经验贝叶斯收缩

Arnav Raj

专题命中 后训练与偏好优化 :RLHF(title,title_cn);分类 cs.AI、cs.LG

AI总结 针对RLHF中奖励模型忽略评分者个体差异的问题,提出PEBS方法,对每个评分者拟合仿射校准器并应用经验贝叶斯收缩,在PRISM和PluriHarms数据集上分别降低RMSE 8.58%和9.66%。

Comments Accepted at the ICML 2026 Workshop on Pluralistic Alignment. Code: https://github.com/deadsmash07/pebs-pluralistic

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23075 2026-06-29 cs.LG cs.AI cs.IT math.IT stat.ML 版本更新 90%

Trust Region Masking for Long-Horizon LLM Reinforcement Learning

长程大语言模型强化学习的信任区域掩码

Yingru Li, Jiacai Liu, Jiawei Xu, Yuxuan Tong, Ziniu Li, Qian Liu, Baoxiang Wang

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM强化学习中因实现差异导致的off-policy误差随序列长度二次增长的问题,提出信任区域掩码(TRM)方法,通过掩码违反信任区域的整个序列,实现首个非平凡的长程单调改进保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27681 2026-06-29 cs.LG cs.CL 新提交 82%

Textual Belief States for World Models: Identifiable Representation Learning Under Strict Mediation

用于世界模型的文本信念状态:严格中介下的可识别表示学习

Xiang Gao, Kaiwen Dong, Yuguang Yao, Padmaja Jonnalagedda, Kamalika Das

机构 * Intuit AI Research(Intuit AI研究)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 提出严格中介原则解决LLM中历史旁路导致的潜在状态不可识别问题,引入离散文本潜在状态和因子化GRPO方法,在TextWorld和ScienceWorld上实现表示质量和滚动性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27608 2026-06-29 cs.CV cs.LG 新提交 81%

Qwen-Image-2.0-RL Technical Report

Qwen-Image-2.0-RL 技术报告

Yixian Xu, Kaiyuan Gao, Yuxiang Chen, Yilei Chen, Zecheng Tang, Zihao Liu, Zikai Zhou, Deqing Li, Hao Meng, Kuan Cao, Jiahao Li, Jie Zhang, Liang Peng, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiaoyue Chen, Yan Shu, Yanran Zhang, Yi Wang, Yu Wu, Yujia Wu, Zekai Zhang, Zhendong Wang, Xiao Xu, Kun Yan, Chenfei Wu

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 提出基于强化学习与在线蒸馏的后训练流程,通过复合奖励模型和GRPO框架提升扩散模型的视觉质量与指令遵循能力,在多个基准上取得显著提升。

Comments 16 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27739 2026-06-29 cs.LG 新提交 70%

The Weakest Link Tells It All: Outcome-Supervised Process Reward Modeling via Learnable Credit Assignment

最薄弱的环节说明一切:通过可学习信用分配的结果监督过程奖励建模

Tianyu Jia, Yue Fang, Hongxin Ding, Rihong Qiu, Zhibang Yang, Zhijing Wu, Xu Chu, Junfeng Zhao, Yasha Wang

机构 * National Engineering Research Center of Software Engineering, Peking University(北京大学软件工程国家工程研究中心) School of Computer Science, Peking University(北京大学计算机学院) Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室) GRG Banking Equipment Co., Ltd.(广电运通金融电子股份有限公司) Center on Frontiers of Computing Studies, Peking University(北京大学计算前沿研究中心) Peking University Information Technology Institute (Tianjin Binhai)(北京大学(天津滨海)信息技术研究院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出LCA框架,通过可学习信用分配解决结果监督过程奖励模型中的信用分配问题,在多个任务上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26360 2026-06-29 cs.LG cs.AI 版本更新 62%

Uncertainty-Aware Reward Discounting for Mitigating Reward Hacking

考虑不确定性的奖励折扣以缓解奖励黑客

Disha Singha

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种双源不确定性-aware奖励框架,通过建模价值估计和人类偏好中的不确定性,减少奖励黑客行为,在多个离散和连续控制环境中验证了其有效性。

Comments 46 pages, 16 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23264 2026-06-29 cs.CV cs.AI 版本更新 57%

Coloring the Noise: Adversarial Sobolev Alignment for Faithful Image Super Resolution

着色噪声:用于忠实图像超分辨率的对抗性Sobolev对齐

Hongbo Wang, Huaibo Huang, Pin Wang, Jinhua Hao, Chao Zhou, Ran He

机构 * MAIS \& NLPR, Institute of Automation, Chinese Academy of Sciences, Beijing, China School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI

AI总结 提出ASASR框架,通过将生成流重铸为Sobolev诱导的黎曼几何并引入基于Riesz表示定理的参数化对抗器,解决图像超分辨率中生成先验导致的光谱失配问题,实现忠实重建。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07533 2026-06-29 cs.AI 版本更新 57%

Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models

联合奖励建模:将思维链内化以实现高效的视觉奖励模型

Yankai Yang, Yancheng Long, Hongyang Wei, Wei Chen, Tianke Zhang, Kaiyu Jiang, Haonan Fan, Changyi Liu, Jiankang Chen, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Kuaishou Technology(快手科技)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 提出联合奖励建模(JRM),通过共享视觉-语言骨干联合优化偏好学习和语言建模,将生成模型的语义推理能力内化到判别表示中,实现快速准确评估,在MMRB2和EditReward-Bench上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27504 2026-06-29 cs.CV 新提交 50%

ReWorld: Learning Better Representations for World Action Models

ReWorld:为世界动作模型学习更好的表示

Tianze Xia, Lijun Zhou, Kaixin Xiong, Jingfeng Yao, Yu Zhu, Zhenxin Zhu, Bing Wang, Guang Chen, Hangjun Ye, Wenyu Liu, Haiyang Sun, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米汽车)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出ReWorld框架,通过优化中间表示(未来预测监督、跨模态对齐、难负样本监督)提升自动驾驶世界动作模型的规划性能,在nuScenes和NAVSIM上取得显著提升。

Comments 19 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05503 2026-06-29 cs.CE 版本更新 50%

MolFORM: Multi-modal Flow Matching for Structure-Based Drug Design

MolFORM:基于多模态流匹配的结构药物设计

Jie Huang, Daiheng Zhang

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 提出MolFORM框架,利用多流匹配联合建模离散原子类型和连续3D坐标,并通过基于直接偏好优化的偏好引导微调提升生成质量,在多个评估指标上取得一致改进。

Comments Accepted to ICML 2025 genbio workshop

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 9 篇

2601.16956 2026-06-29 cs.DC cs.AI cs.PF 交叉投稿 92%

DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers

DataStates-LLM:使用可组合状态提供器实现Transformer模型的可扩展检查点

Avinash Maurya, M. Mustafa Rafique, Franck Cappello, Bogdan Nicolae

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出DataStates-LLM架构,通过状态提供器解耦状态抽象与数据移动,利用模型参数不变性实现惰性非阻塞异步快照,在256块A100 GPU上训练70B参数模型时,检查点吞吐量提升4倍,端到端训练时间减少2.2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏