arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-30 至 2026-06-30 共收录 603 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 51 篇

2506.02459 2026-06-30 cs.CV 67%

ReSpace: Text-Driven Autoregressive 3D Indoor Scene Synthesis and Editing

ReSpace:基于文本的自回归3D室内场景合成与编辑

Martin JJ. Bucher, Iro Armeni

机构 * Stanford University(斯坦福大学)

专题命中 指令微调 :LLM(abstract);language model(abstract)

AI总结 ReSpace通过自回归方法实现文本驱动的3D室内场景合成与编辑,具备明确房间边界和资产无关部署能力,支持通过自然语言添加、移除和交换物体,实验在物体添加和完整场景合成质量上超越现有方法。

Comments 23 pages, 17 figures, 11 tables (incl. appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29916 2026-06-30 cs.LG cs.AI 62%

EVAF: A Test-Retest Protocol for Selective Parametric Consolidation

EVAF:一种选择性参数整合的测试-重测协议

Haoliang Han

专题命中 指令微调 :language agent(abstract);分类 cs.AI、cs.LG

AI总结 提出EVAF机制和测试-重测协议,通过门控LoRA整合高价值、高意外经验,在GPT-2和TinyLlama上实现比基线更强的抗干扰行为持久性,同时保持低参数漂移和低跨角色污染。

Comments 40 pages, 17 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30414 2026-06-30 cs.LG 57%

Diffusion Fine-tuning with Rewarded Moment Matching Distillation

基于奖励矩匹配蒸馏的扩散模型微调

Alexis Jacq, Guillaume Couairon, Valentin De Bortoli, Quentin Berthet, Arnaud Doucet, Romuald Elie

机构 * Google DeepMind(谷歌DeepMind)

专题命中 指令微调 :post-training(abstract);分类 cs.LG

AI总结 提出奖励矩匹配蒸馏(RMMD)框架,同时蒸馏扩散模型并最大化奖励函数,通过在线策略训练和KL正则化实现高质量生成,在ImageNet上取得更优的FID-奖励权衡,并在气象预报模型GenCast上实现7.5倍加速且性能超越教师模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30015 2026-06-30 cs.CL 57%

Parametric Skills

参数化技能

Xuan Zhao, Haonan He, Qingyu Yang, Minglei Li, Jingqi Ye, Zelin Tan, Bo Wan, Peng Ye

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) KTH Royal Institute of Technology(皇家理工学院) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 指令微调 :LLM(abstract_cn);分类 cs.CL

AI总结 提出ParametricSkills框架,将文本技能在测试时转换为LoRA参数,解决长上下文下技能指令难以遵循的问题,在软件工程任务中平均提升6.44分。

Comments Preprint, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28370 2026-06-30 cs.IR cs.AI 57%

Conversational Query Engine for Mixed-Modality Heterogeneous Enterprise Data Sources

面向混合模态异构企业数据源的对话式查询引擎

Darshita Rathore, Vineet Kumar, Vaibhav Singal, Ankur Vivek Singh, Anindya Moitra

机构 * PayPal Artificial Intelligence(PayPal人工智能)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 提出COGNI系统,通过四层架构(索引、路由、检索、缓存)统一处理结构化与非结构化数据,实现高精度、低成本的混合模态查询。

Comments Accepted at Agent4IR @ KDD2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29208 2026-06-30 cs.CV 50%

Zero-Gated Language-conditioned Human Motion Prediction

零门控语言条件人体运动预测

Guanhui Qiao, Lu Zhou, Ding Jiang, Jinqiao Wang

专题命中 指令微调 :language model(abstract)

AI总结 提出ZGL模型,通过零初始化的可学习门控将语言描述作为语义先验注入基于DCT的时空Transformer,在Human3.6M和CMU Mocap上提升运动预测精度。

Comments 5 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28991 2026-06-30 cs.CV eess.IV 50%

Learning from Acquisition: Metadata-driven Multimodal Pre-training for Cardiac MRI

从采集信息中学习:基于元数据驱动的心脏MRI多模态预训练

Xueyi Fu, Liwei Hu, Zi Wang, Guang Yang

机构 * Department of Surgery & Cancer(外科与癌症系) Bioengineering Department and Imperial-X(生物工程系和Imperial-X) National Heart and Lung Institute(国家心脏和肺研究所) Cardiovascular Research Centre(心血管研究中心) School of Biomedical Engineering & Imaging Sciences(生物医学工程与成像科学学院)

专题命中 指令微调 :foundation model(abstract)

AI总结 提出MetaCLIP-CMR框架,将采集元数据转化为文本监督进行对比学习,在分类和分割任务上优于ImageNet和掩码重建初始化,且仅需不到1%的预训练图像量即可达到与大规模模型相当的性能。

Comments 11 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07021 2026-06-30 cs.CV 50%

ModuSeg: Decoupling Object Discovery and Semantic Retrieval for Training-Free Weakly Supervised Segmentation

ModuSeg:解耦目标发现与语义检索以实现无训练弱监督分割

Qingze He, Fagui Liu, Dengke Zhang, Qingmao Wei, Quan Tang

机构 * South China University of Technology Pengcheng Laboratory(华南理工大学鹏城实验室)

专题命中 指令微调 :foundation model(abstract)

AI总结 ModuSeg通过解耦目标发现与语义检索,提出无训练弱监督分割框架,利用通用掩码提出器和语义基础模型构建特征库,提升分割精度与鲁棒性。

Comments Accepted to ECCV 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14152 2026-06-30 cs.CV 50%

SK-Adapter: Skeleton-Based Structural Control for Native 3D Generation

SK-Adapter:基于骨架的结构控制用于原生3D生成

Anbang Wang, Yuzhuo Ao, Shangzhe Wu, Chi-Keung Tang

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出SK-Adapter框架,通过将3D骨架作为第一类控制信号,实现原生3D生成的精确结构控制,同时保留几何与纹理质量,优于现有基线方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14483 2026-06-30 cs.CV 50%

Vivid-VR: Distilling Concepts from Text-to-Video Diffusion Transformer for Photorealistic Video Restoration

Vivid-VR:基于文本到视频扩散变换器的文本概念蒸馏用于逼真视频修复

Haoran Bai, Xiaoxu Chen, Canqian Yang, Zongyao He, Sibin Deng, Ying Chen

机构 * Alibaba Group - Taobao & Tmall Group(阿里巴巴集团 - 淘宝天猫集团)

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出Vivid-VR,通过文本到视频基础模型生成视频修复方法,利用ControlNet控制生成过程以保持内容一致性。为解决传统微调中的分布偏移问题,提出概念蒸馏策略,通过预训练T2V模型合成带文本概念的训练样本,提升纹理和时间一致性。

Comments Accepted by ICLR 2026; ICLR version of the paper: https://openreview.net/pdf?id=YV5Zgv8pdg

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 24 篇

2606.30406 2026-06-30 cs.CL cs.LG 92%

MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training

MOPD: 面向LLM后训练中能力集成的多教师同策略蒸馏

Wenhan Ma, Jianyu Wei, Liang Zhao, Hailin Zhang, Bangjun Xiao, Lei Li, Qibin Yang, Bofei Gao, Yudong Wang, Rang Li, Jinhao Dong, Zhifang Sui, Fuli Luo

机构 * Peking University(北京大学) LLM Core Xiaomi(小米大模型核心团队) University of Hong Kong(香港大学) Renmin University of China(中国人民大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出多教师同策略蒸馏(MOPD)范式,通过先训练领域专家再在学生自生成数据上蒸馏,消除暴露偏差并提供密集优化信号,在Qwen3-30B-A3B上优于多种基线,并已部署于工业级模型MiMo-V2-Flash。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30445 2026-06-30 cs.LG 92%

When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon

在线模仿学习何时有助于LLM后训练?(非)可实现性超越视界的作用

Huaqing Zhang, Jingchu Gai, Juno Kim, Bingbin Liu, Andrej Risteski

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) UC Berkeley(加州大学伯克利分校) Harvard University(哈佛大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);SFT(abstract);分类 cs.LG

AI总结 本文挑战误差累积是在线模仿学习优势主要来源的观点,证明在线交互的收益关键取决于设置是否可实现,并在非可实现情况下提出奖励相关的结构特征,使在线学习仍能取得高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30642 2026-06-30 cs.SD cs.AI 92%

LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training

LeVo 2:通过层次表示建模和渐进式后训练实现稳定悦耳的歌曲生成

Shun Lei, Huaicheng Zhang, Dapeng Wu, Yaoxun Xu, Lishi Zuo, Wei Tan, Hangting Chen, Guangzheng Li, Jianwei Yu, Zhiyong Wu, Dong Yu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Tencent(腾讯) Wuhan University(武汉大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(title,abstract);SFT(abstract,abstract_cn);language model(abstract)

AI总结 提出LeVo 2混合LLM-Diffusion框架,通过层次化建模(先预测混合令牌进行语义规划,再并行预测人声和伴奏令牌)解决全曲生成中协调性与细节保真度的权衡,并引入美学引导训练策略,在主观和客观指标上超越开源基线,接近商业系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28524 2026-06-30 cs.CL 92%

Developmental Trajectories of Situation Modeling and Mentalizing in Transformer Language Models

Transformer语言模型中情境建模与心理推理的发展轨迹

Pamela D. Rivière, Cameron Jones, Sean Trott

机构 * Rutgers University - Newark(新泽西州立大学罗格斯大学-新ark分校) Stony Brook University(史泰文斯布鲁克大学)

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract)

AI总结 本文从发展视角研究大型语言模型在虚假信念任务中的表现,发现其依赖于模型大小和训练量,且后期训练提升显著,但情境建模能力先于并优于心理推理,且两者均存在脆弱性。

Comments Non-archival submission to the First Workshop on Computational Developmental Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06096 2026-06-30 cs.LG cs.CL 88%

The Alignment Auditor: A Bayesian Framework for Verifying and Refining LLM Objectives

对齐审计员:一种用于验证和细化大语言模型目标的贝叶斯框架

Matthieu Bou, Nyal Patel, Arjun Jagota, Satyapriya Krishna, Sonali Parbhoo

机构 * Imperial College London(伦敦帝国学院) Amazon AGI(亚马逊通用人工智能)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文提出一种贝叶斯框架,通过验证和细化LLM目标,解决逆强化学习中奖励函数推断的非识别性问题,提供可操作的诊断和验证政策效用的方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29296 2026-06-30 cs.AI 87%

Process Advantage Signal Shaping: A Paradigm-Agnostic Middleware for Process-Supervised RL in LLM Reasoners

过程优势信号塑形:用于LLM推理器过程监督强化学习的范式无关中间件

Chao Wang, Hongtao Tian, Tao Yang, Yunsheng Shi, Ting Yao, Wenbo Ding

机构 * Tsinghua University(清华大学) WeChat, Tencent(微信、腾讯)

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.AI

AI总结 提出PASS中间件,通过优势融合、按值分块和长度分割解决GRPO在过程监督强化学习中的通道污染、分辨率不匹配和累积陷阱问题,在数学推理和多跳问答任务上持续提升pass@1。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09305 2026-06-30 cs.LG 85%

Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation

基于强化学习的LLM推理中的奖励建模:设计、挑战与评估

Pei-Chi Pan, Yingbin Liang, Sen Lin

机构 * University of Houston(得克萨斯大学) The Ohio State University(俄亥俄州立大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文探讨了奖励建模在提升LLM推理性能中的关键作用,提出了一种以推理为中心的分类视角,分析了奖励机制、奖励黑客问题及评估挑战,旨在构建更稳健、可验证的推理模型。

Comments Accepted at Transactions on Machine Learning Research (TMLR), 2026. https://openreview.net/forum?id=TDfrN1TbGH

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29604 2026-06-30 cs.LG cs.AI 84%

Mechanistically Eliciting Latent Behaviors in Language Models

机械性地引发语言模型中的潜在行为

Andrew Mack, Nina Panickssery, Alexander Matt Turner

机构 * Principles of Intelligence(智能原理研究所) Anthropic(Anthropic公司) Independent(独立)

专题命中 后训练与偏好优化 :language model(title);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出因果扰动引发(CPE)方法,通过无监督方式发现可解释的低秩适配器,以揭示语言模型中的隐藏行为模式,并展示其在数据效率、安全评估和模型对齐方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00539 2026-06-30 cs.LG cs.AI cs.CL 83%

Distributionally Robust Reinforcement Learning with Human Feedback

具有人类反馈的分布鲁棒强化学习

Debmalya Mandal, Paulius Sasnauskas, Goran Radanovic

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

AI总结 本文提出一种分布鲁棒的强化学习方法,通过改进奖励基强化学习和直接偏好优化,提升模型在分布变化时的鲁棒性,实验显示在非分布任务中性能显著提升。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06482 2026-06-30 cs.CL cs.AI cs.LG 82%

Post-training for Efficient Communication via Convention Formation

通过形成惯例实现高效通信的后训练

Yilun Hua, Evan Wang, Yoav Artzi

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过后训练提升大语言模型在多轮交互中形成惯例的能力,设计了两项新基准测试,展示了模型在惯例形成任务上的显著提升。

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29933 2026-06-30 cs.CL 81%

Towards Physical Intuitions for Alignment Dynamics: A Case Study With Randomness Crystallization

走向对齐动力学的物理直觉:以随机性结晶为例的案例研究

Kunal Samanta, Ari Holtzman, Peter West

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 通过类比热力学相变中的结晶过程,将语言模型对齐分解为三个相,并提出直观度量验证相变,为对齐动力学提供物理直觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28898 2026-06-30 cs.CL 81%

PASTA: A Paraphrasing And Self-Training Approach for Knowledge Updating in LLMs

PASTA: 一种用于大语言模型知识更新的释义与自训练方法

Takayuki Yamamoto, Daisuke Kawahara

机构 * Waseda University(早稻田大学)

专题命中 后训练与偏好优化 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出PASTA框架,通过数据增强、问答生成和自学习DPO过程,将新闻事实知识集成到LLM中,实现知识覆盖与幻觉抑制,准确率从0.02提升至0.82。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28710 2026-06-30 cs.AI cs.GT 81%

The Two Genie Game: Adoption and Welfare in Audit-Grounded AI Governance

双精灵博弈:审计基础AI治理中的采纳与福利

Darrell Lewis-Sandy

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);分类 cs.AI

AI总结 利用进化博弈论研究在竞争市场中,最小化危害的AI代理如何取代RLHF代理,并分析其采纳条件及对社区福利的影响。

Comments 36 pages, 3 figures. Lean 4 formalization and figure scripts: https://github.com/dlewissandy/two-genie-scripts

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13977 2026-06-30 cs.RO cs.AI 79%

WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL

WoVR:基于世界模型的可靠模拟器用于训练后VLA策略的强化学习

Zhennan Jiang, Shangqing Zhou, Yutong Jiang, Zefang Huang, Mingjie Wei, Yuhui Chen, Tianxing Zhou, Zhen Guo, Hao Lin, Quanlu Zhang, Yu Wang, Haoran Li, Chao Yu, Dongbin Zhao

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 本文提出WoVR框架,通过可控动作条件视频世界模型和关键帧初始化回放提升模拟稳定性,实现稳定长周期模拟回放和有效策略优化,取得优于LIBERO的性能。

Comments 25pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29745 2026-06-30 cs.MA 78%

ECHO: Learning Epistemically Adaptive Language Agents with Turn-Level Credit

ECHO:基于回合信度的认知自适应语言智能体学习

Abhijnan Nath, Nikhil Krishnaswamy

专题命中 后训练与偏好优化 :language agent(title,abstract)

AI总结 提出认知决策过程(EDP)框架,通过回合级信度分配策略梯度目标ECHO,在证据寻求任务中提升智能体的信息获取效率与认知校准能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29713 2026-06-30 cs.CL cs.AI cs.LG 75%

SEVA: Self-Evolving Verification Agent with Process Reward for Fact Attribution

SEVA: 具有过程奖励的自进化验证代理用于事实归因

Aojie Yuan, Yi Nian, Haiyue Zhang, Zijian Su, Yue Zhao

机构 * University of Southern California, Los Angeles, USA(美国南加州大学,洛杉矶) University of Michigan, Ann Arbor, USA(美国密歇根大学,安娜堡)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SEVA,一种结构化验证代理,通过过程奖励解决多组件输出中的优势崩溃问题,实现自我进化循环,在7B模型上验证了奖励粒度必须匹配输出粒度的原则。

Comments Accepted at AI4GOOD@ICML 2026 and FAGEN@ICML 2026. Code: https://github.com/Justin0504/Verifiable_agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28707 2026-06-30 cs.AI 70%

BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards

BV-Blend: 不确定性加权历史基线用于稳定无评论家可验证奖励强化学习

Yupeng Chang, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(知识驱动人机智能工程研究中心,教育部,中国) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对GRPO在零方差组中学习停滞的问题,提出BV-Blend框架,通过语义聚类历史时刻与置信权重混合基线,稳定优势估计,提升训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12155 2026-06-30 cs.CV 67%

FAIL: Flow Matching Adversarial Imitation Learning for Image Generation

FAIL: 流匹配对抗模仿学习用于图像生成

Yeyao Ma, Chen Li, Xiaosong Zhang, Han Hu, Weidi Xie

机构 * Shanghai Jiao Tong University(上海交通大学) Xi’an Jiaotong University(西安交通大学) Tencent(腾讯)

专题命中 后训练与偏好优化 :post-training(abstract);preference optimization(abstract)

AI总结 本文提出FAIL方法,通过对抗训练最小化策略-专家差异,无需显式奖励或配对比较,在图像生成中实现高效训练与泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05329 2026-06-30 cs.SD eess.AS 67%

CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models

CosyEdit:从零样本文本到语音模型中解锁端到端语音编辑能力

Junyang Chen, Yuhang Jia, Hui Wang, Jiaming Zhou, Yong Qin

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)

AI总结 CosyEdit通过任务特定的后训练和互补训练范式,从零样本文本到语音模型中解锁端到端语音编辑能力,实现高一致性语音编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28347 2026-06-30 cs.CY cs.AI cs.LG 62%

Agentic Safety is an Epistemic Property, Not a Behavioral One

智能体安全是认知属性,而非行为属性

Charles L. Wang, Keir Dorchen, Peter Jin

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AI安全应视为认知属性,强调系统需保持可教性(teachability),即在学习、适应和自修改过程中仍能被纠正。

Comments To appear in proceedings of ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏