arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 257 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 257 篇

2605.30226 2026-06-09 cs.RO cs.AI 版本更新 57%

BORA: Bridging Offline Reinforcement Learning and Online Residual Adaptation for Real-World Dexterous VLA Models

BORA: 弥合离线强化学习与在线残差适应以实现真实世界灵巧VLA模型

Zhongxi Chen, Yifan Han, Yanming Shao, Huanming Liu, Congsheng Xu, Xiaoyu Chen, Yao Mu, Wenzhao Lian

机构 * Shanghai Jiao Tong University(上海交通大学) CASIA(中国科学院自动化研究所) Shanghai AI Laboratory(上海人工智能实验室) USTC(中国科学技术大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 提出BORA框架,通过离线构建动作条件价值引导的评论家,并结合在线冻结VLA基础、引入人类在环的分块残差适应机制,解决灵巧操作中高维探索导致的时间不一致、样本低效和硬件风险问题,在五个真实灵巧任务上平均成功率提升33%。

Comments 24 pages,11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02439 2026-06-09 cs.CV cs.LG 版本更新 57%

Anomaly-Preference Image Generation

异常偏好图像生成

Fuyun Wang, Yuanzhi Wang, Xu Guo, Sujia Huang, Tong Zhang, Dan Wang, Hui Yan, Xin Liu, Zhen Cui

机构 * Nanjing University of Science(南京理工大学) Beijing Normal University, Beijing, China(北京师范大学) China Academy of Space Technology, Beijing, China(中国航天科技集团)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.LG

AI总结 本文提出了一种新的异常生成方法,通过隐式偏好对齐机制和时间感知能力分配模块,提升生成图像的真实性和多样性,实验表明其在真实性和多样性上均优于现有方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21172 2026-06-09 cs.AI cs.CV 版本更新 57%

NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoning

NoRD: 一种无需推理的高数据效率视觉-语言-动作模型

Ishaan Rawal, Shubh Gupta, Yihan Hu, Wei Zhan

机构 * Applied Intuition Texas A&M University(德克萨斯大学A&M分校) UC Berkeley(伯克利加州大学)

专题命中 后训练与偏好优化 :LLM(abstract_cn);分类 cs.AI

AI总结 提出NoRD模型,通过无需推理标注和仅需<60%数据微调,结合Dr. GRPO算法克服难度偏差,实现与现有VLA模型相当的性能,显著降低数据与计算开销。

Comments Accepted to CVPR 2026. Code available at: https://github.com/Applied-Open-Source/nord

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28742 2026-06-08 cs.AI 版本更新 57%

CORE: Contrastive Reflection Enables Rapid Improvements in Reasoning

CORE: 对比反思实现推理能力的快速提升

Linas Nasvytis, Simon Jerome Han, Ben Prystawski, Satchel Grant, Noah D. Goodman, Judith E. Fan

机构 * Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 提出对比反思(CORE)非参数学习算法,通过对比成功与失败的推理轨迹生成自然语言洞察,在少量样本和 rollout 下实现比参数方法(GRPO)和非参数方法(GEPA、情景RAG、MemRL)更快的推理性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03471 2026-08-17 cs.CV 版本更新 50%

Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding

Hi-Token:用于生成式视觉定位的分层坐标分词

Xiuyuan Zhu, Ke Lu, Kun Dong, Siwen Jiao, Hao Wu, Zijin Du, Shun Mao, Dongming Zhang, Jian Xue

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 该研究提出Hi-Token分层坐标分词方法,结合基于几何的Hi-GAR奖励,在生成式视觉定位任务中提升了多模型多基准的定位性能,优于强专用基线。

Comments 15 pages, 7 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01636 2026-08-11 cs.CV 版本更新 50%

Pave-GRPO: Beyond Instantaneous Guidance through Principled Average Velocity Decomposition

Pave-GRPO:通过原则性平均速度分解超越瞬时引导

Pengyang Ling, Jiazi Bu, Yujie Zhou, Yibin Wang, Zhenyu Hu, Zihan Zhang, Yi Jin, Huaian Chen, Yuhang Zang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Harbin Institute of Technology(哈尔滨工业大学) Beihang University(北京航空航天大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 提出Pave-GRPO方法,通过原则性平均速度分解将粗粒度过渡分解为细粒度子轨迹,在不增加生成成本的情况下将奖励反馈传播到更多中间步骤,实现更全面的偏好对齐。

Comments 18 pages,9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01742 2026-08-11 cs.CV 版本更新 50%

Dense Point-to-Mask Optimization with Reinforced Point Selection for Crowd Instance Segmentation

密集点到掩码优化与强化点选择用于人群实例分割

Hongru Chen, Jiyang Huang, Jia Wan, Antoni B. Chan

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) City University of Hong Kong(香港城市大学)

专题命中 后训练与偏好优化 :foundation model(abstract)

AI总结 本文提出DPMO和RPS框架,通过整合SAM与NNEC约束及GRPO训练,实现高效人群实例分割,提升计数精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20633 2026-08-07 cs.RO 版本更新 50%

Reinforcing Action Policies by Prophesying

通过预言强化行动策略

Jiahui Zhang, Ze Huang, Chun Gu, Zipei Ma, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 ProphRL通过Prophet、FA-GRPO和FlowScale提升VLA后训练的效率与稳定性,实现机器人任务的成功率提升。

Comments https://LogosRoboticsGroup.github.io/ProphRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18557 2026-08-04 cs.CV cs.GR cs.RO 版本更新 50%

SynAgent: Generalizable Cooperative Humanoid Manipulation via Solo-to-Cooperative Agent Synergy

SynAgent:通过独狼到协作代理协同实现通用化的人形机器人操作

Wei Yao, Haohan Ma, Hongwen Zhang, Liangjun Xing, Zhile Yang, Yuanjun Guo, Yunlian Sun, Yebin Liu

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Department of Automation, Tsinghua University(清华大学自动化系) College of Artificial Intelligence, Nanjing Forestry University(南京林业大学人工智能学院)

专题命中 后训练与偏好优化 :pretraining(abstract)

AI总结 本文提出SynAgent框架,通过独狼到协作代理协同转移单agent人-物体交互技能,实现可扩展且物理合理的协作操作,实验显示其在协作模仿和轨迹条件控制方面优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31226 2026-07-29 cs.CV 版本更新 50%

ForgeDrive: Bidirectional Cross-Conditioning for Unified Visual-Action Generation in Autonomous Driving

ForgeDrive: 自动驾驶中统一视觉-动作生成的双向交叉条件

Xuchang Zhong, He Zheng, Chenxu Zhao, Tianxiong Lv, Hangqi Fan, Bohua Wang, Yushan Liu, Li Gao, Zhihao Liao, Leigang Luo, Congyang Zhao, Yang Cai

机构 * Amap, Alibaba Group(阿里巴巴集团高德地图)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出ForgeDrive统一自回归扩散框架,通过“先动作后想象”范式实现视觉与动作的双向交叉条件,解决级联误差问题,在NAVSIM上优于现有规划器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18988 2026-07-28 cs.CV 版本更新 50%

DobicVLM: Aligning Chest X-Ray Report Generation with Clinically-Grounded Programmatic Rewards via Group Relative Policy Optimization

DobicVLM:通过群体相对策略优化使胸部X光报告生成与临床基础的程序化奖励保持一致

Thanni Adewuyi, Angelica Obayi, Andem Aniekan, Samuel Okoko, Angel Ezendu, Ephraim Usani, Ademide Animasaun, Philip Chibundu, Christian Maurice, Mary Donald Essien, Oluwaseun Odunsi, Oluwasegun Oguntuase, Abiodun Adereni

机构 * Dobic Health(多比克健康公司) University of Ibadan(伊巴丹大学)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 研究针对自动胸部X光报告生成难题,提出DobicVLM模型,结合监督微调、GRPO及临床奖励,用可解释规则组件执行标准,经训练和评估,该模型多数标准优于Gemini 2.5 Flash,证明GRPO在资源受限设置中的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19356 2026-07-20 cs.CV 版本更新 50%

Rethinking Reward Signals in Video GRPO: When Scores Become Targets

重新思考视频GRPO中的奖励信号:当分数成为目标

Rui Li, Yuanzhi Liang, Ziqi Ni, Haibin Huang, Chi Zhang, Xuelong Li

机构 * University of Science and Technology of China(中国科学技术大学) Southeast University(东南大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出TaRoS框架,通过组件级评估和组内稀疏性解决GRPO中奖励信号失真问题,提升视频生成的视觉质量和对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23615 2026-07-09 cs.CV 版本更新 50%

HART: High-Resolution Annotation-Free Reasoning Technique through a Closed-loop Framework

无需标注的高分辨率大多模态模型视觉推理技术

Jiacheng Yang, Anqi Chen, Yunkai Dang, Qi Fan, Cong Wang, Wenbin Li, Feng Miao, Yang Gao

机构 * State Key Laboratory of Novel Software Technology(新型软件技术国家重点实验室) Institute of Brain-inspired Intelligence(脑启发式智能研究院) Shenzhen Research Institute of Nanjing University(南京大学深圳研究院)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 HART通过闭环框架和AP-GRPO方法,实现无需外部标注的高分辨率视觉推理,提升多模态模型在高分辨率任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19506 2026-07-01 cs.CV 版本更新 50%

Bridging Information Asymmetry: A Hierarchical Framework for Deterministic Blind Face Restoration

弥合信息不对称:一种降低不确定性的分层盲脸修复框架

Zhengjian Yao, Jiakui Hu, Kaiwen Li, Hangzhou He, Xinliang Zhang, Shuang Zeng, Lei Zhu, Yanye Lu

机构 * Biomedical Engineering Department, College of Future Technology, Peking University(北京大学未来技术学院生物医学工程系) Institute of Medical Technology, Peking University Health Science Center(北京大学医学部医学技术研究所) National Biomedical Imaging Center, Peking University(北京大学国家生物医学成像中心)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 提出Pref-Restore分层框架,通过语义信息增强、纹理保真对齐和保真约束偏好优化,降低盲脸修复中的不确定性,实现身份敏感的高保真重建。

Comments Accepted by TPAMI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05503 2026-06-29 cs.CE 版本更新 50%

MolFORM: Multi-modal Flow Matching for Structure-Based Drug Design

MolFORM:基于多模态流匹配的结构药物设计

Jie Huang, Daiheng Zhang

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 提出MolFORM框架,利用多流匹配联合建模离散原子类型和连续3D坐标,并通过基于直接偏好优化的偏好引导微调提升生成质量,在多个评估指标上取得一致改进。

Comments Accepted to ICML 2025 genbio workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14475 2026-06-23 cs.CV 版本更新 50%

GeoVista: Visually Grounded Active Perception for Vision-Language Understanding of Ultra-High-Resolution Remote Sensing Images

GeoVista: 用于超高清遥感理解的视觉引导主动感知

Jiashun Zhu, Ronghao Fu, Jiasen Hu, Jing Huang, Nachuan Xing, Bo Yang

机构 * College of Computer Science and Technology, Jilin University, China(吉林大学计算机科学与技术学院)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 GeoVista提出一种基于规划的主动感知框架,通过构建全局探索计划和分支式局部检查,实现超高清遥感图像的高效解读,提升全局上下文理解与证据聚合效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09296 2026-06-16 cs.CY 版本更新 50%

If open source is to win, it must go public

如果开源要获胜,它必须走向公共

Joshua Tan, Nicholas Vincent, Katherine Elkins, Magnus Sahlgren, Joseph Low, David Pham, Sampo Pyysalo, Jenia Jitsev

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文主张开源AI必须由公共AI补充,即建设公共基础设施和机构,以确保模型在公共利益下可访问、可持续和受治理。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏