arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 470 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 470 篇

2607.06374 2026-07-08 cs.CV 新提交 50%

VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery

花瓶博物馆:古希腊陶器数字智能博物馆

Jiazi Wang, Nonghai Zhang, Qiushi Xie, Zeyu Zhang, Yufeng Chen, Yang Zhao, Ling Shao, Hao Tang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) School of Computer Science, Peking University(北京大学计算机科学学院) Huazhong University of Science and Technology(华中科技大学) Department of Computer Science and Information Technology, La Trobe University(拉筹伯大学计算机科学与信息技术系) UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学UCAS-Terminus人工智能实验室)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 针对古希腊陶器文化遗产领域中视觉语言模型面临的挑战,提出轻量级模块化多模态智能体框架花瓶博物馆,结合虚拟博物馆与花瓶智能体,经多模态感知等操作,提高引用有效性,减少幻觉并产生更中立答案。

Comments Code: https://github.com/AIGeeksGroup/VaseMuseum. Website: https://aigeeksgroup.github.io/VaseMuseum

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15313 2026-07-03 eess.AS cs.SD 新提交 50%

DDPO-VC: Speaker De-Identification via Diffusion Denoising Policy Optimization

DDPO-VC:基于扩散去噪策略优化的说话人去识别

Liming Wang, Cody Karjadi, Rhoda Au, James Glass

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出DDPO-VC框架,通过强化学习后训练扩散模型,利用隐私与效用教师奖励信号,在说话人去识别中平衡隐私保护与下游任务效用,优于多种强基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01191 2026-07-02 cs.CV 新提交 50%

Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning

感知到推理:解耦感知与推理用于细粒度视觉推理

Hongxing Li, Xiufeng Huang, Dingming Li, Wenjing Jiang, Zixuan Wang, Haolei Xu, Hanrong Zhang, Haiwen Hong, Longtao Huang, Hui Xue, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 提出Perceive-to-Reason (P2R)框架,将细粒度视觉推理解耦为感知和推理两阶段,并引入PRA-GRPO强化学习策略,在多个高分辨率基准上显著提升性能。

Comments Code: https://github.com/ZJU-REAL/Perceive-to-Reason

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01067 2026-07-02 cs.RO cs.CV 新提交 50%

Human-Centric Transferable Tactile Pre-Training for Dexterous Robotic Manipulation

面向灵巧机器人操作的人为中心的可迁移触觉预训练

Chi Zhang, Penglin Cai, Ziheng Xi, Haoqi Yuan, Hao Luo, Wanpeng Zhang, Sipeng Zheng, Chaoyi Xu, Zongqing Lu

机构 * Peking University(北京大学) BeingBeyond Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出H-Tac大规模触觉-动作数据集和可迁移触觉预训练(TTP)系统,通过统一触觉与动作空间弥合人机差距,利用触觉专家预测未来触觉以建模接触动力学,显著提升灵巧操作的泛化与精细控制能力。

Comments The first two authors contribute equally. Orders are decided by flipping a coin

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00622 2026-07-02 cs.CV 新提交 50%

Learning to Watch: Active Video Anomaly Understanding via Interleaved Policy Optimization

学习观察:通过交错策略优化的主动视频异常理解

Mengjingcheng Mo, Jiaxu Leng, Xinbo Gao

机构 * School of Computer Science and Technology, Chongqing University of Posts and Telecommunications, Chongqing, China(重庆邮电大学计算机科学与技术学院) School of Computer Science(计算机科学学院) Chongqing College of Artificial Intelligence, Chongqing, China(重庆人工智能学院)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 提出Anom-π闭环框架,将视频异常理解建模为主动序列决策过程,通过交错策略统一内部推理与证据获取,并设计iDPO实现轨迹级策略对齐,仅2B参数即超越大规模模型。

Comments Accepted at ICML 2026; 25 pages, 8 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31660 2026-07-01 physics.chem-ph cond-mat.mtrl-sci 新提交 50%

Contrastive Regularization of Machine Learning Potentials

机器学习势的对比正则化

Dimitrios Tzivrailis, Georgios Sotiropoulos, Alberto Rosso, Eiji Kawasaki

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 针对机器学习势在采样时产生虚假低能态的问题,提出对比正则化MSE(CRMSE),通过KL散度对比项修正分布,使采样恢复物理构象,在MD17分子上达到近定量精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27504 2026-06-29 cs.CV 新提交 50%

ReWorld: Learning Better Representations for World Action Models

ReWorld:为世界动作模型学习更好的表示

Tianze Xia, Lijun Zhou, Kaixin Xiong, Jingfeng Yao, Yu Zhu, Zhenxin Zhu, Bing Wang, Guang Chen, Hangjun Ye, Wenyu Liu, Haiyang Sun, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米汽车)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出ReWorld框架,通过优化中间表示(未来预测监督、跨模态对齐、难负样本监督)提升自动驾驶世界动作模型的规划性能,在nuScenes和NAVSIM上取得显著提升。

Comments 19 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26938 2026-06-26 cs.CV 新提交 50%

Focusing on What Matters: Saliency-Harnessing Accurate Routing for Diffusion MoE

关注重要之处:面向扩散MoE的显著性引导精确路由

Haoyou Deng, Keyu Yan, Chaojie Mao, Xiang Wang, Yu Liu, Changxin Gao, Nong Sang

机构 * Key Laboratory of Image Processing and Intelligent Control, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院图像处理与智能控制重点实验室) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 针对扩散MoE中路由无法准确分配计算资源给显著令牌的问题,提出SharpMoE后训练框架,利用干净潜在特征作为无噪声引导信号,并引入轨迹路由损失,实现精确资源分配,在视觉生成中达到最优性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26930 2026-06-26 cs.CV 新提交 50%

PortraitGen: Exemplar-Driven GRPO with Dual-Reward Guidance for Photorealistic Portrait Generation

PortraitGen: 基于示例驱动的双奖励引导GRPO的逼真肖像生成

Xiaomin Li, Qian Liang, Yinan Li, Ying Zhang, Chen Li, Jing Lyu, Huchuan Lu, Xu Jia

机构 * Dalian University of Technology(大连理工大学) University of Electronic Science and Technology of China(电子科技大学) Zhejiang University(浙江大学) WeChat, Tencent Inc.(腾讯微信)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出PortraitGen框架,通过将真实图像引入GRPO采样组并设计双奖励机制(OmniReward和AI-Portrait),有效抑制AI伪影,实现逼真肖像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26175 2026-06-26 cs.RO 新提交 50%

RMTL: Reinforced Micro-task Learning for Long-Horizon Manipulation with VLM Rewards

RMTL: 基于强化微任务学习与VLM奖励的长时域操作

Anıl Can Ateş, Orhan Kahraman, Cihan Topal

机构 * Istanbul Technical University(伊斯坦布尔理工大学)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 针对长时域操作中单提示VLM奖励信号稀疏的问题,提出RMTL方法,将任务分解为语言描述的微任务,通过多视角VLM奖励和反向课程学习加速训练,并学习层次化策略切换微任务。

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25706 2026-06-25 cs.RO 新提交 50%

Learning Asynchronous Upper-body Task-space Trajectory Tracking Policy for Humanoid Robots

学习人形机器人异步上肢任务空间轨迹跟踪策略

Yumeng Liu, Dongqi Wang, Jiyu Yu, Yijun Fan, Rong Xiong, Yue Wang

机构 * Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 针对规划与执行间的异步问题,提出异步上肢任务空间跟踪框架,通过教师-学生蒸馏初始化策略,结合滑动窗口全局奖励减少帧漂移,并利用MPC模块和自引导约束实现稀疏参考跟踪,仿真与硬件实验验证了低更新率下的优越性能。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23950 2026-06-24 cs.CV 新提交 50%

DivRL: Disentangled Self-Similarity Rewards for Diverse Subject-Driven Generation

DivRL: 解耦自相似性奖励用于多样化主题驱动生成

Qian Wang, Zhenyu Li, Abdelrahman Eldesokey, Peter Wonka

机构 * KAUST(阿卜杜拉国王科技大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出DivRL框架,通过解耦视觉特征中的负自相似性度量(nSSM)和视觉语义匹配(VSM),采用“探索-抑制”策略联合优化身份一致性与结构多样性,解决主题驱动生成中的身份-多样性悖论。

Comments Accepted to ECCV 2026. Project page: https://qianwangx.github.io/DivRL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22955 2026-06-23 cs.CV 新提交 50%

Evo-RAD: Navigating Rare Retinal Disease Diagnosis via Self-Evolving Agentic Retrieval

Evo-RAD:通过自进化代理检索导航罕见视网膜疾病诊断

Wangding Xia, Ye Du, Jiashi Lin, Meng Wang, Danli Shi, Shujun Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) Northwestern Polytechnical University(西北工业大学) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :foundation model(abstract)

AI总结 提出Evo-RAD框架,将检索增强诊断建模为马尔可夫决策过程,通过图代理动态删除不相关证据、插入病理一致样本或终止进化,利用同质性感知奖励优化,显著提升罕见视网膜疾病诊断性能。

Comments Accepted by MICCAI 2026. 10 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17470 2026-06-17 cs.CY cs.HC 新提交 50%

Self-Efficacy and Favorability Shape Learning from Tutoring Systems and Paper Practice

自我效能感和偏好影响辅导系统与纸质练习的学习效果

Xinfei Cen, Vincent Aleven, Kenneth R. Koedinger, Conrad Borchers, Paulo F. Carvalho

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 研究通过平衡被试内设计,发现低基线自我效能感的学生无论练习形式如何都获得更大学习收益,且对辅导系统的偏好与学习收益正相关,但纸质练习模式不同;基于智能辅导系统的练习并未显著提升自我效能感。

Comments Full research paper accepted at EC-TEL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10495 2026-06-16 cs.RO 新提交 50%

Act on What You See: Unlocking Safe Social Navigation in Vision-Language-Action Models

Act on What You See: 在视觉-语言-动作模型中解锁安全社交导航

Qingzi Wang, Xiyang Wu, Guangyao Shi, Dianwei Chen, Xianfeng Yang, Dinesh Manocha

机构 * University of Maryland(马里兰大学) University of Southern California(南加州大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出SALSA框架,通过两阶段无标注后训练(社交行为对齐和时间安全对齐),使预训练VLA模型利用已有表征实现安全社交导航,减少86.4%的近距离碰撞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14162 2026-06-15 cs.CV 新提交 50%

VideoWeave: Unlocking Geometric Consistency in Video Generation via Joint Geometry-Video Modeling

VideoWeave: 通过联合几何-视频建模解锁视频生成中的几何一致性

Xunzhi Xiang, Zixuan Duan, Yabo Chen, Zhengxuan Wei, Guiyu Zhang, Zixiao Gu, Zhe Gao, Haibin Huang, Chi Zhang, Qi Fan, Xuelong Li

机构 * Nanjing University(南京大学) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出VideoWeave,一种在潜在空间后训练框架,利用隐式几何模型特征约束生成分布,缓解几何重建误差,提升视频几何一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14086 2026-06-15 cs.SD 新提交 50%

Explainable and Trustworthy Speech Emotion Recognition Using Confidence Score and Reinforcement Learning Rectified Speech Emotion Descriptors

使用置信度分数和强化学习修正语音情感描述子的可解释且可信的语音情感识别

Youjun Chen, Xurong Xie, Mengzhe Geng, Zengrui Jin, Jiajun Deng, Guinan Li, Shujie Hu, Huimeng Wang, Haoning Xu, Chengxi Deng, Bowen Zhang, Xunying Liu

机构 * The Chinese University of Hong Kong(香港中文大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) National Research Council Canada(加拿大国家研究委员会) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出基于置信度分数和强化学习的在线语音情感描述子修正方法,用于后训练语音情感识别系统,在IEMOCAP和MELD上分别取得2.9%和3.3%的绝对性能提升。

Comments Accepted by Interspeech2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13676 2026-06-12 cs.CV 新提交 50%

Modality Forcing for Scalable Spatial Generation

模态强制实现可扩展的空间生成

Bardienus Pieter Duisterhof, Deva Ramanan, Jeffrey Ichnowski, Justin Johnson, Keunhong Park

机构 * Carnegie Mellon University(卡内基梅隆大学) World Labs

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出Modality Forcing方法,通过为每个模态分配独立噪声水平,实现单DiT的联合图像-深度生成,利用稀疏深度数据训练,继承T2I预训练的可扩展性,在深度估计上取得竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09486 2026-06-09 cs.MM 新提交 50%

LangRetrieval: Language-Guided Self-Evolving Satellite-to-Radar Retrieval via CSI-Driven Reward

LangRetrieval: 基于CSI驱动奖励的语言引导自进化卫星到雷达检索

Chunlei Shi, Junming Hou, Yi-Lin Wei, Jiong Wang, Yecheng Zhang, Yichao Dong, Wenqi Ren, Dan Niu

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 提出LangRetrieval框架,通过语言引导的条件流匹配和自进化语义优化,利用多阈值CSI奖励提升卫星到雷达降水检索精度。

Comments 17 pages, 9 figures. Submitted to IEEE Transactions on Image Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06556 2026-06-08 cs.RO 新提交 50%

Robots Need More than VLA and World Models

机器人需要的不仅仅是VLA和世界模型

Elis Karcini, Faisal Mehrban, Quang Nguyen, Mac Schwager, Arash Ajoudani, Cesar Cadena, Jan Peters, Marco Hutter, Haitham Bou-Ammar

机构 * Motoniq.ai Stanford University(斯坦福大学) Istituto Italiano di Tecnologia(意大利技术研究院) ETH Zurich(苏黎世联邦理工学院) Technical University of Darmstadt(德累斯顿技术大学) UCL Centre for AI(伦敦大学学院人工智能中心)

专题命中 后训练与偏好优化 :foundation model(abstract)

AI总结 本文认为机器人通用智能的关键瓶颈不仅是策略学习,还缺乏将非结构化行为数据转化为机器人可用监督的机制,并提出了四种缺失的接口组件。

详情

展开后加载摘要…

URL PDF HTML 收藏