arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11359 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 494 篇

2606.08414 2026-06-09 cs.RO cs.AI 新提交 57%

PACT: Self-Evolving Physical Safety Alignment for Diffusion Policies in Embodied Manipulation

PACT: 具身操作中扩散策略的自我演化物理安全对齐

Lingxuan Wu, Zijian Zhu, Lizhong Wang, Chengyang Ying, Huayu Chen, Xiao Yang, Fangming Liu, Jun Zhu

机构 * Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University, Beijing, 100084, China(计算机科学与技术系,人工智能研究院,清华-博世联合机器学习中心,THBI实验室,BNRist中心,清华大学,北京,100084,中国) Peng Cheng Laboratory, 518108, China(鹏城实验室,518108,中国)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 提出PACT框架,通过自演化后训练将预训练扩散策略投影到约束可行区域,无需演示数据或任务奖励,在降低31.0%安全违规的同时提升30.7%任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17235 2026-08-19 eess.SY cs.SY 新提交 50%

Safe Deep Reinforcement Learning for Energy-Efficient HVAC Control in Multi-Zone Residential Buildings

面向多区域住宅建筑节能HVAC控制的安全深度强化学习

Oussama Ziadi, Abdelilah Rochd, Samir Idrissi Kaitouni, Mohamed Oualid Mghazli, Adnane Saoud

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 该研究针对多区域住宅建筑HVAC控制的能耗-安全问题,提出带安全认证的深度强化学习框架,在仿真中训练PPO与SAC智能体,验证了其在降低能耗、减少舒适度违规方面的有效性及安全保证的可行性。

Comments 6 pages, 5 figures. Accepted to IEEE Conference on Control Technology and Applications (CCTA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16887 2026-08-18 cs.CV 新提交 50%

An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models

像素空间文本到图像扩散模型训练的实证研究

Dengyang Jiang, Ruoyi Du, Zhennan Chen, Dongyang Liu, Zanyi Wang, Mingzhe Zheng, Xiangpeng Yang, Huanqia Cai, Aiming Hao, Yuming Jiang, Peng Gao, Harry Yang, Steven Hoi

机构 * Alibaba Token Hub(阿里巴巴令牌中心) Alibaba Group(阿里巴巴集团) Nanjing University(南京大学) University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文通过实证研究提出潜空间到像素空间的训练策略,确定关键设计选择,使像素空间文本到图像扩散模型性能媲美或超越潜空间模型,且推理加速3.18至4.75倍,为相关研究提供实用指南。

Comments Z-Image-Pixel & Empirical Insight of Training Pixel-Space Diffusion Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15452 2026-08-18 cs.CV 新提交 50%

Spatially-Grounded Flow Matching: Structured Source Distributions for Image Generation

空间接地流匹配:用于图像生成的结构化源分布

Arman Zarei, Mahdi M. Kalayeh

机构 * University of Maryland(马里兰大学) Netflix(网飞公司)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 针对流匹配模型源分布缺乏空间结构的问题,提出StructFlow将空间局部性编码到源分布,可提升图像生成质量与局部可控重合成性能,且能集成到大型预训练模型中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13026 2026-08-14 cs.RO 新提交 50%

Temporal GRPO: Beyond Trajectory-Level Credit in Vision-Language-Action Reinforcement Learning

时间差分GRPO:超越视觉-语言-动作强化学习中的轨迹级信用分配

Yao Zhou, Hang Gao, Fengge Wu, Changwen Zheng, Wenwen Qiang

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 针对视觉-语言-动作强化学习中轨迹级信用混叠问题,提出时间差分GRPO方法,在RoboTwin 2.0和LIBERO-Long上提升了任务性能与样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11205 2026-08-12 cs.CV 新提交 50%

AdvFD: Boosting Visual Generation via Adversarial Fr'echet Distance Loss

AdvFD:通过对抗性Fréchet距离损失提升视觉生成性能

Mingju Gao, Jingkai Zhou, Kun Gai, Changqian Yu, Hao Tang

机构 * Peking University(北京大学) KlingAI(可灵AI)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本研究提出AdvFD算法,通过补充静态Fréchet损失的对抗学习表示并引入真实特征白化,解决Fréchet攻击问题,提升了JiT、pMF等骨干网络的单步生成器后训练性能。

Comments Project Page: https://gasaiyu.github.io/AdvFD-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07409 2026-08-10 cs.CV 新提交 50%

UniJEPA: A Unified Joint-Embedding Predictive Architecture for Task-Agnostic Visual World Modeling

UniJEPA:面向任务无关视觉世界建模的统一联合嵌入预测架构

An Lanji, Dawei Liu, Jin Li, Haoran Xu, Mei Chen, Yu Tian

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 UniJEPA是统一JEPAs,共享潜在空间联合学习图像级与视频级预测,抗坍塌,经后训练可零样本规划,在多基准上性能相当或更优,规划速度更快。

Comments 10 pages, 7 figures; Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06768 2026-08-10 cs.CV 新提交 50%

Explore or Converge? Stage-Guided Per-Step Optimization for Diffusion Models

探索还是收敛?面向扩散模型的阶段引导式逐步优化方法

Renye Yan, Jikang Cheng, You Wu, Wei Peng, Zongwei Wang, Ling Liang, Yimao Cai

机构 * Peking University(北京大学) Nanjing University(南京大学) Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 针对扩散模型RL偏好对齐的奖励不匹配问题,提出SGPO方法,通过分阶段分配目标,使生成质量提升26.7%、收敛速度提高36.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04809 2026-08-06 cs.IR 新提交 50%

DEGR: Dual Exploration-Driven Generative Re-Ranking for Adaptive Cross-Request Context Bridging

DEGR:双探索驱动的生成重排序方法,用于自适应跨请求上下文桥接

Binglei Zhao, Xuanhua Yang, Xiwei Zhao, Sulong Xu

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 针对工业推荐系统重排序受上游供给限制的问题,提出DEGR方法,通过双探索驱动的混合优化范式实现自适应跨请求上下文桥接,在京东电商推荐系统中较SOTA方法取得UCTR最高1.22%、PV0.20%的提升。

Comments Accepted by KDD2026 ADS Track, 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02197 2026-08-04 cs.RO 新提交 50%

Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models

关注关键区域:面向视觉-语言-动作模型的自适应视觉细化

Jin Cui, Yanbin Hu, Xinyue Long, Linkai Li, Boran Zhao, Pengju Ren

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 针对VLA模型视觉表示不可靠的问题,提出AtVLA框架,结合注意力校正与不确定性门控局部细化,在多基准测试中显著提升机器人操作成功率且计算开销可控。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00816 2026-08-04 cs.IR 新提交 50%

Exponential Reward Weighting for Fine-Tuning Generative Recommenders under Sparse and Noisy Feedback

稀疏且含噪反馈下生成式推荐器微调的指数奖励加权方法

Keertana Chidambaram, Sanath Kumar Krishnamurthy, Qiuling Xu, Ko-Jen Hsiao, Moumita Bhattacharya

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 针对稀疏含噪反馈下生成式推荐器的过优化问题,提出Exp-RSFT方法,通过指数奖励加权和温度λ平衡覆盖与噪声成本,在多数据集上验证其优于PPO、DPO,可提升排序性能且无需额外数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00750 2026-08-04 cs.IR 新提交 50%

Hierarchical Residual Policy Optimization for Generative Recommendations

用于生成式推荐的分层残差策略优化

Kaifeng Guo, Yiming Yang, Jingtong Gao, Guolei Zeng, Fukang Yang, Yukang Liang, Peng Jiang, Qingpeng Cai, Xiangyu Zhao

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 针对生成式推荐器后训练中标记级信用分配问题,提出HRPO框架,将项目级结果转换为标记对齐学习信号,经实验在会话效用和业务指标上取得提升。

Comments 12 pages, 6 figures, 10 tables. Accepted at KDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00502 2026-08-04 cs.CV 新提交 50%

SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance

SpatialAfford:教紧凑视觉语言模型(VLMs)关注何处与定位何处以实现 affordance

Yufei Zhang, Chenlu Zhan, Donghui Sun, Xiaoxin Chen, Hongwei Wang

机构 * Zhejiang University(浙江大学) Vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 SpatialAfford 是一个两阶段框架,通过空间注意力对齐和空间感知 GRPO,使紧凑 4B VLMs 在多个基准上的 affordance 定位性能优于更强的 7B+ 基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27061 2026-07-30 cond-mat.stat-mech math-ph math.MP physics.data-an 新提交 50%

Neural variational framework for random Young-diagram limit shapes

随机杨图极限形状的神经变分框架

Qian Chen, Bo-Xuan Ge

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 该研究提出适配随机杨图系综结构与尺度的保持结构神经变分框架,在多类系综上验证后,用于研究无解析鞍形的四次变形钩长系综,为变形依赖的宏观鞍形族提供数值证据。

Comments 38 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25258 2026-07-29 q-fin.RM q-fin.CP q-fin.PR 新提交 50%

Robust Hedging Valuation Adjustment for Deep Hedging Policies under Market Frictions

市场摩擦下深度套期保值策略的稳健套期保值估值调整

Takayuki Sakuma

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 研究在市场摩擦下对衍生品头寸套期保值的交易规则,应用稳健套期保值估值调整,结合资金和保证金附加项评估跟踪损失CVaR,在不同流动性市场比较经典与学习到的套期保值规范,给出不同风险预算下的选择建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22270 2026-07-27 cs.SE 新提交 50%

Comparing and Conceptualizing Data Protection Requirements Worldwide for Privacy Regulatory Compliance

全球范围内隐私监管合规的数据保护要求比较与概念化

Claudia Negri-Ribalta, Lorena Sanchez Chamorro, Ioana Visescu, Muriel Frank, Anastasia Sergeeva, Alberto García, Rene Noel

专题命中 后训练与偏好优化 :prompting(abstract)

AI总结 本文从法律专家角度,通过访谈和法规分析,识别全球通用及不同的数据保护要求,回答相关问题,并转化为数据保护官故事,助力组织管理跨境个人数据流动的监管合规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21722 2026-07-27 cs.CV 新提交 50%

Be Consistent! Enhancing Robust Visual Reasoning in LVLMs with Consistency Constraints

保持一致!利用一致性约束增强大视觉语言模型中的鲁棒视觉推理

Liqiang Jing, Xiong Zhou, Siddharth Varia, Neha Anna John, Xinya Du, Vassilis N. Ioannidis

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Amazon Web Services(亚马逊网络服务公司)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 研究针对LVLMs在视觉推理任务中较脆弱的问题,引入ConVBench基准及逻辑一致性等评估指标,提出ConVLM,通过基于GRPO的强化学习及一致性奖励改进LVLM推理,利用自动生成的问答对和双重奖励设计提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13931 2026-07-16 cs.CV 新提交 50%

SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning

SIVA-RL:用于多模态强化学习的灵敏度不变视觉对齐

Cheng Tang, Junzhi Ning, Min Cen, Wei Li, Xinyi Zeng, Pinxian Zeng, Rongbin Li, Qiming Zhu, Yuqiang Li, Junjun He, Yirong Chen, Ming Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Macau(澳门大学)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 研究多模态强化学习中视觉语言模型预测与视觉证据结合问题,提出SIVA-RL框架,通过特定方法构建局部干预并以奖励下降为权重驱动对齐,在多基准测试中相比基线改进了模型。

Comments 27 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06374 2026-07-08 cs.CV 新提交 50%

VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery

花瓶博物馆:古希腊陶器数字智能博物馆

Jiazi Wang, Nonghai Zhang, Qiushi Xie, Zeyu Zhang, Yufeng Chen, Yang Zhao, Ling Shao, Hao Tang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) School of Computer Science, Peking University(北京大学计算机科学学院) Huazhong University of Science and Technology(华中科技大学) Department of Computer Science and Information Technology, La Trobe University(拉筹伯大学计算机科学与信息技术系) UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学UCAS-Terminus人工智能实验室)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 针对古希腊陶器文化遗产领域中视觉语言模型面临的挑战,提出轻量级模块化多模态智能体框架花瓶博物馆,结合虚拟博物馆与花瓶智能体,经多模态感知等操作,提高引用有效性,减少幻觉并产生更中立答案。

Comments Code: https://github.com/AIGeeksGroup/VaseMuseum. Website: https://aigeeksgroup.github.io/VaseMuseum

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15313 2026-07-03 eess.AS cs.SD 新提交 50%

DDPO-VC: Speaker De-Identification via Diffusion Denoising Policy Optimization

DDPO-VC:基于扩散去噪策略优化的说话人去识别

Liming Wang, Cody Karjadi, Rhoda Au, James Glass

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出DDPO-VC框架,通过强化学习后训练扩散模型,利用隐私与效用教师奖励信号,在说话人去识别中平衡隐私保护与下游任务效用,优于多种强基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01191 2026-07-02 cs.CV 新提交 50%

Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning

感知到推理:解耦感知与推理用于细粒度视觉推理

Hongxing Li, Xiufeng Huang, Dingming Li, Wenjing Jiang, Zixuan Wang, Haolei Xu, Hanrong Zhang, Haiwen Hong, Longtao Huang, Hui Xue, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 提出Perceive-to-Reason (P2R)框架,将细粒度视觉推理解耦为感知和推理两阶段,并引入PRA-GRPO强化学习策略,在多个高分辨率基准上显著提升性能。

Comments Code: https://github.com/ZJU-REAL/Perceive-to-Reason

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01067 2026-07-02 cs.RO cs.CV 新提交 50%

Human-Centric Transferable Tactile Pre-Training for Dexterous Robotic Manipulation

面向灵巧机器人操作的人为中心的可迁移触觉预训练

Chi Zhang, Penglin Cai, Ziheng Xi, Haoqi Yuan, Hao Luo, Wanpeng Zhang, Sipeng Zheng, Chaoyi Xu, Zongqing Lu

机构 * Peking University(北京大学) BeingBeyond Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出H-Tac大规模触觉-动作数据集和可迁移触觉预训练(TTP)系统,通过统一触觉与动作空间弥合人机差距,利用触觉专家预测未来触觉以建模接触动力学,显著提升灵巧操作的泛化与精细控制能力。

Comments The first two authors contribute equally. Orders are decided by flipping a coin

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00622 2026-07-02 cs.CV 新提交 50%

Learning to Watch: Active Video Anomaly Understanding via Interleaved Policy Optimization

学习观察:通过交错策略优化的主动视频异常理解

Mengjingcheng Mo, Jiaxu Leng, Xinbo Gao

机构 * School of Computer Science and Technology, Chongqing University of Posts and Telecommunications, Chongqing, China(重庆邮电大学计算机科学与技术学院) School of Computer Science(计算机科学学院) Chongqing College of Artificial Intelligence, Chongqing, China(重庆人工智能学院)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 提出Anom-π闭环框架,将视频异常理解建模为主动序列决策过程,通过交错策略统一内部推理与证据获取,并设计iDPO实现轨迹级策略对齐,仅2B参数即超越大规模模型。

Comments Accepted at ICML 2026; 25 pages, 8 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31660 2026-07-01 physics.chem-ph cond-mat.mtrl-sci 新提交 50%

Contrastive Regularization of Machine Learning Potentials

机器学习势的对比正则化

Dimitrios Tzivrailis, Georgios Sotiropoulos, Alberto Rosso, Eiji Kawasaki

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 针对机器学习势在采样时产生虚假低能态的问题,提出对比正则化MSE(CRMSE),通过KL散度对比项修正分布,使采样恢复物理构象,在MD17分子上达到近定量精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27504 2026-06-29 cs.CV 新提交 50%

ReWorld: Learning Better Representations for World Action Models

ReWorld:为世界动作模型学习更好的表示

Tianze Xia, Lijun Zhou, Kaixin Xiong, Jingfeng Yao, Yu Zhu, Zhenxin Zhu, Bing Wang, Guang Chen, Hangjun Ye, Wenyu Liu, Haiyang Sun, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米汽车)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出ReWorld框架,通过优化中间表示(未来预测监督、跨模态对齐、难负样本监督)提升自动驾驶世界动作模型的规划性能,在nuScenes和NAVSIM上取得显著提升。

Comments 19 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26938 2026-06-26 cs.CV 新提交 50%

Focusing on What Matters: Saliency-Harnessing Accurate Routing for Diffusion MoE

关注重要之处:面向扩散MoE的显著性引导精确路由

Haoyou Deng, Keyu Yan, Chaojie Mao, Xiang Wang, Yu Liu, Changxin Gao, Nong Sang

机构 * Key Laboratory of Image Processing and Intelligent Control, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院图像处理与智能控制重点实验室) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 针对扩散MoE中路由无法准确分配计算资源给显著令牌的问题,提出SharpMoE后训练框架,利用干净潜在特征作为无噪声引导信号,并引入轨迹路由损失,实现精确资源分配,在视觉生成中达到最优性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26930 2026-06-26 cs.CV 新提交 50%

PortraitGen: Exemplar-Driven GRPO with Dual-Reward Guidance for Photorealistic Portrait Generation

PortraitGen: 基于示例驱动的双奖励引导GRPO的逼真肖像生成

Xiaomin Li, Qian Liang, Yinan Li, Ying Zhang, Chen Li, Jing Lyu, Huchuan Lu, Xu Jia

机构 * Dalian University of Technology(大连理工大学) University of Electronic Science and Technology of China(电子科技大学) Zhejiang University(浙江大学) WeChat, Tencent Inc.(腾讯微信)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出PortraitGen框架,通过将真实图像引入GRPO采样组并设计双奖励机制(OmniReward和AI-Portrait),有效抑制AI伪影,实现逼真肖像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26175 2026-06-26 cs.RO 新提交 50%

RMTL: Reinforced Micro-task Learning for Long-Horizon Manipulation with VLM Rewards

RMTL: 基于强化微任务学习与VLM奖励的长时域操作

Anıl Can Ateş, Orhan Kahraman, Cihan Topal

机构 * Istanbul Technical University(伊斯坦布尔理工大学)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 针对长时域操作中单提示VLM奖励信号稀疏的问题,提出RMTL方法,将任务分解为语言描述的微任务,通过多视角VLM奖励和反向课程学习加速训练,并学习层次化策略切换微任务。

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25706 2026-06-25 cs.RO 新提交 50%

Learning Asynchronous Upper-body Task-space Trajectory Tracking Policy for Humanoid Robots

学习人形机器人异步上肢任务空间轨迹跟踪策略

Yumeng Liu, Dongqi Wang, Jiyu Yu, Yijun Fan, Rong Xiong, Yue Wang

机构 * Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 针对规划与执行间的异步问题,提出异步上肢任务空间跟踪框架,通过教师-学生蒸馏初始化策略,结合滑动窗口全局奖励减少帧漂移,并利用MPC模块和自引导约束实现稀疏参考跟踪,仿真与硬件实验验证了低更新率下的优越性能。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23950 2026-06-24 cs.CV 新提交 50%

DivRL: Disentangled Self-Similarity Rewards for Diverse Subject-Driven Generation

DivRL: 解耦自相似性奖励用于多样化主题驱动生成

Qian Wang, Zhenyu Li, Abdelrahman Eldesokey, Peter Wonka

机构 * KAUST(阿卜杜拉国王科技大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出DivRL框架,通过解耦视觉特征中的负自相似性度量(nSSM)和视觉语义匹配(VSM),采用“探索-抑制”策略联合优化身份一致性与结构多样性,解决主题驱动生成中的身份-多样性悖论。

Comments Accepted to ECCV 2026. Project page: https://qianwangx.github.io/DivRL/

详情

展开后加载摘要…

URL PDF HTML 收藏