arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2931
2601.02386 2026-01-07 cs.IR cs.AI

Tree of Preferences for Diversified Recommendation

偏好树用于多样化推荐

Hanyang Yuan, Ning Tang, Tongya Zheng, Jiarong Xu, Xintong Hu, Renhong Huang, Shunyu Liu, Jiacong Hu, Jiawei Chen, Mingli Song

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Hangzhou City University(杭州市大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出基于偏好树的多样化推荐方法,利用LLMs揭示用户未探索偏好,提升推荐多样性与相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23564 2026-01-07 cs.AI cs.CL cs.LG

ReCode: Unify Plan and Action for Universal Granularity Control

ReCode:统一计划与行动以实现通用粒度控制

Zhaoyang Yu, Jiayi Zhang, Huixue Su, Yufan Zhao, Yifan Wu, Mingyi Deng, Jinyu Xiang, Yizhang Lin, Lingxiao Tang, Yuyu Luo, Bang Liu, Chenglin Wu

机构 * DeepWisdom The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Renmin University of China(中国人民大学) Zhejiang University(浙江大学) Université de Montréal & Mila(蒙特利尔大学及Mila)

AI总结 ReCode通过递归代码生成统一规划与行动,实现通用粒度控制,提升智能体在不同决策粒度上的灵活性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02201 2026-01-06 cs.LG cs.CV

CORE: Code-based Inverse Self-Training Framework with Graph Expansion for Virtual Agents

CORE: 基于代码的逆向自训练框架与图扩展用于虚拟代理

Keyu Wang, Bingchen Miao, Wendong Bu, Yu Wu, Juncheng Li, Shengyu Zhang, Wenqiao Zhang, Siliang Tang, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Wuhan University(武汉大学)

AI总结 CORE提出一种基于代码的逆向自训练框架,通过语义代码抽象和策略图扩展,提升虚拟代理的行为多样性和泛化能力。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08873 2026-01-06 cs.AI

UCO: A Multi-Turn Interactive Reinforcement Learning Method for Adaptive Teaching with Large Language Models

UCO:一种用于基于大语言模型的自适应教学的多轮交互强化学习方法

Shouang Wei, Min Zhang, Xin Lin, Bo Jiang, Kun Kuang, Zhongxiang Dai

机构 * East China Normal University(东华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 UCO通过多轮交互强化学习方法,利用进展奖励和支架奖励函数,提升大语言模型在教育场景中的自适应教学能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10838 2026-01-06 cs.CV

Unsupervised Stereo via Multi-Baseline Geometry-Consistent Self-Training

无监督立体视觉:基于多基线几何一致性的自训练方法

Peng Xu, Zhiyu Xiang, Tingming Bai, Tianyu Pu, Kai Wang, Chaojie Ji, Zhihao Yang, Eryun Liu

机构 * College of Information Science and Electronic Engineering (ISEE) Zhejiang University, China(信息科学与电子工程学院(ISEE)浙江大学)

AI总结 S³通过多基线几何一致性自训练方法,有效解决遮挡区域的监督问题,提升立体视觉性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09040 2026-01-06 cs.CV cs.AI cs.CL

Autoregressive Semantic Visual Reconstruction Helps VLMs Understand Better

自回归语义视觉重建有助于VLMs更好地理解

Dianyi Wang, Wei Song, Yikun Wang, Siyuan Wang, Kaicheng Yu, Zhongyu Wei, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) AutoLab, Westlake University(西湖大学AutoLab) Zhejiang University(浙江大学) Shanghai AI Lab(上海人工智能实验室) University of Southern California(美国南加州大学)

AI总结 自回归语义视觉重建通过提升多模态理解能力,改进了VLMs对视觉信息的把握

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03802 2026-01-06 cs.LG cs.AI

Balancing Fidelity and Plasticity: Aligning Mixed-Precision Fine-Tuning with Linguistic Hierarchies

在保真度与可塑性之间寻求平衡:将混合精度微调与语言层次结构对齐

Changhai Zhou, Shiyang Zhang, Yuhua Zhou, Qian Qiao, Jun Gao, Shichao Weng, Weizhong Zhang, Cheng Jin

机构 * Fudan University(复旦大学) Yale University(耶鲁大学) Zhejiang University(浙江大学)

AI总结 QR-Adaptor通过联合优化量化位宽和LoRA秩,解决混合精度微调中保真度与可塑性的平衡问题,实现内存与性能的高效资源分配。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01532 2026-01-06 cs.AI cs.CL cs.LG

Aletheia: Quantifying Cognitive Conviction in Reasoning Models via Regularized Inverse Confusion Matrix

Aletheia: 通过正则化逆混淆矩阵量化推理模型中的认知信念

Fanzhe Fu

机构 * Zhejiang University(浙江大学)

AI总结 Aletheia通过正则化逆混淆矩阵量化推理模型中的认知信念,探索AI科学诚信的测量方法。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01483 2026-01-06 cs.CV

Unified Generation and Self-Verification for Vision-Language Models via Advantage Decoupled Preference Optimization

通过优势解耦偏好优化实现视觉语言模型的统一生成与自验证

Xinyu Qiu, Heng Jia, Zhengwen Zeng, Shuheng Shen, Changhua Meng, Yi Yang, Linchao Zhu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Venus Team, Ant Group(蚂蚁集团 Venus 团队)

AI总结 ADPO通过统一生成与自验证的强化学习框架,提升视觉语言模型的验证性能和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01360 2026-01-06 cs.CV cs.HC

Garment Inertial Denoiser (GID): Endowing Accurate Motion Capture via Loose IMU Denoiser

服装惯性去噪器(GID):通过松散IMU去噪实现准确的运动捕捉

Jiawei Fang, Ruonan Zheng, Xiaoxia Gao, Shifan Jiang, Anjun Chen, Qi Ye, Shihui Guo

机构 * Xiamen University(厦门大学) Zhejiang University(浙江大学)

AI总结 GID通过松散IMU去噪实现准确运动捕捉,利用位置感知专家架构和轻量级融合模块,提升惯性MoCap的准确性和泛化能力。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01352 2026-01-06 cs.CV cs.AI

Slot-ID: Identity-Preserving Video Generation from Reference Videos via Slot-Based Temporal Identity Encoding

Slot-ID: 通过基于槽的时序身份编码从参考视频中生成身份保持的视频

Yixuan Lai, He Wang, Kun Zhou, Tianjia Shao

机构 * State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室) University College London(伦敦大学学院) Zhejiang University(浙江大学)

AI总结 Slot-ID通过基于槽的时序身份编码从参考视频生成身份保持的视频,提升大姿态变化下的身份保留和视觉真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01222 2026-01-06 cs.CV

UniSH: Unifying Scene and Human Reconstruction in a Feed-Forward Pass

UniSH:在单次前向传递中统一场景和人体重建

Mengfei Li, Peng Li, Zheng Zhang, Jiahao Lu, Chengfeng Zhao, Wei Xue, Qifeng Liu, Sida Peng, Wenxiao Zhang, Wenhan Luo, Yuan Liu, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学)

AI总结 UniSH通过统一前馈框架实现场景和人体的联合重建,利用野外数据提升泛化能力,实现高保真度的3D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00998 2026-01-06 cs.CV

DVGBench: Implicit-to-Explicit Visual Grounding Benchmark in UAV Imagery with Large Vision-Language Models

DVGBench: 面向无人机影像的隐式到显式视觉 grounding 评估基准

Yue Zhou, Jue Chen, Zilun Zhang, Penghui Huang, Ran Ding, Zhentao Zou, PengFei Gao, Yuchen Wei, Ke Li, Xue Yang, Xue Jiang, Hongxin Yang, Jonathan Li

机构 * Hinton STAI Institute(Hinton STAI研究所) Key Laboratory of Geographic Information Science (Ministry of Education), East China Normal University(地理信息科学重点实验室(教育部)) School of Geospatial Artificial Intelligence, East China Normal University(地理空间人工智能学院) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Information Engineering University(信息工程大学)

AI总结 DVGBench 是一个面向无人机影像的隐式到显式视觉 grounding 评估基准,通过设计 DroneVG-R1 模型提升 LVLM 的推理能力。

Comments 20 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16760 2026-01-06 cs.RO

Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future

面向自动驾驶的视觉-语言-动作模型:过去、现在与未来

Tianshuai Hu, Xiaolu Liu, Song Wang, Yiyao Zhu, Ao Liang, Lingdong Kong, Guoyang Zhao, Zeying Gong, Jun Cen, Zhiyu Huang, Xiaoshuai Hao, Linfeng Li, Hang Song, Xiangtai Li, Jun Ma, Shaojie Shen, Jianke Zhu, Dacheng Tao, Ziwei Liu, Junwei Liang

机构 * HKUST(香港科技大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) HKUST(GZ)(香港科技大学(广州)) DAMO Academy, Alibaba(阿里巴巴达摩院) University of California, Los Angeles(加州大学洛杉矶分校) Xiaomi EV(小米电动车) Xi'an Jiaotong University(西安交通大学) Nanyang Technological University, Singapore(新加坡南洋理工大学)

AI总结 本文探讨了自动驾驶中视觉-语言-动作模型的发展历程,提出两种主要范式并分析其挑战与未来方向。

Comments Survey; 47 pages, 7 figures, 9 tables; GitHub Repo at https://github.com/worldbench/awesome-vla-for-ad

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12869 2026-01-06 cs.CE cs.CL

ERA-IT: Aligning Semantic Models with Revealed Economic Preference for Real-Time and Explainable Patent Valuation

ERA-IT:通过揭示的经济偏好对齐语义模型以实现实时和可解释的专利估值

Yongmin Yoo, Seungwoo Kim, Jingjiang Liu

机构 * School of Computing(计算学院) Macquarie University(麦考瑞大学) School of Computer Science(计算机科学学院) University of Technology Sydney(悉尼技术大学) School of Management(管理学院) Zhejiang University(浙江大学)

AI总结 ERA-IT通过揭示的经济偏好对齐语义模型,实现实时且可解释的专利估值,提升预测准确性并增强决策透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07745 2026-01-06 cs.CR cs.AI cs.SE

Chimera: Harnessing Multi-Agent LLMs for Automatic Insider Threat Simulation

Chimera: 利用多智能体大语言模型实现自动内部威胁模拟

Jiongchi Yu, Xiaofei Xie, Qiang Hu, Yuhan Ma, Ziming Zhao

机构 * Singapore Management University(新加坡管理大学) Tianjin University(天津大学) Zhejiang University(浙江大学)

AI总结 Chimera通过多智能体大语言模型生成真实企业环境中的内部威胁数据集,提升内部威胁检测的挑战性和实用性。

Comments Accepted by NDSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13201 2026-01-06 cs.CR cs.LG cs.MA

CEE: An Inference-Time Jailbreak Defense for Embodied Intelligence via Subspace Concept Rotation

CEE: 通过子空间概念旋转实现体智能中的推断时间劫持防御

Jirui Yang, Zheyu Lin, Zhihui Lu, Yinggui Wang, Lei Wang, Tao Wei, Qiang Duan, Xin Du, Shuhan Yang

机构 * Fudan University(复旦大学) Dalian University of Technology(大连理工大学) Ant Group(蚂蚁集团) Pennsylvania State University(宾夕法尼亚州立大学) Zhejiang University(浙江大学)

AI总结 CEE通过动态构建子空间并应用SLERP旋转,实现体智能系统中高效的推断时间劫持防御,提升安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01342 2026-01-06 cs.AI cs.LG

DeepFilter: A Transformer-style Framework for Accurate and Efficient Process Monitoring

DeepFilter: 一种用于准确且高效过程监控的Transformer风格框架

Hao Wang, Zhichao Chen, Licheng Pan, Xiaoyu Jiang, Yichen Song, Qunshan He, Xinggao Liu

机构 * State Key Laboratory of Industrial Control Technology, College of Control Science and Engineering, Zhejiang University(工业控制技术国家重点实验室,控制科学与工程学院,浙江大学)

AI总结 DeepFilter通过改进自注意力机制,提升过程监控的准确性和效率,为从业者提供了一个高效的基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09378 2026-01-06 cs.CY cs.CL

From Bench to Bedside: A Review of Clinical Trials in Drug Discovery and Development

从实验室到临床:药物发现与开发中临床试验的综述

Tianyang Wang, Ming Liu, Benji Peng, Xinyuan Song, Charles Zhang, Xintian Sun, Qian Niu, Junyu Liu, Silin Chen, Keyu Chen, Ming Li, Pohsun Feng, Ziqian Bi, Yunze Wang, Yichao Zhang, Cheng Fei, Lawrence KQ Yan, Ziyuan Qin, Riyang Bao, Zekun Jiang

机构 * University of Liverpool, UK(利物浦大学) Purdue University, USA(普渡大学) Georgia Institute of Technology, USA(佐治亚理工学院) Emory University, USA(埃默里大学) Simon Fraser University, Canada(Simon Fraser大学) Kyoto University, Japan(京都大学) Zhejiang University, China(浙江大学) National Taiwan Normal University, Taiwan(台湾师范大学) Indiana University, USA(印第安纳大学) University of Edinburgh, UK(爱丁堡大学) The University of Texas at Dallas, USA(德克萨斯大学达拉斯分校) University of Wisconsin-Madison, USA(威斯康星大学麦迪逊分校) The Hong Kong University of Science(香港科学大学)

AI总结 本文综述了临床试验在药物发现与开发中的关键作用,探讨了各阶段特点、挑战及未来发展方向。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10143 2026-01-06 cs.RO cs.CV eess.IV

P2U-SLAM: A Monocular Wide-FoV SLAM System Based on Point Uncertainty and Pose Uncertainty

P2U-SLAM:基于点不确定性与位姿不确定性的单目广视场SLAM系统

Yufan Zhang, Kailun Yang, Ze Wang, Kaiwei Wang

机构 * State Key Laboratory of Extreme Photonics and Instrumentation, Zhejiang University(极端光束与仪器国家重点实验室,浙江大学) National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人视觉感知与控制技术国家工程研究中心,湖南大学) State Key Laboratory of Autonomous Intelligent Unmanned Systems(自主智能无人系统国家重点实验室)

AI总结 P2U-SLAM通过引入点不确定性和位姿不确定性,提升广视场单目SLAM系统的鲁棒性和定位精度。

Comments Accepted to IEEE Transactions on Intelligent Transportation Systems (T-ITS). The source code will be made publicly available at https://github.com/BambValley/P2U-SLAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23537 2026-01-05 cs.CV cs.AI

AnyMS: Bottom-up Attention Decoupling for Layout-guided and Training-free Multi-subject Customization

AnyMS: 从下到上注意力解耦用于布局引导和无训练多主体定制

Binhe Yu, Zhen Wang, Kexin Li, Yuqian Yuan, Wenqiao Zhang, Long Chen, Juncheng Li, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) HKUST(香港科技大学) Zhejiang Tobacco Monopoly Administration(浙江烟草专卖局)

AI总结 AnyMS通过从下到上的双层注意力解耦机制,实现无训练的布局引导多主体定制,有效解决文本对齐、主体身份保持和布局控制的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11990 2026-01-05 cs.AI

Improving Autoformalization Using Direct Dependency Retrieval

通过直接依赖检索改进自动形式化

Shaoqi Wang, Lu Yu, Siwei Lou, Feng Yan, Chunjie Yang, Qing Cui, Jun Zhou

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出DDR方法,通过直接依赖检索提升声明自动形式化的精确度和召回率,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18961 2026-01-05 cs.CV

AnomalyCLIP: Object-agnostic Prompt Learning for Zero-shot Anomaly Detection

AnomalyCLIP:面向零样本异常检测的对象无关提示学习

Qihang Zhou, Guansong Pang, Yu Tian, Shibo He, Jiming Chen

机构 * Zhejiang University(浙江大学) Singapore Management University(新加坡管理学院) Harvard University(哈佛大学)

AI总结 AnomalyCLIP通过学习对象无关的文本提示,实现跨不同领域的零样本异常检测,提升异常识别的泛化能力。

Comments Accepted by ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24688 2026-01-01 cs.RO

CREPES-X: Hierarchical Bearing-Distance-Inertial Direct Cooperative Relative Pose Estimation System

CREPES-X:分层的方位-距离-惯性直接协作相对位姿估计系统

Zhehan Li, Zheng Wang, Jiadong Lu, Qi Liu, Zhiren Xun, Yue Wang, Fei Gao, Chao Xu, Yanjun Cao

机构 * State Key Laboratory of Industrial Control Technology, Institute of Cyber-Systems and Control, Zhejiang University(工业控制技术国家重点实验室,系统与控制研究所,浙江大学) Huzhou Institute of Zhejiang University(浙江大学湖州研究院) University of Michigan(密歇根大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 CREPES-X通过分层估计器实现多机器人系统的鲁棒且高效的相对位姿估计,适用于复杂环境下的高精度定位。

Comments 21 pages, 23 figures, journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24278 2026-01-01 cs.CV cs.AI

One-shot synthesis of rare gastrointestinal lesions improves diagnostic accuracy and clinical training

一次性合成罕见胃肠道病变提高诊断准确性和临床培训

Jia Yu, Yan Zhu, Peiyao Fu, Tianyi Chen, Zhihua Wang, Fei Wu, Quanlin Li, Pinghong Zhou, Shuo Wang, Xian Yang

机构 * Zhejiang University(浙江大学) Shanghai Institute for Advanced Study of Zhejiang University(浙江大学上海研究院) Digital Medical Research Center, School of Basic Medical Sciences, Fudan University(复旦大学基础医学部数字医学研究中心) Shanghai Collaborative Innovation Center of Endoscopy(上海内镜协同创新中心) Alliance Manchester Business School, The University of Manchester(曼彻斯特大学曼彻斯特商学院) Data Science Institute, Imperial College London(伦敦帝国理工学院数据科学学院)

AI总结 EndoRare通过一次性合成罕见胃肠道病变,提升诊断准确性和临床培训效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24100 2026-01-01 cs.CV

Think Before You Move: Latent Motion Reasoning for Text-to-Motion Generation

在行动前思考:用于文本到动作生成的潜在动作推理

Yijie Qian, Juncheng Wang, Yuxiang Feng, Chao Xu, Wang Lu, Yang Liu, Baigui Sun, Yiqiang Chen, Yong Liu, Shujun Wang

机构 * Zhejiang University(浙江大学) Hong Kong Polytechnic University(香港理工大学) IROOTECH TECHNOLOGY(IROOTECH技术) Wolf 1069 b Lab, Sany Group(Wolf 1069 b实验室,三一集团) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

AI总结 本文提出Latent Motion Reasoning框架,通过分阶段推理与执行提升文本到动作生成的语义与物理合理性。

Comments project page: https://chenhaoqcdyq.github.io/LMR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24074 2026-01-01 cs.CV

Balanced Hierarchical Contrastive Learning with Decoupled Queries for Fine-grained Object Detection in Remote Sensing Images

平衡的层次对比学习与解耦查询用于遥感图像的细粒度目标检测

Jingzhou Chen, Dexin Chen, Fengchao Xiong, Yuntao Qian, Liang Xiao

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology, China(南京理工大学计算机科学与工程学院) College of Computer Science, Zhejiang University, China(浙江大学计算机学院)

AI总结 本文提出平衡层次对比学习与解耦查询策略,以提升遥感图像细粒度目标检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22998 2026-01-01 cs.AI

TIM-PRM: Verifying multimodal reasoning with Tool-Integrated PRM

TIM-PRM:利用工具集成PRM验证多模态推理

Peng Kuang, Xiangxiang Wang, Wentao Liu, Jian Dong, Kaidi Xu

机构 * Zhejiang University(浙江大学) iFLYTEK AI Research Institute(iFLYTEK人工智能研究院) City University of Hong Kong(香港城市大学)

AI总结 TIM-PRM通过工具集成PRM验证多模态推理,有效解决视觉幻觉和逻辑不一致问题,实验表明其在性能和可解释性上优于现有模型。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22693 2026-01-01 cs.CV

VADTree: Explainable Training-Free Video Anomaly Detection via Hierarchical Granularity-Aware Tree

VADTree: 通过分层粒度感知树实现可解释的无训练视频异常检测

Wenlong Li, Yifei Xu, Yuan Rao, Zhenhua Wang, Shuiguang Deng

机构 * School of Software, Xi’an Jiaotong University(西安交通大学软件学院) China Railway Xi’an Group(中国铁路西安集团) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 VADTree通过分层粒度感知树结构实现无训练视频异常检测,利用预训练模型知识和多维先验提升异常感知与推理能力。

Comments NeurIPS 2025 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23457 2025-12-30 cs.AI cs.CL cs.LG

Replay Failures as Successes: Sample-Efficient Reinforcement Learning for Instruction Following

重播失败作为成功:用于指令跟随的样本高效强化学习

Kongcheng Zhang, Qi Yao, Shunyu Liu, Wenjian Zhang, Min Cen, Yang Zhou, Wenkai Fang, Yiru Zhao, Baisheng Lai, Mingli Song

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Dalian University of Technology(大连理工大学) University of Science and Technology of China(中国科学技术大学) Alibaba Cloud Computing(阿里云计算) Chinese Academy of Sciences(中国科学院)

AI总结 HiR 提出了一种样本高效强化学习框架,通过将失败尝试视为成功来提升指令跟随任务的性能,利用双偏好学习实现高效优化。

详情

展开后加载摘要…

URL PDF HTML 收藏