arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2931
2602.01875 2026-02-03 cs.CL

PretrainRL: Alleviating Factuality Hallucination of Large Language Models at the Beginning

PretrainRL: 缓解大语言模型在开始阶段的事实性幻觉

Langming Liu, Kangtao Lv, Haibin Chen, Weidong Zhang, Yejing Wang, Shilei Liu, Xin Tong, Yujin Yuan, Yongwei Wang, Wenbo Su, Bo Zheng

机构 * Future Living Lab of Alibaba(阿里巴巴未来生活实验室) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 PretrainRL通过在预训练阶段引入强化学习,缓解大语言模型在开始阶段的事实性幻觉问题,通过去偏见和学习机制提升事实准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01853 2026-02-03 cs.LG stat.ME stat.ML

Designing Time Series Experiments in A/B Testing with Transformer Reinforcement Learning

在A/B测试中设计时间序列实验的Transformer强化学习

Xiangkun Wu, Qianglin Wen, Yingying Zhang, Hongtu Zhu, Ting Li, Chengchun Shi

机构 * School of Mathematical Sciences(数学科学学院) Zhejiang University(浙江大学) Yunnan Key Laboratory of Statistical Modeling and Data Analysis(云南统计建模与数据分析重点实验室) Yunnan University(云南大学) School of Statistics(统计学系) East China Normal University(华东师范大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) London School of Economics and Political Science(伦敦政治经济学院)

AI总结 本文提出基于Transformer的强化学习方法,用于在A/B测试中设计时间序列实验,通过充分利用历史记录和直接优化均方误差,提升实验设计效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01816 2026-02-03 cs.CV

Seeing Is Believing? A Benchmark for Multimodal Large Language Models on Visual Illusions and Anomalies

看见即相信?多模态大语言模型在视觉错觉和异常上的基准测试

Wenjin Hou, Wei Liu, Han Hu, Xiaoxiao Sun, Serena Yeung-Levy, Hehe Fan

机构 * Zhejiang University(浙江大学) Tencent Hunyuan Team(腾讯文言团队) Stanford University(斯坦福大学)

AI总结 本文提出VIA-Bench基准测试,评估多模态大语言模型在视觉错觉和异常上的性能,揭示其在复杂视觉任务中的鲁棒性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01814 2026-02-03 cs.CV

GPD: Guided Progressive Distillation for Fast and High-Quality Video Generation

GPD: 用于快速高质量视频生成的引导渐进蒸馏

Xiao Liang, Yunzhu Zhang, Linchao Zhu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 GPD通过引导渐进蒸馏方法,减少视频生成的采样步骤,同时保持高质量输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01778 2026-02-03 cs.CL

Data Distribution Matters: A Data-Centric Perspective on Context Compression for Large Language Model

数据分布至关重要:一种以数据为中心的视角来探讨大型语言模型中的上下文压缩

Kangtao Lv, Jiwei Tang, Langming Liu, Haibin Chen, Weidong Zhang, Shilei Liu, Yongwei Wang, Yujin Yuan, Wenbo Su, Bo Zheng

机构 * Future Living Lab of Alibaba(阿里巴巴未来生活实验室) Tsinghua University(清华大学) Zhejiang University(浙江大学)

AI总结 本文从数据分布角度探讨了大型语言模型中的上下文压缩问题,发现输入熵与压缩质量负相关,而内在数据差距影响压缩增益,提出优化压缩的实用指南。

Comments 15 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01725 2026-02-03 cs.CL cs.AI cs.LG

SafePred: A Predictive Guardrail for Computer-Using Agents via World Models

SafePred: 通过世界模型为计算机使用代理构建一种预测性防护措施

Yurun Chen, Zeyi Liao, Ping Yin, Taotao Xie, Keting Yin, Shengyu Zhang

机构 * Zhejiang University, China(浙江大学) The Ohio State University, USA(俄亥俄州立大学)

AI总结 SafePred通过世界模型预测未来风险,构建风险到决策的循环,提升计算机使用代理的安全性和任务效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01640 2026-02-03 cs.CL

A2Eval: Agentic and Automated Evaluation for Embodied Brain

A2Eval: 基于代理的自动评估用于具身脑

Shuai Zhang, Jiayu Hu, Zijie Chen, Zeyuan Ding, Yi Zhang, Yingji Zhang, Ziyi Zhou, Junwei Liao, Shengjie Zhou, Yong Dai, Zhenzhong Lan, Xiaozhu Ju

机构 * Zhejiang University, China(浙江大学) Westlake University, China(西湖大学) Beijing Innovation Center of Humanoid Robotics, China(北京人形机器人创新中心) University of Manchester, UK(曼彻斯特大学) Southern University of Science(南方科技大学) Xiamen University Malaysia, Malaysia(厦门大学马来西亚分校)

AI总结 A2Eval提出首个基于代理的自动评估框架,通过两个协作代理自动化基准编纂和评估,显著提升评估效率并减少成本,同时保持高保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01634 2026-02-03 eess.AS cs.AI

HuPER: A Human-Inspired Framework for Phonetic Perception

HuPER:一种受人类启发的语音感知框架

Chenxu Guo, Jiachen Lian, Yisi Liu, Baihe Huang, Shriyaa Narayanan, Cheol Jun Cho, Gopala Anumanchipalli

机构 * Zhejiang University, China(浙江大学) University of California, Berkeley, USA(加州大学伯克利分校)

AI总结 HuPER是一种受人类启发的语音感知框架,通过自适应推断实现高效语音识别,仅需100小时训练数据即可在多个语言基准中取得最佳性能,并支持跨语言零样本迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24408 2026-02-03 cs.CV

DyStream: Streaming Dyadic Talking Heads Generation via Flow Matching-based Autoregressive Model

DyStream: 通过基于流匹配的自回归模型实现流式双人谈话头生成

Bohong Chen, Haiyang Liu

机构 * Zhejiang University(浙江大学) The University of Tokyo(东京大学)

AI总结 DyStream通过基于流匹配的自回归模型实现双人谈话头视频的实时生成,有效降低延迟并提升唇同步质量。

Comments Project Page: https://robinwitch.github.io/DyStream-Page

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02426 2026-02-03 cs.CL cs.LG

Learning to Evolve: Bayesian-Guided Continual Knowledge Graph Embedding

学习进化:贝叶斯引导的持续知识图谱嵌入

Linyu Li, Zhi Jin, Yuanpeng He, Dongming Jin, Yichi Zhang, Haoran Duan, Xuan Zhang, Zhengwei Tao, Nyima Tash

机构 * Peking University(北京大学) Zhejiang University(浙江大学) Wuhan University(武汉大学) Yunnan University(云南大学) Tibet University(西藏大学)

AI总结 BAKE通过贝叶斯推断和持续聚类方法,有效解决持续知识图谱嵌入中的灾难性遗忘问题,实现对动态数据的持续学习与知识保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01340 2026-02-03 cs.CV

MTC-VAE: Multi-Level Temporal Compression with Content Awareness

MTC-VAE:具有内容意识的多级时间压缩

Yubo Dong, Linchao Zhu

机构 * ReLER, CCAI, Zhejiang University(ReLER、CCAI、浙江大学)

AI总结 MTC-VAE通过多级时间压缩技术提升视频压缩效率,结合内容意识方法实现高效压缩与性能优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01182 2026-02-03 cs.LG

Analyzing and Improving Diffusion Models for Time-Series Data Imputation: A Proximal Recursion Perspective

分析和改进用于时间序列数据插补的扩散模型:从近端递归的角度

Zhichao Chen, Hao Wang, Fangyikang Wang, Licheng Pan, Zhengnan Li, Yunfei Teng, Haoxuan Li, Zhouchen Lin

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(人工智能国家重点实验室、智能科学与技术学院、北京大学) Zhejiang University(浙江大学) Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Center for Data Science, Peking University(北京大学数据科学中心) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Pazhou Laboratory (Huangpu), Guangzhou, China(黄埔实验室(华南))

AI总结 本文从近端递归角度提出SPIRIT框架,通过引入熵诱导的Bregman分歧和半近端传输正则化,改进扩散模型在时间序列数据插补中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01156 2026-02-03 cs.LG cs.RO

PolicyFlow: Policy Optimization with Continuous Normalizing Flow in Reinforcement Learning

PolicyFlow: 在强化学习中使用连续归一化流进行策略优化

Shunpeng Yang, Ben Liu, Hua Chen

机构 * Hong Kong University of Science and Technology(香港科技大学) Southern University of Science and Technology(南方科技大学) Zhejiang University-University of Illinois Urbana-Champaign Institute(浙江大学-伊利诺伊大学厄巴纳-香槟分校联合研究所) LimX Dynamics

AI总结 PolicyFlow是一种基于连续归一化流的在线强化学习算法,通过减少似然计算开销实现稳定训练,并通过布朗正则化器促进多样化行为。

Comments Submitted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01118 2026-02-03 cs.CV

LightCity: An Urban Dataset for Outdoor Inverse Rendering and Reconstruction under Multi-illumination Conditions

LightCity: 一个用于多光照条件下户外反渲染与重建的城市数据集

Jingjing Wang, Qirui Hu, Chong Bao, Yuke Zhu, Hujun Bao, Zhaopeng Cui, Guofeng Zhang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

AI总结 LightCity是一个用于多光照条件下城市反渲染与重建的高质量合成数据集,包含多样化的光照条件和丰富的属性,用于评估和分析城市环境中的关键任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01059 2026-02-03 cs.CV cs.MM

DRFormer: A Dual-Regularized Bidirectional Transformer for Person Re-identification

DRFormer: 一种双正则化双向变换器用于人重识别

Ying Shu, Pujian Zhan, Huiqi Yang, Hehe Fan, Youfang Lin, Kai Lv

机构 * Institute of Network Science and Intelligent Systems, Beijing Jiaotong University, Beijing, China(网络科学与智能系统研究所,北京交通大学,北京,中国) Zhejiang University, Hangzhou, Zhejiang, China(浙江大学,杭州,浙江,中国)

AI总结 DRFormer通过双正则化双向变换器融合视觉基础模型和视觉-语言模型的优势,提升人重识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01039 2026-02-03 cs.LG cs.AI

Adaptive Dual-Weighting Framework for Federated Learning via Out-of-Distribution Detection

面向联邦学习的自适应双加权框架通过分布外检测

Zhiwei Ling, Hailiang Zhao, Chao Zhang, Xiang Ao, Ziqi Wang, Cheng Zhang, Zhen Qin, Xinkui Zhao, Kingsum Chow, Yuanqing Wu, MengChu Zhou

机构 * School of Software Technology, Zhejiang University(浙江大学软件技术学院) Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字智能服务技术重点实验室) School of Information Technology and Artificial Intelligence, Zhejiang University of Finance and Economics(浙江财经大学信息科技与人工智能学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Intelligent Systems Engineering, Sun Yat-sen University(中山大学智能系统工程学院) Department of Electrical and Computer Engineering, New Jersey Institute of Technology(新泽西理工学院电子与计算机工程系)

AI总结 FLood通过分布外检测机制,提出自适应双加权框架,提升联邦学习在非独立同分布数据下的收敛稳定性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00839 2026-02-03 cs.CV

TransNormal: Dense Visual Semantics for Diffusion-based Transparent Object Normal Estimation

TransNormal: 用于扩散基透明物体法线估计的密集视觉语义

Mingwei Li, Hehe Fan, Yi Yang

机构 * Zhejiang University(浙江大学) Zhongguancun Academy(中关村学院)

AI总结 TransNormal通过整合密集视觉语义和多任务学习,提升透明物体法线估计的精度与鲁棒性。

Comments Project Page: https://longxiang-ai.github.io/TransNormal

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00746 2026-02-03 cs.SE cs.CV

Can Vision-Language Models Handle Long-Context Code? An Empirical Study on Visual Compression

视觉-语言模型能处理长上下文代码吗?对视觉压缩的实证研究

Jianping Zhong, Guochang Li, Chen Zhi, Junxiao Han, Zhen Qin, Xinkui Zhao, Nan Wang, Shuiguang Deng, Jianwei Yin

机构 * Zhejiang University(浙江大学) Hangzhou City University(杭州市大学) Shenzhou Aerospace Software Technology Company Limited(神州航天软件技术有限公司)

AI总结 本文提出LongCodeOCR,通过视觉压缩替代文本压缩,提升长上下文代码任务的性能与效率,同时揭示了视觉压缩在全局依赖支持与保真度之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00717 2026-02-03 cs.LG cs.AI

Deep Time-series Forecasting Needs Kernelized Moment Balancing

深度时间序列预测需要核化矩平衡

Licheng Pan, Hao Wang, Haocheng Yang, Yuqi Li, Qingsong Wen, Xiaoxi Li, Zhichao Chen, Haoxuan Li, Zhixuan Chu, Yuan Lu

机构 * Xiaohongshu Inc.(小红书公司) National University of Singapore(新加坡国立大学) The City University of New York, CUNY(纽约市立大学,CUNY) State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(人工智能国家重点实验室,北京大学) Center for Data Science, Peking University(北京大学数据科学中心) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 本文提出KMB-DF方法,通过核化矩平衡提升深度时间序列预测的准确性,实现更全面的分布平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00687 2026-02-03 cs.CV

V2X-DSC: Multi-Agent Collaborative Perception with Distributed Source Coding Guided Communication

V2X-DSC: 基于分布式源编码引导通信的多智能体协同感知

Yuankun Zeng, Shaohui Li, Zhi Li, Shulan Ruan, Yu Liu, You He

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

AI总结 V2X-DSC通过分布式源编码引导通信,实现多智能体协同感知的高效带宽受限融合,提升3D理解精度与通信效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23909 2026-02-03 cs.CV

EditScore: Unlocking Online RL for Image Editing via High-Fidelity Reward Modeling

EditScore: 通过高保真奖励建模解锁图像编辑的在线强化学习

Xin Luo, Jiahao Wang, Chenyuan Wu, Shitao Xiao, Xiyan Jiang, Defu Lian, Jiajun Zhang, Dong Liu, Zheng liu

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Zhejiang University(浙江大学)

AI总结 EditScore通过高保真奖励建模解锁图像编辑的在线强化学习,提供从基准到奖励建模到RL训练的系统路径。

Comments Accepted to ICLR 2026. Code, models, and benchmark: https://github.com/VectorSpaceLab/EditScore

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20198 2026-02-03 cs.CV

A Survey of Token Compression for Efficient Multimodal Large Language Models

多模态大语言模型高效性中的标记压缩综述

Kele Shao, Keda Tao, Kejia Zhang, Sicheng Feng, Mu Cai, Yuzhang Shang, Haoxuan You, Can Qin, Yang Sui, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Xiamen University(厦门大学) National University of Singapore(新加坡国立大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Central Florida(佛罗里达大学) Salesforce AI Research(Salesforce AI研究) Rice University(德克萨斯大学)

AI总结 本文综述了多模态大语言模型中标记压缩技术,分类讨论了图像、视频和音频三种模态的压缩方法及其机制,旨在推动该领域的发展。

Comments For ongoing updates and to track the latest advances in this promising area, we maintain a public repository: https://github.com/cokeshao/Awesome-Multimodal-Token-Compression

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11963 2026-02-03 cs.LG cs.CR

Effective and Efficient Cross-City Traffic Knowledge Transfer: A Privacy-Preserving Perspective

高效且高效的跨城市交通知识迁移:隐私保护视角

Zhihao Zeng, Ziquan Fang, Yuting Huang, Lu Chen, Yunjun Gao

机构 * Zhejiang University(浙江大学)

AI总结 本文提出FedTT框架,通过隐私保护和高效联邦学习方法解决跨城市交通知识迁移中的隐私泄露、数据分布差异和低数据质量问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01945 2026-02-03 cs.CL

LFQA-E: Carefully Benchmarking Long-form QA Evaluation

LFQA-E: 仔细评估长形式问答评测

Yuchen Fan, Chen Lin, Xin Zhong, Shuo Zhang, Heng Zhou, Yuchen Zhang, Mingyu Liang, Chengxing Xie, Ermo Hua, Gang Chen, Zhizhou He, Cheng Huang, Ning Ding, Bowen Zhou

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) Tsimnghua University(塔密纳大学) Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学) University of Tokyo(东京大学)

AI总结 LFQA-E是一个多语言、基于参考的长形式问答评测基准,用于严格评估自动指标的性能,揭示现有指标在捕捉长回答信息方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00463 2026-02-03 cs.CV

PSGS: Text-driven Panorama Sliding Scene Generation via Gaussian Splatting

PSGS:通过高斯点划法实现文本驱动的全景滑动场景生成

Xin Zhang, Shen Chen, Jiale Zhou, Lei Li

机构 * East China University of Science and Technology(东华大学) Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学)

AI总结 PSGS通过高斯点划法和双阶段框架实现高质量文本驱动全景场景生成,提升3D场景的真实感和细节保真度。

Comments Accepted to ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00150 2026-02-03 cs.CL cs.AI

Reversible Diffusion Decoding for Diffusion Language Models

可逆扩散解码用于扩散语言模型

Xinyun Wang, Min Zhang, Sen Cui, Zhikang Chen, Bo Jiang, Kun Kuang, Mingbao Lin

机构 * East China Normal University(华东师范大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) University of Oxford(牛津大学)

AI总结 可逆扩散解码通过引入可逆性,提升扩散语言模型生成的鲁棒性和质量,同时保持并行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00061 2026-02-03 cs.CY cs.AI

Simple Role Assignment is Extraordinarily Effective for Safety Alignment

简单的角色分配在安全对齐中表现尤为有效

Zhou Ziheng, Jiakun Ding, Zhaowei Zhang, Ruosen Gao, Yingnian Wu, Demetri Terzopoulos, Yipeng Kang, Fangwei Zhong, Junqi Wang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Tianjin University(天津大学) Peking University(北京大学) Zhejiang University(浙江大学) Beijing Institute of General Artificial Intelligence(北京一般人工智能研究院)

AI总结 本研究提出基于角色条件化的安全对齐方法,通过角色隐含编码价值观和认知模式,有效降低不安全输出,适用于多种AI对齐任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07666 2026-02-03 cs.CV cs.AI

iPEAR: Iterative Pyramid Estimation with Attention and Residuals for Deformable Medical Image Registration

iPEAR: 基于注意力和残差的迭代金字塔估计用于形变医学图像配准

Heming Wu, Di Wang, Tai Ma, Peng Zhao, Yubin Xiao, Zhongke Wu, Xing-Ce Wang, Xuan Wu, You Zhou

机构 * College of Software, Jilin University(吉林大学软件学院) Joint NTU-UBC Research Centre of Excellence in Active Living for the Elderly, Nanyang Technological University(老年活跃生活卓越研究中⼼(NTU-UBC), 新加坡国立大学) College of Computer Science(计算机科学学院) Technology, Zhejiang University(技术, 浙江大学) Key Laboratory of Symbolic Computation(符号计算重点实验室) Knowledge Engineering of Ministry of Education, College of Computer Science(教育部知识工程重点实验室, 计算机科学学院) Technology, Jilin University(技术, 吉林大学) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

AI总结 iPEAR通过融合注意力与残差模块和双阶段阈值控制迭代策略,提升医学图像配准的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19299 2026-02-02 cs.AI

Helios: A Foundational Language Model for Smart Energy Knowledge Reasoning and Application

Helios:一种面向智能能源知识推理与应用的基础语言模型

Haoyu Jiang, Fanjie Zeng, Boan Qu, Xiaojie Lin, Wei Zhong

机构 * College of Energy Engineering, Zhejiang University(浙江大学能源工程学院) Polytechnic Institute, Zhejiang University(浙江大学 polytechnic 院) Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海研究院)

AI总结 Helios是一种专为智能能源领域设计的基础语言模型,通过构建多智能体协作框架和相关数据集,提升领域知识、任务执行准确性和与人类偏好的对齐程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22491 2026-02-02 cs.CL

SSL: Sweet Spot Learning for Differentiated Guidance in Agentic Optimization

SSL:在代理优化中差异化引导的甜蜜点学习

Jinyang Wu, Changpeng Yang, Yuhao Shen, Fangzhi Xu, Bolin Ni, Chonghua Liao, Yuchen Liu, Hongzhen Wang, Shuai Nie, Shuai Zhang, Haoran Luo, Jiaming Xu

机构 * Tsinghua University(清华大学) Xiaomi Corporation(小米公司) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 SSL通过分层奖励引导代理优化,提升解空间中的方向性优化,实现样本效率提升和跨任务迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏