arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-12 至 2026-05-12 共收录 878 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 78 篇

2605.08129 2026-05-12 cs.LG 70%

Towards Customized Multimodal Role-Play

迈向定制化的多模态角色扮演

Chao Tang, Jianzong Wu, Qingyu Shi, Ye Tian, Aixi Zhang, Hao Jiang, Jiangning Zhang, Yunhai Tong

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出定制化多模态角色扮演任务,通过统一模型和两阶段训练框架实现角色个性化,实验表明方法在角色扮演任务中优于现有方法。

Comments Code available at https://github.com/Tangc03/UniCharacter Project page available at https://tangc03.github.io/UniCharacter.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.03496 2026-05-12 cs.CL cs.AI cs.LG 67%

Inductive Entity Representations from Text via Link Prediction

通过链接预测进行文本中的归纳实体表示

Daniel Daza, Michael Cochez, Paul Groth

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of Amsterdam(阿姆斯特丹大学) Discovery Lab, Elsevier(Elsevier发现实验室)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过链接预测目标评估实体表示,展示其在链接预测、实体分类和信息检索中的良好泛化能力,优于现有方法。

Comments The Web Conference 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09242 2026-05-12 eess.IV cs.CV 67%

Cross-Modal Semantic-Enhanced Diffusion Framework for Diabetic Retinopathy Grading

跨模态语义增强的扩散框架用于糖尿病视网膜病变分级

Yiqun Wang

机构 * School of Software Engineering Beijing Jiaotong University(软件工程学院 北京交通大学)

专题命中 指令微调 :language model(abstract);pretraining(abstract)

AI总结 本文提出CLIP引导语义扩散框架,通过整合视觉-语言预训练与扩散概率建模,解决糖尿病视网膜病变分级中的细粒度病变模式区分、分布差异和临床语义知识利用问题。

Comments 6 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13710 2026-05-12 cs.CV 67%

SLQ: Bridging Modalities via Shared Latent Queries for Retrieval with Frozen MLLMs

SLQ:通过共享潜在查询桥接模态以实现冻结MLLMs的检索

Haoran Lou, Ziyan Liu, Chunxiao Fan, Yuexin Wu, Yue Ming, Hao Wu, Kai Zuo, Yibo Chen, Xu Tang

机构 * School of Electronic Engineering, Beijing University of Posts(北京邮电大学电子工程学院) Xiaohongshu Inc., China(小红书公司)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 SLQ通过冻结MLLMs的主干,引入共享潜在查询提升多模态检索性能,实验显示其在多个基准上表现优异。

Comments Accepted to ICML-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17546 2026-05-12 cs.CL cs.LG 62%

Learning to Stay Safe: Adaptive Regularization Against Safety Degradation during Fine-Tuning

学习保持安全:在微调过程中对抗安全退化的一种自适应正则化方法

Jyotin Goel, Souvik Maji, Pratik Mazumder

机构 * Indian Institute of Technology Jodhpur(印度理工学院乔浦尔)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种自适应正则化框架,通过评估安全风险来维持模型在微调过程中的安全性,实验表明该方法能有效降低攻击成功率并保持下游性能。

Comments Work in progress (48 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09238 2026-05-12 cs.LG cs.AI 62%

Intrinsic Muon: Spectral Optimization on Riemannian Matrix Manifolds

内在缪子:在黎曼矩阵流形上的谱优化

Yibang Li, Bihari Lal Pandey, Ravi Sah, Andi Han, Cyrus Mostajeran, Pratik Jawanpuria, Bamdev Mishra

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Indian Institute of Technology Bombay, India(印度理工学院班加罗尔,印度) University of Sydney, Australia(悉尼大学,澳大利亚) Microsoft India(微软印度)

专题命中 指令微调 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出内在缪子框架,通过在固定秩、SPD、Stiefel和Grassmann流形上实现闭式更新,解决传统缪子在流形参数上的泛化问题,并提供收敛保证。

Comments Code: https://github.com/1bang118/manifold-intrinsic-muon

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13486 2026-05-12 cs.LG cs.AI cs.DC 62%

Preventing Rank Collapse in Federated Low-Rank Adaptation with Client Heterogeneity

防止联邦低秩适应中的秩坍缩与客户端异质性

Fei Wu, Jia Hu, Geyong Min, Shiqiang Wang

机构 * Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文针对联邦低秩适应中因客户端异质性导致的秩坍缩问题,提出raFLoRA方法,通过分解本地更新并加权聚合提升模型性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10468 2026-05-12 cs.LG 57%

Can Muon Fine-tune Adam-Pretrained Models?

Muon能否微调Adam预训练模型?

Xingyu Qu, Peigeng Huang, Samuel Horvath

机构 * Nanjing University(南京大学)

专题命中 指令微调 :pretraining(abstract);分类 cs.LG

AI总结 研究发现Muon在微调时因与Adam的隐式偏置差异导致性能下降,通过LoRA等方法验证了限制更新强度可缓解这一问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07575 2026-05-12 cs.CV cs.AI 57%

Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding

响应-G1:面向前瞻性流视频理解的显式场景图建模

Ke Ma, Jiaqi Tang, Bin Guo, Xueting Han, Ruonan Xu, Qingfeng He, Ziheng Wang, Xu Wang, Qifeng Chen, Zhiwen Yu, Yunhao Liu

机构 * Northwestern Polytechnical University(北华大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) Harbin Engineering University(哈尔滨工程大学)

专题命中 指令微调 :prompting(abstract);分类 cs.AI

AI总结 响应-G1通过显式场景图建模提升前瞻性流视频理解,通过三阶段流程实现视频证据与查询条件的结构化对齐,提高响应时机的可解释性和准确性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09827 2026-05-12 cs.CV cs.AI 57%

Fashion Florence: Fine-Tuning Florence-2 for Structured Fashion Attribute Extraction

Fashion Florence:基于Florence-2的结构化时尚属性提取微调

Anushree Berlia

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 本文提出Fashion Florence,通过LoRA微调Florence-2模型,实现从服装图像中提取结构化时尚属性。模型在iMaterialist Fashion数据集上训练,生成包含类别、颜色、材质、风格和场合标签的JSON输出,适用于下游推荐和检索系统。

Comments Model: https://huggingface.co/anushreeberlia/fashion-florence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19219 2026-05-12 cs.CV cs.AI 57%

Selective LoRA for Visual Tokens and Attention Heads

选择性LoRA用于视觉标记和注意力头

Tiange Luo, Lajanugen Logeswaran, Jaekyeom Kim, Justin Johnson, Honglak Lee

机构 * University of Michigan(密歇根大学) LG AI Research(LG人工智能研究)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 本文提出Image-LoRA,通过选择性更新视觉标记和注意力头,减少参数和计算量,同时保持纯文本前向传递不变,在视觉定位任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25926 2026-05-12 cs.CR cs.LG 57%

Preventing Prompt Injection with Type-Directed Privilege Separation

通过类型引导的特权分离防止提示注入

Dennis Jacob, Emad Alghamdi, Zhanhao Hu, Basel Alomair, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 本文提出一种类型引导的特权分离技术,通过将不可信数据转换为受控的数据类型,有效防止提示注入攻击,同时保持系统的实用性和兼容性。

Comments Revised manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22143 2026-05-12 cs.GR cs.CV 50%

JUST-DUB-IT: Video Dubbing via Joint Audio-Visual Diffusion

JUST-DUB-IT: 通过联合音频-视觉扩散进行视频配音

Anthony Chen, Naomi Ken Korem, Gal Zeevi, Tavi Halperin, Matan Ben Yosef, Urska Jelercic, Ofir Bibi, Or Patashnik, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学)

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出JUST-DUB-IT方法,利用轻量LoRA调整基础音频-视频扩散模型,实现视频到视频的高质量配音,提升视觉保真度和唇同步性能。

Comments Project webpage available at https://justdubit.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09925 2026-05-12 cs.CV 50%

Frequency Adapter with SAM for Generalized Medical Image Segmentation

基于SAM的频率适应器用于通用医学图像分割

Phuoc-Nguyen Bui, Van-Nguyen Pham, Duc-Tai Le, Junghyun Bum, Hyunseung Choo

机构 * Sungkyunkwan University, Korea(成均馆大学,韩国)

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出FSAM框架,结合LoRA和频率适配器提升医学图像分割的域泛化能力,通过提取域不变高频特征缓解频率相关域偏移。

Comments Under review, 10 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09394 2026-05-12 physics.chem-ph cond-mat.mtrl-sci 50%

Systematic Fine-Tuning of MACE Interatomic Potentials for Catalysis

MACE相互作用势系统微调用于催化

Nima Karimitari, Jacob Clary, Derek Vigil-Fowler, Ravishankar Sundararaman, Gábor Csányi, Christopher Sutton

专题命中 指令微调 :foundation model(abstract)

AI总结 本文比较了九种不同数据集和策略训练的MLIPs,发现微调模型在处理非分布反应时更稳健,且在催化反应建模中表现出更高的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08874 2026-05-12 cs.CV 50%

Semantic Alignment in Hyperbolic Space for Open-Vocabulary Semantic Segmentation

超几何空间中的语义对齐用于开放词汇语义分割

Hoang M. Truong, Hai Nguyen-Truong, Dang Huynh

机构 * Fulbright University Vietnam(富布赖特大学越南分校)

专题命中 指令微调 :language model(abstract)

AI总结 本文提出HyRo框架,通过解耦超几何空间中的层次和语义对齐,提升开放词汇语义分割性能。

Comments Accepted to the PVUW Workshop at CVPR 2026. Project page: https://tmhoanggg.github.io/HyRo/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 40 篇

2605.09608 2026-05-12 cs.LG cs.IT math.IT 93%

Geometry Conflict: Explaining and Controlling Forgetting in LLM Continual Post-Training

几何冲突:解释和控制LLM持续微调中的遗忘

Yuanyi Wang, Yifan Yang, Su Lu, Yanggan Gu, Pengkai Wang, Wenjun Wang, Zhaoyi Yan, Congkai Xie, Jianmin Wu, Jialun Cao, Shing-Chi Cheung, Hongxia Yang

机构 * The Hong Kong Polytechnic University, PolyU(香港理工大学,PolyU) The Hong Kong University of Science and Technology, HKUST(香港科学与技术大学,HKUST) PolyU-Daya Bay Technology and Innovation Research Institute(PolyU-大亚湾技术与创新研究院)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究LLM持续微调中的遗忘现象,通过任务几何分析揭示遗忘驱动因素及控制方法,提出GCWM算法提升模型保留与最终性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09853 2026-05-12 cs.LG 91%

Exploration-Driven Optimization for Test-Time Large Language Model Reasoning

基于探索的优化用于测试时大语言模型推理

Changhao Li, Yuchen Zhuang, Chenxiao Gao, Haotian Sun, Rushi Qiang, Chao Zhang, Bo Dai

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 本文提出EDO框架,通过扩展奖励偏差探索目标到迭代后训练,提升大语言模型推理中的探索与利用平衡,实验表明ED-iDPO和ED-GRPO在推理能力和多样性上优于基线模型。

Comments Accepted by TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08577 2026-05-12 cs.LG cs.AI 90%

Distributionally Robust Token Optimization in RLHF

强化学习中对抗性令牌优化

Yeping Jin, Jiaming Hu, Ioannis Ch. Paschalidis

机构 * Department of System Engineering(系统工程系) Boston University(波士顿大学) Department of Math & Statistics(数学与统计学系)

专题命中 后训练与偏好优化 :RLHF(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DRTO方法,结合RLHF与DRO,通过构建f-散度模糊集增强策略优化中的困难响应段,提升多步骤推理任务在分布变化下的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10766 2026-05-12 cs.LG cs.AI cs.CL 89%

How Instruction and Reasoning Data shape Post-Training: Data Quality through the Lens of Layer-wise Gradients

指令和推理数据如何塑造训练后阶段:通过层梯度的视角探讨数据质量

Ming Li, Yanhong Li, Ziyue Li, Tianyi Zhou

机构 * University of Maryland(马里兰大学) Allen Institute for AI(Allen人工智能研究所)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文通过层梯度的谱分析,揭示了高质量指令和推理数据对大语言模型训练后阶段的影响,统一了数据评估指标,并展示了数据质量与训练稳定性之间的关系。

Comments ACL2026, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11181 2026-05-12 cs.CL 88%

Code Mixologist : A Practitioner's Guide to Building Code-Mixed LLMs

代码调酒师:构建代码混合LLM的从业者指南

Himanshu Gupta, Pratik Jayarao, Chaitanya Dwivedi, Neeraj Varshney

机构 * Arizona State University(亚利桑那州立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文探讨了代码混合和切换在大语言模型中的挑战,提出统一的分类体系和实用指南,涵盖数据、建模和评估方法,分析现有评估实践并讨论安全问题。

Comments 8 pages main paper, 13 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00986 2026-05-12 cs.CL 88%

Sparse Reward Subsystem in Large Language Models

大语言模型中的稀疏奖励子系统

Guowei Xu, Mert Yuksekgonul, James Zou

机构 * Tsinghua University(清华大学) Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 研究揭示大语言模型隐藏状态中稀疏神经元构成奖励子系统,识别价值神经元和多巴胺神经元,用于预测模型置信度和指导推理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21228 2026-05-12 cs.CR cs.AI 88%

CachePrune: Teaching LLMs What Not to Follow via KV-Cache Editing

CachePrune: 通过KV缓存编辑教LLMs不遵循指令

Rui Wang, Junda Wu, Yu Xia, Tong Yu, Ruiyi Zhang, Ryan Rossi, Subrata Mitra, Lina Yao, Julian McAuley

机构 * Adobe Research(Adobe研究院) University of California San Diego(加州大学圣地亚哥分校) University of New South Wales(新南威尔士大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 CachePrune通过KV缓存编辑识别并修剪指令跟随相关神经元,降低间接提示注入攻击成功率,同时保持LLM执行用户指令的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06375 2026-05-12 cs.LG cs.AI math.ST stat.TH 87%

A Unified Pair-GRPO Family: From Implicit to Explicit Preference Constraints for Stable and General RL Alignment

一对GRPO家族的统一:从隐式到显式的偏好约束用于稳定和通用的RL对齐

Hao Yu

机构 * Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出了一种统一的偏好基于RL优化框架,通过Soft-Pair-GRPO和Hard-Pair-GRPO两种变体,解决了主流配对偏好学习中政策更新不稳定、梯度方向模糊等问题,提升了对齐质量与训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10716 2026-05-12 cs.LG stat.ML 85%

What should post-training optimize? A test-time scaling law perspective

在测试时间视角下,后训练应优化什么?

Muheng Li, Jian Qian, Wenlong Mou

机构 * Department of Statistical Sciences, University of Toronto(多伦多大学统计科学系) Department of AI and Data Science, The University of Hong Kong(香港大学人工智能与数据科学系)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了测试时间预算不匹配场景下,基于奖励尾部统计的后训练优化方法,提出TEA和Prefix-TEA估计器提升最佳N性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07579 2026-05-12 cs.LG cs.AI cs.CL 85%

Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States

你的语言模型就是其自身的批评者:具有从演员内部状态估计价值的强化学习

Yunho Choi, Jongwon Lim, Woojin Ahn, Minjae Oh, Jeonghoon Shim, Yohan Jo

机构 * Graduate School of Data Science(数据科学研究生院) Seoul National University(首尔国立大学) Computer Science and Engineering(计算机科学与工程)

专题命中 后训练与偏好优化 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出POISE方法,通过利用策略模型内部信号在强化学习中实现高效的基线估计,减少方差并提高训练稳定性,适用于数学推理任务。

Comments Under Review; Project Page: https://elijah0430.github.io/poise/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08327 2026-05-12 cs.LG cs.AI 84%

Interactive Critique-Revision Training for Reliable Structured LLM Generation

交互式批评-修订训练用于可靠的结构化大语言模型生成

Fei Xu Yu, Zuyuan Zhang, Mahdi Imani, Nathaniel D. Bastian, Tian Lan

机构 * The George Washington University(乔治华盛顿大学) Northeastern University(东北大学) United States Military Academy(美国军事学院)

专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出DPA-GRPO方法,通过生成器-验证器游戏中的结构化验证干预,提升结构化决策的准确性与一致性,实验显示其在TaxCalcBench TY24上优于零样本生成和生成器-only RL基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04660 2026-05-12 cs.CL 83%

Composing Policy Gradients and Prompt Optimization for Language Model Programs

将策略梯度与提示优化组合用于语言模型程序

Noah Ziems, Dilara Soylu, Lakshya A Agrawal, Isaac Miller, Liheng Lai, Chen Qian, Kaiqiang Song, Meng Jiang, Dan Klein, Matei Zaharia, Karel D'Oosterlinck, Christopher Potts, Omar Khattab

机构 * University of Notre Dame(诺特大学) Stanford University(斯坦福大学) UC Berkeley(伯克利大学) Anyscale CMU(卡内基梅隆大学) Zoom, Inc.(Zoom公司) Contextual AI MIT(麻省理工学院)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL

AI总结 本文研究了如何将GRPO与自动提示优化结合,以提升多提示程序的性能,实验表明这种组合在分类、多跳搜索和隐私保护委托任务中平均提升准确率11%。

Comments ACM CAIS 2026. Lakshya*, Dilara*, and Noah* contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09359 2026-05-12 cs.LG cs.AI 82%

Skill-R1: Agent Skill Evolution via Reinforcement Learning

Skill-R1:通过强化学习实现智能体技能进化

Yash Vishe, Rohan Surana, Xunyi Jiang, Zihan Huang, Xintong Li, Nikki Lijing Kuang, Tong Yu, Ryan A. Rossi, Jingbo Shang, Julian McAuley, Junda Wu

机构 * UC San Diego(UC圣地亚哥大学) Adobe Research(Adobe研究院)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Skill-R1通过强化学习框架实现实例级递归技能优化,利用可验证奖励训练轻量级技能生成器,提升智能体在复杂多步骤任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09433 2026-05-12 cs.CV 82%

Offline Preference Optimization for Rectified Flow with Noise-Tracked Pairs

离线偏好优化用于具有噪声跟踪配对的校正流

Yunhong Lu, Qichao Wang, Hengyuan Cao, Xiaoyin Xu, Min Zhang

机构 * Zhejiang University(浙江大学) Shanghai Institute for Advanced Study-Zhejiang University(上海先进研究院-浙江大学) Shanghai Institute for Mathematics and Interdisciplinary Sciences(上海数学与交叉科学研究院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 本文提出PNAPO框架,通过保留生成胜败图像的先验噪声,改进校正流的偏好优化,提升稳定性和样本效率。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏