CommentsThis version is the camera-ready version for ICLR 2021. Main changes include a detailed discussion about natural tasks, more detailed proof sketch and updated experimental evaluations
DuplexGen: Adaptive Synthesis of Human-AI Turn-Taking Dialogues
DuplexGen:人机交替对话的自适应合成
Takyoung Kim, Kang-wook Kim, Sang Hoon Woo, Julia Hirschberg, Gunhee Kim, Dilek Hakkani-Tür
机构
*
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Seoul National University(首尔大学)
;
Columbia University(哥伦比亚大学)
;
University of California, Berkeley(加州大学伯克利分校)
;
Georgia Institute of Technology(佐治亚理工学院)
MGUP: A Momentum-Gradient Alignment Update Policy for Stochastic Optimization
MGUP:一种用于随机优化的动量-梯度对齐更新策略
Da Chang, Ganzhao Yuan
机构
*
Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)
;
Shenzhen University of Advanced Technology(深圳理工大学)
;
Pengcheng Laboratory(鹏城实验室)
;
University of Chinese Academy of Sciences(中国科学院大学)
专题命中
预训练与数据
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)
Denoise First, Orthogonalize Later: Understanding Momentum in Muon via Spectral Filtering
先降噪,后正交:通过谱滤波理解Muon中的动量
Xianliang Li, Zihan Zhang, Weiyang Liu, Han Bao
机构
*
The Institute of Statistical Mathematics(统计数学研究所)
;
The Graduate Institute for Advanced Studies, SOKENDAI(SOKENDAI高级研究院)
;
National Institute of Informatics(国家信息研究所)
;
The Chinese University of Hong Kong(香港中文大学)
;
Tohoku University(东北大学)
;
RIKEN AIP(理化学研究所AIP)
专题命中
预训练与数据
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)
From Unfamiliar to Familiar: Detecting Pre-training Data via Gradient Deviations in Large Language Models
从陌生到熟悉:通过梯度偏差检测大型语言模型中的预训练数据
Ruiqi Zhang, Lingxiang Wang, Hainan Zhang, Zhiming Zheng, Yanyan Lan
机构
*
Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(北京未来区块链与隐私计算先进创新中心,北京航空航天大学)
;
School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)
;
Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
专题命中
预训练与数据
:large language model(title);language model(title);分类 cs.CL
Where Does Warm-Up Come From? Adaptive Scheduling for Norm-Constrained Optimizers
自适应调度机制:规范约束优化器中的暖启动来源
Artem Riabinin, Andrey Veprikov, Arman Bolatov, Martin Takáč, Aleksandr Beznosikov
机构
*
Basic Research of Artificial Intelligence Laboratory(人工智能基础研究实验室)
;
Federated Learning Problems Laboratory(联邦学习问题实验室)
;
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
;
Innopolis University(因诺普里斯大学)
专题命中
预训练与数据
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)