机构
*
Nanyang Technological University(南洋理工大学)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
University of Illinois Chicago(伊利诺伊大学香槟分校)
;
Tsinghua University(清华大学)
;
Sun Yat-sen University(中山大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
专题命中
长上下文与记忆
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
机构
*
SKLP, Institute of Computing Technology, Chinese Academy of Sciences(SKLP,计算技术研究所,中国科学院)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
University of New South Wales(新南威尔士大学)
EpiAgent: An Agent-Centric System for Ancient Inscription Restoration
EpiAgent: 一种以智能体为中心的古铭文修复系统
Shipeng Zhu, Ang Chen, Na Nie, Pengfei Fang, Min-Ling Zhang, Hui Xue
机构
*
School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院)
;
Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其跨学科应用关键实验室(东南大学),教育部,中国)
;
Key Laboratory of Computer Network and Information Integration (Southeast University), Ministry of Education, China(计算机网络与信息集成关键实验室(东南大学),教育部,中国)
;
Nanjing University Museum, Nanjing University, China(南京大学博物馆,南京大学,中国)
;
The China Centre for Linguistic and Strategic Studies, Nanjing University, China(中国语言战略研究中心,南京大学,中国)
机构
*
Nanjing University(南京大学)
;
Beihang University(北京航空航天大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
BMW (Nanjing) Information Technology Co., Ltd.(宝马(南京)信息技术有限公司)
;
University of Rochester(罗切斯特大学)
专题命中
长上下文与记忆
:large language model(abstract);language model(abstract);foundation model(abstract)
Position: The Turing-Completeness of Autoregressive Transformers Relies Heavily on Context Management
立场:自回归Transformer的图灵完备性高度依赖于上下文管理
Guanyu Cui, Zhewei Wei, Kun He
机构
*
Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学北京校区人工智能学院)
;
DEKE Lab, Renmin University of China, Beijing, China(中国人民大学北京校区DEKE实验室)
HGMEM: Hypergraph-based Working Memory to Improve Multi-step RAG for Long-Context Complex Relational Modeling
HGMem:基于超图的工作记忆以改进长上下文复杂关系建模的多步RAG
Chulun Zhou, Chunkang Zhang, Guoxin Yu, Fandong Meng, Jie Zhou, Wai Lam, Mo Yu
机构
*
The Chinese University of Hong Kong.(香港中文大学)
;
Pengcheng Laboratory.(鹏城实验室)
;
WeChat AI, Tencent(微信AI,腾讯)
;
University of Chinese Academy of Sciences.(中国科学院大学)
专题命中
长上下文与记忆
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Attention Sink Forges Native MoE in Attention Layers: Sink-Aware Training to Address Head Collapse
注意力汇聚在注意力层中锻造原生MoE:针对头部坍塌的汇聚感知训练
Zizhuo Fu, Wenxuan Zeng, Runsheng Wang, Meng Li
机构
*
Institute for Artificial Intelligence, Peking University, Beijing(人工智能研究院,北京大学,北京)
;
School of Integrated Circuits, Peking University, Beijing(集成电路学院,北京大学,北京)
专题命中
长上下文与记忆
:large language model(abstract);language model(abstract);分类 cs.CL、cs.LG