arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4789 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4789 篇

2605.29421 2026-05-29 cs.CL 70%

Learning Design Skills as Memory Policies for Agentic Photonic Inverse Design

将设计技能学习为记忆策略用于智能光子逆向设计

Shengchao Chen, Ting Shu, Sufen Ren

机构 * AAII, University of Technology Sydney(AAII,悉尼技术大学) School of Artificial Intelligence, Shenzhen University(人工智能学院,深圳大学) School of Information and Communication Engineering, Hainan University(信息与通信工程学院,海南大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出SkillPCF闭环智能体框架,通过物理引导的记忆技能库、强化学习技能选择和模拟器接地技能演化,解决光子晶体光纤逆向设计中的知识积累问题,在真实数据集上实现更优的设计质量与效率权衡。

Comments AI4Physics@ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17220 2026-05-29 cs.CL 70%

Mindscape-Aware Retrieval Augmented Generation for Improved Long Context Understanding

心智景观感知的检索增强生成以改进长上下文理解

Yuqing Li, Jiangnan Li, Zheng Lin, Ziyan Zhou, Junjie Wu, Weiping Wang, Jie Zhou, Mo Yu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) WeChat AI, Tencent(腾讯微信AI) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出MiA-RAG框架,通过层次化摘要构建心智景观并统一检索与生成的条件,实现全局语义表示指导下的长上下文检索与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12508 2026-05-29 cs.AI 70%

AgentOrchestra: Orchestrating Multi-Agent Intelligence with the Tool-Environment-Agent(TEA) Protocol

AgentOrchestra:使用工具-环境-智能体(TEA)协议编排多智能体智能

Wentao Zhang, Liang Zeng, Yuzhen Xiao, Yongcong Li, Ce Cui, Yilei Zhao, Rui Hu, Yang Liu, Yahui Zhou, Bo An

机构 * Skywork AI Nanyang Technological University(南洋理工大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出TEA协议和AgentOrchestra框架,通过统一抽象和分层编排实现多智能体系统的生命周期感知协调,在GAIA测试集上达到89.04%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28769 2026-05-28 cs.LG 70%

Multi-Mixer Models: Flexible Sequence Modeling with Shared Representations

多混合器模型:基于共享表示的灵活序列建模

Kevin Y. Li, Asher Trockman, Ananda Theertha Suresh, Ziteng Sun

机构 * Carnegie Mellon University(卡内基梅隆大学) Google Research(谷歌研究)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出Oryx混合模型,通过序列轴上的灵活切换(注意力与线性递归)实现高效长上下文处理,在1.4B规模下平均语言建模任务提升0.7个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28640 2026-05-28 cs.LG 70%

Augmenting Attention with Exponentially Decaying Memory Improves Query-Aware KV Sparsity

用指数衰减记忆增强注意力提升查询感知的KV稀疏性

Xiuying Wei, Caglar Gulcehre

机构 * EPFL(苏黎世联邦理工学院) CLAIRE(人工智能实验室)

专题命中 长上下文与记忆 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文通过引入指数衰减记忆模块增强注意力机制,在稀疏注意力推理中显著提升查询感知方法的准确性,并在多个任务上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28424 2026-05-28 cs.CL 70%

Skill0.5: Joint Skill Internalization and Utilization for Out-of-Distribution Generalization in Agentic Reinforcement Learning

Skill0.5:面向智能体强化学习中分布外泛化的联合技能内化与利用

Jiapeng Zhu, Jianxiang Yu, Yibo Zhao, Chengcheng Han, Qi Gu, Xunliang Cai, Xiang Li, Weining Qian

机构 * East China Normal University(华东师范大学) Meituan Longcat Team(美团Longcat团队)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出Skill0.5框架,通过区分通用技能内化与任务特定技能利用,结合动态难度感知路由器,在ALFWorld和WebShop上提升了分布内和分布外场景的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27760 2026-05-28 cs.AI 70%

SkillGrad: Optimizing Agent Skills Like Gradient Descent

SkillGrad: 像梯度下降一样优化智能体技能

Hanyu Wang, Yifan Lan, Bochuan Cao, Lu Lin, Jinghui Chen

机构 * College of Information Sciences and Technology(信息科学与技术学院) The Pennsylvania State University(宾夕法尼亚州立大学) University Park, PA, USA

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出SkillGrad框架,将技能包视为结构化参数,通过轨迹级损失、文本梯度诊断和动量记忆覆盖进行类梯度下降优化,在表格问答任务上平均提升6.7个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27531 2026-05-28 cs.PL cs.CL cs.SE 70%

Agentic Separation Logic Specification Synthesis

智能体分离逻辑规范合成

Tarun Suresh, David Korczynski, Julien Vanegue

机构 * Bloomberg(贝莱德)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出 Spec-Agent 智能体系统,通过静态分析、运行时堆追踪和反例引导迭代,为大型 C++ 代码库合成分离逻辑规范,在百万行级代码上达到 85% 有效规范合成率且无假阳性。

Comments 9 pages, 3 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26182 2026-05-28 cs.CL 70%

ClinicalAgents: Multi-Agent Orchestration for Clinical Decision Making with Dual-Memory

ClinicalAgents:具有双记忆的临床决策多智能体编排

Zhuohan Ge, Haoyang Li, Yubo Wang, Nicole Hu, Chen Jason Zhang, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ClinicalAgents多智能体框架,通过蒙特卡洛树搜索动态编排和双记忆架构模拟临床推理,显著提升诊断准确性和可解释性。

Comments Accepted to the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26870 2026-05-27 cs.MA cs.AI cs.HC 70%

Persistent AI Agents in Academic Research: A Single-Investigator Implementation Case Study

学术研究中的持久性AI智能体:单研究者实施案例研究

Anas H. Alzahrani

机构 * Department of Preventive Medicine and Public Health, Faculty of Medicine, King Abdulaziz University(预防医学与公共卫生系,医学院,国王阿卜杜勒阿齐兹大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过单研究者案例研究,分析了持久性AI智能体在真实学术环境中的架构、使用、产出和治理,发现缓存主导的工作流可能将经济单位从每token成本转向每完成工件成本。

Comments 19 pages, 2 figures, 3 main tables; supplementary appendix with 6 tables, 2 figures, and a reproducibility methods section. Describes 17 configured agents in a persistent research environment and introduces the PARE-M (Persistent Agentic Research Environment Measurement) framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01030 2026-05-27 cs.AI cs.LO cs.PL 70%

Effect-Transparent Governance for AI Workflow Architectures: Semantic Preservation, Expressive Minimality, and Decidability Boundaries

AI工作流架构的效果透明治理:语义保持、表达最小性与可判定性边界

Alan L. McCann

机构 * Mashin, Inc.(Mashin公司)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过机器验证的形式化方法,证明在AI工作流架构中,效果级治理可以在不降低内部计算表达性的前提下实施,并建立了治理与计算表达性正交的理论基础。

Comments 15 pages. Companion proofs: https://github.com/mashin-live/governance-proofs. Project: https://mashin.live. v2: corrected cross-reference identifiers for companion papers. License updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25869 2026-05-26 cs.CL 70%

Mitigating Provenance-Role Collapse in Long-Term Agents via Typed Memory Representation

通过类型化记忆表示缓解长期智能体中的来源-角色崩溃

Zhengda Jin, Bingbing Wang, Jing Li, Ruifeng Xu, Min Zhang

机构 * Harbin Institute of Technology(哈尔滨工业大学) The Hong Kong Polytechnic University(香港理工大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出MemIR类型化记忆中间表示,通过结构约束实现来源监控,解决长期智能体中因无结构存储导致的来源-角色崩溃问题,在LoCoMo和BEAM-100K上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25693 2026-05-26 cs.CL cs.DB cs.MA 70%

From Facts to Insights: A Persona-Driven Dual Memory Framework and Dataset for Role-Playing Agents

从事实到洞察:面向角色扮演智能体的角色驱动双记忆框架与数据集

Rongsheng Zhang, Ruofan Hu, Weijie Chen, Jiji Tang, Junnan Ren, Wanying Wu, Xunuoyan Chen, Tangjie Lv, Tao Jin, Zhou Zhao

机构 * Zhejiang University(浙江大学) Fuxi AI Lab, Netease Inc.(复活AI实验室,网易公司)

专题命中 长上下文与记忆 :SFT(abstract,abstract_cn);分类 cs.CL

AI总结 针对长期对话中角色扮演智能体因上下文窗口限制而丧失角色一致性的问题,提出角色记忆数据集RoleMemo和双记忆框架DualMem,通过将记忆解耦为事实认知和角色条件洞察,结合监督微调与强化学习,在4B参数模型上超越基于DeepSeek-V3.2的零样本角色无关框架。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25430 2026-05-26 cs.AI 70%

CODESKILL: Learning Self-Evolving Skills for Coding Agents

CODESKILL:学习自进化技能的编码智能体

Yanzhou Li, Yiran Zhang, Xiaoyu Zhang, Xiaoxia Liu, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出CODESKILL框架,通过强化学习从编码智能体轨迹中提取多粒度程序性技能并维护技能库,提升下游任务解决能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09943 2026-05-26 cs.AI 70%

PathMem: Toward Cognition-Aligned Memory Transformation for Pathology MLLMs

PathMem: 面向病理学多模态大模型的认知对齐记忆转换

Jinyue Li, Yuci Liang, Qiankun Li, Xinheng Lyu, Jiayu Qian, Huabao Chen, Kun Wang, Zhigang Zeng, Anil Anthony Bharath, Yang Liu

机构 * University of Science and Technology of China(中国科学技术大学) Shenzhen University(深圳大学) Nanyang Technological University(南洋理工大学) Imperial College London(伦敦帝国学院) Huazhong University of Science and Technology(华中科技大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出PathMem框架,通过长期记忆与工作记忆的动态转换机制,实现结构化病理知识整合与可解释记忆控制,在WSI报告生成和开放诊断任务上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25092 2026-05-26 cs.IR cs.CL cs.DB 70%

AgentIR: A Workload-Adaptive Cascade Retrieval Substrate for Long-Term Conversational Memory

AgentIR:面向长期对话记忆的工作负载自适应级联检索基座

Aojie Yuan, Haiyue Zhang, Shahin Nazarian

机构 * University of Southern California(南加州大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对长期对话记忆中索引动态增长、查询类型变化和亚10毫秒延迟预算的挑战,提出一种基于置信度触发的级联路由策略,通过自适应选择融合方法和是否运行稠密通道,在保持准确率的同时显著降低延迟并提升并发能力。

Comments 29 pages, 9 figures, 12 tables. Main paper 9 pages + comprehensive appendix (proof, GPU kernels, full per-dataset BEIR/LongMemEval/LoCoMo tables, cascade router C++ API, 6 robustness experiments, FAQ, failure-case catalog)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24879 2026-05-26 cs.LG math.OC 70%

Efficient DP-SGD for LLMs with Randomized Clipping

基于随机裁剪的高效DP-SGD用于大语言模型

Enayat Ullah, Sai Aparna Aketi, Devansh Gupta, Huanyu Zhang, Meisam Razaviyayn

机构 * Meta Platforms Inc(Meta平台公司) University of Southern California(南加州大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出DP-SGD-RC算法,利用随机迹估计(Hutchinson和Hutch++)降低每样本梯度范数估计的内存开销,在保持隐私保证的同时减少内存和计算复杂度。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24842 2026-05-26 cs.CL cs.CY 70%

Translators as Invisible Teachers of AI: Copyright, Translation Memory, and the Political Economy of Linguistic Data

译者作为人工智能的无形教师:版权、翻译记忆库与语言数据的政治经济学

Masaru Yamada

机构 * College and Graduate School of Intercultural Communication, Rikkyo University(文化交流研究生院,立命馆大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究译者劳动如何转化为人工智能的基础数据资本,提出“无消费的挪用”和“译者的无形教师化”两个概念,并探讨版权框架下的数据供应链与再分配设计方向。

Comments 13 pages; comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22337 2026-05-26 cs.AI 70%

Meta-Soft: Leveraging Composable Meta-Tokens for Context-Preserving KV Cache Compression

Meta-Soft: 利用可组合元标记实现上下文保持的KV缓存压缩

Wei Luo, Yi Huang, Songchen Ma, Huanyu Qu, Jiang Cai, Mingkun Xu

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) University of Macau(澳门大学) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Hong Kong University of Science and Technology(香港科技大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Meta-Soft动态压缩框架,通过可学习正交基矩阵和Gumbel-Softmax选择网络合成元标记,结合注意力流整合机制保留丢弃上下文信息,解决KV缓存压缩中的信息丢失和上下文断裂问题。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24468 2026-05-26 cs.AI 70%

SAM: State-Adaptive Memory for Long-Horizon Reasoning Agent

SAM:面向长程推理智能体的状态自适应记忆

Yuyang Hu, Hongjin Qian, Shuting Wang, Jiongnan Liu, Ziliang Zhao, Jiejun Tan, Zheng Liu, Zhicheng Dou

机构 * GSAI, Renmin University of China(GSAI,中国人民大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出状态自适应记忆框架SAM,通过紧凑记忆线索和原始轨迹页面实现意图驱动的信息重建,无需重新训练基础模型,在多个基准上超越强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11941 2026-05-26 cs.CV cs.AI 70%

DynaPURLS: Dynamic Refinement of Part-Aware Representations for Skeleton-Based Zero-Shot Action Recognition

DynaPURLS: 基于骨架的零样本动作识别中部分感知表示的动态细化

Jingmin Zhu, Anqi Zhu, James Bailey, Jun Liu, Hossein Rahmani, Mohammed Bennamoun, Farid Boussaid, Qiuhong Ke

机构 * Monash University(莫纳什大学) Lancaster University(兰卡斯特大学) University of Western Australia(西澳大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出DynaPURLS框架,通过多尺度视觉-语义对应和动态细化模块,解决骨架零样本动作识别中的领域偏移问题,在三个基准数据集上取得最优结果。

Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23751 2026-05-25 cs.LG 70%

Approaching I/O-optimality for Approximate Attention

逼近近似注意力的I/O最优性

Pál András Papp, Aleksandros Sobczyk, Anastasios Zouzias

机构 * Computing Systems Lab(计算系统实验室) Huawei Technologies(华为技术)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文针对大语言模型中的注意力机制,提出一种基于近似注意力框架的I/O高效算法,使得I/O开销在大多数参数范围内几乎线性依赖于n,并证明其接近I/O最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23559 2026-05-25 cs.CV cs.AI 70%

PathNavigate: A Training-Free Pathology Agent with Surprise-Guided Scan and Shared Slide Memory for Whole-Slide Image VQA

PathNavigate: 一种无需训练的病理学代理,具有惊喜引导扫描和共享幻灯片记忆用于全切片图像VQA

Chunze Yang, Qidong Liu, Wenjie Zhao, Yue Tang, Jiusong Ge, Di Zhang, Jiashuai Liu, Lei Wu, Junbo Lu, Ni Zhang, Xian Wu, Zeyu Gao, Chen Li

机构 * School of Comp. Science & Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Tencent Jarvis Lab(腾讯Jarvis实验室) University of Cambridge(剑桥大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出PathNavigate,一种无需训练的病理学代理,通过惊喜引导扫描和共享幻灯片记忆,在严格检查预算下高效定位证据并回答临床查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23258 2026-05-25 cs.LG 70%

A Simple Plug-in for Improving Eviction-Based KV Cache Compression

一种改进基于驱逐的KV缓存压缩的简单插件

Yuping Lin, Jiayuan Ding, Yue Xing, Pengfei He, Jiliang Tang, Subhabrata Mukherjee

机构 * Michigan State University(密歇根州立大学) Hippocratic AI(希波克拉底AI)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出VECTOR插件,通过引入保留、近似和驱逐的三路路由机制,利用可重构性信号恢复有价值信息,改善中高压缩率下的质量-内存权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23067 2026-05-25 cs.CL 70%

What Training Data Teaches RL Memory Agents: An Empirical Study of Curriculum Effects in Memory-Augmented QA

训练数据教会RL记忆体代理什么:记忆增强问答中课程效应的实证研究

Xinjie He, Zhiyuan Lin, Su Liu, Jialun Wu, Qiyang Xie, Weikai Zhou, Shuai Xiao

机构 * Columbia University(哥伦比亚大学) Independent Researcher(独立研究者) Johns Hopkins University(约翰霍普金斯大学) Northeastern University(东北大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 通过控制实验,研究训练课程(领域内、混合、领域外)对强化学习记忆体代理在记忆增强问答中的技能获取和专业化影响,发现课程组成作为专业化的细粒度杠杆,混合课程在整体F1上最优,而窄领域外课程可转移特定技能(如时间推理),并报告了将GRPO适配到单GPU环境的实用经验。

Comments 14 pages, 2 figures, 11 tables. Code, checkpoints, and evaluation artifacts available at https://github.com/EvaxHe/rl-memory-curriculum

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22850 2026-05-25 cs.DC cs.AI 70%

ObjectCache: Layerwise Object-Storage Retrieval for KV Cache Reuse

ObjectCache: 用于KV缓存重用的分层对象存储检索

Yu Zhu, Aditya Dhakal, Yunming Xiao, Dejan Milojicic, Gustavo Alonso

机构 * ETH Zurich(苏黎世联邦理工学院) HPE Labs(惠普实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出ObjectCache系统,利用S3兼容对象存储存储KV缓存,通过协同设计存储协议和传输调度,在GPU消费顺序下交付数据,重叠数据传输与计算,从而在不增加集群成本的前提下最小化TTFT延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21997 2026-05-22 cs.AI cs.MA 70%

The Log is the Agent: Event-Sourced Reactive Graphs for Auditable, Forkable Agentic Systems

日志即代理:用于可审计、可分支代理系统的事件源反应图

Yohei Nakajima

专题命中 长上下文与记忆 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于事件源的反应图结构,通过将日志作为事实来源,实现了可审计、可分支的代理系统,提供了确定性回放、低成本分支和端到端溯源能力。

Comments 11 pages, 1 figure. Open-source Apache-2.0 implementation with reproducible quickstart demo, deterministic replay, fork-and-diff, and lineage tracing

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03865 2026-05-22 cs.CL 70%

An Entity Linking Agent for Question Answering

用于问答任务的实体链接代理

Yajie Luo, Yihong Wu, Muzhi Li, Jia Ao Sun, Xinyu Wang, Liheng Ma, Yingxue Zhang, Jian-Yun Nie

机构 * The Chinese University of Hong Kong(香港中文大学) McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克AI研究院) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种基于大语言模型的实体链接代理,用于解决问答任务中短且模糊用户问题的实体链接问题,通过两个实验验证了其有效性。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19269 2026-05-21 cs.LG 70%

CODA: Rewriting Transformer Blocks as GEMM-Epilogue Programs

CODA:将Transformer块重写为GEMM-epilogue程序

Han Guo, Jack Zhang, Arjun Menon, Driss Guessous, Vijay Thakkar, Yoon Kim, Tri Dao

机构 * Massachusetts Institute of Technology(麻省理工学院) Princeton University(普林斯顿大学) Together AI Meta

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出CODA,一种将Transformer中的非注意力计算重写为GEMM-epilogue程序的GPU内核抽象,以提高训练效率和硬件利用效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13549 2026-05-21 cs.SE cs.AI 70%

A Showdown of ChatGPT vs DeepSeek in Solving Programming Tasks

ChatGPT与DeepSeek在解决编程任务中的对决

Ronas Shakya, Sam Urmian, Mohammad Khalil

机构 * Centre for the Science of Learning & Technology (SLATE)(学习科学中心及技术(SLATE)) University of Bergen(卑尔根大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文评估了ChatGPT和DeepSeek在解决编程任务中的性能,发现ChatGPT在中等难度任务中表现更优,而两者在困难任务上均面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏