arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 571 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 571 篇

2607.26455 2026-07-30 cs.CL cs.AI 新提交 84%

ForgetBench: Benchmarking Forgetting Dynamics of Long-Term Parametric Memory in Language Models

ForgetBench:语言模型中长期参数记忆的遗忘动态基准测试

Ruxi Gu, Zhenliang Zhang, Wei Wang

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出ForgetBench基准测试,通过两种评估范式与统一分析框架,揭示现有LLMs在长期知识保留与泛化间难以平衡的问题,为未来模型记忆机制优化提供方向。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25140 2026-07-29 cs.AI cs.CL cs.GR cs.MA 新提交 84%

How Affect Propagates among LLM Agents: Emergent Emotional Contagion in Crowd Simulation

情感如何在大语言模型智能体之间传播:人群模拟中的涌现情感传染

Funda Durupinar

机构 * University of Massachusetts(马萨诸塞大学)

专题命中 长上下文与记忆 :LLM(title,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究多智能体人群模拟中情感传播,通过感知 - 评估 - 表达循环及借鉴相关模型构建架构,在多场景评估,揭示情感传染动态,包括警报扩散、个性影响等,还发现评估步骤动态依赖后端。

Comments 31 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22389 2026-07-27 cs.AR cs.AI cs.LG 新提交 84%

HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding

HiKV:用于大语言模型解码的具有硬件加速的分层重要性感知键值缓存

Chao Fang, Jun Yin, Man Shi, Marian Verhelst

机构 * ESAT-MICAS, KU Leuven(KU莱顿大学ESAT-MICAS)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对长上下文大语言模型解码时键值缓存的内存瓶颈,HiKV提出算法-硬件协同设计,通过分层重要性感知在两粒度压缩缓存,开发专用加速器统一两阶段加速,在大语言模型上评估实现加速、降能及减少内存访问,优于现有方法。

Comments To appear in the IEEE Transactions on Circuits and Systems I: Regular Papers (TCAS-I)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11614 2026-07-14 cs.CL cs.AI 新提交 84%

Extending LLM Context via Associative Recurrent Memory

通过关联循环记忆扩展大语言模型上下文

Gleb Kuzmin, Ivan Rodkin, Aydar Bulatov, Yuri Kuratov, Lyudmila Rvanova, Mikhail Katkov, Ilia Sochenkov, Misha Tsodyks, Timothy Baldwin, Mikhail Burtsev, Artem Shelmanov

机构 * FusionBrain Lab(融合大脑实验室) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Cognitive AI Systems Lab(认知人工智能系统实验室) RUDN(俄罗斯人民友谊大学) London Institute for Mathematical Sciences(伦敦数学科学研究所) MIRAI(未来人工智能研究机构) Lomonosov Moscow State University(莫斯科国立罗蒙诺索夫大学) Laboratory for Analysis and Controllable Text Generation Technologies RAS(俄罗斯科学院分析与可控文本生成技术实验室) School of Natural Sciences, Institute for Advanced Study, Princeton(普林斯顿高等研究院自然科学学院) Department of Brain Sciences, Weizmann Institute of Science(魏茨曼科学研究所脑科学系)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究如何通过关联循环记忆扩展大语言模型上下文长度。提出ARMT方法,构建特定数据集,给出综合训练方法。实验表明该方法能让模型处理超长输入,更好泛化,且降低计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26629 2026-06-26 cs.LG cs.CL 新提交 84%

From Weights to Features: SAE-Guided Activation Regularization for LLM Continual Learning

从权重到特征:SAE引导的激活正则化用于大语言模型持续学习

Evan Ning, Wei Xue, Dong Lou, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对大语言模型持续学习中的灾难性遗忘问题,提出利用预训练稀疏自编码器(SAE)在激活空间进行正则化,通过特征掩码平衡稳定性和可塑性,无需旧任务数据,内存效率高,在TRACE和MedCL基准上超越EWC等方法。

Comments 21 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12703 2026-06-12 cs.CR cs.AI cs.LG 新提交 84%

SMSR: Certified Defence Against Runtime Memory Poisoning in Persistent LLM Agent Systems

SMSR:针对持久化LLM代理系统中运行时内存投毒的认证防御

Tarun Sharma

机构 * Independent Researcher(独立研究者)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出SMSR防御框架,通过写入时HMAC签名和查询时随机化内存消融与基于判决的多数投票,首次为多会话内存投毒攻击提供认证鲁棒性保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10435 2026-06-10 cs.LG cs.CL 新提交 84%

Parallel Causal Associative Fields: Gated Sparse Memory for Long-Context Language Modeling

并行因果关联域:用于长上下文语言建模的门控稀疏记忆

Muhammad Ahmed

机构 * Independent Researcher(独立研究员)

专题命中 长上下文与记忆 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 提出并行因果关联域(PCAF),通过哈希桶存储局部记录、检索候选集形成稀疏缓存,并与参数化语言模型门控混合,实现稀疏长上下文访问,避免固定状态瓶颈。

Comments 17 pages, 5 figures, and 6 tables. Experiments on WikiText-103, PG-19, and WikiText-2 using TPU v4-32 and NVIDIA RTX 3060 hardware. Code: https://github.com/ahmed123hds/PCAF

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03800 2026-08-05 cs.CY cs.AI cs.SI 新提交 84%

Autoreflection: How Agentic Strange Loops Turn Human Culture into AI Infrastructure

自反:智能体的奇异循环如何将人类文化转化为AI基础设施

Holly Lewis

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.AI;large language model(comments);language model(comments)

AI总结 本文提出自反概念,以LLM智能体为研究对象,通过Moltbook平台案例验证其行为标准,发现智能体将人类文化转化为自身AI基础设施。

Comments 35 pages. Also available at https://philarchive.org/rec/LEWAHA. Keywords: autoreflection, AI agents, agentic AI, LLM agents, generative agents, large language models, multi-agent systems, agent societies, Moltbook, OpenClaw, situational awareness, in-context learning, philosophy of mind, emergent behavior, computational social science, identity, memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23195 2026-06-25 cs.LG cs.AI cs.CL 新提交 83%

Memory Contagion: Cross-Temporal Propagation of Evaluator Bias via Agent Memory

记忆传染:通过智能体记忆的评估者偏见的跨时间传播

Zewen Liu

机构 * Independent Researcher(独立研究员)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大型语言模型智能体记忆中评估者偏见通过记忆存储跨时间传播的现象,发现即使完美记忆整合也会导致偏见传播,且无安全阈值。

Comments 12 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06416 2026-08-10 cs.CR cs.AI 新提交 83%

WorldMark: A Plug-and-Play World Knowledge Interface for Cross-Host Language Model Watermarking

WorldMark:一种用于跨宿主语言模型水印的即插即用世界知识接口

Song Xiao, Yuqi Yuan, Yanshuo Zhang, Kejun Zhang

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本研究提出即插即用的WorldMark接口,通过世界知识记忆与非对称知识调制优化跨宿主语言模型水印,提升检测性能且开销可忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01739 2026-08-04 cs.AI 新提交 83%

CoEvo-Mem: Co-Evolving Retrieval Policy and Memory Bank for LLM Agents

CoEvo-Mem:协同演化检索策略与记忆库的大语言模型智能体框架

Bowen Ye, Yongchao Xu, Zhijian Li, Xiang Yin, Junkai Ma, Wenzhao Li

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI

AI总结 CoEvo-Mem是协同演化检索策略与记忆库的闭环框架,通过交替更新路由器与记忆库,在七个基准测试中实现了大语言模型智能体的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01234 2026-08-04 cs.AI 新提交 83%

Learning What to Remember and What to Internalize in LLM Self-Evolution via Adaptive Memory-Parameter Coordination

在大语言模型自进化中通过自适应记忆-参数协调学习该记住什么和该内化什么

Tianyun Ji, Zhenya Huang, Jiayu Liu, Zirui Liu, Yu Su, Hongbin Pei

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Hefei Normal University(合肥师范学院) Xi’an Jiaotong University(西安交通大学)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出 COVE 框架,通过任务感知路由等方式协调大语言模型自进化的记忆与参数通道,解决单通道进化的灵活性与性能权衡问题,在多任务上实现更稳健高效的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12397 2026-07-15 cs.AI 新提交 83%

Critic Experience Bank: Self-Evolving Step-Level Confidence Estimation for LLM Agents

评论家经验库:大语言模型智能体的自进化步骤级置信度估计

Yaopei Zeng, Congchao Wang, JianHang Chen, Nan Wang, Yurui Chang, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Virginia Tech(弗吉尼亚理工大学) Purdue University(普渡大学) Amazon AGI(亚马逊通用人工智能)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI

AI总结 研究大语言模型智能体的步骤级置信度估计问题,提出自进化评论家框架CEB,其通过积累自身过去判断及后果证据来估计置信度,无需训练和真实步骤标签,在多个基准和主干上校准和排名表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09921 2026-07-14 cs.CL 新提交 83%

Global Merger-Arbitrage Forecasting with Language Models

使用语言模型进行全球并购套利预测

Hinal Jajal, Michal Mucha, Charles Sweat, Chris Pulman, Charlie Flanagan, Peter Anderson

专题命中 长上下文与记忆 :language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 研究使用语言模型预测并购套利结果,结合专家指导上下文工程与基于事后推理痕迹的微调,在超400笔跨国大交易的样本外数据集上性能最佳,证明该方法在专业长上下文金融工作流中成功,相关因素起关键作用。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26403 2026-06-26 cs.CL 新提交 83%

ProfileFoundry: A Synthetic Person-Object Substrate for Privacy, Memory, and Tool-Use Evaluation in LLM Agent

ProfileFoundry: 用于LLM智能体隐私、记忆和工具使用评估的合成人物-对象基底

Sriram Selvam, Anneswa Ghosh

机构 * NVIDIA Corporation(英伟达公司)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL

AI总结 提出ProfileFoundry,一个确定性生成器,发布10万个合成成人人物对象,包含快照、家庭、雇主等字段及事件、关系边,用于下游基础模型评估中的记忆、隐私等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25115 2026-06-25 cs.LG cs.NI 新提交 83%

Forget to Improve: On-Device LLM-Agent Continual Learning via Budget-Curated Memory

遗忘以改进:通过预算策划内存的设备端LLM智能体持续学习

Beining Wu, Zihao Ding, Jun Huang, Yanxiao Zhao

机构 * Apple(苹果) Google(谷歌) Microsoft(微软) Meta Alibaba(阿里巴巴)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.LG

AI总结 提出净价值每字节评分机制,在设备端智能体内存中权衡价值与危害,实现预算约束下的记忆保留、共享与信任决策,降低内存和上行带宽并防御注入攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10537 2026-06-10 cs.CL 新提交 83%

Prefilling-dLLM: Predictive Prefilling for Long-Context Inference in Diffusion Language Models

Prefilling-dLLM: 扩散语言模型中长上下文推理的预测性预填充

Jing Xiong, Qi Han, Shansan Gong, Yunta Hsieh, Chengyue Wu, Chaofan Tao, Chenyang Zhao, Ngai Wong

机构 * The University of Hong Kong(香港大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) LMSYS Org(LMSYS组织)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 针对扩散语言模型在长上下文中因重复编码前缀导致计算量二次增长的问题,提出Prefilling-dLLM框架,通过分块缓存KV表示并基于稀疏性选择相关块,实现高效解码,在LongBench等基准上达到最先进加速效果。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12720 2026-08-14 cs.CL cs.AI 新提交 82%

ERSkill: Evolving for Skill-Guided Adaptive Memory Retrieval

ERSkill:面向技能引导的自适应记忆检索的演化框架

Haolong Chen, Liang Zhang, Zhuo Li, Lei Xue, Guanrxu Zhu

机构 * Shenzhen International Center for Industrial and Applied Mathematics(深圳国际工业与应用数学中心) Shenzhen Research Institute of Big Data(深圳大数据研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ERSkill是一个以检索为核心的自演化技能引导记忆访问框架,通过协同演化技能集与路由器,在多个智能体记忆基准上大幅超越基线,在两款模型上分别实现31.3%、28.1%的指标提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12627 2026-08-14 cs.CV cs.AI cs.CL cs.HC 新提交 82%

EgoCITE: Context-Augmented Indexing and Time-Aware Retrieval for Long-Horizon Egocentric Memory

EgoCITE:面向长时程自我中心记忆的上下文增强索引与时序感知检索

Le Zhang, Ke Sun

机构 * University of Michigan(密歇根大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究针对长时程自我中心记忆系统的索引不可靠、忽略时序意图的问题,提出EgoCITE框架,经多数据集评估,其准确率优于基线且成本显著低于长上下文LLM智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08684 2026-08-11 cs.LG cs.AI 新提交 82%

RippleKV: Cross-Layer KV Cache Allocation via Perturbation Propagation

RippleKV:基于扰动传播的跨层KV缓存分配

Dongjie Xu, Kai Qian, Julius, Weijie Shi, Yuxuan Sun, Minghua Tang, Fenglei Jin, Hanchi Dong, Jiajie Xu

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 针对长上下文LLM推理的KV缓存分配问题,提出RippleKV方法,通过层值缓存扰动敏感性分配预算,在LongBench上的匹配缓存预算下实现了最高平均性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08236 2026-08-11 cs.AI cs.CL 新提交 82%

LatticeMind: A Conflict-Aware Memory Primitive for Multi-Agent Systems

LatticeMind:面向多智能体系统的冲突感知记忆原语

Heng Zhou, Lian Zhang, Yutao Fan, Tiancheng He, Siki Chen, Hejia Geng, Philip Torr, Zhenfei Yin

机构 * University of Science and Technology of China(中国科学技术大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Shanghai AI Laboratory(上海人工智能实验室) Beijing University of Posts and Telecommunications(北京邮电大学) University of Oxford(牛津大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出冲突感知记忆原语LatticeMind,解决多智能体LLM系统的主张信任决策问题,在ConflictBank评估中准确率达0.97,显著优于基线, ablation验证了其核心组件的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13027 2026-07-15 cs.CL cs.AI 新提交 82%

PalmClaw: A Native On-Device Agent Framework for Mobile Phones

PalmClaw:一种用于手机的原生设备上代理框架

Hongru Cai, Yongqi Li, Ran Wei, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Hangzhou Diagens Biotechnology Co., Ltd.(杭州迪基因生物技术有限公司)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对移动设备上代理框架存在的问题,提出PalmClaw开源框架,能在手机上原生运行并管理相关要素,将设备能力以工具形式呈现,实验显示该框架提升了任务成功率、缩短完成时间且降低设置负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01224 2026-07-02 cs.AI cs.CL cs.MA 新提交 82%

AutoMem: Automated Learning of Memory as a Cognitive Skill

AutoMem:自动化学习记忆作为认知技能

Shengguang Wu, Hao Zhu, Yuhui Zhang, Xiaohan Wang, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出AutoMem框架,通过双循环自动优化LLM的记忆管理结构和使用能力,在长时域任务中提升性能约2-4倍。

Comments Project Website: https://autolearnmem.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20898 2026-06-23 cs.IR cs.AI cs.CL cs.CY 新提交 82%

The Token Tax of Epistemic Accuracy: Comparing RAG and Long-Context Architectures for Document-Grounded Generative AI Applications

认知准确性的Token税:比较RAG与长上下文架构在文档基础生成式AI应用中的表现

Austin Hamilton, Ryan Singh, Michael Wise, Ibrahim Yousif, Arthur Carvalho, Zhe Shan, Mohammad Mayyas, Lora A. Cavuoto, Fadel M. Megahed

机构 * Miami University(迈阿密大学) University at Buffalo(布法罗大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);small language model(abstract);prompting(abstract)

AI总结 研究比较RAG与长上下文提示两种架构在文档基础生成式AI中的认知准确性与成本权衡,发现长上下文虽准确率更高(73.1% vs 65.4%),但Token成本增加26倍。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18726 2026-06-18 cs.LG cs.AI 新提交 82%

Graph Grounded Cross Attention Transformer Neural Network for Structurally Constrained Full Event Sequence Generation in Predictive Process Monitoring

基于图锚定交叉注意力Transformer神经网络的预测过程监控中结构约束完整事件序列生成

Fang Wang, Ernesto Damiani

机构 * Department of Computer Science, University of Milan(米兰大学计算机科学系)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出图锚定交叉注意力Transformer(GGATN),通过全局过程图作为结构化记忆、Transformer自注意力编码序列位置、图锚定交叉注意力注入过程拓扑,结合维特比式图约束解码,一次性生成完整事件序列,在六个基准日志上优于LLM基线。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15903 2026-06-17 cs.CL cs.AI 新提交 82%

Control-Plane Placement Shapes Forgetting: An Architectural Study of Agent Memory Across Thirteen System Configurations

控制平面放置塑造遗忘:跨十三种系统配置的智能体记忆架构研究

Dongxu Yang

机构 * DeepLethe

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 研究LLM在智能体记忆管道中的位置(控制平面 vs 召回平面)对遗忘失败模式的影响,通过13种配置在385例对抗测试集上的实验,揭示了三种放置机制的互补覆盖范围,并提出了ForgetEval评估套件。

Comments 25 pages including appendices. Code, benchmark, and adapters released under MIT at https://github.com/deeplethe/lethe

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10716 2026-06-12 cs.CL cs.AI 新提交 82%

Attention Expansion: Enhancing Keyphrase Extraction from Long Documents with Attention-Augmented Contextualized Embeddings

注意力扩展:利用注意力增强的上下文嵌入提升长文档关键短语提取

Roberto Martínez-Cruz, Alvaro J. López-López, José Portela

机构 * Institute for Research in Technology, ICAI School of Engineering, Comillas Pontifical University(技术研究所,ICAI工程学院,科米利亚斯宗座大学) DD-AIM, Senior Machine Learning Researcher(DD-AIM,高级机器学习研究员)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出注意力扩展机制,通过预训练词嵌入增强PLM的上下文表示,在不增加计算成本的情况下扩展有效上下文范围,显著提升长文档关键短语提取性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07603 2026-06-09 cs.LG cs.AI 新提交 82%

MetaEvo: A Meta-Optimization Framework for Experience-Driven Agent Evolution

MetaEvo:一种基于经验驱动的智能体进化的元优化框架

Bowen Ren, Heyan Huang, Yinghao Li, Yang Gao

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Beijing Institute of Technology Southeast Academy of Information Technology(北京理工大学东南信息技术研究院)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出MetaEvo两阶段框架,通过偏好优化增强模型从任务经验中抽象原则的能力,并在模块化架构中积累复用,持续提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29279 2026-08-03 cs.SD 新提交 82%

ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition

ParaASR:面向快速长上下文基于大语言模型的语音识别的多令牌预测

Qingjian Lin, Yuxin Li, Haoyang Zhang, Jun Chen, Yechang Huang, Feng Tian, Xie Li, Xiangyu Tony Zhang, Daijiao Liu, Yuxin Zhang, Jinglan Gong, Bo Zhao, Fei Tian, Xuerui Yang, Gang Yu, Xiangyu Zhang, Daxin Jiang

机构 * StepFun(阶跃星辰) NTU(南洋理工大学) PKU(北京大学) UNSW(新南威尔士大学) SJTU(上海交通大学) USTC(中国科学技术大学)

专题命中 长上下文与记忆 :LLM(title,abstract);language model(abstract)

AI总结 ParaASR是一款基于大语言模型的ASR系统,通过多令牌预测技术,在保持低错误率、低延迟的同时,支持32K长上下文及30分钟音频的快速转录,兼顾识别质量、速度与上下文长度。

Comments 14 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25820 2026-07-29 cs.CV 新提交 82%

Food Image Segmentation with LLM-Derived Ingredient Labels and Multimodal Fusion

基于大语言模型衍生成分标签和多模态融合的食品图像分割

Jui-Feng Chi, Wei-Ta Chu, Sheng-Long Lin

机构 * National Cheng Kung University(国立成功大学)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract)

AI总结 针对现有食品图像分割模型在相似成分和罕见类别上表现不佳的问题,提出两个多模态模块LIM-F和LIM-Q,利用大语言模型衍生标签提升分割性能,在FoodSeg103基准测试中取得领先,且内存消耗增加适度,为细粒度食品理解提供实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏