arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4771 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4771 篇

2607.26335 2026-07-30 cs.DC 新提交 80%

The Fabric Is the Cluster Driver: Cross-Layer eBPF Policies for GPU-CXL Fabrics

Fabric 是集群驱动:面向 GPU-CXL Fabric 的跨层 eBPF 策略

Yiwei Yang, Andi Quinn

专题命中 长上下文与记忆 :LLM(summary_cn,abstract)

AI总结 该研究提出 fabric_ext 中间件编译器与运行时,通过语义移动图实现跨 GPU-CXL Fabric 多层的 eBPF 策略,以处理 LLM 预填充等场景下的跨岛数据流需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01194 2026-07-28 cs.CR 版本更新 80%

AgentWatcher: A Rule-based Prompt Injection Monitor

AgentWatcher: 一种基于规则的提示注入监控

Yanting Wang, Wei Zou, Runpeng Geng, Jinyuan Jia

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出AgentWatcher,通过聚焦短文本片段和定义明确的规则,解决提示注入检测中上下文长度影响和规则不明确的问题,实现可扩展且可解释的检测方法。

Comments The code is available at https://github.com/wang-yanting/AgentWatcher

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13612 2026-07-28 cs.CR 80%

PINA: Prompt Injection Attack against Navigation Agents

PINA:针对导航代理的提示注入攻击

Jiani Liu, Yixin He, Lanlan Fan, Qidi Zhong, Yushi Cheng, Meng Zhang, Yanjiao Chen, Wenyuan Xu

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 PINA提出了一种针对导航代理的提示注入攻击检测框架,通过实验展示了其高攻击成功率和稳健性,揭示了导航代理在安全方面的关键漏洞。

Comments Accepted at ICASSP 2026

Journal ref 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22030 2026-07-17 cs.AI cs.CL cs.IR cs.LG 版本更新 80%

When Does Belief-Based Agent Memory Help? Reliability-Conditional Updating and Provenance-Capped Poisoning Defense

Nous:一种用于长期智能体记忆的预测世界模型

Pranav Singh

机构 * Indian Institute of Technology Ropar(印度理工学院罗巴尔分校)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Nous记忆架构,基于知识即预测而非存储的原则,通过贝叶斯更新维护概率分布,以信息论惊喜度评分并记录信念变化,在LoCoMo基准上取得优于对比方法的F1分数。

Comments Preprint. 10 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04031 2026-07-07 cs.AR 新提交 80%

TileLens: Efficiently Using Large-Granularity Memory Systems with Transparent Two-Dimensional Memory Layout

TileLens:通过透明二维内存布局高效使用大粒度内存系统

Jae Hyung Ju, Euijun Chung, Hritvik Taneja, Anish Saxena, Shinnung Jeong, Hyesoon Kim, Moinuddin K. Qureshi

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究大语言模型推理受GPU高带宽内存限制问题,指出大粒度内存系统致 tiled 矩阵乘法性能降。提出用 tile-major 布局缓解读放大,介绍TileLens软硬件扩展,评估显示其能在特定条件下接近HBM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02517 2026-07-03 cs.CV 新提交 80%

WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory

WorldDirector: 构建具有持久动态记忆的可控世界模拟器

Hanlin Wang, Hao Ouyang, Qiuyu Wang, Wen Wang, Qingyan Bai, Ka Leong Cheng, Yue Yu, Yixuan Li, Yihao Meng, Zichen Liu, Yanhong Zeng, Yujun Shen, Qifeng Chen

机构 * HKUST(香港科技大学) Ant Group(蚂蚁集团) ZJU(浙江大学) CUHK(香港中文大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract)

AI总结 提出WorldDirector框架,通过LLM协调3D轨迹与相机运动作为视频生成控制信号,解耦语义运动编排与视觉生成,实现持久动态对象记忆和自由视角探索。

Comments Project Page: https://worlddirector.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00440 2026-07-02 cs.CR 新提交 80%

Minos: A Multi-Agent Collaborative Framework for Provenance-Based Backward Tracking

Minos:一种基于溯源的反向追踪多智能体协作框架

Jiahui Wang, Zhenyuan Li, Zhengkai Wang, Xiangmin Shen, Fan Zhang

专题命中 长上下文与记忆 :LLM(summary_cn,abstract)

AI总结 提出多智能体框架Minos,利用LLM驱动推理进行基于溯源的反向追踪,通过分层上下文管理、检索增强推理和有限状态机协调四个智能体,有效缓解依赖爆炸,在5个数据集上平均召回率0.92、精确率0.64,攻击子图压缩49%。

Comments 20 pages,7 figures, accepted by ESORICS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31206 2026-07-01 cs.SE 新提交 80%

FeatX: Editing Software by Editing Features for Repository-Level Code Evolution

FeatX: 通过编辑特征来编辑软件以实现仓库级代码演化

Xutian Li, Yifeng Zhu, Xianlin Zhao, Yanzhen Zou, Lu Zhang, Bing Xie

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出特征导向工具FeatX,通过提取层次化史诗-特征结构并调用三阶段演化代理,将特征编辑转化为代码补丁,显著降低认知负荷并提升修改定位F1达42.6%。

Comments 4 pages, Accepted to the Tools and Datasets Track of ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30404 2026-06-30 cs.RO 80%

HUMEMBR: Learning Human Routines for Predictive Embodied Navigation

HUMEMBR:学习人类日常行为以进行预测性具身导航

Samira Huber, Klaas Pelzer, Duc M. Nguyen, Xuesu Xiao, Sören Pirk

机构 * Kiel University, Germany(德国基尔大学) George Mason University, USA(美国乔治·马歇尔大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract)

AI总结 提出HUMEMBR系统,通过连续记忆构建与并行检索机制,实现基于人类日常行为的具身问答和导航,相比全上下文LLM基线在长时推理上更高效。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28780 2026-06-30 cs.IR cs.CV 80%

Multimodal Graph RAG for Long-range Visually Rich Document Understanding

多模态图RAG用于长程视觉丰富文档理解

Yi-Cheng Wang, Chu-Song Chen

机构 * Department of Computer Science and Information Engineering, National Taiwan University(国家台湾大学计算机科学与信息工程系) FinTech Center, National Taiwan University(国家台湾大学金融科技中心)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出多模态图RAG方法,通过构建多模态知识图谱解决长文档视觉问答中全局理解不足的问题,并引入新基准DLVQA进行评测,实验表明该方法优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21842 2026-06-23 cs.CR 新提交 80%

Agent-Assisted Side-Channel Attacks on Non-Prefix KV Cache in RAG

代理辅助的非前缀KV缓存侧信道攻击

He Sun, Shinan Liu, Siyuan Ma, Junhao Li, Mingjun Xiao, Wenhao Jiang

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对RAG系统中非前缀KV缓存融合的侧信道漏洞,提出SpliceLeak攻击,利用“阶梯波”时序特征提取私有提示长度和语义内容,并设计SpliceDefense防御机制。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20164 2026-06-19 cs.CL cs.AI cs.LG q-bio.QM 新提交 80%

MedRLM: Recursive Multimodal Health Intelligence for Long-Context Clinical Reasoning, Sensor-Guided Screening, Evidence-Grounded Decision Support, and Community-to-Tertiary Referral Optimization

MedRLM:用于长上下文临床推理、传感器引导筛查、证据支持决策及社区到三级转诊优化的递归多模态健康智能

Aueaphum Aueawatthanaphisut

机构 * School of Information, Computer Communication Technology Sirindhorn International Institute of Technology, Thammasat University Pathum Thani, Thailand 1

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MedRLM递归多模态健康智能框架,通过递归检查、分解、检索、验证和合成患者信息,协调多个专业代理并引入临床证据图记忆,实现长上下文临床推理和传感器引导筛查。

Comments 9 pages, 3 figures, 3 tables, 1 Algorithm, 29 equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12735 2026-06-09 cs.SE 版本更新 80%

OOPS: Automated generation of REST API specification via LLMs

OOPS: 通过大语言模型自动生成REST API规范

Hao Chen, Yunchun Li, Chen Chen, Fengxu Lin, Wei Li

专题命中 长上下文与记忆 :LLM(summary_cn,abstract)

AI总结 提出OOPS方法,利用LLM对服务器代码进行静态分析,通过端点方法提取和OAS生成两步工作流,自动生成高质量OpenAPI规范,无需技术特定规则或人工干预。

Journal ref Journal of Systems and Software 239 (2026) 112914

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02014 2026-06-08 cs.CV cs.AI cs.CL cs.LG 版本更新 80%

Rethinking Genomic Modeling Through Optical Character Recognition

通过光学字符识别重新思考基因组建模

Hongxin Xiang, Pengsen Ma, Yunkang Cao, Di Yu, Haowen Chen, Xinyu Yang, Xiangxiang Zeng

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出OpticalDNA框架,将DNA渲染为视觉布局,利用视觉语言模型进行OCR式基因组理解,实现高保真压缩和长序列高效处理,在450k碱基序列上以近20倍更少有效token超越基线模型。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17315 2026-06-04 cs.AI cs.CL cs.LG 80%

Longer Context, Deeper Thinking: Uncovering the Role of Long-Context Ability in Reasoning

更长上下文,更深思考:揭示长上下文能力在推理中的作用

Wang Yang, Zirui Liu, Hongye Jin, Qingyu Yin, Vipin Chaudhary, Xiaotian Han

机构 * Case Western Reserve University(凯斯西储大学) University of Minnesota - Twin Cities(明尼苏达大学双城分校) Texas A&M University(德克萨斯阿姆大学)

专题命中 长上下文与记忆 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过实验发现,增强模型的长上下文能力(在监督微调前)能显著提升推理性能,即使对于短输入任务也有泛化收益,表明长上下文建模是推理能力的关键基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00866 2026-06-02 cs.OS 80%

Idleness is Relative: Exploiting Tool-Call Idle Windows for Offloading in Agentic Systems with MORI

空闲是相对的:利用工具调用空闲窗口在MORI代理系统中进行卸载

Tian Xia, Hanchen Li, Zhifei Li, Xiaokun Chen, Hao Kang, Yifan Qiao, Yi Xu, Ion Stoica

专题命中 长上下文与记忆 :LLM(summary_cn,abstract)

AI总结 提出MORI系统,通过将代理程序按空闲程度连续排序并动态划分内存层级,解决了LLM代理工作负载中KV缓存卸载效率低下的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27224 2026-06-02 cs.SE cs.CR 80%

Finding Memory Leaks in C/C++ Programs via Neuro-Symbolic Augmented Static Analysis

通过神经符号增强静态分析发现C/C++程序中的内存泄漏

Huihui Huang, Jieke Shi, Bo Wang, Zhou Yang, David Lo

专题命中 长上下文与记忆 :LLM(summary_cn,abstract)

AI总结 提出MemHint神经符号管道,结合LLM语义理解与Z3符号推理,扩展静态分析器对自定义内存管理函数的识别和路径敏感控制流建模,在8个真实项目中发现54个内存泄漏(53个确认/修复),每个漏洞成本约1.7美元。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31584 2026-06-01 cs.CL cs.AI cs.LG 80%

LongTraceRL: Learning Long-Context Reasoning from Search Agent Trajectories with Rubric Rewards

LongTraceRL: 基于评分奖励从搜索智能体轨迹中学习长上下文推理

Nianyi Lin, Jiajie Zhang, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学)

专题命中 长上下文与记忆 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出LongTraceRL框架,通过知识图谱随机游走生成多跳问题并利用搜索智能体轨迹构建分层干扰物,结合基于实体链的评分奖励进行过程监督,提升大语言模型在长上下文推理中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09367 2026-05-28 cs.CV 80%

EpiAgent: An Agent-Centric System for Ancient Inscription Restoration

EpiAgent: 一种以智能体为中心的古铭文修复系统

Shipeng Zhu, Ang Chen, Na Nie, Pengfei Fang, Min-Ling Zhang, Hui Xue

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其跨学科应用关键实验室(东南大学),教育部,中国) Key Laboratory of Computer Network and Information Integration (Southeast University), Ministry of Education, China(计算机网络与信息集成关键实验室(东南大学),教育部,中国) Nanjing University Museum, Nanjing University, China(南京大学博物馆,南京大学,中国) The China Centre for Linguistic and Strategic Studies, Nanjing University, China(中国语言战略研究中心,南京大学,中国)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract)

AI总结 提出基于智能体的EpiAgent系统,通过分层规划与LLM协调多模态分析、历史经验和专用工具,实现灵活自适应的古铭文修复,在真实退化铭文上取得更优修复质量和泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23170 2026-05-25 cs.CL cs.AI cs.LG 80%

Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks

长上下文LLM中的位置失败:推理基准测试中的盲点

Chuyifei Zhang, Hongyu Cui, Xiaowen Huang, Jitao Sang

机构 * Beijing Jiaotong University(北京交通大学) Central South University of Forestry and Technology(中央林业科技大学)

专题命中 长上下文与记忆 :LLM(title_cn,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 通过提出上下文旋转评估(CRE)框架,系统控制任务位置、填充内容和上下文长度,揭示了长上下文推理基准测试中因任务位置变化导致的模型性能显著下降,并发现填充-答案干扰是主要错误模式。

Comments 20 pages, 1 figure, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20724 2026-05-21 cs.IR 80%

CALMem : Application-Layer Dual Memory for Conversational AI

CALMem : 会话AI的应用层双记忆

Rajendra Narayan Jena, Rajan Padmanabhan, Sankar Arumugam

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对大型语言模型固定上下文窗口限制会话连续性的问题,CALMem提出了一种应用层双记忆架构,通过结合事件记忆层和语义记忆层,实现无限制的有效上下文容量,无需修改底层模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13762 2026-05-14 cs.MA 80%

EconAI: Dynamic Persona Evolution and Memory-Aware Agents in Evolving Economic Environments

EconAI:动态身份演变与记忆感知代理在演变经济环境中的应用

Annie Liu, Zane Cao, Lang Chen, Zongxin Xu, Zigan Wang

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出EconAI框架,通过经济情绪指数、记忆加权和动态决策机制,提升经济模拟的适应性和真实性,实现宏观与微观经济环境的统一模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10712 2026-05-12 cs.SE cs.CR 80%

AutoSOUP: Safety-Oriented Unit Proof Generation for Component-level Memory-Safety Verification

AutoSOUP:面向组件级内存安全验证的安全导向单元证明

Paschal C. Amusuo, Ricardo Calvo, Dharun Anandayuvaraj, Taylor Le Lievre, Kevin Kolyakov, Elijah Jorgensen, Aravind Machiry, James C. Davis

专题命中 长上下文与记忆 :LLM(summary_cn,abstract)

AI总结 AutoSOUP通过安全导向单元证明自动化组件级内存安全验证,结合确定性程序合成与LLM,生成可验证的证明以提高内存安全验证的自动化水平。

Comments 13 main pages, 7 appendix pages, 2 figures, 5 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17979 2026-05-12 cs.IR 80%

Architecture Matters More Than Scale: A Comparative Study of Retrieval and Memory Augmentation for Financial QA Under SME Compute Constraints

架构比规模更重要:在中小企业计算限制下的金融问答中检索与记忆增强的比较研究

Jianan Liu, Jing Yang, Xianyou Li, Weiran Yan, Yichao Wu, Penghao Liang, Mengwei Yuan

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文在中小企业计算限制下比较了检索增强生成和记忆增强推理架构,发现结构化记忆在确定性任务中更精确,而检索方法在对话场景中表现更优,提出混合部署框架以平衡准确性、可审计性和效率。

Comments Accepted at the 2026 6th International Conference on Artificial Intelligence and Industrial Technology Applications (AIITA 2026), to be published by IEEE. 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22457 2026-05-08 cs.DC cs.ET 80%

CCCL: Node-Spanning GPU Collectives with CXL Memory Pooling

CCCL: 基于CXL内存池的节点跨度GPU集体通信

Dong Xu, Han Meng, Xinyu Chen, Dengcheng Zhu, Wei Tang, Fei Liu, Liguang Xie, Wu Xiang, Rui Shi, Yue Li, Henry Hu, Hui Zhang, Jianping Jiang, Dong Li

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出CCCL库,利用CXL共享内存池实现跨节点GPU操作,解决同步、数据交错和通信并行化问题,实验显示在多个节点上性能提升显著,证明CXL在可扩展内存导向GPU通信中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01477 2026-05-05 cs.RO 80%

Action Agent: Agentic Video Generation Meets Flow-Constrained Diffusion

动作代理:代理视频生成与流约束扩散的结合

Jeffrin Sam, Nguyen Khang, Yara Mahmoud, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Skoltech(斯克里普切尔技术大学智能空间机器人实验室)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Action Agent框架,结合代理导航视频生成与流约束扩散控制,通过两阶段方法提升多体机器人导航性能,实现从语言和图像输入生成物理合理的第一人称导航视频,并在真实和仿真环境中取得高成功率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00413 2026-05-04 cs.SE 80%

ClozeMaster: Fuzzing Rust Compiler by Harnessing LLMs for Infilling Masked Real Programs

ClozeMaster:利用LLMs填充掩码真实程序以模糊Rust编译器

Hongyan Gao, Yibiao Yang, Maolin Sun, Jiangchang Wu, Yuming Zhou, Baowen Xu

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出ClozeMaster,通过利用LLMs填充掩码的真实程序,生成有效测试用例,发现Rust编译器27个已确认的bug,优于现有模糊测试工具。

Comments Accepted at ICSE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27436 2026-05-01 eess.AS eess.IV 80%

BUT System Description for CHiME-9 MCoRec Challenge

BUT系统描述用于CHiME-9 MCoRec挑战

Dominik Klement, Alexander Polok, Nguyen Hai Phong, Prachi Singh, Lukáš Burget

专题命中 长上下文与记忆 :LLM(summary_cn,abstract)

AI总结 本文提出BUT系统,通过长上下文目标说话人音频视频ASR模型和LLM聚类方法,在CHiME-9 MCoRec任务中实现高精度语音识别与对话组划分。

Comments Accepted to HSCMA 2026 Workshop at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23553 2026-04-28 cs.DC 80%

ClusterFusion++: Expanding Cluster-Level Fusion to Full Transformer-Block Decoding

ClusterFusion++: 扩展集群级融合至完整Transformer-块解码

ChiHeng Jin, Hongche Yu, Xihui Chen

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出ClusterFusion++,通过融合Transformer解码器全块中的各层操作,提升Pythia模型的吞吐量,同时保持高输出保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11297 2026-04-14 cs.LG cs.AI cs.CL 80%

The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping

过去并非过去:记忆增强的动态奖励塑造

Yang Liu, Enxi Wang, Yufei Gao, Weixin Zhang, Bo Wang, Zhiyuan Zeng, Yikai Zhang, Yining Zheng, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MEDS框架,通过整合历史行为信号改进奖励设计,提升大语言模型的探索多样性与性能,实验显示在多个数据集上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏