arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-22 至 2026-07-22 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 11 篇

2510.19299 2026-07-22 cs.AI cs.MA cs.SI 版本更新 90%

Learning to Make Friends: Coaching LLM Agents toward Emergent Social Ties

学习交朋友:引导大语言模型智能体形成新兴社会关系

Philipp J. Schneider, Lin Tian, Marian-Andrei Rizoiu

机构 * EPFL Lausanne, Switzerland(洛桑联邦理工学院) University of Technology Sydney(悉尼技术大学)

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究LLM智能体能否再现人类在线行为社会动态及相关机制。提出多智能体LLM模拟框架,设计行为奖励函数,经实验发现引导后的智能体形成稳定互动与社会关系,为研究LLM群体集体动态建立测试平台。

Comments NeurIPS 2025 Workshop: Scaling Environments for Agents (SEA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03691 2026-07-22 cs.SE cs.AI cs.LG 版本更新 90%

Don't Blame the Large Language Model: How Agent Harness Evolution Shapes Coding Agent Quality

不要责怪大语言模型:脚手架演化如何塑造编码代理质量

Oussama Ben Sghaier, Hao Li, Bram Adams, Ahmed E. Hassan

机构 * Queen’s University Canada(加拿大女王大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究编码代理中脚手架演化对其质量的影响。通过固定模型、仅改变脚手架,对Qwen Code CLI的35个连续版本进行评估,追踪质量波动与开发模式及架构组件的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18727 2026-07-22 cs.PL cs.AR 新提交 86%

Formal Verification of an Out-of-Order Multiprocessor against an In-Order Weak-Memory ISA

针对顺序弱内存ISA的乱序多处理器形式验证

Janggun Lee, Jeehoon Kang

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对顺序弱内存ISA的乱序多处理器验证问题,核心方法是设计核心规范并分两步证明,主要贡献是首次实现此类形式验证,借助核心规范简化证明,且利用LLM代理自动编写证明。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18241 2026-07-22 cs.AI 新提交 85%

BatchDAG: LLM-Planned Execution Graphs for Scalable Ad-Hoc Analysis Over Enterprise Data

BatchDAG:用于企业数据上可扩展即席分析的大语言模型规划执行图

Anupreet Walia

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对企业数据跨实体分析问题,提出BatchDAG系统,大语言模型生成操作DAG,经确定性引擎评估。通过实体感知批处理优化,减少大语言模型调用。实验显示其质量高、溯源性好,能高效处理查询,是通用编排层替代手工工作流程。

Comments 9 pages, 2 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17545 2026-07-22 cs.AI 版本更新 85%

Retain or Consolidate? Budget-Dependent Operator Selection for Language Agent Memory

保留还是合并?语言智能体记忆中依赖预算的算子选择

Qingcan Kang, Mingyang Liu, Shixiong Kai, Kaichao Liang, Zhentao Tang, Yuqi Cui, Tao Zhong, Mingxuan Yuan

专题命中 长上下文与记忆 :language agent(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究语言智能体记忆中预算依赖的算子选择问题,核心方法是将算子效用分解,用离线抽象安全机制实现,主要贡献是通过实验揭示在不同预算下保留和合并策略的适用情况及算子效果差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19257 2026-07-22 cs.CL cs.AI 新提交 85%

Prompt Design at Scale: How Format, Instruction Count, and Context Length Shape Instruction Adherence and Hallucination in Large Language Models

大规模提示设计:格式、指令数量和上下文长度如何影响大语言模型中的指令遵循和幻觉

Netanel Eliav

机构 * Machine Human Intelligence Lab (MHIL)(机器人类智能实验室)

专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 研究大语言模型提示设计中格式、指令数量和上下文长度对指令遵循及幻觉的影响,通过在合成语料库上的两个控制实验评估五个模型,揭示了不同因素下的表现及规律,还发布了相关工具和结果。

Comments 21 pages, 6 figures. Code and data: https://github.com/iNetanel/veyrabench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30566 2026-07-22 cs.CR cs.LG 版本更新 81%

Forensic Trajectory Signatures for Agent Memory Poisoning Detection

用于智能体记忆中毒检测的法医轨迹签名

Jun Wen Leong

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 发现LLM智能体在持久记忆中毒下的行为不变性,利用轨迹特征实现高精度检测(AUC=0.9904),并能区分记忆通道攻击与提示注入攻击。

Comments 16 pages, 3 figures. v2: adds preregistered deployment boundary study (N=4,360, 13 models). Companion to arXiv:2605.08442

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18754 2026-07-22 cs.AI cs.CL 新提交 81%

AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents

AgentDebugX:用于大语言模型代理中故障可观测性、归因和恢复的开源工具包

Kunlun Zhu, Xuyan Ye, Zhiguang Han, Yuchen Zhao, Bingxuan Li, Weijia Zhang, Muxin Tian, Xiangru Tang, Pan Lu, James Zou, Jiaxuan You, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Toronto(多伦多大学) Google(谷歌公司) Stanford University(斯坦福大学)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型代理故障调试难题,提出开源框架AgentDebugX,其核心DeepDebug通过多轮诊断定位根源,在基准测试中表现出色,能修复更多失败任务,还通过多种方式公开工作流程并提供错误中心。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10248 2026-07-22 cs.CL cs.LG 版本更新 81%

One mechanism for many mental spaces: a shared router over a value slot in language models

一种机制用于多种心理空间:语言模型中基于值槽的共享路由器

Oliver Steele, Jiangtao Wen, Yuxing Han

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究Transformer语言模型实现何种心理空间构建机制,发现其采用共享路由器和值槽格式,一种空间类型子空间训练能控制其他类型,确立跨类型通用性,还表明该机制驱动推理和组合。

Comments 26 pages, 5 figures, 9 tables. v2: cite the released Mental Spaces Corpus (dataset DOI); switch to ACL bibliography style; minor copy-editing. No change to results

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18886 2026-07-22 cs.SE 新提交 67%

TraceDev: A Traceability-Driven Multi-agent Framework for Requirement-to-Code Development

TraceDev:一种用于需求到代码开发的可追溯性驱动的多智能体框架

Mingyu Chen, Yakun Zhang, Zihao Xie, Yixing Luo, Jinrui Xu, Cuiyun Gao, Kaiqi Zhao, Yunming Ye

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 针对现有方法在自然语言需求到代码转换中存在的不足,提出TraceDev多智能体框架,通过五个特定角色智能体及可追溯性图,实现自动化软件开发,在两个数据集上的评估结果证明了其在需求到代码生成上的有效性。

Comments Accepted by ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00555 2026-07-22 cs.AR 版本更新 67%

Sim-FA: A GPGPU Simulator Framework for Fine-Grained Asynchronous Pipeline Analysis

Sim-FA:异步流水线的模拟前端

Zhongchun Zhou, Yuhang Gu, Chengtao Lai, Ya Wang, Zeyu Han, Wei Zhang, Jun Liu

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 本文提出Sim-FA模拟器,用于高效支持大语言模型,通过模拟流水线实现高精度性能评估,并分析FlashAttention-3的流量估计问题。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏