arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-15 至 2026-07-15 共收录 114 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 4 篇

2607.12831 2026-07-15 cs.CL 新提交 83%

Knowledgeless Language Models: Suppressing Parametric Recall for Evidence-Grounded Language Modeling

无知识语言模型:抑制参数化记忆以进行基于证据的语言建模

Roi Cohen, Yvan Carré, Nick Lechtenbörger, Hendrik Droste, Lucas Kerschke, Russa Biswas, Gerard de Melo, Jan Buys

机构 * HPI / University of Potsdam(波茨坦大学哈索·普拉特纳数字工程学院) African Institute for Mathematical Sciences(非洲数学科学研究所) Department of Computer Science Aalborg University(奥尔堡大学计算机科学系) Department of Computer Science University of Cape Town(开普敦大学计算机科学系) Polytechnique Montréal(蒙特利尔理工大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 研究修改预训练信号能否使语言模型从参数化记忆转向基于证据的推理,引入无知识语言模型(KLLMs),其在命名实体匿名化语料库上预训练,实验表明能降低闭卷事实记忆,在多任务基准上表现优,提升鲁棒性与校准,为语言模型训练提供新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12524 2026-07-15 cs.CR cs.SE 新提交 67%

Open-Source Intelligence for Code Provenance and the Security Patterns that Separate Human and Large-Language-Model Implementations of Common Programming Tasks

用于代码溯源的开源情报以及区分人类和大语言模型对常见编程任务实现的安全模式

Mohammadreza Rashidi

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 研究开发者代码来源(人类答案和大语言模型输出)的差异,利用开源构建管道收集样本,训练分类器区分溯源,报告安全差异,通过案例研究发现修复情况及问题,管道数据驱动可添加新任务或语言。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12360 2026-07-15 cs.LG 新提交 57%

Same Loss, Same Noise, Opposite Schedules: Noise Structure and Optimizer Normalization Jointly Determine Whether Learning-Rate Cooldown Helps

相同损失、相同噪声、相反调度:噪声结构和优化器归一化共同决定学习率冷却是否有帮助

Subham Singh, Ashutosh Mishra, Subha Raut

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 研究热身 - 稳定 - 衰减学习率调度中冷却阶段效果,发现其取决于梯度噪声结构和优化器更新归一化。通过理论分析和模拟,揭示不同情况下冷却的作用机制,还在真实分类任务中验证噪声 regime 诊断,解释冷却是否有帮助。

Comments 11 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12079 2026-07-15 cs.CL 新提交 57%

The Capacity of Thought: Benchmarking Llama 3.2 in Semantic fMRI Neural Language Decoding and Improving the Huth Encoding-Model Baseline

思维的能力:在语义功能磁共振成像神经语言解码中对Llama 3.2进行基准测试并改进Huth编码模型基线

Milos Suvakovic, Dom Marhoefer, Glenn Grant-Richards, Aidan Pinero

机构 * UC Santa Cruz(加州大学圣克鲁兹分校)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 研究从fMRI信号中解码连续语言的挑战,一方面改进Huth编码管道,另一方面引入fMRIFlamingo,发现高容量语言模型本身未提升fMRI解码能力,且无严格评估会掩盖失败,强调盲控评估的重要性。

Comments 7 pages, 2 tables, 2 figures. Preprint. NLP 244: Advanced Machine Learning for Natural Language Processing report, UC Santa Cruz

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 12 篇

2607.12468 2026-07-15 cs.SD cs.AI 新提交 92%

An Omnilingual-ASR-Based Speech-LLM System for the 2nd MLC-SLM Challenge

用于第二届MLC-SLM挑战赛的基于全语言自动语音识别的语音语言模型系统

Shuming Fang, Shuifei Zeng

专题命中 指令微调 :SLM(title,title_cn);LLM(title,abstract);分类 cs.AI

AI总结 该研究针对第二届MLC-SLM挑战赛任务1,提出级联分帧识别系统,结合多种技术,测试无先验信息。分析工程选择影响,如基于嵌入的聚类更优,重叠感知分割虽提召回率但增加tcpMER,在开发集和评估集有相应表现。

Comments Accepted to INTERSPEECH 2026. 4 pages + references. Technical description of our 2nd MLC-SLM Challenge Task 1 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11893 2026-07-15 cs.CL cs.AI 新提交 82%

I'm Sorry, but I Can't Help with Braille: Revealing Accessibility Failures in State-of-the-Art LLMs

对不起,我无法处理盲文:揭示当前最先进语言模型中的无障碍性缺陷

Abdullah Abdullah

机构 * orinu Inc.(奥里努公司)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究评估先进语言模型在韩语-盲文翻译上的表现,发现其存在缺陷。通过人工标注数据集测试,发现输出差且不稳定。对比发现,对小模型进行监督微调效果更好,揭示了当前语言模型的局限,证明特定监督的有效性。

Comments Accepted at the LTEDI Workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13013 2026-07-15 cs.AI cs.SD 新提交 79%

Audio-Native Speech Recognition with a Frozen Discrete-Diffusion Language Model

使用冻结离散扩散语言模型的音频原生语音识别

Harsha Vardhan Khurdula, Abhinav Kumar Singh, Yoeven D Khemlani, Vineet Agarwal

机构 * Interfaze AI(Interfaze人工智能公司)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 探讨离散扩散语言模型能否用于语音识别,训练音频原生接口,用冻结Whisper编码器等,约42M参数。自然训练目标遇问题,连接主义时间分类损失打破僵局,模型在LibriSpeech test-clean上字错误率6.6%,能并行转录多种语言。

Comments 10 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12782 2026-07-15 cs.CV 新提交 78%

MBTI: A Multi-Branch Efficient Fine-Tuning Framework for Hyperspectral Image Classification with Foundation Models

MBTI:一种用于基于基础模型的高光谱图像分类的多分支高效微调框架

Mingzhen Xu, Haonan Guo, Di Wang, Yinghua Qu, Zhiliang Zhou, Lei Zhang, Huiwen Yao, Rui Zhao, Fengxiang Wang, Gang Wan, Bo Du, Liangpei Zhang

机构 * School of Computer Science, Wuhan University(武汉大学计算机科学学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) China Petroleum Pipeline Engineering Corporation(中国石油管道局工程有限公司) Hebei Key Laboratory of Underground Energy Storage Technology(河北省地下储能技术重点实验室) No. 7 Oil Production Plant, Changqing Oilfield Branch, PetroChina Company Limited(中国石油天然气股份有限公司长庆油田分公司第七采油厂) Faculty of Electrical Engineering and Computer Science, Ningbo University(宁波大学电气工程与计算机科学学院) College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) School of Aerospace Information, Space Engineering University(航天工程大学航天信息学院) Key Laboratory of Intelligent Processing and Applicati(智能处理与应用重点实验室)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 针对高光谱基础模型因传感器光谱带配置差异难以直接转移用于HSI分类的问题,提出MBTI框架,通过多分支预处理、LoRA模块及注意力融合模块,在保留光谱信息同时适应下游任务,实验证明其性能优越且可训练参数少。

Comments The code will be available at https://github.com/Azhenmiddleblock/MBTI/tree/main

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12279 2026-07-15 cs.CL cs.LG 新提交 73%

A Shared Subcircuit Lets LLMs Count Down Across Tasks

一个共享子电路使大语言模型能够跨任务进行倒计时

Jacob Dunefsky, Wes Gurnee, Emmanuel Ameisen

机构 * Yale University(耶鲁大学) Anthropic

专题命中 指令微调 :LLM(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究发现Llama-3.1-70B-Instruct中有个“倒计时子电路”可跨任务执行特定任务,先在受控设置中分离它,再研究其表示几何结构,发现与另一模型有相同模式,还通过无监督探测找到其用于多种任务的情况,有助于理解行为推广。

Comments 12 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12112 2026-07-15 cs.LG cs.AI cs.CV cs.DC 新提交 73%

Continual Learning with Elastic Regularization and Synthetic Replay for Federated MLLM Fine-Tuning

用于联邦多模态大语言模型微调的弹性正则化和合成重放持续学习

Jing Liu, Chenxuanyin Zou, Jiayang Ren, Gaoyun Fang, Chengfang Li, Yan Wang, Zhenchao Ma, Bo Hu

机构 * The University of British Columbia(英属哥伦比亚大学) Fudan University(复旦大学) Royal College of Science, Imperial College London(伦敦帝国理工学院皇家科学学院) Dyson School of Design Engineering(戴森设计工程学院) Suzhou Institute of Biomedical Engineering and Technology (SIBET), Chinese Academy of Sciences(中国科学院苏州生物医学工程技术研究所) East China Normal University(华东师范大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对联邦多模态大语言模型微调中灾难性遗忘问题,提出FedCMM框架,在参数、数据、聚合三个层面嵌入持续学习保障,经实验验证该框架在准确性和反向迁移上优于基线,能实现跨异构网络AI部署的稳健进化适应。

Comments submitted to IEEE JSTSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12111 2026-07-15 cs.LG cs.AI cs.DC cs.MA cs.NI 新提交 73%

PFAdapter: Hierarchical LoRA Decomposition for Personalized Federated MLLMs

PFAdapter:用于个性化联邦多模态大语言模型的分层LoRA分解

Jing Liu, Kun Yang, Yan Wang, Dingkang Yang, Xiaoshuai Hao, Wei Zhang, Yang Liu, Wei Zhou

机构 * College of Future Information Technology, Fudan University(复旦大学未来信息技术学院) Division of Natural and Applied Sciences, Duke Kunshan University(昆山杜克大学自然科学与应用科学部) Department of Electrical and Computer Engineering, The University of British Columbia(英属哥伦比亚大学电气与计算机工程系) Ant Group(蚂蚁集团) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) School of Data Science and Engineering, East China Normal University(华东师范大学数据科学与工程学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University & Fysics AI(复旦大学智能机器人与先进制造学院及复肆智能科技(上海)有限公司) Xiaomi EV, Xiaomi Campus(小米汽车、小米园区) Information and Communications Technology Cluster, Singapore Institute of Technology (SIT)(新加坡理工学院信息通信技术集群) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对分布式网络中联邦微调平衡全局知识与局部适应的挑战,提出PFAdapter框架,用分层LoRA分解将适配器参数分离,通过正交正则化和选择性聚合协议减少通信成本,实验证明该框架在多数据集上性能优于基线,为智能AI部署提供有效方案。

Comments submitted to IEEE TCCN

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11919 2026-07-15 cs.NE cs.AI cs.CV cs.LG 新提交 62%

Do You Remember? Toward Memory-Centric Multimodal AI

你还记得吗?迈向以记忆为中心的多模态人工智能

Xuguang Yu, Weigang Zheng, Minyue Yu

专题命中 指令微调 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究针对当前多模态语言模型缺乏重建性记忆的问题,提出DoYouRemember三阶段架构,通过VQ-VAE、LoRA微调语言模型和扩散解码器实现,经实验发现语言模型隐藏状态视觉信息少,还解决了共享记忆矩阵训练问题,统一相关发现于信息论框架。

Comments 43 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12422 2026-07-15 cs.AI 新提交 57%

Accepted Prefixes Are Not All You Need: A Negative Result on PEFT-Based Block-Diffusion Drafting

接受前缀并非全部所需:基于PEFT的块扩散草稿生成的负面结果

Abdurrahman Javat, Allan Kazakov

机构 * Bahçeşehir University(巴赫切希尔大学)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 研究基于PEFT - BD的推测性解码方法,虽有避免分词器不匹配等优点,但在Qwen3 - 0.6B实验中未实现实际加速,因草稿生成器计算不高效。结果表明成功推测性解码需草稿生成器执行成本远低于验证器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12820 2026-07-15 cs.CV 新提交 50%

AVSCap: Orchestrating Audio-Visual Synergy for Omni-modal Video Captioning

AVSCap:为全模态视频字幕编排视听协同

Yanghai Wang, Jiahao Wang, Jiafu Tang, Yuanxing Zhang, Zhe Cao, Hanyan Bian, Zijie Zhang, Weiliang Luo, Zhiyu Pan, Zixuan Dong, Jiaheng Liu, Zhaoxiang Zhang

机构 * Nanjing University(南京大学) Kuaishou Technology(快手科技) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 指令微调 :SFT(abstract)

AI总结 研究全模态视频字幕编排视听协同问题,提出AVSCap框架,构建训练语料库,采用两阶段策略训练字幕生成器,引入新基准,实验表明该模型在非语音音频覆盖率和跨模态绑定方面表现出色,提升了整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12450 2026-07-15 cs.CV 新提交 50%

Let RGB Be the Language of Vision

让 RGB 成为视觉的语言

Timing Yang, Jinrui Yang, Xinlong Li, Yuhan Wang, Haoran Li, Yanqing Liu, Guoyizhe Wei, Jixuan Ying, Chen Wei, Rama Chellappa, Yuyin Zhou, Cihang Xie, Alan Yuille, Feng Wang

机构 * Johns Hopkins University(约翰·霍普金斯大学) UC Santa Cruz(加州大学圣克鲁兹分校) Carnegie Mellon University(卡内基梅隆大学) Rice University(莱斯大学)

专题命中 指令微调 :language model(abstract)

AI总结 该研究为视觉模型引入统一表述 RGB In and RGB Out(RINO),将多种视觉信息转为 RGB 图像编辑问题,共享架构参数,基于通用主干无需微调,在多视觉任务上有强大零样本性能,为统一视觉语言系统提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12418 2026-07-15 cs.CV 新提交 50%

MQAdapter: Multi-Modal Quantum Adapter for Coarse-to-Fine VLM Fine-tuning

MQAdapter:用于从粗到细的视觉语言模型微调的多模态量子适配器

Yumiao Zhao, Bo Jiang, Min Lu, Xiao Wang, Jin Tang

机构 * Anhui University(安徽大学) Origin Quantum Computing Company Limited(本源量子计算有限公司)

专题命中 指令微调 :language model(abstract)

AI总结 针对视觉语言模型在少样本学习中细粒度区分不足的问题,提出多模态量子适配器MQAdapter。先检索Top-K候选类别作语义锚点,再用跨模态量子学习机制,利用量子特性建模高阶交互,细化视觉特征,参数高效且能集成现有算法提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 1 篇

2607.12640 2026-07-15 cs.AI cs.CL 新提交 81%

A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism

小语言和视觉语言模型网络智能体中GRPO的学习率门控失败:一个可控的无效结果及其机制

Chengguang Gan, Zhixi Cai, Yunhao Liang, Hanjun Wei, Shiwen Ni, Qinghao Zhang

机构 * Monash University(莫纳什大学) University of Chinese Academy of Sciences(中国科学院大学) Shenzhen University of Advanced Technology(深圳先进技术大学) Pusan National University(釜山国立大学)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究4B到8B规模小语言和视觉语言模型网络智能体中GRPO的效果,通过控制变量实验发现其在已掌握任务上无明显提升,解释了学习率导致失败的机制,表明该耦合与模型规模相关。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长上下文与记忆 10 篇

2607.12233 2026-07-15 cs.CL cs.AI 新提交 90%

Fin-Analyst at FinMMEval 2026 Task 3: A Live Hybrid Trading Agent with LLM Specialists and Rule-Based Signals

2026年金融市场评估任务3中的金融分析师:一个结合大型语言模型专家和基于规则信号的实时混合交易代理

Mohotarema Rashid, Lingzi Hong, Junhua Ding, K. S. M. Tozammel Hossain

机构 * University of North Texas(北德克萨斯大学)

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对金融市场评估任务3,提出结合LLM专家和规则信号的混合交易代理Fin-Analyst,用于特斯拉和比特币交易。通过多源信息聚合及规则投票,在特斯拉交易上取得高回报率,比特币交易表现良好,还分析了排名逆转原因及信号影响等,为后续模型改进提供依据。

Comments 14 pages, 7 tables, 1 figure. CLEF 2026 FinMMEval Task 3 Working Notes

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12195 2026-07-15 cs.CL cs.AI 新提交 90%

Comparing Semantic Navigation in Humans and Large Language Models using Natural Language Processing

使用自然语言处理比较人类和大语言模型中的语义导航

Gabriel Paris-Colombo, Rodrigo M. Cabral-Carvalho, Felipe D. Toro-Hernández

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 该研究通过语言流畅性数据,运用基于轨迹的自然语言处理指标,比较人类与三个大语言模型的语义搜索动态,量化相关维度,发现人类语义搜索在局部利用和全局探索间有独特平衡,当前模型架构无法重现。

Comments Cogsci paper 2026

Journal ref Proceedings of the Annual Meeting of the Cognitive Science Society, 48(0), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12397 2026-07-15 cs.AI 新提交 83%

Critic Experience Bank: Self-Evolving Step-Level Confidence Estimation for LLM Agents

评论家经验库:大语言模型智能体的自进化步骤级置信度估计

Yaopei Zeng, Congchao Wang, JianHang Chen, Nan Wang, Yurui Chang, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Virginia Tech(弗吉尼亚理工大学) Purdue University(普渡大学) Amazon AGI(亚马逊通用人工智能)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI

AI总结 研究大语言模型智能体的步骤级置信度估计问题,提出自进化评论家框架CEB,其通过积累自身过去判断及后果证据来估计置信度,无需训练和真实步骤标签,在多个基准和主干上校准和排名表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13027 2026-07-15 cs.CL cs.AI 新提交 82%

PalmClaw: A Native On-Device Agent Framework for Mobile Phones

PalmClaw:一种用于手机的原生设备上代理框架

Hongru Cai, Yongqi Li, Ran Wei, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Hangzhou Diagens Biotechnology Co., Ltd.(杭州迪基因生物技术有限公司)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对移动设备上代理框架存在的问题,提出PalmClaw开源框架,能在手机上原生运行并管理相关要素,将设备能力以工具形式呈现,实验显示该框架提升了任务成功率、缩短完成时间且降低设置负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12267 2026-07-15 cs.LG cs.AI 新提交 81%

Track, Rank, Crack: Epistemic Working Memory Scales Multi-Hop Reasoning in Language Agents

追踪、排序、决断:认知工作记忆对语言智能体中的多跳推理进行衡量

Ning Liu

专题命中 长上下文与记忆 :language agent(title,abstract);分类 cs.AI、cs.LG

AI总结 研究语言智能体多跳推理链变长性能下降问题,提出SLEUTH方法通过结构化认知工作记忆提升推理,经实验优势随难度增加,还发现证据充分性问题及解决办法,表明组织推理方式是扩展多跳推理关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12236 2026-07-15 cs.LG cs.CL 新提交 81%

Speculate with Memory: Lossless Acceleration for LLM Agents

用记忆进行推测:大语言模型智能体的无损加速

Yu Li, Qinyuan Ye, Prafulla Kumar Choubey, Jiaxin Zhang, Chien-Sheng Wu

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 研究旨在加速大语言模型智能体,提出为推测器配备三个在线记忆系统,通过从智能体过去轨迹学习提升预测质量。经六个基准测试,记忆增强推测在动作和观察预测上有显著提升,且无损并能跨模型推广。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12216 2026-07-15 cs.CL cs.AI cs.MA 新提交 81%

RCWT: Measuring Task-Budget Displacement from Coordination Content in LLM Calls

RCWT:从大语言模型调用中的协调内容测量任务预算位移

Brenda Lelis, Rodrigo Cabral-Carvalho

机构 * CloudWalk, Inc.(云从科技集团股份有限公司)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 研究多智能体和内存增强大语言模型中协调内容占用任务预算的问题,提出RCWT测量协议,通过改变协调内容等控制变量进行实验,发现模型表现受影响,该测试是上下文分配预算测量原语,但非多智能体收益等完整理论。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12406 2026-07-15 cs.AI 新提交 79%

Isolation as a First-Class Principle for LLM-Agent System Safety: Concepts, Taxonomy, Challenges and Future Directions

隔离作为大语言模型智能体系统安全的头等原则:概念、分类法、挑战及未来方向

Huihao Jing, Wenbin Hu, Shaojin Chen, Haochen Shi, Sirui Zhang, Hanyu Yang, Changxuan Fan, Zhongwei Xie, Hongyu Luo, Wun Yu Chan, Wei Fan, Haoran Li, Yangqiu Song

机构 * HKUST(香港科技大学) NYU(纽约大学) SWUPL(西南政法大学)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI

AI总结 探讨大语言模型智能体系统安全问题,将隔离作为头等原则,用边界中心分类法组织文献,助于识别隔离丧失位置、妥协传播方式及相关防御,还总结了故障路径,讨论挑战并勾勒研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12385 2026-07-15 cs.AI 新提交 79%

PM-Bench: Evaluating Prospective Memory in LLM Agents

PM-Bench:评估大语言模型智能体中的前瞻记忆

Genglin Liu, Saadia Gabriel

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI

AI总结 研究针对智能体人工智能中的前瞻记忆挑战,引入PM-Bench基准,受认知科学启发评估大语言模型智能体相关能力。在模拟一周内比较八个先进模型,发现各模型在此基准测试中均具挑战性,且无单一改善策略占优,还发布该基准用于诊断与干预。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12893 2026-07-15 cs.AI cs.CL 新提交 62%

MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations

MemOps:在长期对话中对生命周期内存操作进行基准测试

Xixuan Hao, Zeyu Zhang, Zehao Lin, Yihang Sun, Ziliang Guo, Xichong Zhang, Yuxuan Liang, Feiyu Xiong, Zhiyu Li

机构 * MemTensor (Shanghai) Technology Co., Ltd.(墨天轮(上海)科技有限公司) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Renmin University of China(中国人民大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究针对长期对话中内存操作评估,引入MemOps基准测试,将对话内存视为操作生命周期,通过可控管道嵌入操作并评估,揭示了当前系统内存操作的问题,推动评估从答案评分转向操作级诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理与问题求解 20 篇

2607.12177 2026-07-15 cs.AI cs.CV 新提交 87%

The Emerging Paradigm of Geospatial Foundation Models: From Pre-Training to Agentic Reasoning

地理空间基础模型的新兴范式:从预训练到智能推理

Shelley Cazares

机构 * Google Public Sector(谷歌公共部门)

专题命中 推理与问题求解 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究地理空间基础模型的新兴范式,通过职责分离实现预训练与特定任务微调,探讨不同类型模型能力及实现考虑因素,提出模型适应策略分类法和框架,展望智能地理空间推理推动领域从感知到认知的发展。

Comments 18 pages, 4 figures. To appear in Lecture Notes in Computer Science (LNCS)

Journal ref Lecture Notes in Computer Science, Vol. 16446 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13034 2026-07-15 cs.AI cs.CL cs.SE cs.SY eess.SY 新提交 87%

Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution

人工智能代理知道任务何时简单吗?迈向复杂性感知推理与执行

Junjie Yin, Xinyu Feng

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨LLM代理缺乏任务感知执行范围估计能力,提出E3方法,在MSE-Bench基准测试及真实模型工具中验证,该方法能在保证成功率时大幅降低成本,推动迈向工程基础人工智能,还发布了框架和基准。

Comments 27 pages, 8 figures, 8 tables. Code and benchmark: https://github.com/eejyin/Do-AI-Agents-Know-When-a-Task-Is-Simple-Toward-Complexity-Aware-Reasoning-and-Execution

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12490 2026-07-15 cs.PL 新提交 87%

When is LLM-Based Program Reasoning Correct? A Completion Semantics for LLM-Based Code Inference

基于大语言模型的程序推理何时正确?基于大语言模型的代码推理的补全语义

Zhiyuan Liu, Yihe Li, Trevor E. Carlson, Huiyan Wang, Ruijie Meng, Gregory J. Duck

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型的程序推理何时正确,引入补全语义,将不完整程序形式化,定义存在性推理正确性。以见证生成工作流程实例化方法,在真实任务上评估,能区分合理与不合理推理,为验证不完整程序推理提供实用机制。

Comments 28 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏