arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-23 至 2026-07-23 共收录 138 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 7 篇

2607.19992 2026-07-23 cs.CL cs.AI cs.DL cs.HC 新提交 88%

TINY_SCHILLER: A Drop-In German Drama Corpus for Small Language Models

TINY_SCHILLER:用于小语言模型的即插即用德语戏剧语料库

Mark Schutera

机构 * Duale Hochschule Baden-Württemberg Ravensburg(巴登-符腾堡双元制应用技术大学 Ravensburg)

专题命中 预训练与数据 :language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对德语文学文本在小语言模型相关应用的空白,提出Tiny_schiller语料库,经特定处理,可通过单文件和一行代码让小语言模型接触德语文学文本,填补了相关研究和应用的空白。

Comments 5 pages. Dataset: https://huggingface.co/datasets/mrkschtr/tiny_schiller ; Code: https://github.com/schutera/tiny_schiller

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20346 2026-07-23 cs.CE physics.flu-dyn 新提交 86%

IteraSim RAG: A Multi-Stage Retrieval-Augmented Agentic Back-End for OpenFOAM-Based Computational Fluid Dynamics

IteraSim RAG:基于OpenFOAM的计算流体动力学的多阶段检索增强智能后端

Pratyush Kumar

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对OpenFOAM配置CFD案例的难题,提出IteraSim RAG。通过LLM扩展查询、多种融合与重排策略及多智能体分工协作,结合规范知识层。在28个案例基准测试中表现良好,能完成配置、诊断修复问题,还公布相关内容以保障可重复性。

Comments 40 pages, 7 figures, 5 tables. Submitted to Computer Physics Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19524 2026-07-23 cs.LG cs.AI cs.DC 新提交 81%

SynPre-FL: Synthetic data-driven pretraining integrated Federated Learning training framework

SynPre-FL:合成数据驱动的预训练集成联邦学习训练框架

Akarsh K Nair, Muhammad Arifur Rahman, Nicholas Shopland, Andy Burton, Jun He, Yuan Shen, David Baldwin, Emma O'Dowd, Amna Burzic, Mufti Mahmud, David J. Brown

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对联邦学习在临床风险预测中面临的问题及局限,提出SynPre-FL框架,结合合成EHR生成与合成预训练联邦学习,通过潜在自动编码器扩散模型等技术,提升非IID条件下预测的稳健性、可扩展性与可解释性。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20251 2026-07-23 cs.CL 新提交 79%

Exposure is Optional: Learning Unlike Coordination in Language Models

曝光非必需:语言模型中学习不同类别的并列结构

Jiamu Luo, Shane Steinert-Threlkeld

机构 * University of Washington(华盛顿大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 研究语言模型中不同类并列结构习得是否需直接曝光,用过滤语料库训练GPT-2模型,发现无需直接曝光,模型能泛化处理,还揭示了模型处理方式及可从同类并列结构学习,助力理解语言模型结构表示。

Comments 13 pages, 6 tables, 2 figures, to submit to TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20310 2026-07-23 q-bio.NC 新提交 75%

Capturing Inner Experience At Scale: An AI Interviewer Co-Developed with the Founder of a Landmark Phenomenological Method

大规模捕捉内心体验:与一种具有里程碑意义的现象学方法的创始人共同开发的人工智能访谈者

Jona Carmon, Clara Bersch, Charles Fernyhough, Russell T. Hurlburt, Simone Kühn

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究聚焦于主观体验研究中深度与规模的权衡问题,核心方法是将描述性经验抽样法转化为人工智能访谈者的推理架构,主要贡献是开发出首个基于既定方法研究内心体验的人工智能访谈者及相关平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19771 2026-07-23 cs.LG cs.AI 新提交 73%

An Isotropy-Preserving Spectral Cap for Muon: Theory and Three Case Studies

用于μ子的各向同性保持谱帽:理论与三个案例研究

Jiachun Li

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究μ子和相关矩阵符号优化器对权重矩阵的影响,提出基于尺度不变性假设的统一框架及轻量级“谱帽”,通过三个案例研究表明谱帽可增加各向同性并防止失败,验证损失基本不变,结果为初步的。

Comments Preliminary Report; Larger scale experiments ongoing; Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19718 2026-07-23 cs.CL 新提交 57%

Lightweight Person-Place Relation Extraction from Historical Newspapers with Dependency Graphs and Proximity Features

利用依存图和邻近特征从历史报纸中进行轻量级人物-地点关系提取

Mlen-Too Wesley

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 研究从历史报纸中提取人物-地点关系,构建文档级图,提取实体对特征,用小型模型分类。在官方评估中取得一定成绩,发现最小字符距离重要,且文档分组交叉验证对避免数据泄漏、保证结果可靠至关重要。

Comments 19 pages, 4 figures. Accepted at CLEF 2026 HIPE Shared Task. To appear in CEUR Workshop Proceedings (CEUR-WS.org)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 13 篇

2607.19523 2026-07-23 cs.CL 新提交 91%

When Reasoning Narrows the Move: Diversity Collapse in LLM Game Play

当推理缩小行动范围:大语言模型游戏中的多样性崩溃

Junyi Sha, Renfei Tan, David Simchi-Levi

机构 * Institute for Data, Systems, and Society(数据、系统与社会研究所)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型游戏中监督微调对行为多样性的影响,发现推理模式生成常抑制行动多样性,标准SFT会致过早多样性崩溃,行动增强可部分缓解,指出窄支持模仿是策略崩溃源,SFT中保持行动支持对维持探索行为很重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19604 2026-07-23 cs.CL cs.LG 新提交 88%

Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models

基于超网络的大语言模型知识注入的缩放定律

Nischay Dhankhar, Dos Baha, Abulhair Saparov

机构 * Nace AI(Nace人工智能公司) Purdue University(普渡大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究大语言模型训练时知识注入问题,核心方法是用超网络生成LoRA适配器,主要贡献是发现超网络注入能力随规模变化规律,能可靠进行分布外泛化,为训练时适应提供新基础及缩放定律。

Comments Preprint, 22 pages, 14 figures. Dataset collection available at https://huggingface.co/collections/nace-ai/hypernetwork-datasets

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19608 2026-07-23 cs.CL 新提交 88%

Task Competence Is Not Instruction Following: Evaluating Instruction-Conflicting Behavior in Small Language Models

任务能力并非遵循指令:评估小语言模型中的指令冲突行为

Mahdiyeh Farajidizaji, Vatsal Raina

机构 * Khajeh Nasir Toosi University of Technology(哈杰·纳西尔·图西理工大学) Apta AI, Spark AI Research(阿普塔人工智能公司,星火人工智能研究院)

专题命中 指令微调 :language model(title,abstract);small language model(title);instruction tuning(abstract);分类 cs.CL

AI总结 研究小语言模型在指令冲突时的行为,通过跨任务设计,用标准准确率等指标评估指令微调的Qwen模型,发现任务能力提升不自动带来可靠行为控制,任务能力与指令遵循是不同能力,仅报标准准确率会掩盖问题。

Comments 12 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19674 2026-07-23 cs.CR cs.AI cs.LG 新提交 86%

FedLSG: LLM-Enhanced Semantic Calibration for Federated Graph Backdoor Defense

FedLSG:用于联邦图后门防御的大语言模型增强语义校准

Chenyu Zhou, Yabin Peng, Wei Huang, Kunlin Li, Shuaishuai Zhang, Xinyuan Miao

机构 * Southeast University(东南大学) Purple Mountain Laboratories(紫金山实验室) Institute of AI for Industries(人工智能产业研究院) Chinese Academy of Sciences(中国科学院)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对联邦图神经网络易受后门攻击问题,提出FedLSG框架,将大语言模型集成防御,通过图与行为到文本的转换及轻量级师生架构,在不损图完整性时显著提升对后门攻击的抵抗力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19408 2026-07-23 cs.LG 新提交 83%

Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning

语言模型微调中基于奖励感知的进化策略种群规模缩放

Sung Cho, Gyubin Han

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究在大语言模型微调中,进化策略种群规模缩放与奖励设计及归一化的关系。通过实验发现交叉熵与二元奖励微调种群规模结论差异大,主要因奖励设计和归一化,禁用归一化可改进小种群模型表现,揭示小种群失败可能是实现问题而非内在限制。

Comments 15 pages, 2 figures. Accepted at the 4th HiLD (High-dimensional Learning Dynamics) Workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20301 2026-07-23 cs.LG cs.CL 新提交 79%

The Blessing of Dimensionality: How Near-Orthogonality in High-Dimensional Spaces Explains Temporal Portability

维度的祝福:高维空间中的近正交性如何解释时间可移植性

Abigail Woodring, Adrian Chan, Rana Muhammad Shahroz Khan, Sukwon Yun, Chau-Wai Wong, Tianlong Chen

机构 * NC State University(北卡罗来纳州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨PortLLM在持续预训练中LoRA补丁的长期时间可移植性及有效性。通过对Mistral、Gemma和Qwen基础模型进行实证研究,并提供理论分析,发现其可移植性持久,高维向量近正交性是关键,还展示了损失景观几何视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20270 2026-07-23 cs.CL 新提交 77%

Which Values Do LLMs Confuse? A Schwartz-Based Recognition Study

大语言模型混淆了哪些价值观?基于施瓦茨的识别研究

Andrei Chetvergov, Stepan Ukolov, Timofei Sivoraksha, Alexander Evseev, Mikhail Solovev, Valeriia Kuschenko, Maria Chistyakova, Sergey Bolovtsov

机构 * Ivannikov Institute for System Programming of the Russian Academy of Sciences(俄罗斯科学院伊万尼科夫系统编程研究所) Russian Presidential Academy of National Economy and Public Administration(俄罗斯总统国民经济与公共管理学院)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究大语言模型对施瓦茨十个基本价值观的识别,通过俄语情境文本评估 21 个指令微调的模型运行,分析准确率、混淆情况等,推动结合精确准确率、排序恢复和有向错误分析的价值识别评估。

Comments 14 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19399 2026-07-23 cs.LG cs.AI cs.CV 新提交 73%

Leveraging Offline Supervision for Efficient and Generalizable Reinforcement Learning in Large-Scale Vision-Language-Action Models

在大规模视觉-语言-动作模型中利用离线监督实现高效且通用的强化学习

Dmitriy Poyarkov, Aleksei Staroverov, Aleksandr I. Panov

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究在大规模视觉-语言-动作模型中,通过将离线监督纳入强化学习,结合离线与在线训练优点,提升训练效率。经实验验证,该混合方法在保持强大分布外能力的同时,所需训练预算减半,实现效率与性能双赢。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20389 2026-07-23 cs.CV 新提交 67%

PercepCap: Video Captioner with Structured Spatio-Temporal Perception

PercepCap:具有结构化时空感知的视频字幕生成器

Yifan Xu, Zihao Wang, Zhixiao Wang, Jiaming Zhang, Yichun Yang, Desen Meng, Yuanxing Zhang, Pengfei Wan, Limin Wang

机构 * Nanjing Univerisity(南京大学) Kuaishou Technology(快手科技) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 研究视频字幕生成问题,提出PercepCap框架,遵循感知-描述生成链,设计两阶段训练策略及相关数据构建方法,在评估中优于基线,提升视频字幕生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19354 2026-07-23 cs.AI 新提交 57%

FormulaSPIN: Self-Play Fine-Tuning for Natural Language to Spreadsheet Formula Generation

FormulaSPIN:用于自然语言到电子表格公式生成的自博弈微调

Cy Xie

专题命中 指令微调 :SFT(abstract);分类 cs.AI

AI总结 研究自然语言到电子表格公式生成问题,提出FORMULASPIN自博弈框架,利用公式生成优势及双人博弈实现迭代自我改进,引入ExecVote提高准确性,实验证明其性能达最优,凸显自博弈解决稀缺数据任务的潜力。

Comments 15 pages,7 figures, 14 tables. Accepted to ACL 2026 Main Conference Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19889 2026-07-23 cs.CV 新提交 50%

LAVIFT: Latent-Action-Guided Vision Fine-Tuning for Surgical Interaction Recognition

LAVIFT:用于手术交互识别的潜在动作引导视觉微调

Jiajun Cheng, Subarna Tripathi, Sainan Liu, Xiaofan Yu, Shan Lin

机构 * Arizona State University(亚利桑那州立大学) University of California, Merced(加州大学默塞德分校) Intel Corporation(英特尔公司)

专题命中 指令微调 :language model(abstract)

AI总结 研究针对手术交互识别中预训练模型适应细粒度交互的挑战,提出LAViFiT框架,通过逆动力学模型、前向世界模型及补丁级SIG正则化器,实现视觉语言微调,提升了识别率和图像-文本对齐,增强了特征基础和空间连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19886 2026-07-23 cs.CV 新提交 50%

MTVDiff: Multimodal Conditional Latent Diffusion for Enhanced Thermal-to-Visible Face Translation

MTVDiff:用于增强热红外到可见光面部翻译的多模态条件潜扩散

Zhiyuan Xia, Haojie Li, Jingyu Lin, Yiguo Qiao, Cunjian Chen

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University)(新一代人工智能技术及其交叉应用重点实验室(东南大学)) Monash University(莫纳什大学)

专题命中 指令微调 :SFT(abstract)

AI总结 针对热红外到可见光面部翻译的挑战,提出MTVDiff框架,通过双分支交叉注意力融合等三个核心技术,整合深度和文本信息,在多指标上优于现有方法,提升图像质量和面部验证性能,推动跨光谱面部图像翻译发展。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19836 2026-07-23 cs.IR cs.DL 新提交 50%

Using Hierarchical Controlled Vocabularies to Understand CLIP Retrieval Failures in Historical Photo Collections

使用分层控制词汇表理解历史照片集中CLIP检索失败的原因

Ratan Sebastian, Anett Hoppe, Christoph Rippe, Ralph Ewerth

专题命中 指令微调 :language model(abstract)

AI总结 研究探讨用AAT词汇表的根面类型和层次深度解释CLIP在历史照片集检索的成败及微调作用,通过三个标注集研究视觉连贯性等指标,发现两指标可区分失败模式,根面类型有区分作用,微调对层次浅的术语更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 8 篇

2607.19367 2026-07-23 cs.AI 新提交 91%

Rethinking Uncertainty Evaluation in Large Language Models

重新思考大语言模型中的不确定性评估

Krish Matta, Atharv Naphade, Andy Zou

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);large language model(title);language model(title);LLM(abstract)

AI总结 研究大语言模型中置信度评估问题,指出校准标准不充分。沿结构连贯性、忠实性和有用性三个轴形式化条件为C1指标,发现常用估计器违反条件,RLHF等未恢复连贯性,框架可测度与弥合差距。

Comments 19 pages, 11 figures, ICML 2026 EIML Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19712 2026-07-23 cs.LG 新提交 87%

How Fast Can Reward Models Score? A Systems Study of C++ and PyTorch Inference Runtimes for RLHF

奖励模型评分能有多快?对用于基于人类反馈的强化学习的C++和PyTorch推理运行时的系统研究

Venkata Naga Sai Vishnu Rohit Pulipaka, Anish Katta, Deva Rohit Reddy Peddireddy

专题命中 后训练与偏好优化 :RLHF(title,summary_cn);分类 cs.LG

AI总结 研究RLHF中奖励模型评分速度,构建基于ONNX Runtime的C++推理引擎,经测试,在CPU上击败所有基线,GPU上部分领先,发现加速源于ONNX Runtime,且批处理策略对速度影响更大,结果经多次独立运行得出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20057 2026-07-23 q-bio.BM cs.LG 新提交 85%

Antigen-specific Antibody Multi-modal Foundation Model for Functional Antibody Design

用于功能性抗体设计的抗原特异性抗体多模态基础模型

Xiaoliang Shi, Zichen Wang, Runze Ma, Zhongyue Zhang, Shuangjia Zheng

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 后训练与偏好优化 :foundation model(title,abstract);language model(abstract);preference optimization(abstract);分类 cs.LG

AI总结 该研究针对抗原特异性抗体设计难题,引入AAMFM多模态基础模型,通过跨模态适配器整合抗原信息,用校准直接偏好优化微调,实现抗体 - 抗原相互作用联合建模,实验证明其在功能性抗体设计中性能最优,有抗原特异性抗体工程潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19824 2026-07-23 cs.AI cs.CL 新提交 84%

Rewarding Better Thinking for LLM Preference Alignment

奖励更好的思维以实现大语言模型偏好对齐

Xubo Liu, Wenya Guo, Ruxue Yan, Xinying Qian, Ying Zhang

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型偏好对齐问题,提出思维清单奖励(TCR)方法,将偏好对转化为思维清单评估推理轨迹,引入EMA残差公式减少与结果监督重叠,实验证明该方法能提升对齐性能。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20345 2026-07-23 cs.RO cs.AI 新提交 83%

Closing the Lab-to-Store Gap: A Data-Efficient Post-Training and Experience-Driven Learning VLA Framework for Retail Humanoids

弥合实验室与商店之间的差距:一种用于零售类人机器人的数据高效训练后及经验驱动学习的VLA框架

Roger Sala Sisó, Tiago Silvério, Jakob Sand, Tran Nguyen Le

机构 * HIVE Robots(蜂巢机器人公司) Technical University of Denmark(丹麦技术大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 研究针对VLA类人机器人弥合实验室与实际应用差距的问题,提出DEED系统级方法,含数据高效训练后管道、经验驱动细化研究及潜在空间分析工具,经实验证明精心设计数据和训练后处理可解决该问题。

Comments 8 pages. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19395 2026-07-23 cs.LG cs.AI 新提交 82%

From Trajectories to Prefixes: Reusing Teacher Trajectories via Replayed Prefixes and Online Continuation

从轨迹到前缀:通过重放前缀和在线延续复用教师轨迹

Yihan Wang, Zhong Guan, Haoran Sun, Jiale Huang, Likang Wu, Hongke Zhao

机构 * Tianjin University(天津大学) Peking University(北京大学) Tianjin University of Technology(天津工业大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对小语言模型蒸馏低效问题,提出Prefix-GRPO强化学习框架,将教师轨迹分解,通过重放前缀恢复中间状态并在线延续,统一前缀与延续学习,实验证明其优于蒸馏和标准RL基线,凸显前缀令牌优化的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20082 2026-07-23 cs.CL 新提交 70%

The Two-Process Theory of Machine Self-Report

机器自我报告的双过程理论

Hubert Plisiecki, Filip Chmielewski, Kacper Dudzic, Anna Sterna, Karolina Drożdż, Marcin Moskalewicz

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.CL

AI总结 研究针对语言模型自我报告缺乏有效方式的问题,提出双过程理论,通过角色设定和归因门控反映自我报告结构。经量表操作化及测试,发现训练后维度变化,表明其非固定属性,为语言模型自我报告研究提供新理论与方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19514 2026-07-23 cs.LG 新提交 57%

Do Sheaf Neural Networks Use Holonomy? A Measure--Intervene--Control Study

层神经网络是否使用和乐性?一项测量-干预-控制研究

Ankit Grover, Rémi Bourgerie

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 以层神经网络为测试平台,对训练后的三角循环积进行与基无关测量,通过神经层传播等方法区分几何变化等,在不同实验设置下观察其效果,研究层神经网络是否使用和乐性及相关特性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长上下文与记忆 3 篇

2607.19857 2026-07-23 cs.CV cs.AI 新提交 88%

Memory-Augmented Multimodal Large Language Models for Small Object Understanding in Streaming Aerial Videos

用于流式航空视频中小目标理解的内存增强多模态大语言模型

Penglei Sun, Yehua Huang, Zhuoli Tao, Xiang Li, Runwei Guan, Yaoxian Song, Kaiyong Zhao, Henghui Ding, Bo Han, Yang Yang, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Freiburg(弗莱堡大学) Hangzhou City University(杭州城市大学) XGRIDS(XGRIDS公司) Fudan University(复旦大学) Hong Kong Baptist University(香港浸会大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究针对流式航空视频中小目标理解难题,提出像素级开放词汇数据集DroneEyes,以及含语义感知令牌路由器和分层内存库的多模态大语言模型SkyAnchor,从数据和方法角度应对挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19359 2026-07-23 cs.AI 新提交 79%

Profile-Graph Memory for LLM Agents: Implicit Cross-Entity Traversal through Narrative Profiles

用于大语言模型智能体的概要图内存:通过叙事概要进行隐式跨实体遍历

Shengtong Zhu

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI

AI总结 研究针对大语言模型智能体长期记忆中多跳关联未被充分测量的问题,提出了MemHop基准和ProGraph两层内存架构,通过概要扩展与压缩残差实现跨实体遍历,提升了多跳推理及精确召回能力,在多个基准测试中表现优异并开源相关实现。

Comments 11 pages, 2 figures, 7 tables. Code and MemHop benchmark: https://github.com/ShengtongZhu/ProGraph

详情

展开后加载摘要…

URL PDF HTML 收藏