arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-03 至 2026-07-03 共收录 232 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 13 篇

2607.02329 2026-07-03 cs.AI cond-mat.mtrl-sci physics.comp-ph 新提交 90%

Grounded autonomous research: a fault-tolerant LLM pipeline from corpus to manuscript in frontier computational physics

基于语料库的前沿计算物理容错LLM流水线:从语料到论文的自主研究

Haonan Huang

机构 * Princeton University(普林斯顿大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一个端到端LLM流水线,从11,083篇arXiv论文语料库出发,自主完成前沿计算物理研究,包括构思方向、复现文献、第一性原理计算和撰写论文,通过冗余设计实现容错。

Comments 39 pages, 5 figures. Accepted at the ICML 2026 AI for Science Workshop (https://openreview.net/forum?id=R5YXaPgUAx). Includes the pipeline-generated companion physics manuscript as an appendix. Data and scaffolding archive: https://doi.org/10.5281/zenodo.21126996

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01733 2026-07-03 cs.CL eess.AS 新提交 89%

Rethinking Speech-LLM Integration for ASR: Effective Joint Speech-Text Training by Interleaving

重新思考语音-LLM集成用于ASR:通过交错实现有效的联合语音-文本训练

Ruchao Fan, Yiming Wang, Rui Zhao, Liliang Ren, Keqi Deng, Xiaoyang Chen, Ali Zare, Bo Ren, Yuxuan Hu, Junkun Chen, Yan Huang, Yelong Shen, Jinyu Li

机构 * Microsoft(微软)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(abstract);分类 cs.CL

AI总结 提出JSTIP,一种面向ASR的预训练策略,通过构建词级和段级交错语音-文本序列,在38k小时数据上相比基线提升了实体识别准确率,并缩小了模态差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02221 2026-07-03 cond-mat.stat-mech 新提交 88%

Alternative routes to universal diversity scaling in component systems: from proteomes to large language models

组件系统中通用多样性标度的替代路径:从蛋白质组到大语言模型

Andrea Mazzolini, Leonardo Agasso, Filippo Valle, Michele Caselle, Marco Cosentino Lagomarsino, Matteo Osella

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract)

AI总结 研究复杂组件系统中多样性标度定律的涌现条件,发现创新驱动增长模型与潜在异质性模型均能产生相同的宏观定律,但无法唯一确定生成机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02513 2026-07-03 cs.CL cs.AI cs.LG 新提交 82%

LACUNA: A Testbed for Evaluating Localization Precision for LLM Unlearning

LACUNA: 评估大语言模型遗忘定位精度的测试平台

Matteo Boglioni, Thibault Rousset, Siva Reddy, Marius Mosbach, Verna Dankers

机构 * Mila – Quebec Artificial Intelligence Institute(米拉-魁北克人工智能研究所) McGill University(麦吉尔大学)

专题命中 预训练与数据 :LLM(title);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出LACUNA测试平台,通过注入合成个人身份信息到模型参数,评估遗忘方法是否真正擦除知识,发现现有方法定位不精确且易受重现攻击,而精确定位可实现强擦除。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02466 2026-07-03 cs.RO cs.AI 新提交 79%

Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs

先学移动再学做事:面向VLA的任务无关预训练

Junhao Shi, Siyin Wang, Xiaopeng Yu, Li Ji, Jingjing Gong, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 提出任务无关预训练(TAP)框架,先通过自监督逆动力学从廉价无标签交互数据学习可迁移运动先验,再用少量专家数据将先验与语言对齐,显著降低VLA模型对专家演示的依赖。

Comments Accepted to ICML 2026, 21 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02259 2026-07-03 cs.CL 新提交 79%

BamiBERT: A New BERT-based Language Model for Vietnamese

BamiBERT: 一种新的基于BERT的越南语语言模型

Dat Quoc Nguyen, Thinh Pham, Chi Tran, Linh The Nguyen

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 提出BamiBERT,一种从头训练的越南语BERT模型,支持2048 token上下文长度且无需分词,在15项指标中11项最优,刷新越南语编码器性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01538 2026-07-03 cs.CL 新提交 79%

Can Language Models Actually Retrieve In-Context? Drowning in Documents at Million Token Scale

语言模型真的能进行上下文检索吗?在百万Token规模的文档中淹没

Siddharth Gollapudi, Nilesh Gupta, Prasann Singhal, Sewon Min

机构 * UC Berkeley(加州大学伯克利分校) UT Austin(得克萨斯大学奥斯汀分校)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本文首次系统研究百万Token语料库上的上下文检索,提出0.6B参数的BlockSearch模型,通过注意力稀释分析引入长度感知调整,在MS MARCO和NQ上匹配稠密检索,在LIMIT上得分高出3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01594 2026-07-03 eess.AS 新提交 78%

Enhancing Acoustic-to-Articulatory Inversion with Multi-Target Pretraining for Low-Resource Settings

面向低资源场景的声学-发音反演的多目标预训练增强方法

Jesuraj Bandekar, Prasanta Kumar Ghosh

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出一种多目标预训练方法,利用音素标签、发音特征标签和关键发音器官标签,在低资源场景下提升声学-发音反演性能,同时降低推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01766 2026-07-03 cs.AI 新提交 70%

SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation

SimWorlds: 一个用于动态3D场景创建的多智能体系统

Chunjiang Liu, Xiaoyuan Wang, Haoyu Chen, Yizhou Zhao, Ming-Hsuan Yang, László A. Jeni

机构 * Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) University of California, Merced(加州大学默塞德分校)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出多智能体框架SimWorlds,通过规划-编码-审查流程和运行时状态检查工具,从文本生成动态4D场景,并引入基准4DBuildBench评估视觉保真度和物理一致性。

Comments 20 pages, 3 figures. Project page: https://dynsimworlds.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01640 2026-07-03 cs.SE cs.CR 新提交 67%

AgentFlow: Building Agent Dependency Graphs for Static Analysis of Agent Programs

AgentFlow:构建用于智能体程序静态分析的智能体依赖图

Shenao Wang, Xinyi Hou, Yanjie Zhao, Xiao Cheng, Haoyu Wang

专题命中 预训练与数据 :LLM(abstract,abstract_cn)

AI总结 提出AgentFlow,首个从智能体程序中恢复和分析智能体依赖的静态分析框架,通过构建框架无关的智能体依赖图(ADG)支持智能体治理和安全分析,在5399个真实程序中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23041 2026-07-03 cs.CV 新提交 67%

SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models

SPAR: 语义-像素自对齐与自适应路由的统一多模态模型

Hongxiang Li, Hongxu Chen, Chenyang Zhu, Xiaoshuang Huang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Xiaohongshu Inc.(小红书公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 提出SPAR框架,通过非对称双流统一分词器协调语义感知与像素重建,利用自对齐生成范式消除外部依赖,并引入动态令牌路由实现灵活多模态交互,在统一架构中达到生成、重建与视觉理解的最优性能。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01686 2026-07-03 cs.LG 新提交 57%

WARP: Weight-Space Analysis for Recovering Training Data Portfolios

WARP: 基于权重空间分析恢复训练数据组合

Tzu-Heng Huang, Aditya Goyal, John Cooper, Frederic Sala

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.LG

AI总结 提出WARP框架,通过模型合并生成伪检查点,从权重空间几何特征恢复微调模型的训练数据域混合比例,在BERT和GPT-2上平均MAE分别低至0.046和0.104。

Comments This work appears in the ICML 2026 Workshop on Weight-Space Symmetries (WSS): from Foundations to Practical Applications. Our source code is available at github.com/SprocketLab/WARP

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02139 2026-07-03 cs.CV 新提交 50%

AdaCount: Training-Free Similarity-Guided Spatial and Feature Adaptation for Zero-Shot Object Counting

AdaCount: 基于相似性引导的空间与特征自适应无训练零样本目标计数

Muhammad Ibraheem Siddiqui, Muhammad Haris Khan

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫萨德·本·扎耶德人工智能大学)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 针对零样本目标计数在密集小目标场景下的漏检和分割不佳问题,提出无训练框架AdaCount,通过原型驱动相似性图引导空间扭曲和特征调制,提升SAM3对目标区域的表征能力,达到新SOTA。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 24 篇

2607.02214 2026-07-03 cs.CL eess.AS 新提交 93%

Unlocking Speech-Text Compositional Powers: Instruction-Following Speech Language Models without Instruction Tuning

解锁语音-文本组合能力:无需指令微调的指令跟随语音语言模型

Congrui Du, Yang Zhang, Kaizhi Qian, Shiyu Chang

机构 * University of California, Santa Barbara, USA(加州大学圣芭芭拉分校) MIT-IBM Computing Research Lab, IBM Research, USA(麻省理工-IBM计算研究实验室,IBM研究)

专题命中 指令微调 :LLM(summary_cn,abstract);language model(title,abstract);instruction tuning(title,abstract);SLM(abstract,abstract_cn)

AI总结 提出SpeechCombine,通过单轮30k小时语音预训练和权重组合,无需指令微调即可实现指令跟随,有效将文本LLM能力迁移至语音域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01772 2026-07-03 cs.CV eess.SP 新提交 91%

LLM-Empowered Multimodal Fusion Framework for Autonomous Driving: Semantic Enhancement and Channel-Adaptive Design

LLM赋能的自动驾驶多模态融合框架:语义增强与信道自适应设计

Wen Wang, Yaping Sun, Yejun He, Hao Chen, Zhiyong Chen, Xiaodong Xu, Nan Ma, Shuguang Cui

机构 * National Natural Science Foundation of China(国家自然科学基金) Shenzhen Natural Science Foundation(深圳市自然科学基金) Shenzhen Key Laboratory Evaluation(深圳市重点实验室评估)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出LM-SCIP框架,以LLM为核心推理中枢,通过信道自适应语义模块动态融合视觉与雷达特征,实现低信噪比下的视觉主导回退和高信噪比下的协同融合,在nuScenes和VIRAT数据集上显著提升定位精度。

Comments 6 pages, 4 figures. Accepted by 2026 IEEE 37th International Symposium on Personal, Indoor and Mobile Radio Communications (PIMRC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01433 2026-07-03 cs.AI cs.LG 新提交 90%

CreativityNeuro: Steering Language Model Weights to Improve Divergent Thinking and Reduce Mode Collapse

CreativityNeuro: 引导语言模型权重以改善发散思维并减少模式崩溃

Samuel Schapiro, Core Francisco Park, Felix Sosa, Lav R. Varshney

机构 * Center for Brain Science, Harvard University(哈佛大学脑科学中心) CBS-NTT Program in Physics of Intelligence, Harvard University(哈佛大学CBS-NTT智能物理项目) Prior Computers AI Innovation Institute, Stony Brook University(石溪大学人工智能创新研究所)

专题命中 指令微调 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 提出数据无关的对比权重引导方法CreativityNeuro,通过调整LLM权重增强发散思维,在多项创造力测试中提升原创性并减少模式崩溃,无需重新训练或微调。

Comments Accepted at ICML 2026 Workshop on Creativity & Generative AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01764 2026-07-03 cs.AI 新提交 89%

Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction

Mastermind: 基于策略学习的仓库级漏洞复现

Mingzhe Du, Luu Anh Tuan, Tianyi Wu, Renyang Liu, Zhijiang Guo, Dong Huang, See-Kiong Ng

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 指令微调 :LLM(summary_cn,abstract);SFT(summary_cn,abstract);分类 cs.AI

AI总结 提出Mastermind双循环框架,通过策略学习(SFT+GRPO)提升LLM代理在仓库级漏洞复现中的表现,在260个训练任务和200个测试任务上达到84.5%通过率,并成功迁移至不同执行器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01436 2026-07-03 cs.AI cs.LG 新提交 88%

Discrete Diffusion Language Models for Interactive Radiology Report Drafting

离散扩散语言模型用于交互式放射报告草稿生成

Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge, Olivier Gevaert

机构 * Stanford University School of Medicine(斯坦福大学医学院) Ghent University(根特大学) Stanford University(斯坦福大学)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出将离散扩散语言模型用于放射报告草稿生成,利用其任意顺序填充能力实现交互式编辑,在医学VQA任务上达到或超越自回归模型,解码速度快3.5-4.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01239 2026-07-03 cs.CL cs.AI 新提交 88%

Breaking Safety at the Token Boundary: How BPE Tokenization Creates Exploitable Gaps in LLM Alignment

在Token边界打破安全:BPE分词如何在LLM对齐中制造可利用的漏洞

Tung-Ling Li, Hongliang Liu, Yuhao Wu

机构 * Palo Alto Networks

专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究发现BPE分词将安全关键词拆分为子词,导致对齐数据集缺乏此类碎片化输入,通过优化碎片化可绕过80-100%的安全拒绝,并定位到模型最后约30%层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01846 2026-07-03 cs.AI 新提交 85%

CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training

CLAP:领域智能体后训练的闭环训练、评估与发布控制

Fangfei Li, Chenyang Zhao, Long Wang, Feng Tian, Zhiyue Zheng, Lv Guo

机构 * MatrixOrigin(矩阵起源)

专题命中 指令微调 :post-training(title,abstract);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 提出CLAP闭环方法,通过数据验证、奖励/KL诊断、离线门控和应用链回放,在制造场景中评估后训练效果,发现仅部分批次提升且存在KL风险,支持集成循环管理。

Comments 6 pages, 1 figure. Accepted to CRAE 2026; to appear in SPIE Proceedings. Best Poster Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01927 2026-07-03 cs.CL cs.AI 新提交 82%

TUDUM: A Turkish-Thinking Reasoning Pipeline for Qwen3.5-27B

TUDUM:面向Qwen3.5-27B的土耳其语思维推理流水线

Baran Bingol, Bahaeddin Turkoglu

机构 * Department of Artificial Intelligence and Data Engineering(人工智能与数据工程系) Faculty of Engineering(工程学院) Ankara University(安卡拉大学)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出TUDUM流水线,通过SFT和GRPO强化学习将Qwen3.5-27B适配为土耳其语思维模型,使推理过程本身使用土耳其语,而非仅输出本地化答案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01470 2026-07-03 cs.AI 新提交 81%

World Feedback for Clinical Agents: Diagnosing RL in FHIR Environments

临床智能体的世界反馈:在FHIR环境中诊断强化学习

Ananya Mantravadi, Harshit Rajgarhia, Prasanna Desikan, Abhishek Mukherji

机构 * Centific Global Solutions, Inc.(Centific全球解决方案公司)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.AI

AI总结 针对临床协议执行任务,审计发现MedAgentBench存在静默完成上限,构建MAB-v3后训练Qwen3-8B,揭示能力上限和格式知识障碍是RL性能瓶颈,提出决策/格式知识/查找分类法并给出SFT注入代码、RL学习条件逻辑的修复方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02479 2026-07-03 cs.CV 新提交 80%

EAGLE-360: Embodied Active Global-to-Local Exploration in 360$^\circ$

EAGLE-360: 360°环境中的具身主动全局到局部探索

Jingtao Xu, Zizhuo Lin, Jianwen Sun, Yi Yang, Yawei Luo

机构 * Zhejiang University(浙江大学) Central China Normal University(华中师范大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对多模态大模型在360°全景主动视觉搜索中因极地畸变和连续拓扑建模不足导致的效率低下问题,提出EAGLE-360框架,通过全局先验引导局部探索,结合RoPE Rolling位置编码和GRPO训练,实现近8倍精度提升。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01690 2026-07-03 cs.AI cs.CL cs.LG 新提交 80%

Epistemic Goggles: A Pretrained Module that Induces an Epistemic Frame via Gradient Editing

认知护目镜:通过梯度编辑诱导认知框架的预训练模块

Joshua Penman

机构 * Independent Researcher(独立研究员)

专题命中 指令微调 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对微调语言模型时出现的“否定忽视”问题,提出Goggles模块,通过编辑微调梯度而非数据来赋予模型特定的认知框架,使模型在保持能力的同时正确识别虚构内容。

Comments 20 pages, 10 figures, 2 tables. Code at https://github.com/JoshuaSP/epistemic-goggles and generated documents, questions, and teacher rollouts at https://huggingface.co/datasets/joshuapenman/epistemic-goggles-artifacts

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28016 2026-07-03 cs.CV 新提交 80%

TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL

TempAct: 通过规划器-执行器强化学习推进自回归视频生成中的时间合理性

Jing Wang, Xiangxin Zhou, Jiajun Liang, Kaiqi Liu, Wanyuan Pang, Zhenyu Xie, Tianyu Pang, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区) Tencent Hunyuan(腾讯混元) Tsinghua University(清华大学) Peking University(北京大学) USTB(北京科技大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn)

AI总结 提出TempAct框架,利用规划器-执行器强化学习联合优化时间分解与步骤条件执行,解决自回归视频生成中时间指令模糊、延迟反应和错误传播问题,提升时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02140 2026-07-03 cs.LG 新提交 79%

Probing Chemical Language Models: Effects of Pre-training and Fine-tuning

探测化学语言模型:预训练与微调的影响

Anna Karnysheva, Dietrich Klakow, Ji-Ung Lee

专题命中 指令微调 :language model(title,abstract);分类 cs.LG

AI总结 通过探测78种分子子结构,系统研究了预训练和微调对化学语言模型分子结构感知能力的影响,发现预训练提升上层结构意识,微调增强任务相关子结构表征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01918 2026-07-03 cs.LG 新提交 79%

Zeus: Towards Tuning-Free Foundation Model for Time Series Analysis

Zeus:面向时间序列分析的无调优基础模型

Yisong Fu, Zezhi Shao, Chengqing Yu, Yujie Li, Yongjun Xu, Xueqi Cheng, Fei Wang

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 提出统一无调优时间序列基础模型Zeus,通过多尺度Transformer和Multi-Objective Temporal Masking策略,在无需任务特定调优下实现多种分析任务的优异性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02025 2026-07-03 cs.CV 新提交 78%

Evaluating Vision-Language Models as a Zero-Shot Learning Alternative to You Only Look Once and Optical Character Recognition for Nigerian License Plate Recognition

评估视觉语言模型作为尼日利亚车牌识别的零样本学习替代方案:对比YOLO与光学字符识别

Ismail Ismail Tijjani, Ahmad Abubakar Mustapaha, Sunusi Ibrahim Muhammad, Muhammad Bashir Aliyu

专题命中 指令微调 :language model(title,abstract)

AI总结 研究探索视觉语言模型作为尼日利亚车牌识别的统一零样本解决方案,在88张真实图像上评估5种VLM,发现Gemini和Qwen在字符错误率上显著优于YOLO+OCR。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01908 2026-07-03 cs.CV 新提交 78%

Towards Real-World Ultrasound Understanding: Large Vision-Language Models from Multi-Image Examinations with Long-Form Reports

迈向真实世界超声理解:基于多图像检查与长文本报告的大规模视觉语言模型

Bingcong Yan, Chunlei Li, Jingliang Hu, Yilei Shi, Xiao Xiang Zhu, Lichao Mou

机构 * MedAI Technology (Wuxi) Co. Ltd.(MedAI科技(无锡)有限公司) Technical University of Munich(慕尼黑工业大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 通过构建150万次真实超声检查的大规模数据集(含1770万图像和多器官覆盖),采用标准视觉语言模型结合低秩适配微调,无需复杂架构即实现多任务超声理解性能领先。

Comments Project Page: https://medai-t.github.io/LUMI/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02010 2026-07-03 cs.AI 新提交 77%

InduceKV: Fixed-Footprint Continual Adaptation of Multimodal LLMs via Inducing KV Memories

InduceKV: 通过诱导KV记忆实现多模态大语言模型的固定足迹持续适应

Qianyu Chen, Ziteng Feng, Canran Xiao, Runxuan Tang

机构 * Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.AI

AI总结 提出InduceKV方法,通过检索将训练前缀存储为注意力就绪的记忆条目,在固定内存预算下实现多模态大语言模型的持续适应,无需更新骨干模型。

详情

展开后加载摘要…

URL PDF HTML 收藏