arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-13 至 2026-08-13 共收录 27 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 27 篇

2605.16409 2026-08-13 cs.CV cs.CL cs.LG 版本更新 92%

Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models

多语言OCR感知微调和提示引导的链式思维推理用于多模态大语言模型

Qinwu Xu, Yifan Jiang, Haoyu Ren

机构 * Meta AI UT Austin(德克萨斯大学奥斯汀分校)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);post-training(abstract)

AI总结 提出一种多语言OCR感知的多模态训练框架,通过合成数据生成、OCR感知微调和结构化视觉链式思维提示,提升多模态大语言模型在复杂视觉条件下的OCR完整性和多语言翻译准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11510 2026-08-13 q-bio.NC cs.AI 新提交 90%

Conflict and Congruency Effects in Large Language Models: In-Weight and In-Context Competition in a Verbal Conflict Task

大语言模型中的冲突与一致性效应:言语冲突任务中的权重内与上下文内竞争

Xiaoyang Hu, Mike Angstadt, Shane Storks, Zan Huang, Aman Taxali, Alex Weigard, Richard L. Lewis, Chandra Sripada

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 本研究通过言语冲突任务,探究LLM中一致性效应的机制,发现其源于权重内默认映射与上下文内规则映射的竞争,为分析此类响应竞争提供了模型系统。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11631 2026-08-13 cs.AI 新提交 90%

CLAIM: Leading Open-domain Active Clarification of Large Language Models with Uncertainty Measurement

CLAIM:基于不确定性度量的大语言模型开放域主动澄清领先方案

Kuangzhao Yang, Ziliang Zhao, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出基于不确定性度量的CLAIM框架,无需人工标注,结合监督学习与强化学习训练统一澄清决策模型,实现开放域人机交互中低成本鲁棒的主动澄清。

Comments 11 pages, 4 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13891 2026-08-13 cs.CL cs.AI 版本更新 90%

Large Language Models Reproduce Racial Stereotypes When Used for Text Annotation

大型语言模型在用于文本标注时会再现种族刻板印象

Petter Törnberg

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 研究发现大型语言模型在文本标注中会因身份线索产生系统性偏见,再现种族刻板印象,尤其在名字相关任务中表现显著。

Comments Withdrawn by the author due to a confound in stimulus assignment that invalidates the main results; addressing it requires re-running the experiment with matched stimuli

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11715 2026-08-13 cs.CL cs.AI 新提交 89%

When the API Speaks the Wrong Language: Revisiting Post-Training for Multilingual Tool Use

当API“说错”语言:重新审视多语言工具使用的后训练

Siddharth Chauhan, Thomas Butler, Abhishek Singhania, Pankaj Porwal, Honey Gupta

机构 * Amazon(亚马逊)

专题命中 指令微调 :post-training(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对多语言API调用中存在的参数语言不匹配问题,研究发现监督微调可实现接近或优于复杂强化学习方法的性能,强化学习仅能提供渐进式改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11912 2026-08-13 cs.CE 新提交 89%

Comparative Analysis of Low-Rank Adaptation in Large Language Models versus Dense Embedding Regression for Headline Click-Through Rate Prediction

用于标题点击率预测的大语言模型低秩适配(LoRA)与密集嵌入回归的对比分析

Samarth Sirsat, Anirudha Shinde, Amit Sethi, Aman Verma

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn)

AI总结 本研究将标题选择建模为赢家通吃分类任务,对比发现用于标题点击率预测的密集嵌入回归模型,性能优于经LoRA微调的0.6B规模生成式语言模型,凸显了嵌入回归模型在高吞吐量内容排序中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11342 2026-08-13 cs.LG cs.CL 新提交 88%

Weightless Fine-Tuning: Personalizing LLMs via Logit-Space Transport

无权重微调:通过对数几率空间迁移实现大语言模型的个性化

Bohan Zhang, Anqi Ni, Yixin Wang, Paramveer S. Dhillon

机构 * University of Michigan(密歇根大学) University of Chicago(芝加哥大学)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.LG

AI总结 针对个性化场景下LLM微调成本过高的问题,提出无需权重更新的WFT方法,在LaMP基准上性能优于多数基线,仅用不到7%计算量接近SFT效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09996 2026-08-13 cs.CV 版本更新 88%

Omni-Persona: Systematic Benchmarking and Improving Omnimodal Personalization

Omni-Persona:系统性基准测试与改进多模态个性化

Yeongtak Oh, Dongwook Lee, Sangkwon Park, Heeseung Kim, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电气与计算机工程系) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能跨学科项目) Department of Artificial Intelligence, University of Seoul(首尔大学人工智能系)

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 Omni-Persona提出首个多模态个性化基准,通过Persona Modality Graph任务组和细粒度任务,系统分析多模态个性化中的接地行为,提出Calibrated Accuracy评估方法,揭示开源模型在音频与视觉接地上的差距及SFT与RLVR的局限性。

Comments Project Page: https://github.com/oyt9306/Omni-Persona

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17450 2026-08-13 cs.IR cs.AI 版本更新 87%

VLM2Rec: Resolving Modality Collapse in Vision-Language Model Embedders for Multimodal Sequential Recommendation

VLM2Rec: 解决视觉语言模型嵌入器在多模态序列推荐中的模态崩溃问题

Junyoung Kim, Woojoo Kim, Wonbin Kweon, Jaehyung Lim, Dongha Kim, Hwanjo Yu

机构 * Pohang University of Science

专题命中 指令微调 :language model(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);分类 cs.AI

AI总结 本文提出VLM2Rec框架,通过弱模态惩罚对比学习和跨模态关系拓扑正则化,解决多模态序列推荐中模态崩溃问题,提升推荐准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06027 2026-08-13 cs.AI cs.CL cs.LG cs.SI 版本更新 87%

RedditPersona: A Modular Framework for Community-Conditioned LLM Adaptation from Reddit

RedditPersona: 一个用于从Reddit进行社区条件化LLM适配的模块化框架

Amirhossein Ghaffari, Ali Goodarzi, Huong Nguyen, Simo Hosio, Lauri Lovén, Ekaterina Gilman

机构 * Future Computing Group University of Oulu(未来计算组奥卢大学) Centre for Applied Computing University of Oulu(应用计算中心奥卢大学)

专题命中 指令微调 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出RedditPersona模块化框架,通过五种分组策略和QLoRA训练参数高效适配器,在112个Reddit子版块上评估社区条件化语言模型,发现适配器的行为可识别性与策略内在一致性相关,且所有策略在可识别性和分布相似性之间存在一致权衡。

Comments Accepted manuscript (CC BY 4.0). To appear in ACM CIKM 2026, Rome, Italy, Nov 7-11, 2026. DOI: https://doi.org/10.1145/3799682.3840182

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26690 2026-08-13 cs.LG 版本更新 84%

LoRAQuant: Mixed-Precision Quantization of LoRA to Ultra-Low Bits

LoRAQuant:将LoRA混合精度量化至超低比特

Amir Reza Mirzaei, Yuqiao Wen, Yanshuai Cao, Lili Mou

机构 * Dept. Computing Science & Alberta Machine Intelligence Institute (Amii), University of Alberta(计算科学系及阿尔伯塔人工智能研究所(Amii),阿尔伯塔大学) RBC Borealis Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对多LoRA适配器规模化部署的高存储成本问题,提出专为LoRA定制的混合精度后训练量化方法LoRAQuant,在LLaMA 2、Mistral模型的多任务上,以更低比特实现了相当或更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11295 2026-08-13 cs.CR cs.AI 新提交 83%

Backdoor Decontamination Dynamics in LLM Agents

大语言模型智能体中的后门净化动力学

Gabriel Huang, Abhay Puri, Léo Boisvert, Alexandre Drouin, Perouz Taslakian, Spandana Gella, Christopher Pal

专题命中 指令微调 :LLM(title,abstract);分类 cs.AI

AI总结 本研究针对大语言模型智能体的后门问题,提出框架研究净化动力学,发现防御性投毒加遗忘可高效擦除多数后门,中间层仍留触发器感知痕迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11233 2026-08-13 cs.CL cs.AI cs.LG 新提交 82%

Retrofitting Recurrent Depth into a Pretrained Language Model: Installation, Extrapolation, Transfer, and Retention at Two Parameter Budgets

将循环深度改造融入预训练语言模型:在两个参数预算下的安装、外推、迁移与保留

Mark Shapiro

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究在Qwen2.5-0.5B-Instruct中融入循环深度,在两个参数预算下实现安装,其模型在ARC测试集等任务上性能优于同等规模基准,可外推至1.5倍监督深度,推理速度更快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11426 2026-08-13 cs.CL 新提交 81%

Is Convergence Inevitable? Tracing Output Homogeneity Back to Base Models

收敛是不可避免的吗?将输出同质性追溯至基础模型

Alexandrine Fortier, Hazel Chen, Peter West

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);pretraining(abstract);prompting(abstract);分类 cs.CL

AI总结 该研究指出大语言模型的语义收敛或源于预训练目标,仅靠对齐后干预难缓解,通过实验证实基础模型可被提示诱导类指令式坍缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11898 2026-08-13 eess.AS 新提交 80%

On-Policy Self-Distillation for Multi-Dialect ASR: Mastering Dialects, Retaining Mandarin

面向多方言自动语音识别的策略内自蒸馏:掌握方言,保留普通话

Shuiyuan Wang, Bingshen Mu, Pengshen Zhang, Chengyou Wang, Yujie Liao, Chengdong Liang, Binbin Zhang, Qiangze Feng, Lei Xie

专题命中 指令微调 :SFT(summary_cn,abstract)

AI总结 本研究针对ASR模型方言识别效果有限且直接适配易降低普通话准确率的问题,提出策略内自蒸馏(OPSD)方法,结合CPT、SFT优化Qwen3-ASR-1.7B,在不降低普通话识别能力的同时提升了多方言识别效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31237 2026-08-13 math.DS 版本更新 80%

Two block gluing constructions

两个块粘合构造

Ville Salo, Ilkka Törmä

专题命中 指令微调 :SFT(summary_cn,abstract)

AI总结 针对二维SFT的块粘合问题,构造了介于指数和对数之间的块粘合函数,并构造了一个熵维数为1的非周期线性块粘合二维SFT,解决了相关开放问题。

Comments 30 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11359 2026-08-13 cs.LG 新提交 79%

Market-Information-Aware Gated-LoRA of Foundation Models for Transferable Day-Ahead Electricity Price Forecasting

面向可迁移日前电价预测的、融合市场信息的基础门控低秩适配(Gated-LoRA)模型

Hang Fan, Wei Wei, Shengwei Mei

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出融合市场信息的Gated-LoRA框架,将Chronos-2模型迁移至日前电价预测,经中国四省现货市场验证,可显著降低预测误差,为数据稀缺电力市场提供迁移方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12082 2026-08-13 eess.AS 新提交 78%

Rethinking Language Model-Based Generative Speech Enhancement in the Latent Space of a Neural Audio Codec

在神经音频编解码器的隐空间中重新思考基于语言模型的生成式语音增强

Yihui Fu, Zhengyang Li, Tim Fingscheidt

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出涵盖六种基于LM的生成式SE范式的统一框架,对比其性能并提出辅助损失微调策略,发现连续域范式优于离散域,CNAR效果最佳且微调策略可提升多指标。

Comments Accepted at IWAENC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11558 2026-08-13 physics.chem-ph physics.app-ph 新提交 78%

Simulating Ionic Liquid Fragmentation in Electrospray Thrusters with Foundation Models

用基础模型模拟电喷推进器中的离子液体碎片化

Ziyu Huang

专题命中 指令微调 :foundation model(title,abstract)

AI总结 该研究针对电喷推进器离子液体撞击模拟的成本与保真度矛盾,测试MACE系列预训练机器学习势,发现其兼顾类DFT保真度与低成本,为推进器模拟提供了实用中间方案。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08891 2026-08-13 cs.CE 版本更新 78%

Ortho2CAD: 3D CAD generation from orthographic drawings using vision language models

Ortho2CAD:使用视觉语言模型从正投影图生成3D CAD

Aditya Joglekar, Amit Regmi, Kenji Shimada, Levent Burak Kara

专题命中 指令微调 :language model(title,abstract)

AI总结 研究旨在解决工程设计中从正投影图到3D CAD模型转换的问题,核心方法是利用视觉语言模型Ortho2CAD,通过监督微调与强化学习训练,借助绘图生成器实现大规模学习,主要贡献是代码有效率高且3D CAD精度超基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12219 2026-08-13 cs.LG 新提交 74%

ScreenShot: A Foundation Model for Few-Shot Combination Drug Screening

ScreenShot:用于少样本组合药物筛选的基础模型

Antoine de Mathelin, Christopher Tosh, Wesley Tansey

机构 * Computational Oncology(计算肿瘤学) Memorial Sloan Kettering Cancer Center(纪念斯隆-凯特琳癌症中心)

专题命中 指令微调 :foundation model(title);分类 cs.LG

AI总结 本研究提出用于少样本组合药物筛选的基础模型ScreenShot,其经多药物筛选数据集预训练,可通过上下文学习直接预测患者样本的组合疗法响应,在预留数据集上优于基线,还可驱动主动学习策略以降低实验预算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11949 2026-08-13 cs.AI 新提交 74%

ExRole: From Team Trajectories to Executable Roles in Multi-Agent Language Models

ExRole:从团队轨迹到多智能体语言模型中的可执行角色

Zhou Liu, Chaoyang Han, Zewei Pan, Zeli Su, Wentao Zhang

专题命中 指令微调 :language model(title);分类 cs.AI

AI总结 ExRole是一种多智能体语言模型的轨迹转角色框架,可学习可执行角色,在两个问答基准上显著优于单智能体及其他角色设置,能捕捉可迁移的行为专业化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10300 2026-08-13 cs.AI cs.CR cs.LG 版本更新 73%

Logit-Boundary Geometric Belief Interfaces and Sparse Sheaf-Enclave Protocols: A Self-Contained Substrate for Secure Network Electronic Health Record (EHR) Interoperability

Logit边界几何置信接口与稀疏层束 enclaves 协议:安全网络电子健康记录(EHR)互操作性的自包含底层架构

Alvin Spivey, Yu Huang

机构 * Light Imaging Technologies, Inc.(光成像技术公司)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究提出Logit边界几何置信接口与稀疏层束 enclaves 协议,构建EHR互操作的自包含底层架构,经GBI BoundaryBench v0.1评估,Qwen3-4B-Instruct-2507在该接口下无符合要求的输出,为接受边界提供实证证据。

Comments 39 pages; executable Julia verification code included as ancillary material; companion public benchmark: https://github.com/AlvinSpivey/GBI-BoundaryBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11588 2026-08-13 cs.AI 新提交 57%

CoAdapt-GUI: Joint Workflow Context and Policy Adaptation for Unseen GUI Applications

CoAdapt-GUI:面向未知GUI应用的工作流上下文与策略联合适配

Linqiang Guo, Li Gu, Zihuan Jiang, Zhixiang Chi, Siobhan Reid, Ziqiang Wang, Yuanhao Yu, Wei Liu, Yang Wang, Tse-Hsun, Chen

机构 * Li Gu(李谷(音译))

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 CoAdapt-GUI框架通过联合适配工作流上下文与策略,在有限交互预算无目标演示的未知GUI应用场景下,将AndroidWorld泛化性能提至45.0%、AndroidWorld Plus提至52.9%,优于仅策略TTA基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11350 2026-08-13 cs.CL cs.RO 新提交 57%

Self-Evolving Embodied Agents via Skill-Harness Evolution

基于技能-工具链进化的自演化具身智能体

Peidong Wang, Zhiming Ma, Ying Chang, Xufang Luo, Xiaocui Yang, Shi Feng, Yuqing Yang, Dongsheng Li

机构 * Microsoft Research(微软研究院) Northeastern University(东北大学)

专题命中 指令微调 :foundation model(abstract);分类 cs.CL

AI总结 提出免训练的SHAPER框架,通过演化技能与工具链实现冻结模型驱动的自演化具身智能体,在VLABench等数据集上验证其适配优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11329 2026-08-13 cs.SD cs.CV cs.MM 新提交 50%

Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-Visual QA

Qwen-MusicAVQA-7B:一种用于音乐音频-视觉问答的多模态模型

Maryam Dehdashti

机构 * Inference Matter Labs(推理物质实验室)

专题命中 指令微调 :language model(abstract)

AI总结 该研究提出轻量级多模态模型Qwen-MusicAVQA-7B,通过连接冻结的Whisper编码器与Qwen2-VL-7B-Instruct,在MUSIC-AVQA等基准上实现高准确率,训练成本低,且发现音频时间信息保留程度影响下游问答准确率。

Comments 24 pages, 1 figure, 8 tables. Code: https://github.com/MKDehdashti/Qwen2-vl-audio Checkpoints: https://huggingface.co/MayaKD/qwen2-vl-audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09730 2026-08-13 cs.CV cs.RO 交叉投稿 50%

World Tokens: Enhancing Embodied Policies with Training-Time World Modeling

世界令牌:通过训练时世界建模增强具身策略

Qu Tang, Benhui Zhuang, Bo Yuan, Xue Yu, Longteng Guo, Junlan Feng

机构 * JIUTIAN Research(九天研究院) Zhongguancun Academy(中关村学院)

专题命中 指令微调 :pretraining(abstract)

AI总结 本文提出World Tokens架构,通过训练时的World Adapter衔接视觉-语言理解、世界动态建模与动作生成,在保持高效部署的同时提升具身策略性能,在多个基准测试中取得优异结果。

详情

展开后加载摘要…

URL PDF HTML 收藏