arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-22 至 2026-07-22 共收录 20 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 20 篇

2607.04733 2026-07-22 cs.CL cs.LG 版本更新 92%

LP-SFT: Local-Preserving Supervised Fine-Tuning via Multimodal Entropy Structure

LP-SFT:通过多模态熵结构进行局部保持监督微调

Yueyang Wang, Baolong Bi, Shuo Lu, Jingyuan Zhang, Jiajun Shi

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) College of Computing, Georgia Institute of Technology(佐治亚理工学院计算学院)

专题命中 指令微调 :SFT(title,title_cn);language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究监督微调中存在的问题,利用香农和雷尼熵分析揭示预训练模型的多模态熵结构,提出LP-SFT目标,在多领域实验中提升性能,平衡准确率和k准确率。

Comments 20 pages, 3 figures. Code is available at https://github.com/Wakaka161/LP-SFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03698 2026-07-22 cs.LG 版本更新 92%

Multi$^2$: Hierarchical Multi-Agent Decision-Making with LLM-Based Agents in Interactive Environments

Multi$^2$:基于LLM智能体在交互环境中的分层多智能体决策

Sangeun Park, Minhae Kwon

机构 * KAIST(韩国科学技术院)

专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出Multi$^2$分层多智能体决策框架,通过高层智能体(System 1)使用监督微调生成子目标,低层智能体(System 2)使用离线到在线强化学习执行原子动作,以缓解目标漂移并实现长期稳定控制。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18772 2026-07-22 cs.CL 新提交 91%

RF-Agent: A Practical Framework for Building Language Agents for RFIC Design

RF-Agent:用于构建射频集成电路设计语言代理的实用框架

Yueqi Xing, Houbo He, Jolie Wang, Erin Ni, Shikai Wang, Qiufeng Li, Weidong Cao, Taiyun Chi

机构 * Rice University(莱斯大学) The George Washington University(乔治·华盛顿大学)

专题命中 指令微调 :SFT(summary_cn,abstract);language agent(title);LLM(abstract,comments);large language model(abstract)

AI总结 针对大语言模型在射频电路设计应用受限问题,提出RF-Agent框架,通过教科书驱动知识蒸馏创建数据集及基准,研究监督微调与检索增强生成策略,发现特定领域SFT对中小模型提升大,语义检索的RAG表现最佳,为相关工作提供基础。

Comments Accepted at ICLAD (IEEE International Conference on LLM-Aided Design), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23381 2026-07-22 cs.CL 版本更新 90%

Guard Vector: Beyond English LLM Guardrails with Task-Vector Composition and Streaming-Aware Prefix SFT

Guard Vector:通过任务向量合成和流感知前缀监督微调超越英语大语言模型护栏

Wonhyuk Lee, Youngchol Kim, Yunjin Park, Junhyung Moon, Dongyoung Jeong, Wanjin Park

专题命中 指令微调 :SFT(title,summary_cn);LLM(title);language model(abstract);分类 cs.CL

AI总结 研究提出Guard Vector安全任务向量,通过与目标语言模型合成及流感知方法调整得到TGM,能提升分类质量、实现语言扩展和模型可移植性,前缀SFT保持流环境下分类质量,单令牌输出设计提高效率,有助于构建更负责的AI生态系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18481 2026-07-22 cs.CL cs.IR 新提交 89%

Search-on-Graph-R1: Training Large Language Models to Search Knowledge Graphs with Reinforcement Learning

搜索图-R1:使用强化学习训练大型语言模型以搜索知识图谱

Jia Ao Sun, Hao Yu, Fengran Mo, Zhan Su, Yuchen Hui, Bang Liu, Jian-Yun Nie

机构 * Université de Montréal(蒙特利尔大学) Mila – Québec AI Institute(米拉-魁北克人工智能研究所) McGill University(麦吉尔大学) Halmstad University College(哈尔姆斯塔德大学学院)

专题命中 指令微调 :large language model(title);language model(title);SFT(abstract,abstract_cn);LLM(abstract)

AI总结 研究针对知识图谱问答部署成本高的问题,提出搜索图-R1,通过监督微调与强化学习,将导航内化到8B模型。核心是用黄金SPARQL查询搭建教师遍历答案路径。该模型在多个数据集上超越前沿语言模型,推理无需辅助模块,训练无需语言模型评判,且训练阶段互补,可跨模型家族迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18960 2026-07-22 cs.LG cs.AI cs.CR 新提交 89%

SFGA: A Statistics-First Gating Architecture with Adjudicative Escalation for Trustworthy SFT Data Procurement

SFGA:一种用于可信SFT数据采购的具有裁决升级的统计优先门控架构

Arther Tian, Alex Ding, Simon Wu, Aaron Chan

机构 * DGrid AI(DGrid人工智能)

专题命中 指令微调 :SFT(title,title_cn);LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究如何采购监督微调数据,提出统计优先门控架构SFGA,将采购视为成本感知路由问题,经实验在准确率、F1值和成本上取得良好平衡,还报告辩论路径负面诊断,为测量和校准构建合成基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18691 2026-07-22 cs.AI cs.CL 新提交 88%

Semantic Primes as Explanans for Emotion in Large Language Models

语义原素作为大语言模型中情感的解释因素

Frank Xing

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨大语言模型中情感的解释问题,通过在四个指令微调的LLMs上实验,发现自然语义元语言的语义原素是可恢复的内部元素,能更有效控制情感,且与相应情感可互换,是比其他选项更好的情感解释因素。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18266 2026-07-22 cs.AI 新提交 88%

Structured Synthetic Reasoning Data for Arithmetic Fine-Tuning of Small Language Models

用于小型语言模型算术微调的结构化合成推理数据

Jake O'Grady, Effirul Ramlan

机构 * University of Galway(戈尔韦大学) School of Computer Science(计算机科学学院)

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);分类 cs.AI

AI总结 研究小型语言模型多步算术推理困难问题,通过生成结构化合成推理数据并结合LoRA在消费硬件上微调Qwen3模型,提高了模型在GSM8K等基准测试上的准确率和迁移效果,证明低成本合成数据设计可改善小型语言模型算术适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18293 2026-07-22 cs.LG cs.CL 新提交 82%

One Student, Many Teachers: Multi-Task On-Policy Distillation via Soft-Prompt Privileged Context

一个学生,多个教师:通过软提示特权上下文进行多任务在线策略蒸馏

Yingzi Ma, Zichen Zhu, Ming Jiang, Chaowei Xiao

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Johns Hopkins University(约翰霍普金斯大学) Nanyang Technological University(南洋理工大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究提出一种多任务在线策略蒸馏方法,教师与学生仅通过可学习软提示区分,在骨干冻结时训练特定任务教师。单任务变体训练参数少且效果好,多任务变体保持通用能力基准同时实现最佳总体平均水平。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06409 2026-07-22 cs.CR 版本更新 82%

VENOMREC: Cross-Modal Interactive Poisoning for Targeted Promotion in Multimodal LLM Recommender Systems

VENOMREC: 多模态交互性污染用于多模态大语言模型推荐系统中的定向推广

Guowei Guan, Yurong Hao, Jiaming Zhang, Tiantong Wu, Fuyao Zhang, Tianxiang Chen, Longtao Huang, Cyril Leung, Wei Yang Bryan Lim

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract)

AI总结 VENOMREC通过跨模态交互性污染技术,在多模态大语言模型推荐系统中实现定向推广,有效提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06471 2026-07-22 cs.CL cs.AI cs.LG 版本更新 80%

PRISP: Privacy-Safe Few-Shot Personalization via Lightweight Adaptation

PRISP:通过轻量级适配实现隐私安全的少样本个性化

Junho Park, Dohoon Kim, Taesup Moon

机构 * Department of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) ASRI/INMC/IPAI/AIIS, Seoul National University(ASRI/INMC/IPAI/AIIS,首尔国立大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型个性化中数据、资源和隐私问题,提出PRISP框架,利用文本到LoRA超网络生成参数,结合少样本用户数据优化,减少计算开销并消除隐私风险,相比先前方法性能更强。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18958 2026-07-22 cs.CV cs.AI 新提交 79%

Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model

用于增强大型视觉语言模型鲁棒性的对偶对抗微调

Sibo Wang, Jie Zhang, Shiguang Shan, Xilin Chen, Wen Gao

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 针对大型视觉语言模型视觉输入易受攻击且现有防御方法缺乏通用性的问题,提出对偶对抗微调框架,通过联合优化视觉和语义监督信号增强模型鲁棒性,实验证明该方法在多任务对抗鲁棒性评估中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18283 2026-07-22 cs.LG cs.AI cs.CV 新提交 76%

FedCC: A Low-Resource Federated Adaptation of Foundation Models for Robust Corpus Callosum localization in Fetal Ultrasound Images

FedCC:用于胎儿超声图像中胼胝体稳健定位的基础模型低资源联邦适应

Alessandro Di Matteo, Sara Moccia, Giuseppe Rizzo, Gianpaolo Grisolia, Ricciarda Raffaelli, Lorenzo Vasciaveo, Francesco D'Antonio, Maria Chiara Fiorentino

机构 * unich(那不勒斯费德里克二世大学)

专题命中 指令微调 :foundation model(title);分类 cs.AI、cs.LG

AI总结 针对胎儿超声图像中胼胝体定位难题,提出FedCC框架,集成冻结的DINOv2主干与轻量级YOLO检测头,并引入LoRA模块。在多中心数据集上评估,该框架性能出色,减少了可训练参数与通信成本,迈向可临床部署的胎儿神经超声AI系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18718 2026-07-22 eess.AS 新提交 75%

Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering

DCASE 2026任务5总结:音频相关问答

Haolin He, Renhe Sun, Zheqi Dai, Xingjian Du, Chunyat Wu, Zining Liang, Zhengxi Liu, Jiahe Lei, Runbang Wang, Jiayi Zhou, Mingru Yang, Xiquan Li, Yun Chen, Xie Chen, Zhiyao Duan, Weiqiang Wang, Mark D. Plumbley, Jian Liu, Qiuqiang Kong

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 DCASE 2026任务5聚焦音频相关问答,用音频依赖过滤管道构建评估集。比赛分两轨道,众多团队参与。成均馆大学团队取得较好成绩,还分析了常见构建模块、测试方法及各系统普遍遗漏的项目。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05493 2026-07-22 cs.CL cs.AI cs.MA 版本更新 73%

LinguistAgent Technical Report: A Reflective Multi-Model Platform for Automated Linguistic Annotation

LinguistAgent: 一个用于自动化语言标注的反思多模型平台

Bingru Li

机构 * University of Birmingham(伯明翰大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LinguistAgent通过反思多模型架构实现自动化语言标注,采用双代理工作流程模拟同行评审,支持多种标注范式并提供实时评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18271 2026-07-22 cs.AI 新提交 70%

Using LLMs for Explainable, Data-Driven Insight Generation from Time Series

使用大语言模型从时间序列中生成可解释的、数据驱动的见解

Ria Mundhra, Gustavo Sato dos Santos, Michael Benedikt

机构 * University of Oxford(牛津大学) Vortexa

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对时间序列预测中解释生成难且易幻觉的问题,提出领域无关框架,含提取解释因素、基于证据生成解释及可扩展评估三组件,经案例研究验证,该框架能大规模实现有根据的解释生成,无需特定领域微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19737 2026-07-22 cs.CL 版本更新 70%

XCOMPS: A Multilingual Benchmark of Conceptual Minimal Pairs

XCOMPS:概念最小对的多语言基准测试

Linyang He, Ercong Nie, Sukru Samet Dindar, Arsalan Firoozi, Adrian Florea, Van Nguyen, Corentin Puffay, Riki Shimizu, Haotian Ye, Jonathan Brennan, Helmut Schmid, Hinrich Schütze, Nima Mesgarani

机构 * Columbia University(哥伦比亚大学) Munich Center for Machine Learning(慕尼黑机器学习中心) LMU Munich(慕尼黑大学) University of Michigan(密歇根大学) KU Leuven(根特大学)

专题命中 指令微调 :instruction tuning(abstract);prompting(abstract);分类 cs.CL

AI总结 介绍多语言概念最小对数据集XCOMPS,通过多种方式评估LLMs多语言概念理解,比较不同模型发现LLMs对低资源语言概念理解弱,指令微调与知识蒸馏有不同效果,形态复杂语言理解分数低。

Comments Accepted at SIGTYP 2025: https://aclanthology.org/2025.sigtyp-1.9/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18570 2026-07-22 cs.CL cs.AI 新提交 62%

For What Reason? Interpreting Models' Encoding of Causation and Antithesis

出于什么原因?解释模型对因果关系和对立关系的编码

Abhidip Bhattacharyya, Shira Wein

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of South Florida(南佛罗里达大学)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究指令微调的Transformer模型对英语话语关系的编码,聚焦因果和对立关系。通过下一个token预测任务及可解释性技术,发现早期层在序列中间做预测,中层接近末尾确定决策,部分层有答案偏好,揭示话语推理的不对称表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00429 2026-07-22 cs.CL cs.LG cs.MA 版本更新 62%

Node-as-Agent: Graph Agentic Network

节点即智能体:图智能体网络

Minghao Guo, Xi Zhu, Qingyue Jiao, Xiujin Liu, Haochen Xue, Chong Zhang, Shuhang Lin, Jingyuan Huang, Ziyi Ye, Yongfeng Zhang

机构 * Rutgers University(罗格斯大学) University of Liverpool(利物浦大学) Fudan University(复旦大学)

专题命中 指令微调 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 研究针对图神经网络不能处理节点信息不平衡及忽略全局语义关系的局限,提出检索增强图智能体网络ReaGAN,赋予节点自主决策能力,通过智能体规划和局部 - 全局检索实现自适应消息传播,在少样本设置下性能优异。

Comments 11 pages, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19339 2026-07-22 cs.CV 新提交 50%

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

OmniReasoner:通过原生工具使用进行长音频-视频推理

Yu Chen, Caorui Li, Ziyu Xiong, Yidong Wang, Mingqi Gao, Shuman Liu, Biao Liu, Chunfeng Yang, Anxiang Zeng, Haibo Zhang, Chaofan Chen

专题命中 指令微调 :post-training(abstract)

AI总结 针对长音频-视频推理难题,OmniReasoner提出工具使用后训练框架,通过监督微调与强化学习让全模态语言模型学会调用放大工具,利用TimeAnchor保持时间参数一致性,借助时间增强数据引擎实现可训练,提升了答案准确性与时间定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏