arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-13 至 2026-04-13 共收录 19 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 19 篇

2604.08703 2026-04-13 cs.MM cs.DB cs.LG 89%

QoS-QoE Translation with Large Language Model

服务质量-用户体验转换与大语言模型

Yingjie Yu, Mingyuan Wu, Ahmadreza Eslaminia, Lingzhi Zhao, Kaizhuo Yan, Klara Nahrstedt

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文提出服务质量-用户体验转换数据集,利用大语言模型进行双向转换,展示了在连续值和离散标签预测上的强性能,为多媒体质量预测与优化提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23808 2026-04-13 cs.CL cs.AI 88%

DenseLoRA: Dense Low-Rank Adaptation of Large Language Models

DenseLoRA: 大型语言模型的密集低秩适应

Lin Mu, Xiaoyu Wang, Li Ni, Yang Li, Zhize Wu, Peiquan Jin, Yiwen Zhang

机构 * Anhui University(安徽大学) Hefei University(合肥大学) University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 DenseLoRA通过引入密集低秩矩阵提升参数效率和性能,相比LoRA在多个基准测试中表现更优。

Journal ref ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08926 2026-04-13 cs.LG 87%

Bridging SFT and RL: Dynamic Policy Optimization for Robust Reasoning

弥合SFT与RL:面向鲁棒推理的动态策略优化

Taojie Zhu, Dongyang Xu, Ding Zou, Sen Zhao, Qiaobo Hao, Zhiguo Yang, Yonghong He

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Intelligent System Department, Zhongxing Telecom Equipment (ZTE)(中兴通讯股份有限公司智能系统部) Institute of Advanced Interdisciplinary Studies, Chongqing University of Posts and Telecommunications(重庆邮电大学前沿交叉研究院)

专题命中 指令微调 :SFT(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出DYPO框架,通过组对齐损失、多教师蒸馏和动态探索-利用门控机制,解决SFT与RL间的偏倚-方差权衡问题,提升复杂推理和分布外任务性能。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07361 2026-04-13 cs.LG 87%

BLEG: LLM Functions as Powerful fMRI Graph-Enhancer for Brain Network Analysis

BLEG: LLM作为强大的fMRI图增强器用于脑网络分析

Rui Dong, Zitong Wang, Jiaxing Li, Weihuang Zheng, Youyong Kong

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出BLEG方法,通过结合大语言模型与图神经网络,提升fMRI脑网络分析性能,采用三阶段流程增强图神经网络表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08915 2026-04-13 cs.CV cs.AI 83%

Large-Scale Universal Defect Generation: Foundation Models and Datasets

大规模通用缺陷生成:基础模型与数据集

Yuanting Fan, Jun Liu, Bin-Bin Gao, Xiaochen Chen, Yuhuan Lin, Zhewei Dai, Jiawei Zhan, Chengjie Wang

机构 * Tencent Youtu Lab, Shenzhen, China(腾讯优图实验室,深圳,中国)

专题命中 指令微调 :foundation model(title,abstract);SFT(abstract);分类 cs.AI

AI总结 本文提出UniDG模型和UDG数据集,通过参考基和文本指令生成缺陷,提升缺陷生成的多样性和真实性,实验表明其在异常检测和定位任务中表现优异。

Comments 25 pages, 13 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01580 2026-04-13 cs.LG cs.AI 82%

The Two-Stage Decision-Sampling Hypothesis: Understanding the Emergence of Self-Reflection in RL-Trained LLMs

两阶段决策采样假说:理解RL训练LLM中自反思能力的产生

Zibo Zhao, Yuanting Zha, Haipeng Zhang, Xingcheng Xu

机构 * Arizona State University(亚利桑那州立大学) Shanghaitech University(上海科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 研究探讨了RL训练后LLM中自反思能力的形成机制,提出两阶段决策采样假说,通过梯度归因属性分析发现RL优于SFT的原因在于决策能力的提升而非生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08771 2026-04-13 cs.HC cs.ET 80%

TeamLLM: Exploring the Capabilities of LLMs for Multimodal Group Interaction Prediction

TeamLLM: 探索LLMs在多模态群体交互预测中的能力

Diana Romero, Xin Gao, Daniel Khalkhali, Salma Elmalaki

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文研究LLMs在多模态传感器数据中预测群体协调模式的能力,发现LLMs在语言基础行为上比LSTM基线提升3.2倍,细调准确率达96%。同时揭示了文本模型在多模态交互中的局限性及模拟模式的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08976 2026-04-13 cs.CL 79%

Quantisation Reshapes the Metacognitive Geometry of Language Models

量化重塑语言模型的元认知几何

Jon-Paul Cacioli

专题命中 指令微调 :language model(title);SFT(abstract);分类 cs.CL

AI总结 研究发现模型量化重构了语言模型在不同领域内的元认知效率,而非均匀降低。通过评估Llama-3-8B-Instruct在不同精度下的表现,发现元认知比率在不同领域间无相关性,但Type-2 AUROC曲线保持稳定,表明重构发生在元认知比率归一化而非基础辨别信号上。

Comments 10 pages, 2 figures, 5 tables. Pre-registered study. Code and data: https://github.com/synthiumjp/sdt-calibration

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21334 2026-04-13 cs.CV 78%

Streaming Video Instruction Tuning

流式视频指令微调

Jiaer Xia, Peixian Chen, Mengdan Zhang, Xing Sun, Kaiyang Zhou

机构 * Hong Kong Baptist University(香港浸会大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 指令微调 :instruction tuning(title);LLM(abstract)

AI总结 本文提出Streamo,一个实时流式视频大语言模型,能执行多种视频任务,如实时叙述、动作理解等。通过大规模指令遵循数据集训练,Streamo在时间推理和多任务处理上表现优异,填补了离线视频模型与实时多模态助手之间的差距。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04736 2026-04-13 cs.AI cs.AR cs.PL 77%

ChipSeek: Optimizing Verilog Generation via EDA-Integrated Reinforcement Learning

ChipSeek: 通过集成EDA的强化学习优化Verilog生成

Zhirong Chen, Kaiyan Chang, Zhuolin Li, Cangyuan Li, Xinyang He, Chujie Chen, Mengdi Wang, Haobo Xu, Yinhe Han, Huawei Li, Ying Wang

机构 * SKLP, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所智能计算机研究中心) University of Chinese Academy of Sciences(中国科学院大学) University of Electronic Science and Technology of China(电子科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ChipSeek通过集成EDA的强化学习框架,优化RTL代码生成,提升功能正确性和PPA指标。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05426 2026-04-13 cs.LG cs.AI cs.DC 73%

ALTO: Adaptive LoRA Tuning and Orchestration for Heterogeneous LoRA Training Workloads

ALTO:适应性LoRA调优与异构LoRA训练工作负载的编排

Jingwei Zuo, Xinze Feng, Zien Liu, Kaijian Wang, Fanjiang Ye, Ye Cao, Zhuang Wang, Yuke Wang

机构 * Rice University(莱斯大学) Independent Researcher(独立研究员)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 ALTO通过适应性调优和编排技术提升异构LoRA训练效率,通过监控损失轨迹和优化资源分配实现多任务协同,达到13.8倍的速度提升而不牺牲适配器质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08974 2026-04-13 cs.CL 70%

Confident in a Confidence Score: Investigating the Sensitivity of Confidence Scores to Supervised Fine-Tuning

对置信度分数的敏感性进行研究:探究置信度分数对监督微调的敏感性

Lorenzo Jaime Yu Flores, Cesare Spinoso di-Piano, Jackie Chi Kit Cheung

机构 * Mila - Quebec AI Institute(Mila - 魁北克人工智能研究所) McGill University(麦吉尔大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能教席)

专题命中 指令微调 :language model(abstract);SFT(abstract);分类 cs.CL

AI总结 研究探讨了置信度分数对监督微调的敏感性,发现微调会降低置信度分数与输出质量的相关性,强调了开发更鲁棒的置信度指标的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08844 2026-04-13 cs.LG 70%

Spectral Geometry of LoRA Adapters Encodes Training Objective and Predicts Harmful Compliance

LoRA适配器的谱几何编码了训练目标并预测了有害合规性

Roi Paul

机构 * Independent Researcher(独立研究员)

专题命中 指令微调 :language model(abstract);SFT(abstract);分类 cs.LG

AI总结 研究LoRA适配器的谱几何能否识别语言模型的微调目标,并预测下游行为危害。通过实验发现,LoRA权重空间几何能反映训练目标和危害合规性,但跨方法监控需单独校准。

Comments 15 pages, 8 figures, pre-registered experiment, data at https://github.com/roip/task-geometry-experiment-results

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17667 2026-04-13 cs.IR cs.CV cs.LG 70%

When & How to Write for Personalized Demand-aware Query Rewriting in Video Search

何时及如何为个性化需求感知的视频搜索查询重写编写

Cheng cheng, Chenxing Wang, Aolin Li, Haijun Wu, Huiyun Hu, Juyuan Wang

机构 * Weixin Group, Tencent(腾讯微信事业群)

专题命中 指令微调 :LLM(abstract);SFT(abstract);分类 cs.LG

AI总结 本文提出WeWrite框架,通过自动化后验挖掘策略、混合训练范式和并行'假召回'架构,提升视频搜索查询重写效果,提高点击视频量1.07%并降低查询重写率2.97%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22832 2026-04-13 cs.CV cs.AI 70%

Listener-Rewarded Thinking in VLMs for Image Preferences

图像偏好中的VLMs思考奖励

Alexander Gambashidze, Li Pengyi, Matvey Skripkin, Andrey Galichin, Anton Gusarov, Konstantin Sobolev, Andrey Kuznetsov, Ivan Oseledets

专题命中 指令微调 :language model(abstract);SFT(abstract);分类 cs.AI

AI总结 本文提出一种增强GRPO框架,通过引入独立的监听器模型来校准推理过程,提升图像偏好任务中的准确性和泛化能力。

Comments part of a different work

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08600 2026-04-13 q-bio.TO eess.IV 67%

Gaze2Report: Radiology Report Generation via Visual-Gaze Prompt Tuning of LLMs

Gaze2Report:通过视觉-凝视提示调优LLM实现放射学报告生成

Aishik Konwer, Moinak Bhattacharya, Prateek Prasanna

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 本文提出Gaze2Report框架,利用扫描路径预测模块和图神经网络生成视觉-凝视标记,结合指令和报告标记对LLM进行微调,提升报告生成质量并实现推理时无需凝视输入。

Comments Accepted at ISBI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08565 2026-04-13 cs.CL cs.AI cs.LG 67%

Dynamic sparsity in tree-structured feed-forward layers at scale

大规模树状前馈层中的动态稀疏性

Reza Sedghi, Robin Schiewer, Anand Subramoney, David Kappel

机构 * CITEC, Bielefeld University(比勒费尔德大学认知交互技术研究中心) Department of Computer Science, Royal Holloway, University of London(伦敦大学皇家霍洛威学院计算机科学系)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了树状结构前馈层作为Transformer中密集MLP块的替代方案,实现条件计算无需额外路由网络。通过动态稀疏性技术,在大规模模型中实现高效的语言建模和问答任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09101 2026-04-13 cs.CR cs.AI cs.CV cs.LG 62%

CLIP-Inspector: Model-Level Backdoor Detection for Prompt-Tuned CLIP via OOD Trigger Inversion

CLIP-Inspector:通过OoD触发器反向工程实现提示调优CLIP的模型级后门检测

Akshit Jindal, Saket Anand, Chetan Arora, Vikram Goyal

机构 * IIIT Delhi(印度德里国际信息技术学院) IIT Delhi(印度德里理工学院)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 针对提示调优CLIP模型中潜在的后门攻击,CLIP-Inspector通过OoD触发器反向工程实现模型级后门检测,利用白盒访问和未标记OoD图像重建可能触发器,验证模型安全性并修复后门效果。

Comments 17 pages (8 main + 2 references + 7 supplementary), Accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09059 2026-04-13 cs.CV cs.AI 57%

Learning Vision-Language-Action World Models for Autonomous Driving

学习视觉-语言-动作世界模型以实现自动驾驶

Guoqing Wang, Pin Tang, Xiangxuan Ren, Guodongfang Zhao, Bailan Feng, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部人工智能重点实验室) Central Research Institute, Huawei(华为中央研究院)

专题命中 指令微调 :pretraining(abstract);分类 cs.AI

AI总结 本文提出VLA-World模型,通过结合预测想象与反思推理提升自动驾驶的前瞻性。该模型利用生成的轨迹引导图像生成,并通过反思优化轨迹预测,实验表明其在规划和未来场景生成任务中优于现有方法。

Comments Accepted by CVPR2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏