arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-08 至 2026-07-08 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 17 篇

2601.12494 2026-07-08 cs.SD cs.AI cs.CL eess.AS 版本更新 93%

Multi-Task Instruction Tuning via Data Scheduling for Low-Resource Arabic SpeechLLMs

通过数据调度实现低资源阿拉伯语音频LLM的多任务指令微调

Hunzalah Hassan Bhatti, Firoj Alam, Shammur Absar Chowdhury

机构 * Qatar Computing Research Institute(卡塔尔计算研究院)

专题命中 指令微调 :LLM(title_cn,summary_cn);instruction tuning(title,abstract);large language model(abstract,comments);language model(abstract,comments)

AI总结 本文研究了在资源受限环境下,通过数据调度优化多任务指令微调方法,提出AraMega-SSum用于训练和评估阿拉伯语中心的音频LLM,并比较了四种训练策略,发现两阶段TPC→ADS策略在任务平衡上表现最佳。

Comments Foundation Models, Large Language Models, Native, Speech Models, Arabic

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06175 2026-07-08 cs.CL cs.AI cs.LG 新提交 88%

Improving LLM-Generated Process Model Quality Through Reinforcement Learning: The Role of Reward Function Design

通过强化学习提高大语言模型生成的过程模型质量:奖励函数设计的作用

Alexander Rombach, Chantale Lauer, Nijat Mehdiyev

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Saarland University(萨尔兰大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 研究探索基于强化学习的大语言模型生成过程模型时奖励函数设计,训练两个模型家族,发现强化学习可提质量,均等奖励加权效果好,设计选择与模型架构相互作用复杂,奖励构成是优化关键,结果适用于多维度质量评估的结构化生成任务。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05615 2026-07-08 cs.LG 新提交 88%

A Coin Flip Per Token: Bernoulli Sparse Steering of Large Language Models

每个令牌的抛硬币:大语言模型的伯努利稀疏控制

Nima Eshraghi, Lovedeep Gondara, Yuqing Huang, Sagarika Suresh, Leizer Teran, Jithin Pradeep, Xiaotong Xu, Fanny Chevalier

机构 * The Vanguard Group, Inc.(先锋集团公司) University of Toronto(多伦多大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 研究大语言模型控制问题,提出随机令牌控制和随机块控制方法,无需奖励模型或门控策略。实验表明,仅控制部分令牌就能恢复大部分密集控制效果且保持流畅性,揭示了SAE介导控制的速率限制特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23597 2026-07-08 cs.CL cs.LG 82%

Structure-Guided Entity Resolution: Fine-Tuning LLMs for Robust Name Matching in Complex Linguistic Contexts

结构引导的实体解析:微调大语言模型以实现复杂语言上下文中的鲁棒姓名匹配

Shivam Chourasia, Hitesh Kapoor, Nilesh Patil

机构 * Dream Sports

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出结构引导实体解析(SGER)框架,通过两阶段课程微调大语言模型,先学习姓名语法结构再优化匹配任务,在印度身份数据上达到99.02%准确率和0.994 F1分数,已部署于Dream11平台服务2.5亿+用户。

Comments Accepted to ACL 2026. 8 pages, 1 figure, 2 tables

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 6: Industry Track), pages 1461-1468, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20314 2026-07-08 hep-th gr-qc 新提交 82%

Macroscopic Black-Hole Remnants in a Nonlocal Field Theory: Towards Hawking Radiation in SFT

非局域场论中的宏观黑洞残余:走向弦场论中的霍金辐射

Feng-Yin Cheng, Pei-Ming Ho, Wei-Hsiang Shao

专题命中 指令微调 :SFT(title,abstract)

AI总结 通过弦场论中的非局域指数抑制效应,证明大黑洞的霍金辐射在搅乱时间后终止,粒子数趋零,形成宏观残余,为信息悖论提供新解。

Comments 17 pages, no figure, references added

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05910 2026-07-08 cs.CV cs.AI cs.CL 新提交 79%

PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails

PolicyShiftGuard:基准测试与改进策略自适应图像护栏

Mingyang Song, Luxin Xu, Haoyu Sun, Minzhou Pan, Yu Cheng, Bo Li

机构 * Fudan University(复旦大学) Tongji University(同济大学) Virtue AI(美德人工智能公司) The Chinese University of Hong Kong(香港中文大学) University of Chicago(芝加哥大学) University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 研究策略自适应图像护栏问题,提出PolicyShiftGuard方法,结合随机策略SFT和边界对策略适应进行两阶段训练,在PolicyShiftBench基准测试中显著提升性能,消融实验验证关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06185 2026-07-08 cs.CV 新提交 78%

Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition

用于细粒度图像识别的视觉语言模型中的结构化压缩提示调优

Xinda Liu, Qinyu Zhang, Weiqing Min, Guohua Geng, Shuqiang Jiang

机构 * School of Information Science and Technology, Northwest University(西北大学信息科学与技术学院) Laboratory of Intelligent Information Processing, Institute of Computing Technology(中国科学院计算技术研究所智能信息处理重点实验室)

专题命中 指令微调 :language model(title,abstract)

AI总结 针对细粒度图像识别中视觉语言模型捕捉细微差别能力有限的问题,提出结构化压缩提示调优(SCPT),通过语义关系编码和语义压缩损失增强语义结构建模,在多基准实验中有效减轻语义模糊性,取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05655 2026-07-08 cs.HC 新提交 78%

GeoXplain: On-the-Fly Visual Explanations for Weather Foundation Models

GeoXplain:天气基础模型的实时可视化解释

Clemens Walter Koprolin, Leonardo Trentini, Benedikt Soja, Mennatallah El-Assady, Christina Humer

专题命中 指令微调 :foundation model(title,abstract)

AI总结 研究天气和气候基础模型预测关系难察问题,提出GeoXplain交互式可视化工具包及Aurora Adapter计算后端,支持多种解释方法,可在笔记本或浏览器呈现地理空间归因图,方便探索,代码开源可安装。

Comments 9 pages, 6 figures. Submitted to VISxClimate at IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05582 2026-07-08 cs.IR 新提交 78%

Prompting Beats Fine-Tuning: Generative Expected Value Scoring for Statutory Term Retrieval

提示优于微调:用于法定术语检索的生成期望值评分

Alvin Wang, Jaromir Savelka

专题命中 指令微调 :prompting(title,abstract)

AI总结 研究法规中模糊法律概念检索任务,比较仅编码器模型微调与仅解码器模型零样本提示两类方法,发现提示仅解码器模型总体效果最佳,最佳系统超越此前所有最先进结果。

Comments Accepted to the ASAIL Workshop at ICAIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05752 2026-07-08 cs.CL cs.AI 新提交 73%

When Should LLMs Search? Counterfactual Supervision for Search Routing

大语言模型何时应进行搜索?搜索路由的反事实监督

Minho Kim

机构 * Minho Kim

专题命中 指令微调 :language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型搜索路由问题,通过比较无搜索和强制搜索结果构建预言机,以其为评估标准和学习信号,用监督微调及偏好优化训练策略,提升了Gemma E2B和Qwen3.5 - 4B的路由宏F1,减少特定模型路由失败并揭示相关瓶颈。

Comments 20 pages, 10 figures. Accepted at the FAGEN Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05810 2026-07-08 cs.SE 新提交 67%

SCOPE: Leveraging Subgoal Critiques for Code Generation

SCOPE:利用子目标批判进行代码生成

Yueke Zhang, Yifan Zhang, Zihan Fang, Kevin Leach, Wei Zhang, Yu Huang

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型代码生成不可靠问题,提出SCOPE方法,利用证明器初始化子目标批判,结合监督微调、强化学习等,通过两个互补奖励改进代码生成,实验显示在多个数据集上优于基线,优势集中在有语义约束任务,代码修正更局部。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05968 2026-07-08 cs.CL cs.AI cs.IR 新提交 62%

InfluMatch: Frontier-Quality KOL Search at 4B-Model Cost

InfluMatch:以4B模型成本实现前沿质量的关键意见领袖搜索

Krittanon Kaewtawee, Petmongkon Pornpichitsuwan, Natchaya Temyingyong, Nutnicha Laplamoon, Wachiravit Modecrua, Krittin Pachtrachai, Touchapon Kraisingkorn

专题命中 指令微调 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究如何将关键意见领袖与泰国营销标准匹配,提出低成本三阶段级联InfluMatch,由小型开放权重模型构建,能以低得多的成本达到前沿模型效果,是可部署、可解释的KOL搜索系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06125 2026-07-08 cs.SE cs.AI cs.CR 新提交 57%

Evaluating Fine-Tuning and Metrics for Neural Decompilation of Dart AOT Binaries

评估Dart AOT二进制文件神经反编译的微调与指标

Raafat Abualazm, Ayman AboElhassan, Amr G. Wassal

机构 * Cairo University Computer Engineering Department, Faculty of Engineering(开罗大学计算机工程系,工程学院)

专题命中 指令微调 :LLM(abstract);分类 cs.AI

AI总结 研究针对Dart AOT二进制文件神经反编译,在新基准上用三个指标评估六种微调模型变体,发现无微调配置能显著提升pass@k,存在跨语言干扰及指标差异,指出汇编序列长度是任务难度关键预测指标,贡献新基准等并明确pass@k为主要评估指标。

Comments Under review at ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05568 2026-07-08 cs.CV cs.AI 新提交 57%

Harnessing Generative Image Models for Training-Free Primitive Shape Abstraction

利用生成式图像模型进行无训练的原始形状抽象

Gregor Kobsik, Tim Elsner, Leif Kobbelt

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 研究如何利用生成式图像模型进行无训练的原始形状抽象,通过渲染多视图图像、分析语义部分、绘制分割掩码、重新投影和拟合超二次基元的流程,实现与类别无关且方向不变,在相关数据集上Chamfer距离最低。

Comments 13 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05465 2026-07-08 cs.CV cs.AI 新提交 57%

CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration

CanvasAgent:通过视觉工具编排实现复杂图像创建和编辑

Hairui Zhu, Yiying Yang, Tengjin Weng, Ziyu Lu, Xiao Yao, Xiaoyang Ye, Lin Ma, Wenhao Jiang

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))

专题命中 指令微调 :SFT(abstract);分类 cs.AI

AI总结 研究复杂图像创建编辑问题,提出CanvasAgent代理,通过多轮交互编排异构视觉工具,先经监督微调学习轨迹,再用广义信赖域策略优化器结合多种信号优化,结合CanvasCraft数据集进行实验,证明其对复杂多工具图像创建工作流程有效。

Comments 18pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05625 2026-07-08 cs.CV 新提交 50%

Cross-Contextual Vision-Language Adaptation with LoRA for Personalized Severe Adverse Event Detection in Clinical Wound Monitoring

基于LoRA的跨上下文视觉语言适配用于临床伤口监测中的个性化严重不良事件检测

Aditi Naiknaware, Jian Sun, Aminreza Khandan, Shengyang Huang, Sean Dow, Bijan Najafi, Salimeh Sekeh

机构 * San Diego State University(圣地亚哥州立大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of California, Davis(加利福尼亚大学戴维斯分校)

专题命中 指令微调 :language model(abstract)

AI总结 研究针对临床伤口监测中严重不良事件检测问题,提出基于双流LoRA框架及跨上下文融合机制的多模态框架,结合多种方法识别个性化严重不良事件并捕捉愈合动态,在相关实验中展现良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06305 2026-07-08 astro-ph.IM 新提交 50%

Exploring Image-Text Alignment for Radio Galaxy Morphologies

探索射电星系形态的图像-文本对齐

Erica Lastufka, Mariia Drozdova, Svyatoslav Volosynovskiy

专题命中 指令微调 :language model(abstract)

AI总结 研究射电星系图像与文本描述的对齐,利用MiraBest数据集及SigLIP-2模型,经特定提示生成描述并评估。结果显示基于描述的星系分类与图像类似,微调改善局部连贯性,此为射电星系形态研究提供新方法。

Comments Accepted at the AI in Science (AIS) Conference 2025

详情

展开后加载摘要…

URL PDF HTML 收藏