arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-21 至 2026-08-21 共收录 20 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 20 篇

2608.15949 2026-08-21 cs.IR cs.AI cs.CL cs.LG 版本更新 94%

Ask to Be Sure: Informative Interactions for Confident Multi-Turn LLM Recommendation

为确认而提问:用于自信多轮大语言模型推荐的信息交互

Cedar Site Bai, Zhenyu Liao, Duanshun Li, Sheikh Sarwar, Huiyuan Chen, Yuan Chen, Changhe Yuan, Haiyang Zhang, Qilin Qi

专题命中 指令微调 :LLM(title,summary_cn);SFT(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对多轮LLM推荐中有效挖掘用户偏好的挑战,提出以推荐熵降为奖励的方法微调LLM,结合SFT与DPO在INSPIRED、ReDial数据集上提升了推荐质量与对话效率。

Comments CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19526 2026-08-21 cs.CL cs.AI cs.IR 新提交 93%

Automated Summarization of Financial News Using Large Language Models and Retrieval-Augmented Generation: An Early Empirical Study (Fall 2023)

基于大语言模型与检索增强生成的财经新闻自动摘要:2023年秋的早期实证研究

Pranav Chandaliya

机构 * George Washington University(乔治·华盛顿大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 该2023年秋的研究构建了结合LLM与RAG的财经新闻摘要流程,测试多种模型与方法,发现Summarize Chains的Falcon-7B表现最优,RAG存在缺陷,且相关失效模式至今仍具参考价值。

Comments 17 pages, 1 figure, 6 tables. Research conducted Fall 2023 at George Washington University; manuscript prepared for public release in 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08022 2026-08-21 cs.CL cs.AI 版本更新 90%

DiverValue-Bench: A Benchmark and Fine-Tuning Framework for Aligning Large Language Models with Diverse Human Values

DiverValue-Bench:用于使大语言模型与多元人类价值观对齐的基准及微调框架

Yao Liang, Dongcheng Zhao, Feifei Zhao, Guobin Shen, Yuwei Wang, Dongqi Liang, Yi Zeng

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 该研究推出覆盖74个国家/地区的人群感知基准DiverValue-Bench,发现现有LLMs存在地理与人口统计学价值观对齐差异,结合LoRA与DPO的轻量微调可提升对齐效果,为全球公平AI开发提供实用基础。

Comments 11 pages, 5 figures. Accepted to IJCAI-ECAI 2026 (Human-Centred AI Special Track). v2: Updated to the camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19680 2026-08-21 cs.AI 新提交 88%

Frequency-Aware Continual Learning for Smart Contract Vulnerability Detection with Large Language Models

基于大语言模型的频率感知持续学习智能合约漏洞检测

Tenghui Huang, Jiawen Kang, Dongning Liu, Changyan Yi, Chengjun Cai, Anjia Yang, Li Li, Dong In Kim

机构 * School of Automation, Guangdong University of Technology(广东工业大学自动化学院) School of Computer Science and Technology, Guangdong University of Technology(广东工业大学计算机科学与技术学院) College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) Department of Computer Science, City University of Hong Kong (Dongguan)(香港城市大学(东莞)计算机科学系) College of Cyber Security, Jinan University(暨南大学网络安全学院) Guangdong Institute of Science and Technology Information(广东省科技情报研究所) Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电气与计算机工程系)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究针对大语言模型用于智能合约漏洞检测时的三个挑战,提出含FA-LoRA、FAR、APPM的三阶段集成框架,在DIVE数据集上取得优异性能,可有效应对区块链生态系统的相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20314 2026-08-21 cs.AI 新提交 86%

MidTool: Mid-training Data Synthesis for Agentic Tool Use

MidTool:面向智能体工具使用的训练中期数据合成

Fengqing Jiang, Yite Wang, Boyi Liu, Zhaoyang Wang, Canwen Xu, Zhewei Yao, Radha Poovendran, Yuxiong He

机构 * University of Washington(华盛顿大学) Snowflake(雪花公司) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出MidTool流水线,构建面向智能体工具使用的训练中期数据,在MidTool-Mix上微调Qwen3模型,可显著提升工具使用相关下游任务性能,证明通用工具使用需专门训练中期调整。

Comments Data & Model: this https URL (https://hf.co/collections/MidTool/midtool-release)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20047 2026-08-21 cs.CL cs.CR cs.LG 新提交 84%

Auditing Cross-Lingual Fairness in Language Model Watermarking

语言模型水印的跨语言公平性审计

Alexander Nemecek, Osama Zafar, Debargha Ganguly, Vikash Singh, Vipin Chaudhary, Erman Ayday

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出含四组件的跨语言公平性评估框架,应用于多方案、生成器、语言及模型 regime,揭示单语言评估无法发现的失效模式,发现水印跨语言公平性差距源于语言属性的结构性问题。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19938 2026-08-21 cs.CR cs.LG 新提交 81%

From Noise to Signal: Improving Security Log Anomaly Detection Using LLMs with Endpoint-Specific Logs

从噪声到信号:利用具备端点特定日志的大语言模型改进安全日志异常检测

Christopher Henshaw, Gour Karmakar

专题命中 指令微调 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 本研究开发基于指令的LLM分类框架,结合端点特定日志,经实验验证Meta Llama 3.1 8B Instruct在安全日志异常检测中性能优于Wazuh、OpenSearch等方法。

Comments The paper contains 35 pages and 3 figures. The paper has not been submitted or published in any conference or journal. The authors have an aim to publish it in a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19669 2026-08-21 cs.CV cs.LG 新提交 81%

Scaffolding Minds: Optimizing Latent Visual Target Representations for Multimodal Reasoning

搭建心智:优化多模态推理的潜在视觉目标表示

Haoqiang Kang, Yinpeng Chen, Luyang Liu, Jesper Sparre Andersen, Abhijit Ogale, Baochen Sun, Lichan Hong, Ed H. Chi

机构 * Google DeepMind(谷歌DeepMind) UC San Diego(加州大学圣迭戈分校)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.LG

AI总结 针对潜在推理框架的 SFT 阶段潜在表示对齐差、RL 阶段缺乏探索性潜在轨迹的局限,提出 Scaffolding Minds,学习专用搭建编码器与 RL 采样器的均值方差,在多基准任务上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19778 2026-08-21 cs.MA cs.AI 新提交 79%

Distilling Aggregate Mobility Statistics into a Language Model Policy for Post-Event Crowd Simulation

将聚合出行统计数据提炼为语言模型策略以用于事件后人群模拟

Tatsuya Amano, Hirozumi Yamaguchi

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 该研究针对仅能获取聚合出行统计数据的场景,通过微调语言模型人群智能体并结合迭代比例拟合与低秩适配器,降低了事件后人群模拟的目的地份额误差。

Comments 4 pages, 3 figures. Accepted as a short paper at ACM SIGSPATIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19710 2026-08-21 cs.CV cs.AI 新提交 74%

Robust Cross-Modal Foundation Model Perception for Underwater Robots under Degraded Visual Conditions

退化视觉条件下水下机器人的鲁棒跨模态基础模型感知

Mohammad Arif Ul Alam

机构 * College of Science and Technology, North Carolina A & T State University(北卡罗来纳农工州立大学科学技术学院)

专题命中 指令微调 :foundation model(title);分类 cs.AI

AI总结 该研究针对水下机器人视觉退化问题,提出感知退化的视觉-声纳门控融合方法,在极端退化下使平衡准确率较 DINOv2 基线提升 33.5%,实现鲁棒跨模态感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19726 2026-08-21 cs.CL cs.CV cs.LG 新提交 73%

Projector Is All You Train

仅训练投影器就足够

Nyx Iskandar, Saathvik Selvan, Slater Victoroff

机构 * Ramen VR(拉面VR公司) University of California, Berkeley(加州大学伯克利分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究探究多模态大语言模型适配新模态是否需微调主干,经实验发现仅训练投影器即可实现强多模态性能,还能避免联合训练导致的语言模型能力漂移,且训练样本吞吐量约为联合训练的两倍,通过多类基准验证了结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19534 2026-08-21 cs.CR 新提交 71%

AEGIS: Attention-Embedding Gradient Isolation Shield - Triple-Channel Gradient Masking for Privacy-Preserving Federated LLM Fine-Tuning

AEGIS:注意力嵌入梯度隔离护盾——用于隐私保护的联邦大语言模型微调的三通道梯度掩码

Ye Tao, Hong Shen, Hui Tian, Xin Wang, Can Wang

专题命中 指令微调 :LLM(title)

AI总结 AEGIS是一种轻量级联邦大语言模型微调防御措施,通过三通道梯度掩码关闭私有令牌信息泄露通道,可将梯度反演攻击的令牌恢复率降至接近零,同时保留或提升模型效用。

Comments 23 pages, 6 figures. Accepted at NDSS 2027; camera-ready version forthcoming

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07267 2026-08-21 cs.AI cs.CV cs.RO 版本更新 70%

WNM-3D: A World Navigation Model with 3D Scene Conditioning for Closed-Loop VLN

WNM-3D:一种用于闭环视觉语言导航的带3D场景条件的世界导航模型

Yuehao Huang, Yunzi Wu, Xiaotao Zhang, Xinhai Li, Jiankun Dong, Jiajun Lv, Chi Zhang, Chenjia Bai, Yong Liu, Xuelong Li

专题命中 指令微调 :language model(abstract);SFT(abstract);分类 cs.AI

AI总结 该研究提出带3D场景条件的WNM-3D模型,通过几何编码器与适配器整合场景上下文,经多阶段训练后在GN-Bench等数据集上的闭环导航性能优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19355 2026-08-21 cs.MM cs.CV 新提交 67%

GRACE: Grounded Reasoning via Adapter Composition and Evidence-Aware Calibration for Educational Visual Question Answering

GRACE:基于适配器组合与证据感知校准的教育视觉问答的接地推理

Xinjin Li, Yudi Xia, Xi Zhao, Yiliu Xu, Yining Liu, Cheng Lu, Yujian Long, Yu Ma, Jinghan Cao, Liang Fan, Yeyun Xu

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 针对教育视觉问答的问题-选项捷径问题,提出GRACE框架,利用结构化教育状态实现参数高效多模态适配,在ScienceQA上提升了多项准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20290 2026-08-21 cs.AI cs.CL 新提交 62%

Phantom Gains: Auditing Self-Improvement Against a Measured Null

幻影增益:针对可测量零假设的自我改进审计

Cheng Xu, Nan Yan, Liming Chen, M-Tahar Kechadi

机构 * University College Dublin(都柏林大学学院) Georgia Institute of Technology(佐治亚理工学院) Dalian University of Technology(大连理工大学)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对Qwen3-8B的LoRA自训练开展审计,发现测量伪影会反转改进结论,提出用逐问题精确检验替代自然阈值修复,还揭示外部蒸馏与自训练的不同效果及自训练的破坏作用。

Comments Code and evaluation artifacts are available at this https URL (https://github.com/chengxuphd/phantom-gains)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20054 2026-08-21 cs.AI cs.LG cs.MA 新提交 62%

What You Can't See Is What You Learn: Restricted Evidence Visibility Favors Compositional Generalization in Shared-Genome Language-Model Societies

你看不见的是你所学的:受限证据可见性有利于共享基因组语言模型社群中的组合泛化

Narcis Marincat

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究探究受限证据可见性对共享基因组语言模型社群的影响,发现受限可见性可显著提升组合泛化能力,虽未通过完整预注册测试,但利于形成可重用的值索引接口。

Comments 16 pages, 3 figures, 5 tables. Code and evaluation records: this https URL (https://github.com/tokenosopher/populus-evidence-partitioning); checkpoints: this https URL (https://huggingface.co/tokenosopher/populus-evidence-partitioning-checkpoints)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19490 2026-08-21 cs.RO cs.CV cs.LG 新提交 57%

Fine-Tuning VLAs with Self-Demonstrated Generative Control for Multi-Task Manipulation

通过自演示生成控制对视觉-语言动作(VLA)模型进行微调以实现多任务操作

Prachi Garg, Steve Xing, Prahit Yaugand, Saurabh Gupta, Derek Hoiem

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :pretraining(abstract);分类 cs.LG

AI总结 本文针对VLA模型部署到新机器人时因硬件不匹配导致性能下降的问题,提出自监督方法生成在线交互rollout数据微调VLA模型,使模型在目标机器人上同时具备先验任务能力、指令遵循能力与高效学习新技能的能力。

Comments Project Page: this https URL (https://self-supervised-control.pages.dev/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17034 2026-08-21 cs.LG 版本更新 57%

Agents unlock new capabilities through Switching LoRA Adapters as a Tool (SLAaaT)

智能体通过切换LoRA适配器作为工具(SLAaaT)解锁新能力

Kenneth Ge

专题命中 指令微调 :post-training(abstract);分类 cs.LG

AI总结 该研究针对后训练导致的灾难性遗忘问题,提出让智能体在轨迹中途切换专用LoRA适配器的SLAaaT方法,实验显示其可解决新问题、自主切换策略且能力损耗低,在任务能力和token使用上优于生成子智能体的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19637 2026-08-21 cs.CV 新提交 50%

TextRefine: Improving Textual Fidelity, Spatial Placement, and Glyph Rendering for Text Editing in Product Posters

TextRefine:提升产品海报文本编辑中的文本保真度、空间位置与字形渲染

Honglie Wang, Jia Sun, Zijun Li, Junlong Wu, Pengcheng Wei, Jiyuan Wang, Yongrui Heng, Boheng Zhang, Huaiqing Wang, Dewen Fan, Qianqian Gan, Fan Yang, Tingting Gao, Yan-Ming Zhang

专题命中 指令微调 :post-training(abstract)

AI总结 研究针对产品海报文本编辑中通用模型的缺陷,提出TextRefine框架与OpenTextEdit数据集,在文本保真度、位置可靠性等指标上优于基线方法,提升了产品海报文本编辑效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19613 2026-08-21 cs.RO cs.CV 新提交 50%

What Matters for Latent Actions in Robot Learning

机器人学习中隐式动作的关键影响因素

Xizhou Bu, Qingda Hu, Lei Zhou, Lingfeng Zhang, Yingbo Tang, Zihao Liu, Xinyi Tao, Zhiqiang Ma, Qingqiu Huang, Chufeng Tang, Hongbo Wang, Jing Zhang, Jiayi Ma, Hangjun Ye, Wei Li, Xiaoshuai Hao

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Guangdong Provincial Key Laboratory of Computility Microelectronics, Faculty of Computility Microelectronics, Shenzhen University of Advanced Technology(深圳先进技术研究院计算机微科学与技术学院、广东省计算微电子重点实验室) School of Aeronautics and Astronautics, Sichuan University(四川大学航空航天学院) Suzhou Evans Intelligent Technology Co., Ltd.(苏州伊文斯智能科技有限公司) Morphi Intelligence Technology Co., Ltd.(墨飞智能科技有限公司) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Xiaomi EV(小米汽车)

专题命中 指令微调 :language model(abstract)

AI总结 本研究通过统一框架整合代表性隐式动作模型,系统探究41种设计选择,发现用隐式动作微调视觉语言模型主干可为下游机器人操纵策略学习提供更强初始化。

Comments Project page: this https URL (https://carldegio.github.io/latent_action.github.io)

详情

展开后加载摘要…

URL PDF HTML 收藏