arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-27 至 2026-02-27 共收录 20 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 20 篇

2510.06008 2026-02-27 cs.CV cs.AI 89%

Detection and Measurement of Hailstones with Multimodal Large Language Models

利用多模态大语言模型检测和测量冰雹

Moritz Alker, David C. Schedl, Andreas Stöckl

机构 * Digital Media Lab University of Applied Sciences Upper Austria(数字媒体实验室 上奥地利应用科学大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 利用多模态大语言模型检测和测量冰雹,通过社交媒体图像实现快速评估

Comments 6 pages, 5 figures, accepted at The 2nd International Conference on Electrical and Computer Engineering Researches

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22475 2026-02-27 cs.CL 88%

Mind the Gap in Cultural Alignment: Task-Aware Culture Management for Large Language Models

注意文化契合差距:面向任务的文化管理用于大语言模型

Binchi Zhang, Xujiang Zhao, Jundong Li, Haifeng Chen, Zhengzhang Chen

机构 * University of Virginia(弗吉尼亚大学) NEC Laboratories America(NEC美洲实验室)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出CultureManager,一种面向任务的文化管理方法,通过任务感知的文化数据对齐和文化路由器管理,提升大语言模型在文化敏感任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22368 2026-02-27 cs.SE cs.AI 85%

EyeLayer: Integrating Human Attention Patterns into LLM-Based Code Summarization

EyeLayer:将人类注意力模式整合到基于LLM的代码摘要中

Jiahao Zhang, Yifan Zhang, Kevin Leach, Yu Huang

机构 * Vanderbilt University(范德比尔特大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EyeLayer通过整合人类眼动模式提升LLM代码摘要效果,实现13.17%的BLEU-4提升。

Comments Accepted at the 34th IEEE/ACM International Conference on Program Comprehension (ICPC 2026), April 12-13, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10497 2026-02-27 cs.CV 82%

MERGETUNE: Continued Fine-Tuning of Vision-Language Models

MERGETUNE: 视觉-语言模型的持续微调

Wenqing Wang, Da Li, Xiatian Zhu, Josef Kittler

机构 * University of Surrey(萨里大学) Samsung AI Centre Cambridge(三星AI研究中心(剑桥)) Queen Mary University of London(伦敦大学女王学院)

专题命中 指令微调 :language model(title,abstract);pretraining(abstract)

AI总结 MERGETUNE通过持续微调和线性模式连接,恢复视觉-语言模型在微调中丢失的预训练知识,提升基础-新样本泛化和稳健微调性能。

Comments 20 pages, 5 figures

Journal ref ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22554 2026-02-27 cs.LG 81%

Multilingual Safety Alignment Via Sparse Weight Editing

多语言安全对齐 via 稀疏权重编辑

Jiaming Liang, Zhaoxin Wang, Handing Wang

机构 * School of Artificial Intelligence, Xidian University(人工智能学院,西安电子科技大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

AI总结 本文提出基于稀疏权重编辑的多语言安全对齐方法,通过稀疏神经元映射降低低资源语言攻击成功率,同时保持通用推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22452 2026-02-27 cs.AI cs.RO 81%

CWM: Contrastive World Models for Action Feasibility Learning in Embodied Agent Pipelines

CWM: 用于具身智能体流水线中动作可行性学习的对比世界模型

Chayan Banerjee

机构 * School of Electrical Engineering and Robotics, Queensland University of Technology(电气工程与机器人学学院,昆士兰理工大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 CWM通过对比训练提升动作可行性评分,优于SFT方法,提升精度并增强安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16661 2026-02-27 cs.CL cs.AI cs.LG cs.LO 80%

RLSF: Fine-tuning LLMs via Symbolic Feedback

通过符号反馈进行LLM微调:RLSF

Piyush Jha, Prithwish Jana, Pranavkrishna Suresh, Arnav Arora, Vijay Ganesh

机构 * Georgia Institute of Technology, USA(佐治亚理工学院)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RLSF通过符号反馈微调LLM,利用符号推理工具提供精细反馈,提升领域特定任务的性能,使小模型超越大模型。

Journal ref ECAI 2025, Frontiers in Artificial Intelligence and Applications, Vol. 413, pp. 1687-1694, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22293 2026-02-27 cs.LG physics.geo-ph 79%

Global River Forecasting with a Topology-Informed AI Foundation Model

基于拓扑信息的AI基础模型实现全球河流预报

Hancheng Ren, Gang Zhao, Shuo Wang, Louise Slater, Dai Yamazaki, Shu Liu, Jingfang Fan, Shibo Cui, Ziming Yu, Shengyu Kang, Depeng Zuo, Dingzhi Peng, Zongxue Xu, Bo Pang

机构 * College of Water Sciences, Beijing Normal University, Beijing, China(北京师范大学水科学学院) School of Geography and the Environment, University of Oxford, Oxford, UK(牛津大学地理与环境学院) Department of Transdisciplinary Science and Engineering, Institute of Science Tokyo, Tokyo, Japan(东京科学研究所跨学科科学与工程系) School of Systems Science, Beijing Normal University, Beijing, China(北京师范大学系统科学学院) Institute of Industrial Science, University of Tokyo, Tokyo, Japan(东京大学工业科学研究所) China Institute of Water Resources and Hydropower Research, Beijing, China(中国水利水电科学研究院) State Key Laboratory of Hydro-Science and Engineering, Department of Hydraulic Engineering, Tsinghua University, Beijing, China(清华大学水利科学与工程国家重点实验室) School of Artificial Intelligence, Beijing Normal University, Beijing, China(北京师范大学人工智能学院) School of Water Resources and Hydropower Engineering, Wuhan University, Wuhan, China(武汉大学水利水电学院)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 GraphRiverCast通过拓扑信息和物理对齐的神经操作符架构,实现了全球河流系统的系统性水动力模拟,无需历史数据即可进行稳健预测。

Comments 26 pages, 5 figures, 3 extended data tables, 3 extended data figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21306 2026-02-27 cs.CL 77%

PARL: Prompt-based Agents for Reinforcement Learning

PARL:基于提示的强化学习智能体

Yarik Menchaca Resendiz, Roman Klinger

机构 * Fundamentals of Natural Language Processing, University of Bamberg, Germany(自然语言处理基础,巴姆伯格大学,德国)

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 PARL是一种基于提示的强化学习智能体,利用预训练语言模型在无需微调的情况下完成RL任务,适用于简单环境但受限于复杂数学运算任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22539 2026-02-27 cs.AI eess.SP 77%

Agentic AI for Intent-driven Optimization in Cell-free O-RAN

面向无细胞O-RAN意图驱动优化的代理AI

Mohammad Hossein Shokouhi, Vincent W. S. Wong

机构 * Department of Electrical and Computer Engineering, The University of British Columbia(电气与计算机工程系,不列颠哥伦比亚大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种面向无细胞O-RAN的代理AI框架,通过多代理协作实现意图驱动的优化,减少O-RU数量并降低内存使用。

Comments Accepted by IEEE International Conference on Communications (ICC), Glasgow, UK, May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22938 2026-02-27 cs.CV cs.AI cs.LG 76%

pMoE: Prompting Diverse Experts Together Wins More in Visual Adaptation

pMoE:协同提示不同专家以赢得更多视觉适应

Shentong Mo, Xufang Luo, Dongsheng Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Research(微软研究院)

专题命中 指令微调 :prompting(title);分类 cs.AI、cs.LG

AI总结 pMoE通过整合多个领域专家的知识,提升视觉适应任务的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22357 2026-02-27 astro-ph.IM 75%

STILTS-NLI: A Natural Language Interface for STILTS

STILTS-NLI:一种用于STILTS的自然语言接口

R. A. Shaw, S. Fotopoulou, M. Taylor, M. Bremer

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 STILTS-NLI通过微调开源大语言模型,为天文学数据处理提供自然语言接口,降低用户学习门槛并提升使用效率。

Comments Accepted for publication in RASTI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21294 2026-02-27 cs.CL 74%

UPDESH: Synthesizing Grounded Instruction Tuning Data for 13 Indic Languages

UPDESH: 为13种印地语系语言合成基于现实的指令微调数据

Pranjal A. Chitale, Varun Gumma, Sanchit Ahuja, Prashant Kodali, Manan Uppadhyay, Deepthi Sudharsan, Sunayana Sitaram

机构 * Microsoft Corporation(微软公司) Nanyang Technological University(南洋理工大学) Northeastern University(东北大学) Independent Researcher(独立研究者)

专题命中 指令微调 :instruction tuning(title);分类 cs.CL

AI总结 UPDESH通过基于维基百科内容的自下而上方法,生成高质量的多语言指令数据,提升多语言AI系统的文化适应性与性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22817 2026-02-27 cs.LG cs.AI 73%

Hierarchy-of-Groups Policy Optimization for Long-Horizon Agentic Tasks

长周期代理任务的分层组策略优化

Shuo He, Lang Feng, Qi Wei, Xin Cheng, Lei Feng, Bo An

机构 * Nanyang Technological University(南洋理工大学) Southeast University(东南大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 HGPO通过分层组策略优化解决长周期代理任务中分步优势估计的上下文不一致问题,提升策略优化效果。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22963 2026-02-27 cs.AI 70%

FactGuard: Agentic Video Misinformation Detection via Reinforcement Learning

FactGuard:通过强化学习进行代理视频虚假信息检测

Zehao Li, Hongwei Yu, Hao Jiang, Qiang Sheng, Yilong Xu, Baolong Bi, Yang Li, Zhenlong Yuan, Yujun Cai, Zhaoqi Wang

机构 * Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院计算技术研究所) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) University of Science and Technology Beijing(北京科技大学) The University of Queensland, Brisbane, Australia(昆士兰大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FactGuard通过强化学习和代理框架,提升视频虚假信息检测的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22703 2026-02-27 cs.LG 70%

Enhancing Geometric Perception in VLMs via Translator-Guided Reinforcement Learning

通过翻译引导强化学习增强VLMs的几何感知

Hao Yu, Shuning Jia, Guanghao Li, Wenhao Jiang, Chun Yuan

专题命中 指令微调 :language model(abstract);SFT(abstract);分类 cs.LG

AI总结 通过翻译引导强化学习提升VLMs的几何感知能力,实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22072 2026-02-27 cs.CL 70%

Fine-tuning Done Right in Model Editing

在模型编辑中正确进行微调

Wanli Yang, Rui Tang, Hongyu Zang, Du Su, Qi Cao, Jingang Wang, Huawei Shen, Xueqi Cheng, Fei Sun

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS University of Chinese Academy of Sciences(人工智能安全国家重点实验室、计算技术研究所、中国科学院大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出LocFT-BF方法,通过恢复微调的广度优先管道并改进调参策略,在模型编辑中显著提升了效果,实现了大规模编辑任务的高效处理。

Comments Accepted as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22462 2026-02-27 cs.CV cs.IR 69%

MammoWise: Multi-Model Local RAG Pipeline for Mammography Report Generation

MammoWise:多模型本地RAG流水线用于乳腺X线摄影报告生成

Raiyan Jahangir, Nafiz Imtiaz Khan, Amritanand Sudheerkumar, Vladimir Filkov

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 指令微调 :prompting(abstract,comments);language model(abstract)

AI总结 MammoWise是一种本地多模型流水线,通过多任务分类和检索增强生成技术,实现乳腺X线摄影报告的高准确度生成与分类。

Comments arXiv preprint (submitted 25 Feb 2026). Local multi-model pipeline for mammography report generation + classification using prompting, multimodal RAG (ChromaDB), and QLoRA fine-tuning; evaluates MedGemma, LLaVA-Med, Qwen2.5-VL on VinDr-Mammo and DMID; reports BERTScore/ROUGE-L and classification metrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15464 2026-02-27 cs.LG cs.AI stat.ML 62%

Learning to Answer from Correct Demonstrations

从正确示范中学习回答

Nirmit Joshi, Gene Li, Siddharth Bhandari, Shiva Prasad Kasiviswanathan, Cong Ma, Nathan Srebro

机构 * Toyota Technological Institute at Chicago(芝加哥技术学院) Amazon(亚马逊) University of Chicago(芝加哥大学)

专题命中 指令微调 :SFT(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于上下文老虎机的模仿学习方法,通过离线示范学习回答问题,无需显式奖励,样本复杂度与奖励类基数对数成正比,能处理任意自适应示范。

Comments Generalized some results. Updated the presentation in light of an important related work of Syed and Schapire. Improved discussions. Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23339 2026-02-27 cs.CV 50%

Retrieve and Segment: Are a Few Examples Enough to Bridge the Supervision Gap in Open-Vocabulary Segmentation?

检索与分割:在开放词汇分割中,几个示例是否足以弥合监督差距?

Tilemachos Aravanis, Vladan Stojnić, Bill Psomas, Nikos Komodakis, Giorgos Tolias

专题命中 指令微调 :language model(abstract)

AI总结 本文提出了一种基于检索增强的测试时间适配器,通过融合文本和视觉支持特征来实现开放词汇分割,有效缩小了零样本与监督分割间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏