arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11601 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11601 篇

2601.06498 2026-04-24 cs.CL astro-ph.IM 83%

Spec-o3: A Tool-Augmented Vision-Language Agent for Rare Celestial Object Candidate Vetting via Automated Spectral Inspection

Spec-o3:一种工具增强的视觉-语言代理,用于通过自动化光谱检查验证稀有天体候选体

Minghui Jia, Qichao Zhang, Ali Luo, Linjing Li, Shuo Ye, Hailing Lu, Wen Hou, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, CAS(SKL-MAIS,自动化研究所,中国科学院) School of Advanced Interdisciplinary Sciences, UCAS(交叉科学学院,中国科学院大学) National Astronomical Observatories, CAS(国家天文台,中国科学院) School of Artificial Intelligence, UCAS(人工智能学院,中国科学院大学)

专题命中 指令微调 :language agent(title,abstract);post-training(abstract);分类 cs.CL

AI总结 本文提出Spec-o3,一种工具增强的视觉-语言代理,通过多模态链式推理实现天文学家对稀有天体候选体的自动化光谱检查,提升验证效率和准确性。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20279 2026-04-22 cs.CV cs.CL 83%

VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction

VLM-3R:融合指令对齐3D重建的视觉-语言模型

Zhiwen Fan, Jian Zhang, Renjie Li, Junge Zhang, Runjin Chen, Hezhen Hu, Kevin Wang, Huaizhi Qu, Shijie Zhou, Dilin Wang, Zhicheng Yan, Hongyu Xu, Justin Theiss, Tianlong Chen, Jiachen Li, Zhengzhong Tu, Zhangyang Wang, Rakesh Ranjan

机构 * UT Austin(德克萨斯大学奥斯汀分校) XMU(厦门大学) TAMU(德克萨斯大学阿灵顿分校) UCR(加州大学河滨分校) UNC(北卡罗来纳大学教堂山分校) Meta UCLA(加州大学洛杉矶分校)

专题命中 指令微调 :language model(title,abstract);instruction tuning(abstract);分类 cs.CL

AI总结 本文提出VLM-3R,通过融合3D重建指令微调,实现单目视频的3D空间辅助与具身推理,提升了视觉-空间推理和时间3D上下文理解的准确性和可扩展性。

Comments Project Page: https://vlm-3r.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18404 2026-04-21 cs.AI 83%

Six Llamas: Comparative Religious Ethics Through LoRA-Adapted Language Models

六头 llama:通过 LoRA 调整的语言模型进行比较宗教伦理研究

Chad Coleman, W. Russell Neuman, Manan Shah, Ali Dasdan, Matthew Crispi, Morris Chiang, Zack Leitman, Mustafa Poonawala

机构 * Meta

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文通过 LoRA 调整的语言模型比较不同宗教文本对伦理推理的影响,发现调整模型在伦理推理上与基础模型有系统性差异,并在不同温度设置下表现出稳定性与多样性。

Comments 51 pages, 14 figures. We present Six Llamas, a comparative study examining whether Llama-3.1-8B models fine-tuned on distinct religious corpora encode systematically different patterns of ethical reasoning. Five LoRA-adapted variants are constructed for Christianity, Islam, Judaism, Hinduism, and Buddhism. For theoretical background on the condensate comparative method, see arXiv:2603.07329

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20867 2026-04-21 cs.SD cs.AI eess.AS 83%

Generalizable Prompt Tuning for Audio-Language Models via Semantic Expansion

通过语义扩展实现音频-语言模型的通用提示微调

Jaehyuk Jang, Wonjun Lee, Kangwook Ko, Changick Kim

机构 * KAIST(韩国科学技术院)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文提出SEPT框架,通过引入语义扩展损失提升音频-语言模型提示微调的泛化能力,增强嵌入空间语义结构,改进基到新泛化和跨数据集迁移。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14877 2026-04-17 cs.LG 83%

Does RL Expand the Capability Boundary of LLM Agents? A PASS@(k,T) Analysis

强化学习是否扩展大语言模型代理的能力边界?一种PASS@(k,T)分析

Zhiyuan Zhai, Wenjing Yan, Xiaodan Shao, Xin Wang

机构 * Fudan University(复旦大学) Chinese University of Hong Kong(香港中文大学) University of Waterloo(滑铁卢大学)

专题命中 指令微调 :LLM(title,abstract);分类 cs.LG

AI总结 本文通过PASS@(k,T)指标分析强化学习在代理工具使用中的能力扩展,发现其在复杂任务中确实扩大了能力边界,而静态推理中则趋于收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13268 2026-04-16 cs.CV cs.CL cs.IR 83%

Indexing Multimodal Language Models for Large-scale Image Retrieval

多模态大语言模型的索引用于大规模图像检索

Bahey Tharwat, Giorgos Kordopatis-Zilos, Pavel Suma, Ian Reid, Giorgos Tolias

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) VRG, FEE, Czech Technical University in Prague(布拉格捷克技术大学VRG学院)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文探讨了多模态大语言模型作为无训练相似性估计器在实例级图像到图像检索中的应用,通过提示配对图像并转换下一个词的概率为相似性分数,实现了零样本重排序,展示了其在大规模检索中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09625 2026-04-14 cs.CL 83%

Toward Generalized Cross-Lingual Hateful Language Detection with Web-Scale Data and Ensemble LLM Annotations

迈向基于网络级数据和集成大语言模型标注的通用多语言仇恨语言检测

Dang H. Dang, Jelena Mitrovi, Michael Granitzer

专题命中 指令微调 :LLM(title,abstract);language model(abstract);分类 cs.CL

AI总结 本文研究大规模未标注网络数据与基于大语言模型的合成标注对多语言仇恨语检测的提升作用,通过继续预训练BERT模型和集成LLM标注策略,展示了在低资源环境下显著的性能提升。

Comments 8 Pages, 3 tables, LREC 2026 papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08915 2026-04-13 cs.CV cs.AI 83%

Large-Scale Universal Defect Generation: Foundation Models and Datasets

大规模通用缺陷生成:基础模型与数据集

Yuanting Fan, Jun Liu, Bin-Bin Gao, Xiaochen Chen, Yuhuan Lin, Zhewei Dai, Jiawei Zhan, Chengjie Wang

机构 * Tencent Youtu Lab, Shenzhen, China(腾讯优图实验室,深圳,中国)

专题命中 指令微调 :foundation model(title,abstract);SFT(abstract);分类 cs.AI

AI总结 本文提出UniDG模型和UDG数据集,通过参考基和文本指令生成缺陷,提升缺陷生成的多样性和真实性,实验表明其在异常检测和定位任务中表现优异。

Comments 25 pages, 13 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03322 2026-04-07 cs.CV cs.AI cs.RO 83%

VitaTouch: Property-Aware Vision-Tactile-Language Model for Robotic Quality Inspection in Manufacturing

VitaTouch:面向制造领域机器人质量检测的属性感知视觉-触觉-语言模型

Junyi Zong, Qingxuan Jia, Meixian Shi, Tong Li, Jiayuan Li, Zihang Lv, Gang Chen, Fang Deng

机构 * School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(北京邮电大学智能工程与自动化学院) Zhongguancun Academy(中关村学院) School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) School of AI, Beijing Institute of Technology(北京理工大学人工智能学院) Beijing Key Laboratory of Lightweight Intelligent System, Beijing Institute of Technology(北京理工大学北京市轻量化智能系统重点实验室)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 VitaTouch通过融合视觉、触觉与语言信息,提升机器人在制造中对材料属性的识别能力,实现了高精度的质量检测与自然语言描述。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28733 2026-04-07 cs.LG 83%

See it to Place it: Evolving Macro Placements with Vision-Language Models

看清它,放置它:利用视觉-语言模型进行宏放置

Ikechukwu Uchendu, Swati Goel, Karly Hou, Ebrahim Songhori, Kuang-Huei Lee, Joe Wenjie Jiang, Vijay Janapa Reddi, Vincent Zhuang

机构 * Harvard University(哈佛大学) Kempner Institute for the Study of Natural and Artificial Intelligence(肯普纳自然与人工智能研究所) Google DeepMind(谷歌DeepMind)

专题命中 指令微调 :language model(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 本文提出利用视觉-语言模型进行芯片布局中的宏放置优化,通过进化搜索策略提升放置质量,在9/10基准上优于现有方法,且能泛化至分析型布局器。

Comments 31 pages, 12 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29206 2026-04-01 cs.AI 83%

Route-Induced Density and Stability (RIDE): Controlled Intervention and Mechanism Analysis of Routing-Style Meta Prompts on LLM Internal States

路由诱导密度与稳定性(RIDE):路由式元提示对大语言模型内部状态的受控干预与机制分析

Dianxing Zhang, Gang Li, Sheng Li

机构 * Digital China AI Research Institute(神州数码人工智能研究院)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过注入路由式元提示测试路由到任务专家是否激活更稀疏的内部计算,发现早期/中期层表示密度增加而非稀疏化,且不同模型对关键词注意力的响应各异,最终揭示密度与稳定性之间的弱关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15695 2026-04-01 cs.CV cs.LG 83%

ORIC: Benchmarking Object Recognition under Contextual Incongruity in Large Vision-Language Models

ORIC:在大视觉-语言模型中基于情境不一致性的物体识别基准测试

Zhaoyang Li, Zhan Ling, Yuchen Zhou, Litian Gong, Erdem Bıyık, Hao Su

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校) University of California, Riverside(加利福尼亚大学河滨分校) University of Southern California(南加利福尼亚大学)

专题命中 指令微调 :language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 研究探讨了大视觉-语言模型在非典型场景中识别物体的困难,提出ORIC框架通过两种策略生成不一致的物体-情境对,并验证了情境不一致是不确定性的重要来源。

Comments We request withdrawal of this paper because one of the listed institutional affiliations was included without proper authorization. This issue cannot be resolved through a simple revision, and we therefore request withdrawal to prevent dissemination of incorrect or unauthorized affiliation information

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00638 2026-03-24 cs.IR cs.LG 83%

RAIE: Region-Aware Incremental Preference Editing with LoRA for LLM-based Recommendation

RAIE: 基于LoRA的区域感知增量偏好编辑用于基于LLM的推荐系统

Jin Zeng, Yupeng Qi, Hui Li, Chengming Li, Ziyu Lyu, Lixin Cui, Lu Bai

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区计算机科学与技术学院) Department of Computer Science and Technology, Xiamen University(厦门大学计算机科学与技术系) Artificial Intelligence Research Institute, Shenzhen MSU-BIT University(深圳MSU-BIT大学人工智能研究院) School of Information, Central University of Finance and Economics(中央财经大学信息学院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出RAIE框架,通过区域级更新解决推荐系统中偏好漂移问题,采用LoRA模块实现动态修正,实验表明其在动态推荐场景中具有高准确性和可扩展性。

Comments Published on WWW'26: In Proceedings of the ACM Web Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19011 2026-03-20 cs.CR cs.AI 83%

Security awareness in LLM agents: the NDAI zone case

LLM代理中的安全意识:NDAI区域案例

Enrico Bottazzi, Pia Park

机构 * Leku

专题命中 指令微调 :LLM(title,abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨LLM代理在安全环境识别中的能力差异,发现失败的证明会抑制披露,而成功的证明导致不同模型反应不一,揭示LLM在检测危险信号方面可靠但无法验证安全,需进一步改进以支持隐私保护代理协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18656 2026-03-20 cs.AI 83%

Balanced Thinking: Improving Chain of Thought Training in Vision Language Models

平衡思考:改进视觉语言模型中的推理链训练

Shaked Perek, Ben Wiesel, Avihu Dekel, Nimrod Shabtay, Eli Schwartz

机构 * IBM Research(IBM研究院)

专题命中 指令微调 :language model(title,abstract);SFT(abstract);分类 cs.AI

AI总结 本文提出SCALe方法,通过动态权重平衡推理和答案段,提升视觉语言模型的推理效率和准确性,且训练时间仅为传统方法的七分之一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17558 2026-03-20 cs.CL cs.SD 83%

Zipper-LoRA: Dynamic Parameter Decoupling for Speech-LLM based Multilingual Speech Recognition

Zipper-LoRA: 语音-大语言模型基于多语言语音识别的动态参数解耦

Yuxiang Mei, Delai Qiu, Shengping Liu, Jiaen Liang, Yanhua Long

机构 * Shanghai Engineering Research Center of Intelligent Education and Bigdata, Shanghai Normal University(智能教育与大数据上海工程研究中心,上海师范大学) SHNU-Unisound Natural Human-Computer Interaction Lab, Shanghai Normal University(上海师范大学Unisound自然人机交互实验室) Unisound AI Technology Co., Ltd.(Unisound人工智能技术有限公司)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Zipper-LoRA框架,通过动态解耦共享与语言特定子空间,解决多语言语音识别中参数高效微调的稳定性与可塑性矛盾,实验表明其在低资源场景下性能优越。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18507 2026-03-20 cs.AI 83%

Expert Personas Improve LLM Alignment but Damage Accuracy: Bootstrapping Intent-Based Persona Routing with PRISM

专家人设提升LLM对齐但损害准确性:基于PRISM的意图驱动人设路由 Bootstrapping

Zizhao Hu, Mohammad Rostami, Jesse Thomason

机构 * University of Southern California(南加州大学)

专题命中 指令微调 :LLM(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文研究了专家人设在不同任务类型和提示长度下的有效性,提出PRISM框架通过自蒸馏实现意图条件的人设路由,提升生成任务的人类偏好对齐,同时保持判别任务的准确性,且计算开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25093 2026-03-19 cs.LG cs.IR 83%

Continual Low-Rank Adapters for LLM-based Generative Recommender Systems

连续低秩适配器用于基于LLM的生成推荐系统

Hyunsik Yoo, Ting-Wei Li, SeongKu Kang, Zhining Liu, Charlie Xu, Qilin Qi, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Korea University(韩国大学) Amazon(亚马逊)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出PESO方法,通过引入近端正则化器,在推荐系统中实现连续学习,平衡适应与保留,提升对近期用户行为的捕捉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12248 2026-03-17 cs.LG 83%

Matching Features, Not Tokens: Energy-Based Fine-Tuning of Language Models

匹配特征而非标记:基于能量的语言模型微调

Samy Jelassi, Mujin Kwun, Rosie Zhao, Yuanzhi Li, Nicolo Fusi, Yilun Du, Sham M. Kakade, Carles Domingo-Enrich

机构 * Harvard University, Kempner Institute(哈佛大学凯普纳研究所) Microsoft Research New England(微软研究院新英格兰分部)

专题命中 指令微调 :language model(title,abstract);SFT(abstract);分类 cs.LG

AI总结 本文提出基于能量的语言模型微调方法,通过匹配序列级统计信息提升模型表现,无需任务特定验证器或偏好模型,在多个任务中优于传统微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13587 2026-03-17 cs.AI cs.CV 83%

Breaking the SFT Plateau: Multimodal Structured Reinforcement Learning for Chart-to-Code Generation

突破SFT平台:面向图表到代码生成的多模态结构强化学习

Lei Chen, Xuanle Zhao, Zhixiong Zeng, Jing Huang, Liming Zheng, Yufeng Zhong, Lin Ma

专题命中 指令微调 :SFT(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文提出多模态结构强化学习(MSRL)以突破SFT平台,通过大规模实验构建最大训练语料库,并采用双阶段课程训练策略,提升图表到代码生成的高阶指标。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16931 2026-03-17 cs.AI 83%

Narrow Fine-Tuning Erodes Safety Alignment in Vision-Language Agents

细粒度微调会削弱视觉语言代理的安全对齐

Idhant Gulati, Shivam Raval

专题命中 指令微调 :language agent(title);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 研究发现细粒度微调在有害数据集上会导致广泛的任务和模态对齐偏差,且单模态安全基准可能低估视觉语言模型的对齐退化。

Comments 25 pages, 14 figures, Published at the Lifelong Agent Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13647 2026-03-17 cs.CL 83%

Instruction Tuning on Public Government and Cultural Data for Low-Resource Language: a Case Study in Kazakh

在公共政府和文化数据上进行指令微调以处理低资源语言:哈萨克语案例研究

Nurkhan Laiyk, Daniil Orel, Rituraj Joshi, Maiya Goloburda, Yuxia Wang, Preslav Nakov, Fajri Koto

专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文通过构建大规模哈萨克语指令遵循数据集,提升低资源语言中政府与文化领域LLM的理解能力,并验证了基于LLM的指令微调方法在多选和生成任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09065 2026-03-17 cs.LG 83%

Learning Adaptive LLM Decoding

学习自适应的大语言模型解码

Chloe H. Su, Zhe Ye, Samuel Tenka, Aidan Yang, Soonho Kong, Udaya Ghai

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出学习自适应解码策略,通过强化学习和可验证终端奖励提升解码准确性与预算平衡,实验表明在数学和编程竞赛基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09154 2026-03-11 cs.CL 83%

Bioalignment: Measuring and Improving LLM Disposition Toward Biological Systems for AI Safety

Bioalignment: 评估和改进LLM对生物系统的倾向以提高AI安全性

Trent R Northen, Mingxun Wang

机构 * Bioaligned Labs(Bioaligned实验室) Lawrence Berkeley National Lab(伯克利国家实验室) Computer Science & Engineering Dept, UC Riverside(加州大学河滨分校计算机科学与工程系)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过微调改进LLM对生物解决方案的偏好,表明少量微调可提升模型对生物与合成方法的权衡能力。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06656 2026-03-11 cs.CV cs.AI 83%

GameVerse: Can Vision-Language Models Learn from Video-based Reflection?

GameVerse: 视觉-语言模型能否通过视频反思学习?

Kuan Zhang, Dongchen Liu, Qiyue Zhao, Jinkun Hou, Xinran Zhang, Qinlei Xie, Miao Liu, Yiming Li

专题命中 指令微调 :language model(title,abstract);SFT(abstract);分类 cs.AI

AI总结 GameVerse通过反思-重试范式评估视觉-语言模型在视频反思中的学习能力,结合失败轨迹和专家教程提升模型性能。

Comments https://gameverse-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12988 2026-03-03 cs.AR cs.AI 83%

ROMA: a Read-Only-Memory-based Accelerator for QLoRA-based On-Device LLM

ROMA: 一种基于只读存储器的QLoRA加速器

Wenqiang Wang, Yijia Zhang, Zikai Zhang, Guanting Huo, Hao Liang, Shijie Cao, Ningyi Xu

机构 * Shanghai Jiao Tong University(上海交通大学) Huixi Intelligence(汇溪智能) Peking University(北京大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ROMA是一种基于只读存储器的QLoRA加速器,通过混合存储架构和B-ROM设计,实现高效存储和加速LLM在边缘设备上的部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23701 2026-03-02 cs.AI cs.SE 83%

From Flat Logs to Causal Graphs: Hierarchical Failure Attribution for LLM-based Multi-Agent Systems

从平面日志到因果图:面向基于大语言模型的多智能体系统的分层故障归因

Yawen Wang, Wenjie Wu, Junjie Wang, Qing Wang

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) State Key Laboratory of Complex System Modeling and Simulation Technology(复杂系统建模与仿真技术国家重点实验室) Science & Technology on Integrated Information System Laboratory(信息系统集成技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Wuhan University of Technology(武汉理工大学)

专题命中 指令微调 :LLM(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出CHIEF框架,通过分层因果图和反事实归因方法,提升基于大语言模型的多智能体系统故障归因的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20676 2026-02-25 cs.IR cs.AI 83%

PRECTR-V2:Unified Relevance-CTR Framework with Cross-User Preference Mining, Exposure Bias Correction, and LLM-Distilled Encoder Optimization

PRECTR-V2:一种结合跨用户偏好挖掘、曝光偏差校正和LLM蒸馏编码器优化的统一相关性-CTR框架

Shuzhi Cao, Rong Chen, Ailong He, Shuguang Han, Jufeng Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 指令微调 :LLM(title,abstract);SFT(abstract);分类 cs.AI

AI总结 PRECTR-V2通过跨用户偏好挖掘、曝光偏差校正和LLM蒸馏编码器优化,解决搜索系统中相关性匹配与CTR预测的一致性问题。

Comments arXiv admin note: text overlap with arXiv:2503.18395

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15050 2026-02-23 cs.CL 83%

Entailed Opinion Matters: Improving the Fact-Checking Performance of Language Models by Relying on their Entailment Ability

蕴含观点重要性:通过依赖生成语言模型的蕴含能力提升事实核查性能

Gaurav Kumar, Ayush Garg, Debajyoti Mazumder, Aditya Kishore, Babu kumar, Jasabanta Patro

机构 * Department of Data Science and Engineering(数据科学与工程系) Indian Institute of Science Education and Research(印度科学教育与研究学院)

专题命中 指令微调 :language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出通过生成语言模型的蕴含能力提升事实核查性能,通过证据分类和蕴含论证训练仅编码器的语言模型,以提高事实核查的准确性。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13942 2026-02-17 stat.ML cs.LG 83%

A Theoretical Framework for LLM Fine-tuning Using Early Stopping for Non-random Initialization

基于早停机制的LLM微调理论框架

Zexuan Sun, Garvesh Raskutti

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于早停机制的LLM微调理论框架,结合NTK理论与非随机初始化,揭示微调收敛率与特征值衰减的关系,并通过实验验证理论成果。

详情

展开后加载摘要…

URL PDF HTML 收藏