arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-18 至 2026-08-18 共收录 661 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 54 篇

2602.19612 2026-08-18 cs.CL 88%

Anatomy of Unlearning: The Dual Impact of Fact Salience and Model Fine-Tuning

遗忘的解剖:事实显著性与模型微调的双重影响

Anna Borisiuk, Andrey Savchenko, Alexander Panchenko, Elena Tutubalina

机构 * AIRI Sber AI Lab HSE University(HSE大学) Skoltech ISP RAS Research Center for Trusted Artificial Intelligence(ISP RAS可信人工智能研究中心)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究通过构建DUET基准,分析了预训练与监督微调阶段的事实显著性对机器遗忘效果的影响,发现微调后的模型遗忘更平滑且保留率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06087 2026-08-18 cs.CL cs.AI 版本更新 88%

LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents

LatentSkill: 从上下文文本技能到LLM智能体的权重内隐技能

Aofan Yu, Chenyu Zhou, Tianyi Xu, Zihan Guo, Rong Shan, Zhihui Fu, Jun Wang, Weiwen Liu, Yong Yu, Weinan Zhang, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Sun Yat-Sen University(中山大学) Shanghai Innovation Institute(上海创新研究院) OPPO Research Institute(OPPO研究院)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出LatentSkill框架,通过预训练超网络将文本技能转换为即插即用的LoRA适配器,将技能知识存储在权重空间而非上下文空间,从而减少预填充令牌并提升性能。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14563 2026-08-18 cs.LG cs.AI 新提交 87%

Forward Pass Domain Adaptation (Without Cross-Layer Backpropagation)

仅前向传播的领域适配(无需跨层反向传播)

Rivaan Patil, Simon Dennis, Hao Guo, Kevin Shabahang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) University of Melbourne(墨尔本大学)

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出仅前向传播的MLP训练(FPO)方法,无需跨层反向传播即可适配大语言模型,提升吞吐量、降低内存开销,在保持域外基准性能的同时优化域内困惑度,且耗时低于限定SFT的方案。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12147 2026-08-18 cs.CL cs.AI cs.LG 版本更新 87%

Improving Influence-based Instruction Tuning Data Selection for Balanced Learning of Diverse Capabilities

改进基于影响力的指令调优数据选择以实现多样化能力的均衡学习

Qirun Dai, Dylan Zhang, Jiaqi W. Ma, Hao Peng

专题命中 指令微调 :instruction tuning(title);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对基于影响力的指令调优数据选择的任务偏向问题,提出BIDS算法,经实验验证其在小比例数据下可实现更均衡性能且优于现有方法。

Comments Accepted to EMNLP 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14693 2026-08-18 cs.CL cs.AI 新提交 86%

Domain Agnostic Text Redaction from Natural Language Rules using Instruction Tuning

基于指令微调的自然语言规则的领域无关文本脱敏

Aravindhan Arunagiri, Ayaan Khan, Udayaadithya Avadhanam, SaiBarath Sundar

机构 * Mphasis Limited(美费西斯有限公司)

专题命中 指令微调 :instruction tuning(title);LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于指令微调语言模型的领域无关可解释文本脱敏方案,支持用户以自然语言定义敏感信息,可应用于法律、医疗等关键场景的自动文本脱敏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14649 2026-08-18 cs.LG 新提交 85%

Discrete Diffusion Language Models Are Training-Free Multi-Label Classifiers

离散扩散语言模型是无需训练的多标签分类器

Pawan Kumar

机构 * International Institute of Information Technology, Hyderabad(印度海得拉巴国际信息技术学院)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本研究提出无需训练的多标签分类方法dLLM-SetScore,基于离散掩码扩散语言模型,在多个数据集上对比基准模型,验证了其性能优势并完成了相关理论分析。

Comments Accepted to SIAM SDM 2026, 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23982 2026-08-18 cs.MA cs.AI 版本更新 85%

Moral Hazard in Multi-Agent Language Models

多智能体语言模型中的道德风险

Dane Malenfant

专题命中 指令微调 :language model(title);SFT(abstract,abstract_cn);language agent(abstract);分类 cs.AI

AI总结 研究多智能体语言模型中的道德风险,引入对话道德风险游戏,评估七个模型并分解行为,用多种优化机制更新,发现效果异质,强调应报告机制级行为而非仅团队成功。

Comments New frontier baselines, new open weight inference baselines

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16467 2026-08-18 cs.HC cs.CL cs.CY 新提交 84%

Computational KJ-Ho: An Analyst-Bias-Free Insight Extraction Framework from Large-Scale Qualitative Data Using Domain-Specialized LLMs

计算KJ-Ho:利用领域专用大型语言模型从大规模定性数据中提取无分析师偏差见解的框架

Kasumi Ban

专题命中 指令微调 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出计算KJ-Ho框架,结合领域专用LLM实现无分析师偏差的定性数据见解提取,整合三种方法论并作出五项贡献,属概念性研究。

Comments Concept paper. 38 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15594 2026-08-18 cs.AI 新提交 84%

TRACE: Trajectory Aware Reasoning for Multi-Turn Adversarial Conversation Evaluation

TRACE:面向多轮对抗对话评估的轨迹感知推理

Md Messal Monem Miah, Adrita Anika, Zhiyuan Yu, Ruihong Huang

机构 * Texas A&M University(德克萨斯农工大学) Amazon(亚马逊公司)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 针对LLM多轮越狱攻击,提出具备轨迹感知推理的Trace防御方法,训练Llama-3.1-8B-Instruct实现安全与实用平衡,在多轮攻击基准中显著降低攻击成功率并提升合规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26866 2026-08-18 cs.CL cs.LG 版本更新 83%

MoRFI: Monotonic Sparse Autoencoder Feature Identification

MoRFI: 基于单调性的稀疏自编码器特征识别

Dimitris Dimakopoulos, Shay B. Cohen, Ioannis Konstas

机构 * University of Edinburgh, UK(爱丁堡大学) Heriot-Watt University, UK(赫瑞斯泰德大学)

专题命中 指令微调 :language model(abstract,comments);large language model(abstract);post-training(abstract);SFT(abstract)

AI总结 本文通过控制微调实验发现,逐步引入新知识会增加幻觉,提出MoRFI方法利用稀疏自编码器分析残差流激活,识别因果相关的潜在特征。

Comments Accepted to the Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15665 2026-08-18 cs.LG 新提交 83%

SubZero+: Efficient Zeroth-Order LLM Fine-Tuning via Large Learning Rates

SubZero+:基于大学习率的高效零阶大语言模型微调方法

Ziming Yu, Shuyao Xiao, Xingyu Zhao, Sike Wang, Pan Zhou, Peiyu Zang, Xiangda Yan, Yongjie Yang, Jia Li

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SubZero+是改进的SubZero框架,通过三种互补方式提升零阶优化稳定性,在1.3B至32B参数模型的SuperGLUE任务上,优于现有零阶基线,扩大稳定学习率范围,缩小与一阶方法差距且内存开销极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15311 2026-08-18 cs.AI 新提交 83%

MoE Router-Guided Clustering for Heterogeneous Federated Instruction Tuning

面向异构联邦指令微调的MoE路由器引导聚类

Ankita Sharma, Bahar Farahani, Sanaz Rahimi Moosavi, Amir Rrahmani, Farshad Firouzi, Krishnendu Chakrabarty

机构 * California State University, Dominguez Hills(加州州立大学多明戈斯山分校) University of California, Irvine(加州大学欧文分校) Johns Hopkins University(约翰斯·霍普金斯大学) Arizona State University(亚利桑那州立大学)

专题命中 指令微调 :instruction tuning(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出ClientMorpher框架,通过MoE路由特征设计两种聚类策略,在Databricks Dolly-15K数据集上验证其可提升联邦指令微调的个性化性能,且通信成本与传统方法相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02414 2026-08-18 cs.CL cs.LG 版本更新 82%

Misconception Diagnosis From Student-Tutor Dialogue: Generate, Retrieve, Rerank

从学生-辅导对话中诊断误解:生成、检索、重排序

Joshua Mitton, Prarthana Bhattacharyya, Digory Smith, Thomas Christie, Ralph Abboud, Simon Woodhead

机构 * Eedi Renaissance Philanthropy Learning Engineering Virtual Institute(Eedi 理性慈善学习工程虚拟研究所)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出利用大语言模型从学生-辅导对话中检测误解的方法,通过生成、检索和重排序提升误解识别的准确性。

Comments Published as Oral Paper at Learning at Scale, 2026. Link: https://dl.acm.org/doi/10.1145/3774398.3811609. 21 pages, 8 figures, 8 tables. Joshua Mitton and Prarthana Bhattacharyya contributed equally to this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15605 2026-08-18 cs.CV 新提交 82%

AlloEgo-VLM: Disambiguating Allocentric and Egocentric Reference Frames in Vision-Language Models

AlloEgo-VLM:在视觉语言模型中消除 allocentric( allocentric 即 allocentric 参考框架,又称 allocentric 坐标系,指以环境为中心的参考框架)与 egocentric( egocentric 即 egocentric 参考框架,又称自我中心坐标系,指以观察者自身为中心的参考框架)参考框架的歧义

Kuan-Lin Chen, Tzu-Ti Wei, Chao-Chi Liao, Yu-Chee Tseng, Jen-Jee Chen

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Institute of Computer Science and Engineering(工程与计算机科学学院) College of Artificial Intelligence(人工智能学院)

专题命中 指令微调 :language model(title,abstract)

AI总结 针对VLMs理解空间语义时 allocentric 与 egocentric 参考框架的歧义问题,构建数据集AlloEgo-View并开发框架AlloEgo-VLM,经NVIDIA Isaac Sim平台验证其在具身机器人开放式物体搜索任务中的有效性。

Comments 28 pages, 9 figures. Project page and code available at https://github.com/CKL9001/AlloEgo-VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14929 2026-08-18 cs.CL cs.LG 新提交 81%

Training Leaves Traces: Centered Residual Signatures for Language Model Lineage Verification

训练留下痕迹:用于语言模型谱系验证的中心化残差特征

Aman Singh Thakur, Rayan Khoury

机构 * Amazon(亚马逊) Massachusetts Institute of Technology(麻省理工学院)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究提出中心化残差特征方法,通过移除残差训练产生的共享身份对齐组件,对比残差块特有结构得到谱系分数,可高效准确验证开源权重语言模型检查点的谱系

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16284 2026-08-18 cs.CV 新提交 80%

TransAnyText: Translating Arbitrary Text in E-commerce Images via Structured Visual Generation

TransAnyText:通过结构化视觉生成实现电商图像中任意文本的翻译

Xiaoan Liu, Lichen Ma, Zipeng Guo, Yu He, Xiaoyan Su, Shaojie Guo, Hao Yang, Jingling Fu, Xiaolong Fu, Zhen Chen, Yu Guo, Fei Wang, Xinyi Liu, Yongjun Zhang, Ke Zhang, Junshi Huang

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);post-training(abstract)

AI总结 本文提出TransAnyText框架,将电商图像文本翻译转化为生成可渲染HTML补丁,经三阶段后训练优化,在多基准上表现优于对比方法,为跨境电商图像翻译提供有效可控的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15241 2026-08-18 cs.DC 新提交 80%

LOCAL: Enabling Learning On-device Contiguously for Agent LLMs

LOCAL:支持智能体大语言模型在设备上进行连续学习

Xinxin Liu, Jiaxin Li, Zibo Wang, Yun Ji, Zhangqi Zhu, Qing Hu, Zhibin Wang, Rong Gu, Sheng Zhong, Chen Tian

专题命中 指令微调 :LLM(summary_cn,abstract)

AI总结 LOCAL是首个支持LLM智能体设备端连续学习的单GPU运行时,通过协同组件共享状态实现一致性,在7B级模型、24 GB单GPU上显著降低多项性能指标,保障学习与推理的连续性。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13163 2026-08-18 cs.CR cs.CV cs.LG 79%

LoREnc: Low-Rank Encryption for Securing Foundation Models and LoRA Adapters

LoREnc:低秩加密用于保护基础模型和LoRA适配器

Beomjin Ahn, Jungmin Kwon, Chanyong Jung, Jaewook Chung

机构 * Samsung Research(三星研究院) Samsung Electronics(三星电子) Amazon Web Services(亚马逊网络服务) University of Michigan(密歇根大学)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 LoREnc通过谱截断和补偿技术,在不重新训练的情况下保护基础模型和LoRA适配器,防止模型恢复攻击和知识产权泄露,实验表明其在1%计算开销下有效。

Comments Accepted to ICIP 2026

Journal ref 2026 IEEE International Conference on Image Processing (ICIP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12478 2026-08-18 cs.CV cs.LG 版本更新 79%

Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning

数据更少,收敛更快:面向多模态指令微调的目标驱动数据优化

Rujie Wu, Haozhe Zhao, Hai Ci, Yizhou Wang

机构 * Peking University(北京大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) National University of Singapore(新加坡国立大学)

专题命中 指令微调 :instruction tuning(title,abstract);分类 cs.LG

AI总结 本文提出目标驱动数据优化框架GDO,通过优化训练样本实现更快收敛和更高精度,适用于多模态指令微调任务。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16620 2026-08-18 cs.CL cs.AI 新提交 79%

Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning

Palmyra x6技术报告:一种通过锚定监督微调进行后训练的具工具使用能力的智能体模型

Peng Du, Kiran Kamble, Rakshith Vasudev, Zhizhuo Yang, Rohith Nadimpally, Arjun Krishna, Waseem Alshikh, Daniel M. Bikel

机构 * Writer AI Research, Writer, Inc.(Writer AI研究院,Writer公司)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 Palmyra x6是一款针对企业级智能体任务优化的大语言模型,通过锚定监督微调后训练构建,在公开基准测试及偏见安全评估中表现优异。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15984 2026-08-18 cs.CV 新提交 78%

A Plug-and-Play 2D Motion Interface for Real-World Motion Language Models

用于真实世界运动语言模型的即插即用二维运动接口

Kaname Yokoyama, Norimichi Ukita

机构 * Toyota Technological Institute(丰田工业大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 针对MoLMs依赖三维运动输入、真实世界适用性受限的问题,提出即插即用二维运动接口,经实验验证其性能接近三维输入,优于从零训练的二维输入方案,为MoLMs部署提供实用途径。

Comments Accepted to HCMIW at ECCV 2026 (Oral Presentation). Code and demo: https://github.com/irajisamurai/2D-Motion-Interface

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15763 2026-08-18 cs.CL 新提交 77%

TaoLive Digital Avatar Agent Technical Report: Training Agents to Evolve with Their Harness

TaoLive数字虚拟人智能体技术报告:训练智能体随其Harness进化

TaoLive AIGC LLM Team, Yuhan Sun, Wenhao Lin, Yongdong Luo, Yibo Hu, Meiguang Jin, Junfeng Ma, Weihang Pan, Jiaxin Zhao, Zulong Chen

机构 * TaoLive(陶境科技)

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract);分类 cs.CL

AI总结 本研究针对直播电商数字虚拟人主播的实时需求,提出HAT方法,结合HSA的三阶段训练,使35B紧凑模型在低延迟下适配Harness变化,性能优于基础模型及通用大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15351 2026-08-18 cs.LG stat.ME 新提交 74%

Spectral Rank Certification for Foundation Model Adapters

基础模型适配器的谱秩验证

Mohammed Ahnouch, Lotfi Elaachak

机构 * Université Paris 1(巴黎第一大学) Faculty of Science and Technology of Tangier(丹吉尔科学与技术学院) Abdelmalek Essaadi University(阿卜杜勒-马利克·埃萨迪大学)

专题命中 指令微调 :foundation model(title);分类 cs.LG

AI总结 本研究针对基础模型适配器开发有限样本谱秩验证框架,提出PEFT LoRA适配器的经验空工作流程,经26个公开适配器审计发现校准有效秩远小于名义秩,且能量保留与统计惊喜对应不同问题。

Comments 11 pages, 4 figures , KDD 2026 Workshop TensorKDD

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15223 2026-08-18 cs.CL 新提交 74%

TRACE-BN: Transferring Bangla-English Tutoring Behavior to a Sub-1B Offline Language Model

TRACE-BN:将孟加拉语-英语辅导行为迁移至参数量小于10亿的离线语言模型

Khan Raiyan Ibne Reza, Sanjana Aktar Maria, Mohammad Tushar Abdullah, Asfee Bhuiyan Leen, Sumaiya Tabassum Nimi

机构 * North South University(北南大学)

专题命中 指令微调 :language model(title);分类 cs.CL

AI总结 本文提出TRACE-BN数据集,将其辅导行为通过LoRA迁移至Qwen3-0.6B模型,在资源受限离线部署下,相关指标及多维度辅导效果均获显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16333 2026-08-18 cs.CL cs.AI 新提交 73%

Step-Level On-Policy Distillation: Interpolating Between On-Policy Distillation and Supervised Fine-Tuning

步骤级在线策略蒸馏:在线策略蒸馏与监督微调的插值方法

Changhui Sun, Lanbo Liu, Hang Lei, Tong Ling, Jiahang Xie, Zhiyong Zheng, Yujia Wang, Hao Liu, Feng Xiao, Lu Liu, Yanlong Du, Zifeng Cheng, Ziwei Jiang, Qing Gu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学现代软件技术国家重点实验室) XingYun Lab, HUJING Digital Media & Entertainment Group(星云实验室,沪景数字媒体娱乐集团) University of Chinese Academy of Sciences(中国科学院大学) School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究针对令牌级在线策略蒸馏的局限,提出步骤级在线策略蒸馏SOPD,结合监督微调与在线策略蒸馏的优势,在推理和智能体任务上显著优于传统方法,为蒸馏研究提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15381 2026-08-18 cs.AI cs.LG 新提交 73%

FedPA-LoRA: Product-Aligned Framework for Mitigating Aggregation and Initialization Errors in Heterogeneous Federated LoRA

FedPA-LoRA:用于缓解异构联邦LoRA中聚合与初始化误差的产品对齐框架

Juseok Jeon, Ramy E. Ali, Doyun Kwon, Myungbeom Her, Jinhwi Kim, Jinhyun So

机构 * DGIST(大邱庆北科学技术院) Samsung(三星)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 FedPA-LoRA是缓解异构联邦LoRA聚合与初始化误差的产品对齐框架,在多任务实验中较基线方法平均GLUE准确率最高提升6.82个百分点。

Comments 35 pages, 6 figures. Code: https://github.com/Juseok-Jeon/FedPA-LoRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14681 2026-08-18 cs.CL cs.AI 新提交 73%

Automatic or Controlled? Repetition Priming Reveals Divergent Processing in Base LLMs, Instruct LLMs, and Humans

自动还是受控?重复启动揭示基础大语言模型、指令调优大语言模型与人类的加工差异

Jinglei Ren, Yuyue Wang

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 指令微调 :language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 该研究通过重复启动实验对比基础大语言模型、指令调优大语言模型与人类的重复信息加工差异,发现训练后模型加工模式发生质变,且Qwen 2.5家族中该差异随规模增大而增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15041 2026-08-18 cs.AI cs.CL 版本更新 73%

mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA

mR²AG:用于基于知识的视觉问答的多模态检索-反思增强生成

Tao Zhang, Ziqi Zhang, Zongyang Ma, Yuxin Chen, Zhongang Qi, Chunfeng Yuan, Bing Li, Junfu Pu, Yuxuan Zhao, Zehua Xie, Jin Ma, Ying Shan, Weiming Hu

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对多模态大语言模型在基于知识的视觉问答中的缺陷,提出mR²AG框架,通过两种反思操作实现自适应检索与信息定位,在相关基准任务上性能优于现有方法。

Comments Accepted for publication in IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15215 2026-08-18 stat.ML cs.LG 新提交 70%

The Distributional View of Knowledge Distillation

知识蒸馏的分布视角

Gordei Verbii, Juho Lee

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.LG

AI总结 该研究提出知识蒸馏的分布视角,将教师表示为多温度视角族,形式化设计空间并证明相关结果,在Pythia模型实验中得出三条经验规律,发现最佳KD损失取决于上限间隙Γ。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16622 2026-08-18 cs.CV cs.AI 新提交 70%

HarmTrace: Anchor-Calibrated Decoupled Optimization for Fine-Grained Target Identification in Harmful Memes

HarmTrace:用于恶意梗图细粒度目标识别的锚定校准解耦优化方法

Yujia Li, Yiqun Zhang, Zihan Cheng, Yijie Huang, Tenglong Ye, Zihan Wang, Xiaocui Yang, Shi Feng, Yifei Zhang, Daling Wang

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对多模态恶意梗图检测中存在的目标识别错误问题,提出HarmTrace框架,结合实体感知微调与CTPO方法,在Qwen3-VL-8B上JRA提升至52.51%,还构建了Meme3W数据集与JRA指标。

详情

展开后加载摘要…

URL PDF HTML 收藏