arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-18 至 2026-08-18 共收录 52 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 52 篇

2608.15949 2026-08-18 cs.IR cs.AI cs.CL cs.LG 新提交 94%

Ask to Be Sure: Informative Interactions for Confident Multi-Turn LLM Recommendation

为确认而提问:用于自信多轮大语言模型推荐的信息交互

Cedar Site Bai, Duanshun Li, Zhenyu Liao, Sheikh Sarwar, Huiyuan Chen, Yuan Chen, Changhe Yuan, Haiyang Zhang, Qilin Qi

专题命中 指令微调 :LLM(title,summary_cn);SFT(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对多轮LLM推荐中有效挖掘用户偏好的挑战,提出以推荐熵降为奖励的方法微调LLM,结合SFT与DPO在INSPIRED、ReDial数据集上提升了推荐质量与对话效率。

Comments CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15983 2026-08-18 cs.SE cs.AI cs.LG math.OC 版本更新 93%

ReLoop: Structured Modeling and Behavioral Verification for Reliable LLM-Based Optimization

ReLoop:结构建模与行为验证用于可靠的基于LLM的优化

Junbo Jacob Lian, Yujun Sun, Huiling Chen, Chaoyu Zhang, Hanzhang Qin, Chung-Piaw Teo

机构 * McCormick School of Engineering, Northwestern University(西北大学工程学院) Wenzhou Buyi Pharmacy Chain Co., Ltd.(温州-buyi药链有限公司) College of Computer Science and Artificial Intelligence, Wenzhou University(温州大学计算机科学与人工智能学院) Department of Decision Analytics and Operations, City University of Hong Kong(香港城市大学决策分析与运营部门) Institute of Operations Research and Analytics, National University of Singapore(新加坡国立大学运筹学与分析研究所)

专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 ReLoop通过结构生成和行为验证机制,解决LLM生成优化代码的可行性与正确性差距问题,提升代码执行准确性和鲁棒性。

Comments Code and benchmark: this https URL (https://github.com/junbolian/ReLoop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06628 2026-08-18 cs.AI 版本更新 92%

Rethinking Generalization in Reasoning SFT: A Conditional Analysis on Optimization, Data, and Model Capability

重新思考推理SFT中的泛化:对优化、数据和模型能力的条件分析

Qihan Ren, Peng Wang, Ruikun Cai, Shuai Shao, Dadi Guo, Yuejin Xie, Yafu Li, Quanshi Zhang, Xia Hu, Jing Shao, Dongrui Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :SFT(title,title_cn);LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 本文研究推理SFT的泛化问题,发现泛化受优化动态、训练数据和模型能力共同影响,指出短训练检查点可能低估泛化能力,数据质量和结构及模型能力均影响泛化效果,且推理提升与安全下降存在不对称性。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16156 2026-08-18 cs.AI 新提交 90%

TRCA: Transition-wise Rubric Credit Assignment for Long-horizon LLM Agents

TRCA:面向长 horizon 大语言模型智能体的逐步规则信用分配

Huan Zhang, Mingju Chen, Dongxu Zhou, Can Lv, Heng Chang, Sen Cui, Faguo Wu, Shiji Zhou

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对长 horizon LLM 智能体稀疏最终结果优化导致的细粒度信用分配难题,提出无需学习评估器或成功锚点的 TRCA,在多基准上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09020 2026-08-18 cs.SE cs.AI 版本更新 90%

Enhancing the Non-Functional Quality Compliance of LLM-Generated Code through Quality-Aware Preference Learning

通过质量感知偏好学习增强大语言模型生成代码的非功能质量合规性

Liang Lu, Yuan Jiang, Christoph Treude, Shuzheng Gao, Jingyu Xiao, Xiaohong Su, Michael R. Lyu

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLM生成代码存在的非功能质量合规性问题,提出质量感知偏好学习框架,通过三阶段方法提升代码合规性,在保持功能正确的同时实现显著性能提升,具备良好实用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15360 2026-08-18 cs.LG cs.AI 新提交 90%

SAPE: Sandwich Adapters for Parameter Efficiency in Large Language Model Fine-Tuning

SAPE:用于大语言模型微调参数效率的三明治适配器

Mohammad Aref Jafari-Raddani, Morteza Mohajjel Kafshdooz

机构 * Qom University of Technology(库姆理工大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 SAPE是一种基于三明治式硬权重共享拓扑的PEFT框架,通过隔离边界变换降低内存与计算开销,在低参数约束下,于RoBERTa-large、LLaMA-3.2等模型的多项任务中取得优于现有方法的性能。

Comments 16 pages, 4 figures, 10 tables, includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06286 2026-08-18 cs.CL cs.AI 版本更新 90%

Bactrainus: Optimizing Large Language Models for Multi-hop Complex Question Answering Tasks

Bactrainus:为多跳复杂问答任务优化大型语言模型

Iman Barati, Arash Ghafouri, Behrouz Minaei-Bidgoli

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对多跳问答的证据瓶颈,提出模块化选择器-阅读器框架Bactrainus,经实验验证其在HotpotQA任务中表现优异,为该领域提供了可审计的证据接口方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15507 2026-08-18 cs.CL cs.LG 新提交 89%

Do Language Models Consistently Encode the Current Year?

语言模型是否一致地编码了当前年份?

Suze van Adrichem, Aditi Bhaskar, Diyi Yang, Christopher Potts, Jing Huang

机构 * Stanford University(斯坦福大学)

专题命中 指令微调 :language model(title,abstract);SFT(abstract,abstract_cn);post-training(abstract);prompting(abstract)

AI总结 该研究探究语言模型对当前年份的编码一致性,设计两项不同任务,发现关联与声明年份的编码机制不同,现有修改方法无法同时调整两者,表明当前年份未被一致编码。

Comments Accepted at the Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15516 2026-08-18 cs.LG 新提交 89%

UniFed-VLM: Federated Instruction Tuning for Vision-Language Models with Multiple Heterogeneity

UniFed-VLM:面向多异质性视觉语言模型的联邦指令调优

Pengyu Wang, Baochen Xiong, Xiaoshan Yang, Yifan Xu, Zhang Qimeng, Haifeng Chen, Changsheng Xu

专题命中 指令微调 :language model(title,abstract);instruction tuning(title,abstract);分类 cs.LG

AI总结 UniFed-VLM是解决任务、模态、模型架构联合异质性的VLM联邦指令调优框架,含FedCSA与TCoD组件,在多基准数据集上优于现有FL方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22067 2026-08-18 cs.CL cs.AI 版本更新 89%

Multimodal Language Models Benchmarked Against the NRC Reactor Operator Licensing Examination: Fine-Tuning and Retrieval Strategies

基于美国核管理委员会反应堆操作员执照考试的多模态语言模型微调与检索策略基准测试

Isak Hwang, Yoon Pyo Lee, Syed Bahauddin Alam

机构 * organization= Department of Nuclear Engineering, Hanyang University , addressline= 222 Wangsimni-ro , postcode= 04763 , state= Seongdong-gu , city= Seoul , country= South Korea organization= The Grainger College of Engineering, Nuclear, Plasma \& Radiological Engineering, University of Illinois Urbana-Champaign , city= Urbana , state= IL , country= USA

专题命中 指令微调 :SFT(summary_cn,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对美国核管理委员会反应堆操作员执照考试,评估310亿参数多模态模型应用核知识的能力,通过对比基础模型与多种微调及检索配置,发现固定大小分块RAG的SFT配置表现最佳,并揭示了分块策略规律及RAFT与SFT的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17397 2026-08-18 quant-ph cs.AI cs.LG 版本更新 88%

Quantum Large Language Models via Tensor Network Disentanglers

基于张量网络解纠缠器的量子大语言模型

Borja Aizpurua, Fernando Loren, Saeed S. Jahromi, Sukhbinder Singh, Roman Orus

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出将量子计算与预训练大语言模型融合的框架,用张量网络解纠缠器压缩模型参数,经量子处理器验证可提升性能,为量子增强语言模型提供实用方案。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14631 2026-08-18 cs.AI 新提交 88%

Accuracy and Reliability of Large Language Models in Cosmetic Chemistry and Skin Health: A Benchmarking Study

大型语言模型在化妆品化学与皮肤健康领域的准确性与可靠性:一项基准测试研究

Amelia Liu

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究测试14个LLMs在化妆品化学与皮肤健康领域的表现,发现其总体准确性差、技术深度不足,无法可靠提供相关信息,需微调验证数据集并改进算法推理。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06087 2026-08-18 cs.CL cs.AI 版本更新 88%

LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents

LatentSkill: 从上下文文本技能到LLM智能体的权重内隐技能

Aofan Yu, Chenyu Zhou, Tianyi Xu, Zihan Guo, Rong Shan, Zhihui Fu, Jun Wang, Weiwen Liu, Yong Yu, Weinan Zhang, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Sun Yat-Sen University(中山大学) Shanghai Innovation Institute(上海创新研究院) OPPO Research Institute(OPPO研究院)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出LatentSkill框架,通过预训练超网络将文本技能转换为即插即用的LoRA适配器,将技能知识存储在权重空间而非上下文空间,从而减少预填充令牌并提升性能。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14563 2026-08-18 cs.LG cs.AI 新提交 87%

Forward Pass Domain Adaptation (Without Cross-Layer Backpropagation)

仅前向传播的领域适配(无需跨层反向传播)

Rivaan Patil, Simon Dennis, Hao Guo, Kevin Shabahang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) University of Melbourne(墨尔本大学)

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出仅前向传播的MLP训练(FPO)方法,无需跨层反向传播即可适配大语言模型,提升吞吐量、降低内存开销,在保持域外基准性能的同时优化域内困惑度,且耗时低于限定SFT的方案。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12147 2026-08-18 cs.CL cs.AI cs.LG 版本更新 87%

Improving Influence-based Instruction Tuning Data Selection for Balanced Learning of Diverse Capabilities

改进基于影响力的指令调优数据选择以实现多样化能力的均衡学习

Qirun Dai, Dylan Zhang, Jiaqi W. Ma, Hao Peng

专题命中 指令微调 :instruction tuning(title);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对基于影响力的指令调优数据选择的任务偏向问题,提出BIDS算法,经实验验证其在小比例数据下可实现更均衡性能且优于现有方法。

Comments Accepted to EMNLP 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14693 2026-08-18 cs.CL cs.AI 新提交 86%

Domain Agnostic Text Redaction from Natural Language Rules using Instruction Tuning

基于指令微调的自然语言规则的领域无关文本脱敏

Aravindhan Arunagiri, Ayaan Khan, Udayaadithya Avadhanam, SaiBarath Sundar

机构 * Mphasis Limited(美费西斯有限公司)

专题命中 指令微调 :instruction tuning(title);LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于指令微调语言模型的领域无关可解释文本脱敏方案,支持用户以自然语言定义敏感信息,可应用于法律、医疗等关键场景的自动文本脱敏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14649 2026-08-18 cs.LG 新提交 85%

Discrete Diffusion Language Models Are Training-Free Multi-Label Classifiers

离散扩散语言模型是无需训练的多标签分类器

Pawan Kumar

机构 * International Institute of Information Technology, Hyderabad(印度海得拉巴国际信息技术学院)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本研究提出无需训练的多标签分类方法dLLM-SetScore,基于离散掩码扩散语言模型,在多个数据集上对比基准模型,验证了其性能优势并完成了相关理论分析。

Comments Accepted to SIAM SDM 2026, 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23982 2026-08-18 cs.MA cs.AI 版本更新 85%

Moral Hazard in Multi-Agent Language Models

多智能体语言模型中的道德风险

Dane Malenfant

专题命中 指令微调 :language model(title);SFT(abstract,abstract_cn);language agent(abstract);分类 cs.AI

AI总结 研究多智能体语言模型中的道德风险,引入对话道德风险游戏,评估七个模型并分解行为,用多种优化机制更新,发现效果异质,强调应报告机制级行为而非仅团队成功。

Comments New frontier baselines, new open weight inference baselines

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16467 2026-08-18 cs.HC cs.CL cs.CY 新提交 84%

Computational KJ-Ho: An Analyst-Bias-Free Insight Extraction Framework from Large-Scale Qualitative Data Using Domain-Specialized LLMs

计算KJ-Ho:利用领域专用大型语言模型从大规模定性数据中提取无分析师偏差见解的框架

Kasumi Ban

专题命中 指令微调 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出计算KJ-Ho框架,结合领域专用LLM实现无分析师偏差的定性数据见解提取,整合三种方法论并作出五项贡献,属概念性研究。

Comments Concept paper. 38 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15594 2026-08-18 cs.AI 新提交 84%

TRACE: Trajectory Aware Reasoning for Multi-Turn Adversarial Conversation Evaluation

TRACE:面向多轮对抗对话评估的轨迹感知推理

Md Messal Monem Miah, Adrita Anika, Zhiyuan Yu, Ruihong Huang

机构 * Texas A&M University(德克萨斯农工大学) Amazon(亚马逊公司)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 针对LLM多轮越狱攻击,提出具备轨迹感知推理的Trace防御方法,训练Llama-3.1-8B-Instruct实现安全与实用平衡,在多轮攻击基准中显著降低攻击成功率并提升合规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26866 2026-08-18 cs.CL cs.LG 版本更新 83%

MoRFI: Monotonic Sparse Autoencoder Feature Identification

MoRFI: 基于单调性的稀疏自编码器特征识别

Dimitris Dimakopoulos, Shay B. Cohen, Ioannis Konstas

机构 * University of Edinburgh, UK(爱丁堡大学) Heriot-Watt University, UK(赫瑞斯泰德大学)

专题命中 指令微调 :language model(abstract,comments);large language model(abstract);post-training(abstract);SFT(abstract)

AI总结 本文通过控制微调实验发现,逐步引入新知识会增加幻觉,提出MoRFI方法利用稀疏自编码器分析残差流激活,识别因果相关的潜在特征。

Comments Accepted to the Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15665 2026-08-18 cs.LG 新提交 83%

SubZero+: Efficient Zeroth-Order LLM Fine-Tuning via Large Learning Rates

SubZero+:基于大学习率的高效零阶大语言模型微调方法

Ziming Yu, Shuyao Xiao, Xingyu Zhao, Sike Wang, Pan Zhou, Peiyu Zang, Xiangda Yan, Yongjie Yang, Jia Li

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SubZero+是改进的SubZero框架,通过三种互补方式提升零阶优化稳定性,在1.3B至32B参数模型的SuperGLUE任务上,优于现有零阶基线,扩大稳定学习率范围,缩小与一阶方法差距且内存开销极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15311 2026-08-18 cs.AI 新提交 83%

MoE Router-Guided Clustering for Heterogeneous Federated Instruction Tuning

面向异构联邦指令微调的MoE路由器引导聚类

Ankita Sharma, Bahar Farahani, Sanaz Rahimi Moosavi, Amir Rrahmani, Farshad Firouzi, Krishnendu Chakrabarty

机构 * California State University, Dominguez Hills(加州州立大学多明戈斯山分校) University of California, Irvine(加州大学欧文分校) Johns Hopkins University(约翰斯·霍普金斯大学) Arizona State University(亚利桑那州立大学)

专题命中 指令微调 :instruction tuning(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出ClientMorpher框架,通过MoE路由特征设计两种聚类策略,在Databricks Dolly-15K数据集上验证其可提升联邦指令微调的个性化性能,且通信成本与传统方法相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02414 2026-08-18 cs.CL cs.LG 版本更新 82%

Misconception Diagnosis From Student-Tutor Dialogue: Generate, Retrieve, Rerank

从学生-辅导对话中诊断误解:生成、检索、重排序

Joshua Mitton, Prarthana Bhattacharyya, Digory Smith, Thomas Christie, Ralph Abboud, Simon Woodhead

机构 * Eedi Renaissance Philanthropy Learning Engineering Virtual Institute(Eedi 理性慈善学习工程虚拟研究所)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出利用大语言模型从学生-辅导对话中检测误解的方法,通过生成、检索和重排序提升误解识别的准确性。

Comments Published as Oral Paper at Learning at Scale, 2026. Link: this https URL (https://dl.acm.org/doi/10.1145/3774398.3811609). 21 pages, 8 figures, 8 tables. Joshua Mitton and Prarthana Bhattacharyya contributed equally to this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15605 2026-08-18 cs.CV 新提交 82%

AlloEgo-VLM: Disambiguating Allocentric and Egocentric Reference Frames in Vision-Language Models

AlloEgo-VLM:在视觉语言模型中消除 allocentric( allocentric 即 allocentric 参考框架,又称 allocentric 坐标系,指以环境为中心的参考框架)与 egocentric( egocentric 即 egocentric 参考框架,又称自我中心坐标系,指以观察者自身为中心的参考框架)参考框架的歧义

Kuan-Lin Chen, Tzu-Ti Wei, Chao-Chi Liao, Yu-Chee Tseng, Jen-Jee Chen

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Institute of Computer Science and Engineering(工程与计算机科学学院) College of Artificial Intelligence(人工智能学院)

专题命中 指令微调 :language model(title,abstract)

AI总结 针对VLMs理解空间语义时 allocentric 与 egocentric 参考框架的歧义问题,构建数据集AlloEgo-View并开发框架AlloEgo-VLM,经NVIDIA Isaac Sim平台验证其在具身机器人开放式物体搜索任务中的有效性。

Comments 28 pages, 9 figures. Project page and code available at this https URL (https://github.com/CKL9001/AlloEgo-VLM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14929 2026-08-18 cs.CL cs.LG 新提交 81%

Training Leaves Traces: Centered Residual Signatures for Language Model Lineage Verification

训练留下痕迹:用于语言模型谱系验证的中心化残差特征

Aman Singh Thakur, Rayan Khoury

机构 * Amazon(亚马逊) Massachusetts Institute of Technology(麻省理工学院)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究提出中心化残差特征方法,通过移除残差训练产生的共享身份对齐组件,对比残差块特有结构得到谱系分数,可高效准确验证开源权重语言模型检查点的谱系

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16284 2026-08-18 cs.CV 新提交 80%

TransAnyText: Translating Arbitrary Text in E-commerce Images via Structured Visual Generation

TransAnyText:通过结构化视觉生成实现电商图像中任意文本的翻译

Xiaoan Liu, Lichen Ma, Zipeng Guo, Yu He, Xiaoyan Su, Shaojie Guo, Hao Yang, Jingling Fu, Xiaolong Fu, Zhen Chen, Yu Guo, Fei Wang, Xinyi Liu, Yongjun Zhang, Ke Zhang, Junshi Huang

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);post-training(abstract)

AI总结 本文提出TransAnyText框架,将电商图像文本翻译转化为生成可渲染HTML补丁,经三阶段后训练优化,在多基准上表现优于对比方法,为跨境电商图像翻译提供有效可控的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15241 2026-08-18 cs.DC 新提交 80%

LOCAL: Enabling Learning On-device Contiguously for Agent LLMs

LOCAL:支持智能体大语言模型在设备上进行连续学习

Xinxin Liu, Jiaxin Li, Zibo Wang, Yun Ji, Zhangqi Zhu, Qing Hu, Zhibin Wang, Rong Gu, Sheng Zhong, Chen Tian

专题命中 指令微调 :LLM(summary_cn,abstract)

AI总结 LOCAL是首个支持LLM智能体设备端连续学习的单GPU运行时,通过协同组件共享状态实现一致性,在7B级模型、24 GB单GPU上显著降低多项性能指标,保障学习与推理的连续性。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12478 2026-08-18 cs.CV cs.LG 版本更新 79%

Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning

数据更少,收敛更快:面向多模态指令微调的目标驱动数据优化

Rujie Wu, Haozhe Zhao, Hai Ci, Yizhou Wang

机构 * Peking University(北京大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) National University of Singapore(新加坡国立大学)

专题命中 指令微调 :instruction tuning(title,abstract);分类 cs.LG

AI总结 本文提出目标驱动数据优化框架GDO,通过优化训练样本实现更快收敛和更高精度,适用于多模态指令微调任务。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16620 2026-08-18 cs.CL cs.AI 新提交 79%

Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning

Palmyra x6技术报告:一种通过锚定监督微调进行后训练的具工具使用能力的智能体模型

Peng Du, Kiran Kamble, Rakshith Vasudev, Zhizhuo Yang, Rohith Nadimpally, Arjun Krishna, Waseem Alshikh, Daniel M. Bikel

机构 * Writer AI Research, Writer, Inc.(Writer AI研究院,Writer公司)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 Palmyra x6是一款针对企业级智能体任务优化的大语言模型,通过锚定监督微调后训练构建,在公开基准测试及偏见安全评估中表现优异。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏