arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-08 至 2026-05-08 共收录 413 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 32 篇

2605.06632 2026-05-08 cs.LG 94%

Crafting Reversible SFT Behaviors in Large Language Models

在大型语言模型中构建可逆的SFT行为

Yuping Lin, Pengfei He, Yue Xing, Yingqian Cui, Jiayuan Ding, Subhabrata Mukherjee, Hui Liu, Zhen Xiang

机构 * Michigan State University(密歇根州立大学) Hippocratic AI(希波克拉底AI) University of Georgia(佐治亚大学)

专题命中 指令微调 :SFT(title,title_cn);large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出LCDD和SFT-Eraser方法,通过构建稀疏必要子网络实现对SFT诱导行为的可控逆向,验证了结构对行为因果必要性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05413 2026-05-08 cs.AI 93%

From History to State: Constant-Context Skill Learning for LLM Agents

从历史到状态:为LLM代理的常域技能学习

Haoyang Xie, Xinyuan Wang, Yancheng Wang, Puda Zhao, Feng Ju

机构 * School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学)

专题命中 指令微调 :LLM(title,title_cn);SFT(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出常域技能学习框架,通过轻量任务模块学习可重用流程,利用确定性跟踪器生成紧凑状态块,结合SFT和在线RL提升性能,减少提示词用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00199 2026-05-08 cs.CL cs.AI cs.IR cs.LG 92%

RSAT: Structured Attribution Makes Small Language Models Faithful Table Reasoners

RSAT:结构化归因使小型语言模型成为可信表格推理器

Jugal Gajjar, Kamalasankari Subramaniakuppusamy

机构 * Department of Computer Science, The George Washington University, USA(计算机科学系,乔治·华盛顿大学,美国)

专题命中 指令微调 :SFT(summary_cn,abstract);language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RSAT通过结构化归因提升小型语言模型的表格推理可信度,采用SFT和GRPO阶段训练,显著提高推理忠实度并确保引用有效性。

Comments 8 pages, 8 tables, 9 figures, and a 3-page Appendix. Accepted at the SURGeLLM Workshop at ACL 2026 and will be included in the proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05676 2026-05-08 cs.CL cs.AI 92%

Decomposing the Basic Abilities of Large Language Models: Mitigating Cross-Task Interference in Multi-Task Instruct-Tuning

分解大型语言模型的基本能力:在多任务指令微调中缓解跨任务干扰

Bing Wang, Ximing Li, Changchun Li, Jinjin Chi, Gang Niu, Masashi Sugiyama

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering, Ministry of Education, Jilin University(吉林大学符号计算与知识工程重点实验室) RIKEN Center for Advanced Intelligence Project(RIKEN高级智能项目中心) Graduate School of Frontier Sciences, University of Tokyo(东京大学前沿科学研究生院)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过实验揭示现有方法仍存在跨任务干扰问题,提出BADIT方法将LLM参数分解为正交的高奇异值LoRA专家,通过球形聚类保持正交性,实验证明其在多任务指令微调中优于现有方法。

Comments Accepted by ICML 2026. 25 pages, 13 figures. Code: https://github.com/wangbing1416/BADIT

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20375 2026-05-08 cs.LG cs.AI cs.CL 92%

LLM-AutoDP: Automatic Data Processing via LLM Agents for Model Fine-tuning

LLM-AutoDP: 通过LLM代理实现模型微调的自动数据处理

Wei Huang, Anda Cheng, Yinggui Wang, Lei Wang, Tao Wei

机构 * Ant Group(蚂蚁集团)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LLM-AutoDP框架,利用LLM代理自动生成和优化数据处理策略,通过迭代学习机制提升处理质量,同时减少隐私风险和人工成本。

Comments Accepted by VLDB2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05626 2026-05-08 cs.CL cs.AI 91%

When2Speak: A Dataset for Temporal Participation and Turn-Taking in Multi-Party Conversations for Large Language Models

When2Speak: 一个多党对话中大型语言模型的时间参与和发言时机的数据集

Vihaan Nama, Shreya Mendi, Zian Ye, Brinnae Bent

机构 * Pratt School of Engineering(普拉特工程学院) Duke University(杜克大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);LLM(abstract_cn)

AI总结 本文提出When2Speak数据集,通过四阶段生成流程学习群体互动中的发言时机,通过强化学习优化模型,提升多党对话中的发言准确性与自然度。

Comments Currently under review. Dataset can be found: https://huggingface.co/datasets/duke-trust-lab/When2Speak

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06330 2026-05-08 cs.CR cs.AI 91%

Fine-Tuning Small Language Models for Solution-Oriented Windows Event Log Analysis

针对Windows事件日志分析的细调小型语言模型

Siraaj Akhtar, Saad Khan, Simon Parkinson

机构 * School of Computing and Engineering, University of Huddersfield, Huddersfield, United Kingdom(计算与工程学院,赫德斯菲尔德大学,赫德斯菲尔德,英国)

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 本文研究小型语言模型在事件日志分析中的应用,通过合成数据集验证其在问题识别和修复方案生成上的优势,相比大语言模型更节省资源。

Comments 27 pages, 14 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06596 2026-05-08 cs.CR cs.LG 90%

FedAttr: Towards Privacy-preserving Client-Level Attribution in Federated LLM Fine-tuning

FedAttr: 向联邦LLM微调中实现隐私保护的客户端级归因

Su Zhang, Junfeng Guo, Heng Huang

机构 * Department of Computer Science(计算机科学系)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 FedAttr提出一种新的联邦学习协议,通过配对子集差分机制识别训练过水印文档的客户端,同时保持隐私保障和性能。该方法在理论和实验上均表现出色,具有高召回率和低误报率。

Comments 39 pages, 4 figures, 21 tables (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06166 2026-05-08 cs.LG 90%

One Algorithm, Two Goals: Dual Scoring for Parameter and Data Selection in LLM Fine-Tuning

一个算法,两个目标:在LLM微调中用于参数和数据选择的双评分

Xinrui Chen, Liu Yang, Ou Wu

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出DualSFT算法,通过共享梯度统计生成参数掩码和数据子集,提升微调性能与稳定性-可塑性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06443 2026-05-08 cs.MA 89%

AgenticPrecoding: LLM-Empowered Multi-Agent System for Precoding Optimization

代理预编码:基于LLM的多智能体系统用于预编码优化

Zijiu Yang, Zixiang Zhang, Shunpu Tang, Qianqian Yang, Zhiguo Shi

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出AgenticPrecoding框架,通过多智能体系统自动推导端到端预编码,提升未来6G网络中异构场景的适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06654 2026-05-08 cs.LG cs.AI math.OC 89%

Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less

优化器-模型一致性:使用与预训练相同的优化器进行全微调可减少遗忘

Yuxing Liu, Jianyu Wang, Tong Zhang

机构 * UIUC(伊利诺伊大学香槟分校) Apple(苹果公司)

专题命中 指令微调 :pretraining(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文发现使用与预训练相同的优化器进行全微调,在监督微调阶段能更少遗忘并保持性能,提出优化器-模型一致性概念,通过实验和理论分析揭示优化器对模型的影响及微调策略的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06030 2026-05-08 cs.CL 88%

More Aligned, Less Diverse? Analyzing the Grammar and Lexicon of Two Generations of LLMs

更一致,更不多样?分析两代LLM的语法和词汇

Adrián Gude, Roi Santos-Ríos, Francis Bond, Dan Flickinger, Carlos Gómez-Rodríguez, Olga Zamaraeva

机构 * Universidade da Coruña, CITIC(科鲁纳大学,CITIC) Independent Researcher(独立研究者) Palacký University, Olomouc(帕拉茨基大学,奥洛穆克)

专题命中 指令微调 :LLM(title_cn,summary_cn);instruction tuning(abstract);分类 cs.CL

AI总结 研究比较两代LLM生成的新闻文本与人类写作的语法特性,发现新模型在语法和词汇多样性上有所下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23629 2026-05-08 cs.AI cond-mat.dis-nn cond-mat.stat-mech cs.LG physics.soc-ph 87%

Emergent Slow Thinking in LLMs as Inverse Tree Freezing

大语言模型中涌现的慢思考作为逆树冻结

Sihan Hu, Xiansheng Cai, Yuan Huang, Zhiyuan Yao, Linfeng Zhang, Pan Zhang, Youjin Deng, Kun Chen

机构 * Hefei National Laboratory, University of Science and Technology of China(中国科学技术大学合肥微尺度物质科学国家实验室) Hefei National Laboratory for Physical Sciences at the Microscale and Department of Modern Physics, University of Science and Technology of China(中国科学技术大学合肥微尺度物质科学国家实验室和现代物理系) Institute of Theoretical Physics, Chinese Academy of Sciences(中国科学院理论物理研究所) School of Fundamental Physics and Mathematical Sciences, Hangzhou Institute for Advanced Study, UCAS(杭州高等研究院基础物理与数学科学学院) DP Technology(DP技术) Lanzhou Center for Theoretical Physics, Key Laboratory of Theoretical Physics of Gansu Province, Key Laboratory of Quantum Theory and Applications of MoE, Gansu Provincial Research Center for Basic Disciplines of Quantum Physics, Lanzhou University(兰州理论物理中心、甘肃省理论物理重点实验室、教育部量子理论与应用重点实验室、甘肃省量子物理基础学科省重点实验室、兰州大学) AI for Science Institute, Beijing(北京人工智能科学研究院)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文通过统计物理视角揭示大语言模型中慢思考的涌现机制,提出逆树冻结结构,并提出Annealed-RLVR方法提升模型性能。

Comments 34 pages, 17 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20531 2026-05-08 cs.DC cs.AI cs.CL cs.LG 87%

Epistemic Observability in Language Models

语言模型中的认知可观察性

Tony Mason, Vaastav Anand

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 指令微调 :language model(title);RLHF(abstract,abstract_cn);instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现语言模型在制造内容时自信度最高,证明这是观察问题而非能力问题,提出通过计算副产品提升检测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05909 2026-05-08 cs.AI 86%

Null Space Constrained Contrastive Visual Forgetting for MLLM Unlearning

空域约束对比遗忘用于MLLM反学习

Yuhang Wang, Zhenxing Niu, Haoxuan Ji, Guangyu He, Linlin Zhang, Haichang Gao

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Xi’an Jiaotong University(西安交通大学)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种MLLM反学习方法,通过冻结LLM主干并微调视觉模块,在保留非目标视觉知识和全部文本知识的同时,有效遗忘目标视觉知识。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25907 2026-05-08 cs.LG cs.AI 85%

How Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss Continuum

模型应如何快速承诺于监督?在Tsallis损失连续体上训练推理模型

Chu-Cheng Lin, Eugene Ie

机构 * Google(谷歌)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Tsallis损失族J_Q,通过q参数在RLVR和密度估计极之间插值,解释SFT-then-RLVR流程,并提出GARL和PAFT方法以缓解冷启动问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19455 2026-05-08 cs.CV 85%

Masked Language Prompting for Generative Data Augmentation in Few-shot Fashion Style Recognition

生成数据增强的掩码语言提示在少样本时尚风格识别中的应用

Yuki Hirakawa, Ryotaro Shimizu

机构 * ZOZO Research(ZOZO研究院)

专题命中 指令微调 :prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出掩码语言提示方法,通过掩码参考描述中的词并利用大语言模型生成多样且语义连贯的图像,提升少样本时尚风格识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06196 2026-05-08 cs.AI cs.CL 84%

The Granularity Axis: A Micro-to-Macro Latent Direction for Social Roles in Language Models

粒度轴:语言模型中社会角色的微到宏观潜在方向

Chonghan Qin, Xiachong Feng, Ziyun Song, Xiaocheng Feng, Jing Xiong, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示语言模型中社会角色粒度的潜在方向,通过定义粒度轴,发现其主导了角色表示空间的几何结构,并通过实验验证其在不同层级和模型间的稳定性与因果相关性。

Comments 28 pages, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15270 2026-05-08 cs.CL cs.AI 82%

From Documents to Spans: Scalable Supervision for Evidence-Based ICD Coding with LLMs

从文档到跨度:基于LLM的证据导向ICD编码可扩展监督方法

Xu Zhang, Wenxin Ma, Chenxu Wu, Rongsheng Wang, Zhiyang He, Xiaodong Tao, Kun Zhang, S. Kevin Zhou

机构 * School of Biomedical Engineering, Division of Life Sciences and Medicine, USTC(生物医学工程学院,生命科学与医学系,中国科学技术大学) MIRACLE Center, Suzhou Institute for Advance Research, USTC(MIRACLE中心,苏州先进研究院,中国科学技术大学) Jiangsu Provincial Key Laboratory of Multimodal Digital Twin Technology(江苏省多模态数字孪生技术重点实验室) State Key Laboratory of Precision and Intelligent Chemistry, USTC(精密与智能化学国家重点实验室)

专题命中 指令微调 :LLM(title_cn,abstract_cn);SFT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Span-Centric Learning框架,通过局部跨度学习提升ICD编码能力,以更低成本实现宏F1提升8.2点,并提供明确证据支持预测代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05741 2026-05-08 cs.AI 81%

HyperLens: Quantifying Cognitive Effort in LLMs with Fine-grained Confidence Trajectory

HyperLens: 通过细粒度置信轨迹量化大语言模型中的认知努力

Chengda Lu, Xiaoyu Fan, Wei Xu

机构 * IIIS, Tsinghua University(清华大学信息学院) Shanghai Qi Zhi Institute(上海启智研究院)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HyperLens通过分析大语言模型推理过程中的置信轨迹,量化认知努力,揭示复杂任务对更高认知努力的需求,并诊断监督微调对领域任务性能的影响。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15711 2026-05-08 cs.CV cs.AI 81%

SSMamba: A Self-Supervised Hybrid State Space Model for Pathological Image Classification

SSMamba: 一种用于病理图像分类的自监督混合状态空间模型

Enhui Chai, Sicheng Chen, Tianyi Zhang, Xingyu Li, Tianxiang Cui

机构 * School of Computer Science, Northwest University(西北大学计算机科学学院) PuzzleLogic Pte Ltd, Singapore(新加坡PuzzleLogic公司) Department of Electrical & Computer Engineering, National University of Singapore(新加坡国立大学电子与计算机工程系) School of Computer Science, University of Nottingham Ningbo China(中国诺丁汉大学 Ningbo 分校计算机科学学院)

专题命中 指令微调 :SFT(abstract,abstract_cn);foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出SSMamba,一种混合自监督框架,通过MAMIM、DMS和LPR模块解决病理图像分析中的领域偏移、局部-全局关系建模和细粒度敏感性问题,优于现有方法。

Journal ref Medical Image Analysis, Volume 111, June 2026, 104080

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05503 2026-05-08 cs.CL 79%

Chainwash: Multi-Step Rewriting Attacks on Diffusion Language Model Watermarks

Chainwash:针对扩散语言模型水印的多步重写攻击

Mohd Ruhul Ameen, Akif Islam, Nadim Mahmud, Md. Ekramul Hamid

机构 * College of Engineering and Computer Science, Marshall University(马歇尔大学工程与计算机科学学院) Department of Computer Science and Engineering, University of Rajshahi(拉贾沙希大学计算机科学与工程系) Miami University(迈阿密大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 研究多步重写对扩散语言模型水印检测的影响,发现多次重写显著降低检测率,表明重写是更有效的攻击手段。

Comments 13 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05365 2026-05-08 cs.AI cs.CL 79%

ZAYA1-8B Technical Report

ZAYA1-8B 技术报告

Robert Washbourne, Rishi Iyer, Tomas Figliolia, Henry Zheng, Ryan Lorig-Roach, Sungyeon Yang, Pritish Yuvraj, Quentin Anthony, Yury Tokpanov, Xiao Yang, Ganesh Nanduru, Stephen Ebert, Praneeth Medepalli, Skyler Szot, Srivatsan Rajagopal, Alex Ong, Bhavana Mehta, Beren Millidge

机构 * Zyphra

专题命中 指令微调 :pretraining(abstract);post-training(abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 ZAYA1-8B 是基于 MoE++ 架构的推理聚焦混合专家模型,通过全栈 AMD 平台训练,在数学和编程基准中表现优异,采用 RL 策略和 Markovian RSA 方法提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05867 2026-05-08 cs.SE 78%

On Fixing Insecure AI-Generated Code through Model Fine-Tuning and Prompting Strategies

通过模型微调和提示策略修复不安全的AI生成代码

Ali Soltanian Fard Jahromi, Amjed Tahir, Peng Liang, Foutse Khomh

专题命中 指令微调 :prompting(title,abstract)

AI总结 本文系统研究了通过模型微调和提示策略增强AI生成代码安全性的方法,分析了不同策略和模型对安全性的提升效果,发现安全改进高度依赖策略和模型,且修复某些漏洞可能引入新漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16155 2026-05-08 cs.NE 75%

PRIMETIME : Limits of LLMs in Temporal Primitives

PRIMETIME:LLMs在时间原语中的极限

Edward Gaere, Florian Wangenheim

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出PRIMETIME合成生成器,用于评估大语言模型中时间推理基础操作(解析和日期时间算术)的分解性。研究发现各原语可靠性各异,且通过生成器可生成训练数据提升事件规划任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01699 2026-05-08 cs.LG cs.AI cs.CR cs.NE 73%

Probe-Geometry Alignment: Erasing the Cross-Sequence Memorization Signature Below Chance

探测器几何对齐:在偶然机会以下消除跨序列记忆签名

Anamika Paul Rupa, Anietie Andy

机构 * Howard University(霍华德大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大语言模型中记忆痕迹的消除方法,提出通过探测器几何对齐技术在不损害能力的前提下,有效消除跨序列记忆签名,且在多种模型上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05231 2026-05-08 eess.AS cs.SD 71%

Prompting Whisper for Joint Speech Transcription and Diarization

通过提示Whisper实现语音转录与说话人识别的联合处理

Mariia Zamyrova, Henk van den Heuvel

机构 * Radboud University Nijmegen(拉德堡德大学奈梅亨分校)

专题命中 指令微调 :prompting(title)

AI总结 本文研究如何高效结合Whisper与说话人识别,通过提示和微调提高转录准确性与一致性,解决重叠语音和时间戳问题。

Comments To be presented at the Joint Workshop on HSCMA and CHiME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06326 2026-05-08 cs.CL 70%

Teaching Thinking Models to Reason with Tools: A Full-Pipeline Recipe for Tool-Integrated Reasoning

教授思考模型进行工具推理:一种完整的全管道配方用于工具集成推理

Qianjia Cheng, Yuchen Zhang, Zhilin Wang, Yuxin Zuo, Shunkai Zhang, Yuchen Fan, Yu Qiao, Bowen Zhou, Ning Ding, Yu Cheng, Yun Luo, Ganqu Cui

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出一种全管道配方,通过注入自然工具使用行为提升强思考模型的工具集成推理能力,同时保持文本推理能力,展示在Qwen3模型上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05714 2026-05-08 cs.CV cs.RO 67%

TriRelVLA: Triadic Relational Structure for Generalizable Embodied Manipulation

TriRelVLA:三元关系结构用于可迁移的具身操作

Hanyu Zhou, Chuanhao Ma, Gim Hee Lee

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

专题命中 指令微调 :LLM(abstract,abstract_cn)

AI总结 TriRelVLA通过构建三元关系结构,解决视觉语言动作模型在未见场景和物体上的泛化问题,提升具身操作的迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05438 2026-05-08 cs.LG cs.CL 62%

Residual-Mass Accounting for Partial-KV Decoding

残差质量会计用于部分KV解码

Yasuto Hoshi, Daisuke Miyashita, Jun Deguchi

机构 * Kioxia Corporation(铠侠公司)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出残差质量会计方法,通过精确计算检索token贡献并减去以保持非重叠,从而在部分KV解码中提升性能,尤其在1%支持预算下优于Top-K基线。

详情

展开后加载摘要…

URL PDF HTML 收藏