arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-07 至 2026-04-07 共收录 34 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 34 篇

2604.04064 2026-04-07 cs.CL cs.AI 91%

Extracting and Steering Emotion Representations in Small Language Models: A Methodological Comparison

在小型语言模型中提取和引导情绪表示:一种方法学比较

Jihoon Jeong

机构 * ModuLabs(ModuLabs实验室)

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);instruction tuning(abstract);RLHF(abstract)

AI总结 本文比较了小型语言模型中情绪向量提取方法,评估了9种模型在5种架构家族中的情绪表示,发现生成基于的方法在情绪分离上更优,并揭示了情绪表示在中间transformer层的定位及引导实验中的三种 regime。

Comments 14 pages, 4 figures, 7 tables. Paper #6 in the Model Medicine series

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04450 2026-04-07 cs.CL cs.AI 90%

Conversational Control with Ontologies for Large Language Models: A Lightweight Framework for Constrained Generation

基于本体的大型语言模型对话控制:一种轻量级框架用于受约束生成

Barbara Gendron, Gaël Guibon, Mathieu d'Aquin

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI

AI总结 本文提出一种轻量级框架,通过对话相关本体定义实现对LLM输出的模块化和可解释控制,通过建模关键方面作为约束并微调LLM,提升对话生成的可控性和可解释性。

Comments Accepted at KG & LLM: Knowledge Graphs and Large Language Models LREC 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04215 2026-04-07 cs.CL 90%

DARE: Diffusion Large Language Models Alignment and Reinforcement Executor

DARE:扩散大语言模型对齐与强化执行器

Jingyi Yang, Yuxian Jiang, Xuhao Hu, Shuang Cheng, Biqing Qi, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);post-training(abstract);preference optimization(abstract)

AI总结 DARE框架整合了监督微调、参数高效微调、偏好优化和强化学习,为扩散大语言模型提供统一的执行栈,支持多种模型家族,实现算法覆盖、可重复评估和实际加速。

Comments 14 pages,3 figures,5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04488 2026-04-07 cs.CV cs.LG 88%

A Patch-based Cross-view Regularized Framework for Backdoor Defense in Multimodal Large Language Models

基于补丁的跨视图正则化框架用于多模态大语言模型中的后门防御

Tianmeng Fang, Yong Wang, Zetai Kong, Zengzhen Su, Jun Wang, Chengjin Yu, Wei Wang

机构 * Singapore Management University(新加坡管理大学) China University of Mining and Technology(中国矿业大学) The University of Melbourne(墨尔本大学) Anhui University(安徽大学) Xi’an Jiaotong University(西安交通大学) Sun Yat-sen University(中山大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出一种基于补丁增强和跨视图正则化的统一后门防御框架,通过约束特征表示和输出分布层面的异常行为,有效降低后门攻击成功率并保持正常生成能力。

Comments 26 pages, 3 figures. Subjects: Machine Learning (cs.LG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03302 2026-04-07 cs.CV cs.AI 88%

Beyond Static Vision: Scene Dynamic Field Unlocks Intuitive Physics Understanding in Multi-modal Large Language Models

超越静态视觉:场景动态场解锁多模态大语言模型中的直观物理理解

Nanxi Li, Xiang Wang, Yuanjie Chen, Haode Zhang, Hong Li, Yong-Lu Li

机构 * Shanghai Jiao Tong University(上海交通大学) Tianjin University(天津大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究探讨多模态大语言模型在物理理解上的不足,提出Scene Dynamic Field方法提升对连续物体动态的理解能力,实现20.7%的改进并展现良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03890 2026-04-07 cs.RO 85%

From Prompt to Physical Action: Structured Backdoor Attacks on LLM-Mediated Robotic Control Systems

从提示到物理行动:针对LLM介导机器人控制系统结构后门攻击

Mingyang Xie, Jin Wei-Kocsis

机构 * School of Applied and Creative Computing, Purdue University(普渡大学应用与创意计算学院)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究探讨了LLM介导的机器人控制系统中结构后门攻击的影响,通过LoRA技术验证了后门在不同命令生成阶段的传播效果,并提出基于二次LLM的验证防御方法,揭示了实时机器人系统中的安全与响应权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03677 2026-04-07 cs.CL cs.AI 84%

Unlocking Prompt Infilling Capability for Diffusion Language Models

解锁扩散语言模型的提示填充能力

Yoshinari Fujinuma, Keisuke Sakaguchi

机构 * Patronus AI Tohoku University(东北大学) RIKEN(理化学研究所)

专题命中 指令微调 :language model(title,abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 本文通过扩展监督微调中的全序列掩码,解锁扩散语言模型的提示填充能力,证明模型填充的提示能匹配或超越手动设计模板,并有效跨模型迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14536 2026-04-07 cs.CL cs.AI 84%

Explainable Token-level Noise Filtering for LLM Fine-tuning Datasets

可解释的token级噪声过滤用于LLM微调数据集

Yuchen Yang, Wenze Lin, Enhao Huang, Zhixuan Chu, Hongbin Zhou, Lan Tao, Yiming Li, Zhan Qin, Kui Ren

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全全国重点实验室) Hangzhou HighTech Zone (Binjiang) Blockchain and Data Security Research Institute(杭州高新区(滨江)区块链与数据安全研究院)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出XTF框架,通过分解token级数据对微调过程的贡献,提升LLM微调性能,实验表明在数学、代码和医学任务中性能提升达13.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03322 2026-04-07 cs.CV cs.AI cs.RO 83%

VitaTouch: Property-Aware Vision-Tactile-Language Model for Robotic Quality Inspection in Manufacturing

VitaTouch:面向制造领域机器人质量检测的属性感知视觉-触觉-语言模型

Junyi Zong, Qingxuan Jia, Meixian Shi, Tong Li, Jiayuan Li, Zihang Lv, Gang Chen, Fang Deng

机构 * School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(北京邮电大学智能工程与自动化学院) Zhongguancun Academy(中关村学院) School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) School of AI, Beijing Institute of Technology(北京理工大学人工智能学院) Beijing Key Laboratory of Lightweight Intelligent System, Beijing Institute of Technology(北京理工大学北京市轻量化智能系统重点实验室)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 VitaTouch通过融合视觉、触觉与语言信息,提升机器人在制造中对材料属性的识别能力,实现了高精度的质量检测与自然语言描述。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28733 2026-04-07 cs.LG 83%

See it to Place it: Evolving Macro Placements with Vision-Language Models

看清它,放置它:利用视觉-语言模型进行宏放置

Ikechukwu Uchendu, Swati Goel, Karly Hou, Ebrahim Songhori, Kuang-Huei Lee, Joe Wenjie Jiang, Vijay Janapa Reddi, Vincent Zhuang

机构 * Harvard University(哈佛大学) Kempner Institute for the Study of Natural and Artificial Intelligence(肯普纳自然与人工智能研究所) Google DeepMind(谷歌DeepMind)

专题命中 指令微调 :language model(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 本文提出利用视觉-语言模型进行芯片布局中的宏放置优化,通过进化搜索策略提升放置质量,在9/10基准上优于现有方法,且能泛化至分析型布局器。

Comments 31 pages, 12 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04088 2026-04-07 cs.CL cs.AI cs.CY cs.LG 82%

Embedding Enhancement via Fine-Tuned Language Models for Learner-Item Cognitive Modeling

通过微调语言模型增强嵌入以实现学习者-项目认知建模

Yuanhao Liu, Zihan Zhou, Kaiying Wu, Shuo Liu, Yiyang Huang, Jiajun Guo, Aimin Zhou, Hong Qian

机构 * East China Normal University(华东师范大学) Tencent Inc(腾讯公司) Shanghai Innovation Institute(上海创新研究院)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出EduEmbed框架,通过微调语言模型提升学习者-项目认知建模的嵌入表示,在多种认知诊断任务中实现稳健性能。

Comments Accepted by The ACM Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00050 2026-04-07 cs.LG cs.AI 81%

Task-Centric Personalized Federated Fine-Tuning of Language Models

面向任务的个性化联邦微调语言模型

Gabriel U. Talasso, Meghdad Kurmanji, Allan M. de Souza, Nicholas D. Lane, Leandro A. Villas

机构 * Universidade Estadual de Campinas(坎皮纳斯州立大学) University of Cambridge(剑桥大学) Flower Labs

专题命中 指令微调 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出FedRouter,通过任务聚类实现个性化联邦学习,提升模型在任务泛化和客户端内部任务干扰中的鲁棒性,实验显示在任务干扰场景中性能提升6.1%,在泛化评估中提升136%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04341 2026-04-07 cs.AI 79%

Implementing surrogate goals for safer bargaining in LLM-based agents

在基于语言模型的智能体中实现安全谈判的替代目标

Caspar Oesterheld, Maxime Riché, Filip Sondej, Jesse Clifton, Vincent Conitzer

专题命中 指令微调 :LLM(title);prompting(abstract);分类 cs.AI

AI总结 本文探讨了在基于语言模型的智能体中实现替代目标以提高谈判安全性的方法,通过四种不同技术验证了细调和支架法在应对替代目标威胁方面的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27584 2026-04-07 cs.CV cs.IR cs.LG 79%

Image Hashing via Cross-View Code Alignment in the Age of Foundation Models

基于基础模型的跨视图代码对齐图像哈希

Ilyass Moummad, Kawtar Zaher, Hervé Goëau, Alexis Joly

机构 * INRIA(法国国家信息与自动化研究所) LIRMM(蒙彼利埃计算机科学、机器人及微电子实验室) INA(法国国家视听研究所) CIRAD(法国农业研究发展国际合作中心) AMAP(植物建模与生态学联合实验室)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出CroVCA方法,通过统一的二进制交叉熵损失和编码率最大化正则化,在少量训练轮次内实现高效图像哈希,适用于多种视觉检索任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04872 2026-04-07 cs.CL cs.LG 79%

Synthetic Sandbox for Training Machine Learning Engineering Agents

合成沙盒用于训练机器学习工程代理

Yuhang Zhou, Lizhu Zhang, Yifan Wu, Jiayi Liu, Xiangjun Fan, Zhuokai Zhao, Hong Yan

机构 * Meta AI

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.LG

AI总结 本文提出SandMLE框架,通过生成多样化的合成机器学习工程环境,显著提升机器学习工程代理的训练效率,实现大规模在线策略学习,并在多个基准测试中取得显著性能提升。

Comments 28 pages, 9 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27139 2026-04-07 cs.CV 78%

The Geometry of Robustness: Optimizing Loss Landscape Curvature and Feature Manifold Alignment for Robust Finetuning of Vision-Language Models

鲁棒性几何:优化损失景观曲率和特征流形对齐以增强视觉-语言模型的鲁棒微调

Shivang Chopra, Shaunak Halbe, Chengyue Huang, Brisa Maneechotesuwan, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出GRACE框架,通过联合调节参数空间曲率和特征空间不变性,提升视觉-语言模型在分布内准确率、分布外泛化和对抗鲁棒性之间的平衡,实验显示在ImageNet微调中ID准确率提升10.8%,对抗准确率提升13.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03388 2026-04-07 cs.LG stat.ML 77%

Scalable Variational Bayesian Fine-Tuning of LLMs via Orthogonalized Low-Rank Adapters

通过正交化低秩适配器实现大规模语言模型的可扩展变分贝叶斯微调

Haotian Xiang, Bingcong Li, Qin Lu

机构 * School of Electrical and Computer Engineering, University of Georgia(佐治亚大学电气与计算机工程学院) Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出PoLAR-VBLL框架,通过正交化低秩适配器与变分推断结合,实现大规模语言模型的可扩展贝叶斯微调,提升不确定性量化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03240 2026-04-07 cs.LG cs.AI cs.CL 75%

Scaling DPPs for RAG: Density Meets Diversity

在RAG中扩展DPPs:密度与多样性

Xun Sun, Baiheng Xie, Li Huang, Qiang Gao

机构 * Southwestern University of Finance and Economics(西南财经大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ScalDPP,通过轻量级P-Adapter整合DPPs,实现RAG中密度与多样性的联合优化,通过DML损失确保互补证据链的优先级,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04898 2026-04-07 cs.AI cs.CL cs.LG 67%

QED-Nano: Teaching a Tiny Model to Prove Hard Theorems

QED-Nano:用小型模型证明难题定理

LM-Provers, Yuxiao Qu, Amrith Setlur, Jasper Dekoninck, Edward Beeching, Jia Li, Ian Wu, Lewis Tunstall, Aviral Kumar

机构 * CMU(卡内基梅隆大学) Hugging Face ETH Zurich(苏黎世联邦理工学院) Project Numina

专题命中 指令微调 :SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出QED-Nano模型,通过三个阶段训练在数学竞赛证明任务中超越大模型,以较低成本实现高性能证明生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03113 2026-04-07 cs.SE 67%

PAFT: Preservation Aware Fine-Tuning for Minimal-Edit Program Repair

PAFT:面向最小编辑程序修复的保留意识微调

Boyang Yang, Zijian Cai, Shunfu Jin, Haoye Tian

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 PAFT通过保留意识微调方法,在Defects4J和HumanEval-Java上将pass@1提升65.6%,同时降低平均编辑距离32.6%,实现更小、更局部化的合理补丁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04411 2026-04-07 cs.CL cs.AI cs.CV 62%

Responses Fall Short of Understanding: Revealing the Gap between Internal Representations and Responses in Visual Document Understanding

响应未能揭示理解:揭示视觉文档理解中内部表征与响应之间的差距

Haruka Kawasaki, Ryota Tanaka, Kyosuke Nishida

机构 * Human Informatics Labs., NTT, Inc.(日本电信电话株式会社人类信息学实验室)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了视觉文档理解中内部表征与生成响应之间的差距,发现任务所需信息在中间层更线性编码,并通过微调中间层提升性能。

Comments Accepted to CVPR2026 workshop (MULA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06391 2026-04-07 cs.CL cs.AI 62%

HatePrototypes: Interpretable and Transferable Representations for Implicit and Explicit Hate Speech Detection

HatePrototypes: 用于隐性与显性仇恨言论检测的可解释且可迁移的表示

Irina Proskurina, Marc-Antoine Carpentier, Julien Velcin

机构 * Laboratoire Hubert Curien, UMR CNRS 5516(于贝尔·居里实验室,法国国家科学研究中心5516联合研究单位) Université Lumière Lyon 2(里昂第二大学) Université Claude Bernard Lyon 1(克洛德·贝尔纳里昂第一大学) ERIC, Lyon(里昂ERIC实验室) École Centrale de Lyon(里昂中央理工学院) LIRIS CNRS UMR 5205(LIRIS实验室,法国国家科学研究中心5205联合研究单位)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出HatePrototypes,通过语言模型优化的类级向量表示,实现显性和隐性仇恨言论的跨任务迁移,无需重复微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01168 2026-04-07 cs.CL cs.LG 62%

S0 Tuning: Zero-Overhead Adaptation of Hybrid Recurrent-Attention Models

S0调优:混合循环-注意模型的零开销适应

Jack Young

机构 * Indiana University(印第安纳大学)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.LG

AI总结 S0调优通过零推理开销优化循环层状态矩阵,提升HumanEval性能10.8个百分点,且在多个任务中展示出显著的跨域迁移能力。

Comments 15 pages (10 main + 5 appendix), 3 figures, code at https://github.com/jackyoung27/s0-tuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12510 2026-04-07 cs.RO cs.AI cs.CL 62%

Red-Teaming Vision-Language-Action Models via Quality Diversity Prompt Generation for Robust Robot Policies

通过质量多样性提示生成实现视觉-语言-动作模型的红队测试以获得鲁棒的机器人策略

Siddharth Srikanth, Freddie Liang, Ya-Chuan Hsu, Varun Bhatt, Shihan Zhao, Henry Chen, Bryon Tjanaka, Minjune Hwang, Akanksha Saran, Daniel Seita, Aaquib Tabrez, Stefanos Nikolaidis

机构 * Thomas Lord Department of Computer Science, University of Southern California(南加州大学托马斯·洛德计算机科学系) Sony AI(索尼AI) Sibley School of Mechanical and Aerospace Engineering, Cornell University(康奈尔大学西布利机械与航空航天工程学院)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Q-DIG方法,通过生成多样化且相关的语言指令来发现VLA模型的漏洞,提升机器人策略的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04448 2026-04-07 cs.LG cs.AI cs.CR 62%

RASA: Routing-Aware Safety Alignment for Mixture-of-Experts Models

RASA:面向混合专家模型的路由感知安全对齐

Jiacheng Liang, Yuhui Wang, Tanqiu Jiang, Ting Wang

机构 * Department of XXX, University of YYY(YYY大学XXX系) School of ZZZ, Institute of WWW(WWW学院ZZZ学院)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 RASA通过针对性修复安全关键专家提升混合专家模型的安全性,有效防止路由绕过,实现高鲁棒性和跨攻击泛化能力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04839 2026-04-07 cs.CL 57%

MERIT: Multilingual Expert-Reward Informed Tuning for Chinese-Centric Low-Resource Machine Translation

MERIT: 多语言专家-奖励引导调优用于以中文为中心的低资源机器翻译

Zhixiang Lu, Chong Zhang, Chenyu Xue, Angelos Stefanidis, Chong Li, Jionglong Su, Zhengyong Jiang

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 指令微调 :SFT(abstract);分类 cs.CL

AI总结 针对中文到低资源东南亚语言的机器翻译,MERIT框架通过语料预处理和奖励引导优化,显著提升了翻译质量,优于单纯模型扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03151 2026-04-07 cs.AI 57%

Enhancing Foundation VLM Robustness to Missing Modality: Scalable Diffusion for Bi-directional Feature Restoration

增强基础视觉语言模型对缺失模态的鲁棒性:可扩展的扩散用于双向特征恢复

Wei Dai, Haoyu Wang, Honghao Chang, Lijun He, Fan Li, Jian Sun, Haixia Bi

机构 * Department of Electronics Information \ 'an Jiaotong University Xi'an China School of Information Communications Engineering \ 'an Jiaotong University Xi'an China School of Mathematics Statistics \ 'an Jiaotong University Xi'an China Information \ 'an Jiaotong University Communications Engineering \ 'an Jiaotong University Statistics \ 'an Jiaotong University

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 本文提出一种通用缺失模态恢复策略,通过增强扩散模型实现双向特征对齐,提升视觉语言模型在模态缺失情况下的鲁棒性和可扩展性。

Comments 10 pages, 8 figures, 6 tables. Experiments and some details have been updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04701 2026-04-07 cs.CL 57%

XiYan-SQL: A Novel Multi-Generator Framework For Text-to-SQL

XiYan-SQL:一种新型多生成器框架用于文本到SQL

Yifu Liu, Yin Zhu, Yingqi Gao, Zhiling Luo, Xiaoxia Li, Xiaorong Shi, Yuntao Hong, Jinyang Gao, Yu Li, Bolin Ding, Jingren Zhou

机构 * Alibaba Cloud Computing Co., Ltd.(阿里云计算有限公司)

专题命中 指令微调 :LLM(abstract);分类 cs.CL

AI总结 本文提出XiYan-SQL框架,通过多生成器 ensemble 方法生成高质量SQL查询,并结合schema过滤和选择模型提升性能,实现在BIRD和Spider数据集上均取得SOTA结果。

Comments Published in IEEE TKDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01702 2026-04-07 cs.CL 57%

On the Role of Reasoning Patterns in the Generalization Discrepancy of Long Chain-of-Thought Supervised Fine-Tuning

在长链式思维监督微调中推理模式在泛化差异中的作用

Zhaoyi Li, Xiangyu Xi, Zhengyu Chen, Wei Wang, Gangwei Jiang, Ranran Shen, Linqi Song, Ying Wei, Defu Lian

机构 * University of Science and Technology of China(中国科学技术大学) Meituan LongCat Team(美团龙猫团队) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

专题命中 指令微调 :SFT(abstract);分类 cs.CL

AI总结 本文研究不同来源的长链式思维轨迹对模型泛化性能的影响,发现训练损失低并不一定带来更好的泛化能力,提出过滤频繁分支轨迹以提升SFT泛化性能。

Comments Under Review. version2: correct typos in Table 4 and add an ablation study (Table 5)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22783 2026-04-07 cs.IR cs.CV cs.LG cs.MM cs.SD 57%

Compact Hypercube Embeddings for Fast Text-based Wildlife Observation Retrieval

紧凑超立方体嵌入用于快速基于文本的野生动物观察检索

Ilyass Moummad, Marius Miron, David Robinson, Kawtar Zaher, Hervé Goëau, Olivier Pietquin, Pierre Bonnet, Emmanuel Chemla, Matthieu Geist, Alexis Joly

机构 * Inria, LIRMM, UM(法国国家信息与自动化研究所,蒙彼利埃计算机科学实验室,蒙彼利埃大学)

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

AI总结 本文提出紧凑超立方体嵌入框架,通过二进制表示实现高效文本检索,提升大规模野生动物图像和音频数据库的检索效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏