arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-28 至 2026-05-28 共收录 525 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 25 篇

2605.28598 2026-05-28 cs.CL cs.AI 90%

Evaluating the Realism of LLM-powered Social Agents: A Case Study of Reactions to Spanish Online News

评估基于LLM的社会智能体的真实性:对西班牙在线新闻反应的案例研究

Alejandro Buitrago López, Alberto Ortega Pastor, Javier Pastor-Galindo, José A. Ruipérez-Valiente

机构 * Faculty of Computer Science, University of Murcia(计算机科学系,穆尔西亚大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 通过比较真实与LLM生成的西班牙新闻评论,研究LLM在仇恨言论、情感和语义对齐三个维度上的真实性,发现现成模型表现不佳,微调可部分改善。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27380 2026-05-28 cs.CL cs.AI 90%

BioELX: Cross-lingual Biomedical Entity Linking via Alias-based Retrieval and LLM Ranking

BioELX: 基于别名的检索与LLM排序的跨语言生物医学实体链接

Yi Wang, Corina Dima, Liangyu Zhong, Steffen Staab

机构 * University of Stuttgart, Germany(斯图加特大学) Technical University of Berlin, Germany(柏林技术大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出BioELX两阶段框架,通过维基数据多语言别名增强SapBERT检索器,并利用预训练LLM排序器进行上下文感知消歧,无需标注数据即在多个基准上取得最佳性能。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21465 2026-05-28 cs.CL cs.LG 88%

DRTriton: Large-Scale Synthetic Data Driven Reinforcement Learning for Triton Kernel Generation

DRTriton:大规模合成数据驱动的强化学习用于Triton内核生成

Siqi Guo, Ming Lin, Tianbao Yang

机构 * Texas A&M University(德克萨斯大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出DRTriton框架,通过合成数据生成、课程强化学习和测试时搜索,训练LLM将PyTorch程序转换为优化的Triton内核,在KernelBench Level 2任务中超越GPT-5.2和Claude-Sonnet-4.5。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28456 2026-05-28 cs.AI cs.CV eess.AS 88%

Diffusion Large Language Models for Visual Speech Recognition

用于视觉语音识别的扩散大语言模型

Jeong Hun Yeo, Chae Won Kim, Hyeongseop Rha, Yong Man Ro

机构 * Integrated Vision Language Lab, KAIST, South Korea(韩国加耶大学集成视觉语言实验室)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出首个基于扩散大语言模型(DLLM)的视觉语音识别框架DLLM-VSR,通过迭代掩码去噪和灵活顺序解码,结合置信度引导的解掩码策略及两阶段训练,并引入长度引导候选解码以降低目标长度不确定性,在LRS3上取得19.5%的词错误率。

Comments Code: https://github.com/JeongHun0716/dllm-vsr

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01735 2026-05-28 cs.CL 86%

Less is More: Geometric Unlearning for LLMs with Minimal Data Disclosure

少即是多:面向LLM的几何遗忘方法,实现最小数据披露

Chenchen Tan, Xinghao Li, Shujie Cui, Youyang Qu, Cunjian Chen, Longxiang Gao

机构 * Faculty of Information Technology, Monash University, Clayton, Victoria, Australia.(墨尔本大学信息技术学院,澳大利亚维多利亚州克莱顿分校)

专题命中 预训练与数据 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出几何遗忘(GU)方法,通过操作模型隐藏状态并利用少量安全参考提示和锚点上下文合成提示,在无需原始训练数据的情况下实现高效选择性遗忘,在ToFU和UnlearnPII基准上达到强目标抑制且对非目标性能影响最小。

Comments 21 pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09258 2026-05-28 cs.LG 85%

Nexus: Same Pretraining Loss, Better Downstream Generalization via Common Minima

Nexus: 相同预训练损失,通过公共极小值实现更好的下游泛化

Huanran Chen, Huaqing Zhang, Xiao Li, Yinpeng Dong, Ke Shen, Jun Zhu

机构 * Tsinghua University(清华大学)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Nexus优化器,通过最大化梯度相似性促使不同数据源的损失函数极小值靠近,在保持相同预训练损失的情况下显著提升下游泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27383 2026-05-28 cs.CL cs.AI 84%

Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models

弥合稳定性与表现力之间的差距:低资源口语语言模型的合成数据扩展与偏好对齐

Yizhong Geng, Yanliang Li, Jinghan Yang, Tianhan Jiang, Boxun An, Ya Li, Xiaoyu Shen

机构 * Beijing University of Posts(北京邮电大学) University of California, USA(美国加州大学) Northwestern University, USA(美国西北大学) Eastern Institute of Technology, Ningbo, China(宁波工程技术学院)

专题命中 预训练与数据 :language model(title,abstract);SLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 针对低资源口语语言模型因合成数据导致的表现力崩溃问题,提出两种自对齐框架(DGSA和TDSC)以恢复韵律多样性,实现超越商业系统的性能并首次支持老挝语零样本语音克隆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28174 2026-05-28 cs.CV cs.AI 83%

FLORO: A Multimodal Geospatial Foundation Model for Ecological Remote Sensing Across Sensors and Scales

FLORO:面向跨传感器与尺度的生态遥感多模态地理空间基础模型

Jorge L. Rodriguez, Victor Angulo Morales, Areej Alwahas, Mariana Elias Lara, Fida Mohammad Thoker, Kasper Johansen, Bernard Ghanem, Fernando T. Maestre, Matthew F. McCabe

机构 * Biological and Environmental Science and Engineering Division, King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹科技大学生物与环境科学与工程 division) Computer, Electrical and Mathematical Science and Engineering Division, King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹科技大学计算机、电气与数学科学与工程 division)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 提出FLORO多模态地理空间基础模型,通过掩码自编码在异构遥感数据上预训练,利用可用性感知输入统一异构传感器配置,在PANGAEA基准上实现强迁移性能。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09572 2026-05-28 cs.AI cs.LG cs.SE 82%

SynthTools: A Framework for Scaling Synthetic Tools for Agent Development

SynthTools: 用于扩展智能体开发中合成工具的框架

Tommaso Castellani, Naimeng Ye, Daksh Mittal, Thomson Yen, Emmanouil Koukoumidis, William Zeng, Hongseok Namkoong

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出基于LLM的端到端管道SynthTools,通过环境生成、模拟、验证和任务构建,生成大规模多样化工具使用环境,提升智能体工具使用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28184 2026-05-28 cs.LG 77%

Joint Training of Multi-Token Prediction in Reinforcement Learning via Optimal Coefficient Calibration

通过最优系数校准在强化学习中联合训练多令牌预测

Zili Wang, Jiajun Chai, Lin Chen, Xiaohan Wang, Shiming Xiang, Guojun Yin

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Meituan(美团)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文从优化角度分析多令牌预测与强化学习联合训练失败的原因,提出最优系数校准方法,通过在线跟踪最优系数实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28522 2026-05-28 cs.IR 75%

Search for Coverage: Learning Coverage-Aware Retrieval with Augmented Sub-Question Answerability

搜索覆盖:学习基于增强子问题可回答性的覆盖感知检索

Jia-Huei Ju, Eugene Yang, Trevor Adriaanse, Suzan Verberne, Andrew Yates

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn)

AI总结 提出CoveR,一种通过覆盖对比和蒸馏目标训练的密集检索方法,结合LLM生成的子问题可回答性信号,在长文本RAG中提升覆盖度10%而不牺牲相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28228 2026-05-28 cs.CL 70%

When Seekers Are Hard to Help: Evaluating Emotional Support Dialogue Systems in Worst-Case Interactions

当求助者难以帮助:评估情感支持对话系统在最坏情况交互中的表现

Jiajie Yang, Yangchun Li, Guanyi Chen, Rui Fan, Xin Bai, Tingting He

机构 * Hubei Provincial Key Laboratory of Artificial Intelligence and Smart Learning(湖北人工智能与智能学习省级重点实验室) National Language Resources Monitoring and Research Center for Network Media(网络媒体语言资源监测与研究中心) School of Computer Science, Central China Normal University(华中师范大学计算机学院) Faculty of Artificial Intelligence in Education, Central China Normal University(华中师范大学教育人工智能学院) School of Chinese Language and Literature, Central China Normal University(华中师范大学中文语言文学学院)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究通过专家模拟和提出最坏情况评估框架,发现现有情感支持对话系统在面对低参与度、抗拒等困难求助者时性能显著下降,并验证了最坏情况模拟数据可提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28074 2026-05-28 cs.CR cs.CL cs.IR 70%

SilentRetrieval: Hijacking Retrieval-Augmented Generation via Semantically-Preserving Adversarial Data Poisoning

SilentRetrieval:通过语义保持的对抗性数据投毒劫持检索增强生成

Jiachen Qian

机构 * City University of Hong Kong(香港城市大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出SilentRetrieval两阶段数据投毒攻击,通过协调束搜索和上下文自适应触发生成,在保持文档流畅性的同时实现高检索命中率和攻击成功率,并评估了防御措施的有效性。

Comments 12 pages, 4 figures, KDD '26 camera-ready version

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09--13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27734 2026-05-28 cs.LG 70%

Learn from your own latents and not from tokens: A sample-complexity theory

从自身潜在表示而非token学习:样本复杂度理论

Daniel J. Korchinski, Alessandro Favero, Matthieu Wyart

机构 * Institute of Physics(物理研究所) University of Cambridge(剑桥大学) Johns Hopkins University(约翰霍普金斯大学) EPFL(苏黎世联邦理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过概率上下文无关语法数据,证明潜在预测方法在样本复杂度上相比token级SSL具有指数级优势,并分析了多尺度层次结构的必要性。

Comments 10 pages, 5 figures in main. 28 pages, 14 figures, 1 table in all

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10085 2026-05-28 cs.CL 70%

CALM-IT: Generating Realistic Long-Form Motivational Interviewing Dialogues with Dual-Actor Conversational Dynamics Tracking

CALM-IT: 通过双角色对话动态追踪生成逼真的长形式动机访谈对话

Viet Cuong Nguyen, Nhi Yen Nguyen, Kristin A. Candan, Mary Conlon, Vanessa Rumie, Kristen Risola, Michael L. Birnbaum, Munmun De Choudhury

机构 * Georgia Institute of Technology(佐治亚理工学院) Northwell Health(北well健康) Columbia University(哥伦比亚大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出CALM-IT框架,通过显式建模客户与咨询师状态的演变来生成和评估长形式动机访谈对话,在8,232个合成对话语料上优于基线方法,尤其在MITI 4.2全局评分和客户接受率上表现最佳。

Comments 53 pages, in submission to EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28664 2026-05-28 cs.LG cs.CL 62%

Activation Steering for Synthetic Data Generation: The Role of Diversity in Downstream Safety Detection

用于合成数据生成的激活引导:多样性在下游安全检测中的作用

Vijeta Deshpande, Tootiya Giyahchi, Veena Padmanabhan, Leman Akoglu, Anna Rumshisky

机构 * UMass Lowell(马萨诸塞大学洛厄尔分校) Amazon(亚马逊公司) CMU(卡内基梅隆大学)

专题命中 预训练与数据 :prompting(abstract);分类 cs.CL、cs.LG

AI总结 研究激活引导(AS)生成高质量训练数据用于下游安全检测分类器,发现多样性是关键但被忽视的轴,且AS在窄参数范围内优于提示生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28585 2026-05-28 cs.LG 57%

Outer-Momentum Restarting in High-Dimensional Two-Phase Optimization

高维两阶段优化中的外动量重启

Kristi Topollai, Allan Ma, Tolga Dimlioglu, Sui Jiet Tay, Anna Choromanska

机构 * New York University(纽约大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文研究在分布式优化中周期性重启外动量以控制外存效应,通过理论分析、玩具实验和语言模型预训练验证其能扩大稳定范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28363 2026-05-28 cs.CL 57%

PubMedCausal: A Span-Level Annotated Corpus for Causal Relation Extraction in Biomedical Text

PubMedCausal: 用于生物医学文本中因果关抽取的跨度级标注语料库

Ifeoluwa Kunle-John, Josiah Paul, Oluwatosin Agbaakin, Peter Aina, Ikenna Odezuligbo, Sydney Anuyah

机构 * Edyah Limited(Edyah有限公司) University of Ibadan(伊巴丹大学) Indiana University(印第安纳大学) Creighton University(克雷顿大学)

专题命中 预训练与数据 :prompting(abstract);分类 cs.CL

AI总结 为解决现有资源将因果关系与广义关联混淆、限制句子级标注或仅关注显式因果线索的问题,构建了基于PubMed摘要的跨度级因果关抽取语料库PubMedCausal,包含30,000段落级行、3,945因果行和6,491个裁决的因果对,并基准测试了判别式编码器和开源生成模型。

Comments Submitted to EMNLP 2026, 8 Pages, 23 page appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28287 2026-05-28 cs.LG cond-mat.mtrl-sci 57%

AtomComposer: Discovering Chemical Space from First Principles with Reinforcement Learning

AtomComposer: 基于强化学习从第一性原理发现化学空间

Bjarke Hastrup, Francois Cornet, Tejs Vegge, Arghya Bhowmik

机构 * Dept. of Energy Conversion and Storage, Technical University of Denmark(丹麦技术大学能源转换与存储系) Dept. of Applied Mathematics and Computer Science, Technical University of Denmark(丹麦技术大学应用数学与计算机科学系) Pioneer Center for Accelerating P2X Materials Discovery (CAPeX), Kgs. Lyngby, Denmark(加速P2X材料发现的先锋中心(CAPeX),Lyngby,丹麦)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 提出AtomComposer,一种无需预训练数据、通过在线强化学习自主构建有效3D异构体的智能体,在未见化学式上发现的异构体数量比现有方法多一个数量级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27733 2026-05-28 cs.LG 57%

Can Entry-Wise Clipping Give Spectral Control of Stochastic Gradients?

逐元素裁剪能否实现随机梯度的谱控制?

Zitao Song, Cedar Site Bai, Zhe Zhang, Brian Bullins, David F. Gleich

机构 * Department of Computer Science, Purdue University, West Lafayette, IN, USA(计算机科学系,普渡大学,西拉法塞特,印第安纳州,美国) School of Industrial Engineering, Purdue University, West Lafayette, IN, USA(工业工程学院,普渡大学,西拉法塞特,印第安纳州,美国)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出一种逐元素裁剪方法,通过分析梯度噪声的局部化特性,在保持矩阵结构的同时实现谱控制,并在Cauchy污染噪声下给出收敛保证,实验表明该方法可节省训练令牌。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10961 2026-05-28 cs.LG 57%

Bio-Inspired Self-Supervised Learning for Wrist-worn Accelerometer Data

生物启发的自监督学习用于腕戴式加速度计数据

Prithviraj Tarale, Kiet Chu, Abhishek Varghese, Kai-Chun Liu, Maxwell A. Xu, Mohit Iyyer, Sunghoon I. Lee

机构 * College of Information and Computer Sciences, University of Massachusetts, Amherst, United States(信息与计算机科学学院,马萨诸塞大学阿默斯特分校) Google Health, Seattle, United States(谷歌健康,西雅图,美国) Department of Computer Science, University of Maryland, College Park, United States(计算机科学系,马里兰大学学院公园分校) Stevens Institute of Technology, Hoboken, United States(史蒂文斯理工学院,霍博肯,美国)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 提出基于运动子单元理论的令牌化策略,通过掩码重建预训练Transformer编码器,在六个HAR基准上超越现有自监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18137 2026-05-28 cs.CV 50%

Xiaomi Auto World Model: A Joint World Model Integrating Reconstruction and Generation for Autonomous Driving

小米自动驾驶世界模型:一个融合重建与生成的联合世界模型

Lijun Zhou, Hongcheng Luo, Zhenxin Zhu, Cheng Chi, Mingfei Tu, Kaixin Xiong, Lei Gong, Zhanqian Wu, Zehan Zhang, Fangzhen Li, Hao Li, Yingying Shen, Jiale He, Haohui Zhu, Shan Zhao, Kai Wang, Zhiwei Zhan, Yuechuan Pu, Kaiyuan Tan, Ruiling Yang, Xianqi Wang, Tianyi Yan, Jiawei Zhou, Lei Zhang, Jingyang Zhao, Xi Zhou, Chitian Sun, Chenming Wu, Jiong Deng, Hongwei Xie, Ming Lu, Kun Ma, Long Chen, Guang Chen, Hangjun Ye, Bing Wang, Haiyang Sun

机构 * Xiaomi(小米)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出一个统一技术系统,通过稀疏场景查询驱动的重建模块WorldRec和两阶段训练框架WorldGen,实现高保真3D场景表示与高质量因果视频生成,并联合优化以提升生成稳定性、跨帧一致性和视觉保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27843 2026-05-28 cs.CV 50%

A self-supervised learning approach to deep filter banks for texture recognition

一种用于纹理识别的深度滤波器组的自监督学习方法

Joao B. Florindo, Lucas O. Lyra, Antonio E. Fabris

机构 * Institute of Mathematics and Statistics of the University of Sao Paulo(圣保罗大学数学与统计学研究所) Institute of Mathematics, Statistics and Scientific Computing of the University of Campinas(坎皮纳斯大学数学、统计与科学计算研究所)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对纹理识别中训练数据有限的问题,提出一种基于卷积自编码器的自监督预训练框架,结合深度滤波器和Fisher向量池化,在不显著增加计算负担的情况下提升识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23560 2026-05-28 eess.SY cs.NI cs.SY 50%

SafeSABR: Risk-Calibrated Adaptive Bitrate Streaming over Starlink Networks

SafeSABR:星链网络上的风险校准自适应比特率流媒体

Hongjun Xie, Jiahang Zhu, Zhiming Shao, Chao Fan, Zenghui Zhang, Genke Yang, Pengcheng Luo

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对星链网络吞吐量波动导致的严重会话级缓冲问题,提出SafeSABR框架,通过行为克隆预训练、风险校准强化学习微调和运行时安全审计,在保持高体验质量的同时显著降低严重卡顿会话比例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03668 2026-05-28 cs.RO cs.CV 50%

MVP-LAM: Learning Action-Centric Latent Action via Cross-Viewpoint Reconstruction

MVP-LAM:通过跨视角重建学习以动作为中心的潜在动作

Jung Min Lee, Dohyeok Lee, Seokhun Ju, Taehyun Cho, Jin Woo Koo, Li Zhao, Sangwoo Hong, Jungwoo Lee

机构 * Seoul National University, Seoul, South Korea(首尔国立大学,首尔,韩国) Konkuk University, Seoul, South Korea(韩国konkuk大学,首尔,韩国) Microsoft Research Asia, Beijing, China(微软亚洲研究院,北京,中国) HodooAI Labs, Seoul, South Korea(HodooAI实验室,首尔,韩国)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出MVP-LAM模型,利用多视角视频通过跨视角重建目标学习与真实动作高度相关的潜在动作,提升动作预测和下游操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 50 篇

2605.27747 2026-05-28 stat.ML cs.LG stat.CO 93%

Soft Specialists: $α$-Rényi Ensembles for Uncertainty-Aware LLM Post-Training

软专家:用于不确定性感知的LLM后训练的$\alpha$-Rényi集成

Paula Cordero-Encinar, Georgy Tyukin, Andrew B. Duncan

机构 * Department of Mathematics, Imperial College London(帝国理工学院伦敦校区数学系) Bessemer AI

专题命中 指令微调 :LLM(title,title_cn);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出一种$\alpha$-Rényi变分框架,通过学习后训练参数的分布来替代深度集成,实现不确定性感知的LLM后训练,并支持软路由和模型专业化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28760 2026-05-28 cs.LG 92%

LLM Zeroth-Order Fine-Tuning is an Inference Workload

LLM零阶微调是一种推理工作负载

Zelin Li, Caiwen Ding

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文发现LLM零阶微调是推理主导的工作负载,通过将其重复评分阶段在服务运行时中执行,实现了8.13倍加速,并保持了高精度。

Comments 12 pages, 4 figures, 3 tables, including appendix and references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27375 2026-05-28 cs.CL 92%

LCO: LLM-based Constraint Optimization for Safer Agentic LLMs in Real-world Tasks

LCO:基于LLM的约束优化,用于现实任务中更安全的智能体LLM

Jiayong Wan, Jiawei Chen, Zhaoxia Yin, Liu Shuyuan, Hang Su

机构 * East China Normal University(东华大学) Beijing Zhongguancun Academy(北京中关村学院) Tsinghua University(清华大学)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出LCO框架,通过自思考模块和进化采样模块约束LLM行为,在不微调模型的情况下减少上下文奖励黑客行为,实验表明在输出优化和策略优化场景中显著提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21128 2026-05-28 cs.AI 92%

RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs

RL 压缩,SFT 扩展:推理型大语言模型的比较研究

Kohsei Matsutani, Shota Takashiro, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

专题命中 指令微调 :SFT(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过轨迹级和步骤级分析框架,比较了强化学习(RL)和监督微调(SFT)对数学推理大语言模型推理路径的影响,发现RL压缩错误轨迹并集中推理功能,而SFT扩展正确轨迹并均匀化推理功能。

Comments Accepted at ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20996 2026-05-28 cs.CL 91%

AFRILANGTUTOR: Advancing Language Tutoring and Culture Education in Low-Resource Languages with Large Language Models

AFRILANGTUTOR:利用大语言模型推进低资源语言的语言辅导与文化教育

Tadesse Destaw Belay, Shahriar Kabir Nahin, Israel Abebe Azime, Ocean Monjur, Marek Rei, Chris Biemann, Shamsuddeen Hassan Muhammad, Seid Muhie Yimam, Anshuman Chhabra

机构 * Instituto Politécnico Nacional(墨西哥政治技术学院) University of South Florida(佛罗里达州立大学) Saarland University(萨尔兰大学) Imperial College London(伦敦帝国理工学院) University of Hamburg(汉堡大学)

专题命中 指令微调 :large language model(title);language model(title);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn)

AI总结 针对低资源语言缺乏训练数据的问题,提出AFRILANGDICT词典资源并构建AFRILANGEDU数据集,通过监督微调和直接偏好优化训练AFRILANGTUTOR模型,在10种非洲语言上显著提升辅导性能。

详情

展开后加载摘要…

URL PDF HTML 收藏