arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-14 至 2026-04-14 共收录 589 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 45 篇

2604.11386 2026-04-14 cs.RO cs.CV 67%

ComSim: Building Scalable Real-World Robot Data Generation via Compositional Simulation

ComSim:通过组合模拟构建可扩展的现实世界机器人数据生成

Yiran Qin, Jiahua Ma, Li Kang, Wenzhan Li, Yihang Jiao, Xin Wen, Xiufeng Song, Heng Zhou, Jiwen Yu, Zhenfei Yin, Xihui Liu, Philip Torr, Yilun Du, Ruimao Zhang

机构 * CUHK-Shenzhen(香港中文大学(深圳)) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) USTC(中国科学技术大学) The University of Hong Kong(香港大学) University of Oxford(牛津大学) Harvard University(哈佛大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本文提出Compositional Simulation方法,结合经典模拟与神经模拟生成准确的动作-视频对,通过闭环数据增强管道生成大规模高质量训练数据,减少仿真到现实的域差距,提升现实环境中的政策模型性能。

Comments 14 pages, 8 figures, 4 tables; supplementary material included; Project page: https://faceong.github.io/ComSim/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10501 2026-04-14 cs.CR 67%

MuSimA: A Tool with Multi-modal Input for Generating Bespoke ABAC Datasets

MuSimA:一种支持多模输入的生成定制ABAC数据集的工具

Saket Jha, Karthikeya S. M. Yelisetty, Singabattu Sathya, Shamik Sural

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本文提出MuSimA工具,支持多模输入生成定制ABAC数据集,利用大语言模型自动提取分布参数,用于测试ABAC系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11805 2026-04-14 cs.LG cs.AI cs.CV cs.RO 62%

Solving Physics Olympiad via Reinforcement Learning on Physics Simulators

通过物理模拟器强化学习解决物理竞赛

Mihir Prabhudesai, Aryan Satpathy, Yangmin Li, Zheyang Qin, Nikash Bhardwaj, Amir Zadeh, Chuan Li, Katerina Fragkiadaki, Deepak Pathak

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文通过物理模拟器生成合成数据,利用强化学习训练LLM,实现零样本迁移到现实物理竞赛,提升模型物理推理能力。

Comments Project Webpage - https://sim2reason.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20792 2026-04-14 cs.LG cs.CL q-bio.BM 62%

BadGraph: A Backdoor Attack Against Latent Diffusion Model for Text-Guided Graph Generation

BadGraph: 针对文本引导图生成的潜在扩散模型后门攻击

Liang Ye, Shengqin Chen, Jiazhu Dai

机构 * School of Computer Engineering and Science, Shanghai University(上海大学计算机工程与科学学院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文提出BadGraph,一种针对文本引导图生成的潜在扩散模型的后门攻击方法,通过文本触发器污染训练数据,在推理时触发指定子图,同时保持对清洁输入的正常性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07286 2026-04-14 cs.LG cs.AI q-bio.BM q-bio.QM 62%

Evolutionary Profiles for Protein Fitness Prediction

蛋白质适应性预测的进化图谱

Jigang Fan, Xiaoran Jiao, Shengdong Lin, Zhanming Liang, Weian Mao, Chenchen Jing, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学) Peking University(北京大学) East China University of Science and Technology(华东理工大学) Chengdu University of Information Technology(成都信息工程大学) Massachusetts Institute of Technology(麻省理工学院) Zhejiang University of Technology(浙江工业大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EvoIF模型,通过整合进化信号提升蛋白质突变适应性预测性能,采用轻量结构和逆强化学习框架,在有限数据下实现高精度预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11757 2026-04-14 cs.RO cs.AI cs.CV 57%

StarVLA-$α$: Reducing Complexity in Vision-Language-Action Systems

StarVLA-$α$:降低视觉-语言-动作系统复杂度

Jinhui Ye, Ning Gao, Senqiao Yang, Jinliang Zheng, Zixuan Wang, Yuxin Chen, Pengguang Chen, Yilun Chen, Shu Liu, Jiaya Jia

机构 * HKUST(香港科技大学) XJTU(西安交通大学) CUHK(香港中文大学) THU(清华大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) SmartMore Ltd.(SmartMore有限公司)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 本文提出StarVLA-$α$,通过简化架构与流程降低实验干扰,系统分析VLA设计关键因素,在多个基准测试中表现优异,优于现有模型20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26499 2026-04-14 cs.AI 57%

AIRA_2: Overcoming Bottlenecks in AI Research Agents

AIRA_2:克服人工智能研究代理中的瓶颈

Karen Hambardzumyan, Nicolas Baldwin, Edan Toledo, Rishi Hazra, Michael Kuchnik, Bassel Al Omari, Thomas Simon Foster, Anton Protopopov, Jean-Christophe Gagnon-Audet, Ishita Mediratta, Kelvin Niu, Michael Shvartsman, Alisia Lupidi, Alexis Audran-Reiss, Parth Pathak, Tatiana Shavrina, Despoina Magka, Hela Momand, Derek Dunfield, Nicola Cancedda, Pontus Stenetorp, Carole-Jean Wu, Jakob Nicolaus Foerster, Yoram Bachrach, Martin Josifoski

机构 * FAIR at Meta(Meta FAIR) University College London(伦敦大学学院) University of Oxford(牛津大学)

专题命中 预训练与数据 :LLM(abstract);分类 cs.AI

AI总结 AIRA_2通过异步多GPU工作池、隐藏一致性评估协议和ReAct代理解决AI研究代理的三个性能瓶颈,提升搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01152 2026-04-14 cs.CL 57%

MASH: Modeling Abstention via Selective Help-Seeking

MASH:通过选择性求助进行模型退避建模

Mustafa Omer Gul, Claire Cardie, Tanya Goyal

机构 * Department of Computer Science, Cornell University(康奈尔大学计算机科学系)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL

AI总结 本文提出MASH框架,通过强化学习实现LLM退避决策,提升多跳问答准确率7.6%,展示出优于传统方法的退避性能。

Comments 25 pages, with 15 dedicated to citations and appendix. 17 tables and 11 figures. Preprint, under review. Paper updated to reflect new title and results

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05902 2026-04-14 cs.CR cs.CL 57%

Defending against Backdoor Attacks via Module Switching

通过模块切换防御后门攻击

Weijun Li, Ansh Arora, Xuanli He, Mark Dras, Qiongkai Xu

机构 * Macquarie University(麦考瑞大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University College London(伦敦大学学院)

专题命中 预训练与数据 :post-training(abstract);分类 cs.CL

AI总结 本文提出模块切换防御方法,通过验证理论依据和实验效果,展示其在减少后门攻击有效性方面优于现有方法,适用于深层网络和多种架构,实验表明其在较少模型情况下具有更强的防御能力。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10665 2026-04-14 cs.CL cs.IR 57%

HeceTokenizer: A Syllable-Based Tokenization Approach for Turkish Retrieval

HeceTokenizer:一种基于音节的土耳其检索分词方法

Senol Gulgonul

机构 * Ostim Technical University(奥斯蒂姆技术大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 HeceTokenizer利用土耳其语言的确定性六模式语音结构,构建了一个约8000种音节类型的封闭词汇表,结合细粒度分块检索策略,在TQuAD基准上取得50.3%的Recall@5,优于传统形态驱动方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10636 2026-04-14 cs.LG 57%

Mitigating Privacy Risk via Forget Set-Free Unlearning

通过遗忘集无关的去学习来缓解隐私风险

Aviraj Newatia, Michael Cooper, Viet Nguyen, Rahul G. Krishnan

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 预训练与数据 :language model(abstract);分类 cs.LG

AI总结 本文提出部分盲去学习方法Reload,通过梯度优化和结构化权重稀疏化有效去除训练数据影响,实验证明其在去学习效率和隐私保护方面优于传统方法。

Comments 50 pages, 20 figures, Published at The Fourteenth International Conference on Learning Representations

Journal ref Proceedings of The Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09693 2026-04-14 cs.CV cs.AI 57%

TaFall: Balance-Informed Fall Detection via Passive Thermal Sensing

TaFall:基于被动热传感的平衡感知跌倒检测

Chengxiao Li, Xie Zhang, Wei Zhu, Yan Jiang, Chenshu Wu

机构 * University of Hong Kong(香港大学) West China Hospital, Sichuan University(四川大学华西医院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 TaFall通过低成本隐私保护热阵列传感,结合平衡动态建模实现高可靠跌倒检测,其在真实环境中实现了98.26%的检测率和0.65%的误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07462 2026-04-14 cs.AI 57%

Do Machines Fail Like Humans? A Human-Centred Out-of-Distribution Spectrum for Mapping Error Alignment

机器是否像人类一样失败?一种以人为中心的分布外谱系用于映射误差对齐

Binxia Xu, Xiaoliang Luo, Luke Dickens, Robert M. Mok

专题命中 预训练与数据 :language model(abstract);分类 cs.AI

AI总结 本文提出以人为中心的分布外谱系,通过量化刺激偏离参考集的程度,揭示不同深度学习架构在近分布外和远分布外条件下的模型-人类对齐差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10970 2026-04-14 cs.CV 50%

Using Deep Learning Models Pretrained by Self-Supervised Learning for Protein Localization

利用自监督学习预训练的深度学习模型进行蛋白质定位

Ben Isselmann, Dilara Göksu, Heinz Neumann, Andreas Weinmann

机构 * European University of Technology(欧洲科技大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文研究了通过自监督学习预训练的深度学习模型在蛋白质定位任务中的泛化能力,发现基于DINO的ViT模型在无需微调时即可有效迁移至小样本数据集,且微调进一步提升了性能。

Comments 29 pages, 8 figures, submitted to BMC Bioinformatics. arXiv admin note: text overlap with arXiv:2602.05527

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01201 2026-04-14 cs.CV 50%

Perceptual Inductive Bias Is What You Need Before Contrastive Learning

感知归纳偏置是在对比学习之前所需的东西

Tianqin Li, Junru Zhao, Dunhan Jiang, Shenghao Wu, Alan Ramirez, Tai Sing Lee

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出在对比学习前引入感知归纳偏置,通过构建边界和表面表示来提升ResNet18的收敛速度和最终表示质量。

Comments CVPR 2025. Tianqin Li and Junru Zhao contributed equally to this work. Due to a formatting error during the CVPR submission, the equal contribution note was omitted in the official proceedings. This arXiv version corrects that oversight. The author order follows alphabetical order by last name. Code: https://github.com/juz031/MidVCL

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 45 篇

2409.02231 2026-04-14 physics.chem-ph cs.LG 91%

SmileyLlama: Modifying Large Language Models for Directed Chemical Space Exploration

SmileyLlama:通过监督微调改进大语言模型以定向探索化学空间

Joseph M. Cavanagh, Kunyang Sun, Andrew Gritsevskiy, Dorian Bagni, Yingze Wang, Thomas D. Bannister, Teresa Head-Gordon

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)

AI总结 SmileyLlama通过监督微调和直接偏好优化,改进大语言模型以生成具有特定性质的药物分子,展示了其在药物发现中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17516 2026-04-14 cs.CL cs.AI cs.CY cs.LG 91%

SimBench: Benchmarking the Ability of Large Language Models to Simulate Human Behaviors

SimBench:大型语言模型模拟人类行为能力的基准测试

Tiancheng Hu, Joachim Baumann, Lorenzo Lupo, Nigel Collier, Dirk Hovy, Paul Röttger

机构 * University of Cambridge(剑桥大学) Stanford University(斯坦福大学) Bocconi University(博科尼大学) University of Oxford(牛津大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

AI总结 SimBench通过统一20个多样化的数据集,评估大型语言模型模拟人类行为的 fidelity,发现模型性能与模型大小呈对数线性关系,但与计算资源无关,且存在指令微调与模拟准确性之间的权衡。

Comments Accepted at ICLR 2026. Project Website: http://simbench.tiancheng.hu/ Data: https://huggingface.co/datasets/pitehu/SimBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11129 2026-04-14 cs.CL 89%

DeCoVec: Building Decoding Space based Task Vector for Large Language Models via In-Context Learning

DeCoVec:通过上下文学习构建基于解码空间的任务向量以指导大语言模型

Feiyang Li, Yile Wang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 DeCoVec通过上下文学习在解码空间中构建任务向量,无需微调或侵入性操作,有效提升大语言模型性能,实验显示在多个数据集上优于基线方法。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20868 2026-04-14 cs.LG cs.AI cs.CL 89%

StyleBench: Evaluating thinking styles in Large Language Models

StyleBench: 评估大型语言模型中的思维风格

Junyu Guo, Shangding Gu, Ming Jin, Costas Spanos, Javad Lavaei

机构 * University of California, Berkeley(加州大学伯克利分校) Virginia Tech(弗吉尼亚理工大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过StyleBench评估不同推理风格在大型语言模型中的表现,发现结构复杂度在特定任务和模型容量下提升准确性,同时探讨了推理策略选择的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16333 2026-04-14 cs.CV cs.LG 89%

RL makes MLLMs see better than SFT

强化学习使多模态大语言模型比监督微调看得更清楚

Junha Song, Sangdoo Yun, Dongyoon Han, Jaegul Choo, Byeongho Heo

机构 * NAVER AI Lab(NAVER AI实验室)

专题命中 指令微调 :SFT(title,abstract);LLM(abstract);language model(abstract);pretraining(abstract)

AI总结 本文研究了强化学习在多模态大语言模型中的视觉编码器影响,发现RL能产生更精确的视觉表示,提出PIVOT方法提升视觉编码性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11299 2026-04-14 cs.CL cs.AI 88%

Enhancing Multimodal Large Language Models for Ancient Chinese Character Evolution Analysis via Glyph-Driven Fine-Tuning

通过字形驱动微调增强多模态大语言模型用于古汉字演变分析

Rui Song, Lida Shi, Ruihua Qi, Yingji Li, Hao Xu

机构 * College of Computer Science and Technology, Jilin University, China(吉林大学计算机科学与技术学院) Key Laboratory of Ancient Chinese Script, Culture Relics and Artificial Intelligence, Jilin University, China(吉林大学古文字、文物与人工智能重点实验室) School of Artificial Intelligence, Jilin University, China(吉林大学人工智能学院) School of Archaeology, Jilin University, China(吉林大学考古学院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出GEVO框架,通过字形驱动微调提升多模态大语言模型在古汉字演变分析中的能力,实验显示模型在多个任务上均取得显著提升。

Comments Accepted by ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06291 2026-04-14 cs.LG cs.AI 88%

TalkLoRA: Communication-Aware Mixture of Low-Rank Adaptation for Large Language Models

TalkLoRA: 一种面向通信的低秩适应混合框架用于大语言模型

Lin Mu, Haiyang Wang, Li Ni, Lei Sang, Zhize Wu, Peiquan Jin, Yiwen Zhang

机构 * Anhui University(安徽大学) Hefei University(合肥大学) University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 TalkLoRA通过引入专家间通信机制,提升LoRA在大语言模型中的参数效率和路由稳定性,实现在多种任务中更高效和均衡的专家路由。

Journal ref ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10508 2026-04-14 cs.SE cs.AI 87%

How Many Tries Does It Take? Iterative Self-Repair in LLM Code Generation Across Model Scales and Benchmarks

需要多少次尝试?跨模型规模和基准的LLM代码生成中的迭代自修复

Johin Johny Arimbur

机构 * Independent Researcher(独立研究员)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究探讨了在不同模型规模和基准测试中,通过迭代自修复提高代码生成正确率的方法,发现自修复显著提升了通过率,且现代模型无需微调即可实现有效自修复。

Comments 11 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03402 2026-04-14 cs.AI cs.LG 86%

Risk Awareness Injection: Calibrating Vision-Language Models for Safety without Compromising Utility

风险感知注入:为安全校准视觉-语言模型而不牺牲实用性

Mengxuan Wang, Yuxin Chen, Gang Xu, Tao He, Hongjie Jiang, Ming Li

机构 * Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(华南理工大学吴贤铭智能工程学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) University of Electronic Science and Technology of China(电子科技大学)

专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RAI框架,通过增强不安全信号恢复视觉-语言模型的安全识别能力,同时保持语义完整性,实验显示有效降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02343 2026-04-14 cs.CL cs.AI cs.CV cs.IR cs.LG 85%

Why Steering Works: Toward a Unified View of Language Model Parameter Dynamics

为何转向有效:语言模型参数动态的统一视角

Ziwen Xu, Chenyan Wu, Hengyu Sun, Haiwen Hong, Mengru Wang, Yunzhi Yao, Longtao Huang, Hui Xue, Shumin Deng, Zhixuan Chu, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出统一视角分析语言模型控制方法,通过偏好-效用分析揭示控制效果的权衡关系,并引入SPLIT方法提升偏好与效用。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10256 2026-04-14 eess.SP 85%

Graph-Enhanced LLM for SWAN-ISAC

图增强的大语言模型用于SWAN-ISAC

Qian Gao, Ruikang Zhong, Yuanwei Liu

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出图增强大语言模型框架,用于分割捏缩天线辅助的ISAC系统,通过自图捕捉场景依赖交互,实现天线部署与波束成形预测的优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08557 2026-04-14 cs.CL cs.AI 84%

Re-Mask and Redirect: Exploiting Denoising Irreversibility in Diffusion Language Models

重新掩码和引导:利用去噪不可逆性在扩散语言模型中进行攻击

Arth Singh

机构 * National Institute of Technology Agartala(阿加尔塔拉国立理工学院)

专题命中 指令微调 :language model(title,abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TrajHijack攻击,通过重新掩码已承诺的拒绝标记并注入短的肯定前缀,显著提升ASR性能,揭示了扩散语言模型的安全性漏洞及防御机制的不足。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07224 2026-04-14 cs.AI cs.LG 84%

Consolidation or Adaptation? PRISM: Disentangling SFT and RL Data via Gradient Concentration

巩固还是适应?PRISM:通过梯度集中解耦SFT和RL数据

Yang Zhao, Yangou Ouyang, Xiao Ding, Hepeng Wang, Bibo Cai, Kai Xiong, Jinglong Gao, Zhouhao Sun, Li Du, Bing Qin, Ting Liu

机构 * Research Center for Social Computing and Interactive Robotics, Harbin Institute of Technology(哈尔滨工业大学社会计算与交互机器人研究中心) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 指令微调 :SFT(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 PRISM通过分析梯度空间结构,区分高冲突数据需RL重构与低冲突数据需SFT巩固,提升LLM训练效率与鲁棒性。

Comments ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10585 2026-04-14 cs.LG cs.AI cs.CL 83%

Calibration Collapse Under Sycophancy Fine-Tuning: How Reward Hacking Breaks Uncertainty Quantification in LLMs

在奉承式微调下校准崩溃:奖励黑客如何破坏大语言模型的不确定性量化

Subramanyam Sahoo

机构 * Cambridge AI Safety Hub (CAISH)(剑桥人工智能安全中心)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

AI总结 研究探讨了在强化学习从人类反馈(RLHF)等方案中,奉承式微调对校准的影响,发现GRPO微调导致校准退化,尽管效果不显著,但经矩阵缩放后仍保留较高校准误差。

Comments Accepted at the AISTATS 2026 Workshop on Towards Trustworthy Predictions: Theory and Applications of Calibration for Modern AI. 14 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09625 2026-04-14 cs.CL 83%

Toward Generalized Cross-Lingual Hateful Language Detection with Web-Scale Data and Ensemble LLM Annotations

迈向基于网络级数据和集成大语言模型标注的通用多语言仇恨语言检测

Dang H. Dang, Jelena Mitrovi, Michael Granitzer

专题命中 指令微调 :LLM(title,abstract);language model(abstract);分类 cs.CL

AI总结 本文研究大规模未标注网络数据与基于大语言模型的合成标注对多语言仇恨语检测的提升作用,通过继续预训练BERT模型和集成LLM标注策略,展示了在低资源环境下显著的性能提升。

Comments 8 Pages, 3 tables, LREC 2026 papers

详情

展开后加载摘要…

URL PDF HTML 收藏