arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-23 至 2026-06-23 共收录 779 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 57 篇

2606.23113 2026-06-23 cs.CV 新提交 78%

Technical Report for the ICRA 2026 GOOSE 2D Fine-Grained Semantic Segmentation Challenge: Pretraining-Diverse Ensemble of Foundation Vision Encoders for Robust Outdoor Scene Understanding

ICRA 2026 GOOSE 2D细粒度语义分割挑战赛技术报告:面向鲁棒户外场景理解的预训练多样化基础视觉编码器集成

Boyan Wang, Yongxi Huang, Wenjing Li, Tianrui Hui, Shaofei Huang, Nan Pu, Zhun Zhong

机构 * LION Lab, Hefei University of Technology(合肥工业大学 LION 实验室) University of Macau(澳门大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本方案集成DINOv3、SigLIP2和InternImage三种预训练互补的视觉编码器,搭配Mask2Former解码器及长训练、EMA等策略,在GOOSE挑战赛56类细粒度分割中获75.40% mIoU,夺得第二名,并发现编码器预训练策略是精度主导因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02370 2026-06-23 cs.CV 版本更新 78%

Cultural Counterfactuals: Evaluating Cultural Biases in Large Vision-Language Models with Counterfactual Examples

文化反事实:用反事实示例评估大型视觉语言模型中的文化偏见

Phillip Howard, Xin Su, Kathleen C. Fraser

机构 * Thoughtworks University of Ottawa(Ottawa大学)

专题命中 预训练与数据 :language model(title,abstract)

AI总结 提出文化反事实数据集(近6万张反事实图像),通过图像编辑模型将不同人口特征的人置于真实文化背景中,量化大型视觉语言模型在宗教、国籍和社会经济地位方面的文化偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12879 2026-06-23 cs.LG cs.AI cs.CL 版本更新 78%

Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition

通过可扩展归因图分解从十亿参数语言模型中提取分层稀疏电路

Mohammed Mudassir Uddin, Shahnawaz Alam, Mohammed Kaif Pasha

机构 * Department of CSE, Muffakham Jah College of Engineering and Technology (MJCET)(计算机科学与工程系,穆法卡姆·贾赫工程与技术学院(MJCET))

专题命中 预训练与数据 :language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 提出分层归因图分解(HAGD)方法,通过跨层编码器训练、谱粗化、GNN引导分层遍历和因果干预验证,将电路提取复杂度降至O(n² log n),在多个大模型上实现高行为保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13491 2026-06-23 cs.IT cs.LG math.IT math.ST stat.TH 版本更新 77%

From Zipf's Law to Neural Scaling through Heaps' Law and Hilberg's Hypothesis

从齐普夫定律到神经缩放:通过希普斯定律和希尔伯格假设

Łukasz Dębowski

机构 * Institute of Computer Science, Polish Academy of Sciences(波兰科学院计算机科学研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 本文系统揭示了神经缩放定律与齐普夫定律之间的演绎关系,通过推导词汇增长的希普斯定律和熵缩放的希尔伯格假设,证明神经缩放定律是齐普夫定律在广泛假设下的推论。

Comments 32 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28737 2026-06-23 eess.AS cs.AI cs.CL cs.SD 版本更新 76%

ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining

ParaSpeechCLAP:面向丰富风格语言-音频预训练的双编码器语音-文本模型

Anuj Diwan, Eunsol Choi, David Harwath

机构 * Department of Computer Science, The University of Texas at Austin, USA(德克萨斯大学奥斯汀分校计算机科学系) Computer Science and Data Science, New York University, USA(纽约大学计算机科学与数据科学系)

专题命中 预训练与数据 :pretraining(title);分类 cs.CL、cs.AI

AI总结 提出ParaSpeechCLAP双编码器模型,将语音与文本风格描述映射到共享嵌入空间,支持丰富内在和情境风格描述,在风格描述检索、属性分类及TTS奖励模型中优于基线。

Comments Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21271 2026-06-23 cs.LG 新提交 74%

Reward-free Pretraining for Reinforcement Learning via Occupancy Coverage Maximization

通过占据覆盖最大化进行强化学习的无奖励预训练

Marco Pratticò, Pietro Novelli, Massimiliano Pontil, Carlo Ciliberto

机构 * Computational Statistics and Machine Learning - Istituto Italiano di Tecnologia(计算统计与机器学习 - 意大利技术研究院) AI Centre, Computer Science Department, University College London(人工智能中心,计算机科学系,伦敦大学学院)

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 提出一种无奖励预训练方法ROVER,通过最大化状态占据测度的覆盖来学习可迁移探索策略,在稀疏奖励下游任务中快速适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13161 2026-06-23 cs.CL 74%

Nemotron-CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training

Nemotron-CLIMB: 基于聚类的迭代数据混合自助法用于语言模型预训练

Shizhe Diao, Yu Yang, Yonggan Fu, Xin Dong, Dan Su, Markus Kliegl, Zijia Chen, Peter Belcak, Yoshi Suhara, Hongxu Yin, Mostofa Patwary, Yingyan Lin, Jan Kautz, Pavlo Molchanov

机构 * NVIDIA Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :language model(title);分类 cs.CL

AI总结 本文提出Nemotron-CLIMB方法,通过聚类和迭代优化提升预训练数据混合效果,实验显示其在预训练性能上优于现有模型,同时提供了一个大规模数据集用于研究。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20936 2026-06-23 cs.CL cs.AI 新提交 73%

Comparing Transformers and Hybrid Models at the Token Level

在词级上比较变换器和混合模型

Yanhong Li, William Merrill

机构 * Allen Institute for AI(艾伦人工智能研究所)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文通过对比混合模型与纯变换器在词级上的表现,揭示了混合模型在处理开放类词汇时的优势,以及在语义状态利用和n-gram复制任务中的不同表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07822 2026-06-23 eess.SP cs.AI cs.HC cs.LG 版本更新 73%

Exploration of LLMs, EEG, and behavioral data to measure and support attention and sleep

探索LLMs、EEG和行为数据以测量和支持注意力与睡眠

Akane Sano, Judith Amores, Mary Czerwinski

机构 * Rice University(里士大学) Microsoft Research(微软研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文探索利用大语言模型(LLMs)结合脑电图(EEG)和活动数据估计注意力状态、睡眠阶段和质量,并生成改善建议和引导想象脚本,发现LLMs能基于行为特征评估睡眠质量,但基于EEG和活动数据的检测需更多训练数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22883 2026-06-23 cs.AI 新提交 70%

CLI-Universe: Towards Verifiable Task Synthesis Engine for Terminal Agents

CLI-Universe:面向终端代理的可验证任务合成引擎

Zhanbo Hua, Yifan Yao, Weihao Xie, Yongchi Zhao, Minghao Liu, Ruizhi Qiu, Zhewei Huang, Zun Wang, Yiyan Ji, Yunhai Ye, Letian Zhu, Xinping Lei, Han Li, Zhiyuan Ma, Zili Wang, Zhaoxiang Zhang, Jiaheng Liu

机构 * Nanjing University(南京大学) StepFun(阶跃星辰) ZODA Shanghai AI Lab(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出CLI-Universe引擎,通过多维能力分类采样和证据引导研究生成终端代理任务,经多阶段可执行验证流水线筛选,构建高质量数据集CLI-Universe-6K,微调Qwen3-32B在Terminal-Bench 2.0上达到33.4%的SOTA。

Comments 20 pages, 5 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21550 2026-06-23 cs.AI 新提交 70%

AI Alignment From Social Choice Perspectives

从社会选择视角看AI对齐

Daniel Halpern, Evi Micha, Ariel D. Procaccia, Benjamin Schiffer, Itai Shapira, Shirley Zhang

机构 * Google Research(谷歌研究院) University of Southern California(南加州大学) Harvard University(哈佛大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文从社会选择理论视角审视人类反馈对齐中的偏好聚合问题,识别失败模式并揭示处理分歧的广阔设计空间。

Comments Accepted for publication in ACM SIGecom Exchanges

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17655 2026-06-23 cs.CL 版本更新 70%

What Language is This? Ask Your Tokenizer

这是什么语言?问你的分词器

Clara Meister, Ahmetcan Yavuz, Pietro Lesci, Tiago Pimentel

机构 * EPFL(苏黎世联邦理工学院) University of Cambridge(剑桥大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出基于UnigramLM分词算法的UniLID方法,通过比较字符串在各语言单字分布下的似然进行语言识别,在低资源和细粒度方言场景下显著提升样本效率。

Comments In Proceedings of ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17377 2026-06-23 cs.CL 版本更新 70%

Corpus Prevalence of Multiple-Choice Question Options

多项选择题选项的语料普遍性

Leonidas Zotos, Hedderik van Rijn, Malvina Nissim

机构 * Center for Language and Cognition, University of Groningen(语言与认知中心,格罗宁根大学) Department of Experimental Psychology, University of Groningen(实验心理学系,格罗宁根大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究多项选择题中正确选项在语料库中更常见的问题,提出基于文本嵌入的计算方法,发现正确选项普遍性显著高于错误选项,最高比随机基线高9.0%。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23611 2026-06-23 cs.CV cs.AI cs.LG 新提交 62%

Data Selection Through Iterative Self-Filtering for Vision-Language Settings

面向视觉-语言场景的迭代自过滤数据选择

Andrei Liviu Nicolicioiu, Sarvjeet Singh Ghotra, Morgane M. Moss, Aaron Courville

机构 * Mila, Université de Montréal(蒙特利尔大学Mila实验室)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种自举式方法,通过迭代训练CLIP模型并自选择改进的数据混合,无需额外数据或预训练模型即可提升下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22700 2026-06-23 cs.LG cs.AI cs.CR cs.CV 新提交 62%

SCRUB-FL: Sanitizing and Cleansing Representations via Unlearning of Backdoors

SCRUB-FL:通过遗忘后门来净化和清洗表示

Osama Wehbi, Sarhad Arisdakessian, Omar Abdel Wahab, Azzam Mourad, Hadi Otrok

机构 * Polytechnique Montréal(蒙特利尔综合理工学院) Khalifa University(哈利法大学)

专题命中 预训练与数据 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出SCRUB-FL,一种两阶段后门移除方法,在训练时通过谱分析和激活聚类检测可疑样本并训练WGAN-GP捕获触发分布,收敛后利用机器遗忘合成近似触发样本并消除触发-目标关联,在CIFAR-10和GTSRB上后门攻击成功率降至3.88%,正常任务准确率超91%。

Comments 14 pages, 3 tables, 1 algorithm, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21139 2026-06-23 cs.RO cs.AI cs.LG 新提交 62%

PoLAR: Factorizing Extent and Mode in Latent Actions for Robot Policy Learning

PoLAR:分解潜在动作中的程度和模式用于机器人策略学习

Youngjoon Jeong, Jihwan Yu, Minsoo Jo, Junha Chun, Taesup Kim

机构 * Seoul National University(首尔国立大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出PoLAR方法,通过径向方向结构分解潜在动作中的程度和模式,利用时间偏移作为程度代理,在双曲空间中实现,提升下游策略性能。

Comments Project Page: https://joon-stack.github.io/PoLAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20696 2026-06-23 cs.CL cs.AI eess.AS 新提交 62%

MindAlign: Decoding Inner Speech from fMRI Signals via Multimodal Embedding Alignment under Limited Data

MindAlign: 在有限数据下通过多模态嵌入对齐从fMRI信号解码内心语言

Muxuan Liu, Ichiro Kobayashi, Satoshi Nishida

机构 * Graduate School of Humanities and Sciences Ochanomizu University(大仓山大学人文科学研究生院) Center for Information and Neural Networks Advanced ICT Research Institute National Institute of Information and Communications Technology(信息与神经网络中心先进信息通信研究机构信息通信技术研究所)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出MindAlign两阶段框架,通过神经-语义对齐将fMRI信号映射到多模态语义空间,再结合视觉上下文冻结多模态语言模型生成文本,在静默图像描述数据上优于基线,且语义-语言投影可跨被试泛化。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21579 2026-06-23 cs.CV cs.AI 新提交 57%

The Unreasonable Effectiveness of VLMs for Zero-shot Procedural Mistake Detection

VLM在零样本程序性错误检测中的惊人有效性

Serdar Ozsoy, Lars Doorenbos, Federico Spurio, Gianpiero Francesca, Juergen Gall

机构 * University of Bonn(波恩大学) Toyota Motor Europe(丰田欧洲公司) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习和人工智能研究所)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI

AI总结 提出ZeProM框架,利用单个预训练VLM同时解决零样本程序性错误检测和时间动作分割,在EgoPER和CaptainCook4D基准上接近或超越全监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20993 2026-06-23 cs.CL 新提交 57%

Phonemes to the Rescue: Multilingual Tokenization Based on International Phonetic Alphabet

音素救援:基于国际音标的多语言分词

Milan Miletić, Julie Kallini, Ekaterina Shutova

机构 * University of Amsterdam(阿姆斯特丹大学) Stanford University(斯坦福大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 提出使用国际音标(IPA)作为多语言分词的语言无关输入表示,通过更平衡的字节-字符分布和跨语言字符重叠,显著提升分词质量,尤其对非拉丁文字和未见语言更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10507 2026-06-23 cs.IR cs.LG 57%

PinRec: Unified Generative Retrieval for Pinterest Recommender Systems

PinRec:统一生成检索用于Pinterest推荐系统

Edoardo Botta, Jaewon Yang, Yi-Ping Hsu, Laksh Bhasin, Yilin Chen, Prabhat Agarwal, Anirudhan Badrinath, Jiajing Xu, Charles Rosenberg

机构 * Pinterest

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 PinRec是一种统一的生成式检索模型,用于Pinterest的所有推荐界面,通过预训练和微调实现单一模型适应不同界面需求,提升搜索保存率4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17396 2026-06-23 cs.LG eess.SP stat.ML 57%

RINS-T: Robust Implicit Neural Solvers for Time Series Linear Inverse Problems

RINS-T:用于时间序列线性逆问题的鲁棒隐式神经求解器

Keivan Faghih Niresi, Zepeng Zhang, Olga Fink

机构 * Intelligent Maintenance and Operations Systems Laboratory, EPFL(智能维护与运营系统实验室,瑞士联邦理工学院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出RINS-T,一种无需预训练的深度先验框架,通过隐式先验和鲁棒优化技术提升时间序列数据的鲁棒性和稳定性,解决逆问题中的噪声和异常检测挑战。

Comments Accepted to IEEE Transactions on Instrumentation and Measurement

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25665 2026-06-23 cs.LG 版本更新 57%

Gradual Capacity Growth for Sparse Network Discovery

稀疏网络发现的渐进容量增长

Qihang Yao, Constantine Dovrolis

机构 * Georgia Institute of Technology(佐治亚理工学院) The Cyprus Institute(塞浦路斯研究所)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 提出渐进容量增长(GCG)框架,通过路径增长规则在训练中逐步分配网络容量,无需预训练或预设稀疏度,以较低成本发现接近稠密性能的稀疏网络。

Comments Accepted at ICANN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22276 2026-06-23 eess.AS cs.SD 新提交 50%

Learning from Audio-Dependency Errors: Data Curation Strategies Based on Model Confusion Patterns in Audio Question Answering

从音频依赖错误中学习:基于模型混淆模式的音频问答数据策展策略

Hyeonuk Nam

机构 * Independent Researcher(独立研究者)

专题命中 预训练与数据 :language model(abstract)

AI总结 提出一种诊断性数据策展方法,通过探测音频-语言模型在不同音频条件下的混淆模式,筛选强音频依赖样本进行微调,在音频问答任务上提升准确率。

Comments DCASE 2025 Challenge Task5 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22738 2026-06-23 cs.IR 新提交 50%

PA-User: Simulating Trust and Verification under AI-Generated Content

PA-User: 模拟AI生成内容下的信任与验证

Saber Zerhoudi

专题命中 预训练与数据 :language model(abstract)

AI总结 提出PA-User用户模拟器,通过检测努力预算、信任组件和决策规则,模拟用户在AI生成内容环境下的验证行为,降低高风险遗憾并提高信任校准。

Journal ref 12th Federation of European Simulation Societies Conference (EUROSIM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21788 2026-06-23 cs.RO cs.CV 新提交 50%

Rotation-Aware Point-Cloud Embeddings for Vision-Based In-Hand Reorientation

基于旋转感知的点云嵌入用于视觉驱动的手中重定向

Yashom Dighe, Karthik Dantu

机构 * University at Buffalo(布法罗大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出旋转感知点云嵌入,通过校准欧氏潜在距离与SO(3)测地误差,使无模型强化学习策略无需显式姿态或稠密流即可从点云目标实现手中重定向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17337 2026-06-23 eess.AS 新提交 50%

From Signals to Patterns: Non-Invasive Tuberculosis Detection from Cough Audio using Bandit Weighted Hyperbolic Prototypes

从信号到模式:使用Bandit加权双曲原型从咳嗽音频进行非侵入性结核病检测

Mohd Mujtaba Akhtar, Girish, Sanjam Wadhwa, Muskaan Singh, Ning Ma

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出COBALT框架,融合频谱特征与语音基础表示,通过码本对齐双曲原型和Bandit可靠性加权,在CODA TB DREAM挑战基准上实现最优性能。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13102 2026-06-23 cs.RO 新提交 50%

FTP-1: A Generalist Foundation Tactile Policy Across Tactile Sensors for Contact-Rich Manipulation

FTP-1:一种跨触觉传感器的通用基础触觉策略,用于密集接触操作

Chengbo Yuan, Zicheng Zhang, Mingjie Zhou, Wendi Chen, Yi Wang, Zhuoyang Liu, Dantong Niu, Shuo Wang, Hui Zhang, Wenkang Zhang, Yingdong Hu, Yuanqing Gong, Wanli Xing, Chuan Wen, Cewu Lu, Kaifeng Zhang, Yang Gao

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海期智研究院) Sharpa Shanghai Jiao Tong University(上海交通大学) University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出FTP-1,首个通用基础触觉策略,通过异构编码器和共享Transformer专家,跨21种传感器和3000小时数据预训练,实现触觉操作技能的跨传感器迁移,在未见传感器上成功率提升31%。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 52 篇

2606.22606 2026-06-23 cs.CL cs.LG 新提交 95%

Sub-Billion, Super-Frontier: Small Language Models Rival Zero-Shot Frontier LLMs on General and Literary Relation Extraction

十亿以下,超级前沿:小语言模型在通用和文学关系抽取上媲美零样本前沿LLM

Despina Christou, Grigorios Tsoumakas

机构 * School of Informatics, Aristotle University of Thessaloniki(亚里士多德大学塞萨洛尼基分校信息学院) Archimedes, Athena Research Center(雅典娜研究中心阿基米德实验室)

专题命中 指令微调 :LLM(title_cn,summary_cn);language model(title,abstract);small language model(title,abstract);SLM(summary_cn,abstract_cn)

AI总结 研究小语言模型(SLM)在通用和文学关系抽取任务上能否通过任务适配缩小与零样本前沿LLM的差距,发现4位SLM经微调后性能超越GPT-5.4和Claude Sonnet 4.6,归因于任务适配而非生成解码。

Comments 41 pages, 3 figures, 25 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21974 2026-06-23 quant-ph cs.AI 新提交 93%

Fine-Tuning Large Language Models for Quantum Reasoning

微调大型语言模型用于量子推理

Katherine Ip, Casey R. Myers, Udaya Parampalli, James Quach, Peiyong Wang

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算机与信息系统学院) School of Physics, Mathematics and Computing, The University of Western Australia(西澳大学物理、数学与计算学院) Pawsey Supercomputing Centre(帕韦西超级计算中心) CSIRO Clayton(CSIRO 克莱顿分校)

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 提出通过量子电路模拟微调LLM,比较监督微调与两阶段SFT+GRPO方法,实现量子推理能力提升。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22402 2026-06-23 cs.SE cs.AI cs.CL cs.LG 新提交 93%

Reinforcement learning to improve large language model-based automated code compliance systems

强化学习改进基于大语言模型的自动化代码合规系统

Jack Wei Lun Shi, Minghao Dang, Wawan Solihin, Leong Hien Poh, Justin K. W. Yeoh

机构 * National University of Singapore(新加坡国立大学) Harbin Institute of Technology(哈尔滨工业大学) NovaCITYNETS

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn)

AI总结 提出P4IR两阶段框架,先通过监督微调注入领域知识,再用GRPO优化高层代码骨架的准确性,在零样本设置下优于多个领先大语言模型。

Comments 22 pages, 12 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏