arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 10821 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 737 篇

2606.22738 2026-06-23 cs.IR 新提交 50%

PA-User: Simulating Trust and Verification under AI-Generated Content

PA-User: 模拟AI生成内容下的信任与验证

Saber Zerhoudi

专题命中 预训练与数据 :language model(abstract)

AI总结 提出PA-User用户模拟器,通过检测努力预算、信任组件和决策规则,模拟用户在AI生成内容环境下的验证行为,降低高风险遗憾并提高信任校准。

Journal ref 12th Federation of European Simulation Societies Conference (EUROSIM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21788 2026-06-23 cs.RO cs.CV 新提交 50%

Rotation-Aware Point-Cloud Embeddings for Vision-Based In-Hand Reorientation

基于旋转感知的点云嵌入用于视觉驱动的手中重定向

Yashom Dighe, Karthik Dantu

机构 * University at Buffalo(布法罗大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出旋转感知点云嵌入,通过校准欧氏潜在距离与SO(3)测地误差,使无模型强化学习策略无需显式姿态或稠密流即可从点云目标实现手中重定向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17337 2026-06-23 eess.AS 新提交 50%

From Signals to Patterns: Non-Invasive Tuberculosis Detection from Cough Audio using Bandit Weighted Hyperbolic Prototypes

从信号到模式:使用Bandit加权双曲原型从咳嗽音频进行非侵入性结核病检测

Mohd Mujtaba Akhtar, Girish, Sanjam Wadhwa, Muskaan Singh, Ning Ma

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出COBALT框架,融合频谱特征与语音基础表示,通过码本对齐双曲原型和Bandit可靠性加权,在CODA TB DREAM挑战基准上实现最优性能。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13102 2026-06-23 cs.RO 新提交 50%

FTP-1: A Generalist Foundation Tactile Policy Across Tactile Sensors for Contact-Rich Manipulation

FTP-1:一种跨触觉传感器的通用基础触觉策略,用于密集接触操作

Chengbo Yuan, Zicheng Zhang, Mingjie Zhou, Wendi Chen, Yi Wang, Zhuoyang Liu, Dantong Niu, Shuo Wang, Hui Zhang, Wenkang Zhang, Yingdong Hu, Yuanqing Gong, Wanli Xing, Chuan Wen, Cewu Lu, Kaifeng Zhang, Yang Gao

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海期智研究院) Sharpa Shanghai Jiao Tong University(上海交通大学) University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出FTP-1,首个通用基础触觉策略,通过异构编码器和共享Transformer专家,跨21种传感器和3000小时数据预训练,实现触觉操作技能的跨传感器迁移,在未见传感器上成功率提升31%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18659 2026-06-18 cs.SD 新提交 50%

Responsible ASR: Overcoming Challenges of Foundational Models in Narrow-Band and Low-Resource Settings

负责任的ASR:克服窄带和低资源场景下基础模型的挑战

Tejas Godambe, Nutan Choudhary, Sanket Shah, Nagaraj Adiga, Sharath Adavanne

机构 * Applied AI(应用人工智能)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文评估了开源和商业基础ASR模型在窄带对话中的表现,针对低资源语言印地语和低资源口音印度英语,发现零样本性能不佳,微调虽有改进但效果因语言和口音而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16209 2026-06-16 cs.DL cs.IR 新提交 50%

Viral Images: Identifying Reprintings within 1.5 Million Photographs in Chronicling America

病毒图像:在《记录美国》的150万张照片中识别翻印

Bruno Buccalon, Yueran Sun, Benjamin Charles Germain Lee

专题命中 预训练与数据 :pretraining(abstract)

AI总结 利用CLIP嵌入和聚类方法,在《记录美国》的150万张照片中无监督识别翻印内容,并构建交互式界面供人文学者研究。

Comments 13 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15938 2026-06-16 cs.CV cs.MM 新提交 50%

Learning Directional Semantic Transitions for Longitudinal Chest X-ray Analysis

学习纵向胸部X光分析的方向性语义转变

Zhangfeng Hu, Zefan Yang, Ge Wang, Tanveer Syeda-Mahmood, Anushree Burade, Mannudeep Kalra, Pingkun Yan

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) Stanford University(斯坦福大学) Massachusetts General Hospital, Harvard Medical School(麻省总医院,哈佛医学院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出ProTrans框架,将疾病进展建模为配对CXR研究间的方向性语义转变,利用放射学报告和可学习进展特征图显式编码语义变化,通过反向时间建模和双向重建一致性实现方向感知,在纵向下游任务中优于现有方法。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13700 2026-06-15 eess.SP cs.CV 新提交 50%

C-MambaPose: A Physics-Informed Complex Mamba Framework for Cross-Environment WiFi Human Pose Estimation

C-MambaPose:一种物理信息驱动的复杂Mamba框架用于跨环境WiFi人体姿态估计

Phuc Nguyen H

机构 * VinUniversity(文大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出C-MambaPose,一种结合物理信息的复值Mamba-GraFormer混合框架,通过相位保留表示和动态选择性感受野的时空复杂Mamba编码器,实现跨环境WiFi三维人体姿态估计,在MM-Fi数据集上以3.78M参数达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13494 2026-06-12 cs.RO cs.CV 新提交 50%

NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation

NavWAM:用于目标条件视觉导航的导航世界动作模型

Daichi Azuma, Taiki Miyanishi, Koya Sakamoto, Shuhei Kurita, Yaonan Zhu, Petr Khrapchenkov, Motoaki Kawanabe, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国立信息学研究所) AIRoA ATR

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出NavWAM,一种扩散变换器策略,通过联合学习未来观测、目标进度值和动作块,将导航世界模型预测直接转化为可执行动作,在离线基准和真实机器人部署中优于基于规划的世界模型基线。

Comments Project page: https://dachii-azm.github.io/navwam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12403 2026-06-11 cs.RO 新提交 50%

World Pilot: Steering Vision-Language-Action Models with World-Action Priors

World Pilot: 用世界动作先验引导视觉-语言-动作模型

Zefu Lin, Rongxu Cui, Junjia Xu, Xiaojuan Jin, Wenling Li, Lue Fan, Zhaoxiang Zhang

机构 * Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) Nanjing University(南京大学) Beihang University(北京航空航天大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出World Pilot框架,通过世界动作模型(WAM)的潜在引导和动作引导两条路径,为VLA模型提供场景演化先验和轨迹级运动提示,在LIBERO-Plus零样本OOD基准上达到84.7%的总成功率,并在多个真实机器人操作任务中取得最高成功率。

Comments Project Website: https://world-pilot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11710 2026-06-11 cs.CV 新提交 50%

ERN-Net : Evolving Reason Node-Net for Document Binarization

ERN-Net: 用于文档二值化的演化推理节点网络

Hsin-Jui Pan, Sheng-Wei Chan, Jen-Shiung Chiang

机构 * Dept. of Electrical Engineering Tamkang University(电子工程系 台湾科技大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出ERN-Net,通过演化推理节点和多尺度推理增强退化敏感区域,结合ConvNeXt-Tiny骨干网络和DIBCO预训练,在低数据低内存下实现高效文档二值化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11314 2026-06-11 cs.CV cs.GR 新提交 50%

TRON: Tracing Rays to Orchestrate a Neural Renderer for 3D Gaussian Reconstructions

TRON:追踪光线以编排用于3D高斯重建的神经渲染器

Or Perel, Hassan Abu Alhaija, Zian Wang, Jacob Munkberg, Matan Atzmon, Sanja Fidler, Masha Shugrina

机构 * NVIDIA(英伟达) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出TRON框架,结合3D高斯光线追踪与神经渲染,实现真实世界3D场景在新光照、动态物体运动、物体插入和材质编辑下的逼真可控渲染,通过内在分解先验和光线追踪辐射引导,弥合物理渲染与神经渲染的差距。

Comments Project page: https://research.nvidia.com/labs/sil/projects/tron/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11188 2026-06-10 cs.CV 新提交 50%

ARM: An AutoRegressive Large Multimodal Model with Unified Discrete Representations

ARM: 一种具有统一离散表示的自回归大型多模态模型

Junke Wang, Xiao Wang, Jiacheng Pan, Xuefeng Hu, Feng Li, Jingxiang Sun, Chaorui Deng, Zilong Chen, Yunpeng Chen, Kaibin Tian, Matthew Gwilliam, Hao Chen, Danhui Guan, Kun Xu, Weilin Huang, Zuxuan Wu, Haoqi Fan, Yu-Gang Jiang, Zhenheng Yang

机构 * Shanghai Key Lab of Intelligent Information Processing, Fudan University(复旦大学上海智能信息处理重点实验室) School of Computer Science, Fudan University(复旦大学计算机科学技术学院) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心) Youtu Lab, Tencent(腾讯优图实验室) Meta AI Shanghai AI Laboratory(上海人工智能实验室)

专题命中 预训练与数据 :preference optimization(abstract)

AI总结 提出ARM模型,通过离散语义视觉分词器将图像映射为紧凑token序列,结合自回归建模和强化学习,统一实现图像理解、生成和编辑,并提升任务性能与跨任务协同。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10340 2026-06-10 cs.RO 新提交 50%

OMG: Omni-Modal Motion Generation for Generalist Humanoid Control

OMG: 面向通用人形机器人的全模态运动生成

Siqiao Huang, Kun-Ying Lee, Dongming Qiao, Guanqi He, Zhenyu Wang, Yitang Li, Shaoting Zhu, Hang Zhao

机构 * Tsinghua University(清华大学)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 提出OMG框架,通过精心策划的数据流程和扩散模型,实现基于语言、音频和参考动作的全模态全身控制,展示了最先进的性能和可扩展性。

Comments Project Page: https://tsinghua-mars-lab.github.io/OMG/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07050 2026-06-08 eess.SP 新提交 50%

Optimized Sampling of Angle-Resolved Scatterometry Data Using End-to-End Compressed Learning Model for Nanograss Deficiency Detection

使用端到端压缩学习模型优化角度分辨散射测量数据采样用于纳米草缺陷检测

Mehdi Abdollahpour, Carsten Bockelmann, Armin Dekorsy

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出端到端压缩学习框架,集成可学习纬度采样层与CNN,联合优化采样与分类,在减少90%采样点下保持94.2%的五级缺陷分类精度。

Comments Preprint. 13 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06978 2026-06-08 cs.CV 新提交 50%

CL-CLIP: CLIP-Based Continual Learning Framework with Cost-Volume Category Decoupling for Object Detection

CL-CLIP: 基于CLIP的持续学习框架与代价体积类别解耦用于目标检测

Zihan Liu, Yuguang Yang, Shengjie Su, Jianing Pang, Linlin Yang, Chunyu Xie, Nikolai Yu. Zolotykh, Baochang Zhang

机构 * National College for Excellent Engineers, Beihang University(卓越工程师学院,北京航空航天大学) AI Research, Qihoo 360(360人工智能研究院,奇虎360) School of Electronic Information Engineering, Beihang University(电子信息学院,北京航空航天大学) School of Cyber Science and Technology, Beihang University(网络安全科学与技术学院,北京航空航天大学) School of Computer Science and Engineering, Beihang University(计算机科学与工程学院,北京航空航天大学) State Key Laboratory of Media Convergence and Communication, Communication University of China(媒体融合与传播国家重点实验室,中国传媒大学) Institute of Information Technology, Mathematics and Mechanics, Lobachebsky University(信息技术、数学与力学学院,洛瓦茨基大学) School of Artificial Intelligence, Beihang University(人工智能学院,北京航空航天大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出CL-CLIP框架,通过代价体积引导的类别解耦,增强开放词汇检测器的持续学习能力,缓解灾难性遗忘,在PASCAL VOC和MS-COCO上显著提升F-ViT基线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06569 2026-06-08 cs.RO 新提交 50%

PhyRoGen: Synthetic Generation of Physical Robot Manipulation Puzzles Using Procedural Content Generation

PhyRoGen:使用程序化内容生成物理机器人操作谜题的合成生成

Lennart Julian Droß, Andreas Orthey, Marc Toussaint

机构 * Technical University of Berlin(柏林技术大学) Robotics Institute Germany(德国机器人研究所)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 提出PhyRoGen框架,利用程序化内容生成自动创建机器人操作谜题的合成数据集,生成的24个谜题可在1-300秒内求解,并在物理仿真中验证可操作性。

Comments 8 pages, accepted at CASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 885 篇

2606.22606 2026-06-23 cs.CL cs.LG 新提交 95%

Sub-Billion, Super-Frontier: Small Language Models Rival Zero-Shot Frontier LLMs on General and Literary Relation Extraction

十亿以下,超级前沿:小语言模型在通用和文学关系抽取上媲美零样本前沿LLM

Despina Christou, Grigorios Tsoumakas

机构 * School of Informatics, Aristotle University of Thessaloniki(亚里士多德大学塞萨洛尼基分校信息学院) Archimedes, Athena Research Center(雅典娜研究中心阿基米德实验室)

专题命中 指令微调 :LLM(title_cn,summary_cn);language model(title,abstract);small language model(title,abstract);SLM(summary_cn,abstract_cn)

AI总结 研究小语言模型(SLM)在通用和文学关系抽取任务上能否通过任务适配缩小与零样本前沿LLM的差距,发现4位SLM经微调后性能超越GPT-5.4和Claude Sonnet 4.6,归因于任务适配而非生成解码。

Comments 41 pages, 3 figures, 25 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25063 2026-07-29 cs.AI 新提交 94%

Similar Models Learn Differently: Final-Window Pretraining Shapes Post-Training Beyond SFT

相似模型学习方式不同:最终窗口预训练对训练后行为的塑造超越监督微调

Cen Lu, Yung-Chen Tang, Andrea Cavallaro

专题命中 指令微调 :SFT(title,summary_cn);pretraining(title,abstract);post-training(title,abstract);instruction tuning(abstract)

AI总结 研究探讨模型预训练最后窗口对训练后行为的影响,通过控制实验发现不同预训练最后窗口数据的分支,SFT后表现相近,但后续训练走向不同,安全文本分支有保护效果,表明不能仅依SFT后行为评估模型,还应考虑预训练最后内容。

Comments 16 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19266 2026-06-18 cs.CL cs.AI 新提交 94%

Trade-offs in Medical LLM Adaptation: An Empirical Study in French QA

医学LLM适应中的权衡:法语问答的实证研究

Ikram Belmadani, Oumaima El Khettari, Carlos Ramisch, Frederic Bechet, Richard Dufour, Benoit Favre

机构 * Aix-Marseille Univ., CNRS, LIS UMR 7020(艾克斯-马赛大学,法国国家科学研究中心,LIS UMR 7020) Nantes Univ., École Centrale Nantes, CNRS, LS2N UMR 6004(南特大学,南特中央理工大学,法国国家科学研究中心,LS2N UMR 6004) Grenoble Alpes Univ., CNRS, INRIA, Grenoble INP, LIG UMR 5217(格勒诺布尔阿尔卑斯大学,法国国家科学研究中心,INRIA,格勒诺布尔INP,LIG UMR 5217)

专题命中 指令微调 :LLM(title,title_cn);SFT(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 通过法语医学问答任务,实证比较持续预训练(CPT)和监督微调(SFT)在多个模型家族和规模下的效果,发现CPT+SFT在多项选择问答上最优但增益小,SFT是强且经济的默认选择,而CPT在开放式问答中提升重叠指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01652 2026-08-04 cs.RO cs.AI 新提交 94%

SyncPlan: Long-Horizon LLM Coordination with Explicit Synchronization and Adaptive Correction

SyncPlan:通过显式同步与自适应修正实现长视 Large Language Model(大语言模型,LLM)协调

Shen You, Xiaoming Zhu, Weining Weng, Hefei Mei, Weixuan Wang, Zhongshen Li, Zeji LI, Ye-Wen Wang, Zijun Liao, Juchao Zhuo, Yang Wei, Fuhao Qiu, Siqin Li, Zhenjie Lian, Danei Gong, Junkai Ji, Xiangtao Li, Qiuzhen Lin, Liang Wang, Ka-Chun Wong

专题命中 指令微调 :LLM(title,title_cn);large language model(title_cn);language model(title_cn);SFT(abstract,abstract_cn)

AI总结 SyncPlan 是用于长视 LLM 多智能体协调的“规划-执行-修正”框架,通过显式同步、自适应修正及轻量级计划过时检测器优化,在低耗时下实现了超越现有方法的任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19988 2026-06-19 cs.SE 新提交 94%

Repository-Level Solidity Code Generation with Large Language Models: From Prompting to Fine-Tuning

基于大语言模型的仓库级Solidity代码生成:从提示到微调

Shi Chen, Rongcun Wang, Yuan Tian, Xiaoyuan Xie, Wei Song, Rubing Huang

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(title,abstract)

AI总结 提出SolidityBench基准和SolidityScore指标,评估多种LLM方法在仓库级Solidity代码生成中的表现,发现监督微调最有效。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25956 2026-07-29 cs.AI math.OC 新提交 93%

Large Language Model for Operations Research Formulation Selection in Multi-Warehouse Inventory Allocation

用于多仓库库存分配中运筹学公式选择的大语言模型

Jintao Xu, Yingzheng Ma, Jiong Dong, Yongzhi Qi, Jianshen Zhang

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 研究多仓库库存分配中运筹学公式选择问题,提出求解器引导的大语言模型框架,通过构建SFT记录、转换质量差距为偏好等进行训练,实验表明GRPO能显著提高选择准确性和分配质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02214 2026-07-03 cs.CL eess.AS 新提交 93%

Unlocking Speech-Text Compositional Powers: Instruction-Following Speech Language Models without Instruction Tuning

解锁语音-文本组合能力:无需指令微调的指令跟随语音语言模型

Congrui Du, Yang Zhang, Kaizhi Qian, Shiyu Chang

机构 * University of California, Santa Barbara, USA(加州大学圣芭芭拉分校) MIT-IBM Computing Research Lab, IBM Research, USA(麻省理工-IBM计算研究实验室,IBM研究)

专题命中 指令微调 :LLM(summary_cn,abstract);language model(title,abstract);instruction tuning(title,abstract);SLM(abstract,abstract_cn)

AI总结 提出SpeechCombine,通过单轮30k小时语音预训练和权重组合,无需指令微调即可实现指令跟随,有效将文本LLM能力迁移至语音域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21974 2026-06-23 quant-ph cs.AI 新提交 93%

Fine-Tuning Large Language Models for Quantum Reasoning

微调大型语言模型用于量子推理

Katherine Ip, Casey R. Myers, Udaya Parampalli, James Quach, Peiyong Wang

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算机与信息系统学院) School of Physics, Mathematics and Computing, The University of Western Australia(西澳大学物理、数学与计算学院) Pawsey Supercomputing Centre(帕韦西超级计算中心) CSIRO Clayton(CSIRO 克莱顿分校)

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 提出通过量子电路模拟微调LLM,比较监督微调与两阶段SFT+GRPO方法,实现量子推理能力提升。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16231 2026-06-16 cs.LG cs.AI 新提交 93%

From Tokens to Regions: CUDA-Sensitive Instruction Tuning for GPU Kernel Generation

从令牌到区域:面向GPU内核生成的CUDA敏感指令微调

Wentao Chen, Jiace Zhu, Xing Zhe Chai, Zeng Qu, Qiaoling Xiao, Liucheng Duan, An Zou

机构 * Shanghai Jiao Tong University(上海交通大学) Biren Technology(壁仞科技)

专题命中 指令微调 :LLM(summary_cn,abstract);SFT(summary_cn,abstract);instruction tuning(title);large language model(abstract)

AI总结 提出CuSeT方法,通过自适应令牌级掩码和区域感知样本重加权,在简单SFT框架内提升LLM生成CUDA内核的功能正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09932 2026-06-10 cs.LG cs.AI 新提交 93%

When RL Fails after SFT: Rejuvenating Model Plasticity for Robust SFT-to-RL Handoff

当强化学习在监督微调后失效:恢复模型可塑性以实现稳健的SFT到RL交接

Runze Liu, Jiashun Liu, Xu Wan, Yuqian Fu, Ling Pan

机构 * Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学) State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,CASIA)

专题命中 指令微调 :SFT(title,title_cn);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对SFT过度训练导致RL阶段改进有限的问题,提出Rejuvenation方法,通过基模型锚定融合和神经元重置恢复模型可塑性,在数学推理和智能体任务上提升RL性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13681 2026-08-17 cs.SE cs.AI cs.ET 新提交 93%

Fine-Tuning Qwen3-27B for C-to-Rust Code Translation: A Three-Stage Curriculum of Pretraining, Debugging-Aware SFT, and Task-Specific SFT

微调Qwen3-27B实现C到Rust代码翻译:预训练、调试感知监督微调与任务特定监督微调的三阶段课程

Pu Zhao, Changdi Yang, Yixiao Chen, Yi Gao, Yifan Cao, Haochen Zeng, Yanzhi Wang

专题命中 指令微调 :SFT(title,abstract);pretraining(title,abstract);LLM(summary_cn,abstract_cn);large language model(abstract)

AI总结 本研究针对C到Rust代码翻译任务,对Qwen3-27B采用三阶段微调课程,结合SACTOR框架评估后,其性能优于基线模型及其他LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10187 2026-08-12 cs.IR cs.SI 新提交 93%

ConnectionMind: Leveraging Social Networks and Large Language Models for Personalized Recommendation at Meta

ConnectionMind:利用社交网络与大语言模型实现 Meta 平台的个性化推荐

Haoyu Han, Yuming Liu, Lei Huang, Lizhu Zhang, Jiliang Tang, Xiangjun Fan

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn)

AI总结 该研究提出 ConnectionMind 框架,结合社交网络与 LLM,经两阶段学习训练后,在 Meta 部署并通过 A/B 测试实现视频观看时长 0.43% 的提升,解决传统推荐模型的多关系上下文整合不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22402 2026-06-23 cs.SE cs.AI cs.CL cs.LG 新提交 93%

Reinforcement learning to improve large language model-based automated code compliance systems

强化学习改进基于大语言模型的自动化代码合规系统

Jack Wei Lun Shi, Minghao Dang, Wawan Solihin, Leong Hien Poh, Justin K. W. Yeoh

机构 * National University of Singapore(新加坡国立大学) Harbin Institute of Technology(哈尔滨工业大学) NovaCITYNETS

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn)

AI总结 提出P4IR两阶段框架,先通过监督微调注入领域知识,再用GRPO优化高层代码骨架的准确性,在零样本设置下优于多个领先大语言模型。

Comments 22 pages, 12 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏