arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-30 至 2026-07-30 共收录 52 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 52 篇

2607.27172 2026-07-30 cs.IR cs.AI 新提交 92%

Improving Item Discoverability in e-Commerce Search via Related Intent Generation

通过相关意图生成提升电商搜索中的商品可发现性

Ji Xin, Xiao Xiao, Ishan Bhatt, Vinesh Gudla, Trace Levinson, Raochuan Fan, Shishir Kumar Prasad, Prakash Putta, Tejaswi Tenneti

专题命中 效率与部署 :LLM(summary_cn,abstract);SLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究提出两阶段混合架构的发现增强型搜索系统,通过LLM和微调SLM提升电商搜索的商品可发现性,将查询流量发现覆盖率从60%提至80%,成本仅为教师模型的30%,还可平衡市场供给。

Comments Accepted to KDD 2026 TSMO

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26602 2026-07-30 cs.NI cs.LG 新提交 92%

Harnessing Large Language Models for Intelligent Resource Allocation in the Internet of Everything

利用大语言模型实现万物互联环境下的智能资源分配

Haijun Zhang, Zhuojun Duan, Zijun Wu, Xu Ma, Yuzheng Ren

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 该研究针对万物互联的动态资源调度挑战,提出大语言模型驱动的资源分配方案,构建多维调度决策模型并引入反馈模块,仿真显示其在收敛速度等指标上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26491 2026-07-30 cs.AR cs.AI cs.ET cs.LG 新提交 92%

LLMET: Enabling Cross-Layer Evaluation of Emerging M3D Memories for Energy-Efficient LLM Serving

LLMET:支持新兴M3D存储器的跨层评估以实现高能效LLM服务

Ming-Yen Lee, Hanchen Yang, Faaiq Waqar, Harsono Simka, Tushar Krishna, Muhammed Ahosan Ul Karim, Shimeng Yu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究开发跨层仿真框架LLMET,通过实验证实采用M3D技术扩展片上缓存可显著降低不同平台及场景下LLM服务的预填充、解码阶段能耗,为高能效LLM服务系统提供新方案。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26571 2026-07-30 cs.LG cs.SE 新提交 92%

From Tokens to Watt-hours: Analytical Energy Estimation for LLM Inference on Modern GPUs

从Token到瓦时:现代GPU上大语言模型(LLM)推理的分析式能耗估算

Tina Vartziotis, Rodopi Kosteli, Elli Vartziotis, George Dasoulas, Michael Keckeisen, Konstantinos Skianis, Sotirios Kotsopoulos, Francesca Dominici

机构 * National Technical University of Athens(雅典国家技术大学) Harvard University(哈佛大学) TWT GmbH Science & Innovation(TWT有限责任公司科学与创新部) NIKI Ltd Digital Engineering(尼基数字工程有限公司) University of Ioannina(约阿尼纳大学) National and Kapodistrian University of Athens(雅典国立卡波迪斯特里亚大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究提出一种无需直接测量的GPU级LLM推理能耗分析估算方法,适用于模型比较、绿色编码分析及设计时评估。

Comments 20 pages, 3 figures, 6 tables. Accepted for oral presentation at the GREEN-AI Workshop, co-located with ECML-PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07246 2026-07-30 cs.CL 版本更新 92%

Ensembling LLM-Induced Decision Trees for Explainable and Robust Error Detection

集成LLM诱导决策树用于可解释和鲁棒的错误检测

Mengqi Wang, Jianwei Wang, Qing Liu, Xiwei Xu, Zhenchang Xing, Liming Zhu, Michael Bain, Wenjie Zhang

机构 * UNSW Sydney(新南威尔士大学悉尼分校) Data61, CSIRO(Data61, 澳大利亚联邦科学与工业研究组织)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出集成LLM诱导决策树的方法,用于可解释和鲁棒的错误检测,通过多棵树集成提升检测准确性与鲁棒性。

Comments 15 pages, 7 figures. Accepted at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09695 2026-07-30 cs.SE 版本更新 91%

How well LLM-based test generation techniques perform with newer LLM versions?

基于新版本LLM的测试生成技术表现如何?

Michael Konstantinou, Renzo Degiovanni, Mike Papadakis

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了基于新版本LLM的测试生成技术表现,发现纯LLM方法在覆盖率和变异评分上优于现有方法,且成本相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18553 2026-07-30 cs.LG cs.DS cs.IT math.IT 91%

The Geometry of LLM Quantization: GPTQ as Babai's Nearest Plane Algorithm

LLM量化几何学:GPTQ作为Babai最近平面算法

Jiale Chen, Yalda Shabanzadeh, Elvir Crnčević, Torsten Hoefler, Dan Alistarh

机构 * Institute of Science and Technology Austria (ISTA)(奥地利科学技术院) Red Hat, Inc.(红帽公司) ETH Zürich(苏黎世联邦理工学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文将GPTQ与Babai最近平面算法等价,揭示其几何意义和误差上界,设计出无裁剪的量化方法并提供高效GPU内核,为大规模模型量化理论奠定基础。

Comments Published as a conference paper at the Fourteenth International Conference on Learning Representations (ICLR 2026): https://openreview.net/forum?id=NFB4QGGS65

Journal ref International Conference on Learning Representations, 2026, pp. 122653-122695

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20535 2026-07-30 cs.CL cs.AI 版本更新 91%

ARC-Encoder: learning compressed text representations for large language models

ARC-Encoder:为大语言模型学习压缩文本表示

Hippolyte Pilchen, Edouard Grave, Patrick Pérez

机构 * Kyutai

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 ARC-Encoder是可将文本压缩为原词元数1/4或1/8的编码器,适配多类LLM解码器,在提升推理效率的同时保持最优性能,为大语言模型提供灵活高效的上下文压缩方案。

Comments Featured Certification

Journal ref Transactions on Machine Learning Research 2026 (https://openreview.net/forum?id=lU1P9dsqfn)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27081 2026-07-30 cs.AI cs.CL cs.CR cs.LG 新提交 90%

On-Policy Distillation for LLM Safety: A Routing Approach to Template-Robust Realignment

面向大语言模型安全的在线策略蒸馏:一种针对模板鲁棒性的重对齐路由方法

Yongjian Guo, Wanlun Ma, Lingyu Shen, Xi Xiao, Sheng Wen

机构 * Tsinghua University(清华大学) Swinburne University of Technology(斯威本科技大学) EPFL(洛桑联邦理工学院)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对现有LLM安全防御的模板鲁棒性不足等问题,提出ROPD框架,通过建模输出分布差异实现重对齐,大幅降低模板不匹配风险,在防御有效性和能力保留上优于基线方法,建立了新的鲁棒重对齐标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27090 2026-07-30 cs.DC cs.LG 新提交 90%

InferScale: GPU-Native KV Injection for Personalized LLM Serving

InferScale:面向个性化大语言模型服务的原生GPU KV注入方案

Peter Li, Prashant Pandey

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 InferScale是原生GPU的LLM内存系统,通过可复用KV状态替代重复提示词预填充,引入Chunked RoPE与上下文窗口编码,在LoCoMo数据集上显著降低TTFT、提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26967 2026-07-30 cs.CL 新提交 90%

Generation or Judgement? A Paradigm Perspective on LLM-Based Emotion-Cause Pair Extraction in Conversation

生成还是判断?基于范式视角的对话中基于大语言模型(LLM)的情感-原因对抽取

Weijie Feng, Hongchuang Wang, Binbin Liu, Zhiyong Cheng

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 该研究针对对话情感-原因对抽取,对比LLM的生成与判断范式,发现对级判断更优,引入辅助检索器后在三个数据集上实现F1提升,明确任务分解与候选范围的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26631 2026-07-30 cs.LG cs.IR 新提交 90%

RAG-HAR+: Towards Cost-Efficient LLM-Based Human Activity Recognition for Edge Deployment

RAG-HAR+: 面向边缘部署的成本高效型基于大语言模型(LLM)的人类活动识别

Hansi Karunarathna, Nirhoshan Sivaroopan, Chamara Madarasingha, Anura Jayasumana, Kanchana Thilakarathna

机构 * University of Sydney(悉尼大学) Curtin University(科廷大学) Colorado State University(科罗拉多州立大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 RAG-HAR+是面向边缘部署的成本高效型LLM辅助HAR方案,通过检索设计智能体优化特征、对确定样本用多数投票、仅不确定样本用LLM,在六基准上性能相当或更优且降低了LLM相关开销。

Comments Submitted to IEEE Transactions on Mobile Computing. Extended version of the IEEE PerCom 2026 paper "RAG-HAR: Retrieval Augmented Generation-based Human Activity Recognition." (https://doi.org/10.1109/PerCom67906.2026.11524560)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06256 2026-07-30 cs.AI 版本更新 90%

RedKnot: Efficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention

RedKnot: 基于头部感知的KV重用和SegPagedAttention的高效长上下文LLM服务

Yang Liu, Zhaokai Luo, Huayi Jin, Zhiyong Wang, Ruozhou He, Boyu Wang, Guanjie Chen, Tao Xie, Junhao Hu

机构 * Xiaohongshu Inc., China(小红书公司,中国) Peking University(北京大学) Huawei Cloud(华为云)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出RedKnot系统,通过按KV头分解缓存并采用SegPagedAttention,实现位置无关的KV重用、前缀压缩、冷热分离和分布式放置,在不重训练模型的情况下提升资源效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26633 2026-07-30 cs.AR 新提交 89%

NELSSA: A GPU-PNM Heterogeneous System for Mixed-Length LLM Serving via Length-based Request Placement

NELSSA:一种基于GPU-PNM异构系统的LLM混合长度服务框架,通过基于长度的请求放置实现

Sookyung Choi, Seungyong Lee, Kangkyu Park, Yunseo Chun, Junseok Lee, Hyeongseok Gwak, Myunghyun Rhee, Euiseok Kim, Donguk Moon, Kwangsik Shin, Guseul Heo, Youngpyo Joo, Hoshik Kim, Jongse Park

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 NELSSA是集成GPU与PNM加速器的LLM服务系统,通过基于长度的请求放置处理混合长度工作负载,解码吞吐量最高提升5.5倍,P99延迟最高降低15倍,为LLM基础设施提供新范式。

Comments 14 pages, 19 figures. Accepted to the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26891 2026-07-30 cs.CL 新提交 89%

DIRECT: Direct Decoding for Efficient and Aligned Sequence Labeling with Large Language Models

DIRECT:基于大语言模型的高效对齐序列标注直接解码方法

Yilei Wang, Jiaxin Gan, Kexuan Zhang, Ling Li, Wentao Zhang, Peichao Lai

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.CL

AI总结 针对现有大语言模型序列标注方法的领域对齐不足与推理效率低问题,提出DIRECT框架,结合训练时优化与推理时校正,在8个数据集上实现性能与效率的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22663 2026-07-30 cs.AI 版本更新 89%

Beyond Block Boundaries: Multi-Block Editing for Diffusion Large Language Models

超越块边界:扩散大语言模型的多块编辑

Xingyu Mou, Zijin Huang, Tianze Zhang, Yuxin Ma, Lanning Wei, Zengfeng Huang, Da Zheng, Lun Du

机构 * Ant Group(蚂蚁集团) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新院)

专题命中 效率与部署 :language model(title,abstract);large language model(title);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 研究针对块扩散语言模型的块边界问题,提出多块编辑(MBE)方法。通过无需训练的解码算法编辑前序块令牌,引入监督微调策略,扩展SGLang提升效率。实验表明该方法在保持吞吐量时优于基线,在长程一致性任务上有显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01043 2026-07-30 cs.LG cs.AI 版本更新 88%

Low-Precision Training of Large Language Models: Methods, Challenges, and Opportunities

大语言模型的低精度训练:方法、挑战与机遇

Zhiwei Hao, Jianyuan Guo, Li Shen, Yong Luo, Han Hu, Guoxia Wang, Dianhai Yu, Yonggang Wen, Dacheng Tao

机构 * School of Information and Electronics, Beijing Institute of Technology(信息与电子学院,北京理工大学) Department of Computer Science, City University of Hong Kong(计算机科学系,香港城市大学) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(网络科学与技术学院,中山大学深圳校区) School of Computer Science, Wuhan University(计算机科学学院,武汉大学) Baidu Inc.(百度公司) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本综述全面梳理大语言模型低精度训练方法,按数值格式分类并探讨相关挑战、鲁棒性及研究方向,助力统一该领域研究视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26475 2026-07-30 cs.DC 新提交 87%

DualDecoder: Accelerate Long Context LLM Inference by Predictive Prefetch

DualDecoder:通过预测预取加速长上下文大语言模型推理

Zuning Liang, Zhiyi Yao, Qi Chen, Yuedong Xu, Hao Dai, Zhiqiang Ding, Tongkai Yang, Jinlong Hou, Yuan Cheng

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 该研究针对长上下文LLM推理的内存墙瓶颈,提出轻量级服务系统DualDecoder,通过双token解码流水线预测预取关键KV条目,消除辅助状态开销,使解码吞吐量最高提升2.62倍且保留延迟与模型质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17109 2026-07-30 cs.LG 版本更新 86%

SENSE: Efficient EEG-to-Text via Privacy-Preserving Semantic Retrieval

SENSE:通过隐私保护的语义检索实现高效的EEG到文本

Akshaj Murhekar, Christina Liu, Abhijit Mishra, Shounak Roychowdhury, Jacek Gwizdka

机构 * School of Information, The University of Texas at Austin(信息学院,德克萨斯大学奥斯汀分校)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SENSE通过本地语义检索和提示语言生成,实现无需微调LLM的EEG到文本转换,提升效率并保护隐私。

Comments Accepted to ACM International Conference on Multimodal Interaction 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24192 2026-07-30 cs.IT cs.CL cs.LG math.IT 版本更新 86%

LLM-based Source Code Compression via Thresholded Symbol Ranking

基于阈值符号排序的基于大语言模型的源代码压缩

Angelo Nardone, Paolo Ferragina

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究基于大语言模型的源代码无损压缩问题,提出两种阈值符号排序变体,将预测限制在前\(T\)个排名,通过通用压缩器联合压缩阈值外符号。实验表明该方法在压缩率和吞吐量上优于此前方法,在压缩速度频谱中提供新权衡点。

Comments This is the version of the paper submitted and then accepted for presentation at the 24th International Conference of the Italian Association for Artificial Intelligence (AIxIA 2026), Perugia, Italy, 6--9 October 2026. The paper will appear in the proceedings, published by Springer Verlag in the Lecture Notes in Artificial Intelligence (LNAI) series

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27205 2026-07-30 cs.CV cs.RO 新提交 86%

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

TurboVLA:在RTX 4090上以32 Hz运行、显存占用<1 GB的实时视觉-语言-动作模型

Hengyi Xie, Chenfei Yao, Xianjin Wu, Xuanyang Xi, Yiping Tang, Di Xu, Yingying Zhu, Dingkang Liang, Xiang Bai, Han Ding

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Technologies Co. Ltd(华为技术有限公司)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出TurboVLA,将传统VLA模型的LLM中心路径重构为视觉语言直接映射,仅0.2B参数即可在RTX 4090上实现97.7%LIBERO任务成功率,性能优于更大模型且显存占用极低。

Comments Code is available at https://github.com/H-EmbodVis/TurboVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02184 2026-07-30 cs.DL cs.LG 版本更新 83%

The Ghost Couple: Correlated LLM Name Priors and Their Haunting of the Web and Academic Publishing

幽灵搭档:相关的大语言模型姓名先验及其对网络和学术出版的困扰

Michał Brzozowski, Neo Christopher Chung

机构 * Samsung AI Center(三星人工智能中心) University of Warsaw(华沙大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究发现大语言模型生成虚构专家姓名时会产生相关性强的角色组合,这些组合具有模型家族特异性,并在Zenodo等平台造成大量幽灵作者记录,影响学术出版。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02092 2026-07-30 cs.CR cs.AI 版本更新 83%

FPEdit: Robust LLM Fingerprinting through Localized Parameter Editing

FPEdit:通过局部参数编辑实现鲁棒的大语言模型指纹技术

Shida Wang, Chaohu Liu, Yubo Wang, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FPEdit通过局部参数编辑注入语义连贯自然语言指纹,解决现有指纹技术的局限,实现高指纹保留率、抗检测性与模型效用保留,大幅降低资源需求,用于大语言模型来源验证。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26554 2026-07-30 cs.CV 新提交 82%

MedARC: Training-Free Adaptive Redundancy Compression of Visual Tokens for 3D Medical Vision-Language Models

MedARC:面向3D医学视觉-语言模型的无训练视觉令牌自适应冗余压缩

Yitao Zhu, Mengjun Liu, Yingji Fu, Haowen Pang, Anqi Qiu

专题命中 效率与部署 :language model(title,abstract);foundation model(abstract)

AI总结 针对3D医学VLMs的视觉令牌冗余压缩问题,本文提出无训练框架MedARC,整合三类线索估计令牌重要性,通过显著性感知合并策略压缩令牌,在CT-RATE和MR-RATE上实现性能保持的同时降低开销。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26339 2026-07-30 cs.LG cs.CR cs.IR 新提交 81%

RAGuard: A Layered Defense Framework for Retrieval-Augmented Generation Systems Against Data Poisoning

RAGuard:一种针对检索增强生成系统数据中毒的分层防御框架

Pushkal Kumar, Tucker Nielson, Tanish Kolhe, Shubham Zala, Vincent Li

专题命中 效率与部署 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.LG

AI总结 该研究针对RAG系统的语料库中毒攻击,提出分层防御框架RAGuard,含对抗微调检索器与ZKIP两层,可将攻击成功率降至0,且保持检索性能,相关资源已开源。

Comments Accepted to NeurIPS ResponsibleFM 2025, AAAI FrontierIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26076 2026-07-30 cs.IR cs.AI 新提交 81%

FinCacheServe: Dependency-Consistent Answer Reuse for Cost-Efficient RAG Serving over Mutable Enterprise Documents

FinCacheServe:面向可变企业文档的高性价比RAG服务的依赖一致答案复用

Lingteng Zeng, Yifan Jin

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 FinCacheServe为可变企业文档的RAG服务设计依赖一致的答案复用机制,可跳过大量LLM调用,相比现有方法能降低能耗,提升服务成本效率。

Comments 16 pages, 11 figures, 12 tables; preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26805 2026-07-30 cs.SE 新提交 80%

MRCoder: An Efficient Context Selecting Approach for Repository-Level Code Generation

MRCoder:一种面向仓库级代码生成的高效上下文选择方法

Peiding Wang, Li Zhang, Fang Liu

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 MRCoder是一种基于Map-Reduce范式的仓库级代码生成上下文选择框架,通过SADGS策略和并行验证,在提升代码生成准确率的同时降低了token消耗与推理时间。

Comments Under review in TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26784 2026-07-30 cs.LG cs.AI 新提交 79%

SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution

SkillRise:面向跨任务技能演化的智能体强化学习

Zhiyuan Yao, Yuxin Chen, Zhengxi Lu, Zishan Xu, Yueqing Sun, Yifu Guo, Yuquan Lu, Zhengzhou Cai, Kangning Zhang, Zhuowen Han, Zi-Han Wang, Ziang Ye, Qi Gu, Xunliang Cai, Weiwen Liu, Yongliang Shen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Meituan(美团)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SkillRise是跨任务学习技能的统一强化学习框架,解耦信用分配机制实现任务求解与技能整理,在多基准上Pass@1性能优于基线,还降低了运行开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19450 2026-07-30 cs.LG cs.AI 版本更新 79%

REGEN: Replay-recycling for Expert-to-Generalist distillation with Offline Reinforcement Learning

REGEN:用于从专家到通用模型蒸馏的离线强化学习的重放回收

Yunjie Chen, Xiaoxin Chen, Fang Wang

机构 * vivo AI Lab(vivo人工智能实验室) Department of Computer Science, Sun Yat-Sen University(中山大学计算机科学系)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对大语言模型强化学习扩展的挑战,提出REGEN方法,通过回收重放记忆并运用离线强化学习算法训练通用模型,解耦训练过程,降低成本,在多任务上以低成本达类似准确率,还可能变革在线强化学习及扩展训练阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02258 2026-07-30 cs.CV 版本更新 78%

SpectraDINO: Modality-Conditioned Adaptation of RGB Vision Foundation Models Across Infrared Bands

SpectraDINO:跨红外波段的RGB视觉基础模型的模态条件适配

Yagiz Nalcakan, Hyeongjin Ju, Incheol Park, Sanghyeop Yeo, Youngwan Jin, Shiho Kim

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 SpectraDINO是适配RGB视觉基础模型的跨红外波段统一骨干网络,通过分阶段蒸馏与微调技术,在7个检测和分割基准上性能优于或媲美特定模态方法。

Comments Updated with the revised model results

详情

展开后加载摘要…

URL PDF HTML 收藏