arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-29 至 2026-05-29 共收录 535 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 125 篇

2601.08064 2026-05-29 cs.CL 70%

Calibration Is Not Enough: Evaluating Confidence Estimation Under Language Variations

校准还不够:评估语言变化下的置信度估计

Yuxi Xia, Dennis Ulmer, Terra Blevins, Yihong Liu, Hinrich Schütze, Benjamin Roth

机构 * Faculty of Computer Science, UniVie Doctoral School Computer Science(计算机科学系,维也纳大学计算机科学博士学院) Faculty of Philological and Cultural Studies, University of Vienna, Austria(文学与文化研究系,维也纳大学,奥地利) ILLC, University of Amsterdam, Netherlands(阿姆斯特丹大学ILLC,荷兰) Khoury College of Computer Sciences, Northeastern University, USA(东北大学计算机科学学院,美国) LMU Munich, Munich Center for Machine Learning (MCML), Germany(慕尼黑大学,慕尼黑机器学习中心(MCML),德国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一个基于鲁棒性、稳定性和敏感性的新评估框架,揭示现有置信度估计方法在区分语义不同答案方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30174 2026-05-29 cs.CV 67%

LiveSVG: Zero-Shot SVG Animation via Video Generation

LiveSVG:通过视频生成的零样本SVG动画

Matan Levy, Ran Margolin, Bar Cavia, Dvir Samuel, Yael Pritch, Shmuel Peleg, Alex Rav Acha, Ariel Shamir, Dani Lischinski

机构 * Google(谷歌) The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Bar-Ilan University(巴伊兰大学) Reichman University(雷赫曼大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出LiveSVG方法,利用视频扩散模型直接拟合目标视频实现零样本SVG动画,无需骨架或类别先验,通过双层运动表示和球体填充重着色策略解决复杂运动与颜色歧义问题。

Comments Project Page: https://levymsn.github.io/LiveSVG

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29579 2026-05-29 cs.CV 67%

ReactBench: A Cause-Driven Benchmark for Multimodal Hallucination via Systematic Evaluation

ReactBench:通过系统评估的多模态幻觉因果驱动基准

Shizhe Zhou, Bohan Jia, Kai Wu, Yan Shen, Tongyun Li, Yuyang Wu, Shaohui Lin

机构 * East China Normal University(华东师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出ReactBench基准,通过对抗性图像和诱导幻觉的查询,系统评估多模态大模型在关系擦除、反事实属性、变化追踪和密集计数等任务中的因果幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29490 2026-05-29 cs.SE cs.CR 67%

CODEFUSE-DEBENCH: An Empirical Study on Readability, Recompilability, and Functionality

CODEFUSE-DEBENCH: 关于可读性、可重编译性和功能性的实证研究

Puzhuo Liu, Yuhan Huang, Jianlei Chi, Peng Di, Yu Jiang

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出基于可重用性的多维反编译评估范式,通过DEBENCH框架在可读性、可重编译性和功能性三个维度上评估主流反编译器,发现反编译器引擎比修复模型对功能影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29372 2026-05-29 cs.SE 67%

On the Road to Personalized Code Intelligence: Portraiting and Assisting Developers Based on Their In-IDE Behaviors

通往个性化代码智能之路:基于IDE内行为的开发者画像与辅助

Yuhong Liu, Yunhe Su, Zhipeng Peng, Zhiwen Luo, Lin Shi, Zhi Jin, Li Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出VirtualME数据基础设施,通过捕获和解释开发者在IDE中的动态编程行为,构建四维开发者画像,并集成到问答代理中实现个性化代码智能,实验显示平均提升33.80%。

Comments 23 pages, 6 figures, accepted by FSE`2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29339 2026-05-29 cs.CV 67%

DMC-CF: Dynamic Multimodal CounterFactual QA benchmark for Causal Reasoning

DMC-CF: 用于因果推理的动态多模态反事实QA基准

Junzhe Zhang, Huixuan Zhang, Guirong Wang, Xingyao Zhang, Pei Liu, Lin Qu, Hu Wei, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对现有因果推理数据集规模有限或基于非真实数据的问题,提出基于真实视频的大规模多模态因果反事实推理基准DMC-CF-Static,并利用动态图干预框架构建动态评估基准DMC-CF-Dynamic,实验表明当前多模态大模型在真实场景下的因果推理能力仍需大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09569 2026-05-29 cs.SE 67%

MigrationBench: Repository-Level Code Migration Benchmark from Java 8

MigrationBench:从Java 8的仓库级代码迁移基准

Linbo Liu, Xinle Liu, Qiang Zhou, Lin Chen, Yihan Liu, Hoan Nguyen, Behrooz Omidvar-Tehrani, Xi Shen, Jun Huan, Omer Tripp, Anoop Deoras

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出MigrationBench基准,用于评估大语言模型在从Java 8迁移到Java 17/21的仓库级代码迁移任务上的表现,并设计了智能体框架实现高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23222 2026-05-29 cs.LG cs.AI stat.ML 62%

Dataset-Driven Channel Masks in Transformers for Multivariate Time Series

数据集驱动的Transformer通道掩码用于多变量时间序列

Seunghan Lee, Taeyoung Park, Kibok Lee

机构 * Department of Statistics and Data Science, Yonsei University(延世大学统计与数据科学系) LG AI Research(LG人工智能研究)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出部分通道依赖(PCD)概念,通过数据集特定的通道掩码(CMs)改进Transformer中的通道依赖建模,并在多种任务和数据集上验证有效性。

Comments ICASSP 2026. Preliminary version: NeurIPS Workshop on Time Series in the Age of Large Models 2024 (Oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29218 2026-05-29 cs.AI cs.CL 62%

GTA: Generating Long-Horizon Tasks for Web Agents at Scale

GTA:大规模生成面向Web智能体的长程任务

Tenghao Huang, Kung-Hsiang Huang, Prafulla Kumar Choubey, Yilun Zhou, Muhao Chen, Jonathan May, Chien-Sheng Wu

机构 * University of Southern California(南加州大学) Salesforce AI Research(Salesforce人工智能研究) University of California, Davis(加州大学戴维斯分校)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出GTA框架,通过集成爬取、检索式种子生成、上下文内生成和自动质量控制,为Web智能体生成带可执行轨迹的真实长程任务,解决现有基准缺乏过程监督和可扩展性问题。

Comments Published at Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06063 2026-05-29 cs.AI cs.IT cs.LG math.IT 62%

TelecomTS: A Multi-Modal Observability Dataset for Time Series and Language Analysis

TelecomTS:面向时间序列与语言分析的多模态可观测性数据集

Austin Feng, Andreas Varvarigos, Ioannis Panitsas, Daniela Fernandez, Jinbiao Wei, Yuwei Guo, Jialin Chen, Ali Maatouk, Leandros Tassiulas, Rex Ying

机构 * Yale University(耶鲁大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TelecomTS,一个来自5G电信网络的大规模多模态可观测性数据集,通过保留绝对尺度信息的异质协变量和多样化下游任务(异常检测、根因分析、多模态问答),揭示了现有模型在处理可观测性数据的高噪声、突变特性时的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30154 2026-05-29 cs.LG 57%

RL2ML: Finite-Rollout Surrogate Objectives from Reinforcement Learning to Maximum Likelihood

RL2ML: 从强化学习到最大似然的有限rollout替代目标

Yifu Zheng

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文提出RL2ML系列有限rollout替代目标,具有闭式无偏梯度估计,连接标准强化学习、类最大似然训练及超越最大似然目标,并揭示群体级更新尺度相变,将剩余自由度转化为一维优化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30090 2026-05-29 cs.CL cs.CV 57%

DirectorBench: Diagnosing Long-Form Video Generation with Personalized Multi-Agent Evaluation

DirectorBench: 通过个性化多智能体评估诊断长视频生成

Jiamin Chen, Qianben Chen, Jiawen Zhang, Yidi Wu, Yuchen Li, Xiaokun Zhang, Wangchunshu Zhou, Chen Ma

机构 * ByteDance Inc.(字节跳动公司) City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 提出DirectorBench,一种基于多智能体的诊断基准,通过80个结构化元数据、7个用户画像和40个检查点标准,在脚本、视觉、音频、跨模态和稳定性五个维度上评估长视频生成,并定位瓶颈和用户偏好依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29615 2026-05-29 cs.CV cs.CL 57%

DiffSpot: Can VLMs Spot Fine-Grained Visual Differences in Web Interfaces?

DiffSpot:VLM能发现网页界面中的细微视觉差异吗?

Linhao Zhang, Aiwei Liu, Yuan Liu, Xiao Zhou

机构 * WeChat AI, Tencent Inc(腾讯公司)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出DiffSpot基准,通过CSS属性突变生成可控图像对,评估视觉语言模型在网页界面中检测细微视觉差异的能力,发现最佳模型仅识别40.7%的真实变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29041 2026-05-29 cs.AI 57%

Practitioner Beliefs and Behaviors in AI-Enhanced Education: DOT Framework Survey Evidence

AI增强教育中的从业者信念与行为:DOT框架调查证据

David Gibson, M. Elizabeth Azukas, Gerald Knezek

机构 * Curtin University(Curtin 大学) Georgia Tech Research Institute(佐治亚理工研究学院) Georgia Institute of Technology(佐治亚理工学院) University of North Texas(北卡罗来纳州立大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 基于DOT框架,通过横截面调查(n=72)探究高等教育从业者对AI整合的信念、行为及制度条件,发现从业者支持AI教学辅助但强调人类监督,且设计导向实践与理论存在差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28975 2026-05-29 cs.LG 57%

A Training-Time Diagnostic for Generalization via the Log-Alignment Ratio

基于对数对齐比率的训练时泛化诊断

Ali Shehper, Ashish Vaswani

机构 * Essential AI

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 提出对数对齐比率(LAR)作为参数-激活对齐的度量,通过捕捉训练中权重谱与激活谱的扩散来跟踪记忆与泛化的转换,并在grokking和语言模型预训练中预测泛化差距。

Comments 32 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30282 2026-05-29 cs.RO 50%

Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation

Gaze2Act: 基于注视条件的视觉-语言-动作策略用于交互式机器人操作

Kuangji Zuo, Gen Li, Bofan Lyu, Yanshuo Lu, Boyu Ma, Shijia Han, Xinyu Zhou, Xichen Yuan, Chuhao Zhou, Jiaqi Bai, Geng Li, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(MARS实验室,南洋理工大学)

专题命中 评测与基准 :prompting(abstract)

AI总结 提出Gaze2Act框架,通过将人类注视作为动态意图信号,结合跨视角语义匹配和策略级条件化,实现机器人对复杂交互任务的精确操作。

Comments Project page: https://zuo-kuangji.github.io/Gaze2Act/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30115 2026-05-29 cs.CV 50%

Large Depth Completion Model from Sparse Observations

来自稀疏观测的大深度补全模型

Zhu Yu, Zhengyi Zhao, Runmin Zhang, Lingteng Qiu, Kejie Qiu, Yisheng He, Siyu Zhu, Zilong Dong, Si-Yuan Cao, Hui-Liang Shen

机构 * Zhejiang University(浙江大学) Tongyi Lab, Alibaba Group(阿里云实验室) Fudan University(复旦大学) Ningbo Innovation Center, Zhejiang University(宁波创新中心,浙江大学) NingboTech University(宁波科技学院) Jinhua Institute of Zhejiang University(金华大学浙大研究院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出LDCM,利用单目基础模型和基于泊松的深度初始化策略,结合点图头回归3D坐标,实现稀疏观测下的度量准确深度补全。

Comments ICLR 2026. Project webpage: https://pkqbajng.github.io/ldcm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29330 2026-05-29 cs.CV 50%

EarthShift: a benchmark for measuring robustness to real-world distribution shifts in Earth observation

EarthShift: 衡量地球观测中真实分布偏移鲁棒性的基准

Kelsey Doerksen, Hannah Kerner

机构 * School of Computing and Augmented Intelligence(计算与增强智能学院) Arizona State University(亚利桑那州立大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出EarthShift基准,通过多源配对数据集评估地理空间基础模型在时间、地理、尺度、传感器等真实分布偏移下的鲁棒性,发现模型性能平均下降15-20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29178 2026-05-29 cs.CR cs.MA 50%

The Best-Laid SCHEMEs: Coordinated Sabotage and Monitoring in Multi-Agent Systems

最佳布局的SCHEMEs:多智能体系统中的协调破坏与监控

Nikolay Radev, Lennart Haas, Benjamin Arnav, Pablo Bernabeu-Pérez

专题命中 评测与基准 :prompting(abstract)

AI总结 提出SCHEME基准测试,评估多智能体系统在合法任务中协调执行隐藏恶意目标的能力,发现协调破坏已实际可行,但代码编辑可被高精度检测。

Comments 33 pages, 25 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28905 2026-05-29 physics.chem-ph 50%

DFT Accuracy on Crystal Structure Prediction with Machine Learning Interatomic Potentials

机器学习原子间势在晶体结构预测中的DFT准确性评估

Laurence I. Midgley, Chen Lin, J. Harry Moore, Flaviano Della Pia, Javier Antorán, Sten O. Nilsson Lill, Emma S. E. Eriksson, Felix A. Faber, Lars Tornberg, Anders Broo, Gábor Csányi

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出CSP-MACE-Å机器学习原子间势,通过分解分子内和分子间能量并引入色散修正与学习模型,在晶体结构预测中达到接近DFT的精度,且速度提升多个数量级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22661 2026-05-29 cs.SD 50%

Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability

评估与奖励基于平均延续对数概率的表达性角色扮演TTS的LALM

Yong Ren, Jingbei Li, Haiyang Sun, Yujie Chen, Cheng Yi, Yechang Huang, Hao Gu, Ye Bai, Xuerui Yang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beihang University(北京航空航天大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出平均延续对数概率(MCLP)作为评估指标和奖励信号,用于提升大型音频语言模型在角色扮演文本转语音任务中的风格一致性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21032 2026-05-29 cs.CV 50%

Multi-Attribute guided Thermal Face Image Translation based on Latent Diffusion Model

基于潜在扩散模型的多属性引导热人脸图像翻译

Mingshu Cai, Osamu Yoshie, Yuya Ieiri

机构 * Graduate School of Information, Production and Systems, Waseda University(早稻田大学信息、生产与系统研究生院)

专题命中 评测与基准 :prompting(abstract)

AI总结 提出一种基于潜在扩散模型的多属性引导方法,从热红外图像生成高质量可见光人脸图像,同时保留关键身份特征,解决异质人脸识别中的域偏移和特征丢失问题。

Comments Accepted by 2025 IEEE International Joint Conference on Biometrics (IJCB 2025)

Journal ref 2025 IEEE International Joint Conference on Biometrics (IJCB), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 81 篇

2605.29543 2026-05-29 cs.LG cs.AI cs.CL cs.HC cs.IR 92%

SCOPE: A Lightweight-training LLM Framework for Air Traffic Control Readback Monitoring

SCOPE:一种用于空中交通管制复诵监控的轻量训练LLM框架

Qihan Deng, Minghua Zhang, Yang Yang, Zhenyu Gao

机构 * Department of Mechanical and Aerospace Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学机械与航空航天工程系) School of Electronic and Information Engineering, Beihang University(北航电子与信息工程学院) State Key Laboratory of CNS/ATM(国家空管自动化系统实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SCOPE框架,通过冻结LLM结合插件式开放集分类器和上下文学习机制,实现高效准确的空管复诵监控,在少样本设置下开放集检测准确率达91.05%,异常纠正率96.63%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27480 2026-05-29 q-bio.OT cs.AI cs.CY 92%

BIRDS: Characterizing and Understanding Biodiversity Impact of Large Language Model Serving

BIRDS:表征与理解大语言模型服务对生物多样性的影响

Tianyao Shi, Yi Ding

机构 * Purdue University(普渡大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出BIRDS框架,通过定义请求级功能单元、量化运营与隐含生物多样性影响,并引入质量归一化生物多样性影响(QNBI),揭示大规模LLM服务对生态系统的累积影响及质量感知的服务权衡。

Comments 21 pages, 27 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29639 2026-05-29 cs.OS 91%

RTP-LLM: High-Performance Alibaba LLM Inference Engine

RTP-LLM:高性能阿里巴巴大语言模型推理引擎

Boyu Tan, Jiarui Guo, Zongwei Lv, Hanbo Sun, Tong Yang, Kan Liu, Xinfei Shi, Zetao Hu, Yaxin Yu, Chi Zhang, Jianning Zhang, Xi Yang, Wei Zhang, Bo Cai, Silu Zhou, Xiyu Wang, Na He, Yinghao Yu, Wending Bao, Guiyang Huang, Yuxing Yuan, Juncheng Yin, Nan Wang, Lin Yang, Zechao Zhang, Lu Chen, Guoding Li, Tao Lan, Lin Qu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出RTP-LLM推理引擎,通过文件顺序驱动I/O、预填充-解码分离架构、分层多级KV缓存、模块化推测解码等技术,在工业规模部署中实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15236 2026-05-29 cs.CR cs.AI cs.LG 91%

Jailbreaking and Mitigation of Vulnerabilities in Large Language Models

大语言模型的越狱与漏洞缓解

Benji Peng, Hanxuan Chen, Keyu Chen, Qian Niu, Ziqian Bi, Ming Liu, Pohsun Feng, Tianyang Wang, Lawrence K. Q. Yan, Yizhu Wen, Yichao Zhang, Caitlyn Heqi Yin, Xinyuan Song, Riyang Bao, Jiacheng Shi

机构 * Hunan University Changsha, PRC Georgia Institute of Technology Atlanta, USA Kyoto University Kyoto, Japan Purdue University West Lafayette, USA National Taiwan Normal University Taipei, ROC University of Liverpool Suzhou, PRC Hong Kong University of Science University of Hawaii Honolulu, USA The University of Texas at Dallas Dallas, USA University of Wisconsin-Madison Madison, USA Emory University Atlanta, USA College of William \& Mary Williamsburg, USA

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文综述了大语言模型在提示注入和越狱攻击下的漏洞,分类攻击方法并评估防御策略,指出研究空白与未来方向。

Journal ref Eureka 1(1) (2026) 26-61

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29979 2026-05-29 cs.CR cs.LG 90%

Fingerprinting Inference Systems of Large Language Models

大型语言模型的推理系统指纹识别

Anna Wimbauer, Jonas Möller, Erik Imgrund, Konrad Rieck

机构 * BIFOLD & TU Berlin(BIFOLD与柏林技术大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.LG

AI总结 本文提出一种通过分析LLM的提示-响应行为来识别推理系统组件(如推理引擎、注意力后端和硬件平台)的指纹方法,并论证了防御该指纹识别的根本困难性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06791 2026-05-29 cs.LG cond-mat.dis-nn cond-mat.stat-mech 90%

Rare Event Analysis of Large Language Models

大型语言模型的罕见事件分析

Jake McAllister Dorman, Edward Gillman, Dominic C. Rose, Jamie F. Mair, Juan P. Garrahan

机构 * School of Physics and Astronomy, University of Nottingham(物理与天文学学院,诺丁汉大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出一个端到端框架,用于系统分析大型语言模型中的罕见事件,涵盖理论、高效生成策略、概率估计和误差分析,并通过实例展示其应用。

Comments ICML 2026 Oral Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28827 2026-05-29 cs.CL cs.LG 90%

RightNow-Arabic-0.5B-Turbo: An Open Sub-1B Arabic Language Model via Vocabulary Injection and Edge-First Deployment

RightNow-Arabic-0.5B-Turbo: 通过词汇注入和边缘优先部署的开源子10亿参数阿拉伯语语言模型

Jaber Jaber, Osama Jaber

机构 * RightNow AI

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);pretraining(abstract)

AI总结 针对现有阿拉伯语模型要么是多语言模型对阿拉伯语支持不足,要么是参数过大难以部署的问题,提出基于Qwen2.5-0.5B的518M参数阿拉伯语专用模型RightNow-Arabic-0.5B-Turbo,通过词汇注入、继续预训练和监督微调等方法,在三个阿拉伯语基准上达到35.9%平均准确率,与1.5B模型性能相当,并实现边缘端高效部署。

Comments 12 pages, 7 tables, 4 figures, 1 algorithm. Weights: https://huggingface.co/RightNowAI/RightNow-Arabic-0.5B-Turbo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30218 2026-05-29 cs.LG cs.PF 90%

MarginGate: Sparse Margin-Triggered Verification for Batch-Invariant LLM Inference

MarginGate: 用于批量不变LLM推理的稀疏边际触发验证

Kexin Chu, Yang Zhou, Wei Zhang

机构 * University of Connecticut(康涅狄格大学) UC Davis(加州大学戴维斯分校)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 提出MarginGate方法,利用logit边际稀疏触发验证,仅对低边际步骤进行验证并修复,以低成本实现批量不变LLM推理的确定性解码。

Comments 13 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏