arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-12 至 2026-08-12 共收录 359 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 85 篇

2608.11200 2026-08-12 cs.CL cs.AI cs.LG 新提交 67%

ConVAWG: A Retrieval-Grounded Framework for Controlled Synthetic Dialogue Generation in Violence Against Women and Girls

ConVAWG:面向针对妇女和女孩的暴力场景下可控合成对话生成的检索驱动框架

Chen Lyu, Xingwei Tan, Simon Cullen, Shelley Wilson, Lois Arthurs, Arshad Jhumka, Gabriele Pergola

机构 * University of Sheffield(谢菲尔德大学) Forensic Capability Network(法医能力网络) University of Leeds(利兹大学) University of Warwick(华威大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究针对VAWG场景建模的空白,提出检索驱动框架ConVAWG,生成符合CPS标准的合成VAWG多轮对话,发布6000余个对话事件,经多类评估验证其质量与领域保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10796 2026-08-12 cs.CV 新提交 67%

E$^3$mo-Bench: A Scalable Benchmark for Multimodal Evoked and Expressed Emotion Understanding via Bayesian Pairwise Alignment

E³mo-Bench:基于贝叶斯成对对齐的可扩展多模态诱发与表达情感理解基准

Lancheng Gao, Ziheng Jia, Shengyan Li, Zixuan Xing, Jiarui Wang, Huiyu Duan, Xiongkuo Min

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究针对现有多模态情感理解基准的不足,推出E³mo-Bench基准,提出贝叶斯成对对齐方法与E³mo-Score智能体,验证了框架有效性并指出MLLMs在情感任务中的缺陷,为多模态情感智能发展指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10646 2026-08-12 cs.MA 新提交 67%

ASCon: A Direction-Aware Reciprocal Agent--Step Contextualization Model for Failure Attribution in Multi-Agent Systems

ASCon:面向多智能体系统故障归因的方向感知互惠智能体-步骤上下文模型

Shuyu Jiang, Yue Ran, Kaiyu Xu, Xingshu Chen, Yi Zhang, Hao Ren, Rui Tang, Tianwei Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究针对多智能体系统故障归因中不同目标间证据依赖关注不足的问题,提出ASCon模型,通过方向感知图注意力等技术聚合轨迹证据,提升了故障智能体、步骤、模式的检测性能及域外归因能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10396 2026-08-12 cs.CV 新提交 67%

FormStruct-Bench:A Hierarchical and Diagnostic Benchmark for Table-Form Document Structure Recognition

FormStruct-Bench:面向表格型文档结构识别的分层诊断基准

Lujie Ban, Jiangtao Zhu, Yuanheng Yu, Jiasheng Shi, Chenhao Ma

专题命中 评测与基准 :SFT(abstract,abstract_cn)

AI总结 该研究提出FormStruct-Bench基准,通过分层评估表格型文档结构识别,发现现有系统在细粒度结构恢复上远弱于内容读取,为相关任务提供诊断依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10882 2026-08-12 cs.SE quant-ph 新提交 67%

From Pattern Detection to Composition Analysis in Quantum Software

从量子软件中的模式检测到组合分析

Neilson Carlos Leite Ramalho, Erico Augusto da Silva, Anthony Accioly, Higor Amario de Souza, Marcos Lordello Chaim

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本研究扩展了量子模式挖掘工具,经评估其在Qrisp上准确率提升,构建了模式组件调用组合图并发布相关流水线、知识库与数据集,支持量子模式采用与演化的可复现研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06075 2026-08-12 cs.DC 版本更新 67%

MemGUI-Bench: Benchmarking Memory of Mobile GUI Agents in Dynamic Environments

MemGUI-Bench: 动态环境中移动GUI代理内存能力的基准测试

Guangyi Liu, Pengxiang Zhao, Yaozhen Liang, Qinyi Luo, Shunye Tang, Yuxiang Chai, Weifeng Lin, Han Xiao, WenHao Wang, Siheng Chen, Zhengxi Lu, Gao Wu, Hao Wang, Liang Liu, Yong Liu

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 MemGUI-Bench提出一个综合的内存导向基准测试,通过128个任务评估移动GUI代理的内存能力,揭示了各系统中的显著内存缺陷并提出5种设计改进措施。

Comments Accepted to ACM MM 2026. Project page: https://memgui-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06110 2026-08-12 cs.AI cs.CL 版本更新 62%

ECHO: A Locally-Deployable Agentic Health Assistant with Temporal Memory, Safety Guardrails, and Speech Assessment

ECHO:具备时序记忆、安全护栏与语音评估功能的本地可部署智能体式健康助手

Abdulkadir Külçe, Alihan Esen, Çağla Fikir, Berke Kurt, Kuzey Arar, Gökhan Ercan, Faik Boray Tek

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出具备时序记忆、安全护栏与语音评估功能的本地可部署智能体式健康助手ECHO,其核心聊天机器人、安全层、语音评估模块均达特定性能指标,且可在消费级硬件运行,符合数据保护法规。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02673 2026-08-12 cs.SD cs.AI cs.CL eess.AS 版本更新 62%

dots.tts.edit: Precisely Controlled Speech Editing with a Continuous Autoregressive Model

dots.tts.edit:基于连续自回归模型的精确可控语音编辑

Hankun Wang, Bohan Li, Shi Lian, Xiaoyu Gu, Jing Peng, Da Zheng, Yiwei Guo, Colin Zhang, Kai Yu

机构 * dots.tts Team(dots.tts团队)

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出dots.tts.edit语音编辑工具,采用XML风格结构化指令接口,基于连续自回归TTS模型,在doteBench评估中表现优异,音频质量与现有系统相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10670 2026-08-12 cs.CL 新提交 57%

Seeds Before Objectives: Rethinking Evaluation for Low-Resource Garhwali ASR

目标之前的种子:重新审视低资源加尔瓦利语自动语音识别(ASR)的评估

Karamvir Singh Batra, Prathamjyot Singh, Ashima Sood, Jasmeet Singh, Sahil Sharma

机构 * Thapar Institute of Engineering and Technology(塔帕尔工程技术学院) Ulster University(阿尔斯特大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.CL

AI总结 针对低资源加尔瓦利语ASR评估,构建首个可复现多种子基准,发现多种子评估可区分真实增益与种子噪声,且w2v-BERT 2.0搭配标准CTC表现最优。

Comments 19 pages, 3 figures. Accepted for oral presentation at ICNLSP 2026, Trento, Italy, September 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10289 2026-08-12 cs.CV cs.LG 新提交 57%

SeFaR: Semantic Feature-aware Robustness Testing of Deep Neural Networks

SeFaR:面向深度神经网络的语义特征感知鲁棒性测试

Nusrat Jahan Mozumder, Divya Gopinath, Corina Pasareanu, Matthew Dwyer

机构 * University of Virginia(弗吉尼亚大学) KBR Inc.(KBR公司) NASA Ames(美国国家航空航天局艾姆斯研究中心) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 SeFaR是一个以语义特征为核心的视觉模型鲁棒性测试框架,可在保留需求满足性的前提下,生成测试输入以识别影响模型决策的特征,进而发现故障并关联相关特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10195 2026-08-12 cs.CV cs.LG 新提交 57%

More Accurate, Less Human: Gestalt Grouping in Vision Models

更准确,更少人工:视觉模型中的格式塔分组

Sudhanva Manjunath Athreya, Sai Phani Kumar Malladi

机构 * University of Utah(犹他大学) Siemens AG(西门子公司)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 该研究引入行为测试套件,对比45个不同类型视觉模型与人类在四项分组任务上的表现,发现部分封闭模型的感知组织对齐度低于基准准确率,为可视化研究提供了审核模型的可复用标准。

Comments 9 pages, 7 figures, 5 tables. Conditionally accepted to VISxVision 2026, a workshop at IEEE VIS 2026. Includes appendix with per-task stimuli, metric derivations, and full per-model results

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09944 2026-08-12 cs.HC cs.AI 新提交 57%

Navigation Alone Is Not Enough: Evaluating Explanatory Assistive UI Agents

仅导航是不够的:评估解释性辅助UI智能体

Santosh Patapati

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 该研究推出辅助UI智能体基准NeXUI,评估其导航、解释及用户控制能力,实验发现Gemini-3.5-Flash在该基准中表现不佳,为相关研发提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26148 2026-08-12 cs.HC cs.CL 版本更新 57%

Beyond Screenshots: Evaluating VLMs' Understanding of UI Animations

超越截图:评估VLMs对UI动画的理解

Chen Liang, Xirui Jiang, Naihao Deng, Eytan Adar, Anhong Guo

机构 * University of Michigan(密歇根大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出AniMINT数据集,评估VLMs对动态UI动画的理解能力,发现其在基础运动检测上可靠,但高阶解释仍不一致,揭示了模型性能的关键瓶颈。

Comments Published in ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09874 2026-08-12 cs.CL cs.SI 版本更新 57%

Simulating Organized Group Behavior: New Framework, Benchmark, and Analysis

模拟有组织群体行为:新框架、基准和分析

Xinkai Zou, Yiming Huang, Zhuohang Wu, Jian Sha, Nan Huang, Longfei Yun, Jingbo Shang, Letian Peng

机构 * University of California, San Diego(加州大学圣迭戈分校) University of California, Irvine(加州大学尔湾分校) Meta

专题命中 评测与基准 :prompting(abstract);分类 cs.CL

AI总结 本文提出新框架和基准,用于模拟有组织群体决策,通过结构化分析模型提升预测性能,并揭示群体行为随时间的变化及跨群体相似性。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20990 2026-08-12 cs.IR cs.AI 版本更新 57%

$\mathrm{ECI}_{\mathrm{sem}}$: Semantic Residual Effective Contrastive Information for Evaluating Hard Negatives

ECI: 有效对比信息用于评估难负样本

Aarush Sinha, Rahul Seetharaman, Aman Bansal

机构 * Department of Computer Science and Engineering, Indian Institute of Technology (IIT), Kharagpur, India(1. 印度理工学院(IIT)计算机科学与工程系,克哈格布尔,印度)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 本文提出ECI,一种无需训练的诊断方法,通过冻结的目标编码器嵌入对候选负样本进行排序,其在MS MARCO数据集上展示了优于其他模型的性能,且在不同条件下表现出稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13319 2026-08-12 cs.AI cs.HC 版本更新 57%

Situation Graph Prediction for User Perspective Modeling

情境图预测:用户建模的结构化视角推断

Jisung Shin, Daniel Platnick, Marjan Alirezaie, Hossein Rahnama

机构 * Flybits Labs, Creative AI Hub(Flybits实验室、创意人工智能中心) University of Toronto(多伦多大学) Toronto Metropolitan University(多伦多 Metropolitan 大学) MIT Media Lab(MIT媒体实验室)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 情境图预测通过结构化视角推断提升用户建模能力,揭示潜在状态推断比表层提取更困难。

Comments Accepted to PILA 2026: Workshop on Personal Intelligence in the Agentic AI Era, at KDD 2026, 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01597 2026-08-12 eess.AS cs.SD 版本更新 50%

Toward Fair Speech Technologies: A Comprehensive Survey of Bias and Fairness in Speech AI

面向公平的语音技术:语音AI中的偏差与公平性综合综述

Yi-Cheng Lin, Yun-Shao Tsai, Kuan-Yu Chen, Hsiao-Ying Huang, Huang-Cheng Chou, Shrikanth Narayanan, Yu Tsao, Jian-Jiun Ding, Hung-yi Lee

专题命中 评测与基准 :language model(abstract)

AI总结 本综述整合400余项相关研究,构建统一框架,针对语音模态提出7种公平定义,梳理偏差来源并系统化缓解策略,为语音AI的公平性研究提供了全面指引。

Comments 73 pages, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10858 2026-08-12 cs.DL cs.CY cs.HC 新提交 50%

Auditable AI-Assisted Research Writing: An Engineering Discipline with Pre-Registered Process Observation

可审计的AI辅助研究写作:一种带有预注册过程观测的工程学科

Yang Zhou, Chengqun Yu

专题命中 评测与基准 :language model(abstract)

AI总结 针对AI辅助研究写作缺乏可追溯责任历史的问题,该研究提出一套预注册过程观测的可审计性工程规范,通过git密封、红线门等技术实现审计,经实验验证其停止规则可有效终止不合规工作,相关工具包可供第三方复现指标。

Comments 25 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10706 2026-08-12 cs.CV cs.MM 新提交 50%

MMArt A Multi-Perspective Multimodal Dataset for Visual Art Understanding

MMArt:用于视觉艺术理解的多视角多模态数据集

Shuai Wang, Wangyuan Ding, Yixian Shen, Jia-Hong Huang, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学) Amazon AGI(亚马逊AGI) College of Business and Economics, University of Johannesburg(约翰内斯堡大学经济与商学院)

专题命中 评测与基准 :language model(abstract)

AI总结 针对现有艺术数据集单视角局限,推出含74234幅WikiArt画作的多视角多模态数据集MMArt,通过分析各视角特性证实多视角设计的必要性,为视觉艺术理解提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10662 2026-08-12 cs.MA 新提交 50%

Reifying Research Logic: AI-Assisted Workflow Construction and Incremental Refinement for Quantitative Syntax

具象化研究逻辑:面向定量句法的AI辅助工作流构建与增量优化

He Wang, Jingbo Chen, Yuqiao Lai, Nan Yang, Hanwen Zhang, Wei Yuan

专题命中 评测与基准 :language model(abstract)

AI总结 针对定量句法研究的步骤逻辑隐藏问题,提出QLWF可视化工作流平台,可通过AI辅助将自然语言描述转为可执行工作流,在基准测试中表现优异并发布相关可复用资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10426 2026-08-12 cs.CV 新提交 50%

GeoSeg-OV: Bridging Geospatial Gaps with Structural Guidance for Open-Vocabulary Remote Sensing Segmentation

GeoSeg-OV:利用结构引导弥合地理空间差距的开放词汇遥感分割方法

Ruizhong Liu, Tingzhang Luo, Zaiyan Zhang, Jundong Chen, Hongruixuan Chen, Shaoguang Huang, Hongyan Zhang

机构 * School of Computer Science, China University of Geosciences(中国地质大学计算机学院) Systems Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)系统中心) Department of Computer Science, City University of Hong Kong(香港城市大学计算机系) School of Geodesy and Geomatics, Wuhan University(武汉大学测绘学院) Data Science and AI Innovation Research Promotion Center, Shiga University(滋贺大学数据科学与人工智能创新研究促进中心)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出GeoSeg-OV,通过解耦辅助VFM特征与视觉-文本匹配,将其用作结构引导,结合SGA与CAD模块,在HRLC基准上优于当前最优方法,且具备跨域零样本泛化能力。

Comments Code and benchmark: https://github.com/zzaiyan/GeoSeg-OV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08696 2026-08-12 cs.CV 版本更新 50%

OccAnyScene: Towards Unified Indoor-Outdoor 3D Occupancy Prediction

OccAnyScene:面向统一的室内-室外三维占用预测

Junjie Liu, Wanshui Gan, Zitong Dai, Guiping Cao, Yan Li, Ke Chen, Dongmei Jiang, Xiangyuan Lan, Jianguo Zhang

机构 * SuSTech(南方科技大学) Shanghai AI Laboratory(上海人工智能实验室) HITSZ(哈尔滨工业大学深圳校区) Pengcheng Laboratory(鹏城实验室)

专题命中 评测与基准 :foundation model(abstract)

AI总结 该研究提出跨场景三维语义占用预测新任务,构建OccAnyScene框架实现室内外场景统一三维占用预测,在Occ-ScanNet和SurroundOcc-nuScenes数据集上取得最优mIoU结果。

Comments Corrected a typo in the title; manuscript unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23789 2026-08-12 cs.CV 版本更新 50%

MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation

MuSS:一个多镜头数据集和电影叙事基准用于多镜头主体到视频生成

Haojie Zhang, Di Wu, Bingyan Liu, Linjie Zhong, Yuancheng Wei, Xingsong Ye, Nanqing Liu, Yaling Liang

机构 * South China University of Technology(华南理工大学) Fudan University(复旦大学) Yunnan Normal University(云南师范大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出MuSS数据集和电影叙事基准,解决多镜头视频生成中的叙事逻辑、时空对齐和复制粘贴问题,通过改进的标注流程和反复制粘贴指标提升生成质量。

Comments 17 pages, 9 figues

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00945 2026-08-12 cs.HC 版本更新 50%

Sighted by Default: Addressing Implicit Vision Assumptions in Real-Time VLM Assistance for BLV Users

默认以视觉为中心:解决面向盲人和低视力(BLV)用户的实时视觉语言模型(VLM)辅助中的隐含视觉假设问题

Yi Zhao, Siqi Wang, Qiqun Geng, Erxin Yu, Jing Li

专题命中 评测与基准 :language model(abstract)

AI总结 针对现有面向BLV用户的实时VLM辅助工具存在的以视觉为中心的默认偏见问题,提出VIA-Agent模型,其在保持与Doubao相当成功率的同时,缩短了任务时间并减少了对话轮次,提升了用户信任度。

Comments Accepted to UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 61 篇

2608.10532 2026-08-12 cs.NI cs.LG 新提交 92%

Benchmarking LLM-Guided Control-Plane Policies for Backend Fault Isolation in HAProxy

对HAProxy中后端故障隔离的LLM引导控制平面策略进行基准测试

Aman Chauhan, Vishnu Pendyala

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文测试了不同规模和架构的LLM在HAProxy后端故障隔离中的策略效果,发现约3B有效参数的能力阈值,达标后可显著降低5xx错误,但会增加延迟与令牌开销,高效方案为阈值以上模型的非推理模式。

Comments 43 pages, 6 figures, 15 tables. Submitted to Journal of Network and Computer Applications (Elsevier)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09949 2026-08-12 cs.AI physics.bio-ph 新提交 92%

Closed-Loop LLM Co-Pilots for Digital Agriculture

面向数字农业的闭环大语言模型(LLM)协作副驾驶系统

Serge Kernbach

机构 * CYBRES GmbH(CYBRES有限公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究开发闭环LLM协作副驾驶系统,基于49通道植物传感器网络实现数字农业自主控制,通过三案例验证可缩短生产周期、降低能耗,提升成本价值比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08730 2026-08-12 cs.LG cs.DC cs.PF 版本更新 92%

Measuring and Reducing WebGPU Dispatch Overhead for LLM Inference

测量与降低用于大语言模型(LLM)推理的WebGPU调度开销

Jędrzej Maczan

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究针对WebGPU用于LLM推理时的调度开销问题,提出顺序调度测量方法,发现批大小为1时调度开销是瓶颈,核心贡献为明确该优化方向并指出调度摊销的改进路径。

Comments Accepted to The Fourth UK AI Conference 2026 as a full paper, to be published in Proceedings of Machine Learning Research (PMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10314 2026-08-12 cs.SE physics.comp-ph 新提交 91%

Does the way we write a theory change the program an LLM builds from it? A prospective randomized study of renderer format in LLM theory-to-program translation

我们撰写理论的方式会改变大语言模型(LLM)据此构建的程序吗?一项针对LLM理论转程序翻译中渲染器格式的前瞻性随机研究

Andre Panossian

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 该研究通过前瞻性随机实验发现,LLM理论转程序翻译中渲染器格式未产生预测的行为几何,为该领域规范格式效应设定了边界并提供了可审计研究工具。

Comments 112 pages, 2 figures; includes supplementary material and five reproducibility annexes. Data: https://doi.org/10.5281/zenodo.21876518. Software: https://doi.org/10.5281/zenodo.21879576

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02329 2026-08-12 cs.DC 版本更新 91%

Taming Request Imbalance: SLO-Aware Scheduling for Disaggregated LLM Inference

驯服请求不平衡:面向解聚LLM推理的SLO感知调度

Qipeng Wang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对解聚LLM推理中请求长度长尾分布导致的预填阶段队头阻塞和解码阶段拖尾者利用率低的问题,提出SLO感知调度系统Kairos,通过预填侧的紧迫性优先级调度和解码侧的松弛引导自适应批处理,显著提升SLO达成率和吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11045 2026-08-12 cs.LG cs.CL 新提交 91%

ReRound: Reconstructive Rounding to Resolve Midpoint Ambiguity in Calibration-Free LLM Quantization

ReRound:用于解决无校准LLM量化中中点歧义的重构舍入法

He-Yen Hsieh, H. T. Kung

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.CL、cs.LG

AI总结 ReRound是一种后训练量化方法,通过条件扩散模型解决无校准LLM量化的中点歧义,在小型LLM的3、4比特量化上优于标准RTN,性能接近依赖校准方法且无额外推理开销。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏