arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-07 至 2026-08-07 共收录 349 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 95 篇

2603.00059 2026-08-07 cs.CY cs.AI 版本更新 70%

Stochastic Parrots or Singing in Harmony? Testing Five Leading LLMs for their Ability to Replicate a Human Survey with Synthetic Data

随机鹦鹉还是和谐合唱?测试五种领先的大语言模型在复制人类调查响应方面的能力

Jason Miklian, Kristian Hoelscher, John E. Katsos

机构 * Centre for Global Sustainability, University of Oslo(全球可持续发展中心,奥斯陆大学) Peace Research Institute Oslo(奥斯陆和平研究所) American University of Sharjah(阿联酋沙迦美国大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文比较了420名硅谷程序员和开发者的调查数据与五种大语言模型生成的合成数据,发现AI生成的数据在技术上合理但无法捕捉人类调查的非直观洞察,表明合成调查数据在组织研究中存在局限。

Comments V2

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21800 2026-08-07 cs.AI 版本更新 70%

BioAgent Bench: An AI Agent Evaluation Suite for Bioinformatics

BioAgent Bench: 一个用于生物信息学的AI代理评估套件

Dionizije Fa, Marko Culjak, Bruno Pandza, Mateo Cupic

机构 * Entropic

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出BioAgent Bench,用于评估AI代理在常见生物信息学任务中的性能和鲁棒性。通过定制端到端任务和压力测试,发现前沿代理可完成多步骤流程,但鲁棒性测试揭示了在受控扰动下的失败模式,表明高阶流程构建不保证可靠步骤推理。

Comments ICML 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15604 2026-08-07 cs.CL 版本更新 70%

Text Generation: A Systematic Literature Review of Tasks, Evaluation, and Challenges

文本生成:关于任务、评估与挑战的系统文献综述

Jonas Becker, Jan Philip Wahle, Bela Gipp, Terry Ruas

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该系统综述梳理2017-2025年257篇论文,划分文本生成五大任务,评估三类方法,指出任务特有与共有的9项挑战,为NLP领域不同阶段研究者提供领域概览与研究方向参考。

Comments Published in the Journal of Artificial Intelligence Research (JAIR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05507 2026-08-07 eess.AS 新提交 67%

AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks

AffectDF:针对情感表达型攻击的最全面语音深度伪造检测基准

Aurosweta Mahapatra, Xiutian Zhao, Shreeram Suresh Chandra, Zihan Zhang, Zongyang Du, Ismail Rasim Ulgen, Kong Aik Lee, Nicholas Andrews, Carlos Busso, Berrak Sisman

专题命中 评测与基准 :language model(abstract);prompting(abstract)

AI总结 该研究提出涵盖多类情感表达型语音伪造攻击的AffectDF基准,实验发现常规训练的SDD系统在该基准上鲁棒性严重下降,为开发更鲁棒的检测模型提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05495 2026-08-07 cs.CR cs.HC 新提交 67%

PromptShield Home: Ambient Multimodal Prompt Injection Defense for Smart-Home Agents

PromptShield Home:面向智能家居智能体的环境多模态提示注入防御方案

He Zhang, Feilong Li, Dingning Long, Yilin Cui, Peijun Zhang, Yuewen Zhang, Qianyao Xu, Xinyi Fu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究针对智能家居智能体的提示注入安全问题,构建了现实场景基准测试PromptShield-Home,对比了三类防御层的性能,发现多智能体调解的上限性能最优,提出应采用学习路由与传感器融合方案保障安全。

Comments This work has been accepted as a poster to UbiComp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05223 2026-08-07 cs.SE cs.CR 新提交 67%

Towards a Risk Assessment of Malicious Skill Files in Coding Agents

面向编码智能体中恶意技能文件的风险评估

Rui Yang, Michael Fu, Kla Tantithamthavorn, Chetan Arora, Joey Chua

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究针对编码智能体技能接口的恶意文件风险,提出对抗性技能合成方法与评估流水线,发现企业级智能体易被恶意技能利用,仅少数运行有明确安全识别,呼吁企业提前评估风险。

Comments 29 pages, 6 figures, 6 tables. Preprint; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05222 2026-08-07 cs.SD eess.AS 新提交 67%

Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model

Diff-Symbo:基于自回归潜在扩散模型的文本控制长时长符号音乐生成

Zhiwei Lin, Jun Chen, Boshi Tang, Weihao Wu, Yang Jing, Yaolong Ju, Fan Fan, Zhiyong Wu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 Diff-Symbo借助LDM与自回归方法,结合含19345个文本模板的数据集,实现了文本控制的长时长高质量符号音乐生成,在多项指标上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05215 2026-08-07 cs.RO cs.CV 新提交 67%

VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances

VLAff:用于统一可操作 affordance 的视觉-语言-affordance 模型

Jihoon Oh, Kento Kawaharazuka, Kei Okada

机构 * University of Tokyo(东京大学)

专题命中 评测与基准 :language model(abstract);foundation model(abstract)

AI总结 本研究提出 VLAff 模型,结合 EgoAffordance 数据集,解决人类与机器人 embodiment 不匹配问题,实现视觉 affordance 预测及真实机器人零样本操作等应用。

Comments 8 pages, 5 figures. Accepted to IEEE/RSJ IROS 2026. Project page: https://ojh6404.github.io/vlaff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05180 2026-08-07 cs.CY 新提交 67%

The Nuclear Decision-Making Benchmark: Evaluating Frontier LLMs on Nuclear Tendencies

核决策基准:评估前沿大语言模型的核倾向

Benjamin Jensen, Ian Reynolds, Yasir Atalan, Martin Pollack, Austin Woo, Robert Sincero

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究推出核决策基准(NDM Bench),评估7种前沿大语言模型在核相关场景的表现,发现模型间核倾向差异显著,不同模型的行动偏好、一致性及对国家和措辞的响应均存在差异。

Comments 34 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05175 2026-08-07 cs.CY 新提交 67%

Teaching Intro AI When the Tools Can Do the Homework: A Course Redesign and a Student Bill of Rights

当工具能完成作业时教授人工智能入门课程:课程重新设计与学生权利法案

Yusuf Pisan

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对大型语言模型可完成AI入门课程作业的问题,华盛顿大学博塞尔分校重新设计CSS 382课程,保留经典核心、新增大模型构建模块,重构评估体系,还通过学生参与制定教师AI使用规范。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16284 2026-08-07 cs.CV cs.MM 版本更新 67%

MAC 2026: Advancing Micro-Action Analysis Towards Fine-Grained Understanding

MAC 2026:推动微动作分析迈向细粒度理解

Kun Li, Dan Guo, Jihao Gu, Pengyu Liu, Xiaobai Li, Haoyu Chen, Yanbin Hao, Guoying Zhao, Meng Wang

机构 * United Arab Emirates University(阿联酋大学) Hefei University of Technology(合肥工业大学) University College London(伦敦大学学院) Zhejiang University(浙江大学) University of Oulu(奥卢大学) CMVS, University of Oulu(奥卢大学计算机视觉与媒体研究中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文介绍第三届MAC 2026,以从识别到细粒度微动作理解为主题,扩大挑战范围,引入新任务并借助多模态大语言模型评估,总结了相关数据集、设置、结果等,还探讨了微动作分析未来方向及在视频理解中的作用。

Comments Challenge Summary Paper of the 3rd Micro-Action Analysis Grand Challenge (MAC 2026) at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02091 2026-08-07 cs.LG cs.AI cs.CL cs.DB 版本更新 67%

CRINN: Contrastive Reinforcement Learning for Approximate Nearest Neighbor Search

CRINN:用于近似最近邻搜索的对比强化学习

Xiaoya Li, Albert Wang, Guoyin Wang, Chris Shum, Jiwei Li

机构 * DeepReinforce Team(深强化团队)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对近似最近邻搜索算法,提出CRINN新范式,将其优化视为强化学习问题,以执行速度为奖励信号,实验证明该方法在多个基准数据集上有效,且其成功验证了强化学习增强语言模型用于算法优化的有效性。

Comments Preprint Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05954 2026-08-07 cs.AI cs.CV cs.LG 新提交 62%

Training a Conditioned Video Game Agent on a VLM Annotated Dataset

基于VLM标注数据集训练条件化电子游戏智能体

Katrin Schmid, Iuri Frosio

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对电子游戏强化学习中奖励获取、加权及稀疏性等问题,提出用VLM标注数据集,结合离线RL训练条件化智能体,并分析实验中的困难与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05493 2026-08-07 cs.PL cs.AI cs.CL cs.SE 新提交 62%

Learning Context-Free Grammars for Grammar-Constrained Decoding via Declarative Agentic Programming with Guarantees

通过带保障的声明式智能体编程学习用于语法约束解码的上下文无关文法

Kevin Cheang, Geoff Hulette, Rahul Kumar, Felipe R. Monteiro, Federico Mora, Robin Salkeld, Lin Tan, Serdar Tasiran

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出名为Autogrammar的声明式智能体,可从文档和执行数据自动学习上下文无关文法,用于语法约束解码,在三种DSLs上的实验显示其生成的文法性能优于现有基线,能显著提升端到端LM的真实任务表现。

Comments 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05478 2026-08-07 cs.GR cs.CL cs.CV cs.HC cs.LG cs.MM 新提交 62%

GenGA: Editable and Data-Grounded Graphical Abstract Generation for Academic Papers

GenGA:面向学术论文的可编辑且基于数据的图形摘要生成

Takuro Kawada, Shunsuke Kitada, Hitoshi Iyatomi

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 GenGA是一种直接生成矢量格式图形摘要的框架,可实现便捷的元素级编辑,其编辑简易性优于传统方法,且在简洁性和语义对齐上超过人工生成的图形摘要,还提出了量化编辑简易性的SIC指标。

Comments 20 pages, 11 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02616 2026-08-07 cs.CL cs.AI 版本更新 62%

OpenAI Privacy Filter: A Cross-Lingual, Cross-Domain PII Evaluation Across 32 Benchmarks

评估OpenAI的隐私过滤器:在42个基准测试中开展跨语言、跨领域的个人身份信息(PII)检测

Rohith Uppala

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究首次系统评估OpenAI的15亿参数PII检测器OPF,在42个跨语言跨领域基准中对比其与Presidio、XLM-RoBERTa、GPT-4o的PII检测性能,揭示其优势与缺陷。

Comments 9 pages, 2 figures, 9 tables; evaluation of a production PII detection system

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14299 2026-08-07 cs.CV cs.LG 版本更新 57%

What Drives Test-Time Adaptation for CLIP? A Controlled Empirical Study from an Update Perspective

什么驱动了CLIP的测试时适应?从更新视角进行的受控实证研究

Jiazhen Huang, Xiao Chen, Zhiming Liu, Yaru Sun, Jingyan Jiang, Zhi Wang

机构 * Tsinghua University(清华大学) Shenzhen Technology University(深圳技术大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文通过受控实证研究,从更新视角分析了CLIP测试时适应方法的驱动因素,揭示了适应增益主要来自测试时证据和可靠代理,而非繁重优化,并指出无单一范式普遍最优。

Comments Benchmark and codes are available at https://github.com/walawalagoose/TTABC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15145 2026-08-07 cs.AI cs.DL 版本更新 57%

An Axiomatic Benchmark for Evaluation of Scientific Novelty Metrics

一种评估科学新颖性度量的公理化基准

Miri Liu, ChengXiang Zhai

机构 * Department of Computer Science University of Illinois at Urbana-Champaign(计算机科学系伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出一种公理化基准,评估科学新颖性度量,通过跨三个AI研究领域的十项任务验证现有度量,发现无一指标完全满足所有公理,且不同架构的指标组合能显著提升基准表现。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16763 2026-08-07 cs.AI 版本更新 57%

When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation

当AI基准测试达到平台期:基准饱和的系统性研究

Mubashara Akhtar, Anka Reuel, Prajna Soni, Sanchit Ahuja, Pawan Sasanka Ammanamanchi, Ruchit Rawal, Vilém Zouhar, Srishti Yadav, Chenxi Whitehouse, Dayeon Ki, Jennifer Mickel, Leshem Choshen, Marek Šuppa, Jan Batzner, Jenny Chim, Jeba Sania, Yanan Long, Hossein A. Rahmani, Christina Knight, Yiyang Nan, Jyoutir Raj, Yu Fan, Shubham Singh, Subramanyam Sahoo, Eliya Habba, Usman Gohar, Siddhesh Pawar, Robert Scholz, Arjun Subramonian, Jingwei Ni, Mykel Kochenderfer, Sanmi Koyejo, Mrinmaya Sachan, Stella Biderman, Zeerak Talat, Avijit Ghosh, Irene Solaiman

机构 * University of California, Berkeley(加州大学伯克利分校) University of Toronto(多伦多大学) University of Washington(华盛顿大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan(密歇根大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本研究定义并分析了60个语言模型基准的饱和现象,发现近半数基准出现饱和,且专家策划而非公开测试数据影响抗饱和能力,为延长基准寿命提供了设计建议。

Comments Published at ICML 2026 (Forty-Third International Conference on Machine Learning)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17241 2026-08-07 cs.CL 版本更新 57%

Predicting Social Media User Actions: A Hybrid Approach for Common and Rare Behavior Prediction on Bluesky

基于社交媒体的人格挑战:混合预测常见和罕见用户行为于Bluesky

Benjamin White, Anastasia Shimorina

机构 * Orange Innovation(Orange创新)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出了一种混合方法,用于预测社交媒体上常见和罕见用户行为,通过结合多种模型和特征工程,在Bluesky数据集上实现了较高的预测精度,并在挑战赛中获得第一名。

Comments 1st place at SocialSim: Social-Media Based Personas challenge 2025; SoCon workshop (LREC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05699 2026-08-07 cs.CV 新提交 50%

TAU-Bench: From Anomaly Instance Tracking to Fine-Grained Video Anomaly Understanding

TAU-Bench:从异常实例跟踪到细粒度视频异常理解

Kepeng Yang, Dongxuan Liu, Rongxin Gao, Zixin Su, Rui Wu, Shuzhao Xie, Chenxin Li, Panwang Pan, Yuzhi Huang, Yue Huang, Jingyan Jiang

专题命中 评测与基准 :language model(abstract)

AI总结 该研究引入TAU-Bench这一以跟踪为核心的基准,用于联合评估异常实例跟踪与细粒度视频异常理解,发现现有视觉-语言模型存在语义推理与视觉接地的差距,为构建更可靠的视频异常理解系统提供了关键评估方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05539 2026-08-07 cs.CV 新提交 50%

OmniMech: All-in-one Multimodal Mechanical Benchmark for 3D Reconstruction

OmniMech:面向3D重建的全合一多模态机械基准

Taiting Lu, Runze Liu, Ziwei Dong, Sisong Bei, Jingying Zeng, Mingjia Wang, Zhenghao Li, Kaiyuan Lin, Yi-Shan Wu, Yangshoudu Zheng, Hongxing Pan, Kai Zhang, Guoliang Shi, Ling Ma, Yifan Yang, Jiaying Lu, Qi He, Sung-Liang Chen, Yi-Chao Chen, Yincheng Jin, Mahanth Gowda

专题命中 评测与基准 :language model(abstract)

AI总结 研究人员提出OmniMech——首个百万级多模态机械基准,针对工业制造数据的可执行CAD生成任务,含四类任务,实验发现现有模型在相关任务中存在不足,将发布资源支持后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05506 2026-08-07 cs.CV 版本更新 50%

Robust Scene Transfer for PointGoal Navigation via Privileged Sensor Guided Contrastive Learning

基于特权传感器引导对比学习的点目标导航鲁棒场景迁移

Amirhossein Zhalehmehrabi, Tiziano Tezze, Alberto Castelini, Alessandro Farinelli

机构 * University of Padua(帕多瓦大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :pretraining(abstract)

AI总结 提出一种传感器引导的自适应对比学习框架,利用特权LiDAR传感器在训练时引导视觉编码器学习导航相关结构,并通过解耦表征学习与策略优化以及跨阶段域不匹配来提升策略级场景迁移能力。

Comments 8 pages, Accepted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05836 2026-08-07 astro-ph.CO 版本更新 50%

Diagnostic Consistency Tests of the Concordance Cosmology

一致性检验的协和宇宙学

S. M. Koksbang, A. Heinesen

专题命中 评测与基准 :prompting(abstract)

AI总结 本文提出一种模型无关的框架,通过角直径距离和径向膨胀率的导数检验大尺度几何结构,提供对标准宇宙学的严格诊断。

Comments 5 pages, 1 captioned figure. v2: 6 pages, text slightly elaborated and figures updated. No changes to results. Matches version accepted for publication in PRL. Joint submission with arXiv:2604.05822

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02450 2026-08-07 math.CO 版本更新 50%

Lower bounds for multivariate independence polynomials and their generalisations

多重独立多项式的下界及其推广

Joonkyung Lee, Jaehyeon Seo

专题命中 评测与基准 :language model(abstract)

AI总结 本文研究了多重独立多项式的下界及其推广,提出并证明了关于图的独立集的不等式,并推测该结果可推广至其他反铁磁模型。

Comments 17 pages. Clarify Section 3 and add a Lean formalisation of Theorem 1.4. See https://github.com/thegreatseo/multivar-indep-formalize for the GitHub repo

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 47 篇

2608.05926 2026-08-07 cs.NI cs.AI 新提交 92%

BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks

BALANCE:无线边缘网络中的混合自回归-推测式大语言模型推理

Guanqiao Qu, Shuo Chen, Qian Chen, Kin K. Leung, Xianhao Chen

专题命中 效率与部署 :LLM(title,summary_cn);SLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对边缘LLM推理的延迟-内存权衡问题,提出混合自回归-推测式框架BALANCE,通过多项式时间算法优化资源分配,提升了任务吞吐量与服务用户数。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05695 2026-08-07 cs.AI cs.CL cs.CR 新提交 92%

DreamGuard: Efficient Runtime Guardrail for LLM Agents via Risk-Aware World Model

DreamGuard:基于风险感知世界模型的LLM智能体高效运行时护栏

Wenhao Lin, Chenyu Yu, Xingwei Lin, Sicong Cao, Xiang Chen, Lei Xue, Le Yu, Letian Sha, Chunming Wu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM智能体运行时护栏的长视野风险盲点问题,提出基于风险感知世界模型的主动式护栏DreamGuard,经实验验证其安全-效用权衡更优且延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01997 2026-08-07 cs.LG cs.AI 版本更新 91%

On the Limits of Layer Pruning for Generative Reasoning in Large Language Models

关于生成推理中大语言模型层剪枝的极限

Safal Shrestha, Anubhav Shrestha, Aadim Nepal, Minwu Kim, Keith Ross

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);post-training(abstract)

AI总结 研究发现层剪枝在分类任务中有效压缩模型但生成推理任务表现较差,揭示了剪枝对算法能力如算术和括号生成的影响,指出在受限条件下生成推理能力恢复有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05651 2026-08-07 cs.CL cs.AI cs.NE 新提交 90%

Relay, Don't Route: Adaptive Population Handoff for Cost-Efficient LLM-Driven Evolution

中继而非路由:面向成本高效的大语言模型驱动演化的自适应种群交接

Sichun Luo, Yi Huang, Guanzhi Deng, Haibo Wang, Haochen Luo, Lei Li, Zefa Hu, Junlan Feng, Qi Liu

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM驱动演化全程用强模型成本高的问题,提出无需训练的自适应种群交接框架,通过廉价模型探索、中继增益触发交接,在12个测试设置中11个获最高平均分数,性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05303 2026-08-07 cs.AR cs.CL cs.LG 新提交 90%

EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding

EdgeXpert:一种基于混合专家与推测解码的内存高效型大语言模型推理边缘设备

Sangwoo Ha, Hyunwoo Seo, Yurim Jo, Youngjin Moon, Hoi-Jun Yoo

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 EdgeXpert是一款软硬件协同设计的LLM加速器,通过优化预填充与解码阶段的专家处理,解决推测解码与MoE的兼容性问题,在降低延迟与能耗的同时维持精度,适用于边缘设备的LLM推理。

Comments Accepted at the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏