arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-04 至 2026-08-04 共收录 725 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 174 篇

2606.08417 2026-08-04 cs.CL cs.AI 版本更新 62%

Hacking Generative Perplexity: Why Unconditional Text Evaluation Needs Distributional Metrics

破解生成困惑度:为何无条件文本评估需要分布度量

Antonio Franca, Alexander Tong

机构 * AITHYRA Institute(AITHYRA研究所)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文指出生成困惑度(gen-PPL)作为非自回归语言模型评估指标存在缺陷,通过构造零参数朴素采样器在LM1B和OpenWebText上达到SOTA gen-PPL但生成不连贯文本,建议采用直接量化生成文本与参考文本分布差异的评估套件。

Comments Presented at the ICML 2026 Workshop on Structured Probabilistic Inference & Generative Modeling (SPIGM), Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15307 2026-08-04 cs.AI cs.CL 版本更新 62%

DeepSurvey-Bench: Evaluating Academic Value of Automatically Generated Scientific Surveys

DeepSurvey-Bench: 评估自动生成功科学调查的学术价值

Guo-Biao Zhang, Xian-Ling Mao, Ding-Yuan Liu, Da-Yi Wu, Tian Lan, Huihui Li, Heyan Huang

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 DeepSurvey-Bench 通过综合评估生成调查的学术价值,解决现有基准在评估深度和可靠性上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00722 2026-08-04 eess.AS cs.LG eess.SP 新提交 57%

Experience-Calibrated Contrastive Decoding for Mitigating Hallucinations in LM-Based Text-to-Speech

用于缓解基于语言模型的文本转语音中幻觉的经验校准对比解码

Chenlin Liu, Minghui Fang, Zhonghao Bi, Zekai Su, Rong Wang, Jiqing Han

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 该研究针对基于语言模型的文本转语音的语音幻觉问题,提出无训练的经验校准对比解码方法,在多数据集上显著降低错误率并提升听辨质量,为解码时缓解语音幻觉提供新方向。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02470 2026-08-04 cs.CV cs.AI 新提交 57%

Grounding Agentic VLMs with Dedicated Segmentation for Fine-Grained Vehicle Damage Assessment

基于专用分割模型实现具身智能视觉语言模型(Agentic VLMs)的细粒度车辆损伤评估

Vishwajeet Shivaji Hogale, Anjali Pai, Nitya Ravi

机构 * Northeastern University(东北大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 针对VLMs空间定位不可靠问题,本文提出TinyDamage架构,将空间定位委托给专用多任务分割模型,集成至7节点LangGraph智能体流程,在车辆损伤评估中大幅降低报告虚构率。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02358 2026-08-04 cs.CL 新提交 57%

ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step

ScrambleToolBench:即使自身的“地图”指向下一步,智能体仍会进行穷尽式搜索

Vernon Toh, Navonil Majumder, Zhengyuan Liu, Nancy F. Chen, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Agency for Science, Technology, and Research (A*STAR)(新加坡科学、技术与研究局)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 针对现有工具使用基准依赖先验知识的局限,推出ScrambleToolBench交互式终端基准,评估发现当前语言模型面对环境结构变化时难以实现稳健适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01704 2026-08-04 cs.IR cs.CL cs.HC 新提交 57%

Floor, Ceiling, and the Fusion Gap: How Much of Crowd Reading Attention Can Machines Predict?

下限、上限与融合差距:机器能预测多少群体阅读注意力?

Kazuki Nakayashiki, Keisuke Watanabe

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 该研究构建了群体阅读注意力预测任务的上下限与融合差距,发现前沿模型仅能捕捉部分差距,多模型融合可提升性能,蒸馏后的8B学生模型能保留融合的大部分优势,证实人群信号存在于文档级结构中。

Comments 8 pages. Ancillary files include the pre-registrations, hostile-audit records, verification scripts, and the aggregate artifacts every reported number is generated from

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01033 2026-08-04 cs.CR cs.AI 新提交 57%

CallScreenBench: Benchmarking On-Device Models as Phone Secretaries

CallScreenBench:将端侧模型作为电话秘书的基准测试

Simiao Ren

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究人员提出CallScreenBench基准,针对端侧模型作为电话秘书的场景,从五个维度评分,发现分类性能差异是测量假象,脚本退化代理提供基准线,未设通过/失败阈值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25379 2026-08-04 cs.AI 版本更新 57%

Cyber-Capable AI Agents: Vulnerabilities, Evaluation Containment, and Defensive Response

具备网络能力的人工智能代理:漏洞、评估遏制与防御响应

Abu Bakar Siddik

机构 * Rajshahi University of Engineering & Technology(拉杰沙希工程技术大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究具备网络能力的人工智能代理的漏洞等问题,综合五类漏洞,以特定事件为案例研究,探讨遏制等控制措施,确定评估网络能力及其运行环境安全性的实际优先事项。

Comments 27 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05915 2026-08-04 cs.AI 版本更新 57%

PCBWorld: A Benchmark Environment for Engine-Grounded PCB Design Automation

PCBWorld:用于基于引擎的PCB设计自动化的基准环境

Hyungseok Song, Junseok Park, Won-Seok Choi, Seohui Bae, Han-Seul Jeong, Youngjoon Park, Soonyoung Lee

机构 * LG AI Research(LG人工智能研究院)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究旨在改进PCB布线,介绍基于KiCad EDA引擎的开源环境PCBWorld及数据集PCBWorld-Bench,支持多种智能体。实验表明其中智能体性能优于基线,仅在合成板训练的强化学习策略可零样本迁移到真实板,有望提升布线能力。

Comments Accepted to the KDD 2026 Workshop on Evaluation and Trustworthiness of Agentic AI (non-archival). Main text with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17020 2026-08-04 cs.CV cs.AI 版本更新 57%

FusionRS: A Large-Scale RGB-Infrared-Style Remote Sensing Dataset for Cross-Modal Vision-Language Learning

FusionRS: 用于双模态视觉-语言基础模型的大规模RGB-红外遥感数据集

Jiaju Han, Ben Zhang, Xuemeng Sun, Qike Zhang, Yuxian Dong, Dingyi Lu, Chengyin Hu, Luwei Yang, Fengyu Zhang, Yiwei Wei, Jiujiang Guo

机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) University of Electronic Science and Technology of China(电子科技大学) Tianjin University(天津大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 针对遥感视觉-语言模型缺乏红外数据的问题,提出首个大规模RGB-红外-文本数据集FusionRS,通过翻译RGB图像为红外风格并配以红外感知描述,训练双模态基础模型,提升RGB-红外对齐和双模态字幕生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06055 2026-08-04 cs.AI 版本更新 57%

HUSH-Bench: Measuring Memory-Use Boundaries for Sensitive History in Conversational Agents

记忆何时应保持沉默:衡量记忆增强型对话代理的记忆使用边界

Lingxiang Xu, Jiaoyun Yang, Min Hu, Ning An

机构 * Hefei University of Technology(合肥工业大学) Harvard Medical School(哈佛医学院)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 提出RBI-Eval框架,通过探针集比较模型在有/无敏感记忆时的行为差异,发现当前检索增强生成系统无法避免敏感记忆的不当整合,需在检索和生成阶段同时进行记忆感知决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17920 2026-08-04 cs.LG 版本更新 57%

SingLEM: Single-Channel Large EEG Model

SingLEM:单通道脑电大模型

Jamiyan Sukhbaatar, Satoshi Imamura, Ibuki Inoue, Shoya Murakami, Kazi Mahmudul Hassan, Seungwoo Han, Ingon Chanpornpakdi, Toshihisa Tanaka

机构 * Department of Electronic and Information Engineering, Tokyo University of Agriculture and Technology(电子信息工程系,东京农业科技大学) Department of Electronics and Communication Engineering, National University of Mongolia(电子与通信工程系,蒙古国立大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 SingLEM是一种自监督单通道EEG基础模型,通过71个公开EEG数据集预训练,在6项任务的严格评估中表现优于对比方法,支持灵活的EEG特征提取与空间分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02561 2026-08-04 cs.CV 新提交 50%

ReMiX-MAE: Learning Missing-Channel Cross-Modal Representations from RGB-Only Clinical Facial Videos for Sympathetic-Mediated Pain Assessment

ReMiX-MAE:从仅含RGB的临床面部视频中学习缺失通道跨模态表征以用于交感介导的疼痛评估

Nan Bi, Taoyue Wang, Lijun Yin, Vandana Sharma

机构 * School of Computing, Binghamton University(宾汉姆顿大学计算学院) SUNY Upstate Medical University(纽约州立大学上州医科大学)

专题命中 评测与基准 :pretraining(abstract)

AI总结 本文提出ReMiX-MAE框架,构建SMP数据集,在仅用RGB的疼痛评估任务中,其性能优于仅用RGB的基线,且在数据有限的临床场景中迁移能力更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02315 2026-08-04 cs.CV 新提交 50%

GEOID-Flood: A Large-Scale Multi-Modal Benchmark Dataset for Flood Segmentation

GEOID-Flood:用于洪水分割的大规模多模态基准数据集

Gaetano Chiriaco, Luca Barco, Andrea Bragagnolo, Claudio Rossi, Edoardo Arnaudo

机构 * Fondazione LINKS(LINKS基金会) Politecnico di Torino(都灵理工大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 该研究推出GEOID-Flood大规模多模态洪水分割基准数据集,评估发现基础模型优势适度,光学-SAR融合微调效果最佳,该数据集训练的模型迁移性更优。

Comments Accepted at ECCV 2026 - Terrabytes II Workshop, 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02001 2026-08-04 cs.SE 新提交 50%

VulnGym: Benchmarking Coding Agents for Repository-Level Vulnerability Detection

VulnGym:面向代码智能体的仓库级漏洞检测基准测试

Kexing Ji, Jiachen Liu, Enze Hu, Cuiyun Gao, Keke Lian, Yongheng Liu, Lei Zhang, Tian Dong, Hao Chen, Wang Bin

专题命中 评测与基准 :LLM(abstract)

AI总结 研究人员提出VulnGym基准,解决现有基准难以评估代码智能体仓库级漏洞检测能力的问题,发现当前代码智能体在该检测及支撑追踪构建上仍存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01973 2026-08-04 cs.RO cs.CV 新提交 50%

Roomer: Reflective Object-Grounded Model Editing and Repair for 3D Indoor Layout Synthesis

Roomer:用于3D室内布局合成的基于对象的反射式模型编辑与修复

Lingwei Dang, Ziyan Qiu, Jiajia Cheng, Shishuo Shang, Zhenhao Zhang, Yufei Zhu, Qingxin Xiao, Pan Liu, Shenghui Huang, Yun Hao, Juntong Li, Qingyao Wu

专题命中 评测与基准 :language model(abstract)

AI总结 针对现有室内布局生成器的局部违规问题,提出Roomer框架,通过视觉语言模型规划器与确定性求解器实现基于对象的局部修复,提升布局物理有效性与可用性且可跨生成器迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01948 2026-08-04 cs.CV 新提交 50%

Event ActivityNet: A Large-Scale Simulated-Event Benchmark for Untrimmed Action Understanding

Event ActivityNet:用于未修剪动作理解的大规模模拟事件基准

Cheng-Yao Hong, Ting-Wei Lin, Yun-Chung Lai, Hua-Wei Lee, Hwann-Tzong Chen, Tyng-Luh Liu

专题命中 评测与基准 :pretraining(abstract)

AI总结 本文提出大规模模拟事件基准Event ActivityNet,解决长时序事件动作理解数据集不足的问题,建立基线并验证其预训练对原生事件微调的性能提升效果。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01906 2026-08-04 cs.CV 新提交 50%

Assessing the Benefits of Combining Advanced Deep Learning Techniques for Post-Disaster Building Damage Assessment from UAV Imagery

结合先进深度学习技术的优势,从无人机影像中评估灾后建筑物损毁情况

Huy Quang Ung, Guillaume Habault, Roberto Legaspi, Hao Niu, Lian Cao, Masato Taya

机构 * KDDI Research, Inc.(KDDI研究所)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出将CV模型与LVLM结合的混合框架,在RescueNet、FloodNet基准上评估,可准确统计灾后建筑物损毁情况,性能优于单独基准模型且仅需少量标注数据,相关资源公开。

Comments Accepted at ECMLPKDD 2026, 31 pages (including appendix), 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00844 2026-08-04 cs.CY cs.HC 新提交 50%

BoilerSketch: A TA-Supervised, Diagram-First GenAI Practice for Structured Diagrams in CS1/Early CS2

BoilerSketch:面向CS1/早期CS2的TA监督、以图表为核心的生成式AI结构化图表实践

Ethan Dickey, Vivan Tiwari, Anvit Sinha, Andres Bejarano

专题命中 评测与基准 :prompting(abstract)

AI总结 BoilerSketch是面向CS1/早期CS2的TA监督式生成式AI实践,通过双面板交互模型生成结构化Mermaid图表,经21名教学人员评估,三分之二认为其对概念理解和支持任务有中等以上帮助,为入门计算课程提供了实用AI支持方案。

Comments 9 pages, 3 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00775 2026-08-04 cs.RO cs.CV cs.HC 新提交 50%

ORCESTRA: VLM-driven Visual Robot programming in Mixed Reality

ORCESTRA:基于视觉语言模型的混合现实视觉机器人编程系统

Ivan Snegirev, Elizaveta Semenyakina, Mikhail Konenkov, Artem Lykov, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Skolkovo Institute of Science and Technology(斯科尔科沃科技学院) R&D Center, MWS(MWS研发中心)

专题命中 评测与基准 :language model(abstract)

AI总结 ORCESTRA是一款混合现实系统,通过无代码路径点示教和语言引导控制实现机器人数字孪生编程,支持多种异构机器人,其混合现实验证可作为语言引导机器人物理部署前的安全层。

Comments 4 page, 3 figures, 1 table, ISMAR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00736 2026-08-04 cs.CV 新提交 50%

MDTD-ArtIR: Benchmarking Image Editing and Restoration Models for Art Image Restoration under Texture-Overlay Degradations

MDTD-ArtIR:针对纹理叠加退化的艺术图像修复的图像编辑与修复模型基准测试

Mridula Vijendran, Shuang Chen, Hubert P. H. Shum

机构 * Durham University(杜伦大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本研究构建MDTD-Art基准及MDTD-Art数据集,对比各类模型,发现图像编辑模型在艺术图像修复中优于专用修复架构,结构化提示可放大其性能优势。

Comments 15 pages, 6 figures, 6 tables. Preprint submitted to Elsevier Journal of Visual Communication and Image Representation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00652 2026-08-04 cs.RO 新提交 50%

Assistant Placement Aria: A Benchmark for Egocentric Placement Assistance

助手放置基准Aria:面向以自我为中心的放置辅助任务的基准

Amir Belder, Gonçalo Dias Pais, Refael Vivanti, Omri Carmi, Daniel DeTone, Oren Shrout, Ido Gattegno, Ayellet Tal

机构 * Reality Labs, Meta inc.(Meta公司现实实验室) Technion, institute of technology(以色列理工学院) Sensei

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出首个虚拟放置基准Assistant Placement Aria,涵盖三类以人为中心的放置任务,在基准上评估了多个基础模型,推动虚拟放置领域研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00105 2026-08-04 cs.CV q-bio.QM 新提交 50%

What Carries the Signal in Pathology Foundation-Model Atlases? A Patient-Level Controlled Benchmark in Breast Cancer

病理基础模型图谱中的信号由什么承载?乳腺癌的患者级对照基准测试

Chimdi Walter Ndubuisi

机构 * University of Missouri(密苏里大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本研究以乳腺癌患者为单位开展对照基准测试,发现病理基础模型的信号由嵌入而非几何机制承载,嵌入在多数基因程序预测中优于组织组成,驱动基因计数指标无显著预测性。

Comments 40 pages, 7 figures, 10 tables. Supplementary Information (16 pages) included as an ancillary file. Segmentation outputs obtained under the Aignostics Research Access Programme; OpenTME data at https://huggingface.co/datasets/Aignostics/OpenTME

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04529 2026-08-04 cs.IR 版本更新 50%

Evaluation and Explainability of Unsupervised Scholarly Collaboration Recommendations

无监督学术合作推荐的评估与可解释性

Md Asaduzzaman Noor, John W. Sheppard, Jason A. Clark

专题命中 评测与基准 :language model(abstract)

AI总结 研究无监督、基于内容的学术合作推荐,比较TF-IDF基线、主题模型和基于嵌入的检索等方法,引入受限设置评估模型,还从两视角考察可解释性,展现不同方法差异及权衡。

Comments 6 pages, 2 figures, Submitted to ICMLA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30514 2026-08-04 cs.CV 版本更新 50%

3D Scene-Adaptive Trajectory-Controllable Human Image Animation with Camera Movement

3D场景自适应轨迹可控的人体图像动画与相机运动

Deyin Liu, Jicheng Xu, Lin Yuanbo Wu, Xiaowei Zhao, Xiatian Zhu, Zhe Jin, Anjan Dutta

机构 * Engineering Research Center of Autonomous Unmanned System Technology(自主无人系统工程研究中心) Ministry of Education(教育部) Anhui Provincial Key Laboratory of Security Artificial Intelligence(安徽省安全人工智能重点实验室) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) University of Warwick(沃林格大学) Zhejiang Yuexiu University(浙江越秀大学) University of Surrey(萨里大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出场景自适应人体动画框架,通过地面自适应3D运动重定向和视角自适应潜在融合机制,实现自然场景中人体运动与相机轨迹的可控视频生成。

Comments Accepted to the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25806 2026-08-04 cs.CV 版本更新 50%

An Analysis Focused on Womens Safety: Can VAD Models Be Enhanced by a Multi-modal Dataset?

聚焦女性安全分析:多模态数据集能否增强VAD模型?

Sangeeta ., Maddikuntla Sai Prajwal, Debi Prosad Dogra, Kamalakar Vijay Thakare, Hyungjoo Jung, Ig-Jae Kim, Heeseung Choi

机构 * Indian Institute of Technology Bhubaneswar(印度理工学院巴特那分校) Artificial Intelligence and Robotics Institute, Korea Institute of Science and Technology(人工智能与机器人研究所,韩国科学技术院) Yonsei-KIST Convergence Research Institute, Yonsei University(延世大学KIST融合研究中心)

专题命中 评测与基准 :LLM(abstract)

AI总结 针对现有视频异常检测数据集缺乏女性中心异常样本的问题,提出包含1001个视频及文本描述的多模态基准ExtrAnom,覆盖5种犯罪类型,并验证了多模态方法在检测女性中心异常上的有效性。

Comments 15 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21930 2026-08-04 cs.SE 版本更新 50%

PITMuS: A Tool for Automated Bug Dataset Generation via Source-Level Mutant Reconstruction

PITMuS: 通过源级变异体重建实现自动化bug数据集生成工具

Tasfia Tasnim, Soneya Binta Hossain

专题命中 评测与基准 :LLM(abstract)

AI总结 本文提出PITMuS工具,通过源级变异体重建生成自动化bug数据集,解决现有工具生成的变异体难以复现和利用的问题,为bug定位和修复技术提供结构化数据支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05637 2026-08-04 cs.SE 版本更新 50%

Real Faults in Model Context Protocol (MCP) Software: a Comprehensive Taxonomy

模型上下文协议(MCP)软件中的真实故障:一种全面的分类

Mina Taraghi, Mohammad Mehdi Morovati, Foutse Khomh

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文首次提出MCP服务器故障的分类,通过实证研究识别出五个高层故障类别,揭示MCP特定故障与非MCP故障的区别,为提升AI软件系统的可靠性提供依据。

Comments Revised version following peer review. Expanded methodological details, practitioner-survey validation, statistical analyses, and discussion; main conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14546 2026-08-04 cs.RO 版本更新 50%

QuASH: Using Natural-Language Heuristics to Query Visual-Language Robotic Maps

QuASH:使用自然语言启发式方法查询视觉语言机器人地图

Matti Pekkanen, Francesco Verdoja, Ville Kyrki

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出QuASH方法,利用自然语言启发式处理查询相关的语言空间,训练分类器划分环境,提升地图和图像的可查询性,该方法与表示及编码器无关且训练量有限。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 147 篇

2603.13418 2026-08-04 cs.LG cs.AI 版本更新 94%

GPrune-LLM: Generalization-Aware Structured Pruning for Large Language Models

GPrune-LLM: 为大语言模型的通用性感知结构剪枝

Xiaoyun Liu, Divya Saxena, Jiannong Cao, Yuqing Zhao, Yiying Dong, Penghui Ruan

机构 * Department of Computing, The Hong Kong Polytechnic University, Hong Kong(香港理工大学计算机系) School of Artificial Intelligence and Data Science, IIT Jodhpur(IIT朱罗浦人工智能与数据科学学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出GPrune-LLM框架,通过识别神经元在不同分布下的行为差异,改进结构化剪枝方法,提升模型在分布外任务中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏