arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-27 至 2026-02-27 共收录 213 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 45 篇

2602.23062 2026-02-27 cs.CL 77%

Toward Automatic Filling of Case Report Forms: A Case Study on Data from an Italian Emergency Department

迈向自动填写病例报告表:一项关于意大利急诊科数据的案例研究

Gabriela Anna Kaczmarek, Pietro Ferrazzi, Lorenzo Porta, Vicky Rubini, Bernardo Magnini

机构 * Italian Emergency Department(意大利急诊部门)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一项基于意大利急诊科数据的案例研究,展示如何利用大型语言模型自动填写病例报告表,并揭示了模型偏见问题。

Journal ref Published at 11th Language & Technology Conference: Human Language Technologies as a Challenge for Computer Science, Linguistics and Low Resourced Languages, 2025, Poznań, Poland

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03772 2026-02-27 cs.LG stat.ML 77%

Skewed Score: A statistical framework to assess autograders

偏斜评分:一个评估自动评分器的统计框架

Magda Dubois, Harry Coppock, Mario Giulianelli, Timo Flesch, Lennart Luettgau, Cozmin Ududec

机构 * UK AI Security Institute(英国人工智能安全研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于贝叶斯广义线性模型的统计框架,用于评估自动评分器的可靠性与偏见,提升LLM评估的稳健性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12150 2026-02-27 cs.AI cs.CL cs.LG 76%

GPT-4o Lacks Core Features of Theory of Mind

GPT-4o 缺乏理论思维的核心特征

John Muchovej, Amanda Royka, Shane Lee, Julian Jara-Ettinger

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG;LLM(comments)

AI总结 研究发现,尽管LLMs在简单ToM任务中表现良好,但其在逻辑等价任务中表现不佳,表明其缺乏一致的理论思维能力。

Comments Submitted to CogSci 2025; see more at https://jmuchovej.com/projects/llm-tom. Note: "abstractness" is the second feature we test for, but due to arXiv's abstract requirements, the text has been altered

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22374 2026-02-27 cs.HC 75%

VoiceAlign: A Shimming Layer for Enhancing the Usability of Legacy Voice User Interface Systems

VoiceAlign:一种增强传统语音用户界面系统可用性的 shim 层

Md Ehtesham-Ul-Haque, Syed Masum Billah

专题命中 评测与基准 :large language model(abstract);language model(abstract);small language model(abstract)

AI总结 VoiceAlign 通过适应性 shim 层提升传统语音用户界面系统的可用性,减少命令失败并降低用户认知负担。

Comments Accepted at IUI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22697 2026-02-27 cs.CL cs.AI 73%

Reinforcing Real-world Service Agents: Balancing Utility and Cost in Task-oriented Dialogue

强化现实服务代理:在任务导向对话中平衡效用与成本

Ning Gao, Wei Zhang, Yuqin Dai, Ling Shi, Ziyin Wang, Yujie Wang, Wei He, Jinpeng Wang, Chaozheng Wang

机构 * Ning Gao Wei Zhang Yuqin Dai Ling Shi Ziyin Wang Yujie Wang Wei He Jinpeng Wang Chaozheng Wang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 InteractCS-RL通过多粒度强化学习框架,在任务导向对话中平衡效用与成本,通过用户驱动策略和成本感知优化提升代理性能。

Comments 35 pages, 8 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00564 2026-02-27 cs.AI cs.CL 73%

Unmasking Reasoning Processes: A Process-aware Benchmark for Evaluating Structural Mathematical Reasoning in LLMs

揭示推理过程:一种评估大语言模型结构性数学推理的过程感知基准

Xiang Zheng, Weiqi Zhai, Wei Wang, Boyu Yang, Wenbo Li, Ruixiang Luo, Haoxiang Sun, Yucheng Wang, Zhengze Li, Meng Wang, Yuetian Du, Guojie Lin, Yaxuan Wang, Xiaoxiao Xu, Yanhu Mo, Xuan Ren, Hu Wei, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ReasoningMath-Plus基准,通过过程感知评估方法揭示大语言模型在结构性数学推理中的不足,引入HCRS评分函数和过程奖励模型,发现仅答案指标可能高估推理能力。

Comments 8 pages, and 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19060 2026-02-27 cs.CV cs.AI cs.CL 73%

PoSh: Using Scene Graphs To Guide LLMs-as-a-Judge For Detailed Image Descriptions

PoSh:利用场景图引导LLM-as-a-Judge进行详细图像描述

Amith Ananthram, Elias Stengel-Eskin, Lorena A. Bradford, Julia Demarest, Adam Purvis, Keith Krut, Robert Stein, Rina Elster Pantalony, Mohit Bansal, Kathleen McKeown

机构 * Columbia University(哥伦比亚大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) The National Gallery of Art(国家艺术馆) UCLA(加州大学洛杉矶分校) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 PoSh通过利用场景图引导LLM-as-a-Judge,提供了一种更准确的详细图像描述评估方法,并展示了其在新数据集DOCENT中的优越表现。

Comments Accepted at ICLR 2026. 26 pages, 9 figures. Metric/benchmark available at https://github.com/amith-ananthram/posh

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22219 2026-02-27 cs.IR cs.AI cs.CL 73%

Comparative Analysis of Neural Retriever-Reranker Pipelines for Retrieval-Augmented Generation over Knowledge Graphs in E-commerce Applications

电商应用场景下知识图谱检索增强生成中神经检索-排序流水线的比较分析

Teri Rumble, Zbyněk Gazdík, Javad Zarrin, Jagdeep Ahluwalia

机构 * Abertay University(阿伯泰大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究电商场景下知识图谱检索增强生成中神经检索-排序流水线的设计与比较,通过实验验证了优化配置在提升检索性能上的有效性。

Comments This manuscript is under review at the Springer journal Knowledge and Information Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24796 2026-02-27 cs.LO cs.AI cs.FL cs.LG math.CT 73%

LeanCat: A Benchmark Suite for Formal Category Theory in Lean (Part I: 1-Categories)

LeanCat:Lean中的形式范畴论基准测试套件(第一部分:1-范畴)

Rongge Xu, Hui Dai, Yiming Fu, Jiedong Jiang, Tianjiao Nie, Junkai Wang, Holiverse Yang, Zhi-Hao Zhang

机构 * Yau Mathematical Sciences Center, Tsinghua University(清华大学尤洋数学科学中心) Iluvatar CoreX Department of Mathematics, Southern University of Science and Technology(南方科技大学数学系) Westlake Institute for Advanced Study, Westlake University(西湖研究学院) Qiuzhen College, Tsinghua University(清华大学齐臻学院) Department of Physics, The Chinese University of Hong Kong(香港中文大学物理系) Yanqi Lake Beijing Institute of Mathematical Sciences and Applications (BIMSA)(燕琦湖北京应用数学研究所(BIMSA))

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 LeanCat通过100个形式化范畴论任务测试模型的抽象能力,揭示了现有模型在组合泛化上的不足,提出LeanBridge通过迭代优化提升性能至24%。

Comments 22 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23300 2026-02-27 cs.CL eess.AS 70%

A Mixture-of-Experts Model for Multimodal Emotion Recognition in Conversations

一种用于对话中多模态情绪识别的专家混合模型

Soumya Dutta, Smruthi Balaji, Sriram Ganapathy

机构 * LEAP Lab, Department of Electrical Engineering(LEAP实验室,电气工程系) Microsoft(微软)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MiSTER-E通过专家混合框架提升对话中多模态情绪识别的准确率,实现跨模态一致性与融合。

Comments Accepted to Elsevier Computer Speech and Language. 30 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23184 2026-02-27 cs.CL 70%

MTRAG-UN: A Benchmark for Open Challenges in Multi-Turn RAG Conversations

MTRAG-UN:多轮检索增强生成对话中开放挑战的基准

Sara Rosenthal, Yannis Katsis, Vraj Shah, Lihong He, Lucian Popa, Marina Danilevsky

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MTRAG-UN是一个用于评估多轮检索增强生成对话中开放挑战的基准,包含666个任务和2800多轮对话,揭示了检索和生成模型在处理无答案、无描述等问题时的不足。

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22973 2026-02-27 cs.AI 70%

Modeling Expert AI Diagnostic Alignment via Immutable Inference Snapshots

通过不可变推理快照建模专家AI诊断对齐

Dimitrios P. Panagoulias, Evangelia-Aikaterini Tsichrintzi, Georgios Savvidis, Evridiki Tsoureli-Nikita

机构 * organization= Department of Informatics, University of Piraeus , addressline= Karaoli ke Dimitriou 80 , city= Piraeus , postcode= 18534 , country= Greece organization= Department of Research \& Development, Noetiv PC , addressline= Valaoritou 18 , city= Athens , postcode= 10671 , country= Greece organization= Department of Dermatology, Dermacen SA , addressline= Valaoritou 18 , city= Athens , postcode= 10671 , country= Greece

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过不可变推理快照建模专家AI诊断对齐,提升临床决策支持系统评估的准确性与可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04403 2026-02-27 cs.CV cs.CL cs.CR 70%

Self-adaptive Dataset Construction for Real-World Multimodal Safety Scenarios

自适应数据集构建用于现实世界多模态安全场景

Jingen Qu, Lijun Li, Bo Zhang, Yichen Yan, Jing Shao

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种图像导向的自适应数据集构建方法,用于构建现实世界多模态安全场景的数据集,通过生成35,000个图像-文本对及其指导响应,提升了安全评估的有效性。

Comments Accepted at EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22236 2026-02-27 q-bio.GN cs.CV cs.LG 70%

CrossLLM-Mamba: Multimodal State Space Fusion of LLMs for RNA Interaction Prediction

CrossLLM-Mamba: LLMs多模态状态空间融合用于RNA相互作用预测

Rabeya Tus Sadia, Qiang Ye, Qiang Cheng

机构 * Department of Computer Science, University of Kentucky, Lexington, KY, USA(计算机科学系,肯塔基大学,路易斯维尔,KY,美国) Department of Mathematics, University of Kentucky, Lexington, KY, USA(数学系,肯塔基大学,路易斯维尔,KY,美国) Institute for Biomedical Informatics, University of Kentucky, Lexington, KY, USA(生物医学信息学研究所,肯塔基大学,路易斯维尔,KY,美国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 CrossLLM-Mamba通过多模态状态空间融合实现RNA相互作用预测,采用双向Mamba编码器和动态序列转换模型,达到高精度性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22416 2026-02-27 cs.HC 67%

Seeing Graphs Like Humans: Benchmarking Computational Measures and MLLMs for Similarity Assessment

像人类一样看图:通过计算度量和MLLMs进行相似性评估的基准测试

Seokweon Jung, Jeongmin Rhee, Seoyoung Doh, Hyeon Jeon, Ghulam Jilani Quadri, Jinwook Seo

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文通过实验比较了计算度量和MLLMs在图相似性评估中的表现,发现MLLMs,特别是GPT-5,在匹配人类感知方面表现优异,能提供可解释的推理理由。

Comments 21 pages including 1 page of appendix, 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22988 2026-02-27 cs.LG cs.AI 62%

Residual Koopman Spectral Profiling for Predicting and Preventing Transformer Training Instability

残差Koopman谱分析用于预测和防止Transformer训练不稳定性

Bum Jun Kim, Shohei Taniguchi, Makoto Kawano, Yusuke Iwasawa, Yutaka Matsuo

机构 * Graduate School of Engineering, The University of Tokyo, Japan(东京大学工学系研究生院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 残差Koopman谱分析通过预测和防止Transformer训练不稳定性,显著降低发散率并提升学习率

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01780 2026-02-27 cs.AI cs.CL 62%

LiveMCPBench: Can Agents Navigate an Ocean of MCP Tools?

LiveMCPBench: 代理能否在MCP工具的海洋中导航?

Guozhao Mo, Wenliang Zhong, Jiawei Chen, Qianhao Yuan, Xuanang Chen, Yaojie Lu, Hongyu Lin, Ben He, Xianpei Han, Le Sun

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 LiveMCPBench通过大规模基准测试揭示MCP代理在检索和工具组合上的性能差距,强调检索错误是主要瓶颈,并提供可重复的评估框架和工具套件。

Comments Our code and data will be publicly available at https://icip-cas.github.io/LiveMCPBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23335 2026-02-27 cs.HC cs.AI cs.IR 57%

Understanding Usage and Engagement in AI-Powered Scientific Research Tools: The Asta Interaction Dataset

理解人工智能驱动的科学研究工具的使用与参与:Asta交互数据集

Dany Haddad, Dan Bareket, Joseph Chee Chang, Jay DeYoung, Jena D. Hwang, Uri Katz, Mark Polak, Sangho Suh, Harshit Surana, Aryeh Tiktinsky, Shriya Atmakuri, Jonathan Bragg, Mike D'Arcy, Sergey Feldman, Amal Hassan-Ali, Rubén Lozano, Bodhisattwa Prasad Majumder, Charles McGrady, Amanpreet Singh, Brooke Vlahos, Yoav Goldberg, Doug Downey

机构 * Allen Institute for AI(艾伦人工智能研究所) Core contributors(核心贡献者)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文通过Asta交互数据集研究用户在AI驱动的科学研究工具中的使用模式与参与行为,揭示了用户如何将系统视为协作伙伴,并提出了新的查询意图分类法以指导未来设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03495 2026-02-27 cs.SE cs.AI 57%

AgentHub: A Registry for Discoverable, Verifiable, and Reproducible AI Agents

AgentHub: 一个用于可发现、可验证和可重复的AI代理注册表

Erik Pautsch, Tanmay Singla, Parv Kumar, Wenxin Jiang, Huiyun Peng, Behnaz Hassanshahi, Konstantin Läufer, George K. Thiruvathukal, James C. Davis

机构 * Purdue University, USA(普渡大学) Socket Inc.(Socket公司) Oracle Labs(Oracle实验室)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 AgentHub旨在通过提供一个注册表层和研究议程,实现AI代理的可发现性、可验证性和可重复性,以构建可靠且可重用的代理生态系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22302 2026-02-27 cs.AI cs.MA cs.SE 57%

Agent Behavioral Contracts: Formal Specification and Runtime Enforcement for Reliable Autonomous AI Agents

智能体行为契约:为可靠自主AI智能体的正式规范与运行时执行

Varun Pratap Bhardwaj

机构 * Accenture(埃森哲)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出智能体行为契约框架,通过形式化规范和运行时执行,提升自主AI智能体的可靠性与行为可控性。

Comments 71 pages, 7 figures, 14 tables. Patent pending. Also available on Zenodo: DOI 10.5281/zenodo.18775393

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14162 2026-02-27 cs.CL cs.CV cs.IR 57%

Index Light, Reason Deep: Deferred Visual Ingestion for Visual-Dense Document Question Answering

索引轻,推理深:延迟视觉摄入用于视觉密集文档问答

Tao Xu

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出延迟视觉摄入框架,通过分层图号聚类构建索引,利用BM25检索和VLM分析提升视觉密集文档问答性能。

Comments 24 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23229 2026-02-27 cs.CV 50%

Large Multimodal Models as General In-Context Classifiers

大多模态模型作为通用上下文分类器

Marco Garosi, Matteo Farina, Alessandro Conti, Massimiliano Mancini, Elisa Ricci

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出CIRCLE方法,通过伪标签迭代优化,使LMM在开放世界分类中超越VLM,展示LMM作为统一分类器的潜力。

Comments CVPR Findings 2026. Project website at https://circle-lmm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22671 2026-02-27 cs.RO cs.ET 50%

Does the testing environment matter? Carsickness across on-road, test-track, and driving simulator conditions

驾驶环境是否影响晕动症?公路、测试赛道和驾驶模拟器条件下的晕动症

Georgios Papaioannou, Barys Shyrokau

专题命中 评测与基准 :prompting(abstract)

AI总结 本研究通过驾驶模拟器再现公路晕动症暴露,发现其晕动症评分显著低于公路和测试赛道条件,因模拟器无法再现低频运动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22663 2026-02-27 cs.RO 50%

Rethinking the Practicality of Vision-language-action Model: A Comprehensive Benchmark and An Improved Baseline

重新审视视觉-语言-动作模型的实用性:一个全面的基准和一个改进的基线

Wenxuan Song, Jiayi Chen, Xiaoquan Sun, Huashuo Lei, Yikai Qin, Wei Zhao, Pengxiang Ding, Han Zhao, Tongxin Wang, Pengxu Hou, Zhide Zhong, Haodong Yan, Donglin Wang, Jun Ma, Haoang Li

机构 * OpenHelix-Team(OpenHelix团队)

专题命中 评测与基准 :post-training(abstract)

AI总结 本文提出CEbench基准和LLaVA-VLA模型,通过轻量级设计和两阶段训练提升视觉-语言-动作模型的实用性,实现在消费级GPU上的实际应用。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22311 2026-02-27 astro-ph.GA astro-ph.IM 50%

Galaxy Zoo: Cosmic Dawn -- morphological classifications for over 41,000 galaxies in the Euclid Deep Field North from the Hawaii Two-0 Cosmic Dawn survey

银河系动物园:宇宙黎明——来自欧几里得深场北区的41,000多颗星系形态分类,来自夏威夷二十度宇宙黎明调查

James Pearson, Hugh Dickinson, Stephen Serjeant, Mike Walmsley, Lucy Fortson, Sandor Kruk, Karen L. Masters, Brooke D. Simmons, R. J. Smethurst, Chris Lintott, Lukas Zalesky, Conor McPartland, John R. Weaver, Sune Toft, Dave Sanders, Nima Chartab, Henry Joy McCracken, Bahram Mobasher, Istvan Szapudi, Noah East, Wynne Turner, Matthew Malkan, William J. Pearson, Tomotsugu Goto, Nagisa Oi

专题命中 评测与基准 :foundation model(abstract)

AI总结 银河系动物园:宇宙黎明通过公民科学家和深度学习模型对41,000多颗星系进行形态分类,并发现51个新引力透镜。

Comments 23 pages; 21 figures; 3 tables; accepted for publication in MNRAS

Journal ref MNRAS, 546:3 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22843 2026-02-27 cs.CV 50%

Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering

打破多模态知识驱动视觉问答中的视觉捷径

Dosung Lee, Sangwon Jung, Boyoung Kim, Minyoung Kim, Sungyeon Kim, Junyoung Sung, Paul Hongsuck Seo

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) Amazon(亚马逊)

专题命中 评测与基准 :LLM(abstract)

AI总结 本研究通过RETINA基准和MIMIR方法,打破多模态知识驱动视觉问答中的视觉捷径问题,验证现有模型对捷径的依赖并展示改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 46 篇

2505.18502 2026-02-27 cs.AI cs.CL cs.LG 90%

Knowledge Fusion of Large Language Models Via Modular SkillPacks

通过模块化技能包实现大语言模型的知识融合

Guodong Du, Zhuo Li, Xuanning Zhou, Junlin Li, Zesheng Shi, Wanyu Lin, Ho-Kin Tang, Xiucheng Li, Fangming Liu, Wenya Wang, Min Zhang, Jing Li

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GraftLLM通过模块化技能包实现大语言模型的知识融合,提升跨能力迁移的效率和效果。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03801 2026-02-27 cs.LG cs.AI 90%

Large Language Model Compression with Global Rank and Sparsity Optimization

大型语言模型压缩与全局秩和稀疏性优化

Changhai Zhou, Qian Qiao, Yuhua Zhou, Yuxin Wu, Shichao Weng, Weizhong Zhang, Cheng Jin

机构 * Fudan University(复旦大学) Soul AILab, OpenWPLab(Soul AILab,OpenWPLab) Zhejiang University(浙江大学) Renmin University of China(中国人民大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种两阶段LLM压缩方法,通过全局资源分配优化秩和稀疏性,有效提升模型压缩性能。

Comments 33 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26577 2026-02-27 cs.CL cs.LG 88%

Inference-Cost-Aware Dynamic Tree Construction for Efficient Inference in Large Language Models

面向推理成本的动态树结构构建用于大型语言模型高效推理

Yinrong Hong, Zhiquan Tan, Kai Hu

机构 * Beihang University(北航大学) E Fund Management Co., Ltd.(E基金管理有限公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出CAST方法,通过考虑推理成本优化动态树结构,显著提升大型语言模型的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22345 2026-02-27 cs.LG cs.AI 88%

Structure and Redundancy in Large Language Models: A Spectral Study via Random Matrix Theory

大语言模型的结构与冗余:通过随机矩阵理论的谱研究

Davide Ettori

机构 * Laurea Magistrale in Computer Science Engineering - Ingegneria Informatica(计算机科学工程硕士课程 - 信息工程)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究通过谱几何和随机矩阵理论,提出EigenTrack用于检测大语言模型幻觉和分布外行为,以及RMT-KD用于压缩深度网络,提升模型可靠性与效率。

Comments Executive Summary of Master Thesis in Computer Science Engineering, Politecnico di Milano

详情

展开后加载摘要…

URL PDF HTML 收藏