arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-10 至 2026-04-10 共收录 307 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 70 篇

2604.07816 2026-04-10 cs.CL 70%

Tool Retrieval Bridge: Aligning Vague Instructions with Retriever Preferences via Bridge Model

工具检索桥:通过桥模型对模糊指令与检索器偏好进行对齐

Kunfeng Chen, Luyao Zhuang, Fei Liao, Juhua Liu, Jian Wang, Bo Du

机构 * Department of Gastroenterology, Renmin Hospital, Wuhan University(武汉大学人民医院消化内科) School of Computer Science, Wuhan University(武汉大学计算机学院) State Grid Corporation(国家电网公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出TRB方法,通过桥模型将模糊指令转化为更具体的指令,提升模糊指令下的工具检索性能,实验表明TRB在多个检索设置下显著提升检索效果。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07429 2026-04-10 cs.CV cs.AI cs.HC 70%

GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents

GameWorld: 向标准化和可验证的多模态游戏代理评估迈进

Mingyu Ouyang, Siyuan Hu, Kevin Qinghong Lin, Hwee Tou Ng, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GameWorld提出一个标准化且可验证的多模态游戏代理评估基准,包含34种游戏和170个任务,通过可验证的指标评估代理能力,揭示了当前代理在视频游戏中与人类能力的差距。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24517 2026-04-10 cs.CL 70%

Paragraph Segmentation Revisited: Towards a Standard Task for Structuring Speech

段落分割再审视:迈向结构化语音的标准任务

Fabian Retkowski, Alexander Waibel

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出TEDPara和YTSegPara基准,通过约束解码方法和紧凑模型MiniSeg,实现语音段落分割的标准化与实用化。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05524 2026-04-10 cs.CL cs.IR 70%

KEO: Knowledge Extraction on OMIn via Knowledge Graphs and RAG for Safety-Critical Aviation Maintenance

KEO:通过知识图谱和RAG进行OMIn的领域知识提取

Kuangshi Ai, Jonathan A. Karr, Meng Jiang, Nitesh V. Chawla, Chaoli Wang

机构 * University of Notre Dame(圣母大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 KEO通过知识图谱和RAG框架提升航空安全维护中的领域知识提取与推理,实验显示其在全局理解上优于传统文本块RAG,同时保持对细粒度任务的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.00638 2026-04-10 cs.LG cs.CV 70%

Tabular GANs for uneven distribution

用于不均衡分布的表格GANs

Insaf Ashrapov

机构 * Moscow Institute of Physics and Technology(莫斯科物理技术学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文综述了三种主要范式下的表格数据生成方法,提出统一框架支持GAN、扩散模型和大语言模型,并通过实验验证框架在分布偏移下的有效性。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08417 2026-04-10 cs.SE cs.CR 67%

Vulnerability Detection with Interprocedural Context in Multiple Languages: Assessing Effectiveness and Cost of Modern LLMs

基于多语言交叉过程上下文的漏洞检测:评估现代LLM的有效性与成本

Kevin Lira, Baldoino Fonseca, Davy Baía, Márcio Ribeiro, Wesley K. G. Assunção

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文研究了多语言交叉过程依赖漏洞检测中四种现代LLM的有效性、推理成本及解释质量,发现Gemini 3 Flash在C语言中具有最佳成本效益,Claude Haiku 4.5在93.6%的案例中正确识别并解释漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07773 2026-04-10 cs.SI 67%

A Guide to Using Social Media as a Geospatial Lens for Studying Public Opinion and Behavior

利用社交媒体作为地理视角研究公众意见和行为的指南

Lingyao Li

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出利用社交媒体数据进行地理研究的方法,展示其在公众态度、行为和地方体验分析中的应用,通过四个案例说明其在测量及时性、地理影响评估和精细分析中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01482 2026-04-10 eess.AS cs.AI cs.LG eess.SP 62%

A SUPERB-Style Benchmark of Self-Supervised Speech Models for Audio Deepfake Detection

一种用于音频深度伪造检测的自监督语音模型基准

Hashim Ali, Nithin Sai Adupa, Surya Subramani, Hafiz Malik

机构 * Electrical and Computer Engineering University of Michigan(密歇根大学电气与计算机工程系)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Spoof-SUPERB基准,评估20种自监督语音模型在音频深度伪造检测中的性能,发现大规模判别模型在多语言预训练和说话人感知目标下表现更优。

Comments Accepted at ICASSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08030 2026-04-10 cs.LG cs.AI 62%

From Universal to Individualized Actionability: Revisiting Personalization in Algorithmic Recourse

从通用到个性化可执行性:重新审视算法救济中的个性化

Lena Marie Budde, Ayan Majumdar, Richard Uth, Markus Langer, Isabel Valera

机构 * Saarland Informatics Campus, Saarland University(萨尔大学萨尔兰信息学园区) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Institute for Psychology, University of Freiburg(弗莱堡大学心理学研究所)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文重新审视算法救济中的个性化,提出将个性化定义为个体可执行性,通过硬约束和软约束分析其对救济关键指标的影响,揭示个性化对可执行性、成本和合理性的影响及潜在偏见。

Comments 27 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07655 2026-04-10 cs.LG cs.CL 62%

Guardian-as-an-Advisor: Advancing Next-Generation Guardian Models for Trustworthy LLMs

顾问式守护者:推进下一代守护模型以实现可信的大语言模型

Yue Huang, Haomin Zhuang, Jiayi Ye, Han Bao, Yanbo Wang, Hang Hua, Siyuan Wu, Pin-Yu Chen, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) IBM Research(IBM研究院)

专题命中 评测与基准 :SFT(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Guardian-as-an-Advisor框架,通过预测风险标签和解释并前置建议,提升模型安全性和实用性,同时降低误拒率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07354 2026-04-10 cs.CL cs.AI cs.SD 62%

Contextual Earnings-22: A Speech Recognition Benchmark with Custom Vocabulary in the Wild

上下文收益-22:带有自定义词汇的语音识别基准测试

Berkin Durmus, Chen Cen, Eduardo Pacheco, Arda Okan, Atila Orhon

机构 * Argmax, Inc.(Argmax公司) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Contextual Earnings-22基准测试,通过真实自定义词汇场景推动研究,揭示潜在进展。关键词提示和增强方法在扩展到大规模系统时表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18019 2026-04-10 cs.CL cs.AI cs.SE 62%

BenchBrowser: Retrieving Evidence for Evaluating Benchmark Validity

BenchBrowser:用于评估基准有效性证据的检索

Harshita Diddee, Gregory Yauney, Swabha Swayamdipta, Daphne Ippolito

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Thomas Lord Department of Computer Science, University of Southern California(南加州大学托马斯·洛德计算机科学系)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 BenchBrowser通过检索20个基准测试集中的相关评估项目,帮助评估者诊断基准测试在内容有效性与收敛有效性上的不足,从而弥补实践者意图与实际测试内容之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08455 2026-04-10 cs.AI 57%

KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation

KnowU-Bench: 向交互式、主动式和个性化移动代理评估迈进

Tongbo Chen, Zhengxi Lu, Zhan Xu, Guocheng Shao, Shaohan Zhao, Fei Tang, Yong Du, Kaitao Song, Yizhou Liu, Yuchen Yan, Wenqi Zhang, Xu Tan, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Apple(苹果公司) Tencent(腾讯)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 KnowU-Bench通过Android仿真环境评估个性化移动代理,涵盖42个通用GUI任务、86个个性化任务和64个主动任务,验证代理在交互中获取用户偏好和主动干预的能力,发现前沿模型在模糊指令下表现下降,揭示偏好获取和干预校准的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07988 2026-04-10 cs.DC cs.AI 57%

LogAct: Enabling Agentic Reliability via Shared Logs

LogAct:通过共享日志实现代理可靠性

Mahesh Balakrishnan, Ashwin Bharambe, Davide Testuggine, David Geraghty, David Mao, Vidhya Venkat, Ilya Mironov, Rithesh Baradi, Gayathri Aiyer, Victoria Dudin

机构 * Meta

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 LogAct通过共享日志实现代理可靠性,允许代理通过LLM推理分析执行历史,实现故障恢复、健康检查和优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07929 2026-04-10 cs.IR cs.AI 57%

Same Outcomes, Different Journeys: A Trace-Level Framework for Comparing Human and GUI-Agent Behavior in Production Search Systems

相同结果,不同旅程:一种基于轨迹层面的框架,用于比较人类和GUI代理在生产搜索系统中的行为

Maria Movin, Claudia Hauff, Aron Henriksson, Panagiotis Papapetrou

机构 * Spotify, Sweden(Spotify瑞典) Spotify, Netherlands(Spotify荷兰) Stockholm University, Sweden(斯德哥尔摩大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出一个基于轨迹的评估框架,比较人类和GUI代理在任务结果、努力、查询构建和界面状态导航中的行为差异,通过实验证明代理行为与人类不同,强调轨迹层面诊断的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07834 2026-04-10 cs.CL 57%

Why Are We Lonely? Leveraging LLMs to Measure and Understand Loneliness in Caregivers and Non-caregivers

为什么我们感到孤独?利用大语言模型测量和理解护理人员与非护理人员的孤独

Michelle Damin Kim, Ellie S. Paek, Yufen Lin, Emily Mroz, Jane Chung, Jinho D. Choi

机构 * Emory University(埃默里大学) Nell Hodgson Woodruff School of Nursing, Emory University(埃默里大学尼尔·霍奇森·伍德拉夫护理学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文提出一种基于大语言模型的社交媒体数据集构建方法,用于测量和比较护理人员与非护理人员的孤独感,通过专家框架和分类体系分析文本,展示不同群体的孤独原因分布差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07788 2026-04-10 cs.IR cs.CL 57%

PeReGrINE: Evaluating Personalized Review Fidelity with User Item Graph Context

PeReGrINE:基于用户-物品图上下文的个性化评论可信度评估

Steven Au, Baihan Lin

机构 * Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 PeReGrINE通过构建用户-物品图结构,评估个性化评论生成中证据组合对可信度、个性化和检索条件语言模型的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07733 2026-04-10 cs.AI 57%

CivBench: Progress-Based Evaluation for LLMs' Strategic Decision-Making in Civilization V

CivBench:基于进展的评估用于LLM在文明V中的战略决策

John Chen, Sihan Cheng, Can Gurkan, Mingyi Lin

机构 * University of Arizona(亚利桑那大学) Northwestern University(西北大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 CivBench通过训练模型在回合级游戏状态上估计胜利概率,评估LLM在文明V多玩家中的战略决策能力,揭示代理设置对模型的影响及不同战略特征。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06582 2026-04-10 cs.IR cs.AI cs.MA 57%

Agentic SPARQL: Evaluating SPARQL-MCP-powered Intelligent Agents on the Federated KGQA Benchmark

代理SPARQL:在联邦知识图谱问答基准上评估基于SPARQL-MCP的智能代理

Daniel Dobriy, Frederik Bauer, Amr Azzam, Debayan Banerjee, Axel Polleres

机构 * WU Vienna(维也纳经济大学) Leuphana Universität Lüneburg(吕讷堡大学) Complexity Science Hub Vienna(维也纳复杂性科学中心)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文探讨了基于SPARQL-MCP的智能代理在联邦SPARQL查询中的潜力,扩展了知识图谱问答基准,并评估了通过MCP集成SPARQL联邦与LLM代理的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01878 2026-04-10 cs.RO cs.CV cs.LG 57%

AI-Driven Marine Robotics: Emerging Trends in Underwater Perception and Ecosystem Monitoring

AI驱动的海洋机器人:水下感知与生态系统监测的新兴趋势

Scarlett Raine, Tobias Fischer

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文探讨了气候变暖背景下,AI在水下感知与生态系统监测中的应用发展,分析了环境需求、公民科学平台和研究人员迁移等因素推动的AI创新,展示了弱监督学习、开放集识别和鲁棒感知等技术的进展。

Comments 9 pages, 3 figures, Accepted for Oral Presentation at AAAI Conference on Artificial Intelligence 2026

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40 (2026), 40981-40989

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10437 2026-04-10 cs.CV cs.GR cs.LG 57%

SVGFusion: A VAE-Diffusion Transformer for Vector Graphic Generation

SVGFusion:一种用于矢量图形生成的VAE-扩散变换器

Ximing Xing, Juncheng Hu, Ziteng Xue, Jing Zhang, Buyu Li, Sheng Wang, Dong Xu, Qian Yu

机构 * Beihang University(北京航空航天大学) Bambu AI The University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 本文提出SVGFusion框架,结合VAE-扩散架构生成高质量可编辑SVG,通过融合矢量与像素信息提升结构理解与生成质量。

Comments project page: https://ximinng.github.io/SVGFusionProject/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08282 2026-04-10 cs.CV 50%

Revisiting Radar Perception With Spectral Point Clouds

重新审视雷达感知与光谱点云

Hamza Alsharif, Jing Gu, Pavol Jancura, Satish Ravindran, Gijs Dubbelman

机构 * Eindhoven University of Technology(埃因霍温理工大学) NXP Semiconductors(恩智浦半导体)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出光谱点云范式,证明稀疏点云在加入光谱信息后可媲美密集光谱数据,为统一雷达感知提供更鲁棒的输入表示。

Comments CVPR 2026 Workshop (PBVS 2026). Project page: https://www.tue-mps.org/Spectral-Point-Clouds-Radar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07997 2026-04-10 cs.CV 50%

Few-Shot Incremental 3D Object Detection in Dynamic Indoor Environments

少样本增量式动态室内环境3D物体检测

Yun Zhu, Jianjun Qian, Jian Yang, Jin Xie, Na Zhao

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing University(南京大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出FI3Det框架,利用视觉语言模型学习未见类别知识,通过VLM引导模块和多模态原型模块实现高效3D感知,在ScanNet V2和SUN RGB-D数据集上取得显著提升。

Comments Accepted by CVPR 2026

Journal ref CVPR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07634 2026-04-10 cs.CV 50%

VSAS-BENCH: Real-Time Evaluation of Visual Streaming Assistant Models

VSAS-BENCH:视觉流助手模型的实时评估

Pavan Kumar Anasosalu Vasu, Cem Koc, Fartash Faghri, Chun-Liang Li, Bo Feng, Zhengfeng Lai, Meng Cao, Oncel Tuzel, Hadi Pouransari

机构 * Apple(苹果公司)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出VSAS-Bench,通过时序密集标注和标准化评估协议,评估流式视觉语言模型的实时性能,揭示模型在内存缓冲长度、访问策略等关键设计因素下的精度-延迟权衡。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00912 2026-04-10 cs.CV cs.MM 50%

ProCap: Projection-Aware Captioning for Spatial Augmented Reality

ProCap:面向空间增强现实的投影感知描述生成

Zimo Cao, Yuchen Deng, Haibin Ling, Bingyao Huang

机构 * Southwest University(西南大学) Westlake University(西湖大学)

专题命中 评测与基准 :language model(abstract)

AI总结 ProCap通过分离物理场景与投影内容,解决空间增强现实中的语义歧义问题,提出RGBP数据集和双描述评估协议,提升SAR的智能交互能力。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15118 2026-04-10 cs.CV 50%

VAREX: A Benchmark for Multi-Modal Structured Extraction from Documents

VAREX:多模态结构提取文档的基准

Udi Barzelay, Ophir Azulai, Inbar Shapira, Idan Friedman, Foad Abo Dahood, Madison Lee, Abraham Daniels

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 VAREX基准通过四类输入模态评估多模态基础模型在政府表格结构数据提取中的性能,揭示参数规模、输入格式对提取准确率的影响,强调结构合规性是关键瓶颈。

Comments 9 pages, 4 figures, 4 tables, plus 12-page supplementary. Dataset: https://huggingface.co/datasets/ibm-research/VAREX Code: https://github.com/udibarzi/varex-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01236 2026-04-10 cs.CV 50%

PSR: Scaling Multi-Subject Personalized Image Generation with Pairwise Subject-Consistency Rewards

PSR: 通过成对主体一致性奖励实现多主体个性化图像生成的扩展

Shulei Wang, Longhui Wei, Xin He, Jianbo Ouyang, Hui Lu, Zhou Zhao, Qi Tian

机构 * Zhejiang University(浙江大学) Huawei Inc.(华为技术有限公司)

专题命中 评测与基准 :post-training(abstract)

AI总结 本文提出PSR框架,通过多主体数据生成管道和强化学习策略,提升多主体个性化图像生成的性能和一致性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 72 篇

2409.00084 2026-04-10 cs.CL cs.AI 90%

Vision-Language and Large Language Model Performance in Gastroenterology: GPT, Claude, Llama, Phi, Mistral, Gemma, and Quantized Models

视觉-语言与大语言模型在胃肠病学中的表现:GPT、Claude、Llama、Phi、Mistral、Gemma及量化模型

Seyed Amir Ahmad Safavi-Naini, Shuhaib Ali, Omer Shahab, Zahra Shahhoseini, Thomas Savage, Sara Rafiee, Jamil S Samaan, Reem Al Shabeeb, Farah Ladak, Jamie O Yang, Juan Echavarria, Sumbal Babar, Aasma Shaukat, Samuel Margolis, Nicholas P Tatonetti, Girish Nadkarni, Bara El Kurdi, Ali Soroush

机构 * Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院) University of Texas Health(德克萨斯大学健康科学中心) Virginia Hospital Center(弗吉尼亚医院中心) Shahid Beheshti University of Medical Sciences(沙希德·贝赫什提医科大学) Stanford University(斯坦福大学) Cedars-Sinai Medical Center(西达赛奈医疗中心) Inova Fairfax Medical Campus(伊诺瓦费尔法克斯医疗中心) University of California–Los Angeles(加州大学洛杉矶分校) NYU Grossman School of Medicine(纽约大学格罗斯曼医学院) Columbia University(哥伦比亚大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI

AI总结 本研究评估了大语言模型和视觉-语言模型在胃肠病学中的医学推理性能,比较了不同模型配置、参数及提示工程策略对性能的影响,发现专有模型在准确性上优于开源模型,且图像描述对视觉-语言模型性能有显著影响。

Comments Manuscript Pages: 34, Figures: 7, Tables: 2, Supplementary File Pages: 35, Data Transparency Statement: Code is available at: https://github.com/Sdamirsa/LLM-VLM-in-Gastroenterology . Study data from American College of Gastroenterology (ACG) are restricted and available upon request with ACG permission. Correction: updated abstract considering Llama3.1 results

Journal ref npj Digital Medicine 8, 797 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08003 2026-04-10 eess.AS cs.CL cs.SD 89%

Rethinking Entropy Allocation in LLM-based ASR: Understanding the Dynamics between Speech Encoders and LLMs

重新思考基于大语言模型的自动语音识别中的熵分配:理解语音编码器与大语言模型之间的动态关系

Yuan Xie, Jiaqi Song, Guang Qiu, Xianliang Wang, Ming Lei, Jie Gao, Jie Wu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文从熵分配角度重新审视基于大语言模型的ASR,提出三个指标刻画训练范式如何在语音编码器和LLM之间分配熵减少,通过多阶段训练策略优化参数效率和抗幻觉能力,实验显示在2.3B参数下达到与最新模型相当的性能并有效缓解幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07808 2026-04-10 cs.CL cs.LG 88%

GRASS: Gradient-based Adaptive Layer-wise Importance Sampling for Memory-efficient Large Language Model Fine-tuning

GRASS:基于梯度的自适应层级重要性采样用于内存高效的大型语言模型微调

Kaiyuan Tian, Yu Tang, Gongqingjian Jiang, Baihui Liu, Yifu Gao, Xialin Su, Linbo Qiao, Dongsheng Li

机构 * National University of Defense Technology(国防科技大学) Information Support Force Engineering University(信息支援部队工程大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 GRASS提出一种基于梯度的自适应层级重要性采样方法,通过动态调整层采样概率和优化器状态卸载机制,在降低内存使用的同时提升微调性能,实验显示其在多个模型和基准测试中均优于现有方法。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏