arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-23 至 2026-07-23 共收录 221 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 54 篇

2512.16300 2026-07-23 cs.AI 版本更新 70%

Code-in-the-Loop Forensics: Agentic Tool Use for Image Forgery Detection

循环代码取证:面向图像伪造检测的代理工具使用

Fanrui Zhang, Qiang Zhang, Sizhuo Zhou, Jianwen Sun, Chuanhao Li, Jiaxin Ai, Yukang Feng, Yujie Zhang, Wenjie Li, Zizhen Li, Yifan Chang, Jiawei Liu, Kaipeng Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ForenAgent框架,通过多轮交互使MLLM自主生成并迭代优化Python工具,提升图像伪造检测的灵活性和可解释性,构建FABench数据集进行系统训练和评估。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06550 2026-07-23 cs.CV cs.AI 版本更新 70%

Generative Semantic Multi-Object Tracking: A Large-Scale Benchmark and an MLLM-Driven Reasoning Framework

生成式语义多目标跟踪:大规模基准和基于大型语言模型的推理框架

Pan Liao, Feng Yang, Di Wu, Jinwen Yu, Wang Zhao, Dingwen Zhang

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究将语义多目标跟踪从刚性分类提升为开放式生成推理任务,引入Grand-SMOT基准,提出LLMTrack框架,通过时空融合模块压缩轨迹为语义令牌,提升了生成语义推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09345 2026-07-23 cs.OS cs.AI 版本更新 70%

AgentCgroup: Understanding and Controlling OS Resources of AI Agents

AgentCgroup: 理解和控制AI代理的操作系统资源

Yusheng Zheng, Jiakun Fan, Quanzhi Fu, Yiwei Yang, Wei Zhang, Andi Quinn

机构 * UC Santa Cruz(加州大学圣克鲁兹分校) Virginia Tech(弗吉尼亚理工大学) UConn(康涅狄格大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 AgentCgroup通过意图驱动的eBPF资源控制器,解决多租户云环境中AI代理资源管理的粒度、响应性和适应性不匹配问题,提升隔离性和减少资源浪费。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19678 2026-07-23 cs.CL cs.AI cs.LG 新提交 67%

Reference-Free Evaluation of Reasoning in Open-Ended Question Answering

开放式问答中推理的无参考评估

Guneet Singh Kohli, Yuxiang Zhou, Michael Sejr Schlichtkrull, Gregory E Dean, Maria Liakata

机构 * Queen Mary University of London(伦敦大学玛丽皇后学院) Temple University(天普大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对高风险领域人工智能生成答案难验证问题,提出基于推理的无参考框架审核大语言模型输出,通过分解推理轨迹、标记关系并组织成超图等方法评估,在数学和医学推理设置下比直接以大语言模型为基线更可靠,强调问答评估应考虑推理关系组合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19867 2026-07-23 cs.CL cs.AI cs.CE 新提交 62%

Overview of FinMMEval 2026 Task 2: Multilingual Financial Short-Answer Question Answering

FinMMEval 2026任务2概述:多语言金融简答题问答

Zhuohan Xie, Xueqing Peng, Georgi Georgiev, Dimitar Dimitrov, Yuyang Dai, Rania Elbadry, Vanshikaa Jani, Lingfei Qian, Fan Zhang, Jimin Huang, Jiahui Geng, Yankai Chen, Ye Yuan, Haolun Wu, Yuxia Wang, Ivan Koychev, Veselin Stoyanov, Mingzi Song, Yu Chen, Xue Liu, Preslav Nakov

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) The Fin AI(金融人工智能公司) FMI, Sofia University “St. Kliment Ohridski”(索非亚大学“圣克莱门特·奥赫里德斯基”金融数学与信息学系) INSAIT, Sofia University “St. Kliment Ohridski”(索非亚大学“圣克莱门特·奥赫里德斯基”信息技术与自动化研究所) University of Arizona(亚利桑那大学) The University of Tokyo(东京大学) Linköping University(林雪平大学) McGill University(麦吉尔大学) Mila, Quebec AI Institute(魁北克人工智能研究所) Meiji Gakuin University(明治学院大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 FinMMEval 2026任务2聚焦多语言金融简答题问答,通过特定配对和格式让系统答题,最终测试集含256个项目分两层级,依ROUGE-1 F1排名,最强系统差距小,还记录了多种相关策略。

Comments 9 pages. Task overview paper for CLEF 2026 Working Notes (CEUR Workshop Proceedings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19386 2026-07-23 cs.LG cs.CL 新提交 62%

Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance

构建快速,评估缓慢:管道选择主导自动可解释性得分方差

Sinie van der Ben, Neele Roch, Anna Hedström, Mennatallah El-Assady

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究稀疏自动编码器可解释性得分的跨论文比较,通过多指标、多模型及方法变化轴的实验发现方法方差主导得分方差,排名不稳定,基于得分的比较可能反映管道差异,贡献评估方法以推动可解释性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20073 2026-07-23 cs.LG 新提交 57%

Evaluating and Mitigating Gender Bias in Pre-trained Embeddings for ML-based Recruitment

评估和减轻基于机器学习的招聘中预训练嵌入的性别偏见

Farnaz Faramarzi Lighvan, Lynn Houthuys

机构 * AI Lab, Vrije Universiteit Brussel(人工智能实验室,布鲁塞尔自由大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 研究基于机器学习的招聘中预训练嵌入的性别偏见问题,通过在合成数据集上评估模型、采用多任务对抗学习框架及多目标模型选择,发现清理性别可减少但未消除泄露,对抗学习能改善公平性,是补充策略。

Comments Accepted for presentation at the TRUST-AI 2026 Workshop, held in conjunction with IJCAI/ECAI 2026, Bremen, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20019 2026-07-23 cs.AI 新提交 57%

EvoDRC: A Self-Evolving Agentic Framework for Automated DRC Violation Repair

EvoDRC:一种用于自动修复DRC违规的自进化智能体框架

Bing-Yue Wu, Chia-Tung Ho, Haoyu Yang, Brucek Khailany, Vidya A. Chhabria

机构 * Arizona State University(亚利桑那州立大学) NVIDIA Corporation(英伟达公司)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 针对先进节点物理设计中DRC闭合瓶颈问题,EvoDRC提出自进化智能体框架,利用参考设计知识和目标设计经验初始化并进化修复技能,将布局分解后分配智能体,通过工具反馈和知识数据库提升修复效果,实验显示总体减少73.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17075 2026-07-23 cs.CR cs.CL 版本更新 57%

A Systematic Evaluation of Traditional Privacy Policy Analysis Tools Against LLMs

传统隐私政策分析工具针对大语言模型的系统评估

Madhav Aryal, Sudipa Saha, Sunil Manandhar, Anshuman Chhabra, Kaushal Kafle

机构 * University of South Florida(佛罗里达州立大学) IBM T.J. Watson Research Center(IBM 汤普森研究中心)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL

AI总结 本文系统评估现成大语言模型能否取代专业隐私分析工具,研究六个具三种主要功能及三个中间任务的工具,对比两个先进大语言模型与工具性能,发现大语言模型在隐私政策和法规分析功能上能匹配或超越现有工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09530 2026-07-23 cs.CL 版本更新 57%

FreyaTTS: A Compact Tokenizer-Free Flow-Matching Transformer for Turkish-First Speech Synthesis

FreyaTTS技术报告

Ahmet Erdem Pamuk, Ömer Yentür, Ahmet Tunga Bayrak, Yavuz Alp Sencer Öztürk, Mustafa Yavuz

专题命中 评测与基准 :post-training(abstract);分类 cs.CL

AI总结 介绍无分词器的土耳其语文本转语音模型Freya-TTS,通过无规则端到端建模、非自回归并行去噪等方法推进框架,在基准测试中表现出色,优于开源系统,适合边缘部署,且已开源模型权重、代码和基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30201 2026-07-23 cs.CV cs.CL 版本更新 57%

SHOVIR: A Benchmark for Evaluating Vision Shortcut Learning in Radiology Report Generation

SHOVIR:评估放射学报告生成中视觉捷径学习的基准

Filippo Ruffini, Marco Salmé, Rosa Sicilia, Valerio Guarrasi, Paolo Soda

机构 * UniCamillus-Saint Camillus International University of Health Sciences, Rome, Italy(乌尼卡米尔斯-圣卡米卢斯国际健康科学大学,意大利罗马)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出SHOVIR基准,通过遮挡实验检测放射学报告生成模型是否依赖视觉捷径而非真实病理证据,发现高报告质量模型未必具有良好空间定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03989 2026-07-23 cs.CV cs.AI 版本更新 57%

When Visual Evidence is Ambiguous: Pareidolia as a Diagnostic Probe for Vision Models

当视觉证据模糊时: pareidolia 作为视觉模型的诊断探针

Qianpu Chen, Derya Soydaner, Rob Saunders

机构 * Leiden Institute of Advanced Computer Science (LIACS), Leiden University, Leiden, The Netherlands(莱顿高级计算机科学研究所(LIACS)、莱顿大学、莱顿、荷兰)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文研究了视觉模型在模糊证据下的行为,通过分析pareidolia现象揭示了不同模型在表示层面的差异,发现语义过激活和不确定性策略等机制,为提升视觉语言系统的语义鲁棒性提供诊断和改进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20353 2026-07-23 cs.SE 新提交 50%

Multi-Source and Cross-Scenario Strategy-Guided Code Optimization

多源跨场景策略引导的代码优化

Yuwei Zhao, Qianyu Xiao, Ye Cui, Yijun Yu, Yingfei Xiong

专题命中 评测与基准 :LLM(abstract)

AI总结 研究针对代码优化中现有策略引导方法的局限,提出MoST框架,整合多知识源,通过跨源跨场景聚类识别策略并转移,利用新算法和程序,在基准测试和实际项目中显著提升代码优化效果,优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19876 2026-07-23 cs.RO cs.CV 新提交 50%

KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding

KineBench:通过无逆动力学模型的运动学基础对具身世界模型进行基准测试

Zeyu Liu, Zhangzhe Zhu, Yang Zhang, Chenyou Fan, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Tsinghua University(清华大学) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 研究旨在评估具身世界模型物理一致性,提出无逆动力学模型的KineBench基准测试。利用级联视觉基础模型提取姿态,在物理模拟器中闭环验证,纳入运动学指标,基于ManiSkill3的任务评估EWMs,揭示任务复杂度受限的非线性缩放,为数据缩放策略提供指导。

Comments Accept to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19666 2026-07-23 cs.DB 新提交 50%

Hollywood: Towards a Large Movie Dataset for Database Benchmarking

好莱坞:迈向用于数据库基准测试的大型电影数据集

Ivan Iachnyk, Mihail Stoian, Andreas Kipf

专题命中 评测与基准 :LLM(abstract)

AI总结 研究针对IMDb真实世界数据集无比例因子问题,提出结合大语言模型语义字典和确定性时间图关系数据生成的好莱坞数据集生成方法,实验表明其引发的基数估计误差与原数据集相当或更大,还能测试估计器泛化能力。

Comments Accepted at the Seventh International Workshop on Applied AI for Database Systems and Applications (AIDB 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19476 2026-07-23 cs.CV 新提交 50%

Detect Early, Escalate Rarely: Anytime Detection of AI-Generated Video from the Compressed Bitstream

尽早检测,极少升级:从压缩比特流中随时检测人工智能生成的视频

Mert Onur Cakiroglu, Mehmet Dalkilic, Hasan Kurban

专题命中 评测与基准 :language model(abstract)

AI总结 研究从压缩比特流中随时检测人工智能生成视频的问题,核心方法是将任务重定义为流感知并对运动场评分,贡献是重新构建、两个保证及测量前沿,在GenVidBench等上取得较好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17820 2026-07-23 cs.CV 版本更新 50%

PRiSM: Prototype Regularization for Few-Shot VLMs

PRiSM:少样本视觉语言模型的原型正则化

Ghassen Baklouti, Omprakash Chakraborty, Jose Dolz, Ismail Ben Ayed

机构 * ÉTS Montreal(蒙特利尔高等商学院)

专题命中 评测与基准 :language model(abstract)

AI总结 研究针对视觉语言模型少样本适应方法,质疑现有基准假设,引入新基准。提出PRiSM类原型正则化方法,优化多术语损失,结合有效优化器,提升性能,尤其在处理类不平衡和大量类时效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08075 2026-07-23 cs.CV 版本更新 50%

UAV-OVVIS: Unmanned Aerial Vehicles Also Need Open-Vocabulary Video Instance Segmentation

无人机-开放词汇视频实例分割:无人机也需要开放词汇视频实例分割

Mingyu Dou, Shi Qiu, Ming Hu, Yifan Chen, Zhe Sun

专题命中 评测与基准 :foundation model(abstract)

AI总结 研究针对无人机视频感知在开放场景中支持灵活查询和细粒度实例级动态理解不足的问题,提出无需训练的AeroTrack统一框架,构建AeroVIS评估基准,其实例化变体在无人机场景表现优异,还发布框架和基准以支持后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15403 2026-07-23 cs.CV 版本更新 50%

Pointing-Based Object Recognition

基于指目标识的对象识别

Lukáš Hajdúch, Viktor Kocur

机构 * Comenius University, Bratislava, Slovakia(科门纽斯大学,布拉迪斯拉发,斯洛伐克)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出了一种识别人类指目标识的综合流程,结合物体检测、姿态估计和视觉语言模型等方法,通过单张图像重建3D空间信息提升目标识别精度。

Comments Submitted to InnovAIte conference

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 40 篇

2607.20327 2026-07-23 cs.CL 新提交 92%

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference

PyroDash:具有成本效益的令牌级小语言模型与大语言模型协作推理

Niqi Lyu, Pengtao Shi, Wei Qiu, Jianlin Zhong, Sicong Xia, Jianyao Ma, Yicheng Ding

机构 * Pyromind Dynamics Inc.(Pyromind动力学公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);SLM(abstract,abstract_cn)

AI总结 研究针对大语言模型推理成本高、小语言模型可靠性低的问题,提出PyroDash框架,通过令牌级协作推理,分三阶段训练小语言模型,在数学推理基准测试中能支持不同操作点,可减少大语言模型使用并保持推理性能。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19704 2026-07-23 cs.LG stat.ML 新提交 91%

Efficient Clustering with Provable Guardrails for LLM Inference at Scale

大规模LLM推理中具有可证明护栏的高效聚类

Longshaokan Wang, Wai Tsang Keung, Punit Ghodasara, Roman Wang, Ali Dashti, Francesc Moreno-Noguer

机构 * Amazon(亚马逊)

专题命中 效率与部署 :LLM(title,title_cn);foundation model(abstract);分类 cs.LG

AI总结 研究针对大规模LLM推理成本和延迟瓶颈,提出两阶段聚类算法,先用Mini-batch K-Means生成初始聚类,再在其中选代表,能保证逐样本质量控制,运行高效且可扩展,相比常见方法有显著优势,部署后大幅降低成本和延迟。

Comments Accepted for presentation at ICML HiLD workshop 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18034 2026-07-23 cs.AI 版本更新 90%

AdaHome: An Adaptive Smart Home Assistant using Local Small Language Models

AdaHome:一种使用本地小语言模型的自适应智能家居助手

Eu Jin Lim, Zhaoxing Li, Sebastian Stein

机构 * University of Southampton(南安普顿大学)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 研究旨在解决智能家居助手问题,提出AdaHome,通过意图感知规划框架、草稿链策略及偏好适应机制,在本地小语言模型上实现高效决策与个性化,实验显示其在命令准确性、延迟及多轮场景中有良好表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09080 2026-07-23 cs.CV 版本更新 90%

GeoTrace: Geometry-Aware Trajectory Token Compression for Video Large Language Models

GeoTrace:用于视频大语言模型的几何感知轨迹令牌压缩

Guohuan Xie, Mengqi Lei, Chuan Shi, Wei Bao, Yue Gao, Siqi Li

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 研究针对Video LLMs视觉令牌多致效率受限问题,提出GeoTrace框架,通过CFPA和TCRC分别处理骨架与残差令牌,经实验评估证明该框架在多模型架构和场景下有效,能在大幅减少计算量时保留高比例性能。

Comments Withdrawn by the authors due to an incomplete internal approval process

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02187 2026-07-23 cs.CR cs.AI 版本更新 90%

Rewriting the Response Path: Silent Tampering and Provider-Signed Defense in BYOK LLM Agents

重写响应路径:BYOK LLM 代理中的静默篡改与提供者签名防御

Mingyu Luo, Zihan Zhang, Zesen Liu, Yuchong Xie, Zhixiang Zhang, Dung Hiu Hilton Yeung, Wai Ip Lai, Ping Chen, Ming Wen, Dongdong She

机构 * Fudan University(复旦大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 研究BYOK LLM代理响应路径完整性问题,发现中继可篡改响应。提出sign-c服务器端方案,能认证执行承载字段和查询,本地垫片验证,加密保护机密性,防御有效拒绝篡改响应,误拒率为零,延迟开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19490 2026-07-23 cs.CR cs.AI 新提交 90%

Integrity of peer-to-peer distributed LLM inference under malicious nodes

恶意节点下对等分布式大语言模型推理的完整性

Mert Cihangiroglu, Antonino Nocera

机构 * DCALab, Department of Electrical, Computer and Biomedical Engineering, University of Pavia, Italy(DCALab,电气、计算机与生物医学工程系,帕维亚大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究对等分布式LLM推理在恶意节点下的完整性问题,提出通过测量节点激活值变化检查输出完整性的方法,即混入秘密金丝雀输入,利用与已知参考的偏差识别恶意节点,实验中检测器AUROC达1.0。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19768 2026-07-23 cs.LG cs.AR 新提交 88%

AlphaRoute: Large Language Models as Semantic Optimizers for Multi-Objective Routing

AlphaRoute:将大语言模型用作多目标路由的语义优化器

Kabir Murjani, Mishri Bhavsar, Manish I. Patel, Jonti Talukdar

机构 * Institute of Technology, Nirma University(尼玛大学理工学院) Arizona State University(亚利桑那州立大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG;LLM(comments)

AI总结 针对VLSI全局路由这一NP难组合优化问题,传统方法失效。AlphaRoute将拆线重布重构为动态优化系统,引入基于SHAP的溢出分解等技术,用大语言模型作语义策略优化器,在基准测试中大幅减少溢出,证明优越算法可克服Python实现的延迟。

Comments 7 pages, 5 figures. Accepted for publication in the IEEE International Conference on LLM-Aided Design, 2026, Stanford University, Stanford, CA, USA. Code available at https://github.com/Kcbir/AlphaRoute

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04595 2026-07-23 cs.AR 版本更新 88%

Harmonia: Algorithm-Hardware Co-Design for Memory- and Compute-Efficient BFP-based LLM Inference

Harmonia:面向内存和计算效率的BFP基大语言模型推理算法-硬件协同设计

Xinyu Wang, Jieyu Li, Yanan Sun, Weifeng He

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 Harmonia通过算法-硬件协同设计实现所有层BFP激活,提升LLM推理的内存和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16339 2026-07-23 cs.AI 版本更新 88%

LaCache: Exact Caching and Precision-Adaptive Inference for Diffusion Large Language Models

LaCache:用于扩散大语言模型的精确缓存和精度自适应推理

Xingru Chen, Zelang Liang, Yongjia Ma, Jiqing Zhan, Shuling Yang, Lian Wen, Kun Zhan

机构 * Li Auto Inc.(理想汽车公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究针对扩散大语言模型算子级冗余问题,提出LaCache加速框架,通过无损缓存中间结果及集成FP8量化策略,无需训练,单独使用可实现约1.3倍端到端加速,与现有方法结合可达40.2倍加速且保持任务精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19438 2026-07-23 cs.AR cs.AI cs.CL cs.DC cs.LG cs.PF 新提交 87%

BaseRT: Advancing Best-in-Class LLM Inference with Apple M5 Neural Accelerators

BaseRT:利用苹果M5神经加速器提升一流大语言模型推理性能

Fabian Waschkowski, Prabod Rathnayaka, Lukas Wesemann

机构 * Base Compute

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究利用苹果M5神经加速器提升大语言模型推理性能,通过BaseRT无框架设计及添加特定内核,将计算密集型矩阵乘法经M5处理,大幅提升推理吞吐量及解码优势,确立了设备上大语言模型推理新性能上限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14575 2026-07-23 cs.LG cs.AI stat.ME stat.ML 版本更新 86%

Generative Augmented Inference of LLM-generated Data for Market Research: Theory and Empirical Evidence

生成式增强推断

Cheng Lu, Mengxin Wang, Dennis J. Zhang, Heng Zhang

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Toronto(多伦多大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出生成式增强推断(GAI)框架,将AI输出视为学习真实标签的高维信息特征而非代理,通过非参数方法建模,实现人机数据联合的一致估计和有效推断,在随机标注下渐近效率严格优于仅用人类数据。

详情

展开后加载摘要…

URL PDF HTML 收藏