arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-05 至 2026-08-05 共收录 439 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 105 篇

2608.03337 2026-08-05 cs.SE 新提交 67%

Assessing Behavioral Validation in UI Component Test Suites Using Inferred Metamorphic Relations

利用推断的变形关系评估UI组件测试套件中的行为验证

Yu Pei, Cunming Zhang, Jeongju Sohn, Mike Papadakis

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究提出基于推断变形关系(MR)的框架,可补充执行类指标,用于评估UI组件测试套件的行为验证,发现现有测试存在行为缺口,且MR覆盖率具备实际应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11589 2026-08-05 cs.SE 67%

A Study of Library Usage in Agent-Authored Pull Requests

对代理生成的拉取请求中图书馆使用情况的研究

Lukas Twist, Jie M. Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 研究探讨了代理生成的拉取请求中图书馆使用情况,发现代理频繁导入图书馆但很少引入新依赖项,且在引入时遵循严格的版本控制实践。

Comments 5 pages, 3 tables. Accepted at MSR '26 (Challenge Track)

Journal ref 23rd International Conference on Mining Software Repositories: MSR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03259 2026-08-05 cs.LG cs.AI 新提交 62%

FinVerse: Financial Time-Series Benchmark

FinVerse:金融时间序列基准

Jaehoon Lee, Jun Seo, Seunghan Lee, Tae Yoon Lim, Dongwan Kang, Hwanil Choi, Minjae Kim, Sungdong Yoo, Junhyeok Kang, Sangjun Han, Soonyoung Lee, Wonbin Ahn

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本研究推出金融时间序列预测基准FinVerse,其针对43个公开时间序列基础模型的分析显示,通用预测标准下的优异表现未必对应实用金融预测,凸显了领域感知基准的必要性。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15212 2026-08-05 cs.AI cs.LG 版本更新 62%

Modeling Matches as Language: A Generative Transformer Approach for Counterfactual Player Valuation in Football

将比赛建模为语言:一种生成式Transformer方法用于足球中的反事实球员估值

Miru Hong, Minho Lee, Geonhee Jo, Hyeokje Cho, Hyunsung Kim, Pascal Bauer, Sang-Ki Ko

机构 * Department of Artificial Intelligence, University of Seoul, Seoul, Republic of Korea(首尔大学人工智能系) Institute for Sports and Preventive Medicine, Saarland University, Saarbrücken, Germany(萨尔兰州预防医学研究所) Chair for Sports Analytics, Saarland University(萨尔兰州体育分析教授职位)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ScoutGPT,通过将足球比赛事件视为序列标记,利用生成式Transformer模型模拟反事实球员估值,提升对球员转会效果的预测能力。

Comments 21 pages, 4 figures, 11 tables. Accepted at ECML-PKDD 2026 (Applied Data Science Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03990 2026-08-05 cs.LG 新提交 57%

Assessment of Conditional Diffusion Model for Synthetic Histopathology Image Generation

用于合成组织病理学图像生成的条件扩散模型评估

Seyed Kahaki, Shijie Li, Weijie Chen, Nicholas Petrick

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本研究针对合成组织病理学图像生成的评估问题,提出基于数字病理学预训练基础模型改进的FID、IS及精确率-召回率指标,实验发现改进后的IS与下游细胞核分割性能相关性更高,且生成数据多样性对分割性能的提升作用强于单张图像视觉保真度。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03099 2026-08-05 cs.CL 新提交 57%

What Language Does and What the Evidence Supports: A Functional Role Taxonomy and Evidence Audit of Language Grounding in Embodied Agents

语言的作用与证据支持:具身智能体中语言接地的功能角色分类与证据审查

Yifan Guo, Chenghao Li, Zhu Wang, Wei Xu, Yu Li, Yulong Zhu, Zhuo Sun, Bin Guo, Zhiwen Yu

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL

AI总结 本研究提出具身智能体中语言的五种功能角色,构建框架审查现有文献,发现语言功能使用与证据支持存在差距,以角色主张为单位可合理比较不同具身智能体。

Comments 19 pages, 3 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02845 2026-08-05 cs.LG 新提交 57%

NOMADD: Numerical Optimization of Models Adapting to Data Drift

NOMADD:适配数据漂移的模型数值优化方法

Swapn Shah, Keith Burghardt

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文提出适用于多种模型的事后概念漂移缓解方法NOMADD,通过参数外推提升模型在18个数据集基准上的性能,训练耗时远低于同类最先进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02786 2026-08-05 cs.LG 新提交 57%

Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment

评估盲区:无声的测量故障如何从训练到部署破坏AI系统

Priyanka Bajaj

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 本文提出评估盲区概念,指出测量故障会从AI训练到部署阶段无声传播,通过案例与50起真实事件验证,发现53%公开失效为无声,强调测量基础设施需覆盖全生命周期。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02643 2026-08-05 cs.SE cs.AI 新提交 57%

CUADebug: Diagnosing and Repairing Computer-Use Agent Failures

CUADebug:计算机使用智能体故障的诊断与修复

Weijia Zhang, Kunlun Zhu, Zeyi Liu, Yinting Chen, Tianyi Ma, Jiateng Liu, Jiaxun Zhang, Bingxuan Li, Xiangru Tang, Heng Ji, Jiaxuan You

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 本研究提出CUADebug框架,含错误分类、CUAErrorBench基准与CUADebugger工具,可诊断修复计算机使用智能体故障,提升任务完成与重新执行成功率,证明其能提供可操作修复信号。

Comments 23 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27975 2026-08-05 cs.CV cs.AI 版本更新 57%

TransVLM: A Vision-Language Framework and Benchmark for Detecting Any Shot Transitions

TransVLM:一种用于检测任意 shot 转换的视觉-语言框架和基准

Ce Chen, Yi Ren, Yuanming Li, Viktor Goriachko, Zhenhui Ye, Zujin Guo, Zhibin Hong, Mingming Gong

机构 * University of Melbourne(墨尔本大学) HeyGen Research(HeyGen研究院) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 TransVLM 提出了一种视觉-语言框架,通过注入光流作为关键运动先验,提升对任意 shot 转换的检测能力,同时设计了可扩展的数据引擎和基准测试,实验表明其性能优于传统方法和现有 VLM。

Comments v2: Corrected an inaccurate statement in the abstract regarding production deployment. Accepted by ECCV 2026. For more related research, please visit HeyGen Research (https://www.heygen.com/research) and HeyGen Avatar-V (https://www.heygen.com/research/avatar-v-model). Project page: https://chence17.github.io/TransVLM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13236 2026-08-05 cs.DL cs.AI 57%

Layout-Aware OCR for Black Digital Archives with Unsupervised Evaluation

Fitsum Sileshi Beyene, Christopher L. Dancy

机构 * Department of Computer Science and Engineering(计算机科学与工程系) The Pennsylvania State University(宾夕法尼亚州立大学) Department of Industrial and Manufacturing Engineering(工业与制造工程系)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI

Comments IEEE-ISTAS conference

Journal ref 2025 IEEE International Symposium on Technology and Society (ISTAS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03474 2026-08-05 cs.CV 新提交 50%

MT-Web2Code: Benchmarking Coding Agents on Multi-Turn Regional Reconstruction and Localized Modification

MT-Web2Code:面向多轮区域重构与局部修改的编码智能体基准测试

Qiming Li, Shujie Hu, Haohan Liu, Xiaocheng Feng, Songxiang Liu, Guanglu Wan

专题命中 评测与基准 :language model(abstract)

AI总结 MT-Web2Code是首个面向多轮区域重构与局部修改的多模态编码基准,实验发现现有编码智能体存在多轮错误滚雪球等问题,其评估指标或助力相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03120 2026-08-05 cs.CV 新提交 50%

SeCo-SBIR: Semantically Consistent Prompt Learning for Zero-Shot Sketch-Based Image Retrieval

SeCo-SBIR:用于零样本草图-图像检索的语义一致提示学习

Long Hoang Dang, Tuan Nguyen Huu, Nguyen Minh Hieu, Tu Minh Phuong

专题命中 评测与基准 :prompting(abstract)

AI总结 SeCo-SBIR是解决CLIP适配ZS-SBIR时域适配与泛化矛盾的语义一致提示学习框架,结合多模态提示、一致性约束与多目标损失,在三类ZS-SBIR基准上达最优性能。

Comments ACMMM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03760 2026-08-05 cond-mat.mtrl-sci 新提交 50%

Guided Synthesis of EMT Zeolites by Machine Learning

机器学习指导EMT沸石的合成

Emmanuel A. Olanrewaju, Santosh Adhikari, Zhiyin Niu, Michael Nikolaou, Jeremy C. Palmer, Jeffrey D. Rimer, Mingjian Wen

专题命中 评测与基准 :foundation model(abstract)

AI总结 本研究开发机器学习模型,基于174组合成参数预测沸石骨架,识别关键参数并找到6种EMT合成新条件,5种经实验验证,为加速沸石合成提供数据驱动方案。

Journal ref Phys. Rev. Materials 10, 083801, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22768 2026-08-05 cs.CV 50%

From Pixels to Semantics: A Multi-Stage AI Framework for Structural Damage Detection in Satellite Imagery

从像素到语义:一种多阶段AI框架用于卫星图像中的结构损坏检测

Bijay Shakya, Catherine Hoier, Khandaker Mamun Ahmed

机构 * The Beacom College of Computer & Cyber Sciences, Dakota State University(达科他州立大学比康计算机与网络科学学院)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出一种多阶段AI框架,结合超分辨率、目标检测和视觉-语言模型,提升灾害后建筑损坏评估的语义解读能力,通过CLIPScore和多模型策略提高检测可靠性。

Journal ref IEEE/CVF Conference on Computer Vision & Pattern Recognition Workshop (CVPRW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29368 2026-08-05 cs.CV 版本更新 50%

StereoVGGT: A Training-Free Visual Geometry Transformer for Stereo Vision

StereoVGGT: 一种无需训练的视觉几何变换器用于立体视觉

Ziyang Chen, Yansong Qu, You Shen, Xuan Cheng, Liujuan Cao

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出StereoVGGT,一种专为立体视觉设计的特征骨干网络,通过冻结VGGT并引入无训练特征调整流程,缓解几何退化,提升立体匹配性能,在KITTI基准中取得第一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25761 2026-08-05 cs.CV cs.DL 50%

A Survey of OCR Evaluation Methods and Metrics and the Invisibility of Historical Documents

OCR评估方法和指标及历史文件的不可见性综述

Fitsum Sileshi Beyene, Christopher L. Dancy

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本文探讨OCR系统在历史文档中的评估问题,指出现代文档评估方法忽视了历史档案的布局、字体和材料退化,导致结构性不可见和代表性伤害。

Comments This manuscript is the author's submitted version to the ACM Conference on Fairness, Accountability, and Transparency (FAccT 2026). Please cite the final published version via ACM Digital Library when available

Journal ref FAccT '26: The 2026 ACM Conference on Fairness, Accountability, and Transparency

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 95 篇

2608.02975 2026-08-05 cs.CL cs.AI cs.LG 新提交 93%

TQLite: Multi-LLM Jury Guided Distillation for Real-time MQM Translation Quality Evaluation

TQLite:多大语言模型评审团引导的蒸馏用于实时MQM翻译质量评估

Bhavin Jawade, Cameron R. Wolfe

机构 * Netflix(网飞公司)

专题命中 效率与部署 :LLM(title,summary_cn);SLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出TQLite蒸馏框架,通过多LRM评审团生成合成训练数据,使SLMs的MQM翻译质量评估性能远超普通SLM,成为LLM/LRM评估器的高性价比替代方案。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03626 2026-08-05 cs.CR cs.AI cs.CY 新提交 92%

A Security-Oriented Lifecycle Model for Large Language Model Systems

面向大型语言模型系统的安全导向生命周期模型

Eleftherios Batzolis, George Drosatos, Vassilis Katsouros, Konstantinos Rantos

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文针对LLM系统生命周期框架重效率轻安全、治理与生命周期阶段脱节的问题,提出含32个阶段的安全导向生命周期模型,整合多监管框架发现治理证据分布不均的结构特性。

Comments Accepted as: Batzolis, E., Drosatos, G., Katsouros, V., & Rantos, K. (2026). A Security-Oriented Lifecycle Model for Large Language Model Systems. In: Kieseberg, P., Skopik, F., Atli, B., Schrittwieser, S., & Asplund, M. (Eds.), Availability, reliability and security---ARES 2026 EU Projects Symposium workshops (Lecture Notes in Computer Science, pp. 1-18). Springer Nature Switzerland

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02879 2026-08-05 cs.AI 新提交 92%

Interpreting Black-Box Large Language Models with Sentence-Level Energy Landscapes

基于句子级能量景观的黑盒大语言模型解释

Maryam Rezaee, Pooriya Safaei, Maryam Asgarinezhad, Fatemeh Seyyedsalehi

机构 * Sharif University of Technology(谢里夫理工大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 针对黑盒LLM的可解释性缺失问题,提出一种句子级模型无关后验归因解释器,通过EBM代理捕获概念一致性,无需额外API查询即可量化提示对目标输出的影响,实验验证其能有效识别关键提示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03812 2026-08-05 cs.CV 新提交 92%

OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models

OmniPack:面向高效全模态大语言模型的统一令牌压缩方法

Wanshun Su, Yang Shi, Feihu Liu, Ziwen Yu, Yan Min, Zhuoran Zhang, Qixun Wang, Haotian Wang, Shixuan Liu, Yuanxing Zhang, Peng Wu, Chengfu Huo, Liang Ding

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文针对全模态大语言模型的高计算开销问题,提出无需训练的OmniPack框架,通过LLM前结构压缩与LLM内语义优化的协作,在5个基准上实现最优性能-效率权衡,在Qwen2.5-Omni-7B上大幅降低计算量且保持高性能。

Comments 16 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02995 2026-08-05 cs.CR cs.AI 新提交 92%

SparSEEty: Extracting Tokens from Sparsity-Exploiting LLM Serving Systems via Deterministic Side Channels

SparSEEty:通过确定性侧信道从利用稀疏性的大语言模型(LLM)服务系统中提取 token

Yongwan Jo, Jinyoung Park, Euihyun Lee, Dokyung Song

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SparSEEty 是一种针对利用稀疏性的 LLM 服务系统的 token 提取攻击,通过 CVM 侧信道构建预言机、降低监控开销并反转激活轨迹,可高准确率重建 token,监控开销仅 3.7%-7.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04002 2026-08-05 cs.HC 新提交 91%

Semantic Bundling: Interactive Node and Edge Bundling to Simplify Knowledge Graphs using Large Language Models

语义捆绑:使用大语言模型简化知识图谱的交互式节点与边捆绑

Adam Coscia, Zeyu Hua, Eric Krokos, Timothy Lin, Alex Endert

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 该研究提出基于LLM的语义捆绑技术,在开源系统AgentK中实现,用于简化知识图谱,通过节点边捆绑形成高级结构,在电影评论等场景中可揭示文档集合新见解。

Comments Under review. 12 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28048 2026-08-05 cs.AI 版本更新 91%

SKILL-KD: Contrastive Skill Distillation for LLM Agents

SKILL-KD:面向大语言模型智能体的对比式技能蒸馏

Qiming Shi, Yibo Dou, Jiawen Zhu, Yulong Tao, Linbo Jin, Zhaolu Kang, Yunfan Zhou, Di Weng

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 SKILL-KD是面向LLM智能体的对比式技能蒸馏框架,通过将师生智能体的可操作差异蒸馏为技能补丁并迭代优化,结合感知漂移的技能整合,在五个智能体基准上提升了冻结学生智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03036 2026-08-05 cs.SE cs.AI cs.LG 新提交 90%

LLM Serving in the Wild: An Empirical Study of Frameworks, Methods, and System Designs

野外环境下的大语言模型服务:框架、方法与系统设计的实证研究

Forough Majidi, Mohammad Mehdi Morovati, Foutse Khomh, Heng Li

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过实证分析开源软件系统中5种LLM服务框架的应用情况,明确了框架使用特点、常用服务方法及应用场景,为相关人员提供了实践见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02680 2026-08-05 cs.SE cs.AI cs.LG 新提交 90%

TraceCompiler: Skill-Guided Mining and Compilation of LLM Agent Traces into Mostly Deterministic Workflows

TraceCompiler:技能引导的LLM智能体轨迹挖掘与编译为近确定性工作流

Salma El Yadouni, Guanyi Li

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出TraceCompiler系统,通过技能引导挖掘含噪声的LLM智能体轨迹并编译为近确定性工作流,在T1、AppWorld数据集上验证了依赖恢复的高精度,实现了Venmo资金请求意图的调用减少。

Comments 17 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01774 2026-08-05 cs.LG cs.AI 版本更新 90%

FLARE: Diffusion for Hybrid Language Model

FLARE: 混合语言模型的扩散方法

Yuchen Zhu, Jing Shi, Chongjian Ge, Hao Tan, Yiran Xu, Wanrong Zhu, Jason Kuen, Koustava Goswami, Rajiv Jain, Yongxin Chen, Molei Tao, Jiuxiang Gu

机构 * Adobe Research(Adobe研究院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 效率与部署 :language model(title,abstract);LLM(summary_cn,abstract_cn);large language model(abstract);post-training(abstract)

AI总结 提出FLARE框架,通过结合自回归和扩散目标、硬件感知内核和统一推理,将混合注意力LLM转换为支持并行解码的扩散模型,在保持能力的同时提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03961 2026-08-05 cs.AI 新提交 90%

Interpretable Adaptive Sampling for LLM Test-Time Scaling

面向大语言模型测试时缩放的可解释自适应采样

Mobina Kashaniyan, Ali Jannesari

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对LLM测试时推理的固定计算预算不灵活、不可解释的问题,提出带轻量级模糊控制器的自适应采样方法,在问答和数学任务上提升性能并减少平均采样数,为高效测试时推理提供实用方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03463 2026-08-05 cs.AI 新提交 90%

LeanMem: Simple and Efficient Long-Term Memory for LLM Agents

LeanMem:面向LLM智能体的简单高效长期记忆系统

Yuxin Liao, Le Wu, Min Hou, Hao Liu, Han Wu, Zishu Wang

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 LeanMem是面向LLM智能体的轻量级长期记忆框架,通过差异化处理历史内容、动态分配资源,在两个数据集上提升了记忆基线的准确率,同时降低了成本与延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03867 2026-08-05 cs.AR 新提交 89%

Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference

面向高效低比特大语言模型推理的异构感知微缩放技术

Junyi Luo, Xinting Jiang, Tai-Hao Wen, Ruichen Qi, Minxing Chu, Hongyi Wu, Gregory Kielian, Ben Laurie, Qirui Zhang, Quan Cheng, Dennis Sylvester, Mehdi Saligane

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究针对低比特LLM推理的MX格式精度损失问题,提出异构感知的AdaMX格式与加速器,在不增加EBW的前提下提升精度、降低存储能耗,在多类LLM及多模态模型上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏