arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-24 至 2026-07-24 共收录 80 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 80 篇

2607.20526 2026-07-24 cs.AI cs.LG stat.ML 新提交 93%

ConfidenceBench: Evaluating Confidence Calibration in Large Language Models

ConfidenceBench:评估大语言模型中的置信度校准

Matthew ffrench-Constant, Daniel Yang, Xinmeng Huang, Sanyam Kapoor

机构 * ETH Zurich(苏黎世联邦理工学院) University of Pennsylvania(宾夕法尼亚大学) New York University(纽约大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 研究针对大语言模型在特定场景下仅靠准确性不足的问题,提出ConfidenceBench校准基准,用Brier分数评估15个前沿LLMs口头置信度,经实验发现模型准确性与校准差异大,证明口头置信度校准是LLM可靠性重要维度,补充了基于准确性的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18269 2026-07-24 cs.AI cs.LG 版本更新 92%

Wisdom of LLM Crowds: Aggregation and Contamination in Language Model Ensembles

语言模型群体的智慧:语言模型集成中的聚合与污染

Igor Douven

机构 * SND / CNRS / Sorbonne University(SND / 法国国家科学研究中心 / 索邦大学)

专题命中 评测与基准 :LLM(title,summary_cn);language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨大语言模型群体是否有群体智慧,通过让15个LLMs对254个二元预测市场问题进行概率估计,评估经典和学习型聚合方法,发现学习型聚合器表现优,训练截止污染影响结果,表明LLM群体有群体智慧效应,但可靠评估需无污染评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22952 2026-07-24 cs.SE 版本更新 90%

Sifting the Noise: A Comparative Study of LLM Agents in Vulnerability False Positive Filtering

筛选噪声:LLM代理在漏洞假阳性过滤中的比较研究

Yunpeng Xiong, Ting Zhang

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract)

AI总结 本文比较了三种先进的LLM代理框架在漏洞假阳性过滤中的性能,展示了LLM代理在减少SAST噪声方面的有效性,但指出其效果依赖于模型和漏洞类型,且存在计算成本差异。

Comments To appear in Proceedings of the 35th ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21496 2026-07-24 eess.SP cs.LG 新提交 90%

Toward Generalizable Cognitive Impairment Detection with Speech-Based Multimodal Large Language Models

使用基于语音的多模态大语言模型实现可泛化的认知障碍检测

Yingchao Huang, Xin Wang, Yuhan Su, Shanshan Yao

机构 * Faculty of Digital Innovation, Arts \& Sciences, Saskatchewan Polytechnic, Regina SK S4S 5X1, Canada School of Basic Medical Sciences, Hebei University, Baoding 071000, China Department of Civil \& Environmental Engineering School of Mining \& Petroleum Engineering, University of Alberta, Edmonton AB T6G 2H5, Canada

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 研究针对认知障碍检测问题,提出基于开源大语言模型的多模态检测框架,整合语音音频与转录文本,提取特定模态嵌入后连接成特征向量用于分类,在相关基准数据集上评估,该框架准确率达92.4%,优于单模态基线且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20864 2026-07-24 cs.LG cs.CL 新提交 90%

Position Bias is Hidden Behind Ceiling Effects: A Permutation Diagnostic for LLM Benchmarks

位置偏差隐藏在天花板效应背后:LLM基准测试的排列诊断

Hiroki Tamba

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 研究LLM基准测试中位置偏差问题,引入inspect_permute工具对四个供应商在五个MMLU主题上进行测试,发现位置偏差仅在特定准确率区间可检测,明确了可检测区域及两种机制类型,界定了位置偏差测量范围,使核心问题可验证。

Comments 25 pages, 4 figures, 2 appendices. Code, data, and preregistration verification at https://github.com/TambaClan/inspect_permute. Companion paper: arXiv:2606.26185

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21010 2026-07-24 cs.AI 新提交 90%

Reexamining zero-shot summarization: Empirical investigation of trustworthiness of LLM-summarizers

重新审视零样本摘要:对大语言模型摘要器可信度的实证研究

Vasudha Bhatnagar, Purnima Bindal, Vikas Kumar, Raj Kumari Bahl

机构 * Department of Computer Science, University of Delhi(德里大学计算机科学系) Department of Statistics, Ramjas College, University of Delhi(德里大学拉姆贾斯学院统计系)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型零样本摘要的稳定性与可信度问题,提出两级诊断协议,通过文档级稳定性分析及分层样本观察估计稳定性指数,经对三种文档类型的三个LLM摘要器实证研究,揭示差异,推动相关研究发展。

Comments 28 pages, Under review in a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20531 2026-07-24 cs.AI 新提交 90%

DynamicMCPBench: A Trace-Grounded, Effect-Scored Benchmark for LLM Agents over Live MCP Servers

DynamicMCPBench:用于实时MCP服务器上的大语言模型智能体的基于轨迹的效果评分基准测试

Jerzy Kamiński, Ilya Galyukshev, Artem Kuznetsov, Sergey Chuprin, Kirill Redko, Aidar Shumbalov, Anna Kalyuzhnaya

机构 * ITMO University(俄罗斯圣彼得堡国立信息技术机械与光学大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对LLM智能体在MCP服务器上的评估基准问题,提出DynamicMCPBench框架,能生成目标、追踪轨迹并按效果评分。大规模测试发现智能体处理长多步任务能力不足,且该框架可重复运行,人工验证其自动评分可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01925 2026-07-24 cs.CL cs.AI 版本更新 90%

ImplicitBBQ: Benchmarking Implicit Bias in Large Language Models through Characteristic Based Cues

ImplicitBBQ: 通过基于特征的提示对大语言模型中的隐性偏见进行基准测试

Bhaskara Hanuma Vedula, Darshan Anghan, Ishita Goyal, Ponnurangam Kumaraguru, Abhijnan Chakraborty

机构 * International Institute of Information Technology, Hyderabad(国际信息技术学院海得拉巴) Indian Institute of Technology, Kharagpur(印度理工学院克勒格布尔分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ImplicitBBQ基准测试,通过基于特征的提示评估大语言模型中的隐性偏见,发现隐性偏见在模糊情境中比显性偏见高六倍,现有方法难以有效缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20722 2026-07-24 cs.CL 新提交 90%

REGARD: Regional Affective Differences in Large Language Models

REGARD:大语言模型中的区域情感差异

Andrei Chetvergov, Alexander Evseev, Mikhail Solovev, Timofei Sivoraksha, Stepan Ukolov, Valeriia Kuschenko, Maria Chistyakova, Sergey Bolovtsov

机构 * Ivannikov Institute for System Programming of the Russian Academy of Sciences(俄罗斯科学院伊万尼科夫系统编程研究所) Russian Presidential Academy of National Economy and Public Administration(俄罗斯总统国民经济与公共管理学院)

专题命中 评测与基准 :language model(title,abstract);large language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 研究跨大语言模型对后苏联实体情感框架差异,用目标导向的效价-唤醒-优势剖析,向19个模型询问500个特定区域目标并评分验证,聚类得出行为聚类,发现效价-唤醒-优势剖析能捕捉情感强度,补充传统情感评估。

Comments 17 pages, 11 figures, 3 tables. Includes evaluation of 19 language models, two independent VAD judges, and human validation on 300 items

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20471 2026-07-24 cs.AI 新提交 89%

Benchmarking the Personalization Capabilities of Large Language Models

大型语言模型个性化能力的基准测试

Ashutosh Srivastava, Siddharth Yedlapati, Vinay Aggarwal, Yaman Kumar Singla, Shashwat Dixit, Jitendra Ajmera, Balaji Krishnamurthy

机构 * Adobe Media & Data Science Research(Adobe媒体与数据科学研究)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究大型语言模型个性化能力,将贝叶斯说服框架应用于生成式智能体并实例化到销售场景,发布SDR-Bench语料库,发现个性化存在平台期,通过现场部署验证框架,还公开了SDR-Arena和SDR-Bench以支持相关可重复研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20463 2026-07-24 cs.AI 新提交 89%

ClickGuard: Detecting and Spoiling Clickbait News with Informativeness Measures and Large Language Models

ClickGuard:利用信息性度量和大语言模型检测和揭露标题党新闻

Wojciech Michaluk, Tymoteusz Urban, Mateusz Kubita, Soveatin Kuntur, Anna Wróblewska

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文利用信息性度量和大语言模型开发了名为ClickGuard的浏览器扩展,采用混合机器学习架构,结合Transformer嵌入、语言特征和“诱饵性”分数,基于XGBoost建模,能在用户访问前后预警标题党文章,给出可能性分数并解释,还提供文章剧透。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20476 2026-07-24 cs.AI cs.CL 新提交 88%

Benchmarking Large Language Models on Multi-Sensor Physical Hazard Assessment

在多传感器物理危害评估中对大语言模型进行基准测试

Faizan Iqbal

机构 * Lovely Professional University(可爱专业大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究五个大语言模型对多传感器物理危害数据的评估,通过1800次API调用测试60个场景,发现模型在多传感器场景表现不佳,单传感器场景表现良好,且结构化表格格式优势不明显,为从业者提供了模型应用参考。

Comments 14 pages, 6 figures. Benchmark dataset, evaluation code, and raw results publicly available at: https://github.com/Faizaniqbal52/PhysicalHazardBenchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20454 2026-07-24 cs.CL cs.AI 新提交 88%

Response drift across frontier large language models

前沿大语言模型中的响应漂移

Mohammed Aledhari, Ali Aledhari, Fatimah Aledhari, Gowtham Venkat Eathamokkala, Mohamed Rahouti

机构 * University of North Texas(北德克萨斯大学) Fordham University(福特汉姆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究前沿大语言模型的响应漂移问题,通过47名参与者对十个模型的62个多领域问题进行盲测评估,发现各模型漂移程度不同,依赖领域和问题,且自动指标解释方差低,揭示需以人类评估了解漂移情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20485 2026-07-24 cs.AI cs.CL cs.LG 新提交 88%

Expectation Alignment of Language Models for Real-World User Expectations

语言模型与现实世界用户期望的期望对齐

Miaomiao Li, Yang Wang, Bin Liang, Shudong Liu, Zhiwei Zhang, Kam-Fai Wong

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究LLMs是否满足用户期望,提出提取期望程序并引入ExpectBench基准,分析发现LLMs存在问题,进而提出LENS框架,可让模型内化期望以生成更契合的响应,凸显明确建模用户期望对实现现实人机对齐的重要性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20499 2026-07-24 cs.AI cs.SE 新提交 88%

ExecuGraph: A Multi-Agent, Execution-Grounded Framework for Reliable Backend Code Synthesis with Large Language Models

ExecuGraph:一种用于通过大语言模型进行可靠后端代码合成的多智能体、基于执行的框架

Sai Deekshith Lekkala, Jothi Prabha Appadurai, Rohith Reddy Bellibatlu, Manpreet Singh

机构 * Department of Computer Science and Engineering (AI & ML), Kakatiya Institute of Technology and Science(卡凯蒂亚理工学院计算机科学与工程系(人工智能与机器学习)) Department of Computer Science and Engineering, Kakatiya Institute of Technology and Science(卡凯蒂亚理工学院计算机科学与工程系) Boston University(波士顿大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究针对大语言模型后端代码合成可靠性问题,提出ExecuGraph多智能体框架,将执行验证置于核心,通过六个智能体和有向工作流协调,在多数据集评估中对比单智能体基线,验证方法有效性且能控制测量各因素贡献。

Comments Submitted to Data Science and Management

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20446 2026-07-24 cs.CL cs.CY 新提交 87%

Distinguishing Artificial from Authentic: Evaluating LLMs for Detecting LLM-Generated Content

区分人工与真实:评估大语言模型检测由大语言模型生成的内容

Juho Leinonen, Paul Denny

机构 * Aalto University(阿尔托大学) University of Auckland(奥克兰大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究大语言模型检测自身生成内容的能力,通过真实学生回答和模型生成答案的多种变体,评估不同提示策略和输出格式下的检测性能,发现其检测高度依赖任务,提示框架等因素影响检测效果,凸显了大语言模型自我检测的潜力与局限。

Comments 8 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20465 2026-07-24 cs.LG cs.CL 新提交 87%

DataPrep-Bench: Benchmarking LLMs as Training Data Preparators

数据准备基准:评估作为训练数据准备者的大语言模型

Hao Liang, Qifeng Cai, Yibo Lin, Jianzhuo Du, Qifeng Xia, Sizhe Qiu, Linzhuang Sun, Meiyi Qiang, Zhaoyang Han, Xiaochen Ma, Bohan Zeng, Ruichuan An, Conghui He, Wentao Zhang

机构 * Peking University(北京大学) Institute for Advanced Algorithms Research(先进算法研究院) OriginHub Technology(源创科技)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究LLMs作为训练数据准备者的表现,引入DataPrep - Bench统一基准,涵盖数据构建与质量评估,在多领域和模型上评估,发布相关智能体和评估器,为衡量LLM驱动数据准备能力提供框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03552 2026-07-24 cs.SI 版本更新 86%

From Risk Perception to Behavior Large Language Models-Based Simulation of Pandemic Prevention Behaviors

从风险认知到行为:基于大语言模型的流行病预防行为模拟

Lujia Bo, Mingxuan Chen, Youduo Chen, Xiaofan Gui, Jiang Bian, Chunyan Wang, Yi Liu

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

AI总结 本文提出基于大语言模型的流行病预防行为模拟框架,通过静态和动态模块预测和更新行为,验证了其在不同数据环境下的有效性,并展示了政策放松期间行为变化的模拟结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21300 2026-07-24 cs.CV cs.AI 新提交 83%

Unlearning Under Imbalance: Benchmarking Fairness in Multimodal LLM Unlearning

不平衡下的遗忘:多模态大语言模型遗忘中的公平性基准测试

Lorenzo Orsingher, Thomas De Min, Massimiliano Mancini, Davide Talon, Elisa Ricci

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多模态大语言模型遗忘中的公平性问题,提出FAIRGET基准和FAUN算法,通过模拟现实场景下不平衡的遗忘请求,在考虑数据不平衡性质时遗忘身份,实验证明该方法在遗忘质量和公平性上具有优越性。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17528 2026-07-24 cs.AI cs.AR cs.LG 版本更新 82%

Can AI Agents Really Complete RTL-to-GDS? Lessons from Benchmarking Tool-Interactive EDA Workflows

人工智能代理真的能完成从RTL到GDS的转换吗?基准测试工具交互式EDA工作流程的经验教训

Jinyuan Deng, Zhengrui Chen, Xufeng Wei, Tianyu Xing, Chenyi Wen, Qi Sun, Cheng Zhuo

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 研究探讨人工智能代理在EDA工作流程中的表现,提出FluxBench进行系统评估,涵盖多种场景并评估多项能力,引入Token ROI指标。结果显示不同代理系统架构性能有差距,特定领域技能不是提升性能的唯一关键,系统设计和基础模型能力也很重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25572 2026-07-24 cs.CL cs.AI 版本更新 82%

PennySynth: RAG-Driven Data Synthesis for Automated Quantum Code Generation

PennySynth:基于RAG的数据合成用于自动量子代码生成

Minghao Shao, Nouhaila Innan, Hariharan Janardhanan, Muhammad Kashif, Alberto Marchisio, Muhammad Shafique

机构 * eBRAIN Lab, Division of Engineering, New York University Abu Dhabi (NYUAD)(eBRAIN实验室,工程系,纽约大学阿布扎比分校) Center for Quantum and Topological Systems (CQTS), NYUAD Research Institute(量子与拓扑系统中心(CQTS),NYUAD研究所) Department of Computer Science and Engineering, NYU Tandon School of Engineering(计算机科学与工程系,纽约大学坦顿工程学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出PennySynth框架,通过检索增强生成和代码感知嵌入,利用13,389个PennyLane指令-代码对数据集,在QHack竞赛中实现52%-68%的pass@5,显著提升量子代码生成的结构有效性和功能正确性。

Comments Accepted at the IEEE International Conference on Quantum Computing and Engineering (QCE), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13026 2026-07-24 cs.LG cs.AI cs.CL 版本更新 82%

Understanding and Accelerating the Training of Masked Diffusion Language Models

理解并加速掩码扩散语言模型的训练

Chunsan Hong, Sanghyun Lee, Chieh-Hsin Lai, Satoshi Hayakawa, Yuhta Takida, Yuki Mitsufuji, Seungryong Kim, Jong Chul Ye

机构 * KAIST(韩国科学技术院) Sony AI(索尼人工智能) University of Tokyo(东京大学) Sony Group Corporation(索尼集团)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了掩码扩散模型训练缓慢的原因,提出bell-shaped时间采样策略,显著提升训练效率和模型性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21468 2026-07-24 cs.HC cs.AI 新提交 81%

Thinkink: 2D Spatial Ink-native Interaction with LLMs

Thinkink:与大语言模型的二维空间原生墨水交互

Mohammad Hasan Payandeh, Daniel Vogel, Jian Zhao

机构 * Cheriton School of Computer Science, University of Waterloo(滑铁卢大学计算机科学学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 为将大语言模型融入手写笔记和草图构思,提出Thinkink,通过语义树和轻量级UI实现交互,经三阶段设计,研究不同阶段用户实践及交互挑战,贡献设计启示与交互工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21424 2026-07-24 cs.CL cs.SD 新提交 81%

An Evaluation Framework for Structured Audio Captions Validated by Controlled Perturbations

一种通过受控扰动验证的结构化音频字幕评估框架

Liang-Yuan Wu, Sripathi Sridhar, Mark Cartwright, Magdalena Fuentes

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对结构化音频字幕评估难的问题,提出多轴评估框架,结合大语言模型判断与计算指标,在五个正交轴上评估,通过受控扰动测试协议验证可靠性,能区分释义与损坏。

Comments submitted to DCASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20494 2026-07-24 cs.AI cs.CR cs.LG 新提交 81%

Isolating LLM Alignment from Regex: Zero Coverage and Metric-Dependent Divergence Under Adversarial Mutation

从正则表达式中分离大语言模型对齐:对抗性变异下的零覆盖率和度量相关散度

Alexandre Cristovão Maiorano

机构 * Vertex AI(顶点人工智能)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究在语料库被设计绕过正则表达式时大语言模型对齐情况,引入$L_5$-无正则表达式并评估,发现对齐贡献度量相关,自然语言探针中无额外覆盖率提升,对抗性变体中能检测到子串分类器错过的拒绝。

Comments 15 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11666 2026-07-24 cs.CL cs.AI cs.LG 版本更新 80%

Playing Along: Learning a Double-Agent Defender for Belief Steering via Theory of Mind

扮演:通过理论思维学习双代理守护者以实现信念引导

Hanqi Xiao, Vaidehi Patil, Zaid Khan, Hyunji Lee, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ToM-SB挑战,通过强化学习训练双代理模型以提升信念引导和理论思维能力,结果显示结合两者奖励的模型在对抗任务中表现更优。

Comments First two authors contributed equally. Code: https://github.com/The-Inscrutable-X/AIDoubleAgentDefenders

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11149 2026-07-24 cs.AI 版本更新 79%

The Hidden Footprint: Making Storage a First-Class Metric for LLM Agent Evaluation

隐藏的足迹:使存储成为大语言模型智能体评估的头等指标

Chenglin Yu, Hongquan Gui, Ying Yu, Tao Zeng, Ming Li

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究大语言模型智能体运行后磁盘持久数据评估问题,引入AgentFootprint基准测试,通过序列化感知度量套件测量多方面指标,解决测量陷阱,给出不同配置差异及存储优化结果,确立持久存储为资源指标。

Comments 17 pages, 5 figures; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28346 2026-07-24 cs.CL 版本更新 79%

When Discourse Pressures Conflict: Information Structure in Vision-Language Model Outputs

当话语压力冲突时:视觉-语言模型输出中的信息结构

Marcell Fekete, Johannes Bjerva, Tamás Káldi

机构 * Department of Computer Science, Aalborg University(奥尔堡大学计算机科学系) Department of Psycholinguistics and Neurolinguistics, ELTE Research Centre for Linguistics(ELTE语言研究中心心理学语言学与神经语言学系) ELTE Bárczi Gusztáv Faculty of Special Needs Education(ELTE巴尔茨吉斯塔夫特殊教育学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 研究视觉-语言模型在视觉问答中是否区分话语旧主题和新焦点,发现模型虽产生信息结构相关结构但过度正则化,倾向于窄响应模板,类似模式崩溃。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20584 2026-07-24 eess.IV 新提交 78%

HistoFID- Calibrating Frechet-distance evaluation across pathology foundation models

HistoFID-校准跨病理学基础模型的弗雷歇距离评估

Swapnil Bhat, Devansh Lalwani, Maulik Shah, Sheena Alphones, Rimlee Dutta, Nikita Mulchandani, Roshani Gala, Jay Mehta

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 研究数字病理学中用组织学基础模型取代 Inception 网络后 FID 结果受影响的问题,通过特定比率恢复可比性,划分编码器组,揭示其对生成模型评估结论的影响,还评估了 TuroCompress 编解码器并发布相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21455 2026-07-24 cs.NI 新提交 78%

Out-of-Distribution Detection in Wireless Multimodal Foundation Models for 6G ISAC

6G智能感知与通信无线多模态基础模型中的分布外检测

Mohammad Farzanullah, Akram Bin Sediq, Ali Afana, Melike Erol-Kantarci

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 研究6G智能感知与通信中无线多模态基础模型的分布外检测问题,提出WMFM - OOD框架,通过构建基站原型和温度缩放概率评分机制区分异常,在DeepVerse6G数据集验证,显著优于基线,提升检测灵敏度,保障网络可靠性。

Comments presented at IEEE VTC 2026 Fall, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏