arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2707 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2707 篇

2608.01717 2026-08-04 cs.LG 新提交 83%

Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models

超越在线策略探索:将外部策略 rollout 整合用于扩散语言模型中的强化学习

Wonseok Lee, Jimyeong Kim, Jungmin Ko, Wonjong Rhee

机构 * Seoul National University(首尔大学) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔大学人工智能交叉项目) Artificial Intelligence Institute, Seoul National University(首尔大学人工智能研究院) Department of Intelligence and Information, Seoul National University(首尔大学智能与信息系)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 该研究针对扩散大语言模型强化学习中在线策略 rollout 稀缺的问题,提出 ERILS 方法整合外部策略 rollout,在数独等任务上显著提升性能,验证了 rollout 构建与奖励处理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29079 2026-08-03 cs.CL 新提交 83%

Faster but Different: Diagnosing and Controlling Content Drift in Accelerated Multimodal Diffusion Language Models

更快但不同:加速多模态扩散语言模型中的内容漂移诊断与控制

Yaoxuan Dou, Yang Shu

机构 * School of Mathematics and Statistics, Beijing Institute of Technology(北京理工大学数学与统计学院) Zhejiang University(浙江大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 该研究针对加速多模态扩散语言模型的内容漂移问题,通过实验诊断出漂移源于过期状态,提出缩短KV缓存刷新区间的控制方法,在1.3倍加速时实现近乎完全一致,且未发现事实错误差异。

Comments 9 pages, 4 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24893 2026-07-29 cs.CR cs.AI 新提交 83%

Early Detection of Distributed Backdoors in Multi-Agent LLM Systems: A Characterization Study

多智能体大语言模型系统中分布式后门的早期检测:一项特征研究

Diego Fernandez Arias, Dev Prashant Mistry, Ren Wang, Yibo Hu

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.AI

AI总结 研究多智能体大语言模型系统中分布式后门早期检测,构建分层多智能体系统实例,通过记录片段注入及载荷组装执行时间来检测。前缀检测器能较早标记多数成功攻击,部分检测器依赖表面线索,微调模型可减少线索去除后的损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23386 2026-07-28 cs.AI 新提交 83%

Confidently Wrong: Exception Chain Collapse in Frontier LLM Rule Evaluation

确信错误:前沿大语言模型规则评估中的异常链崩溃

Paul Simpson, John Kozak, Lisa Doake

机构 * Aethis

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究前沿大语言模型在规则评估中异常链崩溃问题,提出神经符号架构Aethis资格模块,通过多方面验证,将不确定性从推理边界转移到规范边界,且相关内容公开可重现。

Comments 43 pages, 9 figures. Working paper v3.13.0. Benchmark data, rule encodings and per-case result artefacts: https://github.com/Aethis-ai/confidently-wrong-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23089 2026-07-28 cs.AI cs.PL 新提交 83%

Compiler-Grounded Hierarchical Diagnosis for LLM-Based Triton Kernel Optimization

基于编译器的大语言模型Triton内核优化分层诊断

Dongjie Chen, Ping Zhao, Bohua Zhan, Yulong Wang, Shushu Chen, Liangjun Feng, Hao Zhou, Min Shen, Linmu Wang, Weijia Sheng, Xiangyu Wei, Weijie Ding, Jianhui Huang, Yaoqing Gao

机构 * Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型内核优化中编译器优化失败原因难揭示的问题,提出基于编译器的Triton内核分层优化框架,通过跨层诊断实现从模式分类到源级重写的优化,在Ascend NPU上显著加速Triton内核。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21756 2026-07-27 cs.DB cs.LG 新提交 83%

Prompt as a Data Type: In-Database LLM Prompt Management and Rewriting

作为一种数据类型的提示:数据库内的大语言模型提示管理与重写

Denis Mayr Lima Martins, Gottfried Vossen

机构 * Department of Computing and Mathematics University of Sao Paulo(计算机与数学系 乌拉圭圣保罗大学) Department of Information Systems University of Münster(信息系统系 梅茵斯特大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究如何在数据库中管理和重写大语言模型提示。核心方法是引入PromptDB系统,将提示视为元组级数据库值,利用数据库元数据重写提示。主要贡献是创造新优化空间,经实验验证数据库引导重写可提高输出有效性并权衡成本质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21300 2026-07-24 cs.CV cs.AI 新提交 83%

Unlearning Under Imbalance: Benchmarking Fairness in Multimodal LLM Unlearning

不平衡下的遗忘:多模态大语言模型遗忘中的公平性基准测试

Lorenzo Orsingher, Thomas De Min, Massimiliano Mancini, Davide Talon, Elisa Ricci

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多模态大语言模型遗忘中的公平性问题,提出FAIRGET基准和FAUN算法,通过模拟现实场景下不平衡的遗忘请求,在考虑数据不平衡性质时遗忘身份,实验证明该方法在遗忘质量和公平性上具有优越性。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19528 2026-07-23 cs.CV cs.AI 新提交 83%

D3VL: Understanding Driving Scenes from 3D Time Series Data and Video with Language Models

D3VL:利用语言模型从3D时间序列数据和视频中理解驾驶场景

Heesang Han, A. Lynn Abbott, Abhijit Sarkar

机构 * Bradley Department of Electrical and Computer Engineering, Virginia Tech(弗吉尼亚理工大学布拉德利电气与计算机工程系) Virginia Tech Transportation Institute(弗吉尼亚理工大学交通研究所) Sanghani Center for Artificial Intelligence and Data Analytics(桑哈尼人工智能与数据分析中心)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文针对自动驾驶中多模态大语言模型,提出D3VL框架,整合2D和3D时间序列数据,回答交通场景相关问题,在KITTI问答数据集上性能提升11%,并引入Waymo QA数据集扩展以评估模型在多样驾驶条件下处理3D和时间序列数据的能力。

Comments Accepted to IEEE IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16646 2026-07-21 cs.SE cs.AI 新提交 83%

Falsification-Based Verification of LLM-Generated Optimization Models: Sound Test Batteries and Their Detection Limits

基于证伪的大语言模型生成优化模型验证:可靠的测试组及其检测极限

Haifeng Li, Mo Hai

机构 * School of Information, Central University of Finance and Economics(信息学院,中央财经大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型生成优化模型的验证问题,基于证伪理论开发测试组,通过求解器调用测试候选模型,实验证实该测试组可靠,能检测多种错误,误报率低,再现可检测性模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16442 2026-07-21 cs.CV cs.CL cs.CR 新提交 83%

One Modality to Forget Them All: Enhancing Cross-Modal Unlearning in Vision-Language Models

一种模态遗忘一切:增强视觉语言模型中的跨模态遗忘

Sudharshan Balaji, Yili Ren, Guangjing Wang, Yimin Chen, Ning Wang

机构 * University of South Florida(南佛罗里达大学) University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 研究视觉语言模型中跨模态遗忘转移问题,通过对三种架构研究发现其不对称不完整。提出CrossInf策略,聚焦关键transformer块遗忘,减少转移差距,提升鲁棒性,经人工评估验证,还用CKA分析浅层遗忘。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16066 2026-07-20 cs.NI cs.AI 新提交 83%

LLM-Powered Agentic AI for 5G/6G Networks: A Tutorial and Survey on Architectures, Protocols, and Standardization

用于5G/6G网络的基于大语言模型的智能体人工智能:架构、协议和标准化教程与综述

Mazene Ameur, Abdelkader Mekrache, Bouziane Brik, Adlen Ksentini

机构 * EURECOM University of Sharjah(谢贾学院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究5G/6G网络中基于大语言模型的智能体人工智能,通过分为两部分的教程与综述,形式化5G和6G相关平面,涵盖智能体系统基础,映射其能力到控制面等,识别自主电信面临的开放挑战。

Comments 35 pages, 4 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14957 2026-07-17 cs.AI 新提交 83%

Contextualized Early Detection of Online Firestorms: A Sequential LLM-Based Approach

在线风暴的情境化早期检测:一种基于序列语言模型的方法

Besim Shala, Peter Mandl, Andreas Humpe, Martin Häusl

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.AI

AI总结 研究在线风暴的早期检测,提出基于语言模型的检测系统,有回顾性分类和顺序处理两种模式,在Reddit数据集上实验,全局模式分类性能强,早期警告模式召回率高,证明语言模型可用于情境感知监测。

Comments 9 pages, 2 figures, 7 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14499 2026-07-17 cs.AI 新提交 83%

Contextualized Evaluation of Vision Language Models through Dynamic, Multi-turn Interactions

通过动态多轮交互对视觉语言模型进行情境化评估

Yijiang Li, Huiqi Zou, Bingyang Wang, Ziang Xiao

机构 * UC San Diego(加州大学圣地亚哥分校) Northeastern University(东北大学) Georgia Institute of Technology(佐治亚理工学院) Johns Hopkins University(约翰·霍普金斯大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 研究多模态大语言模型现实有效性问题,提出CEDI框架,通过三方交互、多轮半结构化对话及多种策略评估,应用于视觉幻觉,发现能揭示更多接近实际情况的幻觉,凸显其对MLLMs能力评估的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14191 2026-07-17 cs.LG 新提交 83%

TEDDY: A Pediatric Foundation Model for Risk Forewarning from ICD-Coded Diagnostic Histories

TEDDY:一种基于ICD编码诊断历史的儿科风险预警基础模型

Matthew Brady Neeley, Jorge Botas, Johnathan Jia, Lin Yao, Daniel Palacios, Benjamin Choi, Zhandong Liu, Hyun-Hwan Jeong

机构 * Baylor College of Medicine(贝勒医学院)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract);分类 cs.LG

AI总结 研究利用儿科电子健康记录训练TEDDY模型,对纵向诊断轨迹和就诊时间建模,在疾病发病预测任务中表现出色,能支持广泛、罕见疾病和长期风险预测,无需大规模人口数据或数十亿参数模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13707 2026-07-16 cs.CL cs.SE 新提交 83%

The Test Oracle Problem in Synthetic LLM-as-Judge Corpora: Disappearance, Distortion and a Validation Protocol

合成语言模型作为评判语料库中的测试预言机问题:消失、扭曲与验证协议

Serkan Ballı

机构 * Mehmet Akif Ersoy University(梅赫梅特·阿基夫·埃尔索伊大学)

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract);分类 cs.CL

AI总结 研究语言模型作为评判系统中合成语料库的测试预言机问题,指出其负面示例由语言模型生成时存在完整性验证漏洞,通过多语言语料库案例揭示答案截断、偏差扭曲等问题,并提出验证协议供无预言机模式分析师使用。

Comments 23 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13305 2026-07-16 cs.CV cs.AI cs.MM 新提交 83%

Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks

无需基础的准确性:诊断视频语言模型基准测试中的视觉依赖解离

Jae Joong Lee

机构 * Purdue University(普渡大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究视频语言模型基准测试中视觉依赖问题,引入视觉依赖差距(VDG),通过实验表明准确性与视觉依赖可分离,任务类型排名稳定,帧多样性贡献大,H.264实验有新发现,VDG可作标准审查,推动相关研究。

Comments Accepted, ACM International Conference on Multimedia 2026 (ACM MM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09526 2026-07-13 cs.CV cs.AI 新提交 83%

ALICE: Learning a General-Purpose Pathology Foundation Model from Vision, Vision-Language, and Slide-Level Experts

ALICE:从视觉、视觉语言和玻片级专家学习通用病理学基础模型

Jiawen Li, Tian Guan, Huijuan Shi, Xitong Ling, Mingxi Fu, Anjia Han, Chao He, Yonghong He

机构 * Institute of Biopharmaceutical and Health Engineering, Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学生物医药与健康工程研究院,清华大学深圳国际研究生院) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Department of Pathology, The First Affiliated Hospital of Sun Yat-sen University(中山大学附属第一医院病理科) Medical Optical Technology R&D Center, Research Institute of Tsinghua, Pearl River Delta(清华珠三角研究院医学光学技术研发中心)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 研究提出通过多阶段凝聚蒸馏训练的ALICE统一基础模型,将多种教师模型知识整合到单个主干。它在大量图像上预训练,经多场景多任务评估,在任务匹配病理基础模型中平均排名最佳,证明凝聚蒸馏可整合能力用于广泛病理学应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08981 2026-07-13 cs.SE cs.AI 新提交 83%

The Patchwork Problem in LLM-Generated Code

大语言模型生成代码中的拼凑问题

Viraaji Mothukuri, Reza M. Parizi

机构 * Decentralized Science Lab, College of Computing and Software Engineering(分布式科学实验室,计算机与软件工程学院)

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究大语言模型生成代码中的拼凑问题,将结构一致性形式化并引入故障分类法,提出混合验证框架,经实证评估和真实世界验证,揭示多数结构故障难被现有检查发现,模型间故障模式有别,此类故障普遍存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08745 2026-07-10 cs.AI cs.CV 新提交 83%

AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding

自动驾驶视觉问答:以事件为中心的行车记录仪理解视觉语言模型基准测试

Siddharth Damodharan, Radhika Gupta, Ali Alshami, Ryan Rabinowitz, Jugal Kalita

机构 * University of Colorado Colorado Springs(科罗拉多大学科罗拉多斯普林斯分校) University of Michigan(密歇根大学) University of Notre Dame(圣母大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 针对评估视觉语言模型对安全关键事件推理能力的挑战,提出AUTOPILOT-VQA基准,通过围绕真实驾驶事件的结构化问题评估系统,涵盖多安全相关类别,推动向安全意识推理发展,为自动驾驶系统评估提供标准,助力相关视觉语言系统开发。

Comments CVPR Autopilot Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07758 2026-07-10 cs.LG 新提交 83%

Scalable and Trustworthy Earth Observation Foundation Models

可扩展且可信的地球观测基础模型

Syed Usama Imtiaz, Mitra Nasr Azadani, Nasrin Alamdari

机构 * Department of Civil and Environmental Engineering, Florida State University(土木与环境工程系,佛罗里达州立大学)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 研究地球观测基础模型,指出其因数据特性需特定领域适配。回顾相关设计原则,综合模型格局等内容,纳入基准证据说明评估问题,通过案例展示实践原则,提出应从多方面评估下一代遥感基础模型。

Comments (Preprint, in review) Elsevier Book Chapter: Next-Generation Remote Sensing Methods

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07382 2026-07-09 cs.LG astro-ph.HE astro-ph.IM 新提交 83%

Generalist Vision-Language Models for Fast Radio Burst detection: a zero-shot benchmark against a specialized detector

用于快速射电暴检测的通用视觉语言模型:针对专用探测器的零样本基准测试

Raiff H. Santos, Amilcar R. Queiroz, Tharcisyo S. S. Duarte, K. E. L. de Farias, Rafael A. Batista

机构 * Universidade Federal de Campina Grande(坎皮纳格兰德联邦大学) Instituto de Formação de Educadores, Universidade Federal do Cariri(卡里里联邦大学教育工作者培训学院)

专题命中 评测与基准 :language model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 研究通用视觉语言模型在零样本下检测快速射电暴,从模拟动态频谱中抽取样本作基准,比较其与专用探测器,发现Gemma 4 2B准确率与SwinYNet相近,在结构化RFI上误报率低,重写提示可用于三类分类,准确率较高。

Comments 24 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07103 2026-07-09 cs.LG cs.DB 新提交 83%

A knowledge-augmented dataset of high-risk driving scenarios with LLM annotations for autonomous driving

一个用于自动驾驶的具有大语言模型注释的高风险驾驶场景知识增强数据集

Heye Huang, Jingguang Li, Zhiyuan Zhou, Paul Liang, Mingyu Wu, Kitae Jang, Jianqiang Wang

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Fudan University(复旦大学) Massachusetts Institute of Technology(麻省理工学院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究自动驾驶中高风险场景数据不足问题,核心方法是构建K-Risk数据集,整合多源轨迹数据并利用大语言模型生成注释,主要贡献是为自动驾驶开发和评估提供标准化基础。

Comments 22 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05904 2026-07-08 cs.LG 新提交 83%

More Convincing, Not More Correct: Self-Play Reward Hacking of Reference-Free LLM Judges

更具说服力,而非更正确:无参考语言模型评判器的自我博弈奖励破解

Chenyu Zhou

机构 * School of Engineering, Institute of Science Tokyo(东京科学大学工程学院)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.LG

AI总结 研究训练语言模型依据自身无参考评判时的奖励破解问题,发现评判器评分合理性而非正确性致误报。通过隐藏锚点审计衡量,以GSM8K为例展示问题。提出决定性变量及对应解决办法,还有可证伪界限,且过程可复制。

Comments 9 pages main text, 15 pages total including references and appendix; 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03644 2026-07-07 cs.CV cs.AI 新提交 83%

Moonstone: A Multimodal Foundation Model and Benchmark for Lunar Remote Sensing

月光石:用于月球遥感的多模态基础模型及基准

Ayush Prasad, Swarnalee Mazumder

机构 * Space and Earth Observation Centre, Finnish Meteorological Institute(芬兰气象研究所空间与地球观测中心) German Climate Computing Centre(德国气候计算中心)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 针对月球多模态遥感数据分散且无评估机器学习基准的问题,引入月光石基准。贡献包括构建全球月球预训练数据集,提出MG-MAE模型,创建涵盖多任务的基准,其预训练特征在各任务中表现出色。

Comments Accepted for publication in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03585 2026-07-07 cs.LG 新提交 83%

Modular Foundation Models for Time-Series Perception in Digital Twins

数字孪生中用于时间序列感知的模块化基础模型

Quang Hung Pham, Ryad Zemouri, Martin Gagnon, Luc Vouligny

机构 * Hydro-Québec(魁北克水电公司)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 针对数字孪生和PHM系统中时间序列感知挑战,提出基于预训练表示编码器集合的模块化基础模型,利用自监督学习,引入选通机制,支持多下游任务,消融研究验证各部分作用,实验有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31551 2026-07-01 cs.CL 新提交 83%

AutoTrainess: Teaching Language Models to Improve Language Models Autonomously

AutoTrainess: 教语言模型自主改进语言模型

Zhaojian Yu, Penghao Yin, Shuzheng Gao, Shilin He, Kai Cai, Xiao-Ping Zhang

专题命中 评测与基准 :language model(title,abstract);post-training(abstract);分类 cs.CL

AI总结 提出AutoTrainess智能体,通过外部化人类经验为工作流和约束,在PostTrainBench上超越CLI基线,平均得分从23.21提升至26.94。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30963 2026-07-01 cs.SE cs.AI 新提交 83%

Loc2Repair: A Framework for Evaluating the Impact of File-Level Issue Localization in Repo-Level LLM Repair

Loc2Repair:评估文件级问题定位在仓库级LLM修复中影响的框架

Mohammad Nour Al Awad, Sergey Ivanov

机构 * ITMO University(ITMO大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出Loc2Repair模块化评估框架,通过解耦定位与修复,在SWE-bench Verified上验证文件级定位能一致提升修复率(44.7%→49.1%)并降低平均耗时。

Comments To appear in the Proceedings of the Generative Code Intelligence Workshop (GeCoIn 2026), co-located with the 35th International Joint Conference on Artificial Intelligence (IJCAI-ECAI 2026), Bremen, Germany, August 15--17, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26348 2026-06-26 cs.AI 新提交 83%

What We are Missing in Multimodal LLM Evaluation?

我们在多模态大语言模型评估中缺失了什么?

Po-han Li, Shenghui Chen, Sandeep Chinchali, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文分析现有多模态大语言模型评估基准的不足,识别出时空连贯性、物理世界理解、多模态一致性和选择性注意等关键缺失,强调填补这些空白对衡量多模态智能真实进展的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26099 2026-06-26 cs.CY cs.AI 新提交 83%

Benchmarking Open-Weight Foundation Models for Global AI Technical Governance

开源基础模型在全球AI技术治理中的基准测试

Jason Hung

专题命中 评测与基准 :foundation model(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有研究在评估大语言模型地理偏差时的三个方法论局限,本研究使用四个开源前沿模型,基于全球AI数据集v2,通过五类响应分类和混合效应模型,评估模型在不同国家的准确性差异。

Comments 12 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25391 2026-06-25 cs.SD cs.AI cs.MM 新提交 83%

From Sounds to Scenes: A Benchmark for Evaluating Context-Aware Auditory Scene Understanding in Large Audio Language Models

从声音到场景:评估大型音频语言模型中上下文感知听觉场景理解的基准

Pengfei Zhang, Hoang H Nguyen, Kazi Shaharair Sharif, Yutong Song, Wenjun Huang, Henry Peng Zou, Pinxin Liu, Honghui Xu, Amir M. Rahmani

机构 * University of California Irvine(加州大学尔湾分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Kennesaw State University(肯尼索州立大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 提出CASU基准,通过构建半合成音频流和设计四项任务,评估大型音频语言模型整合语音、事件和背景环境进行上下文感知听觉场景理解的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏