arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2780 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2780 篇

2607.03523 2026-07-07 cs.SE cs.CL 新提交 57%

Anchored Self-Play for Code Repair

用于代码修复的锚定自博弈

Caroline Choi, Zeyneb Kaya, Shirley Wu, Tengyu Ma, Tatsunori Hashimoto, Ludwig Schmidt

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 研究代码修复能力,提出生成器-修复器自博弈,通过强化学习训练单个模型生成并修复错误,引入BugSourceBench测试泛化性,发现问题后提出锚定自博弈,提高修复率。

Comments 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03381 2026-07-07 cs.DL cs.CL 新提交 57%

Large-scale dataset of automatically classified rhetorical sections in scientific papers

科学论文中自动分类修辞部分的大规模数据集

Daniel Verdi, Jacob Aarup Dalsgaard, Roberta Sinatra

机构 * Graduate School of Education, Stanford University(斯坦福大学教育研究生院) Center for Social Data Science (SODAS), University of Copenhagen(哥本哈根大学社会科学数据科学中心) Networks, Data, and Society (NERDS), IT University of Copenhagen(哥本哈根IT大学网络、数据与社会中心) Pioneer Centre for Artificial Intelligence (P1), Denmark(丹麦先锋人工智能中心) Complexity Science Hub, Austria(奥地利复杂科学中心)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 该研究利用基于规则的分类算法,对语义学者开放研究语料库中的数百万篇科学论文进行质量筛选和标注,构建了一个数据集,可助力大规模科学话语和写作模式的计算研究。

Comments Data descriptor; includes supplementary information (1 PDF). 15 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03135 2026-07-07 cs.SE cs.AI 新提交 57%

Detecting Architectural Drift in Safety-Critical Firmware through Runtime Trace Analysis

通过运行时跟踪分析检测安全关键固件中的架构漂移

Domenico Francesco De Angelis, Marco De Luca, Domenico Amalfitano, Pasquale Cimmino, Anna Rita Fasolino

机构 * University of Naples Federico II(那不勒斯费德里科二世大学) Micron Technology, Inc(美光技术公司) DIETI

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究在长寿命安全关键固件中检测架构漂移问题,核心方法是收集硬件辅助执行跟踪,经抽象比较找出差异,还基于大语言模型生成报告,贡献是经评估该方法有效。

Comments accepted at 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02956 2026-07-07 cs.CV cs.CL 新提交 57%

MORE: A Multilingual Document Parsing Benchmark and Evaluation

MORE:一个多语言文档解析基准和评估

Long Xu, Binghong Wu, Tinghao Yu, Hao Feng, Zhenyu Huang, Haoqing Jiang, Yunhao Wang, Shuo Huang, Feng Zhang

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 研究针对多语言文档解析,现有基准侧重高资源语言。为此引入MORE基准,其具规模大、结构复杂、数据真实的特点,用它评估模型,为长尾语言建性能基线并验证基准有效性。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026). 22 pages, 11 figures. Code and dataset available at https://github.com/zimoqingfeng/MORE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02569 2026-07-07 cs.CV cs.LG 新提交 57%

Uncertainty-Aware Last-Layer Adaptation of RETFound for Referable Diabetic Retinopathy Screening Under Dataset Shift

数据集偏移下用于可参考糖尿病视网膜病变筛查的RETFound不确定性感知最后一层自适应

Karim Mardhani

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 用RETFound对糖尿病视网膜病变筛查的不确定性感知最后一层自适应进行以安全为中心的实证评估,比较多种方法,在APTOS上不确定性感知操作点改善了敏感性等,在DDR上结果有差异,强调安全评估的价值。

Comments 12 pages, 8 tables, 6 figures. Code available at https://github.com/kmardhani/uncertainty-aware-retfound

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01813 2026-07-03 cs.CV cs.AI 新提交 57%

MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models

MMBench-Live:一个持续演进的多模态模型基准

Yuanzhi Liu, Shousheng Zhao, Bo Zhou, Kongming Liang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) PRIS-CV

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出MMBench-Live,一个通过多智能体自动化流水线构建的持续演进多模态基准,解决静态基准的时效性、数据污染和维护成本问题,采用分布一致性更新策略,每次更新成本约30美元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01751 2026-07-03 cs.CV cs.AI 新提交 57%

MedStreamBench: A Time-Aware Benchmark for Streaming and Proactive Medical Video Understanding

MedStreamBench: 面向流式与主动式医疗视频理解的时间感知基准

Yuan Wang, Shujian Gao, Songtao Jiang, Zhengyu Hu, Zuozhu Liu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出MedStreamBench基准,通过时间受限证据窗口和主动监控设置,评估模型在流式与主动式医疗视频理解中的回答时机与正确性,发现离线识别与时间感知决策间存在显著差距。

Comments 10 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01517 2026-07-03 cs.CL 新提交 57%

Parameter Golf: What Really Works?

参数高尔夫:什么真正有效?

Prashanna Mani Paudel, Shivanand Venkanna Sheshappanavar

机构 * Geometric Intelligence Research Lab., Department of Electrical Engineering and Computer Science University of Wyoming(几何智能研究实验室,电气与计算机科学系,怀俄明大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 通过分析社区竞赛中的2037个拉取请求和1430个评分提交,构建84种优化技术分类,测量每种技术对bits-per-byte的贡献,发现大多数技术收益在竞争提交中缩小,仅少数方法能持续提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00218 2026-07-02 cs.CV cs.AI 新提交 57%

EgoSafetyBench: A Diagnostic Egocentric Video Benchmark for Evaluating Embodied VLMs as Runtime Safety Guards

EgoSafetyBench:用于评估具身VLM作为运行时安全卫士的诊断性自我中心视频基准

Siddhant Panpatil, Arth Singh, Mijin Koo, Chaeyun Kim, Haon Park, Dasol Choi

机构 * AIM Intelligence(AIM智能研究所) Seoul National University(首尔国立大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出EgoSafetyBench,一个包含1200个机器人视角场景的自我中心视频基准,用于评估视觉语言模型在流式安全监控中的能力,通过情景和视觉通道两个轨道测试模型识别危险和应对误导性文本的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00159 2026-07-02 cs.CL cs.CV cs.IR cs.MM 新提交 57%

Identifying and Resolving Pitfalls of Knowledge-Based VQA Benchmarks: Auditing, Repairing, and Augmenting

识别和解决基于知识的VQA基准测试中的陷阱:审计、修复与增强

Qian Ma, S M Rayeed, Charles V. Stewart, Qiong Wu, Yao Ma

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) AT&T Chief Data Office(AT&T首席数据办公室)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文审计现有KB-VQA基准测试,发现答案缺失/矛盾、问题不明确和视觉场景简单等系统性问题,导致准确率指标误导模型排名;提出审计-修复协议和多重实体增强协议,重新评估后性能趋势显著变化。

Comments Accepted to ECCV 2026. The datasets and code are available in https://github.com/VAN-QIAN/ECCV26-ARA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30902 2026-07-01 q-bio.BM cs.CE cs.LG 新提交 57%

Structure-Regularized Interpretable TCR-Epitope Prediction

结构正则化的可解释TCR-表位预测

Jiarui Li, Zixiang Yin, Yunbei Zhang, Janet Wang, Samuel J. Landry, Zhengming Ding, Ramgopal R. Mettu

机构 * Department of Computer Science, Tulane University(杜兰大学计算机科学系) Department of Biochemistry and Molecular Biology, Tulane University School of Medicine(杜兰大学医学院生物化学与分子生物学系)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 提出TCR-SRIM模型,结合蛋白质语言模型嵌入与可解释接触原型,在TCR-XAI基准上实现最优预测性能和解释质量,并揭示生成结构对模型学习的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30686 2026-07-01 cs.RO cs.AI 新提交 57%

Position: Vision-Language-Action Models Cannot Be Verified to Perform Physical Reasoning

立场:视觉-语言-动作模型无法被验证执行物理推理

Taozhao Chen, Ian Manchester, Huaming Chen

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文指出基于预训练视觉-语言模型的VLA系统在机器人操作基准上的性能提升无法区分语义匹配与物理泛化,现有评估指标不能验证物理推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27876 2026-07-01 cs.CV cs.AI 新提交 57%

SpatialUAV: Benchmarking Spatial Intelligence for Low-Altitude UAV Perception, Collaboration, and Motion

SpatialUAV:低空无人机感知、协作与运动的空间智能基准

Haoyu Zhang, Meng Liu, Qianlong Xiang, Kun Wang, Yaowei Wang, Liqiang Nie

机构 * IEEE

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出SpatialUAV基准,包含4331个实例和14种任务类型,评估低空无人机在语义判别、空间关系、多视角协作及运动理解等方面的空间智能,发现现有模型在跨视角关联、结构化定位、几何推理和时间理解上远逊于人类。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22678 2026-07-01 cs.SE cs.AI 新提交 57%

RigorBench: Benchmarking Engineering Process Discipline in Autonomous AI Coding Agents

RigorBench: 自主AI编码代理中工程过程纪律的基准测试

Meher Bhaskar Madiraju, Meher Sai Preetam Madiraju

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 提出RigorBench基准,通过五个维度评估AI编码代理的过程纪律,实验表明结构化过程纪律使过程质量提升41%,结果正确性提升17%。

Comments 9 pages, 7 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27474 2026-06-29 cs.SE cs.AI 新提交 57%

Speculative Refinement: A Hybrid Autoregressive Diffusion Decoding Strategy and Its Behavior Across Benchmarks

推测性精炼:一种混合自回归扩散解码策略及其跨基准测试的行为

Aditi Gupta, Neel Mishra, Kushagra Trivedi, Pawan Kumar

机构 * IIIT Hyderabad

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出推测性精炼(SpecRef),一种无需训练的混合解码方法,通过熵引导选择性掩码从自回归草稿启动掩码扩散模型,并在六个基准上揭示代码基准的结构性混淆、精炼张力现象、似然与生成评估排名差异及后处理问题。

Comments 7 pages + 2 pages References

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27438 2026-06-29 cs.LG 新提交 57%

Unified Zero-Shot Time Series Forecasting: A Darts Foundation

统一零样本时间序列预测:Darts 基础模型

Zhihao Dai, Dennis Bader, Alain Gysi

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 针对基础模型接口碎片化问题,Darts 开发了统一 FoundationModel 类集合,提供标准化全周期预测接口,实现零样本或微调预测、不确定性估计和回测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24320 2026-06-29 cs.SD cs.AI 新提交 57%

ZONOS2 Technical Report

ZONOS2 技术报告

Gabriel Clark, Sofian Mejjoute, Mohamed Osman, George Close, Beren Millidge

机构 * Zyphra

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 提出ZONOS2 8B TTS模型,通过MoE架构、6M小时训练数据和简化后训练配方,在自然度、韵律和声音克隆保真度上达到最先进水平。

Comments 15 pages, 7 figures, 7 tables. Technical report. Model weights, inference code, and the ZTTS1-Eval benchmark released under Apache 2.0. Code: https://github.com/Zyphra/ZONOS2 ; weights: https://huggingface.co/Zyphra/ZONOS2 ; benchmark: https://github.com/Zyphra/ZTTS1-Eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27282 2026-06-26 cs.LG 新提交 57%

How Good Can Linear Models Be for Time-Series Forecasting?

线性模型在时间序列预测中能有多好?

Lang Huang, Jinglue Xu, Luke Darlow

机构 * Sakana AI, Tokyo, Japan(Sakana AI,日本东京) National Institute of Informatics, Japan(日本国立信息学研究所)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 通过调整预处理(上下文长度、归一化、正则化、数据增强)而非扩大模型规模,Ridge回归在8个基准上超越Transformer、MLP和CNN,挑战了“更大容量带来更高精度”的假设。

Comments Project page: https://sakanaai.github.io/SearchCast/ 17 pages, 10 figures, and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27215 2026-06-26 cs.AI 新提交 57%

Vulnerability of Natural Language Classifiers to Evolutionary Generated Adversarial Text

自然语言分类器对进化生成的对抗文本的脆弱性

Manjinder Singh, Alexander E. I. Brownlee, Mohamed Elawady

机构 * University of Stirling(斯特灵大学) University of Strathclyde(斯特拉斯克莱德大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出GAversary混合遗传算法,仅利用模型logit输出作为黑盒,通过GloVe嵌入改进词替换的语义相似性,在多个基准数据集上显著降低目标模型准确率(最佳从76.8%降至5.8%),但扰动词数约为对比方法的两倍。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27187 2026-06-26 cs.CV cs.CL 新提交 57%

HarmVideoBench: Benchmarking Harmful Video Understanding in Large Multimodal Models

HarmVideoBench:大型多模态模型中有害视频理解的基准测试

Jiajun Wu, Haoyu Kang, Yining Sun, Jiacheng Hou, Heng Zhang, Danyang Zhang, Zhenjun Zhao, Haochi Zhang, Leixin Sun, Eric Hanchen Jiang, Yushan Li, Ruiyu Li, Mengkai Huang, Yan Gao, Xu Zhang, Guancheng Wan

机构 * Central South University(中南大学) Tsinghua University(清华大学) South China Normal University(华南师范大学) ByteDance Inc(字节跳动公司) University of Zaragoza(阿拉维达大学) CosmosMind Wuhan University(武汉大学) University of California, Los Angeles(加州大学洛杉矶分校) Southeast University(东南大学) Tencent(腾讯公司) Nankai University(南开大学) Supermicro Computer Inc(Supermicro计算机公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出HarmVideoBench,一个包含1379个视频和4137道选择题的多层次诊断基准,从三个维度评估模型对有害视频的深层理解,并引入BCR方法将宏平均准确率从61.7%提升至84.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26923 2026-06-26 cs.CL 新提交 57%

GAVEL: Grounded Caption Error Verification and Localization

GAVEL:基于视觉定位的标题错误验证与定位

Zixian Gao, Atsushi Hashimoto, Kuniaki Saito

机构 * OMRON SINIC X Corporation(欧姆龙SINIC X公司)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出GAVEL任务,联合解决图像-文本对的验证、解释和定位问题,构建数据集和基准,监督基线在定位和解释指标上持续改进。

Comments conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26535 2026-06-26 cs.CV cs.AI 新提交 57%

From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP

从幻觉到扎根:通过CRISP诊断视觉空间智能

Zhixing Li, Yinan Yu

机构 * Chalmers University of Technology(查尔姆斯理工大学)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 提出CRISP诊断范式,通过一致性评估解耦感知与推理,揭示闭源模型存在度量估计不准确和未利用隐式结构表示的问题,开源模型则受限于多跳组合推理能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26443 2026-06-26 cs.RO cs.AI cs.CV 新提交 57%

WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation

WatchAct: 行为引导的机器人操作基准

Baiqi Li, Ce Zhang, Yu Fang, Yue Yang, Shangzhe Li, Mingyu Ding, Gedas Bertasius

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出WatchAct基准,通过人类行为视频与指令配对,评估机器人对观察行为的推理能力,涵盖事件解析、程序推理、意图推断和情景记忆四个认知维度,实验显示现有系统性能远低于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25871 2026-06-25 cs.IR cs.AI 新提交 57%

AutoRelAnnotator: Calibrated Model Cascades for Cost-Efficient Relevance Evaluation in Sponsored Search

AutoRelAnnotator: 用于赞助搜索中成本高效的相关性评估的校准模型级联

Md Omar Faruk Rokon, Shasvat Desai, Hong Yao, Kuang-chih Lee

机构 * Walmart Global Tech(沃尔玛全球科技)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 提出校准模型级联方法,通过路由查询至逐步增大的微调分类器,在保持高准确率的同时降低计算成本,实现大规模离线相关性标注。

Comments Accepted at E-commerce workshop, SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25306 2026-06-25 cs.CV cs.AI 新提交 57%

Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation

物理问题场景图:文本到视频生成中物理合理性的细粒度评估

Atin Pothiraj, Jaemin Cho, Yue Zhang, Elias Stengel-Eskin, Mohit Bansal

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) AI2(艾伦人工智能研究所) Johns Hopkins University(约翰霍普金斯大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出物理问题场景图(PQSG),一种基于层次化问题的评估流程,通过图结构问题检查视频在对象、动作和物理规律上的忠实度,实现细粒度评估。

Comments ECCV 2026. Code and data: https://github.com/atinpothiraj/pqsg

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25246 2026-06-25 cs.CV cs.CL 新提交 57%

Multilingual Hematology Visual Question Answering Dataset

多语言血液学视觉问答数据集

Hajra Malik, Hafiza Tooba Aftab, Abdul Rehman, Mohsen Ali, Waqas Sultani

机构 * Information Technology University, Lahore(拉合尔信息技术大学) King Edward Medical University, Lahore(拉合尔爱德华国王医科大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 针对医疗领域多语言视觉问答资源匮乏的问题,构建了双语(英语-乌尔都语)血液学VQA基准WBCMor VQA,包含11万问答对和2万细胞图像,并评估了多个开源视觉语言模型。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25761 2026-06-25 cs.LG math.OC 新提交 57%

Bridging Spherical Black-Box Optimizers

桥接球形黑箱优化器

Johannes Ackermann, Stefano Peluchetti

机构 * The University of Tokyo(东京大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 将进化策略、共识优化和积分优化统一为理论框架,通过引入混合优化器控制平坦偏好和模态,在连续控制和语言模型合并任务中提升性能与鲁棒性。

Comments Accepted for publication at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24648 2026-06-24 cs.SD cs.CL eess.AS 新提交 57%

ParaPairAudioBench: Paralinguistic Pairwise Audio Benchmark for LALM-as-a-Judge

ParaPairAudioBench: 面向LALM-as-a-Judge的副语言成对音频基准

Jisu Jeon, Seungyeon Jwa, Joosung Lee, Jinhyeon Kim, Woojin Chung, Hwiyeol Jo, Jeonghoon Kim, Jonghyun Choi, Soyoon Kim

机构 * Hongik University(弘益大学) Seoul National University(首尔大学) NAVER Cloud(NAVER云) KAIST(韩国科学技术院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出ParaPairAudioBench,包含5,175对音频,覆盖风格、语速、重音、年龄和性别五个副语言维度,用于评估大型音频语言模型作为评判者的可靠性,发现其与人类判断差距大且校准失败严重。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24515 2026-06-24 cs.AI cs.HC 新提交 57%

Reinforcement Learning for Computer-Use Agents with Autonomous Evaluation

基于自主评估的计算机使用智能体强化学习

Marta Sumyk, Oleksandr Kosovan

机构 * Ukrainian Catholic University(乌克兰天主教大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出利用视觉语言模型自主评估任务完成度作为奖励信号,并引入噪声校正方法,在多个桌面环境上提升计算机使用智能体的成功率。

Comments Accepted to the 4th International Workshop on Generalizing from Limited Resources in the Open World (GLOW @ IJCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24115 2026-06-24 cs.CV cs.AI 新提交 57%

A Benchmark for Hallucination Detection in VLMs for Gastrointestinal Endoscopy

胃肠内窥镜中视觉语言模型幻觉检测的基准测试

Aminu Lawal, Niyoj Oli, Sachin Acharya, Prashnna Gyawali, Maria Carmen Romano, Binod Bhattarai

机构 * University of Aberdeen(阿伯丁大学) Nepal Applied Mathematics and Informatics Institute for Research(尼泊尔应用数学与信息学研究所) West Virginia University(西弗吉尼亚大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 针对胃肠内窥镜领域,在Gut-VLM数据集上基准测试九种幻觉检测方法,发现白盒方法ReXTrust在所有五个视觉语言模型上AUC最高,平均领先19.5点。

Comments Accepted at the Medical Image Understanding and Analysis (MIUA) 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏