arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-20 至 2026-04-20 共收录 273 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 74 篇

2512.22278 2026-04-20 cs.CV 78%

FETAL-GAUGE: A Benchmark for Assessing Vision-Language Models in Fetal Ultrasound

FETAL-GAUGE:用于评估胎儿超声检查中视觉-语言模型的基准

Hussain Alasmawi, Numan Saeed, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出Fetal-Gauge基准,用于评估视觉-语言模型在胎儿超声检查中的性能,包含42000张图像和93000个问题-答案对,揭示当前模型在临床任务中的性能差距,强调需领域适应的架构和训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23536 2026-04-20 cs.CL 77%

IPQA: A Benchmark for Core Intent Identification in Personalized Question Answering

IPQA:个性化问答中核心意图识别的基准

Jieyong Kim, Maryam Amirizaniani, Soojin Yoon, Dongha Lee

机构 * Yonsei University(延世大学) University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 本文提出IPQA基准,用于评估个性化问答中用户优先的意图识别能力,揭示现有系统在复杂问题中识别核心意图的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15495 2026-04-20 cs.AI cs.CV cs.HC cs.RO 77%

GIST: Multimodal Knowledge Extraction and Spatial Grounding via Intelligent Semantic Topology

GIST:通过智能语义拓扑进行多模态知识提取与空间定位

Shivendra Agrawal, Bradley Hayes

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 GIST通过智能语义拓扑提取多模态知识,构建语义标注的导航拓扑,实现复杂环境中的空间定位与人类-AI交互任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16001 2026-04-20 cs.CR 75%

MATRIX: Multi-Layer Code Watermarking via Dual-Channel Constrained Parity-Check Encoding

MATRIX: 通过双通道约束奇偶校验编码实现多层代码水印

Yuqing Nie, Chong Wang, Guosheng Xu, Guoai Xu, Chenyu Wang, Haoyu Wang, Kailong Wang

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 MATRIX提出了一种新型代码水印框架,通过约束奇偶校验矩阵方程解决水印编码问题,采用变量命名和语义保持变换实现双通道水印,提升水印覆盖范围并增强鲁棒性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14388 2026-04-20 cs.CV 75%

FoodSense: A Multisensory Food Dataset and Benchmark for Predicting Taste, Smell, Texture, and Sound from Images

FoodSense:一个多感官食物数据集和基准,用于从图像预测味觉、嗅觉、触觉和声音

Sabab Ishraq, Aarushi Aarushi, Juncai Jiang, Chen Chen

机构 * College of Engineering and Computer Science, University of Central Florida(中央佛罗里达大学工程与计算机科学学院) College of Business Administration, University of Central Florida(中央佛罗里达大学商学院) Institute of Artificial Intelligence, University of Central Florida(中央佛罗里达大学人工智能研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出FoodSense数据集,包含66,842个参与者的图像对,用于预测多感官体验,通过图像接地推理轨迹训练模型,展示传统评估指标在视觉感官推断中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10261 2026-04-20 cs.AI cs.CL cs.LG 75%

The Amazing Agent Race: Strong Tool Users, Weak Navigators

令人惊叹的智能体竞赛:强大的工具使用者,薄弱的导航者

Zae Myung Kim, Dongseok Lee, Jaehyung Kim, Vipul Raheja, Dongyeop Kang

机构 * University of Minnesota Twin Cities(明尼苏达大学双城分校) Yonsei University(延世大学) Grammarly

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出AAR基准测试,通过有向无环图谜题评估智能体的导航与工具使用能力,发现线性基准无法检测到导航失误问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16138 2026-04-20 cs.CL cs.LG 73%

Sentiment Analysis of German Sign Language Fairy Tales

德语手语童话情感分析

Fabrizio Nunnari, Siddhant Jain, Patrick Gebhard

机构 * German Research Center for Artificial Intelligence (DFKI) Saarland Informatics Campus D3 2(德国人工智能研究中心(DFKI)萨尔兰信息学校园D3 2)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出用于德语手语童话情感分析的数据集和模型,通过四个大语言模型进行三类情感分析并采用多数投票达成0.781的Krippendorff's alpha一致性,利用MediaPipe提取面部和身体动作特征,训练可解释模型实现情感预测,结果显示平均平衡准确率为0.631。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07353 2026-04-20 cs.CL cs.AI cs.CV cs.CY cs.SI 73%

Toxic Memes: A Survey of Computational Perspectives on the Detection and Explanation of Meme Toxicities

有毒的迷因:计算视角下对迷因毒性的检测与解释的综述

Delfina Sol Martinez Pandiani, Erik Tjong Kim Sang, Davide Ceolin

机构 * organization= Centrum Wiskunde \& Informatica , addressline= Science Park 123 , city= Amsterdam , postcode= 1098 XG , country= The Netherlands organization= Netherlands eScience center , addressline= Science Park 402 , city= Amsterdam , postcode= 1098 XH , country= The Netherlands

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了计算视角下对迷因毒性的检测与解释的研究,识别了30多个数据集及毒性分类方法,提出了新的毒性分类体系,并探讨了跨模态推理、低资源语言处理等挑战。

Comments 39 pages, 12 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15628 2026-04-20 cs.CV cs.CL cs.IR cs.LG cs.MM 73%

SIMMER: Cross-Modal Food Image--Recipe Retrieval via MLLM-Based Embedding

SIMMER:通过基于MLLM的嵌入进行跨模态食物图像-食谱检索

Keisuke Gomi, Keiji Yanai

机构 * The University of Electro-Communications(电通大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出SIMMER,利用基于MLLM的嵌入模型VLM2Vec,通过统一编码器处理食物图像和食谱文本,设计定制化提示模板和数据增强策略,实现跨模态检索的高精度。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11698 2026-04-20 cs.CV cs.AI cs.CL 73%

OSCBench: Benchmarking Object State Change in Text-to-Video Generation

OSCBench:文本到视频生成中对象状态变化的基准测试

Xianjing Han, Bin Zhu, Shiqi Hu, Franklin Mingzhe Li, Patrick Carrington, Roger Zimmermann, Jingjing Chen

机构 * National University of Singapore(新加坡国立大学) Singapore Management University(新加坡管理大学) Carnegie Mellon University(卡内基梅隆大学) Fudan University(复旦大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出OSCBench基准,用于评估文本到视频模型在对象状态变化上的性能,揭示当前模型在处理新场景时的不足。

Comments ACL 2026 Main Conference, Project page: https://hanxjing.github.io/OSCBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00114 2026-04-20 cs.CV cs.AI cs.LG 73%

1S-DAug: One-Shot Data Augmentation for Robust Few-Shot Generalization

1S-DAug:一种用于鲁棒少样本泛化的单次数据增强

Yunwei Bai, Ying Kiat Tan, Yao Shu, Tsuhan Chen

机构 * National University of Singapore(新加坡国立大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :language model(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出1S-DAug,一种基于单例图像生成多样且忠实变体的生成增强算子,通过结合传统几何扰动、受控噪声注入和去噪扩散过程,提升少样本分类性能,实现在多个基准测试中提升20%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16505 2026-04-20 cs.HC cs.CL cs.LG 73%

Designing Synthetic Discussion Generation Systems: A Case Study for Online Facilitation

设计合成讨论生成系统:在线协调的案例研究

Dimitris Tsirmpas, Ion Androutsopoulos, John Pavlopoulos

机构 * Athens University of Economics and Business(雅典经济与商业大学) Archimedes, Athena Research Center(阿基米德,雅典研究中心)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出了一种理论框架,用于设计、评估和实现合成讨论模拟,展示小型量化模型在成本和性能上的优势,并探讨了在线协调中的应用及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16116 2026-04-20 cs.ET cs.AI cs.CY 70%

The Relic Condition: When Published Scholarship Becomes Material for Its Own Replacement

遗物条件:当已发表的学术成果成为自身替代的原材料

Lin Deng, Chang-bo Liu

机构 * University of New South Wales(新南威尔士大学) Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了通过提取学者的推理系统并将其转化为大语言模型的约束,测试学者机器人在学术功能中的表现,揭示了出版系统如何使推理架构成为可替代的原材料。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16054 2026-04-20 cs.CV cs.AI 70%

Mind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs

Mind's Eye:多模态大语言模型的视觉抽象、转换与组合基准

Rohit Sinha, Aditya Kanade, Sai Srinivas Kancheti, Vineeth N Balasubramanian, Tanuja Ganu

机构 * CSE Dept., IIT Hyderabad(IIT海得拉巴计算机科学与工程系) Microsoft Research(微软研究院) IIT Hyderabad(IIT海得拉巴)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Mind's Eye基准,通过A-R-T分类评估多模态大语言模型的视觉认知能力,发现人类准确率达80%,而顶级模型低于50%,揭示模型在视觉空间推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15994 2026-04-20 cs.AI 70%

ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams

ReactBench: 一种用于在化学反应图上进行拓扑推理的MLLMs基准测试

Qiang Xu, Shengyuan Bai, Yu Wang, He Cao, Leqing Chen, Yuanyuan Liu, Bin Feng, Zijing Liu, Yu Li

机构 * International Digital Economy Academy(国际数字经济学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ReactBench通过化学反应图揭示MLLMs在拓扑推理中的局限性,包含1618个专家标注的问答对,评估17种MLLMs显示锚定任务与整体结构推理任务存在超过30%的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15958 2026-04-20 cs.CR cs.CL 70%

A Case Study on the Impact of Anonymization Along the RAG Pipeline

RAG流水线中匿名化影响的案例研究

Andreea-Elena Bodea, Stephen Meisenbacher, Florian Matthes

机构 * Technical University of Munich School of Computation, Information(慕尼黑技术大学计算、信息与技术学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文通过实证研究分析RAG流水线中匿名化位置对隐私-效用权衡的影响,探讨匿名化在数据集和生成答案处的不同效果。

Comments 7 pages, 1 figure, 6 tables. Accepted to IWSPA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15802 2026-04-20 cs.CL 70%

CHOP: Chunkwise Context-Preserving Framework for RAG on Multi Documents

CHOP:多文档RAG中的分块上下文保留框架

Hyunseok Park, Jihyeon Kim, Jongeun Kim, Dongsik Yoon

机构 * HDC LABS(HDC实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CHOP通过分块相关性评估和上下文连续性决策模块,有效解决多文档检索中相似文档导致的检索混淆问题,提升检索准确性和知识库质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15663 2026-04-20 cs.SE cs.AI 70%

CodeMMR: Bridging Natural Language, Code, and Image for Unified Retrieval

CodeMMR:连接自然语言、代码和图像以实现统一检索

Jiahui Geng, Qing Li, Fengyu Cai, Fakhri Karray

机构 * MBZUAI Linköping University(林雪平大学) University of Groningen(格罗宁根大学) TU Darmstadt(图宾根大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出CodeMMR,通过指令式多模态对齐,将自然语言、代码和图像嵌入共享语义空间,实现跨模态和语言的强泛化,优于基线模型,并提升RAG中的代码生成精度与视觉 grounding。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15331 2026-04-20 cs.HC cs.AI cs.CY 70%

How people use Copilot for Health

人们如何使用Copilot进行健康咨询

Beatriz Costa-Gomes, Pavel Tolmachev, Eloise Taysom, Viknesh Sounderajah, Hannah Richardson, Philipp Schoenegger, Xiaoxuan Liu, Matthew M Nour, Seth Spielman, Samuel F. Way, Yash Shah, Michael Bhaskar, Harsha Nori, Christopher Kelly, Peter Hames, Bay Gross, Mustafa Suleyman, Dominic King

机构 * Microsoft AI(微软人工智能)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究通过分析50万条健康对话,构建了12类意图分类体系,揭示了健康查询的意图分布、主题演变及使用差异,发现健康咨询多涉及个人症状、他人健康及医疗系统导航问题。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10126 2026-04-20 cs.SE cs.AI 70%

MR-Coupler: Automated Metamorphic Test Generation via Functional Coupling Analysis

MR-Coupler:通过功能耦合分析实现自动化元形测试用例生成

Congying Xu, Hengcheng Zhu, Songqiang Chen, Jiarong Wu, Valerio Terragni, Shing-Chi Cheung

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Guangzhou HKUST Fok Ying Tung Research Institute(广州HKUST傅以刚研究所) University of Auckland(奥克兰大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MR-Coupler,通过源代码中易于获取的方法功能耦合关系自动构建元形关系并生成元形测试用例,有效提高了测试用例的有效性并减少误报。

Comments Note: Accepted by ACM International Conference on the Foundations of Software Engineering (FSE) 2026

Journal ref Proceedings of the ACM on Software Engineering, Volume 3, Article FSE206 (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11374 2026-04-20 cs.CL 70%

Reward Modeling for Scientific Writing Evaluation

科学写作评估的奖励建模

Furkan Şahinuç, Subhabrata Dutta, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab) Department of Computer Science and Hessian Center for AI (hessian.AI) Technical University of Darmstadt(普遍知识处理实验室(UKP实验室)计算机科学系海德堡人工智能中心(hessian.AI)达姆施塔特技术大学) Konrad Zuse School of Excellence in Learning and Intelligent Systems (ELIZA)(康拉德·祖斯卓越学习与智能系统学校(ELIZA))

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出高效的开源奖励模型,通过两阶段训练框架提升科学写作评估的准确性和鲁棒性,实现跨任务泛化和动态评分标准适应。

Comments Accepted to ACL 2026 (Main). Project page: https://ukplab.github.io/acl2026-expert-rm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21675 2026-04-20 cs.CL cs.CV cs.GR 70%

Is this chart lying to me? Automating the detection of misleading visualizations

这张图表在欺骗我吗?自动化检测误导性可视化

Jonathan Tonglet, Jan Zimny, Tinne Tuytelaars, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(普遍知识处理实验室(UKP实验室)、计算机科学系、图腾斯大学(TU Darmstadt)及应用网络安全国家研究中心ATHENE) Department of Electrical Engineering, KU Leuven(电子工程系、鲁文大学) Department of Computer Science, KU Leuven(计算机科学系、鲁文大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究提出Misviz基准测试集和合成数据集,用于自动化检测误导性可视化,发现该任务仍极具挑战性。

Comments Camera-ready version accepted at ACL 2026 Main conference. Code and data available at: https://github.com/UKPLab/acl2026-misviz

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15788 2026-04-20 cs.IR 67%

Scattered Hypothesis Generation for Open-Ended Event Forecasting

散点假设生成用于开放性事件预测

He Chang, Zhulin Tao, Lifang Yang, Xianglin Huang, Yunshan Ma

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出SCATTER框架,通过引入假设生成任务,将开放性事件预测从点预测扩展到散点预测,以生成更全面的假设集,提升事件预测的多样性和包容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15800 2026-04-20 cs.HC cs.AI cs.CL 62%

From Intention to Text: AI-Supported Goal Setting in Academic Writing

从意图到文本:支持学术写作的AI目标设定

Yueling Fan, Richard Lee Davis, Olga Viberg

机构 * Department of Media Technology and Interaction Design(媒体技术与交互设计系) KTH Royal Institute of Technology(皇家理工学院) Department of Digital Learning(数字学习系) Digital Futures(数字未来)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出WriteFlow,一种基于AI语音的写作助手,通过目标导向互动支持反思性学术写作。通过Wizard-of-Oz研究显示,WriteFlow通过支持迭代目标优化、维持目标与文本一致性及促进目标完成评估,提升了写作的元认知调节与反思。

Comments Accepted at AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15503 2026-04-20 cs.CL 57%

Brain Score Tracks Shared Properties of Languages: Evidence from Many Natural Languages and Structured Sequences

脑评分追踪语言的共享属性:来自多种自然语言和结构序列的证据

Jingnong Qu, Ashvin Ranjan, Shane Steinert-Threlkeld

机构 * University of Washington(华盛顿大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 研究通过训练语言模型并评估其脑评分表现,发现多种自然语言和结构化数据在脑评分上表现相似,表明模型能提取语言共性,但高评分不一定代表人类级处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10916 2026-04-20 cs.CV cs.AI 57%

ReXSonoVQA: A Video QA Benchmark for Procedure-Centric Ultrasound Understanding

ReXSonoVQA:面向以过程为中心的超声理解的视频问答基准

Xucheng Wang, Xiaoman Zhang, Sung Eun Kim, Ankit Pal, Pranav Rajpurkar

机构 * Harvard Medical School(哈佛医学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 ReXSonoVQA是一个包含514个视频片段和514个问题的视频问答基准,旨在评估动作-目标推理、artifact解决与优化及过程上下文与规划能力,测试VLMs在动态过程理解中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16170 2026-04-20 cs.CV cs.CE 50%

neuralCAD-Edit: An Expert Benchmark for Multimodal-Instructed 3D CAD Model Editing

neuralCAD-Edit:一个多模态指令引导的3D CAD模型编辑专家基准

Toby Perrett, Matthew Bouchard, William McCarthy

机构 * Autodesk Research(Autodesk研究院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出neuralCAD-Edit,首个基于专家CAD工程师采集的3D CAD模型编辑基准。通过捕捉专业设计师与CAD模型交互的视频,收集真实编辑请求,发现基础模型在自动指标和人工评估中均显著落后于CAD专家。

Comments Project page: https://autodeskailab.github.io/neuralCAD-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16099 2026-04-20 cs.CV 50%

DenTab: A Dataset for Table Recognition and Visual QA on Real-World Dental Estimates

DenTab:一个用于真实世界牙科估算表识别和视觉问答的数据集

Laziz Hamdi, Amine Tamasna, Thierry Paquet

机构 * LITIS, Normandy, France(诺曼底大学LITIS实验室) Malakoff Humanis, Paris, France(巴黎Malakoff Humanis机构)

专题命中 评测与基准 :language model(abstract)

AI总结 DenTab数据集包含2000张牙科估算表图像,用于评估表识别和视觉问答性能,包含2208个问题,涵盖检索、聚合和逻辑一致性检查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09530 2026-04-20 cs.CV 50%

DualTrack: Sensorless 3D Ultrasound needs Local and Global Context

DualTrack:无传感器3D超声需要局部和全局上下文

Paul F. R. Wilson, Matteo Ronchetti, Rüdiger Göbl, Viktoria Markova, Sebastian Rosenzweig, Raphael Prevost, Parvin Mousavi, Oliver Zettinig

机构 * Queen's University, Kingston, Canada(昆士兰大学) ImFusion GmbH, Munich, Germany(ImFusion GmbH)

专题命中 评测与基准 :foundation model(abstract)

AI总结 DualTrack提出了一种双编码器架构,通过解耦的局部和全局编码器分别提取特征,以提高无传感器3D超声的轨迹估计精度和3D重建一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15870 2026-04-20 cs.SE cs.DB 50%

QMutBench: A Dataset of Quantum Circuit Mutants

QMutBench:量子电路变体数据集

Eñaut Mendiluze Usandizaga, Thomas Laurent, Paolo Arcaini, Shaukat Ali

专题命中 评测与基准 :prompting(abstract)

AI总结 本文提出QMutBench数据集,包含70万+量子电路变体,用于评估量子软件测试技术的有效性及开发新测试方法。

详情

展开后加载摘要…

URL PDF HTML 收藏