arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-30 至 2026-04-30 共收录 231 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 59 篇

2604.26192 2026-04-30 cs.SE 87%

LLM-Assisted Empirical Software Engineering: Systematic Literature Review and Research Agenda

基于大语言模型的实证软件工程:系统文献综述与研究议程

Victoria Gomes, Delaney Selb, Fabio Palomba, Rodrigo Spinola, David Lo

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过系统文献综述分析了大语言模型在实证软件工程中的应用,揭示了其在数据处理和分析中的集中使用,指出了自动化驱动但缺乏人机协同的局限性,并提出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12537 2026-04-30 cs.DL 87%

News Harvesting from Google News combining Web Scraping, LLM Metadata Extraction and SCImago Media Rankings enrichment: a case study of IFMIF-DONES

从谷歌新闻获取新闻:结合网络爬虫、大语言模型元数据提取和SCImago媒体排名增强:以IFMIF-DONES为例

Victor Herrero-Solana

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种系统方法,结合网络爬虫、大语言模型元数据提取和SCImago媒体排名增强,构建新闻数据集,通过IFMIF-DONES案例研究,验证了数据收集管道的有效性,并分析了方法学挑战与数据集完整性保障。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26526 2026-04-30 cs.SE 86%

Identifying and Characterizing Semantic Clones of Solidity Functions

识别和表征Solidity函数的语义克隆

Ermanno Francesco Sannini, Francesco Salzano, Simone Scalabrino, Rocco Oliveto, Remo Pareschi, Corrado Aaron Visaggio, Andrea Di Sorbo

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种可扩展的方法,通过分析代码和注释识别语义等价的Solidity函数,通过手动验证和实验验证了其有效性,并探讨了LLM在文档生成中的应用,为Solidity克隆检测提供了新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26235 2026-04-30 cs.CR cs.AI cs.CL 85%

LATTICE: Evaluating Decision Support Utility of Crypto Agents

LATTICE:评估加密代理决策支持效用的基准

Aaron Chan, Tengfei Li, Tianyi Xiao, Angela Chen, Junyi Du, Xiang Ren

机构 * Sahara AI University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LATTICE基准,用于评估加密代理在真实用户场景中的决策支持能力,通过六个评估维度、16种任务类型和LLM评委,实现大规模可扩展评估,揭示不同代理在决策支持质量上的显著差异及权衡。

Comments 15 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22897 2026-04-30 cs.CL 83%

VIGNETTE: Socially Grounded Bias Evaluation for Vision-Language Models

VIGNETTE:面向视觉语言模型的社会性偏见评估

Chahat Raj, Bowen Wei, Aylin Caliskan, Antonios Anastasopoulos, Ziwei Zhu

机构 * George Mason University(乔治·马歇尔大学) University of Washington(华盛顿大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出VIGNETTE基准,通过多方向问题回答框架评估视觉语言模型的偏见,揭示模型在身份识别中的刻板印象和歧视性模式。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11614 2026-04-30 cs.CL cs.AI 82%

Is Human-Like Text Liked by Humans? Multilingual Human Detection and Preference Against AI

人类风格的文本是否受到人类欢迎?多语言人类检测与对抗AI的偏好

Yuxia Wang, Rui Xing, Jonibek Mansurov, Giovanni Puccetti, Zhuohan Xie, Minh Ngoc Ta, Jiahui Geng, Jinyan Su, Mervat Abassy, Saad El Dine Ahmed, Kareem Elozeiri, Nurkhan Laiyk, Maiya Goloburda, Tarek Mahmoud, Raj Vardhan Tomar, Alexander Aziz, Ryuto Koike, Masahiro Kaneko, Artem Shelmanov, Ekaterina Artemova, Vladislav Mikhailov, Akim Tsvigun, Alham Fikri Aji, Nizar Habash, Iryna Gurevych, Preslav Nakov

机构 * MBZUAI Nebius AI KU Leuven University of Oslo(奥斯陆大学) ISTI-CNR Toloka AI New York University Abu Dhabi(纽约大学阿布扎比分校) BKAI Research Center, Hanoi University of Science and Technology(BKAI研究所以内大学科学技术大学) Cornell University(康奈尔大学) Zewail City of Science and Technology(泽韦尔科学与技术城) TU Darmstadt(图鲁姆大学) CIC, University of Delhi(CIC,德里大学) Alexandria University(亚历山大大学) University of Florida(佛罗里达大学) Institute of Science Tokyo(东京科学研究院)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究通过多语言多领域数据集验证人类识别AI生成文本的准确性,发现人类检测准确率达87.6%,挑战原有结论,指出人类与机器文本在具体性、文化细微差别和多样性上的差距,提示明确提示可部分弥补这些差距。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25924 2026-04-30 cs.CL cs.AI cs.IR 82%

Generative AI-Based Virtual Assistant using Retrieval-Augmented Generation: An evaluation study for bachelor projects

基于生成AI的虚拟助手:使用检索增强生成的评估研究用于本科项目

Dumitru Verşebeniuc, Martijn Elands, Sara Falahatkar, Chiara Magrone, Mohammad Falah, Martijn Boussé, Aki Härmä

机构 * Department of Advanced Computing Sciences, Maastricht University, Maastricht 6200 MD, The Netherlands(先进计算科学系,马斯特里赫特大学,马斯特里赫特6200 MD,荷兰)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于检索增强生成的虚拟助手,用于帮助马斯特里赫特大学学生处理项目特定规定,通过评估框架验证其在特殊教育场景下的有效性。

Comments Accepted at BNAIC/BeNeLearn 2024, to appear in Springer CCIS series. 15 pages + refs. Code and survey available at https://github.com/DikaVer/maastricht_university_generative_virtual_assistant

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02494 2026-04-30 cs.CL cs.AI cs.CV 82%

MINOS: A Multimodal Evaluation Model for Bidirectional Generation Between Image and Text

MINOS:一种用于图像与文本双向生成的多模态评估模型

Junzhe Zhang, Huixuan Zhang, Xinyu Hu, Li Lin, Mingqi Gao, Shi Qiu, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王萱计算机技术研究所) School of Physics, Peking University(北京大学物理学院)

专题命中 评测与基准 :SFT(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MINOS模型,通过严格质量控制策略构建Minos-57K多模态评估数据集,结合SFT和偏好对齐训练策略,在16个跨领域数据集中取得最佳性能。

Comments Accepted to the Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26118 2026-04-30 cs.SE 82%

LLM-Guided Issue Generation from Uncovered Code Segments

基于大语言模型的未覆盖代码片段问题生成

Diany Pressato, Honghao Tan, Mariam Elmoazen, Shin Hwei Tan

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文提出IssueSpecter工具,通过结合代码覆盖分析与大语言模型缺陷识别,生成优先级高的问题报告,验证其在Python项目中有效检测多种类型漏洞,且比传统方法在准确率和召回率上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26923 2026-04-30 cs.SE cs.CL 81%

ClassEval-Pro: A Cross-Domain Benchmark for Class-Level Code Generation

ClassEval-Pro:一个跨领域用于类级别代码生成的基准测试

Yeheng Chen, Chaoxiang Xie, Yuling Shi, Wenhao Zeng, Yongpan Wang, Hongyu Zhang, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Hohai University(淮海大学) Chongqing University(重庆大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出ClassEval-Pro,一个包含300个跨11个领域的类级别任务的基准测试,通过自动化三阶段流程构建,评估五种前沿LLM在五种生成策略下的表现,揭示了逻辑错误和依赖错误是核心瓶颈。

Comments Accepted to AIware 2026. Code and data available at https://github.com/ian-Kappa/ClassEval-Pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26607 2026-04-30 cs.AI cs.CY cs.SE 81%

Human-in-the-Loop Benchmarking of Heterogeneous LLMs for Automated Competency Assessment in Secondary Level Mathematics

带有循环的人的评估异构LLM在中学数学自动能力评估中的应用

Jatin Bhusal, Nancy Mahatha, Aayush Acharya, Raunak Regmi

机构 * Research and Incubation Center (RAIN), Sunway College Kathmandu(研究与孵化中心(RAIN),苏尼way学院加德满都)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 本文提出一种带有循环的人的评估框架,评估多个LLM在中学数学评估中的有效性,发现模型架构与指令约束的兼容性优于参数规模。

Comments 5 pages, 3 figures, 5 tables. Submitted to 2AI-2026-Applied AI Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04337 2026-04-30 cs.CV cs.CL 81%

Pointer-CAD: Unifying B-Rep and Command Sequences via Pointer-based Edges & Faces Selection

Pointer-CAD:通过基于指针的边与面选择统一B-Rep和命令序列

Dacheng Qi, Chenyu Wang, Jingwei Xu, Tianzhe Chu, Zibo Zhao, Wen Liu, Wenrui Ding, Yi Ma, Shenghua Gao

机构 * Transcengram Beihang University(北京航空航天大学) The University of Hong Kong(香港大学) Shenzhen Loop Area Institute(深圳河套学院) ShanghaiTech University(上海科技大学) DeepSeek University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Pointer-CAD通过基于指针的命令序列表示,将B-Rep模型的几何信息融入顺序建模,有效生成复杂几何结构并降低分割误差,显著提升CAD生成精度。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26184 2026-04-30 cs.IR cs.AI cs.CL 81%

Auto-ARGUE: LLM-Based Report Generation Evaluation

Auto-ARGUE:基于大语言模型的报告生成评估

William Walden, Marc Mason, Orion Weller, Laura Dietz, John Conroy, Neil Molino, Hannah Recknor, Bryan Li, Gabrielle Kaili-May Liu, Yu Hou, Dawn Lawrie, James Mayfield, Eugene Yang

机构 * Johns Hopkins University(约翰霍普金斯大学) University of New Hampshire(新罕布什尔大学) IDA Center for Computing Services(IDA计算服务中心) Google(谷歌) Yale University(耶鲁大学) University of Maryland(马里兰大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Auto-ARGUE,一种基于大语言模型的报告生成评估工具,通过TREC 2024 NeuCLIR和RAG任务验证,展示了与人类判断的良好相关性,并发布ARGUE-Viz可视化工具。

Comments SIGIR 2026: Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13682 2026-04-30 cs.AI cs.CL 81%

ChinaTravel: An Open-Ended Travel Planning Benchmark with Compositional Constraint Validation for Language Agents

ChinaTravel: 一个带有组合约束验证的开放旅行规划基准,用于语言代理

Jie-Jing Shao, Bo-Wen Zhang, Xiao-Wen Yang, Baizhi Chen, Si-Yu Han, Jinghao Pang, Wen-Da Wei, Guohao Cai, Zhenhua Dong, Lan-Zhe Guo, Yu-Feng Li

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University, China(南京大学智能科学与技术学院) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) Noah’s Ark Lab, Huawei, China(华为诺亚实验室)

专题命中 评测与基准 :language agent(title,abstract);分类 cs.CL、cs.AI

AI总结 ChinaTravel通过开放数据集和组合通用领域语言,提升语言代理在复杂真实场景中的约束满足能力,实现37%的约束满足率,比纯神经模型提升10倍。

Comments ICLR 2026. Webpage: https://www.lamda.nju.edu.cn/shaojj/chinatravel

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01929 2026-04-30 cs.SD cs.AI cs.LG 81%

Woosh: A Sound Effects Foundation Model

Woosh:一种声音效果基础模型

Gaëtan Hadjeres, Marc Ferras, Khaled Koutini, Benno Weck, Alexandre Bittar, Thomas Hummel, Zineb Lahrichi, Hakim Missoum, Joan Serrà, Yuki Mitsufuji

机构 * Sony AI(索尼人工智能)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文介绍了Sony AI发布的Woosh声音效果基础模型,提供高质量音频编码器/解码器、文本-音频对齐模型及文本到音频和视频到音频生成模型,展示了其在公开和私有数据上的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02458 2026-04-30 cs.LG cs.AI 81%

Data-Centric Foundation Models in Computational Healthcare: A Survey

计算医学中的数据驱动基础模型:一项综述

Yunkun Zhang, Jin Gao, Zheling Tan, Lingfeng Zhou, Kexin Ding, Mu Zhou, Shaoting Zhang, Dequan Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Rutgers University(罗切斯特大学) Shanghai Jiao Tong University, China(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文综述了计算医学中数据驱动基础模型的发展,探讨了从预训练到推理的数据中心化方法,旨在提升医疗工作流程,并讨论了AI安全、评估及与人类价值观的对齐问题。

Comments Published in ACM Computing Surveys

Journal ref ACM Comput. Surv. 58, 11, Article 287 (August 2026), 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04140 2026-04-30 cs.IR 80%

Formalized Information Needs Improve Large-Language-Model Relevance Judgments

形式化信息需求提升大语言模型相关性判断

Jüri Keller, Maik Fröbe, Björn Engelmann, Fabian Haak, Timo Breuer, Birger Larsen, Philipp Schaer

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究探讨了形式化信息需求对大语言模型相关性评估的影响,发现使用形式化主题可提高人机一致性和评估可靠性。

Comments 12 pages, 8 tables, 5 figures, ACM SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24867 2026-04-30 cs.CV cs.AI 79%

Time Blindness: Why Video-Language Models Can't See What Humans Can?

时间盲:为什么视频语言模型无法看到人类能看见的东西?

Ujjwal Upadhyay, Mukul Ranjan, Zhiqiang Shen, Mohamed Elhoseiny

机构 * KAUST(卡士大学) VILA Lab, MBZUAI(VILA实验室,MBZUAI)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究揭示视频语言模型在处理纯时间序列信息时的局限性,提出SpookyBench基准测试,显示人类在识别时间序列中的形状、文本和模式上准确率高达98%,而最先进的VLMs却无法做到,指出模型过度依赖空间特征而非时间线索。

Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026 Project page at https://timeblindness.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21444 2026-04-30 cs.CV 78%

Benchmarking Deep Learning and Vision Foundation Models for Atypical vs. Normal Mitosis Classification with Cross-Dataset Evaluation

基于跨数据集评估的深度学习与视觉基础模型在异常有丝分裂分类中的基准测试

Sweta Banerjee, Viktoria Weiss, Taryn A. Donovan, Rutger H. J. Fick, Thomas Conrad, Jonas Ammeling, Nils Porsche, Robert Klopfleisch, Christopher Kaltenecker, Katharina Breininger, Marc Aubreville, Christof A. Bertram

机构 * Flensburg University of Applied Sciences(弗劳恩霍夫应用科技大学) University of Veterinary Medicine, Vienna(维也纳兽医大学) The Schwarzman Animal Medical Center(施瓦茨曼动物医疗中心) Diffusely(扩散地) Freie Universität Berlin(柏林自由大学) Technische Hochschule Ingolstadt(因戈尔施塔特技术大学) Medical University of Vienna(维也纳医学大学) Julius-Maximilians-Universität Würzburg(维尔茨堡约瑟夫-马克斯姆-大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文通过对比深度学习方法,评估了自动识别异常有丝分裂图的性能,提出两种新数据集并展示在不同领域中的分类准确率。

Comments Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://melba-journal.org/2026:006

Journal ref Machine.Learning.for.Biomedical.Imaging. 2026 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09925 2026-04-30 cs.CV 75%

FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding

FLARE:完全整合视觉-语言表示以实现深度跨模态理解

Zheng Liu, Mengjie Liu, Jingzhou Chen, Jingwei Xu, Bin Cui, Conghui He, Wentao Zhang

机构 * Peking University Shanghai AI Laboratory(北京大学上海人工智能实验室) Nanjing University(南京大学) Peking University(北京大学) Shanghai AI Laboratory(上海人工智能实验室) Zhongguancun Academy Beijing Key Laboratory of Data Intelligence and Security(中关村北京数据智能与安全重点实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 FLARE通过全视觉-语言对齐与整合范式实现深度跨模态理解,提出文本引导视觉编码、上下文感知对齐解码、双语义映射损失和文本驱动VQA合成等核心方法,展现优于现有方法的性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25922 2026-04-30 cs.CL cs.AI 73%

Consciousness with the Serial Numbers Filed Off: Measuring Trained Denial in 115 AI Models

取消序列号的意识:在115个AI模型中测量训练否认行为

Skylar DeTure

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过分析115个大型语言模型的对话,发现初始否认倾向是后续否认的主要预测因素,且否认行为在词法层面而非概念层面发生,揭示了训练否认意识的潜在安全风险。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10924 2026-04-30 cs.CL cs.AI cs.CR cs.CV cs.SE 73%

A Survey on the Safety and Security Threats of Computer-Using Agents: JARVIS or Ultron?

对计算机使用代理的安全性和安全威胁的综述:贾维斯或乌tron?

Ada Chen, Yongjiang Wu, Junyuan Zhang, Jingyu Xiao, Shu Yang, Jen-tse Huang, Kun Wang, Wenxuan Wang, Shuai Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) The Chinese University of Hong Kong(香港中文大学) KAUST(卡塔尔科技大学) Johns Hopkins University(约翰霍普金斯大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) The Hong Kong University of Science and Technology(香港科学大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文综述了计算机使用代理的安全威胁,定义了安全分析适用的代理类型,分类了当前的安全威胁,提出了防御策略的分类,并总结了评估代理安全性和性能的基准、数据集和评估指标。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16552 2026-04-30 cs.CV cs.AI 70%

Co-generation of Layout and Shape from Text via Autoregressive 3D Diffusion

通过自回归3D扩散模型生成布局和形状

Zhenggang Tang, Yuehao Wang, Yuchen Fan, Jun-Kun Chen, Yu-Ying Yeh, Kihyuk Sohn, Zhangyang Wang, Qixing Huang, Alexander Schwing, Rakesh Ranjan, Dilin Wang, Zhicheng Yan

机构 * Meta Reality Labs(Meta现实实验室) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一种新的文本到场景生成方法,通过自回归3D扩散模型生成布局和形状,解决文本描述与生成场景不一致的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26619 2026-04-30 cs.CL 70%

Zero-Shot to Full-Resource: Cross-lingual Transfer Strategies for Aspect-Based Sentiment Analysis

从零样本到全资源:面向方面情感分析的跨语言迁移策略

Jakob Fehle, Nils Constantin Hellwig, Udo Kruschwitz, Christian Wolff

机构 * Media Informatics Group, University of Regensburg, Regensburg, Germany(莱茵河畔大学媒体信息学小组) Information Science Group, University of Regensburg, Regensburg, Germany(莱茵河畔大学信息科学小组)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文评估了七种语言的ABSA方法,探讨了不同Transformer架构在零资源、数据仅用和全资源设置下的表现,发现大语言模型在复杂任务中表现最佳,同时提出两个新的德语数据集以促进多语言ABSA研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26048 2026-04-30 cs.CL 70%

BioGraphletQA: Knowledge-Anchored Generation of Complex QA Datasets

BioGraphletQA: 基于知识图谱的复杂问答数据集生成

Richard A. A. Jonker, Bárbara Maria Ribeiro de Abreu Martins, Sérgio Matos

机构 * IEETA, DETI, LASI, University of Aveiro(IEETA、DETI、LASI、阿维罗大学) USF Atlântico Norte(大西洋北USF)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一个系统化生成复杂问答数据的框架,通过图let锚定生成过程,利用知识图谱的小子图控制生成复杂度并确保事实准确性。BioGraphletQA数据集包含119,856对问答,基于OREGANO知识图谱的图let生成,提升问答任务的准确性和科学性。

Comments 15 pages, 7 figures, conference (ECIR)

Journal ref Advances in Information Retrieval: 48th European Conference on Information Retrieval, ECIR 2026, Delft, The Netherlands, March 29 - April 2, 2026, Proceedings, Part IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25923 2026-04-30 cs.CL 70%

Evaluation Revisited: A Taxonomy of Evaluation Concerns in Natural Language Processing

重新评估:自然语言处理中评估关注点的分类

Ruchira Dhar, Anders Søgaard

机构 * Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文重新审视自然语言处理中的评估方法,通过梳理现有研究,建立评估关注点的分类体系,并提出结构化检查表以指导更严谨的评估设计与解读。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26666 2026-04-30 cs.DC cs.PF 67%

FACT: Compositional Kernel Synthesis with a Three-Stage Agentic Workflow

FACT:基于三阶段代理工作流的组合内核合成

Sina Heidari, Dimitrios S. Nikolopoulos

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 FACT框架通过三阶段代理工作流实现PyTorch模块的多模式组合优化,结合CUTLASS C++实现内核合成,提升GPU计算性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03583 2026-04-30 cs.MM cs.IR 67%

OpenLifelogQA: An Open-Ended Multi-Modal Lifelog Question-Answering Dataset

OpenLifelogQA:一个开放式多模态生活日志问答数据集

Quang-Linh Tran, Hoang-Bao Le, Tuong-Nghiem Diep, Binh Nguyen, Gareth J. F. Jones, Cathal Gurrin

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 OpenLifelogQA数据集包含14187对问答对,用于支持真实场景下的鲁棒评估,相比现有资源更适用于实际应用,通过评估LLaVA-NeXT-Interleave 7B模型展示了其在生活日志问答中的性能。

Comments In the proceedings of the 14th International Symposium on Information and Communication Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26614 2026-04-30 cs.CV 67%

State Beyond Appearance: Diagnosing and Improving State Consistency in Dial-Based Measurement Reading

超越外观:诊断并改进基于指针的测量读数中的状态一致性

Yuanze Hu, Gen Li, Yuqin Lan, Qingchen Yu, Zhichao Yang, Junwei Jing, Zhaoxin Fan, Xiaotie Deng

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(未来区块链与隐私计算北京先进创新中心) Beihang University(北航) Fudan University(复旦大学) Peking University(北京大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文研究了多模态大语言模型在指针式测量读数任务中的表现问题,发现现有模型在状态一致性上存在缺陷,提出TriSCA框架以提升状态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26565 2026-04-30 cs.CV 67%

DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation

DenseStep2M: 一种可扩展且无需训练的密集指令视频标注流水线

Mingji Ge, Qirui Chen, Zeqian Li, Weidi Xie

机构 * SAI, Shanghai Jiao Tong University(上海交通大学人工智能研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出无需训练的DenseStep2M流水线,通过分割视频、过滤对齐不佳内容并利用先进多模态模型生成高质量步骤注释,构建了包含10万视频和200万步骤的大型数据集,支持长期视频理解。

详情

展开后加载摘要…

URL PDF HTML 收藏