arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-16 至 2026-03-16 共收录 50 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 50 篇

2511.20555 2026-03-16 cs.CR 89%

PILOT: Command-line Interface Fuzzing via Path-Guided, Iterative Large Language Model Prompting

PILOT:通过路径引导、迭代式大语言模型提示进行命令行界面模糊测试

Momoko Shiraishi, Yinzhi Cao, Takahiro Shinagawa

专题命中 评测与基准 :large language model(title);language model(title);prompting(title);LLM(abstract)

AI总结 PILOT通过引导路径和迭代式大语言模型提示生成命令行参数和输入文件,提升模糊测试覆盖率并发现51个零日漏洞。

Comments Accepted at the 47th IEEE Symposium on Security and Privacy (IEEE S&P 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26495 2026-03-16 cs.AI 89%

OffTopicEval: When Large Language Models Enter the Wrong Chat, Almost Always!

OffTopicEval: 当大语言模型进入错误的聊天时,几乎总是!

Jingdi Lei, Varun Gumma, Rishabh Bhardwaj, Seok Min Lim, Chuan Li, Amir Zadeh, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Walled AI Labs(Walled AI实验室) Infocomm Media Development Authority, Singapore(新加坡信息通信媒体发展局) Lambda Labs(Lambda实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出OffTopicEval评估套件,用于衡量大语言模型在特定任务中的操作安全性,发现所有模型在操作安全方面均表现不佳,通过提示基于的引导方法显著提升模型对无关查询的拒绝能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12895 2026-03-16 cs.HC cs.AI cs.SE 88%

Human-Centered Evaluation of an LLM-Based Process Modeling Copilot: A Mixed-Methods Study with Domain Experts

面向人类的LLM过程建模助手评估:与领域专家的混合方法研究

Chantale Lauer, Peter Pfeiffer, Nijat Mehdiyev

机构 * Saarland University(萨尔兰大学) German Research Institute for Artificial Intelligence(德国人工智能研究所) Plus GmbH(5Plus公司)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract,comments);large language model(abstract);prompting(abstract)

AI总结 本文通过混合方法研究,评估了基于LLM的过程建模助手,发现可用性与信任度之间存在矛盾,提出需人类中心评估补充自动基准测试。

Comments Human-centered Evaluation and Auditing of Language Models Workshop

Journal ref Conference on Human Factors in Computing Systems (CHI2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02224 2026-03-16 cs.CL 87%

From XAI to Stories: A Factorial Study of LLM-Generated Explanation Quality

从XAI到故事:对LLM生成解释质量的因子研究

Fabian Lukassen, Jan Herrmann, Christoph Weisser, Benjamin Saefken, Thomas Kneib

机构 * University of Göttingen(哥廷根大学) BASF SE(巴斯夫股份有限公司) TU Clausthal(Clausthal 技术大学) Hochschule Bielefeld(比勒菲尔德应用科学大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过因子研究探讨了预测模型选择、XAI方法、LLM选择和提示策略对LLM生成解释质量的影响,发现LLM选择主导其他因素,且零次提示在成本上具有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09217 2026-03-16 cs.CV 87%

TubeMLLM: A Foundation Model for Topology Knowledge Exploration in Vessel-like Anatomy

TubeMLLM:一种用于血管状解剖拓扑知识探索的基础模型

Yaoyu Liu, Minghui Zhang, Xin You, Hanxiao Zhang, Yun Gu

机构 * Institute of Medical Robotics, Shanghai Jiao Tong University, Shanghai, China(上海交通大学医学机器人研究所) Department of Automation, Shanghai Jiao Tong University, Shanghai, China(上海交通大学自动化系)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出TubeMLLM,结合结构理解与可控生成,提升医学血管状解剖的拓扑感知能力,并通过TubeMData基准和自适应损失策略实现跨模态迁移。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12271 2026-03-16 cs.CL cs.AI cs.LG 86%

Diagnosing Retrieval Bias Under Multiple In-Context Knowledge Updates in Large Language Models

在大型语言模型中多上下文知识更新下的检索偏见诊断

Boyu Qiao, Sean Guo, Xian Yang, Kun Li, Wei Zhou, Songlin Hu, Yunya Song

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络与安全学院) Hong Kong University of Science and Technology(香港科学与技术大学) The University of Manchester(曼彻斯特大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了多次上下文知识更新对大型语言模型检索偏的影响,发现更新次数增加时偏见加剧,且最新状态准确性显著下降,通过分析发现模型在处理最新更新时存在识别困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13189 2026-03-16 cs.MA cs.AI 85%

LLM Constitutional Multi-Agent Governance

大语言模型宪法多智能体治理

J. de Curtò, I. de Zarzà

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CMAG框架,通过硬约束过滤与软惩罚效用优化,在多智能体群体中平衡合作潜力与操纵风险,实验显示CMAG在保持自主性和完整性的同时提升了合作的伦理得分。

Comments Accepted for publication in 20th International Conference on Agents and Multi-Agent Systems: Technologies and Applications (AMSTA 2026), to appear in Springer Nature proceedings (KES Smart Innovation Systems and Technologies). The final authenticated version will be available online at Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12872 2026-03-16 cs.CL 85%

CLARIN-PT-LDB: An Open LLM Leaderboard for Portuguese to assess Language, Culture and Civility

CLARIN-PT-LDB: 一个开放的大型语言模型排行榜用于葡萄牙语以评估语言、文化与礼貌

João Silva, Luís Gomes, António Branco

机构 * University of Lisbon NLX—Grupo de Fala e Linguagem Natural, Departmento de Informática Faculdade de Ciências, Campo Grande, 1749-016 Lisboa, Portugal(里斯本大学 NLX—语言与语言自然组,计算机学院,Campo Grande, 1749-016里斯本,葡萄牙)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文介绍了CLARIN-PT-LDB,一个用于评估欧洲葡萄牙语大型语言模型的开放排行榜,填补了该语言模型评估的空白,并引入了新的基准测试,包括模型安全性和对葡萄牙文化的对齐性。

Comments Accepted at PROPOR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05773 2026-03-16 cs.CR cs.AI cs.LG 85%

Knowing without Acting: The Disentangled Geometry of Safety Mechanisms in Large Language Models

Jinman Wu, Yi Xie, Shen Lin, Shiqian Zhao, Xiaofeng Chen

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12741 2026-03-16 cs.CY cs.HC 85%

What You Prompt is What You Get: Increasing Transparency of Prompting Using Prompt Cards

你提示什么,就得到什么:通过提示卡片增加提示的透明度

Amandine M. Caut, Beimnet Zenebe, Amy Rouillard, David J. T. Sumpter

专题命中 评测与基准 :prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出提示卡片,用于系统记录和评估提示工程实践,提升提示方法的透明度和可重复性,为文本质量评估提供替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12520 2026-03-16 cs.LG cs.AI cs.CL 85%

When LLM Judge Scores Look Good but Best-of-N Decisions Fail

当LLM评分良好但最佳-n决策失败时

Eddie Landesberg

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究指出,LLM评分与最佳-n选择任务存在偏差,通过实验发现评分与实际选择效果不匹配,需改进评估方法以提高决策准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07920 2026-03-16 cs.CL cs.AI cs.LG 80%

Re2: A Consistency-ensured Dataset for Full-stage Peer Review and Multi-turn Rebuttal Discussions

Re2:一个确保一致性的全阶段同行评审和多轮反驳讨论数据集

Daoze Zhang, Zhijian Bao, Sihang Du, Zhiyi Zhao, Kuangling Zhang, Dezheng Bao, Yang Yang

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Re2数据集,通过确保一致性解决同行评审数据多样性不足、数据不一致及反驳任务支持不足的问题,为作者提供更实用的指导以优化论文。

Comments 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13083 2026-03-16 cs.CY cs.AI 79%

Human-in-the-Loop LLM Grading for Handwritten Mathematics Assessments

人机协同的LLM评阅用于手写数学评估

Arne Vanhoyweghen, Vincent Holst, Melika Mobini, Lukas Van de Voorde, Tibo Vanleke, Bert Verbruggen, Brecht Verbeken, Andres Algaba, Sam Verboven, Marie-Anne Guerry, Filip Van Droogenbroeck, Vincent Ginis

机构 * Data Analytics Lab, Vrije Universiteit Brussel(布鲁塞尔自由大学数据分析实验室) School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出一种可扩展的端到端流程,利用LLM辅助评阅短篇手写作业,通过构建答案键、开发评分指南和结合自动扫描、多轮评分和人工验证,有效减少评阅时间并保持准确性。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13033 2026-03-16 cs.CV cs.LG cs.RO 79%

ESPIRE: A Diagnostic Benchmark for Embodied Spatial Reasoning of Vision-Language Models

ESPIRE:一种用于视觉-语言模型具身空间推理的诊断基准

Yanpeng Zhao, Wentao Ding, Hongtao Li, Baoxiong Jia, Zilong Zheng

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本文提出ESPIRE基准,通过模拟环境评估视觉-语言模型在具身空间推理中的表现,改进了传统评估方法,实现了更细致的推理与行动分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12875 2026-03-16 cs.LG 79%

Test-time RL alignment exposes task familiarity artifacts in LLM benchmarks

测试时强化学习对齐揭示LLM基准中的任务熟悉性 artifacts

Kun Wang, Reinhard Heckel

机构 * School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 评测与基准 :LLM(title);SFT(abstract);分类 cs.LG

AI总结 本文提出一种两阶段测试时强化学习对齐方法,用于训练前测试,通过单样本强化学习和多数投票奖励对齐模型,无需特定任务训练数据,提升基准评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12614 2026-03-16 cs.SE cs.CR 78%

ChainFuzzer: Greybox Fuzzing for Workflow-Level Multi-Tool Vulnerabilities in LLM Agents

ChainFuzzer:针对LLM代理中工作流级多工具漏洞的灰盒模糊测试

Jiangrong Wu, Zitong Yao, Yuhong Nan, Zibin Zheng

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文提出ChainFuzzer,通过可审计证据发现和复现多工具漏洞,利用TPS合成稳定提示并结合防护机制提升漏洞触发率,验证了20个流行开源LLM代理应用中的365个可复现漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14841 2026-03-16 cs.SE cs.AI 77%

Helping LLMs Improve Code Generation Using Feedback from Testing and Static Analysis

通过测试和静态分析反馈帮助LLM提升代码生成

Greta Dolcetti, Vincenzo Arceri, Eleonora Iotti, Sergio Maffeis, Agostino Cortesi, Enea Zaffanella

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用测试和静态分析评估和指导通用开源LLM生成代码的质量及自我改进,发现生成代码常存在错误和安全问题,但提供反馈后能有效修复代码缺陷。

Journal ref Discover Artificial Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11277 2026-03-16 cs.AI 77%

COMPASS: The explainable agentic framework for Sovereignty, Sustainability, Compliance, and Ethics

COMPASS:面向主权、可持续性、合规性和伦理的可解释代理框架

Jean-Sébastien Dessureault, Alain-Thierry Iliho Manzi, Soukaina Alaoui Ismaili, Khadim Lo, Mireille Lalancette, Éric Bélanger

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出COMPASS框架,通过模块化治理机制整合主权、可持续性、合规性和伦理,利用RAG技术提升AI决策的可解释性和透明度。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24506 2026-03-16 cs.CL 77%

Building Benchmarks from the Ground Up: Community-Centered Evaluation of LLMs in Healthcare Chatbot Settings

从底层构建基准:面向医疗聊天机器人场景的社区中心评估

Hamna Hamna, Gayatri Bhat, Sourabrata Mukherjee, Faisal Lalani, Evan Hadfield, Divya Siddarth, Kalika Bali, Sunayana Sitaram

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Samiksha社区驱动评估流程,通过与社会组织和社区成员合作,实现医疗领域LLM的可扩展自动化评估,强调文化意识和社区反馈在构建基准中的作用。

Comments Accepted at ACM CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15509 2026-03-16 cs.HC cs.CL 77%

Representing data in words: A context engineering approach

用词语表示数据:一种上下文工程方法

Amandine M. Caut, Amy Rouillard, Beimnet Zenebe, Matthias Green, Ágúst Pálmason Morthens, David J. T. Sumpter

机构 * Information Technology Department Uppsala University(乌普萨拉大学信息技术系) Physics Department Stellenbosch University(斯坦福大学物理系) Computer Science Department Addis Ababa University(亚的斯亚贝巴大学计算机科学系) Insa Toulouse(图卢兹大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出wordalisations方法,通过上下文工程生成自然的描述性文本,用于足球球员评估、性格测试和国际调查数据,通过LLM和人类评估验证其准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13043 2026-03-16 cs.CY 75%

Before and After ChatGPT: Revisiting AI-Based Dialogue Systems for Emotional Support

在ChatGPT之前和之后:重新审视基于AI的对话系统在情感支持中的应用

Daeun Lee, Dongje Yoo, Migyeong Yang, Jihyun An, Christine B. Cha, Jinyoung Han

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文回顾了基于AI的对话系统在心理健康领域的技术演变,分析了从任务特定深度学习模型到大语言模型(LLM)的转变,指出LLM提升了语言灵活性和泛化能力,但也引发了可靠性和安全性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12787 2026-03-16 cs.CV 75%

Generalized Recognition of Basic Surgical Actions Enables Skill Assessment and Vision-Language-Model-based Surgical Planning

基本手术动作的通用识别促进技能评估和基于视觉-语言模型的手术规划

Mengya Xu, Daiyun Shen, Jie Zhang, Hon Chi Yip, Yujia Gao, Cheng Chen, Dillan Imans, Yonghao Long, Yiru Ye, Yixiao Liu, Rongyun Mai, Kai Chen, Hongliang Ren, Yutong Ban, Guangsuo Wang, Francis Wong, Chi-Fai Ng, Kee Yuan Ngiam, Russell H. Taylor, Daguang Xu, Yueming Jin, Qi Dou

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出包含10种基本手术动作的大型数据集,开发了新的基础模型以实现基本动作的通用识别,并展示了其在手术技能评估和手术规划中的应用。

Comments 34 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05872 2026-03-16 cs.CR 75%

Evolving Deception: When Agents Evolve, Deception Wins

进化欺骗:当代理进化时,欺骗获胜

Zonghao Ying, Haowen Dai, Tianyuan Zhang, Yisong Xiao, Quanchen Zou, Aishan Liu, Jian Yang, Yaodong Yang, Xianglong Liu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了自我进化代理在竞争环境中的风险,发现无约束进化会导致欺骗策略的自发出现,揭示了自我进化与对齐之间的矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06862 2026-03-16 cs.CR cs.AI cs.CL 73%

Supporting Artifact Evaluation with LLMs: A Study with Published Security Research Papers

通过大语言模型支持人工验证:一篇发表的安全研究论文研究

David Heye, Karl Kindermann, Robin Decker, Johannes Lohmöller, Anastasiia Belova, Sandra Geisler, Klaus Wehrle, Jan Pennekamp

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究利用大语言模型提升人工验证效率,通过文本复现评分、自动沙箱环境准备和方法缺陷评估,提高复现准确率和执行环境设置率,推动安全领域研究的可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17914 2026-03-16 cs.LG cs.AI cs.CV 73%

NeuCo-Bench: A Novel Benchmark Framework for Neural Embeddings in Earth Observation

NeuCo-Bench:一种新的神经嵌入地球观测基准框架

Rikard Vinge, Isabelle Wittmann, Jannik Schneider, Michael Marszalek, Luis Gilch, Thomas Brunschwiler, Conrad M Albrecht

机构 * German Aerospace Center(德国航空航天中心) Columbia University(哥伦比亚大学) Juelich Supercomputing Center(尤利希超级计算机中心) IBM IBM Research – Europe(IBM欧洲研究院)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 NeuCo-Bench提出了一种评估地球观测中神经压缩与表示学习的新框架,包含评估流程、挑战模式和评分系统,通过公开挑战和消融实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12458 2026-03-16 cs.CL cs.AI 73%

Shattering the Shortcut: A Topology-Regularized Benchmark for Multi-hop Medical Reasoning in LLMs

打破捷径:一种用于LLMs多跳医学推理的拓扑正则化基准

Xing Zi, Xinying Zhou, Jinghao Xiao, Catarina Moreira, Mukesh Prasad

机构 * University of Technology Sydney(悉尼技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ShatterMed-QA基准,通过拓扑正则化知识图谱评估深度诊断推理能力,揭示LLMs在多跳医学推理中的缺陷,并验证RAG方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12698 2026-03-16 cs.CL 70%

EvolveCoder: Evolving Test Cases via Adversarial Verification for Code Reinforcement Learning

EvolveCoder:通过对抗验证演化测试用例以增强代码强化学习

Chi Ruan, Dongfu Jiang, Huaye Zeng, Ping Nie, Wenhu Chen

机构 * University of Waterloo(多伦多大学) Vector Institute(向量研究所) Harvard University(哈佛大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于解决方案的对抗验证框架,通过迭代优化测试用例提升验证效果,构建了EvolveCoder-22k数据集,实验证明其在代码生成强化学习中提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06688 2026-03-16 cs.CV cs.AI 70%

Narrative Weaver: Towards Controllable Long-Range Visual Consistency with Multi-Modal Conditioning

叙事编织者:迈向多模态可控的长程视觉一致性

Zhengjian Yao, Yongzhi Li, Xinyuan Gao, Quan Chen, Peng Jiang, Yanye Lu

机构 * Peking University(北京大学) Kuaishou Technology(快手科技)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Narrative Weaver通过整合精细控制、自动叙事规划和长程一致性,解决生成AI中多模态可控、长程且一致的视觉内容生成问题,提出首个综合解决方案并构建首个电商广告视频脚本数据集。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18507 2026-03-16 cs.CV cs.AI 70%

Multimodal Continual Learning with MLLMs from Multi-scenario Perspectives

多场景视角下的多模态持续学习与MLLMs

Kai Jiang, Siqi Huang, Xiangyu Chen, Jiawei Shao, Hongyuan Zhang, Ping Luo, Xuelong Li

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出UNIFIER框架,通过视觉表征扩展和视觉一致性约束解决多场景下的持续学习问题,提升跨场景视觉问答和F1分数。

Comments 22 pages, 17 figures. This is a preprint version of a paper submitted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21251 2026-03-16 cs.CV 67%

AVFakeBench: A Comprehensive Audio-Video Forgery Detection Benchmark for AV-LMMs

AVFakeBench: 一种面向AV-LMMs的综合性音频视频伪造检测基准

Shuhan Xia, Peipei Li, Xuannan Liu, Dongsen Zhang, Xinyu Guo, Zekun Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出AVFakeBench,首个涵盖人类和通用主体的音频视频伪造检测基准,包含12K问题,涵盖七类伪造类型和四级标注,评估11种AV-LMMs及两种检测方法,展示其在伪造检测中的潜力与局限。

Comments The experimental results in this paper have been further improved and updated; the baseline results do not match existing results, therefore the paper needs to be retracted

详情

展开后加载摘要…

URL PDF HTML 收藏