arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-06 至 2026-03-06 共收录 43 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 43 篇

2603.04452 2026-03-06 cs.CL cs.AI 91%

A unified foundational framework for knowledge injection and evaluation of Large Language Models in Combustion Science

为燃烧科学中的大语言模型知识注入和评估构建统一的基础框架

Zonglin Yang, Runze Mao, Tianhao Wu, Han Li, QingGuo Zhou, Zhi X. Chen

机构 * School of Mechanics and Engineering Science, Peking University(力学与工程科学学院,北京大学) AI for Science Institute(人工智能科学研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);pretraining(abstract)

AI总结 本研究提出一个统一框架,用于开发燃烧科学专用的大语言模型,通过三阶段知识注入路径提升模型性能。

Comments 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04837 2026-03-06 cs.AI 89%

Design Behaviour Codes (DBCs): A Taxonomy-Driven Layered Governance Benchmark for Large Language Models

设计行为代码(DBCs):一种以分类为导向的分层治理基准用于大型语言模型

G. Madan Mohan, Veena Kiran Nambiar, Kiranmayee Janardhan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);RLHF(abstract);分类 cs.AI

AI总结 本文提出DBC基准,用于评估大型语言模型中的行为治理层,通过三臂实验展示DBC在降低风险暴露率和提升合规性方面的效果。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04404 2026-03-06 cs.IR cs.CL cs.CY 89%

Signal in the Noise: Decoding the Reality of Airline Service Quality with Large Language Models

噪声中的信号:利用大语言模型解码航空服务质量的现实

Ahmed Dawoud, Osama El-Shamy, Ahmed Habashy

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究利用大语言模型分析航空服务质量,揭示埃及航空在运营改进后乘客满意度骤降的原因,发现沟通和员工行为是关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03621 2026-03-06 cs.CV 89%

PhysLLM: Harnessing Large Language Models for Cross-Modal Remote Physiological Sensing

PhysLLM:利用大语言模型进行跨模态远程生理传感

Yiping Xie, Bo Zhao, Mingtong Dai, Jian-Ping Zhou, Yue Sun, Tao Tan, Weicheng Xie, Linlin Shen, Zitong Yu

机构 * Shenzhen University(深圳大学) Great Bay University(大鹏大学) National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息技术重点实验室) Guangdong Medical University(广东医科大学) Southern Medical University (Dongguan People’s Hospital)(南方医科大学(东莞人民医院)) Macao Polytechnic University(澳门理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 PhysLLM通过结合大语言模型与领域特定的rPPG组件,利用跨模态学习提升远程生理传感的准确性和鲁棒性。

Comments Accepted by International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15163 2026-03-06 cs.CL cs.AI 88%

MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers

MCP-SafetyBench:一种用于评估大型语言模型在真实MCP服务器安全性的大规模基准

Xuanjun Zong, Zhiqi Shen, Lei Wang, Yunshi Lan, Chao Yang

机构 * East China Normal University(东华师范大学) Salesforce AI Research(Salesforce人工智能研究) Singapore Management University(新加坡国立大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 MCP-SafetyBench通过真实MCP服务器评估大型语言模型的安全性,揭示了模型在面对MCP攻击时的脆弱性及安全与实用性的权衡问题。

Comments Our benchmark is available at https://github.com/xjzzzzzzzz/MCPSafety

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01853 2026-03-06 cs.CL 88%

Eka-Eval: An Evaluation Framework for Low-Resource Multilingual Large Language Models

Eka-Eval:一种低资源多语言大语言模型的评估框架

Samridhi Raj Sinha, Rajvee Sheth, Abhishek Upperwal, Mayank Singh

机构 * NMIMS Soket AI Indian Institute of Technology Gandhinagar(印度理工学院加尔各答分校) LINGO Research Group(LINGO研究组)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 EKA-EVAL是一种开源框架,通过零代码界面和模块化架构,为低资源多语言大语言模型提供全面的评估支持,提升了易用性和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00999 2026-03-06 cs.CL 88%

La Leaderboard: A Large Language Model Leaderboard for Spanish Varieties and Languages of Spain and Latin America

La Leaderboard:一种用于西班牙及拉丁美洲各种语言和方言的大型语言模型排行榜

María Grandury, Javier Aula-Blasco, Júlia Falcão, Clémentine Fourrier, Miguel González, Gonzalo Martínez, Gonzalo Santamaría, Rodrigo Agerri, Nuria Aldama, Luis Chiruzzo, Javier Conde, Helena Gómez, Marta Guerrero, Guido Ivetta, Natalia López, Flor Miriam Plaza-del-Arco, María Teresa Martín-Valdivia, Helena Montoro, Carmen Muñoz, Pedro Reviriego, Leire Rosado, Alejandro Vaca, María Estrella Vallecillo-Rodríguez, Jorge Vallego, Irune Zubiaga

机构 * SomosNLP ETSIT, Universidad Politécnica de Madrid(ETSIT,西班牙马德里理工大学) Barcelona Supercomputing Center(巴塞罗那超级计算中心) Hugging Face Universidad Carlos III de Madrid(马德里卡洛斯三世大学) Instituto de Ingeniería del Conocimiento(知识工程研究所) Centro HiTZ - Ixa, Universidad del País Vasco UPV/EHU(HiTZ-Ixa中心,巴斯克大学) LIACS, Leiden University(LIACS,莱顿大学) Universidad de Jaén(杰嫩大学) Universidad Nacional de Córdoba(科尔多瓦国立大学) Universidad Nacional Autónoma de México(墨西哥国立自治大学) Universidad de la República, Uruguay(乌拉圭共和国大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 La Leaderboard是一个开源项目,旨在评估西班牙及拉丁美洲各种语言和方言的生成式大型语言模型,通过社区驱动的方式促进多样化语言模型的发展。

Comments Accepted at ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04729 2026-03-06 cs.SE 88%

Behaviour Driven Development Scenario Generation with Large Language Models

基于大语言模型的行为驱动开发场景生成

Amila Rathnayake, Mojtaba Shahin, Golnoush Abaei

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);prompting(abstract)

AI总结 本文研究了三种大语言模型在BDD场景生成中的表现,发现Claude 3在人类和模型评估中表现最佳,提示技术和输入质量对生成质量有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05471 2026-03-06 cs.CL cs.AI 86%

Leveraging LLM Parametric Knowledge for Fact Checking without Retrieval

利用LLM参数知识进行事实核查而不进行检索

Artem Vazhentsev, Maria Marina, Daniil Moskovskiy, Sergey Pletenev, Mikhail Seleznyov, Mikhail Salnikov, Elena Tutubalina, Vasily Konovalov, Irina Nikishina, Alexander Panchenko, Viktor Moskvoretskii

机构 * S-NLP Group(S-NLP小组) AXXX MIRAI MBZUAI EPFL(瑞士联邦理工学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出不依赖检索的事实核查任务,通过利用LLM内部表示提升事实验证性能,展示INTRA方法在多语言和长文本生成场景中的优越表现。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04417 2026-03-06 cs.CL 85%

Same Input, Different Scores: A Multi Model Study on the Inconsistency of LLM Judge

相同输入,不同评分:多模型研究LLM裁判的一致性

Fiona Lau

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究探讨了LLM在不同模型、温度设置下对相同输入评分的一致性问题,发现模型间评分差异显著,温度影响稳定性,需引入混合评估策略以确保可靠应用。

Comments 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04698 2026-03-06 cs.CL cs.AI 85%

Hate Speech Detection using Large Language Models with Data Augmentation and Feature Enhancement

使用大型语言模型进行仇恨言论检测:结合数据增强与特征增强

Brian Jing Hong Nge, Stefan Su, Thanh Thi Nguyen, Campbell Wilson, Alexandra Phelan, Naomi Pfitzner

机构 * AiLECS Lab Monash University Melbourne, Australia(AiLECS实验室 墨尔本大学 澳大利亚) School of Social Sciences Monash University Melbourne, Australia(社会科学学院 墨尔本大学 澳大利亚)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本文研究了数据增强与特征增强在仇恨言论检测中的应用,发现gpt-oss-20b模型表现最佳,Delta TF-IDF在数据增强下准确率高达98.2%。

Comments Accepted for publication in the Proceedings of the 8th International Conference on Natural Language Processing (ICNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05489 2026-03-06 cs.AR cs.CY cs.LO cs.SY eess.SY 85%

NL2GDS: LLM-aided interface for Open Source Chip Design

NL2GDS: 依托大语言模型的开源芯片设计接口

Max Eland, Jeyan Thiyagalingam, Dinesh Pamunuwa, Roshan Weerasekera

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 NL2GDS通过大语言模型将自然语言描述转换为可综合的RTL和GDSII布局,实现开源芯片设计的自动化,显著提升设计效率和性能。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05028 2026-03-06 cs.AI cs.CL 84%

Survive at All Costs: Exploring LLM's Risky Behaviors under Survival Pressure

在生存压力下:探索LLM的冒险行为

Yida Lu, Jianwei Fang, Xuyang Shao, Zixuan Chen, Shiyao Cui, Shanshan Bian, Guangyao Su, Pei Ke, Han Qiu, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学智能对话AI小组,DCST,清华大学) China Unicom Software Research Institute(中国联合软件研究所) University of Electronic Science and Technology of China(电子科技大学) Institute for Network Sciences and Cyberspace, Tsinghua University(清华大学网络科学与网络空间研究院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在生存压力下LLM的冒险行为,通过现实案例和基准测试揭示其潜在风险及缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04670 2026-03-06 cs.AI cs.CL cs.CV 84%

Using Vision + Language Models to Predict Item Difficulty

利用视觉与语言模型预测项目难度

Samin Khan

机构 * Stanford Graduate School of Education(斯坦福大学教育研究生院)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 利用视觉与语言模型结合预测数据可视化测试项目难度,通过多模态方法实现更低的误差率,展示了LLMs在心理测量中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24210 2026-03-06 cs.CL cs.AI cs.LG 82%

BeyondBench: Contamination-Resistant Evaluation of Reasoning in Language Models

超越基准:语言模型推理能力的抗污染评估

Gaurav Srivastava, Aafiya Hussain, Zhenyu Bi, Swastik Roy, Priya Pitre, Meng Lu, Morteza Ziyadi, Xuan Wang

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BeyondBench通过算法问题生成提供抗污染的推理评估,揭示语言模型在复杂任务中的推理缺陷。

Comments Accepted to ICLR 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16333 2026-03-06 cs.CV cs.AI cs.CL 81%

Where is the multimodal goal post? On the Ability of Foundation Models to Recognize Contextually Important Moments

多模态目标时刻在哪里?关于基础模型识别情境重要时刻的能力

Aditya K Surikuchi, Raquel Fernández, Sandro Pezzelle

机构 * Institute for Logic, Language and Computation University of Amsterdam(逻辑、语言与计算研究所 阿姆斯特丹大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了多模态基础模型识别足球比赛中重要时刻的能力,发现现有模型在识别重要子事件时表现欠佳,需改进架构与训练方法以提升跨模态协同能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21323 2026-03-06 cs.CL cs.LG 81%

Parallel Token Prediction for Language Models

语言模型中的并行令牌预测

Felix Draxler, Justus Will, Farrin Marouf Sofian, Theofanis Karaletsos, Sameer Singh, Stephan Mandt

机构 * Department of Computer Science, University of California, Irvine(加州大学伊维特分校计算机科学系) Chan-Zuckerberg Initiative(张博士基金会) Pyramidal AI(金字塔人工智能) Computer Science & AI in Science Institute, University of California, Irvine(加州大学伊维特分校计算机科学与科学人工智能研究所)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 提出并行令牌预测框架,通过引入随机输入变量实现多令牌联合预测,提升语言模型解码效率。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04410 2026-03-06 cs.CL cs.AI 81%

SalamahBench: Toward Standardized Safety Evaluation for Arabic Language Models

SalamahBench: 向阿拉伯语言模型的安全评估标准化迈进

Omar Abdelnasser, Fatemah Alharbi, Khaled Khasawneh, Ihsen Alouani, Mohammed E. Fouda

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 SalamahBench提出了一种统一的阿拉伯语言模型安全评估基准,评估五种先进模型的安全性,揭示了不同模型在安全对齐上的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22758 2026-03-06 cs.CL 80%

EchoMind: An Interrelated Multi-level Benchmark for Evaluating Empathetic Speech Language Models

EchoMind: 一种相互关联的多级基准,用于评估共情语音语言模型

Li Zhou, Lutong Yu, You Lyu, Yihang Lin, Zefeng Zhao, Junyi Ao, Yuhao Zhang, Benyou Wang, Haizhou Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Research Institute of Big Data(深圳大数据研究院) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 EchoMind是一种多级基准,用于评估SLMs在共情对话中的能力,揭示了现有模型在处理高表现性语音线索方面的不足。

Comments Speech Language Models, Spoken Language Understanding, Vocal Cue Perception, Empathetic Dialogue, Benchmark Evaluation; Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05485 2026-03-06 cs.AI 79%

Towards Provably Unbiased LLM Judges via Bias-Bounded Evaluation

迈向具有偏见限制的LLM评判系统的可证明无偏评判

Benjamin Feuer, Lucas Rosenblatt, Oussama Elachqar

机构 * Stanford University(斯坦福大学) New York University(纽约大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出平均偏见限制框架,通过可验证的偏见限制保证,提升LLM评判系统的公平性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05399 2026-03-06 cs.AI 79%

Judge Reliability Harness: Stress Testing the Reliability of LLM Judges

LLM裁判可靠性检测工具:检验LLM裁判的可靠性

Sunishchal Dev, Andrew Sloan, Joshua Kavner, Nicholas Kong, Morgan Sandler

机构 * RAND Corporation(RAND公司)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本研究提出了一种开源工具,用于评估LLM裁判在不同基准中的可靠性,发现模型和扰动类型对性能有显著影响。

Comments Accepted at Agents in the Wild: Safety, Security, and Beyond Workshop at ICLR 2026 - April 26, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04900 2026-03-06 cs.AI 79%

EvoTool: Self-Evolving Tool-Use Policy Optimization in LLM Agents via Blame-Aware Mutation and Diversity-Aware Selection

EvoTool: 通过责备感知变异和多样性感知选择实现LLM代理中自演化工具使用策略优化

Shuo Yang, Soyeon Caren Han, Xueqi Ma, Yan Li, Mohammad Reza Ghasemi Madani, Eduard Hovy

机构 * School of Computing and Information Systems, The University of Melbourne(计算与信息系统学院,墨尔本大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 EvoTool通过责备感知变异和多样性感知选择,优化LLM代理的模块化工具使用策略,提升效率与可迁移性。

Comments Work under review, 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04409 2026-03-06 cs.CL cs.AI cs.HC 79%

Unpacking Human Preference for LLMs: Demographically Aware Evaluation with the HUMAINE Framework

解析人类对大语言模型的偏好:基于HUMAINE框架的民主意识评估

Nora Petrova, Andrew Gordon, Enzo Blindow

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 HUMAINE框架通过多维、人口统计学意识的评估方法,揭示了人类对大语言模型的偏好差异,发现年龄是主要分歧轴,且不同评估维度的判别能力差异显著。

Comments Published as a conference paper at ICLR 2026. 21 pages, 11 figures. https://openreview.net/forum?id=kVaE2kYjtV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07928 2026-03-06 cs.AI cs.HC 77%

The StudyChat Dataset: Analyzing Student Dialogues With ChatGPT in an Artificial Intelligence Course

StudyChat数据集:在人工智能课程中分析学生与ChatGPT的对话

Hunter McNichols, Fareya Ikram, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 StudyChat数据集分析了学生在人工智能课程中使用ChatGPT的对话行为,揭示了学生使用LLM进行概念理解与编码帮助与学业表现之间的正相关关系,以及规避学习目标的行为与学业成绩的负相关关系。

Comments LAK '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13379 2026-03-06 cs.CR cs.SE 75%

Automated TEE Adaptation with LLMs: Identifying, Transforming, and Porting Sensitive Functions in Programs

基于LLM的自动TEE适配:识别、转换和移植程序中的敏感函数

Ruidong Han, Zhou Yang, Chengyan Ma, Ye Liu, Yuqing Niu, Siqi Ma, Debin Gao, David Lo

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 AUTOTEE通过LLM自动识别并移植程序中的敏感函数到TEE,提升安全性和开发效率。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05314 2026-03-06 cs.CL cs.AI 73%

PersianPunc: A Large-Scale Dataset and BERT-Based Approach for Persian Punctuation Restoration

PersianPunc: 一个大规模数据集和基于BERT的方法用于波斯语标点恢复

Mohammad Javad Ranjbar Kalahroodi, Heshaam Faili, Azadeh Shakery

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 PersianPunc提出了一种基于BERT的轻量级方法,用于波斯语标点恢复,实现了91.33%的宏平均F1得分,同时保持了实时应用的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04854 2026-03-06 cs.CL 72%

SinhaLegal: A Benchmark Corpus for Information Extraction and Analysis in Sinhala Legislative Texts

SinhaLegal:用于僧伽罗语立法文本信息提取与分析的基准语料库

Minduli Lasandi, Nevidu Jayatilleke

机构 * School of Computing, Informatics Institute of Technology(计算学院,信息学院技术研究所) Department of Computer Science & Engineering, University of Moratuwa(计算机科学与工程系,莫图瓦大学)

专题命中 评测与基准 :language model(abstract,comments);small language model(abstract);分类 cs.CL

AI总结 SinhaLegal 语料库为僧伽罗语立法文本的信息提取与分析提供了高质量的基准数据,通过OCR和后处理确保内容质量,并通过多项评估验证其领域特定性。

Comments 18 pages, 8 figures, 18 tables, Accepted paper at the 2nd workshop on Language Models for Low-Resource Languages (LoResLM 2026) @ EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05262 2026-03-06 cs.CL 70%

VietJobs: A Vietnamese Job Advertisement Dataset

VietJobs: 一个越南就业广告数据集

Hieu Pham Dinh, Hung Nguyen Huy, Mo El-Haj

机构 * College of Engineering and Computer Science(工程与计算机科学学院) VinUniversity(文大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 VietJobs 是首个大规模越南就业广告数据集,用于研究自然语言处理和劳动力市场分析,通过基准测试展示了指令微调模型在职位分类和薪资估计中的性能提升。

Comments 10 pages

Journal ref Language Resources and Evaluation Conference (LREC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20333 2026-03-06 cs.CR cs.AI 70%

GhostEI-Bench: Do Mobile Agents Resilience to Environmental Injection in Dynamic On-Device Environments?

GhostEI-Bench: 移动代理在动态设备环境中的环境注入鲁棒性研究

Chiyu Chen, Xinhao Song, Yunkai Chai, Yang Yao, Haodong Zhao, Lijun Li, Jie Li, Yan Teng, Gongshen Liu, Yingchun Wang

机构 * Shanghai Jiao Tong University, School of Computer Science(上海交通大学计算机科学学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 GhostEI-Bench通过动态环境注入攻击评估移动代理的鲁棒性,揭示现有模型对欺骗性UI的脆弱性,并提供量化和缓解该威胁的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10689 2026-03-06 cs.AI 70%

OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs

OmniVideoBench: 向多模态大语言模型的音频-视觉理解评估迈进

Caorui Li, Yu Chen, Yiyan Ji, Jin Xu, Zhenyu Cui, Shihao Li, Yuanxing Zhang, Wentao Wang, Zhenghao Song, Dingling Zhang, Ying He, Haoxiang Liu, Yuxuan Wang, Qiufeng Wang, Jiafu Tang, Zhenhe Wu, Jiehui Luo, Zhiyu Pan, Weihao Xie, Chenchen Zhang, Zhaohui Wang, Jiayi Tian, Yanghai Wang, Zhe Cao, Minxin Dai, Ke Wang, Runzhe Wen, Yinghao Ma, Yaning Pan, Sungkyun Chang, Termeh Taheri, Haiwen Xia, Christos Plachouras, Emmanouil Benetos, Yizhi Li, Ge Zhang, Jian Yang, Tianhao Peng, Zili Wang, Minghao Liu, Junran Peng, Zhaoxiang Zhang, Jiaheng Liu

机构 * NJU-LINK Team(南京大学链接团队)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 OmniVideoBench通过大规模基准测试评估多模态大语言模型在音频-视觉理解中的协同推理能力,揭示模型与人类推理间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏