arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-23 至 2026-03-23 共收录 45 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 45 篇

2603.19247 2026-03-23 cs.CL cs.AI 90%

When Prompt Optimization Becomes Jailbreaking: Adaptive Red-Teaming of Large Language Models

当提示优化成为劫持:大型语言模型的自适应红队测试

Zafir Shamsi, Nikhil Chekuru, Zachary Guzman, Shivank Garg

机构 * Algoverse AI Research(Algoverse AI研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);small language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大型语言模型在对抗性提示优化下的安全性漏洞,通过自适应红队测试发现开源小模型的安全保障显著降低,表明静态评估无法准确反映真实风险。

Comments EACL SRW 2026, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13207 2026-03-23 cs.CR cs.AI cs.LG 90%

LISAA: A Framework for Large Language Model Information Security Awareness Assessment

LISAA:大型语言模型信息安全意识评估框架

Ofir Cohen, Gil Ari Agmon, Asaf Shabtai, Rami Puzis

机构 * Computer and Information Science Ben-Gurion University of the Negev(计算机与信息科学贝纳尔·戈里翁大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LISAA框架,用于评估大型语言模型的信息安全意识,通过100个真实场景测试其安全知识、态度和行为,揭示当前模型在信息安全方面的普遍漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20122 2026-03-23 cs.CR cs.AI 89%

Evolving Jailbreaks: Automated Multi-Objective Long-Tail Attacks on Large Language Models

进化式越狱:针对大语言模型的自动化多目标长尾攻击

Wenjing Hong, Zhonghua Rong, Li Wang, Feng Chang, Jian Zhu, Ke Tang, Zexuan Zhu, Yew-Soon Ong

机构 * School of Artificial Intelligence(人工智能学院) Brain-Inspired Technology Co.,Ltd(脑启发技术有限公司) Department of Computer Science and Engineering(计算机科学与工程系) Southern University of Science and Technology(南方科技大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出EvoJail框架,通过多目标进化搜索自动发现长尾分布攻击,提升对大语言模型安全性的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09833 2026-03-23 cs.LG 89%

ACT as Human: Multimodal Large Language Model Data Annotation with Critical Thinking

ACT作为人类:多模态大语言模型数据标注中的批判性思维

Lequan Lin, Dai Shi, Andi Han, Feng Chen, Qiuzheng Chen, Jiawen Li, Zhaoyang Li, Jiyuan Li, Zhenbang Sun, Junbin Gao

机构 * University of Sydney(悉尼大学) University of Cambridge(剑桥大学) Riken AIP(理化学研究所AIP分所) University of Adelaide(阿德莱德大学) ByteDance Australia(字节跳动澳大利亚)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文提出ACT标注框架,利用大语言模型作为评判者提高标注效率,通过批判性思维识别潜在错误,减少人工成本,提升标注质量。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19253 2026-03-23 cs.CL cs.AI 88%

A comprehensive study of LLM-based argument classification: from Llama through DeepSeek to GPT-5.2

基于大语言模型的论证分类全面研究:从Llama到DeepSeek到GPT-5.2

Marcin Pietroń, Filip Gampel, Jakub Gomułka, Andrzej Tomski, Rafał Olszowski

机构 * Faculty of Computer Science, Faculty of Humanities(计算机科学系,人文科学系) Institute of Mathematics Faculty of Humanities(人文科学学院数学研究所) University of Silesia(斯蒂利亚大学) AGH University of Krakow(克拉科夫AGH大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文评估了GPT-5.2、Llama 4和DeepSeek等先进大语言模型在Args.me和UKP等论证分类数据集上的性能,通过高级提示策略提升分类准确率和鲁棒性,但揭示了模型在提示稳定性、隐含批评检测等方面存在的系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19281 2026-03-23 cs.CL cs.AI cs.IR 87%

URAG: A Benchmark for Uncertainty Quantification in Retrieval-Augmented Large Language Models

URAG:一种用于检索增强大型语言模型不确定性量化的基准

Vinh Nguyen, Cuong Dang, Jiahao Zhang, Hoa Tran, Minh Tran, Trinh Chau, Thai Le, Lu Cheng, Suhang Wang

机构 * Uppsala University(乌普萨拉大学) University of Science, VNU-HCM(VNU-HCM大学) Indiana University(印第安纳大学) FPT Software, AI Center(FPT软件人工智能中心) The Pennsylvania State University(宾夕法尼亚州立大学) VNU University of Engineering(VNU工程大学) University of Illinois at Chicago(伊利诺伊大学芝加哥分校)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 URAG通过构建多选问答任务评估RAG系统在医疗、编程、科学、数学等领域的不确定性,揭示准确性与不确定性的关系及不同RAG方法的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19264 2026-03-23 cs.CL cs.AI 86%

Generative Active Testing: Efficient LLM Evaluation via Proxy Task Adaptation

生成主动测试:通过代理任务适应实现高效的LLM评估

Aashish Anantha Ramakrishnan, Ardavan Saeedi, Hamid Reza Hassanzadeh, Fazlolah Mohaghegh, Dongwon Lee

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Optum AI

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出生成主动测试(GAT),通过利用LLM作为代理任务,改进样本选择过程,减少估计误差40%,实现高效且经济的模型评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19668 2026-03-23 cs.CL 85%

Structured Prompting for Arabic Essay Proficiency: A Trait-Centric Evaluation Approach

结构化提示法在阿拉伯语作文能力评估中的应用:以特质为中心的评估方法

Salim Al Mandhari, Hieu Pham Dinh, Mo El-Haj, Paul Rayson

专题命中 评测与基准 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种新的提示工程框架,用于阿拉伯语特质特定的自动作文评分,利用大语言模型在零样本和少样本配置下进行评估。通过三种层次提示策略,指导模型评估如组织、词汇、发展和风格等语言能力特质。实验表明,结构化提示法在阿拉伯语自动作文评分中效果显著。

Comments 13 pages

Journal ref The Fifteenth biennial Language Resources and Evaluation Conference (LREC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19333 2026-03-23 cs.AR cs.AI 85%

POET: Power-Oriented Evolutionary Tuning for LLM-Based RTL PPA Optimization

POET:面向LLM的RTL PPA优化的功率导向进化调优

Heng Ping, Peiyu Zhang, Zhenkun Wang, Shixuan Li, Anzhe Cheng, Wei Yang, Paul Bogdan, Shahin Nazarian

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 POET通过差分测试生成测试平台和LLM驱动的进化机制,在保证功能正确性的同时实现RTL PPA优化,取得100%正确性、最佳功耗和竞争力的面积延迟改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05786 2026-03-23 cs.CV cs.AI 83%

How to Enable LLM with 3D Capacity? A Survey of Spatial Reasoning in LLM

如何使LLM具备3D能力?LLM中空间推理的综述

Jirong Zha, Yuxuan Fan, Xiao Yang, Chen Gao, Xinlei Chen

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guang Zhou)(香港科学与技术大学(广州))

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文综述了将LLM与3D空间理解结合的方法,提出分类体系,涵盖图像、点云和混合模态方法,并讨论了当前限制与未来研究方向。

Comments 9 pages, 5 figures

Journal ref IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18048 2026-03-23 cs.AI cs.SD eess.AS 83%

DEAF: A Benchmark for Diagnostic Evaluation of Acoustic Faithfulness in Audio Language Models

DEAF:用于音频语言模型声音忠实度诊断评估的基准

Jiaqi Xiong, Yunjia Qi, Qi Cao, Yu Zheng, Yutong Zhang, Ziteng Wang, Ruofan Liao, Weisheng Xu, Sichen Liu

机构 * University of Oxford(牛津大学) XJTLU HNU(湖南大学) CUHK(SZ)(香港中文大学(深圳)) PKU(北京大学) HKUST(GZ)(香港科技大学(广州))

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 DEAF基准通过2700多个冲突刺激,评估音频语言模型对声音信号的真实处理能力,揭示模型在语音基准测试中的表现与真实声音理解间的差距。

Comments 14 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19744 2026-03-23 cs.CL 77%

Rethinking Ground Truth: A Case Study on Human Label Variation in MLLM Benchmarking

重新审视真实标签:在大语言模型基准测试中的人类标签变异案例研究

Tomas Ruiz, Tanalp Agustoslu, Carsten Schwemmer

机构 * Bavarian Research Institute for Digital Transformation(巴伐利亚数字转型研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨了人类标注差异对大语言模型基准测试的影响,发现大模型在高一致性子集表现最佳,但在高分歧情况下表现不佳,表明参数数量不决定对模糊性和主观性的敏感度。

Comments 6 pages, 3 tables, 1 figure

Journal ref 2025 IEEE International Conference on Big Data (BigData), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19688 2026-03-23 cs.CL 77%

DataProphet: Demystifying Supervision Data Generalization in Multimodal LLMs

DataProphet:解开多模态大语言模型监督数据泛化之谜

Xuan Qi, Luxi He, Dan Roth, Xingyu Fu

机构 * University of Pennsylvania(宾夕法尼亚大学) Tsinghua University(清华大学) Princeton University(普林斯顿大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 本文提出DataProphet,一种无需训练的指标,通过结合多模态困惑度、相似性和数据多样性,有效评估监督数据对目标基准的影响,实现更优的数据选择。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19583 2026-03-23 cs.SE cs.AI 77%

Skilled AI Agents for Embedded and IoT Systems Development

嵌入式与物联网系统开发中的技能型AI代理

Yiming Li, Yuhan Cheng, Mingchen Ma, Yihang Zou, Ningyuan Yang, Wei Cheng, Hai "Helen" Li, Yiran Chen, Tingjun Chen

机构 * Department of Electrical and Computer Engineering, Duke University(杜克大学电气与计算机工程系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出技能型AI代理框架与IoT-SkillsBench基准,通过实测验证,展示结构化专家知识在嵌入式编程中的高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05710 2026-03-23 q-fin.CP cs.AI 77%

FinReflectKG -- EvalBench: Benchmarking Financial KG with Multi-Dimensional Evaluation

FinReflectKG -- EvalBench:基于多维评估的金融知识图谱基准测试

Fabrizio Dimino, Abhinav Arun, Bhaskarjit Sarmah, Stefano Pasquali

机构 * New York, US(美国纽约) Gurugram, India(印度古尔冈)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出FinReflectKG-EvalBench,通过多维评估框架对金融知识图谱提取进行基准测试,证明基于反思的提取方法在全面性、精度和相关性上表现最佳,同时验证LLM作为评判者在成本效率和结构化错误分析中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19765 2026-03-23 cs.CV 75%

FREAK: A Fine-grained Hallucination Evaluation Benchmark for Advanced MLLMs

FREAK:一种用于高级MLLMs细粒度幻觉评估的基准测试

Zhihan Yin, Jianxin Liang, Yueqian Wang, Yifeng Yao, Huishuai Zhang, Dongyan Zhao

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王学苑计算机技术研究所) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出FREAK基准测试,通过高质量图像评估MLLMs在细粒度视觉感知中的幻觉问题,揭示了现有模型在详细视觉感知上的严重幻觉问题。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19399 2026-03-23 cs.SE 75%

DePro: Understanding the Role of LLMs in Debugging Competitive Programming Code

DePro:理解LLMs在调试竞赛编程代码中的作用

Nabiha Parvez, Tanvin Sarkar Pallab, Mia Mohammad Imran, Tarannum Shaila Zaman

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文通过实证研究,提出DePro方法,利用测试用例驱动的方式帮助程序员修正现有代码,有效提升调试效率,实验表明其在减少调试次数和时间方面优于人类和零样本LLM。

Comments This paper is accepted in FSE 2026 IVR track!

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19237 2026-03-23 cs.DL 75%

Prompt engineering for bibliographic web-scraping

用于文献数据库网络爬取的提示工程

Manuel Blázquez-Ochando, Juan José Prieto-Gutiérrez, María Antonia Ovalle-Perandones

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文探讨如何利用提示工程高效构建数据录入模型,通过ChatGPT-4o实现单次交互生成功能完整的PHP网络爬虫,适用于文献数据库。

Comments 26 pages, 7 Tables, 2 Figures

Journal ref Scientometrics, 2025, 130(7), 3433-3453

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03273 2026-03-23 cs.CL cs.AI cs.HC cs.LG 75%

A Multi-Perspective Benchmark and Moderation Model for Evaluating Safety and Adversarial Robustness

一种多视角基准和评估模型用于评估安全性和对抗鲁棒性

Naseem Machlovi, Maryam Saleki, Ruhul Amin, Mohamed Rahouti, Shawqi Al-Maliki, Junaid Qadir, Mohamed M. Abdallah, Ala Al-Fuqaha

机构 * Department of Computer and Information Science, Fordham University(福德汉大学计算机与信息科学系) College of Science and Engineering, Hamad Bin Khalifa University(哈马德·本·卡西姆大学科学与工程学院) Department of Computer Science and Engineering, Qatar University(卡塔尔大学计算机科学与工程系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GuardEval多视角基准和GGuard模型,通过细粒度标签提升内容审核的准确性和对抗鲁棒性,实验显示GGuard在宏平均F1得分上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15872 2026-03-23 cs.LG 74%

Hidden Breakthroughs in Language Model Training

语言模型训练中的隐藏突破

Sara Kangaslahti, Elan Rosenfeld, Naomi Saphra

机构 * Harvard University(哈佛大学) Google Research(谷歌研究)

专题命中 评测与基准 :language model(title);分类 cs.LG

AI总结 本文提出POLCA方法,通过分解损失变化来揭示训练过程中的隐藏转折点,通过合成任务验证其在模型能力解读中的潜力。

Comments ICLR 2026 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19615 2026-03-23 cs.SD cs.AI cs.CL 73%

CAF-Score: Calibrating CLAP with LALMs for Reference-free Audio Captioning Evaluation

CAF-Score: 通过LALMs校准CLAP用于无参考音频描述评估

Insung Lee, Taeyoung Jeong, Haejun Yoo, Du-Seong Chang, Myoung-Wan Koo

机构 * Department of Artificial Intelligence, Sogang University, South Korea(人工智能系,ソガン大学,韩国)

专题命中 评测与基准 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CAF-Score,一种无参考音频描述评估指标,通过结合对比音频-文本嵌入与LALM推理,有效检测语法不一致和细微幻觉,实验表明其在BRACE基准上与人类判断相关性最高。

Comments A condensed version of this work has been submitted to Interspeech 2026. Section 10 is an extended analysis added in this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19539 2026-03-23 cs.CL cs.AI 73%

FDARxBench: Benchmarking Regulatory and Clinical Reasoning on FDA Generic Drug Assessment

FDARxBench:基于FDA通用药物评估的监管与临床推理基准测试

Betty Xiong, Jillian Fisher, Benjamin Newman, Meng Hu, Shivangi Gupta, Yejin Choi, Lanyan Fang, Russ B Altman

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) U.S. Food and Drug Administration(美国食品药品监督管理局)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FDARxBench基准测试,用于评估基于文档的问答任务,通过FDA药物标签文档生成高质量问答示例,揭示语言模型在事实基础、长上下文检索和安全拒绝行为方面的差距。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19426 2026-03-23 cs.CL cs.AI 73%

Is Evaluation Awareness Just Format Sensitivity? Limitations of Probe-Based Evidence under Controlled Prompt Structure

评估意识仅仅是格式敏感性?基于探针的证据在受控提示结构下的局限性

Viliana Devbunova

机构 * Yandex Belgrade(Yandex 布尔加斯)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了基于探针的证据在受控提示结构下的可靠性,发现其主要追踪基准格式而非评估上下文,限制了现有结果的说服力。

Comments 10 pages, 5 tables, 2 figures. Accepted at ICLR 2026 Workshop "I Can't Believe It's Not Better"

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19313 2026-03-23 cs.CL cs.AI 73%

Memory-Driven Role-Playing: Evaluation and Enhancement of Persona Knowledge Utilization in LLMs

基于记忆的角色扮演:评估和增强LLM中人设知识的利用

Kai Wang, Haoyang You, Yang Zhang, Zhongjie Wang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Macquarie University(麦考瑞大学)

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Memory-Driven Role-Playing框架,通过MREval、MRPrompt和MRBench评估LLM在角色扮演中的记忆能力,验证了小模型能效媲美大模型,并证明上游记忆提升下游响应质量。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19276 2026-03-23 cs.CL cs.AI 73%

From Flat to Structural: Enhancing Automated Short Answer Grading with GraphRAG

从平面到结构:利用GraphRAG增强自动简答评分

Yucheng Chu, Haoyu Han, Shen Dong, Hang Li, Kaiqi Yang, Yasemin Copur-Gencturk, Joseph Krajcik, Namsoo Shin, Hui Liu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GraphRAG框架,通过构建结构化知识图谱解决传统RAG在复杂教育内容中的不足,实验表明其在评估科学与工程实践方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19274 2026-03-23 cs.CL cs.AI 73%

CURE: A Multimodal Benchmark for Clinical Understanding and Retrieval Evaluation

CURE:临床理解和检索评估的多模态基准

Yannian Gu, Zhongzhen Huang, Linjie Mu, Xizhuo Zhang, Shaoting Zhang, Xiaofan Zhang

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) SenseTime Research, China(商汤研究院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CURE基准通过控制证据环境评估多模态模型的推理与检索能力,揭示模型在依赖权威文献时性能显著下降,强调整合临床证据与精确检索的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19273 2026-03-23 cs.CL cs.AI 73%

LSR: Linguistic Safety Robustness Benchmark for Low-Resource West African Languages

LSR:低资源西非语言的语言安全鲁棒性基准

Godwin Abuh Faruna

机构 * Fagmart Lab(法格马特实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LSR是首个评估跨语言拒绝退化现象的基准,针对西非语言中的有害意图表达,发现模型拒绝率从英语的90%降至35-55%,其中Igala语言退化最严重。

Comments 6 pages. Reference implementation: https://huggingface.co/spaces/Faruna01/lsr-dashboard. Dataset: https://huggingface.co/datasets/Faruna01/lsr-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20192 2026-03-23 cs.CV cs.AI 70%

LumosX: Relate Any Identities with Their Attributes for Personalized Video Generation

LumosX:通过身份与属性的关系实现个性化视频生成

Jiazheng Xing, Fei Du, Hangjie Yuan, Pengwei Liu, Hongbin Xu, Hai Ci, Ruigang Niu, Weihua Chen, Fan Wang, Yong Liu

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎斑实验室) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LumosX通过结合身份与属性关系,提升多主体个性化视频生成的精细度和一致性,采用数据与模型双改进策略,构建了全面的基准测试平台。

Comments ICLR 2026 Camera Ready Version. Code and Models: https://jiazheng-xing.github.io/lumosx-home/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21448 2026-03-23 cs.CR cs.AI cs.DB 70%

The Phish, The Spam, and The Valid: Generating Feature-Rich Emails for Benchmarking LLMs

钓鱼邮件、垃圾邮件与有效邮件:为评估大语言模型生成特征丰富的电子邮件

Rebeka Toth, Tamas Bisztray, Nils Gruschka

机构 * Department of Informatics University of Oslo Oslo, Norway(信息学院奥斯陆大学奥斯陆挪威)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PhishFuzzer框架,通过将真实邮件输入大语言模型生成23100种结构一致的电子邮件变体,提供严格三类标签和元数据,评估LLM在不同设置下的可靠性与检测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19993 2026-03-23 cs.CV 67%

MedSPOT: A Workflow-Aware Sequential Grounding Benchmark for Clinical GUI

MedSPOT: 一种面向临床GUI的流程感知序列接地基准

Rozain Shakeel, Abdul Rahman Mohammad Ali, Muneeb Mushtaq, Tausifa Jan Saleem, Tajamul Ashraf

机构 * Gaash Research Lab, National Institute of Technology Srinagar, India(加什研究实验室,印度锡里纳杰尔国家理工学院) e\& Group, UAE(e&集团,阿联酋) Mohammad Bin Zayed University of Artificial Intelligence (MBZUAI), UAE(穆罕默德·本·扎耶德人工智能大学(MBZUAI),阿联酋) King Abdullah University of Science and Technology (KAUST), Saudi Arabia(国王 Abdullah 科学技术大学(KAUST),沙特阿拉伯)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 MedSPOT针对临床GUI中需流程驱动的序列推理问题,通过216个任务驱动视频和597个标注关键帧,评估多模态模型在医疗软件中的可靠性与安全性。

Comments Project page: https://rozainmalik.github.io/MedSPOT_web/

详情

展开后加载摘要…

URL PDF HTML 收藏