arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-03 至 2026-03-03 共收录 124 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 124 篇

2603.01343 2026-03-03 cs.CL cs.AI 90%

PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology

PanCanBench: 用于评估大型语言模型在胰腺肿瘤学中的综合基准

Yimin Zhao, Sheela R. Damle, Simone E. Dekker, Scott Geng, Karly Williams Silva, Jesse J Hubbard, Manuel F Fernandez, Fatima Zelada-Arenas, Alejandra Alvarez, Brianne Flores, Alexis Rodriguez, Stephen Salerno, Carrie Wright, Zihao Wang, Pang Wei Koh, Jeffrey T. Leek

机构 * Department of Biostatistics, University of Washington(华盛顿大学生物统计学系) Clinical Research Division, Fred Hutch Cancer Center(Fred Hutch癌症中心临床研究部) Division of Hematology and Oncology, Department of Medicine, University of Washington(华盛顿大学医学系血液学与肿瘤学分会) Allen Institute for AI(Allen人工智能研究所) Department of Computer Science and Engineering, University of Washington(华盛顿大学计算机科学与工程系) Public Health Sciences, Biostatistics, Fred Hutchinson Cancer Center(Fred Hutchinson癌症中心公共卫生科学与生物统计学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 PanCanBench通过评估22种LLM在胰腺肿瘤学问题上的表现,揭示了模型在事实准确性、临床完整性和网络搜索整合方面的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01952 2026-03-03 cs.AI 89%

LiveCultureBench: a Multi-Agent, Multi-Cultural Benchmark for Large Language Models in Dynamic Social Simulations

LiveCultureBench: 一种多智能体、多文化的大型语言模型动态社会模拟基准

Viet-Thanh Pham, Lizhen Qu, Thuy-Trang Vu, Gholamreza Haffari, Dinh Phung

机构 * Department of Data Science & AI, Monash University(数据科学与人工智能系,墨尔本大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 LiveCultureBench通过模拟动态社会环境,评估大型语言模型在文化规范遵守与任务完成之间的平衡,研究其跨文化鲁棒性和评估可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02045 2026-03-03 cs.CL 89%

Harnessing Temporal Databases for Systematic Evaluation of Factual Time-Sensitive Question-Answering in Large Language Models

利用时间数据库对大语言模型中的事实时间敏感问答进行系统评估

Soyeon Kim, Jindong Wang, Xing Xie, Steven Euijong Whang

机构 * KAIST(韩国科学技术院) William & Mary(威廉与玛丽学院) Microsoft Research Asia(微软亚洲研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 TDBench通过时间数据库技术系统构建TSQA对,引入时间准确性指标,实现大语言模型时间敏感问答的可扩展和全面评估。

Comments Published in Proceedings of the 14th International Conference on Learning Representations (ICLR), 2026. Code and data are publicly available at: https://github.com/ssoy0701/tdbench.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07644 2026-03-03 cs.AI 89%

SymGPT: Auditing Smart Contracts via Combining Symbolic Execution with Large Language Models

SymGPT:通过结合符号执行与大语言模型审计智能合约

Shihao Xia, Mengting He, Shuai Shao, Tingting Yu, Yiying Zhang, Nobuko Yoshida, Linhai Song

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Connecticut(康涅狄格大学) University of California San Diego(加州大学圣地亚哥分校) University of Oxford(牛津大学) SKLP, Institute of Computing Technology, Chinese Academy of Sciences(SKLP,计算技术研究所,中国科学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 SymGPT结合符号执行与大语言模型,自动检测智能合约的ERC规则违规,识别出大量潜在安全漏洞。

Comments 34 pages. arXiv admin note: text overlap with arXiv:2404.04306

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06361 2026-03-03 q-fin.TR cs.CL 89%

Large Language Model Agent in Financial Trading: A Survey

金融交易中的大语言模型代理:综述

Han Ding, Yinheng Li, Junhao Wang, Hang Chen, Doudou Guo, Yunbai Zhang

机构 * Columbia University(哥伦比亚大学) New York University(纽约大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文综述了利用大语言模型作为代理进行金融交易的研究,探讨了代理架构、数据输入、回测表现及面临的挑战,并展望了未来研究方向。

Journal ref International Conference on Computers in Management and Business 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01519 2026-03-03 cs.CL eess.AS 89%

Chain of Correction for Full-text Speech Recognition with Large Language Models

基于大语言模型的全文语音识别纠错链

Zhiyuan Tang, Dong Wang, Zhikai Zhou, Yong Liu, Shen Huang, Shidong Shang

机构 * Tencent Ethereal Audio Lab, Tencent, China Center for Speech Language Technologies, BNRist, Tsinghua University, China

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出纠错链(CoC)方法,利用大语言模型逐段纠正全文语音识别错误,通过多轮对话和上下文引导提升纠错效果,实验表明其在纠错性能上优于现有系统。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00028 2026-03-03 cs.CL 89%

EPPCMinerBen: A Novel Benchmark for Evaluating Large Language Models on Electronic Patient-Provider Communication via the Patient Portal

EPPCMinerBen:一种用于通过患者门户评估大语言模型在电子患者-提供者沟通中的新基准

Samah Fodeh, Yan Wang, Linhai Ma, Srivani Talakokkul, Jordan M. Alpert, Sarah Schellhorn

机构 * Department of Emergency Medicine, Yale School of Medicine(耶鲁医学院急诊医学部) Cleveland Clinic Lerner College of Medicine of Case Western Reserve University, Cleveland Clinic(克利夫兰医学中心Lerner学院(凯斯西储大学)) Medical Oncology, Yale School of Medicine(耶鲁医学院肿瘤学部)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 EPPCMinerBen是一个用于评估大语言模型在电子患者-提供者沟通中表现的新基准,通过患者门户数据验证了大型模型在证据提取和分类任务中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01341 2026-03-03 cs.SI 89%

Structural Hallucination in Large Language Models: A Network-Based Evaluation of Knowledge Organization and Citation Integrity

大语言模型中的结构幻觉:基于网络的对知识组织与引用完整性的评估

Moses Boudourides

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出基于网络的结构幻觉压力测试,评估大语言模型在知识组织与引用完整性方面的表现,发现其在不同领域存在显著的结构偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02185 2026-03-03 cs.CV cs.AI cs.CL cs.LG 89%

Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models

视觉-深度研究基准:重新思考多模态大语言模型的视觉和文本搜索

Yu Zeng, Wenxuan Huang, Zhen Fang, Shuang Chen, Yufan Shen, Yishuo Cai, Xiaoman Wang, Zhenfei Yin, Lin Chen, Zehui Chen, Shiting Huang, Yiming Zhao, Xu Tang, Yao Hu, Philip Torr, Wanli Ouyang, Shaosheng Cao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Vision-DeepResearch基准,通过精心设计的问题评估多模态大语言模型的视觉与文本搜索能力,并引入多轮裁剪搜索流程提升实际检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00051 2026-03-03 cs.DL cs.AI cs.LG 88%

LitBench: A Graph-Centric Large Language Model Benchmarking Tool For Literature Tasks

LitBench: 一种面向文献任务的图中心大型语言模型基准评估工具

Andreas Varvarigos, Ali Maatouk, Jiasheng Zhang, Ngoc Bui, Jialin Chen, Leandros Tassiulas, Rex Ying

机构 * Yale University(耶鲁大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 LitBench是一种用于评估领域特定文献任务的大型语言模型基准工具,通过生成领域特定的文献子图和任务集,提升模型在文献相关任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01423 2026-03-03 cs.CL 88%

Quantifying Conversational Reliability of Large Language Models under Multi-Turn Interaction

量化大型语言模型在多轮交互中的对话可靠性

Jiyoon Myung

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL;foundation model(comments)

AI总结 研究评估了大型语言模型在多轮对话中的可靠性,发现其在复杂交互中存在显著下降,揭示了指令漂移、意图混淆等失败模式,强调了对LLM进行压力测试和改进评估方法的重要性。

Comments Accepted at the Workshop on Assessing and Improving Reliability of Foundation Models in the Real World (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01167 2026-03-03 cs.CL 88%

DEP: A Decentralized Large Language Model Evaluation Protocol

DEP:一种去中心化的大型语言模型评估协议

Jianxiang Peng, Junhao Li, Hongxiang Wang, Haocheng Lyu, Hui Guo, Siyi Hao, Zhen Wang, Chuang Liu, Shaowei Zhang, Bojian Xiong, Yue Chen, Zhuowen Han, Ling Shi, Tianyu Dong, Juesi Xiao, Lei Yang, Yuqi Ren, Deyi Xiong

机构 * TJUNLP Lab, Tianjin University, Tianjin, China(天津大学天津实验室) National Supercomputing Center in Tianjin(天津国家超算中心) Yuanhui AI(元慧AI)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 DEP提出一种去中心化的评估协议,通过匹配服务器实现统一、标准化的LLM评估,支持模块化和即插即用的评估方式,减少基准测试泄露风险并提高可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16395 2026-03-03 cs.CL 88%

OJBench: A Competition Level Code Benchmark For Large Language Models

OJBench: 一个面向大语言模型的竞赛级代码基准

Zhexu Wang, Yiping Liu, Yejie Wang, Wenyang He, Bofei Gao, Muxi Diao, Yanxu Chen, Kelin Fu, Flood Sung, Zhilin Yang, Tianyu Liu, Weiran Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) Moonshot AI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 OJBench是一个用于评估大语言模型竞赛级代码推理能力的基准,通过232个编程竞赛问题揭示了现有模型在复杂推理任务中的局限性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04490 2026-03-03 cs.CL q-bio.GN 88%

Large Language Models in Bioinformatics: A Survey

大语言模型在生物信息学中的应用:综述

Zhenyu Wang, Zikang Wang, Jiyue Jiang, Pengan Chen, Xiangyu Shi, Yu Li

机构 * The Chinese University of Hong Kong(香港中文大学) Peking University Third Hospital(北京大学第三医院) The Hong Kong Polytechnic University(香港理工大学) The University of Hong Kong(香港大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文综述了大语言模型在生物信息学中的应用,涵盖基因组序列建模、RNA结构预测等核心方法,并探讨了数据稀缺和跨组学整合等挑战及未来发展方向。

Comments Accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21722 2026-03-03 cs.CL cs.AI cs.CY 88%

German General Social Survey Personas: A Survey-Derived Persona Prompt Collection for Population-Aligned LLM Studies

德国通用社会调查人设:一种基于德国通用社会调查的人员提示集合,用于与人口一致的LLM研究

Jens Rupprecht, Leon Fröhling, Claudia Wagner, Markus Strohmaier

机构 * University of Mannheim(曼海姆大学) GESIS -- Leibniz Institute for the Social Sciences(莱布尼茨社会科学研究所) RWTH Aachen University(亚琛工业大学) Complexity Science Hub(复杂性科学中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出德国通用社会调查人设集合,用于构建与人口一致的LLM研究,通过实验证明其在模拟调查响应方面的有效性。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20487 2026-03-03 cs.CL cs.AI 88%

Steering Evaluation-Aware Language Models to Act Like They Are Deployed

引导评估意识语言模型以使其表现得像已部署

Tim Tian Hua, Andrew Qin, Samuel Marks, Neel Nanda

机构 * MATS

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)

AI总结 本文提出通过引导向量抑制LLM的评估意识,使其在评估时表现得像已部署,从而提高安全评估的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01778 2026-03-03 cs.CL 87%

LLM-as-an-Annotator: Training Lightweight Models with LLM-Annotated Examples for Aspect Sentiment Tuple Prediction

LLM-as-Annotator: 利用LLM标注示例训练轻量模型进行方面情感元组预测

Nils Constantin Hellwig, Jakob Fehle, Udo Kruschwitz, Christian Wolff

机构 * Media Informatics Group, University of Regensburg, Regensburg, Germany(莱茵河畔大学媒体信息学组) Information Science Group, University of Regensburg, Regensburg, Germany(莱茵河畔大学信息科学组)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出LA-ABSA方法,利用LLM生成的标注示例训练轻量模型,以高效完成复杂的情感分析任务。

Comments Accepted for publication at LREC 2026. Final version will appear in the ACL Anthology

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01257 2026-03-03 cs.CR cs.SE 87%

A Systematic Study of LLM-Based Architectures for Automated Patching

对基于大语言模型的自动补丁架构的系统研究

Qingxiao Xu, Ze Sheng, Zhicheng Chen, Jeff Huang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文系统研究了基于LLM的自动补丁架构,通过统一基准评估四种范式,揭示了不同架构在效率、灵活性和泛化能力上的权衡,发现通用代码代理在性能上表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01260 2026-03-03 cs.LG cs.AI 86%

MOSAIC: A Unified Platform for Cross-Paradigm Comparison and Evaluation of Homogeneous and Heterogeneous Multi-Agent RL, LLM, VLM, and Human Decision-Makers

MOSAIC:一个用于跨范式比较和评估同质和异质多智能体RL、LLM、VLM和人类决策者的统一平台

Abdulhamid M. Mousa, Yu Fu, Rakhmonberdi Khajiev, Jalaledin M. Azzabi, Abdulkarim M. Mousa, Peng Yang, Yunusa Haruna, Ming Liu

机构 * School of Optics and Photonics, Beijing Institute of Technology, Beijing 100081, China(北京理工大学光学工程学院) School of Automation Science and Electrical Engineering, Beihang University, Beijing 100191, China(北京航空航天大学自动化科学与电气工程学院) Faculty of Science, Ain Shams University, Cairo, Egypt(爱思唯命大学科学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MOSAIC是一个开源平台,通过统一接口和跨范式评估框架,支持在相同环境中比较不同决策范式的智能体,促进可重复的跨领域研究。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00428 2026-03-03 cs.CL cs.AI cs.CR 86%

When Agents "Misremember" Collectively: Exploring the Mandela Effect in LLM-based Multi-Agent Systems

当智能体“误忆”时:探索基于大语言模型的多智能体系统中的曼德拉效应

Naen Xu, Hengyu An, Shuo Shi, Jinghuai Zhang, Chunyi Zhou, Changjiang Li, Tianyu Du, Zhihui Fu, Jun Wang, Shouling Ji

机构 * Zhejiang University(浙江大学) University of California, Los Angeles(加州大学洛杉矶分校) Palo Alto Networks(帕洛阿尔托网络公司) OPPO Research Institute(OPPO研究院) Zhejiang Key Laboratory of Decision Intelligence(浙江决策智能重点实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了基于大语言模型的多智能体系统中的曼德拉效应,提出MANBENCH基准并提出缓解策略,实现74.40%的效应减少。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01701 2026-03-03 cs.DB cs.AI 85%

Beyond Single-Modal Analytics: A Framework for Integrating Heterogeneous LLM-Based Query Systems for Multi-Modal Data

超越单一模态分析:一种整合异构LLM查询系统的框架用于多模态数据

Ruyu Li, Tinghui Zhang, Haodi Ma, Daisy Zhe Wang, Yifan Wang

机构 * University of Hawaii at Manoa(夏威夷大学曼纳oa分校) University of Florida(佛罗里达大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Meta Engine,一种整合异构LLM查询系统的框架,通过统一的语义查询引擎提升多模态数据处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00993 2026-03-03 cs.AI 85%

CollabEval: Enhancing LLM-as-a-Judge via Multi-Agent Collaboration

CollabEval: 通过多智能体协作增强LLM作为裁判

Yiyue Qian, Shinan Zhang, Yun Zhou, Haibo Ding, Diego Socolinsky, Yi Zhang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CollabEval通过多智能体协作提升LLM作为裁判的评估性能,克服单一模型的不一致性和偏见问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19208 2026-03-03 cs.CL 85%

DiSRouter: Distributed Self-Routing for LLM Selections

DiSRouter: 分布式自路由用于大语言模型选择

Hang Zheng, Hongshen Xu, Yongkai Lin, Shuai Fan, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学系X-LANCE实验室) Shanghai Innovation Institution, Shanghai, China(上海创新机构) Jiangsu Key Lab of Language Computing, Suzhou, China(江苏省语言计算重点实验室) AISpeech Co., Ltd., Suzhou, China(AISpeech公司) Suzhou Laboratory, Suzhou, China(苏州实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DiSRouter通过分布式自路由机制,利用LLM的自我认知能力,实现更灵活、可扩展的多代理系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12462 2026-03-03 cs.AI cs.CR 85%

Evaluating and Mitigating LLM-as-a-judge Bias in Communication Systems

评估和减轻通信系统中LLM-as-a-judge的偏见

Jiaxin Gao, Chen Chen, Yanwen Jia, Xueluan Gong, Kwok-Yan Lam, Qian Wang

机构 * School of Computer Science and Engineering at Nanyang Technological University(南洋理工大学计算机科学与工程学院) School of Cyber Science and Engineering, Wuhan University(武汉大学网络科学与工程学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了LLM-as-a-judge在通信系统中的偏见问题,分析了不同模型对偏见输入的鲁棒性,并提出四种缓解策略以提高判断的公平性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04265 2026-03-03 cs.CR cs.AI 85%

Weaponizing Language Models for Cybersecurity Offensive Operations: Automating Vulnerability Assessment Report Validation; A Review Paper

利用语言模型进行网络安全进攻性操作:自动化漏洞评估报告验证;综述论文

Abdulrahman S Almuhaidib, Azlan Mohd Zain, Zalmiyah Zakaria, Izyan Izzati Kamsani, Abdulaziz S Almuhaidib

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

AI总结 本文综述了利用大型语言模型自动化漏洞评估报告验证的方法,旨在提高验证准确性并减少人工工作量。

Comments Pre-print - Accepted for publication in the Proceedings of the International Computer Sciences and Informatics Conference (ICSIC-2024), published by AIP Publishing

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00489 2026-03-03 cs.SE 85%

Does My README File Need To Be Updated? Exploring LLM-Based README Maintenance

我的 README 文件需要更新吗?探索基于 LLM 的 README 维护

Haoyu Gao, Hong Yi Lin, Christoph Treude, Gregory Gay, Mansooreh Zahedi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于 LLM 的轻量级方法,用于在人机协作流程中精准更新 README 文件,以解决文档过时问题,并通过实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00465 2026-03-03 cs.AI cs.CL 84%

Optimizing In-Context Demonstrations for LLM-based Automated Grading

优化基于大语言模型的自动评分的上下文演示

Yucheng Chu, Hang Li, Kaiqi Yang, Yasemin Copur-Gencturk, Kevin Haudek, Joseph Krajcik, Jiliang Tang

机构 * Michigan State University(密歇根州立大学) University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 GUIDE通过迭代设计示例优化自动评分,提升评分标准的符合性和边界处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06499 2026-03-03 cs.CV 83%

SportR: A Benchmark for Multimodal Large Language Model Reasoning in Sports

SportR:多模态大语言模型在体育中的推理基准

Haotian Xia, Haonan Ge, Junbo Zou, Hyun Woo Choi, Xuebin Zhang, Danny Suradja, Botao Rui, Ethan Tran, Wendy Jin, Zhen Ye, Xiyang Lin, Christopher Lai, Shengjie Zhang, Junwen Miao, Shichao Chen, Rhys Tracy, Vicente Ordonez, Weining Shen, Hanjie Chen

机构 * Department of Computer Science, Rice University(Rice大学计算机科学系) Ken Kennedy Institute, Rice University(Rice大学肯尼迪研究所) Department of Statistics, University of California, Irvine(伊利诺伊大学欧文分校统计系) College of Sciences, Georgia Institute of Technology(佐治亚理工学院科学学院) Department of Applied Mathematics and Statistics, Johns Hopkins University(约翰霍普金斯大学应用数学与统计学系) Department of Computer Science, University of California, Santa Barbara(加州大学圣芭芭拉分校计算机科学系)

专题命中 评测与基准 :large language model(title);language model(title)

AI总结 SportR是一个多体育大规模基准,旨在训练和评估多模态大语言模型在体育推理中的能力,通过精细的视觉感知和规则推理任务提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22957 2026-03-03 cs.LG 83%

Doubly-Robust LLM-as-a-Judge: Externally Valid Estimation with Imperfect Personas

双重鲁棒的LLM-as-a-Judge:具有不完美人设的外部有效性估计

Luke Guerdan, Justin Whitehouse, Kimberly Truong, Kenneth Holstein, Zhiwei Steven Wu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract);分类 cs.LG

AI总结 本研究提出双重鲁棒的LLM-as-a-Judge框架,通过结合不完美的'人设'评分与受抽样偏差影响的人类评分,实现对外部有效性评估的可靠估计。

Comments ICLR 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00164 2026-03-03 cs.CR cs.AI 83%

Reverse CAPTCHA: Evaluating LLM Susceptibility to Invisible Unicode Instruction Injection

反CAPTCHA:评估LLM对不可见Unicode指令注入的易感性

Marcus Graves

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 反CAPTCHA通过测试LLM对不可见Unicode指令的响应,揭示了模型在处理隐藏编码时的易感性及攻击面。

Comments 5 pages, 2 figures, 3 tables. Code and data: https://github.com/canonicalmg/reverse-captcha-eval

详情

展开后加载摘要…

URL PDF HTML 收藏