arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32006 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32006 篇

2410.05406 2026-03-12 cs.AI cs.SY eess.SY 89%

Synthesizing Interpretable Control Policies through Large Language Model Guided Search

通过大语言模型引导搜索合成可解释的控制策略

Carlo Bosio, Mark W. Mueller

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出通过大语言模型引导搜索生成可解释的动态系统控制策略,利用标准编程语言提高透明性和可解释性,并展示在摆动单摆和杯中球任务中的应用。

Comments 8 pages, 7 figures, conference paper

Journal ref Published at ACC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09884 2026-03-11 cs.CL cs.CY 89%

Benchmarking Political Persuasion Risks Across Frontier Large Language Models

在前沿大语言模型中评估政治说服风险基准

Zhongren Chen, Joshua Kalla, Quan Le

机构 * Yale University(耶鲁大学) Department of Statistics & Data Science(统计与数据科学系) Coefficient Giving

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究评估了前沿大语言模型在政治说服方面的风险,发现Claude模型说服力最强,Grok最弱,且信息提示效果因模型而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10934 2026-03-10 cs.DB cs.LG 89%

Towards Practical Benchmarking of Data Cleaning Techniques: On Generating Authentic Errors via Large Language Models

面向数据清洗技术实用基准测试的探索:通过大语言模型生成真实错误

Xinyuan Liu, Jiahui Chen, Bocheng Hu, Yu Sun, Xinyang Chen, Shaoxu Song, Yongxin Tong

机构 * Nankai University(南开大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua University(清华大学) Beihang University(北京航空航天大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 TableEG利用大语言模型生成真实错误,通过三元组表示和表格微调策略,提升数据清洗技术的基准测试效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05832 2026-03-09 cs.HC cs.AI 89%

Lexara: A User-Centered Toolkit for Evaluating Large Language Models for Conversational Visual Analytics

Lexara: 一种以用户为中心的评估工具包,用于评估用于对话式可视化分析的大型语言模型

Srishti Palani, Vidya Setlur

机构 * Tableau Research, Salesforce(Tableau研究机构,Salesforce)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 Lexara是一种以用户为中心的评估工具包,用于评估对话式可视化分析中的大型语言模型,通过多格式输出的可解释指标和交互式工具帮助用户进行模型和提示选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04837 2026-03-06 cs.AI 89%

Design Behaviour Codes (DBCs): A Taxonomy-Driven Layered Governance Benchmark for Large Language Models

设计行为代码(DBCs):一种以分类为导向的分层治理基准用于大型语言模型

G. Madan Mohan, Veena Kiran Nambiar, Kiranmayee Janardhan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);RLHF(abstract);分类 cs.AI

AI总结 本文提出DBC基准,用于评估大型语言模型中的行为治理层,通过三臂实验展示DBC在降低风险暴露率和提升合规性方面的效果。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04404 2026-03-06 cs.IR cs.CL cs.CY 89%

Signal in the Noise: Decoding the Reality of Airline Service Quality with Large Language Models

噪声中的信号:利用大语言模型解码航空服务质量的现实

Ahmed Dawoud, Osama El-Shamy, Ahmed Habashy

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究利用大语言模型分析航空服务质量,揭示埃及航空在运营改进后乘客满意度骤降的原因,发现沟通和员工行为是关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03846 2026-03-05 cs.CL 89%

Benchmarking Motivational Interviewing Competence of Large Language Models

对大型语言模型动机访谈能力的评估

Aishwariya Jha, Prakrithi Shivaprakash, Lekhansh Shukla, Animesh Mukherjee, Prabhat Chand, Pratima Murthy

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文评估了大型语言模型在真实世界临床转录中的动机访谈能力,发现LLM在MITI框架下表现良好,甚至在复杂反思和问题比率上优于人类专家。

Comments 17 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16852 2026-03-05 cs.CL 89%

Meenz bleibt Meenz, but Large Language Models Do Not Speak Its Dialect

梅恩语仍为梅恩语,但大语言模型并不说它的方言

Minh Duc Bui, Manuel Mager, Peter Herbert Kann, Katharina von der Wense

机构 * Johannes Gutenberg University Mainz, Germany(莱茵河畔摩泽尔大学) Marburg University, Germany(马堡大学) University of Colorado Boulder, USA(科罗拉多大学波德分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究首次探讨梅恩语的NLP应用,发现大语言模型在生成方言词汇定义和生成方面表现不佳,需更多资源和研究支持。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17558 2026-03-04 cs.CL 89%

A Survey of Query Optimization in Large Language Models

大型语言模型中查询优化的综述

Mingyang Song, Mao Zheng

机构 * Large Language Model Department(大语言模型部门)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文综述了大型语言模型中查询优化的技术,提出查询优化生命周期框架、查询复杂度分类法及四个基本操作,分析了优化方法和挑战,为研究和实践提供指导。

Comments Ongoing Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00582 2026-03-04 cs.CL 89%

Super Research: Answering Highly Complex Questions with Large Language Models through Super Deep and Super Wide Research

超研究:通过超深和超宽研究利用大型语言模型解决高度复杂的问题

Yubo Dong, Nianhao You, Yuxuan Hou, Zixun Sun, Yue Zhang, Liang Zhang, Siyuan Zhao, Hehe Fan

机构 * College of Computer Science and Technology(计算机科学与技术学院) Ant Group(蚂蚁集团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 通过超深和超宽研究,利用大型语言模型解决高度复杂问题,提供可验证的报告和审计协议,评估模型在复杂研究任务中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01952 2026-03-03 cs.AI 89%

LiveCultureBench: a Multi-Agent, Multi-Cultural Benchmark for Large Language Models in Dynamic Social Simulations

LiveCultureBench: 一种多智能体、多文化的大型语言模型动态社会模拟基准

Viet-Thanh Pham, Lizhen Qu, Thuy-Trang Vu, Gholamreza Haffari, Dinh Phung

机构 * Department of Data Science & AI, Monash University(数据科学与人工智能系,墨尔本大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 LiveCultureBench通过模拟动态社会环境,评估大型语言模型在文化规范遵守与任务完成之间的平衡,研究其跨文化鲁棒性和评估可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02045 2026-03-03 cs.CL 89%

Harnessing Temporal Databases for Systematic Evaluation of Factual Time-Sensitive Question-Answering in Large Language Models

利用时间数据库对大语言模型中的事实时间敏感问答进行系统评估

Soyeon Kim, Jindong Wang, Xing Xie, Steven Euijong Whang

机构 * KAIST(韩国科学技术院) William & Mary(威廉与玛丽学院) Microsoft Research Asia(微软亚洲研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 TDBench通过时间数据库技术系统构建TSQA对,引入时间准确性指标,实现大语言模型时间敏感问答的可扩展和全面评估。

Comments Published in Proceedings of the 14th International Conference on Learning Representations (ICLR), 2026. Code and data are publicly available at: https://github.com/ssoy0701/tdbench.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07644 2026-03-03 cs.AI 89%

SymGPT: Auditing Smart Contracts via Combining Symbolic Execution with Large Language Models

SymGPT:通过结合符号执行与大语言模型审计智能合约

Shihao Xia, Mengting He, Shuai Shao, Tingting Yu, Yiying Zhang, Nobuko Yoshida, Linhai Song

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Connecticut(康涅狄格大学) University of California San Diego(加州大学圣地亚哥分校) University of Oxford(牛津大学) SKLP, Institute of Computing Technology, Chinese Academy of Sciences(SKLP,计算技术研究所,中国科学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 SymGPT结合符号执行与大语言模型,自动检测智能合约的ERC规则违规,识别出大量潜在安全漏洞。

Comments 34 pages. arXiv admin note: text overlap with arXiv:2404.04306

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06361 2026-03-03 q-fin.TR cs.CL 89%

Large Language Model Agent in Financial Trading: A Survey

金融交易中的大语言模型代理:综述

Han Ding, Yinheng Li, Junhao Wang, Hang Chen, Doudou Guo, Yunbai Zhang

机构 * Columbia University(哥伦比亚大学) New York University(纽约大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文综述了利用大语言模型作为代理进行金融交易的研究,探讨了代理架构、数据输入、回测表现及面临的挑战,并展望了未来研究方向。

Journal ref International Conference on Computers in Management and Business 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01519 2026-03-03 cs.CL eess.AS 89%

Chain of Correction for Full-text Speech Recognition with Large Language Models

基于大语言模型的全文语音识别纠错链

Zhiyuan Tang, Dong Wang, Zhikai Zhou, Yong Liu, Shen Huang, Shidong Shang

机构 * Tencent Ethereal Audio Lab, Tencent, China Center for Speech Language Technologies, BNRist, Tsinghua University, China

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出纠错链(CoC)方法,利用大语言模型逐段纠正全文语音识别错误,通过多轮对话和上下文引导提升纠错效果,实验表明其在纠错性能上优于现有系统。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00028 2026-03-03 cs.CL 89%

EPPCMinerBen: A Novel Benchmark for Evaluating Large Language Models on Electronic Patient-Provider Communication via the Patient Portal

EPPCMinerBen:一种用于通过患者门户评估大语言模型在电子患者-提供者沟通中的新基准

Samah Fodeh, Yan Wang, Linhai Ma, Srivani Talakokkul, Jordan M. Alpert, Sarah Schellhorn

机构 * Department of Emergency Medicine, Yale School of Medicine(耶鲁医学院急诊医学部) Cleveland Clinic Lerner College of Medicine of Case Western Reserve University, Cleveland Clinic(克利夫兰医学中心Lerner学院(凯斯西储大学)) Medical Oncology, Yale School of Medicine(耶鲁医学院肿瘤学部)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 EPPCMinerBen是一个用于评估大语言模型在电子患者-提供者沟通中表现的新基准,通过患者门户数据验证了大型模型在证据提取和分类任务中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17287 2026-02-27 cs.AI 89%

LLM4AD: A Platform for Algorithm Design with Large Language Model

LLM4AD:基于大语言模型的算法设计平台

Fei Liu, Rui Zhang, Zhuoliang Xie, Rui Sun, Kai Li, Qinglong Hu, Ping Guo, Xi Lin, Xialiang Tong, Mingxuan Yuan, Zhenkun Wang, Zhichao Lu, Qingfu Zhang

机构 * City University of Hong Kong(香港城市大学) Southern University of Science and Technology(南方科技大学) Xi’an Jiaotong University(西安交通大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 LLM4AD是一个基于大语言模型的统一平台,旨在通过模块化框架支持多领域算法设计,并提供全面的资源和评估工具促进相关研究发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22500 2026-02-27 cs.AI 89%

Mapping the Landscape of Artificial Intelligence in Life Cycle Assessment Using Large Language Models

利用大语言模型映射人工智能在生命周期评估中的景观

Anastasija Mensikova, Donna M. Rizzo, Kathryn Hinkelman

机构 * University of Vermont(佛蒙特大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究利用大语言模型对人工智能在生命周期评估中的应用进行综合分析,揭示了AI技术在LCA中的发展趋势和未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21059 2026-02-25 cs.HC cs.CL 89%

An Expert Schema for Evaluating Large Language Model Errors in Scholarly Question-Answering Systems

评估学术问答系统中大语言模型错误的专家模式

Anna Martin-Boyle, William Humphreys, Martha Brown, Cara Leckey, Harmanpreet Kaur

机构 * University of Minnesota(明尼苏达大学) NASA Langley Research Center(NASA兰利研究中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出了一种评估学术问答系统中大语言模型错误的专家模式,通过与领域专家合作识别错误模式,并探讨了支持专家评估LLM输出的个性化工具机会。

Comments 24 pages, 2 figures. Accepted at ACM CHI conference on Human Factors in Computing Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20976 2026-02-25 cs.CL cs.CY 89%

Evaluating Proactive Risk Awareness of Large Language Models

评估大型语言模型的前瞻性风险意识

Xuan Luo, Yubin Chen, Zhiyu Hou, Linpu Yu, Geng Tu, Jing Li, Ruifeng Xu

机构 * The Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Hong Kong Polytechnic University, Hong Kong(香港理工大学) Southern University of Science and Technology, Shenzhen(南方科技大学) Shenzhen Loop Area Institute, Shenzhen, China(深圳南山区研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出前瞻性风险意识评估框架,通过Butterfly数据集评估LLMs在生态领域预见潜在危害的能力,发现响应长度限制和多模态保护盲点等问题,强调部署LLM时需加强主动防护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12434 2026-02-25 cs.AI 89%

A Survey on the Optimization of Large Language Model-based Agents

基于大语言模型代理的优化综述

Shangheng Du, Jiabao Zhao, Jinxin Shi, Zhentao Xie, Xin Jiang, Yanhong Bai, Liang He

机构 * Shanghai Institute of Artificial Intelligence for Education, East China Normal University(上海人工智能教育研究院,东华大学) School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,东华大学) School of Computer Science and Technology, Donghua University(计算机科学与技术学院,东华大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文综述了基于大语言模型的代理优化方法,分类讨论参数驱动与参数无关策略,分析关键技术和挑战,提出未来研究方向。

Comments Published in ACM Computing Surveys, Vol. 58, No. 9, Article 223, July 2026

Journal ref ACM Computing Surveys 58(9), Article 223, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20812 2026-02-25 cs.AI 89%

Qwen-BIM: developing large language model for BIM-based design with domain-specific benchmark and dataset

Qwen-BIM: 开发用于基于BIM的设计的大型语言模型,结合领域特定的基准和数据集

Jia-Rui Lin, Yun-Hong Cai, Xiang-Rui Ni, Shaojie Zhou, Peng Pan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出Qwen-BIM,通过领域特定基准和数据集开发了首个用于基于BIM设计的大型语言模型,显著提升了在该领域的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20759 2026-02-25 cs.CL 89%

Overton Pluralistic Reinforcement Learning for Large Language Models

奥顿多元强化学习用于大语言模型

Yu Fu, Seongho Son, Ilija Bogunovic

机构 * University College London(伦敦大学学院) University of Basel(巴塞尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出OP-GRPO框架,通过强化学习使大语言模型生成多样化响应,提升人类视角覆盖和视角独特性,实验证明其在自然语言推理任务中的优越性能。

Comments 28 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20513 2026-02-25 cs.CL 89%

From Performance to Purpose: A Sociotechnical Taxonomy for Evaluating Large Language Model Utility

从性能到目的:一种用于评估大语言模型效用的社技术分类

Gavin Levinson, Keith Feldman

机构 * University of Michigan(密歇根大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出LUX框架,用于评估大语言模型在不同应用场景中的效用,涵盖性能、交互、运营和治理四个领域,并提供动态工具支持框架探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20202 2026-02-25 cs.CR cs.AI 89%

Evaluating the Reliability of Digital Forensic Evidence Discovered by Large Language Model: A Case Study

评估由大语言模型发现的数字证据的可靠性:案例研究

Jeel Piyushkumar Khatiwala, Daniel Kwaku Ntiamoah Addai, Weifeng Xu

机构 * School of Criminal Justice(犯罪司法学院) College of Public Affairs(公共事务学院) University of Baltimore(巴尔的摩大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出了一种结构化框架,通过大语言模型驱动的分析和数字取证知识图谱验证,提升AI识别证据的可靠性与可追溯性。

Comments 10 pages, 5 figures. Published in the Proceedings of the 2025 IEEE 49th Annual Computers, Software, and Applications Conference (COMPSAC), Toronto, ON, Canada, 8-11 July 2025

Journal ref 2025 IEEE 49th Annual Computers, Software, and Applications Conference (COMPSAC), IEEE, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15850 2026-02-19 cs.CL 89%

Large Language Models for Assisting American College Applications

大型语言模型用于协助美国大学申请

Zhengliang Liu, Weihang You, Peng Shu, Junhao Chen, Yi Pan, Hanqi Jiang, Yiwei Li, Zhaojun Ding, Chao Cao, Xinliang Li, Yifan Zhou, Ruidong Zhang, Shaochen Xu, Wei Ruan, Huaqin Zhao, Dajiang Zhu, Tianming Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 EZCollegeApp 通过大型语言模型帮助高中生处理复杂大学申请流程,提供结构化表格、权威文件支持及人工控制,提升申请效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02356 2026-02-17 cs.CR cs.AI 89%

Measuring Physical-World Privacy Awareness of Large Language Models: An Evaluation Benchmark

评估大型语言模型的物理世界隐私意识:一种评估基准

Xinjie Shen, Mufei Li, Pan Li

机构 * Georgia Tech(佐治亚理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 EAPrivacy评估基准揭示大型语言模型在物理世界隐私意识方面存在严重缺陷,需更稳健的物理感知对齐。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08500 2026-02-17 cs.AI 89%

Large Language Models as Oracles for Ontology Alignment

大型语言模型作为本体对齐的预言机

Sviatoslav Lushnei, Dmytro Shumskyi, Severyn Shykula, Ernesto Jimenez-Ruiz, Artur d'Avila Garcez

机构 * City St George’s, University of London, UK(伦敦大学城市圣乔治学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出利用大型语言模型作为预言机,通过验证高不确定性的对应关系子集,提升本体对齐任务的性能,在OAEI 2025中取得优异成绩。

Comments Paper accepted at the 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026), main conference. 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13611 2026-02-17 cs.SE cs.AI 89%

From What to How: Bridging User Requirements with Software Development Using Large Language Models

从‘是什么’到‘如何做’:利用大型语言模型弥合用户需求与软件开发之间的鸿沟

Xiao He, Ru Chen, Jialun Cao

机构 * University of Science and Technology Beijing(北京科技大学) Hong Kong University of Science and Technology(香港科学大学) University of Science(科学大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出DesBench基准测试,评估LLMs在软件设计相关任务中的表现,揭示LLMs在代码生成、面向对象建模及测试用例设计方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11305 2026-02-13 cs.CL 89%

Are Aligned Large Language Models Still Misaligned?

对齐的大型语言模型仍然存在偏差吗?

Usman Naseem, Gautam Siddharth Kashyap, Rafiq Ali, Ebad Shabbir, Sushant Kumar Ray, Abdullah Mohammad, Agrima Seth

机构 * Macquarie University(麦考瑞大学) DSEU-Okhla University of Delhi(德里大学) Microsoft(微软公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出Mis-Align Bench基准测试,通过统一评估安全、价值和文化维度的偏差,揭示单维度模型在联合条件下的高覆盖率与高假失败率问题。

详情

展开后加载摘要…

URL PDF HTML 收藏