arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32034 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32034 篇

2605.24079 2026-05-26 cs.SE cs.AI cs.CL 88%

TRACER: A Semantic-Aware Framework for Fine-Grained Contamination Detection in Code LLMs

TRACER: 一种用于代码大语言模型中细粒度污染检测的语义感知框架

Yifeng Di, Xuliang Huang, Tianyi Zhang

机构 * Purdue University West Lafayette, IN(帕克大学韦斯特拉法叶分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出TRACER框架,通过三级语义重叠和粗到细流水线检测代码LLM中的细粒度数据污染,在基准测试中F1达0.91。

Comments 21 pages, 2 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20650 2026-05-19 cs.CL cs.AI cs.CE 88%

FinTagging: Benchmarking LLMs for Extracting and Structuring Financial Information

FinTagging: 评估LLM提取和结构化财务信息

Yan Wang, Lingfei Qian, Xueqing Peng, Yang Ren, Keyi Wang, Yi Han, Dongji Feng, Fengran Mo, Shengyuan Lin, Qinchuan Zhang, Kaiwen He, Chenri Luo, Jianxing Chen, Junwei Wu, Chen Xu, Ziyang Xu, Jimin Huang, Guojun Xiong, Xiao-Yang Liu, Qianqian Xie, Jian-Yun Nie

机构 * Georgia Institute of Technology(佐治亚理工学院) Columbia University(哥伦比亚大学) California State University(加州州立大学) University of Montreal(蒙特利尔大学) Carnegie Mellon University(卡内基梅隆大学) Rensselaer Polytechnic Institute(莱斯利理工学院) The University of Manchester(曼彻斯特大学) Harvard University(哈佛大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FinTagging基准,用于评估LLM在提取和结构化财务信息方面的能力,通过分解为FinNI和FinCL两个子任务,揭示了LLM在细粒度概念链接上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10981 2026-05-19 cs.IR cs.AI cs.CL 88%

A Survey on Retrieval-Augmented Text Generation for Large Language Models

基于大型语言模型的检索增强文本生成综述

Yizheng Huang, Jimmy Huang

机构 * York University(约克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文综述了检索增强文本生成方法,探讨了其在提升大型语言模型生成准确性和可靠性方面的核心方法与主要贡献。

Comments Ongoing Work

Journal ref ACM Computing Surveys, Volume 58, Issue 12, Article No.: 300, Pages 1 - 38, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15341 2026-05-18 cs.LG cs.AI 88%

LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design

LEAP:LLM在迭代科学设计中的轨迹级评估

Marilyn Zhang, Tianfeng Chen, Fabián Barzuna, Ankita Rathod, Mark E. Whiting

专题命中 评测与基准 :LLM(title_cn,summary_cn);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LEAPBench框架,通过轨迹级评估方法揭示LLM在迭代科学设计中的学习效率,发现传统基于结果的评估方法存在偏差,轨迹指标能更准确反映效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10346 2026-05-15 cs.CL cs.LG 88%

Geometry-Aware Decoding with Wasserstein-Regularized Truncation and Mass Penalties for Large Language Models

具有Wasserstein正则化截断和质量惩罚的几何感知解码

Arash Gholami Davoodi, Navid Rezazadeh, Seyed Pouyan Mousavi Davoudi, Pouya Pezeshkpour

机构 * Carnegie Mellon University(卡内基梅隆大学) Megagon Labs(Megagon实验室) University of California, Irvine(加州大学伊文斯顿分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Top-W解码方法,通过Wasserstein距离保持token嵌入空间几何特性,平衡概率质量与熵,提升大语言模型生成质量与创造力。

Comments 20 pages, 3 figures, 8 tables, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04265 2026-05-13 cs.AI cs.CL math.ST stat.ML stat.TH 88%

Don't Pass@k: A Bayesian Framework for Large Language Model Evaluation

不要Pass@k:大规模语言模型评估的贝叶斯框架

Mohsen Hariri, Amirhossein Samandar, Michael Hinczewski, Vipin Chaudhary

机构 * Department of Computer and Data Sciences, Case Western Reserve University(计算机与数据科学系,凯斯西储大学) Department of Physics, Case Western Reserve University(物理系,凯斯西储大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出基于贝叶斯的评估框架,用后验估计替代Pass@k和avg@N,提升排名稳定性与透明度,适用于二元和非二元评估。

Comments OpenReview (ICLR 2026): https://openreview.net/forum?id=PTXi3Ef4sT

Journal ref The Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06658 2026-05-12 cs.CL cs.AI 88%

Elite Polarization in European Parliamentary Speeches: a Novel Measurement Approach Using Large Language Models

欧洲议会演讲中的精英极化:一种利用大语言模型进行新型测量的方法

Gennadii Iakovlev

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出精英极化指数,利用大语言模型分析议会演讲中的跨党派评价,验证了其在英国、匈牙利和意大利议会数据中的有效性,区分了极化与其他相关概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05211 2026-05-08 q-fin.PR cs.AI cs.LG q-fin.ST 88%

A Review of Large Language Models for Stock Price Forecasting from a Hedge-Fund Perspective

对冲基金视角下大型语言模型在股票价格预测中的综述

Olivia Zhang, Zhilin Zhang

机构 * Hockaday School(霍卡迪学校) Lumos Alpha(卢姆斯阿尔法)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文综述了大型语言模型在股票预测中的应用,包括从新闻和社交媒体提取情绪、分析财务报告和电话会议记录,以及构建多智能体交易系统,并指出实践中常被忽视的问题,如情绪分析的脆弱性、数据集和时间范围设计、性能评估指标、数据泄露、流动性溢价和股价预测的局限性。

Comments Accepted at the IEEE Conference on Artificial Intelligence, Spain, May 8--10, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10915 2026-05-04 cs.CL cs.LG 88%

Bias in Large Language Models: Origin, Evaluation, and Mitigation

大型语言模型中的偏差:起源、评估与缓解

Yufei Guo, Muzhe Guo, Juntao Su, Zhou Yang, Mengqiu Zhu, Hongfei Li, Mengyang Qiu, Shuo Shuo Liu

机构 * Department of Statistics, George Washington University(乔治华盛顿大学统计学系) University of Connecticut(康奈尔大学) Saint Elizabeth University(圣艾利泽大学) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了大型语言模型中偏差的起源、评估方法及缓解策略,分析了内在与外在偏差在NLP任务中的表现,并讨论了伦理和法律影响,旨在推动公平和负责任的AI发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27169 2026-05-01 cs.CL cs.LG 88%

Semantic Structure of Feature Space in Large Language Models

大语言模型特征空间的语义结构

Austin C. Kozlowski, Andrei Boutyline

机构 * Knowledge Lab University of Chicago(芝加哥大学知识实验室) Department of Sociology University of Michigan(密歇根大学社会学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究发现大语言模型隐藏状态中语义特征的几何关系与人类心理关联相似,通过360个词的特征向量投影32个语义轴,发现其与人类评分高度相关,且语义轴间余弦相似度预测了尺度间相关性,同时显示语义轴在低维子空间中存在显著变异,且词在某一轴上的操控会引发其在其他尺度上的评分变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08049 2026-04-30 cs.CL cs.AI 88%

A Survey of Process Reward Models: From Outcome Signals to Process Supervisions for Large Language Models

对过程奖励模型的调查:从结果信号到大语言模型的过程监督

Congmin Zheng, Jiachen Zhu, Zhuoying Ou, Yuxiang Chen, Kangning Zhang, Rong Shan, Zeyu Zheng, Mengyue Yang, Jianghao Lin, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University College London(伦敦大学学院) Carnegie Mellon University(卡内基梅隆大学) University of Bristol(布里斯托大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文综述了过程奖励模型,探讨了如何生成过程数据、构建PRMs及在测试时扩展和强化学习中的应用,涵盖数学、代码、文本、多模态推理、机器人和智能体等领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25359 2026-04-29 cs.CL cs.AI 88%

The Structured Output Benchmark: A Multi-Source Benchmark for Evaluating Structured Output Quality in Large Language Models

结构化输出基准:一个多源基准,用于评估大型语言模型中的结构化输出质量

Abhinav Kumar Singh, Harsha Vardhan Khurdula, Yoeven D Khemlani, Vineet Agarwal

机构 * JigsawStack, Inc.(JigsawStack公司) New Delhi, India(印度新德里) San Francisco, CA, USA(美国旧金山) Durgapur, WB, India(印度德里邦杜格apur)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SOB基准,用于评估大型语言模型在多源数据中的结构化输出质量,通过文本、图像和音频三种模态的测试数据,发现模型在结构合规性上表现良好,但价值准确性在不同数据源中差异显著。

Comments 19 pages, 4 figures, 11 tables, submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16378 2026-04-28 cs.CL cs.AI cs.SD 88%

Hearing to Translate: The Effectiveness of Speech Modality Integration into LLMs

听译:将语音模态整合到LLMs中的有效性

Sara Papi, Javier Garcia Gilabert, Zachary Hopton, Vilém Zouhar, Carlos Escolano, Gerard I. Gállego, Jorge Iranzo-Sánchez, Ahrii Kim, Dominik Macháček, Patricia Schmidtova, Maike Züfle

机构 * Fondazione Bruno Kessler(布鲁诺·凯瑟尔基金会) Barcelona Supercomputing Center(巴塞罗那超级计算中心) University of Zurich(苏黎世大学) ETH Zurich(苏黎世联邦理工学院) Universitat Politècnica de Catalunya(加泰罗尼亚理工大学) Universitat Politècnica de València(瓦伦西亚理工大学) Soongsil University(顺天大学) Charles University(查尔斯大学) KIT(卡尔斯鲁厄理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文评估了将语音模态整合到LLMs中的有效性,发现级联系统总体更可靠,但最新SpeechLLMs在某些情况下可匹配或超越级联系统,而SFM表现较差,强调整合LLM的重要性。

Comments Project available at https://github.com/sarapapi/hearing2translate | Accepted at TACL, this version is a pre-MIT Press publication version

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18169 2026-04-27 cs.CR cs.AI cs.LG 88%

Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey

大型语言模型有害微调攻击与防御:综述

Tiansheng Huang, Sihao Hu, Fatih Ilhan, Selim Furkan Tekin, Ling Liu

机构 * School of Computer Science, Georgia Institute of Technology(佐治亚理工学院计算机科学系)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文综述了大型语言模型中有害微调攻击的威胁模型、防御设计及评估方法,分析了现有攻击与防御机制,并提出了未来研究方向。

Comments Accepted by ACM Computing Survey (CSUR). The authors will continuously update the arXiv version. Please reach out to the authors if you find uncovered papers on relevant topics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19887 2026-04-23 cs.CL cs.AI 88%

Depression Risk Assessment in Social Media via Large Language Models

通过大语言模型在社交媒体上评估抑郁症风险

Giorgia Gulino, Manuel Petrucci

机构 * Guglielmo Marconi University, Department of Human Sciences(圭里莱莫·马尔科尼大学人文科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于大语言模型的系统,通过多标签分类八种抑郁相关情绪和计算加权严重性指数,评估Reddit帖子中的抑郁症风险,实验结果显示模型在零样本设置下表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19809 2026-04-23 cs.AI cs.LG 88%

MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models

MIRROR:大型语言模型元认知校准的分层基准

Jason Z Wang

机构 * Independent(独立)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 MIRROR基准通过八个实验评估大型语言模型是否能利用自我知识做出更好决策,发现模型在多领域任务中无法预测自身表现,且外部元认知控制能显著降低失败率,但内部自我知识改进无效。

Comments 30 pages, 6 figures,code at: https://github.com/Jason-Wang313/Mirror

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19781 2026-04-23 cs.CY cs.AI cs.CL 88%

Do Small Language Models Know When They're Wrong? Confidence-Based Cascade Scoring for Educational Assessment

小型语言模型知道它们犯错时吗?基于置信度的级联评分用于教育评估

Tyler Burleigh

机构 * PhD(博士)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过置信度评估确定级联系统中何时升级任务,发现置信度差异影响评分准确性与成本,最佳级联在降低成本和延迟的同时接近大模型性能。

Comments 12 pages, 7 figures. Accepted at NCME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18775 2026-04-22 cs.CL cs.LG 88%

An Empirical Study of Multi-Generation Sampling for Jailbreak Detection in Large Language Models

多代采样在大型语言模型 jailbreak 检测中的实证研究

Hanrui Luo, Shreyank N Gowda

机构 * University of Nottingham(诺丁汉大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究通过JailbreakBench数据集和多种生成模型,评估了基于输出的jailbreak检测方法,发现单输出评估低估了模型漏洞,多代采样能更准确检测有害行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17730 2026-04-21 cs.CL cs.AI cs.HC 88%

MHSafeEval: Role-Aware Interaction-Level Evaluation of Mental Health Safety in Large Language Models

MHSafeEval:面向大语言模型中心理健康安全的交互层面角色感知评估

Suhyun Lee, Palakorn Achananuparp, Neemesh Yadav, Ee-Peng Lim, Yang Deng

机构 * Department of Artificial Intelligence, Hanyang University(翰艺大学人工智能系) School of Computing and Information Systems, Singapore Management University(新加坡国立管理学院信息系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MHSafeEval框架,通过角色感知模型评估大语言模型在多轮对话中的心理健康安全问题,揭示角色依赖性和累积性安全故障,提升故障模式覆盖和诊断精度。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25897 2026-04-20 cs.CL cs.AI cs.CY 88%

RoleConflictBench: A Benchmark of Role Conflict Scenarios for Evaluating LLMs' Contextual Sensitivity

RoleConflictBench: 一个用于评估LLM上下文敏感性的角色冲突场景基准

Jisu Shin, Hoyun Song, Juhyun Oh, Changgeon Ko, Eunsu Kim, Chani Jung, Alice Oh

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RoleConflictBench基准,通过生成13000个角色冲突场景,评估LLM在角色冲突中的上下文敏感性,发现模型更倾向于遵循角色偏好而非动态上下文线索。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20635 2026-04-15 cs.CL cs.AI 88%

Why Did Apple Fall: Evaluating Curiosity in Large Language Models

苹果为何坠落:评估大语言模型中的好奇心

Haoyu Wang, Sihang Jiang, Yuyan Chen, Xiaojun Meng, Jiansheng Wei, Yitong Wang, Yanghua Xiao

机构 * Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(上海数据科学 key laboratory,计算机科学学院,复旦大学) Huawei Large Model Data Technology Lab(华为大模型数据技术实验室) Cornell University(康奈尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文基于人类好奇心评估量表,设计评估框架,发现大语言模型对知识有更强的渴求,但在不确定环境中仍保守,好奇心可提升推理与学习能力。

Comments ACL 2026 findings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09619 2026-04-14 cs.CY cs.AI cs.CL 88%

Assessing the Pedagogical Readiness of Large Language Models as AI Tutors in Low-Resource Contexts: A Case Study of Nepal's K-10 Curriculum

评估大型语言模型作为AI辅导教师在低资源环境中的教学准备性:尼泊尔K-10课程的案例研究

Pratyush Acharya, Prasansha Bharati, Yokibha Chapagain, Isha Sharma Gauli, Kiran Parajuli

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文评估了四个先进LLM在尼泊尔K-10课程中的教学有效性,发现存在显著的课程对齐差距,提出人机协同部署策略和课程特定微调方法。

Comments 14 pages and 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09029 2026-04-13 cs.CL cs.AI 88%

CONDESION-BENCH: Conditional Decision-Making of Large Language Models in Compositional Action Space

CONDESION-BENCH:大语言模型在组合动作空间中的条件决策

Yeonjun Hwang, Sungyong Park, Minju Kim, Dongha Lee, Jinyoung Yeo

机构 * Department of Artificial Intelligence, Yonsei University(延世大学人工智能系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CONDESION-BENCH基准,用于评估大语言模型在组合动作空间中的条件决策能力,通过引入变量、上下文和分配层级的显式条件限制,提升决策质量评估的严谨性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02781 2026-04-10 cs.LG cs.AI 88%

An Automated Survey of Generative Artificial Intelligence: Large Language Models, Architectures, Protocols, and Applications

生成人工智能的自动化调查:大型语言模型、架构、协议和应用

Eduardo C. Garrido-Merchán, Álvaro López López

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文调查了生成人工智能领域,重点分析了前沿大型语言模型的架构、训练方法和性能,涵盖多个模型家族及部署协议,总结了各行业应用案例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06213 2026-04-09 cs.CL cs.AI 88%

Invisible Influences: Investigating Implicit Intersectional Biases through Persona Engineering in Large Language Models

不可见的影响:通过大型语言模型中的角色工程探究隐性交叉偏见

Nandini Arimanda, Achyuth Mukund, Sakthi Balan Muthiah, Rajesh Sharma

机构 * Shiv Nadar University Chennai(钦奈希夫纳达尔大学) Plaksha University(普拉克沙大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过角色工程研究大型语言模型中的隐性交叉偏见,提出BADx指标,揭示角色上下文对偏见动态影响的机制,评估五种LLM在不同角色框架下的表现。

Comments 11 pages, 5 figures, ACM WebScience Conference, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10287 2026-04-08 cs.LG cs.CL 88%

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models

OutSafe-Bench:一种用于大型语言模型多模态攻击内容检测的基准测试

Yuping Yan, Yuhan Xie, Yuanshuai Li, Yingchao Yu, Lingjuan Lyu, Yaochu Jin

机构 * School of Engineering, Westlake University(西湖大学工学院) Sony AI(索尼人工智能)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出OutSafe-Bench,首个多模态时代内容安全评估测试套件,包含四类模态大规模数据集及多维交叉风险评分指标,评估九种内容风险类别,揭示九种先进MLLM的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00002 2026-04-02 cs.CL cs.AI 88%

Benchmark for Assessing Olfactory Perception of Large Language Models

嗅觉感知基准测试

Eftychia Makri, Nikolaos Nakis, Laura Sisson, Gigi Minsky, Leandros Tassiulas, Vahid Satarifard, Nicholas A. Christakis

机构 * Patina(Patina公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出嗅觉感知基准测试,评估大语言模型对气味的推理能力,发现化合物名称提示优于SMILES表示,揭示LLM主要通过词汇关联而非结构分子推理获取嗅觉知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08137 2026-03-31 cs.LG cs.CL cs.GR cs.MM 88%

Large Language Models for Computer-Aided Design: A Survey

大型语言模型在计算机辅助设计中的应用:综述

Licheng Zhang, Bach Le, Naveed Akhtar, Siew-Kei Lam, Tuan Ngo

机构 * The University of Melbourne(墨尔本大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文首次系统性地探讨了大型语言模型与计算机辅助设计的结合,分析了其在CAD中的应用领域及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23506 2026-03-26 cs.CL cs.AI 88%

Leveraging Computerized Adaptive Testing for Cost-effective Evaluation of Large Language Models in Medical Benchmarking

利用计算自适应测试对大型语言模型进行成本效益的医学基准评估

Tianpeng Zheng, Zhehan Jiang, Jiayi Liu, Shicong Feng

机构 * Institute of Medical Education, Health Science Center, Peking University(北京大学医学教育研究院、健康科学中心) School of Public Health, Peking University(北京大学公共卫生学院) Peking University Health Science Center-Chaoxing Joint Laboratory for Digital and Smart Medical(北京大学健康科学中心-超星数字与智能医疗联合实验室) Graduate School of Education, Peking University(北京大学教育学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于项目反应理论的计算自适应测试框架,用于高效评估大型语言模型在标准化医学知识中的表现,通过模拟和实证研究验证了其在成本效益和评估效率上的优势。

Comments 37 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20514 2026-03-24 cs.CL cs.AI 88%

Evaluating Large Language Models on Historical Health Crisis Knowledge in Resource-Limited Settings: A Hybrid Multi-Metric Study

在资源有限环境中评估大型语言模型对历史健康危机知识的评估:一种混合多指标研究

Mohammed Rakibul Hasan

机构 * organization= Department of Electrical \& Computer Engineering , addressline= North South University , city= Dhaka , country= Bangladesh

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究评估GPT-4、Gemini Pro、Llama 3和Mistral-7B在低资源环境下对新冠、登革热、尼帕病毒和登革热等健康危机问题的处理能力,通过语义相似度、专家评估和NLI方法分析模型表现,揭示LLM在流行病学历史和健康危机知识表示中的优缺点。

Comments Comments: 20 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏