arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31794 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31794 篇

2511.10271 2026-04-23 cs.SE cs.AI 92%

Quality Assurance of LLM-generated Code: Addressing Non-Functional Quality Characteristics

LLM生成代码的质量保障:解决非功能性质量特性

Xin Sun, Daniel Ståhl, Kristian Sandahl, Christoph Kessler

机构 * Department of Computer and Information Science, Linköping University, Sweden(Linköping大学计算机与信息科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过文献综述、行业研讨会和实证分析,探讨LLM生成代码在安全、可维护性和性能效率等非功能性质量特性上的表现,揭示学术研究与行业需求的不匹配,强调需在代码生成流程中集成质量保障机制。

Journal ref Journal of Systems and Software (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19354 2026-04-22 cs.AI cs.CR cs.SE 92%

Do Agents Dream of Root Shells? Partial-Credit Evaluation of LLM Agents in Capture The Flag Challenges

智能体是否梦想着根壳?在夺旗挑战中的LLM智能体部分分数评估

Ali Al-Kaswan, Maksim Plotnikov, Maxim Hájek, Roland Vízner, Arie van Deursen, Maliheh Izadi

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DeepRed基准,用于评估LLM智能体在真实夺旗挑战中的能力,通过部分分数评分和自动化标注流程,发现当前智能体在非标准发现和长周期适应任务中表现有限。

Comments Accepted to AIWare'26 Benchmark and Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19124 2026-04-22 cs.CL 92%

Detoxification for LLM: From Dataset Itself

LLM去毒化:从数据集本身开始

Wei Shao, Yihang Wang, Gaoyu Zhu, Ziqiang Cheng, Lei Yu, Jiafeng Guo, Xueqi Cheng

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出HSPD方法,通过在原始语料上进行语义保留的改写,有效降低模型毒性,提升数据效用,减少后续调整成本。

Comments Accepted to Main Conference of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19071 2026-04-22 cs.CL 92%

HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing

HoWToBench: LLM在人类水平写作能力的综合评估方法:写作树

Andrew Zhuoer Feng, Cunxiang Wang, Yu Luo, Lin Fan, Yilin Zhou, Zikang Wang, Xiaotao Gu, Jie Tang, Hongning Wang, Minlie Huang

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Tree-of-Writing方法,通过树状流程结构评估LLM写作能力,构建包含12类文体和1302条指令的中文写作基准,实现与人类判断的高相关性。

Comments 49 pages, 6 figures, 19 tables, ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18660 2026-04-22 cs.CR cs.AI 92%

Evaluating Answer Leakage Robustness of LLM Tutors against Adversarial Student Attacks

评估LLM导师对对抗性学生攻击的答案泄露鲁棒性

Jin Zhao, Marta Knežević, Tanja Käser

机构 * EPFL(瑞士联邦理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了学生对抗性攻击下LLM导师的答案泄露鲁棒性,评估了多种模型在对抗攻击下的表现,并提出标准化基准和防御策略。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18333 2026-04-22 cs.CR cs.CL 92%

Position: LLM Watermarking Should Align Stakeholders' Incentives for Practical Adoption

位置:LLM水印应使所有相关方的利益一致以实现实际应用

Yepeng Liu, Xuandong Zhao, Dawn Song, Gregory W. Wornell, Yuheng Bu

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) UC Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨了LLM水印技术中利益相关方激励不一致的问题,提出通过设计激励一致的水印方法,如上下文水印,来解决实际应用中的障碍,强调在特定领域内实现可靠工具的重要性。

Comments ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18234 2026-04-21 cs.IR cs.AI 92%

Evaluating Multi-Hop Reasoning in RAG Systems: A Comparison of LLM-Based Retriever Evaluation Strategies

评估基于检索增强生成系统的多跳推理:LLM检索评估策略的比较

Lorenz Brehme, Thomas Ströhle, Ruth Breu

机构 * Universität Innsbruck(因斯布鲁克大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过对比三种LLM评估策略,提出上下文感知检索评估(CARE),证明其在提升RAG系统多跳推理能力方面效果显著,尤其在参数多和上下文长的模型中表现更优。

Comments 15 Pages, Accepted for publication at the SynIRgy Workshop, ECIR 2026 (48th European Conference on Information Retrieval)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17817 2026-04-21 cs.HC cs.AI cs.MA 92%

Do LLMs Need to See Everything? A Benchmark and Study of Failures in LLM-driven Smartphone Automation using Screentext vs. Screenshots

LLM是否需要看到一切?基于Screentext与截图的LLM驱动智能手机自动化失败性基准与研究

Shiquan Zhang, Tianyi Zhang, Le Fang, Simon D'Alfonso, Hong Jia, Vassilis Kostakos

机构 * University of Melbourne(墨尔本大学) School of Computer Science(计算机科学学院) University of Auckland(奥克兰大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过DailyDroid基准测试,探讨LLM驱动的智能手机自动化在文本与截图输入下的性能差异,揭示UI可访问性、输入模态及LLM应用设计中的关键问题。

Comments 29 pages. This study was conducted around May, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10286 2026-04-21 cs.SI cs.AI 92%

Characterizing LLM-driven Social Network: The Chirper.ai Case

刻画由LLM驱动的社会网络:Chirper.ai案例

Yiming Zhu, Yupeng He, Ehsan-Ul Haq, Gareth Tyson, Pan Hui

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过对比Chirper.ai和Mastodon的社会网络结构,分析LLM代理与人类用户在发帖行为、恶意内容及网络结构上的差异,为负责任的AI通信系统发展提供启示。

Comments Accepted to CSCW 2026, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16790 2026-04-21 cs.SE cs.AI 92%

Bias in the Loop: Auditing LLM-as-a-Judge for Software Engineering

循环中的偏见:用于软件工程的LLM作为评判者的审计

Zixiao Zhao, Amirreza Esmaeili, Fatemeh Fard

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了LLM作为评判者在代码评估中的偏见问题,通过测量优先的方法分析了代码生成、修复和测试生成任务中的评判制度,并发现提示偏见显著影响评判结果,甚至改变任务结论和模型排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02497 2026-04-20 cs.SE cs.AI quant-ph 92%

A PennyLane-Centric Dataset to Enhance LLM-based Quantum Code Generation using RAG

面向增强基于LLM的量子代码生成的PennyLane数据集

Abdul Basit, Nouhaila Innan, Muhammad Haider Asif, Minghao Shao, Muhammad Kashif, Alberto Marchisio, Muhammad Shafique

机构 * Center for Quantum and Topological Systems (CQTS)(量子与拓扑系统中心(CQTS)) NYUAD Research Institute(纽约大学阿布扎克研究院) New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PennyLang数据集,通过系统化方法提升LLM生成量子代码的性能,验证了RAG框架在增强量子代码生成中的有效性。

Comments 8 pages, 6 figures, 8 tables. Accepted at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14709 2026-04-17 cs.AI 92%

HWE-Bench: Benchmarking LLM Agents on Real-World Hardware Bug Repair Tasks

HWE-Bench:在真实世界硬件Bug修复任务上评估LLM代理的基准测试

Fan Cui, Hongyuan Hou, Zizhang Luo, Chenyun Yin, Yun Liang

机构 * Peking University(北京大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HWE-Bench是首个大规模仓库级基准,用于评估LLM代理在真实世界硬件Bug修复任务中的表现,通过417个任务实例验证代理在不同项目中的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10101 2026-04-17 cs.CL 92%

Who Wrote This Line? Evaluating the Detection of LLM-Generated Classical Chinese Poetry

是谁写的这行诗?评估LLM生成古典中文诗歌的检测

Jiang Li, Tian Lan, Shanshan Wang, Dongxing Zhang, Dianqing Lin, Guanglai Gao, Derek F. Wong, Xiangdong Su

机构 * College of Computer Science, Inner Mongolia University, China(内蒙古大学计算机学院,中国) National & Local Joint Engineering Research Center of Intelligent Information Processing Technology for Mongolian, China(蒙古语智能信息处理技术国家与地方联合工程研究中心,中国) NLP²CT Lab, Department of Computer and Information Science, University of Macau, China(澳门大学计算机与信息科学学院NLP²CT实验室,中国)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ChangAn基准,用于评估AI检测器对LLM生成的古典中文诗歌的检测能力,揭示现有工具的局限性。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23578 2026-04-17 cs.CL cs.SD 92%

Style Amnesia: Investigating Speaking Style Degradation and Mitigation in Multi-Turn Spoken Language Models

风格失忆:多轮对话中 spoken language models 的说话风格退化与缓解研究

Yu-Xiang Lin, Cheng-Han Chiang, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)(国立交通大学人工智能卓越研究中心(NTU AI-CoRE))

专题命中 评测与基准 :language model(title,title_cn);SLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文研究了多轮对话中 spoken language models 无法维持指定说话风格的问题,发现模型在后续对话中无法保持一致性,通过实验表明模型在被提示时可回忆风格指令但无法正确表达,需改进以提升风格一致性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13041 2026-04-16 cs.DB cs.AI 92%

TableNet A Large-Scale Table Dataset with LLM-Powered Autonomous

TableNet:一个大规模表格数据集与LLM驱动的自主系统

Ruilin Zhang, Kai Yang

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TableNet通过LLM驱动的自主系统生成和识别表格,解决大规模高质量表格数据集的不足,提升表格结构识别的效率与精度。

Comments The 40th Annual AAAI Conference on Artificial Intelligence Bridge Program on Logic & AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03610 2026-04-16 cs.AI 92%

Orak: A Foundational Benchmark for Training and Evaluating LLM Agents on Diverse Video Games

Orak:面向多样化视频游戏的LLM代理训练与评估基础基准

Dongmin Park, Minkyu Kim, Beongjun Choi, Junhyuck Kim, Keon Lee, Jonghyun Lee, Inkyu Park, Byeong-Uk Lee, Jaeyoung Hwang, Jaewoo Ahn, Ameya S. Mahabaleshwarkar, Bilal Kartal, Pritam Biswas, Yoshi Suhara, Kangwook Lee, Jaewoong Cho

机构 * KRAFTON Seoul National University(首尔国立大学) NVIDIA University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Ludo Robotics

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Orak通过12种主流视频游戏构建基础基准,系统评估LLM代理在不同游戏场景中的能力,提供统一评估框架和细调数据集,推动多样化游戏代理发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12312 2026-04-15 cs.CL 92%

CompliBench: Benchmarking LLM Judges for Compliance Violation Detection in Dialogue Systems

CompliBench:对话系统中LLM判别器合规性违规检测基准测试

Jingbo Yang, Guanyu Yao, Bairu Hou, Xinghan Yang, Nikolai Glushnev, Iwona Bialynicka-Birula, Duo Ding, Shiyu Chang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) Cresta

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CompliBench基准测试,用于评估LLM判别器在多轮对话中检测和定位违规指南的能力。通过自动化数据生成管道解决数据稀缺问题,展示小型判别器模型在合成数据上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02528 2026-03-04 cs.AI cs.RO 92%

LLM-MLFFN: Multi-Level Autonomous Driving Behavior Feature Fusion via Large Language Model

LLM-MLFFN: 通过大语言模型的多级自动驾驶行为特征融合

Xiangyu Li, Tianyi Wang, Xi Cheng, Rakesh Chowdary Machineni, Zhaomiao Guo, Sikai Chen, Junfeng Jiao, Christian Claudel

机构 * Department of Civil, Architectural, and Environmental Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校土木、建筑与环境工程系) Systems Engineering Program, Cornell University(康奈尔大学系统工程项目) Department of Electrical and Computer Engineering, University of Michigan(密歇根大学电气与计算机工程系) Department of Civil and Environmental Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校土木与环境工程系) School of Architecture, The University of Texas at Austin(德克萨斯大学奥斯汀分校建筑学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 LLM-MLFFN通过大语言模型的多级特征融合提升自动驾驶行为分类的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14564 2026-02-17 cs.CL 92%

Assessing Large Language Models for Medical QA: Zero-Shot and LLM-as-a-Judge Evaluation

评估大型语言模型用于医疗问答:零样本和LLM作为评判者评估

Shefayat E Shams Adib, Ahmed Alfey Sani, Ekramul Alam Esham, Ajwad Abrar, Tareque Mohmud Chowdhury

机构 * Department of Computer Science and Engineering, Islamic University of Technology, Gazipur, Bangladesh(计算机科学与工程系,伊斯兰技术大学,加兹ipur,孟加拉国) Department of Computer Science(计算机科学系) Engineering, Islamic University of Technology, Gazipur, Bangladesh(工程,伊斯兰技术大学,加兹ipur,孟加拉国)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文评估了多种大型语言模型在医疗问答任务中的性能,发现大模型表现更优,同时指出在实际部署中需权衡效率与避让问题。

Comments Accepted in 28th ICCIT, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01020 2025-12-25 cs.CR cs.LG 92%

AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models

AutoAdv:多轮对抗性提示生成用于大型语言模型的多轮 Jailbreaking 攻击

Aashray Reddy, Andrew Zagula, Nicholas Saban

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title);LLM(abstract)

AI总结 AutoAdv 提出了一种自动化多轮对抗性提示生成方法,通过策略性重写和优化配置,实现对大型语言模型的安全机制的高效攻击,揭示了其在有害内容生成上的高成功率。

Comments We encountered issues with the paper being hosted under my personal account, so we republished it under a different account associated with a university email, which makes updates and management easier. As a result, this version is a duplicate of arXiv:2511.02376

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09772 2025-12-15 cs.CL 92%

DeepSeek's WEIRD Behavior: The cultural alignment of Large Language Models and the effects of prompt language and cultural prompting

DeepSeek的WEIRD行为:大型语言模型的文化契合与提示语言和文化提示的影响

James Luther, Donald Brown

机构 * School of Data Science University of Virginia(数据科学学院 芝加哥大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL

AI总结 研究探讨了大型语言模型在不同文化提示下的对齐行为,发现DeepSeek-V3和GPT-5在美文化下表现突出,而GPT-4在英文化下更接近中国,文化提示可调整这种对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22598 2025-12-01 cs.LG 92%

LLM-Cave: A benchmark and light environment for large language models reasoning and decision-making system

LLM-Cave: 一个用于大型语言模型推理和决策系统的基准和轻量环境

Huanyu Li, Zongyuan Li, Wei Huang, Xian Guo

机构 * College of Artificial Intelligence Nankai University(人工智能学院 南开大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 LLM-Cave提出了一种轻量环境和基准,用于评估大型语言模型的推理和决策能力,展示了不同模型在复杂任务中的表现及改进方法。

Comments 8 pages, 5 figures, ICICN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18966 2025-11-25 cs.AI cs.CR 92%

LLM-CSEC: Empirical Evaluation of Security in C/C++ Code Generated by Large Language Models

LLM-CSEC: 对大型语言模型生成的C/C++代码安全性的实证评估

Muhammad Usman Shahid, Chuadhry Mujeeb Ahmed, Rajiv Ranjan

机构 * Independent Researcher(独立研究者) Newcastle University(新castle大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究评估了大型语言模型生成的C/C++代码安全性,发现存在大量漏洞,强调开发人员需谨慎使用此类代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15216 2025-11-25 cs.CL cs.CY 92%

Assessing Historical Structural Oppression Worldwide via Rule-Guided Prompting of Large Language Models

通过规则引导提示法评估全球历史结构性压迫

Sreejato Chatterjee, Linh Tran, Quoc Duy Nguyen, Roni Kirson, Drue Hamlin, Harvest Aquino, Hanjia Lyu, Jiebo Luo, Timothy Dye

机构 * Goergen Institute for Data Science(数据科学研究所) University of Rochester(罗切斯特大学) Department of Computer Science(计算机科学系) Department of Economics(经济学系) College of Arts and Sciences(文理学院) Rochester Institute of Technology(罗切斯特理工学院) Department of Sociology and Anthropology(社会学与人类学系) Department of Public Health(公共卫生系) University of Rochester School of Medicine(罗切斯特大学医学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL

AI总结 本文提出利用大型语言模型和规则引导提示法,评估全球历史结构性压迫,提供可扩展的跨文化测量工具。

Comments To appear in the 2025 IEEE International Conference on Big Data (IEEE BigData 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10819 2025-11-19 cs.CL 92%

LLM-as-a-Grader: Practical Insights from Large Language Model for Short-Answer and Report Evaluation

Grace Byun, Swati Rajwal, Jinho D. Choi

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06479 2025-07-09 cs.AI 92%

ExKG-LLM: Leveraging Large Language Models for Automated Expansion of Cognitive Neuroscience Knowledge Graphs

Ali Sarabadani, Kheirolah Rahsepar Fard, Hamid Dalvand

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19450 2025-05-07 cs.HC cs.AI 92%

Secret Use of Large Language Model (LLM)

Zhiping Zhang, Chenxinran Shen, Bingsheng Yao, Dakuo Wang, Tianshi Li

机构 * Northeastern University(东北大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 26 pages, 3 figures, and accepted at CSCW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20612 2025-04-30 cs.CR cs.AI cs.ET 92%

The Hidden Risks of LLM-Generated Web Application Code: A Security-Centric Evaluation of Code Generation Capabilities in Large Language Models

Swaroop Dora, Deven Lunkad, Naziya Aslam, S. Venkatesan, Sandeep Kumar Shukla

机构 * Department of IT IIIT Allahabad(信息技术系,印度阿拉哈巴德IIIT) Department of ECE IIIT Allahabad(电子工程系,印度阿拉哈巴德IIIT) Department of CSE IIT Kanpur(计算机科学与工程系,印度坎purIIT)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04601 2025-04-15 cs.CL 92%

ProtoMed-LLM: An Automatic Evaluation Framework for Large Language Models in Medical Protocol Formulation

Seungjun Yi, Jaeyoung Lim, Juyong Yoon

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Oral Presentation at the 2025 Conference on Health IT and Analytics (CHITA 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01448 2025-04-03 cs.IR cs.LG 92%

LLM-VPRF: Large Language Model Based Vector Pseudo Relevance Feedback

Hang Li, Shengyao Zhuang, Bevan Koopman, Guido Zuccon

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏