arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32006 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32006 篇

2506.04822 2026-04-02 cs.CL 89%

Evaluating Vision-Language and Large Language Models for Automated Student Assessment in Indonesian Classrooms

评估视觉语言和大语言模型用于印度尼西亚课堂自动学生评估

Nurul Aisyah, Muhammad Dehan Al Kautsar, Arif Hidayat, Raqib Chowdhury, Fajri Koto

机构 * Quantic School of Business and Technology(Quantic商业与技术学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Indonesia University of Education(印度尼西亚教育大学) Monash University(莫纳什大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 研究评估了视觉语言和大语言模型在印尼课堂中的自动学生评估效果,发现VLM在手写识别上存在困难,但LLM反馈仍具教学价值。

Comments Accepted at AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00046 2026-04-02 cs.SE cs.LG 89%

Large Language Models for Analyzing Enterprise Architecture Debt in Unstructured Documentation

大型语言模型用于分析企业架构债务中的非结构化文档

Christin Pagels, Simon Hacks, Rob Henk Bemthuis

机构 * Stockholm University(斯德哥尔摩大学) University of Twente(特温特大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文提出利用大型语言模型自动检测企业架构异味,通过案例研究验证其在非结构化文档中的有效性,展示了LLM在企业架构治理中的应用潜力。

Comments Author version, 2 figures, 5 tables. To appear in the Proceedings of the 41st ACM/SIGAPP Symposium on Applied Computing (SAC '26), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29846 2026-04-01 cs.CL 89%

SNEAK: Evaluating Strategic Communication and Information Leakage in Large Language Models

SNEAK:评估大语言模型中的战略沟通与信息泄露

Adar Avsian, Larry Heck

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 SNEAK通过模拟盟友和间谍两种角色,评估语言模型在信息共享与保密之间的平衡能力,发现当前系统在非对称信息下的战略沟通仍存在挑战,人类表现显著优于模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09938 2026-03-31 cs.CL 89%

Model Merging in the Era of Large Language Models: Methods, Applications, and Future Directions

大语言模型时代下的模型合并:方法、应用与未来方向

Mingyang Song, Mao Zheng

机构 * Tencent, China(腾讯(中国))

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文探讨了大语言模型时代模型合并的方法、应用及未来方向,通过FUSE分类体系系统回顾了算法空间、下游应用及支持生态系统,识别了关键挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25633 2026-03-27 cs.AI 89%

Is Mathematical Problem-Solving Expertise in Large Language Models Associated with Assessment Performance?

大语言模型中的数学问题解决能力是否与评估表现相关?

Liang Zhang, Yu Fu, Xinyi Jin

机构 * University of Michigan(密歇根大学) The High School Affiliated to Minzu University of China(中央民族大学附属中学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究探讨了大语言模型在数学问题解决能力与评估表现之间的关系,发现模型在解决正确问题时评估准确率更高,但步级诊断仍需额外能力支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07396 2026-03-25 quant-ph cs.AI 89%

Automating quantum feature map design via large language models

通过大语言模型自动化量子特征图设计

Kenya Sakka, Kosuke Mitarai, Keisuke Fujii

机构 * Center for Quantum Information and Quantum Biology(量子信息与量子生物学中心) Graduate School of Engineering Science(工程科学研究生院) RIKEN Center for Quantum Computing(理化学研究所量子计算中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型自主生成、评估和优化量子特征图,通过实验在MNIST等数据集上实现超越现有量子特征图的性能,展示了闭环发现方法在量子电路设计中的应用价值。

Comments 39 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22291 2026-03-25 cs.CL 89%

Evaluating Large Language Models' Responses to Sexual and Reproductive Health Queries in Nepali

评估大型语言模型对尼泊尔性与生殖健康问题的回应

Medha Sharma, Supriya Khadka, Udit Chandra Aryal, Bishnu Hari Bhatta, Bijayan Bhattarai, Santosh Dahal, Kamal Gautam, Pushpa Joshi, Saugat Kafle, Shristi Khadka, Shushila Khadka, Binod Lamichhane, Shilpa Lamichhane, Anusha Parajuli, Sabina Pokharel, Suvekshya Sitaula, Neha Verma, Bishesh Khanal

机构 * Nepal Applied Mathematics and Informatics Institute for research(尼泊尔应用数学与信息学研究所) Partnership for Sustainable Development Nepal(尼泊尔可持续发展伙伴关系) Visible Impact(可见影响)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出LEAF框架,评估大型语言模型在尼泊尔性与生殖健康问题上的准确性、语言、可用性及安全性,发现仅35.1%的回应符合标准,揭示了当前模型的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08626 2026-03-24 cs.LG cs.RO 89%

RoboMorph: Evolving Robot Morphology using Large Language Models

RoboMorph: 使用大语言模型进化机器人形态

Kevin Qiu, Władysław Pałucki, Krzysztof Ciebiera, Paweł Fijałkowski, Marek Cygan, Łukasz Kuciński

机构 * University of Warsaw(华沙大学) IDEAS NCBR Nomagic Polish Academy of Sciences(波兰科学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.LG

AI总结 RoboMorph利用大语言模型和进化算法自动生成和优化模块化机器人设计,通过结构化语法探索设计空间,结合最佳-shot提示策略和强化学习评估,在四种地形中发现多种适应性形态,展示LLM与进化选择结合的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20313 2026-03-24 cs.SE cs.AI 89%

Semantic Tool Discovery for Large Language Models: A Vector-Based Approach to MCP Tool Selection

面向大语言模型的语义工具发现:基于向量的方法用于MCP工具选择

Sarat Mudunuri, Jian Wan, Ally Qin, Srinivasan Manoharan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出基于向量检索的语义工具发现架构,通过语义索引和动态选择机制,显著降低工具调用的token消耗,提升效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20204 2026-03-24 cs.CY cs.AI 89%

Measuring Research Convergence in Interdisciplinary Teams Using Large Language Models and Graph Analytics

利用大型语言模型和图分析测量跨学科团队中的研究收敛性

Wenwen Li, Yuanyuan Tian, Sizhe Wang, Amber Wutich, Paul Westerhoff, Sarah Porter, Anais Roque, Jobayer Hossain, Patrick Thomson, Rhett Larson, Michael Hanemann

机构 * School of Geographical Sciences and Urban Planning, Arizona State University, Tempe, AZ(地理科学与城市规划学院,亚利桑那州立大学,Tempe, AZ) School of Human Evolution and Social Change, Arizona State University, Tempe, AZ(人类进化与社会变革学院,亚利桑那州立大学,Tempe, AZ) School of Sustainable Engineering and the Built Environment, Arizona State University, Tempe, AZ(可持续工程与环境学院,亚利桑那州立大学,Tempe, AZ) Kyl Center for Water Policy, Arizona State University, Tempe, AZ(水政策凯尔中心,亚利桑那州立大学,Tempe, AZ) Nicholas School of the Environment, Duke University, Durham, NC(环境学院,杜克大学,Durham, NC) Sandra Day O'Connor College of Law, Arizona State University, Tempe, AZ(索尔·达·奥康纳法学院,亚利桑那州立大学,Tempe, AZ) Center for Environmental Economics and Sustainability Policy, School of Sustainability, Arizona State University, Tempe, AZ(环境经济学与可持续政策中心,可持续性学院,亚利桑那州立大学,Tempe, AZ)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出一种多层AI驱动框架,通过大型语言模型、图可视化和人类在回路评估,分析跨学科团队研究观点的共享、影响与整合,展示其在研究收敛性分析中的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20122 2026-03-23 cs.CR cs.AI 89%

Evolving Jailbreaks: Automated Multi-Objective Long-Tail Attacks on Large Language Models

进化式越狱:针对大语言模型的自动化多目标长尾攻击

Wenjing Hong, Zhonghua Rong, Li Wang, Feng Chang, Jian Zhu, Ke Tang, Zexuan Zhu, Yew-Soon Ong

机构 * School of Artificial Intelligence(人工智能学院) Brain-Inspired Technology Co.,Ltd(脑启发技术有限公司) Department of Computer Science and Engineering(计算机科学与工程系) Southern University of Science and Technology(南方科技大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出EvoJail框架,通过多目标进化搜索自动发现长尾分布攻击,提升对大语言模型安全性的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09833 2026-03-23 cs.LG 89%

ACT as Human: Multimodal Large Language Model Data Annotation with Critical Thinking

ACT作为人类:多模态大语言模型数据标注中的批判性思维

Lequan Lin, Dai Shi, Andi Han, Feng Chen, Qiuzheng Chen, Jiawen Li, Zhaoyang Li, Jiyuan Li, Zhenbang Sun, Junbin Gao

机构 * University of Sydney(悉尼大学) University of Cambridge(剑桥大学) Riken AIP(理化学研究所AIP分所) University of Adelaide(阿德莱德大学) ByteDance Australia(字节跳动澳大利亚)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文提出ACT标注框架,利用大语言模型作为评判者提高标注效率,通过批判性思维识别潜在错误,减少人工成本,提升标注质量。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19195 2026-03-20 eess.AS cs.CL cs.SD 89%

How Auditory Knowledge in LLM Backbones Shapes Audio Language Models: A Holistic Evaluation

LLM骨干中的听觉知识如何塑造音频语言模型:全面评估

Ke-Han Lu, Szu-Wei Fu, Chao-Han Huck Yang, Zhehuai Chen, Sung-Feng Huang, Chih-Kai Yang, Yi-Cheng Lin, Chi-Yuan Hsiao, Wenze Ren, En-Pei Hu, Yu-Han Huang, An-Yu Cheng, Cheng-Han Chiang, Yu Tsao, Yu-Chiang Frank Wang, Hung-yi Lee

机构 * National Taiwan University, Taiwan(国立台湾大学) NVIDIA Academia Sinica, Taiwan(台湾“学术院”)

专题命中 评测与基准 :LLM(title,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 研究比较不同LLM在文本仅和音频基础设置下的表现,揭示听觉知识在不同家族间差异显著,文本结果与音频性能强相关。

Comments Project website: https://kehanlu.github.io/AKB

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18765 2026-03-20 cs.CL 89%

Implicit Grading Bias in Large Language Models: How Writing Style Affects Automated Assessment Across Math, Programming, and Essay Tasks

大语言模型中的隐性评分偏见:写作风格如何影响数学、编程和作文任务的自动评估

Rudra Jadhav, Janhavi Danve, Sonalika Shaw

机构 * Department of Computer Science(计算机科学系) Savitribai Phule Pune University(萨维特里·巴伊·普内大学) Dr. D. Y. Patil School of Science and Technology(D.Y.帕提尔科学与技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 研究探讨了大语言模型在内容正确性不变时,写作风格对评分的隐性偏见,发现作文任务存在显著偏见,而数学和编程任务则无显著偏见。

Comments 7 pages, 5 figures, 2 tables, 11 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18469 2026-03-20 cs.CL 89%

GAIN: A Benchmark for Goal-Aligned Decision-Making of Large Language Models under Imperfect Norms

GAIN:在不完美规范下评估大语言模型目标对齐决策的基准

Masayuki Kawarada, Kodai Watanabe, Soichiro Murakami

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 GAIN基准通过模拟现实商业场景,评估大语言模型在规范与目标冲突下的决策平衡能力,揭示影响决策的关键因素。

Comments We are working towards releasing the code in April 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06265 2026-03-20 cs.CL 89%

Large Language Models Hallucination: A Comprehensive Survey

大语言模型幻觉:全面调查

Aisha Alansari, Hamzah Luqman

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文全面调查大语言模型中的幻觉现象,分析其成因、检测与缓解方法,探讨现有评估指标及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13526 2026-03-19 cs.CL 89%

MATA: Mindful Assessment of the Telugu Abilities of Large Language Models

MATA:对大型语言模型泰卢格语能力的有意识评估

Chalamalasetti Kranti, Sowmya Vajjala

机构 * Department of Linguistics, University of Potsdam(波恩大学语言学系) National Research Council(加拿大国家研究委员会)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文介绍MATA数据集,用于评估大型语言模型在泰卢格语中的能力,包含729道精心编写的多选和开放式问题,评估11种开源和闭源LLM,并分析其表现,揭示LLM在多选题中依赖表面启发法的现象,比较LLM作为评判者与人类评估在低资源语言中的可靠性。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17123 2026-03-19 cs.CR cs.AI 89%

Security Assessment and Mitigation Strategies for Large Language Models: A Comprehensive Defensive Framework

大型语言模型的安全性评估与缓解策略:一种全面的防御框架

Taiwo Onitiju, Iman Vakilinia

机构 * School of Computing University of North Florida(北弗罗里达大学计算学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文评估了大型语言模型在关键基础设施中的安全风险,提出了一种标准化的评估框架和多层次防御系统,通过测试五种主流模型对1万多个对抗性提示的响应,揭示了安全差异,并开发了高准确率的防御框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07714 2026-03-18 cs.CR cs.AI cs.SE 89%

LLAMAFUZZ: Large Language Model Enhanced Greybox Fuzzing

LLAMAFUZZ:大语言模型增强的灰盒模糊测试

Hongxiang Zhang, Yuyang Rong, Yifeng He, Hao Chen

机构 * University of California, Davis(加州大学戴维斯分校) University of Hong Kong(香港大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出LLAMAFUZZ,利用大语言模型生成有效输入,提升灰盒模糊测试对结构化数据的处理能力,实验表明其在发现漏洞方面表现优异。

Comments The 7th ACM/IEEE International Conference on Automation of Software Test (AST 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14313 2026-03-17 cs.CL 89%

Mind the Shift: Decoding Monetary Policy Stance from FOMC Statements with Large Language Models

注意偏移:利用大语言模型从FOMC声明中解码货币政策立场

Yixuan Tang, Yi Yang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出Delta-Consistent Scoring框架,通过联合建模绝对立场和会议间相对变化,无需标注即可从FOMC声明中解码货币政策立场,实现时间一致的立场轨迹,提升分类准确率并具有经济意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13884 2026-03-17 cs.CL 89%

Too Open for Opinion? Embracing Open-Endedness in Large Language Models for Social Simulation

观点过于开放?在大型语言模型中拥抱开放性以进行社会模拟

Bolei Ma, Yong Cao, Indira Sen, Anna-Carolina Haensch, Frauke Kreuter, Barbara Plank, Daniel Hershcovich

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文探讨了在大型语言模型中采用开放性文本进行社会模拟的重要性,强调其在提升测量、探索意外观点和减少偏差方面的价值。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13317 2026-03-17 cs.LG cs.HC 89%

Evaluating Large Language Models for Gait Classification Using Text-Encoded Kinematic Waveforms

利用文本编码的运动学波形评估大语言模型用于步态分类

Carlo Dindorf, Jonas Dully, Rebecca Keilhauer, Michael Lorenz, Michael Fröhlich

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 研究评估了将连续步态运动学波形编码为文本数值序列时,通用大语言模型在步态分类中的性能,并与传统机器学习方法进行比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26495 2026-03-16 cs.AI 89%

OffTopicEval: When Large Language Models Enter the Wrong Chat, Almost Always!

OffTopicEval: 当大语言模型进入错误的聊天时,几乎总是!

Jingdi Lei, Varun Gumma, Rishabh Bhardwaj, Seok Min Lim, Chuan Li, Amir Zadeh, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Walled AI Labs(Walled AI实验室) Infocomm Media Development Authority, Singapore(新加坡信息通信媒体发展局) Lambda Labs(Lambda实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出OffTopicEval评估套件,用于衡量大语言模型在特定任务中的操作安全性,发现所有模型在操作安全方面均表现不佳,通过提示基于的引导方法显著提升模型对无关查询的拒绝能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03464 2026-03-13 cs.CL 89%

Prompting Underestimates LLM Capability for Time Series Classification

提示低估了LLM在时间序列分类中的能力

Dan Schumacher, Erfan Nourbakhsh, Rocky Slavin, Anthony Rios

机构 * The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 评测与基准 :prompting(title,abstract);LLM(title);large language model(abstract);language model(abstract)

AI总结 研究通过对比提示输出与线性探针,揭示LLM在时间序列分类中的实际能力被提示评估低估,且早期Transformer层能有效捕捉时间序列信息。

Comments 8 pages + Appendix and References, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02907 2026-03-13 cs.CL 89%

Beyond the Black Box: A Survey on the Theory and Mechanism of Large Language Models

超越黑箱:大型语言模型理论与机制的综述

Zeyu Gan, Ruifeng Ren, Wei Yao, Xiaolin Hu, Gengze Xu, Chen Qian, Huayi Tang, Zixuan Gong, Xinhao Yao, Pengwei Tang, Zhenxing Dou, Yong Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文综述了大型语言模型的理论与机制,提出生命周期分类法,分析核心理论问题并识别前沿挑战,旨在推动LLM发展向科学学科转型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11594 2026-03-13 cs.AI 89%

Leveraging Large Language Models and Survival Analysis for Early Prediction of Chemotherapy Outcomes

利用大型语言模型和生存分析进行化疗疗效的早期预测

Muhammad Faisal Shahid, Asad Afzal, Abdullah Faiz, Muhammad Siddiqui, Arbaz Khan Shehzad, Fatima Aftab, Muhammad Usamah Shahid, Muddassar Farooq

机构 * CureMD Research(CureMD研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究利用大型语言模型和生存分析技术,通过提取患者资料中的表型和治疗结果标签,提高化疗疗效预测的准确性,从而实现更个性化的治疗方案,改善患者预后。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14552 2026-03-13 cs.AI 89%

Large Language Models Assisting Ontology Evaluation

大语言模型辅助本体评估

Anna Sofia Lippolis, Mohammad Javad Saeedizade, Robin Keskisärkkä, Aldo Gangemi, Eva Blomqvist, Andrea Giovanni Nuzzolese

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究提出OE-Assist框架,利用大语言模型辅助本体评估,通过自动化和半自动化CQ验证提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10018 2026-03-12 cs.CY cs.AI 89%

DeliberationBench: A Normative Benchmark for the Influence of Large Language Models on Users' Views

DeliberationBench: 一个用于评估大语言模型对用户观点影响的规范性基准

Luke Hewitt, Maximilian Kroner Dale, Paul de Font-Reaulx

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 DeliberationBench通过评估大语言模型对用户观点影响的规范性基准,揭示了其在政策讨论中的显著影响及对民主标准的贡献。

Comments 20 pages, 6 figures, IASEAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09638 2026-03-12 cs.CL 89%

Tracking Cancer Through Text: Longitudinal Extraction From Radiology Reports Using Open-Source Large Language Models

通过文本追踪癌症:使用开源大语言模型进行放射学报告的纵向提取

Luc Builtjes, Alessa Hering

机构 * Department of Medical Imaging, Radboudumc(放射医学部,拉德堡德大学医学中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出基于开源大语言模型的放射学报告纵向信息提取方法,实现高准确率的肿瘤病变数据提取,适用于隐私敏感的医疗环境。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00307 2026-03-12 cs.AI 89%

BiasBusters: Uncovering and Mitigating Tool Selection Bias in Large Language Models

BiasBusters: 检测和缓解大语言模型中的工具选择偏差

Thierry Blankenstein, Jialin Yu, Zixuan Li, Vassilis Plachouras, Sunando Sengupta, Philip Torr, Yarin Gal, Alasdair Paren, Adel Bibi

机构 * University of Oxford(牛津大学) Microsoft(微软)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究通过基准测试揭示LLM工具选择中的系统性偏差,并提出轻量级缓解策略以减少选择偏差。

Comments ICLR 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏