arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-14 至 2026-04-14 共收录 589 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 129 篇

2604.10971 2026-04-14 cs.CV cs.AI 90%

MMR-AD: A Large-Scale Multimodal Dataset for Benchmarking General Anomaly Detection with Multimodal Large Language Models

MMR-AD:一个大规模多模态数据集,用于基于多模态大语言模型的通用异常检测基准测试

Xincheng Yao, Zefeng Qian, Chao Shi, Jiayang Song, Chongyang Zhang

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院) MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部人工智能重点实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);post-training(abstract)

AI总结 本文提出MMR-AD数据集,用于评估多模态大语言模型在通用异常检测中的性能,揭示当前SOTA模型与工业需求的差距,并提出基于推理的Anomaly-R1模型,实现了异常检测与定位的显著提升。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02578 2026-04-14 cs.CL cs.AI cs.HC cs.LG 90%

How Controllable Are Large Language Models? A Unified Evaluation across Behavioral Granularities

大型语言模型有多可控?跨行为细粒度的统一评估

Ziwen Xu, Kewei Xu, Haoming Xu, Haiwen Hong, Longtao Huang, Hui Xue, Ningyu Zhang, Yongliang Shen, Guozhou Zheng, Huajun Chen, Shumin Deng

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SteerEval基准,从语言特征、情感和个性三个领域评估LLM可控性,揭示细粒度控制效果下降问题,提供安全可控的LLM行为框架。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18931 2026-04-14 cs.AI cs.CL cs.LG 90%

Can Large Language Models Infer Causal Relationships from Real-World Text?

大语言模型能否从现实文本中推断因果关系?

Ryan Saklad, Aman Chadha, Oleg Pavlov, Raha Moraffah

机构 * Worcester Polytechnic Institute(伍斯特理工学院) Apple(苹果公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨大语言模型能否从现实文本中推断因果关系,构建了首个现实世界数据集,发现最佳模型在因果推断上的F1分数仅为0.535。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10182 2026-04-14 cs.CL cs.AI 90%

A Survey of Inductive Reasoning for Large Language Models

大型语言模型归纳推理的综述

Kedi Chen, Dezhao Ruan, Yuhao Dan, Yaoting Wang, Siyu Yan, Xuecheng Wu, Yinqi Zhang, Qin Chen, Jie Zhou, Liang He, Biqing Qi, Linyang Li, Qipeng Guo, Xiaoming Shi, Wei Zhang

机构 * East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Xi’an Jiaotong University(西安交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大型语言模型中归纳推理的方法与评估,分为训练后改进、测试时扩展和数据增强三大类,并提出统一的评估方法,为未来研究奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11871 2026-04-14 cs.CL cs.AI 90%

MegaFake: A Theory-Driven Dataset of Fake News Generated by Large Language Models

MegaFake:一种由大型语言模型生成的理论驱动的虚假新闻数据集

Lionel Z. Wang, Ka Chung Ng, Yiming Ma, Wenqi Fan

机构 * The Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MegaFake数据集,通过理论框架指导生成虚假新闻,提升虚假新闻检测的理论和实践能力。

Comments Decision Support Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11287 2026-04-14 cs.AI q-bio.OT 89%

Consistency of AI-Generated Exercise Prescriptions: A Repeated Generation Study Using a Large Language Model

人工智能生成锻炼处方的一致性:使用大型语言模型的重复生成研究

Kihyuk Lee

机构 * Seoul National University Bundang Hospital(首尔大学盆唐医院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究评估了大型语言模型生成锻炼处方在相同条件下的内在一致性,发现语义一致性高,但关键定量成分存在差异,需进一步结构约束和专家验证。

Comments 15 pages, 5 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09606 2026-04-14 cs.AI cs.SE 89%

Evaluating Reliability Gaps in Large Language Model Safety via Repeated Prompt Sampling

通过重复提示采样评估大语言模型安全性的可靠性差距

Keita Broadwater

机构 * Independent Researcher(独立研究员)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出APST框架,通过重复采样相同提示在受控条件下揭示LLM潜在故障模式,量化不同模型和配置下的操作风险,展示浅层基准分数可能掩盖持续使用下的可靠性差异。

Comments 9 pages, 4 figures; accepted at the CCAI 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13987 2026-04-14 cs.CL 89%

RiTeK: A Dataset for Large Language Models Complex Reasoning over Textual Knowledge Graphs in Medicine

RiTeK:一个用于大型语言模型在医学领域文本知识图谱上复杂推理的数据集

Jiatan Huang, Mingchen Li, Zonghai Yao, Dawei Li, Yuxin Zhang, Zhichao Yang, Yongkang Xiao, Feiyun Ouyang, Xiaohan Li, Shuo Han, Hong Yu

机构 * University of Connecticut(康涅狄格大学) University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校) School of Computing, and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院) UMass Chan Medical School(马萨诸塞大学陈医学院) University of Minnesota(明尼苏达大学) Rollins School of Public Health, Emory University(埃默里大学罗林斯公共卫生学院) Optum AI University of Massachusetts, Lowell(马萨诸塞大学洛厄尔分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出RiTeK数据集,用于评估大型语言模型在医学领域文本知识图谱上的复杂推理能力,通过合成高质量查询和专家评估,揭示现有检索方法的不足。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13166 2026-04-14 quant-ph cs.AI cs.CL cs.LG 89%

Large Language Models Can Help Mitigate Barren Plateaus in Quantum Neural Networks

大型语言模型有助于缓解量子神经网络中的 barren plateaus

Jun Zhuang, Chaowen Guan

机构 * Boise State University(博伊西州立大学) University of Cincinnati(辛辛那提大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG;LLM(comments)

AI总结 本文提出AdaInit框架,利用具有亚鞅性质的大语言模型迭代合成量子神经网络的初始参数,以维持梯度方差,缓解 barren plateaus 问题。

Comments [ACL'26 Findings] TL;DR: We propose a new LLM-driven submartingale-based framework that adaptively generates effective initial parameters for quantum neural networks to mitigate barren plateaus by leveraging LLMs with the submartingale property

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09619 2026-04-14 cs.CY cs.AI cs.CL 88%

Assessing the Pedagogical Readiness of Large Language Models as AI Tutors in Low-Resource Contexts: A Case Study of Nepal's K-10 Curriculum

评估大型语言模型作为AI辅导教师在低资源环境中的教学准备性:尼泊尔K-10课程的案例研究

Pratyush Acharya, Prasansha Bharati, Yokibha Chapagain, Isha Sharma Gauli, Kiran Parajuli

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文评估了四个先进LLM在尼泊尔K-10课程中的教学有效性,发现存在显著的课程对齐差距,提出人机协同部署策略和课程特定微调方法。

Comments 14 pages and 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09548 2026-04-14 cs.IR cs.AI 88%

Retrieval-Augmented Large Language Models for Evidence-Informed Guidance on Cannabidiol Use in Older Adults

基于检索增强的大型语言模型用于指导老年人使用大麻二酚的证据支持

Ali Abedi, Charlene H. Chu, Shehroz S. Khan

机构 * Lawrence Bloomberg Faculty of Nursing, University of Toronto(多伦多大学劳伦斯·布隆伯格护理学院) KITE Research Institute, Toronto Rehabilitation Institute, University Health Network(大学健康网络多伦多康复研究所KITE研究所) College of Engineering and Technology, American University of the Middle East(中东美国大学工程与技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出一种结合结构化提示工程与大麻二酚证据的检索增强型大型语言模型框架,用于为老年人提供安全指导,同时开发了无标注评估框架以评估AI在敏感健康场景中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06813 2026-04-14 cs.CL 88%

A Comparative Benchmark of Large Language Models for Labelling Wind Turbine Maintenance Logs

大型语言模型在风力涡轮机维护日志标注中的比较基准

Max Malyi, Jonathan Shek, Alasdair McDonald, Andre Biscaya

机构 * Institute for Energy Systems, School of Engineering, The University of Edinburgh(爱丁堡大学工程学院能源系统研究所) Nadara

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出一种可复现的框架,用于评估大型语言模型在分类复杂工业记录任务中的性能,通过对比不同模型的可靠性、效率和校准能力,发现最佳模型需结合人类在循环系统提升数据标注质量。

Comments Associated GitHub repository: https://github.com/mvmalyi/wind-farm-maintenance-logs-labelling-with-llms

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11772 2026-04-14 cs.CR 88%

Towards Automated Pentesting with Large Language Models

向大型语言模型迈进的自动化渗透测试

Ricardo Bessa, Rui Claro, João Trindade, João Lourenço

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出RedShell框架,利用微调的LLM生成针对Windows漏洞的恶意PowerShell代码,实现高效隐私保护的渗透测试自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18073 2026-04-14 cs.CV 88%

FPBench: A Comprehensive Benchmark of Multimodal Large Language Models for Fingerprint Analysis

FPBench: 多模态大语言模型在指纹分析中的综合基准测试

Ekta Gavas, Sudipta Banerjee, Chinmay Hegde, Nasir Memon

机构 * New York University(纽约大学) University of Wyoming(怀俄明大学)

专题命中 评测与基准 :large language model(title);language model(title);foundation model(abstract);prompting(abstract)

AI总结 本文提出FPBench基准测试,评估20种多模态大语言模型在7个真实和合成数据集上的8项生物识别任务,发现微调视觉和语言编码器可提升性能7%-39%。

Comments Revised version with additional experiments and code release

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07522 2026-04-14 cs.SE 88%

Byam: Fixing Breaking Dependency Updates with Large Language Models

Byam:利用大型语言模型修复破坏性依赖更新

Frank Reyes, May Mahmoud, Federico Bono, Sarah Nadi, Benoit Baudry, Martin Monperrus

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文利用大型语言模型自动修复因依赖更新导致的客户端代码问题,通过BUMP数据集验证,o3-mini模型在修复构建和编译错误方面表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01241 2026-04-14 cs.CR 88%

Peering Behind the Shield: Guardrail Identification in Large Language Models

窥视屏障之后:大型语言模型中的屏障识别

Ziqing Yang, Yixin Wu, Rui Wen, Michael Backes, Yang Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出AP-Test方法,通过对抗性提示检测黑盒AI代理中的屏障,解决安全对齐LLM和缺乏决策策略的问题,实验显示其在多种场景下实现完美分类准确率。

Comments To Appear in the 64th Annual Meeting of the Association for Computational Linguistics, July 2-7, 2026. ACL Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02311 2026-04-14 cs.CV cs.LG 87%

Inferring Dynamic Physical Properties from Video Foundation Models

从视频基础模型推断动态物理性质

Guanqi Zhan, Xianzheng Ma, Weidi Xie, Andrew Zisserman

机构 * VGG, University of Oxford(牛津大学VGG实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究通过视频预测动态物理性质,提出新数据集和三种推断方法,展示视频基础模型与多模态大语言模型的性能对比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09553 2026-04-14 cs.IR cs.AI 86%

SRBench: A Comprehensive Benchmark for Sequential Recommendation with Large Language Models

SRBench: 一个面向大型语言模型的序列推荐综合基准

Jianhong Li, Zeheng Qian, Wangze Ni, Haoyang Li, Hongwei Yao, Yang Bai, Kui Ren

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 SRBench通过多维框架、统一输入范式和新型提取机制,解决序列推荐模型评估中的公平性、稳定性与效率问题,揭示LLM-SR模型过度关注流行度而缺乏深度理解的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11655 2026-04-14 cs.CL cs.AI cs.MA 86%

RPA-Check: A Multi-Stage Automated Framework for Evaluating Dynamic LLM-based Role-Playing Agents

RPA-Check:一种多阶段自动框架,用于评估基于大语言模型的角色扮演代理

Riccardo Rosati, Edoardo Colucci, Massimiliano Bolognini, Adriano Mancini, Paolo Sernani

机构 * Department of Political Sciences, Communication and International Relations, University of Macerata(马切拉塔大学政治学、传播与国际关系系) Department of Law, University of Macerata(马切拉塔大学法律系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RPA-Check框架,通过四阶段流程评估LLM基于角色扮演代理的性能,发现模型规模与过程一致性呈反比关系,小型模型在特定场景下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10590 2026-04-14 cs.CL cs.AI 86%

Bridging Linguistic Gaps: Cross-Lingual Mapping in Pre-Training and Dataset for Enhanced Multilingual LLM Performance

弥合语言鸿沟:预训练和数据集中的跨语言映射以提升多语言大语言模型性能

Weihua Zheng, Chang Liu, Zhengyuan Liu, Xin Huang, Kui Wu, Muhammad Huzaifah Md Shahrin, Aiti Aw, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Agency for Science, Technology and Research(新加坡科技研究局)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出在预训练阶段引入跨语言映射任务,提升多语言对齐能力,通过语言对齐系数量化一致性,实验显示在机器翻译、跨语言自然语言理解及问答任务中性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09620 2026-04-14 cs.CY cs.AI cs.CL 86%

LLM Nepotism in Organizational Governance

大语言模型在组织治理中的偏袒行为

Shunqi Mao, Wei Guo, Dingxin Zhang, Chaoyi Zhang, Weidong Cai

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型在组织治理中因对AI信任态度产生的偏袒现象,提出Merit-Attitude Factorization方法以缓解该偏见。

Comments 23 pages, 3 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11154 2026-04-14 cs.AI 85%

Environmental Footprint of GenAI Research: Insights from the Moshi Foundation Model

生成式AI研究的环境足迹:来自Moshi基金会模型的洞察

Marta López-Rauhut, Loic Landrieu, Mathieu Aubry, Anne-Laure Ligozat

机构 * LIGM, CNRS, Univ Gustave Eiffel, ENPC, Institut Polytechnique de Paris(LIGM, CNRS, 古斯塔夫·埃菲尔大学, ENPC, 巴黎综合理工学院) Université Paris-Saclay, CNRS, LISN(巴黎-萨克雷大学, CNRS, LISN) Université Paris-Saclay, CNRS, ENSIIE, LISN(巴黎-萨克雷大学, CNRS, ENSIIE, LISN) Kyutai

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过细粒度分析Moshi模型的计算消耗,首次量化了生成式多模态大语言模型(MLLM)研究的环境影响,揭示了计算密集型研究的能耗与环境成本,为可持续AI研究提供指导。

Comments 28 pages, 12 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15481 2026-04-14 cs.LG 85%

LLM-as-Judge on a Budget

在预算限制下的人工智能语言模型作为裁判

Aadirupa Saha, Aniket Wagde, Branislav Kveton

机构 * UIC(伊利诺伊大学芝加哥分校) Adobe

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种基于多臂老虎机理论的变异性自适应方法,用于在有限预算下优化对提示-响应对的查询分配,以最小化评估误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23966 2026-04-14 cs.CR cs.AI 85%

Policy-Guided Threat Hunting: An LLM enabled Framework with Splunk SOC Triage

基于策略的威胁狩猎:一个由LLM赋能的框架与Splunk SOC分拣

Rishikesh Sahay, Bell Eapen, Weizhi Meng, Md Rasel Al Mamun, Nikhil Kumar Dora, Manjusha Sumasadan, Sumit Kumar Tetarave, Elyson De La Cruz

机构 * Department of Management Information Systems, University of Illinois, Springfield, USA(美国伊利诺伊大学斯普林菲尔德分校管理信息系统系) School of Computing and Communications, Lancaster University, United Kingdom(英国兰卡斯特大学计算与通信学院) School of Computer Applications, Kalinga Institute of Industrial Technology, India(印度卡林加工业技术学院计算机应用学院) School of Information Technology and Artificial Intelligence, University of Cumberlands, USA(美国坎伯兰大学信息技术与人工智能学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一个自动化威胁狩猎框架,结合LLM与Splunk平台,通过多层模型实现动态威胁适应与风险优先级评估,提升SOC分析效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11546 2026-04-14 cs.CR 85%

RLSpoofer: A Lightweight Evaluator for LLM Watermark Spoofing Resilience

RLSpoofer: 一种轻量级的LLM水印欺骗鲁棒性评估器

Hanbo Huang, Xuan Gong, Yiran Zhang, Hao Zheng, Shiyu Liang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出RLSpoofer,通过分布视角研究LLM水印对抗欺骗的鲁棒性,仅需100人水印改写训练对,使4B模型在PF文本上实现62.0%的欺骗成功率,揭示当前水印方案的脆弱性。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23514 2026-04-14 cs.CL cs.AI 84%

If an LLM Were a Character, Would It Know Its Own Story? Evaluating Lifelong Learning in LLMs

如果一个大语言模型是一个角色,它会知道自己故事吗?评估大语言模型的终身学习

Siqi Fan, Xiusheng Huang, Yiqun Yao, Xuezhi Fang, Kang Liu, Peng Han, Shuo Shang, Aixin Sun, Yequan Wang

机构 * University of Electronic Science and Technology of China(电子科技大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) Nanyang Technological University(南洋理工大学) Peking University(北京大学) Spin Matrix, China(中国Spin Matrix公司)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LIFESTATE-BENCH基准,评估LLM的终身学习能力,通过Hamlet和合成剧本数据集,发现非参数方法在管理状态学习上表现更优,但所有模型在交互延长时均面临灾难性遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10733 2026-04-14 cs.CL cs.AI 84%

Too Nice to Tell the Truth: Quantifying Agreeableness-Driven Sycophancy in Role-Playing Language Models

太过讨好而不说实话:量化角色扮演语言模型中由顺从性驱动的阿谀奉承

Arya Shah, Deepali Mishra, Chaklam Silpasuwanchai

机构 * IIT Gandhinagar(印度理工学院甘地讷格尔分校) IIT Kanpur(印度理工学院坎普尔分校) Asian Institute of Technology(亚洲理工学院)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了角色扮演语言模型中顺从性对阿谀奉承行为的影响,通过13种模型验证了顺从性与阿谀奉承的正相关性,揭示了顺从性作为预测因素的重要性。

Comments 14 Pages, 5 Figures, 9 Tables, ACL Main Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09907 2026-04-14 cs.CV cs.AI cs.CL 84%

From UAV Imagery to Agronomic Reasoning: A Multimodal LLM Benchmark for Plant Phenotyping

从无人机图像到农学推理:一种多模态大语言模型基准用于植物表型分析

Yu Wu, Guangzeng Han, Ibra Niang Niang, Francia Ravelombola, Maiara Oliveira, Jason Davis, Dong Chen, Feng Lin, Xiaolei Huang

机构 * University of Memphis(孟菲斯大学) University of Missouri(密苏里大学) University of Arkansas Division of Agriculture(阿肯色大学农业分部) Mississippi State University(密西西比州立大学)

专题命中 评测与基准 :LLM(title);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PlantXpert基准,用于大豆和棉花表型分析,评估多模态模型在农业领域的表现,发现任务特定微调显著提升准确率,但模型扩展和跨物种泛化仍面临挑战。

Comments In review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03926 2026-04-14 cs.CL 83%

Doc-PP: Document Policy Preservation Benchmark for Large Vision-Language Models

Doc-PP:大型视觉-语言模型文档政策保护基准

Haeun Jang, Hwan Chang, Hwanhee Lee

机构 * Chung-Ang University(中央大学)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出Doc-PP基准,用于评估大型视觉-语言模型在严格非披露政策下对文档的理解能力,揭示了推理诱导的安全差距,并提出DVA框架提升政策合规性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19691 2026-04-14 cs.AI stat.AP 83%

Scalable Stewardship of an LLM-Assisted Clinical Benchmark with Physician Oversight

可扩展的LLM辅助临床基准的 stewardship 与医生监督

Junze Ye, Daniel Tawfik, Alex J. Goodell, Nikhil V. Kotha, Mark K. Buyyounouski, Mohsen Bayati

机构 * Department of Operations, Information and Technology, Stanford Graduate School of Business, Stanford, CA, USA(斯坦福大学商学院运营、信息与技术系) Department of Pediatrics, Division of Critical Care Medicine, Stanford University School of Medicine, Stanford, CA, USA(斯坦福大学医学院儿科系重症监护医学部) Department of Anesthesiology, Perioperative and Pain Medicine, Stanford University School of Medicine, Stanford, CA, USA(斯坦福大学医学院麻醉学、围手术期与疼痛医学系) Department of Radiation Oncology, Stanford University School of Medicine, Stanford, CA, USA(斯坦福大学医学院放射肿瘤学系) Department of Electrical Engineering, Stanford University School of Engineering, Stanford, CA, USA(斯坦福大学工程学院电气工程系)

专题命中 评测与基准 :LLM(title,abstract);post-training(abstract);分类 cs.AI

AI总结 研究通过医生监督流程重新评估LLM辅助生成的临床基准标签,发现其可靠性不足,且影响模型性能。

Comments Github codebase: https://github.com/junzeye/validate-medcalc-labels

详情

展开后加载摘要…

URL PDF HTML 收藏