arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-01 至 2026-05-01 共收录 76 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 76 篇

2604.21564 2026-05-01 cs.CL 92%

Measuring Opinion Bias and Sycophancy via LLM-based Persuasion

通过基于LLM的说服测量意见偏见和阿谀奉承

Rodrigo Nogueira, Giovana Kerche Bonás, Thales Sales Almeida, Andrea Roque, Ramon Pires, Hugo Abonizio, Thiago Laitz, Celio Larcher, Roseval Malaquias Junior, Marcos Piau

机构 * Maritaca AI JusBrasil

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出llm-bias-bench方法,通过模拟多轮交互发现LLM在争议性话题上的真实立场,揭示辩论比直接提问更易引发阿谀奉承,且模型在持续争论中更倾向于模仿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27001 2026-05-01 cs.CR cs.SE 91%

An Empirical Security Evaluation of LLM-Generated Cryptographic Rust Code

对LLM生成的密码学Rust代码的实证安全评估

Mohamed Elsayed, Kenneth Fulton, Jeong Yang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文评估了三种LLM生成的加密Rust代码的安全性,发现通用工具不足,提示策略对结果影响显著,且存在nonce重用等系统性问题。

Comments 10 pages, 2 figures , EASE 2026-The 6th International Workshop on Software Security Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14719 2026-05-01 cs.AI 90%

Policy-Grounded Safety Evaluation of 20 Large Language Models

基于政策的安全性评估:20个大语言模型

Juan Manuel Contreras

机构 * Aymara

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出Aymara AI平台,用于生成和管理定制化的政策导向安全性评估。通过评估20个商业大语言模型在10个现实安全领域中的表现,揭示了模型在不同领域中的显著性能差异,强调了构建可扩展、可定制工具的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27405 2026-05-01 cs.CL cs.AI 90%

Beyond the Mean: Within-Model Reliable Change Detection for LLM Evaluation

超越平均:LLM评估中的模型内可靠变化检测

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文将临床心理学的可靠变化指数应用于LLM版本比较,发现大多数项目无可靠变化,但部分项目存在双向变化,且领域分解揭示了模型特定的反转现象。

Comments 7 pages, 4 figures, 2 tables. Pre-registered study. Code and data available

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27249 2026-05-01 cs.CL cs.AI 90%

Instruction Complexity Induces Positional Collapse in Adversarial LLM Evaluation

指令复杂性导致对抗性LLM评估中的位置崩溃

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨指令复杂性如何影响对抗性LLM评估中的位置崩溃现象,通过六种条件对抗性指令梯度测试,发现不同指令类型导致不同的响应分布和内容参与度,揭示了指令复杂性对响应机制的影响。

Comments 12 pages, 3 figures, 3 tables. Pre-registered on OSF (osf.io/7p64)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27666 2026-05-01 cs.CR 90%

VOW: Verifiable and Oblivious Watermark Detection for Large Language Models

VOW:用于大型语言模型的可验证且 oblivious 水印检测

Xiaokun Luan, Yihao Zhang, Pengcheng Su, Feiran Lei, Meng Sun

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 VOW 提出一种隐私保护且可验证的水印检测协议,通过安全多方计算和可验证 oblivious 假随机函数实现高效检测,提升水印对抗现代改写攻击的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27014 2026-05-01 cs.LG cs.CR 90%

Fidelity, Diversity, and Privacy: A Multi-Dimensional LLM Evaluation for Clinical Data Augmentation

保真度、多样性与隐私:面向临床数据增强的多维LLM评估

Guillermo Iglesias, Gema Bello-Orgaz, María Navas-Loro, Cristian Ramirez-Atencia, Mercè Salvador Robert, Enrique Baca-Garcia

机构 * Universidad Politécnica de Madrid(马德里理工大学) University Hospital Rey Juan Carlos(雷伊·卡洛斯大学医院) University Hospital Jimenez Diaz Foundation(吉梅尼兹·迪亚兹基金会大学医院) General Hospital of Villalba(维拉尔巴综合医院) University Hospital Infanta Elena(伊菲塔·埃莱娜大学医院) Universidad Catolica del Maule(马乌尔天主教大学) Madrid Autonomous University(马德里自治大学) CIBERSAM, ISCIII

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出多维LLM评估框架,用于生成符合ICD-10编码的合成心理健康评估报告,评估保真度、多样性及隐私安全,提升临床NLP训练数据质量。

Comments 9 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26955 2026-05-01 cs.CY cs.AI 90%

Policy-Governed LLM Routing with Intent Matching for Instrument Laboratories

基于意图匹配的政策引导LLM路由用于仪器实验室

Emmanuel A. Olowe, Danial Chitnis

机构 * School of Engineering The University of Edinburgh Edinburgh, UK(工程学院 苏格兰爱丁堡大学 爱丁堡 英国)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出基于意图匹配的政策引导LLM路由系统,通过Routiium和EduRouter实现对实验室辅助系统的管理和控制,提升学习挑战度和任务完成率。

Comments IEEE EduCon

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16516 2026-05-01 cs.CL 90%

Supercharging Agenda Setting Research: The ParlaCAP Dataset of 28 European Parliaments and a Scalable Multilingual LLM-Based Classification

提升议程设定研究:28个欧洲议会的ParlaCAP数据集及可扩展的多语言LLM分类方法

Taja Kuzman Pungeršek, Peter Rupnik, Daniela Širinić, Nikola Ljubešić

机构 * Jožef Stefan Institute(焦兹夫·斯蒂芬研究所) Faculty of Computer and Information Science(计算机与信息科学系) University of Ljubljana(卢布尔雅那大学) Institute of Contemporary History(当代历史研究所) Faculty of Political Science(政治科学系) University of Zagreb(扎格列布大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文介绍ParlaCAP数据集,用于分析欧洲议会议程设定,并提出一种低成本的领域特定政策主题分类方法,通过多语言ParlaMint语料库构建分类器,展示其在目标领域内的有效性。

Comments 17 pages, 7 figures, 7 tables. Presented in the PoliticalNLP 2026 workshop, co-located with LREC 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27920 2026-05-01 cs.CL cs.AI 90%

Beyond Semantics: Measuring Fine-Grained Emotion Preservation in Small Language Model-Based Machine Translation

超越语义:在小型语言模型基础上的机器翻译中细粒度情感保留的测量

Dawid Wisniewski, Igor Czudy

机构 * Poznań University of Technology(波兹南技术大学)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了三种先进的小型语言模型在回译中保持细粒度情感的能力,探讨了模型自身的情感保留能力、情感意识提示的效果以及ModernBERT在情感分类中的表现。

Comments Accepted at EAMT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27727 2026-05-01 cs.SE 89%

LLM-as-a-Judge for Human-AI Co-Creation: A Reliability-Aware Evaluation Framework for Coding

LLM作为裁判促进人机协同创造:一种可靠性感知的编码评估框架

Md Faizul Ibne Amin, Yutaka Watanobe, Daniel M. Muepu, Haruto Suzuki, Kenta Nanaumi, Md Mostafizer Rahman

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出一种基于评分标准的LLM作为裁判框架,用于编程和软件工程的人机协同创造评估,通过多指标协议评估多个LLM裁判,并分析协同创造轨迹信号,揭示协同创造成功早期集中和修订行为异质性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27319 2026-05-01 cs.CR cs.LG cs.SE 89%

REBENCH: A Procedural, Fair-by-Construction Benchmark for LLMs on Stripped-Binary Types and Names (Extended Version)

REBench:一种用于LLM在剥离二进制类型和名称上的程序性、公平构造的基准测试(扩展版)

Jun Yeon Won, Xin Jin, Shiqing Ma, Zhiqiang Lin

机构 * Ohio State University(俄亥俄州立大学) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 REBench为LLM在二进制逆向工程中提供了一个全面的基准测试集,通过知识库驱动的方法生成地面真实数据,确保任务难度和通用性,以公平评估LLM在复杂任务中的表现。

Comments This is an extended version of our paper, which appears in AIWare 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27169 2026-05-01 cs.CL cs.LG 88%

Semantic Structure of Feature Space in Large Language Models

大语言模型特征空间的语义结构

Austin C. Kozlowski, Andrei Boutyline

机构 * Knowledge Lab University of Chicago(芝加哥大学知识实验室) Department of Sociology University of Michigan(密歇根大学社会学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究发现大语言模型隐藏状态中语义特征的几何关系与人类心理关联相似,通过360个词的特征向量投影32个语义轴,发现其与人类评分高度相关,且语义轴间余弦相似度预测了尺度间相关性,同时显示语义轴在低维子空间中存在显著变异,且词在某一轴上的操控会引发其在其他尺度上的评分变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27467 2026-05-01 cs.SE cs.CL 88%

ScaleBox: Enabling High-Fidelity and Scalable Code Verification for Large Language Models

ScaleBox:实现大规模语言模型高保真和可扩展的代码验证

Jiasheng Zheng, Xin Zheng, Boxi Cao, Pengbo Wang, Zhengzhao Ma, Qiming Zhu, Jiazhen Jiang, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory(中国科学院信息处理实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 ScaleBox通过自动化特殊判题生成与管理、细粒度并行执行和配置驱动的评估套件,提升大规模代码训练的验证准确性和效率,显著优于基线方法。

Comments Accepted to ACL 2026 Demo. Our project is available at https://github.com/icip-cas/ScaleBox

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27137 2026-05-01 cs.CL 88%

Cross-Lingual Response Consistency in Large Language Models: An ILR-Informed Evaluation of Claude Across Six Languages

跨语言响应一致性在大语言模型中的研究:基于ILR的Claude多语言评估

Camelia Baluta

机构 * Independent Researcher(独立研究者) Former Faculty, Defense Language Institute Foreign Language Center(前国防语言研究院外语中心 faculty) ILR/OPI Assessment Specialist(ILR/OPI 评估专家)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文基于ILR技能描述系统,评估Claude在六种语言中的响应一致性,发现法语响应比德语更长30%,且创造性输出存在显著跨语言差异,提出ILR指导的专家评估方法补充了纯计算基准。

Comments 12 prompt clusters 6 languages 3 runs; data and code at github.com/camelbal-ship-it/crosslingual-claude-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00095 2026-05-01 cs.CV cs.AI cs.CY 88%

EDU-CIRCUIT-HW: Evaluating Multimodal Large Language Models on Real-World University-Level STEM Student Handwritten Solutions

EDU-CIRCUIT-HW:评估多模态大语言模型在真实世界大学级STEM学生手写解答中的表现

Weiyu Sun, Liangliang Chen, Yongnuo Cai, Huiru Xie, Yi Zeng, Ying Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院) Virginia Tech(弗吉尼亚理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出EDU-CIRCUIT-HW数据集,用于评估多模态大语言模型在处理包含数学公式、图表和文本推理的大学STEM学生手写解答中的性能,揭示模型在自动评分中的可靠性问题,并提出通过纠正识别错误提升AI评分系统鲁棒性的方法。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026. Project Website: https://gt-learning-innovation.github.io/CIRCUIT_EDU_HW_ACL GitHub and Dataset: https://gt-learning-innovation.github.io/CIRCUIT_EDU_HW_ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08418 2026-05-01 cs.LG cs.AI 88%

Taxon: Hierarchical Tax Code Prediction with Semantically Aligned LLM Expert Guidance

Taxon: 基于语义对齐的LLM专家指导的层级税码预测

Jihang Li, Qing Liu, Zulong Chen, Jing Wang, Wei Wang, Chuanfei Xu, Zeyi Wen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Group(阿里巴巴集团) Guangdong Laboratory of Artificial Intelligence and Digital Economy (Shenzhen)(广东人工智能与数字经济实验室(深圳))

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Taxon框架,通过语义对齐和专家指导实现层级税码预测,结合多专家架构和语义一致性模型,在实际业务中提升准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20965 2026-05-01 q-fin.TR cs.AI cs.MA q-fin.CP q-fin.ST 87%

Learning to Aggregate Zero-Shot LLM Agents for Corporate Disclosure Classification

学习聚合零样本大语言模型代理以进行企业披露分类

Kemal Kirtac

机构 * University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过聚合零样本大语言模型输出提升企业披露分类性能,发现监督聚合优于零样本投票,尤其在混合信号披露中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27421 2026-05-01 cs.IR cs.CL 87%

A Reproducibility Study of LLM-Based Query Reformulation

基于大语言模型的查询改写可重复性研究

Amin Bigdeli, Radin Hamidi Rad, Hai Son Le, Mert Incesu, Negar Arabzadeh, Charles L. A. Clarke, Ebrahim Bagheri

机构 * University of Waterloo(滑铁卢大学) Mila – Quebec AI Institute(魁北克AI研究所) Toronto Metropolitan University(多伦多 Metropolitan 大学) University of Toronto(多伦多大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文在统一框架下系统评估了十种代表性大语言模型查询改写方法,发现检索范式对改写效果有显著影响,且大模型并不总能提升下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27335 2026-05-01 cs.CV 87%

Iterative Definition Refinement for Zero-Shot Classification via LLM-Based Semantic Prototype Optimization

基于LLM的语义原型优化的零样本分类迭代定义细化

Naeem Rehmat, Muhammad Saad Saeed, Ijaz Ul Haq, Khalid Malik

机构 * University of Michigan-Flint(密歇根大学弗林特分校)

专题命中 评测与基准 :LLM(title,title_cn);foundation model(abstract)

AI总结 本文提出一种无需训练的迭代定义优化框架,通过优化类别定义提升零样本网页内容分类性能,引入三种定义优化策略,并在13种前沿嵌入模型上验证了定义质量对分类效果的关键影响。

Comments Accepted at CVPR NeXD Workshop (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27261 2026-05-01 cs.DB 86%

SynSQL: Synthesizing Relational Databases for Robust Evaluation of Text-to-SQL Systems

SynSQL: 为文本到SQL系统的稳健评估合成关系数据库

Mohammadamin Habibollah, Davood Rafiei

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 SynSQL通过合成语义一致的关系数据库,揭示了文本到SQL系统在固定基准数据库外的性能下降,为研究LLM的结构化数据合成能力提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27000 2026-05-01 cs.SE cs.CR cs.PL 86%

Adaptive and AI-Augmented Security Testing: A Systematic Survey of Program Analysis, Feedback-Driven Testing, and Hybrid Learning-Based Approaches

自适应与AI增强的安全测试:程序分析、反馈驱动测试和基于混合学习方法的系统性综述

Michael Wienczkowski

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文系统综述了自适应和AI增强的安全测试研究,探讨了程序分析、DevSecOps、反馈驱动模糊测试、LLM自动化测试生成及混合系统等五个领域,揭示了结构化程序表示与自适应测试机制之间的断层,并提出五个开放研究挑战。

Comments 29 pages, submitted for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27891 2026-05-01 cs.AI cs.LG 84%

In-Context Prompting Obsoletes Agent Orchestration for Procedural Tasks

上下文提示使代理协调在过程性任务中过时

Simon Dennis, Michael Diamond, Rivaan Patil, Kevin Shabahang, Hao Guo

机构 * University of Melbourne(墨尔本大学)

专题命中 评测与基准 :prompting(title);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文通过对比实验表明,对于过程性任务,将整个流程置于系统提示中让模型自主协调优于传统的外部代理协调框架。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07180 2026-05-01 cs.CL cs.AI cs.CV 82%

Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs

视频中的奉承:视频大语言模型中奉承行为的基准测试与分析

Wenrui Zhou, Mohamed Hendy, Shu Yang, Qingsong Yang, Zikun Guo, Yuyu Luo, Lijie Hu, Di Wang

机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证负责任人工智能与数据 analytics 实验室) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹科学与技术大学) HKUST(香港科技大学) MBZUAI(穆罕默德·本·拉希德人工智能研究所) University of Science and Technology of China(中国科学技术大学) Kyungpook National University(庆尚国立大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VISE基准,用于评估视频大语言模型在面对误导性输入时的奉承行为,通过多类型分析和两种无训练缓解策略提升模型可靠性。

Comments 27 Pages, Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27093 2026-05-01 cs.CL cs.AI 82%

Useless but Safe? Benchmarking Utility Recovery with User Intent Clarification in Multi-Turn Conversations

无用却安全?在多轮对话中通过用户意图澄清基准测试恢复效用

Mingqian Zheng, Malia Morgan, Liwei Jiang, Carolyn Rose, Maarten Sap

机构 * Carnegie Mellon University(卡内基梅隆大学) Allen Institute for AI(人工智能联盟研究所) University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CarryOnBench,首个交互式基准测试,评估LLM在多轮对话中是否能修正用户意图并恢复效用,同时保持安全。通过398个看似有害但实际无害的查询,生成5970次对话,评估14个模型的意图对齐效用和安全性能,发现模型在意图澄清后恢复效用存在不同失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12476 2026-05-01 cs.CL cs.AI 82%

When Personalization Tricks Detectors: The Feature-Inversion Trap in Machine-Generated Text Detection

当个性化技巧欺骗检测器:机器生成文本检测中的特征反向陷阱

Lang Gao, Xuhui Li, Chenxi Wang, Mingzhe Li, Wei Liu, Zirui Song, Jinghui Zhang, Rui Yan, Preslav Nakov, Xiuying Chen

机构 * MBZUAI ByteDance(字节跳动) National University of Singapore(新加坡国立大学) Wuhan University(武汉大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种检测器在个性化文本中性能变化的预测方法,揭示了特征反向陷阱对检测器鲁棒性的影响,并通过实验验证了该方法的有效性。

Comments Oral of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17056 2026-05-01 cs.CL cs.AI 82%

From Test-taking to Cognitive Scaffolding: A Pedagogical Diagnostic Benchmark for LLMs on English Standardized Tests

从应试到认知支架:一种面向LLM的教育诊断基准测试标准测试

Luoxi Tang, Tharunya Sundar, Yuqiao Meng, Shuai Yang, Ankita Patra, Lakshmi Manohar Chippada, Jiqian Zhao, Yi Li, Weicheng Ma, Zhaohan Xi

机构 * Binghamton University(宾夕法尼亚州立大学比灵顿分校) BlossomsAI(BlossomsAI公司) Dartmouth College(达特茅斯学院)

专题命中 评测与基准 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种教育诊断基准,通过认知框架模拟英语标准化测试问题解决过程,展示ESTBook基准测试在识别认知轨迹和改进教学推理中的实用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26953 2026-05-01 cs.IR cs.CY 82%

A Randomized Controlled Trial and Pilot of Scout: an LLM-Based EHR Search and Synthesis Platform

一项随机对照试验和试点:Scout:一种基于大语言模型的电子健康记录搜索与综合平台

Michael Gao, Suresh Balu, William Knechtle, Kartik Pejavara, William Jeck, Matthew Ellis, Jason Thieling, Blake Cameron, Jason Tatreau, Tareq Aljurf, Henry Foote, Michael Revoir, Marshall Nichols, Matthew Gardner, William Ratliff, Bradley Hintze, Angelo Milazzo, Sreekanth Vemulapalli

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本研究开发了Scout平台,利用大语言模型提升电子健康记录的数据检索效率,通过随机对照试验发现Scout能显著减少任务完成时间及工作负荷,同时保持输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27846 2026-05-01 cs.CL 81%

Multi-Level Narrative Evaluation Outperforms Lexical Features for Mental Health

多层级叙事评估在心理健康预测中优于词法特征

Yuxi Ma, Jieming Cui, Muyang Li, Ye Zhao, Yu Li, Yixuan Wang, Chi Zhang, Yinyin Zang, Yixin Zhu

机构 * Institute for Artificial Intelligence(人工智能研究院) School of Psychological and Cognitive Sciences(心理学与认知科学学院) School of Intelligence Science and Technology(智能科学与技术学院) State Key Laboratory of General AI(通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health(北京行为与心理健康重点实验室) PKU-Changsha Institute for Computing and Digital Economy(北京大学长沙计算与数字经济研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出多层级框架,通过830篇中文治疗文本验证,宏观层面的LLM叙事评估在心理健康预测中表现最佳,挑战了词频统计为主的传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27780 2026-05-01 cs.AR cs.AI 81%

RuC: HDL-Agnostic Rule Completion Benchmark Generation

RuC:HDL无关的规则补全基准生成

Arnau Ayguadé Domingo, Miquel Alberti-Binimelis, Cristian Gutierrez-Gomez, Emanuele Parisi, Razine Moundir Ghorab, Miquel Moreto, Gokcen Kestor, Dario Garcia-Gasulla

机构 * Barcelona Supercomputing Center(巴塞罗那超级计算中心) Universitat Politècnica de Catalunya(加泰罗尼亚理工大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 RuC通过语法驱动的方法生成HDL无关的规则补全基准,用于评估模型在RTL开发中的代码理解能力,结果显示提示策略对性能影响显著。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏