arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2611 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2611 篇

2607.27136 2026-07-30 cs.IR 新提交 83%

KAMR: Grounding Generation via Knowledge-Aligned Multi-hop Retrieval

KAMR:基于知识对齐多跳检索的接地生成

Xiaochen Wang, Yuan Zhong, Haoyu Wang, Ting Wang, Fenglong Ma

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract)

AI总结 该研究针对多跳检索中三元组排序与监督缺失问题,提出KAMR知识对齐多跳检索器,通过构建部分对齐数据集优化对比目标,在多基准与LLM主干上提升了多跳检索和下游问答性能。

Comments Accepted by COLM'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25700 2026-07-29 cs.HC 新提交 83%

BioDisclose: An Actionability-Aware Benchmark for Biomedical Safety under Adversarial Elicitation

BioDisclose:对抗性诱导下生物医学安全的可操作性感知基准

Yinuo Zhu, He Liu, Boyuan Gu

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究针对大语言模型在对抗性诱导下生物医学知识披露行为不足问题,引入BioDisclose基准,含多领域多类别提示,对模型响应四级评分,通过实验揭示不同模型、策略及风险类别差异,为评估生物医学安全提供新测试平台。

Comments 27 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17211 2026-07-21 cs.SE 新提交 83%

Prefactory: Automated Discovery and Application of Library-Adoption Refactorings

Prefactory:库采用重构的自动发现与应用

Islem Bouzenia, Michael Pradel

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract)

AI总结 研究如何自动进行库采用重构。核心方法是用 LLM 合成搜索启发式方法,收集元数据和词汇生成检测器找候选函数,排序后用 LLM 生成重构并验证。主要贡献是在 PrefactoryBench 上表现优于基线,产生多个经测试验证的重构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09007 2026-07-13 cs.SE quant-ph 新提交 83%

Benchmarking Large Language Models on Repairing Qiskit Programs using Bugs4Q

使用 Bugs4Q 对修复 Qiskit 程序的大语言模型进行基准测试

Saumya Brahmbhatt, Mitali Hukkeri, Dongchan Kim, M. V. Panduranga Rao, Lei Zhang

专题命中 评测与基准 :large language model(title);language model(title)

AI总结 研究使用 Bugs4Q 对修复 Qiskit 程序的大语言模型进行基准测试,评估两个含 67 个缺陷的 Bugs4Q 版本,在六个 Qiskit 版本上测试四个大语言模型,发现问题并发布重新验证的基准测试,强调基准验证先于修复评估。

Comments 4 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05785 2026-07-08 cs.SE 新提交 83%

Can Large Language Models Generate Observability-Aware Code?

大语言模型能否生成可观测性感知代码?

Yongliang Tao, Hongyu Zhang, Pengfei Gao, Minghua Ma, Zhiyu Fan, Yu Kang, Jue Zhang, Si Qin, Liqun Li, Qingwei Lin, Saravan Rajmohan

专题命中 评测与基准 :large language model(title);language model(title)

AI总结 研究大语言模型生成的代码在可观测性方面的表现,通过恢复工件和注入故障评估代理生成系统的源级诊断语义与运行时故障信号,发现两者存在差距,引入的技能改进有限,指出当前评估或忽视可观测性这一软件质量维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04558 2026-07-07 cs.CL cs.AI cs.LG 新提交 83%

EEG-SpikeAgent: Agentic Closed-Loop Program Synthesis for Automated EEG Spike Detection

EEG-SpikeAgent:用于自动脑电图尖峰检测的智能闭环程序合成

Sonali Santhosh, Kelly Shuhong Yu, Eugene Chang, Jonathan Kim, Kie Shidara, Danilo Bernardo

机构 * Dept. of Brain and Cognitive Sciences, Massachusetts Institute of Technology(脑科学与认知科学系,麻省理工学院) Dept. of Neuroscience, University of California, Berkeley(神经科学系,加州大学伯克利分校) Dept. of Neurology and Neurologic Sciences, Stanford University(神经病学与神经科学系,斯坦福大学) Weill Institute of Neurology and Neurosciences, University of California, San Francisco(Weill神经医学研究所,加州大学旧金山分校) University of California, San Francisco(加州大学旧金山分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究利用大语言模型智能系统,为头皮脑电图尖峰检测生成信号处理特征。核心方法是迭代提出特征模块并执行代码生成表格特征,评估性能后反馈优化。贡献是实现可审核的脑电图特征工程自动化。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02642 2026-07-07 cs.RO 新提交 83%

GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation

GigaWorld-1:构建用于机器人策略评估的世界模型路线图

GigaWorld Team, Angyuan Ma, Boyuan Wang, Bohan Li, Chaojun Ni, Guo Li, Guan Huang, Guosheng Zhao, Hao Li, Hengtao Li, Jingyu Liu, Jiwen Lu, Qiuping Deng, Tingdong Yu, Xuancheng Xu, Xinyu Zhou, Xiuwei Xu, Xinze Chen, Xiaofeng Wang, Xiaoyu Tian, Yang Wang, Yifan Chang, Yukun Zhou, Yun Ye, Zhenyu Wu, Zhanqian Wu, Zheng Zhu

机构 * GigaAI(巨元人工智能) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)

AI总结 研究机器人策略评估中世界模型,介绍WMBench基准,通过分析多种模型、方案及大量模拟策略展开,得出评估器质量受长期动作忠实性影响等核心见解,推导出设计路线图并实现GigaWorld-1。

Comments Project page: https://open-gigaai.github.io/giga-world-1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22005 2026-07-07 cs.SD 新提交 83%

InstructFX2FX: A Multi-Turn Text-to-Effect System for Sequential Audio Effect Refinement

InstructFX2FX: 用于迭代音频效果优化的多轮文本到预设演示

Song-Ze Yu, Milan Liessens Dujardin, Yuxuan Cai, Wantong Zhang, Brian Cruz, Jeremy Wagner, Carmine-Emanuele Cella

机构 * Center for New Music and Audio Technologies (CNMAT)(新音乐与音频技术中心)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract)

AI总结 提出InstructFX2FX,一种多轮文本引导的音频效果优化演示,结合语言模型和CLAP引导优化,实现迭代效果调整,相比纯LLM重提示基线将平均MMD降低约24%。

Comments Accepted to DAFx26. Audio demos and source code: https://instructfx2fx.vaclis.net/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01647 2026-07-03 cs.DB cs.AI cs.CL cs.LG 新提交 83%

AgenticDataBench: A Comprehensive Benchmark for Data Agents

AgenticDataBench:数据智能体的综合基准

Zhaoyan Sun, Shan Zhong, Daizhou Wen, Jiaxing Han, Guoliang Li, Ying Yan, Peng Zhang, Yu Su, Xiang Qi, Baolin Sun, Chengyuan Yang, Tao Fang, Huaiyu Ruan

机构 * Tsinghua University(清华大学) Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AgenticDataBench基准,通过覆盖15个垂直领域(含5个真实B2B用例)的细粒度任务,评估基于大语言模型的数据智能体在自动化数据科学工作流中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01245 2026-07-03 cs.CL cs.AI cs.CY cs.IR cs.LG 新提交 83%

Office Comprehension Benchmark

办公室理解基准

Firoz Shaik, Mateus Picanço Lima Gomes, Tanvir Aumi, Jingci Wang, Milos Milunovic, Filip Basara, Ivana Jovanovic, Vishwas Suryanarayanan, Neha Nandan Kenkare, Weiyao Xie, Zhipeng Han, Zheng Zhang, Waleed Shahid, Jay Rathi, Russell Scherer, Thong Q. Nguyen, Michael Bentley, Tamara Stankovic, Rasika Chakravarthy, Vishal Chowdhary

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Office Comprehension Bench,首个联合评估LLM对Word Excel和PowerPoint文件理解的基准,包含文件保真度问答和领域问答两个赛道,测试结构与视觉感知及多领域推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00304 2026-07-02 cs.LG cs.AI cs.CL 新提交 83%

Mapping the Evaluation Frontier: An Empirical Survey of the Bias-Reliability Tradeoff Across Eleven Evaluator-Agent Conditions

映射评估前沿:跨11种评估器-智能体条件的偏差-可靠性权衡的实证调查

Zewen Liu

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过扩展至11种评估条件,实证验证了LLM评估系统中评估器耦合、策略多样性与小样本测量可靠性之间的权衡,并发布了标准化基准数据集。

Comments 5 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31213 2026-07-01 cs.CL cs.AI cs.LG 新提交 83%

Can LLMs Imagine Moral Alternatives Beyond Binary Dilemmas?

LLMs能否想象超越二元困境的道德替代方案?

Jongchan Choi, Nari Yang, Sung Soo Park, Jaemin Cho, Han Seoyoung, Haerin Shin, Jun-Hyung Park

机构 * Korea University(高丽大学) XenoStep AI Hankuk University of Foreign Studies(韩国外国语大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLMs在道德困境中缺乏替代方案想象能力的问题,提出MoralAltDataset数据集,通过引入妥协和重构替代方案,发现LLMs倾向于选择替代方案,且生成的替代方案在质量和伦理标准上优于人类。

Comments "23 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30810 2026-07-01 cs.SE 新提交 83%

Towards Knowledge Alignment in Code LLMs: Contrastive Unlearning for Evolving APIs

面向代码大语言模型的知识对齐:针对演化API的对比性遗忘

Huy Q. Tran, Dang H. Vu, Tuyen N. Dinh, Anh H. D. Nguyen, Anh N. H. Vu, Anh M. T. Bui, Phuong T. Nguyen

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出对比性遗忘方法CURE,在抑制废弃API的同时鼓励正确替代,使代码LLM适应演化库,实验表明该方法优于现有基线。

Comments The paper has been peer reviewed and accepted to the 42nd International Conference on Software Maintenance and Evolution (ICSME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24819 2026-06-24 cs.CR 新提交 83%

HelpBench: Assessing the Ability of LLMs to Provide Privacy, Safety, and Security Advice

HelpBench:评估LLM提供隐私、安全和安全建议的能力

Sarah Meiklejohn, Sunny Consolvo, Patrick Gage Kelley, Tara Matthews, Sai Teja Peddinti, Renee Shelby, Lenin Simicich, Kurt Thomas

专题命中 评测与基准 :LLM(title_cn,summary_cn)

AI总结 提出HelpBench基准,通过450个真实用户问题评估18个LLM的隐私、安全建议准确性,发现平均得分82%但10%回答低于65%存在有害建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17789 2026-06-17 cs.HC 新提交 83%

Mind Companion: An Embodied Conversational Agent for Process-Based Psychotherapy

Mind Companion: 一种用于基于过程心理治疗的具身对话代理

Sofie Kamber, Lukas Diebold, Pascal Riachi, Stella Brogna, Andrew Gloster, Rafael Wampfler

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出Mind Companion,一种基于大语言模型的具身对话代理,通过多层级心理分析与过程治疗原则,实时分析客户陈述并生成回应,评估显示GPT-5.2在多个维度上优于人类治疗师。

Journal ref 2026 IEEE 14th International Conference on Healthcare Informatics (ICHI), Minneapolis, MN, June 1-3, 2026, pp. 980-989

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16753 2026-06-16 cs.CL cs.AI cs.LG 新提交 83%

P3B3: A Multi-Turn Conversational Benchmark for Measuring European and Brazilian Portuguese Variety Bias in LLMs

P3B3:用于测量大语言模型中欧洲和巴西葡萄牙语变体偏差的多轮对话基准

Rafael Ferreira, Inês Vieira, Inês Calvo, James Furtado, Iago Paulo, Diogo Tavares, Diogo Glória-Silva, David Semedo, João Magalhães

机构 * NOVA University of Lisbon(新里斯本大学) NOVA LINCS(NOVA LINCS实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出P3B3基准,通过专家策划的对话提示和评估框架,测量大语言模型在葡萄牙语变体(欧洲vs巴西)上的偏差和可控性,发现多数模型偏向巴西葡萄牙语。

Comments Accepted at MeLLM Workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15390 2026-06-16 cs.CL cs.AI cs.LG 新提交 83%

Not All Skills Help: Measuring and Repairing Agent Knowledge

并非所有技能都有用:测量与修复智能体知识

Yixuan Wang, Yiyang Zhou, Yiming Liang, Congyu Zhang, Fuxiao Liu, Jiawei Zhou, Huaxiu Yao

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Purdue(普渡大学) NVIDIA(英伟达)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ASSAY框架,通过随机掩码测量技能因果贡献,分离技能生成与筛选,在推理时抑制负面技能,显著提升LLM智能体任务完成率。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11459 2026-06-11 cs.CL cs.AI cs.LG 新提交 83%

APEX: Automated Prompt Engineering eXpert with Dynamic Data Selection

APEX: 具有动态数据选择的自动提示工程专家

Fei Wang, Si Si, Cho-Jui Hsieh, Inderjit S. Dhillon

机构 * Google(谷歌) UCLA(加州大学洛杉矶分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出APEX框架,通过动态数据分层(易、难、混合)优先选择高杠杆子集,在固定预算下提升提示优化效率,在三个基准上平均提升11.2%和6.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09890 2026-06-10 cs.LG cs.AI cs.CL 新提交 83%

PreAct-Bench: Benchmarking Predictive Monitoring in LLMs

PreAct-Bench:大语言模型中的预测性监控基准

Hainiu Xu, Italo Luis da Silva, Jiangnan Ye, Yuhao Wang, Wei Liu, Linyi Yang, Jonathan Richard Schwarz, Nicola Paoletti, Yulan He, Hanqi Yan

机构 * King’s College London(伦敦国王学院) National University of Singapore(新加坡国立大学) Southern University of Science and Technology(南方科技大学) Thomson Reuters Foundational Research(汤姆森路透基础研究) Imperial College London(伦敦帝国学院) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出预测性监控任务,在动作执行前判断是否会导致不道德行为,并构建PreActBench基准,评估多种模型发现该任务具有挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08345 2026-06-09 cs.CE 新提交 83%

AuditFraudBench: Benchmarking Audit Judgment in Detecting Fraudulent Misstatements

AuditFraudBench:检测欺诈性错报的审计判断基准

Zhiwei Liu, Yueru He, Qing Ou, Tianlei Zhu, Xiaorui Guo, Xueqing Peng, Sophia Ananiadou

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出AuditFraudBench基准,包含利润来源归因、误导性叙述检测和欺诈模式分类三个任务,评估LLM在审计场景中识别财务欺诈的能力,发现现有模型在联合推理财务数据与披露框架方面存在困难。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14016 2026-08-17 cs.CV cs.AI cs.GR 新提交 83%

Content Based Video Narration of Gameplay with Vision Language Models

基于内容的游戏玩法视频旁白:利用视觉语言模型

Mathew Varghese

机构 * University of Washington(华盛顿大学)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 该研究提出一种基于内容的游戏玩法视频旁白系统,利用视觉语言模型等技术生成电竞风格解说,无需游戏专用工具,支持本地化语音,还发布了可复现基线。

Comments this https URL (https://mathewvarghese.space/ai-powered-game-commentary-auto-narrating-gameplay-videos-with-gpt-4o/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11408 2026-08-13 cs.CL 新提交 83%

Measure, Don't Optimize: Forecasting Recovery in LLM Unlearning

测量,而非优化:预测大语言模型遗忘中的恢复情况

Zirui Song, Huaxing Liu, Xiang Wang, Shuai Li, Xinye Li, Lang Gao, Jinghui Zhang, Zheng Lu, Fengxian Ji, Xiaojun Chang, Xiuying Chen

机构 * AMAP, Alibaba Group(阿里巴巴集团 AMAP)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究提出推理时审计方法J-Access,对398个采用8种遗忘方法的公开模型审计后发现,J-Access可评估模型残留知识恢复易感性,直接最小化J-Access无法促进真正删除,内部审计不应随意转为优化目标。

Comments In processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09937 2026-08-12 cs.CL cs.CY 新提交 83%

Carefully Considering Culture: Analyzing LLM Alignment in Single- and Multi-Cultural Settings using Cultural Consensus Theory

仔细考量文化:利用文化共识理论分析单文化与多文化场景下的大语言模型对齐

Krishna Pothugunta, John P. Lalor

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究利用文化共识理论,分析大语言模型在单/多文化场景下的对齐情况,发现模型存在文化结构误表征问题,该理论可用于区分模型反映人类多样性与算法同质化的情况。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09285 2026-08-11 eess.SP cs.AI 新提交 83%

GLocFM: A Geometry-Aware Foundation Model for 3D Indoor Wireless Localization

GLocFM:面向三维室内无线定位的几何感知基础模型

Chenghong Bian, Chaozheng Wen, Hongze Chen, Jun Zhang

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 该研究针对现有学习式无线定位器无法利用环境几何信息的问题,提出GLocFM模型,联合利用WiFi测量与三维点云场景几何,在两类数据集上较基线降低近50%定位误差,鲁棒性与有效性经消融实验验证。

Comments 13 pages, single column

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08227 2026-08-11 cs.CL cs.HC 新提交 83%

Focus particles and scalar inferences across humans and language models

人类与语言模型的焦点小品词及标量推理

Catherine M. Brousse, Nelu D. Radpour

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本研究测试人类与大型语言模型能否从含焦点小品词的句子构建稳定标量表征,发现二者相似输出或源于不同底层机制。

Comments 3 pages, 1 figure, presented at 9th annual Conference on Cognitive Computational Neuroscience

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07631 2026-08-11 cs.SD cs.AI cs.MM 新提交 83%

PACE: A Playback-Aligned Context Engine for LLM-Based Full-Duplex Voice Dialogue

PACE:面向基于大语言模型的全双工语音对话的播放对齐上下文引擎

Shibo Wang, Zicheng Zhang, Libo Wang, Junfeng Ma

机构 * Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 该研究针对全双工语音对话的生成上下文错位问题,提出了中间件层PACE,通过将模型上下文锚定到客户端播放边界解决该问题,在GCM-Bench等数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07523 2026-08-11 cs.CY cs.AI cs.PL 新提交 83%

From Evaluated Models to Evaluation Aids: A Multi-Evidence Study of LLM-Based Difficulty Calibration for Programming Examinations

从被评估模型到评估辅助工具:面向编程考试的基于大语言模型的难度校准多证据研究

Hongfei Yan, Jiangkai Xiong, Yiqing Li, Chong Chen

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究将大语言模型作为编程考试难度校准的辅助证据,结合多类数据验证其与考试难度的相关性,可用于题目验证等场景,但存在应用限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05993 2026-08-07 cs.CL 新提交 83%

Clinical Communication Processing with Models Trained on LLM-Generated Synthetic Data: A Structured Survey and Novel Application Case Studies

基于大语言模型生成的合成数据训练模型的临床通信处理:结构化综述与新型应用案例研究

Alexander Apartsin, Yehudit Aperstein

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文综述用大语言模型生成的合成数据训练临床NLP系统的研究,结合13项无真实标注数据的案例,发现合成通信可支撑相关系统,微调编码器模型具竞争力,需真实数据迁移等完善。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04847 2026-08-06 cs.CL 新提交 83%

Do Language Models Know Their Slang? Queer Slang Understanding in User-Generated Content

语言模型了解其俚语吗?用户生成内容中的酷儿俚语理解

Arianna Denitto, Beatrice Savoldi

机构 * University of Torino(都灵大学) Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 针对酷儿俚语在自然语言处理研究中未受充分关注的问题,构建含118个酷儿术语的Slang-Q数据集,对语言模型理解酷儿俚语的能力开展首次探索性评估,为研究模型处理敏感社区语言的能力提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03731 2026-08-05 cs.AI 新提交 83%

CARE-Bench: Benchmarking Patient-Facing LLM Triage

CARE-Bench:面向患者的大语言模型分诊基准测试

Yining Hua, Hongbin Na, Cyrus Ayubcha

专题命中 评测与基准 :LLM(title,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 本研究推出面向患者的大语言模型分诊基准CARE-Bench,评估11个模型后发现提示可提升多数模型性能但仍存阈值错误,表明患者分诊需明确评估行动时机而非仅靠简单提示。

Comments Code and data are available at GitHub and Hugging Face. Submitted as a preprint

详情

展开后加载摘要…

URL PDF HTML 收藏