arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2747 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2747 篇

2606.24066 2026-06-24 cs.SD cs.CL eess.AS 新提交 70%

VieSpeaker: A Large-Scale Vietnamese Speaker Recognition Dataset Beyond Visual Dependency

VieSpeaker:超越视觉依赖的大规模越南语说话人识别数据集

Viet Hoang Pham, Tran Trung Nguyen, Bao Thu Ho, Phuong Tuan Dat, Thi Thu Trang Nguyen

机构 * Hanoi University of Science and Technology(河内科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出无需面部线索的数据集构建流程,利用文本元数据和大型语言模型推理说话人身份,构建包含4715名说话人约902小时语音的越南语数据集VieSpeaker,实验证明其提升模型鲁棒性和泛化能力。

Comments 5 pages, 1 figure, 6 tables, Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23877 2026-06-24 cs.SE cs.AI 新提交 70%

JupOtter: Cell-Level Bug Detection in Jupyter Notebooks

JupOtter: Jupyter Notebooks中的单元级错误检测

Lukas Ottenhof, Thibaud Lutellier

机构 * University of Alberta(阿尔伯塔大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出JupOtter系统,通过保留单元结构的标记化策略和单元级错误预测技术,在三个评估数据集中的两个上超越静态分析器和大型语言模型,实现高F1分数的单元级错误检测。

Comments Accepted at the 42nd International Conference on Software Maintenance and Evolution - ICSME 2026 (Research Papers Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23633 2026-06-23 cs.AI econ.GN q-fin.EC 新提交 70%

AI Exposure Scores: what they measure, what they miss, and what comes next

AI暴露分数:它们衡量什么、遗漏什么以及下一步是什么

Campbell Lund, Thomas Euyang, Zanele Munyikwa, Marzieh Fadaee

机构 * Cohere Labs(Cohere实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文以2023年GPTs暴露分数为案例,分析静态暴露分数在政策分析中的结构性局限,并综述五种应对方法,强调需弥合研究-政策差距。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23403 2026-06-23 cs.AI 新提交 70%

Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems

Litmus: 零标注、代码驱动的AI系统评估指标规范

Prajjwal Gupta, Prasang Gupta, Vishal Bhutani, Apoorva Sharma, Sumanth Chundru, Waqar Sarguroh, Kevin Paul

机构 * PricewaterhouseCoopers, U.S.(普华永道(美国))

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出Litmus系统,通过分析源代码自动生成评估指标,无需人工标注,在三个真实AI流水线上优于基线方法。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21930 2026-06-23 cs.CL 新提交 70%

MindTailor: Personalized Emotional Support via Post History-Grounded Case Formulation and Collaborative Refinement

MindTailor: 通过历史帖子基于案例构建和协作精炼的个性化情感支持

Suhyun Han, Kyunghyun Cho, JinYeong Bak

机构 * Sungkyunkwan University(成均馆大学) New York University(纽约大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出MindTailor框架,利用求助者历史帖子构建案例,并通过基于不同咨询策略的协作批评迭代精炼回复,在Reddit数据集上优于基线,提升共情和个性化。

Comments 45 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21657 2026-06-23 cs.CV cs.CL 新提交 70%

Chehre: An Emoji-Prompted Video Dataset for Perceptually Diverse Facial Expression Recognition

Chehre: 一个用于感知多样面部表情识别的表情符号提示视频数据集

Bita Azari, Zoe Stanley, Avneet Batra, Poorvi Bhatia, Hali Kil, Manolis Savva, Angelica Lim

机构 * Simon Fraser University(西蒙弗雷泽大学)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.CL

AI总结 提出Chehre数据集,通过表情符号提示收集动态面部表情视频,并转移至合成人脸以保护隐私,定义主导和分布表情识别任务,基准测试显示现有模型表现有限。

Comments 16 pages, 8 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21618 2026-06-23 cs.CL 新提交 70%

CulMind: Benchmarking Multimodal Understanding and Reasoning in Chinese Cultural Heritage

CulMind:中国文化遗产中的多模态理解与推理基准

Zhangwei Cao, Shuhan Fan, Yuting Wei, Jiajun Zhang, Yihang Peng, Qi Meng, Yangfu Zhu, Liangbin Yang

机构 * University of International Relations(国际关系学院) Kedge Business School(凯致商学院) Peking University(北京大学) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Capital Normal University(首都师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有基准忽视推理过程的问题,提出CulMind和CulMind-R基准,涵盖50个任务和24个推理子任务,并设计ReaScore指标评估推理质量,揭示答案与推理之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21222 2026-06-23 cs.RO cs.AI 新提交 70%

FleetAgent: Teleoperation Assistant for Autonomous Fleets via Vectorized V2N Messages

FleetAgent: 通过向量化V2N消息实现自主车队远程操作助手

Juntong Peng, Qi Chen, Deyuan Qu, Takayuki Shimizu, Yaobin Chen, Ziran Wang

机构 * College of Engineering, Purdue University(普渡大学工程学院) Toyota InfoTech Labs(丰田信息技术实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出FleetAgent,一种基于多模态大语言模型的云端助手,通过紧凑的向量化V2N消息实现高效远程操作监控,显著降低上行负载和内存占用,并提升操作员优先级判断与干预效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20608 2026-06-23 cs.CY cs.AI cs.CV 新提交 70%

CourseBlueprint: A Structured Pipeline for Adaptive Pedagogical Video Generation Grounded in Course Corpora

CourseBlueprint:基于课程语料库的自适应教学视频生成的结构化流程

Md Zabirul Islam, Md Motaleb Hossen Manik, Ge Wang

机构 * Department of Computer Science, Rensselaer Polytechnic Institute(计算机科学系,拉特格斯理工学院) Department of Biomedical Engineering, Rensselaer Polytechnic Institute(生物医学工程系,拉特格斯理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出CourseBlueprint流程,通过结构化教学蓝图(含先决条件图、自适应控制、参与合约)从课程语料库生成自适应教学视频,实验证明显式教学合约比表面流畅性更关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20512 2026-06-23 cs.SE cs.LG 新提交 70%

Probe-and-Refine Tuning of Repository Guidance for Coding Agents

代码代理的仓库指导的探测与精炼调优

Asa Shepard, Jeannie Albrecht

机构 * Williams College(威廉姆斯学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出探测与精炼调优方法,通过合成bug修复探测迭代诊断和修补仓库指导文件,在SWE-bench Verified上以Qwen3.5-35B-A3B模型达到33.0%解决率,优于静态知识库的28.3%和无指导基线的25.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20177 2026-06-23 cs.CV cs.AI 新提交 70%

Evaluating and Enhancing Negation Comprehension in Remote Sensing MLLMs

评估与增强遥感多模态大语言模型的否定理解能力

Haochen Han, Jue Wang, Alex Jinpeng Wang, Fangming Liu

机构 * Peng Cheng Laboratory(鹏城实验室) Tsinghua University(清华大学) Central South University(中南大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出RS-Neg基准评估遥感MLLMs的否定理解,并设计NeFo方法通过测试时学习利用约5%未标注样本显著提升模型性能。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20527 2026-06-19 cs.CL cs.CV 新提交 70%

StylisticBias: A Few Human Visual Cues Drive Most Social Biases in MLLMs

StylisticBias: 少数人类视觉线索驱动多模态大语言模型中的大部分社会偏见

Shaghayegh Kolli, Timo Cavelius, Nafiseh Nikeghbal, Samantha Dalal, Jana Diesner

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Princeton Center for Information and Technology Policy(普林斯顿信息与技术政策中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出StylisticBias基准,通过控制单一视觉属性变化,发现年龄和体型主导身份层面偏见,而时尚风格等约15个属性解释近80%的偏见变化,偏见集中于少数视觉线索。

Comments Accepted to the non-archival workshops AI4Good and Culture x AI at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19965 2026-06-19 cs.CV cs.AI 新提交 70%

ROSE: Benchmarking the Perception-to-Action Gap in Multimodal Models

ROSE:多模态模型中感知到行动差距的基准测试

Yihao Wang, Zijian He, Jie Ren, Keze Wang

机构 * Sun Yat-sen University(中山大学) Shaanxi Normal University(陕西师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ROSE基准,通过固定视觉场景并变化区域约束与符号输出,测试多模态大模型在不同上下文中将相同视觉证据转化为所需行动的能力,发现模型性能下降高达44.5个百分点,揭示感知到行动的瓶颈。

Comments 29 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19881 2026-06-19 cs.CL 新提交 70%

REDACT: A Systematically Controlled Multilingual Benchmark for Personal Information Detection

REDACT:一个系统控制的个人信息检测多语言基准

Guneesh Vats, Anubha Agrawal, Shikha Singhal, Ajita Dash, Praison Selvaraj, Vidhan Jhawar, Ranga Prasad Chenna, Bharadwaj Y M G

机构 * ServiceNow

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出REDACT基准,包含13,427条记录、51种实体类型、25种语言,通过强度-2覆盖阵列采样控制9个生成轴,并引入实体级元数据(披露状态、形式、GDPR敏感层级)以支持分层评估,揭示检测器在敏感数据上的架构依赖性失败模式。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19795 2026-06-19 cs.SE cs.AI 新提交 70%

Agentic Electronic Design Automation: A Handoff Perspective

代理式电子设计自动化:一种交接视角

Jiawei Liu, Peiyi Han, Yuntao Lu, Su Zheng, Fengyu Yan, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Primarius Technologies(Primarius技术公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文从交接有效性角度出发,将EDA流程中的代理系统分为三类,并提出五层代理通信协议,以解决多阶段、多工具间的状态传递和验证问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19668 2026-06-19 cs.CL 新提交 70%

Code-Switching Reveals Language Anchoring in Multilingual LLMs

代码切换揭示多语言大模型中的语言锚定

Jeonghyun Park, Seunghyun Yoon, Yonghyun Jun, Hwanhee Lee

机构 * Chung-Ang University(中央大学) Adobe Research(Adobe研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过语法强制代码切换诊断多语言大模型中的语言锚定现象,提出锚定偏差度量并设计CANVAS干预方法,有效缓解代码切换导致的问答性能下降。

Comments 36 pages, 13 figures, 27 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19647 2026-06-19 cs.CL cs.CY cs.SI 新提交 70%

From 50K to 8.2 Million in 24 Hours: Vozinha's Algorithmic Consecration and the Multilingual Making of World Cup Visibility

从5万到820万在24小时内:Vozinha的算法封圣与世界杯可见性的多语言构建

Vinicius Covas

机构 * Universidad Anáhuac México(墨西哥阿纳瓦克大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 通过多语言语料库和九框架叙事分类法,分析2026年世界杯后Vozinha的算法封圣过程,揭示不同语言承载不同叙事框架,将平台粉丝数作为语言对象研究可见性构建。

Comments 11 pages, 4 figures, 3 tables; v0.1 pilot preprint. Dataset and evidence package available at https://doi.org/10.5281/zenodo.20722235

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19613 2026-06-19 cs.SE cs.AI 新提交 70%

StaminaBench: Stress-Testing Coding Agents over 100 Interaction Turns

StaminaBench: 对编码智能体进行100轮交互的压力测试

Vlad Sobal, Shuo Yang, Yuting Zhang, Wei Xia, Stefano Soatto

机构 * AWS Agentic AI(AWS 代理人工智能)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出StaminaBench基准,通过100轮连续变更请求测试编码智能体的耐力,发现所有模型在5-6轮内失败,而测试反馈和重试机制可将通过轮数提升12倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19407 2026-06-19 cs.SE cs.AI 新提交 70%

JustDiag!: A Diagnostic Justification Engine for Accountable Root Cause Analysis

JustDiag!:用于可问责根本原因分析的诊断论证引擎

Tingzhu Bi, Xinrui Jiang, Xun Zhang, Pengcheng Su, Congjie He, Jinglin Li, Ping Wang, Meng Ma

机构 * Peking University(北京大学) University of Edinburgh(爱丁堡大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出JustDiag诊断论证引擎,通过维护显式的过程状态(证据、发现、竞争假设、冲突和下一步检查)来支持可问责的根本原因分析,在66个真实事件上评估显示其优于仅提供流畅最终答案的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19256 2026-06-18 cs.AI 新提交 70%

X+Slides: Benchmarking Audience-Conditioned Slide Generation

X+Slides:面向受众条件的幻灯片生成基准测试

Haodong Chen, Xuanhe Zhou, Wei Zhou, Xinyue Shao, Yanbing Zhu, Bo Wang, Jiawei Hong, Anya Jia, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学) SenseTime

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出X+Slides基准,通过动态评估框架和受众特定权重,衡量幻灯片生成系统在受众覆盖、领域覆盖、效率和正确性方面的表现,揭示现有系统在受众关键信息恢复上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19218 2026-06-18 cs.CL 新提交 70%

RECOM: A Validity Discrimination Tradeoff in Automatic Metrics for Open Ended Reddit Question Answering

RECOM:开放式 Reddit 问答中自动评估指标的有效性与区分性权衡

Pushwitha Krishnappa, Amit Das, Vinija Jain, Aman Chadha, Tathagata Mukherjee

机构 * University of Alabama Huntsville(阿拉巴马大学亨茨维尔分校) University of North Alabama(北阿拉巴马大学) Stanford University(斯坦福大学) Meta AI Amazon GenAI(亚马逊生成人工智能)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出 RECOM 数据集,发现自动评估指标在开放式问答中无法同时兼顾有效性和区分性,余弦相似度有效性高但区分性差,BERTScore 区分性受长度影响且有效性弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18548 2026-06-18 cs.CY cs.AI 新提交 70%

Engagement Intensity as a Learner-Modeling Signal for Adaptive AI Ethics Instruction

参与强度作为自适应AI伦理教学的学习者建模信号

Yongkyung Oh, Lynn Talton, Alex Bui

机构 * University of California, Los Angeles (UCLA)(加州大学洛杉矶分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究比较了三种学习者特征(使用频率、自评熟悉度、先前AI教育)与AI感知结果的关系,发现使用频率与所有五项结果显著相关,为自适应AI伦理教学提供了简单的入学者建模信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17453 2026-06-18 cs.AI 新提交 70%

MapSatisfyBench: Benchmarking Satisfaction-Aware Map Agents through Behavior-Grounded Implicit Decision Factors

MapSatisfyBench: 通过行为隐含决策因素基准测试满意度感知的地图智能体

Lubin Bai, Mengyu Cao, Sixue Wang, Zhongwei Wan, Yue Pan, Jiale Hou, Xiang Li, Xiuyuan Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MapSatisfyBench基准,通过恢复用户行为链中的隐含决策因素来评估地图智能体的满意度感知能力,实验表明现有智能体在显式任务完成上表现良好,但在满足隐含需求方面仍有局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17786 2026-06-17 cs.HC cs.CL 新提交 70%

Toward Accessible Psychotherapy Training Using AI-Driven Interactive Patient Avatars

利用AI驱动的交互式患者化身实现可及的心理治疗培训

Pascal Riachi, Sofie Kamber, Stella Brogna, Andrew Gloster, Rafael Wampfler

机构 * ETH Zurich(苏黎世联邦理工学院) University of Lucerne(卢塞恩大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一个通过具身虚拟患者进行对话训练ACT心理治疗师的系统,利用大语言模型模拟患者行为,并提供基于ACT保真度标准的逐轮反馈,专家评估证实了高真实性和培训效果。

Journal ref 2026 IEEE 14th International Conference on Healthcare Informatics (ICHI), Minneapolis, MN, June 1-3, 2026, pp. 990-995

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17574 2026-06-17 cs.AI 新提交 70%

DeepInsight: A Unified Evaluation Infrastructure Across the Physical AI Stack

DeepInsight:跨物理AI栈的统一评估基础设施

Siyi Li, Chunyu Sun, Jiahao Zhang, Yuchen Kang, Wuliang Wang, Yu Qiu, Rui Jiang, Haitao Cui, Jie Chen

机构 * Xiaopeng(小鹏汽车)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出DeepInsight,一个在单一运行时上支持物理AI栈全谱系评估的基础设施,通过三个抽象(任务、资源、结果)保持异构性,实现跨层回归诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17092 2026-06-17 cs.CR cs.CL 新提交 70%

Securing Multi-Agent GIS Systems: Risk Evaluation and Prompt Hardening Optimization

保护多智能体GIS系统:风险评估与提示硬化优化

Kyle Gao, Pranavi Kotta, Linlin Xu, Jonathan Li, David A. Clausi

机构 * Department of Systems Design Engineering, University of Waterloo(系统设计工程系,滑铁卢大学) Department of Mechatronics Engineering, University of Waterloo(机电工程系,滑铁卢大学) Department of Geomatics Engineering, University of Calgary(测绘工程系,卡尔加里大学) Department of Geography and Environmental Management, University of Waterloo(地理与环境管理系,滑铁卢大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对多智能体GIS系统的安全风险,提出基于模块化状态机编排和提示优化的安全框架,通过红队测试和对抗演示提升系统鲁棒性。

Comments Kyle Gao and Pranavi Kotta contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16070 2026-06-17 cs.AI 新提交 70%

Mind-Studio: Executable World Models with Lookahead Evaluation for Partially Observable Games

Mind-Studio: 针对部分可观测游戏的可执行世界模型与前向评估

Yifei Dong, Mingen Zheng, Linquan Wu, Jeff Z. Pan, Jiaxin Bai

机构 * Hong Kong University of Science and Technology(香港科技大学) City University of Hong Kong(香港城市大学) University of Edinburgh(爱丁堡大学) Hong Kong Baptist University(香港浸会大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Mind-Studio框架,利用大语言模型从轨迹合成可执行的pygame风格世界模型,通过K步前向保真度协议评估,在Montezuma's Revenge等游戏中显著提升预测准确性和子目标验证。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09376 2026-06-17 cs.CL 新提交 70%

Precision Is Not Faithfulness: Coverage-Aware Evaluation of Grounded Generation with a Complete Oracle

精确性不等于忠实度:基于完全神谕的覆盖感知接地生成评估

Juan S. Santillana

机构 * Globant

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对参考无关忠实度指标仅测量精确性而忽略召回率的问题,提出利用完全神谕(F1赛事和NOAA天气预报)测量覆盖度,并设计结合精确性与覆盖度的综合指标及验证器引导生成方法。

Comments 9 pages. v2: adds Anthropic Claude + 3 additional fine-tuned bases (1B-7B); 6 frontier families x 3 languages. Code https://github.com/vectrayx/precision-is-not-faithfulness Demo https://huggingface.co/spaces/jsantillana/faithful-strategy-engineer-f1

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17005 2026-06-16 cs.AI stat.ME 新提交 70%

Bayesian Inference and Decision Audits for Public Archives of Frontier AI Evaluations

前沿AI评估公共档案的贝叶斯推断与决策审计

Yanan Long

机构 * Yanan Long

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过贝叶斯推断和审计方法,分析公共AI评估档案中的选择性报告和缺失数据,发现单一终端记录与多种历史路径兼容,并验证了审计门限对虚假声明的过滤作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16560 2026-06-16 cs.CL 新提交 70%

The BD-LSC Dataset: Facilitating the Benchmarking of Models for Lexical Semantic Change Detection in Slang and Standard Usage

BD-LSC数据集:促进俚语与标准用法中词汇语义变化检测模型的基准测试

Afnan Aloraini, Viktor Schlegel, Goran Nenadic, Riza Batista-Navarro

机构 * The University of Manchester(曼彻斯特大学) Qassim University(卡西姆大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对词汇语义双向变化及俚语与标准用法混合的挑战,构建BD-LSC和ST-WSD两个基准数据集,评估多种方法,发现稀有俚语义项仍是核心难题。

详情

展开后加载摘要…

URL PDF HTML 收藏