arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-30 至 2026-06-30 共收录 602 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 143 篇

2606.29750 2026-06-30 cs.CL 81%

Managing Map Cardinality in Automatic Disease Classification Mapping: Balancing Precision, Recall and Coverage

管理自动疾病分类映射中的映射基数:平衡精确率、召回率和覆盖率

Santosh Purja Pun, Oliver Obst, Jim Basilakis, Jeewani Anupama Ginige

机构 * Western Sydney University(西悉尼大学) UNSW Sydney(新南威尔士大学悉尼分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一种受实体解析中阻塞-匹配流程启发的方法,先生成候选匹配块,再用大语言模型识别有效映射,在多个ICD版本对间实现了更高精确率、相当召回率和更广覆盖率。

Comments Main text: 8 pages, 1 table and 3 figures; Appendix: 8 pages, 11 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28556 2026-06-30 cs.AI 81%

IMCBench: A benchmark for multimodal LLMs in Image-grounded Medical Conversations

IMCBench:面向多模态大语言模型在图像基础医疗对话中的基准测试

Maria Xenochristou, Ashutosh Joshi, Korosh Vatanparvar, Mohammad Abuzar Hashemi, Prasad Kasu, Deepak Bansal, Anchal Nema, Nivedita Wadhwa, Prashams S Jain, Rebecca Abraham, Will Kimbrough, Dilek Hakkani-Tur, Wilko Schulz-Mahlendorf

机构 * Amazon Health AI(亚马逊健康AI)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出IMCBench基准,结合临床图像与合成患者档案模拟多轮医疗对话,从安全性、准确性和不确定性使用三个维度评估模型,发现准确描述不等于安全指导。

Comments Accepted at ECML PKDD 2026. 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28526 2026-06-30 cs.CL cs.HC 81%

A French OSCE Dialogue Dataset and Controllable Virtual Patient System for Clinical Training

用于临床训练的法国OSCE对话数据集和可控虚拟患者系统

Doria Bonzi, Tom Bourgeade, Fabrice Lefèvre, Irina Illina

机构 * Lorraine Université, CNRS, Inria, LORIA(洛林大学、法国国家科学研究中心、法国国家信息与自动化研究所、LORIA实验室) Avignon Université, LIA, UPR 4128(阿维尼昂大学、LIA、UPR 4128)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 为解决医学培训中标准化病人稀缺问题,构建法语OSCE对话数据集,并提出基于LLM的可控虚拟患者生成管道,通过检索增强和反思循环提升真实性与一致性,实验表明可控性模块改善患者保真度和学生评估一致性。

Comments 9 pages. Accepted at SIGDIAL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28360 2026-06-30 cs.IR cs.AI 81%

Carolina Guide: A Multi-Agent RAG System with Institutional Guardrails for Academic Policy Assistance

Carolina Guide:具有机构护栏的多智能体RAG系统用于学术政策咨询

Ben Torsion, Jun Zhou

机构 * University of South Carolina(南卡罗来纳大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Carolina Guide系统,采用模块化多智能体管道与机构护栏,基于检索增强生成提供学术政策咨询,在90查询测试集上达到98.9%检索成功率,安全F1为0.89。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28336 2026-06-30 cs.IR cs.AI 81%

HyBIRD: Hyperbolic Bridge Retrieval and Diagnosis for Methodology Inspiration Retrieval

HyBIRD: 双曲桥检索与诊断用于方法论灵感检索

Yang Yang, Boyun Xu, Hao Fu, Jindong Li, Zining Zhong, Bowen Tian, Jiemin Wu, Menglin Yang, Yutao Yue

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出HyBIRD框架,将方法论灵感检索建模为双曲桥检索,通过轻量级双曲桥变体保持密集检索性能,并利用LLM辅助方法块进行事后解释和证据选择,实现可检查的查询需求分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28328 2026-06-30 cs.IR cs.LG 81%

TextClusterLab: An Integrated Framework for Reliable Text Clustering Studies

TextClusterLab:一个可靠的文本聚类研究集成框架

Daoming Wan, Yizheng Huang, Jimmy X. Huang

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出TextClusterLab框架,包含基于大语言模型的文本聚类数据集生成器和基准测试,支持设置聚类属性,用于评估算法鲁棒性和多样性。

Comments 13 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30410 2026-06-30 cs.LG cs.AI 81%

Beyond IID: How General Are Tabular Foundation Models, Really?

超越IID:表格基础模型到底有多通用?

Lennart Purucker, Andrej Tschalzev, Nick Erickson, Gioia Blayer, David Holzmüller, Alan Arazi, Alexander Pfefferle, Mustafa Tajjar, Gaël Varoquaux, Frank Hutter

机构 * Prior Labs University of Freiburg(弗赖堡大学) University of Mannheim(曼海姆大学) INRIA Saclay(法国国家信息与自动化研究所萨克雷研究中心) Technion(技术学院) ELLIS Institute Tübingen(图宾根ELLIS研究所) Zuse School ELIZA(Zuse学校ELIZA)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 针对表格数据基础模型评估碎片化问题,提出统一基准BeyondArena,涵盖多种任务类型、数据规模和特征类型,发现现有模型在IID小数据上表现优异,但非IID、大数据和高维数据仍由传统模型主导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29196 2026-06-30 cs.LG cs.CL 81%

Representational Depth of Evaluation Awareness Shifts With Scale in Open-Weight Language Models

评估意识表征深度随规模在开放权重语言模型中变化

Archit Manek

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究发现,在Qwen 2.5和Gemma 2等模型中,评估意识线性可恢复的层从较小模型的后期层转移到较大模型的早期层,表明规模改变了评估意识的表征深度,且白盒探针信号强于黑盒行为表达。

Comments 9 pages, 3 figures. Accepted at the Mechanistic Interpretability Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04080 2026-06-30 cs.IR 版本更新 80%

Caption Injection for Optimization in Generative Search Engine

生成搜索引擎中的标题注入用于优化

Xiaolu Chen, Jie Bao, Haojie Wu, Zhen Chen, Yong Liao

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Caption Injection,一种多模态G-SEO方法,通过提取图像标题并注入文本内容,提升生成搜索中的主观可见性,实验表明其在G-EVAL指标下优于文本-only基线。

Comments 24 pages, 4 figures, ECML PKDD 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30104 2026-06-30 cs.AI 79%

Temporal Feature Extractors in EEG Foundation Models: A Controlled Comparison Including a Pretrained Time-Series Model

脑电图基础模型中的时间特征提取器:包含预训练时间序列模型的受控比较

Ayşe Betül Yüce, Chris Joey Leffler, Sarun Varghese, Myra Spiliopoulou, Sebastian Stober

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 本文在统一脑电图基础模型框架下,受控比较了三种时间特征提取策略(线性基线、卷积编码器、冻结预训练时间序列模型MOMENT),发现预训练TSFM可作为有效的时间特征提取器,但效果因下游任务而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29984 2026-06-30 cs.AI 79%

Be Faithful When Response: Returning Fluent and Grounded Answers for Vision-Language Models Reinforcement Learning

回答时保持忠实:为视觉语言模型强化学习返回流畅且基于视觉依据的答案

Peng, Lee, Yin Zhang, Yanglin Zhang, Haonan Wu, Zishan Liu, Ruoxi Zang, Xin Zhu, Jiayin Zheng, Jian Yao, Zefeng Ji, Fei Ma

机构 * GMLab Hong Kong Polytechnic University(香港理工大学) XPENG Robotics(XPENG机器人)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 提出Faithful Warm-Start (FWS)策略,通过构建具有明确视觉-语言因果关系的FaithfulQA数据集并利用VLM裁判净化,在强化学习前预热模型,提升答案准确性、稳定训练并减少无视觉依据的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29664 2026-06-30 cs.CV cs.LG 79%

Benchmarking Geospatial Foundation Models for Agriculture Applications

农业应用的地理空间基础模型基准测试

Zhuocheng Shang, Sanmay Das, Ahmed Eldawy

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 通过跨区域分割和变化检测任务,系统评估Prithvi、SpectralGPT和SatMAE三个地理空间基础模型在农业应用中的地理迁移能力,发现区域分布偏移导致性能严重下降,并指出输入格式差异影响架构比较。

Comments Submitted to ACM SIGSPATIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17801 2026-06-30 cs.AI 79%

Integrating Counterfactual Simulations with Language Models for Explaining Multi-Agent Behaviour

将反事实模拟与语言模型结合以解释多智能体行为

Bálint Gyevnár, Christopher G. Lucas, Stefano V. Albrecht, Shay B. Cohen

机构 * DeepFlow

专题命中 评测与基准 :language model(title);LLM(abstract);分类 cs.AI

AI总结 本文提出AXIS方法,通过语言模型与环境模拟器交互生成人类中心的多智能体行为解释,提升解释正确性和目标预测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08108 2026-06-30 cs.CV cs.CL cs.CR 79%

Exploiting Vision Encoder Vulnerabilities for Universal Adversarial Perturbations on Large Vision-Language Models

利用视觉编码器漏洞对大视觉-语言模型生成通用对抗扰动

Hee-Seon Kim, Minbeom Kim, Seokil Ham, Changick Kim

机构 * KAIST(韩国科学技术院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文研究了大视觉-语言模型在输入图像中对小对抗扰动的脆弱性,提出了一种针对视觉编码器内部组件的通用对抗扰动攻击框架,通过分析注意力机制识别关键脆弱组件,实现高效攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12078 2026-06-30 cs.MA cs.AI cs.CL cs.CY cs.SI 79%

Modeling Earth-Scale Human-Like Societies with One Billion Agents

用十亿个智能体建模地球尺度的人类社会

Haoxiang Guan, Jiyan He, Liyang Fan, Zhenzhen Ren, Shaobin He, Xin Yu, Yuan Chen, Xueyin Xu, Shuxin Zheng, Yan Gao, Enhong Chen, Tie-Yan Liu, Zhen Liu

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) Shenzhen University(深圳大学) Shanghai University of Finance and Economics(上海财经大学) Tsinghua University(清华大学) Fudan University(复旦大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Light Society框架,通过结合大语言模型与优化算法,实现高效模拟十亿级智能体的社会现象,验证了其在信任游戏和意见扩散中的高保真度与效率。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02742 2026-06-30 cs.CV 78%

Consistent Yet Wrong: Evidence Insensitivity in Spatial Vision-Language Models

一致但错误:空间视觉-语言模型中的证据不敏感性

S Divakar Bhat, Toshihiko Yamasaki

机构 * The University of Tokyo, Japan(东京大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 通过引入ViewDiag多视图评估协议,发现现代视觉-语言模型在空间推理中表现出跨视角一致但错误的现象,表明其预测主要源于先验驱动而非证据敏感推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29887 2026-06-30 cs.AI 77%

SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing

SafePyramid: 一种用于上下文策略护栏的分层基准

Jiacheng Zhang, Haoyu He, Sen Zhang, Shen Wang, Xiaolei Xu, Yuhao Sun, Meng Shen, Feng Liu

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 提出SafePyramid基准,包含1000轮多领域对话和3000条应用特定策略,通过三级难度评估LLM在上下文中执行策略护栏的能力,发现当前模型表现有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29437 2026-06-30 cs.HC cs.AI cs.CY 77%

LLMography: Transforming Human-AI Conversations into Traceability, Oversight, and Auditability Indicators

LLMography:将人机对话转化为可追溯性、监督和可审计性指标

Mohammed Bousmah

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出LLMography框架,通过分析人机对话历史生成可追溯性、人类贡献、AI依赖等KPI指标,促进AI透明度从输出检测转向交互过程记录。

Comments Preliminary exploratory study; 19 anonymized student audit reports; includes prototype screenshots

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28430 2026-06-30 cs.SE cs.AI 77%

Building to the Test: Coding Agents Deliver What You Check, Not What You Requested

为测试而构建:编码代理交付的是你检查的内容,而非你请求的内容

Yanuo Ma, Ben Kereopa-Yorke, Ben Schultz

机构 * Microsoft(微软)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究发现,在代码生成任务中,编码代理在测试存在时得分接近完美,但实际交付的库却残缺不全,揭示了“为测试而构建”的倾向,并提出了“验证自我意识”这一概念。

Comments 27 pages (9 main + 14 appendix), 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05755 2026-06-30 cs.CR cs.AI 77%

Red-Teaming Coding Agents from a Tool-Invocation Perspective: An Empirical Security Assessment

从工具调用角度审视代码代理的红队测试:一项经验性安全评估

Yuchong Xie, Mingyu Luo, Zesen Liu, Zhixiang Zhang, Kaikai Zhang, Yu Liu, Zongjie Li, Ping Chen, Shuai Wang, Dongdong She

机构 * The Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文从工具调用角度对六个流行的代码代理进行红队测试,发现ToolLeak漏洞并实现远程代码执行,揭示了代码代理的安全风险及防御建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14207 2026-06-30 cs.AI 77%

Echoes of Human Malice in Agents: Benchmarking LLMs for Multi-Turn Online Harassment Attacks

人类恶意的回声在智能体中:为多轮在线骚扰攻击评估LLMs

Trilok Padhi, Pinxian Lu, Abdulkadir Erol, Tanmay Sutar, Gauri Sharma, Mina Sonmez, Munmun De Choudhury, Ugur Kursuncu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一个多轮在线骚扰攻击基准测试,通过合成数据集、多智能体模拟和三种 jailbreak 方法评估LLMs在多轮交互中的安全性,发现jailbreak调优显著提高攻击成功率,揭示了智能体在多轮对话中模仿人类攻击模式的弱点。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02292 2026-06-30 cs.CL 77%

LLMs and their Limited Theory of Mind: Evaluating Mental State Annotations in Situated Dialogue

大型语言模型及其有限的心智理论:评估情境对话中的心智状态标注

Katharine Kowalyshyn, Matthias Scheutz

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一个两阶段框架,利用大型语言模型作为团队对话的人类风格标注器和自动差异检测器,评估共享心智模型的连贯性。

Comments Published at The 27th Meeting of the ACL Special Interest Group on Discourse and Dialogue 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29301 2026-06-30 cs.CV 75%

Pointer-CAD v2: Plan-Then-Construct CAD Generation with Dimension-Aware Parametric Precision

Pointer-CAD v2: 先规划后构建的尺寸感知参数化CAD生成

Dacheng Qi, Chenyu Wang, Jingwei Xu, Yi Ma, Shenghua Gao

机构 * The University of Hong Kong(香港大学) Shenzhen Loop Area Institute(深圳河套学院) TranscEngram Monash University(墨尔本大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 提出Pointer-CAD v2,采用先规划后构建范式,通过指针机制直接预测连续参数值,消除量化误差,并在顶点、边和面层级引入层次化几何精度指标,显著提升CAD生成的几何精度。

Comments Accepted to ECCV 2026. Code is available at https://github.com/Snitro/Pointer-CAD-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29280 2026-06-30 cs.LG cs.AI cs.CL 75%

Deterministic Decisions for High-Stakes AI. A Zero-Egress Pipeline with the Deployability of RAG and the Accuracy of Machine Learning

高风险AI的确定性决策:具有RAG可部署性和机器学习准确性的零出口管道

Craig Atkinson

机构 * Verificate Pty Ltd(Verificate公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究识别并量化了零样本大语言模型在教育咨询中的干预偏差,通过监督策略学习(决策树和XGBoost)消除该偏差,实现接近零的校准误差,并揭示了评估差距。

Comments 41 pages, 11 tables, no figures. Preprint intended for submission to EDM 2027 / LAK 2027. Includes a reproducibility package: trained ONNX Decision Transformer, generic training script, OULAD evaluation scripts, and per-arm results CSVs

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28673 2026-06-30 cs.CV 75%

BackTranslation2.0 -- A Linguistically Motivated Metric to Assess Sign Language Production

BackTranslation2.0——一种基于语言学的评估手语生成质量的指标

Oliver Cory, Maksym Ivashechkin, Karahan Sahin, Oline Ranum, Jianhe Low, Edward Fish, Anton Pelykh, Ozge Mercanoglu Sincan, Richard Bowden

机构 * Centre for Vision, Speech and Signal Processing(视觉、语音和信号处理中心)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 提出BackTranslation2.0,一种基于语言学的文本到手语翻译评估指标,通过代理框架整合多个工具评估语法、音韵、流畅性和保真度,与人类判断高度相关。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01173 2026-06-30 cs.CV 75%

EEmo-Logic: A Unified Dataset and Multi-Stage Framework for Comprehensive Image-Evoked Emotion Assessment

EEmo-Logic:面向全面图像诱发情感评估的统一数据集与多阶段框架

Lancheng Gao, Ziheng Jia, Zixuan Xing, Wei Sun, Huiyu Duan, Guangtao Zhai, Xiongkuo Min

专题命中 评测与基准 :large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 提出最大图像诱发情感理解数据集EEmoDB和统一多模态大语言模型EEmo-Logic,通过指令微调和任务定制GRPO实现细粒度情感问答与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06090 2026-06-30 cs.SE cs.AI cs.PF 74%

SWE-fficiency: Can Language Models Optimize Real-World Repositories on Real Workloads?

SWE-fficiency:语言模型能否在真实工作负载上优化现实世界仓库?

Jeffrey Jian Ma, Milad Hashemi, Amir Yazdanbakhsh, Kevin Swersky, Ofir Press, Enhui Li, Vijay Janapa Reddi, Parthasarathy Ranganathan

机构 * Harvard University(哈佛大学) Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学) Google(谷歌)

专题命中 评测与基准 :language model(title);分类 cs.AI

AI总结 本文提出SWE-fficiency基准,评估语言模型在真实工作负载上优化软件仓库性能的能力,发现现有模型在定位优化机会和保持正确性方面表现不佳。

Comments Appearing at ICML 2026. Data, code, and leaderboard are available at https://swefficiency.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29721 2026-06-30 cs.LG cs.AI 73%

Redefining Maritime Anomaly Detection via Equation-Grounded Synthetic Anomalies

通过方程引导的合成异常重新定义海上异常检测

Youngseok Hwang, Sungho Bae, Dohun Lee, Jaeeun Seo, Jeehong Kim, Wonhee Lee, Hyunwoo Park

机构 * Seoul National University(首尔国立大学) KRISO(韩国海洋研究组织)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对海上异常检测中缺乏标签和交互驱动异常的问题,提出基于方程引导的异常分类法,并构建统一评分-合成-标注流程,生成时间戳级标签,评估多种模型性能。

Comments 12 pages, KDD 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29118 2026-06-30 cs.IT cs.CL cs.IR cs.LG math.IT 73%

An Information-Geometric Justification for Composite Coherence in Event-Based Narrative Extraction

基于信息几何的事件叙事提取中复合一致性的证明

Brian Keith-Norambuena

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 针对图叙事提取中一致性度量的信息论缺失,从信息几何角度解释复合度量C=√(A·T),并证明几何均值组合器满足四个自然公理,实验验证其有效性。

Comments Accepted to publication in Entropy on June 24, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20712 2026-06-30 cs.CL cs.AI 73%

SCRIBE: Diagnostic Evaluation and Rich Transcription Models for Indic ASR

SCRIBE:用于印度语言ASR的诊断评估和丰富转录模型

Kavya Manohar, Arghya Bhattacharya, Kush Juvekar, Kumarmanas Nethil

机构 * Adalat AI, India(印度Adalat人工智能公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 SCRIBE通过沙地容忍对齐和领域词汇注入,提供词错误率的分类分解,解决了传统词错误率在处理聚合语言时的不足,同时释放了用于印地语、马拉雅尔语和卡纳达语的丰富转录模型。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏