arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-29 至 2026-05-29 共收录 535 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 125 篇

2605.29446 2026-05-29 cs.AI 79%

CrystalXRD-Bench: Benchmarking Vision-Language Models for XRD Peak Indexing Across Diverse Crystalline Materials

CrystalXRD-Bench:面向多种晶体材料的XRD峰索引的视觉-语言模型基准测试

Chengliang Xu, Xiaogang Li, Peiyao Xiao, Beng Wang, Hu Wei, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 提出CrystalXRD-Bench基准,通过250个样本评估视觉-语言模型从粉末XRD图谱中识别米勒指数(HKL)的能力,发现最佳模型Jaccard得分仅0.5888,任务远未解决。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22080 2026-05-29 cs.CV cs.AI 79%

JMed48k: A Multi-Profession Japanese Medical Licensing Benchmark for Vision-Language Model Evaluation

JMed48k:用于视觉语言模型评估的多专业日本医疗执照基准

Yue Xun, Junyu Liu, Qian Niu, Xinyi Wang, Zheng Yuan, Zirui Li, Zequn Zhang, Bowen Zhao, Shujun Wang, Irene Li, Kan Hatakeyama-Sato, Yusuke Iwasawa, Yutaka Matsuo

机构 * The Hong Kong Polytechnic University(香港理工大学) Kyoto University(京都大学) The University of Tokyo(东京大学) Hohai University(淮海大学) University of Science and Technology of China(中国科学技术大学) University of Toronto(多伦多大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出JMed48k,一个包含48,862道试题和20,142张图像的多专业日本医疗执照基准,通过评估21个模型并引入配对图像移除审计,发现专有和开源模型显著受益于图像,而医学专用模型对视觉证据利用有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19619 2026-05-29 cs.LG 79%

Is Your Diffusion Sampler Actually Correct? A Sampler-Centric Evaluation of Discrete Diffusion Language Models

你的扩散采样器真的正确吗?离散扩散语言模型的采样器中心评估

Luhan Tang, Longxuan Yu, Shaorong Zhang, Greg Ver Steeg

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 针对离散扩散语言模型评估中采样误差与去噪误差混淆的问题,提出基于oracle的采样器中心框架,通过精确隐马尔可夫模型后验隔离采样误差,发现少步离散扩散采样器在oracle去噪器下仍存在分布偏差。

Comments 30 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29807 2026-05-29 cs.CL cs.AI cs.LG 78%

Data filtering methods for training language models

训练语言模型的数据过滤方法

Egor Shevchenko, Elena Bruches

机构 * Novosibirsk State University(新西伯利亚国立大学) A. P. Ershov Institute of Informatics Systems SB RAS(A. P. Ershov 信息系统研究所)

专题命中 评测与基准 :language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文比较了Confident Learning和Dataset Cartography两种自动标签错误检测方法在俄语文本分类任务中的效果,发现其有效性依赖于数据集特性,在小规模高噪声数据集上Confident Learning显著提升F1-macro。

Comments AINL-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29074 2026-05-29 cs.CV cs.RO 78%

Embodied3DBench: Benchmarking Low-Level Embodied Spatial Intelligence of Vision Language Models

Embodied3DBench: 视觉语言模型低级具身空间智能的基准测试

Jiyao Zhang, Mingxu Zhang, Yitong Peng, Haoxuan Liu, Chenshuo Wang, Yuxing Long, Haoyang Huang, Dongjiang Li, Nan Duan, Hui Shen, Hao Dong

机构 * CFCS, School of CS, PKU(计算机学院CFCS,北京大学) Jingdong Technology Information Technology Co., Ltd(京东科技信息技术有限公司)

专题命中 评测与基准 :language model(title,abstract)

AI总结 提出Embodied3DBench基准,通过6类任务(空间结构理解与交互导向感知)系统评估视觉语言模型在3D环境中的低级空间智能,并合成130万QA对训练数据以弥补能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30333 2026-05-29 cs.CL 77%

COMPOSE: Composing Future Theorems from Citations and Formal Structure

COMPOSE: 从引文和形式结构组合未来定理

David Busbib, Michael Werman

机构 * Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 提出 COMPOSE 双图框架,结合科学引文图和形式定理依赖图,生成有依据的未来数学定理,实验表明优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30241 2026-05-29 cs.CL cs.CY cs.SI 77%

CommunityFact: A Dynamic, Multilingual, Multi-domain Benchmark for Misinformation Detection in the Wild

CommunityFact:一个面向野外错误信息检测的动态、多语言、多领域基准

Sahajpreet Singh, Insyirah Mujtahid, Min-Yen Kan, Kokil Jaidka

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 提出CommunityFact基准,通过多语言多领域声明、LLM评估和社区笔记分析,揭示封闭输入验证的挑战、网络搜索的增益以及证据选择策略的偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30080 2026-05-29 cs.CL 77%

Adaptive Targeted Dynamic Chunking for Tokenization-Free Hierarchical Model

自适应目标动态分块用于无分词层次模型

Thang Dang, Akira Nakagawa, Kenichi Kobayashi, Koichi Shirahata

机构 * Fujitsu Research of America(富士通美国研究) Fujitsu Limited(富士通株式会社)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出自适应目标动态分块(ATDC)机制,通过课程学习动态调整压缩比,以优化无分词层次模型的字节压缩效果,在FineWeb-Edu 100B数据集上实现竞争性的每字节比特数性能,并提升训练稳定性和下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29933 2026-05-29 cs.LG 77%

CLUBench: A Clustering Benchmark

CLUBench:一个聚类基准测试

Feng Xiao, Dazhi Fu, Chris Ding, Jicong Fan

机构 * The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 本文提出CLUBench,一个包含24种算法在131个数据集上的综合聚类基准,通过大规模实验分析超参数调优、数据类型、预训练嵌入、大语言模型聚类等,揭示传统算法仍具竞争力,并结合预训练嵌入可提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29742 2026-05-29 cs.AI 77%

Citation-Closure Retrieval and Per-Rule Attribution for Real-World Regulatory Compliance Question Answering

引用闭包检索与逐规则归因:面向真实世界法规合规问答

Yeong-Joon Ju, Seong-Whan Lee

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对法规合规问答中多层级权威结构的引用追踪难题,提出基于操作知识图谱的基准RegOps-Bench和统一框架RefWalk,通过共享主题锚点遍历跨文档引用、多视角候选融合及逐规则归因,显著提升检索召回率和引用准确性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29637 2026-05-29 cs.CL 77%

Evaluating Cross-lingual Knowledge Consistency in Code-Mixed vis-a-vis Indian Languages using IndicKLAR

评估混合语码与印度语言中的跨语言知识一致性:基于IndiKLAR

Debajyoti Mazumder, Divyansh Pathak, Prashant Kodali, Aditya Joshi, Akshay Agarwal, Jasabanta Patro

机构 * Indian Institute of Science Education and Research(印度科学教育与研究学院) Microsoft Corporation(微软公司) UNSW Sydney(新南威尔士大学悉尼分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文通过构建IndiKLAR基准,评估大语言模型在英语、混合语码和印度本土语言上的知识召回一致性,发现混合语码输入能显著缩小与英语的性能差距,并识别出从本土语言到混合语码的“翻转点”。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29476 2026-05-29 cs.CL 77%

Comparative Evaluation of Machine Translation Systems on Images with Text

含文本图像的机器翻译系统比较评估

Blai Puchol, Sergio Gómez González, Miguel Domingo, Francisco Casacuberta

机构 * ValgrAI - Valencian Graduate School and Research Network for Artificial Intelligence(ValgrAI - 瓦伦西亚人工智能研究生学院和研究网络)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究比较评估了三种机器翻译范式(模块化流水线、多模态大语言模型和端到端模型Translatotron-V)在含文本图像翻译任务上的性能,发现多模态大语言模型表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27995 2026-05-29 cs.AI 77%

AsyncTool: Evaluating the Asynchronous Function Calling Capability under Multi-Task Scenarios

AsyncTool: 多任务场景下异步函数调用能力的评估

Kou Shi, Ziao Zhang, Shiting Huang, Avery Nie, Zhen Fang, Qiuchen Wang, Lin Chen, Huaian Chen, Zehui Chen, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) University of Toronto(多伦多大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AsyncTool基准,通过模拟工具响应延迟的多任务环境,评估基于大语言模型的智能体在异步工具调用中的任务协调与效率。

Comments https://github.com/StoKou/repo-asynctool

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28880 2026-05-29 cs.LG physics.data-an stat.ME 76%

Towards Continuous-time Causal Foundation Models

迈向连续时间因果基础模型

Dennis Thumm, Ruben Wiedemann, Ying Chen

机构 * National University of Singapore(新加坡国立大学) Imperial College London(帝国理工学院伦敦分校) Department of Mathematics, Centre for Quantitative Finance, Risk Management Institute, National University of Singapore(新加坡国立大学数学系、量化金融中心、风险管理研究所)

专题命中 评测与基准 :foundation model(title,comments);分类 cs.LG

AI总结 提出轨迹律对观测时间表不变的连续性准则,通过细网格积分与解耦观测实现连续时间因果先验模型,并在线性与非线性先验上验证其优于离散方法。

Comments ICML 2026 2nd Workshop on Foundation Models for Structured Data (FMSD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29613 2026-05-29 eess.AS cs.SD 75%

Decoding Strategies for Diffusion-Based ASR: A Systematic Evaluation of Confidence-Based Thresholding

基于扩散的ASR解码策略:基于置信度阈值的系统评估

Jeong Hun Yeo, Minsu Kim, Hyeongseop Rha, Yong Man Ro

机构 * KAIST(韩国科学技术院) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 本文系统评估了基于扩散语言模型的ASR中三种解码策略,提出使用基于负对数似然的不确定性度量来监控解码进度,发现基于阈值的策略在准确率和速度上均优于固定步数策略,其中静态阈值策略在匹配自回归解码准确率的同时具有更高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21151 2026-05-29 cs.IR 75%

VOGUE: A Multimodal Dataset for Conversational Recommendation in Fashion

VOGUE:面向时尚领域对话式推荐的多模态数据集

David Guo, Minqi Sun, Yilun Jiang, Jiazhou Liang, Scott Sanner

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 为弥补多模态对话推荐数据集的不足,构建了包含60个人类对话、2100个细粒度标注话语的VOGUE数据集,支持视觉和上下文推理评估,并揭示了多模态大语言模型在偏好推断上的系统性分布误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27601 2026-05-29 cs.CR 75%

SecGoal: A Benchmark for Extracting Formalizable Security Goals from Protocol Documents

SecGoal:从协议文档中提取可形式化安全目标的基准

Dawei Huang, Hui Li, Bo Jia, Haonan Feng, Jingjing Guan, Yueshuang Jiao, Xiangdong Li

专题命中 评测与基准 :LLM(summary_cn,abstract_cn)

AI总结 提出SecGoal基准和AIFG框架,通过微调小型开源LLM实现从协议文档中高精度提取可形式化安全目标,并生成结构化安全属性。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29980 2026-05-29 cs.CV cs.AI cs.LG 73%

Genetically Aligned Patient Representations Improve Hematological Diagnosis

基因对齐的患者表示改善血液学诊断

Muhammed Furkan Dasdelen, Fatih Ozlugedik, Ilaria Looser, Rao Muhammad Umer, Christian Pohlkamp, Carsten Marr

机构 * Institute of AI for Health, Helmholtz Munich, Germany International School of Medicine, Istanbul Medipol University, T\"urkiye Munich Leukemia Laboratory, Germany Department of Medicine III, Ludwig-Maximilian-University Hospital, Germany Department of Physics, University of Munich, Germany Munich Center for Machine Learning (MCML), Germany DKTK, German Cancer Consortium, Germany

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出一种两阶段框架,通过自监督视觉预训练和监督对比学习对齐白细胞图像与染色体畸变及体细胞突变,提升血液学诊断性能。

Comments Accepted for publication at the 29th International Conference on Medical Image Computing and Computer Assisted Intervention - MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29711 2026-05-29 cs.CL cs.AI 73%

Personalized Turn-Level User Conversation Satisfaction Benchmark

个性化轮级用户对话满意度基准

Zhefan Wang, Zhiqiang Guo, Weizhi Ma, Min Zhang, Quanjia Yan, Hengliang Luo

机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China.(清华大学计算机科学与技术系,北京,中国) Institute for AI Industry Research, Tsinghua University, Beijing, China.(清华大学人工智能产业研究院,北京,中国) Meituan(美团)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对AI助手响应的个性化满意度评估问题,提出结合用户记忆与目标轮上下文的满意度评估器,并构建PersTurnBench基准,通过回放实现生成模型的受控比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29631 2026-05-29 cs.CL cs.AI 73%

Predicting Causal Effects from Natural Language Queries using Structured Representations

使用结构化表示从自然语言查询预测因果效应

Giuliano Martinelli, Piriyakorn Piriyatamwong, Abelardo Carlos Martinez Lorenzo, Jasmin Baier, Riccardo Orlando, Satvik Garg, Sharif Kazemi, Linxi Wang, Arianna Legovini, Samuel Fraiberger

机构 * The World Bank Group(世界银行集团) University of Oxford(牛津大学) New York University(纽约大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对从自然语言查询预测因果效应的问题,提出Query2Effect基准和两步框架,通过生成结构化表示再预测效应大小,微调使绝对误差降低27%-71%。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29430 2026-05-29 cs.AI cs.CL 73%

Towards Human-Like Interactive Speech Recognition With Agentic Correction and Semantic Evaluation

迈向具有智能体纠正和语义评估的类人交互式语音识别

Zixuan Jiang, Yanqiao Zhu, Peng Wang, Qinyuan Chen, Xinjian Zhao, Xipeng Qiu, Wupeng Wang, Zhifu Gao, Xiangang Li, Kai Yu, Xie Chen

机构 * College of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) X-LANCE Lab, School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院X-LANCE实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Fudan University(复旦大学) Tongyi Fun Team, Alibaba Group(阿里云通义团队)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出Agentic ASR闭环框架,通过多轮交互和语义纠正减少语义错误,并引入句子级语义错误率(S^2ER)作为评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29256 2026-05-29 cs.CL cs.AI 73%

DynSess: Dynamic Session-Level Evaluation and Optimization Framework for Role-Playing Agents

DynSess:面向角色扮演智能体的动态会话级评估与优化框架

Rongsheng Zhang, Jiji Tang, Junnan Ren, Zuyi Bao, Weijie Chen, Ruofan Hu, Zhou Zhao, Tangjie Lv, Yan Zhang

机构 * Zhejiang University(浙江大学) Fuxi AI Lab, NetEase Inc.(福克斯人工智能实验室,网易公司) Xiamen University(厦门大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出DynSess统一会话级框架,通过会话级评估(DynSess-Eval)和基于多步前瞻搜索的训练轨迹优化(DSPO/GSRPO),提升角色扮演智能体的长程一致性和交互质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28830 2026-05-29 cs.CL cs.AI cs.SE 73%

Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation

开源安全防护模型基准测试:全面评估

Reetu Raj Harsh, Bhaskarjit Sarmah, Stefano Pasquali

机构 * Domyn

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究对14个开源安全防护模型在8个NIST AI风险框架安全类别上进行全面评估,发现召回率是关键指标,且模型大小与安全检测性能不相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30289 2026-05-29 cs.LG stat.AP stat.ML 70%

Statistical Embeddings for Similarity, Retrieval, and Interpretable Alignment of Numeric Tabular Datasets

用于数值表格数据集的相似性、检索和可解释对齐的统计嵌入

M. Ross Kunz, John Merickel, Keith Wilson

机构 * Idaho National Laboratory(爱达荷国家实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出一种通过结构化探索性数据分析描述符、句子变换器嵌入和典型相关分析(CCA)来表征和比较数值表格数据集的方法,实现跨数据集的相似性检索和可解释变量级对齐,并支持差分隐私。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29897 2026-05-29 cs.CL 70%

ExCAM: Explainable Cultural Awareness Metrics

ExCAM:可解释的文化意识度量

Christoph Leiter, Haiyue Song, Hour Kaing, Jin Tei, Hideki Tanaka, Masao Utiyama, Steffen Eger

机构 * University of Mannheim(曼海姆大学) University of Technology Nuremberg(纽伦堡技术大学) National Institute of Information and Communications Technology(信息与通信技术国家研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ExCAM,首个可识别、评分并解释指令-输出对中文化错误的专用评估度量,在平衡测试集上达到80%准确率。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29234 2026-05-29 cs.AI cs.IR 70%

Rethinking Literature Search Evaluation: Deep Research Helps, and Human Citation Lists Are Not a Ground Truth

重新思考文献检索评估:深度研究有帮助,且人类引用列表并非金标准

Gaurav Sahu, Laurent Charlin, Christopher Pal

机构 * Mila – Quebec AI Institute(魁北克AI研究所) HEC Montréal(蒙特利尔HEC商学院) ServiceNow Research(ServiceNow研究) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) Université de Montréal(蒙特利尔大学) Polytechnique Montréal(蒙特利尔理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过改进检索流程和检验人类引用列表作为评估目标的可靠性,发现深度研究管道显著提升召回率,而人类引用中仅51%被判定为中等相关以上,建议采用多维度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29188 2026-05-29 cs.CL 70%

Slogans or Stance? A Label-Light Diagnostic for Entrepreneurial-Discourse Measurement on Chinese SOE Speeches

口号还是立场?一种用于中国国企演讲中创业话语测量的轻标签诊断方法

Ting Gong, Shangquan Sun

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出一种轻标签诊断方法,利用同一企业不同演讲者的自然实验,评估词典方法、主题模型和嵌入相似度评分器在测量中国国企演讲中“创业精神”时的有效性,发现零样本大语言模型(Qwen3.5:9b)在区分演讲者身份方面表现最佳。

Comments 15 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28824 2026-05-29 cs.CL 70%

A Modular Architecture for Typologically Controlled Lexicon Generation

一种用于类型学控制词汇生成的模块化架构

Sankalp Tattwadarshi Swain, Dhruv Kumar

机构 * Birla Institute of Technology and Science, Pilani(比拉理工学院,帕利尼)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出模块化框架,通过PHOIBLE音位库、可互换音系语法和Swadesh-Leipzig-Jakarta本体生成音系合理且类型学真实的词汇,实验表明概率语法优于确定性和随机基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05157 2026-05-29 cs.AI 70%

IntentScore: Intent-Conditioned Action Evaluation for Computer-Use Agents

IntentScore: 面向计算机使用智能体的意图条件动作评估

Rongqian Chen, Yu Li, Zeyu Fang, Sizhe Tang, Weidong Cao, Tian Lan

机构 * George Washington University(乔治·华盛顿大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出IntentScore,一种基于计划感知的奖励模型,通过对比对齐和边际排序学习评估动作质量,在OSWorld上提升任务成功率6.9个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04729 2026-05-29 cs.CL 70%

"Be My Cheese?": Cultural Nuance Benchmarking for Machine Translation in Multilingual LLMs

“Be My Cheese?”:多语言大语言模型中机器翻译的文化细微差别基准

Madison Van Doren, Casey Ford, Jennifer Barajas, Riley VanMeter, Cory Holland

机构 * Appen The University of Chicago(芝加哥大学) The University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过大规模人工评估基准,研究多语言大语言模型在机器翻译中处理文化细微差别(如习语、双关语、节日和文化概念)的能力,发现语法准确性与文化共鸣之间存在显著差距。

Comments ACL 2026: Natural Language Generation, Evaluation, and Metrics (GEM) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏