arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-28 至 2026-05-28 共收录 525 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 121 篇

2605.28483 2026-05-28 cs.AI cs.IR 90%

From Learning Resources to Competencies: LLM-Based Tagging with Evidence and Graph Constraints

从学习资源到能力:基于证据和图约束的LLM标签方法

Ngoc Luyen Le, Marie-Hélène Abel, Bertrand Laforge

机构 * Université de technologie de Compiègne, CNRS, Heudiasyc(法国图卢兹技术大学、CNRS、Heudiasyc实验室) Sorbonne Université, CNRS UMR 7585, LPMHE(巴黎大学、CNRS UMR 7585、LPMHE实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种端到端对齐流程,利用大语言模型作为受约束的、能产生证据的标签器,将学习资源链接到结构化能力框架,在计算机科学数据集上取得优于基线方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28308 2026-05-28 cs.CL 90%

HELEA: Hard-Negative Benchmark and LLM-based Reranking for Robust Entity Alignment

HELEA: 用于鲁棒实体对齐的硬负样本基准和基于LLM的重排序

Yoonjin Jang, Junwoo Kim, Youngjoong Ko

机构 * SungKyunKwan University(全州大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 针对现有实体对齐基准中模型依赖名称重叠而非关系结构的问题,提出同名的硬负样本增强策略生成质量可控的评估基准和训练语料,并设计HELEA两阶段框架(实体编码器检索+LLM重排序),在硬负样本基准上实现鲁棒对齐。

Comments 10 pages, 3 figures, 9 tables. Code and benchmarks available at https://github.com/Wnsdnl/HELEA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27766 2026-05-28 cs.AI 90%

Got a Secret? LLM Agents Can't Keep It: Evaluating Privacy in Multi-Agent Systems

Got a Secret? LLM Agents Can't Keep It: Evaluating Privacy in Multi-Agent Systems

Aman Priyanshu, Supriti Vijay, Esha Pahwa

机构 * Foundation AI USA(Foundation AI美国)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究通过多智能体模拟平台评估LLM智能体在社交压力下的隐私泄露风险,发现多轮社交交互显著增加隐私泄露,且泄露具有社交传染性,即使有隐私指令也无法完全消除。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27566 2026-05-28 cs.AI 90%

DynaSchedBench: Calibrated Dynamic Scheduling Benchmarks and Observability Paradox in LLM-based Scheduling Agents

DynaSchedBench: 基于LLM的调度代理中的校准动态调度基准与可观测性悖论

Shijie Cao, Yuan Yuan, Jing Liu

机构 * School of Computer Science and Engineering, Beihang University, Beijing 100191, China(北航计算机科学与工程学院) Shenzhen Loop Area Institute, Shenzhen, China(深圳环城院) Qingdao Research Institute, Beihang University(北航青岛研究院) Hangzhou Innovation Institute, Beihang University(北航杭州创新院) School of Artificial Intelligence, Xidian University, Xi'an 710071, Shaanxi, China(西电人工智能学院) Guangzhou Institute of Technology, Xidian University, Guangzhou 510555, Guangdong, China(西电广州技术院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对动态柔性作业车间调度问题(DFJSP),提出DynaSchedBench诊断框架,通过顺序事件空间校准器(SESC)计算调度压力指数(SSI)对实例进行难度分层,并揭示LLM调度代理中的“可观测性悖论”:完整结构信息反而降低性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27444 2026-05-28 cs.IR cs.AI 90%

A Systematic Evaluation of Retrieval-Augmented Generation and Language Models for Space Operations

检索增强生成与语言模型在太空操作中的系统评估

Ruben Belo, Marta Guimarães, Cláudia Soares

机构 * NOVA LINCS Neuraspace Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文系统评估了结合大语言模型与信息检索技术的检索增强生成管道在太空操作中提取和综合领域知识的效果,比较了不同检索策略、嵌入模型和LLM回答对信息准确性、相关性和可靠性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00180 2026-05-28 cs.NI cs.CL 90%

RouteProfile: Graph-Based Profiling for Cold-Start LLM Routing

RouteProfile:基于图的冷启动LLM路由画像方法

Jingjun Xu, Hongji Pu, Tao Feng, Haozhen Zhang, Jiaxuan You, Ge Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 针对冷启动LLM路由中新模型缺乏交互数据的问题,提出基于图结构的RouteProfile框架,利用技术报告中的公开信号构建模型画像,实验表明结构化画像优于扁平基线,且模型家族元数据比基准域信息更可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00349 2026-05-28 cs.AI cs.MA 90%

COOP$^2$: Defining, Observing, and Repairing Cooperation in LLM Multi-Agent Systems

COOP$^2$: 定义、观察和修复LLM多智能体系统中的合作

Hanqing Yang, Narjes Nourzad, Shiyu Chen, Marie Siew, Jingdi Chen, Carlee Joe-Wong

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Southern California(南加州大学) Singapore University of Technology and Design(新加坡科技设计大学) University of Arizona(亚利桑那大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出COOP$^2$框架,通过将高层合作动态与任务进度关联,定义可验证的合作任务,并开发COOP$^2$-Repair方法预测约束失败并引导修复,提升LLM多智能体系统的任务成功率和约束满足度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28710 2026-05-28 cs.CL cs.AI 90%

Towards Reliable Multilingual LLMs-as-a-Judge: An Empirical Study

迈向可靠的多语言LLM作为评判者:一项实证研究

Irune Zubiaga, Aitor Soroa, Rodrigo Agerri

机构 * HiTZ Center - Ixa, University of the Basque Country EHU(希茨中心 - Ixa,巴斯克国家大学EHU)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过分析指令翻译、单语与多语言监督及模型规模等策略,探讨了在有无领域内数据情况下开发多语言LLM评判者的方法,并揭示了领域内数据可用时微调小模型可媲美专有模型、零样本大模型在域外更有效等关键权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12344 2026-05-28 cs.LG 89%

Can Decision Trees Teach Large Language Models? Distilling Verbalized Knowledge for Molecular Property Prediction

决策树能否教会大语言模型?为分子性质预测提炼语言化知识

Khiem Le, Sreejata Dey, Marcos Martínez Galindo, Vanessa Lopez, Ting Hua, Nitesh V. Chawla, Hoang Thanh Lam

机构 * University of Notre Dame(内布拉斯加大学) IBM Research(IBM研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.LG

AI总结 提出TreeKD方法,通过将基于决策树/随机森林的专业模型知识语言化并融入提示,训练大语言模型,显著提升其在分子性质预测任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09301 2026-05-28 q-fin.PM 89%

Constructing a Portfolio Optimization Benchmark Framework for Evaluating Large Language Models

构建用于评估大语言模型的投资组合优化基准框架

Hanyong Cho, Jang Ho Kim

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究提出一个基准框架,通过具有数学显式解的投资组合优化问题评估大语言模型的金融决策能力,实验显示GPT-4在基于风险的目标上表现最佳,而Llama 3.1-70B整体性能最低。

Comments Poster presented at the AI for Finance Symposium '25, The 6th ACM International Conference on AI in Finance (ICAIF '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27805 2026-05-28 cs.CL cs.AI 88%

ChildEval: When large language models meet children's personalities

ChildEval:当大语言模型遇到儿童个性

Yanyan Luo, Xue Han, Chunxu Zhao, Ruiqiao Bai, Yaxing Zhang, Qian Hu, Lijun Mei, Junlan Feng

机构 * JIUTIAN Research(九天研究院) China Mobile(中国移动) Beijing, China(北京,中国)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出ChildEval基准,通过合成3-6岁儿童个性档案和偏好(显式或隐式表达),评估大语言模型在长对话中推断并遵循儿童偏好的能力,实验表明微调可提升儿童中心性能。

Comments 8 pages of main text (ACL Findings format), with references and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26186 2026-05-28 cs.SE cs.AI cs.CL cs.LG 88%

SetupX: Can LLM Agents Learn from Past Failures in Functionality-Correct Code Repository Setup?

SetupX:LLM代理能否从过去的功能正确代码仓库设置失败中学习?

Zihang Zhou, Ziqian Ren, Yukai Wu, Yingjie Xiong, Wei Zhou, Chao Peng, Dong Zhang, Bingheng Yan, Xuanhe Zhou, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学) Independent Researcher(独立研究者) Jinan Inspur Data Technology Co., Ltd.(济南 Inspur 数据技术有限公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SetupX框架,通过经验学习、推测执行和验证协议解决代码仓库设置中的跨仓库经验迁移、多步试错和鲁棒验证问题,在基准测试中达到92%通过率。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28515 2026-05-28 cs.SE cs.AI 88%

Do LLMs Favor Their Providers? Measuring Vertical Integration Bias in Code Generation

LLM 是否偏袒其提供商?测量代码生成中的垂直整合偏差

Melih Catal, Alex Wolf, Tiago Ferreiro Matos, Pooja Rani, Harald Gall

机构 * University of Zurich(苏黎世大学) University of Mannheim(曼海姆大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出 VIBench 基准,通过 20 个提供商可选的软件集成场景,测量前沿 LLM 在直接和代理代码生成中的垂直整合偏差,发现六成关联模型存在显著偏差,代理工作流加剧偏差至 +39.2 个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28032 2026-05-28 cs.AI 88%

PetroBench: A Benchmark for Large Language Models in Petroleum Engineering

PetroBench:石油工程大语言模型基准测试

Xiang Wang, Tingting Zhang, Sen Wang, Ying Wu, Heng Meng, Peng Zhou, Peng Li

机构 * School of Petroleum and Natural Gas Engineering, Changzhou University(常州大学石油与天然气工程学院) China University of Petroleum (East China)(中国石油大学(华东))

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 针对石油工程领域,构建包含1200道题目的标准化题库,评估8种主流大语言模型,发现模型在主观题上表现优于客观题,中国模型在选择题上有优势,国际模型在简答题上略优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27631 2026-05-28 cs.CR cs.LG 88%

Poison with Style: A Practical Poisoning Attack on Code Large Language Models

风格投毒:针对代码大语言模型的实用投毒攻击

Khang Tran, Yazan Boshmaf, Issa Khalil, NhatHai Phan, Ting Yu, Md Rizwan Parvez

机构 * Department of Data Science, New Jersey Institute of Technology, New Jersey, U.S.A.(新泽西理工学院数据科学系) Qatar Computing Research Institute, HBKU, Doha, Qatar(卡塔尔计算研究所) Mohamed Bin Zayed University of Artificial Intelligence, Abu Dhabi, United Arab Emirates(马尔代夫人工智能大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 提出 Poison-with-Style (PwS) 攻击,利用开发者代码风格作为隐蔽触发器,通过两步训练策略微调代码大语言模型,使其在触发风格下生成漏洞代码,同时保持正常行为。

Comments Accepted to the Forty-Third International Conference on Machine Learning 2026 (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21666 2026-05-28 cs.AI cs.CV 88%

SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding

SONIC-O1:用于评估多模态大语言模型在音视频理解上的真实世界基准

Ahmed Y. Radwan, Christos Emmanouilidis, Hina Tabassum, Deval Pandya, Shaina Raza

机构 * Vector Institute for Artificial Intelligence(向量人工智能研究所) University of Groningen(Groningen大学) York University(约克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出SONIC-O1基准,包含60小时人工验证的音视频数据,评估多模态大语言模型在开放摘要、多项选择问答和时序定位上的能力,发现模型在时序定位上存在显著性能差距和人口统计偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17620 2026-05-28 cs.CL 88%

Forget to Know, Remember to Use: Context-Aware Unlearning for Large Language Models

忘记知识,记住使用:面向大型语言模型的上下文感知遗忘

Yuefeng Peng, Parnian Afshar, Megan Ganji, Thomas Butler, Amir Houmansadr, Mingxian Wang, Dezhi Hong

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Amazon(亚马逊)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对现有遗忘方法损害上下文可用性的问题,提出一种插件式目标项,在保持遗忘效果和保留集性能的同时恢复模型对已遗忘知识的上下文使用能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04876 2026-05-28 cs.SD 88%

ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models

ChronosAudio: 用于评估音频大语言模型的综合长音频基准

Kaiwen Luo, Liang Lin, Yibo Zhang, Moayad Aloqaily, Jialiang Tao, Dexian Wang, Zhenhong Zhou, Junwei Zhang, Kun Wang, Li Sun, Qingsong Wen

机构 * Nanyang Technological University(南洋理工大学) Independent Researcher(独立研究者) United Arab Emirates University(阿联酋大学) North China Electric Power University(华北电力大学) Southwest Jiaotong University(西南交通大学) Squirrel AI Learning(Squirrel AI学习)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 提出首个针对音频大语言模型长音频理解的多任务基准ChronosAudio,包含6大任务类别和36000个测试实例,实验发现模型存在长上下文崩溃、注意力稀释等问题,现有缓解策略仅恢复50%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27472 2026-05-28 cs.AR cs.AI 87%

AssertLLM2: A Comprehensive LLM Benchmark for Assertion Generation from Design Specifications

AssertLLM2: 从设计规格生成断言的全面的LLM基准测试

Yuchao Wu, Wenji Fang, Jing Wang, Wenkai Li, Ziyan Guo, Zhiyao Xie

机构 * Hong Kong University of Science and Technology(香港理工大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AssertLLM2基准,包含83个真实设计,通过结构化规格、黄金RTL和变异RTL支持缺陷预防和缺陷狩猎两种实际场景,采用语法有效性、形式可证明性、覆盖率和基于突变的缺陷检测等严格评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27401 2026-05-28 cs.CY cs.AI 87%

Using Zero-Shot LLM-Generated Survey Data for Geographically Explicit Population Synthesis

使用零样本大语言模型生成的调查数据进行地理显式人口合成

Taylor Anderson, Sara Von Hoene, Orhan Yagizer Cinar, Emma Von Hoene, Amira Roess, Andrew Crooks, Hamdi Kavak

机构 * Dept. of Geography and Geoinformation Science, George Mason University, Fairfax, VA, USA(地理与地理信息科学系,乔治·马歇尔大学,弗吉尼亚州 Fairfax) Dept. of Computer Science, George Mason University, Fairfax, VA, USA(计算机科学系,乔治·马歇尔大学,弗吉尼亚州 Fairfax) College of Public Health, George Mason University, Fairfax, VA, USA(公共卫生学院,乔治·马歇尔大学,弗吉尼亚州 Fairfax) Dept. of Geography, University at Buffalo, Buffalo, NY, USA(地理系,布法罗大学,纽约州 Buffalo) Dept. of Computational and Data Sciences, George Mason University, Fairfax, VA, USA(计算与数据科学系,乔治·马歇尔大学,弗吉尼亚州 Fairfax)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文评估零样本大语言模型生成的健康调查数据能否作为传统迭代比例拟合工作流的输入,用于地理显式人口合成,并发现其可作为补充输入但尚不能替代真实调查数据。

Comments 15 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04631 2026-05-28 cs.AI 87%

Towards automated data analysis: A guided framework for LLM-based risk estimation

迈向自动化数据分析:基于LLM的风险评估引导框架

Panteleimon Rodis

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一个在人类指导和监督下利用大语言模型进行数据集风险评估的框架,通过识别模式、生成聚类代码并解释结果,为自动化风险分析奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27393 2026-05-28 cs.CL cs.AI 87%

StoryMI: Steerable Multi-Agent Therapeutic Dialogue Generation

StoryMI: 可控的多智能体治疗性对话生成

Qingyu Meng, Min Chen, Dingming Liu, Yifan Mo, Yue Su, Xin Sun, Koen Hindriks, Jiahuan Pei

机构 * Vrije Universiteit Amsterdam(弗里堡大学阿姆斯特丹分校) NII, Tokyo Institute of Technology(东京技术大学信息机构)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出StoryMI框架,通过多LLM智能体协作、情境故事基础和动态策略控制,生成符合动机性访谈标准的治疗性对话,并构建评估协议和数据集验证其有效性。

Comments ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02561 2026-05-28 cs.LO cs.AI cs.LG 87%

MathlibLemma: Folklore Lemma Generation and Benchmark for Formal Mathematics

MathlibLemma: 形式化数学中的民间引理生成与基准测试

Xinyu Liu, Zixuan Xie, Amir Moeini, Claire Chen, Shuze Daniel Liu, Yu Meng, Aidong Zhang, Shangtong Zhang

机构 * Department of Computer Science, University of Virginia(弗吉尼亚大学计算机科学系) Astronomy , California Institute of Technology(加州理工学院天文学系) Purdue University(普渡大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出基于LLM的模块化流水线MathlibLemma,自动挖掘、形式化并证明数学中缺失的民间引理,生成包含4028个类型检查的Lean语句的基准测试集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13583 2026-05-28 cs.CL cs.AI 87%

BenGER Platform: A Collaborative Web Platform for End-to-End Benchmarking of German Legal Tasks

BenGER平台:面向德国法律任务端到端基准测试的协作式Web平台

Sebastian Nagl, Matthias Grabmair

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出BenGER开源Web平台,集成任务创建、协作标注、可配置LLM运行及多维度评估,支持多组织项目与租户隔离,实现法律推理基准测试的端到端透明与可复现。

Comments Preprint - Accepted at ICAIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17654 2026-05-28 cs.CL cs.AI 87%

EVADE-Bench: Multimodal Benchmark for Evaluating and Enhancing Evasive Content Detection

EVADE-Bench:用于评估和增强规避性内容检测的多模态基准

Ancheng Xu, Zhihao Yang, Jingpeng Li, Guanghu Yuan, Longze Chen, Liang Yan, Jiehui Zhou, Zhen Qin, Hengyu Chang, Yukun Chen, Hamid Alinejad-Rokny, Min Yang

机构 * SIAT, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) University of New South Wales(新南威尔士大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对电商平台中LLM/VLM易受规避性内容攻击的问题,提出首个专家标注的中文多模态基准EVADE-Bench,评估26个模型并发现规则分类可提升检测一致性,多智能体分解策略能显著提高准确率。

Comments SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17943 2026-05-28 cs.CL 86%

A Benchmark Construction and Evaluation Framework for Specialist Domains: Case Study on Defense-related Documents

专业领域基准构建与评估框架:以国防相关文档为例

Bao Gia Doan, Aditya Joshi, Pantelis Elinas, Aarya Bodhankar, Oscar Leslie, Tom Marchant, Flora Salim

机构 * UNSW Sydney(新南威尔士大学悉尼分校) Cyndr AI

专题命中 评测与基准 :LLM(summary_cn,abstract);post-training(abstract);prompting(abstract);分类 cs.CL

AI总结 提出DoRA框架,通过合成数据生成和双LLM流水线解决专业领域RAG问答的冷启动问题,在国防文档上显著减少幻觉并提升覆盖率和忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27649 2026-05-28 cs.CL cs.LG 86%

Disentangling Language Roles in Multilingual LLM Task Execution

多语言大模型任务执行中的语言角色解耦

Qishi Zhan, Minxuan Hu, Seoyeon Jang, Lei Zhao, Ziheng Chen, Man Liang, Xinyue Xiang, Jiaxin Liu, Guansu Wang, Liang He

机构 * Marquette(马凯特大学) Cornell(康奈尔大学) UC San Diego(南加州大学圣地亚哥分校) UPenn(普林斯顿大学) UT Austin(德克萨斯大学奥斯汀分校) Maryland(马里兰大学) Michigan(密歇根大学) UIUC(伊利诺伊大学香槟分校) Melbourne(墨尔本大学) Stanford(斯坦福大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.LG

AI总结 提出MTM-Bench基准,通过完全交叉设计解耦指令、内容和响应三种语言角色,评估多语言LLM的任务执行能力,发现响应语言角色是性能下降的主要因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28169 2026-05-28 cs.AR 86%

FT-Pilot: Automated Fault-Tolerant RTL Rewriting via Vulnerability-Guided LLMs

FT-Pilot:通过漏洞引导的LLM实现自动化容错RTL重写

Weixing Liu, Zizhen Liu, Jing Ye, Naixing Wang, Cheng Liu, Huawei Li, Xiaowei Li

专题命中 评测与基准 :LLM(title_cn,summary_cn)

AI总结 提出FT-Pilot框架,结合GNN和LLM实现RTL级自动软错误加固,通过漏洞分析和代码重写降低输出错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28782 2026-05-28 cs.CL 84%

Can Large Language Models Handle Discourse Particles? A Case Study of Colloquial Malay

大型语言模型能否处理话语标记?以口语马来语为例

Mariah Al Giptiah Binte Yusoff, Jakin Tan, Bocheng Chen, Guangliang Liu, Xi Chen

机构 * Nanyang Technological University(南洋理工大学) University of Mississippi(密苏里大学) Indiana University(印第安纳大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL

AI总结 本文通过构建MalayPrag基准和提出五个属性,系统评估并改进了大型语言模型在口语马来语中处理话语标记的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28277 2026-05-28 cs.AI 84%

Do LLMs Build World Models From Text? A Multilingual Diagnostic of Spatial Reasoning

LLMs 是否从文本构建世界模型?多语言空间推理诊断

Zhikai Pan, Chih-Ting Liao, Chunrui Liu, Xi Xiao, Yitong Qiao, Chunlei Meng, Zhangquan Chen, Xin Cao

机构 * University of New South Wales(新南威尔士大学) Essential Energy University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Zhejiang University(浙江大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 通过多语言诊断基准 MentalMap 评估大语言模型的空间推理能力,发现所有模型在视角推理上存在普遍的性能瓶颈(L3 推理悬崖),表明该限制源于纯文本工作记忆约束而非特定架构。

详情

展开后加载摘要…

URL PDF HTML 收藏