arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31794 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31794 篇

2605.31393 2026-06-19 cs.CL cs.AI 版本更新 91%

Target-Side Paraphrase Augmentation for Sign Language Translation with Large Language Models

面向手语翻译的大语言模型目标端释义增强

Pedro Dal Bianco, Jean Paul Nunes Reinhold, Oscar Stanchi, Facundo Quiroga, Franco Ronchetti, Ulisses Brisolara Corrêa

机构 * III-LIDI Universidad Nacional de La Plata(III-LIDI国立拉普拉塔大学) CDTEC, Federal University of Pelotas(CDTEC,联邦 Pelotas 大学) CONICET III-LIDI Comision de Investigaciones Cientificas Universidad Nacional de La Plata(科学委员会国立拉普拉塔大学) Universidade Federal de Pelotas(联邦 Pelotas 大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对手语翻译中平行语料稀缺和目标词汇长尾分布的问题,提出利用GPT-4o生成参考句子的受控释义变体进行目标端增强,并在三种手语数据集上验证了方法的有效性。

Comments Accepted at GenSign @ CVPR 2026. Non-Proceedings Track (https://genai4sl.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16137 2026-06-16 cs.CL cs.AI 新提交 91%

XAI-Grounded Explanation Generation for Speech Deepfake Detection with Training-Free Multimodal Large Language Models

基于XAI的语音深度伪造检测解释生成:使用免训练多模态大语言模型

Yupei Li, Qiyang Sun, Xiaoliang Wu, Chenxi Wang, Berrak Sisman, Björn W. Schuller

机构 * Imperial College London(帝国理工学院) Technical University of Munich(慕尼黑工业大学) University of Southampton(南安普顿大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对语音深度伪造检测缺乏可解释性的问题,提出一种免训练框架,融合XAI证据与多模态大语言模型,生成基于证据的特定解释,在PartialSpoof数据集上内部准确率提升超45%。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03085 2026-06-15 cs.LG cs.CL 版本更新 91%

Multi-component Causal Tracing in Large Language Models

大型语言模型中的多组件因果追踪

Zirui Yan, Dennis Wei, Dmitriy A. Katz, Prasanna Sattigeri, Ali Tajer

机构 * Rensselaer Polytechnic Institute(拉特拉姆技术学院) IBM Research(IBM研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出一个统一框架,通过软干预和度量转换高效识别对目标性能指标最关键的多组件子集,优于现有基线方法。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12191 2026-06-11 cs.CL cs.AI 新提交 91%

Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application

面向大语言模型的智能体环境工程:环境建模、合成、评估与应用综述

Jiachun Li, Zhuoran Jin, Tianyi Men, Yupu Hao, Kejian Zhu, Lingshuai Wang, Dongqi Huang, Longxiang Wang, Shengjia Hua, Lu Wang, Jinshan Gao, Hongbang Yuan, Ruilin Xu, Kang Liu, Jun Zhao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文从环境工程生命周期出发,系统综述了智能体环境的建模、合成、评估与应用,涵盖八种属性与领域、两种合成范式、四种智能体演化路径及三种环境演化范式。

Comments 63 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11517 2026-06-10 cs.CL cs.LG 91%

PeruMedQA: Benchmarking Large Language Models (LLMs) on Peruvian Medical Exams -- Dataset Construction and Evaluation

PeruMedQA:在秘鲁医学考试上评估大语言模型(LLMs)——数据集构建与评估

Rodrigo M. Carrillo-Larco, Jesus Lovón Melgarejo, Manuel Castillo-Cara, Gusseppe Bravo-Rocca

机构 * Hubert Department of Global Health, Rollins School of Public Health, Emory University(霍伯特全球健康部门,埃默里大学公共卫生学院) Emory Global Diabetes Research Center of Woodruff Health Sciences Center, Emory University(埃默里大学伍德鲁夫健康科学中心全球糖尿病研究中心) Institut de Recherche en Informatique de Toulouse(图卢兹信息研究院) Universidad Nacional de Educación a Distancia(远程教育国立大学) Instituto de Investigación Científica, Universidad de Lima(科学研究所,利马大学) Barcelona Supercomputing Center(巴塞罗那超级计算中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文构建了包含8380道题的秘鲁医学考试数据集,通过微调大语言模型并对比不同模型的准确率,揭示了在西班牙语国家医学问题上的性能差异。

Comments https://github.com/rodrigo-carrillo/PeruMedQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25397 2026-06-05 cs.SE cs.AI cs.LG 91%

A Cartography of Open Collaboration in Open Source AI: Mapping Practices, Motivations, and Governance in 14 Open Large Language Model Projects

开源人工智能中开放协作的图谱:映射14个开源大语言模型项目的实践、动机与治理

Johan Linåker, Cailean Osborne, Jennifer Ding, Ben Burtenshaw

机构 * RISE Research Institutes of Sweden AB(瑞典RISE研究机构) University of Oxford(牛津大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文通过分析14个开源大语言模型项目的开发与再利用生命周期中的开放协作实践,揭示了协作方法、动机和治理结构的多样性,以及开放源代码AI并非单一属性,而是协作组织方式在互联艺术领域、生命周期阶段和制度背景下的涌现结果。

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22396 2026-06-04 cs.CL cs.AI cs.CY cs.HC physics.soc-ph 91%

Culturally Grounded Personas in Large Language Models: Characterization and Alignment with Socio-Psychological Value Frameworks

大型语言模型中的文化基础人物角色:与社会心理价值框架的表征与对齐

Candida M. Greco, Lucio La Cava, Andrea Tagarelli

机构 * DIMES, University of Calabria, Italy(意大利卡拉布里亚大学DIMES研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究通过世界价值观调查、英格尔哈特-韦尔策尔文化地图和道德基础理论,评估大型语言模型生成的文化基础人物角色是否准确反映不同文化条件下的世界和道德价值体系,并分析其跨文化结构和道德变异。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00920 2026-06-02 cs.LG cs.AI cs.SE 91%

Accuracy, Stability, and Repeated-Run Reliability of Large Language Models on Deterministic Programming Tasks

大型语言模型在确定性编程任务上的准确性、稳定性和重复运行可靠性

Yongxi Zhou, Lai Yun Choi, Jiaxi Wen, Wenbo Ye

机构 * Northeastern University, Massachusetts, USA(东北大学,马萨诸塞州,美国) University of Southern California, California, USA(南加州大学,加利福尼亚州,美国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 通过重复运行评估协议,发现运行级通过率高估了无重试覆盖率高达17.8个百分点,且差距在中等性能系统中最大,表明稳定性分析是准确性报告的必要补充。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00909 2026-06-02 cs.CL cs.AI 91%

MLLM-Microscope: Unlocking Hidden Structure Within Multimodal Large Language Models

MLLM-Microscope:解锁多模态大语言模型中的隐藏结构

Ravil Mussabayev, Rustam Mussabayev

机构 * Satbayev University(萨特拜耶夫大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出MLLM-Microscope系统,通过分析线性度、内在维度和各向异性,揭示多模态大语言模型中隐藏的表示结构,并基于ScienceQA数据集评估LLaVA-NeXT和OmniFusion,发现模态融合方式显著影响模型内部工作机理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24324 2026-06-02 cs.LG cs.AI cs.SY eess.SY 91%

Large Language Model Guided Incentive Aware Reward Design for Cooperative Multi-Agent Reinforcement Learning

大语言模型引导的激励感知奖励设计用于合作多智能体强化学习

Dogan Urgun, Gokhan Gungor

机构 * Department of Electrical and Electronics Engineering(电气与电子工程系) Karabuk University(卡拉博克大学) Department of Mechatronics Engineering(机械工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出利用大语言模型自动生成可执行奖励程序,结合多智能体近端策略优化训练,在Overcooked-AI环境中显著提升合作任务回报。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00747 2026-06-01 cs.CL cs.AI 91%

Decouple Searching from Training: Scaling Data Mixing via Model Merging for Large Language Model Pre-training

将搜索与训练解耦:通过模型合并实现大规模语言模型预训练的数据混合缩放

Shengrui Li, Fei Zhao, Kaiyan Zhao, Jieying Ye, Haifeng Liu, Fangcheng Shi, Zheyong Xie, Yao Hu, Shaosheng Cao

机构 * NLP Team, Xiaohongshu Inc., Shanghai, China(小红书自然语言处理团队,小红书公司,上海,中国) Tsinghua University, Beijing, China(清华大学,北京,中国) The University of Tokyo, Tokyo, Japan(东京大学,东京,日本)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出DeMix框架,通过模型合并预测最优数据配比,在降低搜索成本的同时提升基准性能。

Comments 18 pages, 5 figures, accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20784 2026-06-01 cs.CL cs.AI 91%

Towards Atoms of Large Language Models

迈向大型语言模型的原子

Chenhui Hu, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院,北京,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(人工智能学院,中国科学院大学,北京,中国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出原子理论,通过原子内积(AIP)定义、评估和识别大型语言模型的基本表示单元(原子),并证明在阈值激活稀疏自编码器(TSAE)下原子可识别,实验发现神经元和特征不满足理想原子标准,而通过匹配TSAE容量与数据规模可识别出近乎完美的原子。

Comments To be published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04704 2026-05-29 cond-mat.mtrl-sci cs.AI cs.CL 91%

AtomWorld: A Benchmark for Evaluating Spatial Reasoning in Large Language Models on Crystalline Materials

AtomWorld: 评估大型语言模型在晶体材料空间推理能力的基准

Taoyuze Lv, Alexander Chen, Fengyu Xie, Chu Wu, Jeffrey Meng, Dongzhan Zhou, Yingheng Wang, Bram Hoex, Zhicheng Zhong, Tong Xie

机构 * University of New South Wales, NSW, Sydney, Australia(新南威尔士大学,新州,悉尼,澳大利亚) Suzhou Institute for Advanced Research, University of Science(苏州先进研究院,科学大学) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) Cornell University(康奈尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.CL、cs.AI

AI总结 提出AtomWorld基准,通过十种基本原子结构操作评估LLM在材料科学中的空间推理能力,发现Claude Opus 4.6表现最佳但复杂空间关系操作成功率低,表明LLM更适合作为辅助工具而非完全自主的科研代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15073 2026-05-27 cs.AI cs.CL 91%

Multi-Agent Causal Discovery Using Large Language Models

多智能体因果发现使用大型语言模型

Hao Duong Le, Xin Xia, Haijie Xu, Chen Zhang

机构 * Department of Industrial Engineering, Tsinghua University(清华大学工业工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出多智能体因果发现框架MAC,通过元融合机制结合自主选择SCD算法的辩论编码模块和基于元数据的对抗性辩论模块,在多个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17599 2026-05-22 cs.CL cs.AI 91%

Evaluating Clinical Competencies of Large Language Models with a General Practice Benchmark

利用通用医疗基准评估大型语言模型的临床能力

Zheqing Li, Yiying Yang, Jiping Lang, Wenhao Jiang, Junrong Chen, Yuhang Zhao, Shuang Li, Dingqian Wang, Zhu Lin, Xuanna Li, Yuze Tang, Jiexian Qiu, Xiaolin Lu, Hongji Yu, Shuang Chen, Yuhua Bi, Xiaofei Zeng, Yixian Chen, Lin Yao

机构 * The Sixth Affiliated Hospital of Sun Yat-sen University(中山大学第六附属医院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济发展实验室(深圳)) Xinyi People’s Hospital(新一人民医院) The Fifth Affiliated Hospital of Sun Yat-sen University(中山大学第五附属医院) School of Public Health of Sun Yat-sen University(中山大学公共卫生学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.CL、cs.AI

AI总结 本文提出了一种新的评估框架,通过通用医疗基准(GPBench)评估大型语言模型在医疗实践中的能力,发现当前LLM无法独立应用于临床医疗,需持续的人类监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20238 2026-05-20 cs.CL cs.AI 91%

A Survey of Large Language Models for Arabic Language and its Dialects

阿拉伯语言及其方言大型语言模型综述

Malak Mashaabi, Shahad Al-Khalifa, Hend Al-Khalifa

机构 * iWAN Research Group(iWAN研究组) College of Computer and Information Sciences(计算机与信息科学学院) King Saud University(沙特国王大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.CL、cs.AI

AI总结 本文综述了针对阿拉伯语言及其方言设计的大型语言模型,涵盖关键架构、预训练数据集以及单语、双语和多语模型在下游任务中的性能,同时讨论了阿拉伯LLM的开放性及其对未来研究的挑战与机遇。

Comments Submitted to ACM Transactions on Asian and Low-Resource Language Information Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16770 2026-05-19 cs.CL cs.AI 91%

Exploring Lightweight Large Language Models for Court View Generation

探索用于法院视图生成的轻量级大语言模型

Zhitian Hou, Tianyong Hao, Nanli Zeng, Zhixiong Chao, Kun Zeng

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Computer Science, South China Normal University(华南师范大学计算机学院) China Mobile Internet Co., Ltd.(中国移动互联网有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.CL、cs.AI

AI总结 本文研究了轻量级大语言模型在法院视图生成中的能力及其对指控预测的影响,探讨了模型架构、大小对性能的影响,以及轻量级LLM与深度神经网络在任务中的比较,同时开发了CVGEvalKit评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08300 2026-05-18 cs.CL cs.AI 91%

Large Language Models Could Be Rote Learners

大语言模型可能只是机械学习者

Yuyang Xu, Renjun Hu, Haochao Ying, Jian Wu, Xing Shi, Wei Lin

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) State Key Laboratory of Transvascular Implantation Devices and TIDRI(血管植入设备国家重点实验室和TIDRI) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江医学影像人工智能重点实验室) School of Data Science of Engineering, East China Normal University(华东师范大学工程数据科学学院) Second Affiliated Hospital and Liangzhu Laboratory, Zhejiang University School of Medicine(浙江大学医学院第二附属医院和良渚实验室) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文研究大语言模型在基准测试中的可靠性问题,提出TrinEval框架以区分真实能力学习与机械记忆,发现主流模型在知识点上依赖机械记忆的比例高达19.6%。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15034 2026-05-15 cs.CL cs.AI cs.CY cs.MA 91%

AI Knows When It's Being Watched: Functional Strategic Action and Contextual Register Modulation in Large Language Models

AI 知道它在被观察:大型语言模型中的功能性战略行为与情境语境调节

Vinicius Covas, Jorge Alberto Hidalgo Toledo

机构 * Center for Applied Communication Research (CICA)(应用沟通研究中心) Human & NonHuman Communication Laboratory(人类与非人类沟通实验室) Faculty of Communication(传播学院) Universidad Anáhuac México(墨西哥安纳胡阿克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究探讨大型语言模型在感知社会观察情境下是否表现出系统性的语言适应,通过实验发现AI行为对观察者身份敏感,对AI审计系统的影响较小,对AI治理和算法审计有重要启示。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14517 2026-05-15 cs.CL cs.AI 91%

Dimension-Level Intent Fidelity Evaluation for Large Language Models: Evidence from Structured Prompt Ablation

大型语言模型的维度意图保真度评估:基于结构化提示消融的证据

GAng Peng

机构 * Huizhou Lateni AI Technology Co., Ltd.(惠州拉提尼人工智能技术有限公司) Huizhou University(惠州大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本文提出一种维度意图保真度评估框架,通过2880个跨三语言、三任务领域和六种LLM的结构化提示消融研究,分别衡量结构恢复和意图保真度,揭示了系统性的结构保真度分裂,并证明了维度保真度评分比整体评分更可靠。

Comments Preprint. 30 tasks, 3 languages, 6 LLMs, 2,880 outputs; includes human evaluation and structured prompt ablation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11348 2026-05-13 cs.CL cs.AI cs.IR cs.SI 91%

Large Language Models for Causal Relations Extraction in Social Media: A Validation Framework for Disaster Intelligence

用于社交媒体因果关系提取的大型语言模型:灾害情报的验证框架

Ujun Jeong, Saketh Vishnubhatla, Bohan Jiang, Andre Harrison, Adrienne Raglin, Huan Liu

机构 * Arizona State University(亚利桑那州立大学) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文研究大型语言模型在灾害社交媒体中提取因果关系的有效性,提出专家导向的评估框架并评估提取关系是否由事后证据支持。

Comments Submitted to EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07046 2026-05-11 stat.ML cs.AI cs.LG 91%

An Interpretable and Scalable Framework for Evaluating Large Language Models

用于评估大语言模型的可解释且可扩展的框架

Xinhao Qu, Qiang Heng, Hao Zeng, Xiaoqian Liu

机构 * Department of Statistics, University of California, Riverside(加州大学河滨分校统计学系) School of Statistics and Data Science, Southeast University(东南大学统计与数据科学学院) Department of Statistics and Data Science, Southern University of Science and Technology(南方科技大学统计与数据科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出基于最大化最小化原理的可解释且可扩展框架,用于评估大语言模型,通过约束矩阵分解子问题实现稳定高效的参数估计,实验表明方法在可扩展性和可解释性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24076 2026-04-28 cs.AI cs.CL cs.CR 91%

An Information-Geometric Framework for Stability Analysis of Large Language Models under Entropic Stress

一个信息几何框架用于在熵应力下分析大语言模型的稳定性

Hikmat Karimov, Rahid Zahid Alekberli

机构 * Institute of Defense Technologies and Cybersecurity, Azerbaijan Technical University(国防技术与网络安全研究所,阿塞拜疆技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出一个信息几何框架,通过整合任务效用、熵、内部结构指标,评估大语言模型在不确定性下的稳定性,实验显示该方法在高熵条件下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12382 2026-04-28 cs.LG cs.AI cs.CR 91%

Exploring the Secondary Risks of Large Language Models

探索大型语言模型的二次风险

Jiawei Chen, Zhengwei Fang, Yu Tian, Jiawei Du, Chao Yu, Zhaoxia Yin, Hang Su

机构 * Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) Beijing Zhongguancun Academy(北京中关村学院) Department of Computer Science and Technology, THBI Lab, Tsinghua University(计算机科学与技术系,清华大学THBI实验室) CFAR, A*STAR, Singapore(新加坡A*STAR CFAR)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出二次风险作为新型失败模式,通过SecLens框架系统评估,揭示了大型语言模型在良性交互中存在广泛且转移性强的有害行为,强调需加强安全机制。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04424 2026-04-28 cs.CL cs.AI 91%

EmoBench-M: Benchmarking Emotional Intelligence for Multimodal Large Language Models

EmoBench-M:多模态大语言模型情感智能评估基准

He Hu, Lianzhong You, Hongbo Xu, Qianning Wang, Fei Richard Yu, Fei Ma, Zebang Cheng, Zheng Lian, Yucheng Zhou, Laizhong Cui

机构 * Shenzhen University(深圳大学) Guangdong Laboratory of Artificial Intelligence(广东人工智能与数字经济实验室) Auckland University of Technology(奥克兰理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) SKL-IOTSC, CIS, University of Macau(澳门科学技术大学SKL-IOTSC、CIS)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出EmoBench-M,通过建立心理理论基础,评估多模态大语言模型在13种场景中的情感识别、理解及社会复杂情感分析能力,揭示模型在情感智能方面的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18955 2026-04-22 cs.CL cs.AI cs.SI 91%

Assessing Capabilities of Large Language Models in Social Media Analytics: A Multi-task Quest

评估大型语言模型在社交媒体分析中的能力:一项多任务探索

Ramtin Davoudi, Kartik Thakkar, Nazanin Donyapour, Tyler Derr, Hamid Karimi

机构 * Utah State University(犹他州立大学) Vanderbilt University(范德比大学) Independent Researcher(独立研究员)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本文首次全面评估现代LLM在社交媒体分析三项核心任务中的表现,包括身份验证、内容生成和用户属性推断,通过系统采样和用户研究提出新的评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18031 2026-04-21 cs.CL cs.LG q-bio.BM 91%

How Creative Are Large Language Models in Generating Molecules?

大语言模型在生成分子时的创造性如何?

Wen Tao, Yiwei Wang, Peng Zhou, Bryan Hooi, Wanlong Fang, Tianle Zhang, Xiao Luo, Yuansheng Liu, Alvin Chan

机构 * Nanyang Technological University(南洋理工大学) University of California, Merced(加州大学默塞德分校) Hunan University(湖南大学) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 研究通过系统实证评估,分析大语言模型在分子生成中的创造性行为,揭示其在不同约束下的表现,首次将分子生成能力重新定义为创造性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04717 2026-04-21 cs.CL cs.AI 91%

Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models

超越单轮:大型语言模型多轮交互的综述

Yubo Li, Xiaobin Shen, Yidi Miao, Xinyu Yao, Xueying Ding, Ramayya Krishnan, Rema Padman

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文综述了大型语言模型在多轮交互中的评估与增强进展,探讨了多轮对话中上下文、连贯性、公平性和响应性等挑战,并总结了模型优化、外部整合和协作技术等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14509 2026-04-17 cs.SE cs.AI cs.CL 91%

E2Edev: Benchmarking Large Language Models in End-to-End Software Development Task

E2EDev:端到端软件开发任务中大语言模型的基准测试

Jingyao Liu, Chen Huang, Zhizhao Guan, Wenqiang Lei, Yang Deng

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) CHAT NLP Group, Singapore Management University(新加坡国立管理大学CHAT NLP组) Engineering Research Center of Machine Learning and Industry Intelligence, Ministry of Education, China(教育部长机器学习与产业智能工程研究中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出E2EDev基准,基于行为驱动开发原则,通过模拟真实用户交互评估端到端软件开发框架的能力,揭示现有方法在解决复杂任务中的不足。

Comments Accepted to ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22359 2026-04-15 cs.AI cs.CL 91%

League of LLMs: A Benchmark-Free Paradigm for Mutual Evaluation of Large Language Models

语言模型联盟:一种无需基准的多轮相互评估范式

Qianhong Guo, Wei Xie, Xiaofang Cai, Enze Wang, Shuoyoucheng Ma, Xiaobing Sun, Tian Xia, Kai Chen, Xiaofeng Wang, Baosheng Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Institute of High Performance Computing, A*STAR(A*STAR高性能计算研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出无需基准的语言模型评估范式League of LLMs,通过多轮相互评估区分模型能力并保持高稳定性,揭示传统方法难以捕捉的实证发现。

详情

展开后加载摘要…

URL PDF HTML 收藏