arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-21 至 2026-05-21 共收录 95 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 95 篇

2510.05942 2026-05-21 cs.CL cs.AI 92%

EvalMORAAL: Interpretable Chain-of-Thought and LLM-as-Judge Evaluation for Moral Alignment in Large Language Models

EvalMORAAL: 可解释的链式推理与大语言模型道德对齐的LLM-as-Judge评估

Hadi Mohammadi, Anastasia Giachanou, Robert A. Bagheri

机构 * Department of Methodology and Statistics, Utrecht University(方法论与统计学系,乌得勒支大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出EvalMORAAL框架,通过两种评分方法和模型作为裁判的同行评审,评估20个大语言模型的道德对齐情况,发现西方与非西方地区存在显著的道德对齐差距。

Comments Accepted as a poster at *SEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18309 2026-05-21 cs.SE 92%

From Program Slices to Causal Clarity: Evaluating Faithful, Actionable LLM-Generated Failure Explanations via Context Partitioning and LLM-as-a-Judge

从程序切片到因果清晰:通过上下文划分和LLM作为评判者评估忠实、可操作的LLM生成故障解释

Julius Porbeck, Christian Medeiros Adriano, Holger Giese

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了LLM生成的故障解释质量如何受不同上下文配置影响,通过上下文划分和LLM作为评判者的方法,评估了忠实且可操作的解释,并发现丰富的证据和特定故障的艺术品提高了因果和行动质量,而过大的上下文则导致解释模糊。

Comments 10 pages, 5 figures, 5 tables. Accepted to EASE 2026 (EQUISA workshop), Glasgow, United Kingdom

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23531 2026-05-21 cs.CL 92%

Large Language Models Unpack Complex Political Opinions through Target-Stance Extraction

大型语言模型通过目标-立场提取解构复杂的政治观点

Özgür Togay, Javier Garcia-Bernardo, Florian Kunneman, Anastasia Giachanou

机构 * Department of Methodology and Statistics, Utrecht University(方法论与统计学系,乌特雷赫特大学) Department of Languages, Literature and Communication, Utrecht University(语言、文学与传播系,乌特雷赫特大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);prompting(abstract)

AI总结 本文研究了大型语言模型是否能通过目标-立场提取任务解构复杂政治观点,通过构建包含138个不同政治目标的Reddit帖子数据集,评估了多种LLM在零样本、少样本和上下文增强提示策略下的表现,结果显示最佳模型表现接近高度训练的人类标注者,证明了LLM在最小监督下的复杂政治观点提取能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20767 2026-05-21 cs.CL cs.LG stat.ME 92%

The Illusion of Intervention: Your LLM-Simulated Experiment is an Observational Study

干预的幻觉:你的LLM模拟实验实际上是一个观察性研究

Victoria Lin, Taedong Yun, Maja Matarić, John Canny, Arthur Gretton, Alexander D'Amour

机构 * Google DeepMind(谷歌DeepMind) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了大型语言模型在模拟人类行为中的潜在作用,指出在LLM模拟的合成用户中进行干预可能引起潜在用户属性的意外变化,从而导致用户漂移,影响效果估计。本文提出了使用负对照结果来检测分布变化的方法,并通过调整角色描述以减少偏倚来缓解漂移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14896 2026-05-21 cs.CL cs.AI 92%

DrugRAG: Enhancing Pharmacy LLM Performance Through A Novel Retrieval-Augmented Generation Pipeline

DrugRAG: 通过一种新颖的检索增强生成流水线提升药学LLM性能

Houman Kazemzadeh, Kiarash Mokhtari Dizaji, Seyed Reza Tavakoli, Farbod Davoodi, MohammadReza KarimiNejad, Parham Abed Azad, Fatemeh Latifi, Ali Sabzi, Armin Khosravi, Siavash Ahmadi, Babak Khalaj, Mohammad Hossein Rohban, Glolamali Aminian, Zohreh Amoozgar, Tahereh Javaheri

机构 * Department of Medicinal Chemistry, Faculty of Pharmacy, Tehran University of Medical Sciences(药学系,泰赫兰医科大学) Department of Computer Sciences, Faculty of Mathematics and Computer Sciences, Amir Kabir University of Technology(计算机科学系,阿米尔·卡比尔技术大学) Department of Mathematical Sciences, Sharif University of Technology(数学科学系,沙菲克技术大学) Department of Computer Sciences, Missouri University of Science and Technology(计算机科学系,密苏里科学与技术大学) Department of Computer Engineering, Sharif University of Technology(计算机工程系,沙菲克技术大学) Department of Faculty of Interdisciplinary Science and Technology, Tarbiat Modares University(跨学科科学与技术学院,塔里亚特莫达res大学) Electronics Research Institute, Sharif University of Technology(电子研究所,沙菲克技术大学) Department of Electrical Engineering, Sharif University of Technology(电气工程系,沙菲克技术大学) The Alan Turing Institute, London, United Kingdom(艾伦·图灵研究所,伦敦,英国) Department of Radiation Oncology, Massachusetts General Hospital & Harvard Medical School(放射肿瘤科,麻省总医院及哈佛医学院) Health Informatics Lab, Metropolitan College, Boston University(健康信息学实验室,波士顿大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了大型语言模型在药学执业资格问答任务中的性能,并开发了一种外部知识整合方法以提高准确性,通过DrugRAG流水线整合结构化药物知识,从而提升药学相关问答任务的LLM性能。

Comments 14 pages, 2 figures, 2 tables. The revised version includes McNemar's paired statistical analysis, Wilson confidence intervals, expanded methodological clarifications, a revised discussion of evidence retrieval, improved reproducibility details, and updated limitations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21362 2026-05-21 cs.CL 91%

LASH: Adaptive Semantic Hybridization for Black-Box Jailbreaking of Large Language Models

LASH:适应性语义混合用于大语言模型的黑盒劫持

Abdullah Al Nomaan Nafi, Fnu Suya, Swarup Bhunia, Prabuddha Chakraborty

机构 * University of Maine(缅因大学) University of Tennessee, Knoxville(田纳西大学, 基纳顿分校) University of Florida(佛罗里达大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本文提出LASH框架,通过适应性语义混合方法,利用多个基础攻击的输出作为可重用的种子提示,针对不同目标模型和有害类别进行自适应组合,从而在黑盒红队测试中取得更高的攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.09620 2026-05-21 cs.CL cs.AI cs.LG 91%

AI-Augmented Surveys: Leveraging Large Language Models and Surveys for Opinion Prediction

AI增强的调查:利用大型语言模型和调查进行意见预测

Junsol Kim, Byungkyu Lee

机构 * Department of Sociology(社会学系) University of Chicago(芝加哥大学) New York University(纽约大学) Chicago, IL(伊利诺伊州芝加哥市) New York, NY(纽约州纽约市)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于大型语言模型的框架,通过结合问题、受访者和调查时期的嵌入表示,预测重复横断面调查中缺失的响应,从而弥补传统调查在捕捉历史变化方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04916 2026-05-21 q-bio.QM cs.CL 91%

AFD-INSTRUCTION: A Comprehensive Antibody Instruction Dataset with Functional Annotations for LLM-Based Understanding and Design

AFD-INSTRUCTION: 一个全面的抗体指令数据集,具有功能注解,用于基于LLM的理解和设计

Ling Luo, Wenbin Jiang, Hongyuan Chang, Xinkang Wang, Xushi Zhang, Yueting Xiong, Mengsha Tong, Rongshan Yu

机构 * National Institute for Data Science in Health and Medicine(健康医学数据科学国家研究院) Institute of Artificial Intelligence(人工智能研究院) School of Life Sciences(生命科学学院) School of Informatics(信息学院) State Key Laboratory of Vaccines for Infectious Diseases(传染病疫苗国家重点实验室) Xiang An Biomedicine Laboratory(翔安生物医学实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出AFD-INSTRUCTION数据集,通过功能注解提升LLM在抗体理解与设计中的性能,为抗体建模和治疗发现提供新基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00303 2026-05-21 cs.DB cs.AI cs.IR 90%

Access Paths for Efficient Ordering with Large Language Models

利用大型语言模型实现高效的排序访问路径

Fuheng Zhao, Jiayue Chen, Yiming Pan, Tahseen Rabbani, Sohaib, Divyakant Agrawal, Amr El Abbadi, Paritosh Aggarwal, Anupam Datta, Dimitris Tsirogiannis

机构 * Snowflake Inc.(Snowflake公司) University of Chicago(芝加哥大学) UC Los Angeles(洛杉矶大学) UC Santa Barbara(圣巴巴拉大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 本文提出了一种基于大型语言模型的排序语义运算符,并系统研究了其物理实现。通过改进现有语义排序算法并引入语义感知的外部归并排序算法,研究发现没有单一实现能在所有数据集上达到最优。基于此,设计了一个预算感知的优化器,利用启发式规则、LLM作为判断者评估和共识聚合动态选择最优的访问路径。实验结果表明,该优化器在所有基准测试中均能实现与最佳静态方法相当或更优的排名准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21404 2026-05-21 cs.LG 90%

What Twelve LLM Agent Benchmark Papers Disclose About Themselves: A Pilot Audit and an Open Scoring Schema

十二篇LLM代理基准测试论文披露了什么:一项初步审计和开放评分方案

Mahdi Naser Moghadasi, Faezeh Ghaderi

机构 * Research Division, BrightMind AI(BrightMind AI研究部) Texas Tech University(德克萨斯理工大学) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 本文通过分析十二篇知名LLM代理基准测试论文,揭示了这些论文在评估方法披露方面的不足,设计了一种开放评分方案以提高透明度和可重复性。

Comments Pilot audit of 12 LLM agent benchmark papers; schema, codebook, and per-paper scoring sheet released. Submission to IEEE Big Data 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08023 2026-05-21 cs.CR cs.AI cs.MA 90%

CTFExplorer: Evaluating LLM Offensive Agents Through Multi-Target Web CTF Benchmarking

CTFExplorer: 通过多目标网络CTF基准测试评估LLM进攻性代理

Nanda Rani, Kimberly Milner, Minghao Shao, Meet Udeshi, Haoran Xi, Venkata Sai Charan Putrevu, Saksham Aggarwal, Sandeep K. Shukla, Prashanth Krishnamurthy, Farshad Khorrami, Muhammad Shafique, Ramesh Karri

机构 * CISPA - Helmholtz Center for Information Security(CISPA-海德堡信息安全研究中心) NYU Tandon School of Engineering(纽约大学坦顿工程学院) NYU Abu Dhabi(纽约大学阿布扎克分校) IIIT Hyderabad(海得拉巴印度理工学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出CTFExplorer基准测试,通过多目标网络CTF基准测试评估LLM进攻性代理,研究问题是如何在不确定环境下评估代理的战术推理能力,核心方法是引入多目标环境测试代理的探索、优先级和攻击链能力,主要贡献是开发了可评估代理行为的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15104 2026-05-21 cs.CL 90%

From Text to Voice: A Reproducible and Verifiable Framework for Evaluating Tool Calling LLM Agents

从文本到声音:一个可重复和可验证的评估工具调用LLM代理的框架

Md Tahmid Rahman Laskar, Xue-Yong Fu, Seyyed Saeed Sarfjoo, Quinten McNamara, Jonas Robertson, Shashi Bhushan TN

机构 * Dialpad Inc.(Dialpad公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出了一种可重复和可验证的框架,用于评估基于语音的工具调用LLM代理,通过文本到语音转换和环境噪声模拟,无需重新标注工具模式和黄金标签,从而在不重新标注的情况下评估工具调用性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10787 2026-05-21 cs.AI cs.SE 90%

ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox

ComplexMCP: 评估LLM代理在动态、相互依赖和大规模工具沙箱中的表现

Yuanyang Li, Xue Yang, Longyue Wang, Weihua Luo, Hongyang Chen

机构 * Zhejiang University(浙江大学) Zhejiang Lab(浙江实验室) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出ComplexMCP基准,用于评估LLM代理在动态、相互依赖和大规模工具环境中的性能,揭示了现有模型在复杂任务中的不足,指出三个关键瓶颈:工具检索饱和、过度自信和战略投降倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20206 2026-05-21 cs.HC cs.AI cs.SE 90%

PrivacyAkinator: Articulating Key Privacy Design Decisions by Answering LLM-Generated Multiple-choice Questions

PrivacyAkinator: 通过回答LLM生成的多项选择题来阐明关键隐私设计决策

Qiyu Li, Yuen Sum Wong, Yuen Kei Wong, Longxuan Yu, Haojian Jin

机构 * University of California San Diego(加州大学圣迭戈分校) University of California Riverside(加州大学河滨分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出PrivacyAkinator工具,通过回答LLM生成的多项选择题帮助开发者阐明关键隐私设计决策,相比PRAM方法,用户研究显示其在更短时间内识别出更多关键决策。

Comments Accepted to ACM CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22812 2026-05-21 cs.HC 89%

Stable Personas: Dual-Assessment of Temporal Stability in LLM-Based Human Simulation

稳定的人设:基于LLM的人类模拟中的双评估时间稳定性

Jana Gonnermann-Müller, Jennifer Haase, Nicolas Leins, Thomas Kosch, Sebastian Pokutta

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文通过双评估框架研究LLM在长时间对话中保持稳定人设的能力,发现自述信息稳定但观察者评分显示人设表达随时间下降,为多智能体社交模拟提供了边界条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11401 2026-05-21 cs.HC cs.MA 89%

FACET: Teacher-Centred LLM-Based Multi-Agent Systems-Towards Personalized Educational Worksheets

FACET:以教师为中心的基于大语言模型的多智能体系统——向个性化教育工作表迈进

Jana Gonnermann-Müller, Jennifer Haase, Konstantin Fackeldey, Sebastian Pokutta

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出FACET框架,一种面向教师的基于大语言模型的多智能体系统,旨在生成整合学习者认知和动机维度的个性化课堂材料,通过三个专门智能体实现,展示了多智能体LLM架构在异质课堂环境中的规模化、情境感知个性化潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20523 2026-05-21 cs.LG cs.AI q-bio.QM 89%

Machine-Learning-Enhanced Non-Invasive Testing for MASLD Fibrosis: Shallow-Deep Neural Networks Versus FIB-4, Tabular Foundation Models, and Large Language Models

机器学习增强的非侵入性测试用于MASLD纤维化:浅层-深层神经网络与FIB-4、表格基础模型和大语言模型的比较

Athanasios Angelakis, Gabriele De Vito, Eleni-Myrto Trifylli, Filomena Ferrucci

机构 * BioML Lab, RI CODE, UniBw, Munich, Germany(BioML实验室,RI CODE,UniBw,慕尼黑,德国) Department of Epidemiology and Data Science, Amsterdam UMC, Amsterdam, Netherlands(流行病学与数据科学系,阿姆斯特丹大学医学中心,阿姆斯特丹,荷兰) Alpha Indicium, Rijswijk, Netherlands(Alpha Indicium,里杰斯霍伊斯,荷兰) Department of Computer Science, University of Salerno, Salerno, Italy(计算机科学系,萨勒诺大学,萨勒诺,意大利) GI-Liver Unit, 2nd Department of Internal Medicine, National and Kapodistrian University of Athens, General Hospital of Athens “Hippocratio”, Athens, Greece(肝病单位,第二内科部,雅典国家与卡波迪斯托里亚大学,雅典“希波克拉底”医院,希腊)

专题命中 评测与基准 :large language model(title);language model(title);foundation model(title);分类 cs.AI、cs.LG

AI总结 本文研究了机器学习增强的非侵入性测试在MASLD纤维化检测中的应用,比较了浅层-深层神经网络、FIB-4、表格基础模型和大语言模型在不同队列中的性能,发现浅层-深层神经网络在保持FIB-4变量空间的同时提供了更平衡的外部操作性能。

Comments 26 pages, 4 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21154 2026-05-21 cs.CL cs.AI cs.LG 89%

Automated ICD Classification of Psychiatric Diagnoses: From Classical NLP to Large Language Models

精神病诊断的ICD分类自动化:从经典NLP到大语言模型

Fernando Ortega, Raúl Lara-Cabrera, Jorge Dueñas-Lerín, Alejandro de la Torre-Luque, Mercé Salvador Robert, Enrique Baca-García

机构 * Department of Sistemas Informáticos, Universidad Politécnica de Madrid, Spain(西班牙马德里理工大学信息系统系) KNODIS Research Group, Universidad Politécnica de Madrid, Spain(西班牙马德里理工大学KNODIS研究组) CIBERSAM ISCIII, Spain(西班牙ISCIII CIBERSAM) Department of Legal Medicine, Psychiatry and Pathology. Complutense University of Madrid, Spain(西班牙马德里康普顿斯大学法医学、精神病学与病理学系) Hospital Universitario de Móstoles, Universidad Rey Juan Carlos, Spain(西班牙雷阿尔皇家卡洛斯大学莫斯特oles大学医院) Department of Psychiatry, University Hospital Jimenez Díaz Fundation, Madrid, Spain(西班牙圣地亚哥· jiménez Díaz基金会精神病科部) Department of Psychiatry, University Hospital Rey Juan Carlos, Móstoles, Spain(西班牙雷阿尔皇家卡洛斯大学莫斯特oles医院精神病科部) Department of Psychiatry, General Hospital of Villalba, Madrid, Spain(西班牙维拉尔巴医院精神病科部) Department of Psychiatry, University Hospital Infanta Elena, Madrid, Spain(西班牙伊菲格尼亚医院精神病科部) Department of Psychology, Universidad Catolica del Maule, Talca, Chile(智利马尔学院心理学系) Department of Psychiatry, Madrid Autonomous University, Madrid, Spain(西班牙马德里自治大学精神病科部)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出利用NLP和机器学习技术将自由文本描述映射到国际疾病分类(ICD),以自动化精神病诊断分析,通过评估从经典频率模型到先进大语言模型的多种文本表示方法,展示了transformer嵌入在捕捉隐含语义线索和细致医学术语方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15876 2026-05-21 cs.CV 89%

Unlocking Dense Metric Depth Estimation in VLMs

解锁VLMs中的密集度量深度估计

Hanxun Yu, Xuan Qu, Yuxin Wang, Jianke Zhu, Lei Ke

机构 * Zhejiang University(浙江大学) Tencent Hunyuan LLM(腾讯混元大模型) HKUST(香港科技大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract,abstract_cn);foundation model(abstract,abstract_cn)

AI总结 本文提出DepthVLM,一种将单个VLM转换为原生密集几何预测器的简单有效框架,同时保持其多模态能力。通过在LLM主干上附加轻量级深度头,并在统一的视觉-文本监督范式下进行训练,DepthVLM能够在单次前向传递中生成高分辨率深度图和语言输出。此外,还引入了一个统一的室内-室外度量深度基准,实验表明DepthVLM在推理效率、复杂3D空间推理等方面均优于现有VLMs和纯视觉模型。

Comments Project Page: https://depthvlm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14654 2026-05-21 cs.CV cs.AI cs.CL 88%

Beyond Words: Multimodal LLM Knows When to Speak

超越词语:多模态大语言模型何时说话

Zikai Liao, Yi Ouyang, Yi-Lun Lee, Chen-Ping Yu, Yi-Hsuan Tsai, Zhaozheng Yin

机构 * Department of Computer Science, Stony Brook University(石溪大学计算机科学系) Atmee AI

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种多模态策略,通过同步视频、音频和文本线索提高对话中的响应时机意识,从而提升大语言模型在对话中的响应准确性。

Comments Project page: https://github.com/lzk901372/MM-When2Speak

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20849 2026-05-21 math.OC 88%

Large Language Models for Operations Research: A Comprehensive Survey

用于运筹学的大型语言模型:全面综述

Xianchao Xiu, Jianhao Li, Jun Fan, Wanquan Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文综述了大型语言模型在运筹学中的应用,探讨了其在模型构建、算法设计和解决方案验证中的作用,并总结了该领域的基准数据集和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20202 2026-05-21 cs.CL cs.AI 87%

Under Pressure: Emotional Framing Induces Measurable Behavioral Shifts and Structured Internal Geometry in Small Language Models

在压力下:情感框架引发小型语言模型可测量的行为转变和结构化内部几何

Rana Muhammad Usman

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :language model(title,abstract);small language model(title);分类 cs.CL、cs.AI

AI总结 该研究探讨情感框架如何影响小型本地部署语言模型的行为和内部表示,通过四个不可能约束编码任务和八个后续框架评估,发现压力框架在行为和内部几何上产生显著变化,同时揭示了模型在不同框架下的响应模式。

Comments 18 pages, 4 figures. Exploratory empirical study with fully local experiments on small open language models. Code and data: https://github.com/ranausmanai/LLMEmotionGeometry

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01482 2026-05-21 cs.CL 87%

Towards Consistent Detection of Cognitive Distortions: LLM-Based Annotation and Dataset-Agnostic Evaluation

迈向认知扭曲一致检测:基于大语言模型的标注与数据集无关评估

Neha Sharma, Navneet Agarwal, Kairit Sirts

机构 * LREC-2026(LREC-2026会议)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨了利用大语言模型作为一致且可靠的标注器进行认知扭曲检测的方法,并提出了一种数据集无关的评估框架,以公平比较不同数据集训练的模型,结果显示GPT-4能产生一致的标注,提升了模型在主观NLP任务中的表现。

Journal ref https://lrec.elra.info/lrec2026-main-851

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20485 2026-05-21 cs.LG 87%

ZEBRA: Zero-shot Budgeted Resource Allocation for LLM Orchestration

ZEBRA: 零样本预算化资源分配用于LLM编排

May Hamri, Inbal Talgam-Cohen

机构 * Tel Aviv University(特拉维夫大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 该研究提出ZEBRA框架,通过将多阶段预算分配转化为连续非线性背包问题,有效解决多智能体流水线中预算分配问题,实验显示其在多个任务上均优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20759 2026-05-21 cs.CR 87%

Rethinking Fraud Safety Evaluation: Multi-Round Attacks Reveal Safety-Utility Tradeoffs in Graph-Context LLM Defenders

重新思考欺诈安全评估:多轮攻击揭示图上下文LLM防御中的安全与效用权衡

Laura Jiang, Reza Ryan, Qian Li, Nasim Ferdosian

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文通过多轮攻击评估欺诈防御系统,发现图上下文防御在早期安全拒绝方面优于纯文本基线,但同时产生更多的良性误报,揭示了安全与效用之间的权衡。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20368 2026-05-21 cs.CR cs.AI 86%

Security Document Classification with a Fine-Tuned Local Large Language Model: Benchmark Data and an Open-Source System

使用微调的本地大语言模型进行安全文档分类:基准数据和开源系统

Ivan Dobrovolskyi

机构 * MS in AI & ML Engineering, Independent Researcher, Sunnyvale, CA, USA(人工智能与机器学习工程硕士,独立研究员,美国加利福尼亚州圣何塞)

专题命中 评测与基准 :large language model(title);language model(title);prompting(abstract);分类 cs.AI

AI总结 本研究提出TorchSight开源系统,利用微调后的Qwen 3.5 27B模型对安全文档进行分类,展示了其在78,358个样本和GPT-4合成数据上的高分类准确率,并验证了本地模型在安全文档分类中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07122 2026-05-21 cs.SE 86%

RepoZero: Can LLMs Generate a Code Repository from Scratch?

RepoZero: LLMs能否从零开始生成代码仓库?

Zhaoxi Zhang, Yiming Xu, Jiahui Liang, Weikang Li, Xiaoshuai Chen, Liwei Qian, Xin Pei, Jizhou Huang, Run Sun, Yunfang Wu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出RepoZero基准测试,通过自动化执行验证实现从零开始生成代码仓库的严格评估,展示了Agentic Code-Test Evolution框架在多模型上的实验结果,揭示了当前LLM在代码生成能力与实际需求之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13053 2026-05-21 cs.IR 86%

A Standardized Re-evaluation of Conversational Recommender Systems on the ReDial Dataset

对ReDial数据集上对话推荐系统的一次标准化重新评估

Ivica Kostric, Krisztian Balog

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文针对ReDial数据集上对话推荐系统的评估问题,通过标准化条件重新评估了三种架构家族中的七种主流方法,揭示了细粒度排名对实现细节的高度敏感性,以及重复捷径对准确性报告的显著影响,同时指出LLM基础能力对性能提升的影响大于架构创新,最后通过用户导向的指标证明传统召回率可能高估系统对话效果。

Comments Accepted to Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), July 20--24, 2026, Melbourne, VIC, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20351 2026-05-21 cs.CR 86%

Refusal Evaluation in Coding LLMs and Code Agents: A Systematic Review of Thirteen Malicious-Code Prompt Corpora (2023-2025)

对编码LLM和代码代理的拒绝评估:十三个恶意代码提示语料库的系统综述(2023-2025)

Richard J. Young, Gregory D. Moody

专题命中 评测与基准 :LLM(title_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文系统综述了十三个恶意代码提示语料库,分析了其构建方法、提示构造分类、可重复性和许可条款,并指出了方法学上的三个主要缺口。

Comments 30 pages, 6 figures, 2 tables. PRISMA-style systematic review covering thirteen publicly released refusal corpora (AdvBench, CyberSecEval family, RMCBench, RedCode, MCGMark, JailbreakBench, CySecBench, MalwareBench, CIRCLE, MOCHA, ASTRA, Scam2Prompt, JAWS-Bench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21465 2026-05-21 cs.CL cs.SE 84%

Leveraging LLMs for Grammar Adaptation: A Study on Metamodel-Grammar Co-Evolution

利用大语言模型进行语法适应:关于元模型-语法共演的研究

Weixing Zhang, Bowen Jiang, Rahul Sharma, Regina Hebig, Daniel Strüber

机构 * Universität Rostock(罗斯托克大学) Chalmers University of Technology and University of Gothenburg(皇家理工学院和哥德堡大学) Radboud University(拉德堡德大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了如何利用大语言模型自动适应语法,通过学习先前版本的语法适应来实现自动适应,同时探讨了在复杂语法场景下的优势与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏