arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-26 至 2026-05-26 共收录 663 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 142 篇

2605.25536 2026-05-26 cs.SE cs.AI 90%

A Tertiary Review of Large Language Model-Based Code Generating Tasks: Trends, Challenges, and Future Directions

基于大语言模型的代码生成任务的三级综述:趋势、挑战与未来方向

Muslim Chochlov, Michael English, Jim Buckley

机构 * University of Limerick(利默里克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本三级综述综合了30篇二级研究(2017-2025年),分析了基于大语言模型的代码生成任务在出版趋势、效果、场景、集成挑战和未来方向上的证据,发现基准测试准确率高但泛化性弱,鲁棒性脆弱,效率问题普遍,毒性和偏见报告不足,主要挑战涉及经济可行性、评估有效性和社会技术集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23148 2026-05-26 cs.CL cs.CY 90%

When Symptoms Are Not Enough: Evidence-Weighting Patterns in Large Language Model Psychiatric Screening

当症状不足时:大语言模型精神科筛查中的证据加权模式

Jianfeng Zhu, Megan Korhummel, Ruoming Jin, Karin G. Coifman

机构 * Departments of Computer Science1 and Psychological Science2(计算机科学系和心理学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);prompting(abstract)

AI总结 本研究引入SCID锚定基准,评估五个大语言模型在精神科筛查中的表现,发现模型在焦虑症、抑郁症和创伤后应激障碍分类中,当存在功能保留或保护性背景时倾向于低估症状证据,导致假阴性错误。

Comments 25 pages 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24850 2026-05-26 cs.CL cs.IT math.IT stat.AP 90%

Repeated Sequences Reveal Gaps between Large Language Models and Natural Language

重复序列揭示大语言模型与自然语言之间的差距

Kumiko Tanaka-Ishii

机构 * Waseda University(早稻田大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 通过分析重复子序列的分布及其与高阶Rényi熵的关系,提出一种评估大语言模型生成文本长程统计组织的框架,发现GPT生成文本在熵增长模式上与自然语言存在系统性差异。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19219 2026-05-26 cs.CL cs.CR 90%

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework

大型语言模型在评估中作弊了多少?基于一次性密码本的框架下的高估基准测试

Zi Liang, Liantong Yu, Shiyu Zhang, Qingqing Ye, Haibo Hu

机构 * Tech Startups(科技初创公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对大型语言模型在公开基准测试中因数据污染或训练偏差导致评估结果虚高的问题,提出基于一次性密码本加密思想的动态评估框架ArxivRoll,包含自动生成私有测试用例的SCP模块和衡量污染与偏差比例的Rugged Scores指标,实现可重复、透明且高效的评估。

Comments This paper has been accepted by AAAI 2026. We update it for adding new evaluation results for ArxivRollBench-2025a and ArxivRollBench-2026a, with the evaluation of timly models like DeepSeekV4Pro, GPT-5.5, Claude-Opus-4.7, and so on. Source code: https://github.com/liangzid/ArxivRoll/ Online Leaderboard Website: https://arxivroll.moreoverai.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26070 2026-05-26 cs.CL 90%

WhoSaidIt: Human-LLM Collaborative Annotation for Text-Based Multilingual Speaker-Attribute Classification

WhoSaidIt:面向文本的多语言说话人属性分类的人机协作标注

Lingyu Gao, Will Monroe, David Smith, Meghan Jemison, Jackie Lee

机构 * Duolingo

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一种人机协作重标注框架,通过迭代交互和分歧采样稳定多语言说话人属性标签,构建WhoSaidIt数据集并评估LLM性能。

Comments 16 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25415 2026-05-26 cs.CL cs.CY cs.ET 90%

LLM-as-a-Reviewer: Benchmarking Their Ability, Divergence, and Prompt Injection Resistance as Paper Reviewers

LLM-as-a-Reviewer: 基准测试它们作为论文审稿人的能力、分歧和提示注入抵抗性

Lingyao Li, Junjie Xiong, Changjia Zhu, Runlong Yu, Chen Chen, Junyu Wang, Renkai Ma, Zhicong Lu

机构 * University of South Florida(佛罗里达南大学) Missouri University of Science and Technology(密苏里科技大学) University of Alabama(阿拉巴马大学) Florida International University(佛罗里达国际大学) University of Cincinnati(辛辛那提大学) George Mason University(乔治·梅森大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过一个系统基准测试,评估了12个大型语言模型在论文评审中的表现,包括评分校准、与人类审稿人的分歧以及对不可见字体映射攻击的抵抗性,发现LLMs存在系统性高估弱论文、与人类关注点不同以及易受提示注入攻击等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25232 2026-05-26 cs.SE cs.AI cs.LO 90%

Specification-Based Code-Text-Code Reengineering for LLM-Mediated Software Evolution

基于规约的代码-文本-代码重构:面向LLM介导的软件演化

Oleg Grynets, Vasyl Lyashkevych, Arsen Dolichnyi, Roman Piznak, Taras Zelenyy, Volodymyr Morozov

机构 * EPAM Systems(EPAM系统) McLean, Virginia, USA(美国弗吉尼亚州麦莱恩) Lviv, Ukraine(乌克兰利沃夫) Kyiv, Ukraine(乌克兰基辅)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种基于规约的Code2Text2Code重构框架,通过将源代码转换为中性文本规约并迭代验证,解决直接Code2Code转换中的语义漂移、行为变化等问题,实现受控的LLM介导软件演化。

Comments 15 pages, 9 figures, 7 tables, 39 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24904 2026-05-26 cs.CL 90%

Quantifying the Impact of Translation Errors on Multilingual LLM Evaluation

量化翻译错误对多语言大语言模型评估的影响

Klaudia-Doris Thellmann, Bernhard Stadler, Michael Färber, Jens Lehmann

机构 * TUD Dresden University of Technology and ScaDS.AI(德累斯顿技术大学和ScaDS.AI) InfAI e.V.(InfAI协会) Amazon(亚马逊)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究机器翻译基准中的翻译错误如何影响多语言LLM评估的可靠性,通过自动错误跨度检测和准确性下降分析揭示翻译错误与评估指标之间的关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05847 2026-05-26 cs.CL 90%

Schema-Grounded LLM Extraction for FHIR Patient Digital Twins

基于Schema的LLM抽取用于FHIR患者数字孪生

Rafael Brens, Yuqiao Meng, Luoxi Tang, Zhaohan Xi

机构 * Binghamton University(宾夕法尼亚州立大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出SG-LLM方法,通过检索增强、JSON Schema约束和验证器修复循环,从非结构化EHR中生成有效的FHIR Bundle,并在临床效用实验中优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17937 2026-05-26 cs.CL cs.AI 90%

BacktestBench: Benchmarking Large Language Models for Automated Quantitative Strategy Backtesting

BacktestBench:面向自动化量化策略回测的大语言模型基准测试

Zhensheng Wang, Wenmian Yang, Qingtai Wu, Lequan Ma, Yiquan Zhang, Weijia Jia

机构 * Beijing Normal University(北京师范大学) Elmleaf Ltd.(Elmleaf公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 提出首个大规模自动化量化回测基准BacktestBench,包含18,246个问答对,并设计多智能体基线AutoBacktest,通过协调摘要器、检索器和编码器实现自然语言策略到可重复回测的转换。

Comments This paper has been accepted by KDD 2026 (Datasets and Benchmarks Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24309 2026-05-26 cs.CR 89%

Reframing LLM Agent Security as an Agent-Human Interaction Problem

将LLM智能体安全重新定义为智能体-人类交互问题

Peiran Wang, Ying Li, Yuan Tian

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文通过系统分析59篇学术论文、21个生产智能体系统和26个安全插件,论证LLM智能体安全本质上是智能体-人类交互问题,而非纯算法问题,并提出了三方向研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08652 2026-05-26 cs.AI 89%

Prompt-and-Check: Using Large Language Models to Evaluate Communication Protocol Compliance in Simulation-Based Training

Prompt-and-Check:使用大型语言模型评估基于模拟训练中的通信协议合规性

Vishakha Lall, Yisi Liu

机构 * Centre of Excellence in Maritime Safety(海上安全卓越中心) Singapore Polytechnic(新加坡理工学院) Singapore(新加坡)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 提出Prompt-and-Check方法,利用开源大语言模型通过上下文丰富的提示评估模拟训练中通信协议的合规性,并在海事领域案例中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17234 2026-05-26 cs.AI cs.LG 89%

All Leaks Count, Some Count More: Interpretable Temporal Contamination Detection and Mitigation in LLM Backtesting

所有泄漏都重要,有些泄漏更重要:LLM回测中可解释的时间污染检测与缓解

Zeyu Zhang, Ryan Chen, Bradly C. Stadie

机构 * Department of Statistics and Data Science, Northwestern University(统计与数据科学系,西北大学) Bridgewater AIA Labs(布里奇沃特AIA实验室)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出基于Shapley值的声明级评估框架Shapley-DCLR和推理时架构TimeSPEC,用于检测和缓解LLM回测中的时间污染问题。

Comments 8 pages plus appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24667 2026-05-26 cs.AI cs.LG 89%

When Mean CE Fails: Median CE Can Better Track Language Model Quality

当平均交叉熵失效时:中位数交叉熵能更好地跟踪语言模型质量

Hao Guo, Simon Dennis, Rivaan Patil, Kevin Shabahang

机构 * i14 University of Melbourne(墨尔本大学) University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文发现中位数交叉熵比平均交叉熵更能反映语言模型在训练过程中的任务性能,并建议在评估时报告多个百分位交叉熵。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23950 2026-05-26 cs.AI cs.SE 89%

Stop Comparing LLM Agents Without Disclosing the Harness

停止比较 LLM Agent 而不公开其执行框架

Yunbei Zhang, Janet Wang, Yingqiang Ge, Weijie Xu, Jihun Hamm, Chandan K. Reddy

机构 * Tulane University(Tulane 大学) Rutgers University(Rutgers 大学) Independent Researcher(独立研究者) Virginia Tech(弗吉尼亚理工大学)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 本文论证在长周期任务中,Agent 执行框架(Harness)比底层模型更能决定性能,并提出框架感知的评估标准与方差分解协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25601 2026-05-26 cs.CL cs.AI 88%

Toward a Benchmark for Controllable Simulation of Imperfect Students with Large Language Models

面向大语言模型可控模拟不完美学生的基准

Alexander Apartsin, Omri Sason, Yehudit Aperstein

机构 * Holon Institute of Technology(霍隆理工学院) Afeka Tel Aviv Academic College of Engineering(阿法卡特拉维夫工程学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出一个基准框架,通过提示控制语言模型模拟具有指定技能轮廓的学生,并评估其可控性,为教师教育中的刻意练习提供支持。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22769 2026-05-26 cs.CL cs.AI 88%

Understanding Data Temporality Impact on Large Language Models Pre-training

理解数据时间性对大型语言模型预训练的影响

Hippolyte Pilchen, Romain Fabre, Franck Signe Talla, Patrick Perez, Edouard Grave

机构 * Kyutai

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究预训练数据顺序对大型语言模型获取时间敏感事实知识的影响,通过构建包含7000多个时间相关问题的基准并训练60亿参数模型,发现按时间顺序训练比随机打乱训练能产生更及时和精确的知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24079 2026-05-26 cs.SE cs.AI cs.CL 88%

TRACER: A Semantic-Aware Framework for Fine-Grained Contamination Detection in Code LLMs

TRACER: 一种用于代码大语言模型中细粒度污染检测的语义感知框架

Yifeng Di, Xuliang Huang, Tianyi Zhang

机构 * Purdue University West Lafayette, IN(帕克大学韦斯特拉法叶分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出TRACER框架,通过三级语义重叠和粗到细流水线检测代码LLM中的细粒度数据污染,在基准测试中F1达0.91。

Comments 21 pages, 2 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25658 2026-05-26 cs.CL cs.AI 88%

AutoSG: LLM-Driven Solver Generation Solely from Task Prompts for Expensive Optimization

AutoSG: 仅从任务提示出发的LLM驱动的昂贵优化求解器生成

Haoran Gu, Handing Wang, Yi Mei, Mengjie Zhang

机构 * Xidian University(西安电子科技大学) Victoria University of Wellington(威灵顿维多利亚大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出AutoSG框架,通过检索增强生成、单步自优化和无实例评估机制,从自然语言提示直接生成可执行定制求解器,解决昂贵优化中的幻觉、结构破坏和评估成本问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09658 2026-05-26 cs.CV 88%

Measuring Epistemic Humility in Multimodal Large Language Models

测量多模态大语言模型中的认知谦逊

Bingkui Tong, Jiaer Xia, Sifeng Shang, Kaiyang Zhou

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) Hong Kong Baptist University(香港 Baptist大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 提出HumbleBench基准,通过强制选择多项选择中引入“以上皆非”选项,评估多模态大语言模型拒绝错误选项的谦逊行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23927 2026-05-26 cs.MA 88%

TEAM-SimHRA: A Team-Based Simulation Framework for Human Reliability Analysis Using Multi-Agent Large Language Models

TEAM-SimHRA:基于团队的人因可靠性分析仿真框架——使用多智能体大语言模型

Xingyu Xiao, Jiejuan Tong, Jingang Liang, Haitao Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 提出TEAM-SimHRA框架,利用多智能体大语言模型模拟核控制室团队交互,将人因可靠性视为涌现属性,在三哩岛和切尔诺贝利事故验证中实现历史决策延迟复现和通信抑制再现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11557 2026-05-26 cs.AI 87%

UniToolCall: Unifying Tool-Use Representation, Data, and Evaluation for LLM Agents

UniToolCall: 统一LLM智能体的工具使用表示、数据与评估

Yijuan Liang, Xinghao Chen, Yifan Ge, Ziyi Wu, Hao Wu, Changyu Zeng, Wei Xing, Xiaoyu Shen

机构 * University of Science and Technology of China(中国科学技术大学) Ningbo Institute of Digital Twin(宁波数字孪生研究所) Eastern Institute of Technology(东部技术研究所) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出UniToolCall框架,通过标准化工具集构建、数据集生成和评估流程,结合22k+工具和390k+训练实例,引入锚点链接机制,在混合设置下使Qwen3-8B单轮严格精度达93.0%,超越GPT、Gemini和Claude。

Comments 21 pages, 10 figures, 9 tables. Code and datasets are publicly available at: https://github.com/EIT-NLP/UniToolCall

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24006 2026-05-26 cs.DC cs.LG 87%

A Tabular Schedule Abstraction for Communication-Aware Evaluation of Pipeline-Parallel LLM Training

一种用于通信感知评估流水线并行LLM训练的表格调度抽象

Daniel Barley, Jonathan Leis, Benjamin Klenk, Holger Fröning

机构 * Hardware and Artificial Intelligence (HAWAII) Lab, Heidelberg University, Heidelberg, Germany(海德堡大学硬件与人工智能实验室) NVIDIA Corporation, Santa Clara, CA, USA(英伟达公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种表格调度抽象和统一的多抽象方法,通过公式推理、理想化调度表和通信感知执行模拟,比较了GPipe、1F1B、Chimera和Hanayo等流水线调度方案,发现通信会抵消气泡分析的结构优势,调度排名依赖于执行环境。

Comments Accepted at the 25th IEEE International Symposium on Parallel and Distributed Computing (ISPDC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24000 2026-05-26 cs.CL 87%

Toxicity in Twitch Chats: An LLM-Based Analysis Across Gaming Communities

Twitch聊天中的毒性:基于LLM的游戏社区分析

Ronja Fuchs, Florian Rupp, Timo Bertram, Kai Eckert, Alexander Dockhorn

机构 * Institute for Information Processing(信息处理研究所) Leibniz University Hannover(汉诺威莱布尼茨大学) Department of Computer Science(计算机科学系) Technische Hochschule Mannheim(曼海姆技术学院) Institute for Machine Learning(机器学习研究所) Johannes Kepler University(约翰·凯普勒大学) SDU Metaverse Lab(SDU元宇宙实验室) University of Southern Denmark(南部丹麦大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 使用预训练大语言模型对Twitch平台4452个直播流约2000万条聊天消息进行零样本分类,发现2.4%的消息有毒,其中MOBA游戏毒性最高(3.2%),体育游戏最低(2%),且游戏间毒性分布差异显著,表明存在游戏特定的社区规范。

Comments 8 pages, 2 figures, 5 tables. Accepted at the IEEE Conference on Games (IEEE CoG) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02327 2026-05-26 cs.CL cs.AI eess.AS 87%

KAME: Tandem Architecture for Enhancing Knowledge in Real-Time Speech-to-Speech Conversational AI

KAME:用于增强实时语音到语音对话AI知识的串联架构

So Kuroki, Yotaro Kubo, Takuya Akiba, Yujin Tang

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种混合架构,通过实时注入后端LLM的文本响应来增强S2S模型的知识,在保持低延迟的同时提升响应正确性。

Comments Published at IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24719 2026-05-26 cs.CL cs.AI 87%

World-State Transformations for Neuro-symbolic Interactive Storytelling

世界状态转换用于神经符号交互式故事讲述

Santiago Góngora, Luis Chiruzzo, Gonzalo Méndez, Pablo Gervás

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究探索在神经符号架构中利用LLM预测规则系统中的世界状态转换,以解决纯LLM方法的故事连贯性问题,并通过实验表明该方法能保持世界状态一致性并促进玩家创造性输入。

Comments To be presented at the 17th International Conference on Computational Creativity (ICCC'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24211 2026-05-26 cs.CL cs.AI 87%

Teaching Through Analogies: A Modular Pipeline for Educational Analogy Generation

通过类比教学:教育类比生成的模块化流水线

Mariam Barakat, Ekaterina Kochmar

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一个模块化流水线,将教育类比生成分解为四个阶段,基于结构映射理论,评估12个LLM在两个数据集上的表现,发现子概念显著提升解释质量和封闭检索精度,并引入LLM作为评判的评估方法。

Comments 36 pages, 25 figures. To appear in Proceedings of the 21st Workshop on Innovative Use of NLP for Building Educational Applications (BEA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24614 2026-05-26 cs.CL cs.AI cs.LG 87%

Measuring the Depth of LLM Unlearning via Activation Patching

通过激活修补测量大语言模型遗忘的深度

Jaeung Lee, Dohyun Kim, Jaemin Jo

机构 * Sungkyunkwan University(全北大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出遗忘深度评分(UDS),通过激活修补量化遗忘的机制深度,在150个遗忘模型上的元评估中达到最高忠实性和鲁棒性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11242 2026-05-26 cs.CY 87%

LLMs and Childhood Safety: Identifying Risks and Proposing a Protection Framework for Safe Child-LLM Interaction

大语言模型与儿童安全:识别风险并提出安全的儿童-大语言模型交互保护框架

Junfeng Jiao, Saleh Afroogh, Kevin Chen, Abhejay Murali, David Atkinson, Amit Dhurandhar

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 通过系统文献综述识别儿童与大语言模型交互的风险,并基于不同证据流比较提出包含内容安全、发展敏感性和对抗性滥用控制的保护框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01017 2026-05-26 cs.CL 86%

Psychologically Potent, Computationally Invisible: LLMs Generate Social-Comparison-Eliciting Posts They Fail to Detect

心理上有效,计算上不可见:LLM 生成引发社会比较的帖子但无法检测

Hua Zhao, Jiapei Gu, Michelle Mingyue Gu

机构 * Department of English Language Education(英语语言教育系) Analytics/Assessment Research Centre(分析/评估研究中心)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 本研究通过构建小红书社会比较读者诱发基准(XHS-SCoRE),发现 LLM 在生成引发社会比较的帖子时存在生成-检测不匹配,即该信号在领域内可学习但无法通过提示分类稳健访问。

Comments 19 pages, preprint Title change: Psychologically Potent, Computationally Invisible: LLMs Generate Social-Comparison-Eliciting Posts They Fail to Detect

详情

展开后加载摘要…

URL PDF HTML 收藏