arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-08 至 2026-05-08 共收录 413 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 97 篇

2605.05711 2026-05-08 cs.CV cs.GR cs.HC cs.LG cs.MM 91%

Closing the Loop: Unified 3D Scene Generation and Immersive Interaction via LLM-RL Coupling

闭环:通过LLM-RL耦合实现统一的3D场景生成与沉浸式交互

Anh H. Vo, Sungyo Lee, Phil-Joong Kim, Soo-Mi Choi, Yong-Guk Kim

机构 * Department of Computer Engineering, Sejong University(全州大学计算机工程系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种统一框架,通过LLM-RL耦合实现语言驱动的3D场景生成与沉浸式交互的闭环,提升互动多媒体系统的适应性和沉浸感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06486 2026-05-08 cs.CR 90%

Autonomous Adversary: Red-Teaming in the age of LLM

自主对抗者:在LLM时代进行红队测试

Mohammad Mamun, Mohamed Gaber, Scott Buffett, Sherif Saad

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract)

AI总结 本文探讨了语言模型代理在红队操作中的应用,通过MITRE ATT&CK框架分析其与核心进攻功能的交集,并评估LLM代理在治理和现实评估中的优缺点。研究通过两个横向移动场景对比三种操作模式,发现专家定义的行动计划任务完成率最高,但所有模式均存在频繁失败问题。

Comments Accepted at ACISP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05758 2026-05-08 cs.CL 90%

BioTool: A Comprehensive Tool-Calling Dataset for Enhancing Biomedical Capabilities of Large Language Models

BioTool: 一个全面的工具调用数据集,用于增强大语言模型的生物医学能力

Xin Gao, Ruiyi Zhang, Meixi Du, Peijia Qin, Pengtao Xie

机构 * UC San Diego(圣迭戈大学) MBZUAI(马克斯·普朗克智能系统研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 BioTool通过整合生物医学领域常用工具及高质量查询-API调对,提升大语言模型在生物医学任务中的工具调用能力,实验表明其在生物医学领域表现优于现有商业模型。

Comments Published at ACL 2026; Code and data available at https://github.com/gxx27/BioTool

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05662 2026-05-08 cs.CL cs.AI 90%

XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity

XL-SafetyBench: 一个基于国家的跨文化安全基准,用于LLM安全性和文化敏感性

Dasol Choi, Eugenia Kim, Jaewon Noh, Sang Seo, Eunmi Kim, Myunggyo Oh, Yunjin Park, Brigitta Jesica Kartono, Josef Pichlmeier, Helena Berndt, Sai Krishna Mendu, Glenn Johannes Tungka, Özlem Gökçe, Suresh Gehlot, Katherine Pratt, Amanda Minnich, Haon Park

机构 * AIM Intelligence(AIM智能研究院) Microsoft(微软公司) Korea AISI(韩国人工智能研究所) KT Corporation(KT公司) BMW Group(宝马集团) Coinbase(Coinbase公司) Technical University of Munich(慕尼黑技术大学) Ankara University(安卡拉大学) Cyril Amarchand Mangaldas(Cyril Amarchand Mangaldas法律事务所) Seoul National University(首尔国立大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 XL-SafetyBench通过5500个跨10个国家语言对的测试案例,评估LLM在文化敏感性和安全性的表现,揭示了前沿模型的安全性与文化意识无耦合关系,以及本地模型在安全与文化敏感性间的线性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21682 2026-05-08 cs.CL cs.AI cs.CR cs.LG 90%

FIT to Forget: Robust Continual Unlearning for Large Language Models

FIT to Forget: 为大语言模型设计的鲁棒持续遗忘机制

Xiaoyu Xu, Minxin Du, Kun Fang, Yaxin Xiao, Zhicong Huang, Cheng Hong, Qingqing Ye, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) Ant Group(蚂蚁集团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出FIT框架,解决大语言模型持续删除请求中的遗忘与恢复问题,通过冗余过滤、重要性自适应算法选择和目标层归因机制,实现高效持续遗忘与性能保持。

Comments 26 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07794 2026-05-08 cs.IR 90%

Query Expansion in the Age of Pre-trained and Large Language Models: A Comprehensive Survey

预训练和大语言模型时代的问题扩展:综述

Minghan Li, Xinxuan Lv, Junjie Zou, Tongna Chen, Chao Zhang, Suchao An, Ercong Nie, Guodong Zhou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文综述了预训练和大语言模型时代的问题扩展方法,探讨了不同模型家族如何实现新的扩展行为,并分析了四种设计维度下的最新技术,总结了应用模式和部署考虑,指出了未来挑战和方向。

Comments 42 pages,10 figures,6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06584 2026-05-08 cs.AI 90%

NeuroAgent: LLM Agents for Multimodal Neuroimaging Analysis and Research

NeuroAgent:用于多模态神经影像分析和研究的LLM代理

Lujia Zhong, Yihao Xia, Jianwei Zhang, Shuo huang, Jiaxin Yue, Mingyang Xia, Yonggang Shi

机构 * Stevens Neuroimaging and Informatics Institute, Keck School of Medicine, University of Southern California(史蒂文斯神经影像与信息学研究所,凯克医学院,南加州大学) Viterbi School of Engineering, University of Southern California(维特比工程学院,南加州大学) Alfred E. Mann Department of Biomedical Engineering, Viterbi School of Engineering, University of Southern California(阿尔弗雷德·E·曼生物医学工程部门,维特比工程学院,南加州大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 NeuroAgent通过LLM驱动的代理框架自动化多模态神经影像预处理与分析,支持自然语言查询,提升神经影像研究的自动化与可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06161 2026-05-08 cs.AI cs.SE 90%

Beyond Accuracy: Policy Invariance as a Reliability Test for LLM Safety Judges

超越准确性:将政策不变性作为LLM安全裁判的可靠性测试

Shihao Weng, Yang Feng, Xiaofei Xie

机构 * Nanjing University(南京大学) Singapore Management University(新加坡国立管理学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出政策不变性作为LLM安全裁判可靠性测试,通过三个可测试原则揭示现有裁判在面对规范性变化和结构性重写时的失效模式,并提出政策不变性分数和裁判卡报告协议以评估裁判可靠性。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05846 2026-05-08 cs.CR cs.AI 90%

LoopTrap: Termination Poisoning Attacks on LLM Agents

LoopTrap: 对 LLM agent 的终止污染攻击

Huiyu Xu, Zhibo Wang, Wenhui Zhang, Ziqi Zhu, Yaopeng Wang, Kui Ren, Chun Chen

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Zhejiang University(浙江大学) School of Cyber Science and Engineering(网络安全与工程学院) Southeast University(东南大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究了LLM agent迭代执行循环中的终止污染风险,提出10种攻击策略并通过实验证明不同agent的行为特征影响攻击效果,设计了自动化框架LoopTrap以提升红队攻击效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05731 2026-05-08 cs.AI 90%

Knee Osteoarthritis Severity Grading Using Optimized Deep Learning and LLM-Driven Intelligent AI on Computationally Limited Systems

利用优化深度学习和LLM驱动智能AI对膝骨关节炎严重程度进行分级

Dayam Nadeem, Neha, Safdar Mustafa, Adnan Alvi, Mohd Hussain

机构 * Jamia Hamdard(贾迈亚哈姆达德大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出结合深度学习CNN与TensorFlow Lite平台的自动诊断方法,用于膝骨关节炎严重程度分级,通过迁移学习和优化模型实现94.48%的测试准确率,并利用Gemini-2.0-flash生成解释性结果,提升AI辅助筛查的可及性。

Comments 6 pages, 11 figures, Accepted and presented at the 2nd International Conference on Emerging Computational Intelligence (ICECI 2026), IEEE. Published in conference proceedings. To appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05726 2026-05-08 cs.AI 90%

SkillRet: A Large-Scale Benchmark for Skill Retrieval in LLM Agents

SkillRet:一种大规模技能检索基准,用于LLM代理

Hongcheol Cho, Ryangkyung Kang, Youngeun Kim

机构 * ThakiCloud

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出SkillRet基准,用于评估LLM代理中的技能检索。该基准包含17810个公开技能,提供63259个训练样本和4997个评估查询,通过任务特定微调显著提升了检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06652 2026-05-08 cs.LG cs.AI cs.CL 89%

When No Benchmark Exists: Validating Comparative LLM Safety Scoring Without Ground-Truth Labels

在没有基准的情况下:在无标签的情况下验证比较LLM安全性评分

Sushant Gautam, Finn Schwall, Annika Willoch Olstad, Fernando Vallecillos Ruiz, Birk Torpmann-Hagen, Sunniva Maria Stordal Bjørklund, Leon Moonen, Klas Pettersen, Michael A. Riegler

机构 * Simula Metropolitan Center for Digital Engineering(Simula 数字工程中心) Oslo Metropolitan University(奥斯陆 Metropolitan 大学) University of Oslo(奥斯陆大学) Simula Research Laboratory(Simula 研究实验室) Norwegian Directorate of Health(挪威健康 Directorate)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出在无标签情况下验证LLM安全性的方法,通过构建仪器有效性链来替代真实标签,通过实验验证其有效性,并展示了在不同场景下的应用和结果。

Comments SimpleAudit Repository: https://github.com/kelkalot/simpleaudit

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05790 2026-05-08 cs.HC 89%

GazeMind: A Gaze-Guided LLM Agent for Personalized Cognitive Load Assessment

GazeMind:一种基于注视的LLM代理用于个性化认知负荷评估

Bin Wang, Yue Liu, Benjamin Newman, Ajoy S. Fernandes, Zhiyuan Wang, Robert Cavin, Michele A. Cox, Vijay Rajanna, Takumi Bolte, Melissa Hunfalvay, Ulas Bagci, Michael J. Proulx

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出GazeMind,一种基于注视的LLM代理框架,用于智能眼镜上的认知负荷评估。该框架通过编码注视数据为结构化表示,提供可解释的认知负荷预测,并通过新颖的任务引导推理方法实现跨场景泛化,同时利用用户特定特征和历史参考实现个性化适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05391 2026-05-08 cs.HC 89%

Every(bot) Makes Mistakes: Coding Big Five Personalities, Context, and Tone into an LLM Chatbot Recovery Code Framework

每个( bot )都会犯错:将大五人格、情境和语气编码到LLM聊天机器人恢复代码框架中

Rachel Hill, Tom Owen, Julian Hough

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出一个结合大五人格、情境和语气的LLM聊天机器人恢复代码框架,通过实验验证其在提升错误恢复质量方面的有效性。

Comments 14 pages of main content, 3 figures, 4 tables, 9 appendices. This paper has been submitted to the Becker Friedman Institute 2026 AI in Social Sciences conference for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06290 2026-05-08 cs.AI 89%

Data Language Models: A New Foundation Model Class for Tabular Data

数据语言模型:一种新的用于表格数据的基础模型类别

Eda Erol, Giuliano Pezzoli, Ozer Cem Kelahmet

机构 * SchemaLabs

专题命中 评测与基准 :language model(title,abstract);foundation model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文提出数据语言模型(DLM),一种能直接理解表格数据的基础模型,无需预处理,提升了表格数据在AI决策中的应用效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06191 2026-05-08 cs.AI 89%

Systematic Evaluation of Large Language Models for Post-Discharge Clinical Action Extraction

大型语言模型在出院后临床行动提取中的系统评估

Shivali Dalmia, Ananya Mantravadi, Prasanna Desikan

机构 * Centific AI Research(Centific AI研究) Centific Global Solutions, Inc.(Centific全球解决方案公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文系统评估了零样本和少样本大型语言模型在安全关键的出院后临床行动提取中的表现,提出两阶段提取框架以提升临床任务的可操作性,并分析标注不一致性和模型推理与标注规范的对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17573 2026-05-08 cs.AI 89%

Beyond Static Snapshots: A Grounded Evaluation Framework for Language Models at the Agentic Frontier

超越静态快照:语言模型在代理前沿的 grounded 评估框架

Jazmia Henry

机构 * University of Oxford(牛津大学)

专题命中 评测与基准 :language model(title,abstract);RLHF(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract)

AI总结 本文提出 grounded continuous evaluation 框架,通过 deterministic verifier 和 CPU 更新 LoRA adapters,解决 reward hacking 和硬件限制问题,并在多个架构和领域验证其有效性。

Comments Submitted for consideration to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05211 2026-05-08 q-fin.PR cs.AI cs.LG q-fin.ST 88%

A Review of Large Language Models for Stock Price Forecasting from a Hedge-Fund Perspective

对冲基金视角下大型语言模型在股票价格预测中的综述

Olivia Zhang, Zhilin Zhang

机构 * Hockaday School(霍卡迪学校) Lumos Alpha(卢姆斯阿尔法)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文综述了大型语言模型在股票预测中的应用,包括从新闻和社交媒体提取情绪、分析财务报告和电话会议记录,以及构建多智能体交易系统,并指出实践中常被忽视的问题,如情绪分析的脆弱性、数据集和时间范围设计、性能评估指标、数据泄露、流动性溢价和股价预测的局限性。

Comments Accepted at the IEEE Conference on Artificial Intelligence, Spain, May 8--10, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21471 2026-05-08 cs.AI 88%

SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition

SpatialBench: 多模态大语言模型空间认知的基准测试

Peiran Xu, Sudong Wang, Yao Zhu, Jianing Li, Gege Qi, Yunjian Zhang

机构 * Sun Yat-Sen University(中山大学) HKUST (GZ)(香港科技大学) Zhejiang University(浙江大学) Peking University(北京大学) CAICT(中国科学院电子技术研究所) UCAS(中国科学技术大学) CUC(中国科学技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出SpatialBench基准,通过五级空间认知框架评估多模态大语言模型的空间能力,揭示模型在感知与符号推理间的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05973 2026-05-08 stat.ML cs.AI cs.LG stat.AP 88%

Towards Reliable LLM Evaluation: Correcting the Winner's Curse in Adaptive Benchmarking

迈向可靠的LLM评估:在自适应基准测试中纠正胜利者偏差

Yang Xu, Jiefu Zhang, Haixiang Sun, Zihan Zhou, Tianyu Cao, Vaneet Aggarwal

机构 * Purdue University(普渡大学) Johns Hopkins University(约翰霍普金斯大学) Purdue University, USA(美国普渡大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文研究了自适应基准测试中胜利者偏差问题,提出SIREN方法以提高评估可靠性,通过冻结短名单、分离选择与评估并采用高斯乘子bootstrap进行不确定性量化,实验证明其在有限预算下能提供有效的置信区间和比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06209 2026-05-08 cs.SE 88%

SiblingRepair: Sibling-Based Multi-Hunk Repair with Large Language Models

SiblingRepair: 基于兄弟的多补丁修复与大型语言模型

Xinyu Liu, Jiayu Ren, Yusen Wang, Qi Xin, Xiaoyuan Xie, Jifeng Xuan

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn)

AI总结 SiblingRepair利用大型语言模型进行基于兄弟的多补丁修复,通过语义相关性搜索和两种修复策略提升修复效率和准确性,优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02379 2026-05-08 cs.LG cs.CV 87%

Teaching Metric Distance to Discrete Autoregressive Language Models

向离散自回归语言模型传授度量距离

Jiwan Chung, Saejin Kim, Yongrae Jo, Jaewoo Park, Dongjun Min, Youngjae Yu

机构 * Yonsei University(延世大学) LG AI Research(LG AI研究院) Seoul National University(首尔国立大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.LG

AI总结 本文提出DIST2Loss,通过奖励加权分布替代one-hot目标,提升离散自回归模型的数据效率和跨领域表现,应用于视觉 grounding、机器人操控、奖励建模和向量量化图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05842 2026-05-08 cs.AI 87%

Taklif.AI: LLM-Powered Platform for Interest-Based Personalized College Assignments

Taklif.AI:基于大语言模型的基于兴趣的个性化大学作业平台

Zaki Kurdya, Mohammed Zuqlam, Salem Amassi, Shady Telbany, Motaz Saad

机构 * Faculty of Information Technology(信息科技学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Taklif.AI利用大语言模型生成个性化作业,结合学生兴趣和文化背景,提升学生参与度,减少抄袭风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05725 2026-05-08 cs.AI 87%

Detecting Time Series Anomalies Like an Expert: A Multi-Agent LLM Framework with Specialized Analyzers

像专家一样检测时间序列异常:一种多智能体LLM框架与专用分析器

Hyeongwon Kang, Jeongseob Kim, Jinwoo Park, Pilsung Kang

机构 * Department of Industrial and Management Engineering(工业与管理工程系) Korea University(韩国大学) Department of Industrial Engineering(工业工程系) Seoul National University(首尔国立大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SAGE框架,通过四个专用分析器检测单变量时间序列的异常,结合数值工具和可视化生成证据,提升异常检测的可靠性与实用性。

Comments Preprint. 9 pages main text, 29 pages total, 8 figures, 9 tables, with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05241 2026-05-08 cs.RO cs.LG 87%

DexSim2Real: Foundation Model-Guided Sim-to-Real Transfer for Generalizable Dexterous Manipulation

DexSim2Real: 基于基础模型的仿真到现实迁移用于通用的灵巧操作

Zijian Zeng, Fei Ding, Huiming Yang, Xianwei Li, Yuhao Liao

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Bengbu University(Bengbu大学) UCSI University(UCSI大学)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract,abstract_cn);language model(abstract);分类 cs.LG

AI总结 本文提出DexSim2Real框架,结合基础模型引导的域随机化、触觉视觉交叉注意力策略和渐进技能课程,提升灵巧操作的仿真到现实迁移性能,实验表明其在现实世界中的成功率达到78.2%。

Comments 13 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06544 2026-05-08 cs.DC cs.NI 87%

CCL-Bench 1.0: A Trace-Based Benchmark for LLM Infrastructure

CCL-Bench 1.0:基于跟踪的LLM基础设施基准测试

Eric Ding, Byungsoo Oh, Bhaskar Kataria, Kaiwen Guo, Jelena Gvero, Abhishek Vijaya Kumar, Arjun Devraj, Lindsey Bowen, Atharv Sonwane, Emaad Manzoor, Rachee Singh

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 CCL-Bench 1.0通过记录可重用证据,解决现有基准测试的局限性,揭示计算-通信重叠与训练步时间的关系,以及不同框架配置的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06257 2026-05-08 cs.HC 87%

LearnMate^2: Design and Evaluation of an LLM-powered Personalized and Adaptive Support System for Online Learning

LearnMate^2:一种基于大语言模型的个性化和自适应在线学习支持系统的设计与评估

Xinyu Jessica Wang, Christine P. Lee, Bilge Mutlu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文设计并评估了基于大语言模型的个性化学习支持系统LearnMate^2,通过提供个性化学习计划、实时上下文帮助和自适应学习活动,提升学习效果和用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00113 2026-05-08 cs.MA cs.AI cs.CE cs.CY cs.SI 86%

AI Agents Alone Are Not (Yet) Sufficient for Social Simulation

仅靠AI代理不足以进行社会模拟

Yiming Li, Dacheng Tao

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院,新加坡)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文指出LLM代理单独使用不足以实现真实的社会动态,提出需考虑环境互动和调度机制的统一框架。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13075 2026-05-08 cs.CL cs.AI 85%

DeEscalWild: A Real-World Benchmark for Automated De-Escalation Training with SLMs

DeEscalWild:一个用于自动缓和训练的现实世界基准数据集

Md Hasebul Hasan, Krity Haque Charu, Eshwara Prasad Sridhar, Shuchisnigdha Deb, Mohammad A. Islam

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Department of Industrial, Manufacturing, and Systems Engineering(工业、制造与系统工程系) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出DeEscalWild基准数据集,通过多阶段流程从公开视频库中提取真实警察与平民互动数据,用于训练小型语言模型的缓和任务,实验表明经过该数据微调的SLMs在多个指标上优于基线模型。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06305 2026-05-08 cs.AI cs.IR 84%

Addressing Labelled Data Scarcity: Taxonomy-Agnostic Annotation of PII Values in HTTP Traffic using LLMs

缓解标记数据稀缺:利用LLMs对HTTP流量中的PII值进行类别无关的标注

Thomas Cory, Axel Küpper

机构 * Anonymous Authors(匿名作者)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文探讨LLMs能否在运行时提供类别信息的情况下,对HTTP消息体中的显式传输PII值进行类别无关的标注,通过多阶段流程实现灵活的标注方法,验证了其在不同PII领域和粒度下的有效性。

Comments Accepted to 2026 IEEE European Symposium on Security and Privacy Workshops (EuroS&PW)

详情

展开后加载摘要…

URL PDF HTML 收藏