arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31957 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31957 篇

2602.11460 2026-05-27 cs.CL 90%

ADRD-Bench: A Preliminary LLM Benchmark for Alzheimer's Disease and Related Dementias

ADRD-Bench:阿尔茨海默病及相关痴呆症的初步大语言模型基准

Guangxin Zhao, Jiahao Zheng, Malaz Boustani, Jarek Nabrzyski, Yiyu Shi, Meng Jiang, Zhi Zheng

机构 * Electrical Engineering, University of Notre Dame(诺丁汉大学电气工程系) Computer Science and Engineering, University of Notre Dame(诺丁汉大学计算机科学与工程系) School of Medicine, Indiana University(印第安纳大学医学院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有基准对阿尔茨海默病及相关痴呆症覆盖不足的问题,提出ADRD-Bench,包含统一问答和照护问答两部分,评估了36个LLM,发现顶级模型准确率高但推理质量不稳定。

Comments Update article

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05899 2026-05-27 cs.AI 90%

TowerMind: A Tower Defence Game Learning Environment and Benchmark for LLM as Agents

TowerMind: 一个用于LLM作为智能体的塔防游戏学习环境与基准

Dawei Wang, Chengming Zhou, Di Zhao, Xinyuan Liu, Marci Chi Ma, Gary Ushaw, Richard Davison

机构 * Newcastle University(新castle大学) University of Auckland(奥克兰大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出TowerMind,一个基于塔防子类型的轻量级、多模态游戏环境,用于评估大语言模型在长期规划和决策中的能力,并揭示其与人类专家的性能差距及关键局限性。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05305 2026-05-27 cs.CL 90%

SONAR-LLM: Autoregressive Transformer that Thinks in Sentence Embeddings and Speaks in Tokens

SONAR-LLM:在句子嵌入中思考、以令牌说话的自回归Transformer

Nikita Dragunov, Temurbek Rahmatullaev, Elizaveta Goncharova, Nikita Kurdiukov, Aysel Mirzoeva, Anna Borisiuk, Andrey Kuznetsov, Anton Razzhigaev

机构 * FusionBrain Lab, AXXX(融合大脑实验室,AXXX) T-Tech MSU(莫斯科大学) DS-NLP Group, AXXX(自然语言处理组,AXXX)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出SONAR-LLM,一种在连续SONAR嵌入空间“思考”但通过令牌级交叉熵监督的解码器-only Transformer,融合语义抽象与似然训练信号,在39M至1.3B参数规模上取得有竞争力的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14321 2026-05-27 cs.MA cs.CL 90%

Beyond Self-Talk: A Communication-Centric Survey of LLM-Based Multi-Agent Systems

超越自我对话:基于LLM的多智能体系统的通信中心综述

Bingyu Yan, Zhibo Zhou, Litian Zhang, Lian Zhang, Ziyi Zhou, Dezhuang Miao, Zhoujun Li, Chaozhuo Li, Xiaoming Zhang

机构 * School of Cyber Science and Technology, Beihang University, Beijing 100191, China(信息科学与技术学院,北京航空航天大学,北京100191,中国) The College of Cyber Security/College of Information Science and Technology, Jinan University, Guangzhou, China(网络安全学院/信息科学与技术学院,暨南大学,广州,中国) School of Computer Science and Engineering, Beihang University, Beijing 100083, China(计算机科学与工程学院,北京航空航天大学,北京100083,中国) School of Cyber Science and Technology, Beijing University of Posts and Telecommunications, Beijing 100876, China(信息科学与技术学院,北京邮电大学,北京100876,中国)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文从通信视角综述基于大语言模型的多智能体系统,提出一个整合系统级和系统内部通信的结构化框架,分析智能体交互机制、挑战及未来方向。

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-026-50857-y}

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15787 2026-05-27 cs.CL cs.IR 90%

Interactive Agents: Simulating Counselor-Client Psychological Counseling via Role-Playing LLM-to-LLM Interactions

交互式智能体:通过角色扮演的LLM-LLM交互模拟咨询师-来访者心理咨询

Huachuan Qiu, Zhenzhong Lan

机构 * School of Engineering, Westlake University(西lake大学工程学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出Interactive Agents框架,通过LLM-LLM角色扮演生成高质量心理咨询对话数据,解决隐私、成本和扩展性问题,并验证其治疗有效性和模型性能。

Comments Accepted to *SEM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26070 2026-05-26 cs.CL 90%

WhoSaidIt: Human-LLM Collaborative Annotation for Text-Based Multilingual Speaker-Attribute Classification

WhoSaidIt:面向文本的多语言说话人属性分类的人机协作标注

Lingyu Gao, Will Monroe, David Smith, Meghan Jemison, Jackie Lee

机构 * Duolingo

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一种人机协作重标注框架,通过迭代交互和分歧采样稳定多语言说话人属性标签,构建WhoSaidIt数据集并评估LLM性能。

Comments 16 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25415 2026-05-26 cs.CL cs.CY cs.ET 90%

LLM-as-a-Reviewer: Benchmarking Their Ability, Divergence, and Prompt Injection Resistance as Paper Reviewers

LLM-as-a-Reviewer: 基准测试它们作为论文审稿人的能力、分歧和提示注入抵抗性

Lingyao Li, Junjie Xiong, Changjia Zhu, Runlong Yu, Chen Chen, Junyu Wang, Renkai Ma, Zhicong Lu

机构 * University of South Florida(佛罗里达南大学) Missouri University of Science and Technology(密苏里科技大学) University of Alabama(阿拉巴马大学) Florida International University(佛罗里达国际大学) University of Cincinnati(辛辛那提大学) George Mason University(乔治·梅森大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过一个系统基准测试,评估了12个大型语言模型在论文评审中的表现,包括评分校准、与人类审稿人的分歧以及对不可见字体映射攻击的抵抗性,发现LLMs存在系统性高估弱论文、与人类关注点不同以及易受提示注入攻击等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25232 2026-05-26 cs.SE cs.AI cs.LO 90%

Specification-Based Code-Text-Code Reengineering for LLM-Mediated Software Evolution

基于规约的代码-文本-代码重构:面向LLM介导的软件演化

Oleg Grynets, Vasyl Lyashkevych, Arsen Dolichnyi, Roman Piznak, Taras Zelenyy, Volodymyr Morozov

机构 * EPAM Systems(EPAM系统) McLean, Virginia, USA(美国弗吉尼亚州麦莱恩) Lviv, Ukraine(乌克兰利沃夫) Kyiv, Ukraine(乌克兰基辅)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种基于规约的Code2Text2Code重构框架,通过将源代码转换为中性文本规约并迭代验证,解决直接Code2Code转换中的语义漂移、行为变化等问题,实现受控的LLM介导软件演化。

Comments 15 pages, 9 figures, 7 tables, 39 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24904 2026-05-26 cs.CL 90%

Quantifying the Impact of Translation Errors on Multilingual LLM Evaluation

量化翻译错误对多语言大语言模型评估的影响

Klaudia-Doris Thellmann, Bernhard Stadler, Michael Färber, Jens Lehmann

机构 * TUD Dresden University of Technology and ScaDS.AI(德累斯顿技术大学和ScaDS.AI) InfAI e.V.(InfAI协会) Amazon(亚马逊)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究机器翻译基准中的翻译错误如何影响多语言LLM评估的可靠性,通过自动错误跨度检测和准确性下降分析揭示翻译错误与评估指标之间的关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05847 2026-05-26 cs.CL 90%

Schema-Grounded LLM Extraction for FHIR Patient Digital Twins

基于Schema的LLM抽取用于FHIR患者数字孪生

Rafael Brens, Yuqiao Meng, Luoxi Tang, Zhaohan Xi

机构 * Binghamton University(宾夕法尼亚州立大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出SG-LLM方法,通过检索增强、JSON Schema约束和验证器修复循环,从非结构化EHR中生成有效的FHIR Bundle,并在临床效用实验中优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23362 2026-05-25 cs.LG cs.IT math.IT math.ST stat.ML stat.TH 90%

Instance-Optimal Estimation with Multiple LLM Judges on a Budget

预算限制下多LLM裁判的实例最优估计

Junghyun Lee, Sanghwa Kim, Yassir Jedra, Alexandre Proutière, Se-Young Yun

机构 * KAIST AI(韩国科学技术院人工智能研究所) ICL EEE(国际计算机语言研究所电子工程系) KTH EECS(皇家理工学院电子工程系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对预算限制下异构裁判的评估分配问题,提出基于乐观偏差方差估计的自适应算法EST-IVWE,并证明其达到实例最优的局部极小极大下界。

Comments 53 pages, 4 figures; the first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23175 2026-05-25 cs.CR cs.CL 90%

Robust LLM Watermarking with Minimal Semantic Distortion for IP Protection

用于知识产权保护的具有最小语义失真的鲁棒LLM水印

Kieu Dang, Phung Lai, NhatHai Phan, Yelong Shen, Ruoming Jin

机构 * State University of New York at Albany(纽约州立大学阿尔巴尼分校) New Jersey Institute of Technology(新泽西理工学院) Microsoft(微软) Kent State University(肯特州立大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出SAFESEAL框架,通过密钥条件锦标赛采样和对比检测器,在保持语义保真度的同时实现强可检测性、高实用性和鲁棒性,用于保护专有大语言模型的知识产权。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21958 2026-05-22 cs.CL 90%

Diagnosis Is Not Prescription: Linguistic Co-Adaptation Explains Patching Hazards in LLM Pipelines

诊断并非处方:语言共适应解释了LLM流水线中的修补危害

Yoon Jeonghun, Kim Dongchan

机构 * KAIST (Korea Advanced Institute of Science and Technology)(韩国科学技术院) NAVER Corp.(NAVER公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文研究了多模块LLM代理失败时,诊断与修补之间的矛盾,发现路由模块虽为瓶颈,但注入修正示例反而降低性能,而修正查询重写模块则更有效,提出了语言合同假说解释这种现象。

Comments Preprint. Under review at EMNLP 2026 (ARR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21748 2026-05-22 cs.CL 90%

RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator

RankJudge: 一个多轮LLM-as-a-Judge合成基准生成器

Zhenwei Tang, Zhaoyan Liu, Rasa Hosseinzadeh, Tongzi Wu, Keyvan Golestan, Jesse C. Cresswell

机构 * Layer 6 AI

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出RankJudge,一种用于评估LLM作为评判者在多轮对话中表现的合成基准生成器,通过生成带有单个缺陷的对话对,实现对评判准确性的严格评估,并通过领域覆盖和21个前沿LLM评判者评估,验证了评判排名的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08023 2026-05-21 cs.CR cs.AI cs.MA 90%

CTFExplorer: Evaluating LLM Offensive Agents Through Multi-Target Web CTF Benchmarking

CTFExplorer: 通过多目标网络CTF基准测试评估LLM进攻性代理

Nanda Rani, Kimberly Milner, Minghao Shao, Meet Udeshi, Haoran Xi, Venkata Sai Charan Putrevu, Saksham Aggarwal, Sandeep K. Shukla, Prashanth Krishnamurthy, Farshad Khorrami, Muhammad Shafique, Ramesh Karri

机构 * CISPA - Helmholtz Center for Information Security(CISPA-海德堡信息安全研究中心) NYU Tandon School of Engineering(纽约大学坦顿工程学院) NYU Abu Dhabi(纽约大学阿布扎克分校) IIIT Hyderabad(海得拉巴印度理工学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出CTFExplorer基准测试,通过多目标网络CTF基准测试评估LLM进攻性代理,研究问题是如何在不确定环境下评估代理的战术推理能力,核心方法是引入多目标环境测试代理的探索、优先级和攻击链能力,主要贡献是开发了可评估代理行为的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15104 2026-05-21 cs.CL 90%

From Text to Voice: A Reproducible and Verifiable Framework for Evaluating Tool Calling LLM Agents

从文本到声音:一个可重复和可验证的评估工具调用LLM代理的框架

Md Tahmid Rahman Laskar, Xue-Yong Fu, Seyyed Saeed Sarfjoo, Quinten McNamara, Jonas Robertson, Shashi Bhushan TN

机构 * Dialpad Inc.(Dialpad公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出了一种可重复和可验证的框架,用于评估基于语音的工具调用LLM代理,通过文本到语音转换和环境噪声模拟,无需重新标注工具模式和黄金标签,从而在不重新标注的情况下评估工具调用性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10787 2026-05-21 cs.AI cs.SE 90%

ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox

ComplexMCP: 评估LLM代理在动态、相互依赖和大规模工具沙箱中的表现

Yuanyang Li, Xue Yang, Longyue Wang, Weihua Luo, Hongyang Chen

机构 * Zhejiang University(浙江大学) Zhejiang Lab(浙江实验室) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出ComplexMCP基准,用于评估LLM代理在动态、相互依赖和大规模工具环境中的性能,揭示了现有模型在复杂任务中的不足,指出三个关键瓶颈:工具检索饱和、过度自信和战略投降倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20206 2026-05-21 cs.HC cs.AI cs.SE 90%

PrivacyAkinator: Articulating Key Privacy Design Decisions by Answering LLM-Generated Multiple-choice Questions

PrivacyAkinator: 通过回答LLM生成的多项选择题来阐明关键隐私设计决策

Qiyu Li, Yuen Sum Wong, Yuen Kei Wong, Longxuan Yu, Haojian Jin

机构 * University of California San Diego(加州大学圣迭戈分校) University of California Riverside(加州大学河滨分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出PrivacyAkinator工具,通过回答LLM生成的多项选择题帮助开发者阐明关键隐私设计决策,相比PRAM方法,用户研究显示其在更短时间内识别出更多关键决策。

Comments Accepted to ACM CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13793 2026-05-20 cs.CL 90%

An LLM-Based System for Argument Mining

基于LLM的论证挖掘系统

Paulo Pirozelli, Victor Hugo Nascimento Rocha, Fabio G. Cozman, Douglas Aldred

机构 * Universidade de São Paulo Center for Artificial Intelligence (C4AI)(圣保罗大学人工智能中心(C4AI)) Instituto Mauá de Tecnologia Núcleo de Sistemas Eletrônicos Embarcados (NSEE)(马乌阿技术研究所电子系统嵌入核(NSEE))

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一个基于大语言模型的端到端系统,用于从自然语言文本中提取论证并构建抽象论证图,通过多阶段流程识别论证组件、选择相关元素并揭示其逻辑关系,实验表明该系统能有效恢复论证结构并在不同标注方案下表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19529 2026-05-20 cs.AI 90%

Generative-Evaluative Agreement: A Necessary Validity Criterion for LLM-Enabled Adaptive Assessment

生成-评估一致性:为LLM赋能的自适应评估的必要有效性标准

Grandee Lee, Yue Wang, Che Yee Lye, Luke Peh

机构 * Singapore University of Social Sciences(新加坡社会科学研究大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出生成-评估一致性(GEA)作为LLM赋能自适应评估的有效性标准,通过测量LLM评分函数是否能恢复其生成函数所指示的技能水平,发现其在不同技能层面的有效性存在差异,并提出细粒度、技能分解的评分标准作为提升GEA的主要方法。

Comments BEA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19518 2026-05-20 cs.AI 90%

BLINKG: A Benchmark for LLM-Integrated Knowledge Graph Generation

BLINKG:一个用于集成大语言模型的知识图谱生成基准

Carla Castedo, Enrique Iglesias, Manuel Lama, Alberto Bugarin-Diz, Maria-Esther Vidal, David Chaves-Fraga

机构 * Centro Singular de Investigación en Tecnoloxías Intelixentes (CiTIUS), Universidade de Santiago de Compostela, Spain(圣地亚哥-德孔波斯特拉大学智能技术研究中心(CiTIUS)) L3S Research Center Germany, Hannover, Germany(德国汉诺威L3S研究中心) TIB Leibniz Information Centre for Science and Technology, Hannover, Germany(德国汉诺威TIB莱比锡信息科学与技术研究中心) Leibniz University, Hannover, Germany(德国汉诺威莱比锡大学) Departamento de Electrónica e Computación, Universidade de Santiago de Compostela, Spain(圣地亚哥-德孔波斯特拉大学电子与计算系)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出BLINKG基准,用于评估大语言模型在从异构数据源生成知识图谱中的映射能力,通过复杂度递增的场景和实验评估,揭示了LLM在知识图谱构建中的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19337 2026-05-20 cs.AI 90%

Agentic Trading: When LLM Agents Meet Financial Markets

代理交易:当大语言模型代理与金融市场相遇

Yihan Xia, Panpan You, Taotao Wang, Fang Liu, Han Qi, Xiaoxiao Wu, Shengli Zhang

机构 * College of Electronic and Information Engineering, Shenzhen University, Shenzhen, China(深圳大学电子与信息工程学院) Shenzhen Audencia Financial Technology Institute, Shenzhen University, Guangdong, People's Republic of China(深圳大学审计金融科技研究所)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了如何将大语言模型(LLM)作为交易系统中的代理,感知市场信息、检索上下文、进行决策推理、发出可交易动作并适应市场反馈。研究通过分析77项研究,发现协议不可比性是主要问题,提出证据日志、可重复性审计和报告检查表作为主要贡献。

Comments 59 pages, 15 figures, 27 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19196 2026-05-20 cs.CL 90%

Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?

时间到REFLECT:我们能否信任LLM裁判来评估基于证据的研究代理?

Leyao Wang, Yanan He, Peng Chen, Asaf Yehudai, Yixin Liu, Rex Ying, Michal Shmueli-Scheuer, Arman Cohan

机构 * Yale University(耶鲁大学) IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出REFLECT基准,用于评估LLM裁判在代理环境中的细粒度失败检测,揭示当前LLM裁判在推理、工具使用和报告质量上的可靠性不足,为构建更可靠的评估流程提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19127 2026-05-20 cs.AI 90%

POLAR-Bench: A Diagnostic Benchmark for Privacy-Utility Trade-offs in LLM Agents

POLAR-Bench: 一个用于LLM代理隐私-效用权衡的诊断基准

Qiaoyuan Zheng, Yiqu Yang, Qi Gao, Imanol Schlag

机构 * ETH Zurich(苏黎世联邦理工学院) ETH AI Center(ETH人工智能中心)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出POLAR-Bench基准,用于评估LLM代理在隐私和效用之间的权衡。通过在10个领域和7,852个样本上进行测试,该基准通过确定性集合成员hip评分隐私和效用,并在两个正交轴上变化隐私策略维度和攻击策略,生成5x5的诊断表面。结果揭示了当前前沿模型在保护属性上隐瞒超过99%,而较小的开放权重模型在1-30B范围内表现更差,泄露率高达一半。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18693 2026-05-19 cs.AI 90%

SkillGenBench: Benchmarking Skill Generation Pipelines for LLM Agents

SkillGenBench: 评估LLM代理技能生成流水线的基准测试

Yifan Zhou, Zhentao Zhang, Ziming Cheng, Shuo Zhang, Qizhen Lan, Zhangquan Chen, Zhi Yang, QianyuXu, Ronghao Chen, Huacan Wang, Sen Hu

机构 * SJTU(上海交通大学) XJTU(西安交通大学) NUS(新加坡国立大学) QuantaAlpha(量子Alpha) THU(清华大学) SUFE(上海财经大学) NTU(国立.ntu) PKU(北京大学) UCAS(中国科学技术大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出SkillGenBench,一个用于评估LLM代理技能生成流水线的基准测试,通过统一可控的协议评估技能生成过程,涵盖任务条件生成和任务无关生成两种模式,以及基于仓库和文档的两种程序来源,揭示技能生成在不同数据源中的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02574 2026-05-19 cs.CR cs.AI 90%

LLM-Safety Evaluations Lack Robustness

大语言模型安全评估缺乏鲁棒性

Tim Beyer, Sophie Xhonneux, Simon Geisler, Gauthier Gidel, Leo Schwinn, Stephan Günnemann

机构 * Department of Computer Science \& Munich Data Science Institute, Technical University of Munich Canada AI CIFAR Chair

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文指出当前大语言模型安全对齐研究受到多种交织的噪声源阻碍,如小数据集、方法学不一致和不可靠的评估设置,导致难以公平评估和比较攻击与防御,阻碍了进展。我们系统分析了大语言模型安全评估流程,涵盖数据集整理、自动化红队优化策略、响应生成和响应评估使用LLM法官。在每个阶段,我们识别了关键问题并突出了其实际影响。我们还提出了一套减少未来攻击和防御论文评估中噪声和偏见的指南。最后,我们提出了对立观点,强调现有限制的实用原因。我们相信,未来研究解决这些问题将提高领域生成可比结果的能力,并实现可衡量的进步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17453 2026-05-19 cs.CR cs.CL 90%

Trust No Tool: Evaluating and Defending LLM Agents under Untrusted Tool Feedback

勿信工具:在不可信工具反馈下评估和防御LLM代理

Lecheng Yan, Ruizhe Li, Xicheng Han, Wenxi Li, Binwu Wang, Longyue Wang, Chenyang Lyu, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) University of Science and Technology of China(中国科学技术大学) University of Birmingham(伯明翰大学) Zhejiang University(浙江大学) East China Normal University(华东师范大学) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本研究探讨了在不可信工具反馈环境下评估和防御LLM代理的问题,提出了一种新的失败模式'认知中毒',并介绍了TRUST-Bench基准、GuardedJoint惩罚指标和VISTA-Guard框架,展示了轨迹感知的最终动作评分在安全与效用权衡中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14038 2026-05-19 cs.AI 90%

Model-Adaptive Tool Necessity Reveals the Knowing-Doing Gap in LLM Tool Use

模型适应性工具必要性揭示了大语言模型工具使用中的知行差距

Yize Cheng, Chenrui Fan, Mahdi JafariRaviz, Keivan Rezaei, Soheil Feizi

机构 * University of Maryland, College Park(马里兰大学College Park分校)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了大语言模型在使用外部工具时的必要性问题,提出了一种基于模型自身性能的适应性工具必要性定义,并通过四个模型在算术和事实性问答数据集上的比较,发现工具必要性与实际调用行为之间存在显著的不匹配,揭示了LLM工具使用中的知行差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17324 2026-05-19 cs.CR cs.AI 90%

ASPI: Seeking Ambiguity Clarification Amplifies Prompt Injection Vulnerability in LLM Agents

ASPI:寻求澄清会放大LLM代理中的提示注入漏洞

Udari Madhushani Sehwag, Zhengyang Shan, Heming Liu, Dileepa Lakshan, Joseph Brandifino, Max Fenkell

机构 * Scale AI Boston University(波士顿大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Human Frontier Collective(人类前沿集体)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究探讨了LLM代理在执行任务时寻求澄清的行为对提示注入攻击的影响,发现这种行为会显著增加代理的脆弱性,并提出了ASPI基准测试来评估这一现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15486 2026-05-18 cs.RO cs.AI 90%

Hybrid LLM-based Intelligent Framework for Robot Task Scheduling

基于混合大语言模型的智能机器人任务调度框架

Swayamjit Saha, Subhabrata Das, Haonan Duan, Xiao-Yang Liu

机构 * Department of Computer Science and Engineering, Mississippi State University(密苏里州立大学计算机科学与工程系) Graduate School of Arts and Sciences, Columbia University(哥伦比亚大学研究生院) Consumer and Community Banking, JPMorgan Chase(摩根大通消费与社区银行业) Department of Data Science, Columbia University(哥伦比亚大学数据科学系) Department of Electrical Engineering, Columbia University(哥伦比亚大学电气工程系)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型提升建筑机器人任务调度效率,通过平衡时间效率与资源利用,结合自然语言处理接口实现与专业人员的实时沟通,并采用两个LLM代理生成更精确的任务计划。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏