From Knowing to Acting: Benchmarking Self-Awareness Capability of LLM Agents
从知道到行动:基准测试LLM代理的自我意识能力
Yifan Li, Shengbin Yue, Boyu Feng, Jinhu Qi, Bo Ke, Zixing Song, Hongru Wang, Zhongyu Wei, Irwin King
机构
*
The Chinese University of Hong Kong(香港中文大学)
;
Fudan University(复旦大学)
;
University of Edinburgh(爱丁堡大学)
;
Tencent(腾讯)
;
University of Bristol(布里斯托大学)
Toward Generalizable Cognitive Impairment Detection with Speech-Based Multimodal Large Language Models
使用基于语音的多模态大语言模型实现可泛化的认知障碍检测
Yingchao Huang, Xin Wang, Yuhan Su, Shanshan Yao
机构
*
Faculty of Digital Innovation, Arts \& Sciences, Saskatchewan Polytechnic, Regina SK S4S 5X1, Canada
;
School of Basic Medical Sciences, Hebei University, Baoding 071000, China
;
Department of Civil \& Environmental Engineering
;
School of Mining \& Petroleum Engineering, University of Alberta, Edmonton AB T6G 2H5, Canada
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG
From Many to Meaningful: Feature-Guided Zero-Shot Chronic Kidney Disease Screening Using Large Language Models
从众多到有意义:使用大语言模型进行特征引导的零样本慢性肾病筛查
Muhammad Ashad Kabir, Sirajam Munira
机构
*
School of Computing, Mathematics and Engineering, Charles Sturt University(查尔斯·斯特尔特大学计算、数学与工程学院)
;
Department of Computer Science, Rensselaer Polytechnic Institute(伦斯勒理工学院计算机科学系)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG
NetInjectBench: Benchmarking Indirect Prompt Injection in Tool-Using Large Language Model Agents for Network Operations
NetInjectBench:用于网络操作的工具使用大型语言模型代理中间接提示注入的基准测试
Ruksat Khan Shayoni, Muhammad Faraz Shoaib, S M Asif Hossain, M. F. Mridha
机构
*
School of Computing, Wichita State University(威斯康星州立大学计算机学院)
;
Department of Computer Science, American International University-Bangladesh(孟加拉国国际大学计算机科学系)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG
Large Language Models in Misinformation Ecosystems: Misuse, Defense, and Vulnerability
错误信息生态系统中的大语言模型:滥用、防御与脆弱性
Lingwei Wei, Dou Hu, Wei Zhou, Songlin Hu, Philip S. Yu
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
University of Illinois Chicago(伊利诺伊大学香槟分校)
;
State Key Laboratory of Media Convergence and Communication, Communication University of China(中国传媒大学媒体融合与传播国家重点实验室)
;
University of Chinese Academy of Sciences(中国科学院大学)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI
Optimizing Large Language Models for Causality Assessment in Pharmacovigilance: Developing a Performance Metric as Objective for Bayesian Hyperparameter Optimization
优化用于药物警戒中因果关系评估的大语言模型:开发一种性能指标作为贝叶斯超参数优化的目标
Nicole Sonne Heckmann, Arnault-Quentin Vermillet, Søren Norlin Mølgaard, Manuela Del Castillo Suero, Lars Melskens, Gerard Ompad, Maurizio Sessa
机构
*
Department of Drug Design and Pharmacology, University of Copenhagen(哥本哈根大学药物设计与药理学系)
;
Safety Operations, Novo Nordisk(诺和制药安全运营部)
;
Clinical Development Centre Denmark, Novo Nordisk(丹麦临床开发中心,诺和制药)
;
Statistical Data Science Lead, Pfizer(辉瑞统计数据科学负责人)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
CommentsAccepted for publication in Text, Speech and Dialogue (TSD 2026). The final authenticated publication will be available online via Springer LNCS/LNAI