An Empirical Evaluation of LLM-Generated Code Security Across Prompting Methods
LLM生成代码安全性的提示方法实证评估
Mohammed Kharma, Ahmed Sabbah, Mohammad Alkhanafseh, Mohammad Hammoudeh, David Mohaisen
机构
*
Department of Computer Science, Birzeit University(计算机科学系,巴勒斯坦比泽大学)
;
King Fahd University of Petroleum and Minerals(国王法赫德石油和矿物大学)
;
University of Central Florida(中央佛罗里达大学)
专题命中
评测与基准
:LLM(title,title_cn);prompting(title,abstract);large language model(abstract);language model(abstract)
Dennis Frauen, Marie Brockschmidt, Konstantin Hess, Haorui Ma, Yuchen Ma, Abdurahman Maarouf, Maresa Schröder, Jonas Schweisthal, Yuxin Wang, Athiya Deviyani, Sonali Parbhoo, Rahul G. Krishnan, Stefan Feuerriegel
机构
*
Imperial College London(帝国理工学院伦敦分校)
;
University of Toronto(多伦多大学)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)
Faithful or Fabricated? A Causal Framework for Rationalization Bias in LLM Judges
忠实还是捏造?LLM 评判中合理化偏差的因果框架
Riya Tapwal, Abhishek Kumar, Carsten Maple
机构
*
School of Computing and Electrical Engineering(计算与电子工程学院)
;
Indian Institute of Technology (IIT) Mandi(印度理工学院(IIT)曼迪)
;
London U.K.(伦敦英国)
;
Warwick Manufacturing Group U.K.(沃里克制造集团英国)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)
From Prompt Optimization to Multi-Dimensional Credibility Evaluation: Enhancing Trustworthiness of Chinese LLM-Generated Liver MRI Reports -- with Preliminary Extension to Lung Cancer
机构
*
Yu-Yue Pathology Research Center, Jinfeng Laboratory, Chongqing, China(渝粤病理研究所,金风实验室,重庆,中国)
;
T Magnetic Resonance Imaging Translational Medical Center, Department of Radiology, Southwest Hospital, Army Medical University, Chongqing, China(7T磁共振成像转化医学中心,放射科,西南医院,中国人民解放军军医大学,重庆,中国)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
When the Manual Lies: A Realistic Benchmark to Evaluate MCP Poisoning Attacks for LLM Agents
当手册撒谎:评估LLM智能体MCP投毒攻击的现实基准
Shi Liu, Xuehai Tang, Xikang Yang, Liang Lin, Biyu Zhou, Wenjie Xiao, Wantao Liu
机构
*
Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
SURGE: On the Potential of Large Language Models as General-Purpose Surrogate Code Executors
SURGE: 大型语言模型作为通用代理代码执行器的潜力
Bohan Lyu, Siqiao Huang, Zichen Liang
机构
*
Department of Computer Science and Technology, Tsinghua(清华大学计算机科学与技术系)
;
Institute for Interdisciplinary Information Sciences (IIIS), Tsinghua(清华大学交叉信息研究院)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.LG
A Multi-Agent LLM Framework for Rating the Quality of Surgical Feedback
用于评估手术反馈质量的多智能体LLM框架
Rafal Kocielnik, J. Everett Knudsen, Steven Y. Cen, Jasmine Lin, Cherine H. Yang, Atharva Deo, Ujjwal Pasupulety, Peter Wager, Anima Anandkumar, Andrew J. Hung
机构
*
Computing + Mathematical Sciences, California Institute of Technology(加州理工学院计算与数学科学系)
;
Department of Urology, Cedars-Sinai(塞斯医疗中心泌尿科)
;
Keck School of Medicine, University of Southern California(美国南加州大学凯克医学院)
Automated Detection and Classification of Delusion-related Content in Naturalistic Audio Diaries Using Multi-Agent Language Models
使用多智能体语言模型自动检测和分类自然音频日记中的妄想相关内容
Feng Chen, Justin Tauscher, Changye Li, Meliha Yetisgen, Alex Cohen, Adam Kuczynski, Angelina Pei-Tzu Tsai, Benjamin Buck, Dror Ben-Zeev, Trevor Cohen
机构
*
Department of Biomedical Informatics and Medical Education, University of Washington, Seattle, WA, USA(生物医学信息学与医学教育系,华盛顿大学,西雅图,华盛顿州,美国)
;
Department of Psychiatry and Behavioral Sciences, University of Washington, Seattle, WA, USA(精神病学与行为科学系,华盛顿大学,西雅图,华盛顿州,美国)
;
Department of Psychology, Louisiana State University, Baton Rouge, LA, USA(心理学系,路易斯安那州立大学,巴吞鲁日,路易斯安那州,美国)
;
Department of Psychiatry, University of North Carolina at Chapel Hill, Chapel Hill, NC, USA(精神病学系,北卡罗来纳大学教堂山分校,教堂山,北卡罗来纳州,美国)
专题命中
评测与基准
:LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);foundation model(abstract)
CommentsThis paper has been accepted by AAAI 2026. We update it for adding new evaluation results for ArxivRollBench-2025a and ArxivRollBench-2026a, with the evaluation of timly models like DeepSeekV4Pro, GPT-5.5, Claude-Opus-4.7, and so on. Source code: https://github.com/liangzid/ArxivRoll/ Online Leaderboard Website: https://arxivroll.moreoverai.com/
机构
*
University of South Florida(佛罗里达南大学)
;
Missouri University of Science and Technology(密苏里科技大学)
;
University of Alabama(阿拉巴马大学)
;
Florida International University(佛罗里达国际大学)
;
University of Cincinnati(辛辛那提大学)
;
George Mason University(乔治·梅森大学)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL