Theory-Grounded Evaluation of Human-Like Fallacy Patterns in LLM Reasoning
基于理论的LLM推理中人类似 fallacy 模式的评估
Andrew Keenan Richardson, Ryan Othniel Kearns, Sean Moss, Vincent Wang-Mascianica, Philipp Koralus
机构
*
The Laboratory for Human-Centered AI, Institute for Ethics in AI, Faculty of Philosophy, University of Oxford, UK(以人为中心的人工智能实验室,人工智能伦理研究所,哲学学院,牛津大学,英国)
;
Oxford Internet Institute, University of Oxford, UK(牛津互联网研究所,牛津大学,英国)
;
School of Computer Science, University of Birmingham, UK(计算机科学学院,伯明翰大学,英国)
MARCUS: An agentic, multimodal vision-language model for cardiac diagnosis and management
MARCUS:一种用于心脏诊断和管理的代理式多模态视觉-语言模型
Jack W O'Sullivan, Mohammad Asadi, Lennart Elbe, Akshay Chaudhari, Tahoura Nedaee, Francois Haddad, Michael Salerno, Li Fe-Fei, Ehsan Adeli, Rima Arnaout, Euan A Ashley
机构
*
Division of Cardiology, Department of Medicine, Stanford University(斯坦福大学心脏病学系)
;
Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系)
;
Department of Medicine, Radiology, and Pediatrics, UCSF(旧金山大学医学系、放射学与儿科学系)
;
Bakar Institute, UCSF(Bakar研究所,旧金山大学)
;
UCSF–UC Berkeley Joint Program in Computational Precision Health(旧金山大学-伯克利计算精准健康联合计划)
;
Department of Radiology, Stanford University(斯坦福大学放射学系)
;
Department of Psychiatry and Behavioral Sciences, Stanford University(斯坦福大学精神病学与行为科学系)
;
Department of Computer Science, Stanford University(斯坦福大学计算机科学系)
;
Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系)
;
Department of Biology, Stanford University(斯坦福大学生物学系)
Detection of adversarial intent in Human-AI teams using LLMs
利用大语言模型检测人类-人工智能团队中的对抗意图
Abed K. Musaffar, Ambuj Singh, Francesco Bullo
机构
*
Department of Mechanical Engineering, University of California at Santa Barbara(加州大学圣巴巴拉分校机械工程系)
;
Department of Computer Science, University of California at Santa Barbara(加州大学圣巴巴拉分校计算机科学系)
专题命中
评测与基准
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Yanran Chen, Lynn Greschner, Roman Klinger, Michael Klenk, Steffen Eger
机构
*
NLLG, University of Technology Nuremberg (UTN)(神经语言学与认知科学实验室,图恩大学(UTN))
;
Fundamentals of Natural Language Processing, University of Bamberg, Germany(自然语言处理基础,巴姆堡大学,德国)
;
Ethics and Philosophy of Technology, Delft University of Technology, Netherlands(技术伦理与哲学,代尔夫特理工大学,荷兰)
专题命中
评测与基准
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
Towards Secure Retrieval-Augmented Generation: A Comprehensive Review of Threats, Defenses and Benchmarks
迈向安全的检索增强生成:对威胁、防御和基准的全面综述
Yanming Mu, Hao Hu, Feiyang Li, Qiao Yuan, Jiang Wu, Zichuan Liu, Pengcheng Liu, Mei Wang, Hongwei Zhou, Yuling Liu
机构
*
State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室)
;
Information Engineering University(信息工程大学)
;
Henan Key Laboratory of Information Security(河南省信息安全重点实验室)
;
University of Chinese Academy of Sciences(中国科学院大学)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI
Unlocking Multimodal Document Intelligence: From Current Triumphs to Future Frontiers of Visual Document Retrieval
解锁多模态文档智能:从当前成就到视觉文档检索的未来前沿
Yibo Yan, Jiahao Huo, Guanbo Feng, Mingdong Ou, Yi Cao, Xin Zou, Shuliang Liu, Yuanhuiyi Lyu, Yu Huang, Jungang Li, Kening Zheng, Xu Zheng, Philip S. Yu, James Kwok, Xuming Hu
机构
*
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Alibaba Cloud Computing(阿里云计算)
;
Hong Kong University of Science and Technology(香港科技大学)
;
University of Illinois Chicago(伊利诺伊大学芝加哥分校)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL
Bypassing Document Ingestion: An MCP Approach to Financial Q&A
绕过文档摄入:一种MCP方法用于金融问答
Sasan Mansouri, Edoardo Pilla, Mark Wahrenburg, Fabian Woebbeking
机构
*
University of Groningen(Groningen大学)
;
Goethe University Frankfurt(法兰克福歌德大学)
;
Martin Luther University Halle-Wittenberg(哈雷-维滕贝格马丁路德大学)
;
Halle Institute for Economic Research (IWH)(哈雷经济研究所)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI