CommentsSubmitted to ACM Journal on Responsible Computing, Special Section: Collaborative Methods and Tools for Engineering and Evaluating Transparency in AI. 28 pages 9 figures, 7 tables, 1 algorithm. Source code: https://github.com/Scriptor-Group/AIMVi
CommentsUpdated title and abstract to emphasize key findings on the debiasing paradox for improved discoverability. Content and findings unchanged. 11 pages, 17 figures, Accepted at IEEE Conference on Artificial Intelligence (IEEE CAI) 2025. Full Paper acceptance in the Vertical HUMAN-CENTERED AI category
Journal ref2025 IEEE Conference on Artificial Intelligence (CAI)
HaluNet: Learning Hallucination Risk from Internal Signals in LLM Question Answering
HaluNet:从LLM问答内部信号学习幻觉风险
Chaodong Tong, Qi Zhang, Zhuojun Jiang, Lei Jiang, Yanbing Liu
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
;
China Industrial Control Systems Cyber Emergency Response Team(中国工业控制系统网络应急响应团队)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
Comments16 pages, 12 tables, and 11 figures. This version includes a major revision of the manuscript and updates the author list with the consent of all involved authors
On the Hidden Costs of Counterfactual Knowledge Training in LLM Unlearning
反事实知识训练在LLM遗忘中的隐藏代价
Xiaotian Ye, Xiaohan Wang, Mengqi Zhang, Shu Wu
机构
*
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Huazhong University of Science and Technology(华中科技大学)
;
Shandong University(山东大学)
;
NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences(神经网络计划、人工智能研究所、中国科学院自动化研究所)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
From Prompt Optimization to Multi-Dimensional Credibility Evaluation: Enhancing Trustworthiness of Chinese LLM-Generated Liver MRI Reports -- with Preliminary Extension to Lung Cancer
机构
*
Yu-Yue Pathology Research Center, Jinfeng Laboratory, Chongqing, China(渝粤病理研究所,金风实验室,重庆,中国)
;
T Magnetic Resonance Imaging Translational Medical Center, Department of Radiology, Southwest Hospital, Army Medical University, Chongqing, China(7T磁共振成像转化医学中心,放射科,西南医院,中国人民解放军军医大学,重庆,中国)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
When the Manual Lies: A Realistic Benchmark to Evaluate MCP Poisoning Attacks for LLM Agents
当手册撒谎:评估LLM智能体MCP投毒攻击的现实基准
Shi Liu, Xuehai Tang, Xikang Yang, Liang Lin, Biyu Zhou, Wenjie Xiao, Wantao Liu
机构
*
Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
A novel YOLO26-MoE optimized by an LLM agent for insulator fault detection considering UAV images
一种由LLM代理优化的YOLO26-MoE新型模型用于考虑无人机图像的绝缘子故障检测
João Pedro Matos-Carvalho, Laio Oriel Seman, Stefano Frizzo Stefenon, Mohammad Khalaf Mohammad Khreasat, Gabriel Villarrubia González
机构
*
Department of Automation and Systems Engineering, Federal University of Santa Catarina, Florianópolis, Brazil(自动化与系统工程系,圣卡塔琳娜联邦大学,巴西弗洛里安波利斯)
;
Applications Lab, Faculty of Science, University of Salamanca, Plaza de los Caídos s/n, 37008 Salamanca, Spain(应用实验室,科学学院,萨拉曼卡大学,西班牙萨拉曼卡)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
机构
*
Centre for Industrial Software, University of Southern Denmark(丹麦南部大学工业软件中心)
;
Department of Electronics, Information and Bioengineering, Politecnico di Milano(米兰理工学院电子、信息与生物工程系)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
Prospective multi-pathogen disease forecasting using autonomous LLM-guided tree search
前瞻性多病原体疾病预测使用自主LLM引导的树搜索
Sarah Martinson, Michael P. Brenner, Martyna Plomecka, Brian P. Williams, Nicholas G. Reich, Zahra Shamsi
机构
*
Google Research(谷歌研究)
;
School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)
;
Google Deepmind(谷歌DeepMind)
;
University of Massachusetts(马萨诸塞大学)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
CryptoBench: A Dynamic Benchmark for Expert-Level Evaluation of LLM Agents in Cryptocurrency
CryptoBench: 一种动态基准,用于评估LLM代理在加密货币领域的专家级能力
Jiacheng Guo, Suozhi Huang, Zixin Yao, Yifan Zhang, Yifu Lu, Jiashuo Liu, Zihao Li, Nicholas Deng, Qixin Xiao, Jia Tian, Kanghong Zhan, Tianyi Li, Xiaochen Liu, Jason Ge, Chaoyang He, Kaixuan Huang, Lin Yang, Wenhao Huang, Mengdi Wang
机构
*
Princeton University(普林斯顿大学)
;
Zenith Lab(Zenith实验室)
;
University of California, Los Angeles(加州大学洛杉矶分校)
;
University of California, Berkeley(加州大学伯克利分校)
;
University of Michigan(密歇根大学)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL