CommentsAccepted at the ICML 2026 workshops "Statistical Frameworks for Uncertainty in Agentic Systems" and "Combining Theory and Benchmarks: Towards a Virtuous Cycle to Understand and Guarantee Foundation Model Performance". 13 pages, 9 figures
机构
*
Department of Computer Science and Information Engineering, National Taiwan University(国立台湾大学计算机科学与资讯工程系)
;
National Taiwan University AI Center of Research Excellence(国立台湾大学人工智能研究中心)
Conditional Vendi Score: Prompt-Aware Diversity Evaluation for Generative AI Models and LLMs
条件 Vendi 分数:生成式 AI 模型和 LLM 的提示感知多样性评估
Mohammad Jalali, Azim Ospanov, Amin Gohari, Farzan Farnia
机构
*
Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学)
;
Department of Information Engineering, The Chinese University of Hong Kong(信息工程系,香港中文大学)
专题命中
安全评测
:alignment(abstract);分类 cs.AI、cs.LG
AI总结
针对文本提示引导的生成模型,提出条件 Vendi 和条件 RKE 分数,通过条件熵分离模型自身多样性,并证明收敛性及在多个任务中恢复真实多样性排序。
Mitigating hallucinations in healthcare LLMs with granular fact-checking and domain-specific adaptation
通过细粒度事实核查和领域特定适应减轻医疗保健大语言模型中的幻觉
Musarrat Zeba, Abdullah Al Mamun, Kishoar Jahan Tithee, Debopom Sutradhar, Mohaimenul Azam Khan Raiaan, Saddam Mukta, Reem E. Mohamed, Md Rafiqul Islam, Yakub Sebastian, Mukhtar Hussain, Sami Azam
机构
*
Applied Artificial Intelligence and Intelligent Systems (AAIINS) Laboratory(应用人工智能与智能系统实验室)
;
Department of Computer Science and Engineering(计算机科学与工程系)
;
Department of Data Science and Artificial Intelligence(数据科学与人工智能系)
;
Department of Software Engineering(软件工程系)
;
Faculty of Science and Information Technology(科学与信息技术学院)
;
Faculty of Science and Technology(科学与技术学院)
Revisiting Metric Reliability for Fine-grained Evaluation of Machine Translation and Summarization in Indian Languages
重新审视印度语言机器翻译和摘要细粒度评估的度量可靠性
Amir Hossein Yari, Kalmit Kulkarni, Ahmad Raza Khan, Fajri Koto
机构
*
Sharif University of Technology(谢里夫理工学院)
;
Vellore Institute of Technology(韦洛雷理工学院)
;
IIT Kharagpur(印度理工学院达卡分校)
;
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
Representational Alignment with Chemical Induced Fit for Molecular Relational Learning
基于化学诱导契合的表征对齐用于分子关系学习
Peiliang Zhang, Jingling Yuan, Qing Xie, Yongjun Zhu, Chao Che, Lin Li
机构
*
Wuhan University of Technology(武汉理工大学)
;
Yonsei University(延世大学)
;
Hubei Key Laboratory of Transportation Internet of Things(湖北省交通运输物联网重点实验室)
;
Dalian University(大连大学)
Moral Sensitivity in LLMs: A Tiered Evaluation of Contextual Bias via Behavioral Profiling and Mechanistic Interpretability
大语言模型中的道德敏感性:通过行为剖析和机制可解释性对上下文偏见进行分层评估
Yash Aggarwal, Atmika Gorti, Vinija Jain, Aman Chadha, Krishnaprasad Thirunarayan, Manas Gaur
机构
*
University of Maryland, College Park(马里兰大学学院公园分校)
;
Purdue University(普渡大学)
;
Meta
;
Apple(苹果公司)
;
Wright State University(怀特州立大学)
;
University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)
A Sober Look at Agentic Misalignment in Automated Workflows
对自动化工作流中智能体错位的冷静审视
Wenqian Ye, Bo Yuan, Zhichao Xu, Yijun Tian, Yawei Wang, Henry Kautz, Aidong Zhang
机构
*
University of Virginia(弗吉尼亚大学)
;
Georgia Institute of Technology(佐治亚理工学院)
;
University of Utah(犹他大学)
;
University of Notre Dame(圣约翰大学)
;
George Washington University(乔治华盛顿大学)
CharTide: Data-Centric Chart-to-Code Generation via Tri-Perspective Tuning and Inquiry-Driven Evolution
CharTide: 数据中心的图表到代码生成通过三视角微调和查询驱动进化
Xiangxi Zheng, Kuang He, Jiayi Hu, Ping Yu, Rui Yan, Yuan Yao, Peng Hou, Anxiang Zeng, Alex Jinpeng Wang
机构
*
Nanjing University(南京大学)
;
LLM Team, Shopee Pte. Ltd.(Shopee 联邦学习团队)
;
East China Normal University(华东师范大学)
;
Nanjing University of Science and Technology(南京理工大学)
;
Central South University(中南大学)