Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs
视频中的奉承:视频大语言模型中奉承行为的基准测试与分析
Wenrui Zhou, Mohamed Hendy, Shu Yang, Qingsong Yang, Zikun Guo, Yuyu Luo, Lijie Hu, Di Wang
机构
*
Provable Responsible AI and Data Analytics (PRADA) Lab(可证负责任人工智能与数据 analytics 实验室)
;
King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹科学与技术大学)
;
HKUST(香港科技大学)
;
MBZUAI(穆罕默德·本·拉希德人工智能研究所)
;
University of Science and Technology of China(中国科学技术大学)
;
Kyungpook National University(庆尚国立大学)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
A Randomized Controlled Trial and Pilot of Scout: an LLM-Based EHR Search and Synthesis Platform
一项随机对照试验和试点:Scout:一种基于大语言模型的电子健康记录搜索与综合平台
Michael Gao, Suresh Balu, William Knechtle, Kartik Pejavara, William Jeck, Matthew Ellis, Jason Thieling, Blake Cameron, Jason Tatreau, Tareq Aljurf, Henry Foote, Michael Revoir, Marshall Nichols, Matthew Gardner, William Ratliff, Bradley Hintze, Angelo Milazzo, Sreekanth Vemulapalli
Multi-Level Narrative Evaluation Outperforms Lexical Features for Mental Health
多层级叙事评估在心理健康预测中优于词法特征
Yuxi Ma, Jieming Cui, Muyang Li, Ye Zhao, Yu Li, Yixuan Wang, Chi Zhang, Yinyin Zang, Yixin Zhu
机构
*
Institute for Artificial Intelligence(人工智能研究院)
;
School of Psychological and Cognitive Sciences(心理学与认知科学学院)
;
School of Intelligence Science and Technology(智能科学与技术学院)
;
State Key Laboratory of General AI(通用人工智能国家重点实验室)
;
Beijing Key Laboratory of Behavior and Mental Health(北京行为与心理健康重点实验室)
;
PKU-Changsha Institute for Computing and Digital Economy(北京大学长沙计算与数字经济研究院)
Qualitative Evaluation of Language Model Rescoring in Automatic Speech Recognition
语言模型在自动语音识别中的定性评估
Thibault Bañeras-Roux, Mickaël Rouvier, Jane Wottawa, Richard Dufour
机构
*
LS2N - Nantes University (France)(南特大学LS2N研究所(法国))
;
LIA - Avignon University (France)(阿维尼昂大学LIA研究所(法国))
;
LIUM - Le Mans University (France)(勒曼大学LIUM研究所(法国))
RPC-Bench: A Fine-grained Benchmark for Research Paper Comprehension
RPC-Bench: 一项针对研究论文理解的细粒度基准测试
Yelin Chen, Fanjin Zhang, Suping Sun, Yunhe Pang, Yuanchun Wang, Jian Song, Xiaoyan Li, Lei Hou, Shu Zhao, Jie Tang, Juanzi Li
机构
*
Xinjiang University(新疆大学)
;
Renmin University of China(中国人民大学)
;
Anhui University(安徽大学)
;
Sun Yat-sen University(中山大学)
;
Tsinghua University(清华大学)
;
University of Southampton(南安普顿大学)
机构
*
School of Computer Science and Engineering, School of Intelligence Science and Engineering and Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University, China(东南大学计算机科学与工程学院、智能科学与工程学院及新一代人工智能技术及其跨学科应用关键实验室,中国)
;
Wangxuan Institute of Computer Technology, Peking University, China(北京大学王轩计算机技术研究所,中国)
;
University of Copenhagen, Denmark(丹麦哥本哈根大学)
Comments4 pages , 3 figures , This paper has been submitted to the IEEE-affiliated ICBME Conference (Iran), 2025, and is currently under review. DOR number: [20.1001.2.0425023682.1404.10.1.440.7]
Investigating More Explainable and Partition-Free Compositionality Estimation for LLMs: A Rule-Generation Perspective
探究更可解释且无分区的组合性估计方法:从规则生成的角度
Ziyao Xu, Cong Wang, Houfeng Wang
机构
*
National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机学院,北京大学)
;
OPPO AI Center(OPPO人工智能中心)
InteractWeb-Bench: Can Multimodal Agent Escape Blind Execution in Interactive Website Generation?
InteractWeb-Bench: 多模态代理能否在交互式网站生成中避免盲目执行?
Qiyao Wang, Haoran Hu, Longze Chen, Hongbo Wang, Hamid Alinejad-Rokny, Yuan Lin, Min Yang
机构
*
Shenzhen Institute of Advanced Technology Chinese Academy of Sciences(深圳先进技术研究院中国科学院)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Dalian University of Technology(大连理工大学)
;
UNSW Sydney(悉尼大学)
;
Shenzhen University of Advanced Technology(深圳先进技术大学)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI