STEB: A Speech-to-Speech Translation Expressiveness Benchmark for Evaluating Beyond Translation Fidelity
STEB:用于评估超越翻译保真度的语音到语音翻译表现力基准
Sitong Cheng, Weizhen Bian, Songjun Cao, Jin Li, Bei Liu, Chunyang Jiang, Yike Zhang, Weihao Wu, Yiming Li, Chi-Min Chan, Long Ma, Wei Xue
机构
*
Hong Kong University of Science and Technology(香港科技大学)
;
Tencent Youtu Lab(腾讯优图实验室)
;
Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
SHERLOC: Structured Diagnostic Localization for Code Repair Agents
SHERLOC: 代码修复智能体的结构化诊断定位
Hovhannes Tamoyan, Sean Narenthiran, Erik Arakelyan, Mira Mezini, Boris Ginsburg
机构
*
NVIDIA(英伟达)
;
Santa Clara, CA 95051, USA(美国加利福尼亚州圣克拉拉)
;
TU Darmstadt(达姆施塔特工业大学)
;
National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心 ATHENE)
SkillAudit: From Fixed-Suite Benchmarking to Skill-Centered Assessment
SkillAudit:从固定套件基准测试到以技能为中心的评估
Dexu Yu, Youhua Li, Zhaoyang Guan, Xianhao Lin, Jining Luan, Zihao Rao, Xuanqi Lan, Yang Ran, Bo Lan, Nai-Xin Zhai, Hanwen Du, Junchen Fu, Wenhao Deng, Yongxin Ni, Chunxiao Li
机构
*
Northeastern University(东北大学)
;
City University of Hong Kong(香港城市大学)
;
Northwestern University(西北大学)
;
Fudan University(复旦大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Santa Clara University(圣克拉拉大学)
;
Fenz AI
;
Ohio State University(俄亥俄州立大学)
;
University of Glasgow(格拉斯哥大学)
;
National University of Singapore(新加坡国立大学)
;
DeciLix Lab(DeciLix实验室)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
PaperClaw: Harnessing Agents for Autonomous Research and Human-in-the-Loop Refinement
PaperClaw:利用智能体实现自主研究与人在回路精炼
Weiwei Ye, Hangchen Liu, Dongyuan Li, Renhe Jiang
机构
*
Open scholarly indexes(开放学术索引)
;
Priem et al.(Priem 等)
;
Lo et al.(Lo 等)
;
Si et al.(Si 等)
;
Baek et al.(Baek 等)
;
Wang et al.(Wang 等)
;
Yang et al.(Yang 等)
;
Wei et al.(Wei 等)
;
Yao et al.(Yao 等)
;
Shinn et al.(Shinn 等)
;
Madaan et al.(Madaan 等)
;
Packer et al.(Packer 等)
;
Park et al.(Park 等)
;
Zhong et al.(Zhong 等)
;
Huang et al.(Huang 等)
;
Ji et al.(Ji 等)
;
Min et al.(Min 等)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
PsyScore: A Psychometrically-Aware Framework for Trait-Adaptive Essay Scoring and ZPD-Scaffolded Feedback
PsyScore: 一种心理测量感知的特质自适应作文评分与最近发展区支架反馈框架
Wei Xia, Jin Wu, Haoran Shi, Xiangyu Wang, Chanjin Zheng
机构
*
Department of Educational Psychology, East China Normal University(华东师范大学教育心理学系)
;
Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海智能教育研究院)
;
School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
RadSEM: A Finding-by-Finding Metric for Clinical Consistency in Radiology Reports
RadSEM:放射学报告中临床一致性的逐发现指标
Zhenhong Yang, Zhuoyun Liu, Jintao Fei, Wen Tang, Shichao Quan, Jun Zhao, Jun Xu
机构
*
JDH Algo, JD Health International Inc., China
;
Department of Big Data in Health Science, The First Affiliated Hospital of Wenzhou Medical University, China
;
Zhejiang Engineering Research Center for Hospital Emergency
;
Department of Intensive Care Unit, The First Affiliated Hospital of Wenzhou Medical University, Wenzhou, Zhejiang, China
Evaluating Second-Order Bias of LLMs Through Epistemic Entitlement
通过认知权利评估大语言模型的二阶偏见
Ramaravind Kommiya Mothilal, Terry Jingchen Zhang, Raiyan Ahmed, Zhijing Jin, Shion Guha, Syed Ishtiaque Ahmed
机构
*
University of Toronto(多伦多大学)
;
Vector Institute(向量研究所)
;
EuroSafeAI
;
Max Planck Institute for Intelligent Systems, Tübingen, Germany(马克斯·普朗克智能系统研究所(德国图宾根))
Building Customer Support AI Agents at 100M-User Scale: An Evaluation-Driven Framework
构建面向1亿用户规模的客户支持AI代理:一种评估驱动的框架
Aman Gupta, Kevin Rossell, Edesio Alcobaça, Jose Chrystian Lima Pacheco, Carolina Baptista de Lima, Shao Tang, Luiz Paulo Rabachini, Luis Moneda, Herbert Fei, Daniel Silva, Rohan Ramanath