机构
*
Nankai University(南开大学)
;
Peking University(北京大学)
;
University of Electronic Science and Technology of China(电子科技大学)
;
Shanghai University of Finance and Economics(上海财经大学)
How Well Does AI-Generated Feedback Work? Intrinsic and Extrinsic Evaluation across more than 20,000 EFL Essay Drafts
人工智能生成的反馈效果如何?对20000多篇外语作文草稿的内在和外在评估
Steven Coyne, Diana Galvan-Sosa, Ryan Spring, Machi Shimmei, Michael Zock, Keisuke Sakaguchi, Kentaro Inui
机构
*
Tohoku University(东北大学)
;
RIKEN(理化学研究所)
;
ALTA Institute, Computer Laboratory, University of Cambridge(剑桥大学ALTA研究所,计算机实验室)
;
CNRS, LIS, Aix-Marseille University(法国国家科学研究中心,艾克斯-马赛大学语言信息处理实验室)
;
MBZUAI(Mohamed bin Zayed大学人工智能学院)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL
CommentsPre-review version of DOI https://doi.org/10.1007/978-3-032-29788-4_35, presented at AIED 2026 Late Breaking Results. Readers are encouraged to refer to the published version
机构
*
Technical University of Munich(慕尼黑工业大学)
;
Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑机器人与机器智能研究所)
;
University College London(伦敦大学学院)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI
机构
*
Shanghai AI Laboratory(上海人工智能实验室)
;
MMLab, The Chinese University of Hong Kong(香港中文大学多媒体实验室)
;
Shanghai Jiao Tong University(上海交通大学)
;
Great Bay University(大湾区大学)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL
Evolution of Accuracy and Visual-Cognitive Errors in a Decade of Vision-Language AI Models
十年视觉语言人工智能模型中准确性和视觉认知错误的演变
Shravan Murlidaran, Miguel P. Eckstein
机构
*
Psychological & Brain Sciences, University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校心理与脑科学系)
;
Department of Computer Science, University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校计算机科学系)
;
Department of Electrical and Computer Engineering, University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校电气与计算机工程系)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI
From Triggers to Emotions: A CPM-Grounded Appraisal Multi-Agent for Dynamic Emotional Evolution in Persona-Based Dialogue
从触发因素到情感:基于CPM的评估多智能体模型用于基于角色的对话中的动态情感演变
Jingyao Cai, Shuaijun Liu, Abdul Rehman, Yutong Guo, Qin Tian, Thomas Dolby, Sue Green, Chantel Cox, Xiaosong Yang
机构
*
National Centre for Computer Animation(国家计算机动画中心)
;
Information Hub(信息中心)
;
Key Laboratory of Child Cognition & Behavior Development of Hainan Province(海南省儿童认知与行为发展重点实验室)
;
Chief Technology Officer(首席技术官)
;
School of Health and Care(健康与护理学院)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI
An Experimental Design Approach to Evaluating Agentic AI's Autonomous Model Discovery
一种评估智能体人工智能自主模型发现的实验设计方法
Hao He, Xueying Liu, Chris J. Kuhlman, Xinwei Deng
机构
*
Department of Statistics, Virginia Tech(统计学系,弗吉尼亚理工学院)
;
Department of Statistical Science, Baylor University(统计科学系,贝勒大学)
;
Advanced Research Computing, Virginia Tech(高级研究计算,弗吉尼亚理工学院)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI
Pluralis v0.1: Towards a Multicultural, Multimodal, Multilingual Benchmark for AI Risk and Reliability
Pluralis v0.1:迈向用于人工智能风险与可靠性的多元文化、多模态、多语言基准测试
Alicia Parrish, Rajat Shinde, Sanket Badhe, Xinyi Bai, Sree Bhargavi Balija, Hua-Rong Chu, Emilio Ferrara, Armstrong Foundjem, Rajat Ghosh, Aakash Gupta, Xuanli He, Ong Chen Hui, Minji Jung, Madhangi Karimanal, Faiza Khan Khattak, Boryoung Kim, Eugenia Kim, Liliya Lavitas, Seok Min Lim, Victor Lu, Jim Moirangthem, Dhivya Nagasubramanian, Deepak Pandita, Sita Rajagopal, Geetha Raju, Evgeniia Razumovskaia, Aravind Reddy, Federico Ricciuti, Nobin Sarwar, Sungpil Shin, Sunayana Sitaram, Snehal Thorat, Tharindu Cyril Weerasooriya, Jasmijn Bastings, Joachim Baumann, Kongtao Chen, Murali Emani, Mariya Hendriksen, Jiho Jin, Jun Seong Kim, Younghoon Ko, Alicja Kwasniewska, Minjae Lee, Tom Wei-cyuan Lin Kashyap Ramanandula Manjusha, Junho Myung, Junyeong Park, Roma Patel, Shyam Ratan, Sudarsun Santhiappan, Priyanka Suresh, Tuesday, Ksheeraj Sai Vepuri Laura Amortegui-Ordonez, Claire Dennis, Minsuk Kahng, Chris Knotz, Alice Oh, Balaraman Ravindran, Soojung Ryu William Bartholomew, Hiwot Tesfaye, Lora Aroyo
机构
*
Google DeepMind(谷歌DeepMind)
;
University of Alabama in Huntsville(阿拉巴马大学亨茨维尔分校)
;
Google(谷歌)
;
University of Missouri Columbia(密苏里大学哥伦比亚分校)
;
Chunghwa Telecom Laboratories(春木电信实验室)
;
University of Southern California(南加州大学)
;
Polytechnique Montreal(蒙特利尔理工学院)
;
Nutanix
;
ThinkEvolve Labs(ThinkEvolve实验室)
;
UCL(伦敦大学学院)
;
Infocomm Media Development Authority(信息通信媒体发展局)
;
Monark Health(Monark健康)
;
Seoul National University(首尔国立大学)
;
Microsoft(微软)
;
Centre for Responsible AI (CeRAI), Wadhwani School of Data Science and AI (WSAI), Indian Institute of Technology Madras(负责任人工智能中心(CeRAI)、瓦达威人工智能学校(WSAI)、印度理工学院马德拉斯分校)
;
University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)
;
Microsoft Research India(微软印度研究院)
;
Stanford University(斯坦福大学)
;
Argonne National Laboratory(阿贡国家实验室)
;
University of Oxford(牛津大学)
;
KAIST(韩国科学技术院)
;
Yonsei University(延世大学)
;
Amazon(亚马逊)
;
UIUC(伊利诺伊大学香槟分校)
;
Rochester Institute of Technology(罗切斯特理工学院)
;
Xenoscube Inc.(Xenoscube公司)
;
Korea AI Safety Institute (K-AISI)(韩国人工智能安全研究所(K-AISI))
;
MLCommons
;
CommonGround
;
Artifex Labs(Artifex实验室)
Advanced Topic Modeling Techniques for Categorizing Software Vulnerabilities
用于软件漏洞分类的高级主题建模技术
Utkarsh Tiwari, Spoorthi M, Anirudh S, Nidhin Prabhakar T.
机构
*
Department of Computer Science & Engineering, Amrita School of Computing, Bengaluru, Amrita Vishwa Vidyapeetham, India(计算机科学与工程系,Amrita计算学院,班加罗尔,Amrita世界大学,印度)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI
Comments10 pages, 10 figures. Accepted at the 16th International Conference on Computing, Communication and Networking Technologies (ICCCNT 2025), July 6-11, 2025, IIT Indore, Madhya Pradesh, India. IEEE proceedings