AgentDS Technical Report: Benchmarking the Future of Human-AI Collaboration in Domain-Specific Data Science
AgentDS技术报告:领域特定数据科学中人机协作的未来基准测试
An Luo, Jin Du, Xun Xian, Robert Specht, Fangqiao Tian, Ganghua Wang, Xuan Bi, Charles Fleming, Ashish Kundu, Jayanth Srinivasa, Mingyi Hong, Rui Zhang, Tianxi Li, Galin Jones, Jie Ding
机构
*
School of Statistics, University of Minnesota(明尼苏达大学统计学系)
;
AIScientists, Inc.(AIScientists公司)
;
Data Science Institute, University of Chicago(芝加哥大学数据科学研究所)
;
Carlson School of Management, University of Minnesota(明尼苏达大学卡尔森管理学院)
;
Cisco Research(思科研究)
;
Department of Electrical and Computer Engineering, University of Minnesota(明尼苏达大学电气与计算机工程系)
;
Division of Computational Health Sciences, University of Minnesota(明尼苏达大学计算健康科学 division)
机构
*
Mohamed bin Zayed University of AI(Mohamed bin Zayed人工智能大学)
;
Khalifa University(卡利法大学)
;
Michigan State University(密歇根州立大学)
;
Australian National University(澳大利亚国立大学)
机构
*
Faculty of Electronic and Information Engineering, Xi’an Jiaotong University(西安交通大学电子与信息工程学院)
;
Queen Mary University of London(伦敦大学玛丽女王学院)
;
City University of Hong Kong(香港城市大学)
Learning What to Learn: Stage-Specific Data Sets for SFT-then-RL in Small Language Model Reasoning
学习什么:小语言模型推理中SFT-then-RL的阶段特定数据集
Chongyang He, Rui Zhang, Zixuan Wang, Xin Li
机构
*
Tsinghua University(清华大学)
;
National University of Singapore(新加坡国立大学)
;
DiDi(滴滴出行)
;
University of Electronic Science and Technology of China(电子科技大学)
MedForge: Interpretable Medical Deepfake Detection via Forgery-aware Reasoning
MedForge:基于伪造感知推理的可解释医学深度伪造检测
Zhihui Chen, Kai He, Qingyuan Lei, Bin Pu, Jian Zhang, Yuling Xu, Mengling Feng
机构
*
National University of Singapore(新加坡国立大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Hunan University(湖南大学)
;
Xi’an Jiaotong University(西安交通大学)
;
Guangdong Provincial People’s Hospital(广东省人民医院)
Revisiting Vul-RAG: Reproducibility and Replicability of RAG-based Vulnerability Detection with Open-Weight Models
重新审视Vul-RAG:基于RAG的漏洞检测的可复现性与可复制性——使用开放权重模型
Sabrina Kaniewski, Fabian Schmidt, Tobias Heer
机构
*
Institute for Secure Networked Systems, Esslingen University(安全网络系统研究所,埃斯林根大学)
;
Institute for Intelligent Systems, Esslingen University(智能系统研究所,埃斯林根大学)
CommentsAccepted at AI&CCPS 2026 workshop, co-located with the 21st International Conference on Availability, Reliability and Security (ARES 2026). This is the authors' preprint version
The Saturation Trap and the Subjectivity of Intervention Timing: Why Affect-Based Triggers and LLM Judges Fail to Time Interventions on Autonomous Agents