FieldWorkArena: Agentic AI Benchmark for Real Field Work Tasks
FieldWorkArena:面向真实作业任务的代理AI基准测试
Jun Takahashi, Atsunori Moteki, Akiyoshi Uchida, Shoichi Masui, Fan Yang, Kanji Uchino, Yueqi Song, Yonatan Bisk, Graham Neubig, Ikuo Kusajima, Yasuto Watanabe, Hiroyuki Ishida, Koki Nakagawa, Shan Jiang
机构
*
Fujitsu Limited(富士通株式会社)
;
Fujitsu Research of America(富士通美国研究部)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Master’s Student, The University of Tokyo(东京大学硕士研究生)
;
Agent Research Collective(代理研究集体)
ReplicatorBench: Benchmarking LLM Agents for Replicability in Social and Behavioral Sciences
ReplicatorBench:用于社会科学和行为科学中可复制性评估的LLM代理基准测试
Bang Nguyen, Dominik Soós, Qian Ma, Rochana R. Obadage, Zack Ranjan, Sai Koneru, Timothy M. Errington, Shakhlo Nematova, Sarah Rajtmajer, Jian Wu, Meng Jiang
机构
*
University of Notre Dame(圣母大学)
;
Old Dominion University(老道明大学)
;
Pennsylvania State University(宾夕法尼亚州立大学)
;
Independent Researcher(独立研究员)
;
Uppsala University(乌普萨拉大学)
;
Center for Open Science(开放科学中心)
Exploring the Interplay Between Voice, Personality, and Gender in Human-Agent Interactions
探索语音、个性与性别在人机交互中的相互作用
Kai Alexander Hackney, Lucas Guarenti Zangari, Jhonathan Sora-Cardenas, Emmanuel Munoz, Sterling R. Kalogeras, Betsy DiSalvo, Pedro Guillermo Feijoo-Garcia
Making Image Editing Easier via Adaptive Task Reformulation with Agentic Executions
通过具有代理执行的自适应任务重构使图像编辑更易于实现
Bo Zhao, Kairui Guo, Runnan Du, Haiyang Sun, Pengshan Wang, Huan Yang, Kun Gai, Yixin Cao, Wei Ji
机构
*
Nanjing University(南京大学)
;
Beijing Institute of Technology(北京理工大学)
;
College of Artificial Intelligence, China University of Petroleum (Beijing)(中国石油大学(北京)人工智能学院)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Fudan University(复旦大学)
CommentsExtended version with appendix; final version to appear in the Proceedings of AAAI/ACM AIES 2026; v2: text encoding fix for author name, no content changes
Comments136 pages, 12 practical works, preprint. Textbook for senior undergraduates and graduate students. Original contributions on low-resource languages (Tajik, Tatar and other). Companion repository available
CommentsAn earlier version of this manuscript will appear in the proceedings of IEEE Cyber-AI 2026 Conference. Project source code is available at https://github.com/Keysight/LLM-EncodeGuard