SubtleMemory: A Benchmark for Fine-Grained Relational Memory Discrimination in Long-Horizon AI Agents
SubtleMemory: 面向长时程AI智能体的细粒度关系记忆辨别基准
Wenxuan Wang, Haoyu Sun, Fukuan Hou, Mingyang Song, Weinan Zhang, Yu Cheng, Yang Yang
机构
*
Harbin Institute of Technology(哈尔滨工业大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Tongji University(同济大学)
;
Xiamen University(厦门大学)
;
Fudan University(复旦大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
The Chinese University of Hong Kong(香港中文大学)
MCERF: Advancing Multimodal LLM Evaluation of Engineering Documentation with Enhanced Retrieval
MCERF:通过增强检索推进工程文档的多模态大语言模型评估
Kiarash Naghavi Khanghah, Hoang Anh Nguyen, Anna C. Doris, Amir Mohammad Vahedi, Daniele Grandi, Faez Ahmed, Hongyi Xu
机构
*
School of Mechanical, Aerospace, and Manufacturing Engineering, University of Connecticut, Storrs, CT 06269(机械、航空航天与制造工程学院,康涅狄格大学,斯托尔斯,CT 06269)
;
Department of Mechanical Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139, USA(机械工程系,麻省理工学院,剑桥,MA 02139,美国)
Elmes*: Automated Construction of Fine-Grained Evaluation Rubrics for Large Language Models in Long-Tail Educational Scenarios
Elmes*:面向长尾教育场景的大语言模型细粒度评估量规自动构建
Tao Liu, Ye Lu, Ruohua Zhang, Siyu Song, Wentao Liu, Aimin Zhou, Hao Hao
机构
*
Shanghai Institute of AI for Education, East China Normal University(上海人工智能教育研究院,东华师范大学)
;
School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,东华师范大学)
;
Shanghai Innovation Institute(上海创新研究院)
OpenSkill: Open-World Self-Evolution for LLM Agents
OpenSkill: 面向LLM智能体的开放世界自我进化
Zhiling Yan, Dingjie Song, Hanrong Zhang, Wei Liang, Yuxuan Zhang, Yutong Dai, Lifang He, Philip S. Yu, Ran Xu, Xiang Li, Lichao Sun
机构
*
Lehigh University(莱维大学)
;
University of Illinois Chicago(伊利诺伊大学芝加哥分校)
;
University of British Columbia(不列颠哥伦比亚大学)
;
Vector Institute(向量研究所)
;
Salesforce AI Research(Salesforce人工智能研究)
;
Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院)
Melissa Z. Pan, Negar Arabzadeh, Riccardo Cogo, Yuxuan Zhu, Alexander Xiong, Lakshya A Agrawal, Huanzhi Mao, Emma Shen, Sid Pallerla, Liana Patel, Shu Liu, Tianneng Shi, Xiaoyuan Liu, Jared Quincy Davis, Emmanuele Lacavalla, Alessandro Basile, Shuyi Yang, Paul Castro, Daniel Kang, Koushik Sen, Dawn Song, Joseph E. Gonzalez, Ion Stoica, Matei Zaharia, Marquita Ellis
机构
*
University of California at Berkeley(加州大学伯克利分校)
;
IBM Research(IBM研究院)
;
University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Stanford University(斯坦福大学)
IRAF: Interference-Resilient Adaptive Fusion for Noise-Robust End-to-End Full-Duplex Spoken Dialogue Systems
IRAF:面向噪声鲁棒的端到端全双工口语对话系统的抗干扰自适应融合
Tao Zhong, Jiajun Deng, Nikita Kuzmin, Yinke Zhu, Tianxiang Cao, Tristan Tsoi, Zhili Tan, Simon Lui, Xunying Liu
机构
*
The Chinese University of Hong Kong(香港中文大学)
;
AudioLab Hong Kong, Huawei Leibniz Research Center(香港AudioLab,华为Leibniz研究中心)
;
Nanyang Technological University(南洋理工大学)
Commentsv2: Minor numerical corrections for Table V. 16 pages, 14 figures, 7 tables. Extended version of paper accepted to 2026 IEEE Intelligent Vehicles Symposium (IV 2026). ScenicRules benchmark available at https://github.com/BerkeleyLearnVerify/ScenicRules