How Language Models Fail: Token-Level Signatures of Committed and Persistent Reasoning Failures
语言模型如何失败:承诺性和持续性推理错误的令牌级特征
Tanvi Thoria, Kiana Jafari, Marc R. Schlichting, Mykel J. Kochenderfer
机构
*
Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)
;
Department of Aeronautics and Astronautics, Stanford University(航空航天工程系,斯坦福大学)
Agent Planning Benchmark: A Diagnostic Framework for Planning Capabilities in LLM Agents
Agent规划基准:LLM Agent规划能力的诊断框架
Haoyu Sun, Wenxuan Wang, Mingyang Song, Jujie He, Weinan Zhang, Yang Liu, Yang Yang, Yu Cheng
机构
*
Tongji University(同济大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Fudan University(复旦大学)
;
Skywork AI
;
University of California, Santa Cruz(加州大学圣克鲁兹分校)
;
Shanghai Jiao Tong University(上海交通大学)
;
The Chinese University of Hong Kong(香港中文大学)
CrowdMath: A Dataset of Crowdsourced Mathematical Research Discussions
CrowdMath: 众包数学研究讨论数据集
Sherin Muckatira, Jesse Geneson, Slava Gerovitch, Pavel Etingof, Mikhail Gronas, Anna Rumshisky
机构
*
University of Massachusetts Lowell(马萨诸塞大学洛文分校)
;
San Jose State University(圣何塞州立大学)
;
Massachusetts Institute of Technology(麻省理工学院)
;
Dartmouth College(达特茅斯学院)
;
Amazon AGI(亚马逊人工智能研究院)
SubtleMemory: A Benchmark for Fine-Grained Relational Memory Discrimination in Long-Horizon AI Agents
SubtleMemory: 面向长时程AI智能体的细粒度关系记忆辨别基准
Wenxuan Wang, Haoyu Sun, Fukuan Hou, Mingyang Song, Weinan Zhang, Yu Cheng, Yang Yang
机构
*
Harbin Institute of Technology(哈尔滨工业大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Tongji University(同济大学)
;
Xiamen University(厦门大学)
;
Fudan University(复旦大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
The Chinese University of Hong Kong(香港中文大学)
MCERF: Advancing Multimodal LLM Evaluation of Engineering Documentation with Enhanced Retrieval
MCERF:通过增强检索推进工程文档的多模态大语言模型评估
Kiarash Naghavi Khanghah, Hoang Anh Nguyen, Anna C. Doris, Amir Mohammad Vahedi, Daniele Grandi, Faez Ahmed, Hongyi Xu
机构
*
School of Mechanical, Aerospace, and Manufacturing Engineering, University of Connecticut, Storrs, CT 06269(机械、航空航天与制造工程学院,康涅狄格大学,斯托尔斯,CT 06269)
;
Department of Mechanical Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139, USA(机械工程系,麻省理工学院,剑桥,MA 02139,美国)
Watch, Remember, Reason: Human-View Video Understanding with MLLMs
Watch, Remember, Reason: 基于多模态大语言模型的人类视角视频理解
Jiahao Meng, Yue Tan, Qi Xu, Kuan Gao, Weisong Liu, Yanwei Li, Jason Li, Lingdong Kong, Haochen Wang, Qianyu Zhou, Jiangning Zhang, Guangliang Cheng, Yunhai Tong, Lu Qi, Minghsuan Yang
机构
*
School of Intelligence Science and Technology, Peking University(北京理工大学智能科学与技术学院)
;
Wuhan University(武汉大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Nanyang Technological University(南洋理工大学)
;
CASIA(中国科学院自动化研究所)
;
University of Tokyo(东京大学)
;
University of Liverpool(利物浦大学)
;
Zhejiang University(浙江大学)
;
National University of Singapore(新加坡国立大学)
;
UC Merced(加州大学默塞德分校)
机构
*
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
Beijing University of Chemical Technology(北京化工大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
;
Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
;
Beijing Institute of Technology (Zhuhai)(北京理工大学(珠海))
;
Tencent Hy(腾讯(深圳))
;
Peng Cheng Laboratory(鹏城实验室)
Evidence-Based Intelligent Diagnostic and Therapeutic Visualization System with Large Language Models: Multi-Turn Interaction and Multimodal Treatment Plan Generation
基于证据的智能诊断与治疗可视化系统与大语言模型:多轮交互与多模态治疗方案生成
Yunhan Wang, Yuda Wang, Zhiying Tu, Mingqiang Song, Li Song, Kun Li, Dianhui Chu, Bolin Zhang
机构
*
Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海))
;
Harbin Institute of Technology (Weihai) Qingdao Research Institute(哈尔滨工业大学(威海)青岛研究院)
;
Shandong Key Laboratory of Digital Service Computing Technology and Systems(山东省数字服务计算技术与系统重点实验室)
;
Weihai Municipal Hospital(威海市人民医院)
;
Shanghai Taizhu Technology Co., Ltd(上海泰山技术有限公司)
;
Tianjin Zhifu Qihuang Medical Technology Co., Ltd(天津中孚启黄医疗技术有限公司)
Elmes*: Automated Construction of Fine-Grained Evaluation Rubrics for Large Language Models in Long-Tail Educational Scenarios
Elmes*:面向长尾教育场景的大语言模型细粒度评估量规自动构建
Tao Liu, Ye Lu, Ruohua Zhang, Siyu Song, Wentao Liu, Aimin Zhou, Hao Hao
机构
*
Shanghai Institute of AI for Education, East China Normal University(上海人工智能教育研究院,东华师范大学)
;
School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,东华师范大学)
;
Shanghai Innovation Institute(上海创新研究院)
Evaluating AI-based Scientific Knowledge Synthesis with Epidemiological Systematic Reviews
基于流行病学系统评价评估AI科学知识综合
Shreyansh Padarha, Ryan Othniel Kearns, Tristan Naidoo, Lingyi Yang, Łukasz Borchmann, Piotr BŁaszczyk, Christian Morgenstern, Ruth McCabe, Sangeeta Bhatia, Philip H. Torr, Jakob Foerster, Scott A. Hale, Thomas Rawson, Anne Cori, Elizaveta Semenova, Adam Mahdi
机构
*
University of Oxford(牛津大学)
;
Imperial College London(伦敦帝国理工学院)
;
University of Nottingham(诺丁汉大学)
;
Snowflake AI Research(Snowflake人工智能研究)
;
Independent(独立)
机构
*
University of California, Berkeley(加州大学伯克利分校)
;
The Chinese University of Hong Kong(香港中文大学)
;
New York University(纽约大学)
;
The University of Hong Kong(香港大学)
NoisyGRPO: Incentivizing Multimodal CoT Reasoning via Noise Injection and Bayesian Estimation
NoisyGRPO:通过噪声注入和贝叶斯估计激励多模态Co T推理
Longtian Qiu, Shan Ning, Jiaxuan Sun, Xuming He
机构
*
ShanghaiTech University(上海科技大学)
;
Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程研究中心)
;
Lingang Laboratory(临港实验室)
Stable Reasoning, Unstable Responses: Mitigating LLM Deception via Stability Asymmetry
稳定推理,不稳定响应:通过稳定性不对称缓解大语言模型欺骗
Guoxi Zhang, Jiawei Chen, Tianzhuo Yang, Lang Qin, Juntao Dai, Yaodong Yang, Jingwei Yi
机构
*
Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
School of Chinese as a Second Language, Peking University(北京大学第二语言学院)