Improving Reasoning Capabilities in Small Models through Mixture-of-Layers Distillation with Stepwise Attention on Key Information
通过关键信息的分步注意力混合层蒸馏提升小模型的推理能力
Yao Chen, Jiawei Sheng, Wenyuan Zhang, Tingwen Liu
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
TabularMath: Understanding Math Reasoning over Tables with Large Language Models
TabularMath: 通过大规模语言模型理解表格上的数学推理
Shi-Yu Tian, Zhi Zhou, Wei Dong, Kun-Yang Yu, Ming Yang, Zi-Jian Cheng, Lan-Zhe Guo, Yu-Feng Li
机构
*
National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室)
;
School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)
;
School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)
When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning
何时信任工具?用于工具集成数学推理的自适应工具信任校准
Ruotao Xu, Yixin Ji, Yu Luo, Jinpeng Li, Dong Li, Peifeng Li, Juntao Li, Min Zhang
机构
*
School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)
;
Department of Foundation Model, 2012 Labs, Huawei(华为基础模型部门)
;
Harbin Institute of Technology, Shenzhen (HITSZ)(哈尔滨工业大学深圳(HITSZ))
SelfBudgeter: Adaptive Token Allocation for Efficient LLM Reasoning
SelfBudgeter:面向高效大语言模型推理的自适应令牌分配
Zheng Li, Qingxiu Dong, Jingyuan Ma, Di Zhang, Kai Jia, Zhifang Sui
机构
*
State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学)
;
BandAI, Bytedance(字节跳动BandAI)
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
University of Oxford(牛津大学)
;
Imperial College London(伦敦帝国学院)
;
University of Georgia(佐治亚大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Chinese Academy of Sciences(中国科学院)
;
Dalian University of Technology(大连理工大学)
;
National University of Singapore(新加坡国立大学)
;
Wuhan University(武汉大学)
Disentangling Mathematical Reasoning in LLMs: A Methodological Investigation of Internal Mechanisms
解构大语言模型中的数学推理:对内部机制的调查
Tanja Baeumel, Josef van Genabith, Simon Ostermann
机构
*
German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)
;
Saarland University(萨尔兰大学)
;
Center for European Research in Trusted AI (CERTAIN)(可信人工智能欧洲研究中心)
Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards
用评分奖励模型治愈大语言模型数学推理中的奇迹步骤
Youliang Yuan, Qiuyang Mang, Jingbang Chen, Hong Wan, Xiaoyuan Liu, Junjielong Xu, Jen-tse Huang, Wenxuan Wang, Wenxiang Jiao, Pinjia He
机构
*
School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(数据科学学院,香港中文大学(深圳))
;
UC Berkeley(加州大学伯克利分校)
;
Zhejiang University(浙江大学)
;
Johns Hopkins University(约翰霍普金斯大学)
;
Renmin University of China(中国人民大学)
;
Xiaohongshu Inc.(小红书公司)
Revisiting Entropy Regularization: Adaptive Coefficient Unlocks Its Potential for LLM Reinforcement Learning
重新审视熵正则化:自适应系数解锁其在大语言模型强化学习中的潜力
Xiaoyun Zhang, Xiaojian Yuan, Di Huang, Wang You, Chen Hu, Jingqing Ruan, Ai Jian, Kejiang Chen, Xing Hu
机构
*
State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院)
;
University of Science and Technology of China(中国科学技术大学)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
StepFun Inc(StepFun公司)
机构
*
Department of Computer Science and Engineering(计算机科学与工程系)
;
University of Moratuwa(穆拉图瓦大学)
;
Department of Electrical and Information Engineering(电气与信息工程系)
;
University of Ruhuna(鲁胡纳大学)
;
Faculty of Information Technology and Communication Sciences(信息科技与通讯科学学院)
;
Tampere University(塔尔皮奥大学)
;
School of Computing(计算学院)
;
Australian National University(澳大利亚国立大学)
Discover and Prove: An Open-source Agentic Framework for Hard Mode Automated Theorem Proving in Lean 4
发现与证明:一个开源代理框架用于Lean 4中的硬模式自动定理 proving
Chengwu Liu, Yichun Yin, Ye Yuan, Jiaxuan Xie, Botao Li, Siqi Li, Jianhao Shen, Yan Xu, Lifeng Shang, Ming Zhang
机构
*
State Key Laboratory for Multimedia Information Processing, School of Computer Science, PKU-Anker LLM Lab, Peking University(信息处理国家重点实验室,计算机科学学院,PKU-Anker LLM实验室,北京大学)
;
Huawei Technologies Co., Ltd.(华为技术有限公司)
;
School of Software & Microelectronics, Peking University(软件与微电子学院,北京大学)
;
School of Electronics Engineering and Computer Science, Peking University(电子工程与计算机科学学院,北京大学)
WiseMind: a knowledge-guided multi-agent framework for accurate and empathetic psychiatric diagnosis
WiseMind: 一种基于知识的多智能体框架,用于准确且富有同理心的精神病诊断
Yuqi Wu, Guangya Wan, Jingjing Li, Shengming Zhao, Lingfeng Ma, Tianyi Ye, Ion Pop, Yanbo Zhang, Jie Chen
机构
*
College of Biomedical Engineering(生物医学工程学院)
;
Fudan University(复旦大学)
;
Department of Electrical and Computer Engineering(电气与计算机工程系)
;
University of Alberta(阿尔伯塔大学)
;
University of Virginia(弗吉尼亚大学)
;
McIntire School of Commerce(麦金尼商学院)
;
School of Data Science(数据科学学院)
;
Department of Psychiatry(精神病学系)
SocialGrid: A Benchmark for Planning and Social Reasoning in Embodied Multi-Agent Systems
SocialGrid:一种用于具身多智能体系统规划与社交推理的基准测试
Hikaru Shindo, Hanzhao Lin, Lukas Helff, Patrick Schramowski, Kristian Kersting
机构
*
Technical University of Darmstadt(达姆施塔特技术大学)
;
German Research Center for Artificial Intelligence(德国人工智能研究中心)
;
Lab1141(Lab1141实验室)
;
Centre for Cognitive Science, Darmstadt(达姆施塔特认知科学中心)
Heuristic Classification of Thoughts Prompting (HCoT): Integrating Expert System Heuristics for Structured Reasoning into Large Language Models
思维提示的启发式分类(HCoT):将专家系统启发式方法整合到大型语言模型中的结构化推理
Lei Lin, Jizhao Zhu, Yong Liu, Donghong Sun, Hongbo He, Yihua Du
机构
*
Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心)
;
Shenyang Aerospace University(沈阳航空航天大学)
;
ZGC LAB, Beijing,China(北京ZGC实验室)
;
Institute for Network Sciences and Cyberspace, Tsinghua University(清华大学网络科学与网络空间研究院)
DeepER-Med: Advancing Deep Evidence-Based Research in Medicine Through Agentic AI
DeepER-Med: 通过代理AI推进医学中的深度证据导向研究
Zhizheng Wang, Chih-Hsuan Wei, Joey Chan, Robert Leaman, Chi-Ping Day, Chuan Wu, Mark A Knepper, Antolin Serrano Farias, Jordina Rincon-Torroella, Hasan Slika, Betty Tyler, Ryan Huu-Tuan Nguyen, Asmita Indurkar, Mélanie Hébert, Shubo Tian, Lauren He, Noor Naffakh, Aseem Aseem, Nicholas Wan, Emily Y Chew, Tiarnan D L Keenan, Zhiyong Lu
机构
*
Division of Intramural Research (DIR), National Library of Medicine (NLM), National Institutes of Health (NIH)(国家医学图书馆(NLM)内务研究部,国家卫生研究院(NIH))
;
Hunterian Neurosurgical Laboratory, Johns Hopkins School of Medicine(约翰霍普金斯医学院霍尔特神经外科实验室)
;
Cancer Data Science Laboratory, Center for Cancer Research, National Cancer Institute (NCI), National Institutes of Health (NIH)(国家癌症研究所(NCI)癌症数据科学实验室,国家癌症研究中心,国家卫生研究院(NIH))
;
Experimental Immunology Branch, National Cancer Institute (NCI), National Institutes of Health (NIH)(国家癌症研究所(NCI)实验免疫学分支,国家卫生研究院(NIH))
;
Epithelial Systems Biology Laboratory, Systems Biology Center, National Heart, Lung, and Blood Institute (NHLBI), National Institutes of Health (NIH)(国家心肺血液研究所(NHLBI)上皮系统生物学实验室,系统生物学中心,国家卫生研究院(NIH))
;
Brain Tumor Genetics Lab, Department of Neurosurgery, Johns Hopkins Hospital(约翰霍普金斯医院神经外科部脑肿瘤遗传实验室)
;
Division of Hematology/Oncology, University of Illinois Chicago(伊利诺伊大学芝加哥分校血液/肿瘤科部)
;
University of Illinois Cancer Center, Chicago, IL 60612, USA(伊利诺伊大学癌症中心,芝加哥,IL 60612,美国)
;
Division of Epidemiology and Clinical Applications, National Eye Institute (NEI), National Institutes of Health (NIH)(国家眼耳研究所(NEI)流行病学与临床应用部,国家卫生研究院(NIH))
;
University of Michigan Medical School, Ann Arbor, MI 48109, USA(密歇根大学医学学院,安阿伯,MI 48109,美国)